字体
大
中
小
关灯
上一页 回目录    收藏 下一页

第13章 空手套白狼(2/3)

.”

这是直指alphacode的漏洞啊,尼克思忖。

他继续往下看,数据格式写得很具体。

每个训练样本从题目描述、候选程序到隐含的假设、失败边界、最小反例等等无所不包。

尼克看到这里,第一反应是麻烦,第二反应是新的数据设置方案大概率有用。

他开始按文档搭最小验证环境。

伊戈尔·巴布什金给他的限制很明确:不用内部敏感数据,不碰生产系统,不动alphacode主流程,只用公开题目和小规模候选程序集。

伊戈尔之所以会这样选,是因为他不想被谷歌发现。

他还想拿着这个模型在谷歌和推特两家之间待价而沽呢。

尼克从公开竞赛题里挑了一批结构清楚的题,按文档要求整理候选程序,把其中一部分错误解法标上失败原因,再用脚本生成针对性的反例探针。

一开始他还有点不耐烦,因为这东西过于手工。

指标漂亮当然是好事。

但前提是,漂亮的指标得是模型自发生成的。

而不是事先知道我要什么样的指标,故意设置甚至是手工修剪出来的指标。

为什么未来华国的模型在测试表现上和阿美莉卡的模型差不多,但使用体验却有明显差距。

就是因为针对测试的指标,进行的人工修剪成分过多了。

来自老板的文档里提前标注了:第一轮要证明失败家族这个变量是否能提供额外信息。

如果这个变量在小规模手工标注里都没有价值,那就没有必要专门写程序把它给自动化。

第一天他跑完第一组基线,普通采样加可见测试过滤后,候选程序在语法聚类上看起来很分散。

按照常规方法看,模型给出了不少不同方案。

一旦用反例探针重新测试,候选程序开始成片成片倒下。

变量名不同,循环结构不同,解法看起来不同,最后死在同一种边界条件上。

尼克盯着结果,又跑了一遍。

结果差不多。

他开始兴奋起来。

隐隐约约的感觉被程序给证实。

原本模糊的现象突然被测出来了。

团队里很多人都知道大规模采样会制造虚假的多样性,也知道候选程序之间存在同质化。

知道是一回事,能把它测出来是另一回事。

他接着按照文档里的方法训练了一个很小的策略判别器。

模型粗糙,数据不大。

它不能和alphacode相提并论,更谈不上对外发布。

但在这批小样本上,它已经能比语法聚类更稳定地把看起来不同、实则同源的候选程序归到一起。

当他把反例生成器加入筛选流程后,最终留下的候选解法数量少了,策略互补性明显变高。

他把结果导出成表格,又跑了三组不同随机种子。

提升幅度有波动,趋势没有消失。
本章未完,请翻下一页继续阅读.........
上一页 回目录    收藏 下一页