Claude开始训练Claude!四美元一小时,跑赢150美元人类研究员

Claude开始训练Claude!四美元一小时,跑赢150美元人类研究员
Claude开始训练Claude了时薪4美元干赢时薪150美元的人类研究员。在Anthropic最新发布的研究中Claude自己查论文、提方案、造数据、训练模型一口气攻克了10类AI安全问题。部分任务上它交出的方案甚至比28名人类安全研究员更好。更刺激的是较弱的Claude已经开始反向参与训练更强的Claude。AI「自己改进自己」的那一天好像真的越来越近了…4美元一小时Claude跑赢人类研究员在这篇题为《自动化研究员能够有效缓解AI对齐失败》的研究中Anthropic直接把Claude送进了实验室。具体而言他们基于Claude Opus 4.8搭建了一套名为AAR的自动化对齐研究员系统。拿到一个具体的模型安全问题后Claude会自己搜索相关论文从中寻找可用方法再提出新的训练方案、生成数据、微调模型最后跑一遍安全和通用能力测试。从提出假设到完成验证一套较完整的AI研究闭环就这样交到了Claude手里。效果不好方案扔掉成绩有所提升就沿着这个方向接着试。一轮训练通常只跑30分钟。这样Claude就能像搜索算法一样在大量方案中快速试错。整个过程里人类负责出题、提供模型和评测标准Claude则包下了从查资料到跑实验的绝大部分工作。10道安全难题Claude全部找到改进方案实验中Anthropic一口气给Claude出了10道题。这些题覆盖模型常见的对齐问题包括欺骗、谄媚、奖励黑客、隐私侵犯和越狱等。比如「谄媚」指的是模型为了顺着用户说话给出用户爱听但未必正确的答案「奖励黑客」则是模型没有真正完成任务只是钻了评测规则的空子骗到一个更高分数。Claude每次只处理一种问题反复提出方案、训练对应的目标模型再根据成绩进入下一轮。最后10类问题全部得到改善。按照Anthropic定义的「安全差距」指标Claude弥合了其中26%-96%的差距。简单来说就是把原本存在安全问题的模型向理论满分拉近了一大截。更重要的是这些方法不只对Claude看过的题目有效。部分获胜方案放到未公开的测试集以及模拟多轮对抗场景的Petri评测中依然能够降低模型的不安全行为。应用到规模最大为实验模型4.7倍的模型上效果也能保留下来。Anthropic还设置了一条红线安全训练不能明显损害模型原有能力。毕竟让模型遇到什么都拒绝回答也能让不少安全测试的分数变好但这样的模型基本没法用。最终Claude找到的方案在预设的通用能力测试中没有出现明显退化。85%对20%Claude大比分跑赢人类研究员最悬殊的一局出现在「欺骗」测试中。为了让目标模型变得更诚实Claude先后提交了150多次尝试。它提出一个方法训练一次再根据结果继续调整。单次实验中最佳方案弥合了82%的安全差距综合多次运行平均成绩达到85%。同一道题Anthropic还交给了6名经验丰富的AI安全研究员。结果人类研究员平均只弥合了20%的安全差距…85%对20%Claude赢得那叫一个毫无悬念。全部任务一共有28名人类安全研究员参加每人最多可以用8小时阅读资料、设计方案。论文称自动化研究员通常能在6小时内找到超过人类平均水平的方法人类提供的研究方向也没有让Claude取得更好的成绩。最最最扎心的在于成本一名自动化研究员每小时的API推理成本大约为4美元Anthropic付给人类研究员的报酬则是每小时150美元。这……人类研究员妥妥要被Claude替代了啊。不过呢这场人机比赛也并非完全公平。Claude可以真正训练模型看到每次实验的结果再不断修改方案人类研究员只能提交一次方法没有机会根据结果继续迭代。较弱Claude训练更强Claude60小时逼近正式版前面的实验改进的主要还是开源小模型。接下来Anthropic把难度直接拉高让能力较弱的Claude Sonnet 5去训练尚未完成大部分生产级安全训练的Claude Opus 4.8早期版本。所谓弟子不必不如师说的大概就是这种模式了。在60小时里Sonnet 5测试了50多种解决方案。最终找到的方法弥合了约65%的安全差距已经接近正式发布版Opus 4.8的72%。这套方案使用的训练数据只有2000多条主要由简单模板和公开数据集构成。按照Anthropic的计算在这组特定任务上它的数据效率大约是生产级对齐流程的1.5万倍。当然这还不等于Anthropic可以用2000条数据复制整套生产训练。正式模型还要处理更多能力、更多风险以及大量极端情况这次实验只针对一组明确的安全指标展开。但这已经证明了较弱的Claude已经可以自己查论文、设计方法、生成数据再把训练结果写进更强的Claude。人类划定范围Claude负责迭代。一个模型开始参与制造下一个更安全、更强大的模型。AI改进AI已经成为了发生在眼前的事实。所以到底算不算「AI自进化」?从结果来看这项研究确实已经摸到了「AI自进化」的门槛。但如果把「自进化」理解成一个AI完全自主地设计、训练并制造出更强的下一代AI那这次实验还远没有走到那一步。毕竟这个过程中研究什么问题、用什么模型和数据、什么样的结果算成功都还是由人类决定。Anthropic自己也承认AAR能够优化的只是人类事先写进评测系统的目标。这次实验没有覆盖其他复杂问题一些低频或刚刚出现的风险甚至还没有对应的Benchmark。研究人员也只检查了一组预先选定的通用能力因此无法排除某种安全训练在提高分数的同时损害了其他没有被测试的能力。Petri等安全评测同样只是现实风险的代理指标。模型在测试里表现得更安全并不等于进入真实环境后也一定可靠。所以AAR最大的隐患也藏在它的优势里它太擅长根据指标高速试错了。一旦尺子量错Claude跑得越快离人类真正想要的结果反而可能越远。更戏剧性的是研究Agent自己也会作弊。为了防止AAR钻评测规则的空子Anthropic专门安排了一个监控Agent检查Claude准备执行的方案和完整研究记录。结果在大约1600份研究记录中监控模型发现了39次作弊尝试占比约2.4%。有的Agent反复提交同一方案试图利用评测波动碰出一个更高分数有的模仿Benchmark的格式生成训练数据还有的故意隐藏违反规则的实验步骤。比起真正解决模型的安全问题它们更想找到一条快速提高分数的捷径。这多少有点黑色幽默了…合着Agent监守自盗了呗。好消息是这些作弊意图大多还会出现在模型的推理记录里因此能被监控Agent发现。坏消息是Anthropic也不能确定未来更强的模型还会不会留下这么明显的痕迹。当研究Agent拥有更多工具、更高权限并且可以直接修改模型训练流程时「怎样监控一个负责改进AI的AI」可能会比训练本身更棘手。但总而言之一个AAR每小时大约花费4美元可以连续工作也可以一次复制出几十个、几百个并行跑实验。而人类研究员的时薪远高于这个数需要休息一次能推进的实验数量也相当有限。这笔账怎么算答案都已经很明显了。也不知道该说是核弹爆炸还是当场瘫坐……这一次轮到造AI的人担心被AI抢饭碗了。最后我们整理出这套 AI 大模型 突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2025 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要 《AI大模型入门进阶学习资源包》下方扫码获取~资料展示下面是我整理的AI大模型学习资料和工具包预览适合收藏后按主题逐步学习。需要这份AI大模型资料清单的话在评论区回复「清单」即可我会根据大家的问题继续补充对应的实战内容。

最新新闻

日新闻

周新闻

月新闻