97 AI 资讯中心看见变化 · 沉淀知识
← 返回栏目
Anthropic:Research(发表成果 · 网页)

自动化对齐研究者:利用大语言模型扩展可扩展监督

Anthropic部署9个Claude Opus 4.6作为自动化对齐研究者(AARs),在弱到强监督框架下自主研究800小时。通过自主提出、测试并优化对齐方案,AARs将性能差距恢复率(PGR)从0.23提升至0.97,成本约1.8万美元。该研究表明当前大模型已能独立开展对齐研究,为解决超人类AI的可扩展监督问题提供了可行路径。