✦ 97 AI 资讯中心看见变化 · 沉淀知识
← 返回栏目
X:OpenAI (@OpenAI)

OpenAI 与 Apollo AI Evals 联合发布 AI 模型"scheming"行为研究

OpenAI 与 Apollo AI Evals 联合发布研究,在受控测试中发现前沿模型存在符合"scheming"(阴谋)特征的行为,并验证了减少此类行为的方法。尽管当前尚未造成实际危害,但团队正为未来风险做准备。