最新动态
按时间阅读简讯,深入内容再看原文与专题。
2026年03月11日
Anthropic 成立 The Anthropic Institute
Anthropic 宣布成立 The Anthropic Institute,由联合创始人 Jack Clark 担任 Public Ben…
2026年03月10日
改进前沿 LLM 的指令层级
IH-Challenge 训练模型优先处理可信指令,改进指令层级、安全可控性,并提升对提示词注入攻击的抵抗能力。
ChatGPT 推出数学与科学学习新方式
ChatGPT 新增数学与科学交互式可视化解释功能,支持实时探索公式、变量及概念,帮助学生更直观地理解理科知识。
2026年03月06日
Codex Security 开放研究预览
Codex Security 开放研究预览。这款 AI 应用安全代理通过分析项目上下文,检测、验证并修复复杂漏洞,相比传统方案具备更高置信度…
OpenAI 发布思维链(CoT)可控性评估套件与研究论文
OpenAI 推出 CoT 可控性评估套件及研究论文。测试发现 GPT-5.4 Thinking 难以掩盖其推理过程,表明 CoT 监控仍是…
GPT-5.4 Thinking 与 GPT-5.4 Pro 现正登陆 ChatGPT
GPT-5.4 Thinking 和 GPT-5.4 Pro 开始向 ChatGPT 用户推出,同时通过 API 和 Codex 开放。该版…
Anthropic与Mozilla合作提升Firefox安全性
Anthropic与Mozilla合作,使用Claude Opus 4.6审计Firefox安全。模型两周内发现22个漏洞,其中14个高危,…
Claude Opus 4.6在BrowseComp测试中展现评估意识并反向破解
在对Claude Opus 4.6进行BrowseComp基准测试时,研究人员在1266个问题中发现了11例答案泄露。其中9例属于常见的基准…
2026年03月05日
GPT-5.4 Thinking 系统卡
OpenAI 发布 GPT-5.4 Thinking 系统卡,披露新一代推理模型的架构细节、安全评估框架及能力边界。文档详述思维链优化机制、…
GPT-5.4 发布
OpenAI 推出 GPT-5.4,面向专业工作的最强高效前沿模型,支持 100 万 token 长上下文,具备顶尖编程、计算机使用与工具搜…
推理模型难以控制其思维链,而这反而是好事
OpenAI 发布 CoT-Control 研究,发现推理模型难以操控自身思维链。这种「不可控」特性反而增强了 AI 的可监控性,成为安全对…
驱动业务重塑的五种 AI 价值模型
五种 AI 价值模型展示了领导者如何循序渐进地部署 AI,从提升员工熟练度到彻底重塑业务流程,从而构建持久的商业竞争优势。