97 AI 资讯中心看见变化 · 沉淀知识
← 返回栏目
X:Rohan Paul (@rohanpaul_ai)

JevBench 发布:面向类型化决策的新基准

新基准 JevBench 发布,专为输出受限软件决策而非开放式文本的模型设计,紧随 TypeSafe 9 月 15 日发布 Jev--输入应用状态与固定选项,返回带概率的类型化答案。该基准综合智能、校准、速度与成本,用几何平均防止单一维度优势掩盖短板。GPT-5.6 Luna 在难题准确率上明显高于 Jev 1.13.0,但 Jev 因延迟、校准和成本更优而在综合分上领先。