模型日报 · 2026-09-20

模型日报 2026-09-20|AA Intelligence v4.3.2:Step 5 Preview 进入新口径评测

Artificial Analysis 当前 Intelligence Index 明确为 v4.3.2,AA-Briefcase v1.1 与 GDPval-AA v2.1 采用 Crowd-BT。Step 5 Preview 首次进入本站的独立 AA 记录;旧 v4.3 只作历史参考,当前精确 OpenRouter API 与价格仍未知。

TODAY'S TAKE

先对齐评测口径,再读 Step 5 Preview 的首份快照

当前方法是 v4.3.2

AA 的当前方法页明确将 Intelligence Index 标为 v4.3.2;其中 AA-Briefcase v1.1 与 GDPval-AA v2.1 的 pairwise 评测采用 Crowd-BT。

Step 5 Preview 首次收录

本期来源观察的 Intelligence Index 为 43.73。首次收录指本站首次保存这个精确 AA identity,不等于厂商于今天发布。

当前 API 与价格未知

没有一一对应、已核验的 OpenRouter 付费 variant;不以相似名称、免费变体或 AA 评测成本填补当前 API 价格。

v4.3.2 方法改变了什么

Artificial Analysis 当前方法页将 Intelligence Index 标为 v4.3.2:AA-Briefcase v1.1 与 GDPval-AA v2.1 的成对比较使用 Crowd-BT,GDPval-AA v2.1 同时改用 DeepSeek V4.1 Flash (max) 的 1600 Elo 锚点。v4.3.2 是独立的方法身份;此前 v4.3 观测保留为历史参考,不能把跨版本数值差写成同一模型能力涨跌。

AA 的版本史将 v4.3.2 标为当前方法。它保留十项评测的框架,但说明 AA-Briefcase v1.1 与 GDPval-AA v2.1 的配对拟合口径发生变化;GDPval-AA v2.1 的 Elo 锚点也不同。因此本文只读取这个明确版本的原始观测,不把 v4.3.2 与既有 v4.3 的数值差解释为同一个模型变强或变弱

对搜索 AA Intelligence Index v4.3.2 methodology 或“AA Intelligence v4.3.2 评测”的读者,版本、任务、裁判/拟合方法与精确模型配置是一组边界。模型坐标保留来源分项和历史,不自行平均或重算 AA 的指数。

Step 5 Preview:首次收录的独立原始指标

Step 5 Preview 的 AA 模型页标注为 2026-09-18;本期的“新”仅指本站于 首次观察到该精确配置。此前截止 不存在可用于本文的同版本、同配置 v4.3.2 历史,因此没有“较上一期涨跌”可报告。

Step 5 Preview 的 Artificial Analysis v4.3.2 原始结果;每项固定到 2026-09-20T01:21:54.000Z
原始指标本期结果如何理解observedAt
AA Intelligence Index43.73来源发布的指数;本站不重新合成总分
AA-Briefcase v1.11433.26Elo 相对尺度,不是百分比
GDPval-AA v2.11565.95Elo 相对尺度,不是收入或任务通过率
Terminal-Bench v4.0 pass@133.3%终端任务通过率;不能接到 v2.1 曲线
AutomationBench-AA partial score51.0%来源 partial score,不是完整任务成功率
GDP.pdf all-pass14.8%一份交付需通过全部要求
SciCode58.9%科研代码子问题结果
AA-LCR v1.188.3%长上下文推理 pass@1
AA-Omniscience16.38来源分数,不能等同单一准确率
Humanity's Last Exam46.5%开放式作答 pass@1
CritPt20.9%科学推理;按官方评分服务核验

这些列回答的是不同问题:Elo 不等于百分比;Terminal-Bench、AutomationBench 与 GDP.pdf 的任务和成功定义不同;Omniscience 的来源分数也不应被替换成单一准确率。指数适合缩小候选集,但不能替代你自己的工具权限、任务数据、失败恢复和人工接管验收。

为什么没有做“v4.3 → v4.3.2 提升榜”

这次是方法身份变化,不是同一把尺子下的一次普通数值修订。旧 v4.3 观测仍保留在历史页,便于核对当时来源口径;v4.3.2 当前记录则单独保存。若把两个版本直接相减,会把任务、裁判或拟合更新误写成模型能力变化。

Step 5 Preview 也没有此前同一 exact variant 的本站 v4.3.2 观测。缺少可比前值时保持未知,比借用同系列、相近名称或其他推理档位的数据更可靠。

价格与 API:评测成本不是当前 API 报价

本期没有确认 Step 5 Preview 对应的精确 OpenRouter model ID、活跃付费端点或 Token 报价,当前 API 可用性与价格保持未知。不能把 AA 模型页上的任务成本、混合成本或性能测量,改写成 OpenRouter 的当前输入、输出或缓存价格。

这也意味着本文不把 Step 5 Preview 放入基于精确、稳定当前 API 价格的成本比较。若未来能以同一 exact variant 核验 OpenRouter 端点,新的报价会作为独立 observation 保存,连同来源和 observedAt 再进入相关页面。

对模型选型有什么用

需要文件交付或知识工作 Agent 时,可先看 AA-Briefcase 与 GDPval-AA;命令行任务看 Terminal-Bench;API 工作流看 AutomationBench;长上下文看 AA-LCR 与 GDP.pdf;科学代码和知识推理则分别看 SciCode、HLE 与 CritPt。它们不应被压成一个本站自创总分。

下一步应先确认你的目标任务与评测边界是否相近,再验证所用 API 的精确模型 ID、推理设置、上下文、价格和稳定性。评测中出现同名配置,不自动证明线上可调用版本与来源运行设置完全相同。

时间、未知项与相关数据

  • 本期 AA 原始观测固定于 ;后续来源刷新不会回写本期表格。
  • Step 5 Preview 的当前精确 API、Token 价格、部署条件与实际商业可用性仍为未知;没有把缺失写成 $0.00 或“免费”。
  • 旧 v4.3 与当前 v4.3.2 是不同方法身份;本文不制造跨版本能力涨跌结论。
  • 可从 模型页历史观测历史 JSON能力分项矩阵AA-BriefcaseGDPval-AAOmniscience 继续核对方法和来源。