AA 的当前方法页明确将 Intelligence Index 标为 v4.3.2;其中 AA-Briefcase v1.1 与 GDPval-AA v2.1 的 pairwise 评测采用 Crowd-BT。
模型日报 · 2026-09-20
模型日报 2026-09-20|AA Intelligence v4.3.2:Step 5 Preview 进入新口径评测
Artificial Analysis 当前 Intelligence Index 明确为 v4.3.2,AA-Briefcase v1.1 与 GDPval-AA v2.1 采用 Crowd-BT。Step 5 Preview 首次进入本站的独立 AA 记录;旧 v4.3 只作历史参考,当前精确 OpenRouter API 与价格仍未知。
TODAY'S TAKE
先对齐评测口径,再读 Step 5 Preview 的首份快照
本期来源观察的 Intelligence Index 为 43.73。首次收录指本站首次保存这个精确 AA identity,不等于厂商于今天发布。
没有一一对应、已核验的 OpenRouter 付费 variant;不以相似名称、免费变体或 AA 评测成本填补当前 API 价格。
v4.3.2 方法改变了什么
Artificial Analysis 当前方法页将 Intelligence Index 标为 v4.3.2:AA-Briefcase v1.1 与 GDPval-AA v2.1 的成对比较使用 Crowd-BT,GDPval-AA v2.1 同时改用 DeepSeek V4.1 Flash (max) 的 1600 Elo 锚点。v4.3.2 是独立的方法身份;此前 v4.3 观测保留为历史参考,不能把跨版本数值差写成同一模型能力涨跌。
AA 的版本史将 v4.3.2 标为当前方法。它保留十项评测的框架,但说明 AA-Briefcase v1.1 与 GDPval-AA v2.1 的配对拟合口径发生变化;GDPval-AA v2.1 的 Elo 锚点也不同。因此本文只读取这个明确版本的原始观测,不把 v4.3.2 与既有 v4.3 的数值差解释为同一个模型变强或变弱。
对搜索 AA Intelligence Index v4.3.2 methodology 或“AA Intelligence v4.3.2 评测”的读者,版本、任务、裁判/拟合方法与精确模型配置是一组边界。模型坐标保留来源分项和历史,不自行平均或重算 AA 的指数。
Step 5 Preview:首次收录的独立原始指标
Step 5 Preview 的 AA 模型页标注为 2026-09-18;本期的“新”仅指本站于 首次观察到该精确配置。此前截止 不存在可用于本文的同版本、同配置 v4.3.2 历史,因此没有“较上一期涨跌”可报告。
| 原始指标 | 本期结果 | 如何理解 | observedAt |
|---|---|---|---|
| AA Intelligence Index | 43.73 | 来源发布的指数;本站不重新合成总分 | |
| AA-Briefcase v1.1 | 1433.26 | Elo 相对尺度,不是百分比 | |
| GDPval-AA v2.1 | 1565.95 | Elo 相对尺度,不是收入或任务通过率 | |
| Terminal-Bench v4.0 pass@1 | 33.3% | 终端任务通过率;不能接到 v2.1 曲线 | |
| AutomationBench-AA partial score | 51.0% | 来源 partial score,不是完整任务成功率 | |
| GDP.pdf all-pass | 14.8% | 一份交付需通过全部要求 | |
| SciCode | 58.9% | 科研代码子问题结果 | |
| AA-LCR v1.1 | 88.3% | 长上下文推理 pass@1 | |
| AA-Omniscience | 16.38 | 来源分数,不能等同单一准确率 | |
| Humanity's Last Exam | 46.5% | 开放式作答 pass@1 | |
| CritPt | 20.9% | 科学推理;按官方评分服务核验 |
这些列回答的是不同问题:Elo 不等于百分比;Terminal-Bench、AutomationBench 与 GDP.pdf 的任务和成功定义不同;Omniscience 的来源分数也不应被替换成单一准确率。指数适合缩小候选集,但不能替代你自己的工具权限、任务数据、失败恢复和人工接管验收。
为什么没有做“v4.3 → v4.3.2 提升榜”
这次是方法身份变化,不是同一把尺子下的一次普通数值修订。旧 v4.3 观测仍保留在历史页,便于核对当时来源口径;v4.3.2 当前记录则单独保存。若把两个版本直接相减,会把任务、裁判或拟合更新误写成模型能力变化。
Step 5 Preview 也没有此前同一 exact variant 的本站 v4.3.2 观测。缺少可比前值时保持未知,比借用同系列、相近名称或其他推理档位的数据更可靠。
价格与 API:评测成本不是当前 API 报价
本期没有确认 Step 5 Preview 对应的精确 OpenRouter model ID、活跃付费端点或 Token 报价,当前 API 可用性与价格保持未知。不能把 AA 模型页上的任务成本、混合成本或性能测量,改写成 OpenRouter 的当前输入、输出或缓存价格。
这也意味着本文不把 Step 5 Preview 放入基于精确、稳定当前 API 价格的成本比较。若未来能以同一 exact variant 核验 OpenRouter 端点,新的报价会作为独立 observation 保存,连同来源和 observedAt 再进入相关页面。
对模型选型有什么用
需要文件交付或知识工作 Agent 时,可先看 AA-Briefcase 与 GDPval-AA;命令行任务看 Terminal-Bench;API 工作流看 AutomationBench;长上下文看 AA-LCR 与 GDP.pdf;科学代码和知识推理则分别看 SciCode、HLE 与 CritPt。它们不应被压成一个本站自创总分。
下一步应先确认你的目标任务与评测边界是否相近,再验证所用 API 的精确模型 ID、推理设置、上下文、价格和稳定性。评测中出现同名配置,不自动证明线上可调用版本与来源运行设置完全相同。
时间、未知项与相关数据
- 本期 AA 原始观测固定于 ;后续来源刷新不会回写本期表格。
- Step 5 Preview 的当前精确 API、Token 价格、部署条件与实际商业可用性仍为未知;没有把缺失写成 $0.00 或“免费”。
- 旧 v4.3 与当前 v4.3.2 是不同方法身份;本文不制造跨版本能力涨跌结论。
- 可从 模型页、历史观测、历史 JSON、能力分项矩阵、AA-Briefcase、GDPval-AA 与 Omniscience 继续核对方法和来源。