我们做什么
收集公开榜单,规范字段名称,提供中文解释、站内检索、横向比较和稳定页面地址;个别中文专题会对已有输出运行可复现的 AI 复评。
我们不做什么
不修改公开来源分数,不调整来源权重,不把能力、价格、速度、开放性或专题复评分合并成本站总分。
本站 AI 复评边界
复评分只在所属专题内比较同一任务的有效输出,并披露固定样本、评分维度、Judge 模型、匿名方式、评分轮次、分歧处理、原始输出和机器数据。
数据快照与方法版本
本页方法核验于 2026-09-20T01:32:40.000Z,当前说明对应 AA Intelligence Index v4.3.2。来源将其有效期写为“September 2026 to current”;各模型、价格和历史观测有独立来源与 observedAt,方法核验时间不代表每条模型数据都在同一天更新。
版本可比边界
v4.3.2 的 10 项布局与 v4.3 相近,但 GDPval-AA v2.1 和 AA-Briefcase v1.1 的 Elo 拟合方式已经变更;v4.3.1 是更早的实时裁判协议记录。旧 v4.3、v4.3.1 与 v4.1 观测均保留原版本,跨版本分数差不能直接解释成能力涨跌;同一方法版本、模型 variant 和评测设置才可用于同口径比较。来源标为估算的分数保留估算标记,不与完整评测混称。
缺失值
“—”表示当前公开快照没有可核验结果。缺失不代表性能为零,也不会被本站估算补齐。
名称处理
保留会影响结果的模型版本和推理档位;删除对普通读者没有帮助的冗余描述,但详情页始终提供原始来源供核验。