同框全是熟脸、就它查无此人:Atria Dawn 和 DeepSeek/Kimi/Qwen/GLM 的八张图横评,争议大了
同框全是熟脸、就它查无此人Atria Dawn 和 DeepSeek/Kimi/Qwen/GLM 的八张图横评争议大了【免费下载链接】Atria-Dawn-Preview项目地址: https://ai.gitcode.com/InternLM/Atria-Dawn-Preview大模型圈最近流行一种同框图一张柱状图里并排放着 DeepSeek、Kimi、Qwen、GLM、GPT、Claude——全是熟脸唯独最边上那个名字大多数人查无此人Atria Dawn。更耐人寻味的是成绩流传最广的八图横评里它只拿了两个第一自动化、网络安全SkillsBench 输给 Qwen 零点三分GDPval 干脆掉到倒数第二。可官方口径却是16 项智能体基准、5 项第一。同一个模型两种说法到底谁在说谎本文结合仓库中的完整评测表、模型配置文件与论文公开信息把这两种口径的差距掰开来看。两种口径差在哪不是造假是对比阵容不一样先对齐事实。Atria Dawn Preview 是上海人工智能实验室于 9 月 11 日静默推上 Hugging Face 与 GitHub 的预览版模型9 月 14 日才放出 143 位作者署名的技术报告《Atria Dawn: The Dawn of Agentic Superintelligence》arXiv 2609.15818。仓库的评测表给出了一张完整的 16 行对比矩阵对手是 DeepSeek V4 Pro 0813、KIMI K3、Qwen 3.8 Max、GLM 5.3、GPT 5.6 sol、Claude Opus 5 六家–表示该行没有对应数据逐行数一下 Atria 拿到行内最高分的五个DeepSearchQA 96.0、BrowseComp 92.5、BFCL v4 77.0、AutomationBench 53.8、CyberGym 86.5。官方5/16 第一没注水。但八图横评只剩两冠也没错——关键在于这五个第一的对比阵容完整度DeepSearchQA 行里DeepSeek、Qwen、Claude 全部缺席–BrowseComp 行里Qwen、GLM 缺席BFCL v4 行里Qwen、GPT、Claude 缺席只有 4 家同框。换句话说凡是 DeepSeek/Kimi/Qwen/GLM 四家全部到齐的同框图里Atria 只剩 AutomationBench 和 CyberGym 两个第一其余三项含金量不低但都建立在对手数据缺失的局面上。两种口径都是真的差的是比赛是否全员参赛。这也是那张八图横评在传播上天然吃亏的结构性原因——围观群众看的是满图全勤的对抗而不是数据缺口。自动化与网络安全两项王者的真实含金量把镜头拉近到那两个全员到齐仍夺冠的战场。AutomationBench 53.8领先第二名 Qwen49.74.1 分对 DeepSeek41.7的领先高达 12.1 分Claude49.4、GLM49.2、GPT45.7、Kimi45.9全部落后——这是全场差距最悬殊的一张图。CyberGym 86.5领先 GLM84.52.0 分、GPT83.62.9 分、DeepSeek83.33.2 分对 Kimi78.7、Qwen73.8的压制更明显。自动化与网络安全恰是README.md 里四维能力中 Delivery 与 Cybersecurity 两栏的主场也正对着论文强调的Verifiable Experience Pipeline把工具调用接到可执行环境、用外部可验证结果训练。打开仓库的 chat_template.jinja 能直观看到这种 agent-native 设计——tool_callXML 协议、|observation|观察回填、think推理开关一应俱全config.json 里则是 78 层、256 个路由专家、每 token 激活 8 专家的 MoE 骨架。它确实是为边想边调工具、跑完看结果这种循环而生的。GDPval 垫底的含义则要诚实得多。GDPval 1583只高于 DeepSeek1517被 Claude1768、Qwen1722、GPT1682、GLM1667、Kimi1611全线压制再看同族的 JobBench 50.3Claude 68.0、SWE-bench Pro 59.6Claude 74.7、Qwen 65.1、Terminal-Bench 78.3Claude 90.2、Qwen 89.3——长程办公交付 终端编码正是它的短板区。结论很清晰这是一个把弹药堆在工具调用、安全攻防、开放检索三条线上的智能体底座而不是一个端到端交付的全能选手。八图横评里它只强两项不是偶然是训练目标的选择性暴露。同框背后品牌认知战才刚开始查无此人这件事本身就是这次发布最值得复盘的部分。上海 AI 实验室书生·浦语推出 Atria ASI 这个新马甲时权重先于论文、论文先于公告没有发布会、没有价格页而对手们个个是带着消费级品牌认知入场的老面孔。好在工程圈的反应比大众圈快得多国内 API 控制台给出 1 亿 token 免费额度、海外端点同一 model ID 同时暴露 Chat Completions / Messages / Responses 三套 wire APICodex、Kimi Code、Claude Code 的接入教程在社区里刷屏沐曦 GPU 也完成了 Day 0 适配——MIT 许可 BF16/FP8 双权重FP8 约 756GB让自托管成了可讨论的话题。但品牌认知战拼的不只是工程便利。论文里真正稀缺的素材不是那 5 个第一而是769 条任务记录、56 名参与者的人机协作实证96.5% 的任务启用了 AI人类却守住了 93.4% 的目标设定权与 85.5% 的最终决策权约三分之一被评价为没有 AI 根本做不了的任务由 AI 提出 55.4% 的方法选项、人类用判断力拍板。这才是Agentic Superintelligence区别于普通模型卡的故事线。问题是这张人机协作分工表不会被塞进柱状图也不会出现在和 DeepSeek/Kimi/Qwen/GLM 同框的那八张图里。所以横评争议的本质是评测口径、对比阵容与场景覆盖三者叠加的结果Atria 的五个第一里三个依赖对手缺阵两个经得起全勤对抗但集中在自动化与安全GDPval 的垫底又是它训练取舍的真实回旋镖。对于一个刚满月的新品牌真正的考验是后续的独立复现、开发者生态与人机协作方法论的持续输出——当下一张同框图里所有人都到齐时它还能剩下几个第一那才叫尘埃落定。【免费下载链接】Atria-Dawn-Preview项目地址: https://ai.gitcode.com/InternLM/Atria-Dawn-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考