HN 社区十年 AI 挑战清单:10 万票之后,哪些实现了、哪些还在跳票?

发布时间:2026/10/4 9:10:33
HN 社区十年 AI 挑战清单:10 万票之后,哪些实现了、哪些还在跳票?
本文首发于个人博客 wangyabo.com转载请注明出处。HN 社区十年 AI 挑战清单10 万票之后哪些实现了、哪些还在跳票2026-10-03·王亚博Abel Wang·约 12 分钟·Goalposts · Hacker News · 数据盘点2016 年 1 月AlphaGo 击败李世石前两个月Hacker News 用户 Houshalter 在一条讨论里立下挑战「AI 通过真正的、考察语言理解的图灵测试」。此后十年HN 社区陆续立下826 个这样的挑战——有人要求 AI 通过图灵测试有人要求它造出能住的房子有人干脆要求它去当水管工。一个叫 Goalposts 的网站把这 826 条挑战全部收集起来附上原始评论出处让社区逐条投票这条挑战AI 实现了吗2026 年 10 月 3 日投票关闭100,590 张选票的结果值得认真读一遍哪些被兑现了、是怎么兑现的哪些还挂在墙上为什么。TL;DR · 五条核心发现826 个挑战、100,590 次投票39% 判「已实现」35% 判「未实现」26% 不确定——HN 社区对 AI 十年进展的最终评价接近五五开。 挑战越老越可能被判「已实现」2016 年的挑战 54.7% 判 yes2026 年新立的挑战只有 26.9%——门槛goalpost在数据里肉眼可见地后退。 编程是被攻陷最彻底的领域竞赛题、找 bug、修生产事故等条目的 No 率低至 2%–4%对应技术路径是 LLM 代码预训练 Agent 自验证循环。 物理世界几乎原地踏步「机器人当水管工」0% yes「清洁马桶」11%「蟑螂级 3D 导航」32%——Moravec 悖论的标准注脚。 图灵测试条目十年出现 70 次yes 率从 61% 一路跌到 19%——不是 AI 变弱了是每一条新图灵测试都比上一条更严格。1 · 数据总览十年 826 个挑战10 万张选票Goalpostsstoppels.ch/goalposts做的事情很朴素收集 HN 上「AI 应该能做到 X」的挑战标注提出者、日期和原始讨论然后让社区对每条投 Yes / Not sure / No——Yes 意味着「AI 已经实现这条挑战」。截至投票关闭Yes 39,006 票39%、Not sure 26,509 票26%、No 35,075 票35%。分年度统计如下由本文从源数据计算年份挑战数投票数YesNot sureNo2016303,83454.7%23.2%22.1%2017323,88848.4%27.7%23.9%2018212,66047.8%26.5%25.7%2019222,68940.4%24.8%34.8%2020242,92836.9%28.6%34.5%2021222,70844.8%26.5%28.7%2022728,85241.0%24.5%34.5%202317621,32142.2%25.2%32.5%202412815,49440.8%25.9%33.3%202514717,72536.4%26.6%37.0%2026*(Q1–Q3)15218,49126.9%28.8%44.3%2026 年数据截至投票关闭日10 月 3 日仅含前三个季度。各年投票在 2026 年集中完成。各年挑战的 Yes 率走势这组数字有两个读法。第一挑战数量的曲线就是 AI 热度曲线。2016–2021 年每年只有 20–30 条2022 年翻倍到 72 条Stable Diffusion 与 ChatGPT 前夜2023 年爆发到 176 条——比此前五年总和还多此后维持在每年 130–180 条的高位。挑战的密度记录着社区情绪的密度。第二Yes 率逐年走低不代表 AI 在退步而是条目性质变了。老挑战下棋、翻译、看图说话大多已被兑现新挑战递归自我改进、跑赢数学家、机器人管家本来就是对着当前能力边界的外推。你离门槛越近门槛退得越远——这正是站名 Goalposts 的自嘲。还有第三个读法藏在条目里挑战会「复刻」。同一目标会以不同措辞反复上榜——图灵测试十年出现 70 次「Level 5」「雪天驾驶」「穿越全国」等自动驾驶条目从 2016 到 2026 每隔一两年就被重新立起一次P vs NP 在 2023、2025、2026 三次上榜。反复被重立的清单就是社区执念的清单也是 AI 能力边界最诚实的记录哪条没被划掉哪条就还会回来。2 · 已实现清单它们是怎么被实现的这一节挑出各领域最有代表性的条目把「挑战」对应到真实的技术突破上——重点不是罗列新闻而是说清机制靠什么技术这一步是怎么迈过去的。2.1棋盘与游戏深度强化学习的十年“AI plays well at complex strategy games with uncertainty and incomplete information.”mcv2016-01-19 · Yes 38% / Not sure 31% / No 31%2016 年 3 月AlphaGo 用三件套——监督学习先学人类棋谱 强化学习自我对弈 蒙特卡洛树搜索——4:1 击败李世石。2017 年 AlphaZero 干掉了「人类棋谱」这个前提从零自学数小时即超越顶级国际象棋引擎顺带兑现了 2016-03 的挑战「胜围棋的 AI 不改一行代码也能下别的棋」。不完美信息博弈随后跟进CMU 的 Libratus2017在 12 万手对决中胜四位顶尖职业扑克手核心是反事实遗憾最小化CFR——不靠神经网络暴力靠博弈论式的自我对弈收敛OpenAI Five2019用超大规模自我对弈强化学习击败 Dota 2 世界冠军 OGDeepMind 的 AlphaStar2019在《星际争霸 II》天梯打入 Grandmaster。这一族的挑战基本全部到齐但残留也真实「百强选手看不出 AI 战队与人类战队的区别」只有 13% yes——赢下比赛不等于像人一样比赛。2.2对话与图灵测试LLM RLHF“A chatbot passes the Turing test.”Houshalter2016-03-09 · Yes 75% / Not sure 10% / No 15%这是全库最早被高票判定「已实现」的挑战之一。兑现它的是 ChatGPT2022-11Transformer 自回归「下一词预测」 数万亿 token 预训练 RLHF人类反馈强化学习把「会说」对齐成「说人话」。GPT-42023-03把这条线推到考试场景模拟律师资格考试进入前 10%。语音在同一窗口内补完Google Duplex2018最早演示 AI 打电话订座到 2022-12 的挑战「AI 独立接一通电话——听懂来电、决定说什么、把它说出来」已获 74% yes今天这已是客服与外呼行业的常规配置。2023 年新增的 176 条挑战里一批「ChatGPT 能否 X」被高票判 yes找出代码里的 bug91% yes、读雇佣合同标出隐性陷阱条款85% yes、把整章教科书变成笔记和抽认卡87% yes。2.3编程被降维打击的领域“AI develops software from completely open-ended natural language requests.”fauigerzigerk2017-02-15 · Yes 90% / Not sure 3% / No 7%全库大型条目最高「自然语言 → 应用」在 2016–2017 年被反复提出84%–90% yes十年后全部到货。兑现分三段GitHub Copilot2021OpenAI Codex做上下文补全ChatGPT / Claude2022–2023做对话式生成、解释与修复Cursor / Claude Code / Codex 类编码 Agent2024–2025进入「读写文件 → 跑测试 → 看报错 → 自己迭代」的循环。社区 verdict 极为一致「跑测试失败后自己改代码再提交」89% yes「修复真实生产事故Kafka 配置错误、死锁掉请求」87% yes「解决竞赛编程题」No 率仅 2%。编程类挑战被攻陷得最彻底机制上不意外GitHub 数十亿行公开代码是现成语料编译器与测试套件是完美的自动判分器——连人类反馈都可以被编译反馈替代。验证闭环越干净的任务AI 攻陷得越快。2.4图像与视频扩散模型“An AI paints a subject it is told to draw, and the result is hard to distinguish from a human artist’s painting.”kang2016-02-07全库第二条挑战· Yes 66% / No 22%兑现它的是 DALL-E 22022-04、Stable Diffusion2022-08 开源、Midjourney扩散模型在潜空间逐步去噪CLIP 文本嵌入负责「听懂」主题。从挑战提出到兑现六年。视频在追赶Sora2024-02与 Veo 22024-12演示了连贯长镜头但「生成带运动相机的丰富 3D 世界连贯视频」2023-11也只有 45% yes——能看了还不够真。2.5翻译非印欧语系不再是死角“An AI passably translates a natural non-Indo-European language into English.”Grue32016-08-01 · Yes 73% / No 仅 2%Google 神经机器翻译 NMT2016-11 上线奠基2017 年 Transformer 架构《Attention Is All You Need》成为整个领域的底座Meta 的 NLLB2022把覆盖推到 200 种语言、包括大量低资源语言。「可用地翻译」已经成立但文学级仍有明确距离——「文学翻译达到可出版水准」2025 年只有 30% yes。语境化也在半途「把『Can you stand up?』这类歧义口语按上下文正确翻译」2023-1249% yes——字面翻译解决了言外之意还差一半。2.6数学与科学从辅助到夺牌“An LLM scores at least a bronze medal at the International Math Olympiad.”pphysch2025-07-19 · Yes 70% / No 仅 3%AlphaGeometry2024-01先在几何证明上摸到 IMO 银牌线神经 符号混合架构AlphaProof AlphaGeometry 22024-07在 IMO 拿到银牌档分数2025 年 7 月OpenAI 与 DeepMind 先后官宣模型达到IMO 金牌分数。科学侧AlphaFold22020-11CASP14把蛋白质结构预测从五十年难题变成常规操作拿下 2024 年诺贝尔化学奖FunSearch、AlphaEvolve 在组合数学与算法发现上产出过可验证的新结果。但「原创性」的边界依然清晰模型能解开放数学问题社区仍只有 29% 相信它能「发明训练数据里不存在的新化学、新物种」2026-03 条目。3 · 未实现清单还挂在墙上的3.1通用自动驾驶地图结界外的世界“An AI achieves level 5 self-driving, driving a car in all conditions without human help.”chubot2019-01-07 · Yes 5% / No 78%Waymo 已经在凤凰城、旧金山、洛杉矶、奥斯汀跑无安全员 robotaxi——但全部画在 geofence地图结界里。同族条目全军覆没「雪天城市水牛城/雪城」5% yes2025-05「穿越全国、顺路自己补个胎」6% yes2024-11。即便把标准缩到「有限范围内安全、如人类一样适应性地驾驶」2026-03 的条目也只有 25% yes——社区对「通用性」的验收毫不含糊。难点不是模型不够大而是开放世界的长尾不可枚举暴雨、施工、交警手势、被雪盖住的车道线每一样都无法靠堆数据穷尽安全验证又需要远超人类司机里程的无事故证据出了事故谁负责制度上也没答案。封闭任务上 AI 碾压人类开放物理任务上连「及格线」都难定义。3.2高风险专业技术可以执业不行“AI actually replaces a human lawyer, rather than just augmenting one.”Hydraulix9892017-01-04 · Yes 17% / No 53%读合同、查判例AI 已经很强合同审查条目 85% yes但「好到能取代 500 美元/小时的律师」也只有 31% yes2024-04。医疗更硬「替代外科医生做复杂手术」7% yes「做放射科医生一整天的工作」8% yes「分清装疼与阑尾炎、惊恐发作与心脏病」5% yes。瓶颈不在检索能力在担责签字资格、执业牌照、失误成本、监管诉讼。这不是模型能力的函数是制度变量——模型再强也不会自动长出行医执照。辅助与替代的分界线倒是清晰2025-09 的条目「本地 LLM 帮律师重建零散的计费工时」拿到 60% yes——辅助性任务先落地替代性判断持续后置。3.3物理世界Moravec 悖论现场“An AI-driven robot does the job of a plumber or an electrician.”somenameforme2025-03-23 · Yes 0% / No 95%全场 No 率最高之一0% yes——全场最绝望的数字。同族条目「机器人清洁酒店房间含马桶、床单、迷你冰箱」2% yes「AI 清洁马桶」11% yes「像蟑螂一样在陌生 3D 空间导航」32% yes——后者是全库票数最高的单条161 票HN 用户把最多的票投给了这个卑微的标杆。2016 年的「个体像蚂蚁、群体像蚁群」49% yes至今没有对应的物理系统。同族还在不断补员「机器人互相修理」3% yes2024-04「人形机器人叠一件刚从烘干机拿出来的衬衫」20% yes2026-06「AI 运营一个机器人管家」17% yes2026-02。原因就是 Moravec 悖论推理是进化史上很晚的技能感知运动是几亿年打磨的硬件。灵巧手、触觉反馈、电池能量密度、整机成本每一项都比「下一个更大的模型」慢一个数量级——软件一年迭代硬件十年。3.4原创、持续学习与自我改进“An AI model proves that P is not equal to NP.”raspasov2025-09-25 · Yes 0% / No 84%数学最深的开问题纹丝不动P vs NP 0% yes黎曼猜想相关条目 11%–15% yes。「至少与人类 AI 研究者一样聪明」27% yes2016 年提出至今原地「AI 比人类更擅长 AI 研究」13% yes「递归自我改进RSI」12% yes「只学 1905 年前的知识自己推出相对论」4%–6% yes。结构性缺口有两个其一当前 LLM 是「训练 → 冻结 → 部署」三段式「在服役中更新自己的权重」条目只有 3%–7% yes——没有持续学习就没有真正的经验积累其二「彻底消除幻觉」只有 8%–9% yes——不可靠性限制了让 AI 自主跑长程研究循环的信任额度。改进 AI 的收益无法闭环自动化RSI 就还停在论文叙事里。4 · 有趣的观察4.1图灵测试goalpost 移动的活化石十年里图灵测试条目出现70 次2016–2017 两年就占 17 次。措辞的升级史比数字更精彩2016 年「聊天机器人通过图灵测试」75% yes→ 2019 年「通过需要新颖内省回答的图灵测试」51% yes→ 2022 年「让充分研究过它的人信服」22% yes→ 2024 年「持续数周、对抗性极强的图灵测试」22% yes→ 2026 年「在积极识破的专家面前长时间不被发现」该年图灵条目整体只剩 19% yes。宽松版每被兑现一次紧接的就是更严格的下一版。这 70 条的 yes 率曲线61% → 72% → 40% → 19%测量的早已不是 AI 能力而是人类的验收标准通胀。4.22016 年的「科幻条目」全部到货2016-03「AI 拿到人类可读的问题描述做出过得去的求解尝试」——88% yes。2016-11「AI 干得了一年经验程序员的活」——85% yes。2016-06「有人只要用基础规格提出请求AI 就能构建可用应用」——84% yes。当年原帖下面不少人把这些当调侃立誓十年后它们不仅实现而且已经内化成日常工具——「自然语言 → 应用」从挑战变成了产品类别。4.3AI 效应的教科书案例2016-08 的条目「单一 AI 程序能玩多种游戏、能对话、能答考试题、能写故事」——83% yes。这在 2016 年是 AGI 的定义性挑战2026 年实现了大家管它叫 LLM。被解决的问题就不再被算作智能——AI effectAI 效应在数据里留下了清晰指纹挑战一旦兑现就从「智能试金石」降级为「功能特性」。「数 strawberry 里有几个 r」也一样2024-07 上榜时 69% yes推理模型已基本解决2026-09 换个措辞再上榜只剩 49%——一个梗从笑话到基准再到回归测试的完整生命周期。4.4一个五五开的社区39% vs 35%——HN 投了十年几乎没有共识。分层看更有意思对 2016–2018 年的旧挑战社区多数判「已实现」对 2026 年立下的新挑战44% 直接判「未实现」26% 的 Not sure 同样真实——它们大多是「部分实现」的诚实注脚。HN 不是乐天派社群它是一群被兑现过承诺、也被跳票过承诺的工程师用每一次投票同时记录乐观与警惕。5 · FAQ这个投票是严格的 AI 评测吗不是。它是 HN 社区对 826 条挑战的主观判断聚合没有标准化环境、没有控制变量投票者也无法逐条验证。把它当成「一群技术从业者十年体感的时间线」比当成 benchmark 更准确。「实现」是怎么判定的每条挑战由社区投 Yes / Not sure / NoYes 代表「AI 已实现该挑战」。本文所有比例各年 yes 率、条目 No 率、图灵测试 70 条等统计均由我从源数据计算可复现。为什么图灵测试条目 2026 年 yes 率只有 19%因为测试被升级了。早期条目只要求骗过普通人后期条目要求骗过带着对抗策略的专家、持续数小时甚至数周。同一个名字难度完全不同。为什么编程类条目实现率显著更高三个原因公开代码语料充足编译器与测试套件提供即时判分的验证闭环HN 用户本身就是程序员对一线能力的判断更敏锐。第三点也意味着社区对物理、医疗等领域的判断未必同等可靠。为什么 2026 年的新挑战 yes 率最低因为它们本来就是对当前能力边界的外推agent 长时程自主、递归自我改进、机器人管家。旧挑战衡量「AI 已经走了多远」新挑战衡量「AI 还差多远」——两者的 yes 率天然不可比。哪里能看到全部原始数据和每条挑战的原始评论stoppels.ch/goalposts。每条挑战都带原始 HN 讨论链接含提出者用户名与日期可逐条核对。6 · 边界声明本文数据来自 stoppels.ch/goalposts 的社区投票聚合投票于 2026-10-03 关闭Yes 39,006 票 / 39%Not sure 26,509 票 / 26%No 35,075 票 / 35%。这是社区主观判断的聚合不是严格技术评测。投票集中完成于 2026 年带有后见之明HN 用户以程序员为主对编程类挑战的判断可能偏乐观对物理、医疗类领域的判断未必专业。分年度统计与条目归类由作者从源数据脚本计算与原站展示口径可能存在细微差异。文中技术事件AlphaGo、ChatGPT、AlphaFold 等为公开事实用于解释「挑战如何被实现」具体细节以官方发布为准。7 · 参考来源一手·数据Goalposts — Hacker News AI challengesstoppels.ch/goalposts/results.html826 条挑战与 100,590 次投票完整记录投票关闭于 2026-10-03。一手·原始讨论各挑战附带的 HN 原始评论如 Houshalter 2016-01-19图灵测试挑战、fauigerzigerk 2017-02-15自然语言开发软件、somenameforme 2025-03-23水管工挑战。二手·技术事件AlphaGo vs 李世石DeepMind2016-03AlphaZero2017LibratusCMU2017OpenAI Five2019AlphaStarDeepMind2019AlphaFold2CASP142020-11GitHub Copilot2021NLLB-200Meta2022Stable Diffusion2022-08ChatGPT2022-11GPT-42023-03Sora2024-02AlphaGeometry / AlphaProofDeepMind2024IMO 金牌分数OpenAI / DeepMind2025-07Claude Code 等编码 Agent2025。方法分年度聚合、条目关键词统计图灵测试 70 条、编程类 No 率等由作者脚本计算自源数据。王亚博Abel Wang· 关注 wangyabo.com 获取每日 AI × Agent × 数字效能洞察。