所有大模型追到根,都只是一个神经元在做加法——差别只在“你的数据是什么形状“

发布时间:2026/10/5 3:38:20
所有大模型追到根,都只是一个神经元在做加法——差别只在“你的数据是什么形状“
摘要一张《Types of Neural Networks in AI》九宫格信息图配一句被误读成术语科普的话所有 LLM 追根溯源都是「一个神经元把数字加起来」。但过去七十年真正发生的事情其实只在回答一个问题——你的数据是什么形状本文按形状重排这九种网络空间走 CNN、序列走 RNN/LSTM、关系走 GNN、而 Transformer 根本不是第四种形状它是完全图上的 GNN。文中补了一串原文没有的硬数据Rosenblatt 1958 年那台 Mark I 感知机重达数吨、400 个光电管Minsky Papert 1969 年用一册书把单层感知机送进第一次 AI 寒冬1969–1982Hochreiter Schmidhuber 1997 年靠该留什么、该忘什么这一个门控想法撑起了序列模型二十年以及最反直觉的一条实用建议——结构化业务数据上梯度提升树XGBoost/LightGBM/CatBoost通常仍然赢过神经网络Kaggle 表格赛约七成冠军出自它们。结论换架构改的不是那五个概念权重、激活、损失、反向传播、过拟合而是谁参与计算、怎么聚合、按什么顺序。别问用哪个架构问你的数据长什么样。正文一、先破掉一个误解这张图不是术语表图片标题是《Types of Neural Networks in AI》作者 Satish Kumar Subramanian一张规规矩矩的九宫格Perceptron、MLP/Dense、CNN、RNN、LSTM、Transformer、Autoencoder、GAN、GNN每格三栏——结构描述、可视化结构、主要应用底部一条 KEY CONCEPTS 串起权重、激活、损失、反向传播、过拟合。LangChain 那句原文说得比图本身漂亮Every LLM you use traces back to one neuron adding up numbers. Everything since then answers one question: what shape is the data?前半句没错。你现在用的大模型追到最底层就是一个加权求和再过一道阈值的动作——1958 年 Rosenblatt 那台能用数据改自己参数的机器和今天手机里跑的神经网络共享同一句咒语w ← w − η∇E只不过把电位器换成了浮点数。但后半句才是真正值钱的部分也是大多数人跳过的地方。一个神经元能做的事太少了少到连异或这种最简单的规则都学不会。七十年里所有架构创新的动机其实都不是我们想要更强的模型而是我们把数据摆错了姿势图像数据是二维空间文本是一维序列社交网络是一张图。你拿处理序列的办法去处理空间就必然要重写一套东西。所以这张图真正的读法不是九种网络各有用途而是一张数据形状 → 架构的对照表。二、第一个故事最值得讲感知机是怎么被一本书锤进寒冬的九格里排第一的 Perceptron是整条链里最有戏剧性的一环。1958 年Frank Rosenblatt 在康奈尔造出 Mark I 感知机——一台重达数吨、占满整个房间的机电怪物用 400 个光电单元当眼睛电位器当权重靠接线员手调。它能在几百次尝试内学会区分图形左右半区。当时媒体的口径是机器要思考了。结构上它简单得可怜若干输入乘上权重求和再过一道阈值输出 0 或 1。就是一个开关。1969 年马文·明斯基和西摩尔·派珀特出版《Perceptrons》冷静地证明了一件事单层感知机连 XOR异或都算不出来。XOR 是什么是最典型的非线性规则——两个条件里恰好满足一个才成立。在平面上画你要把两类点分开XOR 的点是十字交叉分布一条直线切不开。而单层感知机的全部能力就是画一条直线。这记重锤不是打在技术上是打在信心上。叠加同期英国的 Lighthill 报告1973大举削减 AI 经费、美国 Mansfield 修正案把 DARPA 资助扭向有明确军事产出的方向神经网络研究被拖进了第一次 AI 寒冬大约 1969 年持续到 1982 年。这里有个值得记住的细节明斯基和派珀特批评的是单层但被判死刑的是神经网络。而叠多层怎么训练这个问题1986 年 Rumelhart、Hinton 等人用反向传播解开了——中间隔了 17 年。现在所有大模型的老家就坐在那一格。顺带说一句 MLP多层感知机就是把感知机一层一层摞起来用反向传播训。但原文那句提醒别忽略——在结构化的表格业务数据上梯度提升树往往仍然赢先试它们。这一点我们第四节单独讲因为它被低估得最厉害。三、九个架构其实只解决了三种形状现在把九格重排。你会发现它们不是九个并列选项是同一个邻域聚合模板的三种特化。数据的形状痛点解法代价空间图像全连接每层两两相连参数量爆炸CNN 共享卷积核猫在角落也还是猫丢全局靠叠加视野序列文本、语音、时序顺序必须逐字读前面忘得快RNN → LSTM 用门控决定留什么、忘什么串行难并行关系图把网络压成一张张行关系信号就没了GNN 在节点之间传消息图大就过平滑、过压缩没有已知结构token 集合不知道谁该跟谁说话Transformer全连接注意力复杂度随长度平方增长1. CNN 解决的是空间这件事。卷积的核心 idea 只有一句一张图里猫在左上角还是右下角不影响它是猫。如果让每个神经元都去看全图参数量会大到不可训练让卷积核只在局部滑、并且同一套权重在每一个位置复用视觉问题才变得可学。LeCun 1989 年把反向传播装进 CNN 做手写数字识别就是这条路。今天几乎所有视觉骨干ResNet、EfficientNet乃至 ViT 之前的整个 ImageNet 时代都长在这一个 idea 上。2. RNN / LSTM 解决的是顺序。RNN 一个字一个字读把记忆往前传。但梯度顺着时间往回走时会指数级衰减所以开头的信息到后面就淡了——这就是所谓长程依赖问题。1997 年 Hochreiter 和 Schmidhuber 的解法朴素到近乎狡猾给网络装门。该记的打开该忘的关掉遗忘门、输入门、输出门。就这一个想法让序列模型又活了二十年撑起了 2017 年之前几乎全部的语音识别、机器翻译和时间序列预测。3. Transformer 不是第四种形状——它是完全图上的 GNN。原文把这条当 fun fact 轻轻带过Fun fact: a transformer is a GNN on a fully connected graph.这句话的技术含量被严重低估了。学术界对这个等价关系的表述更完整标准的邻域聚合更新长这样——h_v(k1) σ( W₁·h_v(k) W₂·Σ_{u∈N(v)} h_u(k) )其中 N(v) 是 v 的邻居集合。CNN、GNN、Transformer 三者的区别只在于跑在哪张图上、边怎么加权CNN跑在规则网格图上邻居固定每个位置偏移学一份权重 → 平移等变Transformer跑在完全图上任意两个 token 之间都连一条边边权由 attention 动态算出自带置换等变GNN跑在数据自带的图上连接关系本身就是要被预测的信息换句话说这三者是同一个模板的三个实例。这个视角的价值在于你下次看到任何一种新架构先问它跑在哪张图上大半问题就自己解了。4. Autoencoder 和 GAN 是另外一挂——它们不解决形状解决怎么造。自编码器把数据压进一个窄瓶颈latent再重建。重建不出来的那部分就是异常的。这个性质让它安静地好用—— fraud detection、缺陷检测、去噪、压缩而且它现在就住在很多现代图像生成器的内部。GAN生成器造假判别器判真假。 brilliant但训练不稳、容易模式崩塌只造得出几种样本多样性崩掉。所以图像生成这条路上扩散模型基本把它替换掉了——扩散把一次生成拆成很多个稳定的小步骤比博弈稳得多。四、被低估最深的一句表格数据先上树别上神经网络原文第 2 格底下那行小字是整篇里我最想让你记住的一句On structured business data, gradient-boosted trees still often win. Try them first.这不是一句随口的行话它有扎实的实证支撑Grinsztajn 等人 2022 年的论文《Why tree-based models still outperform deep learning on tabular data》给出了结构性原因决策树是轴对齐切分天然贴合业务数据里那些分段结构——价格档位、年龄区间、地域类别、时段规律它对无关特征天然鲁棒直接不切它不需要特征归一化而且不依赖 augmentation。Kaggle 表格类竞赛至今约七成冠军出自 GBDT 集成通常 XGBoost LightGBM CatBoost 堆叠深度学习方案主要出现在带文本特征或超大数据的赛道。更现实的理由是可解释性信贷、保险核保、临床辅助这些场景里监管机构要的是 SHAP 值这种能被客户和合规部门读懂的归因而神经网络的归因又慢又是近似值。反向的结论同样重要神经网络在表格上输是因为它的默认先验平滑、连续、可微跟业务数据的现实分段、离散、规则生成不匹配。神经网络天生爱光滑流形而会计凭证和用户属性压根不是流形。所以上深度学习和上神经网络从来不是一回事。原文这半句提醒比它列的那九个架构加起来都实用。五、五个词才是钥匙换架构只改这三件事图底那排 KEY CONCEPTS——Weights、Activation、Loss、Backpropagation、Overfitting——是真正通用的部分。Weights模型学到的东西Activation让模型能弯而不是只能画直线Loss离标准答案有多远Backpropagation它怎么变好Overfitting它背答案而不是学规律原文说得很干脆学会这五个任何架构都读得懂。这句话的准确翻译是——换架构改的不是这五个词而是三件更具体的事谁参与计算、怎么聚合、按什么顺序。举个例子你把一个 Transformer 换成 CNN变的是谁参与计算从所有 token 变成固定窗口内的像素和怎么聚合从注意力加权变成卷积求和权重、损失、反向传播、过拟合——一个字都没动。反过来如果你连这五个词都不熟那九种架构在你眼里就真的是九个互不相干的名词背下来三天就忘。六、三个可以马上拿来自检的问题第一问我的数据里有什么结构是我根本没用上的如果你手里是带空间结构的东西却用了全连接带时间顺序的东西却用了 MLP带网络关系的东西却 join 成一张表——那不是模型没选对是数据被你提前挫平了。这时候换架构的收益远大于调参。第二问我现在这个架构是不是在硬造结构原文第 8 条和第 9 条其实都在说这件事表格数据先试 GBM图数据别压成行。第三问我为省算力砍掉的那部分砍的是效率还是能力这一条最容易被搞混。Transformer 的二次代价是真实存在的——每个 token 都要看所有 token所以序列一长成本就平方级往上蹿这也是长上下文一直很难的根源。于是有了分组查询注意力GQA、滑动窗口注意力SWA、稀疏与线性注意力最近两年开源模型标配的 GQA 就是这么来的。但要注意区分两件事砍窗口是砍效率砍谁参与聚合才是砍能力。现在的共识是——大多数层只需要读懂眼前128 个 token 的量级留少数几层保留全局视野就够。这个判断成立的前提是多数任务不需要每层都看全篇而不是全局注意力没用。七、结语七十年只做了一件事——给数据找到它该待的形状1958 年一台几吨重的机器用 400 个光电管学画直线媒体说机器要思考了。1969 年一本书证明它连异或都算不出来整个领域被送进寒冬。1986 年反向传播让多层网络重新可训。1997 年两个门控让序列模型多活了二十年。2017 年一篇《Attention Is All You Need》把并行化塞进注意力规模才算真正开始跑起来——代价是平方级的账单。七十年过去底层那个动作一次都没变把数字加起来。变的是一件事——我们把数据摆成了什么形状。图里那句收尾的话值得原样抄下来Math the architecture to the shape of your data.别问用哪个架构。先低头看看你的数据它长什么样。今日互动在你的业务场景里目前打交道最多的是哪种架构是稳如老狗的 MLP 树模型还是正在吞噬一切的 Transformer欢迎在评论区聊聊。免责声明本文基于公开技术资料与论文Rosenblatt 1958、Minsky Papert 1969、Hochreiter Schmidhuber 1997、Vaswani et al. 2017、Goodfellow et al. 2014、Grinsztajn et al. 2022以及Transformers are GNNs相关研究整理撰写文中所述架构特性与对比结论供学习参考。信息图原文作者为 Satish Kumar Subramanian文中部分性能与 benchmark 数据随版本与评测集变化实际选型请以官方技术报告与自有数据实测为准。