依靠自研AI智能体 Ignition (闭源) 初创公司10小时搭建类CUDA软件事件 四家厂商自动算子/类CUDA构建方案横向对比表
资讯完整解读初创公司10小时搭建类CUDA软件事件一、事件核心概况2026年8月初外媒Business Insider披露初创公司Infinity2025年成立仅1年历史依靠自研AI智能体Ignition仅耗时10小时为推理芯片厂商d-Matrix的Corsai芯片开发出一套类CUDA底层软件栈上线后芯片直接达成自身理论峰值性能的92%10天内便可完整跑通3款主流前沿大模型端到端推理流程。英伟达耗费近20年迭代打磨CUDA生态构筑行业护城河而AI智能体将芯片适配、算子开发的周期从「数月/数年」压缩至小时级别引发行业对CUDA壁垒是否松动的讨论。主体背景Infinity创始人Jeremy Nixon曾任Google Brain研究员2026年7月完成1500万美元种子轮融资投后估值1亿美元成立第一年就依靠芯片软件适配业务实现百万级年收入。核心目标用AI自动编写跨芯片底层内核代码抹平各类AI芯片的软件适配门槛。Ignition AI智能体自动化完成全套底层开发闭环自动生成GPU/AI芯片内核Kernel代码→部署测试、自动定位BUG→采集性能指标→迭代重写优化代码人类工程师仅负责下达顶层需求、划定约束条件海量枯燥底层编码、调优工作全部交由AI循环完成。合作方 d-Matrix主打低功耗AI推理芯片竞品对标英伟达推理卡但长期受制于缺少成熟配套软件生态和早年AMD GPU面临「硬件不差、生态落后」困境一致。二、为什么这件事具备行业冲击力CUDA真正的护城河从来不是代码CUDA的壁垒结构CUDA不只是驱动代码而是三层完整生态底层芯片调度内核 海量成熟算子库(cuBLAS、cuDNN等) 全球开发者沉淀二十年的工程生态、工具链、海量适配模型、社区积累。过往适配一款新芯片工程师团队需要数月手写算子、调试兼容、性能打磨这也是AMD、寒武纪、昇腾等芯片硬件性能达标但生态追赶缓慢的根本原因。本次突破的意义AI编码Agent直接解决了新芯片生态起步最难的「底层算子适配阶段」原本数月的芯片软件适配前置工作10小时就能完成高性能适配大幅降低新架构AI芯片的生态入场成本众多国产芯片、非主流AI芯片厂商可以快速补齐软件短板。三、关键事实澄清并非10小时复刻完整CUDA全生态很多自媒体存在夸张误读真实边界10小时产出的是芯片底层驱动基础算子运行环境CUDA最核心的硬件调度层可以让芯片跑出接近满性能并没有复刻CUDA完整庞大生态上万算子库、编译工具、分布式集群方案、数十年社区沉淀、开发者工具套件完整CUDA生态依然需要长期积累本质是AI自动化内核开发工具可以快速给任意芯片搭建「可用的类CUDA运行底座」解决新芯片“没软件能用”的开局难题。四、各方现状与行业连锁反应1英伟达应对同样在用AI加速CUDA迭代英伟达官方回应自身早已大规模使用AI编码Agent开发、验证CUDA代码借助AI提升CUDA迭代速度与测试规模不会坐视壁垒被单方面突破。2国内厂商跟进路线DeepSeek开源TileLang编程语言TileKernels算子库靠可编程语言减少手写CUDA内核工作量降低算子开发门槛昇腾、壁仞等国产芯片厂商也在布局AI自动算子生成工具用来加速算子库补齐进度。3商业格局变化趋势芯片竞争正式进入「硬件性能 AI自动软件适配能力」双赛道未来芯片厂商比拼的不再只是算力还有能不能快速用AI补齐软件生态CUDA独家垄断格局会缓慢弱化多芯片生态共存的速度加快诞生全新商业模式专门用AI智能体为各类芯片做快速软件适配的第三方服务商。五、机遇与局限机遇国产AI芯片生态追赶周期大幅缩短不用再耗费数年组建庞大算子工程师团队个人、小团队也能低成本基于小众AI芯片部署大模型推理算子开发、底层驱动这类高薪底层岗位会出现部分自动化替代。局限成熟生态、上层框架适配、开发者习惯迁移依然需要数年时间CUDA短期内不会被彻底取代Ignition现阶段擅长推理场景内核开发大规模训练场景的分布式算子、集群调度优化仍高度依赖人工深耕AI生成内核在极端稳定性、超长时序训练场景的可靠性暂时不如资深工程师手写优化代码。六、总结10小时搭建类CUDA底座并没有颠覆CUDA但击穿了英伟达最外围的生态壁垒。过去新芯片想要活下去必须砸重金养几十上百人的底层软件团队现在依靠AI Agent初创芯片企业十几小时就能让芯片发挥九成算力极大降低AI芯片赛道的生态入场门槛会加速全球异构算力时代到来。如果你需要我可以补充昇腾、壁仞、AMD当前自动算子方案和Ignition的横向对比表格。四家厂商自动算子/类CUDA构建方案横向对比表对比维度Ignition(Infinity)、昇Ascend C自动算子、壁仞BRC AutoKernel、AMD ROCm自动生成方案整体总览对比项目Infinity Ignition华为昇腾 AutoKernel Ascend C壁仞科技 BRC AutoKernelAMD ROCm AutoGen核心定位通用AI智能体快速给任意芯片搭建类CUDA运行底座解决芯片开机可用问题专为昇腾架构打造补齐NPU算子库、补齐CANN生态壁自研GPU专属算子自动生成完善BRC生态完善ROCm生态实现CU代码一键迁移搭建完整底层运行底座耗时约10小时推理底座从零搭建基础运行环境7~15天从零搭建基础运行环境5~12天CU代码迁移适配完整底座3~7天擅长场景各类推理芯片、小众架构芯片快速适配快速榨干芯片硬件性能大模型训练推理全场景、分布式集群算子、CNN/Transformer算子优化通用训练推理、游戏GPUAI推理两用场景通用GPU训练推理CUDA工程无缝迁移实现原理大模型Agent闭环自动生成Kernel→部署测试→性能 Profiling→自动修bug迭代全程极少人工介入编译层模板生成昇腾算子库模板匹配AI微调优化内核人工配置调度规则基于ML模型预测最优分块策略自动生成PTX风格内核搭配人工优化模板CLANG编译转换AI优化重写CU代码自动转为ROCm可运行代码性能上限可达成芯片理论算力92%左右成熟算子可达理论算力95%~98%成熟算子可达理论算力93%~97%成熟算子可达理论算力94%~97%训练场景能力薄弱仅支持小规模推理不支持分布式训练算子生成极强原生支持多卡集群、大模型张量并行、流水线并行算子生成良好支持多卡训练但分布式生态完善度弱于昇腾优秀分布式训练生态成熟稳定性推理场景够用长时间训练易出现内存碎片、时序异常工业级稳定可用于千亿模型商用训练商用推理稳定超大模型长时间训练仍需人工调优工业级稳定适配绝大多数开源大模型训练任务适用芯片范围全架构通用英伟达、昇腾、壁仞、d-Matrix、各类小众推理芯片仅限昇腾910B/910C/310系列NPU仅限壁仞BR100/BR200系列GPU仅限AMD RDNA2/RDNA3架构GPU商业化模式对外接单为芯片厂商快速搭建类CUDA软件栈按项目收费内部自用为主对外开放算子生成工具链免费商用内部完善自身生态少量对外开放工具免费开源ROCm自动迁移工具拉拢CUDA开发者短板1. 无法生成完整cuDNN/cuBLAS庞大算子库2. 大规模训练稳定性不足3. 复杂通信算子必须人工编写1. 仅适配昇腾硬件无法用于别家芯片2. 陌生新架构适配依然需要人工配置规则1. 生态体量偏小社区算子数量不足2. 自动算子在超长时序训练优化一般1. 老旧CUDA特殊写法迁移容易出错2. 移动端、嵌入式芯片适配能力偏弱二、各自路线差异详解1. Infinity Ignition外来挑战者优势核心通用性无敌不管是什么架构的AI推理芯片只要给出芯片架构参数、寄存器规格就能在十几个小时内生成可用驱动与基础算子解决新芯片“有芯片没软件”的最大痛点。短板注定无法替代完整CUDA只能搞定「能用、跑出九成算力」的基础底座上万种经过二十年打磨的高性能专用算子、通信库、调试工具、框架适配层AI无法自动补齐依然需要长期人力沉淀。商业模式做异构算力生态的“脚手架”专门服务初创AI芯片公司。2. 华为昇腾方案国产闭环路线思路不对外做通用适配工具优先闭环完善自家CANN生态用AI自动算子降低内部算子团队开发压力。落地现状昇腾算子70%常规算子已经由AutoKernel自动生成复杂Transformer通信算子、超低精度FP8高性能算子由工程师手写精调兼顾开发速度与性能稳定性。优势契合国内需求国产算力集群、国产化大模型训练场景适配最好金融、政企国产化场景壁垒牢固。3. 壁仞科技国产通用GPU路线介于英伟达与昇腾之间GPU架构偏向通用计算自动算子工具主要用来快速补齐生态、追赶CUDA上层适配兼顾AI训练与通用渲染面向云厂商算力采购市场。4. AMD ROCm英伟达直接竞品不走从零搭建底座主打CUDA无缝搬家依靠代码迁移工具把存量CUDA项目直接转为ROCm可运行代码利用存量开发者生态追赶英伟达也是目前PC/消费级显卡跑大模型性价比最高的方案。三、落地阶段差距2026年现状生态成熟度排序ROCmAMD昇腾CANN壁仞BRC生态Ignition临时类CUDA底座新芯片生态起步速度排序Ignition AMD ROCm迁移方案 壁仞AutoKernel 昇腾适配新架构商用大规模训练可靠性昇腾 ≈ AMD 壁仞 Ignition四、行业推论Ignition这类工具只会缩短芯片生态冷启动周期没法复刻CUDA二十年积累的完整生态英伟达核心护城河依旧稳固国内昇腾、壁仞可以借助AI自动算子工具把原本35年的生态追赶周期压缩至12年未来分工将会明确Ignition类工具给小众新芯片完成冷启动昇腾/AMD/壁仞依靠自研自动算子工具持续完善自有完整生态英伟达用AI加速CUDA迭代维持领先。Infinity 类CUDA软件Ignition架构核心优势一、极致生态冷启动速度彻底打破新芯片适配周期瓶颈适配周期指数级压缩传统芯片厂商搭建可用类CUDA底座、编写基础推理算子需要专业算子团队耗时3~8个月Ignition依靠AI闭环自动化流程仅10小时即可完成芯片底层驱动、调度内核、基础算子环境部署10天内就能完整跑通主流大模型端到端推理流程解决新芯片“硬件成型、无软件可用”的致命冷启动难题。大幅降低芯片厂商人力成本无需组建数十人的专业底层内核工程师团队人类仅负责下达顶层需求、划定性能约束、管控安全边界算子编写、编译调试、性能 Profiling、BUG修复、迭代优化等海量枯燥底层工作全部交由AI智能体自动完成中小芯片初创企业也能补齐软件栈。二、全域硬件通用适配无架构绑定特性最大差异化优势跨架构兼容能力极强不受芯片架构限制既能适配英伟达GPU、AMD GPU、昇腾NPU、壁仞GPU也可适配脉动阵列推理芯片、移动端SRAM芯片、定制化专用AI芯片等各类自研私有架构甚至能解析封闭专有指令集完成适配而英伟达CUDA仅限自家GPU、昇腾AutoKernel仅适配昇腾NPU、ROCm只适配AMD显卡均为封闭绑定设计。一套推理库多硬件复用可打造通用推理运行库开发者编写一次模型推理代码就能部署在任意异构AI芯片上不用针对不同硬件反复改写内核降低异构算力集群部署成本。三、全自动闭环自优化能力硬件利用率上限很高全自动迭代闭环形成「内核生成→编译部署→正确性校验→性能打点剖析→自动重构优化内核」全自动闭环不间断迭代调优不需要工程师反复手动测参、调分块策略、优化内存排布。硬件算力释放效率优秀适配全新推理芯片时即可榨出芯片92%理论峰值算力成熟迭代后可逼近95%对标商用自研算子的性能水准实测针对通义千问3-8B推理任务经过1天自动优化后推理吞吐量相比vLLM原生框架提升34%。持续自适应优化芯片长期运行、业务负载变化时Agent可持续采集运行数据自动改写内核适配实时负载硬件利用率始终维持高位。四、商业模式轻量化降低入局门槛无前置高额授权费区别于CUDA商业授权收费模式Infinity主流方案采用性能分成模式免费为芯片厂商搭建类CUDA底座后续从芯片算力商用收益中抽取分成大幅减轻初创芯片公司前期资金压力。按需交付模块化软件栈芯片厂商不需要完整复刻全套CUDA生态可以按需只生成推理内核、调度器、编译器其中某一部分模块灵活补齐自身软件短板。五、快速追赶前沿模型适配跟上AI迭代节奏当下大模型架构迭代速度极快Transformer变体、MoE、新型稀疏模型层出不穷传统厂商人工开发算子往往滞后数周甚至数月Ignition可在一两天内为全新模型架构自动生成专属高性能内核让非主流芯片第一时间兼容最新开源大模型不再出现“新模型只能跑英伟达显卡”的局面。六、补齐小众推理芯片生态短板助推异构算力普及大量主打低功耗、高性价比的边缘推理芯片d-Matrix等硬件性能优秀但因无力搭建CUDA级软件生态无法商用这套工具可以快速补齐其软件短板让海量边缘国产推理芯片具备商用落地能力加速全球异构算力时代到来间接弱化英伟达独家生态垄断格局。补充对比CUDA、昇腾CANN的独有长处CUDA性能最强、生态最全但仅支持英伟达硬件、冷启动极慢、绑定生态闭环昇腾AutoKernel性能优秀、适配训练集群但仅限昇腾硬件无法对外适配其他芯片Infinity Ignition通用全芯片适配、极速冷启动短板仅为大规模分布式训练场景稳定性弱于成熟人工算子。结论先行这家做出「10小时搭建类CUDA」的InfinityIgnition智能体完全闭源、不对外开放源代码现阶段没有开源计划市面上也不存在可用开源版本。注意区分Github上名叫IgnitionAI、Infinity的开源项目均是无关产品并非这家芯片适配公司的技术。一、不开源的核心依据商业模式是商业私有化服务Infinity不靠卖软件授权盈利采用效果分成模式上门为芯片厂商私有化部署Ignition、适配芯片生成专属类CUDA栈后续根据芯片推理吞吐量提升带来的收益抽取分成核心引擎作为商业私有资产牢牢把控绝不会开源外泄内核生成逻辑。核心壁垒就是Agent闭环算法它最大竞争力是全自动生成Kernel、自动Profiling调优、闭环迭代的专属智能体逻辑一旦开源所有芯片厂商、巨头都能免费复刻这套冷启动方案公司独家壁垒直接消失。官方公开信息无开源表态2026年7月融资发布会、创始人采访里仅说明会持续对接芯片客户、拓展商用合作从未公布开源时间表、开源协议、开源组件计划。交付形态为私有化部署给d-Matrix等客户交付的是封闭二进制部署包只对外输出适配完成后的类CUDA运行环境不会交付Ignition本体源码、调度模型、内核生成规则。二、开源边界仅有极小部分配套能力对外开放仅开放极少上层配套工具核心引擎依旧闭源对外放出简易SDK接口芯片厂商可以提交芯片架构参数、下发适配任务但看不到Agent内部代码发布公开技术白皮书讲解原理架构用来做行业宣传不附带任何可运行源码开源部分测试基准脚本用来验证芯片推理性能不属于核心类CUDA构建模块。三、容易混淆的同名开源项目全部无关InfiniFlow / Infinity开源向量数据库和类CUDA、算子自动生成毫无关系IgnitionAI网页端Agent开发框架、RAG工具并非用于芯片内核开发的IgnitionInductive Automation Ignition工业组态软件名称重合而已。四、未来开源可能性判断短期12年绝不会开源。公司尚处于种子轮商业化阶段依靠独家技术拿下芯片客户开源等于放弃核心盈利手段长期远景大概率只会开源精简社区版仅支持通用GPU做学习测试阉割跨私有芯片适配能力、分布式训练能力商用完整版持续闭源收费。五、如果你想要实现同类能力的开源替代方案可以用现有开源工具组合复刻近似效果TileLangDeepSeek开源自动生成高性能GPU/昇腾算子TVM AutoTVM自动搜索最优内核调度策略OpenAI Function Calling 编译测试脚本自建简易闭环Agent实现「生成内核→编译测试→迭代优化」的简易流程。