问AI · 特斯拉如何用代理任务让端到端不再黑盒?
看过我们之前文章《特斯拉 CVPR 2026 演讲全文和详解:把自动驾驶,做成「所有机器人的基础模型」》的老粉,能从全貌上明白特斯拉FSD的总体逻辑。
但是,特斯拉FSD算法到底是怎么样的结构?FSD端到端到底怎么摆脱黑盒?怎么可解释?怎么可推理?特斯拉到底怎么看VLA的?特斯拉到底用了和需要多少算力来训练其模型?Ashok Elluswamy 在那个演讲中都没有透露。
不过,Vehicle 从 CVPR 2026 DriveX Workshop 里面找到了他们工程负责人Phil Duan (Tesla)名为Self-Driving at Scale with Foundation Models的演讲。这个演讲中我们找到以上问题的答案,Phil Duan毕竟是工程负责人,人家开发落地的,Ashok Elluswamy 估计领导当久了,宏观信息多点。
所以,本文对Phil Duan (Tesla)名为Self-Driving at Scale with Foundation Models的演讲结合其PPT给大家分享和科普以上答案。
端到端:一个函数
两大问题:算法黑盒和欺骗
一,维度诅咒(严重欠约束)
二,因果的相关(剔除伪相关)
怎么知道环境的输入和运动控制的因果?
针对这种物理AI的复杂度问题,特斯拉算法如何破解呢?
特斯拉算法核心解法:代理任务共训练(Multi-task Co-training)
帮助梯度流过网络。 2 个数字的梯度太稀疏,撑不起一个巨大的视觉编码器。但"这个像素属于哪个物体""这个点离你多远""这个牌子写了什么",这些任务提供的是每像素、每帧的稠密监督信号,梯度量级高出好几个数量级。 强迫模型形成正确的表征。 如果编码器的特征必须同时支持"预测 3D 占用"和"识别标志文字",它就不可能只学到"画面偏亮就直行"这种捷径——因为那种特征无法完成分割和 OCR 任务。代理任务是防止捷径学习的正则化器。 这是把"因果"注入模型的方式。 让模型能读出"左转绿箭头"(OCR + 标志理解),它才有可能建立"绿箭头,可以左转"的正确因果,而不是"背景有绿色,走"。
拆解了算法背后,那么接下来护城河是什么?
护城河:数据引擎
这套理论如何泛化和移植到机器人?
如何泛化:互联网数据与 Optimus 数据
如何保证安全:可验证奖励的强化学习
算力:30万卡
2021 中 – 2023 初接近于零 2023 下半年开始阶梯式抬升 2024 年中约 90,000 2025 全年约 100,000 – 120,000 2026 年 3 月 约 140,000 2026 年 6 月 约 280,000(垂直跃升)
总结:特斯拉算法
Ashok 讲的是特斯拉想去哪儿,Phil Duan 讲的是特斯拉怎么走到那儿。前者是叙事,后者是工程。对做行业内的人来说,后者更有用。
Phil Duan 这场演讲最反常识的地方在于:它把过去十年被行业抛弃的东西,又捡了回来。 感知、分割、检测、深度、光流、OCR——这些模块化时代的老任务,一个都没死。它们只是从"系统的骨架"变成了"训练的脚手架"。楼盖完了脚手架拆掉,但楼的形状是脚手架决定的。 这也是为什么"端到端 = 黑盒"这个流传最广的说法,其实是错的。FSD 内部有大量人类完全读得懂的中间表征,只是到了车上不再导出。不导出,不等于不存在。 最后留个问题给各位:如果代理任务才是端到端不塌的关键,那国内玩家和特斯拉的差距,到底是差在模型规模和算力,还是差在这十几个头选得对不对、训得齐不齐? 欢迎评论区聊聊。 最后的最后广告部分:
买书么?自动驾驶的,Vehicle联合机工社权威出版的,汽车行业高薪岗位,未来具身智能必备书籍 参考资料以及图片
CVPR 2026 Self-Driving at Scale with Foundation Models的演讲内容 - Phil Duan (Tesla),
买书么?自动驾驶的,Vehicle联合机工社权威出版的,汽车行业高薪岗位,未来具身智能必备书籍
CVPR 2026 Self-Driving at Scale with Foundation Models的演讲内容 - Phil Duan (Tesla),