(来源:战投观察)
WAIC2026刚刚于7月20号正式结束!7月28日又迎来一场AI技术盛会!
——2026高工智能汽车全域AI技术峰会
将于明天在上海虹桥盛大举行,关注智能汽车领域AI技术发展的投资人,一同参会交流!
世界已经进入人工智能爆发式发展的时代!投资人也将随时代而进化!欢迎来自世界各地的AI投资人、AI企业圈朋友来组队建群!本群将是顶级AI投资人长期交流进击群!请先添加以下管理员微信,审核进群!

智驾AI技术脉络、物理AI(Momenta案例)
一、基础概念区分
1. 智能驾驶(智驾)
智驾是物理 AI 当前最成熟、最大规模落地场景。
传统 L2+/ 城市 NOA:感知 + 规则 + 模仿学习,AI 只能看见物体,识别车、人、车道;依靠海量案例拟合轨迹,面对极端长尾场景泛化弱。
演进路线:模块化方案 → 端到端大模型 → 世界模型驱动的物理 AI 智驾。
2. 通用 AI vs 物理 AI(核心差异)
通用大模型(LLM、多模态)
处理文字、图像等数字信息;不需要理解重力、惯性、碰撞、运动因果;输入输出都是信息,不直接操控实体硬件。
物理 AI(Physical AI)
AI 嵌入实体载体(车辆、机器人),依托传感器感知真实三维世界;理解物理规律、空间关系、物体交互因果;输出控制指令直接改变现实世界状态。
两大支柱:世界模型 + 强化学习。
LLM:预测下一个 token(数字世界)
物理 AI 世界模型:World State Prediction(预测物理世界未来状态)
简单概括:
传统智驾:看见路况,复刻人类驾驶行为(模仿学习)
物理 AI 智驾:看懂世界运行规律,预判未来,自主推演最优决策

二、智驾AI技术迭代脉络
自动驾驶 AI 历经四代范式迭代,物理 AI 是当前行业终局方向:
1.0 模块化规则驱动(2016 年前)
感知→预测→规划→控制拆分为独立模块;依靠人工编写规则、固定阈值;局限:长尾场景无法覆盖,城市复杂路况难以落地,仅支撑基础 ACC、AEB。
2.0 BEV 感知 + 模仿学习(2017–2022)
Transformer、BEV 环视普及,统一三维空间表征;采用行为克隆(模仿学习),学习人类驾驶员轨迹;高速 NOA 率先落地;痛点:只会 “复刻见过的场景”,遇到陌生障碍物、非常规博弈极易失效,泛化能力存在上限。
3.0 端到端大模型 + 强化学习(2022–2025)
传感器原始输入直接输出驾驶轨迹 / 控制量;引入强化学习,可在仿真环境自主试错;实现无图城市 NOA规模化上车;局限:模型依然优先拟合人类行为,缺少对物理世界因果理解,无法主动推演 “如果我变道,周边车辆如何响应”。
4.0 世界模型驱动 → 物理 AI 时代(2025 至今)
核心定义:Physical AI
AI 不再只是识别物体、模仿驾驶;而是学习重力、运动学、空间约束、物体交互因果,在模型内部构建虚拟世界沙盘,预测未来多步世界状态;
智驾只是物理 AI 第一个大规模商用试验场,长期底座可迁移至无人车、工业机器人、人形具身智能。
总结:智驾→物理 AI
传统感知融合方案
→ 端到端模仿学习大模型
→ 世界模型 + 强化学习 = 物理 AI 智驾
长远:自动驾驶作为物理 AI试验场,沉淀世界模型技术,后续外拓至人形机器人、工业移动机器人。
三、Momenta:从量产智驾走向物理 AI 平台
Momenta 自创立坚持「量产飞轮 + 双路线并行」战略:乘用车量产(现金 + 数据)+ 规模化无人驾驶(前沿技术验证)
阶段 1:模块化感知算法,搭建 CLA 闭环底座(2016–2019)
核心资产:CLA 闭环自动化工具链(Closed Loop Automation)
能力:车辆路测数据自动回流、自动筛选黄金样本、自动标注、模型训练、仿真验证;
战略目标:构建数据飞轮基础,区别于纯 L4 研发企业,优先打通量产落地通道。
阶段 2:BEV 感知 + 端到端模仿学习,规模化落地 L2+/ 城市 NOA(2020–2023)
面向主机厂提供软硬一体智驾方案,快速积累定点车型;
建立第三方城市 NOA 头部地位,持续积累量产车辆与真实道路里程;
矛盾显现:行业内卷加剧,单纯方案供应商增长存在天花板,需要底层架构升级。
阶段 3:R6 强化学习端到端模型(物理 AI 前置形态,2023–2026)
国内率先实现强化学习端到端量产上车;
相比纯模仿学习:允许 AI 在仿真环境自主探索驾驶策略,不局限人类样本;
定位:R7 世界模型的前置技术验证版本,支撑无图 NOA 大规模交付。
阶段 4:R7 世界模型 —— 物理 AI 量产落地里程碑(2026 年 4 月正式发布上车)

Momenta 与行业其他厂商最大差异:
多数企业将世界模型仅用作仿真测试工具;Momenta 把世界模型嵌入模型基座预训练流程,成为主模型原生组成部分。
R7 三层技术架构(物理 AI 完整框架)
1.世界模型预训练层
依托 120 亿 + 公里量产实车数据,预训练物理常识、物体运动规律、人车交互因果;模型建立原生三维世界认知。
2.世界模型仿真推演层
AI 内部生成未来数秒场景推演;自主预判横穿行人、溜动物、车辆加塞等动态目标行为,解决长尾 Corner Case。
3.世界模型内强化学习层
在高保真虚拟沙盘持续试错,优化长期安全决策,实现超越人类驾驶员的博弈、窄路会车、非常规障碍物处理能力。
技术路线总结:CLA 数据飞轮 → R6 强化学习端到端 → R7 世界模型(物理 AI 基座)
维度 | 传统智驾 AI | 物理 AI(Momenta R7 路线) |
|---|---|---|
核心逻辑 | 模仿人类驾驶员轨迹 | 理解物理规律,预测世界未来状态 |
训练方式 | 以模仿学习为主 | 模仿学习 + 世界模型预训练 + 强化学习仿真试错 |
应对长尾场景 | 依赖海量场景覆盖,未知场景容易失效 | 依靠因果推理,泛化能力更强 |
业务边界 | 局限乘用车驾驶 | 底座可复用至 Robotaxi、Robovan、远期具身智能 |


- 全球智能网联解决方案提供商 | 车联网软件生态服务