近日,自动驾驶企业文远知行WeRide发布了自研的物理AI认知基础大模型WeRide WITT(World Intelligence Toward Truth)。
“WITT”这个名字致敬了20世纪哲学家路德维希·维特根斯坦——他提出“世界是事实的总和”,这与物理AI的底层逻辑高度契合:AI要认知真实世界,必须从环境、行为、规则、风险与时序关系中提炼可信事实。
随着物理AI落地进程加速,自动驾驶成为首个可被大规模商业化验证的赛道,但痛点也集中显现:数据越来越多,但真正有训练价值、评测价值和迭代价值的数据,并不容易被高效识别;高价值长尾样本稀缺,L4实际运营与L2量产数据中混杂着人为接管、无效片段等噪声;通用大模型在理解复杂交通场景时,也容易产生幻觉与误判。
根据文远知行提供的资料,WITT的应对方式是引入“最小物理事实单元”概念,将连续变化的真实场景拆解为可被识别和验证的事实单元。
举例来说,一段夜间雨天城市道路行车的视频,会被WITT拆解为“自车右转、城市道路、交叉口、路口信号变化”等多个事实单元。每个事实单元都具备高置信、可校准、可追溯的特征。
在此基础上,WITT形成了四大核心能力:
事实提取:从标准驾驶事实、多主体交互事实和物理模糊条件三个维度识别最小物理事实单元。
事实推理:支持通过关键词或自然语言问题快速检索海量视频数据,精准定位“施工区域内行人突然横穿”等长尾场景。
事实验证:从弱势道路使用者、自车行为、他车行为、场景理解、事实完备性和交通设施六个维度评估模型输出,引入事实置信度反向验证;在自动驾驶垂类场景中,平均每片段事实错误率约为通用大模型的三分之一。
事实编排:按学习价值对事实视频智能分流,长尾场景回流至世界模型WeRide GENESIS用于仿真训练,高频日常场景用于强化学习。
工程效率上,相较于动辄百B级参数的通用大模型,WITT以更轻量的模型规模,在同类任务中可节省98%的Token成本,单卡单日可处理1万分钟车辆运行视频,最高实现200倍数据处理效率提升;标签模式下单次请求即可输出100余个动态标签。
在业内人士看来,WITT的发布,本质上是文远知行在“数据—算法—商业化”闭环效率上的一次押注——它试图回答一个核心问题:当车队规模从百辆级跃迁至千辆、万辆级时,如何用更低的算力成本处理指数级增长的数据?
但技术升级能否转化为可持续的商业模式,还要看两个变量:一是WITT带来的数据处理效率提升,能否实质性地压缩文远知行的研发与运营开支;二是L4车队的规模化扩张速度,能否跟上“2026年规模化落地元年”的行业预期。
中信建投等机构在研报中提示,2026年Robotaxi行业将迎来扩张潮,高盛将2026年中国Robotaxi车队规模预测上调至1.4万辆。在这个时间窗口里,谁先跑通“千辆级车队自我造血”的经济模型,谁就握住了下一轮竞争的主动权。