马斯克承认纯视觉缺陷?特斯拉RoboTaxi被一只灰色小猫难住

2026.10.10 | 焜财商富 | 32693次围观
电子发烧友网报道(文/梁浩斌)激光雷达和纯视觉 自动驾驶的争议,直到今时今日还远未结束。

近日 特斯拉宣布在奥斯汀开放RoboTaxi,运营到晚上11点。在去年内测时,特斯拉RoboTaxi的运营时间是到晚上12点,今年8月特斯拉公布的运营时段为早上6点至晚上10点。

wKgZPGrImM-ARaEtAADjaW2JBlQ615.png

马斯克对于时间的调整,在社交平台上作出了补充,表示特斯拉正在试图解决确保在夜间能见度低时不会撞到宠物。尤其是“灰色小猫出现在灰色路面上”的这类低照度、低对比度场景,而这类,正是激光雷达最擅长的。

虽然有媒体解读成马斯克承认纯视觉的缺陷,但从马斯克在评论区里的回应来看,并没有这一层意思。不少网友表示,激光雷达才能解决这些问题,马斯克在回应网友对于使用热成像 传感器的建议时表示,当用到 AI进行光子计数分析时,目前使用的可见光谱相机在黑暗中也能看得非常清楚。

言下之意就是,虽然一些场景下目前的视觉方案无法分辨,但特斯拉已经有相应的解决方法了。

纯视觉的两道墙,特斯拉能翻过去吗?

马斯克举的“灰猫与灰色路面”例子,指向的是低照度、低对比度与小目标识别叠加的感知难题。摄像头接收的是物体反射的环境光;光线不足时,传感器获得的 信号变弱,噪声占比上升;当目标与背景颜色接近时,边缘和纹理线索也更少。

对自动驾驶来说,挑战不止是画面看起来够不够亮,还包括尽早发现目标、持续跟踪其运动,并为制动或绕行留出足够时间。

第一道墙是光子数量。相机相当于眼睛,它不会照亮任何东西,只能等环境里的光反射回来。这就像雨夜里用杯子接水,传感器上的像素是一只只小杯子,雨大时杯杯接满,雨小时只剩零星几滴。

按车载相机的典型参数估算,每勒克斯照度下,一只“杯子”每帧大约只接到12滴“雨”。而光子到达是随机的,12滴的涨落就有3到4滴,约合三成偏差,也就是说,光越暗,像素接收到的光子越少,读数就越不可信。 AI可以通过降噪、增强、跨帧融合和目标识别,改善传感器已经采集到的有限信息;但它不能保证补回未被采到的光信号,也无法消除眩光、遮挡、运动模糊等造成的信息损失。重建 算法还必须避免把模型推断出的合理细节误当成真实目标。

第二道墙是对比度。灰色小猫趴在灰色沥青上,反射率差别可能只有15%至20%,几乎看不出边界。而传感器判读目标靠的是“这里比周围亮多少”。单个像素的差别太小,噪声一来就盖过去了。

唯一的办法是把证据攒起来,不看单个像素,而看目标覆盖的那一整片,把读数平均起来,就像眯起眼、退后几步看远处的字,轮廓反而浮出来。但能攒多少证据,取决于对比度多低、目标占多少像素,对比度越低、目标越小,门槛越高。

所以,像夜间沥青路上的轮胎、小猫等这类小物体,对于夜间摄像头识别尤为困难。

那么马斯克提到的AI光子计数分析,能解决这个问题吗?

这里我们要知道一个前提,普通CMOS传感器是把光转成电荷后积分读出;而真正逐个探测光子的单光子成像,通常需要专门的SP AD阵列 探测器和读出架构。

按照目前公开的信息,特斯拉提高视觉感知能力的方法是跳过 ISP,把感光元件的原始线性Bayer 数据直接送入 神经网络,2026年1月公开的美国专利US 20260019717 A1描述了这一路径。

该专利要解决的问题是传感器输出的原始图像数据位数较高,但下游计算硬件的处理位宽较窄,直接处理可能丢失精度。专利描述的做法,是用卷积核把Bayer数据按颜色通道和高、低位拆分成若干部分,再由较窄位宽的计算单元分别处理,最后把结果组合起来。例如,以 8 位计算硬件处理12位图像数据时,尽量保留原始数据中的位精度。

不过,这与马斯克提到的光子计数分析,似乎关系不大。

因此,这次发言更准确的含义不是马斯克正式宣布放弃纯视觉,而是他同时承认了两件事:AI视觉可以继续优化,但夜间宠物避让仍是Robotaxi运营必须攻克的具体问题。

可以继续改进的方案包括提升传感器低照度与动态范围表现、优化弱光感知模型、增加针对小动物和突发横穿的训练与验证,并通过速度、服务区域和运营时段管理风险。至少目前看来,特斯拉还没有增加其他传感器的迹象。

Robotaxi路线之争,多传感器融合的规模化现实

与此同时,RoboTaxi行业主流仍是多传感器融合。

Waymo目前在美国已经投入约4000辆规模的 无人驾驶RoboTaxi,在15个美国城市24小时不间断运营,在规模上要远超特斯拉。

Waymo的第六代系统配备 13 颗摄像头、4 颗激光雷达与 6 颗 毫米波雷达。激光雷达主动发射激光脉冲并测量飞行时间,输出距离与三维形状,午夜与正午表现一致;毫米波雷达用无线电波并附加速信息,在雾、尘与眩光下继续工作。

今年8月,Waymo 联合CEO Dmitri Dolgov在演讲中也提到全黑街道上儿童追逐犬只的场景,当相机画面几乎不可用时,激光雷达点云清晰可辨。

中国玩家同样押注这条路线,比如小马智行第七代 Robotaxi 搭载 9 颗激光雷达、14 颗摄像头与 4 颗毫米波雷达,共34个传感器,BOM约28万元。

百度旗下萝卜快跑作为国内RoboTaxi领先玩家,今年一季度全无人出行服务已经达到320万次,目前已经在全球27座城市运营,尤其在珠三角地区,肉眼可见的高覆盖率。目前萝卜快跑的robotaxi方案采用12摄像头(8×800 万 +4×300万)+4激光雷达+6毫米波+12超声波的多传感器策略。

从行业的主流情况来看,多传感器融合仍是robotaxi的核心方案,能够更加适应复杂环境。

不过也有厂商跟进纯视觉方案,10月8日,小鹏正式将其RoboTaxi定名为小鹏悠游,上线打车小程序。其首款车型基于‌小鹏GX‌打造,搭载‌4 颗自研图灵 AI 芯片‌,车端有效算力达‌3000 TOPS‌,并采用纯视觉方案。

小结:

当然,纯视觉方案也有其逻辑闭环:激光雷达与雷达会带来成本、标定负担与自身失效模式,同时激光雷达在暴雨浓雾中的远距离性能下降,毫米波雷达角分辨率有限、存在多径鬼影。

特斯拉的赌注是,摄像头加算力的成本更低、更易随量产摊薄,剩余差距会随数据积累收敛。

但马斯克公开承认业绩见小目标避让仍是其运营难点,对于RoboTaxi来说,纯视觉方案仍需要更大规模的落地应用,来证明其安全性。