从"借用"到"定义":机器人视觉传感器的根本性错配问题

过去十年,机器人视觉系统几乎全部"借用"为消费电子和安防市场设计的图像传感器。无论是4:3的工业相机还是16:9的监控模组,其像素阵列的宽高比都是在为人眼视觉习惯或视频广播标准服务。当这些传感器被塞进机器人视觉系统时,一个被长期忽视的结构性错配问题便产生了:机器人的运动学和空间感知模型天然是各向同性的(isotropic),但输入给它的图像却是各向异性的(anisotropic)。

这意味着什么?一个在全向轮底盘上做V-SLAM的移动机器人,它向左平移100mm和向前平移100mm在运动学上完全等价,但传统4:3传感器给出的特征点分布却是:水平方向覆盖更宽的特征带,垂直方向覆盖更窄的特征带。这种不对等直接导致特征匹配的置信度在垂直方向上衰减更快,进而影响位姿估计的各向同性精度。

思特威(SmartSens)此次联合地瓜机器人推出的三款1:1方形全局快门CMOS图像传感器——SC450XS(1.2MP / 1080×1080)、SC550XS(1.5MP / 1440×1440)、SC830XS(4MP / 1944×1944)——从芯片定义阶段就针对这一根本性错配进行了重新设计。

1:1方形像元阵列的技术深层分析

像素利用率与计算效率

方形传感器的核心优势不仅是"看起来对称"。从信息论和计算的角度:

像素预算的各向同性分配

传统4:3传感器(如1920×1440 = 2.76MP)和1:1方形传感器(如1944×1944 = 3.78MP)在总像素量接近时,方形阵列在单位圆面积内的有效像素密度更高。对于基于特征点的V-SLAM算法(如ORB-SLAM3、VINS-Mono),特征点通常在图像的圆形ROI(Region of Interest)内提取。在4:3画幅中,圆形ROI外的像素被浪费;在1:1方形中,圆形ROI的面积占比从π/(4×(4/3))/(1+(4/3)²) ≈ 58.9%提升至π/4 ≈ 78.5%。

这意味着在相同的物理像素总量下,方形传感器可为SLAM提供约33%更多的有效特征点覆盖。

V-SLAM中的方形优势

V-SLAM的精度瓶颈往往不在算法本身,而在输入数据的质量。方形阵列在以下环节带来直接增益:

  1. 特征点分布均匀性:ORB特征提取器在网格化划分(grid-based)策略下,方形网格天然匹配方形像素阵列。4:3传感器需要非均匀网格才能补偿宽高比差异,增加了实现复杂度。

  2. 光流估计的各向同性精度:Lucas-Kanade光流法假设局部窗口内运动场恒定。方形传感器提供的方形patch使得梯度计算的Hessian矩阵条件数更优,减少了数值不稳定性。

  3. 深度图(Depth Map)的正则化:从双目或结构光获取的深度图在方形分辨率下更容易进行各向同性滤波和空洞填充,避免了4:3→1:1裁剪带来的边缘信息损失。

  4. 全景拼接效率:搭载多个摄像头的机器人进行全景或环视拼接时,方形传感器的重叠区域计算更简洁,鱼眼去畸变后的有效FOV利用率更高。

三款传感器的分辨率-帧率权衡

型号 分辨率 像素总量 帧率 单像素面积(推测) 典型应用
SC450XS 1080×1080 1.17MP 130fps 较大 高速避障、低延迟交互
SC550XS 1440×1440 2.07MP ~100fps 中等 V-SLAM主视觉、物体识别
SC830XS 1944×1944 3.78MP 80fps 适中 高精度抓取、精细操作

帧率范围80fps-130fps的设定并非随意。对于V-SLAM,系统需要至少60fps以上的输入才能在快速运动(>1m/s)时保持跟踪稳定性。130fps的SC450XS为高速移动场景(如物流AGV在仓库通道中的急停避障)提供了足够的运动模糊抑制和跟踪冗余。

全局快门vs卷帘快门:机器人场景的硬约束

卷帘快门的运动伪影

卷帘快门(Rolling Shutter)通过逐行(或逐组行)曝光来采集图像。当场景中存在快速运动时,不同行的曝光时刻不同,导致:

  • 果冻效应(Jello Effect):直线边缘在运动方向上弯曲
  • 运动模糊的方向依赖性:水平运动和垂直运动的模糊模式不同
  • 3D重建的系统性误差:卷帘快门的行间时间差在3D重建中引入额外的运动-结构耦合误差

对于机器人视觉,这些问题是致命的。考虑一个以2m/s速度平移的机器人,使用帧率为120fps的卷帘快门传感器,假设读出时间为10ms,那么首行和末行之间存在约20mm的位移差。这直接转化为V-SLAM位姿估计中的系统性偏差。

全局快门的必然性

全局快门(Global Shutter)的所有像素同时开始和结束曝光,彻底消除了行间时间差。在机器人场景中:

  1. V-SLAM的特征点一致性:全局快门保证所有特征点对应同一时刻的3D空间位置,消除了运动补偿的复杂性。

  2. 高速运动控制:在机械臂高速运动(>500mm/s的末端执行器速度)中,全局快门是视觉伺服(Visual Servoing)能够精确追踪目标位姿的前提。

  3. 结构光/ToF系统的同步:全局快门可以与主动光投射器精确同步,这是3D深度感知系统可靠工作的基础。

  4. 运动检测的精确性:帧间差分法(Frame Differencing)在全局快门下得到的是纯粹的运动信息,而非运动+读出伪影的混合。

全局快门的技术代价与思特威的工程解决

全局快门的经典代价包括:

  • 像素尺寸更大(需要额外的存储晶体管)
  • 满阱容量降低
  • 暗电流噪声更高

思特威此次产品声称具备"高感度、高动态范围、超高帧率、低噪声"的综合表现,这背后依赖于其在背照式(BSI)全局快门像素架构上的积累。采用BSI工艺后,全局快门晶体管层被移至光电二极管下方,减少了对光路的影响,使像素尺寸得以缩小,同时维持了较高的量子效率和信噪比。

CIS+VLA/VLM:端到端感知架构的硬件基座

传统视觉管线与端到端模型的分野

传统机器人视觉管线是模块化的:图像采集 → 去畸变 → 特征提取 → 匹配 → 位姿估计 → 路径规划 → 运动控制。每个模块都有独立的参数空间和优化目标。

端到端VLA(Vision-Language-Action)模型打破了这种模块化。以RT-2、OpenVLA为代表的方法将视觉输入直接映射为动作输出,中间的所有"理解"和"决策"过程都内化在一个统一的神经网络中。

这种范式转移对视觉传感器提出了全新的要求:

  1. 帧间一致性要求更高:VLA模型对输入时序的敏感性远超传统管线。任何帧间伪影(卷帘快门带来的)都会被模型学习为错误的运动-视觉关联。

  2. 动态范围要求更苛刻:端到端模型无法像传统管线那样通过自动曝光控制、HDR合成等后处理来补偿传感器动态范围的不足。传感器需要在单帧内覆盖更宽的照度范围。

  3. 数据格式适配:VLM/VLA模型通常接受方形输入(如ViT的224×224、336×336 patch)。方形传感器的输出天然匹配这些模型的输入尺寸,避免了4:3或16:9图像在预处理时的裁剪或形变。

思特威传感器在VLA管线中的位置

[方形全局快门CIS] → [MIPI CSI-2/ISP] → [地瓜S600 NPU]
      ↓                                    ↓
  1080×1080@130fps               VLA/VLM推理
  1944×1944@80fps               环境感知分割
                                    ↓
                              [运动控制输出]

方形传感器的输出经过最小化的预处理(去Bayer、缩放)后,直接进入NPU进行VLA推理。1:1的比例消除了resize时的纵横比形变,保持了空间度量的正交性。

地瓜S600:560 TOPS算力的分配拓扑

S600 SoC架构定位

地瓜旭日S600是一颗面向具身智能的端侧SoC,其560 TOPS的算力规模在端侧芯片中属于第一梯队。与通用GPU不同,S600的设计目标是单芯片承载完整的具身智能软件栈

  • VLA(Vision-Language-Action):视觉-语言-动作联合模型推理
  • VLM(Vision-Language Model):场景理解与语义分割
  • LLM(Large Language Model):任务规划与指令理解
  • 环境感知:SLAM、深度估计、目标检测
  • 运动控制:模型预测控制(MPC)、阻抗控制

560 TOPS的算力分配模型

假设S600的NPU支持稀疏计算(sparse computation),实际可用的有效算力远高于稠密计算能力。对于具身智能场景的典型算力分配:

任务模块 典型算力需求(TOPS) 频率 优先级
VLA推理 100-200 10-30Hz 最高(实时控制)
VLM场景理解 50-100 5-10Hz 高(语义决策)
V-SLAM 20-50 60-130Hz 高(定位基础)
深度估计/3D感知 30-80 30-60Hz 中高
LLM任务规划 50-100 1-5Hz 中(非实时)
运动控制MPC 10-30 100-1000Hz 最高
系统预留 50-100

关键洞察:思特威方形传感器提供的高帧率(80-130fps)输入直接对齐了SLAM和运动控制的高频需求,使S600的算力可以被充分利用而非被低帧率输入限制。

传感器-SoC的深度适配

"基于地瓜旭日S600平台深度适配"这一表述意味着什么?在工程层面:

  1. ISP管线联合调优:思特威的CIS传感器的RAW数据格式、噪声模型、暗电流特性被地瓜的ISP(Image Signal Processor)针对性优化,包括坏点校正、黑电平校准、去马赛克、降噪等环节的参数微调。

  2. MIPI CSI-2时序优化:高帧率、高分辨率的方形传感器对MIPI接口的带宽和时序提出了更高要求。深度适配包括对数据通道数、LP/HS模式切换、虚拟通道映射的联合优化。

  3. NPU预处理融合:部分传统上由ISP完成的后处理(如色彩空间转换、resize)可能被移入NPU的计算图中,以减少内存拷贝和延迟。

复杂光照环境:高感度与高动态范围的工程实现

机器人需要在室内灯光、户外强光、逆光、昏暗仓库等跨度极大的光照条件下工作。思特威传感器声称具备高感度和高动态范围(HDR),其技术路径可能包括:

  • 双增益像素(Dual Conversion Gain, DCG):每个像素支持高增益和低增益两种读出模式,高增益模式提升暗部信号,低增益模式保留高光细节。通过帧内或帧间HDR合成实现>100dB的动态范围。

  • 片上HDR合成:对于帧间HDR,全局快门使得长短曝光帧的切换更加精确可控,避免了卷帘快门在HDR合成时可能出现的运动鬼影。

  • 低噪声读出电路:全局快门传感器的读出噪声通常高于卷帘快门。思特威通过列级ADC(Column-level ADC)和相关双采样(CDS)来抑制固定模式噪声(FPN)和随机噪声。

具身智能感知架构的范式意义

思特威与地瓜机器人的合作不仅仅是"传感器+芯片"的简单组合。其范式意义在于:

  1. 从应用层适配到硬件层定义:以往的机器人视觉系统在硬件选型后通过软件适配来解决传感器特性带来的问题。此次合作从芯片定义阶段就面向机器人场景,将"方形+全局快门"作为第一性约束而非妥协。

  2. 端到端优化的硬件前提:VLA/VLM等端到端模型对输入数据的一致性和质量要求极高。方形全局快门传感器提供了从物理层到模型层的统一数据接口。

  3. 传感器-计算平台的垂直整合:CIS与S600的深度适配打破了传统"传感器厂商→模组厂→SoC厂商→机器人整机厂"的线性供应链,形成了面向具身智能的垂直整合能力。

这预示着机器人视觉传感器正在从"通用芯片的复用"走向"场景定义的专用硬件",而1:1方形全局快门CMOS可能是这一趋势中最具标志性的起点。