Night Office

CABINET  / Machines in Motion / 具身智能研究

传感器与感知硬件

2026-04 · 24.2k 字


具身智能系统的感知能力完全由传感器硬件决定。本文档系统梳理机器人系统中各类传感器的物理原理、工程指标、产品选型与标定方法。

1. 视觉传感器 (Vision Sensors)

1.1 RGB 相机基础

快门机制 (Shutter Mechanism)

全局快门 (Global Shutter) 与卷帘快门 (Rolling Shutter) 是两种根本不同的曝光方式。

全局快门:所有像素在同一时刻开始曝光、同一时刻结束曝光。传感器在曝光结束后将所有像素的电荷同时转移到存储节点,再逐行读出。这要求每个像素单元内集成额外的存储电容,导致像素填充因子 (fill factor) 降低,通常在 30%~60% 之间。

卷帘快门:逐行曝光,第 N 行开始曝光时,第 N-1 行可能仍在读出。行间延迟 (row delay) 通常为 10~30 μs。对于 1080p (1920×1080) 传感器,首行与末行的时间差为:

total_skew = row_delay × (num_rows - 1)
           = 20 μs × 1079
           ≈ 21.6 ms

在机器人快速运动场景中(末端执行器速度 > 1 m/s),21.6 ms 的时间偏差会产生显著的图像畸变,影响视觉里程计 (Visual Odometry) 精度。

参数全局快门卷帘快门
运动畸变有,与速度正相关
填充因子30%~60%70%~90%
暗电流噪声较高较低
成本高 (2~5x)
典型应用机器人视觉、工业检测手机、消费相机
代表芯片Sony IMX264 (GS)Sony IMX477 (RS)

Bayer 滤色阵列 (Bayer Filter Array)

CMOS 传感器的每个像素本身只能感知光强度,无法区分颜色。Bayer 滤色阵列在像素上方覆盖 R/G/B 滤色片,排列为 RGGB 模式(绿色像素数量是红色和蓝色的两倍,因为人眼对绿色最敏感)。

┌───┬───┬───┬───┬───┬───┐
│ R │ G │ R │ G │ R │ G │
├───┼───┼───┼───┼───┼───┤
│ G │ B │ G │ B │ G │ B │
├───┼───┼───┼───┼───┼───┤
│ R │ G │ R │ G │ R │ G │
├───┼───┼───┼───┼───┼───┤
│ G │ B │ G │ B │ G │ B │
└───┴───┴───┴───┴───┴───┘

去马赛克 (Demosaicing) 算法通过插值计算每个像素缺失的两个颜色通道。常见算法包括双线性插值、自适应色彩平面插值 (ACPI)、VNG (Variable Number of Gradients)。插值过程不可避免地引入伪色 (false color) 和拉链效应 (zipper artifact),在高频纹理区域尤为明显。

ISP 流水线 (Image Signal Processor Pipeline)

从原始传感器数据到可用 RGB 图像,需经过完整的 ISP 流水线:

Raw Bayer Data


Black Level Correction (减去暗电流基底)


Defect Pixel Correction (坏点修正)


Lens Shading Correction (镜头渐晕补偿)


White Balance Gain (白平衡增益,R/G/B 通道独立)


Demosaicing (去马赛克插值)


Color Correction Matrix (3×3 色彩校正矩阵)


Gamma Correction (gamma = 2.2 或 sRGB 曲线)


Noise Reduction (空域 + 时域降噪)


Sharpening (锐化,通常为 Unsharp Mask)


Output RGB Image

在机器人视觉中,ISP 的自动曝光 (AE)、自动白平衡 (AWB) 功能常被禁用或手动设定,以保证帧间一致性。许多视觉 SLAM 系统直接使用灰度图,跳过色彩处理。

1.2 工业相机 vs 消费相机

参数工业相机消费相机
快门全局快门为主卷帘快门为主
接口GigE Vision, USB3 Vision, CoaXPressMIPI CSI-2, USB
触发模式硬件触发(μs 级精度)软件触发
帧率控制精确可编程受限于 ISP
工作温度-20°C ~ +60°C0°C ~ +40°C
MTBF> 50,000 小时未标注
价格$500 ~ $5,000$10 ~ $100 (模组)

代表产品

品牌型号分辨率帧率快门接口价格
BasleracA1920-155uc1920×1200155 fpsGSUSB 3.0~$700
FLIR (Teledyne)BFS-U3-16S2C1440×1080226 fpsGSUSB 3.0~$600
Allied VisionAlvium 1800 U-500c2592×194452 fpsRSUSB 3.0~$400
BasleracA4112-30uc4096×300030 fpsRSUSB 3.0~$1,200

Sony IMX 系列传感器芯片(被广泛用于各类相机模组):

芯片分辨率像素尺寸快门典型应用
IMX47712.3 MP1.55 μmRSRaspberry Pi HQ Camera
IMX2645 MP3.45 μmGS工业检测
IMX5475.1 MP2.74 μmGS机器视觉
IMX6788 MP1.12 μmRS安防、无人机
IMX3348.3 MP2.0 μmRS车载环视

1.3 深度相机 (Depth Cameras)

结构光 (Structured Light)

工作原理:投射已知红外光斑图案 (pattern) 到场景中,用红外相机拍摄被物体表面调制后的图案,通过图案变形计算深度。Intel RealSense D435 使用伪随机红外散斑 (pseudo-random speckle) 配合双红外相机进行立体匹配。

IR Projector ──────── 已知图案投射 ──────── 场景

                                              │ 图案被表面调制

IR Camera(s) ──────── 捕获变形图案 ──────── 深度计算

Intel RealSense 系列规格

参数D435iD455D405
深度技术主动红外立体主动红外立体主动红外立体
深度分辨率1280×7201280×7201280×720
RGB 分辨率1920×10801920×1080
深度帧率最高 90 fps最高 90 fps最高 90 fps
工作距离0.1~10 m0.4~6 m (高精度)0.07~0.5 m
深度精度<2% @ 2m<2% @ 4m<2% @ 0.25m
基线50 mm95 mm18 mm
IMU有 (BMI055)有 (BMI055)
接口USB-C 3.1USB-C 3.1USB-C 3.1
价格~$300~$350~$250

D455 相比 D435i 基线增大至 95 mm,远距离深度精度显著提升。D405 为近距离(7~50 cm)高精度设计,适合机械臂抓取场景。

飞行时间 (Time-of-Flight, ToF)

工作原理分为两类:

连续波 ToF (Continuous-Wave ToF):发射调制红外光(频率通常为 20~100 MHz),测量反射光与发射光之间的相位差,换算距离:

d = (c × Δφ) / (4π × f_mod)

其中 c 为光速,Δφ 为相位差,f_mod 为调制频率。单频调制的最大无模糊距离 (unambiguous range):

d_max = c / (2 × f_mod)

例如,f_mod = 75 MHz 时,d_max = 2.0 m。多频调制可扩展范围。

直接 ToF (Direct ToF, dToF):发射短脉冲光,使用 SPAD (Single-Photon Avalanche Diode) 阵列检测单光子返回时刻,精度可达毫米级。Apple iPhone LiDAR Scanner 采用此方案。

产品类型分辨率帧率范围精度价格
Azure Kinect (DK)iToF1024×1024 / 512×51215/30 fps0.25~5.46 m±11 mm~$400
Sony IMX556 (Lucid Helios2)iToF640×48030 fps0.3~8.3 m±5 mm @ 1m~$2,000 (相机)
PMD flexx2iToF224×17260 fps0.1~4 m±10 mm~$500

ToF 相机的核心问题:多径干扰 (multipath interference),凹角、透明物体处深度值系统性偏差;飞点 (flying pixels),在深度不连续边缘产生错误中间值。

主动立体视觉 (Active Stereo)

结合结构光投影与双目立体匹配。投影红外纹理增强场景特征,使双目匹配在弱纹理区域(白墙、桌面)也能有效工作。Intel RealSense D400 系列实际上属于此类,而非纯结构光。

1.4 立体相机 (Stereo Cameras)

被动双目视觉通过两个固定基线的相机拍摄同一场景,利用视差 (disparity) 计算深度:

Z = (f × B) / d

Z 为深度,f 为焦距(像素),B 为基线长度(米),d 为视差(像素)。

深度精度与距离的平方成反比,与基线成正比:

ΔZ = Z² / (f × B) × Δd

Δd 为视差估计误差(通常 0.1~0.5 像素),这意味着 2 m 处的深度误差远大于 0.5 m 处。

Stereolabs ZED 2i 规格

参数规格值
分辨率2208×1242 (2K) / 1920×1080 / 1280×720 / 672×376
帧率15/30/60/100 fps (随分辨率递减)
基线120 mm
视场角110° (H) × 70° (V)
深度范围0.3~20 m
深度精度<1% @ 0.5~3 m
IMU有 (加速度计 + 陀螺仪)
接口USB 3.0
内置功能神经网络深度估计、位置追踪
IP 防护IP66
价格~$500

ZED 2i 内置 NVIDIA Jetson 可直接运行的深度学习模型,在弱纹理区域通过学习型补全提升深度图质量。

1.5 事件相机 (Event Cameras)

事件相机与传统帧相机的根本区别:传统相机以固定帧率同步采集所有像素亮度值;事件相机中每个像素独立异步工作,仅当该像素检测到对数亮度变化超过阈值 C 时输出一个事件:

当 |log(I(x,y,t)) - log(I(x,y,t_last))| > C 时,输出事件 (x, y, t, p)

其中 p ∈ {+1, -1} 表示亮度增加或减少,t 为微秒级时间戳。

核心特性

特性事件相机传统帧相机
时间分辨率1~10 μs1033 ms (30100 fps)
动态范围120~140+ dB60~70 dB
输出带宽场景相关(稀疏)固定(全帧)
运动模糊
功耗10~50 mW500 mW~2 W
冗余数据极少大量(静态区域)

代表产品

产品分辨率时间分辨率动态范围接口价格
iniVation DAVIS346346×2601 μs120 dBUSB 3.0~$5,000
Prophesee EVK4 HD1280×7201 μs>120 dBUSB 3.0~$4,000
CelePixel CeleX-V1280×8001 μs120 dBUSB 3.0~$3,000
Samsung DVS Gen4640×480<1 μs140 dBMIPI研发中

DAVIS346 (Dynamic and Active-pixel Vision Sensor) 同时集成事件像素和传统帧像素,允许同步输出事件流和灰度帧,方便算法开发与调试。

机器人应用场景:高速抓取(需要 μs 级反应)、无人机在明暗交替环境(隧道出入口、室内外过渡)中的 SLAM、高动态场景下的视觉伺服。

当前限制:分辨率偏低,算法生态不成熟(大部分视觉算法基于帧设计),成本高,量产规模小。

2. LiDAR(激光雷达)

2.1 机械旋转式 (Mechanical Spinning)

工作原理:激光发射/接收模组安装在旋转电机上,以 10~20 Hz 速度 360° 旋转扫描。每个激光通道 (channel) 以固定垂直角度发射,多通道叠加形成三维点云。

                旋转轴

          ┌───────┼───────┐
          │  ┌────┼────┐  │
          │  │ TX │ RX │  │
          │  │ TX │ RX │  │  ← 多个通道(16/32/64/128 线)
          │  │ TX │ RX │  │
          │  │ TX │ RX │  │
          │  └────┼────┘  │
          └───────┼───────┘

            旋转电机 (10~20 Hz)

测距方法为 dToF:发射 905 nm 或 1550 nm 短脉冲,SPAD 或 APD (Avalanche Photodiode) 检测返回脉冲,测量飞行时间。

代表产品

品牌型号线数范围精度点频帧率FOV价格
OusterOS1-128128120 m±1~3 cm5.2M pts/s10/20 Hz360°×45°~$8,000
OusterOS0-12812850 m±1~5 cm5.2M pts/s10/20 Hz360°×90°~$8,000
VelodyneVLP-16 (Puck)16100 m±3 cm300K pts/s5~20 Hz360°×30°~$4,000
VelodyneAlpha Prime128245 m±3 cm4.8M pts/s10/20 Hz360°×40°~$75,000
HesaiPandar128128200 m±1 cm6.9M pts/s10/20 Hz360°×40°~$30,000

机械旋转式的优势:360° 全视角、成熟的测距精度。劣势:旋转机构寿命有限、体积大(直径 85~120 mm)、成本高、抗震性差。

2.2 固态式 (Solid-State)

无旋转机构,通过 MEMS 微镜、OPA (Optical Phased Array) 或闪光 (Flash) 方式实现扫描。

MEMS 微镜方案:微型反射镜在两轴方向快速摆动,将激光束引导至不同方向。Livox 采用独特的”非重复扫描” (non-repetitive scan) 模式,积分时间越长覆盖密度越高。

Livox 花瓣形扫描模式(0.1s 内):

    ╭─────╮
   ╱ • • • ╲
  │ •     • │
  │•   ╳   •│  ← 中心密度高
  │ •     • │
   ╲ • • • ╱
    ╰─────╯

积分 1s 后覆盖率 > 99%

Flash LiDAR:一次发射覆盖整个 FOV(类似相机闪光灯),使用 SPAD 阵列接收。优点为无运动部件、帧率高;缺点为范围受限(发射功率分散)。

品牌型号技术范围精度点频FOV价格
LivoxMid-360MEMS+旋转棱镜70 m±2 cm200K pts/s360°×59°~$1,000
LivoxHAPMEMS150 m±2 cm450K pts/s120°×25°~$1,500
HesaiFT120Flash30 m±3 cm192K pts/frame100°×75°~$500
Intel RealSense L515iToF LiDAR70 m±5 mm@1m23M pts/s70°×55°已停产

2.3 FMCW LiDAR (频率调制连续波)

传统 ToF LiDAR 测量脉冲往返时间;FMCW LiDAR 发射线性调频连续波,将返回光与本振光进行相干混频,通过拍频 (beat frequency) 同时获取距离和径向速度(多普勒效应)。

发射频率

    │    ╱╲    ╱╲    ╱╲
    │   ╱  ╲  ╱  ╲  ╱  ╲   ← 发射信号(线性调频)
    │  ╱    ╲╱    ╲╱    ╲
    │ ╱
    │╱    返回信号(延迟 Δt)
    │  ╱╲    ╱╲    ╱╲
    │ ╱  ╲  ╱  ╲  ╱  ╲
    │╱    ╲╱    ╲╱    ╲
    └──────────────────────► 时间

拍频 f_beat = (B/T) × Δt
距离 R = (c × f_beat × T) / (2B)
速度 v = (Δf_doppler × λ) / 2

B 为调频带宽,T 为调频周期,λ 为激光波长。

FMCW 优势:

  • 同时获得距离 + 速度(传统 dToF 只有距离)
  • 相干检测灵敏度极高,远距离性能好
  • 不受环境光干扰
  • 可用 1550 nm 波长(人眼安全,允许更大功率)

代表产品

品牌型号范围精度速度测量价格
AevaAeries II500 m±2 cm有 (0.01 m/s 精度)未公开 (量产目标 <$500)
SiLCEyeonic Vision200 m±1 cm开发中

2.4 机器人 vs 自动驾驶 LiDAR 需求对比

需求维度机器人(室内/近距)自动驾驶(室外/远距)
范围需求0.1~15 m10~300 m
精度需求±1~5 mm±1~5 cm
FOV 需求宽视场 (>90° vertical)远距窄 + 近距宽
尺寸约束严格 (<50 mm)相对宽松
抗震性高 (关节振动)中等
成本预算$200~$2,000$500~$5,000 (量产目标)
代表选型Livox Mid-360, Hesai FT120Hesai AT128, Aeva Aeries II

3. 惯性测量单元 (IMU)

3.1 物理原理

MEMS 加速度计:质量块通过弹性梁悬挂于固定结构上。当受到加速度时,惯性力使质量块相对框架位移,位移通过电容变化检测:

        固定极板
        ────────
        ┃      ┃
   ┌────┨  d₀  ┠────┐
   │    ┃      ┃    │
   │    ────────    │
   │    ┃      ┃    │  ← 弹性梁
   │    ┃ 质量 ┃    │
   │    ┃  块  ┃    │
   │    ┃      ┃    │
   └────┨  d₀  ┠────┘
        ┃      ┃
        ────────
        固定极板

加速度 a 作用时:
ΔC = ε₀ × A × (1/(d₀-Δx) - 1/(d₀+Δx))
Δx = m × a / k (弹性恢复力平衡)

MEMS 陀螺仪:利用科里奥利力 (Coriolis effect)。振动质量块以已知频率驱动振动,当存在角速度时,科里奥利力在垂直于驱动方向和旋转轴的方向产生位移:

F_coriolis = -2m(ω × v_drive)

通过检测感测方向的位移(电容变化)测量角速度 ω。

3.2 噪声模型 (Allan Variance)

IMU 噪声通过 Allan 方差 (Allan Variance) 分析。在双对数坐标下,不同噪声源表现为不同斜率的直线段:

log(σ²(τ))

    │╲
    │  ╲  斜率 = -1: 角度/速度随机游走 (ARW/VRW)
    │    ╲
    │      ────── 斜率 = 0: 偏置不稳定性 (Bias Instability)
    │            ╱
    │          ╱  斜率 = +1: 速率随机游走
    │        ╱
    └────────────────────── log(τ)
         τ_min (Bias Instability)

关键噪声参数

噪声类型符号单位 (陀螺仪)单位 (加速度计)物理含义
角度随机游走 / 速度随机游走ARW / VRW°/√hm/s/√h白噪声积分后的扩散速率
偏置不稳定性BI°/hμg缓慢漂移的长时间稳定性下限
偏置重复性BR°/hmg开机间偏置变化
标度因子误差SFppmppm测量值与真值的比例偏差

3.3 IMU 等级对比

参数消费级 (MPU-6050)战术级 (ADIS16490)导航级 (FOG)
ARW0.3 °/√h0.06 °/√h0.001 °/√h
Bias Instability (Gyro)20 °/h1.8 °/h0.003 °/h
VRW0.06 m/s/√h0.017 m/s/√h0.003 m/s/√h
Bias Instability (Accel)500 μg32 μg1 μg
采样率1 kHz4 kHz1~10 kHz
价格$5$2,500$10,000~$100,000
尺寸4×4×0.9 mm47×44×14 mm拳头大小
适用场景手机、玩具无人机、机器人潜艇、导弹

机器人系统常用选型

芯片等级ARWBias Instability价格应用
BMI088 (Bosch)工业0.2 °/√h8 °/h~$10无人机飞控
ICM-42688 (TDK)消费+0.18 °/√h6 °/h~$5机器人 VIO
ADIS16475 (ADI)工业0.084 °/√h2 °/h~$300精密导航
ADIS16490 (ADI)战术0.06 °/√h1.8 °/h~$2,500军用/高精度

3.4 IMU 在传感器融合中的角色

IMU 提供高频(2004000 Hz)的短时运动估计,弥补视觉/LiDAR 的低帧率(1560 Hz)间隔。在视觉惯性里程计 (VIO) 中:

  • IMU 在两个图像帧之间进行运动预积分 (preintegration)
  • 视觉提供低频但全局一致的位姿修正
  • 紧耦合 (tightly-coupled) 方案在同一优化问题中联合估计 IMU 偏置和视觉特征

IMU 单独积分定位的漂移速度:位置误差以 O(t²) 增长(加速度计偏置被双重积分),角度误差以 O(t) 增长。消费级 MEMS IMU 单独积分 10 秒后位置误差可达数米,因此必须与其他传感器融合。

4. 力/力矩传感器 (Force/Torque Sensors)

4.1 六轴力/力矩传感器工作原理

六轴 F/T (Force/Torque) 传感器同时测量三维力 (Fx, Fy, Fz) 和三维力矩 (Mx, My, Mz)。核心感测元件为应变片 (strain gauge) 组成的惠斯通电桥 (Wheatstone bridge)。

传感器结构截面:

     外部法兰(连接工具/末端执行器)
    ╔════════════════════════╗
    ║                        ║
    ║   弹性体 (flexure)     ║  ← 应变片贴附于此
    ║   ┌──┐  ┌──┐  ┌──┐   ║
    ║   │  │  │  │  │  │   ║  ← 多个弹性梁
    ║   └──┘  └──┘  └──┘   ║
    ║                        ║
    ╚════════════════════════╝
     内部法兰(连接机器人末端)

当力/力矩作用于外部法兰时,弹性体产生微小形变(μm 级),应变片电阻随形变变化:

ΔR/R = GF × ε

GF 为应变系数 (Gauge Factor,金属约 2,半导体约 100~200),ε 为应变量。

六个分量通过多个应变片的组合和标定矩阵 (calibration matrix) 解耦:

[Fx]       [C11 C12 ... C16] [V1]
[Fy]       [C21 C22 ... C26] [V2]
[Fz]   =   [C31 C32 ... C36] [V3]
[Mx]       [C41 C42 ... C46] [V4]
[My]       [C51 C52 ... C56] [V5]
[Mz]       [C61 C62 ... C66] [V6]

其中 V1~V6 为各电桥的电压输出,C 为 6×6 标定矩阵。

4.2 代表产品规格

ATI Industrial Automation(市场主导者):

型号力量程 (Fx/Fy)力量程 (Fz)力矩量程分辨率 (力)分辨率 (力矩)采样率价格
Mini45±580 N±1160 N±20 Nm0.125 N0.004 Nm7 kHz~$5,000
Nano17±25 N±35 N±0.25 Nm0.003 N0.015 Nmm7 kHz~$5,000
Axia80±200 N±600 N±10 Nm0.05 N0.005 Nm8 kHz~$4,000
Gamma±65 N±200 N±5 Nm0.0125 N0.001 Nm7 kHz~$6,000

OnRobot HEX 系列(协作机器人集成):

型号力量程力矩量程特点价格
HEX-E±200 N (Fz: 500 N)±10 Nm6 自由度~$3,500
HEX-H±600 N (Fz: 1500 N)±40 Nm重载版~$4,000

4.3 关节力矩传感器 (Joint Torque Sensors)

区别于末端 F/T 传感器,关节力矩传感器安装在每个关节内部(减速器输出端),测量单轴力矩。

Franka Emika Panda 的设计:每个关节内置应变式力矩传感器,7 个关节共 7 个力矩测量通道,采样率 1 kHz。这使得 Panda 无需末端 F/T 传感器即可实现:

  • 全身碰撞检测(力矩突变 > 阈值时紧急停止)
  • 关节级阻抗控制 (impedance control)
  • 重力补偿(精确测量每个关节的实际力矩并与模型对比)
  • 外力估计(通过全身动力学模型反推末端接触力)

力矩分辨率:约 0.05 Nm。力矩范围:根据关节不同,12~87 Nm。

4.4 力传感与阻抗控制

力传感是实现阻抗控制 (Impedance Control) 的硬件基础。阻抗控制将机器人末端建模为弹簧阻尼系统:

F_ext = M × ẍ + D × ẋ + K × (x - x_d)

M 为期望惯量矩阵,D 为期望阻尼矩阵,K 为期望刚度矩阵,x_d 为期望位置。

无力传感时,机器人只能做位置控制,接触刚性环境时力会瞬间上升导致碰撞。有力传感时,控制器可实时调整位置轨迹以维持期望的力/位移关系,实现安全的物理交互(擦桌子、插拔、装配)。

力传感器的带宽和噪声直接决定阻抗控制的性能上限。1 kHz 以上的采样率和 0.01 N 级别的力分辨率是实现精细接触操控的基本要求。

5. 触觉传感器 (Tactile Sensors)

5.1 电阻式/电容式阵列

电阻式 (Piezoresistive):压敏材料(导电橡胶、导电织物)在受压时电阻降低。简单、成本低,但非线性严重、迟滞 (hysteresis) 大(20%~40%)、温度漂移明显。

电容式 (Capacitive):两个导电层之间夹柔性介电层,受压时极板间距减小,电容增大:

C = ε₀ × εᵣ × A / d

压缩时 d 减小,C 增大。优点为线性好、迟滞小 (<5%);缺点为对电磁干扰敏感、布线复杂。

类型空间分辨率力分辨率量程迟滞成本/单元
电阻式 (FSR 阵列)2~5 mm0.1 N0~100 N20~40%$1~5
电容式 (MEMS)0.5~2 mm0.01 N0~10 N<5%$10~50
压电式1~3 mm0.001 N动态 onlyN/A$20~100

5.2 光学触觉传感器 (Optical Tactile Sensors)

GelSight 工作原理

GelSight 由 MIT 的 Edward Adelson 团队于 2009 年提出,其核心结构:

┌─────────────────────────────────┐
│         弹性体 (Elastomer)       │ ← 透明硅胶,表面涂反射涂层
│    ╔═══════════════════════╗    │
│    ║  反射涂层 (Reflective  ║    │ ← 接触面(朝外)
│    ║      Coating)         ║    │
│    ╚═══════════════════════╝    │
│                                 │
│    LED (R) LED (G) LED (B)      │ ← 多方向多色 LED
│         ●     ●     ●          │
│                                 │
│         ┌───────────┐           │
│         │  Camera   │           │ ← 内部 RGB 相机
│         └───────────┘           │
└─────────────────────────────────┘

工作流程:

  1. 物体接触弹性体表面时,使弹性体内表面产生局部形变
  2. 多方向 RGB LED 照亮形变后的反射涂层
  3. 内部相机拍摄涂层图像
  4. 通过光度立体法 (Photometric Stereo) 从多色照明重建表面法向量场
  5. 法向量积分得到高精度三维形状

GelSight 的测量能力

  • 空间分辨率:25~50 μm(由相机分辨率和光学系统决定)
  • 深度分辨率:1~2 μm
  • 可测量:接触面三维形状、法向量场、剪切力场、滑移检测

DIGIT (Meta/Facebook AI Research)

DIGIT 是 GelSight 原理的工程化实现,由 Meta FAIR 于 2020 年开源:

参数DIGITGelSight Mini
尺寸20×27×33 mm25×25×28 mm
分辨率640×480320×240~640×480
帧率60 fps30~60 fps
接口USB 2.0USB
弹性体定制硅胶定制硅胶
开源是(硬件 + 软件)部分
价格~$15 (DIY) / ~$300 (商用)~$400
耐久性弹性体寿命约 10,000~50,000 次接触类似

BioTac (SynTouch)

BioTac 模拟人指尖结构:

┌─────────────────────────┐
│     柔性皮肤层            │ ← 弹性外壳 + 指纹状脊纹
│  ┌─────────────────┐    │
│  │  导电液体        │    │ ← 模拟皮下组织
│  │  ┌───────────┐  │    │
│  │  │ 电极阵列   │  │    │ ← 19 个阻抗电极
│  │  │ + 温度     │  │    │
│  │  │ + 压力     │  │    │
│  │  └───────────┘  │    │
│  └─────────────────┘    │
└─────────────────────────┘

测量维度:

  • 19 通道阻抗(空间压力分布)
  • 1 通道液压(总法向力,0~30 N)
  • 1 通道温度(热导率区分材质)
  • 可检测振动到 1 kHz(滑移检测)
参数规格
空间分辨率~2 mm (19 电极)
力分辨率0.01 N
力量程0~30 N
温度分辨率0.003 °C
采样率100 Hz (全通道) / 2.2 kHz (压力+温度)
价格~$16,000

FingerVision

FingerVision 通过透明弹性体 + 外部相机实现视触觉融合:相机同时观察接触面形变和透过弹性体看到的物体视觉信息。

5.3 触觉传感的当前困境

触觉传感是人形机器人感知系统中最薄弱的环节,原因如下:

挑战现状需求目标
空间分辨率15 mm (电子式), 2550 μm (光学式)人指尖: ~1 mm, 40+ 感受器/cm²
覆盖面积指尖局部全手掌、全身(人体 ~1.7 m² 皮肤)
耐久性弹性体 10K~50K 次接触后磨损百万次级别
成本$300~$16,000/指尖$10/指尖 (规模化目标)
多模态力 OR 形状 OR 温度同时测量力+形状+温度+振动
柔性布线刚性 PCB 为主柔性电子、织物传感器
标准化无通用接口类似相机的标准化协议

人手指尖拥有约 2,500 个触觉感受器(Merkel 细胞、Meissner 小体、Pacini 小体、Ruffini 末梢),两点辨别阈值约 1~2 mm,力分辨率约 0.01 N。当前最好的人工触觉传感器在综合指标上仍与人手有数量级差距。

6. 本体感知 (Proprioception)

6.1 关节编码器 (Joint Encoders)

编码器测量关节旋转角度,分为增量式 (Incremental) 和绝对式 (Absolute)。

增量式编码器:输出脉冲序列(A/B 相正交信号),通过计数脉冲数确定相对位移。需要上电归零 (homing)。

A 相: ┌──┐  ┌──┐  ┌──┐  ┌──┐
      │  │  │  │  │  │  │  │
   ───┘  └──┘  └──┘  └──┘  └───

B 相:    ┌──┐  ┌──┐  ┌──┐  ┌──┐
         │  │  │  │  │  │  │  │
   ──────┘  └──┘  └──┘  └──┘  └─

正转:A 领先 B 90°
反转:B 领先 A 90°
4x 解码:每周期计数 4 (上升沿 + 下降沿 × 2 通道)

绝对式编码器:输出当前绝对角度值,无需归零。实现方式:光学码盘 (Gray code)、磁编码器 (磁铁 + 霍尔阵列/AMR)。

类型分辨率精度优点缺点代表产品
增量式光学10,000~100,000 CPR±1~5 arc-sec高分辨率、高速需归零、怕灰尘Renishaw ATOM
绝对式光学17~23 bit (单圈)±5~20 arc-sec无需归零、高精度成本高Renishaw RESOLUTE
绝对式磁性12~14 bit±0.05~0.1°紧凑、耐脏精度较低AS5047P (ams)
绝对式磁性17~19 bit±0.02°紧凑、高精度温漂需补偿AS5147U (ams)

机器人中的典型配置

协作机器人通常在减速器两端各安装一个编码器:

  • 电机侧 (Motor-side):高分辨率增量编码器(10,000+ CPR),用于电机换相和速度环控制
  • 关节输出侧 (Link-side):绝对式编码器(17+ bit),用于实际关节角度测量

两个编码器的差值可以推算减速器柔性形变和关节力矩(替代力矩传感器的低成本方案)。

6.2 电机电流感测力矩估计

通过测量电机驱动电流估算输出力矩:

τ_motor = K_t × I_motor
τ_joint = τ_motor × N_gear × η_gear

K_t 为电机力矩常数 (Nm/A),N_gear 为减速比,η_gear 为传动效率。

优点:不需额外力矩传感器,成本极低。 缺点:受摩擦力影响大(静摩擦、粘滞摩擦、库仑摩擦),估计精度通常为实际力矩的 10%~30%;无法检测外部碰撞的高频分量;减速器回程差 (backlash) 导致力矩传递非线性。

电流测量通常通过分流电阻 (shunt resistor) 或霍尔电流传感器实现,采样率与 PWM 频率同步(10~50 kHz)。

6.3 MCU 集成与控制频率

本体感知数据由嵌入式微控制器 (MCU) 实时采集与处理:

控制层频率处理内容典型硬件
电流环 (Current Loop)10~50 kHz电机换相、电流 PI 控制STM32G4, TMS320F28x
速度环 (Velocity Loop)1~10 kHz速度 PID、编码器解码同上
位置/力矩环1 kHz关节位置控制、力矩控制STM32H7, RT1050
运动规划层100~500 Hz逆运动学、轨迹插值ARM Cortex-A (Linux)

关节级 MCU 通过实时总线(EtherCAT、CAN-FD)与中央控制器通信,延迟 < 1 ms。EtherCAT 总线支持 1 kHz 以上的确定性通信周期,是当前高性能机器人的主流选择。

7. 传感器标定 (Sensor Calibration)

7.1 相机内参标定 (Intrinsic Calibration)

针孔模型 (Pinhole Model)

三维点 P = (X, Y, Z) 在图像平面的投影:

┌ u ┐       ┌ fx  0  cx ┐ ┌ X/Z ┐
│ v │   =   │  0  fy cy │ │ Y/Z │
└ 1 ┘       └  0   0  1 ┘ └  1  ┘

fx, fy 为焦距(像素单位),(cx, cy) 为主点 (principal point)。

畸变模型 (Distortion Model)

径向畸变 (Radial Distortion)

x_distorted = x(1 + k1*r² + k2*r⁴ + k3*r⁶)
y_distorted = y(1 + k1*r² + k2*r⁴ + k3*r⁶)

r² = x² + y²,(x,y) 为归一化坐标。

切向畸变 (Tangential Distortion)

x_distorted += 2*p1*x*y + p2*(r² + 2*x²)
y_distorted += p1*(r² + 2*y²) + 2*p2*x*y

完整畸变参数向量:[k1, k2, p1, p2, k3](OpenCV 5 参数模型)。高阶模型可扩展至 8 或 12 参数。

标定流程 (OpenCV)

import cv2
import numpy as np

# 准备棋盘格角点坐标 (世界坐标系, z=0)
objp = np.zeros((rows*cols, 3), np.float32)
objp[:, :2] = np.mgrid[0:cols, 0:rows].T.reshape(-1, 2) * square_size

obj_points = []  # 世界坐标
img_points = []  # 图像坐标

for image in calibration_images:
    gray = cv2.cvtColor(image, cv2.COLOR_BGR2GRAY)
    ret, corners = cv2.findChessboardCorners(gray, (cols, rows), None)
    if ret:
        # 亚像素级精细化
        corners = cv2.cornerSubPix(gray, corners, (11,11), (-1,-1),
                    (cv2.TERM_CRITERIA_EPS + cv2.TERM_CRITERIA_MAX_ITER, 30, 0.001))
        obj_points.append(objp)
        img_points.append(corners)

# 标定
ret, K, dist, rvecs, tvecs = cv2.calibrateCamera(
    obj_points, img_points, gray.shape[::-1], None, None)

# K = [[fx, 0, cx], [0, fy, cy], [0, 0, 1]]
# dist = [k1, k2, p1, p2, k3]

重投影误差 (Reprojection Error) < 0.5 像素表示标定质量良好。

7.2 手眼标定 (Hand-Eye Calibration)

确定相机坐标系与机器人末端执行器坐标系之间的固定变换关系。分为两种安装方式:

Eye-in-Hand(相机安装在末端):

A_i × X = X × B_i

A_i: 机器人末端从位姿 i 到位姿 j 的相对变换 (已知, 从关节编码器计算)
B_i: 相机从位姿 i 到位姿 j 的相对变换 (已知, 从标定板检测计算)
X:   相机到末端的固定变换 (待求)

Eye-to-Hand(相机固定在外部):

A_i × X = X × B_i (公式形式相同, 但 A 和 B 的含义不同)

经典求解方法:Tsai-Lenz (1989), Park-Martin (1994), Daniilidis (1999, 对偶四元数)。

实际操作:驱动机器人运动到 15~25 个不同位姿(覆盖旋转和平移的各个方向),在每个位姿记录关节角度和标定板检测结果,联立求解。

7.3 IMU 与相机联合标定 (Kalibr)

Kalibr (ETH Zurich) 是最广泛使用的视觉惯性标定工具,同时标定:

  • 相机内参与畸变
  • IMU 内参(轴偏差、标度因子)
  • 相机与 IMU 之间的时空变换 T_cam_imu
  • 时间偏移 t_offset (通常 1~30 ms)

标定过程:在标定板前以丰富运动模式(平移 + 旋转、各轴激励)移动传感器组合,记录图像序列和 IMU 数据,通过非线性优化联合估计所有参数。

关键约束:IMU 必须在标定过程中被充分激励(三轴加速度和三轴角速度都应覆盖),运动需包含足够的高频激励以观测 IMU 时间偏移。

7.4 LiDAR 与相机外参标定

确定 LiDAR 坐标系与相机坐标系之间的刚体变换 [R|t]。

目标法 (Target-based):使用已知几何形状的标定板(带孔洞的棋盘格),在 LiDAR 点云中检测平面/边缘,在图像中检测角点,建立对应关系。

无目标法 (Targetless):利用场景中的自然特征(边缘、平面),通过互信息 (Mutual Information) 或深度不连续一致性优化外参。

典型精度:旋转误差 < 0.5°,平移误差 < 2 cm。

7.5 时间同步 (Time Synchronization)

多传感器融合对时间同步精度要求极高。1 ms 的时间偏差在 1 m/s 运动速度下造成 1 mm 的位置误差。

同步方式精度复杂度适用场景
硬件触发 (GPIO)<10 μs高(需定制硬件)高精度系统
PTP (IEEE 1588)<1 μs中(需网络支持)工业系统
NTP1~10 ms非实时场景
软件时间戳 + 离线校正1~5 ms快速原型

硬件触发方案

MCU Timer (1 kHz 中断)

    ├── GPIO → 相机外触发 (曝光开始时刻已知)
    ├── GPIO → LiDAR 同步脉冲
    ├── GPIO → IMU 数据就绪中断

    └── 统一时间基准 (共同时钟源)

IMU 通常是最高频传感器 (200~4000 Hz),作为时间插值的参考轴。相机和 LiDAR 的时间戳对齐到 IMU 时钟,通过硬件触发确保确定性延迟。

8. 传感器融合基础 (Sensor Fusion Fundamentals)

8.1 多模态融合的必要性

单一传感器模态存在系统性失效模式 (failure mode),无法满足机器人全场景需求:

传感器失效场景
RGB 相机黑暗环境、强逆光、弱纹理表面、运动模糊
深度相机(结构光)室外强光、黑色吸光表面、镜面反射、>10m 距离
LiDAR雾/雨/雪散射、黑色低反射率、玻璃/水面、高成本
IMU长时间漂移(积分误差)、无绝对位置参考
超声波高频吸收、多径、窄视角
触觉仅接触时有效、覆盖面积有限

互补性 (Complementarity) 是融合的核心价值:

传感器 A 失效           传感器 B 有效
    ×                      ✓         → 系统仍工作
传感器 B 失效           传感器 A 有效
    ✓                      ×         → 系统仍工作

同时失效的概率: P(A失效) × P(B失效) << max(P(A失效), P(B失效))
(假设失效模式独立)

8.2 融合层次

融合层次英文输入输出优缺点
早期融合 (原始数据级)Early/Raw Fusion原始传感器数据统一特征表示信息损失小,但数据维度高、对齐困难
特征级融合Feature-level Fusion各模态提取的特征联合特征平衡信息量与计算量
晚期融合 (决策级)Late/Decision Fusion各模态独立估计结果最终决策简单、模块化,但信息损失大

具体示例

  • 早期融合:将深度图与 RGB 图拼接为 RGBD 4 通道输入神经网络
  • 特征级融合:LiDAR 点云特征 + 图像 CNN 特征在 BEV (Bird’s Eye View) 空间拼接
  • 晚期融合:LiDAR 3D 检测结果与相机 2D 检测结果在目标级关联匹配

8.3 传感器模态综合对比

维度RGB 相机深度相机LiDARIMU触觉
信息密度极高 (百万像素)高 (30~100万点)中 (10~500万点/s)低 (6 DoF)低~中
工作距离0.1~∞ m0.1~10 m1~300 mN/A0 (接触)
环境光依赖中(红外)
精度类型2D 高精度3D 中等精度3D 高精度相对运动局部高精度
帧率30~1000 Hz30~90 Hz10~20 Hz200~4000 Hz30~1000 Hz
功耗0.5~3 W2~8 W8~25 W0.01~0.1 W0.01~1 W
成本$10~$1,000$200~$2,000$500~$75,000$5~$2,500$15~$16,000
数据量大 (30 MB/s@1080p30)大 (10~30 MB/s)中 (5~50 MB/s)极小 (<1 KB/s)

8.4 经典融合框架

视觉惯性里程计 (VIO) 是机器人中最常见的融合范式:

算法融合方式前端后端开源精度 (EuRoC)
VINS-Mono紧耦合光流+特征点滑窗优化ATE ~0.1 m
OKVIS2紧耦合特征点匹配关键帧优化ATE ~0.08 m
MSCKF紧耦合特征点EKFATE ~0.15 m
ORB-SLAM3紧耦合ORB 特征BA + 图优化ATE ~0.05 m

LiDAR 惯性里程计 (LIO)

算法特点点云处理开源
LIO-SAM因子图、紧耦合特征提取 (边+面)
FAST-LIO2直接法、iKD-tree全点云直接配准
Point-LIO逐点处理、高频逐点更新

9. 公司格局表 (Industry Landscape)

9.1 视觉与深度传感

公司总部核心产品技术路线市场定位估值/营收
Intel RealSense (已剥离)美国D400/L500 系列主动立体+结构光机器人/无人机独立运营中
Stereolabs法国ZED 系列被动/主动立体机器人/空间计算私有
Orbbec (奥比中光)中国深圳Femto/Gemini 系列结构光+iToF机器人/3D 扫描已上市 (688322.SH)
iniVation瑞士DAVIS/DVXplorer事件相机研究/工业私有,A 轮
Prophesee法国EVK 系列事件相机汽车/工业/IoT$200M+ 融资
Sony Semiconductor日本IMX 系列传感器芯片CMOS Image Sensor芯片供应商万亿日元级营收
Basler德国ace/dart/boost 系列工业相机工业视觉已上市 (BSL.DE)
Teledyne FLIR美国Blackfly/Firefly工业相机工业/科研Teledyne 子公司

9.2 LiDAR

公司总部核心产品技术路线主要市场状态
Velodyne (Ouster 合并)美国VLP/Alpha机械旋转自动驾驶/机器人与 Ouster 合并
Ouster美国OS 系列数字 LiDAR (SPAD)自动驾驶/机器人/测绘已上市 (OUST)
Livox (DJI)中国深圳Mid-360/HAP/Tele-15MEMS+棱镜自动驾驶/机器人DJI 子公司
Hesai (禾赛)中国上海AT128/FT120/Pandar机械+MEMS+Flash自动驾驶/机器人已上市 (HSAI)
Aeva美国Aeries IIFMCW自动驾驶/工业已上市 (AEVA)
RoboSense (速腾聚创)中国深圳M 系列/E 系列MEMS+机械自动驾驶已上市 (2498.HK)
Luminar美国Iris机械扫描 1550nm自动驾驶 (OEM)已上市 (LAZR)

9.3 力觉与触觉

公司总部核心产品技术市场定位状态
ATI Industrial Automation美国Mini/Nano/Gamma/Omega应变片 F/T工业机器人Novanta 子公司
Robotiq加拿大FT 300-S应变片 F/T协作机器人私有
OnRobot丹麦HEX-E/H应变片 F/T协作机器人私有
GelSight Inc.美国GelSight Mini/Svelte光学触觉机器人/质检私有,种子轮
Meta FAIR美国DIGIT光学触觉 (开源)研究Meta 内部
SynTouch美国BioTac多模态触觉研究/假肢私有,小规模
Contactile澳大利亚3-axis tactile光学式工业抓取私有
XELA Robotics日本uSkin电容式全覆盖协作机器人私有

9.4 IMU 与惯性传感

公司总部核心产品技术等级状态
Analog Devices (ADI)美国ADIS16475/16490/16500MEMS工业~战术已上市 (ADI)
Bosch Sensortec德国BMI088/BMI270/BMI323MEMS消费~工业Bosch 子公司
TDK InvenSense日本ICM-42688/ICM-45686MEMS消费~工业TDK 子公司
STMicroelectronics瑞士LSM6DSO/ISM330DHCXMEMS消费~工业已上市 (STM)
Honeywell美国HG1930/HG4930RLG/FOG导航级已上市 (HON)
Northrop Grumman美国LN-200/LN-270FOG导航级已上市 (NOC)

10.1 LiDAR 成本曲线 (2018~2026)

价格 (USD)

70K │ ●                                    Velodyne HDL-64E (2018)

60K │

50K │

40K │

30K │   ●                                  Hesai Pandar128 (2020)

20K │

10K │       ●                              Ouster OS1-128 (2021)
    │           ●                           Hesai AT128 (2022, 车规)
 5K │               ●                      Ouster OS1-128 (2023)

 2K │                   ●                  Livox Mid-360 (2023)
 1K │                       ●  ●           Livox Mid-360 / Hesai FT120 (2024~2025)
500 │                               ●     Flash LiDAR 目标 (2026)

    └────┬────┬────┬────┬────┬────┬────► 年份
       2018 2019 2020 2021 2022 2023 2024~26

关键趋势:

  • 2018~2023:128 线机械 LiDAR 价格从 $70,000 降至 $8,000(约 8x 降幅)
  • 20222025:固态 LiDAR 进入 $500$2,000 区间
  • 20252027:Flash LiDAR 目标 $200$500(30m 范围,机器人近距场景)
  • FMCW LiDAR 仍在 $3,000+ 阶段,预计 2027~2028 年进入 $500 以下

驱动因素:自动驾驶量产拉动规模效应、芯片化集成 (SoC LiDAR)、Flash 方案去除机械/MEMS 部件。

10.2 触觉传感器:最大未满足需求

当前市场规模:触觉传感器在机器人中的渗透率 < 5%,绝大多数工业机器人仍无触觉能力。

时间节点预期进展投资含义
2024~2025GelSight/DIGIT 在研究实验室普及,单个 $300~$400技术验证期
2025~2026人形机器人原型(Tesla Optimus, Figure 01)开始集成触觉需求信号出现
2026~2028柔性电子触觉 skin 原型(大面积覆盖),成本降至 $50/指尖早期产业化
2028~2030全手/全身触觉量产方案,成本 $10~$20/指尖规模化拐点

技术路径竞争:

  • 光学触觉 (GelSight 类):高分辨率但体积受限,难全身覆盖
  • 电容式柔性阵列 (XELA 类):可覆盖大面积,分辨率有限
  • 柔性电子皮肤:学术前沿(Stanford, MIT),可量产性未验证

投资关注点:谁能解决”高分辨率 + 大面积覆盖 + 低成本 + 耐久性”的四角矛盾。

10.3 深度相机商品化

深度相机已从 2014 年的 $400+ (原版 Kinect) 降至 2025 年的 $100~$300 区间,技术路线收敛:

价格区间产品场景
$30~$80手机 ToF 模组 (Sony IMX316)消费电子
$100~$200Orbbec Gemini 2, Oak-D Lite教育/入门机器人
$200~$400Intel D435i, ZED Mini主流机器人
$400~$800Azure Kinect, ZED 2i高性能机器人
$1,000~$3,000Lucid Helios2, Photoneo工业 3D 视觉

投资判断:深度相机硬件已进入利润率压缩阶段,纯硬件创业机会有限。价值正向上游芯片 (Sony, 奥比中光自研 iToF 芯片) 和下游算法/解决方案转移。

10.4 传感器产业关键判断

  1. LiDAR:固态化+芯片化是确定趋势,FMCW 是下一代技术高地。Hesai 和 Ouster 在机器人市场有先发优势。Aeva 的 FMCW 如能量产至 $500 以下,将改变游戏规则。

  2. 触觉:当前处于”类似 2015 年的 LiDAR 阶段”,技术路线未收敛,量产方案未定型。这是具身智能硬件中确定性最高的增量赛道。

  3. 视觉:传感器硬件本身不再是壁垒(Sony 芯片主导),壁垒在感知算法和系统集成。事件相机若成本降至 $200 以下,将在高速/高动态机器人场景中快速渗透。

  4. IMU:MEMS 惯性传感器已高度商品化(Bosch, TDK 主导),利润率低。机会在高精度战术/导航级 (ADI, Honeywell) 和新型架构 (原子惯性传感器)。

  5. 力觉:ATI 长期主导六轴 F/T 市场,但关节内置力矩传感器(Franka 方案)正使独立 F/T 传感器在协作机器人中的必要性降低。

参考文献

  1. Szeliski, R. (2022). Computer Vision: Algorithms and Applications (2nd ed.). Springer.
  2. Hartley, R., & Zisserman, A. (2004). Multiple View Geometry in Computer Vision (2nd ed.). Cambridge University Press.
  3. Gallego, G., et al. (2020). “Event-based Vision: A Survey.” IEEE TPAMI, 44(1), 154-180.
  4. Li, Y., et al. (2020). “GelSight: High-Resolution Robot Tactile Sensors for Estimating Geometry and Force.” Sensors, 17(12), 2762.
  5. Lambeta, M., et al. (2020). “DIGIT: A Novel Design for a Low-Cost Compact High-Resolution Tactile Sensor with Application to In-Hand Manipulation.” IEEE RA-L, 5(3), 3838-3845.
  6. Furgale, P., Rehder, J., & Siegwart, R. (2013). “Unified Temporal and Spatial Calibration for Multi-Sensor Systems.” IROS 2013.
  7. Qin, T., Li, P., & Shen, S. (2018). “VINS-Mono: A Robust and Versatile Monocular Visual-Inertial State Estimator.” IEEE TRO, 34(4), 1004-1020.
  8. Xu, W., et al. (2022). “FAST-LIO2: Fast Direct LiDAR-Inertial Odometry.” IEEE TRO, 38(4), 2053-2073.
  9. Dahiya, R. S., et al. (2010). “Tactile Sensing: From Humans to Humanoids.” IEEE TRO, 26(1), 1-20.
  10. Woodman, O. J. (2007). “An introduction to inertial navigation.” Technical Report, University of Cambridge.
  11. Intel RealSense D400 Series Datasheet. Intel Corporation.
  12. Ouster OS Sensor Datasheet. Ouster, Inc.
  13. ATI F/T Sensor Product Catalog. ATI Industrial Automation.

本文档为 Index 具身智能研究项目的第二层:传感器与感知硬件。上一层:机械本体与执行器,下一层:状态估计与SLAM