46.8%的机器人任务失败,败在
统计 阅读时间大约10分钟以上(8295字)

2026-08-07 46.8%的机器人任务失败,败在"眼睛"上:一文读懂人形机器人视觉模组的千亿卡位战

来源:豆包
作者:GEIA老杨   出品:GEIA全球具身智能观察01一个反常识的事实:让机器人摔倒的不是腿,是眼睛如果一台人形机器人在车间里...

作者:GEIA老杨     出品:GEIA全球具身智能观察

01

一个反常识的事实:让机器人摔倒的不是腿,是眼睛

如果一台人形机器人在车间里摔倒了,你最先想到的原因是什么?

大概率不是关节电机坏了,也不是减速器卡死了——这些硬件的可靠性在工业场景里已经被验证了几十年。真正出问题的,往往是它"没看清"。

2026年上半年,多家整机厂商的真机运行台账显示,整机作业失败案例里46.8%源于二维视觉信息单薄、深度感知缺失——反光工件识别失效、昏暗角落测距失准、堆叠物料定位偏差超过12毫米、避障反应滞后导致磕碰设备……这些故障的共性,是"看不清楚",不是"动不起来"。

这是一个反常识的产业观察:当全行业都在讨论关节电机、谐波减速器、行星滚柱丝杠的时候,视觉模组——这个占整机BOM只有3%到5%的"小部件"——正在成为决定人形机器人能不能真正走进工厂、走进家庭的核心瓶颈。

视觉不是简单的摄像头,它是机器人理解物理世界的入口。一台人形机器人身上,从头部的环境感知、手腕的手眼协同,到脚底的地面识别,视觉信息承载了约80%的环境感知输入。没有视觉的人形机器人,只是一个按程序走轨迹的机械装置——能完成"秀肌肉"的动作演示,却无法应对真实世界里任何一个变量。

真正的产业拐点发生在2025年下半年到2026年上半年。这一年里,几件看上去不相关的事情指向了同一趋势:RealSense从Intel分拆独立并拿到5000万美元A轮融资,因为作为一个部门的发展速度已经追不上机器人视觉的需求增速 (RealSense官方);奥比中光2025年扭亏为盈,人形机器人客户订单2026年一季度环比翻倍 (上交所);联创电子从消费电子镜头厂商一跃成为特斯拉Optimus双目视觉模组独家供应商;欧菲光、舜宇光学、丘钛科技这些车载摄像头模组厂,几乎在同一时间宣布进军机器人视觉赛道。

这些信号指向同一个判断:人形机器人的"视觉军备竞赛"已经开始,但多数参与者还没有意识到这是一场独立于整机竞争的产业级赛事

02

2D不够用:为什么人形机器人天生需要3D

谈人形机器人的视觉,第一件事要搞清楚——它需要的不是2D,是3D。这个判断不是技术偏好,而是由人形机器人的物理属性决定的。

传统工业机器人工作在固定光照、固定位置、固定姿态的结构化产线里,一个2D相机加预先示教就能完成任务。因为工件在哪里、怎么放、要做什么,都是预设好的。2D视觉只需要识别"是不是这个零件、在不在那个位置",不需要知道深度信息。

但人形机器人的工作场景完全不同。它要移动——从一个工位走到另一个工位,从室内走到半室外,光照在变,距离在变。它要处理无序的物体——堆叠的零件、随意摆放的工具、形状各异的包裹,没有一个是"标准姿势"。它要做精细操作——拧螺丝、插接头、握杯子,差一毫米都不行。

这些需求,2D视觉统统满足不了。

没有深度信息,就做不了精确抓取。 一个苹果和一个苹果照片,在2D相机里看起来一样,但机器人伸手去抓的时候,差的就是几十厘米的距离。2D视觉只能告诉你"物体在那里",3D视觉才能告诉你"物体在那里、离我多远、是什么形状"。

没有三维空间理解,就无法在无序环境中导航。 机器人走在工厂车间里,前面是一个台阶还是一条阴影?是一个可以跨过的小物件还是需要绕开的大设备?2D图像无法区分这些,3D点云可以。

没有多视角重建能力,就做不了手眼协同。 手腕上的相机要在运动中实时计算物体的三维位姿,指导手指做出精确的抓取动作。2D图像在运动中会模糊、会失真,3D视觉才能提供稳定的空间坐标。

没有抗光照变化的能力,就无法应对真实环境。 2D视觉严重依赖光照条件——逆光就过曝,暗光就噪点爆炸,反光物体就"消失"。3D视觉(尤其是主动式方案,如结构光、ToF)通过主动投射光源,对环境光的依赖小得多。

说到底,2D视觉是给"固定世界"用的,3D视觉是给"移动世界"用的。人形机器人是移动的、全场景的、面对无序环境的智能体,它的视觉系统从第一天起就必须是3D的。

这不是一个"升级换代"的问题,而是一个"有没有资格入场"的问题。没有3D深度感知的人形机器人,本质上只是一台会走路的演示设备,进不了真实的工作场景。

03

7.8亿元和82%:一个从小基数起飞的赛道

谈论人形机器人视觉模组的市场规模,第一件事是搞清楚统计口径——不同口径下的数字可以差出十倍以上。

当前有三套最常用的数据,它们说的不是一回事。

第一套口径,是全球人形机器人视觉传感器模块专用市场。QYResearch数据显示,2025年全球这个细分市场约9.2亿美元,预计2026年增至11.74亿美元,同比增长约27.6%;到2032年达到50.67亿美元,七年复合增长率27.6% (QYResearch)。这个口径最窄,只统计为人形机器人专门配套的视觉传感器模组。

第二套口径,是中国工业3D视觉整体市场。GGII数据显示,2025年中国工业3D视觉市场规模32.74亿元,同比增长16.31%;2026-2030年CAGR约16%,2030年预计突破71.27亿元 (GGII)。这个口径宽一些,覆盖了所有工业场景的3D视觉需求,人形机器人只是其中一个增量方向。

第三套口径,是中国人形机器人专用3D视觉市场。GGII测算,2025年这个细分市场规模约7.8亿元,2026年预计达14.2亿元,同比增长82.1%;2026到2030年复合增速约74% (GGII)。这个增速最快,因为基数最低——2024年以前人形机器人多以展厅演示为主,2D摄像头加预设程序就能应付,3D深度感知属于选配。

三套数据之间是嵌套关系:工业3D视觉是基本盘,人形专用是增量盘,全球市场是总量盘。理解了这层嵌套,才能理解为什么2025年整个工业3D视觉增速只有16%,而人形专用赛道增速能超过80%——后者是从一个极小的基数上起飞的。

9e1827651c6684247a0aa69472df091e.png

图1:全球与中国人形机器人视觉模组市场规模预测(2025-2032)。全球数据来源:QYResearch;中国数据来源:GGII。

6.75%和100%:渗透率的跃迁逻辑

另一个值得注意的数字,是3D视觉在工业机器人上的渗透率——2025年只有6.75%,2026年预计提升到8.24% (GGII)。这个数字之低,很多人第一次看到会惊讶——工业机器人发展了这么多年,3D视觉的渗透率居然还不到10%?

事实确实如此。传统工业机器人绝大多数工作在结构化产线里,2D相机加预先示教就能完成任务,3D视觉是"奢侈品"。但人形机器人不一样——它移动作业、光照变化、物体姿态无序,没有3D深度信息根本无法正常工作。

这就构成了行业最核心的增长逻辑:工业机器人3D视觉渗透率从6.75%往上爬,走的是渐进式路线;人形机器人3D视觉渗透率从接近0往100%走,走的是从0到1的跃迁式路线。两条线叠加,才是这个赛道未来五年真正的增长势能。

从2D到3D的升级,对人形机器人来说是刚需,不是选配。这个判断是理解整个赛道的基础——不是"机器人会不会用3D视觉"的问题,而是"每一台机器人要用多少套3D视觉"的问题。

单机价值量:量价齐升的双轮驱动

不同机型搭载的视觉方案差异极大,这是理解市场规模时不能忽略的结构变量。

入门消费级机型通常用双目视觉模组,单套价值1800到2400元,能满足基础的环境感知和避障需求。工业重载机型会搭配结构光加短距激光雷达的组合方案,单套价值上升到4200到6000元。高端人形机器人全身布设多组3D视觉单元——头部导航、手腕操作、脚底识别、躯干环视——单机配套价值可以突破1万元。

2024年以前,主流人形机器人演示机型以双目为主,单机视觉价值两千元上下。进入2026年,越来越多厂商在第二代、第三代机型上升级为多传感器融合方案,单机价值量往五千元甚至更高区间爬升。行业的增长不是简单的"出货量乘以单价",而是量价齐升的双轮驱动

8e014becaedbec41774509d30596adf6.png

人形机器人整机BOM成本结构

图2:人形机器人整机BOM成本结构(以特斯拉Optimus为参照)。视觉模组约占整机BOM的3-5%,占感知系统的50-60%。数据来源:多家券商研报与拆机分析综合。

04

从工厂车间到机器人身体:3D视觉的跨界迁移

人形机器人的3D视觉不是从零开始发明的。它站在工业3D视觉十几年积累的肩膀上——这个趋势在2026年变得越来越清晰。

国内有一批做了近十年工业3D视觉的厂商,它们在工业场景里验证了技术的可靠性、精度和算法能力,现在开始把目光投向人形机器人。这个迁移不是"转行",而是"延伸"——工业场景验证过的能力,可以直接复用在机器人场景里。

最典型的代表是图漾科技(Percipio)。这家2015年成立的公司,凭借双目结构光技术在工业3D相机领域做到了全球出货量领先,累计出货超过10万台,服务客户超1000家 (图漾科技官网)。它的产品覆盖工业自动化、智慧物流、移动机器人三大场景,FM系列结构光3D相机在工业无序抓取、上下料、装配防错等场景中广泛应用。

值得注意的是,图漾官网的场景分类里已经出现了"具身智能"一栏——"赋予机器人环境理解与目标识别交互能力,面向下一代泛场景服务与工业协作应用" (图漾科技官网)。虽然目前还没有明确的人形机器人产品发布,但技术路线和场景定位已经明显在向这个方向延伸。

和图漾走类似路径的还有一批公司。梅卡曼德原本是工业3D视觉引导领域的连续五年市占率第一(约38%的市场份额),2026年WAIC上它已经在展示人形机器人协同上下料、货架取货、分拣海量物体等应用,把工业场景积累的"眼脑手"全栈技术直接移植到了人形机器人身上 (梅卡曼德官网)。迁移科技这家工业3D视觉厂商推出了手机大小的Pixel Mini 3D相机,专门针对协作臂"眼在手上"的场景做轻量化设计——同样的技术逻辑,再往前走一步就是人形机器人手腕上的视觉模组 (CSDN)。

这个趋势的意义在于,人形机器人的3D视觉不是一个全新的、从零起步的赛道。它的底层技术——结构光、双目、ToF——已经在工业场景里被打磨了十几年,可靠性、精度、成本控制都经过了验证。现在需要做的,是针对人形机器人的特殊需求(轻量化、低功耗、抗震动、全天候)做适配和优化,而不是重新发明轮子。

工业3D视觉向人形机器人的迁移,有两层含义。对行业来说,这意味着技术成熟度比想象中高,落地速度可能比预期快。对创业公司来说,这意味着竞争的起点不是"谁先做出来",而是"谁先从工业场景迁移过来并做好适配"——有工业积累的玩家,在起跑线上就有优势。

05

三条技术路线的取舍与组合

当前工业化落地成熟的3D视觉技术路线有四条——结构光、双目立体视觉、ToF飞行时间、激光扫描。它们之间不是替代关系,而是互补关系,各自在精度、测距范围、抗干扰能力和成本之间做了不同的权衡。

结构光是精度最高的路线。通过投射特定的光斑图案(通常是红外散斑或条纹),根据图案变形计算深度信息。动态结构光的精度可以做到亚毫米级,适合超高精密的静态检测场景。缺点是容易受环境光干扰,工作距离有限,通常在几米以内。

双目立体视觉是最"仿生"的路线——跟人眼原理一样,通过两个摄像头的视差计算深度。通用性强、成本适中,不需要投射光源,适合机器人环境感知和大范围坐标测量。精度在毫米级,应对导航避障、物体识别等场景绰绰有余。

ToF飞行时间是远距离高速成像的首选。通过测量光脉冲发射与接收的时间差来计算深度,测距范围可以到十几米甚至几十米,帧率高,适合物流包裹体积测量、AGV环境感知等场景。代价是深度精度相对偏低,近距离场景下不如结构光和双目。

激光扫描是最"耐造"的路线。用激光逐行扫描获取三维信息,抗高反光、粉尘、油污干扰能力极强。缺点是速度相对慢一些,成本也比较高。

67534e5c6d7663887f104d48385fc761.jpg

四类主流3D视觉技术路线对比

图3:四类主流3D视觉技术路线对比。各路线在精度、测距、抗干扰、成本上各有侧重,不存在单一"最优解"。数据来源:GGII、行业研究综合整理。

人形机器人的"组合拳"

人形机器人的特殊之处在于,它是一个移动的、全场景的智能体——既需要在几米到几十米范围内做导航避障,也需要在手腕处做厘米到毫米级的精细操作,还要能应对强光、暗光、逆光等各种光照条件。单一技术路线无法满足所有需求,所以多传感器融合成为必然。

当前主流的人形机器人视觉方案,大致是这样的组合:头部装双目+ToF深度相机,负责环境感知、SLAM建图和导航避障;手腕或灵巧手处装结构光或微型3D相机,负责精细操作的手眼协同;部分高端机型还会在腿部或脚底加装视觉传感器,用于地面识别和步态调整。

这也解释了为什么单台视觉模组的价值量差异这么大——方案组合不同,硬件数量和等级不同,价格自然拉开差距。

芯片暗线:最值钱也最卡脖子的环节

技术路线之争的更深一层,是上游芯片的竞争格局。

3D视觉的核心芯片包括CMOS图像传感器、VCSEL激光器(结构光和iToF的光源)、SPAD(单光子雪崩二极管,dToF的核心感光器件)以及深度计算ASIC芯片。

这个领域目前存在两个层级的进口依赖。第一层级是中高端CMOS图像传感器,尤其是全局快门型号——索尼、安森美、三星三家垄断了大部分高端市场。2025年数据显示,国内全局快门CMOS自给率约41.3%,进口芯片仍占高端型号62.8%的采购份额。全局快门CMOS对于机器人视觉至关重要——机器人在移动,拍摄高速运动的物体时,卷帘快门会产生果冻效应导致画面变形,全局快门才能冻结运动瞬间。

第二层级是VCSEL和SPAD芯片。VCSEL领域,Lumentum、Coherent(原II-VI)等海外厂商占据高端市场,国内长光华芯、纵慧芯光等企业正在追赶。SPAD更是高度依赖进口——索尼、意法半导体处于领先位置,国内只有少数企业在研。

深度引擎芯片的国产替代反而走得更快一些。奥比中光自研的MX系列深度引擎芯片和LS635 dToF芯片已经量产,这也是其毛利率能维持在54%以上的关键原因之一 (传感器专家网)。

芯片是整个产业链里技术壁垒最高、价值占比也最高的环节,约占视觉模组成本的40%。谁能在芯片层面实现自主可控,谁就在成本和供应链安全上握有主动权。

06

三梯队和一条跨界线

人形机器人视觉模组的竞争格局,可以用"三梯队加一条跨界线"来概括。三梯队是按技术能力和市场份额划分的玩家层级,跨界线则是指那些从相邻赛道切入、正在重塑竞争边界的玩家。

第一梯队:全栈能力的头部玩家

第一梯队的特点是全栈技术能力和规模化收入,主要由三家企业构成——奥比中光、海康机器人、梅卡曼德。

奥比中光是国内3D视觉感知领域的龙头,也是唯一一家以3D视觉为主营业务的上市公司。它最独特的地方,是全球少数掌握全部六条主流技术路线(结构光、iToF、dToF、双目、激光雷达、工业三维测量)的企业之一,自研深度引擎芯片和dToF芯片,形成"芯片-算法-系统-硬件"的垂直整合能力。

2025年是奥比中光的转折年——营收9.41亿元同比增长66.66%,归母净利润1.28亿元实现扭亏为盈,成功摘掉科创板"U"标识 (上交所)。分业务看,机器人业务贡献显著——在服务机器人3D视觉领域市占率超过70%,人形机器人领域市占率约28.3%,国内第一 (21世纪经济报道)。进入2026年,增长还在加速。一季度扣非归母净利润同比大增531%,人形机器人客户订单环比翻倍,交付周期从40天压缩到20天。

海康机器人背靠海康威视的巨大体量,依托工业AI算法、边缘计算硬件和渠道上的积累,在汽车焊装、电池检测等高精度场景快速落地。在机器人用3D视觉系统市场,海康机器人以约20.5%的市占率位居第二 (豆丁网研究报告)。它的优势是规模化制造能力和行业渠道,劣势是3D视觉作为众多产品线之一,战略聚焦度不如纯3D视觉厂商。

梅卡曼德是工业3D视觉引导领域的连续五年市占率第一,约38%的市场份额 (GGII)。它的核心竞争力是"感知—认知—决策—执行"的全栈技术——从3D相机到视觉软件、编程软件、深度学习软件,再到运动规划。梅卡曼德服务了100多家《财富》500强客户,全球累计部署超过27000套系统。2026年WAIC上,它已经展示了人形机器人协同上下料、货架取货、分拣海量物体等应用,工业积累向人形机器人延伸的路径非常清晰。

c5f22bc28a23fb623ae789a3d52c364c.png

2025年中国机器人3D视觉系统市场竞争格局

图4:2025年中国机器人3D视觉系统市场竞争格局。CR3合计61.1%,市场集中度持续提升。数据来源:GGII、博研咨询综合。

第二梯队:差异化突围

第二梯队企业的特点是在某个细分领域有深厚积累,正在向人形机器人场景延伸。

凌云光(688400)2025年营收29.12亿元,其中机器视觉业务23.46亿元,同比增长44.72% (信达证券)。它的优势在消费电子和新型显示检测——给苹果供应链做视觉检测多年,技术积累深厚。2025年全资收购了全球工业相机品牌JAI A/S,补齐了高端成像能力。在具身智能方向,其FZMotion光学动捕系统受益于机器人数据采集需求,收入同比增长超70%。

奥普特(688686)2025年营收12.69亿元,同比增长39.24%,是国内机器视觉核心零部件领域的龙头企业之一 (传感器专家网)。它的产品线很全——光源、镜头、工业相机、3D传感器、视觉算法都有自研。机器人业务2025年从零起步做到约2330万元,研发了双目结构光与激光雷达等核心感知技术。2026年7月公告拟发行12.7亿元可转债,投向机器人核心零部件及视觉系统研发产业化。

联创电子的故事最有戏剧性——它原本是一家消费电子镜头厂商,连续三年亏损,2025年起收缩消费电子业务、全面转向车载和机器人赛道,反而成为特斯拉Optimus双目视觉模组的独家供应商。其2025年相关订单约3到5亿元,2026年量产后预计达10亿元左右。联创电子的案例最能说明一个趋势:车载光学技术向机器人视觉的迁移,壁垒比想象中低。

跨界线:车载镜头厂的集体转身

2026年上半年最值得关注的现象,是车载摄像头模组厂商集体进军机器人视觉赛道——舜宇光学、欧菲光、联创电子、丘钛科技、瑞声科技、联合光电……这些在智能驾驶浪潮里成长起来的供应商,几乎无一例外把机器人视为"第二增长曲线"。

欧菲光的动作最大——2026年7月正式官宣成立独立机器视觉孙公司,聚焦3D视觉感知和工业智能检测。舜宇光学虽然动作没那么高调,但作为全球最大的车载镜头供应商之一,其进入也是必然选择。

这些跨界玩家的共同优势是:大规模制造能力强、光学设计积累深、成本控制能力出色。它们不缺产能,缺的是机器人领域的算法和场景理解。但这个缺口正在以两种方式快速补齐——要么收购机器人视觉团队,要么和机器人算法公司深度绑定。

国产替代的速度有多快?一组数据可以说明:中国人形机器人3D视觉国产化率从2024年的16.9%快速攀升到2026年上半年的37.6%,两年跨越了近21个百分点。国产同规格产品价格约为进口的三分之一到二分之一,这是替代加速最直接的驱动力。

07

从"看见"到"看懂"

如果说过去十年,视觉模组的演进主线是"看得更清"——分辨率更高、精度更高、速度更快。那么接下来十年,演进主线会转向"看得更懂"——从数据采集升级为环境理解、从被动感知升级为主动认知、从单一视觉升级为多模态融合。

VLA大模型重构视觉感知

2026年最确定的技术趋势,是VLA(视觉-语言-动作)大模型正在快速从实验室走向端侧部署,直接重塑视觉感知的价值链条。

传统的机器人视觉架构是流水线式的:视觉感知模块采集图像→ 场景理解模块做识别和定位 → 规划模块生成动作序列 → 控制模块执行。每个模块独立训练,接口复杂,信息在传递过程中逐层损耗。

VLA模型改变了这个架构——把视觉输入和语言指令直接输入统一的Transformer骨干,端到端输出动作序列。这种架构的好处是信息损耗小、泛化能力强,模型可以从零样本迁移到新的物体和场景。

VLA的演进已经经历了几代:从2022年Google DeepMind的RT-1、2023年的RT-2(第一个真正意义上的VLA模型),到2024年Physical Intelligence的π0(推理速度从5Hz提升到25Hz)和斯坦福的OpenVLA(7B参数的开源VLA基础模型),再到2026年已经出现了端侧部署的VLA方案——Google的Gemini Robotics On-Device可以在本地完成皮带组装、拉开拉链等工业任务,仅需50次演示就能适应新技能 (CSDN)。

VLA对视觉模组的影响是深远的。过去视觉模组的核心指标是分辨率、精度、帧率这些硬件参数。VLA时代,视觉模组需要和大模型做联合优化——什么数据格式最适合大模型输入、什么分辨率在精度和算力之间最优、要不要在模组端做特征提取……这些问题的答案,将决定下一代视觉模组的形态。

事件相机:下一代感知形态

事件相机是一种仿生视觉技术,模仿生物视网膜的工作机制——每个像素独立工作,只有当检测到的光强变化超过阈值时,才会输出一个"事件"信号。

这种异步输出的方式,带来了几个革命性的优势:微秒级延迟、超过120dB的超高动态范围(普通相机大概60-70dB)、极高的能效、没有运动模糊。

这些特性恰好切中了人形机器人的核心痛点——机器人在移动,常规相机有运动模糊;从暗处走到亮处,常规相机容易过曝或欠曝;高速运动物体的追踪,常规相机帧率不够。

2025到2026年,事件相机正从实验室加速走向商业应用。索尼与Prophesee的合作推动了产业成熟。2026年7月的最新研究显示,用事件相机驱动的人形上半身遥操作,在低光照和逆光场景下的表现显著优于RGB基线方案,端到端延迟只有23到34毫秒 (arXiv)。

当然事件相机也有它的局限——静态场景下没有输出、绝对灰度信息缺失、配套的算法和数据集还不成熟。中期看,更可能的方案是事件相机与常规RGB相机的混合使用。

多模态融合走向"五感协同"

视觉是最重要的感知模态,但不是唯一的。当机器人要完成精细操作——拧螺丝、插接头、握杯子——光靠视觉是不够的,因为视觉只能"看到",不能"感觉到"。接触瞬间的力反馈、物体的硬度和纹理、指尖的打滑状态——这些都需要触觉来补充。

2026年,多模态融合的研究明显在加速。最具标志性的工作,是清华大学孙富春团队7月发表在《Nature Sensors》上的脉冲-语言双编码具身触觉系统——把类脑触觉传感器、脉冲神经网络和大语言模型结合在一起,让机器人既能快速感知识别常见物体,也能在遇到未知物体时做语义推理和深度认知 (清华大学计算机系)。

另一组有意思的数据来自NeoteAI和复旦大学——他们搭建的NeoData数据集包含了超过3万小时的视觉-触觉交互操作数据、约140万条操作片段、80亿帧RGB画面和100亿帧触觉图像,覆盖450项真实长程任务。数据规模的量级上去了,视触融合模型的能力才会有质变。

对视觉模组厂商来说,这意味着视觉不再是孤立的感知系统,而是整个感知体系中的一个核心模态。未来的供应商,要么自己往多模态方向延伸,要么深度融入多模态融合的产业体系。只做单一视觉硬件的价值空间会被逐步压缩。

08

眼睛的战争才刚开始

回到文章开头的那个反常识观察——视觉模组占BOM只有3%到5%,却决定了人形机器人46.8%的作业失败率。

这个矛盾本身,就是这个赛道最大的投资逻辑。价值量小的部件,未必是不重要的部件。人体的眼睛只占体重的很小一部分,但没有眼睛,人几乎寸步难行。机器人也是一样——没有好的视觉,再精密的机械结构也只是闭着眼的舞者。

BCG在2026年4月发布的Physical AI五级框架里,Level 2(视觉感知)是从Level 1(显式编程)走出来的第一步 (BCG)。这一步迈过去了,才有后面的灵巧操作、工作流规划和推理。现在整个行业正在跨越这一步——从"按程序走"升级为"看着做"。

跨越这一步的过程,就是视觉模组行业最大的产业机会。

当前的竞争格局还远未固化。奥比中光在3D视觉感知领域走得快,但海康机器人的制造和渠道能力不可小觑;梅卡曼德在工业引导领域积累深,但人形机器人是新战场;RealSense从Intel分拆后动作很大,但国产替代的浪潮正在加速;车载镜头厂跨界进来,可能用成本优势重塑模组环节的竞争;工业3D视觉厂商(如图漾科技这类玩家)的迁移,又给赛道注入了新的变量。

最终胜出的公司,大概率具备三个特征:全栈的技术能力、规模化的制造能力、跨赛道的复用能力。三个里面缺一个,都可能在某个阶段被卡脖子。

视觉模组这个赛道,不是具身智能大戏里的配角——它是这场大戏的开场戏。没有眼睛的机器人,只是机械装置;有了眼睛的机器人,才开始真正接近"智能"。

当一台机器人能"看懂"环境的时候,它能做的事情才刚刚开始。而那些给它装上眼睛的公司,也会在这个过程中,找到属于自己的位置。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×