【具身AGI导读】一场访谈里,一位清华教授把触觉从视觉模型的输入位上挪开:它不需要那么丰富的语义,但需要足够低的延迟。
9 月 15 日,雷峰网「物理AI 50人」栏目刊出对清华大学教授丁文伯的一篇访谈——他同时是 Xspark AI(无界智航)联合创始人兼首席科学家。
访谈中,丁文伯提出「触觉原生智能」:触觉智能不该只被当作视觉模型的一种新输入,而应更轻、更快、更靠近身体。他用人的「脊髓」作类比——处理的信息可以没那么丰富,但延迟要足够低,能在滑动、碰撞、失衡发生的一瞬间做出反应。Xspark AI 还提出一套「慢脑—快脑—脊髓」三层架构,作为这一判断现阶段的工程表达,触觉主要落在快脑与脊髓两层。
这套主张瞄准的是一个更大的分岔。在具身智能这条线上,一种做法是把触觉当成感知的补位者——视觉判定不够确定时,用它补上接触发生之后的信息:杯子有没有开始滑动,手指是不是捏得太紧,一个动作该继续用力还是立刻修正。另一种做法往前多走一步:既然触觉对反馈效率的要求和视觉不同,它需要的可能是更低的延迟、更靠近本体的计算,以及一套自己的模型与逻辑。按丁文伯的说法,触觉进入机器人决策主要落在两个环节——防碰撞与安全,以及手内灵巧操作的后训练,触觉的引入与深度融合放在后训练阶段,重点发挥它对精细动作修正的支持。
但这条路压在三个「跨」上——跨传感器、跨模态、跨本体,分别对着硬件、数据与表征。他提到,不同触觉传感器之间的一致性依然很差,即使同一批次生产,性能也可能存在明显差异,结果是一个模型往往只能锚定某一种传感器继续训练;触觉也没有互联网时代天然积累下来的海量图片和视频,同一个动作换一个人、换一个传感器、换一个机器人,数据分布都可能变;更基础的一层是,不同传感器采到的力、温度、剪切与振动,有没有可能被转成某种与硬件无关的共同表征,目前还没有答案。他给这段路留出的时间是两三年,甚至五年。
而在模型该从哪儿学这一步上,路径并没有收敛——深度机智(北京)科技有限公司给出的答案是人类真实数据。
丁文伯并没有说,一套成熟的「触觉大模型」已经有答案——他承认,目前更现实的仍是一条折中路线:短期先把某一种多模态触觉传感器或触觉方案做好,再与现有模型融合;至于长期,他才倾向于认为,触觉最终会形成自己的模型和逻辑。真正没有被定义清楚的是:触觉究竟只是现有视觉模型增加的一路输入,还是会因为接触、运动与实时反馈的特殊要求,长出一套不同于视觉智能的模型与计算逻辑。
一种感知模态要不要有自己的智能形态——这道题,不是给视觉模型多加一路输入就能回答的。
参考资料
雷峰网 · Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的「脊髓」|物理AI 50人 · 2026-09-15
