大模型会回答,但不会抓取;会规划,但不会在碰撞后修正。2025至2026年,CCF YOCSEF长三角五大分论坛围绕具身智能连续组织了十余场专题活动,最终形成一个核心判断:具身智能不是AI的“应用分支”,而是一个正在形成的新兴交叉学科问题域。这份白皮书首次将具身智能的研究对象定义为“物理交互中的智能行为”,提出三大基本问题与一个应用需求的分析框架,为高校学科建设提供了清晰的路线图。
研究对象——物理交互中的智能行为
三个关键词定义学科边界
具身智能的研究对象可以概括为“物理交互中的智能行为”,包含三个关键词。“物理”意味着智能系统不再只处理符号和数据,而要进入有重量、惯性、摩擦、接触、遮挡、延迟、损耗和风险的世界。一个机械臂抓取错误,可能导致零件损坏、产线停机或人员受伤,与语言模型回答错误的后果有本质区别。
“交互”意味着智能不是一次性输出,而是持续闭环。系统必须感知环境,选择行动,执行动作,接收反馈,判断后果,并在失败或不确定中修正策略。传统PID控制、运动控制和视觉伺服服务于相对确定的任务边界;具身智能面对的是更开放场景中的未知后果。
“行为”意味着研究对象不是静态能力,而是一套可被观察、评价和追责的行动过程。具身智能既要会理解任务,也要会行动;既要能形成计划,也要能执行;既要能完成目标,也要能说明失败、降级和回滚。
为什么过去没有进展到“智能物理交互”的程度
具身智能并非一个新概念,但过去研究很难真正推进到“智能物理交互”的程度,原因在于多个基础条件长期不足:本体能力不足——早期机器人在灵巧性、耐用性、柔顺性方面受限;传感与执行闭环不足——物理交互中的关键经验难以低成本采集;真实交互数据不足——具身智能没有同等规模的“现成语料”;环境开放度不足——传统自动化系统只能在封闭流程中取得成功。
现在多个阈值正在同时被跨过。硬件、数据、仿真、模型和制度五个维度都在发生质变。教育部2026年本科专业目录已将“具身智能”列入交叉学科门类新专业,工信部人形机器人与具身智能标准化技术委员会成立,上海、苏州、杭州、安徽等地陆续发布具身智能相关政策。
三大基本问题——学科建设的知识骨架
基本问题一:智能行动能力如何生成
行动能力至少包含四层能力:任务理解——把自然语言和任务约束转化为可执行问题;动作生成——选择合适的动作序列并适配本体能力;执行反馈——在行动过程中感知状态变化和识别失败;后果治理——在风险升高时降级、停机、求助或回滚。
围绕行动能力生成,论坛中最集中的分歧是端到端学习与机理融合。端到端路线的价值在于可能从大量任务中学习可迁移规律;机理融合路线则强调物理约束、安全边界必须被显式建构。更稳妥的判断是把规模学习与结构建构分层组织,使系统既免于僵化又免于失控。
基本问题二:物理交互经验如何获得、表征与验证
具身数据不是现成语料,而是在行动过程中产生的过程数据。一次抓取、一次装配、一次巡检都包含环境状态、身体状态、感知信号、动作指令、结果与反馈五种信息。如果缺少其中任何一类,数据都可能难以复用。
物理交互经验的来源包括合成数据、仿真环境、数字孪生和真实操作数据。它们不是互相替代关系,而是分工关系。合成数据低成本可控;数字孪生把真实系统映射到可计算空间;真实操作数据负责校准和验收。更可行的路线是建立“虚实协同”的数据闭环。
基本问题三:安全可信的开放物理交互如何建立
安全在具身智能中是一个平行于行动能力和物理经验的独立基本问题。“带外脆弱性”描述了传统数字安全边界之外的物理域风险——声波、光束、振动、电磁扰动可能绕过网络协议直接影响传感器和控制系统。
具身智能安全有独立研究对象(物理攻击面、传感器欺骗、执行器失控、人机共处风险)、独立方法体系(红队测试、分级评估、日志审计、人工接管)和独立评价标准(可审计、可回滚、可追责、可隔离)。安全教育应从原则教育变成系统能力训练。
学科建设七项建议
从研究议程到制度设计
白皮书提出七项具体建议。建立围绕三大基本问题的研究议程——行动能力生成、物理交互经验获取与验证、安全可信交互,以及应用价值与场景评估,形成长期课题群。
建设平台基础设施——开放具身数据平台、仿真与真实场景联动平台、机器人操作系统框架、场景级测试场。平台应遵循“可共享、可复现、可审计、可迭代”原则。
建立标准与评价体系——行动能力评价覆盖任务成功率、跨场景泛化、失败恢复;物理经验评价覆盖数据质量、仿真到真实迁移;安全可信评价覆盖带外攻击、日志审计、责任链;应用价值评价覆盖成本、节拍、ROI、用户体验。
建设学科共同体——跨区域具身智能学科建设联盟,围绕基本问题形成持续工作方向。
建设课程、教材与联合培养机制——基础理论、系统方法、场景实践、治理与价值四类课程模块。
分阶段推进路径——1-2年形成方向与课程雏形,3-5年形成平台与联合培养机制,5年以上形成稳定学科方向。
风险与缓解——避免概念先行而问题不稳、专业设立而交叉不足、演示能力强而评价体系弱、产业牵引强而教育积累弱。
具身智能真正的突破,不会只来自更大的模型、更灵巧的本体或更多的应用场景,而会来自这些要素被组织为可持续的学科共同体之时。