在人工智能领域,让AI真正融入物理世界,远比想象中复杂得多。想象一下,当客厅里电视播放着节目,厨房的油烟机嗡嗡作响,老人和孩子同时说话时,AI不仅要准确识别出哪句话是对自己说的,还要理解“有点口渴”背后的真实需求,并协调不同设备完成服务。这绝非简单地将大模型接入音箱就能实现,而是需要构建一套完整的系统,让AI在物理世界中具备感知、交互和执行能力。
过去几年,大模型技术飞速发展,但始终难以突破对物理世界的感知与操作瓶颈。如何让AI从数字世界走向现实,成为行业关注的焦点。在近期举行的世界人工智能大会上,参数比拼和单品展示逐渐退居次席,取而代之的是算力底座、模型矩阵和数据基础设施的竞争。企业开始意识到,仅靠单一模型性能已无法取胜,底层基座与完整生态链的构建才是关键。
京东以“AI进入物理世界”为主题参展,展示了其在数字智能、附身智能和具身智能领域的技术路线与落地成果。凭借20余年积累的供应链能力、真实场景和产业数据,京东构建了AI在物理世界中训练、验证和创造价值的闭环。其目标不仅是成为全球最大的物理世界运营中心,更为全行业提供可复制的物理AI解决方案。
走进京东展台,观众看到的不是单一产品,而是一整套场景化解决方案。样板间内,台灯能辅导作业,床垫可监测睡眠,茶吧机听到“有点口渴”便主动出水;具身智能展区,观众通过头戴设备完成理货动作,数据经标注、仿真训练后,直接部署到零售小站的机器人上;展区外,物流无人机、AI智采管家和AI医生分别解决不同场景的实际问题。这些展示让人感受到,AI似乎真的开始理解物理世界了。
当前,大模型能力趋于同质化,具身智能虽火热却难以大规模落地。行业逐渐认识到,AI要进入物理世界,需学习人类操作方式、手眼协调及复杂环境应对能力。无论是家庭主动服务还是机器人理货作业,核心挑战在于构建足够强的模型底座、复杂环境交互能力及高质量数据。京东提出数字智能、附身智能和具身智能三层技术路线,三者递进关联:数字智能提供基础能力,附身智能实现终端交互,具身智能扩展至硬件执行。
在数字智能方面,京东展示了面向物理世界的JoyAI模型矩阵,涵盖图像编辑、长视频生成、实时交互、语音和视频编辑等多个方向。这些模型为AI进入家庭奠定了基础,但真实场景的复杂性远超想象。家庭成员多、设备多、场景多,且容错率低,AI需为结果负责。例如,用户只需告诉AI“我想吃外焦里糯的红薯”,设备应自主判断温度、时间和模式,而非依赖用户设置参数。这要求AI具备更高可靠性,否则责任转移将导致用户信任缺失。
推动AI走向现实,离不开算法、算力和数据的支撑。京东集团副总裁指出,行业瓶颈不在于数据量,而在于高质量数据的稀缺。机器人需学习的是人手操作物体的真实经验,而非互联网知识。为此,京东计划建设全球最大具身智能数据采集中心,两年内采集1000万小时高质量数据。尽管数据采集无标准答案,京东已迭代十多次理解框架,并持续优化成本,数据处理效率显著提升。
更关键的是,京东选择开放生态,而非独占资源。其JoyInside平台已覆盖超200家品牌,2026年预计接入超千万台终端;同时开源了人类第一视角数据集EgoLive,包含2000小时高保真视频数据,覆盖346个任务。京东的目标是在物理世界智能化转型的窗口期,为行业铺就一条进入现实的路,而非垄断所有业务。当物理世界开始智能化时,京东希望成为那个提供基础设施和解决方案的引领者。















