返回新闻与洞察

当 Physical RSI 走向生产:现实不能跟着模型试错。

持续进化的具身智能,需要一条稳定的运行边界。

当 AI 开始参与编写机器人控制代码、改进技能和安排实验,具身智能正在获得一种新的能力:把每一轮实践中验证有效的经验,带入下一轮能力改进——这正是我们所说的 Physical RSI。它的目的是让大模型持续提升的能力,更快、更稳定地进入真实生产,成为客户可以持续使用的智能服务。但研发循环加速之后,一个矛盾会更加突出:代码可以重写,技能可以更新,已经发生的物理动作却无法原样撤销。新能力产生得更快,生产现场是否也能更快地采用它?

Physical RSI 真正走向生产,不仅要让模型持续进化,还要让生产系统安全接住这种进化——这需要一条连接持续改进与稳定运行的路径:既能确认新版本确实更好,也能让它安全地重新进入现实。在上一篇关于异构机器人协同的工厂实践中,我们讨论了 Agent 如何把一件事真正做完。当任务开始持续运行、能力开始不断更新,我们需要进一步回答:如何设计系统边界,才能让现场既保持稳定,又持续接纳新的能力?

系统进入持续运行,边界才真正清晰

在客户现场一个月的调试与连续运行中,这条异构机器人协同链路逐步进入真实业务流程,也让我们确立了一个核心立场:生产系统可以迭代,但不能让未经验证的改进直接作用于现实。

拉格朗日具身 · 现场协同作业

真实生产从来不是理想条件。在我们进入的现场,高温、油污是设备长期运行必须面对的现场条件;上午与下午明显变化的光照,也持续考验着感知稳定性。业务信号可能延迟或错配,设备和传感器也有客观的感知与执行边界。 **生产系统的可靠性,不是没有异常,而是异常发生后能够被及时发现、阻止扩散,并恢复到可继续运行的状态。**比如,我们收集到的一个异常 Case 中:现场信号延迟 → 系统误判装料完成 → 流程提前进入卸料环节 → AGV 实际空载 → 末端保护触发 → 后续动作被阻断。

回看各系统日志和现场数据后,我们确认了一个关键事实:系统记录的任务进度与现场实际状态发生了错位,AGV 的实际位置、装载事实和业务状态不再一致。物理世界没有撤销键,恢复不能只回滚一条软件状态。只能先阻断错误动作,再从现场当前状态重新对齐整条任务链路:清理旧任务和失效上下文,建立新的任务链路,并核验恢复结果。已经验证有效的保护继续固化,尚未确认的根因则保留证据、持续收敛。

这不是某一条产线的特例。只要任务在持续运行、模型和 Skill 在不断更新,让智能系统进入真实现场的团队,就会反复面对三类问题:**状态错位了不知道、模型改了不敢上、出了问题说不清是哪版的锅。**行业里常见的应对是“加人工盯盘”“全量回归”“拉群复盘”,但这些方式的成本会随系统复杂度快速上升——从一条链路到十条链路、从一个任务到上百个 Skill,仅靠人工逐项核对,已经难以支撑这种规模。当 Agent 开始持续提出改进候选,原本依赖工程师逐次理解、核对和放行的过程,也需要转化为系统能够执行的规则。候选产生得越快,验证与发布就越容易成为瓶颈。

一次恢复不只是让报错消失,而是让系统重新获得安全继续任务的条件;长期运行中,即使模型和 Skill 持续变化,这条执行边界也不能失效。

模型持续进化,系统如何守住运行边界

随着世界模型、VLA 等具身模型持续增强,系统理解环境、预测状态和生成动作的能力都在提高。但对生产系统而言,能力更强并不意味着模型输出可以直接成为设备命令。模型给出的首先只能是行动提案——它能否执行,取决于当前任务、设备状态、权限和安全条件;执行之后,也必须由现场证据确认结果,而不是由模型自行宣布完成。

智能通过 Agentic OS 在真实物理世界中受控运行并完成恢复

这条边界既要约束一次行动能否执行,也要约束一个新版本能否进入现场。早先在 B 端视觉量产业务中,我们已经见过缺少后者的代价。

长尾场景真正棘手的,不是平均指标不够高,而是不同现场往往存在内部评测难以覆盖的局部条件。在烟火检测、安全帽与安全服识别等任务中,新版本的内部指标即使有所提升,现场问题也未必随之收敛:一个摄像头上的误报刚被修复,另一个此前未暴露的角度、光照或物体形态,又可能触发新的误报。模型对第一个场景的适配,也可能演变为对局部条件的过拟合。一个问题单关闭,另一个意料之外的问题单随即出现——问题并未真正收敛,而是在不同现场之间迁移。

当稳定运行成为首要目标,最直接的选择往往是锁定一个已经过现场验证的版本。但版本锁定并没有消除变化,只是将变化推迟并累积起来。等到升级不可避免,一次发布往往已经跨越多个版本;一旦再次出现问题,归因边界也随之消失。版本冻结、改进积压、跨版本升级、再次难以归因,由此形成循环。这段经历留下的真正教训,不是模型不能迭代,而是生产系统缺少一条让变化安全进入现场的路径。这样的学费,我们不准备在具身智能里再交一次。

稳定的运行边界不是拒绝变化,而是让经过验证的改进可以更频繁、更安全地进入现场。现有的机器人技术栈已经积累了通信、控制、生命周期管理和安全保护等基础能力,工作流、设备运行体系和控制系统继续负责确定性执行与安全底线。但当模型、Skill 和跨设备任务持续变化时,这些能力还需要形成贯穿整条执行链路的统一运行秩序——任务身份、运行版本、行动授权、状态证据和异常恢复,必须始终保持一致。Agentic OS 要建立的,正是这套让动态智能能够持续进入生产的系统秩序。

异常处置与恢复

零件脱落后异常处置:现场异常进入任务系统,告警、暂停、处置与异常恢复可见、可追踪。

这套边界并不要求模型永远正确。相反,它默认模型、软件、设备和环境都可能出现偏差:条件不满足,行动不下发;结果无法确认,任务不推进;状态发生冲突,先停止扩散,再根据现场当前状态恢复,必要时交给人工。

模型可以持续进化,但进入现实的规则不能跟着漂移。

让现场证据推动能力持续进化

当一次任务能够在稳定边界内运行和恢复,现场就有了第二重价值:它不只是任务发生的地方,也开始成为下一版能力的证据来源。

Physical RSI 不是让模型直接改写生产系统,也不是把一次训练或调参包装成“自进化”。它要建立的,是一条受控的能力演进链路:现场运行产生证据,证据推动代码、Skill、模型或配置形成改进候选;Agent 可以依据现场证据参与失败分析并验证候选。候选经过评测、安全门禁和审批后,才以新版本重新进入现实。经过验证的经验再用于下一轮改进,生产系统则负责约束这些变化进入现实的条件。

从真实运行到受控再发布:两条闭环通过 Agentic OS 共同边界连接

因此,一个现场 Incident 在恢复生产之后,还要沉淀为可追溯、可复验的评测案例:哪些条件触发了异常,候选版本是否解决了问题,原本有效的能力是否仍然成立。这些案例要成为后续版本反复检验的共同基准,而不是随问题单关闭而结束的记录。

现场反馈不再只是一次性交付经验,而是沿着“运行—证据—改进—评测—再运行”的受控链路,推动新能力重新进入现实。

Physical RSI 的价值,不在于让模型更频繁地变化,而在于让每一次真实运行都成为下一版能力可复验的起点。当现场证据能够推动改进、评测和受控再发布,持续进化才会从模型能力,变成生产系统能够承接的工程能力。

拉格朗日具身技术