<aside> 💡
English version refers to EvoCUA-1.5: Online RL for Multi-Turn Computer Use Agent
</aside>
Claude Code、OpenAI Codex 等具备目标解读、任务拆解、工具执行、中间结果检查以及多步骤计划修订能力的智能体系统的出现,重新激发了人们对一类更广泛的通用智能体——计算机使用智能体(Computer-Use Agent, CUA)——的兴趣。一个真正胜任的 CUA 必须能够端到端地操作一个通用计算环境:感知屏幕状态、与那些没有便捷编程接口的应用程序进行交互、在适当的时候调用工具或执行命令,并在整个任务过程中对动态、且往往只能局部观测的状态进行推理。
在真实的工作流程中,这要求的不仅是孤立的技能。CUA 必须在整个任务过程中维持单一、一致的任务状态,同时根据任务需要,在不同的交互方式之间灵活切换——包括对界面的直接操作、结构化查询,以及多步骤的工具调用。真正区分通用 CUA 与狭义的、面向特定任务系统的,正是这种整合能力,而不是任何单一的交互渠道。
训练这类智能体具有挑战性,因为环境的状态空间极为庞大,反馈也往往是异构的、延迟的,甚至是稀疏的。一种常见的策略是基于离线收集的轨迹进行优化。离线轨迹固然有价值,但其覆盖范围必然有限。由此产生的策略容易集中于数据集所代表的局部分布,一旦界面发生变化、出现意外的弹窗,或任务进入演示数据中未曾出现的长尾状态,模型就可能表现不佳。
在线强化学习提供了一条不同的路径。智能体使用当前策略与环境进行交互,获得可验证的反馈,并基于其实际遇到的状态进行自我更新。这对于 CUA 任务尤其具有吸引力,因为成功的行为往往需要探索、错误恢复以及反复调整。然而,正是这些使在线强化学习具有吸引力的特性,也使其实施变得困难:一次完整的轨迹可能涉及数十甚至数百次环境交互;奖励通常只在最终才返回;一次错误的动作就可能使整条长轨迹失效;此外,训练所使用的表示方式还依赖于推理阶段所采用的上下文管理策略。
EvoCUA 完成了基于离线自身经验的自进化,EvoCUA-1.5 在此基础上进一步引入 online RL,将自进化延伸到在线交互的场景中。这一版仍基于较早期的 Qwen3-VL 迭代,与最新基座存在天然差距,因此我们并不追求榜单分数的对齐,更希望借这一轮迭代,沉淀 online RL 的关键认知。

在介绍 CUA 的Online RL之前,先给出一个形式化定义,便于不了解该领域的读者后续阅读。
给定自然语言指令 $g$,交互过程被建模为一个元组 $(S, A, Z, O, P, R_{syn})$,分别代表状态空间、动作空间、思维空间、观测、状态转移函数和奖励函数。具体细节如下: