
怎样让 AI 更灵巧地操作手机、电脑界面?开云kaiyun.com
浙江大学与通义实验室 Mobile-Agent 团队在 UI-R1 的基础上,推出全新商榷收尾——UI-S1,忽视了一种名为半在线强化学习(Semi-online Reinforcement Learning)的创新检修范式。
该使命和会了离线检修的清闲性与在线学习的长程优化智力,在不依赖真正环境交互的前提下,显耀进步了模子在动态多轮任务中的进展。

也便是说,这种法子用的也曾离线学习的现成操作数据,但会模拟在线学习的过程。

底下来望望是怎样作念到的。
用"离线"数据,模拟"在线"过程中枢问题:传统法子的局限性
现存的 GUI Agent 检修主要依赖两类强化学习范式:
离线强化学习(Offline RL)
欺诈事先网罗的群众轨迹进行检修,具有高清闲性与低部署资本,但其实质是"活动克隆 + 单步效法",枯竭对轨迹级奖励信号的学习智力,难以应付需要恒久探求的任务。在以下任务中:基于离线学习的模子进展出早停娇傲,面对长程任务枯竭有用的探求。

在线强化学习(Online RL)
通过与真正环境合手续交互赢得反馈,概况捕捉到任务完成与否的全局奖励信号,适用于多步决策优化,但靠近奖励稀少、试错资本不菲以及检修不屈定等问题。
因此,如安在无需时时真正交互的前提下,赋予模子同样在线学习的高低文连贯性和长程推奢睿力,成为冲破瓶颈的关节。
惩处决议:三大中枢时刻构建半在线学习框架

为惩处上述矛盾,商榷团队忽视了三项关节时刻,共同组成 UI-S1 的中枢架构:
半在线机制:在离线数据中模拟在线交互
离线学习的轨迹是固定的,只可将群众轨迹的动作(* 示意)作为历史:

而在线学习的轨迹是不错动态变化的,将模子我方的原始输出(π 示意)作为历史:
UI-S1 初度忽视半在线强化学习范式,其中枢想想是在固定离线轨迹的基础上,在每次 rollout 过程中保留模子自己的原始输出(包括动作聘用与想维链),而非仅使用群众动作作为历史输入。
这一筹备使得模子概况在检修中体验"自我活动带来的高低文变化",从而增强计谋的一致性和多轮连贯性。
换言之,即使莫得真正环境反馈,模子也能"感知"我方畴昔的活动,并据此调理后续决策,杀青了对在线学习过程的有用模拟。
补丁机制(Patching Module):自得当设立采样偏差
由于模子在 rollout 中可能偏离群众旅途,导致后续景色无法匹配原始轨迹,商榷者引入了可配置的补丁机制,以复原被中断的操作流。具体包含三种计谋:
Thought-Free Patch:仅修正失实动作,保合手原想考过程不变
Off-Policy Thought Patch:调用更强外部模子重写失实想维链
On-Policy Thought Patch:教唆模子自己生成正确的推理旅途
此外,提高补丁次数上限可显耀进步模子打听完整轨迹的智力,进而增强对后期体式的学习效果。
分析流露,更高的补丁阈值有助于保管计谋熵,驻守过早管制,促进探索千般性。
长程奖励建模:从体式级到轨迹级的上风估量
为了弥补传统离线 RL 无法拿获将来收益的弱势,UI-S1 引入了带扣头因子的将来奖励传播机制。关于每个中间体式,系统不仅算计其即时规矩奖励

还相连将来体式的潜在价值(按衰减因子 γ 加权)变成概述奖励:

有了这个体式级别奖励,商榷者们用其估量归拢个体式组内的体式级别上风,

临了一步的上风被作为轨迹级别上风,用于评估轨迹是否完成:

商榷者将两个级别的上风加权后(
),摄取动态采样的花式优化计谋模子:

评测立异:SOP ——更贴近真正进展的动态评估主义
针对传统静态评测(如 AC-High)无法响应多轮容错智力的问题,商榷团队忽视了新的评测——SOP(Semi-online Performance)。
该契约保留模子每一轮的真正输出,一朝出现失实即闭幕任务,全面模拟真正使用场景下的连气儿交互过程。收尾标明,SOP 与真正在线性能高度对皆,且支合手更高任务千般性和更快评估速率,填补了现存评测体系在动态性与实用性之间的空缺。

实验收尾:全面超越基线,贴近顶尖闭源模子
在多个主流 GUI 自动化基准上的测试中,UI-S1-7B 展现出超卓性能:
实验收尾
相当是在 AndroidWorld 任务中,UI-S1-7B 取得了34.0%的任务班师率,接近 GPT-4o(34.5%)与 UI-TARS-7B(33.0%),显耀优于纯 SFT 或离线 RL 法子。
值得堤防的是,部分基线法子在动态评测中致使不如基础模子,响应出其在多轮泛化方面的压根弱势。

同期,在单轮任务(如 GUI Odyssey)上,UI-S1-7B 仍保合手 +7.1% 的增益,说明半在线检修并未烽火局部精度,杀青了"乱骂兼顾"的双重优化。

在惯例的 GUI 单轮评测上,UI-S1-7B 比拟于 base 模子也有一定程度的进步(比如 GUI Odyssey +7.1),评释了半在线法子并莫得烽火单轮量度智力。
深切分析:机制有用性与可扩张性考证补丁机制显耀进步数据欺诈率
作为 UI-S1 框架的中枢组件之一,补丁模块(Patch Module)在保管检修清闲性与进步计谋泛化智力方面施展了不成替代的作用。
其筹备初志在于惩处半在线强化学习中一个根人性矛盾:模子在 rollout 过程中不成幸免地会偏离原始群众轨迹,导致后续景色无法对皆真正数据,从而中断统统这个词轨迹的学习进度。
为缓解这一问题,商榷团队引入了可颐养的补丁机制,允许系统在检测到操作偏差时,以有限次数对历史动作或想维链进行修正。通过建树超参数阈值限定每条轨迹最多可修补的次数,商榷东谈主员系统评估了不同配置下的性能变化。

实验收尾标明,提高补丁阈值显耀进步了模子在 SOP 和 AndroidWorld 两个动态评测基准上的进展。
在具体修补计谋的聘用上,商榷对比了三种典型决议,揭示了性能与效用之间的深层权衡:
On-Policy Thought Patch
由主义计谋模子自己重重生成正确的推理过程,在语义格调停推理节拍上与原输出高度一致,因此能提供最当然的高低文衔尾,带来最优性能。有关词,该法子需脱落履行完整的前向推理,算计支出较大,不利于大限制检修。
Thought-Free Patch
仅修正失实的动作标签,保留原有的想维链不变。尽管未设立潜在的逻辑弱势,但由于 GUI 动作空间相对结构化且可通过规矩校验,该花式在实践中进展出接近最优的性能,同期险些不引入脱落算计资本,具备极高的工程实用性。
Off-Policy Thought Patch
借助外部更强的大模子(如 GPT-4)重写失实的想考过程。固然表面上可提供更高质料的推理率领,但因生成格调、术语使用与主义模子存在散布偏移,反而可能导致高低文断裂或误导检修主义,执行效果不如预期。
更进一步分析发现,较大的补丁阈值有助于在检修过程中保管较高的计谋熵(policy entropy),即模子在动作聘用上的不笃定性水平。
较高的熵值响应了更丰富的探索活动,幸免计谋过早管制于少数高频旅途。
这说明补丁机制不仅是瑕疵雠校器用,更是促进计谋千般性和驻守模式坍缩的进攻技能。

数据缩放规矩揭示高效学习后劲
商榷标明,UI-S1 的性能增长得当指数型数据限制律。
跟着补丁阈值从 0 增至无限,指数总共 k 从− 1.13 进步至− 0.73,标明单元数据带来的旯旮收益廓清改善。
这意味着即使在有限数据要求下,该法子也能更充分挖掘非完好轨迹中的监督信号,具备考究的小样本得当智力。

消融实验阐述关节组件孝顺
消融实验进一步考证了多个中枢组件的时刻孝顺。
最初,在将来奖励建模方面,扣头因子 γ 的建树对多轮任务进展具有决定性影响:当 γ =0(宽裕忽略将来奖励)时,模子性能最低;而在 γ =0.5 时达到峰值,说明放置纳入长程优化信号可显耀进步计谋的全局一致性与任务完成率,突显了半在线范式在拿获跨步依赖联系上的上风。

其次,在检修范式组合上,聚会使用监督微调(SFT)与半在线强化学习(Semi-online RL)的效果廓清优于任一单独法子——在 AndroidWorld 基准上,组合决议取得 34.0% 的任务班师率,远离高出仅用 Semi-online RL(30.4%)和仅用 SFT(21.7%)的配置,且平均任务完成步数更少,标明其具备更强的旅途探求与履行效用。
临了,同期引入轨迹级与体式级上风函数算计,并保留多帧历史不雅测信息(包括动作、想考链与界面景色),均被证实对最终性能有正向增益,去除任一组件均会导致性能下跌,说明这些筹备共同守旧了模子在复杂 GUI 交互中的隆重决策智力。

样例分析

商榷者们展示了一项复杂的跨应用任务,该任务要求在多个操作体式中合手续保留关节信息:从 Simple Gallery 中稽察一张包含来往信息的图片,并在 Markor 应用中创建文献纪录该信息。
实验标明,基础模子和离线强化学习(Offline RL)模子在履行过程中出现了想维与动作不一致的问题。
举例,Offline RL 模子在探求完切换至下一应用后便提前闭幕操作,可能因其过度拟合局部奖励,未能统筹后续任务主义。而经过监督微调(SFT)的模子则在进程中遗失了关节信息,导致履行冗余操作,如尝试创建一个已存在的文献。
比拟之下,基于半在线强化学习(Semi-Online RL)框架的 UI-S1 模子在统统这个词 12 步操作序列中保合手了清闲的高低文连贯性,班师将来往信息" 2023-03-23, Monitor Stand, $33.22 "准确以 CSV 体式写入文献。
这一进展考证了该法子在学习多轮复杂活动方面的上风,杀青了推理过程与动作履行的高度对皆。
商榷者合计,该收尾体现了半在线范式在进步 GUI 智能体长程探求智力与任务鲁棒性方面的关节作用。
感敬爱的一又友可戳下方点连气儿赢得更多内容~
论文地址:https://arxiv.org/abs/2509.11543
技俩代码:https://github.com/X-PLUG/MobileAgent/tree/main/UI-S1
模子地址:https://huggingface.co/mPLUG/UI-S1-7B
一键三连「点赞」「转发」「小心心」
宽待在挑剔区留住你的见地!
— 完 —
� � 点亮星标 � �
科技前沿进展逐日见开云kaiyun.com