SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

Jichao Wang; Liuyang Bian; Yufeng Zhou; Han Xiao; Yue Pan; Guozhi Wang; Hao Wang; Zhaoxiong Wang; Yafei Wen; Xiaoxin Chen (陈晓昕); Shuai Ren; Lingfang Zeng

SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

Jichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao, Yue Pan, Guozhi Wang, Hao Wang, Zhaoxiong Wang, Yafei Wen, Xiaoxin Chen, Shuai Ren, Lingfang Zeng

Abstract

As Multimodal Large Language Models (MLLMs) mature, GUI agents are evolving from static interactions to complex navigation. While Reinforcement Learning (RL) has emerged as a promising paradigm for training MLLM agents on dynamic GUI tasks, its effective application faces a dilemma.Standard Offline RL often relies on static step-level data, neglecting global trajectory semantics such as task completion and execution quality. Conversely, Online RL captures the long-term dynamics but suffers from high interaction costs and potential environmental instability. To bridge this gap, we propose SOLAR-RL (Semi Online Long-horizon RL). Instead of relying solely on expensive online interactions, our framework integrates global trajectory insights directly into the offline learning process. Specifically, we reconstruct diverse rollout candidates from static data, detect the first failure point using per-step validity signals, and retroactively assign dense step-level rewards with target-aligned shaping to reflect trajectory-level execution quality—effectively simulating online feedback without interaction costs.Extensive experiments demonstrate that SOLAR-RL significantly improves long-horizon task completion rates and robustness compared to strong baselines, offering a sample-efficient solution for autonomous GUI navigation.

Anthology ID:: 2026.findings-acl.1222
Volume:: Findings of the Association for Computational Linguistics: ACL 2026
Month:: July
Year:: 2026
Address:: San Diego, California, United States
Editors:: Maria Liakata, Viviane P. Moreira, Jiajun Zhang, David Jurgens
Venue:: Findings
SIG:
Publisher:: Association for Computational Linguistics
Note:
Pages:: 24419–24432
Language:
URL:: https://preview.aclanthology.org/ingest-acl/2026.findings-acl.1222/
DOI:
Bibkey:
Cite (ACL):: Jichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao, Yue Pan, Guozhi Wang, Hao Wang, Zhaoxiong Wang, Yafei Wen, Xiaoxin Chen, Shuai Ren, and Lingfang Zeng. 2026. SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning. In Findings of the Association for Computational Linguistics: ACL 2026, pages 24419–24432, San Diego, California, United States. Association for Computational Linguistics.
Cite (Informal):: SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning (Wang et al., Findings 2026)
Copy Citation:
PDF:: https://preview.aclanthology.org/ingest-acl/2026.findings-acl.1222.pdf
Checklist:: 2026.findings-acl.1222.checklist.pdf

PDF Cite Search Checklist Fix data