Publication Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs Qibin Wang, Pu Zhao, Shaohan Huang, Fangkai Yang, Lu Wang, Furu Wei, Qingwei Lin 林庆维, Saravan Rajmohan, Dongmei Zhang ACL’26 findings
Publication Computer‑Using World Model Yiming Guan, Rui Yu, John Zhang, Lu Wang, Chaoyun Zhang, Liqun Li, Bo Qiao, Si Qin, He Huang, Fangkai Yang, Pu Zhao, Lukas Wutschitz, Samuel Kessler, Huseyin A. Inan, Robert Sim, Saravan Rajmohan, Qingwei Lin 林庆维, Dongmei Zhang ICLR’26 Workshop (World Models)
Publication Text2Grad: Reinforcement Learning from Natural Language Feedback Hanyang Wang, Lu Wang, Chaoyun Zhang, Tianjun Mao, Si Qin, Qingwei Lin 林庆维, Saravan Rajmohan, Dongmei Zhang ICLR’26
Publication Lean and mean: Decoupled value policy optimization with global value guidance Chenghua Huang, Lu Wang, Fangkai Yang, Pu Zhao, Zhixu Li, Qingwei Lin 林庆维, Dongmei Zhang, Saravan Rajmohan, Qi Zhang ICLR’26
Publication Thread: A logic-based data organization paradigm for how-to question answering with retrieval augmented generation Kaikai An, Fangkai Yang, Liqun Li, Junting Lu, Sitao Cheng, Shuzheng Si, Lu Wang, Pu Zhao, Lele Cao, Qingwei Lin 林庆维, Saravan Rajmohan, Dongmei Zhang, Qi Zhang, Baobao Chang EMNLP’25 main
Publication ExeCoder: Empowering Large Language Models with Executability Representation for Code Translation Minghua He, Fangkai Yang, Pu Zhao, Wenjie Yin, Yu Kang, Qingwei Lin 林庆维, Saravan Rajmohan, Dongmei Zhang, Qi Zhang EMNLP’25 Main
Publication Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention Mengqi Liao, Lu Wang, Chaoyun Zhang, Bo Qiao, Si Qin, Qingwei Lin 林庆维, Saravan Rajmohan, Dongmei Zhang, Huaiyu Wan ACL‘26 Fingdings
Publication Process Rewarding via Solution-Space Alignment ChenZhuo Zhao, Yue Huang, Pu Zhao, Fangkai Yang, Lu Wang, Lin Ma, Zhi Yang, Youling Huang, Xinda Wang, Junting Lu, , Qingwei Lin 林庆维, Saravan Rajmohan, Dongmei Zhang EMNLP’26 main
Publication Ufo2: The desktop agentos Chaoyun Zhang, He Huang, Chiming Ni, Jian Mu, Si Qin, Shilin He, Lu Wang, Fangkai Yang, Pu Zhao, Chao Du, Liqun Li, Yu Kang, Zhao Jiang, Suzhen Zheng, Rujia Wang, Jiaxu Qian, Minghua Ma, Jian-Guang Lou, Qingwei Lin 林庆维, Saravan Rajmohan, Dongmei Zhang TMLR’26
Publication PEARL: Perturbation Efficient Alignment Group Relative Reinforcement Learning Yue Huang, ChenZhuo Zhao, Zhi Yang, Pu Zhao, Fangkai Yang, Lu Wang, Mengqiao Liu, Qingwei Lin 林庆维 147. EMNLP’26 Findings