Zejun Xu

M.S. student in Intelligent Technology
Macau University of Science and Technology

I work on GUI / browser agents — how to rigorously evaluate them on real websites, and how to train them with reinforcement learning and distillation. I am the first author of CAP-Bench (COLM 2026), a benchmark of 420 cross-site tasks over 108 real-world websites with a verifiable agent-as-a-judge evaluation framework.

Previously, I was a research assistant at TsinghuaNLP & OpenBMB (advised by Prof. Zhiyuan Liu) working on MiniCPM fine-tuning, AgentCPM, and RL for agents, and an algorithm & benchmark engineer at Fellou AI. I also build and open-source agent infrastructure. I am seeking Ph.D. opportunities (Fall 2027) in agents, VLMs, and RL.

Portrait of Zejun Xu

News

Jul 2026 CAP is accepted at COLM 2026 as a conference paper.
2026 An earlier version of CAP was accepted at the Lifelong Agent Workshop @ ICLR 2026.

Publications

CAP benchmark overview figure
CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception
Zejun Xu*, Taiyi Chen*, Jin Li*, Yongtong Gu*, Qi Cheng, Aixuan Lv, Shuai Zhu, Pengfei Zhu, Kaichen Yang, Boyu Sun, Yixian Yang, Mulong Xie, Xin Liu, Dagang Li, Xiaoteng Ma, Hongru Wang
* Equal contribution
COLM 2026Third Conference on Language Modeling
420 cross-site tasks · 108 real-world websites · 24 domains · verifiable agent-as-a-judge evaluation. Earlier version at the Lifelong Agent Workshop @ ICLR 2026.
Other: Xinzhu Liu, Shiyu Zhou, Yuhe Wang, Zejun Xu, et al. Research on the Influence Mechanism of Tourism Behavior Intention of Chinese and Russian Tourists in Northeast China Based on PLS. Areal Research and Development, 2025, 44(3): 89–95. (CSSCI)

Open-Source Projects

Enterprise multi-user agent platform: per-user session isolation, frontdesk→worker delegation, an unforgeable end-user identity trust chain, containerized execution, and RBAC with multi-tenant isolation.
TypeScript48K+ LOC855 tests45 ADRs
Benchmark and verifiable agent-as-a-judge evaluation framework for cross-site browser agents, with a public leaderboard.
PythonCOLM 2026
LLM-driven presentation editor: natural-language slide generation, in-browser visual editing, and PPTX import/export.
JavaScriptMIT

Experience

Jan 2026 – Mar 2026
Macaron AI (Mind Lab)
Research Intern — on-policy distillation
May 2025 – Apr 2026
Tsinghua University (TsinghuaNLP) & OpenBMB
Research Assistant, advised by Prof. Zhiyuan Liu — MiniCPM fine-tuning, AgentCPM, PPO/GRPO
May 2025 – Apr 2026
Fellou AI
Algorithm & Benchmark Engineer — CAP-Bench; model fine-tuning, quantization, and distillation
Sep 2024 – Nov 2024
Institute of Computing Technology, Chinese Academy of Sciences
Deep Learning Intern, advised by Prof. Shuqiang Jiang — LLM SFT, RAG, 100K+-entry dataset construction
Apr 2024 – Jun 2024
iFlytek
Assistant Computer Vision Engineer — 3D point-cloud perception, human-pose models