Ax Qisong Zhang (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Wenzhuo Wu (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Zhuangzhuang Jia (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Yunhao Yang (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Huayu Zhang (Institute of Artificial Intelligence), Xianghao Zang (Institute of Artificial Intelligence), Zhixiang He (Institute of Artificial Intelligence), Zhongjiang He (Institute of Artificial Intelligence), Kongming Liang (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Zhanyu Ma (School of Artificial Intelligence, Beijing University of Posts and Telecommunications) 5/6/2026

DataEvolver: Let Your Data Build and Improve Itself via Goal-Driven Loop Agents

DataEvolver: closed-loop visual data generation system using goal-driven agents for iterative dataset creation and improvement.

Ax George Fatouros, Georgios Makridis, John Soldatos, Dimosthenis Kyriazis, Pedro Malo, George Kousiouris, Giannis Ledakis, Louiza Kachrimani, Panagiotis Rizomiliotis, Bruno Almeida, Despina Tomkou, Kostas Metaxas, Konstantinos Ilias, Christos Gkizelis, Ernstjan de Gooyert, Amin Babazadeh, Kostis Mavrogiorgos, Pepi Paraskevoulakou, Christos Xenakis, Giannis Chouchoulis, Konstantina Tripodi 5/6/2026

CyberAId: AI-Driven Cybersecurity for Financial Service Providers

AI-driven cybersecurity system for financial institutions using LLMs to enhance SOC reasoning capacity and alert investigation.

Ax Alexander Smola 5/6/2026

Submodular Benchmark Selection

arXiv paper formalizing efficient benchmark selection for LLM evaluation as submodular maximization problem.

Ax Ruoqi Liu, Imran Q. Mohiuddin, Austin J. Schoeffler, Kavita Renduchintala, Ashwin Nayak, Prasantha L. Vemu, Shivam C. Vedak, Kameron C. Black, John L. Havlik, Isaac Ogunmola, Stephen P. Ma, Roopa Dhatt, Jonathan H. Chen 5/6/2026

PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments

arXiv paper introducing PhysicianBench, a benchmark for evaluating LLM agents on long-horizon clinical workflows in real EHR environments.

Ax Yiheng Zhang, Yiming Wang, Kaiyan Zhao, Zhenglin Wan, Jiayu Chen, Leong Hou U 5/6/2026

ANO: A Principled Approach to Robust Policy Optimization

ANO optimizer unifies trust region frameworks to address PPO's hard clipping trade-off between sample efficiency and optimization stability.

Ax Jianing Wang, Linsen Guo, Zhengyu Chen, Qi Guo, Hongyu Zang, Wenjie Shi, Haoxiang Ma, Xiangyu Xi, Xiaoyu Li, Wei Wang, Xunliang Cai 5/6/2026

HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness

HeavySkill framework analyzes heavy thinking as the core execution unit in agentic systems with orchestration, memory, skills, and tool use.

Ax Kyle Zheng, Han Zhang, Renliang Sun, Chenchen Ye, Wei Wang 5/6/2026

FitText: Evolving Agent Tool Ecologies via Memetic Retrieval

FitText framework makes tool retrieval dynamic in agent reasoning loops, bridging semantic gaps between task descriptions and API documentation across thousands of endpoints.

Ax Munachiso Samuel Nwadike, Zangir Iklassov, Kareem Ali, Rifo Genadi, Kentaro Inui 5/6/2026

Measuring AI Reasoning: A Guide for Researchers

Guide for evaluating LLM reasoning through adaptive multi-step search rather than final-answer accuracy, formalizing reasoning as search procedures.

Ax Xiyuan Wang, Yi Hu, Yanbo Wang, Chuan Shi, Muhan Zhang 5/6/2026

Position: How can Graphs Help Large Language Models?

Position paper exploring how graph structures can enhance LLM capabilities through knowledge representation, up-to-date information, and improved reasoning.

Ax Abolfazl Mohammadi-Seif, Ricardo Baeza-Yates 5/6/2026

Improving Model Safety by Targeted Error Correction

Dual-classifier GBDT pipeline distinguishes routine errors from high-risk misclassifications in critical ML applications across medical and classification domains.

Ax Ruiqing Zhao, Fengzhi Li, Yuan Zuo, Rui Liu, Yansong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng 5/6/2026

Strategy-Aware Optimization Modeling with Reasoning LLMs

SAGE framework teaches LLMs to choose effective modeling strategies for optimization problems through multi-strategy datasets and supervised fine-tuning.

Ax Alberto Pozanco, Daniel Borrajo, Manuela Veloso 5/6/2026

Counterfactual Reasoning in Automated Planning

Survey of counterfactual reasoning techniques in automated planning for handling deviations from fixed task specifications.