Ax Qisong Zhang (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Wenzhuo Wu (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Zhuangzhuang Jia (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Yunhao Yang (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Huayu Zhang (Institute of Artificial Intelligence), Xianghao Zang (Institute of Artificial Intelligence), Zhixiang He (Institute of Artificial Intelligence), Zhongjiang He (Institute of Artificial Intelligence), Kongming Liang (School of Artificial Intelligence, Beijing University of Posts and Telecommunications), Zhanyu Ma (School of Artificial Intelligence, Beijing University of Posts and Telecommunications) 5/6/2026

DataEvolver: Let Your Data Build and Improve Itself via Goal-Driven Loop Agents

DataEvolver: closed-loop visual data generation system using goal-driven agents for iterative dataset creation and improvement.

Ax George Fatouros, Georgios Makridis, John Soldatos, Dimosthenis Kyriazis, Pedro Malo, George Kousiouris, Giannis Ledakis, Louiza Kachrimani, Panagiotis Rizomiliotis, Bruno Almeida, Despina Tomkou, Kostas Metaxas, Konstantinos Ilias, Christos Gkizelis, Ernstjan de Gooyert, Amin Babazadeh, Kostis Mavrogiorgos, Pepi Paraskevoulakou, Christos Xenakis, Giannis Chouchoulis, Konstantina Tripodi 5/6/2026

CyberAId: AI-Driven Cybersecurity for Financial Service Providers

AI-driven cybersecurity system for financial institutions using LLMs to enhance SOC reasoning capacity and alert investigation.

Ax Alexander Smola 5/6/2026

Submodular Benchmark Selection

arXiv paper formalizing efficient benchmark selection for LLM evaluation as submodular maximization problem.

Ax Ruoqi Liu, Imran Q. Mohiuddin, Austin J. Schoeffler, Kavita Renduchintala, Ashwin Nayak, Prasantha L. Vemu, Shivam C. Vedak, Kameron C. Black, John L. Havlik, Isaac Ogunmola, Stephen P. Ma, Roopa Dhatt, Jonathan H. Chen 5/6/2026

PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments

arXiv paper introducing PhysicianBench, a benchmark for evaluating LLM agents on long-horizon clinical workflows in real EHR environments.