Ax Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xinyu Zhu, WenHao Wang, Linfeng Zhang, Chen Qian, Siheng Chen 5/14/2026

DataMaster: Data-Centric Autonomous AI Research

Autonomous AI system for data-centric machine learning that searches, adapts, and validates datasets to improve model performance.

Ax DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian B\"other, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt 5/14/2026

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone

Demonstrates data curation alone improves vision-language model performance by 11.7pp without architecture or compute changes.

Ax Jeffrey T. H. Wong, Cheng Zhang, Xinye Cao, Pedro Gimenes, Christos-Savvas Bouganis, George A. Constantinides, Wayne Luk, Yiren Zhao 5/14/2026

A3 : an Analytical Low-Rank Approximation Framework for Attention

Low-rank approximation framework for compressing transformer attention layers by analyzing architectural characteristics rather than individual layer outputs.

Ax Millicent Li, Alberto Mario Ceballos Arroyo, Giordano Rogers, Naomi Saphra, Byron C. Wallace 5/14/2026

Do Activation Verbalization Methods Convey Privileged Information?

Investigates whether activation verbalization methods (using LLMs to describe internal representations) reveal privileged information or just input information.

Ax Samuel Willis, Paul Duckworth, Jack Simons, Aleksandra Kalisz, Krisztina Sinkovics, Noam Ghenassia, Shikha Surana, Henry T. Oldroyd, Alexandru I. Stere, Dragos D Margineantu, Carl Henrik Ek, Henry Moss, Erik Bodin 5/14/2026

Sample-Efficient Optimisation over the Outputs of Generative Models

O3 method for sample-efficient optimization within generative model outputs (diffusion/flow models) for task-specific criteria.

Ax Mario Markov (INSAIT, Sofia University "St. Kliment Ohridski"), Stefan Maria Ailuro (INSAIT, Sofia University "St. Kliment Ohridski"), Luc Van Gool (INSAIT, Sofia University "St. Kliment Ohridski"), Konrad Schindler (ETH Zurich), Danda Pani Paudel (INSAIT, Sofia University "St. Kliment Ohridski") 5/14/2026

FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle

FireScope-Bench dataset and method for predicting wildfire risk using chain-of-thought reasoning with satellite imagery and climate data.

Ax Xingyuan Hua, Sheng Yue, Xinyi Li, Yizhe Zhao, Jinrui Zhang, Ju Ren 5/14/2026

Context Learning for Multi-Agent Discussion

Multi-LLM context learning method (M2CL) addressing discussion inconsistency in multi-agent collaborative problem-solving.

Ax Nikolas Melissaris, Antigoni Polychroniadou, Akira Takahashi, Chenkai Weng, Jiayi Xu 5/14/2026

ZKBoost: Zero-Knowledge Verifiable Training for XGBoost

ZKBoost: zero-knowledge proof protocol for verifying XGBoost model training integrity without revealing data or parameters.

Ax Baoqing Yue, Zihan Zhu, Yutong Han, Qian Sun, Jichen Feng, Hufei Yang, Yifan Zhang, Mengdi Wang 5/14/2026

Interactive Benchmarks

Interactive Benchmarks: unified evaluation paradigm assessing model reasoning through adaptive information acquisition rather than fixed benchmarks.