Ax Feng Jiang, Yang Chen, Kyle Xu, Yuchen Liu, Haifeng Wang, Zhenhao Shen, Jasper Lu, Shengze Huang, Yuanfei Wang, Chen Xie, Ruihai Wu 5/15/2026

RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation

RoboWM-Bench evaluates world models for robotic manipulation, testing both visual realism and physical consistency of generated interactions for robot learning.

Ax Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut 5/15/2026

Image Generators are Generalist Vision Learners

Shows image generators develop zero-shot visual understanding capabilities similar to LLM emergent abilities, with evidence of strong generalist vision learning.

Ax Yixian Xu, Yusong Wang, Shengjie Luo, Kaiyuan Gao, Tianyu He, Di He, Chang Liu 5/15/2026

Quotient-Space Diffusion Models

Quotient-space diffusion models exploit symmetries in generative tasks like 3D molecular structure generation for improved learning efficiency.

Ax Jinming Yang, Zheng Hu, Chuxian Qiu, Zhenyu Deng, Xinshan Jiao, Tao Zhou 5/15/2026

Quantifying and Mitigating Self-Preference Bias of LLM Judges

Quantifies and mitigates Self-Preference Bias in LLM-based evaluation systems, addressing systematic favoritism toward models' own outputs in automated assessment.

Ax Fei Bai, Huatong Song, Shuang Sun, Daixuan Cheng, Yike Yang, Chuan Hao, Renyuan Li, Feng Chang, Yuan Wei, Ran Tao, Bryan Dai, Jian Yang, Wayne Xin Zhao, Ji-Rong Wen 5/15/2026

ClawGym: A Scalable Framework for Building Effective Claw Agents

ClawGym framework for building and training AI agents that interact with file systems, tools, and persistent workspaces. Includes systematic data synthesis and diagnostic evaluation.

Ax Jing Xu, Yuexiao Ma, Xuzhe Zheng, Xing Wang, Shiwei Liu, Chenqian Yan, Xiawu Zheng, Rongrong Ji, Fei Chao, Songwei Liu 5/15/2026

Motion-Aware Caching for Efficient Autoregressive Video Generation

Motion-aware caching strategy for autoregressive video generation that skips redundant denoising steps through fine-grained pixel-level optimization.

Ax Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao, Feng Zhao 5/15/2026

Flow-OPD: On-Policy Distillation for Flow Matching Models

Research paper on Flow-OPD: on-policy distillation technique for multi-task text-to-image flow matching models addressing reward sparsity and gradient interference.

Ax Zongmin Yu, Liu Yang 5/15/2026

Evolutionary Ensemble of Agents

Decentralized framework organizing coding agents into co-evolving system for algorithmic discovery, evolving agent behaviors through cumulative guidance.

Ax Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir 5/15/2026

Pretraining large language models with MXFP4 on Native FP4 Hardware

Study of FP4 quantization in transformer training, progressively enabling low-precision arithmetic across forward/backward passes for Llama 3.1 pretraining.

Ax Liang Luo, Yinbin Ma, Quanyu Zhu, Vasiliy Kuznetsov, Yuxin Chen, Jian Jiao, Jiecao Yu, Buyun Zhang, Tongyi Tang, Xiaohan Wei, Yanli Zhao, Zeliang Chen, Yuchen Hao, Venkatesh Ranganathan, Sandeep Parab, Yantao Yao, Maxim Naumov, Chunzhi Yang, Shen Li, Ellie Wen, Wenlin Chen, Santanu Kolay, Chunqiang Tang 5/15/2026

LoKA: Low-precision Kernel Applications for Recommendation Models At Scale

Research on applying FP8 low-precision arithmetic to large recommendation models, addressing numerical sensitivity challenges in GPU training.

Ax Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri 5/15/2026

Learning, Fast and Slow: Towards LLMs That Adapt Continually

Proposes dual-learning approach combining parameter updates and in-context learning to enable LLMs to adapt continually while retaining plasticity.

Ax Zeyu Huang, Adhiguna Kuncoro, Qixuan Feng, Jiajun Shen, Lucio Dery, Arthur Szlam, Marc'Aurelio Ranzato 5/15/2026

Context Training with Active Information Seeking

Equips LLMs with active information-seeking during context training to adapt to tasks requiring newly produced or niche domain knowledge without weight updates.

Ax Guoxiong Gao, Zeming Sun, Jiedong Jiang, Yutong Wang, Jingda Xu, Peihao Wu, Bryan Dai, Bin Dong 5/15/2026

LeanSearch v2: Global Premise Retrieval for Lean 4 Theorem Proving

LeanSearch v2 retrieves relevant library lemmas globally for Lean 4 theorem proving, addressing gap between semantic search and step-by-step premise selection.

Ax William Lehn-Schi{\o}ler, Magnus Ruud Kj{\ae}r, Rahul Thapa, Magnus Guldberg Pedersen, Anton Storgaard Mosquera, Nick Williams, Radu Gatej, Tue Lehn-Schi{\o}ler, S\'andor Beniczky, Sadasivan Puthusserypady, James Zou, Lars Kai Hansen 5/15/2026

Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders

Applies sparse autoencoders to interpret internal computations of EEG foundation models for clinical applications.

Ax L\'eo Grinsztajn (Liam), Klemens Fl\"oge (Liam), Oscar Key (Liam), Felix Birkel (Liam), Philipp Jund (Liam), Brendan Roof (Liam), Mihir Manium (Liam), Shi Bin (Liam), Hoo, Magnus B\"uhler, Anurag Garg, Dominik Safaric, Jake Robertson, Benjamin J\"ager, Simone Alessi, Adrian Hayler, Vladyslav Moroshan, Lennart Purucker, Philipp Singer, Alan Arazi, Julien Siems, Jan Hendrik Metzen, Georg Grab, Nick Erickson, Siyuan Guo, Eliott Kalfon, Simon Bing, David Salinas, Clara Cornu, Lilly Charlotte Wehrhahn, Diana Kriuchkova, Kursat Kaya, Lydia Sidhoum, Marie Salmon, Jerry Chen, Madelon Hulsebos, Yann LeCun, Samuel M\"uller, Bernhard Sch\"olkopf, Sauraj Gambhir, Noah Hollmann, Frank Hutter 5/15/2026

TabPFN-3: Technical Report

TabPFN-3 foundation model for tabular data scaled to 1M rows with improved training/inference speed and synthetic pretraining.

Ax Adrian M\"uller, Antoine Gonon, Zebang Shen, Ya-Ping Hsieh, Niao He 5/15/2026

Support Before Frequency in Discrete Diffusion

Analysis of discrete diffusion models showing hierarchy between support and frequency information in denoising objectives.