Ax Qiyang Li, Zhiyuan Zhou, Sergey Levine 5/12/2026

Reinforcement Learning with Action Chunking

Q-chunking algorithm for improving reinforcement learning on long-horizon sparse-reward tasks in offline-to-online settings.

Ax Hoang Nguyen, Sidharth Surapaneni, Akshay Kalkunte, Jash Mehta, Aman Tiwari, Oluwanifemi Bamgbose, Khyati Mahajan, Jash Shah, Shruthan Radhakrishna, Sathwik Tejaswi Madhusudhan, Vikas Yadav, Sai Rajeswar 5/12/2026

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs

AU-Harness open-source toolkit for standardized evaluation of audio language models with multi-turn dialogue support.

Ax Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa 5/12/2026

RL Fine-Tuning Heals OOD Forgetting in SFT

Analysis of why SFT+RL post-training works: SFT peaks on OOD early then declines; RL recovers generalization.

Ax Katarzyna Kobalczyk, Zhiyuan Jerry Lin, Benjamin Letham, Zhuokai Zhao, Maximilian Balandat, Eytan Bakshy 5/12/2026

LILO: Bayesian Optimization with Natural Language Feedback

LILO framework uses LLMs to translate natural language feedback into structured preference signals for Bayesian optimization.

Ax Lukas Helff, Ruben H\"arle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia W\"ust, Hikaru Shindo, Patrick Schramowski, Kristian Kersting 5/12/2026

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning framework enables systematic logical reasoning in LLM latent spaces using sparse autoencoders for interpretability.

Ax Timo Stoll, Chendi Qian, Ben Finkelshtein, Ali Parviz, Darius Weber, Fabrizio Frasca, Hadar Shavit, Antoine Siraudin, Arman Mielke, Marie Anastacio, Erik M\"uller, Maya Bechler-Speicher, Michael Bronstein, Mikhail Galkin, Holger Hoos, Mathias Niepert, Bryan Perozzi, Jan T\"onshoff, Christopher Morris 5/12/2026

GraphBench: Next-generation graph learning benchmarking

GraphBench provides standardized benchmarking suite for graph machine learning with consistent evaluation protocols for foundation models.

Ax Leyang Shen, Yang Zhang, Chun Kai Ling, Xiaoyan Zhao, Tat-Seng Chua 5/12/2026

CARL: Criticality-Aware Agentic Reinforcement Learning

CARL improves multi-step reinforcement learning for agents by identifying and optimizing criticality-aware action choices rather than treating all steps equally.

Ax Tiange Luo, Lajanugen Logeswaran, Jaekyeom Kim, Justin Johnson, Honglak Lee 5/12/2026

Selective LoRA for Visual Tokens and Attention Heads

Parameter-efficient fine-tuning method applying LoRA selectively to visual tokens and attention heads in vision-language models.