Ax William Lehn-Schi{\o}ler, Magnus Ruud Kj{\ae}r, Rahul Thapa, Magnus Guldberg Pedersen, Anton Mosquera Storgaard, Nick Williams, Radu Gatej, Tue Lehn-Schi{\o}ler, S\'andor Beniczky, Sadasivan Puthusserypady, James Zou, Lars Kai Hansen 5/18/2026

Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders

Applies sparse autoencoders to extract interpretable features from EEG foundation models for clinical applications.

Ax Jerem\'ias Figueiredo Paschmann, Juan Kaplan, Francisco Nattero, Santiago Barron, Juan Wisznia, Luciano del Corro 5/18/2026

Active Learners as Efficient PRP Rerankers

Uses active learning to efficiently rerank LLM pairwise preference judgments, treating it as robust top-K recovery rather than sorting.

Ax ChonLam Lao, Jiaqi Gao, Jiamin Cao, Zhipeng Zhang, Pengcheng Zhang, Jiangfei Duan, Zhilong Zheng, Yu Guan, Yichi Xu, Yong Li, Zhengping Qian, Aditya Akella, Minlan Yu, Ennan Zhai, Dennis Cai, Jingren Zhou 5/18/2026

TrainMover: An Interruption-Resilient Runtime for ML Training

TrainMover is a resilient runtime for LLM training that handles hardware/software interruptions using elastic machines with minimal downtime.

Ax Yash Akhauri, Ahmed F AbouElhamayed, Yifei Gao, Chi-Chih Chang, Sameh Gobriel, Nilesh Jain, Mohamed S. Abdelfattah 5/18/2026

TokenButler: Token Importance is Predictable

TokenButler predicts which tokens are important for KV-cache in LLMs to reduce memory and computation bottlenecks during decoding.

Ax Pascal Bergstr\"a{\ss}er, Ryan Cotterell, Anthony W. Lin 5/18/2026

Transformers are Inherently Succinct

Theoretical analysis proving transformers can be exponentially more succinct than LTL and RNNs in expressing languages, using classical automata theory.

Ax Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh 5/18/2026

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

DR Tulu method using reinforcement learning with evolving rubrics to train deep research agents for multi-step long-form answers.

Ax Tunyu Zhang, Xinxi Zhang, Ligong Han, Haizhou Shi, Xiaoxiao He, Zhuowei Li, Hao Wang, Kai Xu, Akash Srivastava, Chengzhi Mao, Hao Wang, Vladimir Pavlovic, Dimitris N. Metaxas 5/18/2026

Few-Step Diffusion Language Models via Trajectory Self-Distillation

Self-distillation framework for training few-step diffusion language models to reduce decoding steps while maintaining output quality.