Ax Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu 5/12/2026

Skill-R1: Agent Skill Evolution via Reinforcement Learning

arXiv paper on optimizing reusable skills for agentic LLMs through reinforcement learning with two-level credit assignment, moving beyond prompt engineering.

Ax Daemyung Kang, Eunjin Hwang, Hanjeong Lee, HyeokJin Kim, Hyunhoi Koo, Jeongkyu Shin, Jeongseok Kang, Jihyun Kang, Joongi Kim, Junbum Lee, Jungseung Yang, Kyujin Cho, Youngsook Song 5/12/2026

From Detection to Recovery: Operational Analysis on LLM Pre-training with 504 GPUs

Operational analysis of 504-GPU production cluster documenting hardware failures, recovery patterns, and distributed training reliability over 55 days.

Ax Weijia Liufu, Xiaoyu Guo, Ruiyi Chen, Jingzhi Liu, Kaidong Zhang, Xiwen Liang, Jianqi Lin, Dawei Sun, Yuze Wang, Rongtao Xu, Bingqian Lin, Bowen Yang, Tongtong Cao, Bowen Peng, Dongyu Zhang, Guangrun Wang, Min Wang, Liang Lin, Xiaodan Liang 5/12/2026

RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models

RePO-VLA framework improves vision-language-action models for robotic manipulation by learning from recovery trajectories.

Ax Xianhe Chen, Hao Chen, Yingzhen Li 5/12/2026

Spectral Transformer Neural Processes

Spectral Transformer Neural Processes extend TNPs with frequency-aware Spectral Aggregator for time series and spatial data with strong periodicity patterns.

Ax Tzeh Yuan Neoh, Nicholas Teh, Je Qin Chooi, Paul W. Goldberg, Milind Tambe 5/12/2026

Efficient Ensemble Selection from Binary and Pairwise Feedback

Method for efficient ensemble selection from multiple AI systems using minimal model calls and human evaluation, formulated as distributional multiwinner voting.

Ax Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Kr\"ahenb\"uhl, Vladlen Koltun 5/12/2026

Do multimodal models imagine electric sheep?

Fine-tuned Qwen VLM demonstrates spatial reasoning and mental imagery on visual puzzles like tangram and 3D rotation.

Ax Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir 5/12/2026

Pretraining large language models with MXFP4

Controlled study of MXFP4 quantization in transformer pretraining, analyzing stability across forward propagation, activation gradients, and weight gradients.