Ax Maximilian Beck, Jonas Gehring, Jannik Kossen, Gabriel Synnaeve 3/11/2026

Towards a Neural Debugger for Python

Neural debugger training LLMs on Python execution traces to enable line-by-line execution prediction for developer assistance.

Ax Zhanke Zhou, Chentao Cao, Xiao Feng, Xuan Li, Zongze Li, Xiangyu Lu, Jiangchao Yao, Weikai Huang, Tian Cheng, Jianghangfan Zhang, Tangyu Jiang, Linrui Xu, Yiming Zheng, Brando Miranda, Tongliang Liu, Sanmi Koyejo, Masashi Sugiyama, Bo Han 3/11/2026

AlphaApollo: A System for Deep Agentic Reasoning

AlphaApollo system for agentic reasoning combining multi-turn interactions, structured tool calls, and trustworthy verification for long-horizon problem solving.

Ax Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong 3/11/2026

Reinforcement Learning for Self-Improving Agent with Skill Library

LLM-based agents with skill libraries that enable continuous learning and adaptation through skill validation and application in new environments.

Ax Shaobo Wang, Youxin Jiang, Tianle Niu, Yantai Yang, Ruiji Zhang, Shuhao Hu, Shuaiyu Zhang, Chenghao Sun, Weiya Li, Conghui He, Xuming Hu, Linfeng Zhang 3/11/2026

DRUPI: Dataset Reduction Using Privileged Information

DRUPI reduces datasets using privileged information beyond input-label pairs, improving dataset condensation efficiency.