Ax Thanh Q. Tran, Arun Verma, Kiwan Wong, Bryan Kian Hsiang Low, Daniela Rus, Wei Xiao 2/24/2026

BarrierSteer: LLM Safety via Learning Barrier Steering

BarrierSteer framework for LLM safety using barrier functions and steering, addressing adversarial attacks and unsafe content generation.

Ax Kairan Zhao, Iurie Luca, Peter Triantafillou 2/24/2026

Benchmarking Unlearning for Vision Transformers

Benchmark for machine unlearning methods on Vision Transformers, extending prior CNN-focused unlearning research to transformer architectures.

Ax Mert Cemri, Shubham Agrawal, Akshat Gupta, Shu Liu, Audrey Cheng, Qiuyang Mang, Ashwin Naren, Lutfi Eren Erdogan, Koushik Sen, Matei Zaharia, Alex Dimakis, Ion Stoica 2/24/2026

AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization

AdaEvolve uses LLMs as semantic mutation operators in evolutionary optimization with adaptive scheduling for automated program generation.

Ax Zehao Wang, Mingzhe Han, Wei Cheng, Yue-Kai Huang, Philip Ji, Denton Wu, Mahdi Safari, Flemming Holtorf, Kenaish AlQubaisi, Norbert M. Linke, Danyang Zhuo, Yiran Chen, Ting Wang, Dirk Englund, Tingjun Chen 2/24/2026

Agentic AI for Scalable and Robust Optical Systems Control

AgentOptics framework enables agentic AI for autonomous optical system control using Model Context Protocol with 64 MCP tools and 410-task benchmark.

Ax Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thadd\"aus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao, Gaoyun Fang, John Kitaoka, Yile Xu, Hua Xu, Kenton Blacutt, Tin Nguyen, Siyuan Song, Haoran Sun, Shaoyue Wen, Linyang He, Runming Wang, Yanzhi Wang, Mengyue Yang, Ziqiao Ma, Rapha\"el Milli\`ere, Freda Shi, Nuno Vasconcelos, Daniel Khashabi, Alan Yuille, Yilun Du, Ziming Liu, Bo Li, Dahua Lin, Ziwei Liu, Vikash Kumar, Yijiang Li, Lei Yang, Zhongang Cai, Hokin Deng 2/24/2026

A Very Big Video Reasoning Suite

Benchmark suite evaluating video model reasoning capabilities on spatiotemporal understanding including continuity, interaction, and causality.

Ax Seungyoon Woo, Junhyeog Yun, Gunhee Kim 2/24/2026

Meta-Continual Learning of Neural Fields

Novel meta-continual learning approach for neural fields using modular architecture and optimization-based meta-learning to address catastrophic forgetting.

Ax Georgy Noarov, Soham Mallick, Tao Wang, Sunay Joshi, Yan Sun, Yangxinyu Xie, Mengxin Yu, Edgar Dobriban 2/24/2026

Foundations of Top-$k$ Decoding For Language Models

Theoretical analysis of top-k decoding method for LLM sampling, validating sparsity assumptions in next-token distributions.

Ax Subhrangshu Nandi, Arghya Datta, Rohith Nama, Udita Patel, Nikhil Vichare, Indranil Bhattacharya, Prince Grover, Shivam Asija, Giuseppe Carenini, Wei Zhang, Arushi Gupta, Sreyoshi Bhaduri, Jing Xu, Huzefa Raja, Shayan Ray, Aaron Chan, Esther Xu Fei, Gaoyuan Du, Zuhaib Akhtar, Harshita Asnani, Weian Chan, Ming Xiong, Francesco Carbone, Jeetu Mirchandani 2/24/2026

SOP-Bench: Complex Industrial SOPs for Evaluating LLM Agents

SOP-Bench: 2000+ task benchmark for evaluating LLM agents on complex multi-step industrial procedures across 12 business domains.

Ax Minfeng Zhu, Zi Wang, Sizhe Ji, Zhengtong Du, Shengqiang Tai, Junming Ke, Xiao Deng, Zanlang Yin, Xiuqi Huang, Heyu Wang, Wei Chen 2/24/2026

GenesisGeo: Technical Report

Neuro-symbolic geometry theorem prover combining neural diagram understanding with visual language models and symbolic verification.

Ax Zewei Zhang, Huan Liu, Yuanhao Yu, Jun Chen, Xiangyu Xu 2/24/2026

Boolean Satisfiability via Imitation Learning

ImitSAT: Branching policy for SAT solvers using imitation learning from expert traces instead of reinforcement learning.

Ax Zican Hu, Shilin Zhang, Yafu Li, Jianhao Yan, Xuyang Hu, Leyang Cui, Xiaoye Qu, Chunlin Chen, Yu Cheng, Zhi Wang 2/24/2026

Diversity-Incentivized Exploration for Versatile Reasoning

DIVER: Diversity-incentivized exploration method for RL with verifiable rewards to improve LLM reasoning sample efficiency.

Ax Hadi Nekoei, Aman Jaiswal, Patrice Bechard, Oleh Shliazhko, Orlando Marquez Ayala, Mathieu Reymond, Massimo Caccia, Alexandre Drouin, Sarath Chandar, Alexandre Lacoste 2/24/2026

JEF-Hinter: Leveraging Offline Knowledge for Improving Web Agents Adaptation

Method leveraging offline trajectories to improve LLM web agent adaptation without costly online interactions or fine-tuning.

Ax Alessandro Achille, Stefano Soatto 2/24/2026

AI Agents as Universal Task Solvers

Framework conceptualizing AI agents as stochastic dynamical systems for learning reasoning via transductive inference on new tasks.