Ax Yuyu Guo, Wenjie Yang, Siyuan Yang, Ziyang Liu, Cheng Chen, Yuan Wei, Yun Hu, Yang Huang, Guoliang Hao, Dongsheng Yuan, Jianming Wang, Xin Chen, Hang Yu, Lei Lei, Peng Di 5/1/2026

OpAgent: Operator Agent for Web Navigation

Web navigation agent using online reinforcement learning to handle complex, volatile real-world websites beyond offline datasets.

Ax Mohamed Elfeki, Tu Trinh, Kelvin Luu, Guangze Luo, Nathan Hunt, Ernesto Montoya, Nandan Marwaha, Yannis He, Charles Wang, Fernando Crabedo, Alessa Castilo, Bing Liu 5/1/2026

HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?

Benchmark evaluating whether coding agents know when to request human help instead of guessing on ambiguous specifications.

Ax Xue Xia, Chengkai Yao, Mingyu Tsoi, Xinjie Mao, Wenxuan Huang, Jiaqi Wei, Hao Wu, Cheng Tan, Lang Yu, Yuejin Yang, Mengdi Liu, Siqi Sun, Zhangyang Gao 5/1/2026

AblateCell: A Reproduce-then-Ablate Agent for Virtual Cell Repositories

Coding agent system that reproduces baselines and performs ablations on AI Virtual Cell repositories to identify critical components.

Ax Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing, Rania Elbadry, Chen Xu, Haonan Li, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty, Yuxia Wang, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov 5/1/2026

FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning

FinChain benchmark for evaluating chain-of-thought reasoning in financial analysis, addressing gap in existing datasets by focusing on intermediate reasoning steps rather than just final answers.

Ax Santosh Vasa, Aditi Ramadwar, Jnana Rama Krishna Darabattula, Md Zafar Anwar, Stanislaw Antol, Andrei Vatavu, Thomas Monninger, Sihao Ding 5/1/2026

AutoVDC: Automated Vision Data Cleaning Using Vision-Language Models

Framework using vision-language models for automated dataset quality control. Reduces manual annotation effort for autonomous driving datasets.

Ax Joshua Ong Jun Leang, Zheng Zhao, Aryo Pradipta Gema, Sohee Yang, Wai-Chung Kwan, Xuanli He, Wenda Li, Pasquale Minervini, Eleonora Giunchiglia, Shay B. Cohen 5/1/2026

PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains

PiCSAR: training-free scoring function for selecting correct reasoning chains. Improves LLM and reasoning model accuracy via best-of-n sampling.

Ax Brahim Mahmoudi, Naouel Moha, Quentin Sti\'evenart, Florent Avellaneda 5/1/2026

ML Code Smells: From Specification to Detection

Framework to detect code smells in ML pipelines. Identifies implementation practices that compromise reproducibility, robustness, and maintainability.

Ax Elena Celledoni, Brynjulf Owren, Lars Ruthotto, Tianjiao Nicole Yang 5/1/2026

Mixed Precision Training of Neural ODEs

Mixed precision training techniques for neural ODEs addressing computational costs and numerical stability.

Ax Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu 5/1/2026

Mull-Tokens: Modality-Agnostic Latent Thinking

Multimodal model using latent thinking tokens for reasoning across text, images, and other modalities without specialist tools or handcrafted data.

Ax Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov 5/1/2026

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed

Research on converting pretrained autoregressive language models into efficient diffusion language models for faster parallel generation while maintaining accuracy.

Ax Ruozhen Yang, Yucheng Jiang, Yueqi Jiang, Priyanka Kargupta, Yunyi Zhang, Jiawei Han 5/1/2026

Grounding Agent Memory in Contextual Intent

STITCH agentic memory system indexes trajectory steps with contextual intent for long-horizon goal-oriented LLM interactions.

Ax Yelin Chen, Fanjin Zhang, Suping Sun, Yunhe Pang, Yuanchun Wang, Jian Song, Xiaoyan Li, Lei Hou, Shu Zhao, Jie Tang, Juanzi Li 5/1/2026

RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension

RPC-Bench large-scale QA benchmark from research paper review exchanges evaluates LLMs on paper comprehension with fine-grained metrics.