Ax Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuanda Wang, Zhixia Zhang, Hongyan Xie, Songshi Liang, Zehao Chen, Xuefeng Xiao, Fuzhen Zhuang, Jianxin Li, Yikun Ban, Deqing Wang 2/24/2026

Does Your Reasoning Model Implicitly Know When to Stop Thinking?

Studies whether reasoning models implicitly learn when to stop reasoning, addressing inefficiency and redundancy in long chain-of-thought outputs.

Ax Yiheng Shu, Saisri Padmaja Jonnalagedda, Xiang Gao, Bernal Jim\'enez Guti\'errez, Weijian Qi, Kamalika Das, Huan Sun, Yu Su 2/24/2026

REMem: Reasoning with Episodic Memory in Language Agent

REMem framework enables language agents to perform reasoning using episodic memory with spatiotemporal context from interaction histories, not just semantic memory.

Ax Haibo Tong, Feifei Zhao, Linghao Feng, Ruoyu Wu, Ruolin Chen, Lu Jia, Zhou Zhao, Jindong Li, Tenglong Li, Erliang Lin, Shuai Yang, Enmeng Lu, Yinqian Sun, Qian Zhang, Zizhe Ruan, Jinyu Fan, Zeyang Yue, Ping Wu, Huangrui Li, Chengyi Sun, Yi Zeng 2/24/2026

ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI

ForesightSafety Bench framework for evaluating frontier risks in autonomous AI systems addressing limitations of current safety benchmarks and alignment technologies.

Ax Stephan Rabanser, Sayash Kapoor, Peter Kirgis, Kangheng Liu, Saiteja Utpala, Arvind Narayanan 2/24/2026

Towards a Science of AI Agent Reliability

Framework for evaluating AI agent reliability beyond accuracy metrics, examining consistency across runs and robustness to perturbations in deployed agents.

Ax Hongjue Zhao, Haosen Sun, Jiangtao Kong, Xiaochang Li, Qineng Wang, Liwei Jiang, Qi Zhu, Tarek Abdelzaher, Yejin Choi, Manling Li, Huajie Shao 2/24/2026

ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment

Introduces ODESteer, a unified ODE-based framework for LLM alignment via activation steering that captures complex activation distributions.

Ax Wenfang Sun, Xinyuan Song, Pengxiang Li, Lu Yin, Yefeng Zheng, Shiwei Liu 2/24/2026

The Curse of Depth in Large Language Models

Research identifying 'Curse of Depth' phenomenon where ~50% of LLM layers underperform. Analysis across Llama, Mistral, DeepSeek, Qwen with theoretical and empirical investigation.

Ax Jialin Chen, Haolan Zuo, Haoyu Peter Wang, Siqi Miao, Pan Li, Rex Ying 2/24/2026

Towards A Universal Graph Structural Encoder

Pre-training approach for learning universal graph structural representations across different graph domains.