Ax Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, Jun Xiao 5/5/2026

VGR: Visual Grounded Reasoning

VGR: Framework for visual grounded chain-of-thought reasoning that performs reasoning in visual space rather than pure language, for complex visual tasks.

Ax Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Ra\'ul Mel\'endez Luj\'an, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar 5/5/2026

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

ExCyTIn-Bench: First benchmark for evaluating LLM agents on autonomous cyber threat investigation using multi-hop evidence chains from security logs.

Ax Diane Tchuindjo, Omar Khattab 5/5/2026

Reasoning-Intensive Regression

Framework for using LLMs to perform reasoning-intensive regression tasks like rubric-based scoring and dense reward modeling, beyond standard text analysis.

Ax Kai-Wei Chang, En-Pei Hu, Chun-Yi Kuan, Wenze Ren, Wei-Chih Chen, Guan-Ting Lin, Yu Tsao, Shao-Hua Sun, Hung-yi Lee, James Glass 5/5/2026

Game-Time: Evaluating Temporal Dynamics in Spoken Language Models

Benchmark framework (Game-Time) for evaluating temporal dynamics capabilities in conversational spoken language models, including timing and simultaneous speech handling.

Ax Chenhui Xu, Fuxun Yu, Michael J. Bianco, Jacob Kovarskiy, Raphael Tang, Qi Zhang, Zirui Xu, Will LeVine, Brandon Dubbs, Heming Liao, Cassandra Burgess, Suvam Bag, Jay Patravali, Rupanjali Kukal, Mikael Figueroa, Rishi Madhok, Nikolaos Karianakis, Jinjun Xiong 5/5/2026

Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards

Research on training vision-language models for geospatial reasoning using indirect rewards from metadata to overcome supervision scarcity in rare domains.

Ax Th\'eo Cavignac (Research Center Future Energy Materials and Systems of the University Alliance Ruhr and ICAMS, Ruhr University Bochum, Bochum, Germany), Jonathan Schmidt (Department of Materials, ETH Z\"urich, Z\"urich, Switzerland), Pierre-Paul De Breuck (Research Center Future Energy Materials and Systems of the University Alliance Ruhr and ICAMS, Ruhr University Bochum, Bochum, Germany), Antoine Loew (Research Center Future Energy Materials and Systems of the University Alliance Ruhr and ICAMS, Ruhr University Bochum, Bochum, Germany), Tiago F. T. Cerqueira (CFisUC, Department of Physics, University of Coimbra, Coimbra, Portugal), Hai-Chen Wang (Research Center Future Energy Materials and Systems of the University Alliance Ruhr and ICAMS, Ruhr University Bochum, Bochum, Germany), Anton Bochkarev (ICAMS, Ruhr-Universit\"at Bochum and ACEworks GmbH, Bochum, Germany), Yury Lysogorskiy (ICAMS, Ruhr-Universit\"at Bochum and ACEworks GmbH, Bochum, Germany), Aldo H. Romero (Department of Physics, West Virginia University, Morgantown, USA), Ralf Drautz (ICAMS, Ruhr-Universit\"at Bochum and ACEworks GmbH, Bochum, Germany), Silvana Botti (Research Center Future Energy Materials and Systems of the University Alliance Ruhr and ICAMS, Ruhr University Bochum, Bochum, Germany), Miguel A. L. Marques (Research Center Future Energy Materials and Systems of the University Alliance Ruhr and ICAMS, Ruhr University Bochum, Bochum, Germany) 5/5/2026

AI-Driven Expansion and Application of the Alexandria Database

Multi-stage computational materials discovery workflow combining generative models and graph neural networks generating 119M candidate structures.

Ax Nigam H. Shah, Nerissa Ambers, Abby Pandya, Timothy Keyes, Juan M. Banda, Srikar Nallan, Carlene Lugtu, Artem A. Trotsyuk, Suhana Bedi, Alyssa Unell, Miguel Fuentes, Francois Grolleau, Sneha S. Jain, Jonathan Chen, Devdutta Dash, Danton Char, Aditya Sharma, Duncan McElfresh, Patrick Scully, Vishanthan Kumar, Clancy Dennis, Connor OBrien, Satchi Mouniswamy, Elvis Jones, Krishna Jasti, Gunavathi Mannika Lakshmanan, Sree Ram Akula, Varun Kumar Singh, Ramesh Rajmanickam, Sudhir Sinha, Vicky Zhou, Xu Wang, Bilal Mawji, Joshua Ge, Wencheng Li, Travis Lyons, Jarrod Helzer, Vikas Kakkar, Ramesh Powar, Darren Batara, Cheryl Cordova, William Frederick III, Olivia Tang, Phoebe Morgan, April S. Liang, Stephen P. Ma, Shivam Vedak, Dong-han Yao, Akshay Swaminathan, Mehr Kashyap, Brian Ng, Jamie Hellman, Nikesh Kotecha, Christopher Sharp, Gretchen Brown, Christian Lindmark, Anurang Revri, Michael A. Pfeffer 5/5/2026

Adoption and Use of LLMs at an Academic Medical Center

ChatEHR system enabling LLM integration with electronic health records for clinical documentation automations and interactive use.

Ax Wenshuo Zhao (May), Qi Zhu (May), Xingshan Zeng (May), Fei Mi (May), Lifeng Shang (May), Yi R. (May), Fung 5/5/2026

Entropy Centroids as Intrinsic Rewards for Test-Time Scaling

Entropy Centroids: intrinsic reward mechanism for test-time scaling of LLM inference without requiring external reward models.

Ax Boris Shigida, Boris Hanin, Andrey Gromov 5/5/2026

Learning Rate Transfer in Normalized Transformers

Learning rate transfer improvements for Normalized Transformers using alignment exponents for better hyperparameter scaling across model sizes.

Ax Chenxin Li, Zhengyang Tang, Mingxin Huang, Yunlong Lin, Shijue Huang, Shengyuan Liu, Bowen Ye, Rang Li, Lei Li, Benyou Wang, Yixuan Yuan 5/5/2026

Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

Claw-Eval-Live: live benchmark for workflow agents with refreshable task signals, execution verification, and evolving real-world task evaluation.