Ax Alex Chen, Renato Geh, Aditya Grover, Guy Van den Broeck, Daniel Israel 5/15/2026

The Pitfalls of KV Cache Compression

Research identifying performance pitfalls of KV cache compression in LLMs under realistic multi-instruction prompting scenarios.

Ax Dikshya Mohanty, Mohammad Saqib Hasan, Syed Mostofa Monsur, Size Zheng, Benjamin Hsiao, Niranjan Balasubramanian 5/15/2026

Teaching and Evaluating LLMs to Reason About Polymer Design Related Tasks

PolyBench dataset and training approach teaches LLMs polymer design reasoning via domain-specific knowledge to overcome capability gaps in chemistry-related tasks.

Ax Jingkun Liu, Yisong Yue, Max Welling, Yue Song 5/15/2026

Krause Synchronization Transformers

Attention mechanism addressing representation collapse and attention sink phenomena through bounded confidence dynamics.

Ax Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Stephen Tu, Erdem Biyik, Jesse Zhang 5/15/2026

Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

Scalable reward modeling framework for robots using trajectory comparisons instead of absolute progress labels.

Ax Ben Chen, Siyuan Wang, Yufei Ma, Zihan Liang, Xuxin Zhang, Yue Lv, Ying Yang, Huangyu Dai, Lingtao Mao, Tong Zhao, Zhipeng Qian, Xinyu Sun, Zhixin Zhai, Yang Zhao, Bochao Liu, Jingshan Lv, Xiao Liang, Hui Kong, Jing Chen, Han Li, Chenyi Lei, Wenwu Ou, Kun Gai 5/15/2026

OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework

OneSearch-V2 generative retrieval framework using latent reasoning and self-distillation for improved complex query understanding in industrial search systems.

Ax Junyu Guo, Shangding Gu, Ming Jin, Costas Spanos, Javad Lavaei 5/15/2026

LLMs Should Express Uncertainty Explicitly

Studies post-training methods to make LLMs explicitly signal uncertainty in their responses, reducing confident yet incorrect outputs in real-world applications.