Ax Shuhe Li, Chenxu Guo, Jiachen Lian, Cheol Jun Cho, Wenshuo Zhao, Xiner Xu, Ruiyu Jin, Xiaoyu Shi, Xuanru Zhou, Dingkun Zhou, Sam Wang, Grace Wang, Jingze Yang, Jingyi Xu, Ruohan Bao, Xingrui Chen, Elise Brenner, Brandon In, Francesca Pei, Maria Luisa Gorno-Tempini, Gopala Anumanchipalli 2/25/2026

K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function

LLM-based framework for evaluating children's language function through phonetic transcription and automated speech assessment.

Ax Jubayer Ibn Hamid, Ifdita Hasan Orney, Ellen Xu, Chelsea Finn, Dorsa Sadigh 2/25/2026

Polychromic Objectives for Reinforcement Learning

Reinforcement learning fine-tuning approach using polychromic objectives to prevent policy collapse and maintain behavioral diversity.

Ax Jianing Guo, Zhenhong Wu, Chang Tu, Yiyao Ma, Xiangqi Kong, Zhiqian Liu, Jiaming Ji, Shuning Zhang, Yuanpei Chen, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Weifeng Lv, Simin Li 2/25/2026

On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations

Evaluation of Vision-Language-Action model robustness against multi-modal perturbations across 17 adversarial conditions.

Ax Dario Shariatian, Alain Durmus, Umut Simsekli, Stefano Peluchetti 2/25/2026

Latent-Augmented Discrete Diffusion Models

Latent-Augmented Discrete Diffusion model improving fast language generation by modeling cross-token dependencies.

Ax Yizhang Zhu, Liangwei Wang, Chenyu Yang, Xiaotian Lin, Boyan Li, Wei Zhou, Xinyu Liu, Zhangyang Peng, Tianqi Luo, Yu Li, Chengliang Chai, Chong Chen, Shimin Di, Ju Fan, Ji Sun, Nan Tang, Fugee Tsung, Jiannan Wang, Chenglin Wu, Yanwei Xu, Shaolei Zhang, Yong Zhang, Xuanhe Zhou, Guoliang Li, Yuyu Luo 2/25/2026

A Survey of Data Agents: Emerging Paradigm or Overstated Hype?

Survey examining terminology, definitions, and taxonomy of data agents—autonomous systems orchestrating data and AI for complex data tasks.

Ax Yida Zhao, Kuan Li, Xixi Wu, Liwen Zhang, Dingchu Zhang, Baixuan Li, Maojia Song, Zhuo Chen, Chenxi Wang, Xinyu Wang, Kewei Tu, Pengjun Xie, Jingren Zhou, Yong Jiang 2/25/2026

Repurposing Synthetic Data for Fine-grained Search Agent Supervision

LLM-based search agents trained on synthetic entity-centric data using improved reward mechanisms to capture informative near-miss samples.

Ax Zheng Du, Hao Kang, Song Han, Tushar Krishna, Ligeng Zhu 2/25/2026

OckBench: Measuring the Efficiency of LLM Reasoning

OckBench: Benchmark measuring LLM reasoning efficiency via token usage, revealing up to 5x differences in token length across models.

Ax Xing Li, Hui-Ling Zhen, Lihao Yin, Xianzhi Yu, Zhenhua Dong, Mingxuan Yuan 2/25/2026

What Matters For Safety Alignment?

Comprehensive empirical study evaluating factors affecting safety alignment in LLMs and LRMs across 32 recent models.

Ax Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Mohammadreza Salehi, Rohun Tripathi, Sangho Lee, Zhongzheng Ren, Chris Dongjoo Kim, Yinuo Yang, Vincent Shao, Yue Yang, Weikai Huang, Ziqi Gao, Taira Anderson, Jianrui Zhang, Jitesh Jain, George Stoica, Winson Han, Ali Farhadi, Ranjay Krishna 2/25/2026

Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

Molmo2: Open-weight vision-language model with video understanding, grounding, and disclosed training data and recipe.