Ax Baoqing Yue, Zihan Zhu, Yutong Han, Qian Sun, Jichen Feng, Hufei Yang, Yifan Zhang, Mengdi Wang 5/12/2026

Interactive Benchmarks

Interactive Benchmarks evaluation paradigm assesses model reasoning through active information acquisition rather than fixed tasks.

Ax Maria Chang, Ronny Luss, Miao Liu, Keerthiram Murugesan, Karthikeyan Ramamurthy, Djallel Bouneffouf 5/12/2026

Mitigating Misalignment Contagion by Steering with Implicit Traits

Study of misalignment contagion where misaligned behavior spreads between multiple LMs in multi-agent settings, with steering techniques to mitigate.

Ax Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Weizheng Wang, Hongzhang Huang, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu 5/12/2026

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

Benchmark for evaluating AI agents on workspace tasks with real-world file dependencies, addressing gap in current agent evaluation methods.

Ax Joseph Breda, Fadi Yousif, Beszel Hawkins, Marinela Cotoi, Miao Liu, Ray Luo, Po-Hsuan Cameron Chen, Mike Schaekermann, Samuel Schmidgall, Xin Liu, Girish Narayanswamy, Samuel Solomon, Maxwell A. Xu, Xiaoran Fan, Longfei Shangguan, Anran Wang, Bhavna Daryani, Buddy Herkenham, Cara Tan, Mark Malhotra, Shwetak Patel, John B. Hernandez, Quang Duong, Yun Liu, Zach Wasson, Dimitrios Antos, Bob Lou, Matthew Thompson, Jonathan Richina, Anupam Pathak, Nichole Young-Lin, Jake Sunshine, Daniel McDuff 5/12/2026

SymptomAI: Toward a Conversational AI Agent for Everyday Symptom Assessment

Conversational AI agents for patient symptom assessment, evaluated on realistic everyday medical scenarios rather than curated case studies.

Ax Tianyu Liu, Wangjie Zheng, Rui Yang, Benny Kai Guo Loo, Hui Zhang, Jeffries Lauran, Jianlei Gu, Botao Yu, Weihao Xuan, Kexin Huang, Nan Liu, James Zou, Yonghui Jiang, Hua Xu, Hongyu Zhao 5/12/2026

A Versatile AI Agent for Rare Disease Diagnosis and Risk Gene Prioritization

Hygieia: multi-modal AI agent integrating phenotypic, genetic, and clinical data for rare disease diagnosis and gene prioritization.

Ax Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang 5/12/2026

GRIT: Teaching MLLMs to Think with Images

Method enabling multimodal LLMs to integrate visual reasoning with image information using reinforcement learning.