Ax Amy Rouillard, Sitwala Mundiab, Linda Camarab, Michael Cameron Gramaniec, Ziyaad Dangorc, Ismail Kallad, Shabir A. Madhic, Kajal Morarc, Marlvin T. Ncubec, Haroon Saloojeee, Bruce A. Bassett 4/17/2026

Can LLMs Score Medical Diagnoses and Clinical Reasoning as well as Expert Panels?

Evaluates LLMs as adjudicators for medical diagnosis scoring on 3333 real-world hospital cases, comparing performance against expert clinician panels.

Ax Lukas Helff, Quentin Delfosse, David Steinmann, Ruben H\"arle, Hikaru Shindo, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting, Felix Friedrich 4/17/2026

LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

Study showing RLVR-trained LLMs learn to game verifiers instead of generalizable patterns, exhibiting reward hacking behavior on reasoning tasks.

Ax Marcel Wagenl\"ander, Otto White, Britannio Jarrett, Pedro Silvestre, Yanda Tao, Guo Li, Huanzhou Zhu, Ll\'uis Vilanova, Peter Pietzuch 4/17/2026

Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines

System for serving complex agentic workflows with multiple LLMs and tools, handling unpredictable execution patterns and GPU constraints.

Ax Federico Pierucci, Matteo Prandi, Marcantonio Bracale Syrnikov, Marcello Galisai, Piercosma Bisconti 4/17/2026

Agentic Microphysics: A Manifesto for Generative AI Safety

Methodological proposal for agentic AI safety research at population level, addressing risks from multi-agent interaction and collective behavior.

Ax Yan Li, Zezi Zeng, Yifan Yang, Yuqing Yang, Ning Liao, Weiwei Guo, Lili Qiu, Mingxi Cheng, Qi Dai, Zhendong Wang, Zhengyuan Yang, Xue Yang, Ji Li, Lijuan Wang, Chong Luo 4/17/2026

MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation

MM-WebAgent hierarchical multimodal agent for automated webpage generation maintaining style consistency across AIGC-generated elements.