Ax Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu 5/11/2026

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

Framework for evaluating safety vs. capability in phone-use agents, addressing ambiguity in existing benchmarks.

Ax Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Br\"andle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julian Coda-Forno, Can Demircan, Vittoria Dentella, Maria K. Eckstein, No\'emi \'Eltet\H{o}, Michael Franke, Thomas L. Griffiths, Fritz G\"unther, Susanne Haridi, Sebastian Hellmann, Stefan Herytash, Linus Hof, Eleanor Holton, Isabelle Hoxha, Zak Hussain, Akshay Jagadish, Elif Kara, Valentin Kriegmair, Evelina Leivada, Li Ji-An, Tobias Ludwig, Maximilian Maier, Marcelo G. Mattar, Marvin Mathony, Alireza Modirshanechi, Robin Na, Mariia Nadverniuk, Antonios Nasioulas, Surabhi S. Nath, Helen Niemeyer, Kate Nussenbaum, Sebastian Olschewski, Thorsten Pachur, Stefano Palminteri, Aliona Petrenco, Camille V. Phaneuf-Hadd, Angelo Pirrone, Manuel Rausch, Laura Raveling, Shashank Reddy, Milena Rmus, Evan M. Russek, Tankred Saanum, Kai Sandbrink, Louis Schiekiera, Johannes A. Schubert, Luca M. Schulze Buschoff, Nishad Singhi, Leah H. Somerville, Mikhail S. Spektor, Xin Sui, Christopher Summerfield, Mirko Thalmann, Anna I. Thoma, Taisiia Tikhomirova, Vuong Truong, Polina Tsvilodub, Konstantinos Voudouris, Robert C. Wilson, Kristin Witte, Shuchen Wu, Dirk U. Wulff, Hua-Dong Xiong, Songlin Xu, Lance Ying, Xinyu Zhang, Jian-Qiao Zhu, Eric Schulz 5/11/2026

Post-training makes large language models less human-like

Study showing post-training reduces LLM alignment with human behavior; introduces Psych-201 dataset for measuring behavioral alignment at scale.

Ax Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama 5/11/2026

Reliable Chain-of-Thought via Prefix Consistency

Prefix consistency method for improving Chain-of-Thought reliability by using answer reproduction as verification signal.

Ax Yanis Merzouki, Coral Izquierdo, Matei Ignuta-Ciuncanu, Marcos Gomez-Bracamonte, Riccardo Maggioni, Alessandro Lombardi, Camilla Mazzoleni, Federico Martelli, Balazs Gunther, Jonas Petersen, Philipp Petersen 5/11/2026

FactoryBench: Evaluating Industrial Machine Understanding

FactoryBench benchmark evaluates time-series models and LLMs on industrial robotic telemetry along four causal levels.

Ax Dimitrios Mallis, Marco Wang, Ahmet Serdar Karadeniz, Elisa Ricci, Anis Kacem, Djamila Aouada 5/11/2026

Text-to-CAD Evaluation with CADTests

CADTestBench introduces first test-based evaluation benchmark for Text-to-CAD task using automated testing methodology.

Ax Zekun Wu (University College London), Ze Wang (University College London), Seonglae Cho (Holistic AI), Yufei Yang (Imperial College London), Adriano Koshiyama (University College London), Sahan Bulathwela (University College London), Maria Perez-Ortiz (University College London) 5/11/2026

Tool Calling is Linearly Readable and Steerable in Language Models

arXiv research: Tool-calling in LLMs is linearly readable/steerable via internal activations. Tested 12 models, 77-100% steering accuracy.

Ax Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke Zettlemoyer, Christopher Potts, Xiaochuang Han, Srinivasan Iyer 5/11/2026

Fast Byte Latent Transformer

Byte Latent Transformer (BLT) addressing slow byte-level autoregressive generation with diffusion-based training and generation techniques.

Ax Jiatao Gu, Tianrong Chen, Ying Shen, David Berthelot, Shuangfei Zhai, Josh Susskind 5/11/2026

Normalizing Trajectory Models

Normalizing Trajectory Models (NTM) for efficient diffusion-based generation with few steps while preserving likelihood framework.

Ax Surbhi Goel, Adam R. Klivans, Konstantinos Stavropoulos, Arsen Vasilyan 5/11/2026

Testing Noise Assumptions of Learning Algorithms

Algorithm for testing whether training data satisfies noise model assumptions in computational learning theory.