Ax Zibin Dong, Yicheng Liu, Shiduo Zhang, Baijun Ye, Yifu Yuan, Fei Ni, Jingjing Gong, Xipeng Qiu, Hang Zhao, Yinchuan Li, Jianye Hao 2/18/2026

ActionCodec: What Makes for Good Action Tokenizers

Study of action tokenization design for Vision-Language-Action models, examining what makes effective action tokenizers for VLA optimization.

Ax Beatrix M. B. Nielsen, Emanuele Marconato, Luigi Gresele, Andrea Dittadi, Simon Buchholz 2/18/2026

Logit Distance Bounds Representational Similarity

Mathematical analysis of representational similarity in discriminative models including autoregressive language models using logit distance bounds.

Ax Longfei Chen, Ji Zhao, Lanxiao Cui, Tong Su, Xingbo Pan, Ziyang Li, Yongxing Wu, Qijiang Cao, Qiyao Cai, Jing Zhang, Yuandong Ni, Junyao He, Zeyu Zhang, Chao Ge, Xuhuai Lu, Zeyu Gao, Yuxin Cui, Weisen Chen, Yuxuan Peng, Shengping Wang, Qi Li, Yukai Huang, Yukun Liu, Tuo Zhou, Terry Yue Zhuo, Junyang Lin, Chao Zhang 2/18/2026

SecCodeBench-V2 Technical Report

SecCodeBench-V2 benchmark for evaluating LLM code generation security across 98 scenarios and 22 CWE categories in 5 languages.

Ax David Exler, Joaquin Eduardo Urrutia G\'omez, Martin Kr\"uger, Maike Schliephake, John Jbeily, Mario Vitacolonna, R\"udiger Rudolf, Markus Reischl 2/18/2026

Bayesian Optimization for Design Parameters of 3D Image Data Analysis

Bayesian optimization pipeline for selecting and tuning deep learning models for 3D biomedical image segmentation and classification.

Ax Max Springer, Chung Peng Lee, Blossom Metevier, Jane Castleman, Bohdan Turbal, Hayoung Jung, Zeyu Shen, Aleksandra Korolova 2/18/2026

The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety

Analysis showing fine-tuning causes alignment collapse in language models and proposing geometric understanding of safety degradation.

Ax Yuqi Tian, Robert Paine, Attila Dobi, Kevin O'Sullivan, Aravindh Manickavasagam, Faisal Farooq 2/18/2026

Decision Quality Evaluation Framework at Pinterest

Decision quality evaluation framework for assessing content moderation by both human agents and LLMs at scale.

Ax Devang Acharya, Mohammad Hammoud 2/18/2026

Avey-B

Encoder-only adaptation of Avey attention-free architecture for efficient NLP under compute constraints.

Ax Davide Paglieri, Bart{\l}omiej Cupia{\l}, Jonathan Cook, Ulyana Piterbarg, Jens Tuyls, Edward Grefenstette, Jakob Nicolaus Foerster, Jack Parker-Holder, Tim Rockt\"aschel 2/18/2026

Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents

Framework for LLM agents to learn when to plan via reinforcement learning, improving efficiency and performance on long-horizon tasks.

Ax Harry Dong, David Brandfonbrener, Eryk Helenowski, Yun He, Mrinal Kumar, Han Fang, Yuejie Chi, Karthik Abinav Sankararaman 2/18/2026

Generalized Parallel Scaling with Interdependent Generations

Generalized parallel LLM inference scaling uses interdependent generations to share information across parallel responses, improving quality and efficiency.

Ax Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon 2/18/2026

MARS: Modular Agent with Reflective Search for Automated AI Research

MARS: AI agent framework for automated machine learning research. Budget-aware planning, modular script generation, and reflective search for computationally expensive experiments.

Ax Lucas Maes, Quentin Le Lidec, Dan Haramati, Nassim Massaudi, Damien Scieur, Yann LeCun, Randall Balestriero 2/18/2026

stable-worldmodel-v1: Reproducible World Modeling Research and Evaluation

stable-worldmodel-v1: reproducible open implementation of world models for agent reasoning and planning. Standardizes evaluation and reduces publication-specific code fragmentation.