Ax Daniel Song, Peter Ney, Cristina Menghini, Faizan Ahmad, Aidan Boyd, Nathaniel Li, Ziwen Han, Jean-Christophe Testud, Saisuke Okabayashi, Maeve Ryan, Jinpeng Miao, Hamza Kwisaba, Felix Binder, Spencer Whitman, Jim Gust, Esteban Arcaute, Dhaval Kapil, Jacob Kahn, Ayaz Minhas, Tristan Goodman, Lauren Deason, Alexander Vaughan, Shengjia Zhao, Summer Yue 5/6/2026

Code World Model Preparedness Report

Code World Model preparedness report: Meta's code generation and reasoning model assessed for frontier AI risks; found no additional catastrophic risks beyond current ecosystem.

Ax Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh 5/6/2026

Multi-Perspective Transformers in ARC-AGI-2 Challenge

Approach using multi-perspective transformers with test-time training and products of experts on ARC-AGI-2 visual reasoning benchmark.

Ax Tam Nguyen, Tu Anh Nguyen, Sina Alemohammad, Richard G. Baraniuk 5/6/2026

Minimizing Collateral Damage in Activation Steering

Method to minimize unintended side effects (collateral damage) when using activation steering to control LLM behavior through internal representation intervention.

Ax Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed Essouaied, Adepoju Jeremiah Moyondafoluwa, Robert Scholz, Bofeng Huang, Molly Beavers, Srishti Gureja, Anish Mahishi, Sameed Khan, Maxime Griot, Hunar Batra, Jean-Benoit Delbrouck, Siddhant Bharadwaj, Ronald Clark, Ashish Vashist, Anas Zafar, Leema Krishna Murali, Harsh Deshpande, Ameen Patel, William Brown, Johannes Hagemann, Connor Lane, Paul Steven Scotti, Tanishq Mathew Abraham 5/6/2026

Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

Medmarks: open-source benchmark suite with 30 benchmarks for evaluating LLMs on medical tasks including QA, information extraction, and calculations.