Ax Gregory Yauney, Shahzaib Saqib Warraich, Swabha Swayamdipta 3/9/2026

How Reliable is Language Model Micro-Benchmarking?

Meta-evaluation study analyzing reliability of micro-benchmarks for ranking LLMs, comparing against full benchmarks and random sampling approaches.

Ax Mario Markov (INSAIT, Sofia University "St. Kliment Ohridski"), Stefan Maria Ailuro (INSAIT, Sofia University "St. Kliment Ohridski"), Luc Van Gool (INSAIT, Sofia University "St. Kliment Ohridski"), Konrad Schindler (ETH Zurich), Danda Pani Paudel (INSAIT, Sofia University "St. Kliment Ohridski") 3/9/2026

FireScope: Wildfire Risk Prediction with a Chain-of-Thought Oracle

FireScope-Bench: dataset and benchmark for wildfire risk prediction using satellite imagery, climate data, and chain-of-thought reasoning with multimodal integration.

Ax Dashti A. Ali, Aras T. Asaad, Jacob J. Peoples, Mohammad Hamghalam, Natalie Gangai, Richard K. G. Do, Alice C. Wei, Amber L. Simpson 3/9/2026

A Novel Patch-Based TDA Approach for Computed Tomography Imaging

Applies topological data analysis to CT imaging for improved feature extraction in medical imaging ML models.

Ax Ravi Raju, Mengmeng Ji, Shubhangi Upasani, Bo Li, Urmish Thakker 3/9/2026

The Limits of Long-Context Reasoning in Automated Bug Fixing

Evaluates whether LLMs can reliably perform long-context code debugging and patch generation, testing limits of agentic workflows on software engineering tasks.

Ax Sanyam Singh, Naga Ganesh, Vineet Singh, Lakshmi Pedapudi, Ritesh Kumar, SSP Jyothi, Archana Karanam, Waseem Pasha, Ekta Kumari, C. Yashoda, Mettu Vijaya Rekha Reddy, Shesha Phani Debbesa, Chandan Dash 3/9/2026

Fine-Tuning and Evaluating Conversational AI for Agricultural Advisory

Fine-tuning conversational LLMs for agricultural advisory with domain-specific improvements. Addresses recommendation accuracy and farmer communication alignment.

Ax Anatoly Belikov, Ilya Fedotov 3/9/2026

Good-Enough LLM Obfuscation (GELO)

Arxiv paper proposing obfuscation method to protect LLM prompt privacy on shared accelerators. Addresses KV cache security against adversarial memory access.

HN kentf 3/9/2026

OpenAI's Symphony: Agent Management Layer

OpenAI's Symphony orchestrates autonomous coding agents for project work, monitoring task boards and managing PR delivery with proof-of-work artifacts.