Turbo Harness: Instance-Adaptive Harness Optimization
WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents
Cogentic: Multi-Agent Orchestration for Automated Proof Discovery
How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?
PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents
Belief-Aware Multi-Agent Path Finding under Map Uncertainty
Learning from Research: Toward Lifelong Agent Harness Evolution
Unlearnable, or Unmeasured? On the Reliability of Difficulty Labels in RLVR
Agent Error Dataset: Scaling 50,000 Error–Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training
PTNO: Training Neural Operators with Noisy Monte Carlo Estimates for Particle Transport Problems
Who Verifies the Graph? Misspecification Attacks on Causal Action Verification for Language Agents
What Can Component-Replacement Evidence Establish? A Critical Scoping Review of Local Decisions in LLM Agents
AIMS: An Agentic AI Framework for Sim-to-Real Multi-Modal ISAC
Better Deck or Different Judge? Evaluating Agentic Harness Gains in Corporate and Investment Banking
Coverage Before Control: Route-Instruction Grounding and Steering for Controllable Retrosynthesis
ConflictGuide: AutoResearch Improves When Competing Behaviors Are Made Visible
OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software
GrammarRL: Effective Grammar-Constrained Decoding via Reinforcement Learning
Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding
FIGS: Evaluating Multi-Turn Sycophancy Without Penalizing Empathy
