SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? Paper • 2608.19799 • Published 4 days ago • 61
FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis Paper • 2608.18580 • Published 5 days ago • 114
EnvHarness: Awakening Static Worlds for Agent Learning Paper • 2608.19880 • Published 4 days ago • 256
Demystifying Agent Skills: Why They Work-Until They Don't Paper • 2608.14036 • Published 10 days ago • 163
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling Paper • 2608.15089 • Published 9 days ago • 436
Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search Paper • 2608.15669 • Published 8 days ago • 62
Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization Paper • 2608.16072 • Published 7 days ago • 148
Intern-S2-Preview: Scientific Agentic Foundation Model Paper • 2608.13505 • Published 11 days ago • 69
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design Paper • 2608.13560 • Published 11 days ago • 54
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers Paper • 2608.06867 • Published 17 days ago • 109
DarwinX: Evolving Agent Harnesses Through Natural Selection Paper • 2608.07545 • Published 24 days ago • 113
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning Paper • 2608.09888 • Published 14 days ago • 712
Evo-Bench: Can Language Models Improve Agent Harness? Paper • 2608.09096 • Published 14 days ago • 18
Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution Paper • 2608.08311 • Published 16 days ago • 90
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA Paper • 2608.09819 • Published 14 days ago • 338
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring Paper • 2608.09802 • Published 14 days ago • 133
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 29 days ago • 106