Stealing Reasoning Traces from Proprietary LLM APIs Paper • 2608.09867 • Published 13 days ago • 111
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning Paper • 2607.07508 • Published Jul 8 • 30
Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization Paper • 2607.22334 • Published 30 days ago