AgentArk, distilling multi-agent debate into a single LLM, accepted to NeurIPS 2026

jindong_wang92 · x · 2026-09-25

AgentArk distills multi-agent debate dynamics into a single LLM's weights, converting test-time interactions into implicit capabilities. Key numbers: +4.8% avg accuracy over single-agent baseline, 120 experiments across Qwen3/Gemma 3/Llama 3, three distillation strategies (R-SFT, trajectory augmentation, process-aware distillation), 342K questions and 2M reasoning trajectories. Code is open source.

Original post →

More from coding & agent

coding & agent channel →