Researcher Warns Parser Bugs and Chat Template Flaws Skew LLM Benchmarks

Developer kalomaze warns that tool-call parser bugs are a bigger confounder in evals than expected, and that hidden chat template serving flaws—not model quality—can cause models like GLM to spuriously fail tests that GPT-5.6 passes.

2026-09-19 ~ 2026-09-19 · 3 related posts