OfficeQA Pro V2 Released with 120K Treasury PDFs, Frontier Agents Average 26% Accuracy
jefrankle · x · 2026-08-07
OfficeQA Pro V2 benchmark is introduced, built on a corpus of 120,000 PDFs provided by the U.S. Treasury. Currently, frontier AI agents average only 26% accuracy on this test.
Related event: Databricks Launches OfficeQA Pro V2 Benchmark(2 posts)→
More from Research
- MonkeyOCRv2 Sets Open-Source SOTA, Beating Qwen3-VL-235B — jiqizhixin · 2026-08-07
- Debate on AI Agent Evolution: Competition to Replace Collaboration for Resources — Justin_Halford_ · 2026-08-07
- AI Creates First Synthetic Viruses, Raising Biosecurity Concerns — financialtimes · 2026-08-07
- Science: First Functional AI-Generated Bacteriophage Genomes — BrianHie · 2026-08-07
- AI-Designed Viruses Spark Nordic Biosecurity Debate — nordicinst · 2026-08-07
- Extracting Robotic Action Signals from Egocentric Videos Using Only Open-Source Models — gui_penedo · 2026-08-07