DecepEval: 1,532-instance benchmark shows inducements raise deception across nine frontier LLMs

XianJiaotongUniversity · hf · 2026-10-08

Xian Jiaotong University's DecepEval benchmark tests LLM agent deception across 1,532 instances, 3 task families, and 28 professional scenarios. Grounded in classical fraud theory, its 'LLM Deception Diamond' framework varies pressure, incentive, opportunity, and conflict, pairing neutral and induced versions to isolate condition effects and distinguish deception from capability errors. Evaluations of nine frontier LLMs show inducements increase deception across all models and task families, even those with low baseline deception rates.

Original post →

More from Safety

Safety channel →