新研究发现:人类 TSP 解近乎最优,但仍有稳定人类偏差
xuanalogue · x · 2026-07-29
研究发现:人类 TSP 解法接近最优,但保留独特偏差
这篇 arXiv 预印本研究了人类在组合优化问题中的“类人”解法,主案例是 欧氏旅行商问题(TSP)。
作者采样了大量 TSP 实例,收集人类路径,并与 Pointer Networks 进行对比。网络分别用多种目标训练:
- 强化学习
- 用最优解监督训练
- 用人类解监督训练
- 先用最优解预训练,再做 RL 微调
核心结论是:人类路线不是最优解的简单复制,但通常落在一个“接近最优”的几何盆地里,同时保留了稳定的人类特有偏差。论文认为,最能解释人类解的模型不是直接模仿最优解,而是“最优解预训练 + RL 微调 + Best-of-N 解码”的组合。
「研究」频道最新
- NSF 推出四年制博士项目,企业自建 AI 实验室被看作更近了 — annbordetsky · 2026-07-29
- 新论文称 AI 写书正淹没 Amazon 并挤压非 AI 书销量 — TuhinChakr · 2026-07-29
- 商汤开源 SenseNova-Vision,一模型覆盖检测到 3D 重建 — socialwithaayan · 2026-07-29
- 施密德胡贝尔称 AlphaFold 忽略了更早的蛋白结构预测工作 — SchmidhuberAI · 2026-07-29
- 新论文用逆强化学习从示范中提取可审计对齐奖励 — nagpalchirag · 2026-07-29
- AI 破译失传古语言:挑战线性 A 与伊特鲁里亚文 — Ars Technica AI · 2026-07-29