一道基础生物题引发的大模型能力对比

近日,一道涉及基因倒位的基础生物学试题引发了关于大模型推理能力的讨论。多位网友测试发现,5.6 Sol xhigh 模型在该题上给出了错误答案,而 Opus 4.8 则能正确作答。此外,ChatGPT 在回答前会先进行“脑内推理”思考,最终也得出了正确结果。这一直观的对比测试,展现了不同模型在处理基础科学问题时逻辑推理与准确性的差异。

2026-07-24 ~ 2026-07-24 · 3 条相关