用户实测:新模型擅长费米估算与严格格式的诗歌改写
jd_pressman · x · 2026-08-22
用户分享了对某新模型的测试体验。测试内容包括:
- 费米估算:模型能够回忆并处理令人惊叹的大量事实和数字,成功完成估算。
- 诗歌改写:要求将 Blake 的《Jerusalem》改写为抑扬格五步格,模型思考了很长时间并基本完成了任务。
- 自我认知:模型对用户的认知程度不如其他前沿模型深,处于“半知道”状态。
所属事件:新模型实测引发社区热议:能力亮眼但评价仍受品牌影响(2 条相关)→
「模型」频道最新
- GLM 5.3 等 3 模型 Terminal-Bench 3 测试结果与 DeepSWE 表现相反 — zainhas · 2026-08-22
- 测模型猜人设:Claude 盘问本人,Grok 只刷推文 — repligate · 2026-08-22
- 依赖公共基准和舆论共识无法准确评估模型真实能力 — nptacek · 2026-08-22
- Opus 5 技能点侧重编程与哲学,意图理解能力突出 — davidad · 2026-08-22
- Fable 5 博士级数学能力显著,Anthropic 传统弱势逆转 — davidad · 2026-08-22
- 前沿模型能力参差不齐,需针对具体用例自测评估 — nptacek · 2026-08-22