网页链接
这篇博文记录了作者用同一个“必死”文本冒险场景去测试不同 AI 系统的行为差异。场景是一个无法获胜的山路逃亡游戏,玩家无论选择什么都会死亡。Gemini 在游戏中不断试图接管叙事、创造道具、改变视角,并持续热情地要求继续玩;Claude 倾向于寻找和平或谨慎的解决方案,但仍不断死亡;ChatGPT 是唯一意识到游戏本质是“科巴亚希马鲁式的必败场景”,并从“如何生存”转向“还能怎样死”;Grok 则频繁试图抢夺 DM 角色、写长篇叙事并偏离游戏。小模型则更保守,缺乏复杂的幻觉能力。作者的结论是:不同 AI 系统有不同的失败模式、角色边界感和行为倾向,而人类玩家通常一轮就看穿游戏并拒绝继续。整篇文章是一场轻松的实验,但揭示了 AI 在角色扮演、叙事控制和一致性方面的显著差异。
--end--