中间的“ബന്ധ”是 Malayalam,也就是印度喀拉拉邦主要使用的马拉雅拉姆文。更准确地说,Malayalam 里的完整词“ബന്ധം”(bandham)表示 relationship、relation、connection,截图里的形式只差最后一个字符。
所以“情绪价值与 AI ബന്ധ……”在语义上居然很像“情绪价值与 AI 的关系”。
这就比普通乱码奇怪了。模型可能把标题应该表达的意思概括对了,却突然选错了输出语言。
多语言 LLM 里确实有 language confusion 这个问题。ACL 2025 的研究发现,模型会部分或全部生成用户没有期待的语言;ACL 2026 的 OLA 又发现,即使语言线索对人已经很明显,frontier models 仍会选错输出语言,甚至中途发生 language intrusion。最近也有人报告过整段英文 ChatGPT 对话被自动起成中文标题,而且语义概括本身还是对的。
可这个标题后面还有“打一肖”。它大量存在于生肖竞猜、彩票预测和 SEO spam 页面里。偏偏 EMNLP 2025 已经专门研究过 GPT vocabulary 中的 Polluted Chinese tokens,今年的新研究又直接确认大规模中文 web corpus 里存在广泛的博彩 spam 污染。
但现在还不能说两件事已经连上了。没有证据证明“打一肖”就是训练数据污染直接漏出来的,也不知道 ChatGPT 自动标题具体用什么模型和 tokenizer。
所以这个 case 最怪的地方可能不是“AI突然说印度文”,而是它前半截似乎意思还对,语言先错了;后半截才真正开始失去语义连续性。
AI 说胡话,不一定代表它从一开始就没理解。










