谷歌与佐治亚理工Wild Dolphin Project合作的海豚大模型有了新进展:模型能根据一段海豚叫声预测接下来的声音序列,相当于续写。但续写不等于翻译,更不等于能“听懂”海豚在说什么。
动物叫声与人类语言存在本质差异。一个叫声不固定对应一个含义,个体间有“口音”,叫声还会受环境与场景影响。
叫声更像线索,真正的语义需要结合当时情境、互动对象和行为一起判断。特拉维夫大学两位研究者在2023年发表于《Current Biology》的讨论中指出:让AI模仿生成动物声音相对容易,难的是让AI搞清声音所对应的情境。
这正是当前宠物硬件没有主推“翻译器”的原因。主流产品选择先做“赛博观察员”:带摄像头的智能猫砂盆、喂食器、宠物专用摄像头记录如厕、进食和日常行为。
智能项圈采集活动、睡眠、心率数据,再由AI判断异常。海豚模型同样依赖这类多模态积累。Wild Dolphin Project自1985年起持续跟踪同一群野生海豚,同步记录声音、个体身份、互动关系和行为视频,几十年数据才支撑起今天的续写能力。
因此,AI真正能“翻译”动物语言之前,必须先理解行为场景。单纯的声音模仿更像鹦鹉学舌,无法建立语义映射。
过度宣传“翻译器”会放大拟人化误解,把动物表达压缩成人类情绪标签。目前更现实的路径是:通过长期行为数据建立“叫声—情境—状态”的关联。这比续写难得多,也更有价值。
