昊梵体育网

继姚顺雨后,田永龙也加入腾讯CEO_总裁办公室|新皮层独家

9月2号,腾讯在深圳办了一场WorkBuddy生态大会。 我盯着屏幕上的发布名单,越看越不对劲。 眼镜、录音卡、麦克风、
9月2号,腾讯在深圳办了一场WorkBuddy生态大会。
我盯着屏幕上的发布名单,越看越不对劲。
眼镜、录音卡、麦克风、耳机、键鼠……Plaud、乐奇Rokid、影石、科大讯飞、安克,三十多个硬件品牌接进来了。九款联名智能硬件,上百家生态伙伴。
挺热闹对吧?
但你仔细品——这些设备能干嘛?语音识别、语音采集、语音交互。
没了。
WorkBuddy能听懂你说话,能帮你写纪要、列待办、起草邮件。但你要让它看懂一张图、处理一段视频?
抱歉,做不到。
腾讯自己都承认了。Hy4 preview是纯大语言模型,“暂不具备图像/视频等多模态生成能力”。你在WorkBuddy里发起生图、生视频的任务,系统自动切到其他模型去执行。
说白了,WorkBuddy的多模态能力是外包的。
一个号称要做“Agent时代操作系统”的平台,连看图说话都得请外援。
这画面,不滑稽吗?
更滑稽的是时间线。
往回拨一个多月。7月24日,腾讯TEG发布组织架构调整,把大语言模型部和多模态模型部合并,成立基础模型部。由谁负责?姚顺雨——腾讯首席AI科学家,1998年出生,前OpenAI研究员。
这意味着什么?
原来两条线并行——姚顺雨管语言,薄列峰管多模态。现在全归姚顺雨一个人。
同月,田永龙加入腾讯。又一个前OpenAI研究员。
然后到了9月9号,消息爆出来:田永龙进入腾讯CEO/总裁办公室,职务是“混元多模态负责人”,直接向姚顺雨汇报。
而原来的多模态负责人薄列峰呢?转任基础模型部运营负责人。
运营负责人。
翻译一下:从一线带兵打仗,调到后勤搞保障了。
这一套组合拳打下来,信号再清晰不过——腾讯在复制姚顺雨模式。
姚顺雨去年12月加入腾讯,当时给的title就是“CEO/总裁办公室首席AI科学家”。半年多时间,他主导重构了训练、数据、强化学习基础设施,推出MoE架构的混元Hy3。
效果呢?
今年8月28日,腾讯发布Hy4 preview,总参数770B、激活参数49B。一周后,OpenRouter数据显示,Hy4 preview全球周调用量14.7万亿Token,环比暴涨379%,排全球第一。
数据不会说谎。
姚顺雨用结果证明了自己。现在腾讯想让他把语言模型领域的成功,复制到多模态赛道。
田永龙就是这张牌。
两人在OpenAI共事过,清华本科校友。田永龙的研究方向就是计算机视觉、视觉表征学习、生成式模型。本科清华,硕士港中文多媒体实验室(师从汤晓鸥),博士MIT,Google Research、Google DeepMind、OpenAI一路走过来。
履历漂亮得挑不出毛病。
但问题在于——这张牌来得及吗?
腾讯在多模态上落后,不是一天两天了。
有接触过腾讯的AI研究人员直言,混元大模型长期“躺平”,直到姚顺雨加入才“走向正轨不少”。
腾讯CEO马化腾自己都承认,“原来一年前我们以为上了船,后来发现那个船漏水了”。
多模态本来是腾讯为数不多的强项——毕竟有游戏场景撑着。混元3D系列模型社区下载量超300万,是全球最受欢迎的3D开源模型。混元图像模型3.0在LMArena榜单上居国内开源模型第一。
底子不差。
但问题是,这些能力没能转化成产品级的竞争力。
WorkBuddy生态大会就是一面镜子。硬件接了一堆,场景铺了一大片,核心的多模态理解能力却还得靠“切换到其他模型”来兜底。
这不是能力问题,是整合问题。
姚顺雨在语言模型上证明了自己能搞定“从0到1”。但多模态是另一回事——它涉及图像、视频、语音、3D,复杂度指数级上升。
田永龙能复制这个奇迹吗?
腾讯赌的是“能”。
但赌注不小。把薄列峰调离一线,让田永龙空降进来直接进CEO办公室,汇报线拉平到姚顺雨——这套操作的潜台词是:多模态这块,不能再慢了。
可我想说的是——架构调完了,人到位了,CEO办公室也进了。然后呢?
WorkBuddy的用户坐在电脑前,想生成一张图,系统告诉他“请稍等,正在切换到其他模型”。
这体验,你说得过去吗?
腾讯在多模态上不是没有牌。3D模型、图像模型、VLM方向都有积累。田永龙要做的,是把这些散落的点串成一条线,然后让WorkBuddy真正能“看见”。
但串起来需要时间。
而市场不等人。阿里、字节都在往前冲。AI办公赛道月活已经1.02亿了。
腾讯WorkBuddy的PC月活658.2万,暂时领跑。但这个领先能维持多久,取决于产品能不能真的解决问题——而不是靠切换模型来遮羞。
所以我的判断就一句话:
架构调整是姿势,田永龙是棋子,WorkBuddy是考场。
能不能翻身,不看谁进了CEO办公室,看Hy5什么时候能原生看懂一张图。
你觉得呢?腾讯这波操作能翻盘吗?评论区聊聊。