论文标题:Make It Long, Keep It Fast: End-to-End 10k-Sequence Modeling at Billion Scale on Douyin Recommendation
在抖音这种十亿级用户量的短视频平台上,大家每天划过的视频成百上千。用户的历史行为序列越长,推荐模型就越能精准捕捉你的潜在兴趣。 但在工业级实时推荐中,把用户历史行为序列从几百拉长到 10,000 个(10k),会带来可怕的计算延迟和算力成本。
字节跳动推荐团队在本文中提出了一套端到端(End-to-End)超长序列推荐系统,成功将 10,000 长度的用户行为历史无缝引入千亿级在线推荐系统中,并在抖音全量上线!
三大核心创新点:
(1) 架构创新(STCA):提出了目标到历史的堆叠交叉注意力机制(Stacked Target-to-History Cross Attention),把复杂度从传统 Transformer 的 O(L^2) 降到了 O(L),算得又快又准。
(2) 工程创新(RLB):提出了请求级批处理(Request Level Batching),让同一次刷视频请求中的多个候选视频共享同一个用户的行为编码,计算与传输开销大降 8 倍!
(3) 训练创新(外推训练):采用“稀疏训练,密集推理”(Train Sparsely, Infer Densely)策略,训练时用 2k 长度,在线推理时外推到 10k 长度,不增加训练成本就能享受万级序列的红利。
#字节跳动算法 #推荐系统 #大模型ScalingLaw #Transformer架构 #AI论文解读 #机器学习 #深度学习




