清洗了一下。轻飘飘四个字。
但真做过项目就知道:模型工程师80%时间在搞数据,决定模型上限的从来不是网络结构,是数据。
说5个踩坑总结的关键能力:
[一R]数据配比(Data Mixture)是门玄学,但有章法。
代码加多了通用能力降、数学占比高闲聊变生硬。这是大厂最不愿公开的核心机密。先小规模ablation别all-in,领域数据5-20%是安全区。配比错了后面调啥都白搭。
[二R]去重不做,等于花钱让模型背书
重复数据是负资产——过拟合、浪费算力、测试集污染、吐训练原文。三层次:精确去重(hash)、近似去重(MinHash)、子串去重。datasketch / text-dedup直接用。
[三R]质量过滤:垃圾进垃圾出
规则过滤+模型打分+困惑度过滤。2026最大新挑战:过滤AI生成的低质内容——不过滤,你就是在用AI的呕吐物训AI[石化R]。
[四R]合成数据
直接让GPT生成一万条=多样性极差。要多样性优先、质量校验(淘汰30%+正常)、真实数据兜底、拒绝采样。合成数据是放大器,放大方法论也放大错误。
[五R]数据污染检测
benchmark题混进训练集=模型只是背过答案。n-gram重叠检测+训练前去污染+私有holt测。没做污染检测的分数,是用来骗自己和骗老板的。
