4G显卡跑70B大模型。
刚看到一个神操作,4G显存的显卡居然能跑70B的大模型。这事是GitHub上一个叫AirLLM的开源项目干的。70B什么概念?就是700亿参数,一般要拿七八张顶级的显卡才跑得动。但这项目直接让你用一张4G显存的显卡就能跑起来。
4G显存现在随便一台笔记本都差不多这个配置,它怎么做到的?就是把模型拆成小块,算完一块再加载下一块。虽然速度慢点,但胜在门槛低。比如想跑Llama270B,以前得买几十万的服务器,现在自己电脑就能玩。
操作也简单,装个Python环境,然后pip install airllm。代码就一行,调用模型的时候加个参数就行。我朋友试了一下,跑起来内存占用不到4G,还挺稳。这还不算完,项目还支持本地推理,不用把数据传到云端。对搞科研的、做隐私相关项目的人来说简直福音。关键是这项目完全开源免费,大家都能用。
你们觉得这技术能火起来吗?

