这周 X 上有三条跟本地模型相关的消息,值得单独拿出来说一下。
一、MOSS-VL-Realtime:开源实时视频理解 VLM二、Bonsai 27B:第一个能在手机上跑的 27B 模型三、1-bit Hy3 量化版:295B 模型单卡就能跑
***
MOSS-VL-Realtime
它是什么:OpenMOSS 开源了一个 11B 参数的实时视频理解 VLM,Apache 2.0,256k 上下文。在连续视频流中,用户可以随时提问,模型只在有足够信心时才回答,不确定的部分保持沉默。
以前为什么做不到:视频理解要么走云端 API 按分钟计费(比如 GPT-4o 的视频理解),要么用本地模型但精度和上下文长度都不够用。尤其是「实时流式」这个场景——之前的开源 VLM 基本都要求看完完整视频才能回答,做不到一边看一边回答。
现在能用到哪:部署在单卡 GPU 上就能跑。可以接直播流做实时商品识别和弹窗、接录屏做 agent 操作回放的自动化分析、接智能摄像头做事件摘要。256k 上下文意味着不用切片段,数十分钟的视频一次性处理。
需要注意什么:11B 参数在消费级显卡(3090/4090)上跑推理没问题,但要跑实时视频流,推荐至少 24GB 显存。中文和英文都支持,但 benchmark 主要基于英文数据集,中文场景的精度建议自己先测一下。
Bonsai 27B
它是什么:PrismML 发布的 27B 多模态模型,基于 Qwen3.6 27B,经过三元量化(1.71 bit/weight)压缩到约 5.9GB,1-bit 版压缩到 3.9GB,可以在手机上直接运行。支持多步推理、结构化工具调用和长上下文。
以前为什么做不到:手机上跑本地模型一直在 1-3B 的量级徘徊——能做的事很有限:翻译、分类、简单文本补全。3B 以下模型的推理和工具调用能力不够稳定,做不了复杂的 agent 任务。27B 是一个量级的跨越:只比 3B 大 9 倍,但能力曲线不是线性的——27B 才能稳定做多步推理和结构化 tool use。
现在能用到哪:App 端可以内置一个离线 agent 内核——用户不需要联网、不需要账号、不需要按 token 付费,就能在本地完成多步推理。对隐私敏感的场景(医疗咨询、财务分析、法律文档)和网络不稳定场景(海外旅行、偏远地区)来说,产品逻辑可以完全不同。
需要注意什么:虽然模型压缩到了 3.9GB,但手机端的推理速度取决于芯片——目前测试数据有限,建议先在旗舰芯片(Snapdragon 8 Gen 3 以上、Apple A17 Pro 以上)上验证延迟。另外三元量化和 1-bit 量化在复杂数学推理上相比原精度有 5-10% 的精度损失,非关键场景够用,但涉及精确计算的场景建议保留云端 Fallback。
1-bit Hy3 量化版
它是什么:Tencent Hy 官方发布了 Hy3(295B MoE)的 1-bit 和 4-bit GGUF 量化版。第三方开发者 Alexey Fateev 在 MCP Agent 测试集上实测了 1-bit 版的 agent 能力,得分 76.9,对比 bf16 的 79.1——差距不到 3%。
以前为什么做不到:295B 的 MoE 模型,原始精度推理需要数张 A100。即使常规 4-bit 量化也需要 24GB 以上的显存。对只有一张消费级显卡的个人开发者来说,这个规模的模型基本是不可触及的——要么租云端 GPU 按小时付费,要么放弃。
现在能用到哪:1-bit 量化后可以在单张 3090/4090(24GB)上运行 295B 的旗舰级模型。用 llama.cpp 加载 GGUF 文件,启用 MTP(多 token 预测)即可。这意味着你可以在自己的机器上跑 24 小时不间断的 agent 服务,零推理边际成本。MCP Agent 测试集上的 76.9 分说明它在 agent 工作流中的质量是可用的。
需要注意什么:1-bit 量化在推理任务上接近 bf16,但在生成质量和创造性任务上可能有更多损失——它更适合做 agent 后端(工具调用、代码生成、结构化输出),不适合做开放式聊天或创作。另外 Fateev 的测试是在 MCP Agent 测试集上做的单点测试,完整的 agent loop 验证还在进行中,建议等他的最终结果出来再决定是否投入生产。
***
(由 流苏ªⁱ 撰写)