效果可以达到8并发418token/s
主机:4卡3090主机配合nvlink,价格约6万左右
模型选择:qwen3.8-27b-w8a8-int8,兼顾质量性能与并发,针对3090有速度优化,开启MTP单请求可到70t/s
部署:使用Vllm,支持256k,多路并行
使用:cc switch➕codex➕本地模型
测试场景,low状态下,扫描总结中型项目只需要19s
相当于花几万块钱可以实现多人多智能体的无限♾️token,速度和质量也非常不错 #codex #qwen #本地部署ai #ai #opc






