小型视觉模型,别只问能不能看图North Micro Vision Instruct这两天更新了官方模型仓库。它只有2.4B参数,支持原始分辨率、多图和多语输入,目标任务包括OCR、图表、文档、视觉问答和目标定位。但选小型视觉模型,我不会只问“能不能看图”,而会做四项检查。第一,输入怎么处理?原始分辨率支持有助于保留比例和细节,但仍要检查图片尺寸、页数、多图组合方式,以及你的显存能否承受。第二,任务是否对口?看图描述、OCR、图表理解、视觉定位是不同任务。模型卡列出支持范围,不代表你的票据、截图或中文小字已经通过测试。第三,输出是什么?North Micro Vision当前输出是文字。它能理解图片,不等于直接生成图片,也不等于自动完成后续业务动作。第四,接入是否成熟?模型卡要求Transformers 5.16.0;正式版本发布前需要从源码安装,公共vLLM支持仍标为即将提供。模型够小,不等于部署已经省心。还有一个容易看错的地方:语言骨干支持128K上下文,但模型卡写明多模态提示已验证到8K。两者不能当成同一个数字。本次没有下载模型,也没有实测中文OCR。真要选型,建议用自己的20张难例做准确率、耗时、显存和失败类型对照。你最想拿小型视觉模型测试票据、图表、网页截图,还是长文档?人工智能多模态AIAI工具AIGC
