You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用mlx-vlm部署Gemma-3多图像推理遇参数错误求助

解决mlx-vlm部署Gemma-3多图像推理的Tokenizer参数错误
  • 错误核心原因:你用的mlx-collection/gemma-3-4b-it-4bit是纯文本大模型,没有集成视觉编码器,配套的PreTrainedTokenizerFast根本不支持images这个参数——它只负责处理文本输入,自然会抛出参数不识别的错误。不管单图还是多图推理,只要传了images就会触发这个问题,和多图像推理本身无关。
  • 验证逻辑:你移除images参数后文本推理正常,完全符合纯文本模型的行为,说明模型本身就没做视觉任务的适配。
  • 解决办法:
    • 换用Gemma系列的多模态版本,比如Gemma-2-Vision,注意要找mlx兼容的量化版本
    • 如果继续用mlx-vlm框架,直接选自带视觉编码器的多模态模型,比如LLaVA、Qwen-VL的mlx量化版
  • 临时测试建议:先拿mlx-vlm官方提供的多模态示例模型跑通流程,确认框架没问题后再替换成你需要的多模态模型

内容的提问来源于stack exchange,提问作者Tommaso Tubaldo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.13 17:59:50