You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何计算传入图片的Google Gemini多模态流式端点Token使用量

Gemini多模态流式端点(图片输入)Token计算方法

核心计算逻辑

Gemini对图片输入的Token计算依赖分辨率调整规则和处理模式,流式端点无返回值时需手动按以下规则计算:

  • 快速模式(默认)
    • 图片会被缩放至最长边≤320像素,按「每512像素对应1个Token」计算,不足512像素的部分按1个Token算
    • 计算公式:图片Token数 = ceil(调整后图片总像素数 / 512)
  • 细节模式
    • 图片最长边会被缩放至1024像素,再分割为320×320的图块,每个图块对应1个Token,额外加1个全局上下文Token
    • 计算公式:图片Token数 = 图块数量 + 1
    • 图块数量:按缩放后的尺寸分割,不足一个完整图块的按1个计数

文本部分Token计算

提示中的文本内容需使用Gemini对应模型的Tokenizer计算,可通过google-generativeai库的count_tokens方法实现:

import google.generativeai as genai

genai.configure(api_key="YOUR_API_KEY")
model = genai.GenerativeModel("gemini-1.5-pro")
text_token_count = model.count_tokens("你的文本提示")

流式场景总Token计算

流式端点不会返回Token统计,需手动求和:

  • 分别计算文本Token数和图片Token数
  • 总输入Token数 = 文本Token数 + 图片Token数

内容的提问来源于stack exchange,提问作者singh_v

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.22 08:42:35