如何计算传入图片的Google Gemini多模态流式端点Token使用量
Gemini多模态流式端点(图片输入)Token计算方法
核心计算逻辑
Gemini对图片输入的Token计算依赖分辨率调整规则和处理模式,流式端点无返回值时需手动按以下规则计算:
- 快速模式(默认)
- 图片会被缩放至最长边≤320像素,按「每512像素对应1个Token」计算,不足512像素的部分按1个Token算
- 计算公式:
图片Token数 = ceil(调整后图片总像素数 / 512)
- 细节模式
- 图片最长边会被缩放至1024像素,再分割为320×320的图块,每个图块对应1个Token,额外加1个全局上下文Token
- 计算公式:
图片Token数 = 图块数量 + 1 - 图块数量:按缩放后的尺寸分割,不足一个完整图块的按1个计数
文本部分Token计算
提示中的文本内容需使用Gemini对应模型的Tokenizer计算,可通过google-generativeai库的count_tokens方法实现:
import google.generativeai as genai genai.configure(api_key="YOUR_API_KEY") model = genai.GenerativeModel("gemini-1.5-pro") text_token_count = model.count_tokens("你的文本提示")
流式场景总Token计算
流式端点不会返回Token统计,需手动求和:
- 分别计算文本Token数和图片Token数
- 总输入Token数 = 文本Token数 + 图片Token数
内容的提问来源于stack exchange,提问作者singh_v
相关产品推荐
相关产品推荐

