You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Gemini Vertex AI时遭遇费解的429资源耗尽错误

问题分析与解决建议

核心问题

调用Vertex Gemini流式处理PDF多模态请求时,间歇性触发429配额超限错误,错误指向DLP API,但自身未启用DLP服务,错误中的项目ID不属于自身组织,且本地Vertex AI配额未耗尽。

可能原因

  • Vertex Gemini的内容安全过滤功能会后台调用DLP API检测敏感内容,该DLP调用使用Google管理的共享项目(即错误中的911923099736),共享配额耗尽时就会触发429错误。
  • PDF多模态请求的流式响应会拆分处理,每个响应chunk可能都触发DLP检查,累积消耗共享DLP配额,导致间歇性超限。

解决措施

1. 调整内容安全过滤策略

在Vertex AI请求中降低内容安全检测的严格程度,或禁用不必要的检测类别,减少DLP令牌消耗。Node.js SDK示例:

const { GoogleGenerativeAI } = require("@google/generative-ai");
const genAI = new GoogleGenerativeAI(process.env.VERTEX_AI_API_KEY);

const model = genAI.getGenerativeModel({
  model: "gemini-1.5-pro",
  safetySettings: [
    { category: "HARM_CATEGORY_HATE_SPEECH", threshold: "BLOCK_ONLY_HIGH" },
    { category: "HARM_CATEGORY_SEXUALLY_EXPLICIT", threshold: "BLOCK_ONLY_HIGH" },
    { category: "HARM_CATEGORY_DANGEROUS_CONTENT", threshold: "BLOCK_ONLY_HIGH" },
    { category: "HARM_CATEGORY_HARASSMENT", threshold: "BLOCK_ONLY_HIGH" },
    // 若场景允许,可将特定类别设为"BLOCK_NONE"(谨慎使用)
  ],
});

2. 申请共享DLP配额提升

通过Google Cloud支持渠道提交配额提升请求,说明你的Vertex AI多模态使用场景,申请增加共享DLP配额的额度。

3. 优化请求频率

添加限流逻辑,避免短时间内发起大量流式请求,减少DLP令牌的累积消耗。Express框架示例:

const rateLimit = require("express-rate-limit");
const limiter = rateLimit({
  windowMs: 1000, // 1秒时间窗口
  max: 5, // 每秒最多允许5个请求
});
// 对聊天机器人的请求接口应用限流
app.use("/api/chat", limiter);

4. 检查组织级DLP政策

确认所在组织是否有强制启用DLP扫描的全局政策,若有可联系组织管理员调整适配你的业务场景。

内容的提问来源于stack exchange,提问作者Nick

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.16 18:40:08