Azure App Services间歇性返回503.64错误排查问询
间歇性Azure App Service 503.64错误排查求助
我们有多个运行在Azure App Services上的API,近期遭遇间歇性服务中断,具体表现如下:
- 调用请求中10-25%返回
503.64错误,其余指向同一端点的请求响应正常 - 所有失败的503请求未出现在App Insights或App Service的Web服务器日志中,仅能通过调用方的追踪日志(如App Gateway日志、发起内部REST调用的其他App Services)追踪到
- 故障无明确发生规律:两次中断间隔短至1小时,长至2-3天;单次持续时间为2-30分钟
- 问题与流量、系统负载无关,可在任意时段触发,且在I1、I2层级的App Service计划中均出现
- 已尝试超必要规模横向扩展服务,问题仍未解决
错误详情
根据503状态码的64子状态码定义,该错误指向重写模块异常:
<!-- Antares Rewrite provider codes--> <error id ="64" description="Exception in rewrite provider (probably SQL)" />
令人困惑的是,同一时段内部分经过重写的调用可成功执行,部分却触发该错误。
重写规则示例
以下是其中一个故障服务的重写规则,作用是将指定公开API端点重写为内部请求地址,其余API请求直接传递至控制器:
<rewrite> <rules> <rule name="LegacyGetStatus"> <match url="Mapping/fw/1.0/Status(.*)" /> <action type="Rewrite" url="api/Status{R:1}" /> </rule> </rules> </rewrite>
已采取的行动
我们已于一周前提交Azure官方支持工单,同时正在自行尝试排查问题根源及缓解方案,希望能从社区获得更多排查思路。
内容的提问来源于stack exchange,提问作者Origameg
相关产品推荐
相关产品推荐

