Data Science领域中high throughput的具体含义是什么?
高吞吐量(
High Throughput)在数据领域的通俗解释 基础概念拆解
你可以把「吞吐量」理解成数据处理场景里的收费站通行能力:单位时间内能处理的最大数据量/任务量,高吞吐量就是指这个处理能力很强,单位时间能搞定的工作量远高于普通水平。
不同场景下的具体含义
- 离线数仓场景:指每小时/每天能完成的ETL任务总数据量,比如普通数仓一天能处理1TB数据,高吞吐量数仓可以做到一天处理100TB以上的结构化/非结构化数据
- 实时计算场景:指每秒能处理的消息条数,比如普通流处理任务每秒扛1万条消息,高吞吐量方案可以做到每秒扛100万+条消息不丢数、不超时
- 机器学习场景:指训练阶段每秒能读取/预处理的样本条数,或者推理阶段每秒能响应的请求数,比如大模型推理服务单卡每秒能响应10个请求就算高吞吐量配置
常见的高吞吐量优化手段
实现高吞吐量通常会做这些针对性调整:
- 用分布式架构替换单机部署,把数据/任务拆分到多台服务器并行处理
- 对数据做批量处理而非单条逐次处理,比如攒1000条数据再统一写库,比单条写库的吞吐量高几十倍
- 压缩传输数据、用列式存储替代行式存储,减少IO瓶颈的限制
和易混概念「低延迟」的区别
很多人会把这两个概念搞混,举个简单例子区分:
10条车道的收费站,1分钟能过100辆车,这是高吞吐量;如果单独给某辆车开了ETC专用通道,10秒就能过站,这是低延迟。
两者可以同时实现,也可以根据业务需求单独优化:比如离线数仓的历史日志归档场景只要求高吞吐量,对延迟要求很低;而实时风控的交易拦截场景,既要高吞吐量扛住每秒几十万的交易请求,也要低延迟在100毫秒内返回风控结果。
内容的提问来源于stack exchange,提问作者GRandAMi
相关产品推荐
相关产品推荐

