You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何通过.NET Core API(C#)分块导入百万级CSV至SQL Server

分块导入大型CSV文件至SQL Server的解决方案

原代码存在的问题

原代码一次性将100万条记录加载到内存中,最后单次提交所有数据,会导致内存占用过高(甚至触发OutOfMemoryException),同时给数据库带来极大压力,无法高效处理大型CSV文件。

优化方案:分批次处理

通过设置批次大小,每累积一定数量的记录就提交到数据库,并清理上下文跟踪,避免内存累积。同时简化实体赋值逻辑,减少不必要的对象创建。

关键优化点

  • 分批次提交:设置合理的批次大小(建议1000-5000条,可根据内存配置调整)
  • 清理上下文跟踪:每批次提交后清理ChangeTracker,释放内存
  • 简化实体使用:直接复用CsvReader读取的SalesRecord实例,无需重新实例化赋值
  • 可选优化:若需极致效率,可使用SQL Server原生批量导入工具(如bcp)或EF批量扩展库

修改后的代码

public void LoadLargeCsvFile()
{
    string filePath = @"F:\Test\Book1.csv";
    const int batchSize = 1000; // 可根据内存情况调整批次大小
    int recordCount = 0;

    using (var reader = new StreamReader(filePath))
    using (var csv = new CsvReader(reader, CultureInfo.InvariantCulture))
    {
        var records = csv.GetRecords<SalesRecord>();
        
        foreach (var record in records)
        {
            _context.SalesRecords.Add(record);
            recordCount++;

            // 达到批次大小则提交并清理上下文
            if (recordCount % batchSize == 0)
            {
                _context.SaveChanges();
                _context.ChangeTracker.Clear();
            }
        }

        // 提交剩余的未达批次数量的记录
        if (recordCount % batchSize != 0)
        {
            _context.SaveChanges();
            _context.ChangeTracker.Clear();
        }
    }
}

额外说明

如果你的项目允许使用第三方库,EFCore.BulkExtensions可以实现更高效的批量插入,直接将整批次数据批量写入数据库,进一步提升导入速度。

内容的提问来源于stack exchange,提问作者Abhijeet Kumar Jha

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.02 23:03:07