操作系统仅支持文件访问时,DBMS如何访问磁盘页?
操作系统确实只提供文件级的访问接口,但DBMS是通过在普通文件之上构建自己的页管理层来实现磁盘页的读写的,核心思路是把文件当作一个“虚拟磁盘”,自己划分和管理页。具体实现逻辑如下:
预分配与文件划分
DBMS会先创建一个(或多个)专用数据文件,通常会预先分配足够大的空间(比如用Linux的ftruncate或Windows的SetEndOfFile),避免频繁扩展文件产生碎片。然后将这个文件按固定大小(比如4KB、8KB,通常和操作系统页大小对齐)划分成若干块,每一块就对应一个B-tree的磁盘页,每个页有唯一的页号。通过文件偏移量定位页
每个页的位置可以通过页号计算出来:偏移量 = 页号 × 页大小。DBMS直接使用操作系统的随机读写API来访问对应位置的内容,比如:- Linux下用
pread/pwrite,可以指定偏移量直接读写,无需移动文件指针,适合并发场景 - Windows下用
ReadFile/WriteFile配合文件指针定位 - C++标准库可以用
fseek+fread/fwrite实现同样的效果
举个简单的C++实现片段:
const size_t PAGE_SIZE = 4096; // 定义页大小为4KB FILE* db_file = fopen("mydb.db", "rb+"); if (!db_file) { /* 错误处理 */ } int target_page_num = 10; // 要访问第10个页 fseek(db_file, target_page_num * PAGE_SIZE, SEEK_SET); // 定位到页的起始位置 char page_buf[PAGE_SIZE]; size_t read_bytes = fread(page_buf, 1, PAGE_SIZE, db_file); if (read_bytes != PAGE_SIZE) { /* 读取错误处理 */ } // 在这里解析page_buf中的页数据(比如B-tree节点、元数据等) fclose(db_file);- Linux下用
页缓存(Buffer Pool)优化
为了避免频繁磁盘IO,DBMS会在内存中维护一个缓冲池(Buffer Pool),把常用的页加载到内存中,修改后批量刷回磁盘。缓冲池通常用LRU(最近最少使用)等策略管理,确保内存资源高效利用,只有当缓存满了或者需要持久化时才会写回磁盘。自定义页格式
每个页除了存储B-tree的节点数据,还会包含DBMS自定义的元数据:比如页号、校验和、空闲空间指针、页类型(叶子节点/非叶子节点)等。这些元数据让DBMS能快速识别页的作用和状态,实现B-tree的结构管理。
至于你说C++标准库API里找不到页相关的内容,是因为页级访问是DBMS在应用层实现的逻辑,不属于标准库提供的基础文件操作功能——标准库只负责抽象的文件读写,而如何把文件划分为页、管理页的生命周期,都是DBMS自己封装的逻辑。
内容的提问来源于stack exchange,提问作者Nehchal Jindal

