浏览知识库目录

C++

手写 LRU 缓存

通过双向链表和哈希表实现 O(1) 的最近最少使用缓存,并处理更新、容量和引用安全。

手写 LRU 缓存

通过双向链表和哈希表实现 O(1) 的最近最少使用缓存,并处理更新、容量和引用安全。

本系列代码使用 C++20 和 oc::handmade 命名空间,目标是解释实现机制、复杂度和工程边界,不是替代标准库。普通容器与缓存核心不内置互斥锁;这不代表 lock-free。


一、学习目标

  • 实现 O(1) 提升与淘汰
  • 保持哈希索引和链表一致
  • 写出确定性访问轨迹测试

二、前置条件

完成 FIFO 缓存与 list 篇。

Linux/macOS:

cmake -S . -B build -DCMAKE_BUILD_TYPE=Debug
cmake --build build -j
ctest --test-dir build --output-on-failure

Windows PowerShell:

cmake -S . -B build -DCMAKE_BUILD_TYPE=Debug
cmake --build build --config Debug
ctest --test-dir build -C Debug --output-on-failure

三、问题与设计选择

链表头表示最近使用,尾表示最久未使用;哈希表保存键到链表迭代器。命中的 get 和更新 put 都把节点 splice 到头部。

这里刻意保留一条边界:教学实现覆盖构造、复制移动、核心修改、查找和迭代契约,但不复刻标准库全部重载、ABI、constexpr、异构查找或节点句柄。


四、内存布局与核心不变量

索引中的每个迭代器指向唯一链表节点;链表头最热、尾最冷;数量不超过 capacity。

每个修改操作都按“准备资源 → 构造新状态 → 提交连接或指针 → 清理旧状态”的顺序设计。提交点之前发生异常,应保持原对象可继续使用;无法提供强保证时,会在接口说明中明确基本保证。


五、核心实现

std::optional<Value> get(const Key& key) {
    auto found = index_.find(key);
    if (found == index_.end()) return std::nullopt;
    items_.splice(items_.begin(), items_, found->second);
    return found->second->second;
}

上面先聚焦最容易写错的核心步骤;若本篇对应一个独立组件,下一节给出统一工程中的完整教学实现。代码没有放入 std 命名空间,避免未定义行为和名称冲突。


六、完整教学实现

下面是统一工程中经过 GCC、Clang、GoogleTest 和 Sanitizer 验证的完整组件。它依赖前序文章已经实现的公共类型以及头文件中的标准库 #include

namespace oc::handmade {

template<class Key, class Value, class Hash = std::hash<Key>>
class lru_cache {
    using item = std::pair<Key, Value>;
    std::size_t capacity_;
    std::list<item> items_;
    std::unordered_map<Key, typename std::list<item>::iterator, Hash> index_;
public:
    explicit lru_cache(std::size_t capacity) : capacity_(capacity) {}
    std::size_t size() const noexcept { return index_.size(); }
    std::size_t capacity() const noexcept { return capacity_; }
    bool contains(const Key& key) const { return index_.contains(key); }
    std::optional<Value> get(const Key& key) {
        auto found = index_.find(key);
        if (found == index_.end()) return std::nullopt;
        items_.splice(items_.begin(), items_, found->second);
        return found->second->second;
    }
    bool erase(const Key& key) {
        auto found = index_.find(key);
        if (found == index_.end()) return false;
        items_.erase(found->second);
        index_.erase(found);
        return true;
    }
    void put(Key key, Value value) {
        if (capacity_ == 0) return;
        if (auto found = index_.find(key); found != index_.end()) {
            found->second->second = std::move(value);
            items_.splice(items_.begin(), items_, found->second);
            return;
        }
        items_.push_front({std::move(key), std::move(value)});
        index_[items_.front().first] = items_.begin();
        if (index_.size() > capacity_) erase(items_.back().first);
    }
};

}  // namespace oc::handmade

生产级标准库还要处理完整 allocator 传播、全部重载、ABI、调试迭代器和平台特化;这里保留的是能够独立推导核心数据结构的教学边界。


七、使用示例与输出

预期输出或状态:

容量 2,put A、B、get A、put C 后淘汰 B,A 与 C 命中。

示例必须在文章对应的测试目标中实际编译。涉及顺序的输出只依赖接口明确承诺的顺序;无序容器不会把某次桶顺序写成稳定结果。


八、复杂度与失效规则

操作 复杂度 说明
get 平均 O(1) 提升到表头
put 平均 O(1) 更新或插入
erase 平均 O(1) 删除两处
evict O(1) 删除表尾

复杂度中的 O(1) 若标记为“平均”或“摊还”,不能在面试中省略限定词。任何重新分配、节点删除、rehash 或缓存淘汰都必须单独说明迭代器、引用与指针是否失效。


九、异常安全与资源管理

  • 获取资源后立即交给 RAII 对象或明确记录已构造数量。
  • 用户类型构造、复制、移动、比较器和哈希器都可能抛异常。
  • 只有在所有后续步骤不会失败时才修改不可回滚的链接。
  • 析构、释放和关闭路径不得抛异常。
  • 并发包装通过回调在锁内访问,避免返回保护对象的裸引用。

十、常见错误

1. 链表移动后忘记更新索引(splice 时其实无需)

链表移动后忘记更新索引(splice 时其实无需)会破坏本篇建立的契约。调试时先检查核心不变量,再缩小到触发该状态的最短操作序列。

2. 返回内部引用后并发淘汰

返回内部引用后并发淘汰会破坏本篇建立的契约。调试时先检查核心不变量,再缩小到触发该状态的最短操作序列。

3. 更新值却没有提升热度

更新值却没有提升热度会破坏本篇建立的契约。调试时先检查核心不变量,再缩小到触发该状态的最短操作序列。


十一、面试追问

  1. 为什么必须是双向链表?
  2. LRU 对顺序扫描为何敏感?
  3. 分片 LRU 怎样降低锁竞争?

回答时先说数据结构不变量,再给复杂度,最后说明异常、迭代器或并发边界,通常比背诵结论更有说服力。


十二、练习与自测

  1. 实现 peek 不提升热度
  2. 支持运行时 resize
  3. 用 Zipf 访问分布测试命中率

自测标准:能够不看代码画出内存或节点关系,解释一次成功操作和一次失败回滚,并写出至少一个会击穿错误实现的测试。


十三、官方资料与延伸阅读


上一篇:手写 FIFO 缓存 | 下一篇:手写 LFU 缓存