数组中的第 K 个最大元素
nums=[3,2,1,5,6,4],第 2 大元素 5。
nums=[3,2,1,5,6,4],第 2 大元素 5。
堆中保存全部元素,还是只保存当前仍可能进入答案的候选?
小顶堆维护当前见过的最大 k 个数;Quickselect 只作为面试进阶。
先说结论:这道题到底解决什么
怎样从“nums=[3,2,1,5,6,4],第 2 大元素 5。”推导出 堆 · TopK,并证明每次状态变化都不会漏掉答案?
中心结论:小顶堆维护当前见过的最大 k 个数;Quickselect 只作为面试进阶。
- 1.暴力方案在哪里重复计算,为什么仍然是正确基线?
- 2.堆中保存全部元素,还是只保存当前仍可能进入答案的候选?
- 3.不变量“堆维护当前见过的 k 个最大,堆顶是第 k 大。”为什么能保证算法安全前进?
完整题目与题意拆解
找出数组中第 K 大的元素。这一题非常经典。可以用 O(n) 的时间复杂度实现。
在本站主例中,nums=[3,2,1,5,6,4],第 2 大元素 5。
算法最终需要得到或观察:第 2 大为 5。
- • 输入:nums=[3,2,1,5,6,4],第 2 大元素 5。
- • 机器需要维护:大小 k 堆、堆顶。
- • 最终可观察结果:第 2 大为 5。
先看清算法到底要维护什么
先建立输入、目标、输出和第一批状态,不急着进入模板。
堆顶是第 K 大候选中的最小值
第一层方案:暴力做法
每轮在全部元素中重新寻找最值会重复扫描;堆持续维护下一位最值得处理的候选。
暴力方案的价值是确认题意并提供正确性基线。它通常会覆盖所有候选, 但没有保存已经确认的信息,因此同一状态会被重新计算。
重复工作究竟发生在哪里
把重复读取或重复搜索的区域明确标出,再决定优化必须保存什么。
堆顶是第 K 大候选中的最小值
整体地图:先做什么,再做什么
- 1建模把输入翻译成“优先级候车区”,明确答案需要观察什么。
- 2状态只维护 大小 k 堆、堆顶。
- 3转移每一步按照 小顶堆维护当前见过的最大 k 个数;Quickselect 只作为面试进阶。
- 4收尾读取 第 2 大为 5。,并复核边界与复杂度。
优先级候车区:核心概念
先确定堆顶语义,再确定超过容量时淘汰谁。
这道题不是为了记住一个组件名称,而是为了让状态具有可解释的语义:大小 k 堆、堆顶。
- • 堆维护当前见过的 k 个最大,堆顶是第 k 大。
建立“优先级候车区”心智模型
用主例建立核心状态,先预测下一步,再公开正确分支和理由。
堆顶是第 K 大候选中的最小值
核心机制:状态如何一步步变化
在快速选择 quickselect 的 partition 操作中,每次 partition 操作结束都会返回一个点,这个标定点的下标和最终排序之后有序数组中这个元素所在的下标是一致的。利用这个特性,我们可以不断的划分数组区间,最终找到第 K 大的元素。执行一次 partition 操作以后,如果这个元素的下标比 K 小,那么接着就在后边的区间继续执行 partition 操作;如果这个元素的下标比 K 大,那么就在左边的区间继续执行 partition 操作;如果相等就直接输出这个下标对应的数组元素即可。
小顶堆维护当前见过的最大 k 个数;Quickselect 只作为面试进阶。
执行过程中持续维护:大小 k 堆、堆顶。
正确性依赖以下不变量:堆维护当前见过的 k 个最大,堆顶是第 k 大。
面试时可以压缩为:大小为 k 的小顶堆:时间 O(n log k),空间 O(k)。Quickselect 进阶:平均 O(n),最坏 O(n²),空间 O(1)。
落到当前题,执行机制可以压缩为:小顶堆维护当前见过的最大 k 个数;Quickselect 只作为面试进阶。每一次更新都必须保持核心不变量,而不是只让样例碰巧得到正确答案。
一次状态转移为什么成立
集中观察一次选择、计算和状态写回,让变量变化与原因同时出现。
处理 a[0]=3
正确性证明:为什么不会漏答案
初始化:算法开始时,全部合法候选仍在状态表示范围内;堆维护当前见过的 k 个最大,堆顶是第 k 大。
保持:执行“小顶堆维护当前见过的最大 k 个数;Quickselect 只作为面试进阶。”时,只删除已经能证明不可能的候选,并把新信息写回 大小 k 堆、堆顶。
终止:没有待处理状态或达到命中条件时,当前可观察结果就是“第 2 大为 5。”。
完整执行过程
- 1题目与输入nums=[3,2,1,5,6,4],第 2 大元素 5。 因为:小顶堆维护当前见过的最大 k 个数;Quickselect 只作为面试进阶。
- 2维护大小为 2 的小根堆扫描数组,堆只保留 k 个最大。 因为:小根堆堆顶是第 k 大的门槛。
- 3纳入 2,堆大小 2尝试加入当前数,超出 k 则弹出最小。 因为:堆中始终是当前见过的 k 个最大数。
- 4预测下一步先不要看下一帧——根据当前不变量,预测算法接下来会怎么动。 因为:主动预测会暴露你对不变量的真实理解,比被动看动画有效得多。
- 5纳入 5,堆大小 2尝试加入当前数,超出 k 则弹出最小。 因为:堆中始终是当前见过的 k 个最大数。
- 6纳入 6,堆大小 2尝试加入当前数,超出 k 则弹出最小。 因为:堆中始终是当前见过的 k 个最大数。
- 7第 2 大元素 = 5扫描结束,堆顶为第 k 大。 因为:O(n log k) 适合数据流。
- 8收尾与复杂度第 2 大为 5。 因为:时间 O(n log k) · 空间 O(k)。小顶堆维护当前见过的最大 k 个数;Quickselect 只作为面试进阶。
从输入完整走到可观察结果
从主例第一帧运行到答案,时间轴始终显示当前状态、因果解释和下一步。
堆顶是第 K 大候选中的最小值
把动画和 Go 代码逐行对应
代码窗口不会按容易漂移的固定数字行号硬绑动画,而是根据当前语义阶段, 在完整 Go 实现中定位选择、计算、写回或返回分支。当前变量与高亮行一起变化。
让每个动作都落到 Go 分支
重新执行关键分支,只显示当前代码附近窗口,并说明这行为什么在此刻运行。
堆顶是第 K 大候选中的最小值
完整 Go 提交代码与最小测试
import (
"math/rand"
"sort"
)
// 解法一 排序,排序的方法反而速度是最快的
func findKthLargest1(nums []int, k int) int {
sort.Ints(nums)
return nums[len(nums)-k]
}
// 解法二 这个方法的理论依据是 partition 得到的点的下标就是最终排序之后的下标,根据这个下标,我们可以判断第 K 大的数在哪里
// 时间复杂度 O(n),空间复杂度 O(log n),最坏时间复杂度为 O(n^2),空间复杂度 O(n)
func findKthLargest(nums []int, k int) int {
m := len(nums) - k + 1 // mth smallest, from 1..len(nums)
return selectSmallest(nums, 0, len(nums)-1, m)
}
func selectSmallest(nums []int, l, r, i int) int {
if l >= r {
return nums[l]
}
q := partition(nums, l, r)
k := q - l + 1
if k == i {
return nums[q]
}
if i < k {
return selectSmallest(nums, l, q-1, i)
} else {
return selectSmallest(nums, q+1, r, i-k)
}
}
func partition(nums []int, l, r int) int {
k := l + rand.Intn(r-l+1) // 此处为优化,使得时间复杂度期望降为 O(n),最坏时间复杂度为 O(n^2)
nums[k], nums[r] = nums[r], nums[k]
i := l - 1
// nums[l..i] <= nums[r]
// nums[i+1..j-1] > nums[r]
for j := l; j < r; j++ {
if nums[j] <= nums[r] {
i++
nums[i], nums[j] = nums[j], nums[i]
}
}
nums[i+1], nums[r] = nums[r], nums[i+1]
return i + 1
}
// 扩展题 剑指 Offer 40. 最小的 k 个数
func getLeastNumbers(arr []int, k int) []int {
return selectSmallest1(arr, 0, len(arr)-1, k)[:k]
}
// 和 selectSmallest 实现完全一致,只是返回值不用再截取了,直接返回 nums 即可
func selectSmallest1(nums []int, l, r, i int) []int {
if l >= r {
return nums
}
q := partition(nums, l, r)
k := q - l + 1
if k == i {
return nums
}
if i < k {
return selectSmallest1(nums, l, q-1, i)
} else {
return selectSmallest1(nums, q+1, r, i-k)
}
}func main() {
// 1. 主例
// 输入:mode="kth-largest", nums=[3,2,1,5,6,4], k=2
// 期望:第 2 大为 5。
//
// 2. 失败 / 未命中
// 检查:第 k 大不是第 k 个不同的数字。
//
// 3. 边界
// 空输入、单元素、最小合法规模,以及答案恰好落在边界的情况。
//
// 4. 迁移
// LC347 前 K 高频;LC703 Kth
}Go 参考实现基于 halfrost/LeetCode-Go 的 MIT 许可代码整理,并按本站教学结构补充解释与动画映射。
正确性与复杂度
执行过程中只保留仍可能影响答案的状态。小顶堆维护当前见过的最大 k 个数;Quickselect 只作为面试进阶。
额外状态主要用于维护:大小 k 堆、堆顶。
- • 堆维护当前见过的 k 个最大,堆顶是第 k 大。
最容易写错的地方
第 k 大不是第 k 个不同的数字。
小顶堆不是最大堆。
堆里不是保存所有数字,只保存 k 个候选。
Quickselect 的 O(n) 是平均复杂度,不是最坏复杂度。
必须额外检查空输入、单元素、未命中或不可达情况,以及恰好落在边界的输入。
最后复盘:带走逻辑链
- 1题意nums=[3,2,1,5,6,4],第 2 大元素 5。
- 2重复每轮在全部元素中重新寻找最值会重复扫描;堆持续维护下一位最值得处理的候选。
- 3优化小顶堆维护当前见过的最大 k 个数;Quickselect 只作为面试进阶。
- 4证明堆维护当前见过的 k 个最大,堆顶是第 k 大。
- 5复杂度时间 O(n log k),空间 O(k)
- • LC347 前 K 高频
- • LC703 Kth