精选深读Hugging Face21:44
像物理学家一样裁剪 LLM:将块移除视为 Ising 优化问题
Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem
把LLM块移除转成Ising优化,是剪枝新视角,但落地成本待验证
判断
如果团队要在 Llama-3.3-70B-Instruct 上做 50% 深度剪枝,应把选块决策从逐块打分改成先一次性算 Hessian 耦合、再交给约束二元优化求解器;多付标定与求解器工程成本,换 MMLU 相对最佳竞品块移除方法近 23 个百分点。
依据
Multiverse Computing 的 Antonio Tiene、Ali Hashemi、David Jansen、Roman Rausch 在 Hugging Face 论文页提出,把删除哪些 transformer 块从排序问题改成约束二元优化(CBO, constrained binary optimization)。他们给每块一个 0/1 变量,0 保留、1 删除;对损失做二阶泰勒展开得到近似 Hessian(海森矩阵),对角项是单块重要性,非对角项是块间耦合。最小化 xᵀH⁰x 且恰好删 M 个块,等价于在伊辛玻璃(Ising glass,全连接耦合、自旋数守恒的自旋系统)里找低能态。低能态被当作下游质量的代理,因此可跳过逐候选跑基准。Hessian 只用小标定集的前向/反向传播算一次,之后每个候选只需一次能量计算;作者报告 Llama-3.3-70B-Instruct 在 50% 压缩下,MMLU(多任务语言理解基准)比最佳竞品块移除方法高近 23 个百分点。取舍在于:精确求解可行时用精确,不可行时依赖量子或量子启发式求解器,前期工程与求解时间不是零。
- Llama-3.3-70B-Instruct 压缩率50%
- MMLU 相对最佳竞品块移除近 23 个百分点
没写清 材料没给标定集规模、求解器实际耗时,也没给除 MMLU 外的任务、推理延迟和内存实测,所以不能替它补上部署总成本。
下一步 核对论文的标定集规模与求解器运行时间,并在同一 Llama-3.3-70B-Instruct 配置下复现 50% 压缩的 MMLU 增益。