跳到正文

精选深读Hugging Face21:44

像物理学家一样裁剪 LLM:将块移除视为 Ising 优化问题

Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem

把LLM块移除转成Ising优化,是剪枝新视角,但落地成本待验证

判断

如果团队要在 Llama-3.3-70B-Instruct 上做 50% 深度剪枝,应把选块决策从逐块打分改成先一次性算 Hessian 耦合、再交给约束二元优化求解器;多付标定与求解器工程成本,换 MMLU 相对最佳竞品块移除方法近 23 个百分点。

依据

Multiverse Computing 的 Antonio Tiene、Ali Hashemi、David Jansen、Roman Rausch 在 Hugging Face 论文页提出,把删除哪些 transformer 块从排序问题改成约束二元优化(CBO, constrained binary optimization)。他们给每块一个 0/1 变量,0 保留、1 删除;对损失做二阶泰勒展开得到近似 Hessian(海森矩阵),对角项是单块重要性,非对角项是块间耦合。最小化 xᵀH⁰x 且恰好删 M 个块,等价于在伊辛玻璃(Ising glass,全连接耦合、自旋数守恒的自旋系统)里找低能态。低能态被当作下游质量的代理,因此可跳过逐候选跑基准。Hessian 只用小标定集的前向/反向传播算一次,之后每个候选只需一次能量计算;作者报告 Llama-3.3-70B-Instruct 在 50% 压缩下,MMLU(多任务语言理解基准)比最佳竞品块移除方法高近 23 个百分点。取舍在于:精确求解可行时用精确,不可行时依赖量子或量子启发式求解器,前期工程与求解时间不是零。

  • Llama-3.3-70B-Instruct 压缩率50%
  • MMLU 相对最佳竞品块移除近 23 个百分点
50% 压缩下 MMLU 增益对照

没写清 材料没给标定集规模、求解器实际耗时,也没给除 MMLU 外的任务、推理延迟和内存实测,所以不能替它补上部署总成本。

下一步 核对论文的标定集规模与求解器运行时间,并在同一 Llama-3.3-70B-Instruct 配置下复现 50% 压缩的 MMLU 增益。

本期其他新闻

  1. 行业动态

    Cloudflare Python Workers 现已正式可用

    Simon Willison

  2. 行业动态

    Jev:面向生产而非 God 的 System One 模型 — 对话 TypeSafe AI 首席执行官 Diogo Almeida

    Latent Space

  3. 行业动态

    BMW Group 如何检测 14,000 个云账户中的成本异常

    AWS Machine Learning Blog

  4. 行业动态

    John Ternus 能找到 Apple 的下一个重大产品吗?

    The Verge AI

  5. AI工具

    在 Amazon SageMaker AI 上运行 Positron 以支持数据科学工作流

    AWS Machine Learning Blog

  6. 精选深读

    Jev 推出一种新的 LLM 形态 - System One,又名 Decision Models

    Simon Willison

  7. 精选深读

    xAI 的 Grok 4.6 现已在 Amazon Bedrock 中可用

    AWS Machine Learning Blog