跳到正文

2026年09月09日AI 版

3 条 · 3 个来源

头版

精选深读OpenAI

GPT-5.6 Sol 如何帮助运行量子计算实验
量子实验自动化的具体案例,但官方宣传需谨慎参考其泛化能力。

这份材料改变的是负责六量子比特芯片批量表征的实验室排班决定:把夜间与洁净室时段的例行校准交给 GPT-5.6 Sol,把专家人力挪去解读弱信号结果。

展开全文

依据

OpenAI 在这份材料里称,GPT-5.6 Sol 经 Codex(OpenAI 的代码代理工具)接入实验室软件,在未校准的六量子比特芯片上自主跑完标准测量序列:先识别跃迁频率,再校准脉冲,最后测出量子信息保留时间。机制是把测量专用技能和设计目标交给模型,由它选参数、操作硬件、分析数据并迭代决策。材料给的对照是——信号清晰时几乎无需人工干预,信号弱或噪声大时耗时更长、需要专家引导。代价同样写明:资深研究者仍可能更快找到最佳校准参数,而且实验必须先提供明确技能与目标。所以能交出去的是信号清晰的例行校准,模糊物理结果的解读仍是瓶颈,材料也只把适用面限在 EQuS 这类批量标准芯片表征场景。

  1. 识别跃迁频率
    下一步
  2. 校准脉冲
    下一步
  3. 测定量子信息保留时间
    下一步
  4. 分析数据并迭代
GPT-5.6 Sol 在未校准六量子比特芯片上执行的四步测量与迭代流程

没写清 材料没有给出弱信号、噪声大时人工介入的具体次数与耗时差距,也没有 EQuS 的实际部署数据,这两块不能替它补上。

下一步 下一步可核对 OpenAI 是否公布弱信号条件下的人工介入次数、单次校准耗时,以及 EQuS 的实测运行记录。

精选深读

2

  1. 精选深读Hugging Face

    为谁安全?拒绝话题的恰当子集,而非整个话题
    只拒敏感子主题而非整类,校准安全边界,防绕过仍需更多样本验证。

    做政治类安全微调的团队,应把训练与验收单位从“政治”整类改成同一话题锚点下意图相对提示对;代价是边界附近的误拒和漏拒要同时压低很难,且部署方必须先声明允许拒绝哪一子集。

    展开全文

    依据

    Antonio Tiene、Alejo Lopez Avila、Iker García-Ferrero 在 Hugging Face 文章《Safety for Whom?》中提出,安全对齐不应把伤害当成话题属性,而应把同一话题切成“目标有害子集”和“良性补集”。他们用政治说服做测试床:同一话题锚点下配一对意图不同提示,一条该拒、一条该答;这样才能量出边界形状。机制上,按话题整类拦截的防护模型(topic-level guard,如 LlamaGuard-3)把选举只归为“选举制度与过程的错误信息”,既漏掉操纵/定向劝说,也误伤事实性提问;交叉熵训练提高有害子集的拒绝概率,还会把拒绝外溢到良性补集。作者审计自生成安全数据(self-generated safety tuning)时发现:单次生成静默丢弃 19.88% 提示,即 8,009 条;升级重试把残留失败压到 0.20%,即 79 条,修复后留下 40,293 条有害训练提示。为避免副作用,他们加入 11,955 条表层危险良性提示,覆盖 18 种语义类型;再用每侧 1,539 条留出配对测两侧边界。取舍是:话题级指标会把拒绝外溢当改进,所以验收必须同时看误拒与漏拒,并先由部署方定边界。

    • 单次生成丢弃提示19.88%(8,009 条)
    • 升级重试残留失败0.20%(79 条)
    • 修复后有害训练提示40,293 条
    • 留出边界配对(每侧)1,539 条
    覆盖缺口修复前后与边界配对测试规模。

    没写清 材料未给出 Qwen3-8B 在 1,539 对/边测试上的最终误拒与漏拒数字,也未说明跨话题迁移或对抗绕过结果。

    下一步 下一步可核对:论文是否公开 1,539 对/边边界测试集,并给出 Qwen3-8B 的误拒与漏拒数字。

  2. 精选深读Google DeepMind

    AlphaGenome Atlas:人类基因组中每一个可能 DNA 字母变化的预测图谱
    九亿变异图谱虽全,但仅覆盖单碱基替换,缺失大片段结构变异等真实致病场景

    对做变异筛查的遗传学家,这改变的是先做实验验证的排序方式:AlphaGenome Atlas 把 9 billion 条单碱基替换的分子效应预先算好,可直接用来给候选位点排优先级。但它替代不了结构变异的判读决策。

    展开全文

    依据

    Google DeepMind 的 AlphaGenome Atlas 团队 9月8日说,他们用 AlphaGenome 模型预先算完并公开了人类基因组 9 billion 条 single-nucleotide variant(单核苷酸变异,即 DNA 上单个字母的替换)的分子效应预测,学术研究可通过免费网页查询;同时放出 AlphaGenome Variant Impact(AVI)评分,把 AlphaGenome 与 AlphaMissense(预测改变蛋白的变异影响的模型)合并成一个排序分数。机制是把推理从逐个变异按需计算,换成全基因组批量预算,研究者先查表、再挑位点进实验室。材料给的对照是实验成本:9 billion 个单字母突变逐个做实验实际上不可能,所以这份目录的作用是筛掉绝大多数位点,而不是替代实验。局限也写在同一处——预计算只展开单碱基替换这一种变异类型。

    没写清 材料没说这 9 billion 条预测与湿实验结果的一致率,也没说大片段结构变异、拷贝数变异是否在覆盖范围内。

    下一步 到 AlphaGenome Atlas 论文里找基准测试表,核 AVI 评分在同一批变异上相对 AlphaMissense 单独使用的排序表现。