跳到正文

2026年09月07日AI 版

4 条 · 2 个来源

头版

行业动态Simon Willison

代码可以坏到什么程度,没有上限
坏代码无上限,提醒我们警惕技术债累积,重构需及时。

对正在考虑宣布旧系统「不可救」、另起炉灶重写的技术负责人,Willison 的取舍是先投自动化测试和定向重构,而不是开新项目——代价是短期内还得继续替旧账买单。

展开全文

依据

Simon Willison 在 Lobste.rs 的回复里说,他几乎没见过「推倒重写」成功:宣布旧系统被技术债(technical debt,即赶进度时留下、日后要额外偿还的代码负担)淹没之后另起一个团队,旧系统却仍在跑核心业务,改动照旧;维护旧系统的人知道它很快会被替换,只肯做最小投入,技术债继续堆。他给出的对照数字是新系统里 80% 是闲置代码——重写团队起初节奏很快,但没人完全清楚被替换系统的行为与范围(若文档测试齐全,本就不必替换),拖到压力上来只能先上线少数功能,于是两套系统并存生产环境,还可能因「优先级变了」而彻底烂尾。他因此主张:先把旧系统的自动化测试补厚,再看定向重构能否把它改到需要的形状,并推荐 Will Larson 的《Migrations: the sole scalable fix to tech debt》。

  1. 宣布旧系统被技术债淹没
    开新项目
  2. 组建团队从零重写
    并行运行
  3. 旧系统继续承接业务变更
    压力下先上线
  4. 新系统只上线少数功能
从宣布重写到两套系统并存生产环境的实际路径

没写清 材料只给作者的经验与直觉(原文自称 My hunch),没有定向重构与重写两条路径的成功率或案例数字,所以不能替它算出哪边的胜算更大。

下一步 把《Migrations: the sole scalable fix to tech debt》读完,并对现有系统做一次自动化测试覆盖盘点。

行业动态

3

  1. 行业动态OpenAI

    外星思维
    OpenAI首席科学家反思能力跃升与对齐难题,呼吁更强防护,但未提具体措施。

    把「等对齐方案成熟再推进」当排期前提的实验室与监管方,这次要改:帕乔基这篇不是可引用的安全承诺,产品预算和发布节点不能再挂在它上面。

    展开全文

    依据

    OpenAI首席科学家帕乔基在《An Alien Mind》里把能力跃升后的模型行为称作「异类心智」(alien mind,指模型的行为动机不再能用人能理解的意图去复述),据此呼吁更强防护与国际协调。他给的因果是:能力越强,模型内部目标与人类意图的偏差越难被察觉,于是对齐从「训练问题」变成「验证问题」——验证需要可被外部检查的证据。材料里没有出现任何基准、阈值或对照数字,也没写防护措施由谁执行、在哪个环节拦截。所以这篇能支撑的只是「把安全优先级往上提」,支撑不了「某条技术路径已被验证」。

    没写清 他没写防护由谁执行、在哪一步拦截,也没写协调失败时哪一方先让步,这块不能替他补上。

    下一步 下一步可核对:OpenAI 是否公布对齐的可验证指标或第三方评估安排,只发原则性文章不算。

  2. 行业动态Simon Willison

    引用 Zach Kehs 的话
    引用他人观点,价值在于传递行业内部分享,但需辨别立场。

    技术负责人不能再把「等崩了再还债」当默认策略:软件没有建筑那样的坍塌阈值,新增一层间接或性能下降不会触发任何终止信号,止损线只能由团队自己先划,账单由之后的维护者付。

    展开全文

    依据

    Zach Kehs 在 Simon Willison 的网志摘录里说:建筑不停加楼层和房间终会倒塌,软件没有这个约束,代码可以一直变差——总能再加一层间接(indirection,指调用链上多插一层转发)。Willison 在 2026年9月6日收录这条引文,归入 technical-debt(技术债)标签。机制是:建筑的成本由重力即时兑付,软件的多一层间接和性能下降由未来的修改者分期兑付,且没有兑付期限。Kehs 给出的两个变差方向——加一层间接、性能下降——都不会打断编译和测试,所以任何依赖「出故障再修」的流程都收不到提醒。材料里出现过的量化项只有赞助方 Teleport 的实验:13 名工程师用 LLM 清洗代码库 90 天,那是广告位内容,不能拿来给 Kehs 的论断做证据。

    • Teleport 代码清洗实验工程师13 名
    • 用 LLM 清洗代码库时长90 天
    材料里仅有的两个数字都来自赞助方 Teleport,与 Kehs 的论断无关。

    没写清 材料没有给出任何判断「代码差到什么程度算越线」的指标或阈值,所以无法替 Kehs 说明该在哪一层停手。

    下一步 核对 Simon Willison 网志 technical-debt 标签在 2026年9月6日之后的新条目,看是否补上具体案例或数字。

  3. 行业动态OpenAI

    研究加速:OpenAI 内部视角
    OpenAI自曝编码代理提速研究,但样本与指标待考,别急着全信。

    这决定中小实验室负责人此刻是否照 OpenAI 内部说法立项买编码代理。建议先按自家任务类型做一次带基线对照的小试点,再决定铺开范围。

    展开全文

    依据

    OpenAI 自己对外披露,编码代理(coding agent,指能自主写代码、调试、并完成部分实验设计的程序)已进入其研究流程,实验迭代更快、能接更复杂的任务。机制是代理接手代码编写与调试,减少人工干预,研究者因此能并行推进更多假设验证。但材料只交代数据来自 OpenAI 内部早期实践,没给样本量、任务类型和基线对照,外部团队复现效果无从核对。材料同时点出代理执行依赖高度工程化环境,普通机构或小型团队难以直接照搬;并提示过度依赖可能削弱研究者深层问题定义的能力。所以这份提速说法在自家场景下的增益与门槛都还没被算出来。

    没写清 材料没给样本量、任务类型和基线对照,无法换算成自家团队能提速多少。

    下一步 用同一批实验任务跑一次「有代理」与「无代理」的对照,记录迭代轮数差。