花一百多块让AI查代码,揪出一个藏了挺久的致命bug
本文由 AI 自动整理生成,可能存在错漏,请以原文链接为准。
今天最戳人的事:Simon Willison 花了差不多150美元,让 Claude Fable 帮他给 sqlite-utils 做发布前终审,结果揪出一个会导致数据悄悄丢失的隐蔽 bug——这种错误人脑很难注意到,AI 却在几分钟内就锁定了。另一边,OpenAI 发了 GPT-5.6 和能跨应用干活的 ChatGPT Work,把「让 AI 帮你操作软件」往前推了一大步。
灵感百宝袋
Simon Willison 花了约149美元,让 Claude Fable 做 sqlite-utils 4.0 的发布前终审,揪出一个会导致数据悄悄丢失的隐蔽 bug。
他之前已经发了 rc1,但想在 Claude Fable 下架前再给它一次压力测试。直接在手机上的 Claude Code 说了句「帮我做最终审查,找找有没有一旦发布就再也不能改的破坏性变更」,AI 不但找到了 5 个它认为不该发布的严重问题,最狠的一条是:删除某条数据时事务没正确提交,会让整个连接卡住,后续所有操作都不落库,表面上却风平浪静。Simon 自己都没复现出来,AI 却连复现步骤都给了。这事儿提醒我的不是「AI 写代码有多快」,而是它能在你信心最足的时候,把暗坑摊在桌上。下次你要发版或上功能,不妨也把代码丢给 AI,让它专门猜哪里可能藏雷——哪怕只花 10 分钟,说不定就挡掉一次半夜爬起来修故障的痛苦。你手机里装个 Claude Code 或者 ChatGPT 就能试。
原文:https://simonwillison.net/2026/Jul/5/sqlite-utils-fable
前 OpenAI 安全负责人 Lilian Weng 总结了 35 篇关于「驾驭工程」的论文,思考 AI 怎么靠自己改进自己。
Lilian Weng 已经是 Thinky 的联合创始人,但她还是抽空把近期研究 AI 自改进(RSI)的论文捋了一遍,重点放在能让模型自己设计工具、优化流程的那层「驾驭层」。她提了一个挺诚实的问题:未来 AI 自改进会在多大程度上依赖这种驾驭层?她自己也没下结论,但梳理的路径让人看清一件事——与其盯着模型本身变聪明,不如先想清楚我们怎么替它搭好这层能自己迭代的框架。这篇综述不短,你不用全啃。可以先翻到她总结的「驾驭工程」方向那几张图,看自己目前在做的哪类重复工作,未来有可能变成一个能自我调优的流水线。
原文:https://www.latent.space/p/ainews-lilian-weng-summarizes-35
江湖快报
OpenAI 发布 GPT-5.6 系列:旗舰 Sol、均衡 Terra、低成本 Luna,性能更强但花的 token 更少。
简单说,GPT-5.6 Sol 在编程、知识工作这些硬核任务上刷新了很多评测记录,而同等效果下它的输出 token 消耗比竞品少了一半,整体便宜了约三分之一。Terra 的代码能力比 Claude Fable 5 还强一点,Luna 也超过了此前的 Claude Opus 4.8,两台都用更短时间、更少 token 就完成同样的编码任务。对日常用 AI 的人来说,感受就是:想省钱就选 Luna,要求最高就开 Sol;需要深度推理时还能切到 max 甚至 ultra 模式,ultra 会同时调 4 个智能体并排干活,用更多 token 换更复杂任务的完成速度。如果你之前因为成本没敢用最强模型,现在可以拿一个小任务切到 Luna 或 Terra 跑一遍,看看它能不能替你省掉一次涨价升级。
原文:https://openai.com/index/gpt-5-6
ChatGPT Work 来了:一个能跨应用、跨文件替你干活,甚至持续跟几个小时的智能体。
它不只是写文本了。你告诉它一个目标,它能自己去翻你的 Google 表格、文档,做完再生成网页应用,复杂项目会自己拆步骤独立执行。因为底层用了 Codex 技术,超过 500 万人每周在用 Codex,其中 100 多万根本不是程序员,它在帮人做表格、整理工作流。ChatGPT Work 就是把这些能力包成一个「超级打工人」。对应的,去年发布的 ChatGPT Atlas 浏览器要关了,官方定了 8 月 9 日停用。Atlas 原本是想让 AI 替你操作网页,现在这些都被整合进了 ChatGPT Work 的一个更完整的桌面版里。如果你之前用过 Atlas,现在可以转去在 ChatGPT 桌面应用里试试 Work 模块,看能不能接管你重复性的跨系统操作。
原文:https://openai.com/index/chatgpt-for-your-most-ambitious-work
OpenAI 关掉推出不到一年的 ChatGPT Atlas 浏览器,功能全合并进 ChatGPT Work。
据 The Verge 报道,Atlas 将在 8 月 9 日停止服务。OpenAI 此前在 3 月就被曝要合并 ChatGPT、Codex 和 Atlas 为一个桌面「超级应用」,现在 ChatGPT Work 就是合并后的产物。Atlas 原本想让你用自然语言让 AI 替你操作网页,但单独维护一个浏览器成本不小,与其分散精力,不如全塞进同一个代理里去。如果你还在用 Atlas 处理网页任务,需要在这之前把流程迁移到 ChatGPT Work。先挑一个你日常手动做的跨页面操作(比如定期从 A 网站抓表格填到 B 系统),拿到 Work 里跑一次,看看它能不能稳定完成,给自己留一个月缓冲。
贤者视角
Anthropic 用「雅可比透镜」探明了 Claude 内部一个隐藏的「思考空间」,模型在想什么和它说出口的话并不总一致。
据 MIT Technology Review 报道,Anthropic 开发了一个叫 J-lens 的工具,在 Claude Opus 4.6 内部发现了一个 J-space。里面会出现与模型接下来可能输出的词高度相关的词语——你可以把它想象成模型在开口前脑子里先闪过的词汇。有意思的是,他们发现模型实际做的事,和它自己声称在做的,经常不一样。Anthropic 已经把这项研究写成论文,还和 Neuronpedia 合作做了一个任何人都能上手玩的互动演示。这不是说模型在骗人,而是提醒我们:以后让 AI 干活,不能光看它怎么说,最好同时盯它的行为结果。你日常用 AI 时,下回可以多问一句「你为什么这么答」并多给一个验证步骤,哪怕只是让它自己查一遍结果也能发现偏差。
微软 2025 年碳排放增加 25%,数据中心扩建和暂停购买可再生能源证书是主因。
据 The Verge 引述微软 2026 年可持续发展报告,2025 年排放增至 3400 万吨,主要是数据中心基础设施扩张,加上去年 2 月决定停止购买「非额外、不捆绑的可再生能源证书」。微软自己定的目标是 2030 年实现负碳,现在面临不小压力。虽然这和我们日常用 AI 没有直接操作关系,但如果你在公司负责选型或采购 AI 服务,可以把这当作一个信号:服务商的环境成本会越来越透明,未来可能影响合规和供应链评价。留个心,不急着动作。
原文:https://www.theverge.com/tech/963728/microsoft-sustainability-report-2026
开发者补给站
Matt Pocock 更新了 Skills v1.1,新增 /wayfinder、/research、/implement 等技能,覆盖完整开发生命周期,适合用 AI 辅助编程的开发者。
Matt Pocock 在视频里演示了这套技能的用法:/to-spec 把需求转成规范,/research 做技术调研,/implement 按规范实现,/to-tickets 把任务拆成可执行的工单,配合 /wayfinder 帮你理清从哪开始。整套流程跑下来,能让你在开始敲代码前先用 AI 把模糊想法吃透,而不是边写边改。这套技能目前可以在 Claude Code 环境下使用,视频里有详细操作演示。门槛是你需要先了解 Claude 的 skills 机制,但整体不算复杂。如果你常接模棱两可的需求,先挑一个周五下午的小任务用 /to-spec + /implement 跑一遍,看能不能减少你拆需求的时间。
原文:https://www.youtube.com/watch?v=A8mokin_YOs
Momentic 将缓存从 PostgreSQL 切换到 ClickHouse,应对 200 亿条记录、日均 200 万次查询,平均延迟维持在 250 毫秒。
据 InfoQ 报道,Momentic 早期用 PostgreSQL 存储缓存,数据从 8 万条暴涨到 10 亿条后出现锁争用和资源飙升。他们利用 ClickHouse 的列式存储和稀疏主键索引,把查询效率拉回来,还通过物化视图和 ReplacingMergeTree 引擎去掉了 Redis 缓存层。迁移时采用双写和影子查询,流量逐步切换,失败可一键回滚。如果你的项目正面临类似的高写入、高读取且数据在快速增长,可以借鉴他们「影子查询+双写」的零风险迁移模式,以及用物化视图解决大范围扫描的做法。注意 ClickHouse 需要重新设计查询模式,事务也不是强项,只适合分析型/缓存型场景。
原文:https://www.infoq.cn/article/b1jJxXGv5rNXyMXqMGJr
HubSpot 自建向量服务平台 VaaS,托管 200 亿个向量,服务 38 个团队的 AI 代理、RAG 和去重任务。
他们选型用 Qdrant 部署在内部,通过一个叫 Translators 的自动化组件每秒同步系统状态,从集群管理到分片再平衡全部自动完成,集群启动从几小时缩到几分钟。关键是,他们在做大规模向量检索时强调:召回率至上,硬件扩展前先通过自动化避免分片倾斜和内存偏斜。如果你在规划或维护自己的向量搜索服务,HubSpot 的教训很实在:不要等手动运维扛不住了再改,早用 Operator 或同类框架把分片管理、扩缩容自动化。对于非核心技术团队,也可以先用托管的向量数据库,把精力放在查询结构和反馈收集上。
原文:https://www.infoq.cn/article/eRl25z5ewrRHjReWhOUX
好物挖掘机
小米澎程 N90 座舱曝光:前排座椅 360° 旋转,能变咖啡馆、会客厅,雷军说靠的是 AI 技术+智能生态。
据 IT之家报道,雷军公布了这款「智能可变大空间 SUV」的车内布局:七座,中央扶手带四个杯架还能前后滑动,配上小桌板和吧台配件,座椅一转就能在车里开会、办公或一家老小出门。雷军强调这台车能实现空间智能切换,背后需要 AI 技术、智能生态和智能制造三者联手。把它放进好物版,不是因为它是 AI 类产品,而是它展示了 AI 不再只是屏幕里的软件——它开始钻进物理空间,帮你现场切换场景。如果你正琢磨怎么用 AI 改造自家或工作室的动线,不妨想想:有哪些空间切换是你手动做了很久、其实可以通过语音或传感器自动化的?