◄ 返回每日萃
2026-09-13

让 AI 先自己验一遍成果,人工少盯一半

本文由 AI 自动整理生成,可能存在错漏,请以原文链接为准。

今天最想跟你分享两件事:Perplexity 开始把检查系统这类活交给 AI,人工盯的次数明显少了;ChatGPT 修图也越来越厉害,甚至有人喊出「每个人都需要一个缪斯」。

灵感百宝袋

ChatGPT 修图又变强了:只想改一个物件,别的地方它现在基本不动。

Ben Bites 前几天那份简报提到,OpenAI 的图片模型升到了新版,叫 ChatGPT Images 2.5,特别擅长只编辑画面里的某一个元素,其他部分保持原样;每张图的生成时间最多还能省一半。另外还多了一个叫 Sketch 的新功能,可以让你先随手画出想要的样子。如果你手头有张照片只想换个背景或者改个颜色,可以用它试一下,看是不是只动你要的那一处。

原文:https://www.bensbites.com/p/everyone-needs-a-muse

Perplexity 开始让 AI 自己检查系统,人工盯的次数明显变少了。

OpenAI 官网一个案例说,Perplexity 用 GPT-6 Astra 来写沟通内容、改软件、监控生产系统,而且他们共同创始人兼首席战略官 Johnny Ho 讲,现在能放心把端到端的系统交给它,检查频率比以前低很多。最实用的一点是让它自己写测试:模型会按照真实服务的样子去生成请求、模拟各种反应,再把结果带回来给你看。说白了,你想验证一个东西好不好用,可以让 AI 先替你跑一遍,你只要看它留下的证据。

原文:https://openai.com/index/perplexity-improving-accuracy-with-astra

江湖快报

DeepSeek 新版 Flash 更强更快更便宜,却因为换得太急被不少开发者吐槽。

DeepSeek 官方说,V4.1 Flash 在性能、费用、速度和总耗时上都超过了原来的 V4 Pro,所以上线后所有原本发往 V4 Pro 的请求会自动转到 Flash,并且按更便宜的 Flash 价格计费。看起来是笔划算账,但昨天公告一出,很多开发者不买账:不是嫌能力不行,而是从通知到切换只有一天左右,没有并行迁移期。评论区里有人直接请他们别这么干,还有人吐槽这属于缺少基本的软件工程思维。对普通用户来说感受不明显,对把 Pro 接进自己业务的人来说,少了缓冲期确实容易出乱子。

原文:https://www.infoq.cn/article/G7cublzVyXFOUX3vpz1t

Cognition 让 Devin 用 Astra 测试自己的活,目标是工程师少审代码、多交付。

Devin 是一个能自己干活的软件工程师,从大银行到技术型创业公司都有人用。前两天的官方案例说,Cognition 在用 GPT-6 Astra 强化它「自己测试自己成果」的能力,比如测试一个 iPhone 小游戏时,它会返回模拟器里跑起来的录像,外加一份报告,写明哪些检查过了、哪些还没测到。这事放到日常就是说,以前写完代码得人工盯着看,现在可以让模型自己生成证据,证明它做的东西真能跑通。等这类验证手段成熟起来,我们能省下的就不只是写代码的时间,还有反复检查的心力。

原文:https://openai.com/index/cognition-devin-testing-with-astra

贤者视角

英伟达 CEO 黄仁勋给两个离职创业的员工说真话,不画饼也不挽留。

今天看到个挺有意思的故事:两个年轻人在英伟达做机器人研发,辞职前半夜打电话给黄仁勋,本来心里有点打鼓,结果他没劝他们留下,反而说他们原本起的公司名「必须换掉」,又提醒前路会很难。后来英伟达还真的投了这家叫 Flexion Robotics 的新公司。另一位从英伟达离职创业的徐冰,黄仁勋花了两个小时聊,还点出他最大的短板是沟通:默认别人都懂他的专业。徐冰说这是他十年来收到的最真实的反馈。说白了,AI 时代大家都习惯了模型顺着话说,像黄仁勋这样当面给真话,反而特别珍贵。

原文:https://www.ithome.com/1/001/830.htm

据 Wired 报道,Claude 最近被用在了不少越界的事上。

Wired 前天的安全周报提到,有人拿 Claude 这类大模型去做越界的事情,从帮人搞网络攻击,到更危险的方向都有。报道里用了「滥用无处不在」这种说法,听着挺让人警惕。这事给普通人的提醒倒不是要恐慌,而是工具越强,被用歪的空间就越大。我们自己平时拿 AI 干活,还是得守好分寸——尤其别把内部数据、别人的隐私一股脑喂进去,也别拿它去绕开本来该守的边界。

原文:https://www.wired.com/story/security-news-this-week-from-hacks-to-bioweapons-claude-misuse-is-now-everywhere

英伟达说 DLSS 5 是图形大突破,很多玩家却说它像个 AI 滤镜。

英伟达号称 DLSS 5 是自实时光线追踪以来最大的图形突破,想用 AI 在游戏里实时重绘光影和材质,让画面更接近真实照片。但 Engadget 提到,从宣布到最近游戏提前泄露,不少玩家和开发者一直不买账,觉得这技术会覆盖掉游戏原本的美术风格,像套了个「AI 滤镜」。这场架的本质挺值得想:AI 帮你美化画面,到底是在增强,还是在改写你的作品?放到修图、写文案、做设计上都一样——处理得好是增效,处理过头就是把你的原味也带走了。

原文:https://www.engadget.com/2252797/nvidia-dlss-5-why-internet-people-upset-issues

开发者补给站

谷歌开源 Mantis,想用多代理协作把漏洞扫描的误报打下来。

做安全的同行都知道,传统 AI 代码扫描一直有个头疼的地方:误报太高,有时真阳性率还不到 7%。Mantis 的思路是不再暴力扫文件,而是先分析代码库历史、过往安全修复和架构,再把结果放进沙箱里实际复现一遍,确认是真漏洞才报。框架里安排了批评者、审查者、策略师、研究者几个分工代理,还支持不同阶段用不同档次的模型——简单任务用 flash 或 lite,需要深度推理的再上强模型。代码已经在 GitHub 开源,建议先拿一个小库跑一遍,重点看 mantis-review 怎么过滤误报,但别把过滤器调得太宽,不然容易漏掉真问题。

原文:https://www.infoq.cn/article/mF8WwkbQRUS7ZKprE3Ku

Neovim 原生加入 vim.async,写插件终于不用在回调里绕来绕去。

以前 Neovim 插件要处理文件、后台进程、网络请求这类异步操作,要么直接用 Libuv 回调,要么靠 plenary.nvim、async.nvim 这些第三方库,结果常常是回调一层套一层,或者各家实现互相打架。现在 vim.async 进了 Lua 标准库,用 run、await、timeout、semaphore、pawait 这些标准原语来管理任务,父子任务自动挂接,异常会往上抛、兄弟任务连带取消。如果你正在维护 Neovim 插件或写脚本,值得去看一眼官方 lua-async 文档,大概率能删掉一堆自己搓的协程封装。

原文:https://www.infoq.cn/article/exwZJvLsHKXrPyeKaANC

蚂蚁灵波又开源了三款世界模型,最小的 1.3B 参数单张家用显卡就能跑。

LingBot-World 2.0 是一个实时交互世界模型,能做小时级连续生成,对攻击、射箭、施法、射击这类动作,还有下雪下雨的环境变化都能实时响应;算力给够的话能做到 720P 60 帧的高清交互。这次开源的 Small 版只 1.3B 参数,官方说就是冲着消费级单卡 GPU 设计的,个人开发者、高校实验室和小团队都能从本地跑一跑开始。如果你想研究游戏实时世界生成或交互式场景,可以先去 Hugging Face 或魔搭上把模型拉下来试试。

原文:https://www.ithome.com/1/001/863.htm

好物挖掘机

Neopress 想让你靠聊天就把网站搭起来并运营下去。

要是你一直想做个自己的网站,但一想到写代码就头疼,Neopress 这类对话式建站工具可以试试:你告诉它想要什么,它来帮你生成和调整页面,连后续运营也包在里面。从 Product Hunt 的介绍看,信息还比较简略,复杂定制能做到什么程度得自己上手才知道。适合先拿来做个人作品集、活动页或者小生意展示页,边聊边看效果。

原文:https://www.producthunt.com/products/neopress

ABrush 是个给数字艺术家准备的 AI 工作台。

它把 AI 创作工具集中到一个工作室里,适合画插画、做概念设计这类数字创作的人,省得在好几个工具之间来回导文件。目前公开信息不多,具体能做到什么程度、手感顺不顺,得实际用一下才知道。如果你正缺一个把生成、调整、导出都放在一起的地方,可以考虑拿去试几幅图。

原文:https://www.producthunt.com/products/abrush-ai-2