关掉电脑AI还接着干,语音也能边聊边等你了
本文由 AI 自动整理生成,可能存在错漏,请以原文链接为准。
今天想跟你分享两件挺戳人的事:OpenAI 的语音模式终于能边听边说了,还会「嗯嗯」地表示在听;Anthropic 的智能体也溜到了你的手机上——你合上电脑,它照样帮你盯活儿。
灵感百宝袋
15分钟搞懂谷歌的 Gemini Spark——一个常驻的 AI 代理,能帮你盯住事情。
YouTube 博主 Jeff Su 刚出了一期教程,把 Gemini Spark 的核心用法拆得很清楚。简单说,它不是那种你问一句答一句的对话框,而是会一直待在旁边,注意到你待办清单有变动、日程冲突时主动提醒你。你拿它试一个最日常的场景:让 Gemini Spark 盯一下你接下来两天的日程,看看它能不能在你有新邮件进来时主动告诉你哪些需要立刻处理。
原文:https://www.youtube.com/watch?v=7GkIWPPC9i0
谷歌开发者用 Antigravity 和 Gemini 做了个 AI 赛车教练,在赛道上真能帮车手快 0.1 秒。
一群 Google 开发者专家在索诺玛赛道搞了个实验:用 Antigravity 把赛车实时的遥测数据喂给 Gemini,让 AI 边跑边给车手提建议。结果是,系统在过一个弯时找到了一个新的油门点,让车手快了 0.1 秒——在赛道上,这 0.1 秒可能就决定胜负。厉害的点在于,这群软件工程师其实并不懂赛车。他们靠 Antigravity 处理底层数据对接,让赛车专家直接把经验融进去。说白了,以后你想在任何一个专业领域(比如健身、炒股)让 AI 当私人教练,都可以照着这个路子来:先把数据接上,再请懂行的人把判断逻辑告诉模型。
江湖快报
OpenAI 的 GPT-Live 来了,能边听边回话,还会「嗯嗯」地表示在听。
这次不只是把文字转成语音再念出来,而是做了一个真正能同时听和说的模型。跟你聊天时,它会适时插一句「嗯嗯」「对」,或者安静等你把话说完,像真人一样。遇到要查网页、做复杂推理的问题,它会在后台调用更聪明的模型,前端不冷场。目前版本背后跑的是 GPT-5.5,之后还会跟着新模型一起升级。今天你就可以在 ChatGPT 里找到它,试试问一个需要想一想的问题,感受一下它会不会自然地停顿,而不是着急念答案。
原文:https://openai.com/index/introducing-gpt-live
字节的 Seedream 5.0 Pro 能做复杂信息图了,文字渲染也更准。
简单说就是你现在告诉它「帮我生成一张新手观鸟指南的信息图,要带中英文名、插画和识别特征」,它真能给你排出一张像模像样的科普版面。而且支持点选、圈选、换颜色、换材质这些交互式编辑,改了还能接着改。目前已经上了火山方舟体验中心,后续也会进豆包和即梦。你今天就能拿一段数据,让它生成一张信息图,看看排版是不是真的省了你在设计工具里来回拖拽的时间。
原文:https://www.ithome.com/0/974/249.htm
Anthropic 把 Claude Cowork 塞进了手机,你关了电脑它还能干活。
以前用 Cowork 得让笔记本一直开着,现在不用了——任务可以转到手机或网页上继续跑,就算你关灯睡觉,它也能照计划整理文件、替你处理深夜进来的消息。Anthropic 还在演示里让人一口气让它从邮件、Slack、会议记录里扒数据,直接生成会议文件和邮件草稿。你今晚就能试:给它布置一个整理文件夹或者汇总表格的小任务,合上笔记本,第二天早上看一眼完成得怎么样。
原文:https://www.wired.com/story/shut-those-laptops-anthropic-puts-its-claude-cowork-agent-on-your-phone
贤者视角
Kenton Varda 禁止团队用 AI 写提交信息,因为那些描述对审查代码没用。
Cloudflare Workers 的作者之一 Kenton Varda 最近直接下了禁令:不能再让 AI 写 PR 描述和 commit 信息。他说 AI 生成的描述只会复述代码能直接看出来的细节,却跳过了最关键的——你为什么要这样改、整个改动想达成什么目标。这个提醒挺及时:我们用 AI 写摘要、写周报的时候,如果只让它看表面信息,它会写出正确的废话,但缺了背景。以后让它写总结前,先多给一句上下文,告诉它这段变动的背景和目标,可能效果就好很多。
原文:https://simonwillison.net/2026/Jul/8/kenton-varda
开源模型用得多,但闭源模型赚得多——Anthropic 拿走了大部分钱。
Decagon 的 CEO 分享了一个观察:他们公司九成的工作任务跑在开源模型上,不是图便宜,而是因为需要小而快的模型做大规模微调,才能满足客户对响应速度的要求。但最初验证一个业务能否做通时,还是会先用最贵最强的闭源模型。数据也印证了这一点:在 Vercel 和 OpenRouter 的平台上,DeepSeek 在 Token 数量上遥遥领先,但按支出算的话,Anthropic 仍然占了大头。说白了,开源和闭源不是一个替代另一个,更像是先用闭源探路、再用开源铺开。对你来说,选模型时先想清楚现在是探路还是铺量,比纠结开源闭源更实在。
原文:https://www.infoq.cn/article/7qI7yUXcZIwazjEW2Aho
英国一家初创公司把实验室送上了天,用太空环境训练 AI 研究蛋白质行为。
Mass Balance 把一个葡萄柚大小的化学实验装置塞进了 SpaceX 的火箭,在轨道上自动测量细胞在微重力下的生长和反应。地球上因为有重力和热对流,有些蛋白质的行为很难看清楚,太空里这些干扰消失了,数据就更干净。这趟主要是先验证装置能不能在太空稳定运行,如果跑通了,以后药物研发就会多一个维度。这种把极端环境变成 AI 的训练场,说不定能给很多领域带来新数据。
原文:https://www.wired.com/story/british-space-startup-launches-longevity-lab-into-orbit
亚马逊在憋大招,要让 Alexa 一次处理多个任务,比如同时约车和发短信。
据 Business Insider 看到的内部文件,这个代号 Moonraker 的项目想把 Alexa 升级成真正的智能体——你一句话里同时让它叫车、给朋友发消息,它都能串起来做完。不过计划里也透露出成本压力很大,光 GPU 预算今年就可能过亿美金。这说明家居语音助手的战场也在往多步骤、复杂任务的方向卷。对我们来说,目前还不急着期待,但可以留意一下,一旦这类能力落地,日常琐事能整串甩给 AI 的感觉会很不一样。
开发者补给站
Cube Sandbox v0.5.0 支持 Arm 架构了,AI 智能体的沙箱能跑在更多服务器上。
腾讯云开源的 Cube Sandbox 是专为大型语言模型应用设计的硬件级隔离运行环境。这次更新联合了 Arm 工程团队,把对 AArch64 架构的支持正式合入了主线,现在开发者能在 Arm 服务器上完成从编译、部署到启动的全流程。如果你在做 AI 智能体的生产化部署,尤其是在多架构(x86 + Arm)的云环境里,这个版本可以让你把沙箱无缝迁到 Arm 实例上,利用 Arm 的能效优势。
原文:https://www.infoq.cn/article/c4GEoZLWvNZQhSSSWAoH
Security MCP:把你的安全策略喂给 AI 智能体,让它按规矩来。
这是一个开源工具,能把组织内部的安全策略和推荐路径暴露给 AI 智能体。简单说就是,你告诉 Agent 能走哪些「铺好的路」,它调用工具时就会遵守这些约束。如果你在构建需要访问企业内部系统的 Agent,可以把它集成进去,避免 Agent 越权操作。
原文:https://news.ycombinator.com/item?id=48834080
ExploreYC:一个开源 API,能查 6600 多家 YC 和 a16z 投资的公司数据。
提供 Y Combinator 和 a16z 投资组合的搜索、行业筛选、融资阶段、创始人信息等数据,还带着一个地图视图和分析面板。API 支持 curl、Node、Python,有 Swagger 文档。适合做创业研究、竞品分析或者要找联合创始人的开发者,直接用这份结构化数据比自己爬省事得多。
原文:https://www.producthunt.com/products/yc-company-explorer
好物挖掘机
LemonLime:一句话就能把你的工作流自动化,不用写代码。
它连上你现有的工具之后,会自己学习你的业务,然后自动创建对应的 AI 助理和自动化流程。不知道从哪下手的话,它还会主动推荐可以一键搞定的自动化方案。适合团队里那些每天重复跑报表、同步数据、分发通知的琐碎流程,省得自己搭 Zapier 或写脚本。