让AI学会你的重复操作:Codex看一遍屏幕就能替你跑
本文由 AI 自动整理生成,可能存在错漏,请以原文链接为准。
今天想跟你分享两件挺戳人的事:OpenAI Codex 出了个新功能,能看你操作屏幕学习重复任务然后自动执行;谷歌也把「直接操控电脑」的能力塞进了 Gemini 3.5 Flash。另外有一位技术圈的朋友发现,现在很多人连求职材料都让 AI 全包了,反而让面试官看不清真人。
灵感百宝袋
一个自己搭的求职控制台,批量搜岗位、跟进度、改简历,但不帮你投递。
有人做了个叫 JobOps 的自托管工具,把它架在自己服务器上。它能一次性从好几个招聘平台搜出职位,给你一个统一的看板去跟踪申请到了哪一步,还能根据 JD 改好简历。拿来试试:如果你最近在看机会,不用急着搭一套,先用它这个思路,把你在不同平台上收藏的岗位和进度记到一个文档或表格里,看能不能省掉来回跳转的时间。它不自动投递这一点,反而能让你自己把关每一次申请。
原文:https://www.reddit.com/r/selfhosted/comments/1uej3ql/jobops_a_selfhosted_job_search_cockpit_for
OpenAI Codex 现在能看你操作屏幕,学会重复任务然后自动帮你跑。
YouTube 博主 Matt Wolfe 刚拍了个视频演示这个「录制与回放」功能:你正常操作一遍,Codex 就默默记住了步骤,以后它能照着回放,帮你点来点去、填表格、跑流程,就像多了个不知疲倦的实习生。你也能拿手头每天都要重复做的事试一次——比如每天早上的数据拉取、整理日报模板,录一遍让它回放。哪怕第一次不完美,也给了你一个把机械劳动甩出去的起点。
原文:https://www.youtube.com/watch?v=qv-KPydJhXs
江湖快报
谷歌把「直接操控电脑」的能力塞进了 Gemini 3.5 Flash 主模型,不再是一个单独模型了。
以前 Gemini 想操控电脑得用另一个独立的模型,现在 DeepMind 把它内置到 3.5 Flash 里了。开发者可以拿来搭能跨浏览器、桌面、手机操作的智能体,做持续软件测试、跨应用信息汇总这类长链条工作。不过对不写代码的朋友来说,现在还不用操心。把它看成一种信号就好:未来 AI 帮你操作各种软件的门槛,正在肉眼可见地降低。
原文:https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash
OpenAI 联手博通搞了块叫 Jalapeño 的定制推理芯片,九个月就做出来了。
这块芯片从设计到生产只用了九个月,专门为跑大语言模型优化,能效比目前市面上的产品好不少。对普通用户来说,这意味着以后用 AI 服务的速度会更快,成本也可能往下走。短期内不用管它,但能看出 OpenAI 在把算力也攥在自己手里,从模型到产品再到芯片,整条链都自己做。
原文:https://openai.com/index/openai-broadcom-jalapeno-inference-chip
高通砸近 40 亿美元买了芯片软件公司 Modular,想把跨芯片编程的能力收进来。
Modular 做的是让开发者写一次 AI 程序就能在不同的芯片上跑,不用为每种芯片重写代码。高通把它买下来,以后他们的手机、汽车、物联网芯片上跑 AI 可能会更统一。对搞开发的人来说,如果将来一套代码就能覆盖高通的各种设备,省下的移植时间不是一星半点。
原文:https://www.wired.com/story/qualcomm-buys-buzzy-chip-startup-modular-for-nearly-dollar4-billion
苹果 Xcode 27 来了,直接在内置编辑器里集成编程智能体,还能统一管模拟器和真机。
这次更新把 AI 编程助手嵌进了代码编辑器,你可以用指令让它规划任务再动手,不再是边聊边改的生硬体验。另外新出的 DeviceHub 让你在一个窗口里同时操控多台模拟器和实体设备,截图、调暗色模式、改变字号都很顺手。你要是做苹果生态开发,升上去就能直接用智能体起手新项目,省掉不少准备工作。
原文:https://www.infoq.cn/article/VGQNO8bH0sq4kFDb6B7H
华为小艺 Claw 全机型开放,HarmonyOS 5.0 以上都能用,还能选不同的大模型。
把华为手机上的小艺 App 升级到最新版,就能用上小艺 Claw 智能体。套餐里可以选四种基础大模型,有 49 元体验包和 199 元标准包,Skills 市场里已经有超过 500 个能力插件,覆盖办公、知识搜索、创意创作这些场景。如果你手机系统版本够,花几十块先体验一把,看看它在你的日常使用里能不能真正帮上手。
原文:https://www.ithome.com/0/968/211.htm
贤者视角
Anthropic 从自己实践里总结了一套「人机混合团队」怎么搭配才有效的经验。
他们发现,以前用 AI 像一个人对着一个聊天窗单打独斗。现在大家开始把 Claude 这样的智能体放到团队工作空间里,每个人都叫得动它,它也能带着记忆和技能,在共享目标下跟好几号人同时协作,工作变成了一场「多人在线游戏」。这个转变挺有意思的。以后你在推动团队用 AI 的时候,不能只想着「我怎么用它提效」,更要想「我们一群人怎么跟它重新分工」,这比技术本身更值得琢磨。
原文:https://claude.com/blog/building-effective-human-agent-teams
一位技术博主发现,越来越多的求职材料全是 AI 生成的,面试官反而看不出这人到底怎么样。
Tom MacWright 分享了他的观察:最近收的简历、作品集链接、GitHub 项目甚至是提交记录,整个链条一眼看去全是 AI 的手笔。他说,这些东西精致但没有温度,他不知道这个人真实的想法和能力是什么。这提醒我们一件事:让 AI 帮把手没问题,但得在某个地方留下「只有你才写得出」的东西。尤其在别人要用材料判断你这个人的时候,真人痕迹就是最大的竞争力。
原文:https://simonwillison.net/2026/Jun/24/tom-macwright
摩根士丹利一年内两次上调中国人形机器人出货量预测,现在看到明年能出 5 万台。
最新的报告里,分析师觉得商业化落地比预想快得多,中国工厂里已经在真刀真枪用人形机器人干活了,到 2030 年市场规模可能达到 150 亿美元。不用盯着数字,可以留心的是:机器人不是未来的事,它在工厂、仓储这些场景里已经悄悄上了,以后我们用到的东西可能都经了它们的手。
原文:https://www.ithome.com/0/968/205.htm
开发者补给站
Datasette 1.0a35 发布,现在可以直接在网页界面里建表、改表结构,不用写 SQL。
这个面向数据探索和发布的工具,新增了「Create table」和「Alter table」的 Web UI 与 JSON API。建表时能设主键、默认值、外键;改表时能增减列、改类型、重命名,甚至直接删表。对经常要快速整理数据、展示给同事看的人,这版让操作顺手了很多。新出的模板上下文文档也明确了自定义页面的稳定变量,二次开发更安全。
原文:https://simonwillison.net/2026/Jun/23/datasette
IBM 研究团队放出 CUGA 框架,一个轻量级智能体开发工具,附带二十多个现成例子。
CUGA 把搭建能操作工具、执行多步任务的智能体这件事变简单了。你不需要从零踩坑,直接打开他们给的那些样例,看懂了改一改就能跑起来。框架本身很轻,适合快速验证想法。如果你正在摸索怎么让 AI 替你自动化一些工作流,从它给的例子入手,比看文档干想快得多。
原文:https://huggingface.co/blog/ibm-research/cuga-apps
Hugging Face 上了个 FFASR 排行榜,专门测在嘈杂远场环境下语音识别模型的表现。
这个排行榜针对的是真实世界里收音不理想的情况:背景吵、说话人离话筒远、有混响。它用统一的数据集跑一遍各家模型,把准确率摆出来,方便选模型的时候横向比较。如果你在做语音相关的应用,上去看一眼,能省掉自己搭环境做横向测试的功夫。
原文:https://huggingface.co/blog/ffasr-leaderboard
好物挖掘机
Swimio 是个 AI 游泳教练,在 Apple Watch 上追踪你的数据,然后出训练计划。
它不只是记个圈数,还能分析配速、划水效率和心率,根据你的目标生成个性化的训练内容,下水时手表上直接跟着练。练完给你反馈,指出哪些地方该调整。现在产品刚上,有折扣。经常游泳又想练出点名堂的人,拿它比自个儿瞎游要有数得多。
原文:https://www.producthunt.com/products/swimio
Nimt 让你在 Slack 里有个 AI 搜索助手,@它一下就能找文件、查知识库。
不用跳出聊天软件,直接在频道里问一句,它就在你们团队的历史消息、文档、链接里翻,把结果用对话的形式回给你。对整天泡在 Slack 里的团队来说,这个省掉了很多切窗口搜来搜去的功夫,信息都在聊天框里闭环了。