给AI一张没标记的照片,它能推理出你在哪儿拍的
本文由 AI 自动整理生成,可能存在错漏,请以原文链接为准。
今天想跟你分享一件挺戳人的事——Matt Wolfe给了Claude一张没标记的随机照片,它自己上网搜出了拍摄地点。另外谷歌搜索的AI模式能帮办晚宴,实在Agent桌面操作成功率首破90%,几个新工具也值得说说。
灵感百宝袋
谷歌搜索的AI模式,现在能帮你办一场有模有样的晚宴了
玩法是:用搜索AI模式设计菜单、搭配酒水、规划桌景,甚至帮你生成配套的歌单,直接同步到音乐App。说白了就是把办趴体的杂活交给AI,你只管享受和社交。今天随手试一下:下次约朋友来家里吃饭,别自己想菜单了,直接让谷歌搜索帮你配一套,看看效果。
原文:https://blog.google/products-and-platforms/products/search/dinner-party-hosting-tips
Dan Koe分享了一套写作系统,核心是「先捕捉任何想法,再从热门趋势里找选题」
他这套方法的关键不是写得漂不漂亮,而是用写作倒逼自己把碎片想法串成清晰的思路。你可以把他当做一个外挂大脑——随时记下灵感,等要输出的时候,用网上热门的讨论来帮你找到切入角度,写出来的东西既有你自己的东西,又有流量。今天随手试一下:现在就打开备忘录,记下脑子里冒出来的第一个念头,不用整理,记下来就是第一步。
原文:https://www.youtube.com/watch?v=KCjwU4XYBL8
Claude Code拿到一张完全没有地理标记的随机照片,自己上网搜出了拍摄地点
Matt Wolfe丢给Claude Code一张普通街景,没有任何EXIF信息。Claude就在沙盒里打开浏览器、查地图、对比建筑细节,最后精准定位到了拍摄地。这演示的不只是技术,更是AI变成一个能主动用工具的助理的潜力。试试看:拿一张你不知道地点的老照片,丢给Claude或GPT,让它试着推理看看,说不定比你自己猜得还准。
原文:https://www.youtube.com/watch?v=zdG2bgFPxl4
江湖快报
OpenAI发现只要打开两个API设置,GPT-5.6在ARC-AGI-3上的得分就翻了三倍
这两个设置是「保留推理过程」和「压缩」,相当于让模型在做任务时别失忆,并且把多余的思考步骤压掉,又省token又快。结果直接从7.8%跳到38.3%,效率提升6倍。如果你在用OpenAI API接智能体或复杂任务,不妨去后台把这两个选项打开试试手,也许你正在浪费模型能力。
原文:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores
OpenAI要免费把最先进的模型给10万名学术研究人员用
这个项目面向高校和科研机构的科学家、工程师,首批1万人今夏就能用上GPT-5.6 Sol Pro,计划到2027年扩大到10万,每个研究员还能邀请4个校内同事一起用。如果你是搞学术的,可以去官网申请试试,说不定写基金本子、跑实验方案都能快一截。
原文:https://openai.com/index/chatgpt-for-academic-researchers
Google Flow Music更新了音乐模型Lyria 3.5,生成的歌更好听了
新版模型在旋律、歌词和人声上都有提升,听起来更自然,咬字也准了,你还能控速、控制时长。喜欢自己做歌的朋友,今天打开Flow Music就能体验,试一下把你的心情变成一首带伴奏的小曲。
GPT-5.6系列在成本和性能上重新分配,旗舰版Sol性能超越Claude Fable 5,价格不到一半
简单说,OpenAI把模型分成Sol(最强)、Terra、Luna三档,Luna的价格只有Sol的20%,但依然比上一代GPT-5.5还便宜好用。如果你平时用ChatGPT Plus,默认可能就是Sol,但要是自己调API,现在可以根据任务轻重选模型,省钱不少。
原文:https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency
OpenAI让GPT-5.6自己动手优化自己的推理链路,整体服务成本降了20%
不是简单调参,而是用Codex和Sol分析生产流量、改写GPU内核代码,还拉了个开源工具帮它验证对错,相当于AI自己给自己的引擎做了大修。这对我们用API的人来说可能意味着未来更稳定和更低的调用成本,可以多留意后续的pricing调整。
原文:https://www.ithome.com/0/983/590.htm
微软确认今年会推出Copilot超级应用,把聊天、编码和智能体合在一起
按照CEO Satya Nadella的话,Copilot会从一个单纯的聊天窗口,变成一个囊括代码助手、自动化任务Agent的集合体,面向个人和企业。虽说多半是整合已有产品,但对日常在Office、Windows里办公的人来说,可能意味着AI能力离手边更近一步,不妨等正式发布再看看要不要调整工作流。
原文:https://www.theverge.com/tech/972927/microsoft-copilot-super-app-confirmed
国产实在Agent在OSWorld测试中成功率突破90%,首次超越桌面操作智能体的天花板
OSWorld是模拟真实操作系统环境的硬核评测,考验AI操作软件、跨应用协作的能力。实在Agent从361个任务里拿下90.2%成功率,尤其在图像处理和系统底层操作上很稳。如果你在找能自动操作Excel、邮件、浏览器的助手,这个方向值得关注,不过目前主要面向企业场景,个人要用可能还得等等。
原文:https://www.infoq.cn/article/4hUcQzeCeKm0wqkc4Zdc
贤者视角
Greg Isenberg直播聊「软件已死」这说法,但本质不是软件完了,而是写软件的方式变了
他分享了不少AI创业一线的观察:过去做产品要一个功能一个功能地敲代码,现在直接用大模型搭工作流,门槛低到非技术人员也能试。但话说回来,软件的需求没消失,只是实现方式从「写代码」转向「描述需求」。如果你在考虑用AI做点什么,可能重要的不是会不会写代码,而是你有多清楚「想要什么结果」。
原文:https://www.youtube.com/watch?v=Uslb-G2pc5I
开发者补给站
Emboss是个Python PDF引擎,特点是生成的不是死板的版面,而是结构化数据
它不像传统PDF库那样把文档写成固定的线条和文字块,而是保持逻辑结构,方便后续提取、搜索和复用。对频繁处理发票、报告、证书这类文档的开发者来说,可以省去大量解析反解析的功夫。不过目前项目还比较早期,功能边界和稳定性需要自己去测一下。
原文:https://news.ycombinator.com/item?id=49106579
OpenMetaHarness是一个为长周期智能体任务设计的框架,强调自主性
简单说,它把「规划、执行、检查」的循环封装得更自动化,适合需要多步交互、跨多天的任务场景。如果你在调桌面操作或浏览器Agent,可以拿它对比一下,看看能不能提升成功率。门槛是你得对智能体框架有一定了解,上手需读文档。
原文:https://news.ycombinator.com/item?id=49104873
Mousecrack用深度学习模拟真人鼠标轨迹,帮自动化脚本躲过反爬
原理是训练模型来生成逼真的鼠标移动和点击路径,让网站的反机器人系统误以为是真人在操作。对于做数据采集、自动化测试的开发者,这可能在特定场景下有用,但要注意合规——别用来恶意爬取。另外项目很新,效果如何还得看实际环境。
原文:https://news.ycombinator.com/item?id=49104642
好物挖掘机
Yap是Mac上的开源语音听写工具,完全在本地跑,不联网
对注重隐私又需要语音输入的人挺友好,不用把说的话传到云端,直接在你电脑上运行,打开就能用。今天可以下载试试,把一段口述转成文字,看看识别准不准。
原文:https://www.producthunt.com/products/yap-5
Premation是个开源的AI动效工具,想成为After Effects的免费替代品
用文字描述就能生成动画效果,对做视频剪辑、动态海报的创作者来说,省去很多手动打关键帧的活。不过毕竟是开源项目,稳定性和功能完整度还需要关注,感兴趣的话可以去GitHub拉下来试一把。
原文:https://www.producthunt.com/products/premation
Caimera是给时尚团队用的AI视觉制作平台
主打服装展示、虚拟试穿和海报生成,摄影棚里能省不少功夫。如果你是做电商、服装设计的,可以注册看看,用AI生成一组搭配图,看看效果能不能代替部分棚拍。