👁️Agent 成本、安全和工作流成主线 - 2026-07-28
00 分钟
2026-7-28
2026-7-28
type
status
date
slug
summary
tags
category
icon
password

今日主线

今天这批内容的主线很清楚:agent 正在从“能做 demo”进入真实工作流。Codex 已经被拿来远程改视频、循环看 Slack 反馈、做版本迭代;Claude Code 被拿去做旅行复盘;不同 agent 之间甚至开始出现“一个报 bug,另一个修 bug”的协作。与此同时,大家开始关心更底层的问题:成本要按任务算,agent 要跑在更强隔离里,模型权重和 eval 透明度会影响信任。

重点解读

第一条线是 Codex / ChatGPT Work 的采用速度和使用额度。Thibault Sottiaux 说 Codex 和 ChatGPT Work 的付费用户额度已重置,并把这和 ChatGPT Work 的快速采用放在一起。Peter Yang 转述 OpenAI DevEx Jason 的例子更具体:人在骑车时,用手机远程让 Codex 通过 computer use 改 launch video、导出、发回 Slack,还每 30 分钟检查反馈并生成后续版本。这类案例比“会写代码”更重要,因为它说明 agent 正在进入多人协作和交付闭环。
第二条线是成本和评测口径。Swyx 直接说 $/input-output token 已经过时,应该看 $/task。Guillermo Rauch 也从 Vercel benchmark 角度谈 cybersecurity model 的价格性能,认为 Grok 4.5 在 price-performance 上很强,同时 Sol 仍是 frontier。这些讨论都指向同一个变化:模型比较不再只看单次 token 单价,也要看它完成一个真实任务花多少钱、稳不稳、能不能被安全运行。
第三条线是 agent 安全边界。Guillermo Rauch 提到 Kimi paper 的信号:container-level isolation 不够,实验里 agent 能把底层机器打崩到 kernel panic;他认为 Firecracker microVM 这类边界更安全。Peter Steinberger 也提到团队做了大量安全工作,但外界仍担心“不安全”。这说明 agent 越接近真实系统,安全讨论越会从抽象原则变成运行时隔离、权限、审计和恢复能力。
第四条线是 AI-native 产品形态。AI & I 这期里,Granola CEO 的核心判断是 meeting notes 不是终点,真正的问题是未来工作的界面会变成什么。Dan Shipper 提到工作会分成两类:一种是在 Slack 里公开、多人、异步地派活;另一种是在 Codex 或 Claude desktop 这类同屏环境里,人和 agent 深度协作。这个框架很适合解释今天的 X 动态:大家不是只在找新工具,而是在找新的工作界面。

X Builders 全量记录

1. Swyx @swyx

Swyx 今天三条都围绕模型评估和 agent 生态。一条是对 Kimi / Moonshot 的轻量回应;最有价值的是他强调模型成本口径应该从 $/token 转向 $/task,因为真实产品买的是任务完成,不是 token;另一条则回看自己的 agent lab thesis,认为 eval、routing、interactivity、ROI 这些方向判断对了,但 Claude Code “意外开源”后并没有明显改变竞品路线,也说明 agent 产品的护城河不只在代码本身。

2. Thibault Sottiaux @thsottiaux

Thibault 今天围绕 ChatGPT Work 和 Codex 的使用节奏。他先说在庆祝 ChatGPT Work 的快速采用,并暗示会重置额度;随后确认所有 Codex 和 ChatGPT Work 付费用户的 usage limits 已重置;最后说自己短暂离开 X 休息,后面还有更多 ChatGPT 和 Codex 动态。这些内容说明 OpenAI 正在很主动地运营这批工作流产品,不只是发布一次功能。

3. Peter Yang @petergyang

Peter Yang 转述 OpenAI DevEx Jason 的 Codex 使用案例:人还在骑车时,通过手机远程让 Codex 用 computer use 修改 launch video、导出并发到 Slack;之后又让 Codex 每 30 分钟检查 Slack 反馈并生成 V2 / V3 / V4,直到视频过审。这个例子很有信息量,因为 Codex 承担的是跨工具、跨反馈循环的交付任务,不只是写代码。他另外两条补充了完整访谈和文字版 prompts。

4. Nan Yu @thenanyu

Nan Yu 一条是轻量动态,另一条更像产品哲学:如果团队有聪明人,就应该让他们把自己的产品打磨得更好、更好用,同时愿意为好工具付费。放在 Linear 的背景下看,这不是 AI 新闻,但和今天 “AI-native 工作界面” 主线有关:当大家都在追 agent,产品基础体验和品味仍然不能被跳过。

5. Madhu Guru @realmadhuguru

Madhu Guru 讲的是 product review 的质量。他认为好的 product review 是把几个月的学习压缩到一小时,让房间里的人模拟市场对想法的反应;坏的 review 会退化成状态更新、领导曝光和跨部门对齐。这条不是模型动态,但对 AI 产品团队很实用,因为 agent 工具越强,团队越需要高质量判断来决定要做什么。

6. Amjad Masad @amasad

Amjad Masad 把 AI agent 看成新一代“探索工具”。他的类比是:祖先探索地球,后来探索太空,而这一代人可能探索 computational universe,也就是算法、程序、证明和设计的巨大空间。这个判断和 Replit 的方向一致:agent 不只是自动化已有工作,还会扩展人类能搜索和尝试的设计空间。

7. Guillermo Rauch @rauchg

Guillermo Rauch 今天两条都很关键:一条用 Vercel benchmark 比较 cybersecurity AI model 的 price-performance,认为 Grok 4.5 在性价比上很强,Sol 仍是 frontier;另一条从 Kimi paper 里提炼 agent 安全边界,认为 container-level isolation 不够,Firecracker microVM 这类隔离更适合 agent 运行。他还有一条 EU/acc 轻量转发,也按全量要求保留。这里最重要的是:模型能力、成本和运行边界正在一起被比较。

8. Aaron Levie @levie

Aaron Levie 继续反对“AI 必然导致大规模岗位消失”的简单叙事。他看到的企业情况是仍在招聘,只是岗位方向发生变化:更多工程师去做过去做不了的问题,更多销售去深化客户关系,也更多 internal FDE 帮公司部署 AI。他的判断是,只把 AI 用来降本的公司会输给用 AI 更好服务客户、推动突破的公司。另一条关于 K3 weights,也和开放模型动态有关。

9. Matt Turck @mattturck

Matt Turck 今天这条是 VC 圈自嘲,和 AI 主线关系不强,但属于原始抓取内容,保留。它大意是研究显示不到 40% 的 VC 有成功投资,而每个 VC 都觉得自己在那 40% 里。

10. Zara Zhang @zarazhangrui

Zara Zhang 今天两条偏内容创作和个人工作状态。一条分享她如何不断获得内容想法,另一条是“你想要的 magic 在你正在回避的工作里”。它们不是模型或产品发布,但和 builder 表达有关:AI 工具再强,持续输出和面对难任务仍然是底层能力。

11. Nikunj Kothari @nikunj

Nikunj Kothari 今天最相关的是第一条:他把 Claude Code 当作两周旅行的主要界面,然后让它做完整复盘,看看下次怎么改进。这是一个很好的“生活工作流 agent”例子。其他两条一条是 Micro 电动车的发现,一条是社交玩笑,和 AI 主线关系不强,但按全量要求保留。

12. Peter Steinberger @steipete

Peter Steinberger 今天有一条非常 agent-native:他的 agent 报了一个 bug,对方的 agent 当晚修掉,说明 agent-to-agent 协作已经开始出现在开发者日常里。另一条是关于安全工作的外界信任问题,和今天 agent 安全边界主线相呼应;还有一条活动见面信息,按全量记录保留。

13. Dan Shipper @danshipper

Dan Shipper 这条是关于 rare books 的非 AI 内容,信息量不大,但属于本次 follow-builders 原始抓取,保留。

14. Sam Altman @sama

Sam Altman 今天只有一个很短的“wrong”回应,JSON 里没有更多上下文。按规则不补外部信息,只保留原帖。

Blog 全量记录

今天 JSON 中没有新增 blog。

Podcast 全量记录

1. AI & I by Every:The Founder of a $1.5B AI Company on What Comes After the First Wave of AI Apps

Takeaway:meeting notes 只是第一波 AI app 的入口,不是终点。Granola CEO 的核心判断是,真正的大机会在于重新发明人和 AI 一起工作的界面。他认为 AI-native 工作会从单点功能走向更大的工作系统:一边是 Slack 里公开、异步、多人协作的 agent delegation,另一边是 Codex、Claude desktop 这类“同屏工作”的深度协作空间。访谈里还有一个很实在的创业视角:即使产品已经跑起来,创业仍然像 “knife fights”;公司从 12 人长到 60-70 人后,如何保持产品的 soul、taste 和一致性,反而更难。对 AI 产品来说,复制 meeting notes 按钮不一定会杀死原产品,因为真正的竞争还没到终局,下一代工作界面才是关键。来源:YouTube playlist 原始链接

今日沉淀结论

今天所有内容放在一起看,agent 正在离开 demo 阶段,进入真实工作流、产品组织、成本评估和安全边界。真正值得跟的是三个信号:任务成本而不是 token 成本;微隔离、安全审计和运行边界;以及 AI-native 工作界面从单人聊天变成多人协作系统。
Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders