👁️Agent 工作流进入行业现场 - 2026-07-21
00 分钟
2026-7-21
2026-7-21
type
status
date
slug
summary
tags
category
icon
password

今日主线

今天这批 follow-builders 的重点不是单个模型发布,而是 Agent 工作流正在往更真实的行业场景里走。Zara Zhang 讲新公司会从第一天就围绕 coding agents 组织工作;Peter Yang 提到用一个 agent 做事、另一个 agent 按 rubric 审核;Aaron Levie 把 multi-model agentic systems 看成复杂 agent 的核心设计模式。它们指向同一个方向:agent 不只是更会写代码,而是开始改变团队、评估和成本结构。
另一个重要信号来自 No Priors 的 Booking.com 访谈。Glenn Fogel 的观点很实在:AI travel assistant 有机会把复杂行程规划变简单,但旅行不是把库存丢进数据库就完事,它有供应商关系、监管、售后和现实世界的连锁问题。AI 真正落地行业时,壁垒不在一句“有 agent”,而在能不能处理这些复杂细节。

重点解读

第一,agent 的评估方式正在变成熟。Peter Yang 转述 Thariq 的方法:一个 agent 做内容,另一个 agent 按 rubric 审核,避免模型偏爱自己的输出。Zara 的招聘流程也类似:第一轮不用 AI 看基础能力,第二轮必须用 AI 完成项目,还要看候选人与 agents 的聊天记录。未来不是“会不会用 AI”这么粗,而是要看人和 agent 协作的过程质量。
第二,模型路由会成为应用层的重要能力。Aaron Levie 提到 Cursor 的研究:用 frontier model 做规划和编排,再交给便宜的 workhorse model 执行,可以在项目级 token 成本上带来 15 倍改善。这里的重点不是省钱本身,而是复杂任务里并不是每一步都需要最高智力。谁更懂业务流程,谁就更能把不同模型放到正确位置。
第三,行业 AI 会比 demo 难得多。Booking.com CEO 在 podcast 里说,不存在永远安全的 moat,优势会被创新冲掉;但他也提醒,旅行行业有复杂的供应商协作、监管、取消、改签和真实世界反馈。AI 可以让旅行规划更像个人 concierge,但要真正改变行业,需要把业务细节做深。

X Builders 全量记录

1. Swyx @swyx

Swyx 今天最值得看的,是他对 RLM 论文里 benchmark 轨迹比较的提醒。他指出一个现实问题:即使不直接训练测试集,也可以用“长得像测试集”的数据去逼近 benchmark 分数;而开放权重模型通常不会公开数据集和环境,所以外部很难判断有没有这种 test lookalike。论文里用 NLP 距离指标看隐藏轨迹,虽然不是终极解法,但能帮助判断模型是不是在真正泛化。另两条是链接或短评,JSON 没有展开上下文,按全量规则保留。

2. Thibault Sottiaux @thsottiaux

Thibault Sottiaux 今天的内容很短:他说在 OpenAI 工作从来不会无聊,是一个非常不可思议的地方。信息量不大,但结合他近期连续讲 ChatGPT Work 和 Codex 的产品节奏,可以看作团队内部仍处在高强度推进状态。

3. Peter Yang @petergyang

Peter Yang 今天三条里,最重要的是 agent 评估方法:用一个 agent 做任务,再用另一个 agent 按 rubric 审核。视频短片这类任务没有确定答案,如果让同一个模型检查自己的输出,很容易产生 self-preferential bias,也就是对自己更宽容。另一条说禁止中国模型可能会像禁止中国电动车一样变成自伤;第一条只有“What”和链接,JSON 没有足够上下文,不扩写。

4. Madhu Guru @realmadhuguru

Madhu Guru 今天把 enterprise AI、product sense 和 tokenomics 放在一起看。她认为通往 AGI 的路会由大量有经济价值的任务铺出来,而这些任务很多都在企业里,所以 enterprise AI 是重要前线。她还把过去 crypto 的 tokenomics 讨论迁移到今天的 AI:真正关键的是 open vs closed weight、inference costs 和 model routing。换句话说,产品判断、成本结构和模型选择会越来越绑在一起。

5. Thariq @trq212

Thariq 今天说明一个 Claude Code bug 只在线上存在了几分钟,他是在自己个人账号做深夜 coding 时遇到的。内容偏产品运行状态,不是新功能,但能看到这类 coding agent 已经进入持续线上维护节奏,小 bug、快速传播修复、个人实测都会被公开讨论。

6. Amjad Masad @amasad

Amjad Masad 今天一条只写了“Tools”,上下文在链接里,JSON 没有展开;另一条是关于“Being cancelled is a choice”的表达,偏社交讨论。最值得保留的是他转到的“第一个由 coding agent 交付的实体产品?”这个点:coding agent 的影响可能不止停留在软件仓库里,它会逐步碰到硬件、供应链和真实产品交付。

7. Guillermo Rauch @rauchg

Guillermo Rauch 今天给了一个非常 builder 视角的判断:AI 最大的启发是 everything is code。幻灯片、设计、宣传视频、Excel 自动化都可以被当成 code 来生成、修改和迭代。这个判断和最近 disposable software、coding agents 的讨论放在一起看很顺:软件的边界正在外扩,很多过去不是“写代码”的工作,也会被代码化。

8. Aaron Levie @levie

Aaron Levie 今天重点讲 multi-model agentic systems。他转述 Cursor 的研究:复杂任务里,少数环节需要 frontier model 做规划、拆解和关键权衡;一旦不确定性被整理成明确指令,后续大量执行可以交给更便宜的模型。这个模式能带来项目级 15 倍成本改善,也解释了为什么 applied AI layer 会有差异化:真正懂 coding、finance、legal、healthcare、life sciences 等行业的人,才知道哪些步骤该用贵模型,哪些步骤可以路由给便宜模型。

9. Garry Tan @garrytan

Garry Tan 今天三条里,一条是加州税务和政治相关,和 AI 主线关系不强;一条是“Compute rules everything around me”,把算力作为当下 AI 产业底座的调侃式总结;另一条是提醒保持警觉。按全量规则全部保留。

10. Matt Turck @mattturck

Matt Turck 今天用一张梗图表达 OpenAI 和 Anthropic 面对顶级免费中国开源模型发布时的反应。虽然是玩笑,但对应今天多条关于中国模型、开放权重、model routing 和成本的讨论:开源模型已经不是边缘变量,而是会直接影响前沿实验室、应用公司和监管选择。

11. Zara Zhang @zarazhangrui

Zara Zhang 今天三条都很有沉淀价值。她说如果今天招聘,会把面试拆成两轮:第一轮线下面试且禁止 AI,用来测试领域知识和现场判断;第二轮必须用 AI 做一个没有 AI 完不成的项目,并且不仅看结果,还看候选人与 agents 的聊天记录。她还说现在公司分成两类:coding agents 出现前成立、正在 retrofit 的公司,以及 coding agents 之后成立的新公司。后者从第一天起就可能是十人以下团队、按项目而不是部门组织、每个人闭环完成工作、几乎没有内部会议。另一条是她达到 80k followers 的轻量记录。

12. Nikunj Kothari @nikunj

Nikunj Kothari 今天提醒 AI 创业者,不要把“没有 moat”误解成“规模和资本就是主要 moat”。他列了 Webvan、Groupon、MySpace、Yahoo、AltaVista、Blockbuster、Nokia 等例子,意思是结构和资本位置很好,也可能输给更独特的洞察,或者被自己的规模压垮。另一条是 VC 人才流向快速增长 startup 的观察,职位常见名是 special projects。

13. Dan Shipper @danshipper

Dan Shipper 今天一条是链接型短帖,JSON 没有展开上下文;另一条是 Every 正在招 senior engineer 来做 agent,要求是必须喜欢 agents;最后一条是“基本上是 Brian Johnson”的玩笑。对 AI 主线来说,招聘这条更有信息量:agent 产品团队已经开始把“真正想做 agent 的工程师”当成明确筛选条件。

14. Sam Altman @sama

Sam Altman 今天只有一句“it is good now!”并带链接。JSON 没有展开被回应对象或上下文,所以这里不做额外判断,只保留原始嵌入。

Blog 全量记录

今天 follow-builders 输出里没有 blog 内容。

Podcast 全量记录

1. No Priors:Travel Through the Lens of AI with with Booking.com CEO Glenn Fogel

这期 No Priors 采访 Booking Holdings CEO Glenn Fogel。核心结论很清楚:AI 会让旅行规划变得更像个人 concierge,但旅行行业不是单纯的搜索和库存问题。Fogel 认为,人们做复杂家庭旅行时会卡在多目的地、舱位、酒店、交通、餐厅、积分和现金选择这些细节上,AI agent 的价值是记住偏好、快速搜索组合、来回追问并给出可执行方案。与此同时,他反复强调“没有永久 moat”:今天的优势可能明天就没了,长期只能靠持续做新服务。但这并不代表新玩家能轻松掀翻大平台,因为旅行还有供应商关系、监管、merchant of record、改签取消、售后和真实世界问题。AI 在这里真正的机会,不是炫一个旅行聊天框,而是把复杂行程和出错后的连锁处理做扎实。

今日沉淀结论

今天最值得记住的是:Agent 正在从工具层进入组织层和行业层。它会改变面试、团队结构、模型路由、内容审核、旅行规划和产品交付;但真正的门槛也更清楚了,不是会调模型就够,而是要懂任务、懂行业、懂成本,还要有办法验证 agent 做得对不对。
Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders