Anthropic 最狠的方法论,是先把最差版本发出去

1 minute read

Published:

Anthropic 最狠的地方,不是每次都把产品打磨到完美才发布,而是敢先把一个 research preview 扔出来,然后当着所有人的面快速变强。

作者:Koutian WuGitHub: ktwu01

我这两天一直在想 Anthropic 的产品节奏。

不是模型参数,不是 benchmark,也不是那种发布会截图里看起来很吓人的柱状图。

我想的是一个更朴素的东西,Anthropic 好像越来越擅长一件事,先发产品,再看反馈,然后赶紧迭代。

而且它发的时候还挺诚实。

很多东西一上来就叫 research preview。

这四个字其实挺妙的。它不是 beta 那种很工程化的说法,也不是 coming soon 那种营销话术。research preview 的潜台词是,我们自己也知道这东西现在还不稳,它可能会犯错,可能会很贵,可能会把你整懵,但你先用,你的反馈会直接塑造它后面的样子。

我觉得这个姿态很重要。

因为今天很多 AI 产品最大的问题,不是功能不够强,而是太怕丢脸。团队总想等到它像一个正常 SaaS 一样稳定,等到每个按钮都有解释,等到 onboarding 做得丝滑,等到客服话术都准备好,才敢把东西推给用户。

但大模型产品不是这么长出来的。

它更像一个很聪明但还没社会化的小孩,你把它关在实验室里训练半年,它当然会变强,但它不知道真实世界里用户会怎么折腾它。用户会把一整个遗留代码库丢给它,会让它改一个没人敢碰的 build system,会让它在上下文快爆掉的时候继续修 bug,会一边骂它一边继续给它钱。

这些场景,实验室里模拟不出来。

Claude Code 就是很好的例子。

严格按公开时间线看,Claude Code 是 2025 年 2 月 24 日 跟 Claude 3.7 Sonnet 一起发布的 limited research preview。到 2025 年 5 月 22 日,Anthropic 在 Claude 4 发布里说 Claude Code generally available,中间大概三个月。

所以如果说「六个月没人用」,这不一定是精确日历事实,更像是产品人的体感。

体感上,它一开始确实很奇怪。

一个命令行里的 agent,能读你的代码,能改文件,能跑测试,能提交 PR。听起来很猛,但你真打开终端的时候,第一反应可能是,哥们你真的敢动我的 repo 吗?

我自己第一次用 Claude Code 的时候也有这种感觉。

不是它不强,而是我不知道该怎么跟它合作。

你让它随便改,它可能会改太多。你让它只看不动,它又像被绑住了手。你给它一个模糊任务,它会很努力,但很可能努力错方向。你让它跑测试,它可能跑半天把上下文吃光。你看着那个终端滚来滚去,心里一半是兴奋,一半是「等下你别给我搞炸了」。

这就是 research preview 的真实状态。

最差版本。

但有意思的是,Anthropic 好像并不害怕承认这一点。

他们在 2025 年 4 月 发过一篇 Claude Code best practices,里面讲得很直白,Claude Code 是低层、可脚本化、接近 raw model access 的 power tool,有学习曲线。后来新版最佳实践又继续强调,好的结果来自 tight feedback loops,要早纠偏,要给 Claude 验证自己工作的方式,要用测试、截图、输出结果让它自己检查。

这不是传统产品经理那套「我们的产品非常易用」。

这是在说,你看,这东西现在是个活物,你得学会驯它,我们也在学。

我反而很喜欢这种诚实。

因为 agent 产品最怕的不是粗糙,最怕的是假装自己已经成熟。

一个 agent 如果说自己什么都能做,结果一上手连项目结构都读不明白,用户会直接失去信任。但如果它一开始就告诉你,我现在是 research preview,今天这个版本大概率是你这辈子见过的最差版本,后面会飞速变强,那用户的心理预期就完全不一样了。

你不是在买一个完成品。

你是在参与一个会长大的系统。

这块我觉得 Anthropic 跟很多公司很不一样。很多团队做产品,是先在内部想象一个完整形态,然后憋很久,发布,祈祷市场喜欢。Anthropic 的打法更像是,把一个有核心能力但还很硌手的东西先放出去,让真实用户来打磨它的边界。

Claude Code 后面的迭代基本就是沿着用户疼点来的。

用户说命令行里看不清状态,它后来做 terminal interface refresh

用户说我想在 IDE 里看 diff,它后来做 VS Code extension。

用户说 agent 跑远了我想回退,它后来做 checkpoints。

用户说每一步都要确认太烦,它后来做 auto mode,但又加了权限框架和分类器。

这些功能不是坐在会议室里拍脑袋拍出来的,它们一看就是被真实用户骂出来的。

这句话我没有贬义。

好产品就是被真实用户骂出来的。

尤其是 Claude Code 这种东西,它不是一个按钮,不是一个 App,也不是一个漂亮界面。它直接伸进你的工作流,伸进你的 repo,伸进你的测试、lint、CI、GitHub、terminal 和 IDE。它碰到的每一个边界,都是用户工作里的真边界。

所以它必须尽早进入真实工作。

你如果只在 demo 里看 Claude Code,会觉得它像魔法。打开一个项目,写几句自然语言,自动改代码,自动跑测试,自动交 PR,太爽了。

但你如果真用它一周,就会发现魔法后面全是工程细节。

上下文怎么管。

权限怎么放。

错误怎么回滚。

多 agent 怎么并行。

人什么时候介入。

任务怎么切小。

失败两次之后要不要 /clear

这些东西看起来很碎,但它们才是 agent 产品真正的护城河。

模型能力当然重要,但模型能力只是发动机。真正让一辆车能上路的,是方向盘、刹车、仪表盘、安全带,还有你知道什么时候该靠边停一下。

Anthropic 的方法论,厉害就厉害在这里。

它不是先把车漆喷得很漂亮,而是先让车开上真实道路,然后一边听用户骂刹车太硬,一边赶紧改。

说真的,这个方法论对做 AI 产品的人很有启发。

你今天如果要做一个 agent,千万不要等到它什么都能做再发布。

因为你根本不知道用户真正想让它做什么。

你以为用户想要一个会写代码的助手,结果他真正想要的是一个能读懂老项目、敢跑测试、能把 PR 从 0 推到 1 的同事。

你以为用户想要一个会总结文档的助手,结果他真正想要的是一个能在 Slack、Google Drive、Notion、GitHub 之间自己穿梭,把事情闭环的人。

你以为用户想要一个漂亮聊天框,结果他真正想要的是少开 17 个 tab。

这些差异,只有产品发出去之后才会暴露。

而 research preview 给了团队一个很好的缓冲带。

它允许你不完美。

它也要求你快速改。

这里面有个很关键的道德契约。你不能拿 research preview 当挡箭牌,发一个烂东西之后就躺平。你要跟用户讲清楚,今天这个版本确实可能是最差的,但我们会认真看反馈,会快速修,会把你骂的东西变成下一个版本。

用户其实不是不能接受粗糙。

用户不能接受的是粗糙之后没人理。

Claude Code 一开始并不是所有人都会用。我甚至觉得很多人第一次打开之后会关掉,心想这玩意跟 Cursor 到底什么关系,我为什么要在终端里跟一个模型聊天。

但一旦那条「发布,反馈,迭代」的轮子转起来,事情就变了。

早期用户开始写 best practices,开始分享自己的 workflow,开始把它接进 GitHub,接进 CI,接进自己的脚本。Anthropic 自己也把内部使用经验写出来。一个工具慢慢就从「少数 nerd 玩的东西」,变成「团队工作方式的一部分」。

这就是飞轮。

不是某一天突然爆了。

是你把一个不成熟但方向正确的东西放出去,然后让真实世界每天敲它一下。敲到第 100 天,它就开始像个产品了。敲到第 300 天,它就开始像基础设施了。

我有时候觉得,AI 时代最反直觉的一点就在这里。

过去我们总觉得,产品发布是一个终点。你做了很久,终于 launch,大家鼓掌,发 Product Hunt,发 Twitter,发公众号,然后看数据。

但 agent 产品的发布更像起点。

launch 那一刻,它甚至还没真正出生。

真正的出生,是它第一次被用户扔进一个脏兮兮的真实工作流里,第一次犯错,第一次被用户打断,第一次从反馈里长出一个新功能。

这让我想到生物进化。

一个物种不可能在无菌室里进化出适应荒野的能力。它必须进入环境,被选择,被淘汰,被迫改变。产品也是一样。尤其是 AI 产品,你不把它放进用户的混乱生活里,它永远只会在 demo 里优雅。

而真实生活从来不优雅。

真实生活是测试挂了,依赖冲突了,repo 里有十年前的代码,老板明早要 demo,用户说这个按钮太大,CI 又红了,模型上下文爆了,你凌晨两点还在终端里看它跑。

这时候还能继续往前推的东西,才有机会留下来。

所以我现在越来越相信,AI 产品最好的发布文案可能不是「我们很强」。

而是「这是 research preview,它现在会是最差的版本。你先用,骂我们,我们马上改」。

这话听起来不够体面,但很真实。

而且很有力量。

因为它把用户从消费者变成了共同训练这个系统的人。

回到 Anthropic。

Claude Code 真正让我佩服的,不只是它今天能做多少事,而是它从一开始就把自己放在了一个可以被真实反馈塑形的位置。先发出来,承认粗糙,观察用户怎么用,补最佳实践,补权限,补 IDE,补回滚,补自动化。

这条路很苦。

因为你会被骂。

你会看到用户说你贵,说你慢,说你抽风,说你改错文件,说你上下文管理一塌糊涂。你不能躲在「我们还没准备好」后面,因为你已经发出去了。

但也只有这样,产品才会真的长出来。

我自己做东西的时候也越来越被这个思路影响。别总想着一次性做完美。先把核心能力做出来,给真实的人用,告诉他们这只是 research preview,告诉他们今天它最差,然后把反馈接住。

接住,比完美更重要。

大时代啊,朋友们。

以后很多产品可能都不是被设计出来的,而是被使用出来的。谁敢更早进入真实场景,谁敢更快面对难听反馈,谁就更有机会把 agent 从一个 demo 养成一个基础设施。

Claude Code 这件事给我的启发就是这么简单。

先发。

然后认真听。

然后赶紧改。

谢谢你看我的文章,我们,下次再见。