千万别着急,最重要的是快!

要以最快的速度慢下来。Anthropic 的 Dario 最近的一篇 We Must Pace the Frontier 把这种拧巴逻辑推到了高点,然后奥特曼,马老板,哈萨比斯等都出来说对对对。当然,不少有独立观点的大牛说这又是恐吓营销,鼓吹“末日论”,指出观点还是那个,并没有什么新事实新证据,无需较真。更有甚者从商业策略或者偏阴谋论的角度去揶揄,这些说要慢下来的都是为了 IPO 做准备,为了圈更多的钱,为了用政府管制来拖慢小公司,来挡住开源模型的发展。

很多都是大牛,都是有识之士,我愿意相信钱对于他们的公司或者雄心很重要,但绝不是他们的终极考虑,尤其是那些前沿实验室里面的研究员,对于他们,如果有机会能证明自己很在意的一个猜想是对的行得通的,拿一个亿跟他们换,他们都未必肯换。几年前 GPT 刚出来的时候,我为了想要看看我公司的项目的一个自己的想法是不是走的通,自己掏腰包去试,因为不试一下我晚上睡不着。

好了,铺垫完了。我想说的是,我觉得:人为的慢下来对安全有帮助的说法,逻辑上说不通。

把 Dario 文章给 Claude 过一遍,提示词是“指出文章中所有逻辑漏洞”,就能轻松拿到一个列表。

例如:文章同时要求能力增长与安全相匹配,以及减速不能损失对中国的领先。
可以用一个假设检验:安全研究需要两年,而领先中国优势只能容许放慢半年。那么半年之后怎么办?
继续等待:违反保持领先的要求。
继续推进:违反必须安全的要求。

再如:文章认为,有望迫使非美国前沿实验室慢下来的第一个重要步骤,就是不让他们拿到强大的 AI 芯片。但同时又没有论证为什么,美国前沿实验室慢下来的第一个重要步骤,又并不能是不让他们拿到强大的 AI 芯片。
公平的说,Dario 在文章里的确提出,就算美国的实验室,也可以考虑限制训练算力、训练方式以及内部使用 AI 改进 AI。但如果真的相信对减速有效,为什么不是重要步骤的第一条,而只是考虑。
其实,对于美国还是其他国家的实验室,在模型研究和安全研究两条路上,在同一个实验室里,算力基本就是零和博弈。如果没有足够的算力但又想更多的投入模型研究,就只能牺牲安全研究算力。你卖不卖芯片改变不了这个零和的本质。明知道对方在拼命追赶,还限制对方的算力,其实是变相的逼迫对方放弃安全研究,道理就是这么简单,连囚徒困境都不算是。

最后一个逻辑漏洞,是最致命的。以上的漏洞可以说是文章观点或者叙事的逻辑漏洞,但以下这个是 AI 发展层面的数学上的一个无解:递归式自我改进(recursive self-improvement,RSI)是指数于时间的,而人类的学习和思考是线性于时间的。
Dario 的文章开头我是完全同意的,今年开始 AI 越来越能够参与开发下一代 AI,递归式自我改进从理论步入实践,而且还已经证明这是未来的方向。我极端的认为,让 AI 去递归式自我改进,是任何学科领域未来唯一值得发展的方向。
千百年来,人类发明了不少东西,然而,这些东西,它们可以被使用,甚至辅助人类去发明新东西,但并不能完全自主的去发明其他东西。现在,人类历史第一次,有一个叫 AI 的东西,可以自主发明其他东西。
但可怕的是,一旦开启了递归式自我改进,人类的理解能力就因理解需要时间而开始掉队了。昨天,全球25位菲尔兹奖得主,对外发布了一份联合声明,数学领域中人工智能的严重失衡,大意是人类数学家没有足够的时间去消化理解 AI “发明”的数学成果。数学家都深知一条指数的曲线是可以很陡峭的。
“递归”描述反馈关系,“递归式自我改进”这个机制本身,不能保证增长一定是曲线,或者一定是最终超过任何固定斜率的直线的曲线,而且可能因领域而不同。但从当前的几个已经应用递归式自我改进的领域,能力提升能够持续加快下一轮改进,且这种反馈没有被收益递减和资源瓶颈抵消,发展不与时间成线性关系是很明显的。

我的看法是:除非有办法全球禁止使用 AI 递归式自我改进,也就是增长速度本身不增长,否则无论如何去人为的减慢,就是螳臂当车,就是一厢情愿,就是不尊重数学。

我认同的:

  • AI 发展会继续加速
  • AI 安全是个大问题
  • AI 应该尽人力所能的速度尽快发展
  • 已经发现的安全问题要尽快修补
  • AI 递归式自我改进这个潘多拉盒子已经打开了
  • 在 AI 持续指数增长,人类理解持续线性增长下,有限期减速无法永久维持人类理解领先。因此,如果减速方案的安全基础是“让人类始终理解并跟上 AI”,它最终必然失效。

我不认同的:

  • 有一个公司或者有一个国家的人是最适合去为人类决定 AI 的发展速度的
  • 有人知道 AI 发展多慢才是安全的
  • 慢就是更安全的

我希望的:

  • 人的大脑思考速度,因某种科技突破,能超越线性于时间
  • 人类作为一个整体,最终会有办法应对(这算我的一种信仰,无法也无须证明)

另外吐槽一下,Dario 文中的“驻场评估机构”的想法,不就是 OpenAI 的雏形吗?行得通早就行了。不过看样子 OpenAI 也会很快跟进这一步。有时候我还真的不得不佩服这些老大们,理想主义下的各种拧巴但依然保持理想。

最后,神话里,疾病辛劳痛苦灾祸都飞出来之后,潘多拉最后吓得赶紧关上了盒子,只有一样东西来不及在关起来之前飞出,那就是“希望”。既然已经打开了,连关上都未必就一定会更好,慢点打开就一定会更好吗?

Cybercab 的未来发展预测

跟特斯拉的其他发布会一样,Cybercab 今天的发布会一如既往,有说看到未来已来的,也有说失望透顶的。对于我,Cybercab 的投入运营,是一个公开事件,是终于让我可以开始进行预测的可靠起点。

TL;DR

产能预测
2026 Q3:1,200 台
2026 Q4:5,000 台
2027 Q1:14,500 台
2027 Q2:27,000 台
2027 Q3:达到约 31,000 台/季度的稳定产能
到 2027 年底累计约有 11 万台 Cybercab 下线。理论运力相当于大约 20–40 个奥斯汀级市场。

发展时间线
2026—2027 H1:基本全部由特斯拉持有运营
2027 H2:小规模专业车队销售或长期租赁
2028:大规模专业车队 + 少量城市试点普通个人购买
2029:普通个人广泛购买

平台抽成策略
大型车队:18%—22% + FSD $299/月
小车主:25%—30% + FSD $299/月

最大变数
现有美国临时豁免没有方向盘和踏板限制在每年 2,500 辆。如果政策不在年底前放宽,以上预测会受到严重限制。


好了,说说推理过程。

假设 Cybercab 严格复刻 Model 3 的产能爬坡 S 曲线,可以得出上述的产能预测时间线。财报可能不会单独披露 Cybercab 的下线数量,但是产能趋势的大约数量应该可以估算。

至于市场覆盖,在奥斯汀,Uber 加 Lyft 整个传统网约车市场,繁忙时刻大概是 4,000–7,000 辆同时在线。考虑到无司机,Cybercab 可以轻松运行超过八小时。约 3,000–5,000 辆 Cybercab 可覆盖并保留高峰冗余。况且,Uber 应该不会短时间在一个城市完全归零。所以,11 万辆大约 20–40 个奥斯汀。

来看车辆归属。低于 $30,000 的售价,扣除利润,假设每辆成本 $23,000。11 万辆,约 $25.4 亿。另外,运营成本和基础设施,包括电网/充电/停放/清洁/维修/保养/牌费/保险等等,如果把这些投资摊到约 11 万辆车上,到 2027 年底,估计 $10 亿。

特斯拉承受得起吗?截至 2026 年 Q2,特斯拉拥有现金 $152 亿,短期投资 $283 亿,合计流动性 $435 亿。所以是有 $35 亿的偿付能力的。

但是马老板的预算大头应该早就锁定在芯片、数据中心、人形机器人上面了。这 $35 亿他能不给 Robotaxi 这个项目花他一定不给。所以结论是,特斯拉会尽可能快的开放对外销售。但是又不可能快到在 Robotaxi 的全链路没有完全打通并稳定之前(2027 下半年),就额外的增加各种更难控制的风险。

如果拿 Airbnb 和 WeWork 的模式做比较,特斯拉最终一定会走 Airbnb 这种轻资产的路。跟 Airbnb 不同的是,Airbnb 不建房子,但特斯拉造车。或者更贴近的类比是苹果,造手机也卖服务。2015 到 2025十年间,苹果营收的服务占比从8.5%增加到26.2%。苹果服务的毛利率能高达 75%,特斯拉做无人出租平台估计达不到。但是,每辆 Cybercab 的年度平台收入相对于车价,可能远高于一部iPhone的年度服务收入相对于手机价格。

文字担责

Anthropic 今天正式解释了 Claude 的新机制:未来 Claude 模型生成的文本会包含一种机器可检测的统计水印。它不是隐藏字符,也不是往文本里塞 metadata,而是在模型面临多个同样合理的下一个词时,用一个带密钥的随机机制来影响选择。读者肉眼看不出来,但掌握 key 的检测器可以统计判断“Claude 曾参与生成这段文字的可能性”。Anthropic 明确说,这个水印只能说明 Claude likely was involved,不能证明“Claude 是作者”,也无法区分“Claude 写了全文”和“Claude 深度编辑了人写的文字”。

之前一些 AI 检测器闹的笑话,检测出王勃在一千多年前用 AI 写了《滕王阁序》。现在各大院校的 AI 论文检测器把莘莘学子折磨得苦不堪言。

A 社的这个水印,既不能用作证明,也不能用作证伪,不知道有多少是迫于欧盟的一厢情愿的政策,但至少他们是真实施了。

也好,现在可以让这个话题具有科学讨论的余地了。不再是,你说有“AI 味”就是 AI 写的。有了水印,现在是可以精确到“5%的可能性是 AI 写的”。

但,那又能下什么新的结论呢?

举个例子,一篇学生论文,需要想法、调研、反复推敲、查证、构思论文结构、写作等。学生甲把前面的都交给 AI,只是最后用自己语言通篇重新手搓论文,一点 AI 水印都不留。而学生乙把前面的都自己全包了,然后最后让 AI 帮忙码字出论文。两个学生的论文,各自到底是“谁写的”,是靠水印能够分得清的吗?一定要挑一个,你觉得哪个学生应该毕业?当然了,在现实生活中,学生乙更可能是在所有环节都深度让 AI 参与。所以,即使真的可以可靠的知道论文是“谁写的”,也下不了什么结论。

自从近年有了 AI,各大高校对论文的 AI 检测,想想其实挺可悲的。中国千年科举制度,早早已经不看文章是“谁写的”,北宋开始采用誊录。具体来说,考生本人用墨笔写的原卷叫 “墨卷”;试卷先弥封姓名,然后由专门的誊录人员把全文重新抄一遍,通常用朱笔,所以副本叫 “朱卷”。朱卷再经过“对读”程序,与墨卷逐字核对。真正送到考官手里评阅的是朱卷。阅卷官既看不到身份,也不能通过笔迹判断考生。现在的 AI 人人可用,足够公平,教授们为何不能按“朱卷”打分呢?为什么还要纠结“笔迹”呢?

你说那不同,哪能不弄清楚有多少“朱卷”内容是出自学生自己的“大脑”,不能靠 AI 这枪手完成的“朱卷”也顺利毕业吧?

为什么不能?难道当今不会用 AI 的学生就该顺利毕业吗?难道他们毕业以后工作不会用 AI 就能出好业绩吗?就能为校争光吗?

其实以前没有 AI,也可以请人肉枪手,只不过那时候寒门学子比较吃亏,现在 AI 反而把这个出身不公给抹平了。

那些不学无术的完全靠 AI 混毕业的难道就不管了?这就点题了,问“谁写的”,不如问“谁的”?谁的文字谁担责。论文也好,工作报告也好。上面例子里的两篇论文,答案容易很多了,分别是学生甲的和学生乙的。不管用了多少 AI,毕业论文是他们的一个作品,他们用这个作品毕业,用制作这个作品过程累积的知识去面试找工作,去发光发热。责任是他们自己的。当然,那些用人单位找人只看文凭的也要为他们自己的招聘策略担责。

说到底,AI 的出现,只是把整个社会往担责的那边推了一把狠的。以前看不清功劳,就看谁有苦劳。现在 AI 把苦都吃了,人只剩下对结果负责。

有一次,开完会,我让 AI 给总结一下,我瞟了一眼,就发出去了。隔壁组老板看了说,你在 test is trending positive (测试结果呈积极趋势) 后面忘了加 but not stat sig (但尚未达到统计显著性)。我能怪 AI 吗?我发出去的文字,不够完整,只能由我担责。

另外,我还养成一个习惯,公司里有各种乱七八糟的文档,如果一整段文字都是 AI 生成的,我在分享的时候会跟读它的人说,这完全是 AI 生成的,你看着办。我的时间是时间,别人的时间也是时间。另外,这样说了,表明是“谁的”,爱谁谁反正不是我的,不担责。

An Even Harder Challenge: AI Estimates 11.8 Billion Miles

This figure, 11,800 million miles (11.8 billion miles), does not appear in the financial statements. The only way to estimate it is to “eyeball” this chart. I used to do the eyeballing myself; now AI does it, and it is remarkably accurate.

As an aside, growth is first-order; growth in the growth rate is second-order. Human gene limits our ability to understand numbers at this scale.

For long-term investing, if the second-order term is still growing, explosive growth is only a matter of time. This is not investment advice.

Why SpaceX Is Still Right to Bet on Starship HLS

After watching Tim’s video, I finally understand why SpaceX is still committed to this HLS lunar lander architecture, even if it requires more than fourteen orbital refueling flights. If the goal is anything more ambitious than simply replaying Apollo, the long-term math still points in this direction.

For building a sustained lunar base, a single mission that can deliver roughly ten tons of useful payload is probably the bare minimum. A dozen-plus orbital refueling flights may be workable on paper, but once the number gets that high, boil-off in orbit, ground-side launch cadence, and the logistics around propellant supply all become the real constraints.

In the end, SpaceX may either have to wait for a later-generation Starship, perhaps around 2030, or abandon reuse for the first operational orbital-refueling campaign. That could mean expending roughly eight upper-stage Starships, or in a more extreme version, expending five full booster-and-ship stacks.

My guess is that this round of the space race ends with China landing first. The United States may arrive two years later, but with payload capacity an order of magnitude higher.

Source video: https://www.youtube.com/watch?v=T-jf6tTKt3Y