当AI吞噬一切可训练之物

随着AI能力的持续跃迁,投资圈出现了一种新的悲观判断:如果模型越来越强,所有应用公司终将被Anthropic、OpenAI、Nvidia等算力层吞噬,市场最后只剩下前沿模型、算力和少数基础设施。但Conviction合伙人Sarah Guo认为,这种判断只说对了一半——那些“薄包装”应用确实会被吸收,但真正有价值的是那些不可训练的东西。

可衡量即被训练,但并非全部

MIT的Mert Demirer及其团队量化了一个关键现象:在超过10万名开发者中,最新一代编码Agent让代码编写量提升了约180%,但真正交付上线的代码量只提升了约30%。写代码变便宜了,但剩下的环节——代码审查、系统集成、长期维护——仍然需要人为判断。

基准测试是一种可衡量的东西,而任何可衡量之物都可以被用来训练。因此,编码Agent最先成熟:编译器是免费的验证器,测试套件也是免费的验证器。但通过测试从来不意味着这个改动对一个运行十年的代码库来说就是正确的——那个模块存在的原因可能涉及三个没人写进文档的背景,部署流水线可能靠一个无人承认是自己写的cron job勉强维持着。

这种正确性无法从排行榜上读出,只能让一个复杂系统在真实世界中运行足够久才能验证。你之所以信任Google这样的系统,不是因为它通过了单元测试,而是因为它承受了多年真实负载。

翻译:从私有现实到模型行动

真正有护城河的AI公司,不是比通用模型更聪明,而是深入某个行业内部,完成艰难但关键的翻译工作:把客户的私有现实、工具、流程和判断标准整理成模型可以行动的系统。

以一家顶级老牌律所为例,其并购业务每年接近一千宗交易。你不能让几百名律师助理分别下载客户文件给通用Agent通读——保密原因就已不允许,更不用说其他十几个问题。真正重要的信号存在于交易层级:NDA、条款清单、尽职调查、购买协议、附属文件、交割清单——每个业务领域都有自己的结构,律师和工具都不能随意互换。

改造这样一家公司,并不是单一评测任务。它需要操盘手像打“数据棒球”一样处理:中间目标极其模糊,反馈不完整,周期极长,且环境本身也不会静止。

不可训练之物的护城河

通往“不可训练”角落的墙有高有低。一个开发者的玩具代码库是可迁移、标准化的,爬进去不难。但一家银行的生产系统既不可迁移也不标准化——你不会因为SWE-Bench Verified上聪明了2%,就获得它的root权限。

能力会吞掉很多东西,但更好的模型不会让私有的真实标准变成公开标准。它不会持有许可证,不会为责任签字,也不拥有公司的文件;当答案出错时,它也不能成为被起诉的一方。这里的瓶颈不是智能,而是权限与责任

市场资讯部视点:本文精准指出了当前AI投资领域最关键的认知盲区——可训练与不可训练的分水岭。在模型能力快速迭代的背景下,企业级AI应用的价值不再仅仅取决于算法聪明程度,更取决于能否进入并理解客户的组织流程、历史经验和判断体系。这种“深嵌入”能力恰恰是模型算力无法直接购买的,也是护城河的真正来源。对于行业参与者而言,与其追逐模型能力的最前沿,不如深入特定领域的“不可训练”角落,通过翻译、集成和长期服务积累真正的竞争壁垒。这提醒我们,AI商业化的未来不在于“更聪明”,而在于“更懂行”。