AI代码过剩后,给代码“冲厕所”的公司贵了十倍
经常拿AI写代码的人都知道,写出能跑的程序不难,但你稍不留神,文件就莫名大了好几倍。
我曾经心血来潮让AI帮我写个网站,虽然用几句话就生成了,但打眼一看,它硬生生给我写了两千多行屎山。
在AI编程普及之前,写代码是最耗时的事情,但AI现在太厉害了,以前需要几个小时甚至几天才能完成的代码,现在分分钟就能整出来。
但问题是,代码是堆起来了,那些屎里淘金的脏活也堆了起来。
AI可以一分钟写出几百行代码,但公司不可能因为它勉强能跑,就把这些代码直接扔给几百万用户。
一家给AI生成的代码“冲厕所”的公司,因此贵了近十倍。
8月12日,据TechCrunch报道,为GitHub Actions提供持续集成(Continuous Integration,CI)基础设施的Blacksmith完成4500万美元B轮融资,估值达到5.5亿美元。而不到一年前,它的估值还只有约6000万美元。
Blacksmith没有发明更聪明的AI,也不负责帮程序员写代码。它做的是AI把代码写出来以后剩下的事情:跑测试、做构建,确认这些AI生成的代码,到底能不能安全地进入真正的软件。
让它身价暴涨的不是测试本身,是那些需要处理的代码,正在变得越来越多。
AI写的代码,人类已经看不过来了
Blacksmith很早就发现,代码变得有点太多了。
2025年9月,公司在宣布A轮融资时披露,过去一年,在排除开发者人数增长的影响后,其现有客户运行的持续集成任务量,平均每个季度增长60%。
Blacksmith把这种变化归因于AI编程工具的爆发——毕竟人一天只有24个小时,能够生产的代码有限,后面的测试、构建和代码审查自然也有一个上限。
但Coding Agent的爆发改变了这个局面。
现在的多数编程Agent都可以读取代码库、修改多个文件、运行测试,再把结果交给人类,而不只是帮程序员补几行代码。更为重要的是,Agent不仅不需要下班,不需要睡觉,还可以调度多个Subagent,把一个复杂任务拆开,同时处理多个不同工作。
于是,代码生产开始摆脱“有多少程序员,就有多少双手”的限制,从手工作坊迈向工业时代。
Claude Code负责人Boris Cherny的工作方式,已经有点像一座小型代码工厂。
今年6月,Boris Cherny在Fortune Brainstorm Tech大会上说,自己已经8个月没有手写过一行代码。
取而代之的是,他开始管理一支越来越庞大的Agent队伍。Boris表示,大会当天早上,他同时管理着“几百个”Agent;有些时候,这个数字会变成几千,甚至几万个。
这种变化到底能把代码生产推到什么程度,OpenAI也做过一个颇为极端的实验。
2025年8月底,OpenAI一个最初只有3名工程师的团队,从一个空白代码库开始,用Codex开发一款内部软件。
规则很简单:人类不直接写代码,应用逻辑、测试、CI配置、文档、可观测性和内部工具,全部由Codex生成。
五个月后,这个代码库已经膨胀到约100万行,期间完成了约1500个代码合并请求(Pull Request,PR)。OpenAI估算,同样的工作,如果全部由人类手写代码,大约需要十倍的时间。
有意思的是,OpenAI称,他们经常看到单次Codex任务连续工作超过6个小时,很多时候,人已经睡了,Agent还在继续干活。
代码生产的上限,就这样开始脱离人类的工作时间。
但很快,新的问题出现了:代码写得太快,人开始看不过来了。
OpenAI在这次实验中直接写道:随着代码吞吐量增加,他们遇到的新瓶颈变成了“人类QA能力”。
因为不管Agent能写多少代码,人类的时间和精力毕竟是有限的。
这个团队每周五都要拿出整整一天,专门清理所谓的“AI slop”,也就是AI写出的那些屎山代码。它们通常来自Agent在快速生成代码时带来的副作用:比如重复或错误的实现模式、不一致的代码风格,以及在系统中不断累积的技术债。
但很快,这事儿也有点干不过来了。
于是OpenAI又把“擦屁股”的工作交给了Agent:让后台Codex任务定期扫描代码库,发现问题,自动提交重构PR。甚至连大量代码Review,也开始交给Agent之间互相检查,人类只在需要判断的时候介入。
也就是说,AI开始同时出现在生产线两端:一边疯狂生产代码,另一边帮人寻找这些代码里的问题。
但中间那些必须实际跑完的测试、构建和CI任务,并没有消失。
Blacksmith写了一句很直白的话:如果每一次代码修改仍然需要一个小时才能测试完,那么一个比人类快100倍的Coding Agent,也没有太大意义。
AI没有消灭软件开发的瓶颈。
它只是把瓶颈,从“这个代码到底怎么写”,推到了“这么多代码到底怎么验”。
AI代码过剩后,给代码
“冲厕所”的公司贵了十倍
要理解Blacksmith为什么能在不到一年的时间里从6000万美元涨到5.5亿美元,得先弄清楚这家公司的主要业务。
一段代码从程序员手里写出来,到真正出现在用户手机或者电脑上,中间还有很长一段路。
比如你给一个购物网站增加了新的支付按钮,代码写完以后,首先得确认它能不能正常编译;然后跑一遍自动测试,看看按钮能不能用;再跑更多测试,确认这次修改没有顺手把登录、购物车或者退款功能搞坏。
这些事情通常会被组织成一套自动流水线:程序员每提交一次代码,机器就自动把代码拉下来,重新构建软件、运行测试、检查结果。发现问题就打回去,全部通过以后,代码才有资格继续往下走。
而这个流水线,就叫作持续集成(Continuous Integration,CI)。
GitHub自己的GitHub Actions,就是最常见的CI工具之一。
而Blacksmith真正做的,是这套流水线下面的“执行层”。
GitHub Actions负责规定“要跑哪些测试、按什么顺序跑”,Blacksmith则提供真正执行这些任务的计算环境。
换句话说,Blacksmith并不帮你写测试规则,而是提供机器,把构建、测试和部署这些任务真正跑完。
它最初的卖点也很直接:让GitHub Actions跑得更快、更便宜。
按照Blacksmith的说法,它使用高单核性能CPU、本地缓存和NVMe存储来运行这些任务,大部分CI任务速度可以达到GitHub托管服务器的约2倍;一些Docker构建在缓存生效后可以获得更大的加速。对于开发者来说,迁移可能只需要修改一行GitHub Actions配置。
Blacksmith创始人后来形容,CI本质上就是“开发者的管道工程”。他们甚至开玩笑说,想让CI“至少这一次变得性感一点”。
但AI编程恰好把它最不起眼的地方,变成了优势:过去程序员一天提交几次代码,CI就跑几次;现在Agent可以持续改代码、反复尝试,还能并行调用Subagent,每一次修改都会触发新一轮构建、测试和验证。
Blacksmith在A轮融资时就提到,随着AI代码生成工具的发展,代码数量的快速增加正在把CI推向新的瓶颈。为此,Blacksmith没有简单依赖通用云计算资源,而是针对CI任务优化自己的硬件和软件栈,提供更快的执行速度、更高的并发能力,以及更适合测试流程的计算环境。
AI越会写代码,Blacksmith需要跑的机器反而越多,这门过去藏在软件开发后台的“脏活”,就这样被AI放大了。
2025年9月,Blacksmith已经服务约800家组织;不到一年后,这个数字增长到5000多家。
公司的员工数量从约10人增加到30人左右,年化收入则从1000万美元进入“数千万美元”区间,据TechCrunch报道,一些最大的客户每年在Blacksmith上的支出已经超过100万美元。
今天的Blacksmith,已经不满足于只做一个更快的CI执行层,它也开始把AI能力往上叠。
比如Codesmith可以读取代码仓库、修改代码并创建PR,也可以根据CI失败信息辅助定位和修复问题;Test Analytics负责整理测试失败信息;Testboxes则会给Agent临时创建一个虚拟测试环境,让它把刚改完的代码真正跑一遍,如果失败,结果再返回给Agent继续修改。
一条新的软件生产线开始出现:Agent写代码,Blacksmith跑测试;测试失败,AI总结问题;Codesmith修改代码,再扔回Testbox重新测试。
于是,代码生产和代码验证,都开始变得越来越自动化、Agent化。
但这里有一个关键区别。
AI可以自己找Bug、改代码,但最后那句“这段代码真的能用”,不能靠它自己说,必须真跑一遍。
而只要真的运行,就会消耗真实的计算资源。模型可以把写代码的边际成本不断压低,但服务器不会因为代码是AI写的就少跑一次测试,量大再凑个满减。
Blacksmith赚的,本质上是这最后一笔省不掉的钱。
AI写代码的终点,
是一个更大的验收产业
事实上,过去一年,几乎所有主流AI公司都开始往代码生产线的后半段走。
Codex刚推出时,OpenAI还专门提醒用户:即使Agent已经可以自己修改代码、运行测试,在真正集成和执行之前,AI生成的代码仍然需要人工Review和验证。
但很快,Codex自己也开始做Review。2025年9月,OpenAI披露,Codex已经Review了公司内部绝大多数PR,每天可以发现数百个问题,很多问题甚至在人类开始Review之前就被找出来。
Anthropic也在做类似的事情。
Claude Code在今年3月加入了自动安全审查能力,可以直接检查PR里的SQL注入、跨站脚本攻击(XSS)、身份验证漏洞、不安全的数据处理和依赖漏洞,并通过GitHub Actions自动运行。
但Anthropic同时强调,这套功能并不能取代既有的安全流程和人工Review。
GitHub的动作更加直接。今年7月GitHub Code Quality正式上线时,GitHub在官方公告里甚至用了这样一句话:“AI accelerates code output, and Code Quality helps teams ship code they trust.”
AI正在加速代码产出,而Code Quality负责帮助团队交付“可以信任的代码”。
这套产品会在PR阶段检查代码的可靠性和可维护性问题,并结合Copilot Autofix给出修复建议。GitHub披露,其内部团队会在代码合并前解决67.3%的Code Quality问题。
过去几年,AI编程最激烈的竞争发生在代码生成端:谁能写得更快,谁能处理更大的代码库,谁能完成更复杂的任务。
但当代码真的开始过剩,下一场竞争已经悄悄往后移动。测试、持续集成、代码Review、安全检查,这些过去散落在软件开发流程里的环节,正在被重新拉到台前。
这甚至形成了一种和很多“AI替代软件”的故事完全相反的关系:模型越强,代码生成的成本越低;代码生成的成本越低,代码产量越大;代码产量越大,后面的测试、Review和安全审查需求反而越多。
但Blacksmith和这些AI公司的位置又不太一样。
如果说Code Review是在给AI生成的代码“擦屁股”,Blacksmith做的,就是给AI生成的那些代码“冲厕所”。
OpenAI、Anthropic和GitHub正在争谁更会Review代码,而Blacksmith押注的,是这些判断最终都绕不开的一层基础设施。
Coding Agent可以换,但验证基础设施不能省。不管代码是Codex写的、Claude Code写的,还是人写的;也不管最后是谁负责Review,只要想知道这段代码到底能不能跑,测试就必须真正执行。
这也是Blacksmith最早选择自建CI基础设施的原因,它没有简单地在AWS等公有云上租机器,而是针对编译、构建和测试这些CI任务,自己优化CPU、存储、缓存和虚拟机调度。
Blacksmith可以往上做Agent和测试环境,但它最难替代的资产,仍然是下面那层让所有代码真正跑起来的CI基础设施。
换句话说,别人争的是谁更会看代码,Blacksmith赚的是代码最后必须跑一遍的钱。
