程序员已经进入"后AI时代"!乔治梅森大学教授:模型早就足够强,其他行业却连怎么验收都没解决
单击上方“图灵人工智能”,选择“星标”公众号
您想知道的人工智能干货,第一时间送达


“Coding is the obvious one. And there the revolution already has arrived.”
Tyler Cowen:编程是最明显的领域,AI革命已经率先发生。
程序员大概不会觉得这句话夸张。
代码写得对不对,编译器会报错,测试会失败,日志也会留下痕迹。Agent每走一步,都有人替它判分。
换到客服、财务和医疗,情况就不一样了。
一个客服回复是否妥当,可能要等客户投诉才知道;一份财务分析能不能采用,需要经过多层审批,模型可以给出结果,公司却不知道该怎样检查,也不敢让它继续往下执行。
这也是经济学家Tyler Cowen在访谈中提出的问题:同样一批AI模型,为什么程序员的工作方式已经变了,其他行业的生产率却没有明显增长?
备注:Tyler Cowen是乔治梅森大学经济学教授、Mercatus Center主任,也是一位长期研究技术、生产力和人才的经济学家。
他的判断很直接:模型已经足够强。现在卡住AI落地的,是公司还在用原来的流程、权限和管理方式接住它。
以下为访谈内容,我们进行了翻译与整理。
编程最先被AI改写,因为结果能当场验收
主持人问Tyler,AI模型已经表现出很强的能力,为什么宏观数据里的生产率提升仍然不明显?
Tyler先把编程单独拿了出来。
在他看来,软件开发是少数已经明显进入AI革命的领域。
Agent写完一段代码,可以直接编译;修复一个Bug,可以运行复现测试;修改接口,可以检查类型和调用链;性能有没有提升,也能用基准测试比较。代码错了,编译器、测试和日志会迅速把问题暴露出来。
这套反馈回路让Agent能够连续工作。它不必每写几行代码就回来问一句“这样对吗”,而是可以根据工具返回的结果继续调整。

Tyler认为,编程是AI变革最先落地的领域
换到客服、法务和医疗,Agent很快会碰到另一类问题。
客服回复是否合适,可能要等客户投诉才知道;一份合同有没有遗漏,律师之间也可能意见不同;医疗方案是否有效,还要经历真实治疗和长期观察。缺少即时、可靠的反馈,Agent就很难独立跑完任务。
编程率先被AI改变,不只因为训练数据里有大量代码。软件工程现成的编译器、测试、日志、版本控制和回滚机制,正好可以给Agent当“裁判”。
模型已经够强,公司却还没换工作方法
Tyler Cowen:AI的质量已经不是瓶颈,真正拖慢变化的是人怎样采用和使用它。
不少公司的AI改造,还停留在给旧流程增加一个聊天窗口。
原来由员工整理的客服工单,现在让AI先生成摘要,后面仍然要复制进另一套系统;AI写出分析报告,审批人依旧需要在邮件和表格之间来回确认;Agent可以查资料,但没有访问业务系统的权限,最后还得等人补完剩下的步骤。
模型节省了十分钟,整个流程仍然需要三天。
Tyler:很多企业短期内得到的,只是一套几乎没人知道该怎么使用的新软件。模型供应商甚至要派团队进入客户公司,手把手帮助它们重新设计工作流。

技术已经可用,组织怎样采用它成了新的限制
开发团队也在经历同样的问题。
买下AI编程工具的团队很多,真正改掉开发流程的团队并不多。
有人仍然把Agent当成更长的代码补全;有人允许它修改仓库,却没有准备自动测试;还有人让它跑长任务,但权限、日志和回滚路径全靠临时决定。工具进来了,工程系统没有为它变化。
整代员工重新学习工作,比升级模型难得多
Tyler举了一个很直白的场景:告诉一名已经熟悉现有岗位的员工,过去的工作方式从明天起全部改变,以后要围绕AI重新学习。这在组织里很难推动。
员工愿意打开新工具,只是第一步。
工作被重新拆分后,谁负责发起任务,谁来检查结果,AI犯错由谁承担,原来的绩效又该怎样计算,这些都要重新安排。任何一项说不清,团队都会退回最熟悉的旧流程。

AI落地需要员工重新学习,也需要公司重新划分工作
开发者做企业AI项目时,经常把注意力放在模型、Prompt和工具调用上。项目上线以后,真正卡住进度的却可能是另一组问题:财务不允许Agent读取完整订单,法务要求每次生成都能追溯来源,业务部门不知道怎样抽查结果,出了错也找不到明确负责人。
这些问题没有模型参数那么新鲜,却直接决定Agent能走到哪一步。
先把业务变成“可以测试的东西”
编程给其他行业的启发,不是让每个人都去学写代码,而是把工作改造成可以检查、可以复现、可以撤回的过程。
假设团队想让Agent处理退款申请。只写一句“判断这笔退款是否合理”,它很难稳定执行。开发者还要把隐藏在老员工经验里的规则整理出来:哪些订单可以自动通过,哪些情况必须交给人工,应该查询哪些系统,结果要留下什么证据,误判后怎样撤回。
一项任务要交给Agent,至少要补齐四个部分:
·输入从哪里来。需要读取哪些数据库、文档和接口,哪些数据禁止访问。
·什么算完成。结果要满足哪些条件,谁有权确认通过。
·失败怎样暴露。用规则、测试、抽样还是业务指标发现错误。
·出了问题怎样退回。保存操作记录,允许人工接管,也要准备回滚路径。
这些内容写清以后,模型才有机会独立工作。否则再强的Agent,也会在每个模糊路口停下来等人。
“We don’t need GPT 8 for that.”
Tyler Cowen:很多已经能带来改善的工作,并不需要等到GPT-8。
Tyler在访谈中说,现有模型已经可以完成事实核查、校对和不少日常任务。企业一直等待下一代模型,往往是在回避自己的流程问题。

模型已经进入公司,合适的工作流仍在摸索。
当智能变便宜,主动性开始涨价
“Initiative will matter much more.”
Tyler Cowen:主动性会变得重要得多。
Tyler认为,当知识和智能越来越容易获得,读过什么学校、记住多少知识,带来的差距会缩小。更值钱的能力,是发现问题、形成判断,并知道怎样把不同的AI能力组织起来。
对开发者而言,“主动性”最后仍要落到具体工作上。
同样面对一个客服团队,有人只会给模型写一条摘要Prompt;有人会继续追问:哪些工单占用了最多人力,哪一步最适合自动化,系统里有没有可用的失败信号,Agent能否先处理80%的常规情况,再把剩下的交给人工。
后者并不一定写了更多代码,却把模型变成了一条真正能运转的流程。

知识更容易获得以后,主动发现和组织问题的能力会升值
写在最后
程序员率先进入“后AI时代”,靠的是软件工程早已准备好的编译器、测试、日志和版本控制。
Agent来到这里,立刻得到一套可以行动、可以犯错、也可以被纠正的环境。
财务、客服、制造和企业运营还缺少这样的基础设施。
这也给开发者留下了一批很具体的工作:把业务规则接入系统,把完成标准写成机器可以检查的条件,为异常准备日志和告警,再给高风险操作留下人工接管与回滚入口。
下一代模型当然会更强。但在公司真正用起来之前,总得有人先回答四个问题:任务怎么开始,结果怎么验收,失败怎样暴露,出了问题由谁接手。

文章精选:
1.图灵奖得主姚期智最新演讲: AI有边界,恰恰是好事
