传统榜单快刷满了,评测界为什么换了考题——把实现交给 AI 的两年
评测界把考题换成真实系统改造,最强的模型也只答得完四成。这个差距意味着什么?我们在生产系统上验证了两年——一篇数字可溯源的总账,给正在琢磨 AI 落地的朋友三样参考。
一直看着外界各种榜单:Agent 能力、AI 能力、大模型能力,越来越强。也经常看到博主的演示:一个对话之间,搞出一个网页,一个炫酷的效果,一个简单的 APP。
跟我们在真实系统上的体感,反差特别大。
大到我们一直在反思:是不是我们自己哪里工具用得不好,或者不对。
直到最近,出现了一个基于实战的榜单。看完的感受很直接:我们在实战里的体感,终于有人量出来了。
这个榜单换了个思路出题。老的考题太简单:修一个 bug、改一个文件,更像课后习题,模型早就做得差不多了。新考题不造题目,直接从真实开源项目里选出一百七十道系统改造难题,平均一道要动十几个文件,最多的要动两百多个。这是生产力环境里的活。

图源:SWE-Bench ProMax(COLM 2026)
结果:最强的模型,十道题答不完六道。而且答不上的,大多不是不会改,是改不完——改了主干,漏了旁边调用它的地方;改着改着陷进循环,回滚,重来。
评测团队还做了一个对照:换一套工程环境,同一个模型,成绩从两成涨到四成。差的这一倍,全在环境,不在模型。
这件事为什么值得多说两句?因为我们一直在考场里。
原来我们不得已地一直在真实考场
我们写的系统,从来是给真实生意用的:跑在客户的真实业务场景下,接受客户真实业务场景的考验。业务出身,需求来了就得解决——没有别的考场可选。这篇账里的每一笔,都发生在这样的系统里,不是演示项目。
2024 年 8 月,我们把这套系统的实现整体交给了 AI。核心系统打散重构,代码由 AI 写,人主要负责给方向和判断。从那天起,手写代码是零。
一个艰难的选择
我们踏入的时候,AI 刚兴起,各种新技术不断冒出来,我们抱着试试的态度去用。起初还挺优惠:有免费额度,有各种促销。后来它越来越热门,需求越来越多,价格越来越贵,国外的封锁也越来越严。按量付费的那段时间是真的贵。最夸张的一次,一次性买了一亿个 token(AI 用量的计量单位),以为能用上一阵子,结果一两天就用完了。也是在一轮一轮的失败与收获里,这个方向一点点坚定了下来。所以后来即便费用一直在涨、限制越来越多,我们仍然坚定地选它。一个人的公司,一支 AI 团队,没有融资。现在回头看,也是真敢。
一个坚定的选择
把实现交给 AI,相当于把活交给一个全新的实习生:原本自己能直接做的事,现在要通过教他来做。这个实习生,过程中能力并不强;虽然到今天,他已经很强了。而我们,也还没有一套成熟的教育他的办法。
即便这样,我们仍然坚定地选这条路。目标就一个:形成一套教这种实习生的办法,让他做到我们自己写代码的质量。
这件事意味着,越早期,返工越多,问题越多。它其实是挖渠的一种表现:不求短期的速度,只要认定长期的方向对,就坚定做下去——无论短期有多折腾,多浪费,多拖慢。
折腾:失败经历的太多了
这样的失败,我们经历的太多了,一直经历着。这里挑重大的讲。
重写核心系统,前后试了三轮。第一轮卡在云与底层框架,整个底座要整体迁移,退了。第二轮卡在前端框架升级,升了几个月,一次全部回退。第三轮换了新框架,做了三个星期,推倒。
每一轮都是几十天的活,说没就没。很痛苦,也很黑暗。
但每一次失败,至少都证明了一件事:此路不通。此路不通,就去找新的路。
越战越勇:教训变成体系
失败过后,我们没有退,接着打。
曾经看到过一个说法:美军的战术手册里,有一些看似很奇葩的规定——其实每一条背后,都是血淋淋的教训。我们的规矩,也是这么来的。每一轮怎么死的、死在哪个环节,都被一条条记了下来;每一轮结束都复盘:好在哪,坏在哪,能不能复用;验证过可复用的,沉淀成规范、流程、检查单。第四轮动工之前,这些教训已经变成了「这个坑不要再踩」的清单。
第四轮走通了:同一批业务,几乎无损迁入新架构,各层比原来更干净。
就这样一路找,找着找着,真趟出了一条路。失败不值钱,攒下来的失败才值钱。
这套规矩落到今天,一个模块在我们手里的活法是这样的。动手前一到两个钟头,定义需求、消除歧义、拆解任务。这步看着慢,实际是全程最划算的时间。随后是十几小时的执行,写代码占小头。大头在完成后的独立审查:多角度各查一遍,再由利益不相关的「另一双眼」做对抗性审查,修上一两轮;模块关门前过整轮审核,合并前再过几道脚本质量门。规矩攒了几百条,与代码一起长。
这十几小时的执行,常常就是 Agent 的一次连续运行。任务以模块级、功能级、Issue 级为单位,工程体系管着它从头跑到尾——实例里最长的一次,接近 20 个小时。网上常能看到「AI 连续工作了几个小时」的分享;在我们的体系里,这样的长跑是常态,而且跑完,就是能过审的质量。
说穿了不新鲜,企业经营者都懂:每笔生意做完要复盘,验证过的做法定成流程,吃过的亏写进制度。审查的道理也一样:就像财务上的会计和出纳必须分离,管钱的不管账,管账的不管钱;代码也一样,写的人不审,审的人不写。我们只是把这套经营里验证了几百年的机制,做到了代码上。
失败给了我们真实的收获,也让失败之后的成功,更显珍贵。
曙光:从单月 27 次到月均三百多
黑暗之后,慢慢见到了曙光。曙光记在数字上。
先说口径:提交记录的是收工,一个提交,大致是一个功能或一个模块做完。
all in 的第一个月,27 次。AI 没有立刻兑现,预期中的神话没有出现。最低的单月,1 次。有三个月干脆为零,多半就是推倒重来的那几个月,分支删得干干净净。
2023 年也要提一句:整年 138 次提交,全期最低;同一年 10 月,第一家客户上线。两件事挨着,我们不解读,只摆事实。

月度提交次数(2024-08 至 2026-08)· 提交 = 收工记录 · 数据:BM 仓库 git 实测
然后是现在:月均提交是手写时代的十四倍多。手写时代一个月收工二十几次,现在三百多次。
这个「慢慢」,我们最看重:不是爆发,是一天一天熬出来的爬升。
这大概就是跌跌撞撞之后,坚持的意义。
例证:数据库整体替换——换技术栈、改代码、切实例、迁数据,12 小时收尾
单看数字还是抽象,说一件最近的事,一件连我们自己都没想到的事。
数据库整体从 SQL Server 换到 PostgreSQL。从项目代码出发:数据库相关的代码全部替换,全部测试,效果功能等同——技术栈替换、代码替换、验证、测试,一路过关。
这种事,放在前 AI 时代,是想都不敢想的:先过代码兼容这一关——架构不好,业务代码可能全部重写;数据迁移容错率为 0,错一个字节,业务对不上账;时间窗口又短,系统停不起。
过程里最难的部分,是把所有客户实例的生产环境数据全部迁移过去,逐字节做一致性验证。
最后的整体切换,在一个 12 个小时的时间窗口里完成。客户那边,中断只有 15 分钟,其余完全无感。
手动估算过:同一件事,没日没夜至少一个月。而且这不是挑软柿子捏:动的是生产系统的地基。
说出来还有点好笑:要是早知道能这样,早就该换了——不用被绑在这个商业化的免费版本上,受苦受了那么久。
当然,这件事有个前提:我们早期就把架构做成了可替换的。没有那一步,后面的一切都不可能。
同样的事,不止这一件:今天公布的新 logo,和它背后的商标申请,也是一个人带着 AI 做完的。
测试:一张安全网
有一笔历史债务,得先交代:手搓时代,我们的代码是没有测试的。不是不想写——一个人,把测试全部手写出来,不可能。
AI 时代,在 AI 的帮助下,规范的做法进来了:所有新增的代码,全部带测试;旧的代码,一旦涉及改动,就全量补上。如今仓库里的测试文件,有 668 个。
上一章那场大考,就是这张网接住的:数据库替换,代码全部换完之后,怎么证明效果功能等同?跑测试——全量跑下来 4,667 项通过,零新增失败;连两个数据库最挑刺的地方,排序规则、日期语义,都专写了测试盯着。安全网在,才敢把数据库整个换掉。
当然,不只是测试——还有逐字节的一致性验证、一道道独立审查。但这些测试,没有 AI,靠人手写是不可能的;一个人的开发,更不可能。
对客户,这也是一层安全保障:很多问题,在到达他们之前,就被网兜住了。这是行业里公认的好做法;只是从前,一个人做不动。
回到评测:两份考卷,一条沟
现在回到开头那个反差。
先自己说破一件事:那个榜单考的是 AI 面对陌生的系统;我们重构的,是自家七年的系统。两份考卷不一样,谁的成绩也证明不了谁。
但两份考卷背后的那条沟,是同一条。新考题把模型放进生产力环境,分数立刻打回原形:再强的模型,没有规矩和门禁,一样毛糙。我们自己体系里跑出来的活,也一样要过好几道门。同一批员工,放进有规矩、有门禁的公司,和放进什么都没有的公司,产出是两回事:差的不是人,模型也一样。
真正扛事的,是定义、审查、验证这套工程体系。
AI 是水;渠要自己挖——把水引导成我们想要的样子,引向我们所需要的地方,为自己长期所用。
我们信的东西:工程化的积累
两年攒下的,除了跑在业务上的系统,还有一套工程家当:就是前面那几百条规矩和教训,与代码同一条曲线在长。
- 1,894 —— 知识库仓库提交次数(programming-knowledge-base · git 实测)
- 9 · 171 · 160 —— 插件 · 命令 · 技能(另有 35 篇方法论文档)· dgate-marketplace · 文件系统实测
我们越来越信一件事:**上一个时代,最值钱的资产是代码;这个时代,是工程化的积累。**就像一家企业,厂房设备之外,真正值钱的还有多年攒下的流程、制度、经验——这些过去没人当资产攒的东西,现在值得攒。难,但值。
当时知不知道这条路对不对?不知道。认定了,就挖下去。
这份账摊开,其实想对两种经营者各说一句。
一直在攒的——流程、制度、规范,自己企业的 know-how——AI 时代,这是金矿:模型再强,也要有这些喂着、管着,多年的家底会被成倍放大。
还没怎么攒的,或者没太当回事的——现在也不晚。从今天起,把这些好好积累下来:这是 AI 时代最宝贵的资产,攒得越早,越值钱。
这条路我们自己也还在走。数门做的是 AI 时代的数智化管家:自己先把这条路走通,再站到客户身边说话。这个考场我们一直在,往后也一直在。
写在最后
两年走下来,这篇总账如果你想带走点什么,大概是这三样:
- 别等更强的模型:差距在体系,不在模型
- 工程化的积累,是这个时代的资产
- 把验证过的经营机制,搬进 AI 的工作流
