自费十几万开发了一个Codex增强版

7月29日发表10:31更新2.6k浏览

本文纯古法手敲,无AI

一、先说三件事

1、我是一个重度 Vibe Coding 用户

多重度呢?ClaudeCode、Codex、Cursor,我买的都是最贵那一档会员,但还是不够用,需要额外买重置卡。Qoder 我同时有两个 200 美元的账号,两个账号也不够用,后来单独买 Credits资源包都花了几万。

过去半年,我在 AI Coding 工具、模型 API 和云服务器上,前前后后自费花了十几万。

我不敢学懂王说没人比我更懂 Vibe Coding,但如果比使用强度、用过的产品数量和花出去的钱,应该值得"重度"这个自评了。

2、过去半年多我通过Vibe Coding复刻了大量AI产品

业余时间一个人把灵光、豆包、Manus、OpenClaw、ClaudeCode 的核心能力全都复刻了一遍,

ATA 视频直播:《ATA「技说」|大模型实战:从复刻灵光到手搓豆包增强版》

D2 大会分享(一个人复刻豆包、Manus、OpenClaw 的过程):《以模型为积木、以工程为骨架、以用户价值为终点》

3、改用自己开发的zhikuncode

ClaudeCode、Codex、Cursor、Qoder,我现在已经慢慢用得少了,当然有个真实背景是ClaudeCode账号又特么的被封了,正好公司也封禁了。日常很多任务,已经开始交给自己写的 zhikuncode来完成。

因为在我最看重的复杂长任务里,zhikuncode 的最终结果确实可以和 Codex 掰手腕了,有些任务甚至更好。

二、“一个人开发的 AI Coding 工具,比 Codex 还强”——搞笑么?

“zhikuncode 是 Codex 增强版”,看到这个肯定有人要笑,很正常。

Codex 什么地位?它和 ClaudeCode 是 AI Coding 领域的双子星,背后是 OpenAI。zhikuncode 就我一个人,还是业余时间做的,跑任务用的也不是 gpt 和 claude,而是 Kimi、GLM 这些国产模型。

“一个人开发的 AI Coding 工具,比 Codex 还强。”每个字都认识,连起来像在搞笑。

所以我开始也不自信,是不断靠运行真实任务转变自己想法的,下面挑选几个典型任务分享给大家。

1、第一个例子,复刻系统

我给 zhikuncode 一个网站地址和账号,让它先访问这个网站并介绍一下;接着又补了一句话,让它在指定目录里尽量完整地复刻这个网站的前后端。我给zhikuncode的指令一共就两句,没有接口文档,没有数据库设计,没有产品需求,没有页面清单,也没有专门给这个任务准备知识库、Skill、规则或者特殊 Prompt。

zhikuncode先自己登录网站,输密码,把页面、前端 Bundle、API 和业务流程研究了一遍,然后开始写数据库、后端接口和前端页面,主任务连续跑了六个多小时。最后交付了 40 个 Vue 页面、14 个业务实体和一万五千多行业务代码。自动还写测试用例,API 自动化检查最终是 108项全通过,浏览器自动化测试跑了三轮,从第一轮的通过率7/14,到第二轮 10/14,最后到了 14/14。

完整过程在这里:《ZhikunCode 网站复刻过程深度审计|公司内网版》

这个报告很长很长很长,因为里面不只放了最后成功的截图,还把为什么仅凭两句话,就能连跑六个多小时,中间基本没有人工接管(除了让我选择技术方案),最后得到一个前后端都能启动、业务可以操作、还能通过自动化测试的1:1复刻的复杂应用。

这件事过于离谱,证据少了我自己也不信,因此核心证据和详细分析全放进去了。

2、第二个例子,开发系统

我给 zhikuncode 一句模糊的话,让它开发一个黄金投资辅助实时监控系统,同一个任务,也交给了 Codex。最后评分是zhikuncode 68.3,Codex 68.4,基本打平,大家看看是否公正。

对比报告在这里:《黄金监控任务:ZhikunCode × Codex 执行审计》

3、第三个例子,可视化

还是一句话,让它开发一个 12306 候补购票的专业动态可视化页面,背景是我在抖音上看到有人做可视化视频介绍12306,抖音链接:https://www.douyin.com/video/7658102512116829474

同样也拿 Codex 跑了一遍,最后 zhikuncode 是 8.68,Codex 是 8.45,这次 zhikuncode 甚至略高,kimik3也是真的强。

报告在这里:《12306 候补可视化:ZhikunCode × Codex 对比评估》

三、任务分析

这两个对比任务里,zhikuncode 用的是 Kimi 和 GLM,Codex 用的是 GPT-5.6 Sol,而且是高推理强度和快速模式。

按报告评分,一个基本持平,一个略高。

反直觉的问题是:为什么模型差一档,背后的团队更是不可相提并论,最后交付却没有跟着差几档?

教师网站这个任务更能说明问题,23 个子 Agent 里,有 12 个跑到了轮数上限,还有一个发生了模型流超时。中间遇到过 429,服务重启过(因为电脑没电关机了),第一轮 E2E 也只通过了 7 条。如果文件丢了、上下文乱了,或者主 Agent 看见子 Agent 报错就直接停,这个任务到这里基本结束。

实际情况是,前面已经写出来的文件还在,检查点和部分结果也在,主 Agent 可以接着补。服务重启以后又继续跑,最后靠 API 和浏览器测试一轮轮找问题、改问题,把 E2E 从 7/14 推到了 14/14。

很多 AI Coding 产品看起来都差不多:一个输入框,后面接模型,再给模型几个读文件、写文件、跑命令的工具。

但任务要跑几个小时,问题性质就完全变了。

模型前面答得多漂亮不重要,重要的是跑到第 100 轮还记不记得要做什么吗?

子 Agent 失败以后,已经写完的代码算不算白写?

工具调用只返回了一半,协议还能不能闭合?

服务挂了重启,前面的任务还剩多少?

最后模型说“完成了”,系统到底是相信它,还是自己去启动服务、调接口、浏览器里真实验证?

四、如何体验

看到这里如果还是觉得不可能,最简单的办法就是自己下载测试验证。

GitHub 地址:https://github.com/zhikunqingtao/zhikuncode/,clone 到本地,配置自己的真实密钥,然后启动。

不用配啥知识库,不用专门写一堆规则,也不用研究 Prompt,直接找一个自己平时常用的编码任务,把要求告诉它。

别拿 TODO List 这种测,也别写俄罗斯方块什么的,那种任务现在啥工具都能写。拿一个需要理解现有项目、跨很多文件修改、分支拉取创建提交、启动服务、调用接口、操作浏览器页面、处理报错,最后还得跑测试的真实任务。

有条件的话,同一个任务也给 Codex 跑一遍,最后自己比较,看看纯 AI Coding 的暴力美学。

五、介绍一下 zhikuncode

它在 GitHub 上使用最宽松的 MIT 协议开源,可以本地部署,也可以用 Docker 部署到云服务器或者公司内网。电脑浏览器可以访问,手机浏览器也可以访问,而且手机端不是二等公民,任务状态、权限审批、Agent 运行情况这些都能在手机上看和处理。这个对我很重要,很多任务一跑就是几个小时,我不可能一直守在电脑前。模型随便切、CLI、Skill、MCP、插件等等该有的基本都有,GitHub 上README列得更全:https://github.com/zhikunqingtao/zhikuncode/

六、十几万花哪了

再说标题提到的十几万,钱都花哪了

1、各种 AI Coding 工具

为了开发 zhikuncode,我基本ClaudeCode、Codex、Cursor、Qoder 都在轮番用,很多时候是同时用,交叉对比。这里面 Qoder 花得最多,前后几万块钱。

没办法,特么的ClaudeCode 封我两次了,Qoder 能流畅用 Claude 的模型,只能跟 Cursor 一起顶上。

Qoder的同学如果按个人消费金额排个序,我相信全国 Top 10 里肯定有我。

2、各个模型的 API。

Qwen、DeepSeek、Kimi、MiniMax、GLM,我全是消耗大户。还有个小插曲,因为百炼千问流量用得太多,阿里云商务同学专门联系我,估计是觉得碰上大客户了。

3、大头是 SWE-bench。

自己写的产品既然是 AI Coding工具,最直接的验证当然是跑 SWE-bench:《ZhikunCode SWE-bench Lite 技术报告》

我自己电脑跑不起来,只能买阿里云比较贵的服务器、存储和带宽。后来我没有继续刷榜,一是太贵,跑一次模型费就是几千;二是跑完以后发现,这个榜用处没那么大。

因为SWE-bench 测的是在一个代码仓库里修一个相对明确的问题。我平时拿 AI 做的任务,经常连需求是什么都得让它自己先研究,跑几个小时以后还要处理前后端、浏览器、数据库、服务重启和测试失败,swe-bench榜单无法真正衡量复杂长程任务尤其自闭环的能力。

补充一个关于技术栈的思考,为什么是Java+Python+React?

我的思考是,一个技术栈合不合适,得结合时代、产品形态以及它想解决什么问题来看。

早些年在IDEA里写代码,敲几个字母,IDE自动推荐方法名,那时更多是传统代码补全,跟今天讲的AICoding没啥关系。

后来GitHub Copilot、Aone Copilot这类IDE插件出现,开始能够一次补全几行甚至一整段代码。再往后,对话式侧边栏进入IDE,AI才从代码补全扩展到理解上下文、连续对话和修改大量代码文件。这个阶段的产品,本身就是混合技术栈。像VSCode插件以TypeScript为主,IDEA插件则会大量使用Kotlin、Java和IntelliJ原生组件,模型推理及部分Agent能力放在云端。

之后出现了Cursor、Qoder这种更偏AI原生编辑器的产品。Cursor直接基于Fork VS Code,桌面端使用Electron和TypeScript,也在代码库同步等性能敏感的地方使用Rust。Qoder则是Fork VS Code加Go后端,后端负责Agent编排、知识引擎和多模型调用。

再往后是ClaudeCode和Codex这种terminal-first的CodingAgent。它们最初都把终端作为主要入口,围绕本机文件、Git、Shell、进程、流式响应、权限和沙箱展开。ClaudeCode主要来自TypeScript/Bun体系,现在以原生可执行文件分发;CodexCLI则主要使用Rust。

这些选择其实都很好理解。Rust适合独立二进制、系统控制和本地沙箱,TypeScript/Bun开发效率高,Node工具生态也很成熟。对于一个主要运行在程序员本机、需要频繁操作文件和命令行的CodingAgent,这些都是非常自然的选择。

不过,随着模型能力提升,AICoding处理的事情也在发生变化。

一开始可能只生成一行代码,后来可以修改一个文件,再后来开始处理跨文件任务,现在可以给AI一个线上Trace,一份需求文档,甚至只是一个网址,让它自己分析bug、理解用户诉求、拆解需求、编写代码、运行测试并整理交付结果。

代码补全当然仍然需要非常低的延迟,局部修改也很适合在IDE里完成。但是对于需要处理几十个文件、持续几十分钟甚至几个小时的任务,用户可能不需要一直坐在电脑前看着它运行。

这时候大家更关心的是另一组问题:执行中断后能不能继续,服务重启后状态是否还在,Agent达到轮数上限后已经完成的工作能不能保留,多个Agent的结果如何组合,权限请求怎么等待和恢复,以及系统最后如何证明任务确实完成了。

用户群体也可能慢慢从程序员扩展到产品、测试、运营和其他专业角色,交互终端不再局限于专业IDE和终端命令行,浏览器和手机也希望能承担查看进度、回答问题、批准操作和验收结果的工作。

ZhikunCode采用Java、Python和React,主要是基于这种目标做的设计。

Java负责长期运行的控制,包括Run、Session、权限、工具事务、检查点、并发Agent、持久交互和异常恢复;Python则负责浏览器自动化以及变化比较快的能力扩展,毕竟Python包太丰富了;React提供浏览器界面,让系统既可以在本机使用,也可以部署到服务器,并通过电脑或手机访问。

如果zhikuncode的目标只是做一个轻量的本地CLI,那肯定选择Rust、Go或TypeScript,甚至Python也是可选项。但如果目标是一套需要长时间运行、多人访问、状态持久化、权限控制和过程审计的CodingEngine,Java也有它更适合的地方。

根据我十多年的了解,阿里、蚂蚁以及很多大型企业都是Java技术栈,现有的服务治理、数据库、中间件、监控、权限和运维体系都对Java很友好,zhikuncode可以最低成本接入。

Cursor首先是一个AI编辑器,Codex和ClaudeCode最初主要面向程序员本地终端场景,而ZhikunCode从一开始考虑的就是企业云端服务化部署、多人协同、支持长时间任务和多终端访问。

我们选择不同的技术栈,更多是因为产品边界、历史路径和目标场景不同。Java、Rust、Go、TypeScript和Python在Agent系统里都有各自适合承担的部分,最终还是要看这套系统的目的地在哪里。

七、谜底就在谜面上

最后聊一下,一个人怎么可能做出一个能和 Codex 掰手腕的Coding工具呢?

谜底就在谜面上:因为一个人。

不是说一个人比大厂团队还厉害,模型、算力、数据和产品生态,一个人不可能跟 OpenAI 团队比,想说的是另外一件事:

因为一个人,所以既是产品经理,也是开发者,也是测试,还是 zhikuncode 最重度的用户。中间没有需求传递,也没有决策链。用的时候发现哪里不对,几分钟后就改好了。而且我是用 zhikuncode 开发 zhikuncode,一个产品的产出,就是这个产品本身。zhikuncode写代码、改代码、跑测试、修自己,下一轮再继续参与开发自己,这个反馈循环链条短到离谱;

因为一个人,没有知识库团队,也没有模型团队等可以帮忙,很多事情没办法靠外部资源兜底,只能向内求解。我没精力为每种任务都提前写一套规则,也不可能遇到一个场景就加一个专用功能,遇到一个badcase就写一个ifelse。最后只能老老实实从最底层啃最难的问题:代码怎么读,工具怎么调,状态怎么留,任务失败以后怎么继续,模型说完成到底算不算完成;

因为一个人,而且是业余时间,没有排期倒逼,也没有必须在某个日期上线什么功能的压力。我经常一个方案想好几天,迟迟不写代码,最后觉得不该做,自己把它否了,就当从来没有这个需求。有时代码已经写完,自测发现方向有问题,重新设计。或者上线一个功能后,发现这个功能价值没那么大,反而带来了其他的风险,那就回滚。沉没成本反正是自己的,无所谓了。

因为一个人,整个架构不需要划分责任,上下文有问题、工具有问题、Agent 有问题、测试有问题,全都是我一个人的问题,所以每次都是考虑全局最优解。每个模块各自做到局部最优,最后拼出来的东西反而很难是最优,对于AICoding这种产品来说,更得全局考虑,因为这是一个极度高耦合的系统。

八、未来

AI 时代有句话:只要你学得够慢,你就不用学了,因为很快就过时了。

Prompt、Skill、Context、Memory、小龙虾、Agent、Harness、Loop、Goal、Graph,很多概念过时的速度甚至超过学习的速度,随着模型的不断升级,今天很多花大力气做的事情,需要推翻重来甚至需要废弃掉。claudecode负责人说他们因为模型升级删掉了80%的提示词,最终效果反而提升了。

但Coding 不一样。

代码是模型跟我们世界交互的元语言,我相信代码能力是可以穿越AI周期的存在。

我从来没为zhikuncode写过一行办公相关的代码,但是我老婆可以用它来读word改word,制作教学课件ppt,最终专业度甚至比腾讯workbuddy还要好很多,就是因为背后是天花板足够高的Coding能力——《zhikuncode生成word和ppt场景碾压腾讯的WorkBuddy》https://ata.atatech.org/articles/12020732004

一句话生成电脑桌面app:

原文视频

三句话生成一个微信,视频等我晚点找俩手机录个屏

九、为什么免费开源

我曾在无数个深夜里coding,周末也基本都在coding,开车的时候会把电脑放副驾驶让它coding,等红绿灯的间隙给它下指令,送女儿上英语课舞蹈课等待的时候也在coding,吃饭的时候电脑也在跑,如果你曾周末在园区看到一个人端着笔记本走路,那大概是我在等它跑coding任务。

十几万块钱其实最不重要的,自己过去十几年的开发经验,重度使用ClaudeCode、Codex、Cursor、Qoder等各类AICoding工具踩过的坑,所有哪些coding工具未曾满足的需求,复刻AI产品vibecoding了几百万行代码的总结,最后都倾注进了zhikuncode,现在已经差不多成熟了,没必要藏着掖着了。

claudecode已经因为安全被封了,codex是真的没有安全问题还是我们没发现还是我们不想发现问题呢?中国天才程序员会陨落吗?

如果zhikuncode被更多人看见使用,把它改成自己需要的样子,甚至成为很多产品的代码引擎(因为一开始它就是云原生的),那我会很开心:https://github.com/zhikunqingtao/zhikuncode/