q00/ouroboros · 2026 年收录
【开源自荐】Ouroboros:先把需求问清楚再让 AI 写代码的 Agent OS,顺便不让它「刷分」
Ouroboros 是一个开源的本地优先 Agent OS,核心主张是两件事:意图没想清楚之前,不让 AI 开始写代码;判分断言不进执行 agent 的 prompt,让它没法靠刷分过关。它坐在 Claude Code、Codex CLI
https://github.com/q00/ouroboros
被谁收录过
- [开源推荐] Ouroboros:一个不让 AI 看着答案写代码的 Agent OS 2026-08-09
- 【开源自荐】Ouroboros:先把需求问清楚再让 AI 写代码的 Agent OS,顺便不让它「刷分」 2026-08-09
投稿原文(节选)
项目地址 https://github.com/Q00/ouroboros 类别 人工智能 项目标题 一个不让 AI 看着答案写代码的 Agent OS 项目描述 AI 写不好代码,很多时候不是模型不够聪明,而是需求本身就是模糊的:你说「做个任务管理 CLI」,它就自己猜数据模型、存储方式和优先级规则,等你 review 到第三个文件才发现方向不对,只能返工。Ouroboros 是一个本地优先的 Agent OS,它坐在 Claude Code、Codex CLI 等 13 个运行时前面,先用苏格拉底式提问把你自己都没意识到的隐藏假设问出来,凝结成一份不可变规约,再去执行和自动验收。 亮点 和同类「AI 编程工作流」项目相比,它最不一样的地方是 把「什么时候可以开始写代码」和「什么时候可以停」都变成了数字,而不是感觉 : 访谈不靠「差不多了」结束,靠一个阈值。 模糊度被量化成加权清晰度的反值 Ambiguity = 1 - Σ(clarity × weight) ,模糊度高于 0.2 会挡住规约生成——是挡住,不是锁死;绕过它的办法是显式传入强制(force),屏幕上一直摆着这个选项。演化循环那头,最近两代的本体相似度 ≥ 0.95 会判定收敛,但那不是唯一出口——停滞、反复出现的同类反馈、以及 30 代预算耗尽同样会让循环停下来。两道数学关卡,一个理念:没想清楚之前不要写,没稳定之前不要停。 评估分层递进,先便宜后贵。 Mechanical(免费、确定性检查)→ Semantic → Multi-Model Consensus。能在第一层否掉的,绝不送去烧 LLM 判分的钱。 但要说清楚:三层齐跑只在直接评估这条路径上成立。演化循环里实际只跑 Semantic 一层——第一层默认关着,第三层在那条路径上是写死关掉的。 专门防 AI「刷分」。 当一条验收标准定义了自己的验证命令或期望输出时,那些值不会进执行 agent 的契约块,也没有开关能把它放回去(项目级的 lint/test 命令是 故意 给它的——藏起来的是那条标准的答案);失败信息里的断言字符串会被一并过滤,失败时它拿到的是根据工具调用轨迹重建的提示,而不是答案本身。(脱敏是逐字的,只覆盖五种编码,断言换个形状仍会漏——这一条开着 issue,没有藏着说已解决。)因为一旦 agent 看得见断言,糊弄断言永远比真正实现需求更省力。 失败不是终点。 被评估拒绝的结果会自动进入有预算上限的演化循环,下一代的力气集中在没通过的验收标准上——代码里把标准切成 active 和 frozen 两组,互不重叠。要说清楚的是,冻结是把力气集中到该做的地方,不是「已经过的从此不会再挂」:另有一个回归检测器专门看上一代通过、这一代却挂掉的标准,而且还有一个不冻结任何标准的对照组。循环还带震荡检测和等级回退检测,专门识破「分数在两代之间来回跳」的假收敛。 本地优先、MIT 协议,中文 README 齐全( README.zh-CN.md )。 示例代码 # 安装:一条命令,自动识别本机可用的 AI 编码运行时 curl -fsSL https://raw.githubusercontent.com/Q00/ouroboros/main/scripts/install.sh | OUROBOROS_INSTALL_REF=hellogithub bash 装完后打开你的 AI 编码 agent,直接开始访谈: > ooo interview "I want to build a task management CLI" 它不会立刻开始写代码,而是先反问:数据存哪里、命令边界到哪、任务 ID 怎么指定……把这些答完,才会生成规约并进入执行。 设计细节可以直接读这两处:模糊度评分在 README.zh-CN.md 的「模糊度分数」一节,防刷分和收敛循环的完整 RFC 在 issue #1917 。 中文逐章指南 https://ouroboros.page/learn/zh/ 安装、访谈、规约、执行、评估、演化、现有项目、故障排查、术语表、架构,一共 13 页,和英文版章节齐平。里面的每个数字都注了出处文件,你可以直接对着源码核。其中「故障排查」那章有 -32000 启动失败的处理,英文版目前还没有。