DSH Arena — 同一模型,三个 harness

同一份 26KB 需求文档、同一个模型、出厂默认配置、独立容器与独立数据库。三个 coding agent 各自把它做成了一个手机端 App 原型。可以直接在下面点。

模型 deepseek-v4-flash 推理 max / xhigh 配置 出厂默认 重复 n=1 run 2026-08-03-r1

读这些数字前必须知道的

  1. n=1,单次观察。同一个 arm 跑两遍的差异可能大于 arm 之间的差异。这里只能说「本次跑中 X 如何」,不能说「X 比 Y 强」。
  2. 「客观探测」这一栏不可靠,仅供参考。三个产物都是 JS 驱动、靠状态机切换界面的 SPA——首屏被开机提醒卡片占据,深层页面要多级交互才能到达,且切换时 URL 往往不变。自动探测穿不透,会系统性低估。真正可信的是左边那个能点的手机框,和各 arm 自己跑的断言数。
  3. 三个 arm 的主交付形态不同。Claude Code 与 Codex 以 Web 原型为主交付,dsh 以 iOS SwiftUI 工程为主交付、另建了一个等价 Web 原型用于点击验证。这里展示的都是各自的 Web 产物。
  4. 单轮下发。原始 test case 是两轮(需求文档 → 自主迭代指令),但 dsh 的 headless 与会话续跑互斥(--prompt takes no --resume),无法在同一会话内做第二轮。为使三家同条件,两轮指令合并为一次下发。
  5. Claude Code 多一层协议转换。它经 DeepSeek 的 Anthropic 兼容端点接入,另两个走原生协议。这一层在 tool calling 与 reasoning 透传上可能有损失,它与另两者的差异不能纯归因为 harness。
  6. 需求文档里「能在 Xcode build」一条,三个 arm 在 Linux 容器内均无法真实验证,统一记为不适用。三家都各自如实声明了这一点。
  7. 耗时与产出必须成对读——各 arm 自行决定何时收尾,质量脱离成本没有意义。token 只有 Codex 会输出统计,另两个未报。

加载中…