DSH Arena — 同一模型,三个 harness
同一份 26KB 需求文档、同一个模型、出厂默认配置、独立容器与独立数据库。三个 coding agent 各自把它做成了一个手机端 App 原型。可以直接在下面点。
模型 deepseek-v4-flash
推理 max / xhigh
配置 出厂默认
重复 n=1
run 2026-08-03-r1
逐页面对比
同一视口(390×844 @2x)、同一时机、禁用动画下截取。点任意一张看大图。到不了的页面会写明原因,不用别的页面顶替。
注意:为保证截图可复现,所有 CSS 动画与过渡都被禁用。纯靠 animation 绘制的元素(如某些声波)因此不可见——这对该实现不利,但三家条件一致。动效要看实机,不能只看这张表。
读这些数字前必须知道的
- n=1,单次观察。同一个 arm 跑两遍的差异可能大于 arm 之间的差异。这里只能说「本次跑中 X 如何」,不能说「X 比 Y 强」。
- 「客观探测」这一栏不可靠,仅供参考。三个产物都是 JS 驱动、靠状态机切换界面的 SPA——首屏被开机提醒卡片占据,深层页面要多级交互才能到达,且切换时 URL 往往不变。自动探测穿不透,会系统性低估。真正可信的是左边那个能点的手机框,和各 arm 自己跑的断言数。
- 三个 arm 的主交付形态不同。Claude Code 与 Codex 以 Web 原型为主交付,dsh 以 iOS SwiftUI 工程为主交付、另建了一个等价 Web 原型用于点击验证。这里展示的都是各自的 Web 产物。
- 单轮下发。原始 test case 是两轮(需求文档 → 自主迭代指令),但 dsh 的 headless 与会话续跑互斥(
--prompt takes no --resume),无法在同一会话内做第二轮。为使三家同条件,两轮指令合并为一次下发。
- Claude Code 多一层协议转换。它经 DeepSeek 的 Anthropic 兼容端点接入,另两个走原生协议。这一层在 tool calling 与 reasoning 透传上可能有损失,它与另两者的差异不能纯归因为 harness。
- 需求文档里「能在 Xcode build」一条,三个 arm 在 Linux 容器内均无法真实验证,统一记为不适用。三家都各自如实声明了这一点。
- 耗时与产出必须成对读——各 arm 自行决定何时收尾,质量脱离成本没有意义。token 只有 Codex 会输出统计,另两个未报。
加载中…