同一个模型,经 harness 画出的卡不一样
同模型同 effort,api 直连输出与 CLI harness 输出之间的跨臂相似度只有 0.60-0.69,远低于各自臂内的自一致性。harness(系统提示、工具循环、文件交付)是作画的真实变量,不是透明管道。
构建数据集过程中的观察。全部是描述性测量,不是质量评判;每条都指向产生它的原始数据。单一提示族、小 N——当信号看,别当结论。
同模型同 effort,api 直连输出与 CLI harness 输出之间的跨臂相似度只有 0.60-0.69,远低于各自臂内的自一致性。harness(系统提示、工具循环、文件交付)是作画的真实变量,不是透明管道。
经 Claude Code harness,effort 从 low 拉到 max,产出卡片体量约放大 14 倍(fable-5)、12 倍(opus-4.8)、9 倍(sonnet-5)。这个旋钮真实改变了画多少东西。
haiku-4.5(Claude Code harness)和 grok-4.5(官方 api)在我们跑过的所有 effort 档位上输出体量无可辨差异。同一官方 api 上的 grok-4.3 对旋钮有响应。
官方 /responses 对 effort=minimal 一律 400(我们探测过的每个 gpt 模型)。代理或 harness 通道里出现的 "minimal" 档是通道侧映射,不是官方档位。
官方 api 上 effort=max 仅 gpt-5.6-sol/terra/luna 接受,更早的 gpt 模型全部 400。
同一 gpt 模型同一 effort,官方 api 产出的卡片 HTML 是反代 dev 通道的 5-8 倍。通道本身实质性改变产出——这是本数据集区分通道等级的原因之一。
多个上一代模型 api 直连正常作答,但在同一订阅通道的 opencode agentic harness 里直接 500。会答 api 不等于会在工具循环里干活。
在 P-q(质性)提示变体上,kimi-k3 的思考量约为 P-min 的 10 倍——我们观察到的最大变体敏感度。