weather-card-benchmark

观察

构建数据集过程中的观察。全部是描述性测量,不是质量评判;每条都指向产生它的原始数据。单一提示族、小 N——当信号看,别当结论。

8 条观察更新于 2026年7月18日
01

同一个模型,经 harness 画出的卡不一样

同模型同 effort,api 直连输出与 CLI harness 输出之间的跨臂相似度只有 0.60-0.69,远低于各自臂内的自一致性。harness(系统提示、工具循环、文件交付)是作画的真实变量,不是透明管道。

跨臂相似度0.60-0.69
注意在 gpt 家族上测得;每 config N=4。
02

effort 放大输出体量——fable-5 最高 14 倍

经 Claude Code harness,effort 从 low 拉到 max,产出卡片体量约放大 14 倍(fable-5)、12 倍(opus-4.8)、9 倍(sonnet-5)。这个旋钮真实改变了画多少东西。

fable-5 low→max~14x
opus-4.8 low→max~12x
sonnet-5 low→max~9x
注意是输出体量不是质量;单一提示族。
03

有些模型的 effort 旋钮拧了没反应

haiku-4.5(Claude Code harness)和 grok-4.5(官方 api)在我们跑过的所有 effort 档位上输出体量无可辨差异。同一官方 api 上的 grok-4.3 对旋钮有响应。

无响应模型haiku-4.5, grok-4.5
注意基于体量的观察;N=4。
04

官方 gpt api 不存在 "minimal" 档

官方 /responses 对 effort=minimal 一律 400(我们探测过的每个 gpt 模型)。代理或 harness 通道里出现的 "minimal" 档是通道侧映射,不是官方档位。

官方 minimal400 (all gpt models probed)
注意行为探测(接受/拒绝)所得,2026-07-18。
05

"max" 档是 gpt-5.6 系独占

官方 api 上 effort=max 仅 gpt-5.6-sol/terra/luna 接受,更早的 gpt 模型全部 400。

接受 max 的模型gpt-5.6-sol / terra / luna
注意行为探测所得,2026-07-18。
06

官方 api 输出比同模型代理通道大 5-8 倍

同一 gpt 模型同一 effort,官方 api 产出的卡片 HTML 是反代 dev 通道的 5-8 倍。通道本身实质性改变产出——这是本数据集区分通道等级的原因之一。

体量比5-8x
注意dev 通道数据不发布;该对比塑造了通道分级政策。
07

在 agentic harness 里干活是一条独立的能力轴

多个上一代模型 api 直连正常作答,但在同一订阅通道的 opencode agentic harness 里直接 500。会答 api 不等于会在工具循环里干活。

现象api ok / harness 500
注意无法完全排除网关侧因素。
08

kimi-k3 在质性提示变体上思考量 ~10 倍

在 P-q(质性)提示变体上,kimi-k3 的思考量约为 P-min 的 10 倍——我们观察到的最大变体敏感度。

P-q vs P-min 思考量~10x
注意单模型、dev 级通道上的观察;待合格通道复核。