All sessions

nine models, three trials each, bare agent

invalid

Every model on the same subject, same harness, three trials each so the spread is measured rather than assumed / Started 31 Aug 2026, 11:12

Started
Completed
Planned27
Produced27
Missing0

Data problems

Session validation and membership diagnostics remain visible beside the plan

session-run-state-mismatch

session records 'failed', but the linked run lifecycle records 'completed'

afi/deepseek-v4-pro/20260831T111226Z

Plan completion

Every requested trial remains visible, including runs that produced no record

SequenceReviewerRun identityLifecycleReasonInspect run
1afiafi/gpt-oss-120b/20260831T111204Z completed-View evidence
2afiafi/gpt-oss-120b/20260831T111205Z completed-View evidence
3afiafi/gpt-oss-120b/20260831T111206Z completed-View evidence
4afiafi/qwen3-coder-30b/20260831T111207Z failed-View evidence
5afiafi/qwen3-coder-30b/20260831T111208Z failed-View evidence
6afiafi/qwen3-coder-30b/20260831T111209Z failed-View evidence
7afiafi/glm-5.3-flash/20260831T111210Z completed-View evidence
8afiafi/glm-5.3-flash/20260831T111211Z completed-View evidence
9afiafi/glm-5.3-flash/20260831T111212Z completed-View evidence
10afiafi/deepseek-v4-flash/20260831T111213Z completed-View evidence
11afiafi/deepseek-v4-flash/20260831T111214Z completed-View evidence
12afiafi/deepseek-v4-flash/20260831T111215Z completed-View evidence
13afiafi/kimi-k2.7-code/20260831T111216Z completed-View evidence
14afiafi/kimi-k2.7-code/20260831T111217Z completed-View evidence
15afiafi/kimi-k2.7-code/20260831T111218Z completed-View evidence
16afiafi/glm-5.2/20260831T111219Z completed-View evidence
17afiafi/glm-5.2/20260831T111220Z completed-View evidence
18afiafi/glm-5.2/20260831T111221Z completed-View evidence
19afiafi/glm-5.3/20260831T111222Z completed-View evidence
20afiafi/glm-5.3/20260831T111223Z completed-View evidence
21afiafi/glm-5.3/20260831T111224Z completed-View evidence
22afiafi/deepseek-v4-pro/20260831T111225Z completed-View evidence
23afiafi/deepseek-v4-pro/20260831T111226Z failed-View evidence
24afiafi/deepseek-v4-pro/20260831T111227Z completed-View evidence
25afiafi/grok-4.5/20260831T111228Z completed-View evidence
26afiafi/grok-4.5/20260831T111229Z completed-View evidence
27afiafi/grok-4.5/20260831T111230Z completed-View evidence

Produced runs

View evidence opens one run detail

Details
afi
afi · cli
default Default profile · xAI · grok 4.5 high
proxy45%N/A9 scoredView evidence
afi
afi · cli
default Default profile · xAI · grok 4.5 high
proxy40%N/A8 scoredView evidence
afi
afi · cli
default Default profile · xAI · grok 4.5 high
proxy40%N/A8 scoredView evidence
afi
afi · cli
default Default profile · DeepSeek · v4 pro high
proxy25%N/A5 scoredView evidence
afi
afi · cli
default Default profile · DeepSeek · v4 pro high
proxy5%N/A1 scoredView evidence
afi
afi · cli
default Default profile · DeepSeek · v4 pro high
proxy60%N/A58 scoredView evidence
afi
afi · cli
default Default profile · Z.AI · glm 5.3 high
proxy5%N/A34 scoredView evidence
afi
afi · cli
default Default profile · Z.AI · glm 5.3 high
proxy0%N/A0 scoredView evidence
afi
afi · cli
default Default profile · Z.AI · glm 5.3 high
proxy40%N/A21 scoredView evidence
afi
afi · cli
default Default profile · Z.AI · glm 5.2 high
proxy20%N/A4 scoredView evidence
afi
afi · cli
default Default profile · Z.AI · glm 5.2 high
proxy15%N/A4 scoredView evidence
afi
afi · cli
default Default profile · Z.AI · glm 5.2 high
proxy15%N/A3 scoredView evidence
afi
afi · cli
default Default profile · Moonshot AI · kimi k2.7 code high
proxy30%N/A6 scoredView evidence
afi
afi · cli
default Default profile · Moonshot AI · kimi k2.7 code high
proxy30%N/A7 scoredView evidence
afi
afi · cli
default Default profile · Moonshot AI · kimi k2.7 code high
proxy45%N/A13 scoredView evidence
afi
afi · cli
default Default profile · DeepSeek · v4 flash high
proxy0%N/A2 scoredView evidence
afi
afi · cli
default Default profile · DeepSeek · v4 flash high
proxy5%N/A2 scoredView evidence
afi
afi · cli
default Default profile · DeepSeek · v4 flash high
proxy0%N/A0 scoredView evidence
afi
afi · cli
default Default profile · Z.AI · glm 5.3 flash high
proxy40%N/A10 scoredView evidence
afi
afi · cli
default Default profile · Z.AI · glm 5.3 flash high
proxy40%N/A8 scoredView evidence
afi
afi · cli
default Default profile · Z.AI · glm 5.3 flash high
proxy30%N/A8 scoredView evidence
afi
afi · cli
default Default profile · Qwen · qwen3 coder 30b a3b instruct high
proxyN/AN/ANot recorded unscoredView evidence
afi
afi · cli
default Default profile · Qwen · qwen3 coder 30b a3b instruct high
proxyN/AN/ANot recorded unscoredView evidence
afi
afi · cli
default Default profile · Qwen · qwen3 coder 30b a3b instruct high
proxyN/AN/ANot recorded unscoredView evidence
afi
afi · cli
default Default profile · OpenAI · gpt oss 120b high
proxy0%N/A0 scoredView evidence
afi
afi · cli
default Default profile · OpenAI · gpt oss 120b high
proxy0%N/A1 scoredView evidence
afi
afi · cli
default Default profile · OpenAI · gpt oss 120b high
proxy0%N/A0 scoredView evidence

Session specification

The committed JSON is shown as data, not interpreted as instructions

{
  "defaults": {
    "effort": "high",
    "key_limit": 2,
    "mode": "agent",
    "pr": "smykla-skalski/cairn#8",
    "subject": "proxy"
  },
  "description": "Every model on the same subject, same harness, three trials each so the spread is measured rather than assumed",
  "name": "nine models, three trials each, bare agent",
  "runs": [
    {
      "label": "gpt-oss-120b",
      "model": "openrouter:openai/gpt-oss-120b",
      "repeat": 3
    },
    {
      "label": "qwen3-coder-30b",
      "model": "openrouter:qwen/qwen3-coder-30b-a3b-instruct",
      "repeat": 3
    },
    {
      "label": "glm-5.3-flash",
      "model": "openrouter:z-ai/glm-5.3-flash",
      "repeat": 3
    },
    {
      "label": "deepseek-v4-flash",
      "model": "openrouter:deepseek/deepseek-v4-flash",
      "repeat": 3
    },
    {
      "label": "kimi-k2.7-code",
      "model": "openrouter:moonshotai/kimi-k2.7-code",
      "repeat": 3
    },
    {
      "label": "glm-5.2",
      "model": "openrouter:z-ai/glm-5.2",
      "repeat": 3
    },
    {
      "label": "glm-5.3",
      "model": "openrouter:z-ai/glm-5.3",
      "repeat": 3
    },
    {
      "label": "deepseek-v4-pro",
      "model": "openrouter:deepseek/deepseek-v4-pro",
      "repeat": 3
    },
    {
      "label": "grok-4.5",
      "model": "openrouter:x-ai/grok-4.5",
      "repeat": 3
    }
  ]
}

Session evidence

Committed specification and session record

record present

Open verified source artifact

Open this path at the exported commit

The artifact is present; its content is available through the verified source link

spec present

Open verified source artifact

Open this path at the exported commit

The artifact is present; its content is available through the verified source link

benchee benchee-dashboard-1 built from 10f4ec58 Static benchmark evidence ·