Comparison builder

default

afi / afi · cli / proxy / Default profile / Anthropic · sonnet 5 high / afi 0.30.0

P50 across 2 scored trials

2 recorded; malformed and unscored trials remain inspectable but do not participate in aggregate metrics

Recall17.5%
Model-judged precisionN/A
Total bill$0.7268
Duration5m 11s

Per-metric distributions

Exact Type-7 percentiles over complete scored samples; partial scored samples remain unavailable; non-scored trials are disclosed below

Recall 2/2 scored trials measured
P50 17.5% P95 19.8%
Model-judged precision 0/2 scored trials measured
N/A no qualified judge decided these findings, so only locality was measured
N/A · 0 measured
Total bill 2/2 scored trials measured
P50 $0.7268 P95 $0.9190
Duration 2/2 scored trials measured
P50 5m 11s P95 5m 20s
MetricAvailabilityMeasuredMinP50P95Max
Findings
finding_count
Measured 2/233.53.954
Defects found
found
Measured 2/233.53.954
Defects missed
missed
Measured 2/21616.516.9517
Unkeyed findings
unkeyed
Measured 2/20000
Intended findings
intended
Measured 2/20000
Recall
recall
Measured 2/215%17.5%19.8%20%
Model-judged precision
precision
N/A
no qualified judge decided these findings, so only locality was measured
0/2----
F1
f1
N/A
no qualified judge decided these findings, so only locality was measured
0/2----
Tier 1 recall
tier_1
Measured 2/233.3%33.3%33.3%33.3%
Tier 2 recall
tier_2
Measured 2/214.3%14.3%14.3%14.3%
Tier 3 recall
tier_3
Measured 2/216.7%25%32.5%33.3%
Tier 4 recall
tier_4
Measured 2/20%0%0%0%
Security recall
category_security
Measured 2/20%0%0%0%
Defect recall
category_defect
Measured 2/215.4%19.2%22.7%23.1%
Maintainability recall
category_maintainability
Measured 2/20%0%0%0%
Performance recall
category_performance
Measured 2/233.3%33.3%33.3%33.3%
Median anchor distance
anchor_median
Measured 2/20000
Worst anchor distance
anchor_max
Measured 2/20000
Refusals a judge overturned
anchor_missed
Not recorded
no judging pass has looked beyond the scored slack
0/2----
Review bill
review_bill
Measured 2/2$0.5133$0.7268$0.9190$0.9403
Judge bill
judge_bill
N/A
no qualified judge decided these findings, so only locality was measured
0/2----
Total bill
total_bill
Measured 2/2$0.5133$0.7268$0.9190$0.9403
Tokens
tokens
Measured 2/2119880228394.5326057.55336909
Duration
seconds
Measured 2/25m 1s5m 11s5m 20s5m 21s
Carried findings
carried
Not recorded
the reviewer reported no reuse figure
0/2----

Compatibility identity

Any change to these inputs creates another group

Reviewer
afi
Reviewer tool
afi · cli
Subject
proxy
Reviewed SHA
9b51f95ef609a219e211e37b082cd2e6913190e0
Key fingerprint
bd331c0b144e
Settings fingerprint
9e4eff5e45f8
Configuration ID
config-0fac4d008d696fd2
Build
afi 0.30.0 / b0f313c0b59a66ecc7612396dc8db0ea5da13a7a
Harness
bench 1 / 631c4107752a97104719622800c9815e030613cf dirty
Adapter
afi 1 / sha256:a1a935298956020ee6d767a756847abb4c00694c88c2eb80d454886ebc4acf8c
Build ID
build-33906dcd701a0660
Cohort ID
cohort-07363c4dd57b37b6
Comparison ID
comparison-9b0e1ce26d2e951b

Trials

Select View evidence to inspect one run; the static table is paginated at 100 trials

Details
afi
afi · cli
default Default profile · Anthropic · sonnet 5 high
proxy15%N/A3 scoredView evidence
afi
afi · cli
default Default profile · Anthropic · sonnet 5 high
proxy20%N/A4 scoredView evidence
benchee benchee-dashboard-1 built from 10f4ec58 Static benchmark evidence ·