Comparison builder

default

afi / afi · cli / proxy / Default profile / Google · gemini 3.1 pro preview high / afi 0.30.0

Observed values from 1 scored trial

1 recorded; malformed and unscored trials remain inspectable but do not participate in aggregate metrics

Recall40%
Model-judged precisionN/A
Total bill$0.6895
Duration5m 24s

Per-metric observations

Exact values from the one complete scored sample; unavailable metrics and non-scored trials remain explicit

Recall 1/1 scored trials measured
Observed 40% One complete scored trial
Model-judged precision 0/1 scored trials measured
N/A no qualified judge decided these findings, so only locality was measured
N/A · 0 measured
Total bill 1/1 scored trials measured
Observed $0.6895 One complete scored trial
Duration 1/1 scored trials measured
Observed 5m 24s One complete scored trial
MetricAvailabilityMeasuredMinP50P95Max
Findings
finding_count
Measured 1/18888
Defects found
found
Measured 1/18888
Defects missed
missed
Measured 1/112121212
Unkeyed findings
unkeyed
Measured 1/10000
Intended findings
intended
Measured 1/10000
Recall
recall
Measured 1/140%40%40%40%
Model-judged precision
precision
N/A
no qualified judge decided these findings, so only locality was measured
0/1----
F1
f1
N/A
no qualified judge decided these findings, so only locality was measured
0/1----
Tier 1 recall
tier_1
Measured 1/10%0%0%0%
Tier 2 recall
tier_2
Measured 1/157.1%57.1%57.1%57.1%
Tier 3 recall
tier_3
Measured 1/150%50%50%50%
Tier 4 recall
tier_4
Measured 1/125%25%25%25%
Security recall
category_security
Measured 1/150%50%50%50%
Defect recall
category_defect
Measured 1/146.2%46.2%46.2%46.2%
Maintainability recall
category_maintainability
Measured 1/10%0%0%0%
Performance recall
category_performance
Measured 1/133.3%33.3%33.3%33.3%
Median anchor distance
anchor_median
Measured 1/10000
Worst anchor distance
anchor_max
Measured 1/10000
Refusals a judge overturned
anchor_missed
Not recorded
no judging pass has looked beyond the scored slack
0/1----
Review bill
review_bill
Measured 1/1$0.6895$0.6895$0.6895$0.6895
Judge bill
judge_bill
N/A
no qualified judge decided these findings, so only locality was measured
0/1----
Total bill
total_bill
Measured 1/1$0.6895$0.6895$0.6895$0.6895
Tokens
tokens
Measured 1/112751127511275112751
Duration
seconds
Measured 1/15m 24s5m 24s5m 24s5m 24s
Carried findings
carried
Not recorded
the reviewer reported no reuse figure
0/1----

Compatibility identity

Any change to these inputs creates another group

Reviewer
afi
Reviewer tool
afi · cli
Subject
proxy
Reviewed SHA
9b51f95ef609a219e211e37b082cd2e6913190e0
Key fingerprint
bd331c0b144e
Settings fingerprint
910afc28d427
Configuration ID
config-7ba8a6ad7ff36415
Build
afi 0.30.0 / b0f313c0b59a66ecc7612396dc8db0ea5da13a7a
Harness
bench 1 / 6f7cfea8e46bb1f294790937e3df4d0f867e2135 dirty
Adapter
afi 1 / sha256:a1a935298956020ee6d767a756847abb4c00694c88c2eb80d454886ebc4acf8c
Build ID
build-f86dc4de901a8e9f
Cohort ID
cohort-fdab2adfb8a4bd39
Comparison ID
comparison-9a3d8931bc48d334

Trials

Select View evidence to inspect one run; the static table is paginated at 100 trials

Details
afi
afi · cli
default Default profile · Google · gemini 3.1 pro preview high
proxy40%N/A8 scoredView evidence
benchee benchee-dashboard-1 built from 10f4ec58 Static benchmark evidence ·