INNER CODE UNIT · Python
generate_benchmark_json
wgpsec/AboutSecurity · scripts/bench-skill.py:247
def generate_benchmark_json(
skill_name: str,
skill_path: str,
all_runs: list[dict],
model: str,
) -> dict:
"""Generate benchmark.json from collected run data."""
configs = {}
for run in all_runs:
config = run["configuration"]
if config not in configs:
configs[config] = []
configs[config].append(run)
# Calculate summary stats per config
run_summary = {}
for config, runs in configs.items():
pass_rates = [r["result"]["pass_rate"] for r in runs]