INNER CODE UNIT · Python

generate_benchmark_json

wgpsec/AboutSecurity · scripts/bench-skill.py:247

def generate_benchmark_json(
    skill_name: str,
    skill_path: str,
    all_runs: list[dict],
    model: str,
) -> dict:
    """Generate benchmark.json from collected run data."""
    configs = {}
    for run in all_runs:
        config = run["configuration"]
        if config not in configs:
            configs[config] = []
        configs[config].append(run)

    # Calculate summary stats per config
    run_summary = {}
    for config, runs in configs.items():
        pass_rates = [r["result"]["pass_rate"] for r in runs]

View source record →

📰 Research Paper
Loading…
⏳ Fetching content…