@@ -429,7 +429,9 @@ def _generate_summary(self) -> BenchmarkSummary:
429429
430430 # Cascade metrics
431431 direct_routed = sum (1 for r in valid_results if r .direct_routed )
432- drafter_accepted = sum (1 for r in valid_results if r .routing_strategy == "cascade" and r .accepted )
432+ drafter_accepted = sum (
433+ 1 for r in valid_results if r .routing_strategy == "cascade" and r .accepted
434+ )
433435 escalated = sum (1 for r in valid_results if r .verifier_rejected )
434436 cascade_total = drafter_accepted + escalated
435437
@@ -447,14 +449,18 @@ def _generate_summary(self) -> BenchmarkSummary:
447449 p95_latency = latencies [p95_idx ]
448450 cascadeflow_latencies = [r .cascadeflow_latency_ms for r in valid_results ]
449451 avg_cascadeflow_latency = (
450- sum (cascadeflow_latencies ) / len (cascadeflow_latencies ) if cascadeflow_latencies else 0.0
452+ sum (cascadeflow_latencies ) / len (cascadeflow_latencies )
453+ if cascadeflow_latencies
454+ else 0.0
451455 )
452456
453457 # Quality metrics
454458 correct = sum (1 for r in valid_results if r .is_correct )
455459 accuracy = (correct / len (valid_results ) * 100 ) if valid_results else 0.0
456460
457- drafter_results = [r for r in valid_results if r .routing_strategy == "cascade" and r .accepted ]
461+ drafter_results = [
462+ r for r in valid_results if r .routing_strategy == "cascade" and r .accepted
463+ ]
458464 drafter_correct = sum (1 for r in drafter_results if r .is_correct )
459465 drafter_accuracy = (
460466 (drafter_correct / len (drafter_results ) * 100 ) if drafter_results else 0.0
@@ -468,9 +474,7 @@ def _generate_summary(self) -> BenchmarkSummary:
468474
469475 direct_results = [r for r in valid_results if r .direct_routed ]
470476 direct_correct = sum (1 for r in direct_results if r .is_correct )
471- direct_accuracy = (
472- (direct_correct / len (direct_results ) * 100 ) if direct_results else 0.0
473- )
477+ direct_accuracy = (direct_correct / len (direct_results ) * 100 ) if direct_results else 0.0
474478
475479 # Token usage
476480 total_input = sum (r .tokens_input for r in valid_results )
@@ -483,7 +487,9 @@ def _generate_summary(self) -> BenchmarkSummary:
483487 failed_tests = failed ,
484488 drafter_accepted = drafter_accepted ,
485489 escalated_to_verifier = escalated ,
486- acceptance_rate_pct = (drafter_accepted / cascade_total * 100 ) if cascade_total > 0 else 0.0 ,
490+ acceptance_rate_pct = (
491+ (drafter_accepted / cascade_total * 100 ) if cascade_total > 0 else 0.0
492+ ),
487493 escalation_rate_pct = (escalated / cascade_total * 100 ) if cascade_total > 0 else 0.0 ,
488494 direct_routed = direct_routed ,
489495 direct_routing_pct = (direct_routed / successful * 100 ) if successful > 0 else 0.0 ,
@@ -524,9 +530,7 @@ def _print_summary(self, summary: BenchmarkSummary) -> None:
524530 print (
525531 f" Escalated: { summary .escalated_to_verifier } ({ summary .escalation_rate_pct :.1f} %)"
526532 )
527- print (
528- f" Direct Routed: { summary .direct_routed } ({ summary .direct_routing_pct :.1f} %)"
529- )
533+ print (f" Direct Routed: { summary .direct_routed } ({ summary .direct_routing_pct :.1f} %)" )
530534
531535 print ("\n COST ANALYSIS:" )
532536 print (f" Total Cost: ${ summary .total_cost :.6f} " )
0 commit comments