
ML Model Evaluation & Debugging
Debug ML performance issues with structured evaluation workflows
What You Can Do
Diagnose root causes of model performance failures, select optimal evaluation metrics based on your use case and data characteristics, and design comprehensive evaluation strategies. You'll get systematic workflows for analyzing failure modes, statistical significance testing, threshold optimization, and cross-validation planning—turning vague model problems into actionable fixes.
Features
Systematically identify root causes like data drift, class imbalance, or feature leakage
Choose evaluation metrics aligned with your business goals and data characteristics
Create comprehensive evaluation plans with cross-validation and statistical tests
Diagnose and recommend solutions for imbalanced classification problems
Interpret confusion matrices to uncover specific failure patterns
Find optimal decision thresholds and analyze precision-recall tradeoffs
Select appropriate CV methods for your data and model type
Determine if performance improvements are statistically meaningful
Example Output
Root Cause Diagnosis
- Issue: 95% accuracy but 0.45 F1 score
- Root Cause: Severe class imbalance (99% negative class)
- Evidence: Precision 0.92, Recall 0.29 → model predicts mostly negatives
- Recommendation: Switch to stratified k-fold CV, use F1/AUC-PR metrics, apply class weighting
Evaluation Plan
- Primary metrics: AUC-PR, macro-F1, per-class precision/recall
- Cross-validation: Stratified 5-fold CV (preserves class distribution)
- Baseline: Train naive classifier to compare against
- Statistical test: McNemar's test for comparing model improvements
What's Included
- `SKILL.md`: Core evaluation & debugging skill with decision trees
- Evaluation metric selection checklist:
- Failure mode diagnosis template:
- Cross-validation strategy guide:
- Class imbalance mitigation workflows:
- Statistical significance test reference:
- Confusion matrix interpretation guide:
- Production monitoring recommendations:
Who It's For
- ML/Data Scientists debugging production models
- ML Engineers selecting evaluation metrics
- Model Researchers analyzing failure modes
- Analytics Engineers validating data pipeline models
- ML Ops professionals monitoring model performance
Best For
- Diagnosing unexpected model performance degradation
- Selecting appropriate evaluation metrics for your use case
- Analyzing failure modes in classification or regression
- Optimizing decision thresholds and precision-recall tradeoffs
- Planning comprehensive evaluation strategies for new models







