
Databricks Query Optimization & Pipeline Debugging
Optimize Databricks queries and resolve pipeline issues
What You Can Do
You can optimize Databricks SQL queries for performance, debug pipeline failures with root-cause analysis, and recommend cluster configurations. Claude analyzes execution plans, identifies bottlenecks, and provides concrete refactoring suggestions to reduce query runtime and lower infrastructure costs.
Features
Analyze execution plans to identify expensive operations, data shuffles, and scanning inefficiencies
Refactor queries with partitioning strategies, index hints, and join optimization techniques
Trace pipeline failures through logs, identify data quality issues, and recommend fixes
Right-size worker nodes, adjust shuffle partitions, and optimize memory allocation for your workload
Map data flow across jobs and notebooks to identify bottlenecks and failure propagation
Compare query performance before/after optimization and quantify resource savings
Identify fragmented data files, recommend OPTIMIZE/VACUUM operations, and analyze table statistics
Design SLAs for pipelines and configure thresholds to catch performance degradation early
Example Output
Input: Slow query execution plan with 12 shuffles
Output:
-- Optimized query with pre-filter and join reordering
SELECT customer_id, SUM(amount)
FROM sales
WHERE year = 2026 -- Filter first
JOIN customers USING(customer_id)
GROUP BY customer_id
Execution time: 45s → 8s | Shuffle operations: 12 → 2 | Estimated savings: 92% reduction
What's Included
- SKILL.md: Complete Claude skill with workflows for query optimization, pipeline debugging, and cluster tuning
- Query Analysis Checklist: Step-by-step guide for diagnosing slow queries
- Optimization Templates: Reusable SQL patterns for joins, aggregations, and window functions
- Debug Workflow: Decision tree for pipeline failure diagnosis with remediation steps
- Configuration Reference: Cluster sizing formulas and parameter tuning guide
Who It's For
- Data Engineers — Optimize ETL pipeline performance and reduce cloud spending
- Analytics Engineers — Tune SQL queries powering dashboards and reports
- Database Administrators — Manage cluster resources and enforce performance standards
- Data Scientists — Accelerate feature engineering pipelines on large datasets
- MLOps Engineers — Debug training data pipelines and optimize model training workflows
Best For
- Diagnosing slow Databricks queries and recommending optimizations
- Debugging failed Delta Lake jobs with detailed error analysis
- Right-sizing Databricks clusters and predicting cost savings
- Analyzing execution plans to identify data shuffles and scanning bottlenecks
- Optimizing SQL patterns for Databricks-specific features (Photon, Delta cache, Z-order)







