
Databricks ETL Pipeline Architect
Design and optimize production Databricks ETL pipelines
What You Can Do
You can design, build, and optimize production-grade Databricks ETL pipelines that handle large-scale data transformations reliably. Get architectural guidance on pipeline design patterns, performance tuning strategies, data quality frameworks, and troubleshooting approaches that follow Databricks and Apache Spark best practices.
Features
Create scalable, maintainable ETL structures using Delta Lake, medallion patterns, and incremental processing
Identify and fix inefficient transformations, optimize shuffle operations, and tune cluster configurations for your workload
Implement validation rules, schema enforcement, anomaly detection, and data freshness monitoring
Design retry logic, idempotency patterns, dead letter queues, and failure recovery strategies
Analyze transformation logic for correctness, performance, and maintainability across notebooks and jobs
Investigate pipeline errors using logs, metrics, and execution plans to identify root causes and solutions
Reduce compute spend through job clustering, auto-scaling tuning, caching strategies, and resource-efficient code patterns
Integrate Kafka, APIs, cloud storage, and databases with proper error handling and schema evolution
Example Output
Pipeline Design Recommendation:
Design a three-layer medallion architecture:
- Bronze: Raw data ingestion with schema validation
- Silver: Cleaned, deduplicated data with data quality checks
- Gold: Business-ready aggregations for analytics
Performance Diagnosis:
Identified shuffle bottleneck in join operation:
- Current: 45-minute runtime for daily job
- Issue: Broadcasting large dimension table (8GB) instead of smaller fact table
- Solution: Reverse join order + partition pruning
- Expected: 8-minute runtime (82% improvement)
Data Quality Implementation:
from great_expectations.datasource import PandasDatasource
Validation rules:
- No NULL values in customer_id (required)
- Transaction amount > 0 (range check)
- Created_date ≤ today (temporal check)
- Duplicate detection on (order_id, line_item)
What's Included
- SKILL.md: Complete Databricks ETL architecture and optimization guide
- Pipeline Design Template: Medallion pattern boilerplate with Delta Lake configuration
- Spark Tuning Checklist: Step-by-step performance diagnostic workflow
- Data Quality Framework: Reusable validation patterns and monitoring SQL
- Error Handling Patterns: Retry logic, idempotency, and failure recovery code samples
- Cost Optimization Worksheet: Analysis template for cluster sizing and job costing
- Troubleshooting Decision Tree: Flowchart for diagnosing common pipeline failures
Who It's For
- Data Engineers — Building and maintaining ETL pipelines at scale
- Analytics Engineers — Designing data models and transformation logic
- ETL Developers — Transitioning from traditional platforms to Databricks
- Data Platform Architects — Designing enterprise data infrastructure
- Solutions Architects — Advising customers on Databricks best practices
Best For
- Designing scalable ETL pipelines from scratch
- Optimizing underperforming or slow-running jobs
- Implementing comprehensive data quality checks and monitoring
- Troubleshooting pipeline failures and debugging Spark errors
- Migrating legacy ETL workloads to Databricks with performance targets







