SkillsLib.ai

Databricks ETL Pipeline Architect

Design and optimize production Databricks ETL pipelines

3.0(5 reviews)
100+ downloads
Updated Sep 2026

What You Can Do

You can design, build, and optimize production-grade Databricks ETL pipelines that handle large-scale data transformations reliably. Get architectural guidance on pipeline design patterns, performance tuning strategies, data quality frameworks, and troubleshooting approaches that follow Databricks and Apache Spark best practices.

Features

Pipeline architecture design

Create scalable, maintainable ETL structures using Delta Lake, medallion patterns, and incremental processing

Spark performance optimization

Identify and fix inefficient transformations, optimize shuffle operations, and tune cluster configurations for your workload

Data quality frameworks

Implement validation rules, schema enforcement, anomaly detection, and data freshness monitoring

Error handling and resilience

Design retry logic, idempotency patterns, dead letter queues, and failure recovery strategies

SQL and PySpark code review

Analyze transformation logic for correctness, performance, and maintainability across notebooks and jobs

Failure diagnosis

Investigate pipeline errors using logs, metrics, and execution plans to identify root causes and solutions

Cost optimization

Reduce compute spend through job clustering, auto-scaling tuning, caching strategies, and resource-efficient code patterns

Multi-source ingestion patterns

Integrate Kafka, APIs, cloud storage, and databases with proper error handling and schema evolution

Example Output

Pipeline Design Recommendation:

code
Design a three-layer medallion architecture:
- Bronze: Raw data ingestion with schema validation
- Silver: Cleaned, deduplicated data with data quality checks
- Gold: Business-ready aggregations for analytics

Performance Diagnosis:

code
Identified shuffle bottleneck in join operation:
- Current: 45-minute runtime for daily job
- Issue: Broadcasting large dimension table (8GB) instead of smaller fact table
- Solution: Reverse join order + partition pruning
- Expected: 8-minute runtime (82% improvement)

Data Quality Implementation:

code
from great_expectations.datasource import PandasDatasource

Validation rules:
- No NULL values in customer_id (required)
- Transaction amount > 0 (range check)
- Created_date ≤ today (temporal check)
- Duplicate detection on (order_id, line_item)

What's Included

  • SKILL.md: Complete Databricks ETL architecture and optimization guide
  • Pipeline Design Template: Medallion pattern boilerplate with Delta Lake configuration
  • Spark Tuning Checklist: Step-by-step performance diagnostic workflow
  • Data Quality Framework: Reusable validation patterns and monitoring SQL
  • Error Handling Patterns: Retry logic, idempotency, and failure recovery code samples
  • Cost Optimization Worksheet: Analysis template for cluster sizing and job costing
  • Troubleshooting Decision Tree: Flowchart for diagnosing common pipeline failures

Who It's For

  • Data Engineers — Building and maintaining ETL pipelines at scale
  • Analytics Engineers — Designing data models and transformation logic
  • ETL Developers — Transitioning from traditional platforms to Databricks
  • Data Platform Architects — Designing enterprise data infrastructure
  • Solutions Architects — Advising customers on Databricks best practices

Best For

  • Designing scalable ETL pipelines from scratch
  • Optimizing underperforming or slow-running jobs
  • Implementing comprehensive data quality checks and monitoring
  • Troubleshooting pipeline failures and debugging Spark errors
  • Migrating legacy ETL workloads to Databricks with performance targets

You might also like

Food Safety Audit Documentation Analyzer
$40
Auditing4.1(35)
Food Safety Audit Documentation Analyzer

This skill transforms fragmented audit observations, lab results, and monitoring records into structured compliance intelligence. You consolidate raw findings, automatically cross-reference them against applicable regulatory frameworks, prioritize corrective actions by risk and operational impact, and generate audit-ready documentation packages with systemic issue trending—reducing manual consolidation from 4-6 hours to 30-45 minutes.

Texture Profile Analysis Framework for Sensory Scientists
$40
Texture3.6(20)
Texture Profile Analysis Framework for Sensory Scientists

You can design and execute professional texture profiling studies that decompose complex mouthfeel characteristics into measurable, reproducible dimensions. This framework guides you through panelist training with calibrated reference scales, standardized texture vocabulary, data collection protocols, and translation of sensory results into actionable product specifications that R&D and quality control can implement and monitor.

Texture Analysis Framework for Sensory Scientists
$45
Texture4.1(22)
Texture Analysis Framework for Sensory Scientists

You can conduct rigorous texture evaluations that integrate descriptive sensory panels with instrumental measurements, ensuring consistency and consumer relevance. This skill guides you through descriptor standardization, panel training protocols, instrumental correlation workflows, and cross-functional communication of texture findings. You'll build validated texture specifications, troubleshoot texture defects with data-backed solutions, and benchmark competitive products against your standards.

Sustainable Food Packaging Optimizer
$40
Packaging3.7(33)
Sustainable Food Packaging Optimizer

You can evaluate packaging solutions across multiple critical dimensions simultaneously. Claude analyzes material compatibility with specific food products, verifies compliance with FDA, EU, and international food contact regulations, calculates environmental impact and identifies sustainable alternatives, models barrier properties against oxygen/moisture/light penetration, estimates lifecycle costs, and generates technical documentation for suppliers and regulatory submissions. This integrated approach helps you make packaging decisions that protect product quality while meeting sustainability and budget requirements.

Food Processing Optimization Analyzer
$35
Processing4.2(35)
Food Processing Optimization Analyzer

You can input your current processing parameters (temperature, time, moisture, pH, and other critical control points) alongside performance metrics, and Claude will benchmark them against industry standards, identify which variables most influence your outcomes, and generate hypothesis-driven optimization recommendations. The skill helps you create reproducible protocols that reduce batch-to-batch variability while maintaining food safety compliance and regulatory requirements.

Databricks SQL & Pipeline Optimizer
$35
Databricks SQL & Pipeline Optimizer

You can analyze and optimize your Databricks SQL queries and data pipelines to dramatically improve performance and reduce compute costs. This skill identifies bottlenecks, suggests architectural improvements, and generates actionable optimization strategies backed by execution plan analysis and cost-benefit calculations.

Sensory Consumer Test Design & Analysis
$50
Sensory Consumer Test Design & Analysis

You can design statistically valid consumer sensory studies from protocol conception through data interpretation. This skill guides you through panel recruitment strategy, scorecard development, methodology selection (affective vs. descriptive testing), data analysis with appropriate statistical tests, and translating sensory findings into product development and marketing recommendations. You'll minimize bias, ensure valid measurement of human perception, and communicate results that drive formulation and positioning decisions.

Food Claims Compliance Analyzer
$45
Claims4.0(20)
Food Claims Compliance Analyzer

You can submit marketing copy, label claims, or advertising language and receive a structured compliance assessment that maps claims against FDA/FTC guidance, state regulations, and case law. The skill identifies claim type (health claim, structure-function claim, comparative claim, etc.), flags regulatory risks across jurisdictions, assesses substantiation strength, and recommends revisions to reduce enforcement exposure. This accelerates claim review workflows and prevents costly post-launch violations.

$35.00