
Metadata Standardization & Dataset Documentation
Standardize metadata and document datasets with consistent, queryable structures
What You Can Do
This skill helps you create standardized metadata schemas, auto-document datasets with rich descriptions, and generate structured data dictionaries that make your datasets discoverable and reusable. You can transform unorganized data into professionally documented datasets with consistent naming conventions, data lineage tracking, and compliance-ready documentation.
Features
Automatically generate standardized metadata schemas (JSON-LD, Dublin Core, DCAT) that describe your dataset structure, provenance, and usage rights.
Build comprehensive data dictionaries with field names, types, definitions, sample values, and validation rules—exportable as CSV, JSON, or markdown.
Add semantic meaning to raw fields: suggest standardized names, infer data types, identify personally identifiable information (PII), and flag data quality issues.
Generate GDPR, data governance, and regulatory-ready documentation including data lineage, retention policies, and access control specifications.
Create machine-readable catalog entries (XML, YAML) that integrate with data discovery platforms, data lakes, and enterprise metadata repositories.
Analyze datasets for completeness, uniqueness, consistency, and validity—producing scoring reports that identify remediation priorities.
Batch-process hundreds of datasets at once, applying consistent naming conventions and documentation standards across your entire data estate.
Example Output
Example 1: Data Dictionary for Customer Dataset
| Field | Type | Description | Example | Nullable |
|---|---|---|---|---|
| customer_id | UUID | Unique customer identifier | 550e8400-e29b-41d4-a716 | No |
| Customer email address (PII) | john.doe@example.com | No | ||
| lifetime_value | Decimal | Total revenue from customer (USD) | 2543.50 | No |
| registration_date | DateTime | Date account created (ISO 8601) | 2023-01-15T10:30:00Z | No |
| data_quality_score | Float | Quality assessment (0-100) | 95 | No |
Example 2: Metadata Schema (Dublin Core)
{
"dc:title": "Customer Transaction History",
"dc:description": "Complete transaction records for registered customers",
"dc:creator": "Analytics Team",
"dc:subject": ["commerce", "customer-behavior"],
"dcat:keyword": ["customers", "revenue"],
"dcat:issued": "2023-01-15T00:00:00Z",
"dcat:modified": "2024-08-08T10:15:00Z"
}
Example 3: Data Lineage & Governance
Lineage: Raw events table → validated_events view → customer_metrics → BI Dashboard
Retention: 90 days for PII, 7 years for audit logs
Access: Analytics (read), Finance (aggregate), Compliance (audit)
What's Included
- Metadata Schema Templates: Pre-built templates for Dublin Core, JSON-LD, DCAT, and domain-specific schemas for healthcare, finance, and research.
- Documentation Generators: Claude prompts and workflows for auto-generating data dictionaries, README files, and compliance documentation from data samples.
- Quality Assessment Framework: Scoring rubrics and analysis workflows to evaluate dataset completeness, consistency, timeliness, and regulatory readiness.
- Catalog Integration Scripts: Python/SQL utilities to export standardized metadata into common data catalogs like Collibra, Alation, and Apache Atlas.
- Naming Convention Library: Standardized field naming conventions (snake_case, camelCase, versioning) for common industry domains.
Who It's For
- Data Engineers
- Database Administrators
- Data Governance Specialists
- Compliance & Privacy Officers
- Research Data Managers
Best For
- Documenting new datasets before publication
- Creating data catalogs for enterprise discovery
- Building compliance documentation (GDPR, HIPAA)
- Standardizing naming conventions across teams
- Generating data quality assessments






