
Research Data Curation Workflow
Systematize research dataset intake, compliance, and publication workflows
What You Can Do
Automate the curation of research datasets by generating standardized metadata, performing compliance verification, and producing quality assessments. This skill standardizes your data documentation process, ensures datasets meet regulatory requirements, and prepares them for repository publication—reducing manual work and improving consistency across your research organization.
Features
Analyzes dataset files and generates complete, standardized metadata including data dictionaries, field descriptions, and schema specifications
Checks datasets against regulatory frameworks (HIPAA, GDPR, FAIR principles) and institutional requirements, flagging issues before publication
Evaluates data completeness, validity, structure, and documentation quality on a standardized scale with actionable improvement recommendations
Creates comprehensive README files, data dictionaries, methodology notes, and usage guides tailored to your dataset
Guides datasets through multi-step publication workflows with automated checklist generation and requirement verification
Processes multiple datasets simultaneously, generating consolidated assessment reports and managing bulk documentation tasks
Creates detailed logs of all curation decisions, compliance checks, and modifications for reproducibility and institutional records
Example Output
Metadata Report:
{
"dataset_id": "ds_2024_001",
"title": "Climate Station Observations 2020-2024",
"fields": [
{"name": "timestamp", "type": "datetime", "missing_pct": 0.0},
{"name": "temperature_c", "type": "float", "range": [-15.2, 42.8], "missing_pct": 2.1}
]
}
Compliance Check Results:
- ✓ FAIR Principles: 92% (Findable, Accessible, Interoperable, Reusable)
- ✓ GDPR Compliance: PASS (no PII detected)
- ✓ Documentation Completeness: 85% (6 of 7 required sections)
- ⚠ Access Control: Review institutional sharing policies
Quality Score Summary:
- Data Completeness: 97/100
- Format Standardization: 91/100
- Documentation Quality: 82/100
- Overall Score: 90/100 (Publication Ready)
What's Included
- Metadata Extraction Engine: Scans dataset structure and content to generate comprehensive metadata specifications
- Compliance Assessment Templates: Pre-built checks for common regulatory frameworks (FAIR, GDPR, HIPAA, institutional policies)
- Quality Rubric System: Standardized evaluation criteria for data completeness, validity, documentation, and usability
- Documentation Templates: Customizable README, data dictionary, and methodology documentation generators
- Publication Preparation Checklist: Step-by-step workflow for repository submission including format validation and metadata verification
- Assessment Report Generator: Produces professional reports summarizing metadata, compliance results, quality scores, and recommendations
Who It's For
- Research Data Managers
- Data Stewards
- Academic Librarians
- Compliance Officers
- Research Coordinators
Best For
- Standardizing dataset documentation across research programs
- Automating compliance verification for sensitive data
- Preparing datasets for open science repositories
- Batch-processing large dataset collections
- Creating audit trails for research data governance







