
Research Data Documentation Generator
Generate FAIR-compliant dataset documentation and metadata
What You Can Do
You can create comprehensive, standards-compliant documentation for research datasets including data dictionaries, metadata records, and institutional compliance reports. The skill generates structured documentation following FAIR principles (Findable, Accessible, Interoperable, Reusable), validates against disciplinary standards like DDI, DataCite, or Dublin Core, and produces documentation your institution and publishers require for data archival and discovery.
Features
Automatically checks your documentation against all FAIR principles and flags missing elements (persistent identifiers, licenses, provenance, access rights)
Converts raw dataset metadata into structured variable descriptions with data types, value ranges, units, missing value codes, and controlled vocabulary mappings
Produces metadata in multiple formats (JSON-LD, XML, Dublin Core, MIARC) compatible with institutional repositories and data discovery services
Adapts documentation to match standards in your field—DDI-C for social science, MIAME for genomics, FGDC for geospatial, domain-specific vocabularies
Generates compliance checklists and documentation required by your institution's data management policies, IRB protocols, or funder mandates
Tracks and documents data provenance, processing steps, software versions, and transformation logic for full reproducibility
Generates automated quality checks on metadata completeness, consistency, and compliance with specified standards, with actionable recommendations
Example Output
Data Dictionary (tabular format):
| Variable | Type | Range | Unit | Missing Value | Description |
|---|---|---|---|---|---|
| temperature_c | float | -40 to 50 | Celsius | NA | Daily mean temperature measured at 14:00 UTC |
| precipitation_mm | float | 0 to 200 | mm | 999 | Total 24-hour precipitation, quality-controlled |
Metadata Record (Dublin Core):
<dc:creator>Smith, John; Lee, Maria</dc:creator>
<dc:issued>2026-01-15</dc:issued>
<dc:title>Climate Station Data 2025</dc:title>
<dc:identifier>https://doi.org/10.5281/zenodo.1234567</dc:identifier>
<dc:language>en</dc:language>
<dc:rights>CC-BY-4.0</dc:rights>
<dcat:keyword>climate, temperature, precipitation, station-data</dcat:keyword>
FAIR Compliance Checklist:
- ✓ Dataset has persistent identifier (DOI)
- ✓ Metadata includes creation date and responsible party
- ✓ License is explicitly stated (CC-BY-4.0)
- ✓ Data dictionary describes all variables and units
- ✗ Missing: Access restrictions and embargo dates
- ✗ Missing: Related publications and citations
What's Included
- Data Dictionary Template: Pre-formatted tables for variables with fields for type, range, units, missing value codes, definitions, and validation rules
- Metadata Generation System: Structured prompts to extract, organize, and standardize metadata from your dataset description and produce standards-compliant output
- FAIR Compliance Validator: Automated checklist testing documentation against FAIR principles and disciplinary standards with gap analysis and remediation guidance
- Institution-Specific Templates: Customizable templates aligned with common data management requirements from funders, IRBs, and institutional repositories
- Data Lineage Worksheet: Guided template to document data sources, processing steps, software versions, parameters, and decision logic for reproducibility
- Quality Assurance Checklist: Verification guide ensuring all required metadata fields are present, internally consistent, and machine-readable for archival systems
Who It's For
- Research Data Scientists and Data Stewards
- Data Librarians and Repository Curators
- Research Administrators and Compliance Officers
- Institutional Repository and Archive Managers
- Grant-Funded Researchers Preparing Data for Submission
Best For
- Creating documentation for datasets destined for institutional or disciplinary archives
- Ensuring FAIR compliance before publication or funder submission
- Standardizing metadata across multi-site or institutional research programs
- Preparing data for long-term preservation, discovery, and reuse







