
Prompt Engineer
Design, test, and optimize prompts for reliable LLM performance
What You Can Do
You can transform underperforming or inconsistent prompts into reliable, production-ready specifications that work across diverse inputs and use cases. This skill guides you through diagnosing prompt failures, applying evidence-based optimization techniques (chain-of-thought reasoning, few-shot examples, output constraints), testing variants systematically, and documenting final prompts for team-wide reproducibility. You'll move beyond trial-and-error to engineering prompts that scale reliably across different model versions and maintain quality with thousands of inputs.
Features
structure prompts to break problems into logical steps for improved reasoning and transparency
craft and validate examples that demonstrate desired behavior patterns
define JSON, markdown, or custom schemas to ensure consistent, parseable results
create controlled test suites to compare prompt versions and measure performance gains
establish baseline metrics and track improvements across iterations
identify why prompts fail (ambiguous instructions, missing context, wrong model assumptions) and target fixes
generate final prompt specs with clear instructions, examples, constraints, and usage guidelines
test and adapt prompts for different LLM versions and families
Example Output
Example 1: Customer Support Classification Prompt
Input: Raw customer ticket text with high variability
Optimized prompt output:
## Classification Prompt Specification
### Purpose
Classify support tickets into: Billing, Technical, Product Feedback, Account Access
### Chain-of-Thought Structure
1. Identify the primary problem statement
2. Note any secondary concerns
3. Match against category definitions
4. Assign confidence score (0-1)
### Few-Shot Examples
- Ticket: "Can't log in after password reset" → Account Access (0.95)
- Ticket: "Charge appeared twice on invoice" → Billing (0.92)
### Output Format
{"category": "string", "confidence": 0.0-1.0, "reasoning": "2-3 sentences"}
### Quality Baseline
- Accuracy target: 92%+
- Consistency: 95%+ same-class agreement on retest
Example 2: Data Extraction Prompt Test Results
Variant A (baseline): 78% accuracy on 50-document sample Variant B (added CoT + constraints): 89% accuracy Variant C (added few-shot examples): 94% accuracy
Recommendation: Use Variant C across production pipeline
Example 3: JSON Structured Output Prompt
Input: Product review text Output:
{
"sentiment": "positive",
"topics": ["durability", "price"],
"actionable_feedback": true,
"priority_level": "medium",
"summary": "Customer praised build quality but flagged cost as concern"
}
What's Included
- SKILL.md: core instruction file with methodology and examples
- Prompt Testing Framework: template for creating and comparing prompt variants with consistency metrics
- Chain-of-Thought Design Checklist: step-by-step guide for structuring reasoning prompts
- Few-Shot Example Generator: worksheet for crafting representative examples and validating coverage
- Output Schema Templates: pre-built JSON and markdown structures for common tasks (classification, extraction, summarization)
- Specification Documentation Template: final prompt specification format for handoff and team use
Who It's For
- Prompt engineers designing and optimizing prompts for production LLM applications
- AI/ML teams scaling prompt quality across multiple use cases and models
- Product managers ensuring consistent AI feature performance at scale
- Data scientists building reliable extraction and classification pipelines
- Operations leads documenting and standardizing prompts across teams
Best For
- Diagnosing and fixing inconsistent or underperforming prompts
- Engineering customer-facing prompts (support, recommendations, content generation)
- Building data extraction and classification pipelines at scale
- Testing and comparing prompt variants with measurable quality metrics
- Documenting production prompts for reproducibility and team handoff
- Optimizing prompts for reliability across different model versions







