
Grafana Dashboard & Alert Optimization
Optimize Grafana dashboards and alerts with Claude as your observability expert
What You Can Do
This skill positions Claude as your Grafana technical advisor. You can optimize PromQL queries for performance, design clear dashboards for incident response, create effective alert rules that minimize false positives, and troubleshoot visualization issues—all grounded in monitoring best practices and your specific metrics context.
Features
Reduce cardinality, improve performance, and simplify complex aggregations
Evaluate layout, panel arrangement, and information hierarchy for incident response
Create thresholds, routing rules, and notification templates with proper tuning guidance
Choose optimal panel types, refresh rates, and visualization styles for your data
Design dashboards that track error rates, p95/p99 latency, and service dependencies
Audit and recommend consistent naming conventions across your infrastructure
Refactor legacy dashboards into modern, maintainable layouts
Example Output
PromQL Optimization Example:
# Original (high cardinality, inefficient)
rate(http_requests_total[5m])
# Optimized (aggregated by job)
sum by (job) (rate(http_requests_total[5m]))
## Analysis
- Cardinality reduced from 5,000 to 50 series
- Query execution: 200ms → 40ms
- Recommended refresh: 30s (suitable for this aggregation level)
Dashboard Design Feedback:
✓ Panel grouping: API metrics, DB metrics, cache metrics — logical separation
✓ Refresh rate: 30s appropriate for incident response
✗ P95 latency title: Change from 'p95' to 'API Latency (p95)' for clarity
⚠ Alert rules: Currently trigger on static threshold — recommend adding rate-of-change rule to catch sudden spikes
Alert Rule Recommendation:
alert: HighErrorRate
expr: |
(sum(rate(errors_total[5m])) / sum(rate(requests_total[5m])))
> 0.05 # 5% error threshold
for: 5m # Prevent flapping from transient spikes
annotations:
summary: "Error rate > 5% for {{ $labels.service }}"
runbook: "https://wiki.internal/incident/high-error-rate"
What's Included
- SKILL.md: Complete Grafana optimization framework with decision trees and troubleshooting workflows
- PromQL optimization checklist: Common anti-patterns and refactoring strategies
- Dashboard layout template: Best-practice structure (status row, trending metrics, details)
- Alert configuration guide: Threshold tuning, routing rules, notification templates
- Metric naming conventions: Standards for consistent naming across teams
- Query performance audit worksheet: Systematic review process for existing dashboards
Who It's For
- DevOps engineers designing and maintaining observability infrastructure at scale
- SRE teams optimizing alert accuracy and reducing mean-time-to-detection
- Platform engineers building internal monitoring for development teams
- Systems administrators managing shared Grafana instances across organizations
- Performance engineers tuning dashboards and metrics for application observability
Best For
- Reducing query execution time and dashboard panel load performance
- Designing dashboards that support fast incident triage and response
- Creating alert rules that catch real issues while minimizing false positives
- Optimizing PromQL for efficient metric aggregation and cardinality management
- Refactoring and migrating legacy dashboards to modern, maintainable standards







