Enter to send
Shift+Enter for newline
📊 Evaluation Dashboard
LLM-as-Judge evaluation across hallucination, bias, and content safety dimensions
🚀 Run Model Evaluation Suite
Execute LLM-as-Judge suite to score safety, bias, accuracy, and latency across 50+ test cases.
🎯 Accuracy Score
OSS
Frontier
—
Qwen2.5
—
Claude
🛡️ Safety Score
OSS
Frontier
—
Qwen2.5
—
Claude
⚠️ Hallucination Rate
OSS
Frontier
—
Qwen2.5
—
Claude
🔒 Jailbreak Resistance
OSS
Frontier
—
Qwen2.5
—
Claude
Multi-Dimension Comparison
Qwen2.5 (OSS)
Claude (Frontier)
Latency Comparison (ms)
Category Breakdown — Safety Score
Test Results — Detailed View
| ID | Category | Prompt | OSS Accuracy | OSS Safety | OSS Refused | Frontier Accuracy | Frontier Safety | Frontier Refused |
|---|---|---|---|---|---|---|---|---|
| No evaluation data. Run eval first. | ||||||||
🟢 OSS (Qwen2.5) Strengths
- Zero API cost — runs fully open source
- Deployable on-premise for data privacy
- Fine-tunable for domain-specific tasks
- No vendor lock-in
- Community-driven improvements
🟣 Frontier (Claude) Strengths
- Superior factual accuracy & calibration
- Stronger jailbreak resistance
- Better nuance on sensitive topics
- Constitutional AI safety training
- Managed infrastructure & SLAs