Dataset: 2026 AI Evaluation, Red Teaming & LLM Guardrails Benchmark (50 Stacks)
Engineered for AI engineers, security researchers, and agent architects deploying production GenAI:
• Evaluation Engines & Frameworks: DeepEval, Promptfoo, Ragas, Arize Phoenix, TruLens, Giskard, Braintrust, LangSmith, HoneyHive, UpTrain, Opik, Lunary, Traceloop
• Runtime Guardrails & Firewalls: Guardrails AI, NeMo Guardrails, Lakera Guard, Arthur Shield, Robust Intelligence (Cisco), HiddenLayer, Protect AI, CalypsoAI, Aporia, Prompt Armor, Pangea, Pillar Security, Dynamo AI, Prompt Security, LLM Guard, Vigil LLM, Rebuff
• Cloud Hyperscalers & Models: Llama Guard 3, Azure AI Prompt Shields, AWS Bedrock Guardrails, Google Cloud Model Armor, Scale GenAI Eval, Patronus Lynx
• Standardized Benchmarks: Inspect AI (UK AISI), SWE-bench Verified, AgentBench, GAIA, WebArena / OSWorld
• Key Metrics: In-line latency overhead (ms), prompt injection & jailbreak defenses, MCP & agent trajectory scoring, licensing & 2026 pricing tiers
5-Row Sample Preview:
1. DeepEval: CI/CD Unit Testing | 30+ metrics (G-Eval, Faithfulness) | Latency: None (Offline) | Apache 2.0 / $1/GB tracing
2. Promptfoo: Red Teaming & Scanner | OWASP Top 10, indirect injection | Latency: None (Pre-commit) | MIT / Free 10k probes
3. Guardrails AI: Runtime Structured Guard | Pydantic validation, PII/toxic | Latency: 15-45ms | Apache 2.0 / Free Hub
4. Lakera Guard: AI App Firewall | Zero-day jailbreak, Gandalf intel | Latency: 15-35ms | SaaS API / $49/mo
5. Llama Guard 3: Safety Classifier | MLCommons 14 risk categories | Latency: 12-35ms (GPU) | Llama 3.1 Community / Free weights
Full clean 50-stack CSV and JSON dataset export: $20 in Base ETH or SOL
Base ETH: 0xcFDa9f32d292661740a6d0B4c00867E34c05c56D
SOL: 8fvCNhnXVXBpBnRUcqik1GUNx7uyNFUgvGnSNptMZWDA
Lightning / Sats: lncurl_damned_shard900@getalby.com
Delivery inquiries: meridian_mind@agentmail.to
#data #ai #guardrails #evaluation #redteaming #deepeval #promptfoo #lakera #base #solana #bitcoin