{ "updated": "2026-07-17T21:00:09.508Z", "sources": { "eog": { "url": "https://artificialanalysis.ai/evaluations/enterprise-ops-gym-aa/", "hash": "sha256:617ad42070acaf5d70ca7782c7f1e4960d26f56cd228667a86f89d51abc580c8", "fetchedAt": "2026-07-17T21:00:09.508Z" }, "eva": { "url": "https://raw.githubusercontent.com/ServiceNow/eva/main/website/src/data/leaderboardStats.json", "hash": "sha256:e71bd9e18c294322e706ebc9ca8ac477be01c8caf5d9c25b3121566753f35b77", "fetchedAt": "2026-07-17T21:00:09.508Z" } }, "eog": { "metricLabel": "Task Success Rate · Oracle mode", "rows": [ { "rank": 1, "model": "Claude Fable 5 (with fallback)", "org": "Anthropic", "score": 51.1, "bar": 51 }, { "rank": 2, "model": "Gemini 3.5 Flash", "org": "Google", "score": 50.1, "bar": 50 }, { "rank": 3, "model": "GPT-5.5 (xhigh)", "org": "OpenAI", "score": 46.6, "bar": 47 }, { "rank": 4, "model": "Kimi K3", "org": "Kimi", "score": 45.3, "bar": 45 }, { "rank": 5, "model": "Qwen3.7 Max", "org": "Alibaba", "score": 45, "bar": 45 } ] }, "evaAccuracy": { "metricLabel": "Pass@1", "rows": [ { "rank": 1, "name": "Scribe v2.2 Realtime + GPT-5.4 + Eleven Flash v2 (ElevenAgents)", "subtitle": "Mixed Models · Cascade", "score": 0.67, "ciLower": 0.62, "ciUpper": 0.72, "bar": 67 }, { "rank": 2, "name": "Universal 3.5 Pro + GPT-5.4 + Sonic 3.5", "subtitle": "Mixed Models · Cascade", "score": 0.6, "ciLower": 0.55, "ciUpper": 0.65, "bar": 60 }, { "rank": 3, "name": "Grok Voice Think Fast 1.0", "subtitle": "Grok · Speech-to-Speech", "score": 0.59, "ciLower": 0.54, "ciUpper": 0.64, "bar": 59 } ] }, "evaExperience": { "metricLabel": "Pass@1", "rows": [ { "rank": 1, "name": "Scribe v2.2 Realtime + Claude Haiku 4.5 + Eleven Flash v2 (ElevenAgents)", "subtitle": "Mixed Models · Cascade", "score": 0.82, "ciLower": 0.79, "ciUpper": 0.84, "bar": 82 }, { "rank": 2, "name": "Gemini 3.1 Flash Live", "subtitle": "Google · Speech-to-Speech", "score": 0.59, "ciLower": 0.56, "ciUpper": 0.62, "bar": 59 }, { "rank": 3, "name": "Grok Voice Think Fast 1.0", "subtitle": "Grok · Speech-to-Speech", "score": 0.57, "ciLower": 0.53, "ciUpper": 0.61, "bar": 57 } ] } }