ITBench-AA – AI Explorer
Erster Benchmark für agentische Enterprise-IT-Aufgaben. Frontier-Modelle erzielen weniger als 50% auf diesem Benchmark, was die Schwierigkeit realer IT-Automatisierung zeigt.
Hersteller & Kategorie
- Hersteller
- Artificial Analysis & IBM
- Herkunftsland
- USA
- Kategorie
- Infra/Plattform
Stärken
- Erster Benchmark speziell für agentische IT-Aufgaben
- Realistische Enterprise-IT-Szenarien
- Aufdeckung von Limitierungen aktueller KI-Modelle
- Zusammenarbeit von IBM und Artificial Analysis
- Standardisierte Bewertung von IT-Automatisierungsfähigkeiten
Schwächen
- Noch keine breite Adoption in der Industrie
- Begrenzte Anzahl an getesteten Szenarien
Anwendungsfälle
- Bewertung von KI-Agenten für IT-Operations
- Vergleich von LLMs für Enterprise-Automatisierung
- Identifikation von Verbesserungspotential in IT-Workflows
- Forschung zu agentischen KI-Systemen
Technische Daten
- Güteklasse
- Etabliert
Verfügbarkeit & Lizenz
- Kostenmodell
- Kostenlos
- Deployment-Optionen
- Cloud
- Eingabe-Modalitäten
- text, code, document
- Ausgabe-Modalitäten
- text
- Sprachen
- en