Die besten AI Agents für QA und Testing 2026: 14 Agents, gerankt nach Transparenz der Selbstheilung

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
QA Wolf und Mabl führen diese Liste für Teams an, die heute das Nächstliegende an agentischer QA-Abdeckung wollen, Testim (Tricentis) und Applitools Autonomous sind die sicherere Wahl, wenn Sie einen Namen wollen, den Analysten bereits geprüft haben, und Momentic oder Functionize sind der richtige Startpunkt für ein kleines Team ohne dedizierte Automatisierungsingenieure. Dieser Leitfaden ordnet 14 AI Agents, die speziell für Software-QA gebaut sind: Tools, die Testfälle aus einer Spezifikation oder durch das Durchsuchen Ihrer App erzeugen, End-to-End- und UI-Läufe ausführen, sich selbst heilen, wenn sich Selektoren ändern, visuelle Regressionen erkennen, APIs ansteuern und einen fehlgeschlagenen Lauf triagieren, geprüft an der jeweiligen Preisseite des Anbieters im August 2026, mit Vermerk überall dort, wo einer keine Zahl veröffentlicht.
Dieser Umfang ist enger, als er klingt. Ein echter Agent plant mehrere Schritte, ruft ein echtes Tool wie einen Browser oder Test-Runner auf und entscheidet, was als Nächstes zu tun ist; ein Produkt, das nur einen Menschen beim Abarbeiten einer Checkliste unterstützt, gehört stattdessen zu den assistiven AI Agents 2026. Dieser Leitfaden behandelt außerdem nicht die AI-Coding-Agents, die den Anwendungscode schreiben, den diese Agents testen, nicht die AI Agents für die Incident Response im Produktivbetrieb nach der Auslieferung und nicht die Observability-Tools für AI Agents, die das Verhalten eines AI Agents selbst nachverfolgen. Er behandelt die Softwarequalität vor dem Release: Funktioniert das Feature, bevor es ausgeliefert wird. Jedes Produkt unten wurde an einer Frage gemessen, die Marketingseiten gern auslassen: Wenn es einen defekten Test „selbst heilt“, sagt es Ihnen, was es geändert hat, und darf ein Mensch Nein sagen, bevor diese Änderung als bestandener Build ausgeliefert wird.
Stand August 2026: Was sich geändert hat
- Gartner hat 2025 seinen ersten Magic Quadrant für AI-Augmented Software Testing Tools veröffentlicht und Tricentis als Leader mit der höchsten Umsetzungsfähigkeit geführt, das bislang klarste Signal, dass diese Kategorie über einzelne Anbieteraussagen hinaus zu einem von Analysten beobachteten Markt gereift ist.
- Forrester hat im 4. Quartal 2025 seine erste Wave für Autonomous Testing Platforms durchgeführt und 15 Anbieter danach bewertet, wie weit jeder Testerstellung, -ausführung und -wartung über klassische skriptbasierte Automatisierung hinaus treibt. Tricentis wurde als Leader eingestuft; Applitools als Strong Performer.
- SmartBear hat am 31. März 2026 neue agentische Fähigkeiten in Reflect ausgeliefert, mit denen ein Entwickler Tests direkt aus einem verbundenen Coding-Agent über einen MCP-Server erzeugen kann statt über ein separates Dashboard, ein deutlich anderes Integrationsmodell als beim Rest dieser Liste.
- Katalon hat seinen AI Assistant und den MCP Server ohne Aufpreis in jede Preisstufe aufgenommen und setzt darauf, dass AI-gestütztes Testen zur Grunderwartung wird statt zum Premium-Add-on.
Wichtige Fakten
- Die Kosten schlechter Softwarequalität in den USA betragen mindestens 2,41 Billionen $, wobei aufgelaufene technische Schulden, der Rückstau ungetesteter oder untertesteter Abkürzungen, rund 1,52 Billionen $ dieser Summe ausmachen, laut dem Bericht 2022 des Consortium for IT Software Quality.
- Die durchschnittliche Testautomatisierungsabdeckung über Organisationen hinweg liegt bei nur 33%, und nur 8% melden eine voll etablierte Automatisierungsstrategie, laut dem World Quality Report 2025-26 von Capgemini, Sogeti und OpenText, einer Umfrage unter 2.000 Führungskräften in 23 Ländern.
- Nur 15% der Organisationen haben generative AI unternehmensweit in der Qualitätssicherung skaliert, während 43% noch experimentieren, laut demselben World Quality Report 2025-26.
- 76,8% der Testteams setzen AI in irgendeiner Form ein, aber die Nutzung neigt zum Erstellen statt zum Pflegen: 69,6% nutzen AI für die Testfallgenerierung gegenüber 59,6% für die Testwartung, laut PractiTests Report State of Testing 2026, inzwischen in der 13. Ausgabe.
- Der Anteil der Teams mit instabilen (flaky) Tests stieg zwischen 2022 und Mitte 2025 von 10% auf 26%, basierend auf einer Analyse von mehr als 10 Mio. Builds, laut Bitrises Report Mobile Insights 2025.
- 40% der Unternehmensanwendungen werden bis Ende 2026 aufgabenspezifische AI Agents enthalten, gegenüber unter 5% im Jahr 2025, laut Gartner.
Schnellvergleich
| Tool | Am besten geeignet für | Einstiegspreis | Zentrale Stärke | Zentrale Einschränkung |
|---|---|---|---|---|
| QA Wolf | Teams, die QA komplett abgenommen haben wollen | Nutzungsbasiert ($0,01/AI-Credit, $0,15/Runner-Minute); Coverage as a Service individuell | Ein Mensch untersucht jeden Fehlschlag innerhalb von 24 Stunden | Die individuelle Managed-Stufe versteckt ihren echten Preis hinter einem Vertriebsgespräch |
| Mabl | Agentische Abdeckung für Web, Mobile, API und Barrierefreiheit in einem Produkt | Individuell, auf Angebotsbasis (500 Credits/Monat Startkontingent) | Positionierung „baut sich selbst, läuft selbst, stellt sich selbst wieder her“ | Überhaupt kein öffentlicher Preis, nicht einmal ein Startwert |
| Testim (Tricentis) | Enterprise-Teams, die von Analysten validiertes autonomes Testing wollen | Kostenloser Community-Plan; kostenpflichtige Stufen individuell | Gartner und Forrester nennen es beide als Leader | Kein öffentlicher Preis oberhalb der begrenzten kostenlosen Stufe |
| Applitools Autonomous | Visuelle Regression gebündelt mit autonomer End-to-End-Generierung | Kostenlose Testphase (50 Test Units); kostenpflichtige Stufen individuell | Scannt eine URL-Liste zu einer vollständigen Suite, bündelt Änderungen zur Freigabe per Klick | Kein öffentlicher Self-Serve-Preis über die Testphase hinaus |
| Katalon AI | Eine Plattform für manuelles und automatisiertes Testen | $70/Platz/Monat (True Platform), Jahresrabatte bis $59 | AI Assistant und MCP Server in jeder Stufe kostenlos enthalten | Volle Lifecycle-Abdeckung braucht ein Bundle für $200/Platz/Monat |
| testRigor | Selektorfreie Tests, erzeugt aus echtem Produktionsverkehr | $300/Monat (Private Linux Chrome) | Heilt sich selbst, indem es die Seite wie ein Mensch versteht, nicht über Selektoren | Für volle plattformübergreifende Abdeckung sind $900/Monat nötig |
| Momentic | Nutzungsbasierte Preise ganz ohne Platzgebühren | Kostenlos (2.000 Credits/Monat); $125/Monat Pay-as-you-go | Veröffentlichter Überschreitungssatz, kein Aufschlag pro Nutzer | Enterprise-Funktionen (SSO, SLA) erfordern ein individuelles Angebot |
| Functionize | Der günstigste Self-Serve-Einstieg in agentisches Testing | Kostenlos ($0, 200 Credits/Monat); Pro $20/Monat | Niedrigster kostenpflichtiger Einstieg dieser Liste | Die Stufen Growth und Scale berechnen Credits pro Nutzer, nicht gemeinsam |
| Reflect (SmartBear) | Ein Agent, den Ihr Coding-Agent direkt aufrufen kann | Credit-gestaffelt (5.000 bis 40.000/Monat); Preis individuell | MCP-Server-Integration, nicht nur ein Dashboard | Kein veröffentlichter Dollarpreis für irgendeine Stufe |
| Autify | Autonomes Testing (Aximo) oder Playwright-basierter Hybrid (Nexus) | $120/Monat (Aximo Core), $99/Monat jährlich | Zwei Produkte decken sowohl No-Code- als auch Code-Teams ab | Nexus stapelt Add-ons pro Nutzer und pro Parallelität obendrauf |
| Rainforest QA | AI-Testplanung, gestützt von menschlichen Crowd-Prüfern | Nicht veröffentlicht; berichteter Durchschnitt um $5.200/Monat | Menschliche Prüfer sitzen hinter der Selbstheilungsebene | Keine öffentlichen Preise; echte Verträge gehen jährlich in den fünfstelligen Bereich |
| CoTester (TestGrid) | Ein gebündeltes AI-Testing-Teammitglied mit 27+ eingebauten Agents | $199/Platz/Monat, Mindestabnahme 4 Plätze | Keine Gebühren pro Agent bei 27+ Testing-Agents | Die Mindestabnahme von 4 Plätzen setzt die reale Preisuntergrenze nahe $800/Monat |
| Meticulous | Wartungsfreie Regressionsabdeckung ganz ohne Testerstellung | Nicht veröffentlicht; kostenlos für Open Source | Deterministische Wiedergabe echter Sitzungen, keine Locators, die brechen können | Passt nicht, wenn Sie skriptbasierte, gezielte Testfälle brauchen |
| Ranger | Die autonomste Option, gebaut für AI-Coding-Agents | Nicht veröffentlicht; individueller Jahresvertrag | Konstruktionsbedingt keine menschliche Beteiligung im Fix-and-Retest-Zyklus | Keine Self-Serve-Stufe; jedes Team beginnt mit einer Vertriebsberatung |
Selbstheilung: Die Funktion, die den Fehler auch verstecken kann
Jeder Anbieter dieser Liste vermarktet Selbstheilung als Grund zum Wechseln. Weniger von ihnen erklären, was sie tatsächlich tut, wenn sie auslöst: Ein Element, das sie erwartet, hat sich bewegt oder verändert, also sucht sie die nächstliegende Übereinstimmung und aktualisiert den Test auf diese. Gut gemacht erspart das einem QA-Ingenieur, jeden Sprint einen Locator neu aufzuzeichnen. Nachlässig gemacht kann es still ein ähnlich aussehendes Element neben dem defekten neu anvisieren, der Test besteht, und eine echte Regression wird ausgeliefert. Genau diesen Fehlerfall nennen die Best-Practice-Leitfäden der Anbieter zur Selbstheilung: Locators heilen, niemals Assertions, vor stiller Heilung eine Konfidenzschwelle verlangen, jede Heilung zur Prüfung protokollieren und den Build scheitern lassen, wenn die Heilungsrate unerwartet springt. Eine Testsuite, die sich heilt, ohne es jemandem zu sagen, hört auf, ein Nachweis zu sein, und wird zur Inszenierung.

Der ehrliche Unterschied zwischen diesen 14 Produkten ist nicht, ob sie sich selbst heilen. Fast alle tun es. Entscheidend ist, ob die Heilung sichtbar und prüfbar ist oder unsichtbar und automatisch. Teams auf der Bauseite, die eine solche Leitplanke von Grund auf entwerfen, sollten sich ansehen, wie sie im Blueprint für einen AI-QA-Testing-Agent umrissen ist, der „einen fehlschlagenden Test niemals als bestanden markieren“ als harte Regel behandelt und nicht als Konfigurationsoption.
| Tool | Was es heilt | Menschliche Freigabe vor der Auslieferung | Wie Änderungen sichtbar werden |
|---|---|---|---|
| QA Wolf | Locators und Workflow-Schritte | Ja, in der Managed-Stufe: Ein Mensch untersucht jeden Fehlschlag innerhalb von 24 Stunden | Von Menschen verifizierter Fehlerbericht mit Video, Traces und Logs |
| Mabl | Locators, über „intelligente Analyse von Testfehlschlägen“ | Nicht als verpflichtendes Gate dokumentiert | Die Fehleranalyse zeigt pro Lauf eine wahrscheinliche Ursache |
| Testim (Tricentis) | Locators, über AI-gestützte und agentische Testautomatisierung | Im Test-Editor prüfbar, bevor einem Lauf vertraut wird | Erzeugte Schritte erscheinen zur Prüfung im Editor |
| Applitools Autonomous | Locators und visuelle Checkpoints | Ja: Änderungen werden gruppiert und dann per Klick freigegeben | Gruppierte Diff-Ansicht über alle betroffenen Tests |
| Katalon AI | Locators, plus über Insights sichtbar gemachte Ursachen | Nicht als verpflichtendes Gate dokumentiert | Insights markiert Ursachen und Muster instabiler Tests |
| testRigor | Seitenverständnis, überhaupt keine Selektoren | Ja: Gruppierte Fälle werden mit Bearbeitungswerkzeugen direkt korrigiert | Fälle, die vom selben Problem betroffen sind, werden zur Prüfung gruppiert |
| Momentic | Locators, über Beschreibungen in natürlicher Sprache | Nicht als verpflichtendes Gate dokumentiert | Wiederholungen und Umgehungen des Agents werden pro Lauf protokolliert |
| Functionize | Locators, adressiert als „das Problem instabiler Tests“ | Nicht als verpflichtendes Gate dokumentiert | Credit-gemessene Läufe melden pro Schritt bestanden/fehlgeschlagen |
| Reflect (SmartBear) | Locators, über visuelle Objekterkennung | Nicht dokumentiert; die Heilung greift ohne manuelles Eingreifen | Testschritte und Screenshots werden pro Lauf aufgezeichnet |
| Autify | Locators, über Aximo und Nexus hinweg | Nicht als verpflichtendes Gate dokumentiert | Skript-Diffs werden nach einem Selbstheilungsereignis angezeigt |
| Rainforest QA | Locators, plus eine Ebene menschlicher Prüfer | Ja, über menschliche Crowd-Prüfer neben der AI-Ebene | Von Menschen geprüfte Ergebnisse, nicht nur ein automatisches Bestanden |
| CoTester (TestGrid) | Locators, gebündelt mit Fehlerzusammenfassung | Nicht als verpflichtendes Gate dokumentiert | Die Fehlerzusammenfassung zeigt, was fehlschlug und warum |
| Meticulous | Nichts zu heilen; konstruktionsbedingt gibt es keine Locators | Entfällt, ersetzt die Heilung durch deterministische Wiedergabe | Visuelle Diffs, gefiltert um unwesentliche Änderungen |
| Ranger | Nichts: Ein Fehlschlag geht an Ihren Coding-Agent, der den Code repariert, nicht den Test | Nein, konstruktionsbedingt: „kein Mensch im Loop“ für den Fix-and-Retest-Zyklus | Screenshots, Aufzeichnungen und Traces am PR angehängt |
Schreibt es eigene Tests oder führt es nur aus, was Sie ihm geben
Die zweite Achse, die diese Produkte tatsächlich trennt, ist die Herkunft des Tests. Manche Agents erkunden Ihre App selbstständig und entscheiden, was testenswert ist. Andere warten auf eine Spezifikation, eine Beschreibung in einfacher Sprache oder eine aufgezeichnete Sitzung und führen immer nur aus, worauf ein Mensch sie angesetzt hat. Keiner der Ansätze ist falsch, aber sie bergen unterschiedliche Risiken: Ein Agent, der selbstständig erkundet, kann Abdeckungslücken finden, von denen Sie nichts wussten, während ein Agent, der nur ausführt, was Sie vorgeben, Sie nicht vor dem Feature warnen kann, das niemand zu beschreiben dachte.

| Tool | Erzeugt Tests aus | Erkundet die App eigenständig |
|---|---|---|
| QA Wolf | Produkterkundung plus Workflow-Kartierung | Ja, ausdrücklich, in der Self-Serve-Stufe Platform |
| Mabl | Aufgezeichnete Abläufe und AI-Testplanung | Teilweise; die Abdeckung wächst durch Nutzung, nicht durch einen Kaltstart-Crawl |
| Testim (Tricentis) | Beschreibung in einfacher Sprache über Testim Copilot, plus Aufzeichnung | Nein; spezifikations- und aufzeichnungsgetrieben |
| Applitools Autonomous | Eine gescannte URL oder eine hochgeladene URL-Liste | Ja; es durchsucht die Website, um die Suite aufzubauen |
| Katalon AI | Aufzeichnung plus AI-Skriptgenerierung; Produktionsverkehr über ein Add-on | Optional, über das Add-on True Production Insights |
| testRigor | Gespiegeltes Verhalten echter Produktionsnutzer | Ja; es lernt, wie sich echte Nutzer durch die App bewegen |
| Momentic | Schrittbeschreibungen in natürlicher Sprache | Nein; spezifikationsgetrieben |
| Functionize | Eine beschriebene Testanforderung | Nein; spezifikationsgetrieben |
| Reflect (SmartBear) | Ein dem Agent in natürlicher Sprache gegebenes Ziel | Teilweise; es handelt Schritt für Schritt auf ein Ziel hin, kein freier Crawl |
| Autify | No-Code-Aufzeichnung plus AI-Generierung (Aximo als „Autonomous“ vermarktet) | Nicht im Detail dokumentiert; überwiegend aufzeichnungsgetrieben |
| Rainforest QA | AI Test Planner, der die App kartiert | Ja; es kartiert die App und schlägt vor, was zu testen ist |
| CoTester (TestGrid) | Manuelle und automatisierte Testfallgenerierung aus Anforderungen | Nein; überwiegend anforderungsgetrieben |
| Meticulous | Echte Nutzersitzungen, automatisch erfasst | Zeichnet echte Nutzung auf, statt zu erkunden oder gesagt zu bekommen, was zu testen ist |
| Ranger | Die eigene Navigation auf der Live-Website | Ja; es navigiert selbst durch die Website, um den Test zu erzeugen |
CI/CD-Integration und Fehlertriage
Ein Agent, der nur über ein Dashboard funktioniert, ist ein zweiter Workflow, den man prüfen muss. Der Großteil dieser Liste ist dafür gebaut, in der Pipeline zu laufen, die Sie bereits haben, und einem Entwickler etwas Verwertbares zu übergeben, wenn ein Lauf fehlschlägt: einen Fehlerbericht, der mit angehängten Reproduktionsschritten direkt in Jira oder Linear angelegt wird, kein rotes X ohne Kontext.
| Tool | CI/CD-Integration | Wie es einen Fehlschlag triagiert |
|---|---|---|
| QA Wolf | API- und Webhook-Trigger; Exporte in Open-Source-Playwright | 24-Stunden-Untersuchung durch einen Menschen mit Video, Traces und Logs |
| Mabl | Unbegrenzte Cloud-Parallelität; lokale Läufe sind kostenlos | Intelligente Analyse von Testfehlschlägen markiert eine wahrscheinliche Ursache |
| Testim (Tricentis) | Cloud-Ausführung innerhalb von Tricentis' Continuous-Testing-Suite | AI-gestützte Ursachenanalyse über Testim Copilot |
| Applitools Autonomous | Browser- und geräteübergreifende Cloud-Ausführung; 30+ SDKs | Gruppierte Änderungsprüfung über alle betroffenen Tests |
| Katalon AI | Cloud-Ausführung plus lokale IDE-Läufe | Modul Insights: Ursachenanalyse und Erkennung instabiler Tests |
| testRigor | Parallelisiert über Linux, Windows, Mac, Android und iOS | Gruppiert zusammengehörige Fehlschläge zu einem behebbaren Problem |
| Momentic | Native Integration mit GitHub Actions und GitLab CI | Wiederholungen und Umgehungsversuche des Agents werden pro Lauf protokolliert |
| Functionize | Bis zu 10 parallele Läufe je nach Stufe | Credit-gemessene Laufberichte mit Bestanden/Fehlgeschlagen pro Schritt |
| Reflect (SmartBear) | API-basiert; auch als Tool durch einen verbundenen Coding-Agent aufrufbar | Screenshots und Schrittprotokolle pro Testlauf |
| Autify | CI-integriert bei Aximo (Cloud) und Nexus (lokal plus Cloud) | Skript-Diff wird angezeigt, wenn ein Selbstheilungsereignis eintritt |
| Rainforest QA | Gebaut für schnelles Ausliefern; fügt sich in bestehende Release-Zyklen | AI markiert Ergebnisse, ein menschlicher Prüfer bestätigt Grenzfälle |
| CoTester (TestGrid) | Cloud-Ausführung auf echten Geräten und Browsern | Eingebaute Fehlerzusammenfassung nennt, was fehlschlug und warum |
| Meticulous | Läuft konstruktionsbedingt gegen jeden Pull Request | Filtert Diffs, um unwesentliche visuelle Änderungen auszuschließen |
| Ranger | Ausgelöst per CLI-Befehl aus der eigenen Schleife des Coding-Agents | Standardmäßig kein menschlicher Triageschritt; der Agent testet sich selbst erneut |
Preismodelle: Plätze, Credits und wo Budgets überraschen
In dieser Liste tauchen drei Preisphilosophien auf, und wer sie in einer Budgetprognose vermischt, wird bei der Verlängerung überrascht. Preise pro Platz begrenzen die Kosten pro Person, vervielfachen sich aber mit der Mitarbeiterzahl. Credit- oder nutzungsbasierte Preise skalieren damit, wie hart der Agent arbeitet, was in Ordnung ist, bis eine große Regressionssuite das Monatskontingent in einer Woche verbrennt. Und etliche der leistungsfähigsten Produkte dieser Liste veröffentlichen schlicht gar keinen Preis.

| Tool | Preismodell | Was Teams überrascht |
|---|---|---|
| QA Wolf | Nutzungsbasierte Credits und Runner-Minuten (Self-Serve); vollständig individuell (Managed) | Zwei sehr unterschiedliche Preismodelle unter einer Marke |
| Mabl | Individuelles Angebot; 500 Credits/Monat Startkontingent | Nirgends existiert ein öffentlicher Dollarbetrag, nicht einmal eine Untergrenze |
| Testim (Tricentis) | Kostenloser Community-Plan; alle kostenpflichtigen Stufen individuell | Nur die begrenzte kostenlose Stufe hat öffentliche Preisangaben |
| Applitools Autonomous | Gemessen in „Test Units“; kostenlose Testphase, danach individuell | Test Units sind Applitools' eigene Kennzahl, keine schlichte Testanzahl |
| Katalon AI | Pro Platz, drei separate Produkte, die sich zu einem vierten Bundle kombinieren | Volle Lifecycle-Abdeckung erfordert das Stapeln von Studio plus Platform |
| testRigor | Pauschale Infrastrukturstufe, nicht pro Platz oder pro Test | Unbegrenzte Nutzer und Tests für eine Pauschale, bepreist nach Parallelität |
| Momentic | Reine nutzungsbasierte Credits, veröffentlichter Überschreitungssatz | Mobile Tests zehren am selben Credit-Pool wie Web |
| Functionize | Pauschale plus Credits (Einzelnutzer); pro Nutzer plus Credits (Team) | Team-Credits gelten pro Nutzer, daher verändert jeder Platz die Rechnung nichtlinear |
| Reflect (SmartBear) | Credit-gestaffelt; Dollarpreis je Stufe zurückgehalten | Mobile Tests kosten das 5-Fache an Credits eines Web-Tests |
| Autify | Zwei getrennte Leitern (Aximo und Nexus) plus gestapelte Add-ons | Die falsche Produktlinie zu wählen heißt, das Konto später neu zu bepreisen |
| Rainforest QA | Nicht veröffentlicht; berichtete Verträge skalieren mit dem Testvolumen | Menschlich unterstütztes Testing ist ein separates Add-on auf der AI-Ebene |
| CoTester (TestGrid) | Pro Platz, Mindestabnahme 4 Plätze | Die Mindestabnahme, nicht der Preis pro Platz, setzt den realen Startpreis |
| Meticulous | Nicht veröffentlicht; kostenlos für Open Source | Es gibt nichts, wogegen sich budgetieren ließe, bis ein Vertriebsgespräch stattfindet |
| Ranger | Individuell, Jahresvertrag, beratungsbasiert | Bei keiner Teamgröße existiert eine Self-Serve-Stufe |
Größe und Persona
| Tool | Ideale Teamgröße | Primäre Käufer-Persona |
|---|---|---|
| QA Wolf | 20-500 Mitarbeitende | Head of QA, VP Engineering, der QA vom Team nehmen will |
| Mabl | 20-1.000 Mitarbeitende | QA Director, Head of Quality Engineering |
| Testim (Tricentis) | 100-5.000+ Mitarbeitende | Enterprise QA Director, Test Automation Lead |
| Applitools Autonomous | 50-5.000+ Mitarbeitende | QA Automation Lead, Visual QA Engineer |
| Katalon AI | 10-1.000 Mitarbeitende | QA Manager, der manuelles und automatisiertes Testen gemeinsam führt |
| testRigor | 10-500 Mitarbeitende | QA Lead ohne dediziertes Automatisierungs-Engineering-Team |
| Momentic | 5-200 Mitarbeitende | Engineering Lead in einem Startup, der QA nebenbei verantwortet |
| Functionize | 5-300 Mitarbeitende | QA Engineer, Engineering Manager |
| Reflect (SmartBear) | 5-200 Mitarbeitende | QA Engineer, der bereits auf einen AI-Coding-Agent standardisiert ist |
| Autify | 10-300 Mitarbeitende | QA Manager (Aximo) oder Automation Engineer (Nexus) |
| Rainforest QA | 10-500 Mitarbeitende | Engineering Director, der AI plus Crowd-Testing durch Menschen will |
| CoTester (TestGrid) | 10-200 Mitarbeitende | QA Manager, der eine gebündelte Agent-Suite will |
| Meticulous | 5-500 Mitarbeitende | Frontend Engineering Lead, der wartungsfreie Regressionsabdeckung will |
| Ranger | 5-100 Mitarbeitende | Gründer oder Eng Lead, der AI-Coding-Agents betreibt, die ein Test-Orakel brauchen |
1. QA Wolf: AI-Testerstellung, gestützt von einem Menschen, der jeden Fehlschlag prüft
QA Wolf versteht sich als Hybrid aus Plattform und Service, der QA einem Team „komplett“ abnimmt, und seine Stufe Coverage as a Service ist die wörtlichste Version dieses Versprechens auf dieser Liste: QA Wolfs eigenes Team baut und pflegt die End-to-End-Abdeckung, garantiert „zero flakes“ und untersucht jeden Fehlschlag innerhalb von 24 Stunden, mit einem von Menschen verifizierten Fehlerbericht im Anhang. Die Self-Serve-Stufe Platform übergibt dieselbe AI-Erkundung und Workflow-Kartierung stattdessen an Ihr eigenes Team und exportiert nach Open-Source-Playwright, sodass bei den zugrunde liegenden Tests kein Vendor-Lock-in entsteht.
Diese Spannweite ist auch das, was man vor dem Kauf verstehen sollte: Platform und Coverage as a Service sind nahezu zwei verschiedene Produkte unter einer Marke, das eine transparent nach Nutzung bepreist, das andere ganz hinter einem Vertriebsgespräch.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Eine Managed-Stufe, in der ein Mensch jeden Fehlschlag in 24 Stunden untersucht | Der echte Preis der Managed-Stufe wird nie veröffentlicht |
| Self-Serve-Stufe Platform mit transparenten Preisen pro Credit und pro Minute | Bei Self-Serve muss Ihr Team die Automatisierung weiterhin selbst verantworten |
| Exporte in Open-Source-Playwright, kein Lock-in | Unbegrenzte parallele Läufe gelten nur für die Self-Serve-Stufe |
| AI-Erkundung und Workflow-Kartierung in Platform enthalten | „Garantiert zero flakes“ ist eine Aussage der Managed-Stufe, nicht von Self-Serve |
Preise: Platform ist nutzungsbasiert: AI-Credits zu je $0,01, Runner-Minuten zu je $0,15, keine Gebühr pro Platz oder pro Test, mit einer kostenlosen Stufe zum Ausprobieren. Coverage as a Service ist individuell, für ein Angebot den Vertrieb kontaktieren. Quelle: qawolf.com/pricing.
Am besten geeignet für: Teams, die End-to-End-QA von einem von Menschen geprüften Managed Service erledigen lassen wollen, mit einer günstigeren Self-Serve-Option für Teams, die die Automatisierung selbst übernehmen.
2. Mabl: Abdeckung, die sich selbst baut, ausführt und heilt
Mabls eigene Positionierung, „Abdeckung, die sich selbst baut, sich selbst ausführt und sich selbst wiederherstellt“, ist der direkteste agentische Anspruch dieser Kategorie und reicht weiter als bei den meisten: Web-, Mobile-, API-, Barrierefreiheits- und Performance-Tests teilen sich einen Credit-Pool unter einem Abonnement statt getrennter SKUs. Unbegrenzte lokale Testläufe und unbegrenzte Cloud-Parallelität sind in jedem Plan enthalten, mit einem Startkontingent von 500 Credits für Cloud-Läufe.
Der Haken ist, dass nichts davon mit einer öffentlichen Zahl daherkommt. Jeder Plan ist ein individuelles Angebot, sodass ein Team ohne vorheriges Gespräch mit dem Vertrieb kein Budget grob überschlagen kann, ungewöhnlich für ein so verbreitet eingesetztes Produkt.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Web-, Mobile-, API-, Barrierefreiheits- und Performance-Tests in einem Produkt | Nirgends eine öffentliche Preisstufe oder ein Einstiegspreis |
| Unbegrenzte lokale Läufe und unbegrenzte Cloud-Parallelität | Cloud-Credits sind der echte Verbrauchszähler, und der Umrechnungskurs ist nicht öffentlich |
| Live-Support 24/5 mit einem benannten Customer Success Manager | Mobile-App-Tests sind ein separates kostenpflichtiges Add-on |
| 14 Tage kostenlose Testphase zur Evaluierung vor einem Vertriebsgespräch | Transparenz der Selbstheilung (was sich änderte, wer es freigibt) ist nicht dokumentiert |
Preise: Individuell, auf Angebotsbasis. Ein monatliches Startkontingent von 500 Credits deckt Cloud-Testläufe über alle Fähigkeiten hinweg; lokale Läufe sind kostenlos. Quelle: mabl.com/pricing.
Am besten geeignet für: Teams, die eine agentische Plattform für Web-, Mobile-, API- und Barrierefreiheits-Tests wollen, statt Einzelwerkzeuge zusammenzustückeln.
3. Testim (Tricentis): Der Gartner- und Forrester-Leader für autonomes Enterprise-Testing
Testims Übernahme durch Tricentis stellte es in den größten dedizierten Testing-Anbieter dieser Kategorie, und 2025-26 zeigte sich das in unabhängiger Validierung: Tricentis wurde als Leader im ersten Gartner Magic Quadrant für AI-Augmented Software Testing Tools und als Leader in Forresters erster Wave für Autonomous Testing Platforms geführt, bewertet dafür, „eine der umfassendsten Plattformen auf Enterprise-Niveau für funktionale und nichtfunktionale Tests“ zu bieten. Testim Copilot erzeugt Teststeps aus einer Beschreibung in einfacher Sprache im Editor, und Tricentis vermarktet inzwischen eine agentische Ebene darüber: beschreiben, was getestet werden soll, und es geschieht automatisch.
Für ein Team, das neben Web bereits Salesforce oder Mobile betreibt, ist das ein echter Vorteil: Testim deckt alle drei unter einer Tricentis-Beziehung ab statt unter drei getrennten Anbieterverträgen.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Unabhängig von Gartner und Forrester als Leader validiert | Kein öffentlicher Preis für irgendeine kostenpflichtige Stufe |
| Testim Copilot erzeugt Teststeps aus einer Beschreibung in einfacher Sprache | Der kostenlose Community-Plan ist auf einen pro Organisation begrenzt |
| Deckt Web, Salesforce und Mobile bei einem Anbieter ab | Support 24x5 erfordert eine kostenpflichtige Stufe Essentials, Pro oder Mobile |
| Teil von Tricentis' breiterer Continuous-Testing-Suite | Enterprise-Pakete werden per Scheck oder Überweisung beglichen, keine Self-Serve-Abrechnung |
Preise: Ein kostenloser Community-Plan ist nach der Testphase verfügbar (nur Self-Service, einer pro Organisation). Testim Web, Testim Salesforce und Testim Mobile erfordern für Preise die Kontaktaufnahme mit dem Vertrieb. Quelle: testim.io/pricing.
Am besten geeignet für: Enterprise-QA-Teams, die einen von Analysten validierten Anbieter wollen, der Web-, Salesforce- und Mobile-Tests unter einer Beziehung abdeckt.
4. Applitools Autonomous: Eine URL-Liste zu einer vollständigen Testsuite durchsuchen
Applitools hat seinen Ruf mit Visual AI aufgebaut, und Autonomous ist der Punkt, an dem diese Expertise auf die Erzeugung und Pflege der Tests selbst ausgeweitet wird: Richten Sie es auf eine URL oder eine Liste von URLs, und es scannt die Website, um automatisch eine Testsuite mit eingebauten visuellen Checkpoints zu erzeugen, ganz ohne Code. Forrester führte Applitools in seiner ersten Wave für Autonomous Testing Platforms als Strong Performer, eine Stufe unter Tricentis, aber eine echte unabhängige Validierung in einer brandneuen Kategorie.
Die Selbstheilung ist hier eine der transparenteren dieser Liste: Wenn die AI Änderungen auf der Website erkennt, gruppiert sie diese, sodass ein Team „Hunderte von Tests per Klick“ prüfen und aktualisieren kann, statt jeden einzeln aufzuspüren, ein Modell der Stapelprüfung statt einer stillen Heilung.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Erzeugt automatisch eine vollständige Testsuite durch Scannen einer URL-Liste | Kein öffentlicher Self-Serve-Preis über die kostenlose Testphase hinaus |
| Visuelles, funktionales und API-Testing in einem Workflow | „Test Unit“ ist Applitools' eigene Kennzahl, keine schlichte Testanzahl |
| Gruppiert erkannte Änderungen zur Stapelfreigabe per Klick | Voller Produktivbetrieb erfordert die individuell bepreiste Stufe Public oder Dedicated Cloud |
| Von Forrester als Strong Performer bei Autonomous Testing Platforms geführt, Q4 2025 | Nicht-Programmierer haben den leichtesten Einstieg; tiefe individuelle Logik profitiert weiterhin von Code |
Preise: Starter enthält eine kostenlose Testphase mit 50 Test Units, unbegrenzten Nutzern und Ausführungen. Die Pläne Public Cloud und Dedicated Cloud (50+ Test Units, SSO, On-Prem-Optionen) sind individuell, Vertrieb kontaktieren. Quelle: applitools.com/pricing.
Am besten geeignet für: Teams, die autonome End-to-End-Testgenerierung gebündelt mit Applitools' etablierter Engine für visuelle Regression wollen.
5. Katalon AI: Eine Plattform für manuelles und automatisiertes Testen, AI kostenlos enthalten
Katalons Wette ist die Breite: eine Plattform für Low-Code- und Full-Code-Testerstellung, manuelles Testfallmanagement, Cloud-Ausführung und Reporting, mit einem AI Assistant und MCP Server, die jetzt ohne Aufpreis in jeder einzelnen Stufe enthalten sind. Dieser letzte Punkt zählt in einer Kategorie, in der die meisten Wettbewerber AI hinter eine Premiumstufe oder ein individuelles Angebot stellen. Katalons AI beherrscht sowohl Skriptgenerierung mit Selbstheilung als auch AI-gestützte manuelle Testfallgenerierung für Teams, die noch nicht vollständig automatisieren wollen.
Das optionale Add-on True Production Insights geht weiter in autonomes Terrain: Es kartiert echte Nutzerreisen gegen die bestehende Testabdeckung und erzeugt die fehlenden Tests automatisch, näher am Erkundungsmodell von Applitools oder Rainforest als an Katalons eigenem Standard, der auf Aufzeichnung setzt.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| AI Assistant und MCP Server in jeder Stufe kostenlos enthalten | Volle Lifecycle-Abdeckung erfordert das Stapeln von zwei der drei Produkte |
| Echte, veröffentlichte Preise pro Platz mit hohen Jahresrabatten | Jahresrabatte erfordern eine Bindung; monatlich ist deutlich teurer |
| Modul Insights für Fehlerursachen und Erkennung instabiler Tests | Transparenz der Selbstheilung (Freigabe-Gates) ist nicht ausdrücklich dokumentiert |
| Das Add-on True Production Insights erzeugt fehlende Testabdeckung automatisch | Dieses Produktions-Monitoring-Add-on wird separat bepreist und verkauft |
Preise: Katalon Studio Enterprise kostet $180/Platz/Monat ($84/Platz/Monat jährlich). True Platform kostet $70/Platz/Monat ($59/Platz/Monat jährlich). True Automation (beides kombiniert) kostet $200/Platz/Monat ($167/Platz/Monat jährlich). Enterprise ist individuell. Quelle: katalon.com/pricing.
Am besten geeignet für: Teams, die manuelles und automatisiertes Testen plus AI-Unterstützung auf einer Plattform ohne zusätzlichen AI-Posten wollen.
6. testRigor: Tests, erzeugt aus dem tatsächlichen Verhalten Ihrer Nutzer
testRigors Kernwette ist, dass Selektoren von vornherein das falsche Fundament für einen robusten Test sind. Statt XPath- oder CSS-Locators wurde seine AI darauf trainiert, eine Web- oder Mobile-App so zu lesen wie ein Mensch, und sie kann Tests automatisch erzeugen und pflegen, indem sie spiegelt, wie sich echte Nutzer im Produktivbetrieb durch die Anwendung bewegen, und deckt dabei standardmäßig bis zu 1.000 Testfälle ab. Wenn etwas bricht, gruppiert testRigor alle Fälle, die vom selben zugrunde liegenden Problem betroffen sind, damit ein Team es einmal behebt, statt einzelnen defekten Locators nachzujagen.
Die Preise folgen demselben Muster, „anders als alle anderen“: überhaupt keine Gebühr pro Nutzer oder pro Test, SSO für das ganze Unternehmen enthalten, und die gesamte Rechnung skaliert nur damit, wie viel parallele Ausführungsinfrastruktur Sie brauchen.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Heilt sich selbst, indem es die Seite versteht, statt einen Selektor neu zu raten | Volle plattformübergreifende Abdeckung (Mac, Android, iOS, Windows Native) kostet $900/Monat |
| Unbegrenzte Nutzer und unbegrenzte Testfälle für eine Pauschale | Die Einstiegsstufe ist nur Linux Chrome, eine echte Einschränkung für mobilelastige Suiten |
| Erzeugt Tests automatisch aus echtem Verhalten von Produktionsnutzern | Autonome Abdeckung ist standardmäßig bei 1.000 Testfällen gedeckelt |
| Gruppiert zusammengehörige Fehlschläge zu einem behebbaren Problem | Kein veröffentlichter Enterprise-Preis; individuelle Pläne erfordern ein Vertriebsgespräch |
Preise: Private Linux Chrome startet bei $300/Monat. Private Complete (Ubuntu, Windows, Mac, Android, iOS, Windows Native, alle AI-Fähigkeiten) startet bei $900/Monat. Eine kostenlose, vollständig öffentliche Stufe existiert zur offenen Evaluierung. Enterprise ist individuell. Quelle: Preis- und FAQ-Seiten von testrigor.com.
Am besten geeignet für: Teams, die Tests aus echtem Nutzerverhalten statt aus einer geschriebenen Spezifikation erzeugen wollen, ohne pro Platz zu zahlen.
7. Momentic: Nutzungsbasierte Preise ohne Platzaufschlag
Momentic ist eines der transparenteren Produkte dieser Liste, was die tatsächlichen Kosten seiner AI betrifft: Jeder Plan wird in Credits gemessen, mit einem veröffentlichten Überschreitungssatz ($0,01875 pro Credit), in keiner Stufe gibt es eine Gebühr pro Platz, und der kostenlose Plan (2.000 Credits im Monat, grob 200 Testläufe) reicht aus, damit ein kleines Team wirklich evaluieren kann, bevor es etwas zahlt. Locators in natürlicher Sprache ersetzen brüchige Selektoren, selbstheilende Tests fangen kleine UI-Änderungen ab, und Wiederholungen des Agents behandeln vorübergehende Fehler, mit Mobile-Tests auf echten iOS- und Android-Emulatoren ab der kostenlosen Stufe.
Der Preis für diese Einfachheit mit Pauschalsatz ist, dass intensivere Nutzung, besonders mobil, aus demselben gemeinsamen Credit-Pool zieht wie alles andere, sodass eine mobilelastige Suite ein Kontingent schneller aufbrauchen kann, als der Listenpreis nahelegt.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Keine Gebühren pro Platz; die Preise sind rein nutzungsbasiert | Enterprise-Funktionen (SAML SSO, SCIM, Audit-Logs) erfordern ein individuelles Angebot |
| Ein veröffentlichter, transparenter Überschreitungssatz | Freigabe-Gates für die Selbstheilung sind nicht dokumentiert; die Heilung greift automatisch |
| Native Integration mit GitHub Actions und GitLab CI | Mobile-Tests zehren am selben Credit-Pool wie Web |
| Multimodale Assertions über Text, Visuelles und DOM | Der kostenlose Plan stoppt hart bei 2.000 Credits, ohne Überschreitungsoption |
Preise: Free kostet $0 (2.000 Credits/Monat). Pay-as-you-go kostet $125/Monat (10.000 Credits/Monat) plus $0,01875 pro Credit bei Überschreitung. Enterprise ist individuell, bepreist nach Testvolumen. Quelle: momentic.ai/pricing.
Am besten geeignet für: Teams, die transparente, creditbasierte Preise ohne Aufschlag pro Platz wollen, wenn die Mitarbeiterzahl wächst.
8. Functionize: Der günstigste Self-Serve-Einstieg in agentisches Testing
Functionize vermarktet sein Produkt schlicht als „einen unabhängigen Testing-Agent für Ihren gesamten Web-UI-Workflow“, und seine Preise sind die zugänglichsten dieser Liste mit großem Abstand: eine wirklich nutzbare kostenlose Stufe mit 200 Credits im Monat und eine Stufe Pro für 20 Dollar im Monat, ein Bruchteil dessen, was der Rest dieser Kategorie vor jeder echten Nutzung verlangt. Functionizes eigene technische Texte konzentrieren sich gezielt auf das Problem instabiler Tests, zu dessen Lösung diese ganze Kategorie existiert, und seine Stufe Max ergänzt SMS- und MFA/OTP-Tests für Workflows, an denen einfachere Automatisierungstools scheitern.
Die Team-Preise verschieben das Modell: Die Stufen Growth und Scale berechnen pro Nutzer, wobei jeder Nutzer sein eigenes Credit-Kontingent mitbringt statt eines gemeinsamen Team-Pools, was sich vor einer Skalierung über ein paar Plätze hinaus durchzurechnen lohnt.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Der günstigste kostenpflichtige Einstieg dieser Kategorie ($20/Monat) | Die Stufen Growth und Scale berechnen Credits pro Nutzer, nicht als gemeinsamen Pool |
| SMS- und MFA/OTP-Tests in der Stufe Max | Freigabe-Gates für die Selbstheilung sind nicht dokumentiert |
| Bis zu 10 parallele Läufe in höheren Stufen | 1 Monat Datenaufbewahrung in jeder Stufe, selbst in den Enterprise-Preisstufen darunter |
| Ein Credit-Modell, einfach genug, um es in einer Tabelle zu prognostizieren | Enterprise ist die einzige Stufe mit Premium-Support und Account-Management |
Preise: Free kostet $0/Monat (200 Credits). Pro kostet $20/Monat (400 Credits). Max kostet $100/Monat (2.000 Credits, bis zu 10 parallele Läufe). Growth (Team) kostet $40/Nutzer/Monat (400 Credits/Nutzer). Scale (Team) kostet $200/Nutzer/Monat (2.000 Credits/Nutzer). Enterprise ist individuell. Quelle: functionize.com/pricing.
Am besten geeignet für: Kleine Teams oder einzelne QA Engineers, die agentisches Testing ausprobieren wollen, ohne vorab Budget zu binden.
9. Reflect (SmartBear): Ein MCP-Server, den Ihr Coding-Agent direkt aufrufen kann
Reflect hat sich als No-Code-Testplattform einen Namen gemacht, und sein markantester Schritt seit dem Wechsel zu SmartBear 2024 ist architektonisch und kein Funktions-Häkchen: Seit März 2026 kann sich ein Coding-Agent über einen MCP-Server mit Reflect verbinden und es als Tool nutzen, Teststeps mit Prompts in natürlicher Sprache hinzufügen, Screenshots machen, um den Anwendungszustand zu prüfen, bestehende Testsegmente wiederverwenden und fehlgeschlagene Schritte wiederholen, statt dass eine Person in ein separates Reflect-Dashboard wechselt. Die Selbstheilung läuft über visuelle Objekterkennung statt über codebasierte Locators und passt sich automatisch an, wenn sich die UI verschiebt.
Diese Formulierung mit „automatisch“ verdient genaues Lesen: SmartBears eigenes Material beschreibt eine Heilung, die Tests „ohne manuelles Eingreifen“ aktualisiert, was Reflect am automatischen Ende des Transparenzspektrums einordnet statt an dem Ende mit Stapelprüfung, das Applitools und testRigor nutzen.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Per MCP direkt von einem verbundenen AI-Coding-Agent aufrufbar | Kein veröffentlichter Dollarpreis für irgendeine Stufe |
| Visuelle Objekterkennung für Selbstheilung über UI-Änderungen hinweg | Die Heilung greift automatisch, ohne dokumentierten Freigabeschritt |
| Unbegrenzte Nutzer und unbegrenzte Testerstellung in jeder Stufe | Mobile-Tests kosten das 5-Fache an Credits eines Web-Tests |
| 14 Tage kostenlose Testphase mit vollem Funktionsumfang | Web-, Mobile- und API-Tests ziehen alle aus einem gemeinsamen Credit-Pool |
Preise: Premium (5.000 Credits/Monat), Advanced (20.000 Credits/Monat) und Enterprise (40.000 Credits/Monat, Tests in privater Umgebung) sind alle credit-gestaffelt, wobei der Dollarpreis bis zu einem Vertriebsgespräch zurückgehalten wird. Web-Tests kosten 1 Credit, Mobile 5 Credits, API 0,1 Credits. Quelle: reflect.run/pricing.
Am besten geeignet für: Teams, die bereits auf einen AI-Coding-Agent standardisiert sind und wollen, dass Testen als Tool-Aufruf in diesem Workflow stattfindet, nicht in einer separaten App, die man prüfen muss.
10. Autify: Zwei Produkte, eine Selbstheilungs-Engine
Autify betreibt unter einer Marke zwei verschiedene Produktlinien. Aximo, vermarktet als „Your Autonomous AI Tester“, ist cloudbasiert und pro Testschritt in Credits gemessen und läuft bemerkenswerterweise unter der Haube auf Claude-Modellen (seine Preisseite bepreist Schritte der Sonnet-Klasse mit 1x Credit-Verbrauch und Schritte der Haiku-Klasse günstiger). Nexus ist das klassischere Gegenstück: ein Playwright-basiertes Tool, das No-Code- und Full-Code-Erstellung mischt, gedacht für Teams, die AI-Generierung wollen, ohne die Kontrolle auf Codeebene aufzugeben.
Beide teilen sich Selbstheilung über Web und Mobile, aber die zwei Preisleitern teilen sich keine Geldbörse: Wer Aximo wählt, obwohl ein Team Nexus brauchte (oder umgekehrt), beginnt das Preisgespräch von vorn.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Zwei Produkte, die sowohl autonome als auch codebasierte Teststile abdecken | Zwei getrennte Preisleitern, die sich weder Credits noch Plätze teilen |
| Aximo ausdrücklich als autonomer Tester vermarktet und gebaut | Nexus stapelt Add-ons pro Nutzer ($250/Monat), pro Parallelität ($150/Monat) und für den Workspace |
| Selbstheilung über Web und Mobile bei beiden Produkten | Tests von Desktop-Apps gibt es bei Aximo nur in Enterprise |
| Rabatte bei jährlicher Abrechnung für beide Produktlinien | Die kostenlosen Stufen sind deutlich begrenzt: 1 Nutzer, bei Nexus nur lokal |
Preise: Aximo Core kostet $120/Monat ($99/Monat jährlich, 6.000 Credits/Monat). Aximo Team kostet $550/Monat ($450/Monat jährlich, 30.000 Credits/Monat). Nexus Professional kostet $400/Monat oder $3.600/Jahr (1 Nutzer). Beide ergänzen individuelle Enterprise-Stufen. Quelle: autify.com/pricing.
Am besten geeignet für: Teams, die von einer Anbieterbeziehung aus zwischen einem vollständig autonomen Tester (Aximo) und einem Playwright-basierten Hybrid (Nexus) wählen wollen.
11. Rainforest QA: AI-Testplanung mit einer menschlichen Crowd dahinter
Rainforest QAs AI Test Planner kartiert eine Anwendung automatisch und schlägt vor, was zu testen ist, erzeugt Tests über eine visuelle No-Code-Oberfläche und heilt sich selbst, wenn sich die UI ändert, dieselbe Form wie bei etlichen anderen Produkten dieser Liste. Was Rainforest abhebt, ist das, was hinter dieser Ebene sitzt: menschliche Crowd-Tester, die exploratives Testen und Grenzfälle übernehmen können, die die AI allein verpassen würde, positioniert als Brücke zwischen aufwendiger skriptbasierter Automatisierung und manuellen Regressionstests.
Diese menschliche Ebene ist eine echte Antwort auf das Vertrauensproblem der Selbstheilung, das diese ganze Kategorie lösen muss, bedeutet aber auch, dass Rainforests Preise die unberechenbarsten dieser Liste sind: Nichts ist veröffentlicht, und reale Verträge, die laut Käuferdaten Dritter berichtet werden, reichen von rund 1.500 \(im Monat für ein kleines Team bis weit über 7.000\) im Monat bei hohem Volumen.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Menschliche Crowd-Prüfer hinter der AI-Testplanung und der Selbstheilungsebene | Nirgends auf der Website des Anbieters veröffentlichte Preise |
| Der AI Test Planner kartiert die App automatisch und schlägt Abdeckung vor | Menschlich unterstütztes Testing wird als separates Add-on bepreist |
| Visuelle No-Code-Oberfläche für Teams ohne dedizierte Automatisierungsingenieure | Berichtete reale Verträge gehen jährlich weit in den fünfstelligen Bereich |
| Speziell für Teams gebaut, die schnell ausliefern müssen, ohne aufwendiges Skripting | Die Budgetierung erfordert ein Vertriebsgespräch, bevor irgendeine Zahl erscheint |
Preise: Nicht veröffentlicht. Berichtet (Dritte, auf Basis anonymisierter Vertragsdaten von Käufern): kleine Teams um 1.500 bis 3.000 $/Monat, mittelgroße Teams 3.500 bis 6.500 $/Monat, Enterprise 7.000 bis 12.000+ $/Monat, durchschnittlicher jährlicher Vertragswert um $62.400. Quelle: Vendr; Rainforest QAs eigene Preisseite erfordert ein Vertriebsgespräch.
Am besten geeignet für: Teams, die AI-gesteuerte Testplanung wollen, aber der Selbstheilung nicht ohne menschlichen Prüfer im Loop vertrauen mögen.
12. Meticulous: Keine Selektoren, keine Testerstellung, nur Session Replay
Meticulous verfolgt einen grundlegend anderen Ansatz als jedes andere Produkt dieser Liste: Statt Tests aus einer Spezifikation, einem Crawl oder einer Aufzeichnung zu erzeugen, zeichnet es echte Nutzersitzungen auf (aus Staging oder Produktion) und spielt sie bei jedem Pull Request deterministisch gegen neuen Code ab, wobei visuelle Unterschiede automatisch markiert werden. Weil es nichts gibt, was einem klassischen Locator ähnelt, gibt es im üblichen Sinn nichts zu „heilen“; Meticulous' echtes technisches Problem ist das umgekehrte, nämlich visuelle Diffs herauszufiltern, die tatsächlich keine Rolle spielen, damit ein Team nicht in Fehlalarmen ertrinkt.
Das macht es zu einem grundlegend anderen Kauf als der Rest dieser Liste: kein Ersatz für gezielte, skriptbasierte Testfälle, die bestimmte Geschäftslogik prüfen, sondern ein wartungsfreies Sicherheitsnetz, das Regressionen auffängt, für die niemand daran dachte, einen Test zu schreiben.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Keine Testerstellung oder -wartung; Sitzungen werden automatisch erfasst | Kein Ersatz für gezielte, skriptbasierte Tests der Geschäftslogik |
| Keine Locators, also kann sich eine Selbstheilung nirgends irren | Keine veröffentlichten Preise; erfordert ein Vertriebsgespräch |
| Läuft konstruktionsbedingt gegen jeden Pull Request, CI-nativ | Die Abdeckung hängt völlig davon ab, welche echten Sitzungen aufgezeichnet werden |
| Kostenlos für Open-Source- und öffentliche Repositories | Deterministische Wiedergabe ist eine engere Aufgabe als vollständiges End-to-End-Skripting |
Preise: Nicht veröffentlicht; als individuell beschrieben, Vertrieb kontaktieren. Kostenlos für Open-Source-Projekte und öffentliche Repositories. Quelle: meticulous.ai (zum Zeitpunkt dieser Prüfung keine öffentliche Preisseite).
Am besten geeignet für: Frontend-Teams, die automatische Regressionsabdeckung aus echter Nutzung wollen, ohne einen einzigen Testfall zu schreiben oder zu pflegen.
13. CoTester (TestGrid): Ein gebündeltes AI-Testing-Teammitglied, nach Plätzen gemessen
CoTester versteht sich als „Ihr stets verfügbares AI-Teammitglied für das Testen“, gebaut auf TestGrids breiterer agentischer Plattform, und bündelt mehr als 27 AI-Testing-Agents, die Testfallgenerierung, Selbstheilung, Fehlerzusammenfassung, visuelles Testing, Performance-Testing, API-Testing und Geolokalisierungs-Tests abdecken, in jedem Platz ohne zusätzliche Gebühr pro Agent. Zugriff auf echte Geräte und Browser ist ab der Einstiegsstufe enthalten, was für Teams zählt, deren Fehler nur auf bestimmter Hardware auftreten.
Die Zahl, auf die man achten sollte, ist die Mindestabnahme, nicht der Platzpreis: Starter verlangt vier Plätze, bevor ein Team überhaupt starten kann, was die reale monatliche Untergrenze näher an $800 rückt als an den Listenpreis von $199.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| 27+ AI-Testing-Agents gebündelt, ohne Gebühren pro Agent | Die Mindestabnahme von 4 Plätzen bedeutet einen realen Startpreis von etwa $800/Monat |
| Zugriff auf echte Geräte und Browser ab der Einstiegsstufe | Transparenz der Selbstheilung (Freigabe-Gates) ist nicht im Detail dokumentiert |
| Fehlerzusammenfassung als benanntes Triage-Feature eingebaut | Token-Kontingent und Preis der Stufe Growth sind beide individuell |
| On-Premise- oder Private-Cloud-Option in der obersten Stufe | Im Einstiegspaket Starter sind nur 5.000 Tokens/Monat enthalten |
Preise: Starter kostet $199/Platz/Monat, Mindestabnahme 4 Plätze, inklusive 4 Geräte/Browser und 5.000 Tokens/Monat. Growth ist individuell (unbegrenzte Tokens, keine Ausführungslimits). Custom Device Lab (On-Premise oder Private Cloud) ist ebenfalls individuell. Quelle: testgrid.io/pricing.
Am besten geeignet für: Teams, die eine gebündelte Agent-Suite für funktionales, visuelles, Performance- und API-Testing wollen, ohne jede Fähigkeit einzeln zu bepreisen.
14. Ranger: Gebaut, damit ein Coding-Agent seine eigenen Fehlschläge repariert
Ranger ist das autonomste Produkt dieser Liste und für einen anderen Nutzer gebaut als der Rest: nicht für einen QA Engineer, der Ergebnisse prüft, sondern für einen AI-Coding-Agent, der eine schnelle, verlässliche Möglichkeit braucht, seine eigene Arbeit zu kontrollieren. Führen Sie ranger go aus, und es startet einen Browser, testet das Feature und liefert ein Urteil; schlägt etwas fehl, greift Ihr Coding-Agent es auf, repariert den zugrunde liegenden Code und testet erneut über Ranger, ausdrücklich „kein Mensch im Loop“ für diesen Zyklus. Tests werden von AI Agents erzeugt, die die Website navigieren, und als Playwright kodifiziert, dann von Rangers eigenen menschlichen QA-Expertinnen und -Experten geprüft, bevor ihnen als Teil der Suite vertraut wird, sodass die menschliche Prüfung einmal bei der Testerstellung stattfindet statt bei jedem späteren Lauf.

Dieses Design verdient es, schlicht gegen die Kernthese dieses Artikels gehalten zu werden: Ranger versucht gar nicht erst, einen defekten Test still zu heilen. Wenn etwas bricht, schlägt es ehrlich fehl und übergibt die Reparatur an den Agent, der es verursacht hat, mit Screenshots, Aufzeichnungen und Traces als Nachweis, den ein Mensch an einem Pull Request weiterhin prüfen kann.
| Das bekommen Sie | Das bekommen Sie nicht |
|---|---|
| Speziell für die eigene Retry-Schleife eines AI-Coding-Agents gebaut | Keine menschliche Prüfung einzelner Läufe, nur bei der ersten Testerstellung |
| Tests werden zu offenem Playwright kompiliert, einmal von menschlichen QA-Experten geprüft | Nirgends veröffentlichte Preise; jede Zusammenarbeit beginnt mit einer Demo |
| Nachweise (Screenshots, Aufzeichnungen, Traces) an einen Pull Request anhängbar | Nicht gebaut für einen menschlichen QA Engineer, der Ergebnisse über ein Dashboard steuert |
| Keine Selbstheilung, der man misstrauen müsste; ein Fehlschlag schlägt ehrlich fehl | Nur jährliche, beratungsbasierte Verträge; keine Self-Serve-Stufe |
Preise: Nicht veröffentlicht. Jahresverträge, nach einer Beratung individuell angeboten auf Basis der Größe der Testsuite, mit gehosteter Testinfrastruktur, Testerstellung und Prüfung durch menschliche Experten. Quelle: ranger.net (keine öffentliche Preisseite).
Am besten geeignet für: Teams, die AI-Coding-Agents betreiben und wollen, dass diese Agents ihre eigene Arbeit mit minimaler menschlicher Beteiligung verifizieren und reparieren.
So entscheiden Sie: Entscheidungsrahmen
Wählen Sie nach Testerstellungsmodell, Transparenz der Selbstheilung, menschlicher Prüfung, CI-Passung und der Preiseinheit, die zu Ihrer Suite passt.

| Wenn Sie brauchen... | Wählen Sie... | Warum |
|---|---|---|
| QA komplett abgenommen, mit einem Menschen, der jeden Fehlschlag prüft | QA Wolf | Coverage as a Service verbindet AI-Testerstellung mit einer 24-Stunden-Untersuchung durch einen Menschen bei jedem Fehlschlag |
| Eine agentische Plattform für Web, Mobile, API und Barrierefreiheit | Mabl | „Baut sich selbst, läuft selbst, stellt sich selbst wieder her“, mit unbegrenzter Cloud-Parallelität |
| Testing auf Enterprise-Niveau mit unabhängiger Analystenvalidierung | Testim (Tricentis) | Als Leader im ersten Gartner-MQ für AI-Augmented Software Testing und in Forresters Autonomous-Testing-Wave geführt |
| Visuelle Regression gebündelt mit autonomer End-to-End-Generierung | Applitools Autonomous | Scannt eine URL-Liste zu einer vollständigen Suite, bündelt Änderungen zur Freigabe per Klick |
| Eine Plattform für manuelles und automatisiertes Testen, AI kostenlos enthalten | Katalon AI | AI Assistant und MCP Server in jeder Stufe ohne Aufpreis |
| Tests, erzeugt aus echtem Produktionsverkehr statt aus Selektoren | testRigor | Liest die App wie ein Mensch und heilt sich selbst ohne CSS oder XPath |
| Transparente nutzungsbasierte Preise ohne Aufschlag pro Platz | Momentic | Veröffentlichter Überschreitungssatz, in keiner Stufe Platzgebühren |
| Der günstigste Weg, agentisches Testing auszuprobieren | Functionize | Echter Funktionsumfang in der Stufe Pro für $20/Monat |
| Testing, das als Tool-Aufruf in Ihrem Coding-Agent läuft | Reflect (SmartBear) | Wird als MCP-Server ausgeliefert, den Ihr Agent direkt aufruft |
| Die Wahl zwischen autonomem und codebasiertem Testing bei einem Anbieter | Autify | Aximo für autonomes Testing, Nexus für Playwright-basierte Kontrolle |
| Ein menschlicher Prüfer hinter der AI, nicht nur ein automatisches Bestanden | Rainforest QA | Menschliche Crowd-Tester sitzen hinter der AI-Testplanung und der Selbstheilungsebene |
| Wartungsfreie Regressionsabdeckung ganz ohne Testerstellung | Meticulous | Zeichnet echte Sitzungen auf und spielt sie gegen neuen Code ab; kostenlos für Open Source |
| Die autonomste Option, gebaut für die eigene Schleife eines Coding-Agents | Ranger | Konstruktionsbedingt kein Mensch im Loop für den Fix-and-Retest-Zyklus |
Typische Fehler beim Kauf von QA-Agents, die Sie vermeiden sollten
Prüfen Sie vor der Unterschrift den Umfang der Heilung, Freigabeprotokolle, Erkundungstiefe, den Umgang mit instabilen Tests, Mindestabnahmen und den realen Credit-Verbrauch.

| Fehler | So sieht es aus | Was Sie stattdessen tun sollten |
|---|---|---|
| Der Selbstheilung vertrauen, ohne zu prüfen, was sie heilt | Annehmen, dass „Selbstheilung“ bei jedem Anbieter dasselbe bedeutet | Gezielt fragen: Repariert es nur Locators, oder kann es auch eine Assertion anfassen |
| Nie nach einem Freigabe-Gate fragen | Jeden Sprint ein grüner Build, ohne zu wissen, wie viele Tests automatisch geheilt wurden | Fragen, ob jede Heilung protokolliert und prüfbar ist, nicht nur still angewendet wird |
| Erkundung mit Ausführung verwechseln | Annehmen, dass ein Agent Abdeckungslücken findet, weil er „AI nutzt“ | Klären, ob er Ihre App selbstständig durchsucht oder nur ausführt, was Sie geschrieben haben |
| Nach dem Listenpreis pro Platz budgetieren | CoTester mit $199/Monat ansetzen und die Mindestabnahme von 4 Plätzen übersehen | Das Kleingedruckte zu Mindestabnahmen, Credit-Pools und Add-ons pro Nutzer lesen |
| Annehmen, eine kostenlose Testphase prognostiziere eine echte Rechnung | Mit 200 Credits testen und dann in eine mobilelastige Suite hochskalieren | Ihr tatsächliches Testvolumen gegen den Credit-Dollar-Kurs durchrechnen, bevor Sie sich binden |
| Den Kauf wie den eines Coding-Agents behandeln | Einen QA-Agent so bewerten, wie Sie Cursor oder Claude Code bewerten würden | Ihn nach Testabdeckung und Fehlererkennung bewerten, nicht nach Geschwindigkeit der Codegenerierung |
| Das Gespräch über instabile Tests überspringen | Wegen der Selbstheilung kaufen und annehmen, dass Flakiness verschwindet | Nach der eigenen Quote des Anbieters für instabile gegenüber echten Fehlschlägen fragen, nicht nach einer Marketingaussage |
| Preise bei der Verlängerung nicht neu prüfen | Nach einem Angebot aus einer Kategorie budgetieren, die ihre Preismodelle noch umbaut | Die aktuelle Seite des Anbieters neu prüfen; nutzungs- und creditbasierte Preise ändern sich oft |
Die nächsten Schritte
Wählen Sie einen Agent und lassen Sie ihn zwei bis drei Wochen lang gegen einen echten, bereits instabilen Teil Ihrer Suite laufen, bevor Sie einen Jahresvertrag unterschreiben. Bevor Sie einer einzigen Selbstheilung vertrauen, bitten Sie den Anbieter, Ihnen das Protokoll zu zeigen: was sich geändert hat, wann und ob eine Person es freigeben musste. Ein Tool, das das im Vertriebsgespräch nicht beantworten kann, verlangt von Ihnen, einer Blackbox Ihr Release-Gate anzuvertrauen. Wenn Ihr Team eher dazu neigt, diese Fähigkeit zu bauen statt zu kaufen, führt der Blueprint für einen AI-QA-Testing-Agent durch dasselbe Act-Ask-Handoff-Design, das diese Anbieter verkaufen, und der Blueprint für einen AI-Code-Review-Agent behandelt die angrenzende Aufgabe, den Pull Request selbst zu prüfen, bevor überhaupt ein Test läuft. Und wenn Sie sich noch nicht auf die breitere Agent-Plattform unter dieser Entscheidung festgelegt haben, ist die besten AI-Agentenplattformen 2026 der Leitfaden, um zuerst diese Ebene zu wählen.

On this page
- Stand August 2026: Was sich geändert hat
- Wichtige Fakten
- Schnellvergleich
- Selbstheilung: Die Funktion, die den Fehler auch verstecken kann
- Schreibt es eigene Tests oder führt es nur aus, was Sie ihm geben
- CI/CD-Integration und Fehlertriage
- Preismodelle: Plätze, Credits und wo Budgets überraschen
- Größe und Persona
- 1. QA Wolf: AI-Testerstellung, gestützt von einem Menschen, der jeden Fehlschlag prüft
- 2. Mabl: Abdeckung, die sich selbst baut, ausführt und heilt
- 3. Testim (Tricentis): Der Gartner- und Forrester-Leader für autonomes Enterprise-Testing
- 4. Applitools Autonomous: Eine URL-Liste zu einer vollständigen Testsuite durchsuchen
- 5. Katalon AI: Eine Plattform für manuelles und automatisiertes Testen, AI kostenlos enthalten
- 6. testRigor: Tests, erzeugt aus dem tatsächlichen Verhalten Ihrer Nutzer
- 7. Momentic: Nutzungsbasierte Preise ohne Platzaufschlag
- 8. Functionize: Der günstigste Self-Serve-Einstieg in agentisches Testing
- 9. Reflect (SmartBear): Ein MCP-Server, den Ihr Coding-Agent direkt aufrufen kann
- 10. Autify: Zwei Produkte, eine Selbstheilungs-Engine
- 11. Rainforest QA: AI-Testplanung mit einer menschlichen Crowd dahinter
- 12. Meticulous: Keine Selektoren, keine Testerstellung, nur Session Replay
- 13. CoTester (TestGrid): Ein gebündeltes AI-Testing-Teammitglied, nach Plätzen gemessen
- 14. Ranger: Gebaut, damit ein Coding-Agent seine eigenen Fehlschläge repariert
- So entscheiden Sie: Entscheidungsrahmen
- Typische Fehler beim Kauf von QA-Agents, die Sie vermeiden sollten
- Die nächsten Schritte