Die besten AI Agents für QA und Testing 2026: 14 Agents, gerankt nach Transparenz der Selbstheilung

Prüflinse eines AI-QA-Testing-Agents, die eine defekte Locator-Hülle sichtbar macht, während der Kern der Testaussage erhalten bleibt

Turn this article into takeaways for your work.

Each assistant summarizes the article only for you and suggests best practices for your work.

QA Wolf und Mabl führen diese Liste für Teams an, die heute das Nächstliegende an agentischer QA-Abdeckung wollen, Testim (Tricentis) und Applitools Autonomous sind die sicherere Wahl, wenn Sie einen Namen wollen, den Analysten bereits geprüft haben, und Momentic oder Functionize sind der richtige Startpunkt für ein kleines Team ohne dedizierte Automatisierungsingenieure. Dieser Leitfaden ordnet 14 AI Agents, die speziell für Software-QA gebaut sind: Tools, die Testfälle aus einer Spezifikation oder durch das Durchsuchen Ihrer App erzeugen, End-to-End- und UI-Läufe ausführen, sich selbst heilen, wenn sich Selektoren ändern, visuelle Regressionen erkennen, APIs ansteuern und einen fehlgeschlagenen Lauf triagieren, geprüft an der jeweiligen Preisseite des Anbieters im August 2026, mit Vermerk überall dort, wo einer keine Zahl veröffentlicht.

Dieser Umfang ist enger, als er klingt. Ein echter Agent plant mehrere Schritte, ruft ein echtes Tool wie einen Browser oder Test-Runner auf und entscheidet, was als Nächstes zu tun ist; ein Produkt, das nur einen Menschen beim Abarbeiten einer Checkliste unterstützt, gehört stattdessen zu den assistiven AI Agents 2026. Dieser Leitfaden behandelt außerdem nicht die AI-Coding-Agents, die den Anwendungscode schreiben, den diese Agents testen, nicht die AI Agents für die Incident Response im Produktivbetrieb nach der Auslieferung und nicht die Observability-Tools für AI Agents, die das Verhalten eines AI Agents selbst nachverfolgen. Er behandelt die Softwarequalität vor dem Release: Funktioniert das Feature, bevor es ausgeliefert wird. Jedes Produkt unten wurde an einer Frage gemessen, die Marketingseiten gern auslassen: Wenn es einen defekten Test „selbst heilt“, sagt es Ihnen, was es geändert hat, und darf ein Mensch Nein sagen, bevor diese Änderung als bestandener Build ausgeliefert wird.

Stand August 2026: Was sich geändert hat

  • Gartner hat 2025 seinen ersten Magic Quadrant für AI-Augmented Software Testing Tools veröffentlicht und Tricentis als Leader mit der höchsten Umsetzungsfähigkeit geführt, das bislang klarste Signal, dass diese Kategorie über einzelne Anbieteraussagen hinaus zu einem von Analysten beobachteten Markt gereift ist.
  • Forrester hat im 4. Quartal 2025 seine erste Wave für Autonomous Testing Platforms durchgeführt und 15 Anbieter danach bewertet, wie weit jeder Testerstellung, -ausführung und -wartung über klassische skriptbasierte Automatisierung hinaus treibt. Tricentis wurde als Leader eingestuft; Applitools als Strong Performer.
  • SmartBear hat am 31. März 2026 neue agentische Fähigkeiten in Reflect ausgeliefert, mit denen ein Entwickler Tests direkt aus einem verbundenen Coding-Agent über einen MCP-Server erzeugen kann statt über ein separates Dashboard, ein deutlich anderes Integrationsmodell als beim Rest dieser Liste.
  • Katalon hat seinen AI Assistant und den MCP Server ohne Aufpreis in jede Preisstufe aufgenommen und setzt darauf, dass AI-gestütztes Testen zur Grunderwartung wird statt zum Premium-Add-on.

Wichtige Fakten

  • Die Kosten schlechter Softwarequalität in den USA betragen mindestens 2,41 Billionen $, wobei aufgelaufene technische Schulden, der Rückstau ungetesteter oder untertesteter Abkürzungen, rund 1,52 Billionen $ dieser Summe ausmachen, laut dem Bericht 2022 des Consortium for IT Software Quality.
  • Die durchschnittliche Testautomatisierungsabdeckung über Organisationen hinweg liegt bei nur 33%, und nur 8% melden eine voll etablierte Automatisierungsstrategie, laut dem World Quality Report 2025-26 von Capgemini, Sogeti und OpenText, einer Umfrage unter 2.000 Führungskräften in 23 Ländern.
  • Nur 15% der Organisationen haben generative AI unternehmensweit in der Qualitätssicherung skaliert, während 43% noch experimentieren, laut demselben World Quality Report 2025-26.
  • 76,8% der Testteams setzen AI in irgendeiner Form ein, aber die Nutzung neigt zum Erstellen statt zum Pflegen: 69,6% nutzen AI für die Testfallgenerierung gegenüber 59,6% für die Testwartung, laut PractiTests Report State of Testing 2026, inzwischen in der 13. Ausgabe.
  • Der Anteil der Teams mit instabilen (flaky) Tests stieg zwischen 2022 und Mitte 2025 von 10% auf 26%, basierend auf einer Analyse von mehr als 10 Mio. Builds, laut Bitrises Report Mobile Insights 2025.
  • 40% der Unternehmensanwendungen werden bis Ende 2026 aufgabenspezifische AI Agents enthalten, gegenüber unter 5% im Jahr 2025, laut Gartner.

Schnellvergleich

Tool Am besten geeignet für Einstiegspreis Zentrale Stärke Zentrale Einschränkung
QA Wolf Teams, die QA komplett abgenommen haben wollen Nutzungsbasiert ($0,01/AI-Credit, $0,15/Runner-Minute); Coverage as a Service individuell Ein Mensch untersucht jeden Fehlschlag innerhalb von 24 Stunden Die individuelle Managed-Stufe versteckt ihren echten Preis hinter einem Vertriebsgespräch
Mabl Agentische Abdeckung für Web, Mobile, API und Barrierefreiheit in einem Produkt Individuell, auf Angebotsbasis (500 Credits/Monat Startkontingent) Positionierung „baut sich selbst, läuft selbst, stellt sich selbst wieder her“ Überhaupt kein öffentlicher Preis, nicht einmal ein Startwert
Testim (Tricentis) Enterprise-Teams, die von Analysten validiertes autonomes Testing wollen Kostenloser Community-Plan; kostenpflichtige Stufen individuell Gartner und Forrester nennen es beide als Leader Kein öffentlicher Preis oberhalb der begrenzten kostenlosen Stufe
Applitools Autonomous Visuelle Regression gebündelt mit autonomer End-to-End-Generierung Kostenlose Testphase (50 Test Units); kostenpflichtige Stufen individuell Scannt eine URL-Liste zu einer vollständigen Suite, bündelt Änderungen zur Freigabe per Klick Kein öffentlicher Self-Serve-Preis über die Testphase hinaus
Katalon AI Eine Plattform für manuelles und automatisiertes Testen $70/Platz/Monat (True Platform), Jahresrabatte bis $59 AI Assistant und MCP Server in jeder Stufe kostenlos enthalten Volle Lifecycle-Abdeckung braucht ein Bundle für $200/Platz/Monat
testRigor Selektorfreie Tests, erzeugt aus echtem Produktionsverkehr $300/Monat (Private Linux Chrome) Heilt sich selbst, indem es die Seite wie ein Mensch versteht, nicht über Selektoren Für volle plattformübergreifende Abdeckung sind $900/Monat nötig
Momentic Nutzungsbasierte Preise ganz ohne Platzgebühren Kostenlos (2.000 Credits/Monat); $125/Monat Pay-as-you-go Veröffentlichter Überschreitungssatz, kein Aufschlag pro Nutzer Enterprise-Funktionen (SSO, SLA) erfordern ein individuelles Angebot
Functionize Der günstigste Self-Serve-Einstieg in agentisches Testing Kostenlos ($0, 200 Credits/Monat); Pro $20/Monat Niedrigster kostenpflichtiger Einstieg dieser Liste Die Stufen Growth und Scale berechnen Credits pro Nutzer, nicht gemeinsam
Reflect (SmartBear) Ein Agent, den Ihr Coding-Agent direkt aufrufen kann Credit-gestaffelt (5.000 bis 40.000/Monat); Preis individuell MCP-Server-Integration, nicht nur ein Dashboard Kein veröffentlichter Dollarpreis für irgendeine Stufe
Autify Autonomes Testing (Aximo) oder Playwright-basierter Hybrid (Nexus) $120/Monat (Aximo Core), $99/Monat jährlich Zwei Produkte decken sowohl No-Code- als auch Code-Teams ab Nexus stapelt Add-ons pro Nutzer und pro Parallelität obendrauf
Rainforest QA AI-Testplanung, gestützt von menschlichen Crowd-Prüfern Nicht veröffentlicht; berichteter Durchschnitt um $5.200/Monat Menschliche Prüfer sitzen hinter der Selbstheilungsebene Keine öffentlichen Preise; echte Verträge gehen jährlich in den fünfstelligen Bereich
CoTester (TestGrid) Ein gebündeltes AI-Testing-Teammitglied mit 27+ eingebauten Agents $199/Platz/Monat, Mindestabnahme 4 Plätze Keine Gebühren pro Agent bei 27+ Testing-Agents Die Mindestabnahme von 4 Plätzen setzt die reale Preisuntergrenze nahe $800/Monat
Meticulous Wartungsfreie Regressionsabdeckung ganz ohne Testerstellung Nicht veröffentlicht; kostenlos für Open Source Deterministische Wiedergabe echter Sitzungen, keine Locators, die brechen können Passt nicht, wenn Sie skriptbasierte, gezielte Testfälle brauchen
Ranger Die autonomste Option, gebaut für AI-Coding-Agents Nicht veröffentlicht; individueller Jahresvertrag Konstruktionsbedingt keine menschliche Beteiligung im Fix-and-Retest-Zyklus Keine Self-Serve-Stufe; jedes Team beginnt mit einer Vertriebsberatung

Selbstheilung: Die Funktion, die den Fehler auch verstecken kann

Jeder Anbieter dieser Liste vermarktet Selbstheilung als Grund zum Wechseln. Weniger von ihnen erklären, was sie tatsächlich tut, wenn sie auslöst: Ein Element, das sie erwartet, hat sich bewegt oder verändert, also sucht sie die nächstliegende Übereinstimmung und aktualisiert den Test auf diese. Gut gemacht erspart das einem QA-Ingenieur, jeden Sprint einen Locator neu aufzuzeichnen. Nachlässig gemacht kann es still ein ähnlich aussehendes Element neben dem defekten neu anvisieren, der Test besteht, und eine echte Regression wird ausgeliefert. Genau diesen Fehlerfall nennen die Best-Practice-Leitfäden der Anbieter zur Selbstheilung: Locators heilen, niemals Assertions, vor stiller Heilung eine Konfidenzschwelle verlangen, jede Heilung zur Prüfung protokollieren und den Build scheitern lassen, wenn die Heilungsrate unerwartet springt. Eine Testsuite, die sich heilt, ohne es jemandem zu sagen, hört auf, ein Nachweis zu sein, und wird zur Inszenierung.

Sichere und unsichere Testselbstheilung im Vergleich: geprüfte Locator-Reparatur neben einer versteckten Änderung der Assertion

Der ehrliche Unterschied zwischen diesen 14 Produkten ist nicht, ob sie sich selbst heilen. Fast alle tun es. Entscheidend ist, ob die Heilung sichtbar und prüfbar ist oder unsichtbar und automatisch. Teams auf der Bauseite, die eine solche Leitplanke von Grund auf entwerfen, sollten sich ansehen, wie sie im Blueprint für einen AI-QA-Testing-Agent umrissen ist, der „einen fehlschlagenden Test niemals als bestanden markieren“ als harte Regel behandelt und nicht als Konfigurationsoption.

Tool Was es heilt Menschliche Freigabe vor der Auslieferung Wie Änderungen sichtbar werden
QA Wolf Locators und Workflow-Schritte Ja, in der Managed-Stufe: Ein Mensch untersucht jeden Fehlschlag innerhalb von 24 Stunden Von Menschen verifizierter Fehlerbericht mit Video, Traces und Logs
Mabl Locators, über „intelligente Analyse von Testfehlschlägen“ Nicht als verpflichtendes Gate dokumentiert Die Fehleranalyse zeigt pro Lauf eine wahrscheinliche Ursache
Testim (Tricentis) Locators, über AI-gestützte und agentische Testautomatisierung Im Test-Editor prüfbar, bevor einem Lauf vertraut wird Erzeugte Schritte erscheinen zur Prüfung im Editor
Applitools Autonomous Locators und visuelle Checkpoints Ja: Änderungen werden gruppiert und dann per Klick freigegeben Gruppierte Diff-Ansicht über alle betroffenen Tests
Katalon AI Locators, plus über Insights sichtbar gemachte Ursachen Nicht als verpflichtendes Gate dokumentiert Insights markiert Ursachen und Muster instabiler Tests
testRigor Seitenverständnis, überhaupt keine Selektoren Ja: Gruppierte Fälle werden mit Bearbeitungswerkzeugen direkt korrigiert Fälle, die vom selben Problem betroffen sind, werden zur Prüfung gruppiert
Momentic Locators, über Beschreibungen in natürlicher Sprache Nicht als verpflichtendes Gate dokumentiert Wiederholungen und Umgehungen des Agents werden pro Lauf protokolliert
Functionize Locators, adressiert als „das Problem instabiler Tests“ Nicht als verpflichtendes Gate dokumentiert Credit-gemessene Läufe melden pro Schritt bestanden/fehlgeschlagen
Reflect (SmartBear) Locators, über visuelle Objekterkennung Nicht dokumentiert; die Heilung greift ohne manuelles Eingreifen Testschritte und Screenshots werden pro Lauf aufgezeichnet
Autify Locators, über Aximo und Nexus hinweg Nicht als verpflichtendes Gate dokumentiert Skript-Diffs werden nach einem Selbstheilungsereignis angezeigt
Rainforest QA Locators, plus eine Ebene menschlicher Prüfer Ja, über menschliche Crowd-Prüfer neben der AI-Ebene Von Menschen geprüfte Ergebnisse, nicht nur ein automatisches Bestanden
CoTester (TestGrid) Locators, gebündelt mit Fehlerzusammenfassung Nicht als verpflichtendes Gate dokumentiert Die Fehlerzusammenfassung zeigt, was fehlschlug und warum
Meticulous Nichts zu heilen; konstruktionsbedingt gibt es keine Locators Entfällt, ersetzt die Heilung durch deterministische Wiedergabe Visuelle Diffs, gefiltert um unwesentliche Änderungen
Ranger Nichts: Ein Fehlschlag geht an Ihren Coding-Agent, der den Code repariert, nicht den Test Nein, konstruktionsbedingt: „kein Mensch im Loop“ für den Fix-and-Retest-Zyklus Screenshots, Aufzeichnungen und Traces am PR angehängt

Schreibt es eigene Tests oder führt es nur aus, was Sie ihm geben

Die zweite Achse, die diese Produkte tatsächlich trennt, ist die Herkunft des Tests. Manche Agents erkunden Ihre App selbstständig und entscheiden, was testenswert ist. Andere warten auf eine Spezifikation, eine Beschreibung in einfacher Sprache oder eine aufgezeichnete Sitzung und führen immer nur aus, worauf ein Mensch sie angesetzt hat. Keiner der Ansätze ist falsch, aber sie bergen unterschiedliche Risiken: Ein Agent, der selbstständig erkundet, kann Abdeckungslücken finden, von denen Sie nichts wussten, während ein Agent, der nur ausführt, was Sie vorgeben, Sie nicht vor dem Feature warnen kann, das niemand zu beschreiben dachte.

Testerkunder und Testausführer im Vergleich: autonome App-Kartierung neben der Ausführung eines vorgegebenen Pfads

Tool Erzeugt Tests aus Erkundet die App eigenständig
QA Wolf Produkterkundung plus Workflow-Kartierung Ja, ausdrücklich, in der Self-Serve-Stufe Platform
Mabl Aufgezeichnete Abläufe und AI-Testplanung Teilweise; die Abdeckung wächst durch Nutzung, nicht durch einen Kaltstart-Crawl
Testim (Tricentis) Beschreibung in einfacher Sprache über Testim Copilot, plus Aufzeichnung Nein; spezifikations- und aufzeichnungsgetrieben
Applitools Autonomous Eine gescannte URL oder eine hochgeladene URL-Liste Ja; es durchsucht die Website, um die Suite aufzubauen
Katalon AI Aufzeichnung plus AI-Skriptgenerierung; Produktionsverkehr über ein Add-on Optional, über das Add-on True Production Insights
testRigor Gespiegeltes Verhalten echter Produktionsnutzer Ja; es lernt, wie sich echte Nutzer durch die App bewegen
Momentic Schrittbeschreibungen in natürlicher Sprache Nein; spezifikationsgetrieben
Functionize Eine beschriebene Testanforderung Nein; spezifikationsgetrieben
Reflect (SmartBear) Ein dem Agent in natürlicher Sprache gegebenes Ziel Teilweise; es handelt Schritt für Schritt auf ein Ziel hin, kein freier Crawl
Autify No-Code-Aufzeichnung plus AI-Generierung (Aximo als „Autonomous“ vermarktet) Nicht im Detail dokumentiert; überwiegend aufzeichnungsgetrieben
Rainforest QA AI Test Planner, der die App kartiert Ja; es kartiert die App und schlägt vor, was zu testen ist
CoTester (TestGrid) Manuelle und automatisierte Testfallgenerierung aus Anforderungen Nein; überwiegend anforderungsgetrieben
Meticulous Echte Nutzersitzungen, automatisch erfasst Zeichnet echte Nutzung auf, statt zu erkunden oder gesagt zu bekommen, was zu testen ist
Ranger Die eigene Navigation auf der Live-Website Ja; es navigiert selbst durch die Website, um den Test zu erzeugen

CI/CD-Integration und Fehlertriage

Ein Agent, der nur über ein Dashboard funktioniert, ist ein zweiter Workflow, den man prüfen muss. Der Großteil dieser Liste ist dafür gebaut, in der Pipeline zu laufen, die Sie bereits haben, und einem Entwickler etwas Verwertbares zu übergeben, wenn ein Lauf fehlschlägt: einen Fehlerbericht, der mit angehängten Reproduktionsschritten direkt in Jira oder Linear angelegt wird, kein rotes X ohne Kontext.

Tool CI/CD-Integration Wie es einen Fehlschlag triagiert
QA Wolf API- und Webhook-Trigger; Exporte in Open-Source-Playwright 24-Stunden-Untersuchung durch einen Menschen mit Video, Traces und Logs
Mabl Unbegrenzte Cloud-Parallelität; lokale Läufe sind kostenlos Intelligente Analyse von Testfehlschlägen markiert eine wahrscheinliche Ursache
Testim (Tricentis) Cloud-Ausführung innerhalb von Tricentis' Continuous-Testing-Suite AI-gestützte Ursachenanalyse über Testim Copilot
Applitools Autonomous Browser- und geräteübergreifende Cloud-Ausführung; 30+ SDKs Gruppierte Änderungsprüfung über alle betroffenen Tests
Katalon AI Cloud-Ausführung plus lokale IDE-Läufe Modul Insights: Ursachenanalyse und Erkennung instabiler Tests
testRigor Parallelisiert über Linux, Windows, Mac, Android und iOS Gruppiert zusammengehörige Fehlschläge zu einem behebbaren Problem
Momentic Native Integration mit GitHub Actions und GitLab CI Wiederholungen und Umgehungsversuche des Agents werden pro Lauf protokolliert
Functionize Bis zu 10 parallele Läufe je nach Stufe Credit-gemessene Laufberichte mit Bestanden/Fehlgeschlagen pro Schritt
Reflect (SmartBear) API-basiert; auch als Tool durch einen verbundenen Coding-Agent aufrufbar Screenshots und Schrittprotokolle pro Testlauf
Autify CI-integriert bei Aximo (Cloud) und Nexus (lokal plus Cloud) Skript-Diff wird angezeigt, wenn ein Selbstheilungsereignis eintritt
Rainforest QA Gebaut für schnelles Ausliefern; fügt sich in bestehende Release-Zyklen AI markiert Ergebnisse, ein menschlicher Prüfer bestätigt Grenzfälle
CoTester (TestGrid) Cloud-Ausführung auf echten Geräten und Browsern Eingebaute Fehlerzusammenfassung nennt, was fehlschlug und warum
Meticulous Läuft konstruktionsbedingt gegen jeden Pull Request Filtert Diffs, um unwesentliche visuelle Änderungen auszuschließen
Ranger Ausgelöst per CLI-Befehl aus der eigenen Schleife des Coding-Agents Standardmäßig kein menschlicher Triageschritt; der Agent testet sich selbst erneut

Preismodelle: Plätze, Credits und wo Budgets überraschen

In dieser Liste tauchen drei Preisphilosophien auf, und wer sie in einer Budgetprognose vermischt, wird bei der Verlängerung überrascht. Preise pro Platz begrenzen die Kosten pro Person, vervielfachen sich aber mit der Mitarbeiterzahl. Credit- oder nutzungsbasierte Preise skalieren damit, wie hart der Agent arbeitet, was in Ordnung ist, bis eine große Regressionssuite das Monatskontingent in einer Woche verbrennt. Und etliche der leistungsfähigsten Produkte dieser Liste veröffentlichen schlicht gar keinen Preis.

Preismodelle für QA-Agents als Spuren für Plätze, Credits und Angebote, die ein gemeinsames Testsuite-Budget speisen

Tool Preismodell Was Teams überrascht
QA Wolf Nutzungsbasierte Credits und Runner-Minuten (Self-Serve); vollständig individuell (Managed) Zwei sehr unterschiedliche Preismodelle unter einer Marke
Mabl Individuelles Angebot; 500 Credits/Monat Startkontingent Nirgends existiert ein öffentlicher Dollarbetrag, nicht einmal eine Untergrenze
Testim (Tricentis) Kostenloser Community-Plan; alle kostenpflichtigen Stufen individuell Nur die begrenzte kostenlose Stufe hat öffentliche Preisangaben
Applitools Autonomous Gemessen in „Test Units“; kostenlose Testphase, danach individuell Test Units sind Applitools' eigene Kennzahl, keine schlichte Testanzahl
Katalon AI Pro Platz, drei separate Produkte, die sich zu einem vierten Bundle kombinieren Volle Lifecycle-Abdeckung erfordert das Stapeln von Studio plus Platform
testRigor Pauschale Infrastrukturstufe, nicht pro Platz oder pro Test Unbegrenzte Nutzer und Tests für eine Pauschale, bepreist nach Parallelität
Momentic Reine nutzungsbasierte Credits, veröffentlichter Überschreitungssatz Mobile Tests zehren am selben Credit-Pool wie Web
Functionize Pauschale plus Credits (Einzelnutzer); pro Nutzer plus Credits (Team) Team-Credits gelten pro Nutzer, daher verändert jeder Platz die Rechnung nichtlinear
Reflect (SmartBear) Credit-gestaffelt; Dollarpreis je Stufe zurückgehalten Mobile Tests kosten das 5-Fache an Credits eines Web-Tests
Autify Zwei getrennte Leitern (Aximo und Nexus) plus gestapelte Add-ons Die falsche Produktlinie zu wählen heißt, das Konto später neu zu bepreisen
Rainforest QA Nicht veröffentlicht; berichtete Verträge skalieren mit dem Testvolumen Menschlich unterstütztes Testing ist ein separates Add-on auf der AI-Ebene
CoTester (TestGrid) Pro Platz, Mindestabnahme 4 Plätze Die Mindestabnahme, nicht der Preis pro Platz, setzt den realen Startpreis
Meticulous Nicht veröffentlicht; kostenlos für Open Source Es gibt nichts, wogegen sich budgetieren ließe, bis ein Vertriebsgespräch stattfindet
Ranger Individuell, Jahresvertrag, beratungsbasiert Bei keiner Teamgröße existiert eine Self-Serve-Stufe

Größe und Persona

Tool Ideale Teamgröße Primäre Käufer-Persona
QA Wolf 20-500 Mitarbeitende Head of QA, VP Engineering, der QA vom Team nehmen will
Mabl 20-1.000 Mitarbeitende QA Director, Head of Quality Engineering
Testim (Tricentis) 100-5.000+ Mitarbeitende Enterprise QA Director, Test Automation Lead
Applitools Autonomous 50-5.000+ Mitarbeitende QA Automation Lead, Visual QA Engineer
Katalon AI 10-1.000 Mitarbeitende QA Manager, der manuelles und automatisiertes Testen gemeinsam führt
testRigor 10-500 Mitarbeitende QA Lead ohne dediziertes Automatisierungs-Engineering-Team
Momentic 5-200 Mitarbeitende Engineering Lead in einem Startup, der QA nebenbei verantwortet
Functionize 5-300 Mitarbeitende QA Engineer, Engineering Manager
Reflect (SmartBear) 5-200 Mitarbeitende QA Engineer, der bereits auf einen AI-Coding-Agent standardisiert ist
Autify 10-300 Mitarbeitende QA Manager (Aximo) oder Automation Engineer (Nexus)
Rainforest QA 10-500 Mitarbeitende Engineering Director, der AI plus Crowd-Testing durch Menschen will
CoTester (TestGrid) 10-200 Mitarbeitende QA Manager, der eine gebündelte Agent-Suite will
Meticulous 5-500 Mitarbeitende Frontend Engineering Lead, der wartungsfreie Regressionsabdeckung will
Ranger 5-100 Mitarbeitende Gründer oder Eng Lead, der AI-Coding-Agents betreibt, die ein Test-Orakel brauchen

1. QA Wolf: AI-Testerstellung, gestützt von einem Menschen, der jeden Fehlschlag prüft

QA Wolf versteht sich als Hybrid aus Plattform und Service, der QA einem Team „komplett“ abnimmt, und seine Stufe Coverage as a Service ist die wörtlichste Version dieses Versprechens auf dieser Liste: QA Wolfs eigenes Team baut und pflegt die End-to-End-Abdeckung, garantiert „zero flakes“ und untersucht jeden Fehlschlag innerhalb von 24 Stunden, mit einem von Menschen verifizierten Fehlerbericht im Anhang. Die Self-Serve-Stufe Platform übergibt dieselbe AI-Erkundung und Workflow-Kartierung stattdessen an Ihr eigenes Team und exportiert nach Open-Source-Playwright, sodass bei den zugrunde liegenden Tests kein Vendor-Lock-in entsteht.

Diese Spannweite ist auch das, was man vor dem Kauf verstehen sollte: Platform und Coverage as a Service sind nahezu zwei verschiedene Produkte unter einer Marke, das eine transparent nach Nutzung bepreist, das andere ganz hinter einem Vertriebsgespräch.

Das bekommen Sie Das bekommen Sie nicht
Eine Managed-Stufe, in der ein Mensch jeden Fehlschlag in 24 Stunden untersucht Der echte Preis der Managed-Stufe wird nie veröffentlicht
Self-Serve-Stufe Platform mit transparenten Preisen pro Credit und pro Minute Bei Self-Serve muss Ihr Team die Automatisierung weiterhin selbst verantworten
Exporte in Open-Source-Playwright, kein Lock-in Unbegrenzte parallele Läufe gelten nur für die Self-Serve-Stufe
AI-Erkundung und Workflow-Kartierung in Platform enthalten „Garantiert zero flakes“ ist eine Aussage der Managed-Stufe, nicht von Self-Serve

Preise: Platform ist nutzungsbasiert: AI-Credits zu je $0,01, Runner-Minuten zu je $0,15, keine Gebühr pro Platz oder pro Test, mit einer kostenlosen Stufe zum Ausprobieren. Coverage as a Service ist individuell, für ein Angebot den Vertrieb kontaktieren. Quelle: qawolf.com/pricing.

Am besten geeignet für: Teams, die End-to-End-QA von einem von Menschen geprüften Managed Service erledigen lassen wollen, mit einer günstigeren Self-Serve-Option für Teams, die die Automatisierung selbst übernehmen.

2. Mabl: Abdeckung, die sich selbst baut, ausführt und heilt

Mabls eigene Positionierung, „Abdeckung, die sich selbst baut, sich selbst ausführt und sich selbst wiederherstellt“, ist der direkteste agentische Anspruch dieser Kategorie und reicht weiter als bei den meisten: Web-, Mobile-, API-, Barrierefreiheits- und Performance-Tests teilen sich einen Credit-Pool unter einem Abonnement statt getrennter SKUs. Unbegrenzte lokale Testläufe und unbegrenzte Cloud-Parallelität sind in jedem Plan enthalten, mit einem Startkontingent von 500 Credits für Cloud-Läufe.

Der Haken ist, dass nichts davon mit einer öffentlichen Zahl daherkommt. Jeder Plan ist ein individuelles Angebot, sodass ein Team ohne vorheriges Gespräch mit dem Vertrieb kein Budget grob überschlagen kann, ungewöhnlich für ein so verbreitet eingesetztes Produkt.

Das bekommen Sie Das bekommen Sie nicht
Web-, Mobile-, API-, Barrierefreiheits- und Performance-Tests in einem Produkt Nirgends eine öffentliche Preisstufe oder ein Einstiegspreis
Unbegrenzte lokale Läufe und unbegrenzte Cloud-Parallelität Cloud-Credits sind der echte Verbrauchszähler, und der Umrechnungskurs ist nicht öffentlich
Live-Support 24/5 mit einem benannten Customer Success Manager Mobile-App-Tests sind ein separates kostenpflichtiges Add-on
14 Tage kostenlose Testphase zur Evaluierung vor einem Vertriebsgespräch Transparenz der Selbstheilung (was sich änderte, wer es freigibt) ist nicht dokumentiert

Preise: Individuell, auf Angebotsbasis. Ein monatliches Startkontingent von 500 Credits deckt Cloud-Testläufe über alle Fähigkeiten hinweg; lokale Läufe sind kostenlos. Quelle: mabl.com/pricing.

Am besten geeignet für: Teams, die eine agentische Plattform für Web-, Mobile-, API- und Barrierefreiheits-Tests wollen, statt Einzelwerkzeuge zusammenzustückeln.

3. Testim (Tricentis): Der Gartner- und Forrester-Leader für autonomes Enterprise-Testing

Testims Übernahme durch Tricentis stellte es in den größten dedizierten Testing-Anbieter dieser Kategorie, und 2025-26 zeigte sich das in unabhängiger Validierung: Tricentis wurde als Leader im ersten Gartner Magic Quadrant für AI-Augmented Software Testing Tools und als Leader in Forresters erster Wave für Autonomous Testing Platforms geführt, bewertet dafür, „eine der umfassendsten Plattformen auf Enterprise-Niveau für funktionale und nichtfunktionale Tests“ zu bieten. Testim Copilot erzeugt Teststeps aus einer Beschreibung in einfacher Sprache im Editor, und Tricentis vermarktet inzwischen eine agentische Ebene darüber: beschreiben, was getestet werden soll, und es geschieht automatisch.

Für ein Team, das neben Web bereits Salesforce oder Mobile betreibt, ist das ein echter Vorteil: Testim deckt alle drei unter einer Tricentis-Beziehung ab statt unter drei getrennten Anbieterverträgen.

Das bekommen Sie Das bekommen Sie nicht
Unabhängig von Gartner und Forrester als Leader validiert Kein öffentlicher Preis für irgendeine kostenpflichtige Stufe
Testim Copilot erzeugt Teststeps aus einer Beschreibung in einfacher Sprache Der kostenlose Community-Plan ist auf einen pro Organisation begrenzt
Deckt Web, Salesforce und Mobile bei einem Anbieter ab Support 24x5 erfordert eine kostenpflichtige Stufe Essentials, Pro oder Mobile
Teil von Tricentis' breiterer Continuous-Testing-Suite Enterprise-Pakete werden per Scheck oder Überweisung beglichen, keine Self-Serve-Abrechnung

Preise: Ein kostenloser Community-Plan ist nach der Testphase verfügbar (nur Self-Service, einer pro Organisation). Testim Web, Testim Salesforce und Testim Mobile erfordern für Preise die Kontaktaufnahme mit dem Vertrieb. Quelle: testim.io/pricing.

Am besten geeignet für: Enterprise-QA-Teams, die einen von Analysten validierten Anbieter wollen, der Web-, Salesforce- und Mobile-Tests unter einer Beziehung abdeckt.

4. Applitools Autonomous: Eine URL-Liste zu einer vollständigen Testsuite durchsuchen

Applitools hat seinen Ruf mit Visual AI aufgebaut, und Autonomous ist der Punkt, an dem diese Expertise auf die Erzeugung und Pflege der Tests selbst ausgeweitet wird: Richten Sie es auf eine URL oder eine Liste von URLs, und es scannt die Website, um automatisch eine Testsuite mit eingebauten visuellen Checkpoints zu erzeugen, ganz ohne Code. Forrester führte Applitools in seiner ersten Wave für Autonomous Testing Platforms als Strong Performer, eine Stufe unter Tricentis, aber eine echte unabhängige Validierung in einer brandneuen Kategorie.

Die Selbstheilung ist hier eine der transparenteren dieser Liste: Wenn die AI Änderungen auf der Website erkennt, gruppiert sie diese, sodass ein Team „Hunderte von Tests per Klick“ prüfen und aktualisieren kann, statt jeden einzeln aufzuspüren, ein Modell der Stapelprüfung statt einer stillen Heilung.

Das bekommen Sie Das bekommen Sie nicht
Erzeugt automatisch eine vollständige Testsuite durch Scannen einer URL-Liste Kein öffentlicher Self-Serve-Preis über die kostenlose Testphase hinaus
Visuelles, funktionales und API-Testing in einem Workflow „Test Unit“ ist Applitools' eigene Kennzahl, keine schlichte Testanzahl
Gruppiert erkannte Änderungen zur Stapelfreigabe per Klick Voller Produktivbetrieb erfordert die individuell bepreiste Stufe Public oder Dedicated Cloud
Von Forrester als Strong Performer bei Autonomous Testing Platforms geführt, Q4 2025 Nicht-Programmierer haben den leichtesten Einstieg; tiefe individuelle Logik profitiert weiterhin von Code

Preise: Starter enthält eine kostenlose Testphase mit 50 Test Units, unbegrenzten Nutzern und Ausführungen. Die Pläne Public Cloud und Dedicated Cloud (50+ Test Units, SSO, On-Prem-Optionen) sind individuell, Vertrieb kontaktieren. Quelle: applitools.com/pricing.

Am besten geeignet für: Teams, die autonome End-to-End-Testgenerierung gebündelt mit Applitools' etablierter Engine für visuelle Regression wollen.

5. Katalon AI: Eine Plattform für manuelles und automatisiertes Testen, AI kostenlos enthalten

Katalons Wette ist die Breite: eine Plattform für Low-Code- und Full-Code-Testerstellung, manuelles Testfallmanagement, Cloud-Ausführung und Reporting, mit einem AI Assistant und MCP Server, die jetzt ohne Aufpreis in jeder einzelnen Stufe enthalten sind. Dieser letzte Punkt zählt in einer Kategorie, in der die meisten Wettbewerber AI hinter eine Premiumstufe oder ein individuelles Angebot stellen. Katalons AI beherrscht sowohl Skriptgenerierung mit Selbstheilung als auch AI-gestützte manuelle Testfallgenerierung für Teams, die noch nicht vollständig automatisieren wollen.

Das optionale Add-on True Production Insights geht weiter in autonomes Terrain: Es kartiert echte Nutzerreisen gegen die bestehende Testabdeckung und erzeugt die fehlenden Tests automatisch, näher am Erkundungsmodell von Applitools oder Rainforest als an Katalons eigenem Standard, der auf Aufzeichnung setzt.

Das bekommen Sie Das bekommen Sie nicht
AI Assistant und MCP Server in jeder Stufe kostenlos enthalten Volle Lifecycle-Abdeckung erfordert das Stapeln von zwei der drei Produkte
Echte, veröffentlichte Preise pro Platz mit hohen Jahresrabatten Jahresrabatte erfordern eine Bindung; monatlich ist deutlich teurer
Modul Insights für Fehlerursachen und Erkennung instabiler Tests Transparenz der Selbstheilung (Freigabe-Gates) ist nicht ausdrücklich dokumentiert
Das Add-on True Production Insights erzeugt fehlende Testabdeckung automatisch Dieses Produktions-Monitoring-Add-on wird separat bepreist und verkauft

Preise: Katalon Studio Enterprise kostet $180/Platz/Monat ($84/Platz/Monat jährlich). True Platform kostet $70/Platz/Monat ($59/Platz/Monat jährlich). True Automation (beides kombiniert) kostet $200/Platz/Monat ($167/Platz/Monat jährlich). Enterprise ist individuell. Quelle: katalon.com/pricing.

Am besten geeignet für: Teams, die manuelles und automatisiertes Testen plus AI-Unterstützung auf einer Plattform ohne zusätzlichen AI-Posten wollen.

6. testRigor: Tests, erzeugt aus dem tatsächlichen Verhalten Ihrer Nutzer

testRigors Kernwette ist, dass Selektoren von vornherein das falsche Fundament für einen robusten Test sind. Statt XPath- oder CSS-Locators wurde seine AI darauf trainiert, eine Web- oder Mobile-App so zu lesen wie ein Mensch, und sie kann Tests automatisch erzeugen und pflegen, indem sie spiegelt, wie sich echte Nutzer im Produktivbetrieb durch die Anwendung bewegen, und deckt dabei standardmäßig bis zu 1.000 Testfälle ab. Wenn etwas bricht, gruppiert testRigor alle Fälle, die vom selben zugrunde liegenden Problem betroffen sind, damit ein Team es einmal behebt, statt einzelnen defekten Locators nachzujagen.

Die Preise folgen demselben Muster, „anders als alle anderen“: überhaupt keine Gebühr pro Nutzer oder pro Test, SSO für das ganze Unternehmen enthalten, und die gesamte Rechnung skaliert nur damit, wie viel parallele Ausführungsinfrastruktur Sie brauchen.

Das bekommen Sie Das bekommen Sie nicht
Heilt sich selbst, indem es die Seite versteht, statt einen Selektor neu zu raten Volle plattformübergreifende Abdeckung (Mac, Android, iOS, Windows Native) kostet $900/Monat
Unbegrenzte Nutzer und unbegrenzte Testfälle für eine Pauschale Die Einstiegsstufe ist nur Linux Chrome, eine echte Einschränkung für mobilelastige Suiten
Erzeugt Tests automatisch aus echtem Verhalten von Produktionsnutzern Autonome Abdeckung ist standardmäßig bei 1.000 Testfällen gedeckelt
Gruppiert zusammengehörige Fehlschläge zu einem behebbaren Problem Kein veröffentlichter Enterprise-Preis; individuelle Pläne erfordern ein Vertriebsgespräch

Preise: Private Linux Chrome startet bei $300/Monat. Private Complete (Ubuntu, Windows, Mac, Android, iOS, Windows Native, alle AI-Fähigkeiten) startet bei $900/Monat. Eine kostenlose, vollständig öffentliche Stufe existiert zur offenen Evaluierung. Enterprise ist individuell. Quelle: Preis- und FAQ-Seiten von testrigor.com.

Am besten geeignet für: Teams, die Tests aus echtem Nutzerverhalten statt aus einer geschriebenen Spezifikation erzeugen wollen, ohne pro Platz zu zahlen.

7. Momentic: Nutzungsbasierte Preise ohne Platzaufschlag

Momentic ist eines der transparenteren Produkte dieser Liste, was die tatsächlichen Kosten seiner AI betrifft: Jeder Plan wird in Credits gemessen, mit einem veröffentlichten Überschreitungssatz ($0,01875 pro Credit), in keiner Stufe gibt es eine Gebühr pro Platz, und der kostenlose Plan (2.000 Credits im Monat, grob 200 Testläufe) reicht aus, damit ein kleines Team wirklich evaluieren kann, bevor es etwas zahlt. Locators in natürlicher Sprache ersetzen brüchige Selektoren, selbstheilende Tests fangen kleine UI-Änderungen ab, und Wiederholungen des Agents behandeln vorübergehende Fehler, mit Mobile-Tests auf echten iOS- und Android-Emulatoren ab der kostenlosen Stufe.

Der Preis für diese Einfachheit mit Pauschalsatz ist, dass intensivere Nutzung, besonders mobil, aus demselben gemeinsamen Credit-Pool zieht wie alles andere, sodass eine mobilelastige Suite ein Kontingent schneller aufbrauchen kann, als der Listenpreis nahelegt.

Das bekommen Sie Das bekommen Sie nicht
Keine Gebühren pro Platz; die Preise sind rein nutzungsbasiert Enterprise-Funktionen (SAML SSO, SCIM, Audit-Logs) erfordern ein individuelles Angebot
Ein veröffentlichter, transparenter Überschreitungssatz Freigabe-Gates für die Selbstheilung sind nicht dokumentiert; die Heilung greift automatisch
Native Integration mit GitHub Actions und GitLab CI Mobile-Tests zehren am selben Credit-Pool wie Web
Multimodale Assertions über Text, Visuelles und DOM Der kostenlose Plan stoppt hart bei 2.000 Credits, ohne Überschreitungsoption

Preise: Free kostet $0 (2.000 Credits/Monat). Pay-as-you-go kostet $125/Monat (10.000 Credits/Monat) plus $0,01875 pro Credit bei Überschreitung. Enterprise ist individuell, bepreist nach Testvolumen. Quelle: momentic.ai/pricing.

Am besten geeignet für: Teams, die transparente, creditbasierte Preise ohne Aufschlag pro Platz wollen, wenn die Mitarbeiterzahl wächst.

8. Functionize: Der günstigste Self-Serve-Einstieg in agentisches Testing

Functionize vermarktet sein Produkt schlicht als „einen unabhängigen Testing-Agent für Ihren gesamten Web-UI-Workflow“, und seine Preise sind die zugänglichsten dieser Liste mit großem Abstand: eine wirklich nutzbare kostenlose Stufe mit 200 Credits im Monat und eine Stufe Pro für 20 Dollar im Monat, ein Bruchteil dessen, was der Rest dieser Kategorie vor jeder echten Nutzung verlangt. Functionizes eigene technische Texte konzentrieren sich gezielt auf das Problem instabiler Tests, zu dessen Lösung diese ganze Kategorie existiert, und seine Stufe Max ergänzt SMS- und MFA/OTP-Tests für Workflows, an denen einfachere Automatisierungstools scheitern.

Die Team-Preise verschieben das Modell: Die Stufen Growth und Scale berechnen pro Nutzer, wobei jeder Nutzer sein eigenes Credit-Kontingent mitbringt statt eines gemeinsamen Team-Pools, was sich vor einer Skalierung über ein paar Plätze hinaus durchzurechnen lohnt.

Das bekommen Sie Das bekommen Sie nicht
Der günstigste kostenpflichtige Einstieg dieser Kategorie ($20/Monat) Die Stufen Growth und Scale berechnen Credits pro Nutzer, nicht als gemeinsamen Pool
SMS- und MFA/OTP-Tests in der Stufe Max Freigabe-Gates für die Selbstheilung sind nicht dokumentiert
Bis zu 10 parallele Läufe in höheren Stufen 1 Monat Datenaufbewahrung in jeder Stufe, selbst in den Enterprise-Preisstufen darunter
Ein Credit-Modell, einfach genug, um es in einer Tabelle zu prognostizieren Enterprise ist die einzige Stufe mit Premium-Support und Account-Management

Preise: Free kostet $0/Monat (200 Credits). Pro kostet $20/Monat (400 Credits). Max kostet $100/Monat (2.000 Credits, bis zu 10 parallele Läufe). Growth (Team) kostet $40/Nutzer/Monat (400 Credits/Nutzer). Scale (Team) kostet $200/Nutzer/Monat (2.000 Credits/Nutzer). Enterprise ist individuell. Quelle: functionize.com/pricing.

Am besten geeignet für: Kleine Teams oder einzelne QA Engineers, die agentisches Testing ausprobieren wollen, ohne vorab Budget zu binden.

9. Reflect (SmartBear): Ein MCP-Server, den Ihr Coding-Agent direkt aufrufen kann

Reflect hat sich als No-Code-Testplattform einen Namen gemacht, und sein markantester Schritt seit dem Wechsel zu SmartBear 2024 ist architektonisch und kein Funktions-Häkchen: Seit März 2026 kann sich ein Coding-Agent über einen MCP-Server mit Reflect verbinden und es als Tool nutzen, Teststeps mit Prompts in natürlicher Sprache hinzufügen, Screenshots machen, um den Anwendungszustand zu prüfen, bestehende Testsegmente wiederverwenden und fehlgeschlagene Schritte wiederholen, statt dass eine Person in ein separates Reflect-Dashboard wechselt. Die Selbstheilung läuft über visuelle Objekterkennung statt über codebasierte Locators und passt sich automatisch an, wenn sich die UI verschiebt.

Diese Formulierung mit „automatisch“ verdient genaues Lesen: SmartBears eigenes Material beschreibt eine Heilung, die Tests „ohne manuelles Eingreifen“ aktualisiert, was Reflect am automatischen Ende des Transparenzspektrums einordnet statt an dem Ende mit Stapelprüfung, das Applitools und testRigor nutzen.

Das bekommen Sie Das bekommen Sie nicht
Per MCP direkt von einem verbundenen AI-Coding-Agent aufrufbar Kein veröffentlichter Dollarpreis für irgendeine Stufe
Visuelle Objekterkennung für Selbstheilung über UI-Änderungen hinweg Die Heilung greift automatisch, ohne dokumentierten Freigabeschritt
Unbegrenzte Nutzer und unbegrenzte Testerstellung in jeder Stufe Mobile-Tests kosten das 5-Fache an Credits eines Web-Tests
14 Tage kostenlose Testphase mit vollem Funktionsumfang Web-, Mobile- und API-Tests ziehen alle aus einem gemeinsamen Credit-Pool

Preise: Premium (5.000 Credits/Monat), Advanced (20.000 Credits/Monat) und Enterprise (40.000 Credits/Monat, Tests in privater Umgebung) sind alle credit-gestaffelt, wobei der Dollarpreis bis zu einem Vertriebsgespräch zurückgehalten wird. Web-Tests kosten 1 Credit, Mobile 5 Credits, API 0,1 Credits. Quelle: reflect.run/pricing.

Am besten geeignet für: Teams, die bereits auf einen AI-Coding-Agent standardisiert sind und wollen, dass Testen als Tool-Aufruf in diesem Workflow stattfindet, nicht in einer separaten App, die man prüfen muss.

10. Autify: Zwei Produkte, eine Selbstheilungs-Engine

Autify betreibt unter einer Marke zwei verschiedene Produktlinien. Aximo, vermarktet als „Your Autonomous AI Tester“, ist cloudbasiert und pro Testschritt in Credits gemessen und läuft bemerkenswerterweise unter der Haube auf Claude-Modellen (seine Preisseite bepreist Schritte der Sonnet-Klasse mit 1x Credit-Verbrauch und Schritte der Haiku-Klasse günstiger). Nexus ist das klassischere Gegenstück: ein Playwright-basiertes Tool, das No-Code- und Full-Code-Erstellung mischt, gedacht für Teams, die AI-Generierung wollen, ohne die Kontrolle auf Codeebene aufzugeben.

Beide teilen sich Selbstheilung über Web und Mobile, aber die zwei Preisleitern teilen sich keine Geldbörse: Wer Aximo wählt, obwohl ein Team Nexus brauchte (oder umgekehrt), beginnt das Preisgespräch von vorn.

Das bekommen Sie Das bekommen Sie nicht
Zwei Produkte, die sowohl autonome als auch codebasierte Teststile abdecken Zwei getrennte Preisleitern, die sich weder Credits noch Plätze teilen
Aximo ausdrücklich als autonomer Tester vermarktet und gebaut Nexus stapelt Add-ons pro Nutzer ($250/Monat), pro Parallelität ($150/Monat) und für den Workspace
Selbstheilung über Web und Mobile bei beiden Produkten Tests von Desktop-Apps gibt es bei Aximo nur in Enterprise
Rabatte bei jährlicher Abrechnung für beide Produktlinien Die kostenlosen Stufen sind deutlich begrenzt: 1 Nutzer, bei Nexus nur lokal

Preise: Aximo Core kostet $120/Monat ($99/Monat jährlich, 6.000 Credits/Monat). Aximo Team kostet $550/Monat ($450/Monat jährlich, 30.000 Credits/Monat). Nexus Professional kostet $400/Monat oder $3.600/Jahr (1 Nutzer). Beide ergänzen individuelle Enterprise-Stufen. Quelle: autify.com/pricing.

Am besten geeignet für: Teams, die von einer Anbieterbeziehung aus zwischen einem vollständig autonomen Tester (Aximo) und einem Playwright-basierten Hybrid (Nexus) wählen wollen.

11. Rainforest QA: AI-Testplanung mit einer menschlichen Crowd dahinter

Rainforest QAs AI Test Planner kartiert eine Anwendung automatisch und schlägt vor, was zu testen ist, erzeugt Tests über eine visuelle No-Code-Oberfläche und heilt sich selbst, wenn sich die UI ändert, dieselbe Form wie bei etlichen anderen Produkten dieser Liste. Was Rainforest abhebt, ist das, was hinter dieser Ebene sitzt: menschliche Crowd-Tester, die exploratives Testen und Grenzfälle übernehmen können, die die AI allein verpassen würde, positioniert als Brücke zwischen aufwendiger skriptbasierter Automatisierung und manuellen Regressionstests.

Diese menschliche Ebene ist eine echte Antwort auf das Vertrauensproblem der Selbstheilung, das diese ganze Kategorie lösen muss, bedeutet aber auch, dass Rainforests Preise die unberechenbarsten dieser Liste sind: Nichts ist veröffentlicht, und reale Verträge, die laut Käuferdaten Dritter berichtet werden, reichen von rund 1.500 \(im Monat für ein kleines Team bis weit über 7.000\) im Monat bei hohem Volumen.

Das bekommen Sie Das bekommen Sie nicht
Menschliche Crowd-Prüfer hinter der AI-Testplanung und der Selbstheilungsebene Nirgends auf der Website des Anbieters veröffentlichte Preise
Der AI Test Planner kartiert die App automatisch und schlägt Abdeckung vor Menschlich unterstütztes Testing wird als separates Add-on bepreist
Visuelle No-Code-Oberfläche für Teams ohne dedizierte Automatisierungsingenieure Berichtete reale Verträge gehen jährlich weit in den fünfstelligen Bereich
Speziell für Teams gebaut, die schnell ausliefern müssen, ohne aufwendiges Skripting Die Budgetierung erfordert ein Vertriebsgespräch, bevor irgendeine Zahl erscheint

Preise: Nicht veröffentlicht. Berichtet (Dritte, auf Basis anonymisierter Vertragsdaten von Käufern): kleine Teams um 1.500 bis 3.000 $/Monat, mittelgroße Teams 3.500 bis 6.500 $/Monat, Enterprise 7.000 bis 12.000+ $/Monat, durchschnittlicher jährlicher Vertragswert um $62.400. Quelle: Vendr; Rainforest QAs eigene Preisseite erfordert ein Vertriebsgespräch.

Am besten geeignet für: Teams, die AI-gesteuerte Testplanung wollen, aber der Selbstheilung nicht ohne menschlichen Prüfer im Loop vertrauen mögen.

12. Meticulous: Keine Selektoren, keine Testerstellung, nur Session Replay

Meticulous verfolgt einen grundlegend anderen Ansatz als jedes andere Produkt dieser Liste: Statt Tests aus einer Spezifikation, einem Crawl oder einer Aufzeichnung zu erzeugen, zeichnet es echte Nutzersitzungen auf (aus Staging oder Produktion) und spielt sie bei jedem Pull Request deterministisch gegen neuen Code ab, wobei visuelle Unterschiede automatisch markiert werden. Weil es nichts gibt, was einem klassischen Locator ähnelt, gibt es im üblichen Sinn nichts zu „heilen“; Meticulous' echtes technisches Problem ist das umgekehrte, nämlich visuelle Diffs herauszufiltern, die tatsächlich keine Rolle spielen, damit ein Team nicht in Fehlalarmen ertrinkt.

Das macht es zu einem grundlegend anderen Kauf als der Rest dieser Liste: kein Ersatz für gezielte, skriptbasierte Testfälle, die bestimmte Geschäftslogik prüfen, sondern ein wartungsfreies Sicherheitsnetz, das Regressionen auffängt, für die niemand daran dachte, einen Test zu schreiben.

Das bekommen Sie Das bekommen Sie nicht
Keine Testerstellung oder -wartung; Sitzungen werden automatisch erfasst Kein Ersatz für gezielte, skriptbasierte Tests der Geschäftslogik
Keine Locators, also kann sich eine Selbstheilung nirgends irren Keine veröffentlichten Preise; erfordert ein Vertriebsgespräch
Läuft konstruktionsbedingt gegen jeden Pull Request, CI-nativ Die Abdeckung hängt völlig davon ab, welche echten Sitzungen aufgezeichnet werden
Kostenlos für Open-Source- und öffentliche Repositories Deterministische Wiedergabe ist eine engere Aufgabe als vollständiges End-to-End-Skripting

Preise: Nicht veröffentlicht; als individuell beschrieben, Vertrieb kontaktieren. Kostenlos für Open-Source-Projekte und öffentliche Repositories. Quelle: meticulous.ai (zum Zeitpunkt dieser Prüfung keine öffentliche Preisseite).

Am besten geeignet für: Frontend-Teams, die automatische Regressionsabdeckung aus echter Nutzung wollen, ohne einen einzigen Testfall zu schreiben oder zu pflegen.

13. CoTester (TestGrid): Ein gebündeltes AI-Testing-Teammitglied, nach Plätzen gemessen

CoTester versteht sich als „Ihr stets verfügbares AI-Teammitglied für das Testen“, gebaut auf TestGrids breiterer agentischer Plattform, und bündelt mehr als 27 AI-Testing-Agents, die Testfallgenerierung, Selbstheilung, Fehlerzusammenfassung, visuelles Testing, Performance-Testing, API-Testing und Geolokalisierungs-Tests abdecken, in jedem Platz ohne zusätzliche Gebühr pro Agent. Zugriff auf echte Geräte und Browser ist ab der Einstiegsstufe enthalten, was für Teams zählt, deren Fehler nur auf bestimmter Hardware auftreten.

Die Zahl, auf die man achten sollte, ist die Mindestabnahme, nicht der Platzpreis: Starter verlangt vier Plätze, bevor ein Team überhaupt starten kann, was die reale monatliche Untergrenze näher an $800 rückt als an den Listenpreis von $199.

Das bekommen Sie Das bekommen Sie nicht
27+ AI-Testing-Agents gebündelt, ohne Gebühren pro Agent Die Mindestabnahme von 4 Plätzen bedeutet einen realen Startpreis von etwa $800/Monat
Zugriff auf echte Geräte und Browser ab der Einstiegsstufe Transparenz der Selbstheilung (Freigabe-Gates) ist nicht im Detail dokumentiert
Fehlerzusammenfassung als benanntes Triage-Feature eingebaut Token-Kontingent und Preis der Stufe Growth sind beide individuell
On-Premise- oder Private-Cloud-Option in der obersten Stufe Im Einstiegspaket Starter sind nur 5.000 Tokens/Monat enthalten

Preise: Starter kostet $199/Platz/Monat, Mindestabnahme 4 Plätze, inklusive 4 Geräte/Browser und 5.000 Tokens/Monat. Growth ist individuell (unbegrenzte Tokens, keine Ausführungslimits). Custom Device Lab (On-Premise oder Private Cloud) ist ebenfalls individuell. Quelle: testgrid.io/pricing.

Am besten geeignet für: Teams, die eine gebündelte Agent-Suite für funktionales, visuelles, Performance- und API-Testing wollen, ohne jede Fähigkeit einzeln zu bepreisen.

14. Ranger: Gebaut, damit ein Coding-Agent seine eigenen Fehlschläge repariert

Ranger ist das autonomste Produkt dieser Liste und für einen anderen Nutzer gebaut als der Rest: nicht für einen QA Engineer, der Ergebnisse prüft, sondern für einen AI-Coding-Agent, der eine schnelle, verlässliche Möglichkeit braucht, seine eigene Arbeit zu kontrollieren. Führen Sie ranger go aus, und es startet einen Browser, testet das Feature und liefert ein Urteil; schlägt etwas fehl, greift Ihr Coding-Agent es auf, repariert den zugrunde liegenden Code und testet erneut über Ranger, ausdrücklich „kein Mensch im Loop“ für diesen Zyklus. Tests werden von AI Agents erzeugt, die die Website navigieren, und als Playwright kodifiziert, dann von Rangers eigenen menschlichen QA-Expertinnen und -Experten geprüft, bevor ihnen als Teil der Suite vertraut wird, sodass die menschliche Prüfung einmal bei der Testerstellung stattfindet statt bei jedem späteren Lauf.

Fix-and-Retest-Schleife des Ranger-Agents, die Browser-Testnachweise, Codereparatur und einen ehrlichen erneuten Lauf verbindet

Dieses Design verdient es, schlicht gegen die Kernthese dieses Artikels gehalten zu werden: Ranger versucht gar nicht erst, einen defekten Test still zu heilen. Wenn etwas bricht, schlägt es ehrlich fehl und übergibt die Reparatur an den Agent, der es verursacht hat, mit Screenshots, Aufzeichnungen und Traces als Nachweis, den ein Mensch an einem Pull Request weiterhin prüfen kann.

Das bekommen Sie Das bekommen Sie nicht
Speziell für die eigene Retry-Schleife eines AI-Coding-Agents gebaut Keine menschliche Prüfung einzelner Läufe, nur bei der ersten Testerstellung
Tests werden zu offenem Playwright kompiliert, einmal von menschlichen QA-Experten geprüft Nirgends veröffentlichte Preise; jede Zusammenarbeit beginnt mit einer Demo
Nachweise (Screenshots, Aufzeichnungen, Traces) an einen Pull Request anhängbar Nicht gebaut für einen menschlichen QA Engineer, der Ergebnisse über ein Dashboard steuert
Keine Selbstheilung, der man misstrauen müsste; ein Fehlschlag schlägt ehrlich fehl Nur jährliche, beratungsbasierte Verträge; keine Self-Serve-Stufe

Preise: Nicht veröffentlicht. Jahresverträge, nach einer Beratung individuell angeboten auf Basis der Größe der Testsuite, mit gehosteter Testinfrastruktur, Testerstellung und Prüfung durch menschliche Experten. Quelle: ranger.net (keine öffentliche Preisseite).

Am besten geeignet für: Teams, die AI-Coding-Agents betreiben und wollen, dass diese Agents ihre eigene Arbeit mit minimaler menschlicher Beteiligung verifizieren und reparieren.


So entscheiden Sie: Entscheidungsrahmen

Wählen Sie nach Testerstellungsmodell, Transparenz der Selbstheilung, menschlicher Prüfung, CI-Passung und der Preiseinheit, die zu Ihrer Suite passt.

Entscheidungsrahmen für AI-QA-Agents, der Teams nach Testerstellung, Heilung, Prüfung, CI und Preisen einordnet

Wenn Sie brauchen... Wählen Sie... Warum
QA komplett abgenommen, mit einem Menschen, der jeden Fehlschlag prüft QA Wolf Coverage as a Service verbindet AI-Testerstellung mit einer 24-Stunden-Untersuchung durch einen Menschen bei jedem Fehlschlag
Eine agentische Plattform für Web, Mobile, API und Barrierefreiheit Mabl „Baut sich selbst, läuft selbst, stellt sich selbst wieder her“, mit unbegrenzter Cloud-Parallelität
Testing auf Enterprise-Niveau mit unabhängiger Analystenvalidierung Testim (Tricentis) Als Leader im ersten Gartner-MQ für AI-Augmented Software Testing und in Forresters Autonomous-Testing-Wave geführt
Visuelle Regression gebündelt mit autonomer End-to-End-Generierung Applitools Autonomous Scannt eine URL-Liste zu einer vollständigen Suite, bündelt Änderungen zur Freigabe per Klick
Eine Plattform für manuelles und automatisiertes Testen, AI kostenlos enthalten Katalon AI AI Assistant und MCP Server in jeder Stufe ohne Aufpreis
Tests, erzeugt aus echtem Produktionsverkehr statt aus Selektoren testRigor Liest die App wie ein Mensch und heilt sich selbst ohne CSS oder XPath
Transparente nutzungsbasierte Preise ohne Aufschlag pro Platz Momentic Veröffentlichter Überschreitungssatz, in keiner Stufe Platzgebühren
Der günstigste Weg, agentisches Testing auszuprobieren Functionize Echter Funktionsumfang in der Stufe Pro für $20/Monat
Testing, das als Tool-Aufruf in Ihrem Coding-Agent läuft Reflect (SmartBear) Wird als MCP-Server ausgeliefert, den Ihr Agent direkt aufruft
Die Wahl zwischen autonomem und codebasiertem Testing bei einem Anbieter Autify Aximo für autonomes Testing, Nexus für Playwright-basierte Kontrolle
Ein menschlicher Prüfer hinter der AI, nicht nur ein automatisches Bestanden Rainforest QA Menschliche Crowd-Tester sitzen hinter der AI-Testplanung und der Selbstheilungsebene
Wartungsfreie Regressionsabdeckung ganz ohne Testerstellung Meticulous Zeichnet echte Sitzungen auf und spielt sie gegen neuen Code ab; kostenlos für Open Source
Die autonomste Option, gebaut für die eigene Schleife eines Coding-Agents Ranger Konstruktionsbedingt kein Mensch im Loop für den Fix-and-Retest-Zyklus

Typische Fehler beim Kauf von QA-Agents, die Sie vermeiden sollten

Prüfen Sie vor der Unterschrift den Umfang der Heilung, Freigabeprotokolle, Erkundungstiefe, den Umgang mit instabilen Tests, Mindestabnahmen und den realen Credit-Verbrauch.

Kaufrisiken bei AI-QA-Agents als Release-Förderband, das versteckte Fallen bei Heilung, Credits und instabilen Tests passiert

Fehler So sieht es aus Was Sie stattdessen tun sollten
Der Selbstheilung vertrauen, ohne zu prüfen, was sie heilt Annehmen, dass „Selbstheilung“ bei jedem Anbieter dasselbe bedeutet Gezielt fragen: Repariert es nur Locators, oder kann es auch eine Assertion anfassen
Nie nach einem Freigabe-Gate fragen Jeden Sprint ein grüner Build, ohne zu wissen, wie viele Tests automatisch geheilt wurden Fragen, ob jede Heilung protokolliert und prüfbar ist, nicht nur still angewendet wird
Erkundung mit Ausführung verwechseln Annehmen, dass ein Agent Abdeckungslücken findet, weil er „AI nutzt“ Klären, ob er Ihre App selbstständig durchsucht oder nur ausführt, was Sie geschrieben haben
Nach dem Listenpreis pro Platz budgetieren CoTester mit $199/Monat ansetzen und die Mindestabnahme von 4 Plätzen übersehen Das Kleingedruckte zu Mindestabnahmen, Credit-Pools und Add-ons pro Nutzer lesen
Annehmen, eine kostenlose Testphase prognostiziere eine echte Rechnung Mit 200 Credits testen und dann in eine mobilelastige Suite hochskalieren Ihr tatsächliches Testvolumen gegen den Credit-Dollar-Kurs durchrechnen, bevor Sie sich binden
Den Kauf wie den eines Coding-Agents behandeln Einen QA-Agent so bewerten, wie Sie Cursor oder Claude Code bewerten würden Ihn nach Testabdeckung und Fehlererkennung bewerten, nicht nach Geschwindigkeit der Codegenerierung
Das Gespräch über instabile Tests überspringen Wegen der Selbstheilung kaufen und annehmen, dass Flakiness verschwindet Nach der eigenen Quote des Anbieters für instabile gegenüber echten Fehlschlägen fragen, nicht nach einer Marketingaussage
Preise bei der Verlängerung nicht neu prüfen Nach einem Angebot aus einer Kategorie budgetieren, die ihre Preismodelle noch umbaut Die aktuelle Seite des Anbieters neu prüfen; nutzungs- und creditbasierte Preise ändern sich oft


Die nächsten Schritte

Wählen Sie einen Agent und lassen Sie ihn zwei bis drei Wochen lang gegen einen echten, bereits instabilen Teil Ihrer Suite laufen, bevor Sie einen Jahresvertrag unterschreiben. Bevor Sie einer einzigen Selbstheilung vertrauen, bitten Sie den Anbieter, Ihnen das Protokoll zu zeigen: was sich geändert hat, wann und ob eine Person es freigeben musste. Ein Tool, das das im Vertriebsgespräch nicht beantworten kann, verlangt von Ihnen, einer Blackbox Ihr Release-Gate anzuvertrauen. Wenn Ihr Team eher dazu neigt, diese Fähigkeit zu bauen statt zu kaufen, führt der Blueprint für einen AI-QA-Testing-Agent durch dasselbe Act-Ask-Handoff-Design, das diese Anbieter verkaufen, und der Blueprint für einen AI-Code-Review-Agent behandelt die angrenzende Aufgabe, den Pull Request selbst zu prüfen, bevor überhaupt ein Test läuft. Und wenn Sie sich noch nicht auf die breitere Agent-Plattform unter dieser Entscheidung festgelegt haben, ist die besten AI-Agentenplattformen 2026 der Leitfaden, um zuerst diese Ebene zu wählen.

About the author

Camellia

Camellia

Principal Product Marketing Strategist

Camellia is Principal Product Marketing Strategist at Rework, helping B2B buyers pick the right software with confidence. With 6+ years in product marketing and 150+ SaaS tools evaluated across CRM, project management, and sales engagement, Camellia turns competitive intelligence into clear, honest comparisons. Readers get vendor evaluations they can trust to cut through marketing noise and decide faster.