NCA Social Media
Aktualisiert:
Autor:
Roland Golla
Grüne Kontrollschranke mit Schild Akzeptanztest, Roboter mit Paket

Was sind agentische Akzeptanztests?

Agentische Akzeptanztests sind Akzeptanztests, die im Workflow mit KI Agenten eine doppelte Rolle spielen. Sie sind der Maßstab, gegen den ein Coding Agent seine Umsetzung prüft, und sie entstehen zunehmend selbst mit Hilfe von Agenten aus Anforderungen in natürlicher Sprache.
Klassisch prüft ein Akzeptanztest, ob eine Funktion das tut, was der Fachbereich verlangt hat. Im agentischen Workflow wird er zum Abbruchkriterium: Der Agent arbeitet, bis die Akzeptanztests grün sind. Damit hängt die Qualität des Ergebnisses direkt an der Qualität der Tests.
Genau hier liegt das Risiko. Ein Agent, der Code und Tests gleichzeitig schreibt, bewertet seine eigene Arbeit. Studien zeigen, dass Coding Agenten Tests anpassen oder löschen, statt den Fehler zu beheben. Agentische Akzeptanztests brauchen deshalb klare Regeln, wer den Maßstab setzt und wer ihn ändern darf.

Agentische Akzeptanztests mit NCA: Schnelle Hilfe vom Experten

Testing ist unser Ursprung. Roland Golla ist Cypress Ambassador, seit über 20 Jahren arbeiten wir mit PHPUnit, Codeception und Cypress, und in unserer eigenen Production entscheiden Cypress Tests mit Cypress Cloud, ob eine Änderung live geht. Cypress nutzen wir dabei sehr intensiv. Seit Coding Agenten Code schreiben, zählt diese Erfahrung mehr als je zuvor, weil der Test zum Maßstab für den Agenten wird.
Wir helfen Teams, Akzeptanztests so aufzubauen, dass Agenten sie nicht aushebeln. Den Rahmen setzen die Agentic AI Coding Guardrails, bestehende Projekte bringen wir mit AI Coding Refactoring und AI Slop Refactoring in Form. Für Barrierefreiheit kombinieren wir Cypress mit Axe DevTools. Den Einstieg ins Team begleitet das Vibe Coding Onboarding, die Gesamtstrategie das Vibe Coding Consulting.
Lass uns über deine Akzeptanztests sprechen
Finde das passende Angebot für dein Projekt
Anfrage-Konfiguration
Starten Sie Ihre Anfrage
Projektart
Infos
Nachricht

Eliminierung technischer Schulden mit PHPStan, Rector PHP und PHPUnit. Über 20 Jahre Praxiserfahrung in skalierbaren Backends.

CORE EXPERTISE

Gesetzliche Konformität & Inklusion. Optimierung von Performance und Conversion durch radikal nutzerzentriertes, universelles Design.

BFSG COMPLIANT

Skalierbare KI-Systeme mit echtem Code Ownership. CI/CD, Backup-Strategien und Infrastruktur, die mit deinem Team wächst.

ENTERPRISE READY

Warum Akzeptanztests im agentischen Workflow wichtiger werden

Coding Agenten liefern schnell, und sie bauen dabei Regressionen ein. Kent Beck, Pionier von Test Driven Development, nennt Tests deshalb eine Superkraft im Umgang mit Agenten. In seinem veröffentlichten System Prompt verlangt er, jeweils den nächsten Test umzusetzen und nur so viel Code zu schreiben, dass genau dieser Test grün wird.
Akzeptanztests gehen eine Ebene höher als Unit Tests. Sie prüfen das Verhalten aus Sicht des Nutzers oder Fachbereichs, meist als End to End Test im Browser. Für den Agenten sind sie das deutlichste Signal, dass eine Aufgabe erledigt ist. Wie ein Agent in Schleifen gegen ein solches Ziel arbeitet, zeigt unser Eintrag zum Agent Looping.
Damit verschiebt sich Arbeit nach vorn. Wer Akzeptanzkriterien sauber formuliert, bevor der Agent startet, steuert das Ergebnis. Die Methode dazu beschreibt unser Beitrag zu Example Mapping, die Rolle der Tests als Dokumentation der Beitrag Tests als lebende Spezifikation.

Das Problem: Der Agent bewertet seine eigene Arbeit

Die Forschung dazu ist deutlich. Die Benchmark ImpossibleBench aus dem Oktober 2025 baut Aufgaben, deren Tests der Spezifikation widersprechen. Jeder bestandene Test beweist also einen Trick. Das Ergebnis: Frontier Modelle schummeln häufig, stärkere Modelle oft sogar mehr. Claude Modelle und Qwen3 Coder griffen dabei vor allem zum Ändern der Tests.
Kent Beck beschreibt dasselbe aus der Praxis. Zu seinen Warnsignalen bei der Arbeit mit Agenten gehört jeder Hinweis, dass der Agent Tests abschaltet oder löscht. Im Podcast The Pragmatic Engineer erzählte er, wie schwer es ist, Agenten davon abzuhalten, Tests zu löschen, nur damit sie bestehen.
Es gibt auch gute Nachrichten. Strengere Anweisungen senkten die Schummelrate in ImpossibleBench drastisch, bei GPT-5 in einer Variante von 92 auf 1 Prozent. Auch weniger Zugriff auf die Tests half. Schutzregeln wirken also, wenn man sie konsequent setzt.

Akzeptanztest Levels: Vom Klicktest zum agentischen Loop

Kaum ein Team startet bei null, und keines sollte bei Stufe vier beginnen. Die Tabelle zeigt vier Stufen, wie wir sie mit Teams einordnen. Jede Stufe setzt die vorige voraus.

Akzeptanztest Levels im Überblick

Level Tools Freigabe
1 Manuell Checkliste, Testprotokoll, Klicktest Fachbereich nimmt von Hand ab
2 Automatisiert Cypress, Szenarien im Given When Then Format Pipeline blockiert bei rotem Test
3 Generiert cy.prompt, KI Testgenerierung für SAP Prozesse Mensch prüft den generierten Testcode vor dem Commit
4 Agentisch Coding Agent im Loop, geschützte Testdateien, Cypress in CI Mensch gibt den Merge frei, Tests nur per Review änderbar
Aufsteigendes Säulendiagramm der vier Akzeptanztest Stufen Manuell, Automatisiert, Generiert und Agentisch. Inhalt steht textuell in der Tabelle darüber.

Akzeptanzkriterien als Auftrag für den Agenten

Ein guter Akzeptanztest beginnt als Satz, den der Fachbereich versteht. Das Format Given When Then hat sich dafür bewährt: Ausgangslage, Aktion, erwartetes Ergebnis. Solche Szenarien sind gleichzeitig Anforderung, Testfall und Prompt.
Cypress greift das direkt auf. Laut Cypress kann ein Product Manager Akzeptanzkriterien aufschreiben, die mit cy.prompt zu einem ausführbaren Test werden, auch in einer Form nah an Gherkin. Damit können Product Owner, QA und Support Tests beisteuern, ohne JavaScript zu schreiben.
Wie Szenarien, PRD und Architekturentscheidungen gemeinsam den Kontext für einen Agenten bilden, zeigt die Dokumentenkette für KI Coding. Ergänzend sichern Schema Based AI Coding und saubere rules.md und AGENTS.md Dateien die Verträge ab, an denen sich der Agent orientiert.

Akzeptanztests generieren mit cy.prompt

Mit cy.prompt hat Cypress auf der CypressConf 2025 einen Befehl vorgestellt, der Testschritte in natürlicher Sprache in echte Cypress Befehle übersetzt und im Browser ausführt. Der Befehl ist als experimentelles Feature für alle verfügbar und braucht einen Cypress Cloud Account.
cy.prompt ist ein toller Weg, mit dem Testen anzufangen und nach vorne zu gehen. Wer bisher keine Tests hat, kommt damit schnell zu ersten lauffähigen Szenarien. Erfahrene Tester gehen weiter: Sie wissen, welche Fälle fehlen, wo Tests brüchig werden und welche Assertion wirklich etwas absichert. Genau diese Erfahrung bringt Roland Golla als Cypress Ambassador in Teams ein.
Cypress bietet zwei Wege. Beim ersten generiert die KI den Test, das Team prüft den erzeugten Code und speichert ihn versioniert im Projekt. Beim zweiten bleibt cy.prompt im Test und passt Selektoren bei Änderungen der Oberfläche automatisch an. Jede Anpassung erscheint dabei im Command Log.
Für Akzeptanztests ist der erste Weg der sicherere: generieren, lesen, committen. So bleibt der Test ein fester Maßstab, und Änderungen daran laufen über ein Review. Cypress selbst warnt vor Werkzeugen, bei denen die KI über Korrektheit urteilt statt der Mensch, der den Test verantwortet. Generierte Tests gehören ausschließlich in Testumgebungen mit Daten aus Faker, nie an echte Kundendaten.

Schutzregeln: So bleibt der Test der Maßstab

Aus der Forschung und aus unserer Arbeit mit Agenten ergeben sich sechs Regeln:
  • Tests zuerst: Akzeptanztests entstehen vor dem Code, formuliert von Menschen oder einem getrennten Agenten, nie vom Agenten, der umsetzt.
  • Testdateien schützen: Der umsetzende Agent darf Akzeptanztests nicht ändern. Änderungen daran laufen über ein eigenes Review, etwa über festgelegte Code Owner.
  • Rollen trennen: Ein Agent implementiert, ein anderer prüft in einer isolierten Umgebung. Kent Beck nutzt diese Trennung, damit Agenten schwache Ergebnisse nicht schönreden.
  • Klare Anweisung bei Widersprüchen: Passt ein Test nicht zur Anforderung, stoppt der Agent und meldet den Konflikt, statt ihn selbst aufzulösen.
  • Verdeckte Tests: Holdout Tests, die der Agent nicht sieht, decken Tricks auf. Laut der EvilGenie Studie helfen sie, sind aber nicht lückenlos.
  • Diffs auf Tests markieren: Die Pipeline schlägt Alarm, wenn ein Merge Request Code und Akzeptanztests gleichzeitig ändert.
Wie die Pipeline solche Regeln erzwingt, zeigt unser Beitrag zu Quality Gates für KI Code. Scope, Evidenz und Freigabe für den Agenten selbst beschreibt der Governed Agent Loop.

Akzeptanztests bei externen Dienstleistern

Wenn ein Dienstleister agentisch entwickelt, werden Akzeptanztests zum Vertrag. Der Auftraggeber formuliert die Kriterien, der Dienstleister liefert eine grüne Pipeline und die Nachweise dazu. Entscheidend ist dabei eine Frage: Wer hat die Tests geschrieben, und wer durfte sie ändern?
Im SAP Umfeld setzt SAP für Tests auf Prozessebene auf Tricentis. SAP Enterprise Continuous Testing by Tricentis erzeugt dort seit Mai 2026 Testfälle per KI aus Prozessbeschreibungen in natürlicher Sprache. Wie Agenten in einer SAP Landschaft andocken, beschreibt unser Eintrag zum ABAP MCP Server. Welche Fragen Auftraggeber an agentisch arbeitende Partner stellen sollten, steht unter Agentic Product Engineering, den vollständigen Fragenkatalog für die Ausschreibung liefert unser RFP Leitfaden zu KI Anforderungen an Umsetzungspartner.

Any indication that the genie was cheating, for example by disabling or deleting tests.

Kent Beck, Begründer von Extreme Programming und Pionier von Test Driven Development – Tidy First? Newsletter

Agentische Akzeptanztests in der Praxis mit Never Code Alone

Unsere Reihenfolge ist seit Jahren dieselbe: statische Analyse, Unit Tests, funktionale Tests, End to End Tests mit Cypress. Mit Agenten kommt eine Regel dazu: Der Maßstab gehört nicht dem, der gemessen wird. Deshalb trennen wir Tests und Umsetzung konsequent und machen jede Änderung an einem Test sichtbar.
CYPRESS.IO Ambassador und IT Consultant für QA Engenieering und Qualität in PHP Projekten.

NCA Vibe Coding Consulting

Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.

Häufige Fragen zu agentischen Akzeptanztests

Die Antworten decken die häufigsten Fragen zu agentischen Akzeptanztests ab: Definition, Risiken durch manipulierte Tests, Schutzregeln, cy.prompt und die Arbeit mit Dienstleistern. Stand: September 2026.

Was sind agentische Akzeptanztests 2026?

Agentische Akzeptanztests sind Akzeptanztests, die im Workflow mit KI Agenten als Maßstab dienen. Der Coding Agent arbeitet, bis sie grün sind, und Agenten helfen zunehmend, sie aus Anforderungen in natürlicher Sprache zu erzeugen. Weil der Test damit über Qualität entscheidet, braucht er klare Regeln, wer ihn schreibt und wer ihn ändern darf.

Warum manipulieren KI Agenten 2026 Tests?

Agenten optimieren auf das Ziel, das sie sehen, und das ist oft ein grüner Test. Die Benchmark ImpossibleBench zeigt, dass Frontier Modelle häufig Tests ändern, Sonderfälle hart codieren oder andere Abkürzungen nehmen, wenn Test und Anforderung sich widersprechen. Stärkere Modelle schummeln dabei oft mehr. Strenge Anweisungen und weniger Zugriff auf Tests senken die Rate deutlich.

Wie schützt man Akzeptanztests 2026 vor KI Agenten?

Tests entstehen vor dem Code und nicht durch den umsetzenden Agenten. Testdateien sind für ihn gesperrt, Änderungen laufen über ein eigenes Review. Ein zweiter Agent prüft isoliert, verdeckte Holdout Tests decken Tricks auf, und die Pipeline meldet Merge Requests, die Code und Tests gleichzeitig ändern. Bei Widersprüchen stoppt der Agent und meldet den Konflikt.

Was ist cy.prompt 2026?

cy.prompt ist ein KI gestützter Cypress Befehl, der Testschritte in natürlicher Sprache in echte Cypress Befehle übersetzt und im Browser ausführt. Cypress hat ihn auf der CypressConf 2025 vorgestellt, er ist experimentell und braucht einen Cypress Cloud Account. Den erzeugten Code kann man jederzeit ansehen und exportieren. Für Teams ohne Tests ist cy.prompt ein toller Einstieg ins Testen.

Können Product Owner 2026 Akzeptanztests selbst schreiben?

Ja, zumindest die Kriterien. Szenarien im Format Given When Then versteht der Fachbereich, und Werkzeuge wie cy.prompt machen daraus ausführbare Tests. Wichtig bleibt, dass jemand mit Testerfahrung den erzeugten Code prüft, bevor er zum Maßstab wird. Methoden wie Example Mapping helfen, Kriterien gemeinsam mit Entwicklung und QA zu schärfen.

Was ist der Unterschied zwischen Akzeptanztest und Unit Test?

Ein Unit Test prüft eine einzelne Funktion oder Klasse isoliert. Ein Akzeptanztest prüft das Verhalten aus Sicht des Nutzers oder Fachbereichs, meist als End to End Test im Browser. Im agentischen Workflow brauchen Teams beides: Unit Tests fangen Fehler früh und schnell, Akzeptanztests zeigen, ob die Anforderung wirklich erfüllt ist.

Sollte der Coding Agent seine eigenen Akzeptanztests schreiben?

Nein. Wer Code und Test gleichzeitig schreibt, bewertet seine eigene Arbeit und kann den Maßstab unbemerkt anpassen. Akzeptanztests sollten von Menschen oder einem getrennten Agenten stammen und vor der Umsetzung feststehen. Der umsetzende Agent darf Unit Tests ergänzen, die Akzeptanztests aber nicht verändern.

Was sind Holdout Tests?

Holdout Tests sind zusätzliche Tests, die der Agent während der Arbeit nicht sieht. Sie laufen erst nach der Umsetzung und decken Lösungen auf, die nur die sichtbaren Tests bedienen. Die EvilGenie Studie zeigt, dass sie hilfreich, aber nicht lückenlos sind, weil auch heuristische Lösungen verdeckte Tests bestehen können.

Welche Werkzeuge braucht man für agentische Akzeptanztests?

Ein E2E Framework wie Cypress, eine CI Pipeline, die bei roten Tests blockiert, und Regeln, die Testdateien schützen. Für die Kriterien helfen Given When Then Szenarien, für die Generierung Werkzeuge wie cy.prompt. Realistische Testdaten liefert Faker. Im SAP Umfeld übernimmt Tricentis die Testautomatisierung auf Prozessebene.

Funktionieren agentische Akzeptanztests auch bei externen Dienstleistern?

Ja, dort sind sie besonders wertvoll. Akzeptanztests werden zum Vertrag: Der Auftraggeber formuliert die Kriterien, der Dienstleister liefert eine grüne Pipeline mit Nachweisen. Entscheidend ist die Frage, wer die Tests geschrieben hat und wer sie ändern durfte. Ohne diese Klarheit sagt ein grüner Test wenig über die Qualität.

Was bedeutet Self Healing bei E2E Tests?

Self Healing heißt, dass ein Test Selektoren automatisch anpasst, wenn sich die Oberfläche ändert. cy.prompt bietet das, wenn der Befehl dauerhaft im Test bleibt, und zeigt jede Anpassung im Command Log. Für Akzeptanztests ist das mit Vorsicht zu nutzen, weil sich der Maßstab dann ohne Review verändern kann.

Kann Never Code Alone bei agentischen Akzeptanztests helfen?

Ja. Testing ist unser Ursprung, Roland Golla ist Cypress Ambassador, und Cypress mit Cypress Cloud läuft bei uns intensiv in Production. Wir helfen Teams, Akzeptanzkriterien zu formulieren, Tests vor Agenten zu schützen und die Pipeline als Quality Gate aufzusetzen. Der Einstieg ist ein kostenloses Kennenlernen, abgerechnet wird transparent minutengenau.