KI-IMPERIUM
Code Review mit KI: Warum ein Modell sich nie selbst prüft

Code Review mit KI: Warum ein Modell sich nie selbst prüft

Ruwen Bädorf··7 Min. Lesezeit

Wer seine KI den eigenen Code prüfen lässt, bekommt fast immer ein Ja. Mit Claudex Loop plant und baut ein Modell, und das andere prüft.

Code Review mit KI funktioniert erst dann zuverlässig, wenn nicht dasselbe Modell prüft, das den Code geschrieben hat. Die einfachste Lösung ist ein zweites Modell von einem anderen Anbieter, das den Plan vorher zerlegt und den fertigen Code hinterher kontrolliert.

Genau das macht der kostenlose Skill Claudex Loop, der Claude Code und Codex von OpenAI gegeneinander arbeiten lässt. Wie das Ganze aussieht, zeige ich in einem kurzen Reel auf @ruwen.ai bei Instagram.

Warum Code Review mit KI oft nichts findet

Die meisten lassen ihre KI Code schreiben und fragen danach dieselbe KI, ob alles passt. Die Antwort ist fast immer ja. Das liegt nicht daran, dass der Code gut ist. Es liegt daran, dass das Modell seine eigenen Annahmen noch einmal liest und sie für richtig hält.

Stell dir vor, du lässt einen Text von dem Menschen korrigieren, der ihn gerade geschrieben hat. Der Tippfehler im dritten Absatz fällt ihm nicht auf, weil er im Kopf schon das richtige Wort liest. Bei Code ist es genauso, nur teurer.

Die Fehler, die dabei durchrutschen, sind selten Tippfehler. Es sind fehlende Prüfungen, vergessene Sonderfälle und Stellen, an denen der neue Code nicht zum alten passt. Solche Lücken sieht nur jemand, der die Aufgabe mit anderen Augen liest.

🔥 Willst du dir das zweite Paar Augen gleich einrichten? Im Guide zu Claudex Loop stehen der Link zum Skill und alle Befehle zum Kopieren. → Guide holen

So funktioniert Code Review mit KI, wenn zwei Modelle beteiligt sind

Claudex Loop ist ein Skill für Claude Code, also eine fertige Arbeitsanweisung, die du einmal installierst. Er verteilt die Arbeit auf zwei Anbieter und sorgt dafür, dass keiner seine eigene Arbeit abnickt. Der Ablauf hat vier Phasen, die im Projekt selbst beschrieben sind (Quelle: Claudex Loop auf GitHub, Stand September 2026).

  1. In der Erkundung sieht sich der Skill deinen vorhandenen Code an und schreibt auf, wovon er ausgeht.
  2. In der Klärung stellt er dir die Fragen, die das Ergebnis verändern, und schreibt daraus einen Plan mit prüfbaren Zielen.
  3. In der Planprüfung liest das andere Modell den Plan und widerspricht mit Belegen, bis der Plan freigegeben ist oder die Runden aufgebraucht sind.
  4. Im Bau setzt ein Modell den Plan um, und das jeweils andere prüft den fertigen Code in einer frischen Sitzung.

Der wichtigste Satz aus der Anleitung des Projekts lautet sinngemäß: Wer gebaut hat, bewertet nie selbst. Du legst nur fest, wer baut. Mit der Einstellung builder=codex baut Codex, und Claude prüft. Mit builder=claude ist es genau andersherum.

Was Code Review mit KI anders macht als ein einzelnes Modell

Der Unterschied liegt nicht in der Intelligenz der Modelle, sondern in der Rolle. Ein Modell, das prüft und nicht selbst gebaut hat, hat keinen Grund, eine Lösung zu verteidigen. Die Tabelle zeigt, was sich dadurch ändert.

FrageEin Modell macht allesZwei Modelle mit Claudex Loop
Wer prüft den Plan?Das Modell, das ihn geschrieben hatDas Modell des anderen Anbieters
Wann wird geprüft?Meist erst am Ende, wenn überhauptVor dem ersten Code und nach dem Bau
Was passiert bei Einwänden?Sie werden oft weggeredetSie landen im Protokoll mit einer Entscheidung
Was, wenn der Plan später geändert wird?Nichts, es geht einfach weiterDie Freigabe erlischt, und es wird neu geprüft
Was bleibt übrig?Nur der CodeDer Code, der Plan und ein Prüfprotokoll

Der vorletzte Punkt ist der unterschätzte. Das Projekt speichert zu jeder Freigabe einen Fingerabdruck des Plans. Ändert jemand den Plan danach, gilt die Freigabe nicht mehr (Quelle: Claudex Loop auf GitHub). So kann niemand still einen geprüften Plan gegen einen ungeprüften tauschen.

Wie viele Runden Code Review mit KI braucht

Eine berechtigte Sorge ist, dass sich zwei Modelle endlos gegenseitig korrigieren. Das verhindert der Skill mit festen Obergrenzen. In der Grundeinstellung gibt es höchstens fünf Runden für die Planprüfung. Für Nachbesserungen am Code sind es höchstens zwei Versuche. Bei der Endkontrolle gibt es eine erste Prüfung und höchstens eine zweite (Quelle: Einstellungen in der Anleitung von Claudex Loop).

Die Planprüfung endet außerdem, sobald das prüfende Modell ein klares Urteil fällt. Möglich sind drei Urteile: freigegeben, überarbeiten oder blockiert. Du kannst die Rundenzahl für die Planprüfung selbst herabsetzen, wenn es schneller gehen soll.

Für dich heißt das: Der Durchlauf hat ein Ende, und du siehst am Protokoll, warum er genau dort geendet hat.

🔥 Du willst den Ablauf an deinem eigenen Projekt testen? Der Guide mit dem kompletten Setup hat die Installation und den Satz, mit dem du den ersten Durchlauf startest. → Guide holen

Was du für Code Review mit KI nach diesem Muster brauchst

Die Voraussetzungen sind überschaubar. Du brauchst Claude Code und Codex, und beide müssen mit deinem Konto angemeldet sein. Codex läuft über dein ChatGPT-Abo, Claude Code über dein Claude-Abo. Einen zusätzlichen API-Schlüssel brauchst du laut der Anleitung nicht. Auf deinem Rechner muss außerdem Python ab Version 3.10 installiert sein.

Die Installation besteht aus zwei Befehlen in Claude Code. Der erste fügt den Katalog hinzu, in dem der Skill liegt. Der zweite installiert den Skill selbst. Danach öffnest du eine neue Sitzung, und der Skill steht bereit.

Für den ersten Durchlauf rufst du den Skill auf und beschreibst in zwei, drei Sätzen, was gebaut werden soll. Schreib dazu, woran du erkennst, dass es fertig ist. Genau aus diesem Satz macht der Skill später die prüfbaren Ziele im Plan. Je klarer du ihn formulierst, desto weniger muss das prüfende Modell raten. Am Ende liegen zwei Dateien in deinem Projekt: der Plan und das Prüfprotokoll mit allen Einwänden.

Achte beim Herunterladen auf die richtige Adresse. Auf GitHub gibt es viele Kopien des Projekts, das Original liegt bei chaseai-yt.

Wofür sich Code Review mit KI im Alltag lohnt

Der naheliegende Fall ist neuer Code für eine Funktion, die sonst niemand prüft. Wer allein arbeitet, hat keinen Kollegen, der mal drüberschaut. Genau diese Lücke füllt ein zweites Modell.

Der zweite Fall ist ein Umbau an etwas, das schon läuft. Hier sind die gefährlichen Fehler nicht im neuen Code, sondern an der Stelle, an der er auf den alten trifft. Weil der Skill in der ersten Phase den vorhandenen Code liest, fallen solche Brüche früh auf.

Der dritte Fall wird oft übersehen. Du musst gar nicht bauen lassen, um den Skill zu nutzen. Er kann auch nur einen Plan prüfen, den du schon hast. Ein reiner Prüfauftrag erlaubt ihm ausdrücklich nicht, danach mit dem Bauen anzufangen.

Was sich für mich bei Code Review mit KI geändert hat

Früher habe ich am Ende eines Projekts geprüft, und da war es oft zu spät. Ein falscher Gedanke im Plan steckte dann schon in zehn Dateien. Heute lasse ich den Plan prüfen, bevor die erste Zeile Code entsteht. Die Einwände kommen dadurch an der Stelle, an der sie am wenigsten kosten.

Das Schönste daran ist das Protokoll. Ich sehe, welcher Einwand kam, was daraus wurde und was bewusst offen geblieben ist. Wenn später etwas nicht funktioniert, muss ich nicht raten, woran es lag.

Wo Code Review mit KI an seine Grenzen kommt

Zwei Modelle finden mehr als eines, aber nicht alles. Wenn beide denselben blinden Fleck haben, übersehen sie denselben Fehler. Deshalb ersetzt der Ablauf nicht deinen eigenen Blick auf die Stellen, an denen es um Geld, Kundendaten oder Zugänge geht.

Außerdem kostet jede Prüfrunde Arbeitszeit der Modelle. Ein kompletter Durchlauf mit mehreren Runden verbraucht spürbar mehr von deinem Kontingent als eine einzelne Frage. Für eine Kleinigkeit lohnt sich der ganze Ablauf deshalb nicht.

Die Faustregel ist einfach. Je teurer ein Fehler später wäre, desto mehr lohnt sich die Prüfung vorher.

🔥 Bereit für deinen ersten geprüften Plan? Im Guide zu Claudex Loop findest du alles, was du für den ersten Durchlauf brauchst. → Guide holen

Über Ruwen Bädorf

Ich bin Ruwen Bädorf und ich baue Systeme, die mit KI von allein arbeiten. Ich helfe Selbstständigen, ihre Arbeit einmal zu bauen statt jeden Tag zu wiederholen.

  • Ich baue und betreibe die komplette Reel-Fabrik auf ki-imperium.com selbst, vom Skript über den Avatar bis zur Auslieferung des Guides.
  • Ich arbeite täglich mit Claude, Lovable und Higgsfield und zeige genau die Abläufe, die ich selbst fahre.
  • Auf Instagram veröffentliche ich diese Abläufe als Reels, jeweils mit einem Guide zum Nachbauen.

→ Folg mir auf Instagram

Das könnte dich auch interessieren

ChatGPT und Claude verbinden zeigt das offizielle Plugin von OpenAI für Claude Code. Claude Code Agenten erklärt, wie mehrere Agenten gemeinsam an einer Aufgabe arbeiten. KI Agenten selbst bauen ist der Einstieg, wenn du ganz von vorne anfängst.

Wer Code Review mit KI ernst nimmt, lässt nie das Modell prüfen, das den Code geschrieben hat.

Häufige Fragen

Kann eine KI ein Code Review machen?

Ja. Am zuverlässigsten wird es, wenn nicht das Modell prüft, das den Code geschrieben hat, sondern ein zweites von einem anderen Anbieter.

Warum findet die KI in ihrem eigenen Code so wenig?

Weil sie beim Prüfen dieselben Annahmen liest, die sie beim Schreiben getroffen hat. Fehlende Prüfungen und vergessene Sonderfälle fallen ihr dadurch kaum auf.

Ersetzt Code Review mit KI den eigenen Blick?

Nein. Zwei Modelle finden mehr als eines, aber an Stellen mit Geld, Kundendaten oder Zugängen solltest du selbst noch einmal hinschauen.

Was kostet Code Review mit Claudex Loop?

Der Skill selbst ist kostenlos und quelloffen. Die Arbeit der beiden Modelle läuft über deine bestehenden Abos bei Claude und ChatGPT.

Wie lange dauert ein Durchlauf mit zwei Modellen?

Das hängt vom Projekt ab. Der Skill begrenzt die Runden fest: höchstens fünf für die Planprüfung, zwei Nachbesserungen und eine Nachkontrolle.

Weiterlesen

ChatGPT und Claude verbinden: OpenAIs neues Plugin

Seit Kurzem gibt es ein offizielles Plugin von OpenAI, mit dem Codex direkt in Claude Code läuft. Vier Befehle, dann prüfen sich die beiden Modelle gegenseitig.

Claude Code Agenten: So arbeitet ein ganzes Team für dich

Von den eingebauten Subagents bis zum Ruflo-Schwarm: So lässt du in Claude Code mehrere Agenten gleichzeitig für dich arbeiten.

KI Agenten selbst bauen: die 3 Bausteine, die zählen

Du gibst einmal ein Ziel vor, und ein System arbeitet weiter, bis es erreicht ist. Wie das geht und woran es fast immer scheitert.

Hol dir den kostenlosen Guide

Konkrete Schritte, die du sofort in deinem Business anwenden kannst.

Kostenlos. Eintragen dauert zehn Sekunden.