Die Vergleichsseiten auf dieser Website decken dreizehn KI-Agenten, Coding-Tools und App-Builder ab, wobei jedes mit TODO for AI und dem restlichen Feld verglichen wird. Sie werden aus einer einzigen Datendatei erzeugt. Darum nutzt jede Seite dieselben Fakten, dieselben sechs Dimensionen und dieselbe Ranking-Regel. Dieser Guide erklärt die Regel und listet die Seiten auf.
Offenlegung: TODO for AI erstellt diese Seiten über seine eigenen Konkurrenten. Jede Angabe trägt ein Prüfdatum, und die Gewichte sind unten veröffentlicht. So kannst du das Ranking nachprüfen, statt ihm einfach zu glauben.
Die abgedeckten Tools
| Tool | Kategorie | Modelle | Ab | Vergleich |
|---|---|---|---|---|
| Claude Code | Coding-Agent | nur Anthropic | 20 $/Monat | vs · Alternativen |
| OpenAI Codex | Coding-Agent | nur OpenAI | 8 $/Monat | vs · Alternativen |
| Cursor | IDE | mehrere Anbieter, nutzungsbasiert | 20 $/Monat | vs · Alternativen |
| OpenCode | Coding-Agent | jeder Anbieter (BYOK) | kostenlos | vs · Alternativen |
| Cline | IDE-Erweiterung | jeder Anbieter (BYOK) | kostenlos | vs · Alternativen |
| Aider | Coding-Agent | jeder Anbieter (BYOK) | kostenlos | vs · Alternativen |
| OpenHands | Coding-Agent | jeder Anbieter | kostenlos (Self-Host) | vs · Alternativen |
| Claude Cowork | allgemeiner Agent | nur Anthropic | 20 $/Monat | vs · Alternativen |
| ChatGPT | allgemeiner Agent | nur OpenAI | kostenlos | vs · Alternativen |
| Lindy | allgemeiner Agent | die meisten großen Modelle | 30 $/Monat | vs · Alternativen |
| Manus | allgemeiner Agent | vom Anbieter gewählt | 20 $/Monat | vs · Alternativen |
| Lovable | App-Builder | vom Anbieter gewählt | 25 $/Monat | vs · Alternativen |
| Base44 | App-Builder | vom Anbieter gewählt, Modellauswahl in kostenpflichtigen Tarifen | 16 $/Monat | vs · Alternativen |
Die Preise sind öffentliche Listenpreise zum Prüfdatum, das auf jeder Seite steht (15.–18. September 2026). Bei „BYOK“-Tools fällt keine Toolgebühr an; die Tokens werden jedoch über dein eigenes Anbieterkonto abgerechnet.
Wie eine Seite bewertet wird
Jedes Tool bekommt auf sechs Dimensionen eine ganzzahlige Wertung von 0 bis 5. Dieselben sechs gelten für TODO for AI.
| Dimension | Was sie misst |
|---|---|
| Modellfreiheit | Welche Anbieter und Modelle du nutzen kannst |
| Langlaufende Arbeit | Persistente Rechenumgebung, Zeitplanung, parallele Aufgaben |
| Über Code hinaus | Marketing, Ops, Browser, E-Mail — nicht nur Repositories |
| Offenheit | Quellcode verfügbar, Self-Hosting, erweiterbar |
| Team & Rechte | Rollen, gemeinsames Kontingent, Freigaben für Tools |
| Kostenplanbarkeit | Flatrate-Tarif oder nutzungsabhängige Token-Abrechnung |
Ein direkter Vergleich (/vs/<tool>) zeigt die Wertungen beider Tools nebeneinander, dazu eine Feature-Matrix und die Preisstaffel. Er erstellt kein Ranking. Er stellt die beiden Profile dar und sagt, wer sich für welches entscheiden sollte.
Wie ein Rollen-Guide rankt
Die sechs Zielgruppen-Guides — Gründer, Solo-Entwickler, Agenturen, Marketing-Teams, nicht-technische Teams, Startups — sind gerankt. Das Ranking wird berechnet und nicht redaktionell festgelegt.
- bearbeitet Code?
- führt Aktionen in Geschäftssystemen aus?
- ohne Terminal nutzbar?
- jede Dimension bekommt w ∈ [0.25, 3]
- nicht aufgeführte Dimensionen zählen 1
- Tools absteigend sortiert
Dabei ist (D) die Menge der sechs oben genannten Dimensionen, und ist standardmäßig 1 für jede Dimension, die die Rolle nicht aufführt.
Das Gate läuft zuerst, bei allen Rollen, die eines festlegen. Eine gewichtete Summe lässt nämlich zu, dass eine Stärke eine Aufgabe ausgleicht, die das Tool gar nicht erledigen kann. Der Guide für Marketing-Teams verlangt beides: führt Aktionen in Geschäftssystemen aus und ohne Terminal nutzbar. Ein Tool, das eines von beiden nicht erfüllt, steht als ausgeschlossen in der Liste, statt niedrig eingestuft zu werden, egal wie gut es Code bearbeitet. Die Guides für Gründer und Startups legen kein Gate fest und ranken das ganze Feld.
Zwei Beispiele für Gewichtungen aus den veröffentlichten Daten:
| Rolle | Modelle | Autonomie | Umfang | Offenheit | Team | Kosten |
|---|---|---|---|---|---|---|
| Gründer | 1,5 | 2,5 | 3 | 1 | 1 | 2 |
| Solo-Entwickler | 3 | 2 | 0,5 | 2 | 0,25 | 1,5 |
Dasselbe Tool landet in verschiedenen Guides auf verschiedenen Plätzen, weil sich die Gewichte unterscheiden, nicht die Fakten. Jede Guide-Seite nennt ihre Gewichte im Text, damit du die Gewichtung hinterfragen kannst.
So liest du die Seiten
- Fang bei dem Tool an, das du schon nutzt: Die vs-Seite beantwortet „Was ändert sich, wenn ich wechsle?“. Die Alternativen-Seite beantwortet „Was gibt es sonst noch?“.
- Fang bei der Aufgabe an: Der Rollen-Guide beantwortet „Welches Tool zuerst?“, mit offen gelegter Gewichtung.
- Einen Editor, der nach seinen eigenen Maßstäben bewertet wird und nicht gegen uns, findest du im Cursor-Review.
- Zur Benchmark-Zahl auf den Coding-Agent-Seiten lies die Terminal-Bench 2.1 Methodik — auch dazu, warum sie nicht direkt mit den Leaderboard-Werten daneben vergleichbar ist.
Kompaktversionen
Fünf der Vergleiche, jeweils auf eine einzige Tabelle verdichtet, als öffentliche Google Docs: KI-To-do-Liste: Test mit fünf Aufgaben, Alternativen zu Claude Cowork für Teams, Backoffice: Wer die Arbeit fertig macht, Agent in deinem Browser, in dem du angemeldet bist, Claude Code für Aufgaben ohne Code. Index-Tabelle.