AI Agent Tooling Landscape
Rund 100 Tools zum Entwickeln mit KI-Agenten, sortiert in 14 Kategorien entlang des Stacks – vom Editor, in dem man tippt, bis zum Review-Bot, der das Ergebnis prüft. Jede Kategorie ist nach dem gerankt, was Hacker News und Reddit über die einzelnen Tools im vergangenen Jahr geschrieben haben, ergänzt durch GitHub-Sternzahlen – mit Kosten, Lizenz, aktuellen Statusänderungen und einem Link zu jedem Tool.
Warum es das gibt
Mein aktuelles Setup ist: Zed als Editor, Claude Code als Agent, eine handgeschriebene agents.md-Datei, die jede neue Session mit dem Projekt vertraut macht, tmux um Sessions am Leben zu erhalten, und mein eigenes n8n-Deployment für die handvoll Aufgaben, die sich regelmässig wiederholen. Keine Remote-Control-App, kein Control Plane, keine parallelen Orchestratoren – auch wenn ich ein Wochenende mit Firstmate verbracht habe und die Idee überzeugend fand, auch wenn sie sich noch früh angefühlt hat. Für Modelle jenseits von Claude leite ich gelegentlich über OpenRouter, wenn ich etwas Neues ausprobieren möchte, zum Beispiel Jev. Code Review mache ich noch von Hand.
Das Setup funktioniert gut für mich. Aber der Tooling-Space bewegt sich schnell genug, dass ich immer wieder zweifelte: Übersehe ich etwas Offensichtliches? Ich sah einen Thread auf Hacker News, öffnete fünf Tabs, las die Hälfte davon und schloss den Browser – ohne klüger zu sein als vorher. Das Signal steckte irgendwo in diesen Kommentar-Threads und Reddit-Diskussionen – es war nur nicht organisiert. Also entschied ich mich, es richtig zu machen: alle Tools zu katalogisieren, die ich finden konnte, zu prüfen, was die Communities über jedes einzelne im vergangenen Jahr wirklich gesagt hatten, und sie nach diesem Signal zu ranken – nicht nach Marketing-Texten oder Sternzahlen.
Was mich am meisten überraschte, war, wie schnell es sich zusammenfügte. Systematisch ein Jahr lang Hacker-News- und Reddit-Diskussionen über rund hundert Tools zu lesen, Sentiment-Scores zu vergeben, GitHub-Zahlen gegenzuprüfen und die Zusammenfassungen zu schreiben – das wäre als Solo-Rechercheprojekt wochenlange Abende gewesen. Mit KI-Unterstützung bei der Suche, der Synthese und der repetitiven Datenarbeit dauerte es ein paar intensive Tage. Diese Lücke ist das eigentliche Argument für die Tools auf dieser Seite.
Wie das Ranking entstand
Jedes Tool wird auf zwei Dimensionen bewertet – Popularität und Sentiment – aus zwei Communities über dasselbe Einjahresfenster: 29. Sep. 2025 – 29. Sep. 2026. Hacker News wurde über seine öffentliche Algolia-API durchsucht; Reddit über seine öffentliche JSON-API, beschränkt auf Subreddits, in denen das Tool tatsächlich diskutiert wird (r/ClaudeAI, r/LocalLLaMA, r/cursor, r/programming, r/n8n und ähnliche).
Popularität (0–4 Punkte für HN, 0–3 für Reddit) misst, wie viel die Community über ein Tool gesprochen hat. Für HN ist das ein Verbundwert aus drei Signalen: Stories, in denen das Tool das Thema war, alle Kommentare in diesen Threads und Erwähnungen des Tool-Namens in Kommentaren anderswo. Die Summe dieser drei Zahlen wird dann in Punkte umgerechnet – über 5.000 ergibt vier Punkte, über 1.000 ergibt drei, und so weiter. Bei Reddit werden einfach dedizierte Posts gezählt. Fahre mit der Maus über das Label Popularität auf einer Karte, um die genauen Schwellenwerte zu sehen.
Sentiment (0–4 Punkte) ist eine Ermessensentscheidung: Ein LLM hat pro Tool 15–40 aktuelle Kommentare gelesen, dazu die Top-Level-Kommentare der grössten Threads, und daraus eine Punktzahl von sehr negativ (0) bis sehr positiv (4) abgeleitet. Jedes Zitat auf einer Karte verlinkt zurück auf den Originalkommentar, damit man die Bewertung selbst prüfen kann. Fahre mit der Maus über das Label Sentiment auf einer Karte für die vollständige Skala.
Rank = Sentiment + Popularität. Bei Gleichstand gewinnt das Tool mit mehr Diskussion, weil mehr Kommentare die Sentiment-Bewertung zuverlässiger machen. Tools mit dem Flag Thin data haben nur eine Handvoll relevante Kommentare und sollten mit Vorsicht behandelt werden. Tools ohne verwertbares Material erscheinen am Ende ihrer Kategorie als ungerankt.
Praxisbeispiel – Cursor. Rund 1.000 HN-Stories im Beobachtungszeitraum plus ein hohes Volumen an Kommentar-Erwähnungen ergibt Popularität ●●●● (Gesamtwert über 5.000). Die Durchsicht der Threads zeigt einen dominant positiven Ton – schnell, ausgereift, der Massstab, an dem andere gemessen werden – aber die SpaceX-Übernahme und der anschliessende Rückzug der OpenAI-Modelle lösten genug «Was jetzt?»-Unsicherheit aus, um bei Sentiment ●●●○ (Positiv statt Sehr positiv) zu bleiben. HN-Rank: 3 + 4 = 7. Auf Reddit hat r/cursor (158K Mitglieder) einen stetigen Strom an Tipps und Vergleichen mit wärmerem Ton als HN: Reddit-Popularität ●●● und Sentiment ●●●○.
Ein wichtiger Vorbehalt: Kurze oder gebräuchliche Namen blähen die HN-Zahlen auf. Manus trifft auch lateinische Texte, Conductor trifft ein anderes Produkt, und CrewAI taucht stark in Job-Suchenden-Skill-Listen auf, nicht in echten Nutzungsdiskussionen. Die HN-API begrenzt auch die tiefe Paginierung, sodass sehr hohe Gesamtwerte Untergrenzen sind, keine exakten Zahlen.