Was kostet es, einen KI-Agenten zu entwickeln?
Bei Lytvynov Production beginnt ein individueller KI-Agent ab 5.000 USD für einen einzelnen Workflow und kostet typischerweise bis zu 30.000 USD für einen Business-Agenten, der an mehrere Systeme angebunden ist, während Multi-Agenten- oder stark regulierte Systeme bis etwa 150.000 USD reichen. Eine typische US- oder UK-Agentur verlangt für denselben Umfang etwa das 2,5- bis 4-Fache. Der Betrag hängt weniger von "KI" ab als davon, aus wie vielen Systemen der Agent lesen und in wie viele er schreiben muss, wie viel Schaden eine falsche Aktion anrichten kann und wie sorgfältig die Genauigkeit vor dem Launch nachgewiesen werden muss.
Ein KI-Agent ist in diesem Ratgeber Software rund um ein großes Sprachmodell (OpenAI, Anthropic Claude oder ein offenes Modell), die mehr kann als chatten: Sie ruft Tools und APIs auf, sucht Daten heraus und führt Aktionen aus, etwa ein Ticket anlegen, einen CRM-Datensatz aktualisieren oder einen Auftrag disponieren. Diese Fähigkeit zu handeln unterscheidet die Kosten für die Entwicklung eines KI-Agenten von den Kosten eines einfachen Chatbots. Jede Aktion braucht eine Integration, Berechtigungen, Logging und einen Plan für den Fall, dass das Modell falsch liegt.
Welche Kostenspannen gelten für KI-Agenten nach Komplexität?
Bei uns beginnen die einfachsten sinnvollen Agenten ab 5.000 USD, und die meisten Business-Agenten mit echten Integrationen liegen zwischen 10.000 und 30.000 USD. Die Tabelle zeigt unsere typischen Spannen für eine einmalige Entwicklung (Entwicklung, Evaluierung und Pilot, ohne die monatlichen Betriebskosten) neben dem, was eine typische US- oder UK-Agentur für denselben Umfang verlangt.
| Agententyp | Typischer Umfang | Zeitrahmen | Bei Lytvynov Production | Typische US/UK-Agentur |
|---|---|---|---|---|
| Agent mit einem Workflow | Eine Aufgabe (zum Beispiel eingehende E-Mails sortieren), 1 bis 3 Tools, überwiegend lesend | 4 bis 8 Wochen | ab 5.000 USD (typischerweise 5.000 bis 12.000 USD) | 5.000 bis 40.000 USD |
| Multi-Tool-Business-Agent | Mehrere Systeme (CRM, Helpdesk, Datenbank), schreibt Daten, menschliche Freigabeschritte | 8 bis 16 Wochen | 10.000 bis 30.000 USD | 25.000 bis 120.000 USD |
| Kundennaher Agent im großen Maßstab | Öffentliche Nutzer, RAG über eine Wissensdatenbank, Übergabe an Mitarbeitende, Analytics | 10 bis 20 Wochen | 15.000 bis 50.000 USD | 40.000 bis 200.000 USD |
| Multi-Agenten- oder reguliertes System | Mehrere kooperierende Agenten, feinabgestimmte Modelle, strenge Audit- und Datenregeln | 4 bis 9 Monate | 50.000 bis 100.000 USD | 125.000 bis 400.000+ USD |
Verstehen Sie diese Werte als Orientierung, nicht als Angebot. Zwei Agenten, die im Vertriebsgespräch identisch klingen, können sich um den Faktor drei unterscheiden, sobald Integrationen, Sonderfälle und Compliance aufgelistet sind. Bei Lytvynov Production geben wir ein Festpreisangebot nach einem kurzen Scoping-Gespräch ab, weil erst dort der tatsächliche Umfang sichtbar wird.
Sollten Sie einen KI-Agenten kaufen oder entwickeln lassen?
Kaufen Sie, wenn ein Anbieter den benötigten Workflow bereits verkauft und Ihre Daten in Systemen liegen, die dieser Anbieter unterstützt; lassen Sie entwickeln, wenn der Agent in Ihrem eigenen Produkt handeln oder Regeln befolgen muss, die kein Anbieter kennt. Viele Unternehmen haben am Ende beides: einen Standard-Agenten für generische Aufgaben und einen individuellen Agenten für den Prozess, der sie vom Wettbewerb abhebt.
| Kriterium | Kaufen (SaaS-Agent) | Entwickeln (individueller Agent) |
|---|---|---|
| Zeit bis zum ersten Ergebnis | Tage bis wenige Wochen | 4 bis 16 Wochen |
| Anfangskosten | Gering, vor allem Einrichtung | Bei uns ab 5.000 USD, die meisten Business-Agenten 10.000 bis 30.000 USD (bei einer US/UK-Agentur das 2,5- bis 4-Fache) |
| Laufende Kosten | Pro Nutzer, pro Gespräch oder pro Lösung, wächst mit der Nutzung | Tokens, Hosting und Wartung, wächst langsamer mit der Nutzung |
| Passung zu Ihrem Prozess | Begrenzt auf Funktionen und Konnektoren des Anbieters | Genau Ihre Regeln, Systeme und Daten |
| Datenhoheit | Daten laufen über den Anbieter | Sie wählen Modelle, Hosting und Aufbewahrung |
| Anbieterabhängigkeit | Hoch | Geringer, besonders bei modellunabhängigem Design |
Der ehrliche Test lautet: Volumen mal Spezifität. Ein kleines Support-Team, das häufige Fragen in einem verbreiteten Helpdesk beantwortet, wird ein Standardprodukt bei den Kosten selten schlagen. Ein Unternehmen, das einen Agenten zum Kalkulieren, Terminieren oder Disponieren im eigenen Backoffice möchte, kann das meist überhaupt nicht kaufen. Speziell für den Kundenservice vergleicht unser Ratgeber zu KI-Agenten im Kundenservice Standardtools und Eigenentwicklungen im Detail.
Was treibt die Kosten für die Entwicklung eines KI-Agenten?
Integrationen, Risiko und Evaluierung machen den Großteil der Kosten aus; der Prompt selbst ist nur ein kleiner Teil. Wenn wir einen Agenten scopen, bewegen diese Punkte die Schätzung am stärksten.
- Anzahl und Qualität der Integrationen. Jedes System, das der Agent berührt, braucht Authentifizierung, Fehlerbehandlung und Tests. Eine saubere REST-API kann Tage dauern; ein Altsystem ohne API kann Wochen kosten.
- Lesende oder schreibende Aktionen. Ein Agent, der nur liest und zusammenfasst, ist weit günstiger als einer, der Datensätze ändert, Nachrichten versendet oder Geld ausgibt. Schreibende Aktionen brauchen Berechtigungsprüfungen, Bestätigungsschritte und Audit-Logs.
- Wissensabruf (RAG). Muss der Agent aus Ihren Dokumenten antworten, zahlen Sie für Ingestion, Chunking, einen Vektorspeicher wie pgvector oder Qdrant und das Tuning der Suche. Unsere Seite zur RAG-Entwicklung erklärt diese Schicht.
- Evaluierung und Leitplanken. Ein ernsthafter Agent braucht ein Testset aus echten Fällen, automatische Bewertung und Regressionstests vor jeder Prompt- oder Modelländerung. Diese Arbeit fehlt in billigen Angeboten oft und ist der Hauptgrund, warum Agenten in Produktion scheitern.
- Mensch im Prozess. Freigabe-Warteschlangen, Eskalationsregeln und eine Oberfläche, in der Mitarbeitende die Arbeit des Agenten prüfen, erweitern den Umfang, senken aber das Risiko.
- Modellstrategie. Gehostete APIs von OpenAI oder Anthropic sind der günstigste Einstieg. Fine-Tuning oder das Hosten offener Modelle bringt GPU-Infrastruktur und MLOps mit sich. In unserem Projekt AI Grief Companion waren LoRA-Training auf einem offenen Modell und eine RAG-Gedächtnisschicht durch das Produkt gerechtfertigt, die meisten Business-Agenten brauchen das aber nicht.
- Compliance und Datenregeln. Anforderungen an Verschlüsselung, Datenresidenz, Aufbewahrung und Löschung kosten zusätzliche Design- und Testzeit.
Was kostet der Betrieb eines KI-Agenten pro Monat?
Die meisten Business-Agenten kosten im Betrieb einige hundert bis mehrere tausend Dollar pro Monat, verteilt auf Modell-Tokens, Hosting und Monitoring. Interne Agenten mit geringem Volumen laufen für unter 300 USD im Monat; kundennahe Agenten mit viel Traffic können 5.000 USD überschreiten.
| Monatlicher Kostenposten | Was er abdeckt | Typische Spanne (Markt, 2026) |
|---|---|---|
| LLM-Tokens | Eingabe- und Ausgabe-Tokens für jeden Modellaufruf | 50 bis 5.000+ USD |
| Hosting | API-Server, Worker, Queues, Datenbank | 50 bis 800 USD |
| Vektordatenbank / Suche | Gemanagter oder selbst gehosteter Retrieval-Speicher | 0 bis 500 USD |
| Monitoring und Tracing | Logs, Traces, Evaluierungsläufe, Alerting | 0 bis 500 USD |
| Wartung | Prompt-Updates, Modell-Upgrades, Integrationskorrekturen | Oft 15 bis 25 % der Entwicklungskosten pro Jahr |
Die Token-Kosten sind der Posten, der überrascht. Eine Nutzeranfrage ist selten ein einziger Modellaufruf: Ein Agent plant vielleicht, ruft zwei Tools auf, liest die Ergebnisse und formuliert eine Antwort, was vier bis acht Aufrufe bedeuten kann. Jeder Aufruf sendet Anweisungen und Kontext erneut, daher dominieren meist die Eingabe-Tokens die Rechnung.
Wie schätzt man die LLM-Token-Kosten für einen Agenten?
Multiplizieren Sie Aufgaben pro Monat mit Modellaufrufen pro Aufgabe und Tokens pro Aufruf und wenden Sie dann den Preis pro Million Tokens der genutzten Modelle an. Wer das vor der Entwicklung auf dem Papier durchrechnet, vermeidet die meisten Budgetüberraschungen.
Hier eine beispielhafte Rechnung mit angenommenen Zahlen, kein Angebot. Ein Agent bearbeitet 1.000 Aufgaben pro Tag. Jede Aufgabe braucht fünf Modellaufrufe mit durchschnittlich 4.000 Tokens, also 20.000 Tokens pro Aufgabe, 20 Millionen pro Tag und rund 600 Millionen pro Monat. Bei einem angenommenen Mischpreis von 2 USD pro Million Tokens liegt die Rechnung bei etwa 1.200 USD im Monat. Nutzt derselbe Agent für jeden Schritt ein Frontier-Modell zu einem deutlich höheren Preis, kann sich die Rechnung vervielfachen; gehen einfache Schritte an ein kleines Modell, kann sie deutlich sinken.
Die praktischen Hebel sind bekannt:
- Modell-Routing: Klassifikation und Extraktion an kleine, günstige Modelle geben und große Modelle für Schlussfolgerungen und finale Antworten reservieren.
- Prompt-Caching: OpenAI und Anthropic bieten beide vergünstigte Preise für wiederkehrenden Kontext, was Agenten mit langen System-Prompts hilft.
- Kürzerer Kontext: drei relevante Passagen abrufen, statt ein ganzes Handbuch einzufügen.
- Harte Limits: Schritte pro Aufgabe und Tokens pro Nutzer begrenzen, damit eine Schleife nicht das Budget verbrennt.
Unser Integrationsratgeber für ChatGPT und Claude behandelt diese Kostenkontrollen Schritt für Schritt.
Wo laufen Budgets für KI-Agenten typischerweise aus dem Ruder?
Budgets laufen meist an drei Stellen aus dem Ruder: unterschätzte Integrationen, fehlende Evaluierung und kein Verantwortlicher nach dem Launch. Alle drei lassen sich günstiger einplanen als nachträglich beheben.
Integrationen werden unterschätzt, weil Demos mit simulierten Daten arbeiten. Sobald der Agent zum ersten Mal auf ein echtes CRM mit inkonsistenten Feldern, doppelten Datensätzen und Rate-Limits trifft, entsteht eine Woche Arbeit. Wir begegnen dem, indem wir uns schon im ersten Sprint mit echten Sandbox-Konten verbinden. In unserem CRM-Projekt für einen Blumen-Abodienst hatte jede Integration eine Sandbox-Implementierung hinter derselben Schnittstelle, sodass der gesamte Ablauf durchgängig getestet werden konnte, bevor es Produktionszugangsdaten gab.
Die Evaluierung wird ausgelassen, weil sie keine sichtbare Funktion erzeugt. Ohne Testset kann niemand sagen, ob ein neuer Prompt oder ein neues Modell den Agenten verbessert oder verschlechtert hat, und Teams hören aus Vorsicht auf, ihn weiterzuentwickeln. Ein paar Dutzend gut ausgewählte echte Fälle mit automatischer Bewertung reichen für den Anfang.
Die Verantwortung wird vergessen, weil das Projekt mit dem Launch als abgeschlossen gilt. Modelle ändern sich, angebundene APIs ändern sich, und Nutzer finden neue Sonderfälle. Jemand muss fehlgeschlagene Gespräche prüfen, sie ins Testset aufnehmen und Korrekturen ausliefern.
Ist ein autonomer Agent teurer als ein geführter?
Ja. Je mehr Freiheit ein Agent hat, Aktionen selbst zu wählen, desto mehr geben Sie für Leitplanken, Tests und Monitoring aus. Ein geführter Agent, der einem definierten Workflow folgt und riskante Schritte von einem Menschen freigeben lässt, ist günstiger in der Entwicklung und leichter zu vertrauen.
Volle Autonomie ist sinnvoll, wo Aktionen umkehrbar und die Regeln klar sind. In unserem F&E-Projekt für einen Drohnenschwarm übernimmt die Flotte Aufgaben aus einer Warteschlange, sobald ein Fluggerät frei wird, ganz ohne Disponenten. Das funktioniert, weil die Aufgabenregeln explizit sind und der Operator jede Zuweisung auf einer Karte sieht. Bei Geld, Kundenkommunikation oder rechtlichen Verpflichtungen setzen wir standardmäßig auf menschliche Freigabe und lockern sie erst, wenn die Fehlerquote des Agenten gemessen ist.
Kann man klein anfangen und den Agenten später ausbauen?
Ja, und das ist meist der günstigste Weg. Beginnen Sie mit einem Workflow, nur lesend oder mit Freigabe jeder Aktion, messen Sie einige Wochen lang die Genauigkeit und fügen Sie dann Tools und Autonomie dort hinzu, wo die Zahlen es rechtfertigen.
Ein gestufter Plan könnte so aussehen:
- Scoping (1 bis 2 Wochen): Workflow abbilden, Systeme und Berechtigungen auflisten, 30 bis 100 echte Beispiele für die Evaluierung sammeln.
- Pilot-Agent (3 bis 6 Wochen): ein Workflow, wenige Tools, menschliche Freigabe, Logging ab dem ersten Tag.
- Produktionsreife (2 bis 6 Wochen): Fehlerbehandlung, Kostenlimits, Monitoring, Zugriffskontrolle.
- Ausbau: neue Tools und Workflows, jeweils mit eigenen Evaluierungsfällen.
So haben wir auch AI Resume Master gebaut, unser eigenes KI-SaaS: Die LLM-Funktionen gingen innerhalb einer dreimonatigen Entwicklung live und wurden erweitert, als die reale Nutzung zeigte, wo Nutzer Hilfe brauchten.
So arbeiten wir an KI-Agenten-Projekten
KI-Agenten beginnen bei uns ab 5.000 USD, größere Agenten wachsen mit Integrationen, Autonomie und Compliance. Nach einem kurzen Scoping-Gespräch erhalten Sie ein Festpreisangebot: Wir bilden Ihren Workflow ab, schätzen Token- und Hosting-Kosten auf Basis Ihrer echten Volumen und benennen die Risiken. Die Entwicklung läuft dann in Meilensteinen mit festem Umfang. Unsere Senior-Entwickler arbeiten intern mit KI-Coding-Agenten, was ein Grund für unsere kurzen Zeitpläne ist, und wir bauen MCP-Server und Agenten-Tooling für unsere eigenen Produkte, kennen also die Betriebsseite und nicht nur die Demo.
Wenn Sie wissen möchten, was die Entwicklung und der Betrieb Ihres Agenten kosten würden, sehen Sie sich unseren Service zur KI-Agenten-Entwicklung an oder buchen Sie ein Scoping-Gespräch und bringen Sie einen Workflow mit, den Sie automatisieren möchten.