Was würde Ihr Projekt bei uns kosten? Beschreiben Sie es in wenigen Zeilen und sehen Sie unsere Preisspanne in zwei Minuten. Schätzung erhalten

Was kostet es, einen KI-Agenten zu entwickeln?

Bei Lytvynov Production beginnt ein individueller KI-Agent ab 5.000 USD für einen einzelnen Workflow und kostet typischerweise bis zu 30.000 USD für einen Business-Agenten, der an mehrere Systeme angebunden ist, während Multi-Agenten- oder stark regulierte Systeme bis etwa 150.000 USD reichen. Eine typische US- oder UK-Agentur verlangt für denselben Umfang etwa das 2,5- bis 4-Fache. Der Betrag hängt weniger von "KI" ab als davon, aus wie vielen Systemen der Agent lesen und in wie viele er schreiben muss, wie viel Schaden eine falsche Aktion anrichten kann und wie sorgfältig die Genauigkeit vor dem Launch nachgewiesen werden muss.

Ein KI-Agent ist in diesem Ratgeber Software rund um ein großes Sprachmodell (OpenAI, Anthropic Claude oder ein offenes Modell), die mehr kann als chatten: Sie ruft Tools und APIs auf, sucht Daten heraus und führt Aktionen aus, etwa ein Ticket anlegen, einen CRM-Datensatz aktualisieren oder einen Auftrag disponieren. Diese Fähigkeit zu handeln unterscheidet die Kosten für die Entwicklung eines KI-Agenten von den Kosten eines einfachen Chatbots. Jede Aktion braucht eine Integration, Berechtigungen, Logging und einen Plan für den Fall, dass das Modell falsch liegt.

Welche Kostenspannen gelten für KI-Agenten nach Komplexität?

Bei uns beginnen die einfachsten sinnvollen Agenten ab 5.000 USD, und die meisten Business-Agenten mit echten Integrationen liegen zwischen 10.000 und 30.000 USD. Die Tabelle zeigt unsere typischen Spannen für eine einmalige Entwicklung (Entwicklung, Evaluierung und Pilot, ohne die monatlichen Betriebskosten) neben dem, was eine typische US- oder UK-Agentur für denselben Umfang verlangt.

Agententyp Typischer Umfang Zeitrahmen Bei Lytvynov Production Typische US/UK-Agentur
Agent mit einem Workflow Eine Aufgabe (zum Beispiel eingehende E-Mails sortieren), 1 bis 3 Tools, überwiegend lesend 4 bis 8 Wochen ab 5.000 USD (typischerweise 5.000 bis 12.000 USD) 5.000 bis 40.000 USD
Multi-Tool-Business-Agent Mehrere Systeme (CRM, Helpdesk, Datenbank), schreibt Daten, menschliche Freigabeschritte 8 bis 16 Wochen 10.000 bis 30.000 USD 25.000 bis 120.000 USD
Kundennaher Agent im großen Maßstab Öffentliche Nutzer, RAG über eine Wissensdatenbank, Übergabe an Mitarbeitende, Analytics 10 bis 20 Wochen 15.000 bis 50.000 USD 40.000 bis 200.000 USD
Multi-Agenten- oder reguliertes System Mehrere kooperierende Agenten, feinabgestimmte Modelle, strenge Audit- und Datenregeln 4 bis 9 Monate 50.000 bis 100.000 USD 125.000 bis 400.000+ USD

Verstehen Sie diese Werte als Orientierung, nicht als Angebot. Zwei Agenten, die im Vertriebsgespräch identisch klingen, können sich um den Faktor drei unterscheiden, sobald Integrationen, Sonderfälle und Compliance aufgelistet sind. Bei Lytvynov Production geben wir ein Festpreisangebot nach einem kurzen Scoping-Gespräch ab, weil erst dort der tatsächliche Umfang sichtbar wird.

Sollten Sie einen KI-Agenten kaufen oder entwickeln lassen?

Kaufen Sie, wenn ein Anbieter den benötigten Workflow bereits verkauft und Ihre Daten in Systemen liegen, die dieser Anbieter unterstützt; lassen Sie entwickeln, wenn der Agent in Ihrem eigenen Produkt handeln oder Regeln befolgen muss, die kein Anbieter kennt. Viele Unternehmen haben am Ende beides: einen Standard-Agenten für generische Aufgaben und einen individuellen Agenten für den Prozess, der sie vom Wettbewerb abhebt.

Kriterium Kaufen (SaaS-Agent) Entwickeln (individueller Agent)
Zeit bis zum ersten Ergebnis Tage bis wenige Wochen 4 bis 16 Wochen
Anfangskosten Gering, vor allem Einrichtung Bei uns ab 5.000 USD, die meisten Business-Agenten 10.000 bis 30.000 USD (bei einer US/UK-Agentur das 2,5- bis 4-Fache)
Laufende Kosten Pro Nutzer, pro Gespräch oder pro Lösung, wächst mit der Nutzung Tokens, Hosting und Wartung, wächst langsamer mit der Nutzung
Passung zu Ihrem Prozess Begrenzt auf Funktionen und Konnektoren des Anbieters Genau Ihre Regeln, Systeme und Daten
Datenhoheit Daten laufen über den Anbieter Sie wählen Modelle, Hosting und Aufbewahrung
Anbieterabhängigkeit Hoch Geringer, besonders bei modellunabhängigem Design

Der ehrliche Test lautet: Volumen mal Spezifität. Ein kleines Support-Team, das häufige Fragen in einem verbreiteten Helpdesk beantwortet, wird ein Standardprodukt bei den Kosten selten schlagen. Ein Unternehmen, das einen Agenten zum Kalkulieren, Terminieren oder Disponieren im eigenen Backoffice möchte, kann das meist überhaupt nicht kaufen. Speziell für den Kundenservice vergleicht unser Ratgeber zu KI-Agenten im Kundenservice Standardtools und Eigenentwicklungen im Detail.

Was treibt die Kosten für die Entwicklung eines KI-Agenten?

Integrationen, Risiko und Evaluierung machen den Großteil der Kosten aus; der Prompt selbst ist nur ein kleiner Teil. Wenn wir einen Agenten scopen, bewegen diese Punkte die Schätzung am stärksten.

  1. Anzahl und Qualität der Integrationen. Jedes System, das der Agent berührt, braucht Authentifizierung, Fehlerbehandlung und Tests. Eine saubere REST-API kann Tage dauern; ein Altsystem ohne API kann Wochen kosten.
  2. Lesende oder schreibende Aktionen. Ein Agent, der nur liest und zusammenfasst, ist weit günstiger als einer, der Datensätze ändert, Nachrichten versendet oder Geld ausgibt. Schreibende Aktionen brauchen Berechtigungsprüfungen, Bestätigungsschritte und Audit-Logs.
  3. Wissensabruf (RAG). Muss der Agent aus Ihren Dokumenten antworten, zahlen Sie für Ingestion, Chunking, einen Vektorspeicher wie pgvector oder Qdrant und das Tuning der Suche. Unsere Seite zur RAG-Entwicklung erklärt diese Schicht.
  4. Evaluierung und Leitplanken. Ein ernsthafter Agent braucht ein Testset aus echten Fällen, automatische Bewertung und Regressionstests vor jeder Prompt- oder Modelländerung. Diese Arbeit fehlt in billigen Angeboten oft und ist der Hauptgrund, warum Agenten in Produktion scheitern.
  5. Mensch im Prozess. Freigabe-Warteschlangen, Eskalationsregeln und eine Oberfläche, in der Mitarbeitende die Arbeit des Agenten prüfen, erweitern den Umfang, senken aber das Risiko.
  6. Modellstrategie. Gehostete APIs von OpenAI oder Anthropic sind der günstigste Einstieg. Fine-Tuning oder das Hosten offener Modelle bringt GPU-Infrastruktur und MLOps mit sich. In unserem Projekt AI Grief Companion waren LoRA-Training auf einem offenen Modell und eine RAG-Gedächtnisschicht durch das Produkt gerechtfertigt, die meisten Business-Agenten brauchen das aber nicht.
  7. Compliance und Datenregeln. Anforderungen an Verschlüsselung, Datenresidenz, Aufbewahrung und Löschung kosten zusätzliche Design- und Testzeit.

Was kostet der Betrieb eines KI-Agenten pro Monat?

Die meisten Business-Agenten kosten im Betrieb einige hundert bis mehrere tausend Dollar pro Monat, verteilt auf Modell-Tokens, Hosting und Monitoring. Interne Agenten mit geringem Volumen laufen für unter 300 USD im Monat; kundennahe Agenten mit viel Traffic können 5.000 USD überschreiten.

Monatlicher Kostenposten Was er abdeckt Typische Spanne (Markt, 2026)
LLM-Tokens Eingabe- und Ausgabe-Tokens für jeden Modellaufruf 50 bis 5.000+ USD
Hosting API-Server, Worker, Queues, Datenbank 50 bis 800 USD
Vektordatenbank / Suche Gemanagter oder selbst gehosteter Retrieval-Speicher 0 bis 500 USD
Monitoring und Tracing Logs, Traces, Evaluierungsläufe, Alerting 0 bis 500 USD
Wartung Prompt-Updates, Modell-Upgrades, Integrationskorrekturen Oft 15 bis 25 % der Entwicklungskosten pro Jahr

Die Token-Kosten sind der Posten, der überrascht. Eine Nutzeranfrage ist selten ein einziger Modellaufruf: Ein Agent plant vielleicht, ruft zwei Tools auf, liest die Ergebnisse und formuliert eine Antwort, was vier bis acht Aufrufe bedeuten kann. Jeder Aufruf sendet Anweisungen und Kontext erneut, daher dominieren meist die Eingabe-Tokens die Rechnung.

Wie schätzt man die LLM-Token-Kosten für einen Agenten?

Multiplizieren Sie Aufgaben pro Monat mit Modellaufrufen pro Aufgabe und Tokens pro Aufruf und wenden Sie dann den Preis pro Million Tokens der genutzten Modelle an. Wer das vor der Entwicklung auf dem Papier durchrechnet, vermeidet die meisten Budgetüberraschungen.

Hier eine beispielhafte Rechnung mit angenommenen Zahlen, kein Angebot. Ein Agent bearbeitet 1.000 Aufgaben pro Tag. Jede Aufgabe braucht fünf Modellaufrufe mit durchschnittlich 4.000 Tokens, also 20.000 Tokens pro Aufgabe, 20 Millionen pro Tag und rund 600 Millionen pro Monat. Bei einem angenommenen Mischpreis von 2 USD pro Million Tokens liegt die Rechnung bei etwa 1.200 USD im Monat. Nutzt derselbe Agent für jeden Schritt ein Frontier-Modell zu einem deutlich höheren Preis, kann sich die Rechnung vervielfachen; gehen einfache Schritte an ein kleines Modell, kann sie deutlich sinken.

Die praktischen Hebel sind bekannt:

  • Modell-Routing: Klassifikation und Extraktion an kleine, günstige Modelle geben und große Modelle für Schlussfolgerungen und finale Antworten reservieren.
  • Prompt-Caching: OpenAI und Anthropic bieten beide vergünstigte Preise für wiederkehrenden Kontext, was Agenten mit langen System-Prompts hilft.
  • Kürzerer Kontext: drei relevante Passagen abrufen, statt ein ganzes Handbuch einzufügen.
  • Harte Limits: Schritte pro Aufgabe und Tokens pro Nutzer begrenzen, damit eine Schleife nicht das Budget verbrennt.

Unser Integrationsratgeber für ChatGPT und Claude behandelt diese Kostenkontrollen Schritt für Schritt.

Wo laufen Budgets für KI-Agenten typischerweise aus dem Ruder?

Budgets laufen meist an drei Stellen aus dem Ruder: unterschätzte Integrationen, fehlende Evaluierung und kein Verantwortlicher nach dem Launch. Alle drei lassen sich günstiger einplanen als nachträglich beheben.

Integrationen werden unterschätzt, weil Demos mit simulierten Daten arbeiten. Sobald der Agent zum ersten Mal auf ein echtes CRM mit inkonsistenten Feldern, doppelten Datensätzen und Rate-Limits trifft, entsteht eine Woche Arbeit. Wir begegnen dem, indem wir uns schon im ersten Sprint mit echten Sandbox-Konten verbinden. In unserem CRM-Projekt für einen Blumen-Abodienst hatte jede Integration eine Sandbox-Implementierung hinter derselben Schnittstelle, sodass der gesamte Ablauf durchgängig getestet werden konnte, bevor es Produktionszugangsdaten gab.

Die Evaluierung wird ausgelassen, weil sie keine sichtbare Funktion erzeugt. Ohne Testset kann niemand sagen, ob ein neuer Prompt oder ein neues Modell den Agenten verbessert oder verschlechtert hat, und Teams hören aus Vorsicht auf, ihn weiterzuentwickeln. Ein paar Dutzend gut ausgewählte echte Fälle mit automatischer Bewertung reichen für den Anfang.

Die Verantwortung wird vergessen, weil das Projekt mit dem Launch als abgeschlossen gilt. Modelle ändern sich, angebundene APIs ändern sich, und Nutzer finden neue Sonderfälle. Jemand muss fehlgeschlagene Gespräche prüfen, sie ins Testset aufnehmen und Korrekturen ausliefern.

Ist ein autonomer Agent teurer als ein geführter?

Ja. Je mehr Freiheit ein Agent hat, Aktionen selbst zu wählen, desto mehr geben Sie für Leitplanken, Tests und Monitoring aus. Ein geführter Agent, der einem definierten Workflow folgt und riskante Schritte von einem Menschen freigeben lässt, ist günstiger in der Entwicklung und leichter zu vertrauen.

Volle Autonomie ist sinnvoll, wo Aktionen umkehrbar und die Regeln klar sind. In unserem F&E-Projekt für einen Drohnenschwarm übernimmt die Flotte Aufgaben aus einer Warteschlange, sobald ein Fluggerät frei wird, ganz ohne Disponenten. Das funktioniert, weil die Aufgabenregeln explizit sind und der Operator jede Zuweisung auf einer Karte sieht. Bei Geld, Kundenkommunikation oder rechtlichen Verpflichtungen setzen wir standardmäßig auf menschliche Freigabe und lockern sie erst, wenn die Fehlerquote des Agenten gemessen ist.

Kann man klein anfangen und den Agenten später ausbauen?

Ja, und das ist meist der günstigste Weg. Beginnen Sie mit einem Workflow, nur lesend oder mit Freigabe jeder Aktion, messen Sie einige Wochen lang die Genauigkeit und fügen Sie dann Tools und Autonomie dort hinzu, wo die Zahlen es rechtfertigen.

Ein gestufter Plan könnte so aussehen:

  1. Scoping (1 bis 2 Wochen): Workflow abbilden, Systeme und Berechtigungen auflisten, 30 bis 100 echte Beispiele für die Evaluierung sammeln.
  2. Pilot-Agent (3 bis 6 Wochen): ein Workflow, wenige Tools, menschliche Freigabe, Logging ab dem ersten Tag.
  3. Produktionsreife (2 bis 6 Wochen): Fehlerbehandlung, Kostenlimits, Monitoring, Zugriffskontrolle.
  4. Ausbau: neue Tools und Workflows, jeweils mit eigenen Evaluierungsfällen.

So haben wir auch AI Resume Master gebaut, unser eigenes KI-SaaS: Die LLM-Funktionen gingen innerhalb einer dreimonatigen Entwicklung live und wurden erweitert, als die reale Nutzung zeigte, wo Nutzer Hilfe brauchten.

So arbeiten wir an KI-Agenten-Projekten

KI-Agenten beginnen bei uns ab 5.000 USD, größere Agenten wachsen mit Integrationen, Autonomie und Compliance. Nach einem kurzen Scoping-Gespräch erhalten Sie ein Festpreisangebot: Wir bilden Ihren Workflow ab, schätzen Token- und Hosting-Kosten auf Basis Ihrer echten Volumen und benennen die Risiken. Die Entwicklung läuft dann in Meilensteinen mit festem Umfang. Unsere Senior-Entwickler arbeiten intern mit KI-Coding-Agenten, was ein Grund für unsere kurzen Zeitpläne ist, und wir bauen MCP-Server und Agenten-Tooling für unsere eigenen Produkte, kennen also die Betriebsseite und nicht nur die Demo.

Wenn Sie wissen möchten, was die Entwicklung und der Betrieb Ihres Agenten kosten würden, sehen Sie sich unseren Service zur KI-Agenten-Entwicklung an oder buchen Sie ein Scoping-Gespräch und bringen Sie einen Workflow mit, den Sie automatisieren möchten.

Case Studies

Häufig gestellte Fragen

Kaufen ist meist günstiger, wenn Ihr Workflow dem entspricht, was ein Anbieter bereits verkauft, etwa FAQ-artiger Kundensupport in einem verbreiteten Helpdesk. Eine Eigenentwicklung wird über ein bis drei Jahre günstiger, wenn der Agent in Ihren eigenen Systemen handeln, unternehmensspezifische Regeln befolgen oder hohe Volumen verarbeiten muss, denn Gebühren pro Nutzer oder pro Lösung wachsen mit der Nutzung, während ein individueller Agent vor allem Tokens und Hosting kostet.

Die Token-Ausgaben hängen vom Aufgabenvolumen ab, davon, wie viele Modellaufrufe eine Aufgabe braucht, und davon, welches Modell Sie nutzen. Ein interner Agent mit geringem Volumen kommt oft mit unter 200 USD im Monat aus. Ein kundennaher Agent, der täglich Tausende mehrstufige Aufgaben bearbeitet, kann mehrere tausend Dollar ausgeben. Einfache Schritte an kleinere Modelle zu leiten und wiederkehrenden Kontext zu cachen sind die beiden Hebel, die diese Rechnung am stärksten senken.

Ein Agent mit einem Workflow und zwei oder drei Tool-Integrationen braucht typischerweise 4 bis 8 Wochen inklusive Evaluierung und Pilot. Ein Agent, der mehrere Geschäftssysteme berührt und rollenbasierte Berechtigungen sowie menschliche Freigabeschritte benötigt, braucht meist 8 bis 16 Wochen. Die meiste Zeit fließt in Integrationen, Testdatensätze und Leitplanken, nicht in Prompts.

Planen Sie drei wiederkehrende Posten ein: Modellnutzung (Tokens), Infrastruktur (Hosting, Vektordatenbank, Logging) und Wartung. Die Wartung umfasst Prompt- und Modell-Updates, neue Evaluierungsfälle, API-Änderungen in angebundenen Systemen und Monitoring. Ein gängiger Planungswert sind 15 bis 25 Prozent der ursprünglichen Entwicklungskosten pro Jahr, zusätzlich zur Nutzung.

Angebote unterscheiden sich, weil Anbieter von unterschiedlichem Umfang ausgehen. Ein Angebot deckt vielleicht eine Demo ab, die im Idealfall funktioniert; ein anderes umfasst Integrationen mit Authentifizierung, Audit-Logs, Evaluierungsdatensätze, Übergabe an Menschen und Produktions-Monitoring. Fragen Sie jeden Anbieter, was passiert, wenn der Agent falsch liegt, wie die Genauigkeit gemessen wird und wem Prompts und Code gehören.

Starten wir Ihr Projekt
Gespräch buchen