Was braucht es, um ChatGPT oder Claude in eine Anwendung zu integrieren?

ChatGPT / Claude in eine Anwendung integrieren heißt, einen Back-End-Service hinzuzufügen, der sorgfältig aufgebaute Prompts an die API eines großen Sprachmodells (LLM) sendet, die Antworten auf Ihre eigenen Daten stützt und Ergebnisse liefert, denen Ihre Nutzer vertrauen können. Der API-Aufruf selbst besteht aus wenigen Zeilen Code. Die eigentliche Arbeit liegt darin, den richtigen Anwendungsfall zu wählen, Daten aufzubereiten, Prompts zu gestalten, Guardrails einzubauen, Qualität zu messen und die Kosten planbar zu halten.

Dieser Leitfaden beschreibt die Schritte, denen wir bei Lytvynov Production folgen, wenn wir LLM-Funktionen in ein bestehendes SaaS-Produkt einbauen. Er richtet sich an CTOs und Product Owner, die die Entscheidungen verstehen möchten, bevor sie Budget freigeben. Wenn Sie die Arbeit lieber einem Team übergeben, sehen Sie sich unsere Leistungen zur KI-Integration an.

Der Prozess in Kurzform:

  1. Einen eng gefassten, messbaren Anwendungsfall wählen.
  2. Modell und Anbieter wählen (und die Option zum Wechsel offenhalten).
  3. Prompts und strukturierte Ausgaben gestalten.
  4. Antworten per Retrieval (RAG) auf Ihre Daten stützen.
  5. Eine Streaming-Nutzererfahrung bauen.
  6. Guardrails für Eingaben, Ausgaben und Aktionen ergänzen.
  7. Vor dem Launch ein Evaluierungsset aufbauen.
  8. Observability und Kostenerfassung einrichten.
  9. Datenschutz, DPA und Compliance klären.
  10. Schrittweise hinter einem Feature Flag ausrollen.

Mit welchem Anwendungsfall sollten Sie beginnen?

Beginnen Sie mit einem Anwendungsfall, bei dem eine falsche Antwort wenig kostet, Erfolg leicht messbar ist und Nutzer die Aufgabe bereits manuell erledigen. Gute erste Kandidaten sind Entwürfe, Zusammenfassungen, Klassifizierung, Datenextraktion aus Dokumenten und die Beantwortung von Fragen auf Basis Ihres eigenen Help Centers oder Ihrer Wissensdatenbank.

Vermeiden Sie den Einstieg mit einem offenen "KI-Assistenten, der alles kann". Er ist schwer zu evaluieren, schwer abzusichern und schwer zu erklären. Eine bessere erste Funktion hat eine klare Eingabe, eine klar erwartete Ausgabe und eine Kennzahl: eingesparte Zeit pro Aufgabe, Anteil der ohne Änderungen übernommenen Entwürfe, vermiedene Support-Tickets oder Extraktionsgenauigkeit an einer Stichprobe echter Dokumente.

Unser eigenes Produkt AI Resume Master ist ein gutes Beispiel für einen engen Scope. Das LLM erstellt, überarbeitet und verbessert Lebenslauf-Abschnitte und erzeugt passgenaue Anschreiben, und Nutzer erstellen einen Lebenslauf in 3-5 Minuten. Das Produkt erreichte 50.000 monatlich aktive Nutzer; siehe die Fallstudie AI Resume Master. Die Funktion funktioniert, weil die Aufgabe klar begrenzt ist und der Nutzer das Ergebnis immer prüft.

Wie wählen Sie zwischen OpenAI, Anthropic Claude und Open-Weight-Modellen?

Wählen Sie durch Tests, nicht nach Marke. OpenAI und Anthropic bieten beide Spitzenmodelle mit langem Kontext, Tool Use und strukturierter Ausgabe; Open-Weight-Modelle (etwa aus den Familien Llama, Qwen, Mistral oder gpt-oss) geben Ihnen volle Kontrolle über Hosting und Daten, dafür betreiben Sie die Infrastruktur selbst.

Kriterium OpenAI API Anthropic Claude API Open-Weight-Modelle (selbst gehostet)
Qualität bei komplexen Aufgaben Spitzenniveau; mehrere Modellklassen Spitzenniveau; stark bei langen Dokumenten, Texten und Code Gut und besser werdend; bei anspruchsvollem Reasoning meist hinter den besten gehosteten Modellen
Kostenkontrolle Modellklassen, Prompt-Caching, Batch-Rabatte Modellklassen, Prompt-Caching, Batch-Rabatte Sie zahlen für GPUs, nicht für Tokens; günstig bei konstant hohem Volumen, teuer im Leerlauf
Datenverarbeitung Business-API-Daten standardmäßig nicht fürs Training genutzt; DPA; Aufbewahrungsoptionen je nach Tarif Gleiche Prinzipien; DPA; Aufbewahrungsoptionen je nach Tarif Daten verlassen nie Ihre Infrastruktur
Kontextgröße Große Kontextfenster (Hunderttausende Tokens bei aktuellen Modellen) Große Kontextfenster (Hunderttausende Tokens, bei einigen Modellen mehr) In der Praxis meist kleiner; begrenzt durch Ihren GPU-Speicher
Tool Use und strukturierte Ausgabe Ausgereiftes Function Calling und JSON-Schema-Ausgaben Ausgereifter Tool Use, strukturierte Ausgaben, MCP-Unterstützung Von vielen Modellen und Serving-Stacks unterstützt, Qualität schwankt
Cloud-Verfügbarkeit Direkte API und Microsoft Azure Direkte API, AWS Bedrock, Google Cloud Vertex AI Jede Cloud oder On-Premise

Genaue Preise und Modellnamen ändern sich alle paar Monate, deshalb legen wir sie in keinem Plan fest. Stabil bleibt die Entscheidungslogik. Nutzen Sie ein gehostetes Spitzenmodell, wenn Qualität am wichtigsten ist und das Volumen moderat. Nutzen Sie ein kleineres gehostetes Modell für einfache Schritte mit hohem Volumen. Ziehen Sie Open-Weight-Modelle in Betracht, wenn Daten Ihre Umgebung nicht verlassen dürfen, wenn Sie tiefgehendes Fine-Tuning brauchen oder wenn konstantes Volumen GPUs günstiger macht als Tokens.

Was Sie auch wählen: Kapseln Sie den Anbieter hinter Ihrer eigenen Schnittstelle, also einem Service, der eine Aufgabe, eine Prompt-Version und Parameter entgegennimmt und ein typisiertes Ergebnis zurückgibt. Das hält den Vendor-Lock-in gering und macht A/B-Tests zwischen Modellen zu einer Konfigurationsänderung.

Wie gestalten Sie Prompts für eine Funktion in Produktion?

Behandeln Sie Prompts wie Code: versionieren, testen und Änderungen reviewen. Ein Produktions-Prompt hat eine stabile Systemanweisung (Rolle, Regeln, Tonalität, Verhalten bei Unsicherheit), einen klar abgegrenzten Kontextbereich, die Nutzereingabe und ein explizites Ausgabeformat.

Praktische Regeln, die Zeit sparen:

  • Fordern Sie strukturierte Ausgaben an. Nutzen Sie JSON Schema oder Tool-Definitionen, damit Ihr Code typisierte Felder erhält und keinen Freitext, den Sie parsen müssen.
  • Trennen Sie Anweisungen von Daten. Platzieren Sie Nutzerinhalte und abgerufene Dokumente in klar markierten Abschnitten, damit das Modell sie nicht als Anweisungen behandelt.
  • Geben Sie Beispiele. Zwei oder drei kurze Beispiele für Ein- und Ausgabe sind meist besser als ein langer Absatz voller Regeln.
  • Speichern Sie Prompts außerhalb des Code-Releases. Wenn Prompts mit Versionshistorie in einer Datenbank liegen, können Sie Tonalität oder Regeln ohne Deployment anpassen. Dieses Muster haben wir im Projekt AI Grief Companion eingesetzt, wo die Prompts mit Versionshistorie in der Datenbank liegen.

Wann brauchen Sie RAG, und wie fügt es sich ein?

Sie brauchen Retrieval-Augmented Generation (RAG), sobald die Antwort von Daten abhängt, die das Modell nicht kennt: Ihre Dokumentation, Verträge, Tickets, Ihr Produktkatalog oder Kundendaten. RAG ruft zum Zeitpunkt der Anfrage die relevantesten Passagen ab und fügt sie in den Prompt ein, sodass das Modell aus Ihren Quellen antwortet und sie zitieren kann.

Ein minimales RAG-Setup besteht aus einem Ingestion-Job, der Dokumente in Chunks zerlegt und Embeddings speichert, einem Suchschritt (idealerweise hybrid aus Keyword- und Vektorsuche, mit Reranking) und einem Prompt, der die besten Passagen mit ihren Quell-IDs enthält. Berechtigungen sind wichtig: Filtern Sie die Ergebnisse nach dem, was der aktuelle Nutzer sehen darf, bevor irgendetwas das Modell erreicht. Unser Leitfaden zur RAG-Implementierung behandelt Chunking, Vektordatenbanken und Evaluierung im Detail, und unsere Seite RAG-Entwicklung erklärt, wie wir es umsetzen.

Wie bauen Sie eine gute Streaming-UX?

Streamen Sie Tokens an den Nutzer, damit die ersten Wörter nach etwa einer Sekunde erscheinen, statt auf die vollständige Antwort zu warten. Beide großen APIs unterstützen Streaming; Ihr Back-End leitet den Stream per Server-Sent Events oder WebSockets an den Browser weiter.

Zu einer guten LLM-UX gehören außerdem:

  • Ein sichtbarer "Stopp"-Button und die Möglichkeit, neu zu generieren.
  • Quellenangaben oder Links neben Antworten, die auf Ihren Daten beruhen.
  • Klare Zustände für "denkt nach", "sucht" und "ruft ein Tool auf" in mehrstufigen Abläufen.
  • Ein Bearbeitungsschritt, bevor etwas im Namen des Nutzers gesendet, gespeichert oder veröffentlicht wird.
  • Ein Feedback-Element (Daumen hoch oder runter mit optionalem Kommentar), das Ihr Evaluierungsset speist.

Wenn Sie eine Konversationsoberfläche bauen, behandelt unsere Seite KI-Chatbot entwickeln die Übergabe an menschliche Mitarbeiter und das Gesprächsdesign.

Welche Guardrails braucht eine LLM-Funktion?

Eine LLM-Funktion braucht Guardrails an drei Stellen: vor dem Modell (Eingabe), nach dem Modell (Ausgabe) und rund um jede Aktion, die das Modell auslösen kann. Ziel ist, Fehler selten, sichtbar und günstig zu machen.

Ebene Was zu prüfen ist Typische Umsetzung
Eingabe Prompt-Injection-Versuche, missbräuchliche Inhalte, Größenlimits, personenbezogene Daten, die nicht gesendet werden sollten Längenlimits, Moderations-Endpoint, PII-Schwärzung, Abgrenzung nicht vertrauenswürdiger Texte
Retrieval Nutzerberechtigungen, veraltete oder widersprüchliche Quellen ACL-Filter in der Suchanfrage, Aktualitäts-Metadaten
Ausgabe Schema-Validität, verbotene Inhalte, unbelegte Aussagen Schema-Validierung, Moderation, Regel "nur aus dem Kontext antworten", Prüfung der Quellenangaben
Aktionen Irreversible oder kostspielige Vorgänge Allow-List für Tools, Berechtigungen pro Tool, menschliche Freigabe für Schreibzugriffe, Rate Limits

Rufen Sie die API des Anbieters nie aus dem Browser auf, und geben Sie dem Modell nie weitergehende Zugangsdaten als die des aktuellen Nutzers. Wenn Ihre Funktion dem Modell erlaubt, interne APIs aufzurufen, ist ein MCP-Server mit eng begrenzten Tools ein sauberer Weg, diese bereitzustellen.

Wie evaluieren Sie die Qualität vor und nach dem Launch?

Bauen Sie vor dem Launch ein Evaluierungsset auf: 50-200 reale Eingaben mit erwarteten Ausgaben oder Bewertungskriterien, die typische Fälle, Randfälle und bekannte Fehlermuster abdecken. Lassen Sie es bei jeder Änderung an Prompt, Modell oder Retrieval laufen, und liefern Sie nicht aus, wenn die Werte sinken.

Die Evaluierung kombiniert meist drei Methoden. Exakte Prüfungen eignen sich für strukturierte Ausgaben (stimmt die extrahierte Rechnungssumme?). Bewertung nach Kriterienkatalog durch ein zweites Modell, mit menschlicher Stichprobenprüfung, eignet sich für Freitext (ist die Antwort quellentreu, vollständig, im richtigen Ton?). Signale aus der Produktion wie Übernahmequote, Bearbeitungen, Daumen runter und Eskalationen zeigen, was das Testset übersehen hat. Führen Sie schlechte Produktionsbeispiele jede Woche ins Evaluierungsset zurück.

Was sollten Sie protokollieren und überwachen?

Protokollieren Sie jeden LLM-Aufruf mit Prompt-Version, Modell, Anzahl der Eingabe- und Ausgabe-Tokens, Latenz, Kosten, IDs der abgerufenen Dokumente, Tool-Aufrufen und Nutzerfeedback. Ohne diese Daten können Sie weder eine schlechte Antwort debuggen noch eine Kostenspitze erklären oder eine Verbesserung belegen.

Dashboards, die Sie vom ersten Tag an haben sollten: Kosten pro Tag und pro Funktion, Kosten pro aktivem Nutzer, p50- und p95-Latenz, Fehler- und Timeout-Raten pro Anbieter sowie Qualitätssignale aus dem Nutzerfeedback. Maskieren Sie personenbezogene Daten in Logs und wenden Sie dieselben Aufbewahrungsregeln an wie im Rest Ihres Produkts. Die Tools reichen von allgemeinen Observability-Stacks bis zu LLM-spezifischen Tracing-Plattformen; die Wahl ist weniger wichtig, als Traces zu haben, die mit Prompt-Versionen verknüpft sind.

Wie behalten Sie die LLM-Kosten im Griff?

Steuern Sie die Kosten über vier Hebel: Prompt-Caching, Modell-Routing, Kontextlimits und Kontingente pro Nutzer. Zusammen zählen sie meist mehr als der ausgewiesene Preis pro Token.

  • Prompt-Caching. Stellen Sie den langen, stabilen Teil des Prompts (Anweisungen, Beispiele, gemeinsame Dokumente) an den Anfang, damit der Anbieter ihn cachen kann; gecachter Input wird bei beiden großen APIs mit hohem Rabatt abgerechnet.
  • Modell-Routing. Schicken Sie einfache Schritte (Klassifizierung, Extraktion, kurze Umformulierungen) an ein kleines Modell und reservieren Sie das große Modell für schwierige Anfragen.
  • Kontextdisziplin. Rufen Sie 5-10 gute Passagen ab, statt ganze Dokumente in jeden Aufruf zu packen.
  • Batch-Verarbeitung. Nutzen Sie Batch-APIs für nicht interaktive Jobs wie nächtliche Zusammenfassungen oder massenhafte Verschlagwortung.
  • Kontingente und Limits. Legen Sie Limits pro Nutzer und pro Mandant fest, damit ein einzelnes Konto keine Überraschungsrechnung erzeugen kann.

Typische Marktspannen, die wir 2026 sehen: Ein internes Tool mit wenig Traffic kostet im Betrieb einige zehn US-Dollar pro Monat, ein stark genutzter Assistent mit Kundenkontakt dagegen kann mehrere tausend US-Dollar pro Monat kosten. Berücksichtigen Sie die Kosten pro Anfrage früh in Ihrem Preismodell.

Was ist mit Datenschutz, DPAs und Compliance?

Bevor Sie Kundendaten an einen Modellanbieter senden, unterzeichnen Sie dessen Auftragsverarbeitungsvertrag (DPA), prüfen die Aufbewahrungsrichtlinie Ihres Tarifs und aktualisieren Ihre eigene Datenschutzerklärung und Ihre Liste der Unterauftragsverarbeiter. Für regulierte Daten kommen eine Anbieterregion oder ein Cloud-Deployment in Frage, das Ihren Pflichten entspricht, oder ein selbst gehostetes Open-Weight-Modell.

Senden Sie so wenig wie möglich: Entfernen Sie Kennungen, die das Modell nicht braucht, und verschlüsseln Sie gespeicherte Konversationen. In der Plattform AI Grief Companion verschlüsseln wir jede Nachricht beim Ingest einzeln mit AES-256-GCM unter einem KMS-Envelope-Key und ermöglichen das Löschen aller Nutzerdaten mit einem Klick, weil das Produkt sehr persönliche Inhalte verarbeitet. Die meisten SaaS-Produkte brauchen dieses Niveau nicht, aber sie brauchen eine klare Antwort auf die Frage "Wohin gehen die Daten unserer Kunden?".

Wie sollten Sie eine LLM-Funktion ausrollen?

Rollen Sie in Stufen aus: zuerst interne Nutzer, dann ein kleiner Prozentsatz der Kunden hinter einem Feature Flag, dann alle. Vergleichen Sie auf jeder Stufe Qualität und Kosten mit den Zielen, die Sie im ersten Schritt festgelegt haben.

Ein typischer Zeitplan für eine gut abgegrenzte Funktion:

Woche Arbeiten
1 Scoping, Kennzahlen des Anwendungsfalls, Datenzugriff, Anbietertest an echten Beispielen
2-3 Prompt-Design, RAG oder Datenpipeline, Anbieter-Abstraktion
4-5 UX mit Streaming, Guardrails, Evaluierungsset, Logging
6 Interne Beta, Fehlermuster beheben, Kostenoptimierung
7-8 Schrittweiser Rollout an Kunden, Monitoring, Übergabe

Planen Sie einen Fallback für Ausfälle des Anbieters (einen zweiten Anbieter oder einen sauberen "Erneut versuchen"-Zustand) und behalten Sie das Feature Flag nach dem Launch bei, damit Sie die Funktion in Sekunden abschalten können.

So arbeiten wir an LLM-Integrationen

Bei Lytvynov Production erhalten Sie nach einem kurzen Scoping-Gespräch ein Festpreisangebot; eine KI-Funktion für ein bestehendes Produkt beginnt bei uns ab 5.000 USD. Im ersten Meilenstein testen wir zwei oder drei Modelle an Ihren echten Daten und definieren das Evaluierungsset. Unser Back-End ist meist PHP/Symfony, und wir integrieren die APIs von OpenAI und Anthropic Claude, RAG und MCP-Server in bestehende Produkte. Wenn Sie eine zweite Meinung zu Ihrem Plan möchten, buchen Sie ein Gespräch.

Case Studies

Häufig gestellte Fragen

Beide sind 2026 produktionsreif. Die ehrliche Antwort: Testen Sie beide an 50-100 realen Beispielen aus Ihrem Produkt und vergleichen Sie Qualität, Latenz und Kosten pro Aufgabe. Viele Teams nutzen am Ende mehr als ein Modell: ein starkes Modell für anspruchsvolles Reasoning oder lange Dokumente und ein kleineres, günstigeres Modell für Klassifizierung und Routing. Bauen Sie eine schlanke Anbieter-Abstraktion in Ihren Code ein, damit ein späterer Wechsel eine Konfigurationsänderung ist und kein Neuschreiben.

Standardmäßig erklären beide Anbieter, dass Daten aus der Business-API nicht zum Training ihrer Modelle verwendet werden, und beide bieten Auftragsverarbeitungsverträge (DPA/AVV) an. Aufbewahrungsfristen und Optionen ohne Datenspeicherung (Zero Data Retention) unterscheiden sich je nach Tarif und Berechtigung. Lesen Sie daher die aktuellen Bedingungen und unterzeichnen Sie den DPA, bevor Sie Kundendaten senden. Wenn Daten in einer bestimmten Cloud oder Region bleiben müssen, sind beide Modellfamilien auch über die großen Cloud-Plattformen verfügbar.

Eine einzelne, gut abgegrenzte Funktion wie Zusammenfassungen, Entwürfe oder ein Support-Assistent auf Basis Ihres Help Centers dauert vom Scoping bis zur Produktion typischerweise 4-8 Wochen, inklusive Evaluierung und Monitoring. Funktionen, die eine Suche in unstrukturierten internen Daten, Berechtigungen oder Aktionen in anderen Systemen erfordern, dauern länger, oft 8-14 Wochen. Die meiste Zeit fließt in Datenaufbereitung, Evaluierung und Randfälle, nicht in den API-Aufruf.

Halluzinationen lassen sich nicht vollständig beseitigen, aber selten und sichtbar machen. Stützen Sie Antworten auf abgerufene Dokumente, weisen Sie das Modell an, nur aus diesem Kontext zu antworten und zu sagen, wenn es etwas nicht weiß, verlangen Sie Quellenangaben, validieren Sie strukturierte Ausgaben gegen ein Schema und lassen Sie bei jeder Prompt- oder Modelländerung ein Evaluierungsset laufen. Bei Aktionen mit hoher Tragweite behalten Sie einen menschlichen Freigabeschritt bei.

Die Betriebskosten hängen vom Anfragevolumen, den Tokens pro Anfrage und der Modellklasse ab. Typische Marktspannen, die wir 2026 sehen, reichen von einigen zehn US-Dollar pro Monat für ein internes Tool mit wenig Traffic bis zu mehreren tausend US-Dollar pro Monat für einen stark genutzten Assistenten mit Kundenkontakt. Prompt-Caching, kleinere Modelle für einfache Schritte und Begrenzungen der Kontextgröße senken die Rechnung meist deutlich, ohne die Qualität zu beeinträchtigen.

Starten wir Ihr Projekt
Gespräch buchen