Wie wählen Sie eine KI-Agentur aus?

Wählen Sie eine KI-Agentur aus, indem Sie ausgelieferte KI-Projekte überprüfen, testen, wie das Team Modellausgaben evaluiert, den Umgang mit Datenschutz und Betriebskosten prüfen und sicherstellen, dass es auch ein starkes klassisches Softwareteam ist. Marketingseiten sehen 2026 alle gleich aus. Diese vier Prüfungen trennen Teams, die ausliefern, von Teams, die nur Demos zeigen.

Die meisten KI-Funktionen scheitern aus gewöhnlichen Gründen: schlechte Daten, keine Evaluierung, unklare Verantwortlichkeiten, ausufernde API-Rechnungen oder ein schwaches Produkt rund um das Modell. Ein guter Partner für KI-Entwicklung investiert in diese Punkte genauso viel Aufwand wie in das Modell selbst. Die folgende Checkliste richtet sich an CTOs, Product Owner und nicht-technische Gründer in Unternehmen mit etwa 10 bis 200 Mitarbeitenden, die entscheiden, wer ihre erste oder nächste KI-Funktion bauen soll.

Was sollten Sie prüfen, bevor Sie mit einer KI-Agentur sprechen?

Prüfen Sie vor dem ersten Gespräch, ob das Unternehmen KI-Produkte hat, die Sie tatsächlich öffnen können, oder ausführliche Fallstudien mit Architektur, nicht nur Logos. Fünf Minuten im Portfolio zeigen meist, ob KI eine Kernkompetenz ist oder nur ein neues Etikett auf einer alten Dienstleistung.

Achten Sie auf:

  • Fallstudien mit technischen Details. Welche Modelle, welcher Retrieval-Ansatz, welcher Vektorspeicher, wie die Ausgaben geprüft werden.
  • Produkte mit echten Nutzern. Ein gelaunchtes Produkt konfrontiert ein Team mit Fehlerbildern, die Prototypen nie erleben.
  • Tiefe im klassischen Engineering. Back-End, Front-End, Mobile, DevOps. KI-Funktionen leben in normaler Software.
  • Öffentliche Bewertungen. Bewertungen auf Marktplätzen und Review-Plattformen sind nicht perfekt, lassen sich aber in großem Umfang schwer fälschen.

Als Beispiel für den Detailgrad, auf den Sie achten sollten: Unsere Fallstudie zu AI Grief Companion beschreibt Parser für zehn Chat-Exportformate, Verschlüsselung jeder einzelnen Nachricht beim Import, LoRA-Fine-Tuning auf Qwen2.5-7B, einen Faktengraphen in Neo4j und vLLM, das pro Anfrage den passenden Adapter ausliefert. Diese Genauigkeit sollten Sie von jedem KI-Anbieter auf Ihrer Shortlist erwarten.

Welche Fragen sollten Sie einer KI-Agentur stellen?

Stellen Sie Fragen, die konkrete Antworten zu Architektur, Qualität, Daten, Kosten und Eigentum erzwingen. Ein fähiges Team antwortet mit Abwägungen und Beispielen, ein schwaches Team mit Adjektiven.

Architektur

  • Wann würden Sie Retrieval (RAG) statt Fine-Tuning einsetzen, und was empfehlen Sie für uns?
  • Mit welchen Modellen würden Sie starten (OpenAI, Claude, offene Modelle), und wie schwer ist ein späterer Wechsel?
  • Welche Vektordatenbank würden Sie verwenden (pgvector, Qdrant oder eine andere) und warum?

Qualität und Sicherheit

  • Wie messen Sie, ob die KI-Ausgaben gut genug für den Launch sind?
  • Wie reduzieren Sie Halluzinationen, und was tut das Produkt, wenn das Modell unsicher ist?
  • Wie schützen Sie vor Prompt Injection, besonders wenn die KI Tools oder APIs aufrufen kann?

Daten und Datenschutz

  • Wohin werden unsere Daten gesendet und wo werden sie gespeichert? Werden sie verwendet, um irgendwelche Modelle zu trainieren?
  • Wie werden personenbezogene Daten und Geheimnisse entfernt oder verschlüsselt?

Kosten und Betrieb

  • Was kostet diese Funktion bei unserer erwarteten Nutzung pro Monat im Betrieb?
  • Wie begrenzen Sie die Ausgaben pro Nutzer, und wie überwachen Sie die API-Kosten?

Eigentum

  • Wem gehören Code, Prompts, Datensätze, Evaluierungssets und eventuell trainierte Modelle?
  • Läuft alles in unseren eigenen Cloud- und API-Konten?

Wie vergleichen Sie KI-Agenturen nebeneinander?

Bewerten Sie jede KI-Agentur auf Ihrer Shortlist nach denselben Kriterien, mit Gewichtungen, die Ihr Risiko widerspiegeln. Eine einfache Bewertungsmatrix verhindert, dass die Entscheidung von der am besten polierten Präsentation bestimmt wird.

Kriterium Gewichtung So sieht eine starke Antwort aus Punkte 1-5
Ausgelieferte KI-Projekte 20% Live-Produkte oder ausführliche Fallstudien mit Architektur und Ergebnissen
Evaluierungsmethode 15% Testsets, messbare Abnahmekriterien, Regressionsprüfungen bei Prompt-Änderungen
Datenschutz und Sicherheit 15% Klarer Datenfluss, kein Training mit Ihren Daten, Verschlüsselung, Zugriffskontrolle
Klassisches Software-Engineering 15% Back-End, Front-End, DevOps, Tests; KI als ein Teil des Produkts behandelt
Kostenbewusstsein 10% Schätzung der monatlichen Betriebskosten, Nutzungslimits, Caching, Modellwahl je Aufgabe
Kommunikation und Zeitüberlappung 10% Benannter Senior-Ansprechpartner, schriftliche Updates, ausreichend überlappende Arbeitszeiten
Eigentum und Ausstiegsbedingungen 10% Code und Konten auf Ihren Namen, Übertragung der IP-Rechte, Übergabedokumentation
Geschäftsmodell 5% Festpreisangebot nach einem kurzen Scoping-Gespräch, danach feste Meilensteine oder ein klarer Teamsatz

Multiplizieren Sie jede Punktzahl mit ihrer Gewichtung und vergleichen Sie die Summen, lesen Sie aber auch die Notizen. Ein Team, das überall 5 Punkte erreicht, nur nicht beim Datenschutz, kann für ein Gesundheits- oder Finanzprodukt trotzdem die falsche Wahl sein.

Was sind Warnsignale bei der Beauftragung einer KI-Agentur?

Das größte Warnsignal ist ein fester Preis und Zeitplan für ein komplexes KI-System, bevor sich jemand Ihre Daten angesehen hat. Andere Warnzeichen kündigen Probleme ebenso zuverlässig an:

  • Genauigkeitsversprechen ohne Testset. "95 Prozent genau" bedeutet nichts, solange Sie nicht wissen, genau worauf bezogen.
  • Fine-Tuning als Standardantwort. Die meisten KI-Funktionen im Unternehmen starten besser mit einem gehosteten Modell, guten Prompts und Retrieval.
  • Kein Wort zu Betriebskosten. Die API-Rechnung ist vom ersten Tag an Teil der Wirtschaftlichkeit des Produkts.
  • Alles in den Konten des Anbieters. API-Schlüssel, Cloud-Konten und Repositories sollten Ihnen gehören.
  • Portfolio nur aus Demos. Prototypen mit sauberen Beispieldaten beweisen nicht, dass das Team mit echten, unordentlichen Eingaben umgehen kann.
  • Juniors hinter einem Senior-Vertriebsteam. Fragen Sie, wer den Code schreibt und reviewt, und lernen Sie diese Personen kennen.
  • Kein Human-in-the-Loop-Design für Agenten. Ein KI-Agent, der E-Mails sendet, Geld bewegt oder Datensätze ändert, braucht Freigabeschritte und Protokolle.

Wie sollte ein KI-Entwicklungsprojekt strukturiert sein?

Ein gesundes KI-Projekt beginnt mit einem kurzen Scoping-Gespräch, einem Festpreisangebot und oft einem kleinen Proof of Concept als erstem Meilenstein und geht dann, sobald der Ansatz bewiesen ist, in Meilensteine mit festem Umfang oder ein dediziertes Team über. Diese Struktur begrenzt das Risiko auf beiden Seiten, weil die schwierigsten Fragen (Datenqualität, Modellwahl, akzeptable Genauigkeit) früh beantwortet werden.

Eine typische Struktur:

  1. Scoping, eine bis drei Wochen. Anwendungsfälle, Datenaudit, Architekturentscheidung, Evaluierungskriterien, Kostenschätzung.
  2. Proof of Concept, zwei bis vier Wochen (optional). Die zentrale KI-Fähigkeit wird mit Ihren echten Daten getestet.
  3. Entwicklung, sechs bis zwölf Wochen. Die Funktion in Ihrem Produkt, mit Guardrails, Monitoring und Nutzungslimits.
  4. Launch und Feinabstimmung. Monitoring mit echten Nutzern, Verbesserung von Prompts und Retrieval, Kostenüberprüfung.

Für ein neues Produkt gilt dieselbe Logik für das gesamte MVP. Unser Leitfaden zum MVP-Entwicklungsprozess zeigt die Version Woche für Woche.

Wie testen Sie den Evaluierungsansatz einer KI-Agentur vor der Unterschrift?

Testen Sie den Evaluierungsansatz einer KI-Agentur, indem Sie ihr 20 bis 50 echte Beispiele aus Ihrem Geschäft geben und fragen, wie sie entscheiden würde, ob die KI-Funktion diese gut genug bewältigt. Ein starkes Team macht daraus ein schriftliches Testset mit erwarteten Ergebnissen, ein schwaches Team bietet an, "so lange zu fine-tunen, bis es funktioniert".

So führen Sie diesen Test während des Vertriebsprozesses praktisch durch:

  1. Teilen Sie eine kleine, anonymisierte Stichprobe. Echte Support-Tickets, Dokumente oder Datensätze, einschließlich einiger unordentlicher Fälle und Grenzfälle.
  2. Fragen Sie nach Abnahmekriterien. Was gilt als richtige, teilweise richtige und falsche Antwort, und welche Erfolgsquote ist realistisch?
  3. Fragen Sie, wie Prompt-Änderungen geprüft werden. Jede Änderung an Prompt oder Modell sollte vor dem Release erneut gegen dasselbe Testset laufen.
  4. Fragen Sie nach Monitoring in Produktion. Protokollierung von Ein- und Ausgaben (mit korrektem Umgang mit personenbezogenen Daten), Feedback-Buttons für Nutzer und regelmäßige Überprüfung.
  5. Fragen Sie nach Fallbacks. Was das Produkt anzeigt, wenn das Modell unsicher, langsam oder nicht verfügbar ist, und wann ein Mensch übernimmt.

Die Antworten zeigen auch, wie das Unternehmen über Verantwortung denkt. Evaluierung ist der Teil der KI-Arbeit, der Ihre Nutzer und Ihre Marke schützt, und genau dieser Teil fehlt in günstigen Angeboten am häufigsten. Wenn ein Anbieter ihn nicht in einfachen Worten erklären kann, wird er ihn wahrscheinlich auch nicht liefern.

Spielt es eine Rolle, wie die KI-Agentur selbst KI nutzt?

Ja: Ein Unternehmen, das KI-Tools in seiner eigenen Projektarbeit einsetzt, versteht die praktischen Grenzen von Modellen meist besser als eines, das KI nur verkauft. Fragen Sie, wie das Team KI intern nutzt und was bei Menschen bleibt.

Bei Lytvynov Production betreiben wir unseren eigenen Engineering-Prozess mit KI-Coding-Agenten auf Basis von Claude Code, beaufsichtigt von Senior-Engineers, die für Architektur und Code-Review verantwortlich sind. Außerdem bauen wir MCP-Server und Agenten-Tools für unsere eigenen Produkte, etwa unser internes Projektboard und das CMS unserer Website. In dieser täglichen Nutzung lernen wir, wo Agenten helfen, wo sie scheitern und welche Guardrails wichtig sind. Unser Service KI-Agenten entwickeln lassen überträgt diese Erfahrungen auf Kundensysteme.

Sollte die KI-Agentur im Inland oder im Ausland sitzen?

Der Standort einer KI-Agentur ist weniger wichtig als Zeitzonenüberlappung, Qualität der Kommunikation und Vertragsbedingungen. Viele Unternehmen in den USA und in Großbritannien beauftragen Teams in Mittel- und Osteuropa oder Lateinamerika, um Senior-Entwickler zu niedrigeren Sätzen zu bekommen.

Wenn Sie einen Nearshore- oder Offshore-Partner in Betracht ziehen, prüfen Sie überlappende Arbeitszeiten, das anwendbare Recht des Vertrags, die Übertragung der IP-Rechte, die Vereinbarungen zur Auftragsverarbeitung und den Kontinuitätsplan des Teams. Diese Punkte, einschließlich Fragen zur Kontinuität in Kriegszeiten, behandeln wir ausführlich in unserem Leitfaden zum Outsourcing der Softwareentwicklung in die Ukraine.

So arbeiten wir mit Unternehmen, die einen KI-Partner suchen

Lytvynov Production ist eine Agentur für Web-, Mobile- und KI-Entwicklung aus der Ukraine, die mit Startups und B2B-Unternehmen in den USA und in Europa arbeitet. Wir entwickeln mit den APIs von OpenAI und Claude, RAG, LLM-Fine-Tuning und MCP-Servern auf Basis eines Stacks aus PHP/Symfony, React und React Native. Zu unseren eigenen Produkten gehören AI Resume Master, das 50.000 monatlich aktive Nutzer erreicht hat, und ein Prototyp eines autonomen Drohnenschwarms für Präzisionslandwirtschaft, den wir intern als F&E-Projekt gebaut haben.

Wenden Sie die Bewertungsmatrix oben auch auf uns an, nicht nur auf andere Anbieter. Buchen Sie ein Scoping-Gespräch und stellen Sie uns jede Frage aus dieser Checkliste. Wenn Sie KI in ein bestehendes Produkt einbauen möchten, siehe unseren Service KI-Integration. Für wissensbasierte Assistenten siehe RAG-Entwicklung.

Case Studies

Häufig gestellte Fragen

Lassen Sie sich KI-Funktionen zeigen, die die Agentur für echte Nutzer ausgeliefert hat, und fragen Sie, wie sie die Qualität der Ausgaben misst, wie sie Halluzinationen und Prompt Injection verhindert, wohin Ihre Daten gehen und ob sie für Training verwendet werden, was die Funktion im Monat im Betrieb kostet und wem Code, Prompts und Modelle gehören. Vage Antworten auf eine dieser Fragen sind ein Warnsignal.

Für eine erste KI-Funktion oder ein MVP ist eine Agentur meist schneller und günstiger, weil Sie ein erfahrenes Team ohne monatelange Rekrutierung bekommen. Ein internes Team lohnt sich, sobald KI ein zentraler, dauerhafter Teil des Produkts ist. Viele Unternehmen starten mit einem Partner und planen eine schrittweise Übergabe an interne Entwickler.

Bitten Sie um ein Live-Produkt oder eine Demo, die Sie selbst nutzen können, nicht nur um Folien. Lassen Sie dann die Entwickler eine Architekturentscheidung erklären, etwa warum sie Retrieval statt Fine-Tuning gewählt haben, welche Vektordatenbank sie genutzt haben und warum, oder wie sie das Modell evaluiert haben. Echte Erfahrung zeigt sich in konkreten Abwägungen und Fehlschlägen, die das Team beschreiben kann.

Ein kurzes Scoping-Gespräch mit anschließendem Festpreisangebot, oft mit einem kleinen Proof of Concept als erstem Meilenstein, ist der fairste Einstieg. Sie liefert einen schriftlichen Umfang, eine Architekturentscheidung und oft einen funktionierenden Prototyp mit Ihren Daten. Sie lernen die Kommunikation des Teams kennen, bevor Sie ein großes Budget freigeben, und das Ergebnis bleibt nützlich, auch wenn Sie den Anbieter wechseln.

Nicht unbedingt. Entscheidend sind überlappende Arbeitszeiten, klare schriftliche Kommunikation, ein Vertrag unter einem Recht, das Sie akzeptieren, und belastbare Datenschutzvereinbarungen. Viele Unternehmen in den USA und in Großbritannien arbeiten mit Teams in Mittel- und Osteuropa oder Lateinamerika. Prüfen Sie die Zeitzonenüberlappung und wie das Team mit den Regeln für Datenübermittlung umgeht.

Starten wir Ihr Projekt
Gespräch buchen