KI-Strategie8 Min. Lesezeit

Das richtige LLM für Ihr Unternehmen auswählen

So wählen Sie ein LLM fürs Unternehmen: Aufgabe definieren, Testset bauen, Qualität, Kosten, Tempo und Datenbedingungen vergleichen, per Scorecard entscheiden.

Um ein LLM für Ihr Unternehmen auszuwählen, beginnen Sie bei der Aufgabe, nicht beim Modell. Legen Sie fest, was das Modell leisten muss und wie ein gutes Ergebnis aussieht, definieren Sie Ihre Rahmenbedingungen (Datenschutz, Budget, Geschwindigkeit, Integration), erstellen Sie eine Shortlist weniger Kandidaten, testen Sie alle an denselben echten Fällen und vergleichen Sie Qualität, Kosten pro Aufgabe und Antwortzeit in einer Scorecard. Die beste Wahl ist das günstigste und schnellste Modell, das Ihre Qualitätsanforderung zuverlässig erfüllt – zu Bedingungen, die Sie akzeptieren können. Da sich Modelle und Preise häufig ändern, bewahren Sie Ihr Testset auf und führen Sie es erneut aus, wenn sich der Markt bewegt.

Dieser Leitfaden liefert Ihnen einen wiederholbaren Prozess. Er bewertet bewusst keine konkreten Modelle: Jede solche Liste wäre schnell veraltet. Prüfen Sie aktuelle Modellangebote, Fähigkeiten und Preise direkt bei den Anbietern.

Schritt 1: Die Aufgabe präzise definieren

„Wir brauchen KI“ ist keine Anforderung. Schreiben Sie auf:

  • Die Aufgabe: etwa „Antworten auf Kunden-E-Mails zu Bestellungen und Retouren entwerfen“ oder „Felder aus Lieferantenrechnungen auslesen“.
  • Eingaben: was das Modell erhält (kurze Nachrichten, lange Dokumente, Bilder, Tabellen).
  • Ausgaben: Freitext, strukturierte Daten, Code, Entscheidungen.
  • Sprachen: in welchen Sprachen Ein- und Ausgaben vorliegen.
  • Volumen: Anfragen pro Tag oder Monat und Spitzen.
  • Wer das Ergebnis sieht: interne Mitarbeitende, Kunden, die Öffentlichkeit.
  • Risiko: was passiert, wenn das Ergebnis falsch ist.

Unterschiedliche Aufgaben begünstigen unterschiedliche Modelle. Ein Klassifizierungsschritt mit hohem Volumen braucht ein schnelles, günstiges Modell. Die Analyse langer Verträge braucht ein Modell mit großem Kontextfenster und starkem logischem Denken. Viele Anwendungen nutzen für verschiedene Schritte mehrere Modelle.

Schritt 2: Kriterien festlegen

Kriterium Zu klärende Fragen
Qualität Erfüllt es die Anforderung bei unseren Testfällen? Wie geht es mit schwierigen und ungewöhnlichen Fällen um?
Befolgen von Anweisungen Hält es Formatregeln und Vorgaben zuverlässig ein?
Quellentreue Bleibt es bei den bereitgestellten Quellen und gibt es zu, wenn Informationen fehlen?
Kontextfenster Verarbeitet es unsere längsten Eingaben mit Platz für Anweisungen und Ausgabe?
Sprachen Wie gut ist es in jeder Sprache, die wir brauchen?
Modalitäten Brauchen wir Bilder, Dokumente, Audio?
Strukturierte Ausgabe Unterstützt es Schemas oder zuverlässiges JSON?
Tool-Nutzung Kann es Funktionen oder Tools aufrufen, falls wir das brauchen?
Geschwindigkeit Zeit bis zum ersten Token und gesamte Antwortzeit bei unseren Eingabegrößen
Kosten Kosten pro Aufgabe bei unseren Token-Mengen, inklusive Caching- und Batch-Optionen
Datenbedingungen Speicherung, Nutzung der Eingaben fürs Training, Speicherort, Zertifizierungen, Vertragsbedingungen
Verfügbarkeit Rate Limits, Verfügbarkeitszusagen, regionale Verfügbarkeit
Ökosystem SDKs, Dokumentation, Integration mit unseren bestehenden Plattformen
Langlebigkeit Wie oft Modelle abgekündigt werden und mit wie viel Vorlauf

Gewichten Sie die Kriterien für Ihre Aufgabe. Bei einem internen Zusammenfassungs-Tool dominieren vielleicht Qualität und Kosten. Bei einem Kundenassistenten, der personenbezogene Daten verarbeitet, können Datenbedingungen und Quellentreue den Ausschlag geben.

Schritt 3: Über das Betriebsmodell entscheiden

Option Was das bedeutet Vorteile Nachteile
Proprietäres Modell über die API des Anbieters Modell wird vom Entwickler gehostet Schneller Start, starke Fähigkeiten, keine Infrastruktur Abhängigkeit von einem Anbieter; Daten verlassen Ihre Umgebung zu dessen Bedingungen
Proprietäres Modell über eine Cloud-Plattform Gleiche oder ähnliche Modelle über einen großen Cloud-Anbieter Passt zu bestehenden Cloud-Verträgen, regionale Hosting-Optionen Verfügbarkeit und Funktionen der Modelle können abweichen
Open-Weight-Modell bei einem Drittanbieter Frei verfügbares Modell, betrieben von einem Hosting-Anbieter Mehr Auswahl und Portabilität Unterschiedliche Qualität von Hosting und Bedingungen
Open-Weight-Modell, selbst gehostet Sie betreiben das Modell auf eigener Infrastruktur Maximale Kontrolle über Daten und Anpassung Erfordert Hardware, Know-how, Wartung und Sicherheitsarbeit

Für die meisten kleinen und mittleren Unternehmen ist der Start über eine API die pragmatische Wahl. Prüfen Sie Self-Hosting erneut, wenn Datenanforderungen, Volumen oder Anpassungsbedarf den Aufwand rechtfertigen.

Schritt 4: Ein Testset aufbauen

Ein Testset ist das wertvollste Werkzeug bei der Modellauswahl. Es ermöglicht einen fairen Vergleich der Kandidaten und später eine schnelle Neubewertung.

  • Sammeln Sie 30 bis 100 echte Fälle, wo nötig anonymisiert.
  • Bilden Sie die erwartete Verteilung ab: überwiegend typische Fälle, dazu schwierige, Sonderfälle und Fälle, die abgelehnt oder eskaliert werden sollten.
  • Halten Sie das erwartete Ergebnis fest oder die Kriterien, die eine gute Antwort erfüllen muss.
  • Legen Sie die Bewertung fest: etwa bestanden/nicht bestanden pro Kriterium oder eine Skala von 1 bis 5 mit klaren Beschreibungen.
  • Halten Sie es vertraulich und stabil, damit Ergebnisse über die Zeit vergleichbar bleiben.

Bei Aufgaben mit einer eindeutig richtigen Antwort, etwa Extraktion oder Klassifizierung, lässt sich die Bewertung automatisieren. Bei Schreibaufgaben nutzen Sie ein Bewertungsraster und lassen Menschen eine Stichprobe bewerten – idealerweise ohne zu wissen, welches Modell welche Antwort erzeugt hat.

Schritt 5: Shortlist erstellen und testen

Wählen Sie drei bis fünf Kandidaten aus verschiedenen Preisklassen: mindestens ein kleines, günstiges Modell, eines aus der Mittelklasse und eines aus der Spitzenklasse. Dann:

  1. Nutzen Sie für alle dieselbe Prompt-Struktur und passen Sie sie nur an, wo die Dokumentation eines Anbieters ein bestimmtes Format empfiehlt. Ein gut gestalteter System-Prompt macht Vergleiche fairer.
  2. Führen Sie das komplette Testset mit jedem Kandidaten aus.
  3. Erfassen Sie Qualitätswerte, Token-Verbrauch und Antwortzeiten.
  4. Lesen Sie die Fehler. Zwei Modelle mit gleichem Durchschnitt können auf sehr unterschiedliche Weise scheitern – und eine Art von Fehler kann für Sie inakzeptabel sein.

Entscheiden Sie nicht allein anhand öffentlicher Benchmarks. Sie messen allgemeine Fähigkeiten bei Standardaufgaben, nicht Ihre Aufgabe mit Ihren Daten und Ihrem Prompt.

Schritt 6: Kosten pro Aufgabe berechnen

Der Preis pro Million Tokens ist nicht dasselbe wie die Kosten pro Aufgabe. Ein günstigeres Modell, das längere Prompts, mehr Wiederholungen oder mehr menschliche Korrektur braucht, kann insgesamt teurer sein.

Berechnen Sie für jeden Kandidaten:

  • durchschnittliche Input- und Output-Tokens pro Aufgabe aus Ihren Testläufen,
  • Kosten pro Aufgabe zu aktuellen Preisen,
  • monatliche Kosten bei Ihrem erwarteten Volumen,
  • den menschlichen Prüfaufwand, den seine Fehlerquote mit sich bringt.

Der LLM-API-Kostenrechner vergleicht drei Preisszenarien nebeneinander, und LLM-API-Preise erklärt behandelt die Faktoren, die die Rechnung verändern, etwa Caching und Batch-Rabatte. Für den vollständigen Business Case inklusive Prüfzeit nutzen Sie den KI-ROI-Rechner.

Schritt 7: Daten- und Vertragsbedingungen prüfen

Prüfen Sie vor der Entscheidung für jeden Anbieter:

  • ob Ein- und Ausgaben gespeichert werden, wie lange und zu welchem Zweck,
  • ob Ihre Daten zum Training von Modellen genutzt werden dürfen und wie Sie gegebenenfalls widersprechen,
  • wo Daten verarbeitet und gespeichert werden,
  • Auftragsverarbeitungsverträge und Sicherheitszertifizierungen,
  • Bedingungen zu Rechten an und Nutzung von Ergebnissen,
  • Nutzungsbeschränkungen, die Ihren Anwendungsfall betreffen könnten.

Wenn Sie in der EU tätig sind und der Anwendungsfall nach dem AI Act in eine regulierte Kategorie fallen könnte, berücksichtigen Sie das früh. Der Artikel zu den Risikoklassen des EU AI Act erklärt die Stufen. Beziehen Sie bei allem, was personenbezogene Daten betrifft, Ihre Datenschutzbeauftragte oder Rechtsberatung ein.

Schritt 8: Mit einer Scorecard entscheiden

Eine einfache gewichtete Scorecard macht die Entscheidung nachvollziehbar:

Kriterium Gewicht Modell A Modell B Modell C
Qualität im Testset 35 % 4 5 3
Kosten pro Aufgabe 25 % 4 2 5
Geschwindigkeit 10 % 4 3 5
Datenbedingungen 20 % 4 4 3
Integration und Ökosystem 10 % 3 4 4
Gewichteter Wert 3,9 3,75 3,8

Die Zahlen sind illustrativ. In diesem Beispiel liegen die Werte dicht beieinander, was häufig vorkommt. Dann schauen Sie auf die Fehleranalyse und auf die Kriterien, die für Sie K.-o.-Kriterien sind, und erwägen Sie ein Routing: das günstigere Modell für die meisten Fälle, das stärkere für schwierige.

Lock-in vermeiden

  • Kapseln Sie den Modellaufruf in Ihrem Code, damit Sie den Anbieter mit begrenztem Aufwand wechseln können.
  • Halten Sie Prompts und Testsets portabel, nicht an proprietäre Funktionen einer Plattform gebunden, es sei denn, der Nutzen ist klar.
  • Protokollieren Sie Eingaben, Ausgaben und Token-Zahlen in Ihren eigenen Systemen, im Rahmen Ihrer Datenregeln.
  • Beachten Sie Abkündigungen. Anbieter nehmen Modellversionen vom Markt; planen Sie Migrationen und testen Sie erneut.

Typische Fehler

  • Standardmäßig das bekannteste Modell wählen. Es ist womöglich leistungsfähiger und teurer, als Ihre Aufgabe es erfordert.
  • Mit einer Handvoll handverlesener Beispiele testen. Die Ergebnisse spiegeln den echten Einsatz nicht wider.
  • Preis pro Token statt Kosten pro Aufgabe vergleichen.
  • Datenbedingungen erst nach dem Bau prüfen.
  • Prompts und Modelle gleichzeitig ändern, sodass Sie nicht erkennen, welche Änderung gewirkt hat.
  • Nie neu bewerten. Der Markt bewegt sich schnell; Ihr Testset hilft Ihnen, davon zu profitieren.

Fazit

Definieren Sie die Aufgabe, legen Sie gewichtete Kriterien fest, bauen Sie ein realistisches Testset, testen Sie eine kleine Auswahl an Kandidaten, vergleichen Sie Kosten pro Aufgabe und Datenbedingungen und entscheiden Sie mit einer Scorecard. Bewahren Sie das Testset auf und führen Sie es erneut aus, wenn neue Modelle oder Preise erscheinen. Wenn die Kosten eine große Rolle spielen, lesen Sie weiter, wie Sie LLM-API-Kosten senken. Und wenn Sie entscheiden, wie Sie dem Modell Ihr Unternehmenswissen zugänglich machen, lesen Sie RAG vs. Fine-Tuning.

Häufige Fragen

Welches ist das beste LLM für Unternehmen?

Ein einzelnes bestes Modell gibt es nicht. Die richtige Wahl hängt von Aufgabe, benötigter Qualität, Volumen, Budget, Antwortzeit, Datenschutzanforderungen und der geplanten Integration ab. Testen Sie einige Kandidaten an Ihren eigenen Fällen.

Sollten wir ein Open-Weight- oder ein proprietäres Modell wählen?

Proprietäre Modelle per API sind meist der schnellste Einstieg. Open-Weight-Modelle können für Datenkontrolle, Anpassung oder Kosten bei großem Volumen attraktiv sein, erfordern aber Infrastruktur und Know-how für Betrieb und Wartung.

Wie vergleicht man LLMs fair?

Nutzen Sie für jedes Modell dieselben realistischen Testfälle, denselben Prompt-Ansatz und klare Bewertungskriterien. Messen Sie Qualität, Kosten pro Aufgabe und Antwortzeit und schauen Sie sich die Fehler an, nicht nur Durchschnittswerte.

Wie oft sollten wir unsere Modellwahl überprüfen?

Immer wenn ein wichtiges neues Modell oder eine Preisänderung erscheint, die für Ihren Anwendungsfall relevant sein könnte, und mindestens ein- bis zweimal im Jahr. Bewahren Sie Ihr Testset auf, damit eine Neubewertung Stunden statt Wochen dauert.

Ähnliche Artikel

KI-Strategie7 Min. Lesezeit

KI-Readiness-Checkliste für den Mittelstand

KI-Readiness-Checkliste für KMU: Ziele, Prozesse, Daten, Tools, Sicherheit, Menschen, Governance und Budget – mit einfacher Bewertung und nächsten Schritten.

KI-Strategie7 Min. Lesezeit

RAG vs. Fine-Tuning: Was braucht Ihr KI-Projekt?

RAG und Fine-Tuning für Unternehmen erklärt: was beides leistet, wann Sie was nutzen, Kosten, Wartung, Datenbedarf – plus Entscheidungshilfe und Hybridansätze.

← Zurück zum Blog