Modelle und Anbieter: Zuerst verstehen, wessen Modell Sie wählen
Unterscheiden Sie zuerst zwischen Anbietern, Modellserien und Modell-IDs, erfahren Sie, wofür jeder Modelltyp geeignet ist, und wählen Sie dann den AI-Provider und die Tool-Anleitungen aus.
Erstens: Die drei Bezeichnungen unterscheiden
| Bezeichnung | Einfache Erklärung | Worauf bei der Konfiguration zu achten ist |
| Anbieter (Vendor) | Unternehmen oder Plattformen, die Modellschnittstellen entwickeln oder bereitstellen, wie OpenAI, Anthropic, Google, DeepSeek, Alibaba Cloud, ByteDance und Volcano Engine usw. | Hersteller bestimmen Modellfähigkeiten, Schnittstellenprotokolle, Preise und Einschränkungen; der AI-Provider leitet diese Funktionen lediglich an sein eigenes Backend weiter. |
| Modellserie | Eine Gruppe von Modellmarken oder Familiennamen, wie GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Doubao. | Der Serienname hilft Ihnen nur dabei, den Ursprung und die allgemeinen Fähigkeiten zu bestimmen; er kann nicht direkt mit der Modell-ID gleichgesetzt werden, die in der Konfiguration eingetragen werden muss. |
| Modell-ID / Modellname | Der exakte Name, der in der API-Anfrage eingetragen werden muss, beispielsweise die Zeichenfolge in der Modellliste des Provider-Backends. | Kopieren Sie ihn exakt aus dem Backend; ändern Sie Groß-/Kleinschreibung, Bindestriche, Punkte oder Versionsnummern nicht selbst. Wenn das Abrufen der Modellliste fehlschlägt, fügen Sie die vom Backend bereitgestellten Modell-IDs manuell hinzu. |
| Anzeigename (Display Name) | Der Name oder Alias, der im Tool- oder Service-Backend zur besseren Lesbarkeit angezeigt wird. | Der Anzeigename kann möglicherweise nicht direkt aufgerufen werden; priorisieren Sie bei der Konfiguration Felder wie 'Model ID', 'Model' oder 'Model Name'. |
Gängige internationale Modellanbieter
| Anbieter | Gängige Modelle oder Serien | Typische Anwendungsbereiche |
OpenAI | GPT, o-Serie, GPT Image, Sora usw. | Textkonversationen, Code, Reasoning, Bildgenerierung, Videogenerierung |
Anthropic | Claude-Serie | Lange Texte lesen, Code, Verfassen von Texten, Analyse |
Google | Gemini-Serie | Multimodales Verständnis, langer Kontext, Code, Bildverständnis |
xAI | Grok-Serie | Textkonversationen, Reasoning, Echtzeit-Informationsszenarien |
Meta | Llama-Serie | Open-Source-Gewichte, Self-Hosting, Drittanbieter-Hosting |
Mistral AI | Mistral, Codestral usw. | Textkonversationen, Code, Szenarien für schlanke Modelle |
Cohere | Command, Embed, Rerank usw. | Unternehmens-Wissensdatenbanken, Retrieval-Augmented Generation (RAG), Vektoren und Reranking |
Stability AI | Stable Diffusion, Stable Image usw. | Bildgenerierung, Bildbearbeitung |
Runway | Gen-Serie Videomodelle | Videogenerierung, Videobearbeitung |
Gängige chinesische Modellanbieter
| Anbieter | Gängige Modelle oder Serien | Typische Anwendungsbereiche |
DeepSeek | DeepSeek Chat, DeepSeek Reasoner usw. | Textkonversationen, Code, Reasoning |
Alibaba Cloud / Qwen | Qwen, Qwen-VL, Qwen-Coder usw. | Textkonversation, Bildverständnis, Code, Open-Source-Modelle |
Moonshot AI | Kimi, Moonshot-Serie | Lange Texte lesen, Verfassen von Texten und Datenanalyse |
Zhipu AI | GLM, GLM-4 usw. | Textdialoge, Reasoning, Multimodalität, intelligente Agenten |
ByteDance / Volcano Engine Ark | Doubao-Serie | Textdialoge, Multimodalität, Vektoren, Unternehmensanwendungen |
Baidu AI Cloud / Qianfan | ERNIE / Wenxin-Serie | Textkonversation, Multimodalität, Suche und Unternehmensszenarien |
Tencent Cloud | Hunyuan-Serie | Text-Chat, multimodal, Unternehmensintegration |
MiniMax | MiniMax, abab, Sprachmodelle | Textkonversation, lange Texte, Audio und Multimodalität |
iFlytek | Spark-Serie | Textkonversationen, Bildungs- und Büroumgebungen, sprachbasierte Szenarien |
01. AI | Yi-Serie | Open-Source-Modelle, Textdialoge, Drittanbieter-Hosting |
Gängige Modelltypen
| Typ | Wofür wird es verwendet | Worauf bei der Konfiguration zu achten ist |
| Chat- / Textmodell | Fragen beantworten, Texte verfassen, übersetzen, zusammenfassen, Code schreiben. | Die meisten Konversationstools priorisieren diesen Modelltyp; er eignet sich am besten für den ersten Funktionstest. |
| Reasoning-Modelle | Besser geeignet für komplexe Analysen, Mathematik, Code-Reasoning und mehrstufige Aufgaben. | Preis und Antwortzeit können höher sein; für einfache Chats ist daher keine Priorisierung erforderlich. |
| Code-Modell | Spezialisiert auf das Lesen von Code, das Schreiben von Code, die Fehlerbehebung und die Erklärung von Projekten. | Prüfen Sie in Code-Tools auch, ob Tool-Aufrufe (Tool Calls), Dateizugriffe und Kontextverwaltung unterstützt werden. |
| Modelle für visuelles Verständnis | Bilder analysieren, Screenshots erkennen, Tabellen oder Benutzeroberflächen verstehen. | Das Tool selbst muss Bilduploads unterstützen, und der Provider muss visuelle Eingaben erlauben. |
| Bildgenerierungsmodell | Bilder anhand von Prompts generieren oder bearbeiten. | Verwendet in der Regel nicht /chat/completions; die Konfigurationsseite muss für Bild-APIs ausgelegt sein. |
| Videogenerierungsmodell | Kurze Videos generieren, Bild-zu-Video oder Videobearbeitung durchführen. | Der übliche Ablauf besteht aus: Aufgabe übermitteln, auf Fertigstellung warten, dann das Ergebnis abrufen – anstelle von sofortigen Chat-Antworten. |
| Embedding-Vektormodell | Text in Vektoren umwandeln für den Abruf aus Wissensdatenbanken und Ähnlichkeitsabgleiche. | Kann nicht zum Chatten verwendet werden; wird üblicherweise zusammen mit Wissensdatenbanken, RAG und Suchsystemen eingesetzt. |
| Rerank-Modell | Suchergebnisse neu ordnen, sodass relevantere Inhalte ganz oben stehen. | Wird häufig zur Optimierung der Trefferqualität in Wissensdatenbanken verwendet und dient nicht dem Generieren von Antworten. |
| Sprachmodelle (Audio) | Text-to-Speech (TTS), Speech-to-Text (STT), Sprachunterhaltungen in Echtzeit. | Die Felder unterscheiden sich von regulären Textmodellen; beachten Sie die entsprechende Dokumentation zu TTS / STT / Realtime. |
Wie sollten Einsteiger wählen?
| Was möchten Sie tun? | Was sollten Sie priorisieren? | Grund |
| Alltägliches Chatten, Übersetzen, Zusammenfassen | Stabile, kostengünstige Chat-Modelle | Den Key, die API-Adresse und den Modellnamen erfolgreich zum Laufen zu bringen, ist anfangs wichtiger als sofort das leistungsstärkste Modell zu wählen. |
| Code schreiben, Projekte bearbeiten | Modelle mit starken Programmier- oder Reasoning-Fähigkeiten | Programmieraufgaben hängen stark von Kontext, Tool-Aufrufen und Präzision ab; günstigere Modelle erfordern oft viele Nachbesserungen. |
| Lange Dokumente lesen, lange Konversationen | Textmodelle mit großem Kontextfenster | Ein größeres Kontextfenster kann mehr Informationen aufnehmen, allerdings können auch die Kosten steigen. |
| Screenshots betrachten, Bilder analysieren | Multimodale Modelle mit Unterstützung für visuelle Eingaben | Wenn nur ein reines Textmodell konfiguriert ist, schlägt der Bildupload fehl oder das Bild wird nicht verstanden. |
| Bilder generieren | Bildgenerierungsmodell | Bildgenerierung unterscheidet sich von Chat-Modellen; Bild-Tools und Bild-APIs müssen in der Regel separat betrachtet werden. |
| Videos generieren | Videogenerierungsmodelle oder Videoplattformen | Videomodelle verbrauchen viele Ressourcen und haben längere Wartezeiten; prüfen Sie Abrechnung und Aufgabenablauf vorab sorgfältig. |
| Eine Wissensdatenbank aufbauen | Chat-Modell + Embedding + optional Rerank | Eine Wissensdatenbank basiert nicht nur auf einem Chat-Modell; Abruf und Reranking beeinflussen die Qualität der Antworten maßgeblich. |
Wenn Sie Tools bei einem AI-Provider konfigurieren, ist dies die verlässlichste Vorgehensweise: Wählen Sie zuerst ein preiswertes Textmodell und bringen Sie es zum Laufen. Testen Sie erst danach die Code-, Vision-, Bild- oder Videomodelle, die Sie tatsächlich benötigen. Tragen Sie nicht den Modellnamen eines Anbieters in das Protokoll eines anderen Anbieters ein, nur weil die Namen der Modellserien ähnlich klingen.