Einrichtungsleitfaden

Provider-Einrichtungsleitfaden

Einrichtungsschritte und Fehlerbehebung nach Tool durchsuchen.

Provider-Einrichtungsleitfaden/Modelle und Anbieter: Zuerst verstehen, wessen Modell Sie wählen

Modelle und Anbieter: Zuerst verstehen, wessen Modell Sie wählen

Unterscheiden Sie zuerst zwischen Anbietern, Modellserien und Modell-IDs, erfahren Sie, wofür jeder Modelltyp geeignet ist, und wählen Sie dann den AI-Provider und die Tool-Anleitungen aus.

Erstens: Die drei Bezeichnungen unterscheiden

BezeichnungEinfache ErklärungWorauf bei der Konfiguration zu achten ist
Anbieter (Vendor)Unternehmen oder Plattformen, die Modellschnittstellen entwickeln oder bereitstellen, wie OpenAI, Anthropic, Google, DeepSeek, Alibaba Cloud, ByteDance und Volcano Engine usw.Hersteller bestimmen Modellfähigkeiten, Schnittstellenprotokolle, Preise und Einschränkungen; der AI-Provider leitet diese Funktionen lediglich an sein eigenes Backend weiter.
ModellserieEine Gruppe von Modellmarken oder Familiennamen, wie GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Doubao.Der Serienname hilft Ihnen nur dabei, den Ursprung und die allgemeinen Fähigkeiten zu bestimmen; er kann nicht direkt mit der Modell-ID gleichgesetzt werden, die in der Konfiguration eingetragen werden muss.
Modell-ID / ModellnameDer exakte Name, der in der API-Anfrage eingetragen werden muss, beispielsweise die Zeichenfolge in der Modellliste des Provider-Backends.Kopieren Sie ihn exakt aus dem Backend; ändern Sie Groß-/Kleinschreibung, Bindestriche, Punkte oder Versionsnummern nicht selbst. Wenn das Abrufen der Modellliste fehlschlägt, fügen Sie die vom Backend bereitgestellten Modell-IDs manuell hinzu.
Anzeigename (Display Name)Der Name oder Alias, der im Tool- oder Service-Backend zur besseren Lesbarkeit angezeigt wird.Der Anzeigename kann möglicherweise nicht direkt aufgerufen werden; priorisieren Sie bei der Konfiguration Felder wie 'Model ID', 'Model' oder 'Model Name'.

Gängige internationale Modellanbieter

AnbieterGängige Modelle oder SerienTypische Anwendungsbereiche
OpenAIGPT, o-Serie, GPT Image, Sora usw.Textkonversationen, Code, Reasoning, Bildgenerierung, Videogenerierung
AnthropicClaude-SerieLange Texte lesen, Code, Verfassen von Texten, Analyse
GoogleGemini-SerieMultimodales Verständnis, langer Kontext, Code, Bildverständnis
xAIGrok-SerieTextkonversationen, Reasoning, Echtzeit-Informationsszenarien
MetaLlama-SerieOpen-Source-Gewichte, Self-Hosting, Drittanbieter-Hosting
Mistral AIMistral, Codestral usw.Textkonversationen, Code, Szenarien für schlanke Modelle
CohereCommand, Embed, Rerank usw.Unternehmens-Wissensdatenbanken, Retrieval-Augmented Generation (RAG), Vektoren und Reranking
Stability AIStable Diffusion, Stable Image usw.Bildgenerierung, Bildbearbeitung
RunwayGen-Serie VideomodelleVideogenerierung, Videobearbeitung

Gängige chinesische Modellanbieter

AnbieterGängige Modelle oder SerienTypische Anwendungsbereiche
DeepSeekDeepSeek Chat, DeepSeek Reasoner usw.Textkonversationen, Code, Reasoning
Alibaba Cloud / QwenQwen, Qwen-VL, Qwen-Coder usw.Textkonversation, Bildverständnis, Code, Open-Source-Modelle
Moonshot AIKimi, Moonshot-SerieLange Texte lesen, Verfassen von Texten und Datenanalyse
Zhipu AIGLM, GLM-4 usw.Textdialoge, Reasoning, Multimodalität, intelligente Agenten
ByteDance / Volcano Engine ArkDoubao-SerieTextdialoge, Multimodalität, Vektoren, Unternehmensanwendungen
Baidu AI Cloud / QianfanERNIE / Wenxin-SerieTextkonversation, Multimodalität, Suche und Unternehmensszenarien
Tencent CloudHunyuan-SerieText-Chat, multimodal, Unternehmensintegration
MiniMaxMiniMax, abab, SprachmodelleTextkonversation, lange Texte, Audio und Multimodalität
iFlytekSpark-SerieTextkonversationen, Bildungs- und Büroumgebungen, sprachbasierte Szenarien
01. AIYi-SerieOpen-Source-Modelle, Textdialoge, Drittanbieter-Hosting

Gängige Modelltypen

TypWofür wird es verwendetWorauf bei der Konfiguration zu achten ist
Chat- / TextmodellFragen beantworten, Texte verfassen, übersetzen, zusammenfassen, Code schreiben.Die meisten Konversationstools priorisieren diesen Modelltyp; er eignet sich am besten für den ersten Funktionstest.
Reasoning-ModelleBesser geeignet für komplexe Analysen, Mathematik, Code-Reasoning und mehrstufige Aufgaben.Preis und Antwortzeit können höher sein; für einfache Chats ist daher keine Priorisierung erforderlich.
Code-ModellSpezialisiert auf das Lesen von Code, das Schreiben von Code, die Fehlerbehebung und die Erklärung von Projekten.Prüfen Sie in Code-Tools auch, ob Tool-Aufrufe (Tool Calls), Dateizugriffe und Kontextverwaltung unterstützt werden.
Modelle für visuelles VerständnisBilder analysieren, Screenshots erkennen, Tabellen oder Benutzeroberflächen verstehen.Das Tool selbst muss Bilduploads unterstützen, und der Provider muss visuelle Eingaben erlauben.
BildgenerierungsmodellBilder anhand von Prompts generieren oder bearbeiten.Verwendet in der Regel nicht /chat/completions; die Konfigurationsseite muss für Bild-APIs ausgelegt sein.
VideogenerierungsmodellKurze Videos generieren, Bild-zu-Video oder Videobearbeitung durchführen.Der übliche Ablauf besteht aus: Aufgabe übermitteln, auf Fertigstellung warten, dann das Ergebnis abrufen – anstelle von sofortigen Chat-Antworten.
Embedding-VektormodellText in Vektoren umwandeln für den Abruf aus Wissensdatenbanken und Ähnlichkeitsabgleiche.Kann nicht zum Chatten verwendet werden; wird üblicherweise zusammen mit Wissensdatenbanken, RAG und Suchsystemen eingesetzt.
Rerank-ModellSuchergebnisse neu ordnen, sodass relevantere Inhalte ganz oben stehen.Wird häufig zur Optimierung der Trefferqualität in Wissensdatenbanken verwendet und dient nicht dem Generieren von Antworten.
Sprachmodelle (Audio)Text-to-Speech (TTS), Speech-to-Text (STT), Sprachunterhaltungen in Echtzeit.Die Felder unterscheiden sich von regulären Textmodellen; beachten Sie die entsprechende Dokumentation zu TTS / STT / Realtime.

Wie sollten Einsteiger wählen?

Was möchten Sie tun?Was sollten Sie priorisieren?Grund
Alltägliches Chatten, Übersetzen, ZusammenfassenStabile, kostengünstige Chat-ModelleDen Key, die API-Adresse und den Modellnamen erfolgreich zum Laufen zu bringen, ist anfangs wichtiger als sofort das leistungsstärkste Modell zu wählen.
Code schreiben, Projekte bearbeitenModelle mit starken Programmier- oder Reasoning-FähigkeitenProgrammieraufgaben hängen stark von Kontext, Tool-Aufrufen und Präzision ab; günstigere Modelle erfordern oft viele Nachbesserungen.
Lange Dokumente lesen, lange KonversationenTextmodelle mit großem KontextfensterEin größeres Kontextfenster kann mehr Informationen aufnehmen, allerdings können auch die Kosten steigen.
Screenshots betrachten, Bilder analysierenMultimodale Modelle mit Unterstützung für visuelle EingabenWenn nur ein reines Textmodell konfiguriert ist, schlägt der Bildupload fehl oder das Bild wird nicht verstanden.
Bilder generierenBildgenerierungsmodellBildgenerierung unterscheidet sich von Chat-Modellen; Bild-Tools und Bild-APIs müssen in der Regel separat betrachtet werden.
Videos generierenVideogenerierungsmodelle oder VideoplattformenVideomodelle verbrauchen viele Ressourcen und haben längere Wartezeiten; prüfen Sie Abrechnung und Aufgabenablauf vorab sorgfältig.
Eine Wissensdatenbank aufbauenChat-Modell + Embedding + optional RerankEine Wissensdatenbank basiert nicht nur auf einem Chat-Modell; Abruf und Reranking beeinflussen die Qualität der Antworten maßgeblich.
Wenn Sie Tools bei einem AI-Provider konfigurieren, ist dies die verlässlichste Vorgehensweise: Wählen Sie zuerst ein preiswertes Textmodell und bringen Sie es zum Laufen. Testen Sie erst danach die Code-, Vision-, Bild- oder Videomodelle, die Sie tatsächlich benötigen. Tragen Sie nicht den Modellnamen eines Anbieters in das Protokoll eines anderen Anbieters ein, nur weil die Namen der Modellserien ähnlich klingen.