Modèles et fournisseurs : sachez d'abord quel modèle vous choisissez
Distinguez d'abord les fournisseurs, séries de modèles et identifiants de modèles, comprenez à quoi chaque type de modèle est adapté, puis choisissez le fournisseur d'API IA et les tutoriels d'outils correspondants.
D'abord, distinguer les trois appellations
| Appellation | Explication simple | Comment l'aborder lors de la configuration |
|---|---|---|
| Fournisseur (Vendor) | Entreprises ou plateformes qui développent ou fournissent des services de modèles, telles qu'OpenAI, Anthropic, Google, DeepSeek, Alibaba Cloud, ByteDance et Volcano Engine, etc. | Les fabricants déterminent les capacités des modèles, les protocoles d'interface, les prix et les limites ; le fournisseur d'API relaie simplement ces fonctionnalités sur son propre backend. |
| Série de modèles | Un ensemble de marques ou de familles de modèles, comme GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Doubao. | Le nom de la série vous aide uniquement à déterminer l'origine et les capacités générales ; il ne correspond pas directement à l'identifiant de modèle à saisir dans la configuration. |
| Identifiant de modèle / Nom du modèle (Model ID / Model Name) | Le nom exact à renseigner dans la requête API, tel que la chaîne de caractères figurant dans la liste des modèles du backend du fournisseur. | Copiez-le exactement depuis le backend, sans modifier la casse, les tirets, les points ou les numéros de version ; si la récupération de la liste échoue, ajoutez manuellement les identifiants fournis par le backend. |
| Nom d'affichage (Display Name) | Le nom ou alias affiché dans l'outil ou le backend du service pour faciliter la lecture. | Le nom d'affichage peut ne pas être directement appelable via l'API ; lors de la configuration, privilégiez les champs tels que 'Model ID', 'Model' ou 'Model Name'. |
Fournisseurs de modèles internationaux courants
| Fournisseur | Modèles ou séries courants | Usages fréquents |
|---|---|---|
| GPT, série o, GPT Image, Sora, etc. | Conversations textuelles, code, raisonnement, génération d'images, génération de vidéos | |
| Série Claude | Lecture de textes longs, code, rédaction, analyse | |
| Série Gemini | Compréhension multimodale, contexte étendu, code, analyse d'images | |
| Série Grok | Conversations textuelles, raisonnement, scénarios d'information en temps réel | |
| Série Llama | Poids open-source, auto-hébergement, hébergement tiers | |
| Mistral, Codestral, etc. | Conversations textuelles, code, scénarios de modèles légers | |
| Command, Embed, Rerank, etc. | Bases de connaissances d'entreprise, recherche augmentée (RAG), vecteurs et reclassement | |
| Stable Diffusion, Stable Image, etc. | Génération et retouche d'images | |
| Modèles vidéo de la série Gen | Génération et édition de vidéos |
Fournisseurs de modèles chinois courants
| Fournisseur | Modèles ou séries courants | Usages fréquents |
|---|---|---|
| DeepSeek Chat, DeepSeek Reasoner, etc. | Conversations textuelles, code, raisonnement | |
| Qwen, Qwen-VL, Qwen-Coder, etc. | Conversation textuelle, analyse d'images, code, modèles open-source | |
| Kimi, série Moonshot | Lecture de textes longs, rédaction et analyse de données | |
| GLM, GLM-4, etc. | Dialogue textuel, raisonnement, multimodal, agents intelligents | |
| Série Doubao | Dialogue textuel, multimodal, vecteurs, applications d'entreprise | |
| Série ERNIE / Wenxin | Conversation textuelle, multimodal, recherche et scénarios d'entreprise | |
| Série Hunyuan | Chat textuel, multimodal, accès d'entreprise | |
| MiniMax, abab, modèles vocaux | Conversation textuelle, contexte long, voix et multimodal | |
| Série Spark | Conversations textuelles, bureautique éducative, scénarios vocaux | |
| Série Yi | Modèles open-source, dialogue textuel, hébergement tiers |
Types de modèles courants
| Type | À quoi sert-il | Points d'attention lors de la configuration |
|---|---|---|
| Modèle de chat / texte | Répondre aux questions, rédiger des textes, traduire, résumer, écrire du code. | La plupart des outils conversationnels configurent en priorité ce type de modèle, ce qui le rend idéal pour la première étape de test. |
| Modèles de raisonnement | Plus adapté aux analyses complexes, aux mathématiques, au raisonnement de code et aux tâches en plusieurs étapes. | Le prix et le temps de réponse peuvent être plus élevés ; ils ne sont donc pas indispensables pour de simples discussions. |
| Modèle de code | Davantage orienté vers la lecture et l'écriture de code, la correction de bugs et l'explication de projets. | Dans les outils de programmation, vérifiez également la prise en charge des appels d'outils (tool calls), de la lecture/écriture de fichiers et de la gestion du contexte. |
| Modèles de vision / compréhension d'images | Analyser des images, reconnaître des captures d'écran, comprendre des tableaux ou des interfaces. | L'outil lui-même doit prendre en charge le téléversement d'images, et le fournisseur doit également autoriser les entrées visuelles. |
| Modèle de génération d'images | Générer ou retoucher des images à partir de prompts textuels. | Généralement distinct de l'interface de chat standard /chat/completions ; la page de configuration doit être basée sur l'API d'image. |
| Modèle de génération de vidéos | Générer de courtes vidéos, convertir une image en vidéo ou éditer des vidéos. | Le fonctionnement habituel consiste à soumettre une tâche, attendre sa complétion, puis récupérer le résultat, plutôt qu'une réponse instantanée par chat. |
| Modèle d'embedding (vectorisation) | Convertir du texte en vecteurs pour la recherche dans une base de connaissances et le calcul de similarité. | Ne peut pas être utilisé pour discuter ; s'utilise généralement avec des bases de connaissances, des architectures RAG et des systèmes de recherche. |
| Modèle de reclassement (Rerank) | Réorganiser les résultats de recherche afin de placer les éléments les plus pertinents en tête. | Couramment employé pour optimiser les performances des bases de connaissances ; ne génère pas de réponses directement. |
| Modèles vocaux | Synthèse vocale (TTS), reconnaissance vocale (STT), conversation vocale en temps réel. | Les champs diffèrent des modèles de texte classiques ; vous devez vous référer à la documentation TTS / STT / Realtime correspondante. |
Comment choisir pour un débutant ?
| Que souhaitez-vous faire ? | Que privilégier ? | Raison |
|---|---|---|
| Chat général, traduction, résumé | Modèles de chat stables et économiques | S'assurer du bon fonctionnement de la clé, de l'adresse API et du nom du modèle est plus important au début que de chercher immédiatement le modèle le plus puissant. |
| Écrire du code, modifier des projets | Modèles dotés de fortes capacités de programmation ou de raisonnement | Les tâches de code dépendent fortement du contexte, des appels d'outils et de la précision ; les modèles bas de gamme risquent de multiplier les allers-retours correctifs. |
| Lire de longs documents, conversations étendues | Modèles de texte avec une grande fenêtre de contexte | Un contexte plus étendu permet de traiter davantage d'informations, mais le coût peut également être plus élevé. |
| Analyser des captures d'écran, traiter des images | Modèles multimodaux prenant en charge les entrées visuelles | Si seul un modèle de texte ordinaire est configuré, le téléversement d'images sera indisponible ou non pris en compte. |
| Générer des images | Modèle de génération d'images | La génération d'images diffère d'un modèle de chat ; vous devez généralement configurer séparément les outils d'images et leurs API. |
| Générer des vidéos | Modèles de génération de vidéos ou plateformes vidéo | Les modèles vidéo consomment beaucoup de ressources et demandent un temps d'attente élevé ; vérifiez attentivement la facturation et le traitement des tâches au préalable. |
| Créer une base de connaissances | Modèle de chat + Embedding + optionnellement Rerank | Une base de connaissances ne repose pas uniquement sur un modèle de chat ; la récupération et le reclassement influent considérablement sur la qualité des réponses. |
Si vous configurez vos outils chez un fournisseur d'API IA, la démarche la plus fiable consiste à : d'abord choisir un modèle de texte abordable pour valider la connexion, puis tester le modèle de code, de vision, d'image ou de vidéo dont vous avez réellement besoin. N'utilisez pas l'identifiant d'un fournisseur avec le protocole d'un autre simplement parce que les noms de séries de modèles se ressemblent.
