導入ガイド

プロバイダー導入ガイド

ツール別の設定手順やトラブルシューティングを見る。

プロバイダー導入ガイド/モデルとベンダー:まずは誰のモデルを選ぶかを把握しよう

モデルとベンダー:まずは誰のモデルを選ぶかを把握しよう

ベンダー、モデルシリーズ、モデルIDの違いを整理し、各モデルタイプの適性を把握した上で、中転スタンド(プロバイダー)の選定やツール連携ガイドに進みましょう。

まずは3つの名称の違いを把握する

名称わかりやすい解説設定時の注意点
ベンダー(提供元)OpenAI、Anthropic、Google、DeepSeek、Alibaba Cloud(阿里雲)、ByteDance(Volcano Engine/火山引擎)など、モデルサービスを開発・提供する企業やプラットフォームです。モデルの性能、APIプロトコル、価格、制限などはベンダーによって決まります。中転スタンド(プロバイダー)はこれらの機能を自社バックエンドへ中継接続しているだけです。
モデルシリーズGPT、Claude、Gemini、DeepSeek、Qwen(通義千問)、GLM、Doubao(豆包)などのモデルブランドやファミリー名のことです。シリーズ名は出自や大まかな性能を把握するためのものであり、設定項目に入力すべき「モデルID」とは必ずしも一致しません。
モデルID / モデル名APIリクエスト時に入力が必要な正式な識別名です(プロバイダーの管理画面にあるモデルリストの文字列など)。管理画面から正確にコピーしてください。大文字・小文字、ハイフン、ピリオド、バージョン番号などを勝手に変更してはいけません。モデルリストの自動取得に失敗した場合は、管理画面に記載されているモデルIDを手動で追加してください。
表示名(Display Name)ツールや管理画面で識別しやすくするために表示される分かりやすい名称やエイリアスです。表示名はAPIから直接呼び出せない場合があります。設定時には「Model ID」「Model」「Model Name」などのフィールドを優先して入力してください。

主な海外モデルベンダー

ベンダー代表的なモデル・シリーズ主な用途
OpenAIGPT、oシリーズ、GPT Image、Soraなどテキスト会話、コーディング、推論、画像生成、動画生成
AnthropicClaudeシリーズ長文読解、コーディング、文章作成、分析
GoogleGeminiシリーズマルチモーダル理解、長文コンテキスト、コーディング、画像理解
xAIGrokシリーズテキスト会話、推論、リアルタイム情報収集
MetaLlamaシリーズオープンソース重み、ローカル展開、サードパーティホスティング
Mistral AIMistral、Codestralなどテキスト会話、コーディング、軽量モデル用途
CohereCommand、Embed、Rerankなど企業向けナレッジベース、検索拡張(RAG)、ベクトル化・リランキング
Stability AIStable Diffusion、Stable Imageなど画像生成、画像編集
RunwayGenシリーズ動画モデル動画生成、動画編集

主な中国系モデルベンダー

ベンダー代表的なモデル・シリーズ主な用途
DeepSeekDeepSeek Chat、DeepSeek Reasonerなどテキスト会話、コーディング、推論
Alibaba Cloud / QwenQwen、Qwen-VL、Qwen-Coderなどテキスト会話、画像理解、コーディング、オープンソースモデル
Moonshot AIKimi、Moonshotシリーズ長文読解、文章作成、データ分析
Zhipu AIGLM、GLM-4などテキスト対話、推論、マルチモーダル、AIエージェント
ByteDance / Volcano Engine ArkDoubao(豆包)シリーズテキスト対話、マルチモーダル、ベクトル検索、企業向けアプリケーション
Baidu AI Cloud / QianfanERNIE / 文心シリーズテキスト会話、マルチモーダル、検索、企業向けシナリオ
Tencent CloudHunyuan(混元)シリーズテキストチャット、マルチモーダル、企業連携
MiniMaxMiniMax、abab、音声関連モデルテキスト会話、長文処理、音声、マルチモーダル
iFlytekSpark(星火)シリーズテキスト会話、教育・オフィス業務、音声関連用途
01. AIYiシリーズオープンソースモデル、テキスト対話、サードパーティホスティング

主なモデルタイプ

タイプ主な役割設定時の注意点
チャット・テキストモデル質問応答、文章作成、翻訳、要約、コーディングなど。多くの対話型ツールではこのタイプを最優先で設定します。最初の動作テストに最適です。
推論モデル複雑な分析、数学、論理的コーディング、複数ステップのタスクに適しています。利用料金が高く応答時間も長くなる傾向があるため、日常の簡単な雑談では優先する必要はありません。
コード特化モデルコードの読解、コーディング、バグ修正、プロジェクト解説などに特化しています。コーディングツールで使用する際は、ツール呼び出し(Tool Call)、ファイル読み書き、コンテキスト管理の対応状況も確認してください。
画像認識・ビジョンモデル画像の閲覧、スクリーンショットの認識、表やUI画面の理解などを行います。利用ツール側で画像のアップロードに対応している必要があり、中転プロバイダー側でもビジョン入力がサポートされている必要があります。
画像生成モデルプロンプトに基づいて画像を生成・編集します。通常は /chat/completions のような通常のチャットAPIではなく、専用の画像生成APIエンドポイントを設定する必要があります。
動画生成モデルショート動画の生成、静止画からの動画生成、動画編集などを行います。チャットのような即時応答ではなく、「タスクを送信 → 完了まで待機 → 結果を取得」という非同期フローが一般的です。
Embedding(埋め込み・ベクトル)モデルテキストをベクトルに変換し、ナレッジベース検索や類似度マッチングに利用します。会話用には使用できません。主にナレッジベース、RAG(検索拡張生成)、検索システムと組み合わせて使用します。
Rerank(リランキング・並べ替え)モデル検索結果を再評価して並べ替え、より関連性の高い情報を上位に配置します。ナレッジベースの精度向上によく用いられます。回答を生成するモデルではありません。
音声モデル音声合成(TTS)、音声認識(STT)、リアルタイム音声対話など。通常のテキストモデルとは設定項目が異なるため、対応するTTS/STT/リアルタイム通信のドキュメントを参照してください。

初心者はどのように選ぶべきか?

やりたいこと優先すべきモデル理由
一般的な雑談、翻訳、要約安定していて低コストなチャットモデル最初から最強モデルを求めるよりも、まずはAPIキー、APIエンドポイント、モデル名が正しく設定できて疎通することを確認する方が重要です。
コーディング、プロジェクトの改修コーディングや推論性能が高いモデルコーディング作業はコンテキスト長、ツール呼び出し、正確性に大きく依存します。安価なモデルでは修正の繰り返しが発生しやすくなります。
長文ドキュメントの読解、長時間の対話コンテキストウィンドウが広いテキストモデル長いコンテキストにより大量の情報を一度に扱えますが、その分コストも高くなる傾向があります。
スクリーンショットの確認、画像分析ビジョン入力対応のマルチモーダルモデル通常のテキスト専用モデルでは、画像をアップロードできなかったり正しく理解されなかったりします。
画像を生成したい画像生成モデル画像生成はチャットモデルとは異なります。通常は画像専用ツールや画像APIを個別に検討する必要があります。
動画を生成したい動画生成モデルまたは動画プラットフォーム動画モデルはトークン消費(コスト)が大きく待機時間も長いため、事前に課金体系や処理フローをよく確認してください。
ナレッジベースを構築したいチャットモデル + Embedding(+必要に応じてRerank)ナレッジベースの構築はチャットモデル単体では完結しません。検索やリランキングの精度が回答品質を大きく左右します。
中転スタンド(プロバイダー)経由でツールを設定する場合、最も確実な手順は「まずは安価なテキストモデルで接続疎通を完了させ、その後に実際の業務で必要なコード、ビジョン、画像、動画モデルなどをテストする」ことです。モデルシリーズ名が似ているからといって、あるプロバイダーのモデル名を別のプロバイダーのプロトコルにそのまま入力しないようご注意ください。