モデルとベンダー:まずは誰のモデルを選ぶかを把握しよう
ベンダー、モデルシリーズ、モデルIDの違いを整理し、各モデルタイプの適性を把握した上で、中転スタンド(プロバイダー)の選定やツール連携ガイドに進みましょう。
まずは3つの名称の違いを把握する
| 名称 | わかりやすい解説 | 設定時の注意点 |
|---|---|---|
| ベンダー(提供元) | OpenAI、Anthropic、Google、DeepSeek、Alibaba Cloud(阿里雲)、ByteDance(Volcano Engine/火山引擎)など、モデルサービスを開発・提供する企業やプラットフォームです。 | モデルの性能、APIプロトコル、価格、制限などはベンダーによって決まります。中転スタンド(プロバイダー)はこれらの機能を自社バックエンドへ中継接続しているだけです。 |
| モデルシリーズ | GPT、Claude、Gemini、DeepSeek、Qwen(通義千問)、GLM、Doubao(豆包)などのモデルブランドやファミリー名のことです。 | シリーズ名は出自や大まかな性能を把握するためのものであり、設定項目に入力すべき「モデルID」とは必ずしも一致しません。 |
| モデルID / モデル名 | APIリクエスト時に入力が必要な正式な識別名です(プロバイダーの管理画面にあるモデルリストの文字列など)。 | 管理画面から正確にコピーしてください。大文字・小文字、ハイフン、ピリオド、バージョン番号などを勝手に変更してはいけません。モデルリストの自動取得に失敗した場合は、管理画面に記載されているモデルIDを手動で追加してください。 |
| 表示名(Display Name) | ツールや管理画面で識別しやすくするために表示される分かりやすい名称やエイリアスです。 | 表示名はAPIから直接呼び出せない場合があります。設定時には「Model ID」「Model」「Model Name」などのフィールドを優先して入力してください。 |
主な海外モデルベンダー
| ベンダー | 代表的なモデル・シリーズ | 主な用途 |
|---|---|---|
| GPT、oシリーズ、GPT Image、Soraなど | テキスト会話、コーディング、推論、画像生成、動画生成 | |
| Claudeシリーズ | 長文読解、コーディング、文章作成、分析 | |
| Geminiシリーズ | マルチモーダル理解、長文コンテキスト、コーディング、画像理解 | |
| Grokシリーズ | テキスト会話、推論、リアルタイム情報収集 | |
| Llamaシリーズ | オープンソース重み、ローカル展開、サードパーティホスティング | |
| Mistral、Codestralなど | テキスト会話、コーディング、軽量モデル用途 | |
| Command、Embed、Rerankなど | 企業向けナレッジベース、検索拡張(RAG)、ベクトル化・リランキング | |
| Stable Diffusion、Stable Imageなど | 画像生成、画像編集 | |
| Genシリーズ動画モデル | 動画生成、動画編集 |
主な中国系モデルベンダー
| ベンダー | 代表的なモデル・シリーズ | 主な用途 |
|---|---|---|
| DeepSeek Chat、DeepSeek Reasonerなど | テキスト会話、コーディング、推論 | |
| Qwen、Qwen-VL、Qwen-Coderなど | テキスト会話、画像理解、コーディング、オープンソースモデル | |
| Kimi、Moonshotシリーズ | 長文読解、文章作成、データ分析 | |
| GLM、GLM-4など | テキスト対話、推論、マルチモーダル、AIエージェント | |
| Doubao(豆包)シリーズ | テキスト対話、マルチモーダル、ベクトル検索、企業向けアプリケーション | |
| ERNIE / 文心シリーズ | テキスト会話、マルチモーダル、検索、企業向けシナリオ | |
| Hunyuan(混元)シリーズ | テキストチャット、マルチモーダル、企業連携 | |
| MiniMax、abab、音声関連モデル | テキスト会話、長文処理、音声、マルチモーダル | |
| Spark(星火)シリーズ | テキスト会話、教育・オフィス業務、音声関連用途 | |
| Yiシリーズ | オープンソースモデル、テキスト対話、サードパーティホスティング |
主なモデルタイプ
| タイプ | 主な役割 | 設定時の注意点 |
|---|---|---|
| チャット・テキストモデル | 質問応答、文章作成、翻訳、要約、コーディングなど。 | 多くの対話型ツールではこのタイプを最優先で設定します。最初の動作テストに最適です。 |
| 推論モデル | 複雑な分析、数学、論理的コーディング、複数ステップのタスクに適しています。 | 利用料金が高く応答時間も長くなる傾向があるため、日常の簡単な雑談では優先する必要はありません。 |
| コード特化モデル | コードの読解、コーディング、バグ修正、プロジェクト解説などに特化しています。 | コーディングツールで使用する際は、ツール呼び出し(Tool Call)、ファイル読み書き、コンテキスト管理の対応状況も確認してください。 |
| 画像認識・ビジョンモデル | 画像の閲覧、スクリーンショットの認識、表やUI画面の理解などを行います。 | 利用ツール側で画像のアップロードに対応している必要があり、中転プロバイダー側でもビジョン入力がサポートされている必要があります。 |
| 画像生成モデル | プロンプトに基づいて画像を生成・編集します。 | 通常は /chat/completions のような通常のチャットAPIではなく、専用の画像生成APIエンドポイントを設定する必要があります。 |
| 動画生成モデル | ショート動画の生成、静止画からの動画生成、動画編集などを行います。 | チャットのような即時応答ではなく、「タスクを送信 → 完了まで待機 → 結果を取得」という非同期フローが一般的です。 |
| Embedding(埋め込み・ベクトル)モデル | テキストをベクトルに変換し、ナレッジベース検索や類似度マッチングに利用します。 | 会話用には使用できません。主にナレッジベース、RAG(検索拡張生成)、検索システムと組み合わせて使用します。 |
| Rerank(リランキング・並べ替え)モデル | 検索結果を再評価して並べ替え、より関連性の高い情報を上位に配置します。 | ナレッジベースの精度向上によく用いられます。回答を生成するモデルではありません。 |
| 音声モデル | 音声合成(TTS)、音声認識(STT)、リアルタイム音声対話など。 | 通常のテキストモデルとは設定項目が異なるため、対応するTTS/STT/リアルタイム通信のドキュメントを参照してください。 |
初心者はどのように選ぶべきか?
| やりたいこと | 優先すべきモデル | 理由 |
|---|---|---|
| 一般的な雑談、翻訳、要約 | 安定していて低コストなチャットモデル | 最初から最強モデルを求めるよりも、まずはAPIキー、APIエンドポイント、モデル名が正しく設定できて疎通することを確認する方が重要です。 |
| コーディング、プロジェクトの改修 | コーディングや推論性能が高いモデル | コーディング作業はコンテキスト長、ツール呼び出し、正確性に大きく依存します。安価なモデルでは修正の繰り返しが発生しやすくなります。 |
| 長文ドキュメントの読解、長時間の対話 | コンテキストウィンドウが広いテキストモデル | 長いコンテキストにより大量の情報を一度に扱えますが、その分コストも高くなる傾向があります。 |
| スクリーンショットの確認、画像分析 | ビジョン入力対応のマルチモーダルモデル | 通常のテキスト専用モデルでは、画像をアップロードできなかったり正しく理解されなかったりします。 |
| 画像を生成したい | 画像生成モデル | 画像生成はチャットモデルとは異なります。通常は画像専用ツールや画像APIを個別に検討する必要があります。 |
| 動画を生成したい | 動画生成モデルまたは動画プラットフォーム | 動画モデルはトークン消費(コスト)が大きく待機時間も長いため、事前に課金体系や処理フローをよく確認してください。 |
| ナレッジベースを構築したい | チャットモデル + Embedding(+必要に応じてRerank) | ナレッジベースの構築はチャットモデル単体では完結しません。検索やリランキングの精度が回答品質を大きく左右します。 |
中転スタンド(プロバイダー)経由でツールを設定する場合、最も確実な手順は「まずは安価なテキストモデルで接続疎通を完了させ、その後に実際の業務で必要なコード、ビジョン、画像、動画モデルなどをテストする」ことです。モデルシリーズ名が似ているからといって、あるプロバイダーのモデル名を別のプロバイダーのプロトコルにそのまま入力しないようご注意ください。
