模型与厂商:先知道你在选谁的模型
先分清厂商、模型系列和模型 ID,知道每类模型适合做什么,再去选择中转站和工具教程。
先分清三个名字
| 名称 | 白话解释 | 配置时怎么看 |
|---|---|---|
| 厂商 | 研发或提供模型服务的公司或平台,例如 OpenAI、Anthropic、Google、DeepSeek、阿里云、字节火山等。 | 厂商决定模型能力、接口协议、价格和限制;中转站只是把这些能力接到自己的后台里。 |
| 模型系列 | 一组模型的品牌或家族名,例如 GPT、Claude、Gemini、DeepSeek、Qwen、GLM、Doubao。 | 系列名只帮助你判断来源和大致能力,不能直接等同于配置里要填的模型 ID。 |
| 模型 ID / 模型名 | API 请求里真正要填写的精确名称,例如服务商后台模型列表里的那一串字符。 | 照抄后台,不要自己改大小写、横线、点号和版本号;获取模型列表失败时,再手动添加后台给出的模型 ID。 |
| 展示名 | 工具或服务商后台为了方便阅读显示出来的中文名或别名。 | 展示名不一定能直接调用,配置时优先找“模型 ID”“Model”“模型名称”这类字段。 |
国外常见模型厂商
| 厂商 | 常见模型或系列 | 常见用途 |
|---|---|---|
| GPT、o 系列、GPT Image、Sora 等 | 文字对话、代码、推理、图片生成、视频生成 | |
| Claude 系列 | 长文本阅读、代码、写作、分析 | |
| Gemini 系列 | 多模态理解、长上下文、代码、图片理解 | |
| Grok 系列 | 文字对话、推理、实时信息类场景 | |
| MMeta | Llama 系列 | 开源权重、自部署、第三方托管 |
| MMistral AI | Mistral、Codestral 等 | 文字对话、代码、轻量模型场景 |
| CCohere | Command、Embed、Rerank 等 | 企业知识库、检索增强、向量和重排 |
| SStability AI | Stable Diffusion、Stable Image 等 | 图片生成、图片编辑 |
| RRunway | Gen 系列视频模型 | 视频生成、视频编辑 |
国内常见模型厂商
| 厂商 | 常见模型或系列 | 常见用途 |
|---|---|---|
| DeepSeek Chat、DeepSeek Reasoner 等 | 文字对话、代码、推理 | |
| Qwen、Qwen-VL、Qwen-Coder 等 | 文字对话、图片理解、代码、开源模型 | |
| Kimi、Moonshot 系列 | 长文本阅读、写作、资料分析 | |
| GLM、GLM-4 等 | 文字对话、推理、多模态、智能体 | |
| Doubao 豆包系列 | 文字对话、多模态、向量、企业应用 | |
| ERNIE / 文心系列 | 文字对话、多模态、搜索和企业场景 | |
| Hunyuan 混元系列 | 文字对话、多模态、企业接入 | |
| MiniMax、abab、语音相关模型 | 文字对话、长文本、语音和多模态 | |
| 讯讯飞 | 星火系列 | 文字对话、教育办公、语音相关场景 |
| 01零一万物 | Yi 系列 | 开源模型、文字对话、第三方托管 |
常见模型类型
| 类型 | 它做什么 | 配置时要注意 |
|---|---|---|
| 聊天 / 文本模型 | 回答问题、写文案、翻译、总结、写代码。 | 大多数对话工具优先配置这类模型,最适合第一步测试。 |
| 推理模型 | 更适合复杂分析、数学、代码推理、多步骤任务。 | 价格和响应时间可能更高,简单聊天不一定需要优先用。 |
| 代码模型 | 更偏向读代码、写代码、修 bug、解释项目。 | 代码工具里还要看是否支持工具调用、文件读写和上下文管理。 |
| 视觉理解模型 | 看图、识别截图、理解表格或界面。 | 工具本身要支持上传图片,服务商也要开放视觉输入。 |
| 图片生成模型 | 根据提示词生成或编辑图片。 | 通常不是 /chat/completions 这种普通聊天接口,配置页要看图片 API。 |
| 视频生成模型 | 生成短视频、图生视频或视频编辑。 | 常见流程是提交任务、等待完成、再取结果,不是即时聊天回复。 |
| Embedding 向量模型 | 把文本转成向量,用于知识库检索和相似度匹配。 | 不能拿来聊天,通常配合知识库、RAG、搜索系统使用。 |
| Rerank 重排模型 | 把检索结果重新排序,让更相关的内容排前面。 | 常用于知识库效果优化,不是生成回答的模型。 |
| 语音模型 | 文字转语音、语音转文字、实时语音对话。 | 字段和普通文字模型不同,要看 TTS / STT / Realtime 对应文档。 |
新手怎么选
| 你要做什么 | 优先选什么 | 理由 |
|---|---|---|
| 普通聊天、翻译、总结 | 稳定、价格低的聊天模型 | 先把 Key、API 地址和模型名跑通,比一开始追求最强模型更重要。 |
| 写代码、改项目 | 代码能力强或推理能力强的模型 | 代码任务更依赖上下文、工具调用和准确性,便宜模型容易反复改。 |
| 读长文档、长对话 | 上下文更长的文本模型 | 长上下文能带入更多资料,但费用也可能更高。 |
| 看截图、分析图片 | 支持视觉输入的多模态模型 | 只配置普通文本模型时,上传图片可能不可用或无法理解。 |
| 生成图片 | 图片生成模型 | 图片生成不等于聊天模型,通常要单独看图片工具和图片 API。 |
| 生成视频 | 视频生成模型或视频平台 | 视频模型消耗高、等待久,先看清计费和任务流程。 |
| 做知识库 | 聊天模型 + Embedding + 可选 Rerank | 知识库不是只靠一个聊天模型,检索和重排会明显影响答案质量。 |
如果你是在中转站里配置工具,最稳的顺序是:先选一个便宜的文本模型跑通,再测试你真正需要的代码、视觉、图片或视频模型。不要因为模型系列名字相似,就把一个厂商的模型名填到另一个厂商的协议里。
