Modelos e fornecedores: Saiba primeiro de quem é o modelo que você está escolhendo
Primeiro diferencie fornecedores, séries de modelos e IDs de modelos, entenda para que cada tipo de modelo é adequado e, em seguida, escolha o provedor de IA e os tutoriais de ferramentas.
Primeiro, diferencie os três conceitos
| Nome | Explicação simples | O que observar ao configurar |
|---|---|---|
| Fornecedor (Vendor) | Empresas ou plataformas que desenvolvem ou fornecem serviços de modelos, como OpenAI, Anthropic, Google, DeepSeek, Alibaba Cloud, ByteDance e Volcano Engine, etc. | Os fabricantes decidem as capacidades do modelo, protocolos de interface, preços e limitações; o provedor de IA simplesmente conecta essas capacidades ao seu próprio backend. |
| Série de modelos | Um conjunto de marcas de modelos ou nomes de famílias, como GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Doubao. | O nome da série apenas ajuda a determinar a origem e a capacidade geral; não pode ser diretamente equiparado ao ID do modelo que precisa ser preenchido na configuração. |
| ID do modelo / Nome do modelo | O nome exato que precisa ser inserido na requisição da API, como a sequência de caracteres na lista de modelos do backend do provedor. | Copie exatamente do backend, não altere maiúsculas/minúsculas, hífens, pontos ou números de versão por conta própria; se a obtenção automática da lista de modelos falhar, adicione manualmente os IDs de modelo fornecidos pelo backend. |
| Nome de exibição (Display Name) | O nome ou alias exibido na ferramenta ou no backend do serviço para facilitar a leitura. | O nome de exibição pode não ser chamável diretamente via API; ao configurar, priorize campos como 'Model ID', 'Model' ou 'Model Name'. |
Principais Fornecedores de Modelos Internacionais
| Fornecedor | Modelos ou Séries Comuns | Usos Comuns |
|---|---|---|
| GPT, série o, GPT Image, Sora, etc. | Conversas de texto, código, raciocínio, geração de imagens, geração de vídeos | |
| Série Claude | Leitura de textos longos, código, redação, análise | |
| Série Gemini | Compreensão multimodal, contexto longo, código, compreensão de imagens | |
| Série Grok | Conversas de texto, raciocínio, cenários com informações em tempo real | |
| Série Llama | Pesos de código aberto, auto-hospedagem (self-hosting), hospedagem de terceiros | |
| Mistral, Codestral, etc. | Conversas de texto, código, cenários com modelos leves | |
| Command, Embed, Rerank, etc. | Base de conhecimento corporativa, geração aumentada por recuperação (RAG), vetores e rerank | |
| Stable Diffusion, Stable Image, etc. | Geração de imagens, edição de imagens | |
| Modelos de vídeo da série Gen | Geração de vídeos, edição de vídeos |
Principais Fornecedores de Modelos Chineses
| Fornecedor | Modelos ou Séries Comuns | Usos Comuns |
|---|---|---|
| DeepSeek Chat, DeepSeek Reasoner, etc. | Conversas de texto, código, raciocínio | |
| Qwen, Qwen-VL, Qwen-Coder, etc. | Conversa de texto, compreensão de imagens, código, modelos de código aberto | |
| Kimi, Série Moonshot | Leitura de textos longos, redação e análise de dados | |
| GLM, GLM-4, etc. | Diálogo de texto, raciocínio, multimodal, agentes inteligentes | |
| Série Doubao | Diálogo de texto, multimodal, vetores, aplicações corporativas | |
| Série ERNIE / Wenxin | Conversa de texto, multimodal, busca e cenários corporativos | |
| Série Hunyuan | Chat de texto, multimodal, acesso corporativo | |
| MiniMax, abab, modelos de voz | Conversa de texto, texto longo, voz e multimodal | |
| Série Spark | Conversas de texto, escritório/educacional, cenários com voz | |
| Série Yi | Modelos de código aberto, diálogo de texto, hospedagem de terceiros |
Tipos Comuns de Modelos
| Tipo | O que faz | O que observar ao configurar |
|---|---|---|
| Modelo de Chat / Texto | Responder a perguntas, redigir textos, traduzir, resumir, escrever código. | A maioria das ferramentas conversacionais prioriza a configuração deste tipo de modelo, tornando-o o mais adequado para a primeira etapa de testes. |
| Modelos de raciocínio | Mais adequados para análises complexas, matemática, raciocínio em código e tarefas de várias etapas. | O preço e o tempo de resposta podem ser mais altos; conversas simples não exigem necessariamente prioridade para este tipo. |
| Modelo de código | Mais focado em leitura de código, escrita de código, correção de bugs e explicação de projetos. | Em ferramentas de programação, verifique também se chamadas de ferramentas (tool calls), leitura/escrita de arquivos e gerenciamento de contexto são suportados. |
| Modelos de visão / compreensão visual | Visualizar imagens, reconhecer capturas de tela, entender tabelas ou interfaces. | A própria ferramenta deve suportar envio de imagens, e os provedores também devem permitir entrada visual. |
| Modelo de geração de imagens | Gerar ou editar imagens com base em prompts. | Geralmente não usam interfaces de chat comuns como /chat/completions; a página de configuração deve ser baseada na API de imagens. |
| Modelo de geração de vídeo | Gerar vídeos curtos, converter imagem em vídeo (image-to-video) ou editar vídeos. | O fluxo comum envolve enviar a tarefa, aguardar a conclusão e depois recuperar o resultado, em vez de respostas instantâneas de chat. |
| Modelo de vetores / Embeddings | Converter texto em vetores para busca em bases de conhecimento e correspondência por similaridade. | Não pode ser usado para chat; é normalmente usado em conjunto com bases de conhecimento, RAG e sistemas de busca. |
| Modelo de Reranking / Reordenação | Reordenar os resultados da busca para que o conteúdo mais relevante fique no topo. | É frequentemente usado para otimizar o desempenho de bases de conhecimento e não gera respostas diretamente. |
| Modelos de voz | Texto para fala (TTS), fala para texto (STT), conversação de voz em tempo real. | Os campos diferem dos modelos de texto comuns; você deve consultar a documentação correspondente de TTS / STT / Realtime. |
Como os iniciantes devem escolher?
| O que você pretende fazer? | O que priorizar? | Motivo |
|---|---|---|
| Chat geral, tradução, resumo | Modelos de chat estáveis e de baixo custo | Fazer a chave (Key), o endereço da API e o nome do modelo funcionarem é mais importante no início do que buscar o modelo mais poderoso. |
| Escrever código, modificar projetos | Modelos com forte capacidade de codificação ou raciocínio | Tarefas de programação dependem mais de contexto, chamadas de ferramentas e precisão; modelos mais baratos tendem a exigir revisões repetidas. |
| Leitura de documentos longos, conversas longas | Modelos de texto com janela de contexto maior | Um contexto mais longo permite processar mais informações, mas o custo também pode ser mais alto. |
| Analisar capturas de tela, visualizar imagens | Modelos multimodais que suportam entrada visual | Se apenas um modelo de texto padrão estiver configurado, o envio de imagens pode falhar ou não ser compreendido. |
| Gerar imagens | Modelos de geração de imagens | A geração de imagens é diferente de um modelo de chat; geralmente é preciso considerar ferramentas de imagem e APIs de imagem separadamente. |
| Gerar vídeos | Modelos de geração de vídeo ou plataformas de vídeo | Modelos de vídeo consomem muitos recursos e têm tempos de espera longos; verifique primeiro a cobrança e o fluxo de tarefas com atenção. |
| Criar uma base de conhecimento | Modelo de chat + Embedding + opcionalmente Rerank | Uma base de conhecimento não depende apenas de um modelo de chat; a recuperação e a reordenação afetam significativamente a qualidade das respostas. |
Se estiver configurando ferramentas em um provedor de IA, a ordem mais estável é: primeiro escolha um modelo de texto acessível e faça-o funcionar; depois, teste o modelo de código, visão, imagem ou vídeo de que realmente precisa. Não insira o nome de modelo de um fornecedor no protocolo de outro provedor apenas porque os nomes das séries de modelos são parecidos.
