Guia de configuração

Guia de configuração de provedores

Veja o passo a passo de configuração e solução de problemas por ferramenta.

Guia de configuração de provedores/Modelos e fornecedores: Saiba primeiro de quem é o modelo que você está escolhendo

Modelos e fornecedores: Saiba primeiro de quem é o modelo que você está escolhendo

Primeiro diferencie fornecedores, séries de modelos e IDs de modelos, entenda para que cada tipo de modelo é adequado e, em seguida, escolha o provedor de IA e os tutoriais de ferramentas.

Primeiro, diferencie os três conceitos

NomeExplicação simplesO que observar ao configurar
Fornecedor (Vendor)Empresas ou plataformas que desenvolvem ou fornecem serviços de modelos, como OpenAI, Anthropic, Google, DeepSeek, Alibaba Cloud, ByteDance e Volcano Engine, etc.Os fabricantes decidem as capacidades do modelo, protocolos de interface, preços e limitações; o provedor de IA simplesmente conecta essas capacidades ao seu próprio backend.
Série de modelosUm conjunto de marcas de modelos ou nomes de famílias, como GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Doubao.O nome da série apenas ajuda a determinar a origem e a capacidade geral; não pode ser diretamente equiparado ao ID do modelo que precisa ser preenchido na configuração.
ID do modelo / Nome do modeloO nome exato que precisa ser inserido na requisição da API, como a sequência de caracteres na lista de modelos do backend do provedor.Copie exatamente do backend, não altere maiúsculas/minúsculas, hífens, pontos ou números de versão por conta própria; se a obtenção automática da lista de modelos falhar, adicione manualmente os IDs de modelo fornecidos pelo backend.
Nome de exibição (Display Name)O nome ou alias exibido na ferramenta ou no backend do serviço para facilitar a leitura.O nome de exibição pode não ser chamável diretamente via API; ao configurar, priorize campos como 'Model ID', 'Model' ou 'Model Name'.

Principais Fornecedores de Modelos Internacionais

FornecedorModelos ou Séries ComunsUsos Comuns
OpenAIGPT, série o, GPT Image, Sora, etc.Conversas de texto, código, raciocínio, geração de imagens, geração de vídeos
AnthropicSérie ClaudeLeitura de textos longos, código, redação, análise
GoogleSérie GeminiCompreensão multimodal, contexto longo, código, compreensão de imagens
xAISérie GrokConversas de texto, raciocínio, cenários com informações em tempo real
MetaSérie LlamaPesos de código aberto, auto-hospedagem (self-hosting), hospedagem de terceiros
Mistral AIMistral, Codestral, etc.Conversas de texto, código, cenários com modelos leves
CohereCommand, Embed, Rerank, etc.Base de conhecimento corporativa, geração aumentada por recuperação (RAG), vetores e rerank
Stability AIStable Diffusion, Stable Image, etc.Geração de imagens, edição de imagens
RunwayModelos de vídeo da série GenGeração de vídeos, edição de vídeos

Principais Fornecedores de Modelos Chineses

FornecedorModelos ou Séries ComunsUsos Comuns
DeepSeekDeepSeek Chat, DeepSeek Reasoner, etc.Conversas de texto, código, raciocínio
Alibaba Cloud / QwenQwen, Qwen-VL, Qwen-Coder, etc.Conversa de texto, compreensão de imagens, código, modelos de código aberto
Moonshot AIKimi, Série MoonshotLeitura de textos longos, redação e análise de dados
Zhipu AIGLM, GLM-4, etc.Diálogo de texto, raciocínio, multimodal, agentes inteligentes
ByteDance / Volcano Engine ArkSérie DoubaoDiálogo de texto, multimodal, vetores, aplicações corporativas
Baidu AI Cloud / QianfanSérie ERNIE / WenxinConversa de texto, multimodal, busca e cenários corporativos
Tencent CloudSérie HunyuanChat de texto, multimodal, acesso corporativo
MiniMaxMiniMax, abab, modelos de vozConversa de texto, texto longo, voz e multimodal
iFlytekSérie SparkConversas de texto, escritório/educacional, cenários com voz
01. AISérie YiModelos de código aberto, diálogo de texto, hospedagem de terceiros

Tipos Comuns de Modelos

TipoO que fazO que observar ao configurar
Modelo de Chat / TextoResponder a perguntas, redigir textos, traduzir, resumir, escrever código.A maioria das ferramentas conversacionais prioriza a configuração deste tipo de modelo, tornando-o o mais adequado para a primeira etapa de testes.
Modelos de raciocínioMais adequados para análises complexas, matemática, raciocínio em código e tarefas de várias etapas.O preço e o tempo de resposta podem ser mais altos; conversas simples não exigem necessariamente prioridade para este tipo.
Modelo de códigoMais focado em leitura de código, escrita de código, correção de bugs e explicação de projetos.Em ferramentas de programação, verifique também se chamadas de ferramentas (tool calls), leitura/escrita de arquivos e gerenciamento de contexto são suportados.
Modelos de visão / compreensão visualVisualizar imagens, reconhecer capturas de tela, entender tabelas ou interfaces.A própria ferramenta deve suportar envio de imagens, e os provedores também devem permitir entrada visual.
Modelo de geração de imagensGerar ou editar imagens com base em prompts.Geralmente não usam interfaces de chat comuns como /chat/completions; a página de configuração deve ser baseada na API de imagens.
Modelo de geração de vídeoGerar vídeos curtos, converter imagem em vídeo (image-to-video) ou editar vídeos.O fluxo comum envolve enviar a tarefa, aguardar a conclusão e depois recuperar o resultado, em vez de respostas instantâneas de chat.
Modelo de vetores / EmbeddingsConverter texto em vetores para busca em bases de conhecimento e correspondência por similaridade.Não pode ser usado para chat; é normalmente usado em conjunto com bases de conhecimento, RAG e sistemas de busca.
Modelo de Reranking / ReordenaçãoReordenar os resultados da busca para que o conteúdo mais relevante fique no topo.É frequentemente usado para otimizar o desempenho de bases de conhecimento e não gera respostas diretamente.
Modelos de vozTexto para fala (TTS), fala para texto (STT), conversação de voz em tempo real.Os campos diferem dos modelos de texto comuns; você deve consultar a documentação correspondente de TTS / STT / Realtime.

Como os iniciantes devem escolher?

O que você pretende fazer?O que priorizar?Motivo
Chat geral, tradução, resumoModelos de chat estáveis e de baixo custoFazer a chave (Key), o endereço da API e o nome do modelo funcionarem é mais importante no início do que buscar o modelo mais poderoso.
Escrever código, modificar projetosModelos com forte capacidade de codificação ou raciocínioTarefas de programação dependem mais de contexto, chamadas de ferramentas e precisão; modelos mais baratos tendem a exigir revisões repetidas.
Leitura de documentos longos, conversas longasModelos de texto com janela de contexto maiorUm contexto mais longo permite processar mais informações, mas o custo também pode ser mais alto.
Analisar capturas de tela, visualizar imagensModelos multimodais que suportam entrada visualSe apenas um modelo de texto padrão estiver configurado, o envio de imagens pode falhar ou não ser compreendido.
Gerar imagensModelos de geração de imagensA geração de imagens é diferente de um modelo de chat; geralmente é preciso considerar ferramentas de imagem e APIs de imagem separadamente.
Gerar vídeosModelos de geração de vídeo ou plataformas de vídeoModelos de vídeo consomem muitos recursos e têm tempos de espera longos; verifique primeiro a cobrança e o fluxo de tarefas com atenção.
Criar uma base de conhecimentoModelo de chat + Embedding + opcionalmente RerankUma base de conhecimento não depende apenas de um modelo de chat; a recuperação e a reordenação afetam significativamente a qualidade das respostas.
Se estiver configurando ferramentas em um provedor de IA, a ordem mais estável é: primeiro escolha um modelo de texto acessível e faça-o funcionar; depois, teste o modelo de código, visão, imagem ou vídeo de que realmente precisa. Não insira o nome de modelo de um fornecedor no protocolo de outro provedor apenas porque os nomes das séries de modelos são parecidos.