Guía de configuración

Guía de configuración del proveedor

Explora los pasos de configuración y soluciones por herramienta.

Guía de configuración del proveedor/Modelos y proveedores: primero identifica el modelo que estás eligiendo

Modelos y proveedores: primero identifica el modelo que estás eligiendo

Primero diferencia entre proveedores, series de modelos e ID de modelos, comprende para qué sirve cada tipo de modelo y luego elige el proveedor de IA y los tutoriales de herramientas adecuados.

Primero, distingue estos tres nombres

NombreExplicación sencillaCómo interpretarlo al configurar
Proveedor (Vendor)Empresas o plataformas que desarrollan o proporcionan servicios de modelos, como OpenAI, Anthropic, Google, DeepSeek, Alibaba Cloud, ByteDance y Volcano Engine, etc.Los fabricantes determinan las capacidades del modelo, los protocolos de interfaz, los precios y las restricciones; el proveedor simplemente conecta estas capacidades a su propio backend.
Serie de modelosUn nombre de marca o familia de modelos, como GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Doubao.El nombre de la serie solo te ayuda a identificar el origen y la capacidad general; no equivale directamente al ID del modelo que se debe introducir en la configuración.
ID del modelo / Nombre del modelo (Model Name)El nombre exacto que se debe incluir en la solicitud API, como la cadena de texto en la lista de modelos del backend del proveedor.Cópialo exactamente del backend; no cambies mayúsculas/minúsculas, guiones, puntos ni números de versión por tu cuenta; si falla la obtención de la lista de modelos, añade manualmente los ID de modelo facilitados por el backend.
Nombre para mostrar (Display Name)El nombre o alias mostrado en la herramienta o en el backend del servicio para facilitar su lectura.Es posible que el nombre para mostrar no se pueda invocar directamente; al configurar, prioriza campos como 'Model ID', 'Model' o 'Model Name'.

Proveedores de modelos internacionales habituales

ProveedorModelos o series habitualesUsos habituales
OpenAIGPT, serie o, GPT Image, Sora, etc.Conversaciones de texto, código, razonamiento, generación de imágenes, generación de vídeo
AnthropicSerie ClaudeLectura de textos extensos, código, redacción, análisis
GoogleSerie GeminiComprensión multimodal, contexto extenso, código, comprensión de imágenes
xAISerie GrokConversaciones de texto, razonamiento, escenarios con información en tiempo real
MetaSerie LlamaPesos de código abierto, despliegue propio, alojamiento en terceros
Mistral AIMistral, Codestral, etc.Conversaciones de texto, código, escenarios con modelos ligeros
CohereCommand, Embed, Rerank, etc.Base de conocimiento empresarial, generación aumentada por recuperación (RAG), vectores y reclasificación
Stability AIStable Diffusion, Stable Image, etc.Generación de imágenes, edición de imágenes
RunwayModelos de vídeo de la serie GenGeneración de vídeo, edición de vídeo

Proveedores de modelos nacionales (China) habituales

ProveedorModelos o series habitualesUsos habituales
DeepSeekDeepSeek Chat, DeepSeek Reasoner, etc.Conversaciones de texto, código, razonamiento
Alibaba Cloud / QwenQwen, Qwen-VL, Qwen-Coder, etc.Conversación de texto, comprensión de imágenes, código, modelos de código abierto
Moonshot AIKimi, serie MoonshotLectura de textos extensos, redacción y análisis de datos
Zhipu AIGLM, GLM-4, etc.Diálogo de texto, razonamiento, multimodal, agentes inteligentes
ByteDance / Volcano Engine ArkSerie DoubaoDiálogo de texto, multimodal, vectores, aplicaciones empresariales
Baidu AI Cloud / QianfanSerie ERNIE / WenxinConversación de texto, multimodal, búsqueda y escenarios empresariales
Tencent CloudSerie HunyuanChat de texto, multimodal, integración empresarial
MiniMaxMiniMax, abab, modelos relacionados con vozConversación de texto, texto extenso, voz y multimodal
iFlytekSerie SparkConversaciones de texto, productividad educativa y de oficina, escenarios de voz
01. AISerie YiModelos de código abierto, diálogo de texto, alojamiento en terceros

Tipos de modelos habituales

TipoPara qué sirveA tener en cuenta al configurar
Modelo de chat / textoResponder preguntas, redactar textos, traducir, resumir, escribir código.La mayoría de las herramientas conversacionales priorizan este tipo de modelo, siendo el más adecuado para las pruebas iniciales.
Modelos de razonamientoMás adecuados para análisis complejos, matemáticas, razonamiento de código y tareas de múltiples pasos.El precio y el tiempo de respuesta pueden ser mayores, por lo que no siempre es necesario priorizarlos para conversaciones sencillas.
Modelo de códigoOrientado a leer código, programar, corregir errores y explicar proyectos.En herramientas de programación, comprueba también si admiten llamadas a herramientas (tool calls), lectura/escritura de archivos y gestión de contexto.
Modelos de comprensión visualVer imágenes, reconocer capturas de pantalla, entender tablas o interfaces.La propia herramienta debe permitir subir imágenes, y los proveedores también deben admitir entrada visual.
Modelo de generación de imágenesGenerar o editar imágenes a partir de prompts.Normalmente no utiliza una interfaz de chat ordinaria como /chat/completions; la página de configuración debe basarse en la API de imágenes.
Modelo de generación de vídeoGenerar vídeos cortos, transformar imágenes en vídeo o editar vídeo.El flujo habitual consiste en enviar la tarea, esperar a que finalice y luego obtener el resultado, en lugar de recibir respuestas de chat instantáneas.
Modelo de vectores (Embedding)Convertir texto en vectores para recuperación en bases de conocimiento y coincidencia por similitud.No se puede usar para chatear; se utiliza normalmente junto con bases de conocimiento, RAG y sistemas de búsqueda.
Modelo de reclasificación (Rerank)Reordenar los resultados de búsqueda para que el contenido más relevante aparezca al principio.Se usa habitualmente para optimizar el rendimiento de bases de conocimiento y no es un modelo para generar respuestas directas.
Modelos de vozTexto a voz (TTS), voz a texto (STT), conversación por voz en tiempo real.Los campos difieren de los modelos de texto estándar; consulta la documentación correspondiente de TTS / STT / Realtime.

¿Cómo deben elegir los principiantes?

¿Qué vas a hacer?¿Qué deberías priorizar?Motivo
Chat general, traducción, resúmenesModelos de chat estables y de bajo costeHacer funcionar la clave (Key), la dirección de la API y el nombre del modelo es más importante al principio que buscar el modelo más potente.
Escribir código, modificar proyectosModelos con gran capacidad de programación o razonamientoLas tareas de código dependen más del contexto, las llamadas a herramientas y la precisión; los modelos más económicos suelen requerir correcciones repetidas.
Leer documentos extensos, conversaciones largasModelos de texto con ventana de contexto más ampliaUn contexto más extenso admite más información, pero el coste también puede ser mayor.
Analizar capturas de pantalla, revisar imágenesModelos multimodales compatibles con entrada visualSi solo se configura un modelo de texto estándar, es posible que la carga de imágenes no esté disponible o no se interprete.
Generar imágenesModelo de generación de imágenesLa generación de imágenes es distinta de un modelo de chat; normalmente debes considerar las herramientas y las API de imágenes por separado.
Generar vídeosModelos de generación de vídeo o plataformas de vídeoLos modelos de vídeo consumen muchos recursos y tienen tiempos de espera prolongados; revisa primero con atención la tarificación y el proceso de tareas.
Crear una base de conocimientoModelo de chat + Embedding + Rerank opcionalUna base de conocimiento no depende únicamente del modelo de chat; la recuperación y la reclasificación influyen decisivamente en la calidad de las respuestas.
Si estás configurando herramientas en un proveedor de IA, el orden más seguro es: primero elige un modelo de texto económico y ponlo en marcha; luego prueba el modelo de código, visión, imagen o vídeo que realmente necesites. No introduzcas el nombre de modelo de un proveedor en el protocolo de otro solo porque los nombres de las series sean parecidos.