Modelos y proveedores: primero identifica el modelo que estás eligiendo
Primero diferencia entre proveedores, series de modelos e ID de modelos, comprende para qué sirve cada tipo de modelo y luego elige el proveedor de IA y los tutoriales de herramientas adecuados.
Primero, distingue estos tres nombres
| Nombre | Explicación sencilla | Cómo interpretarlo al configurar |
|---|---|---|
| Proveedor (Vendor) | Empresas o plataformas que desarrollan o proporcionan servicios de modelos, como OpenAI, Anthropic, Google, DeepSeek, Alibaba Cloud, ByteDance y Volcano Engine, etc. | Los fabricantes determinan las capacidades del modelo, los protocolos de interfaz, los precios y las restricciones; el proveedor simplemente conecta estas capacidades a su propio backend. |
| Serie de modelos | Un nombre de marca o familia de modelos, como GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Doubao. | El nombre de la serie solo te ayuda a identificar el origen y la capacidad general; no equivale directamente al ID del modelo que se debe introducir en la configuración. |
| ID del modelo / Nombre del modelo (Model Name) | El nombre exacto que se debe incluir en la solicitud API, como la cadena de texto en la lista de modelos del backend del proveedor. | Cópialo exactamente del backend; no cambies mayúsculas/minúsculas, guiones, puntos ni números de versión por tu cuenta; si falla la obtención de la lista de modelos, añade manualmente los ID de modelo facilitados por el backend. |
| Nombre para mostrar (Display Name) | El nombre o alias mostrado en la herramienta o en el backend del servicio para facilitar su lectura. | Es posible que el nombre para mostrar no se pueda invocar directamente; al configurar, prioriza campos como 'Model ID', 'Model' o 'Model Name'. |
Proveedores de modelos internacionales habituales
| Proveedor | Modelos o series habituales | Usos habituales |
|---|---|---|
| GPT, serie o, GPT Image, Sora, etc. | Conversaciones de texto, código, razonamiento, generación de imágenes, generación de vídeo | |
| Serie Claude | Lectura de textos extensos, código, redacción, análisis | |
| Serie Gemini | Comprensión multimodal, contexto extenso, código, comprensión de imágenes | |
| Serie Grok | Conversaciones de texto, razonamiento, escenarios con información en tiempo real | |
| Serie Llama | Pesos de código abierto, despliegue propio, alojamiento en terceros | |
| Mistral, Codestral, etc. | Conversaciones de texto, código, escenarios con modelos ligeros | |
| Command, Embed, Rerank, etc. | Base de conocimiento empresarial, generación aumentada por recuperación (RAG), vectores y reclasificación | |
| Stable Diffusion, Stable Image, etc. | Generación de imágenes, edición de imágenes | |
| Modelos de vídeo de la serie Gen | Generación de vídeo, edición de vídeo |
Proveedores de modelos nacionales (China) habituales
| Proveedor | Modelos o series habituales | Usos habituales |
|---|---|---|
| DeepSeek Chat, DeepSeek Reasoner, etc. | Conversaciones de texto, código, razonamiento | |
| Qwen, Qwen-VL, Qwen-Coder, etc. | Conversación de texto, comprensión de imágenes, código, modelos de código abierto | |
| Kimi, serie Moonshot | Lectura de textos extensos, redacción y análisis de datos | |
| GLM, GLM-4, etc. | Diálogo de texto, razonamiento, multimodal, agentes inteligentes | |
| Serie Doubao | Diálogo de texto, multimodal, vectores, aplicaciones empresariales | |
| Serie ERNIE / Wenxin | Conversación de texto, multimodal, búsqueda y escenarios empresariales | |
| Serie Hunyuan | Chat de texto, multimodal, integración empresarial | |
| MiniMax, abab, modelos relacionados con voz | Conversación de texto, texto extenso, voz y multimodal | |
| Serie Spark | Conversaciones de texto, productividad educativa y de oficina, escenarios de voz | |
| Serie Yi | Modelos de código abierto, diálogo de texto, alojamiento en terceros |
Tipos de modelos habituales
| Tipo | Para qué sirve | A tener en cuenta al configurar |
|---|---|---|
| Modelo de chat / texto | Responder preguntas, redactar textos, traducir, resumir, escribir código. | La mayoría de las herramientas conversacionales priorizan este tipo de modelo, siendo el más adecuado para las pruebas iniciales. |
| Modelos de razonamiento | Más adecuados para análisis complejos, matemáticas, razonamiento de código y tareas de múltiples pasos. | El precio y el tiempo de respuesta pueden ser mayores, por lo que no siempre es necesario priorizarlos para conversaciones sencillas. |
| Modelo de código | Orientado a leer código, programar, corregir errores y explicar proyectos. | En herramientas de programación, comprueba también si admiten llamadas a herramientas (tool calls), lectura/escritura de archivos y gestión de contexto. |
| Modelos de comprensión visual | Ver imágenes, reconocer capturas de pantalla, entender tablas o interfaces. | La propia herramienta debe permitir subir imágenes, y los proveedores también deben admitir entrada visual. |
| Modelo de generación de imágenes | Generar o editar imágenes a partir de prompts. | Normalmente no utiliza una interfaz de chat ordinaria como /chat/completions; la página de configuración debe basarse en la API de imágenes. |
| Modelo de generación de vídeo | Generar vídeos cortos, transformar imágenes en vídeo o editar vídeo. | El flujo habitual consiste en enviar la tarea, esperar a que finalice y luego obtener el resultado, en lugar de recibir respuestas de chat instantáneas. |
| Modelo de vectores (Embedding) | Convertir texto en vectores para recuperación en bases de conocimiento y coincidencia por similitud. | No se puede usar para chatear; se utiliza normalmente junto con bases de conocimiento, RAG y sistemas de búsqueda. |
| Modelo de reclasificación (Rerank) | Reordenar los resultados de búsqueda para que el contenido más relevante aparezca al principio. | Se usa habitualmente para optimizar el rendimiento de bases de conocimiento y no es un modelo para generar respuestas directas. |
| Modelos de voz | Texto a voz (TTS), voz a texto (STT), conversación por voz en tiempo real. | Los campos difieren de los modelos de texto estándar; consulta la documentación correspondiente de TTS / STT / Realtime. |
¿Cómo deben elegir los principiantes?
| ¿Qué vas a hacer? | ¿Qué deberías priorizar? | Motivo |
|---|---|---|
| Chat general, traducción, resúmenes | Modelos de chat estables y de bajo coste | Hacer funcionar la clave (Key), la dirección de la API y el nombre del modelo es más importante al principio que buscar el modelo más potente. |
| Escribir código, modificar proyectos | Modelos con gran capacidad de programación o razonamiento | Las tareas de código dependen más del contexto, las llamadas a herramientas y la precisión; los modelos más económicos suelen requerir correcciones repetidas. |
| Leer documentos extensos, conversaciones largas | Modelos de texto con ventana de contexto más amplia | Un contexto más extenso admite más información, pero el coste también puede ser mayor. |
| Analizar capturas de pantalla, revisar imágenes | Modelos multimodales compatibles con entrada visual | Si solo se configura un modelo de texto estándar, es posible que la carga de imágenes no esté disponible o no se interprete. |
| Generar imágenes | Modelo de generación de imágenes | La generación de imágenes es distinta de un modelo de chat; normalmente debes considerar las herramientas y las API de imágenes por separado. |
| Generar vídeos | Modelos de generación de vídeo o plataformas de vídeo | Los modelos de vídeo consumen muchos recursos y tienen tiempos de espera prolongados; revisa primero con atención la tarificación y el proceso de tareas. |
| Crear una base de conocimiento | Modelo de chat + Embedding + Rerank opcional | Una base de conocimiento no depende únicamente del modelo de chat; la recuperación y la reclasificación influyen decisivamente en la calidad de las respuestas. |
Si estás configurando herramientas en un proveedor de IA, el orden más seguro es: primero elige un modelo de texto económico y ponlo en marcha; luego prueba el modelo de código, visión, imagen o vídeo que realmente necesites. No introduzcas el nombre de modelo de un proveedor en el protocolo de otro solo porque los nombres de las series sean parecidos.
