Agente
Un modelo de lenguaje que no solo responde, sino que actúa: llama funciones, evalúa resultados y decide el siguiente paso. La diferencia entre un chatbot y un sistema autónomo.
Lexicon
Términos de IA definidos en voz propia.
No Wikipedia. Criterio editorial y contexto de producción.
22 términos
Un modelo de lenguaje que no solo responde, sino que actúa: llama funciones, evalúa resultados y decide el siguiente paso. La diferencia entre un chatbot y un sistema autónomo.
Retrieval-Augmented Generation. El modelo no inventa — primero recupera contexto relevante de una base de conocimiento, luego genera. Reduce alucinaciones. Base de nuestro motor de búsqueda semántica.
Cuando un modelo genera información plausible pero falsa con total confianza. No es un error de programación — es una característica estadística del proceso de generación. Se mitiga con RAG, grounding y validación humana.
El máximo de tokens que un modelo puede "ver" en una sola inferencia. GPT-4 Turbo: 128K. Claude: 200K. Más contexto permite razonamiento más profundo, pero aumenta latencia y costo.
La arquitectura detrás de Stable Diffusion, FLUX y DALL-E. Aprende a revertir ruido gaussiano progresivamente hasta recuperar una imagen coherente. La síntesis generativa más poderosa para medios visuales.
Correr modelos de lenguaje directamente en hardware propio, sin depender de APIs externas. Ollama lo hace posible en CPU o GPU local. Cero latencia de red, cero datos enviados a terceros. Nuestra filosofía operacional.
La representación numérica de texto (o imagen) en un espacio vectorial de alta dimensión. Dos frases semánticamente similares tienen embeddings cercanos, aunque no compartan palabras. La base de la búsqueda semántica.
El espacio matemático comprimido donde un modelo codifica sus representaciones internas del mundo. Navegar el espacio latente de un modelo de difusión es explorar todas las imágenes que el modelo "puede imaginar".
Proporcionar ejemplos concretos dentro del prompt para que el modelo aprenda el patrón deseado sin re-entrenamiento. Tres ejemplos bien elegidos superan frecuentemente a un prompt explicativo extenso.
Ajustar los pesos de un modelo pre-entrenado con datos específicos de un dominio. No es reentrenar desde cero — es especializar. LoRA y QLoRA hacen esto viable en hardware modesto.
Estructura de datos que representa entidades y sus relaciones. Combinar grafos con LLMs reduce alucinaciones en dominios estructurados — el modelo razona sobre hechos explícitos, no solo sobre patrones estadísticos.
Framework para construir agentes como grafos de estado. Permite ciclos, bifurcaciones y memoria persistente entre pasos. Nuestra base para el motor Adaptive Security.
Large Language Model. Un modelo entrenado sobre grandes corpus de texto para predecir tokens. La distinción relevante no es el tamaño — es la capacidad de razonamiento emergente que aparece en modelos suficientemente grandes.
Un modelo que procesa y genera múltiples tipos de datos: texto, imagen, audio, video. GPT-4o y Gemini son multimodales. La frontera donde el lenguaje se vuelve percepción.
La capa que coordina múltiples agentes, servicios y llamadas a APIs en flujos complejos. n8n es nuestro orquestador: conecta LLMs, bases de datos, webhooks y notificaciones sin fricciones.
La instrucción que define el comportamiento de un modelo. No es simplemente "lo que le dices al modelo" — es diseño de interfaz. Un prompt bien construido es la diferencia entre una herramienta útil y una ilusión de capacidad.
Base de datos vectorial que almacena embeddings y permite búsqueda semántica de alta velocidad. Nuestro sistema de memoria: conecta lo que los modelos necesitan recordar con lo que realmente existe en los datos.
Capacidades que no fueron explícitamente entrenadas pero emergen a cierta escala de parámetros. Chain-of-thought, aritmética compleja, analogía — aparecen sin ser programadas. Siguen siendo parcialmente no explicadas.
Parámetro que controla la aleatoriedad de las predicciones. Temperatura 0 = determinista, reproducible. Temperatura 1+ = creativo, impredecible. Para código: baja. Para poesía: alta. Para sistemas de producción: siempre auditar.
Base de datos especializada en almacenar y recuperar vectores de alta dimensión por similitud (no por coincidencia exacta). Qdrant, Chroma, Pinecone. La capa de memoria semántica de cualquier sistema RAG.
Modelo de transcripción de audio de OpenAI, open source. Soporta 99 idiomas. Nuestro motor de audio corre Whisper localmente para indexar contenido hablado sin enviar audio a APIs externas.
Pedir a un modelo que realice una tarea sin darle ejemplos previos. Funciona porque los modelos grandes generalizan desde su entrenamiento. La brecha entre zero-shot y few-shot mide qué tan bien el modelo entiende la intención.
¿Falta un término?
Proponer →