Módulo 1: Fundamentos y Estrategia en
Inteligencia Artificial
Curso: Creación de Agentes con Inteligencia Arti fi cial desde Cero
Institución: Instituto de Estudios del Futuro (IEF) y Universidad de Boyacá
Año:
. Introducción: ¿Qué es la Inteligencia Arti fi cial?
La Inteligencia Arti fi cial (IA) se ha consolidado como una de las disciplinas más
transformadoras del siglo XXI, rede fi niendo industrias, optimizando procesos y
expandiendo las fronteras de lo tecnológicamente posible. En su núcleo, la IA es un campo
de la informática dedicado a la creación de sistemas capaces de realizar tareas que,
tradicionalmente, han requerido de la inteligencia humana. Estas tareas incluyen el
aprendizaje, el razonamiento, la resolución de problemas, la percepción y la comprensión
del lenguaje.
Una de las de fi niciones más citadas y aceptadas es la propuesta por John McCarthy,
considerado el padre de la disciplina, quien de fi nió la IA como "la ciencia e ingeniería de
crear máquinas inteligentes, especialmente programas de computación inteligentes"
. Esta de fi nición, aunque concisa, captura la esencia dual de la IA: es tanto una ciencia
(que busca comprender los principios de la inteligencia) como una ingeniería (que busca
construir sistemas que la exhiban). Complementariamente, Nils J. Nilsson, en su obra The
Quest for Arti fi fi
cial Intelligence, la de ne como "la actividad dedicada a hacer máquinas
inteligentes, donde la inteligencia es la cualidad que permite a una entidad funcionar
de manera apropiada y con previsión en su entorno" . Esta segunda de fi nición es
particularmente valiosa porque introduce la idea de que la inteligencia no es binaria, sino
un espectro: desde una calculadora que realiza operaciones aritméticas hasta un sistema
que puede razonar, plani ficar y tomar decisiones autónomas en contextos complejos.
El origen formal del término se remonta al verano de , durante un taller en el
Dartmouth College. En este evento, pioneros como John McCarthy, Marvin Minsky,
Nathaniel Rochester y Claude Shannon sentaron las bases conceptuales y establecieron la
hoja de ruta inicial para la disciplina, acuñando o fi cialmente el término "Inteligencia
fi
Arti cial" . Desde entonces, el campo ha experimentado ciclos de gran expectación y
periodos de desilusión (conocidos como "inviernos de la IA"), pero los avances
exponenciales en capacidad computacional y la disponibilidad masiva de datos han
catalizado la revolución que presenciamos hoy.
. Desmiti ficando la IA: IA Estrecha (ANI) vs. IA General
(AGI)
El discurso popular y la ciencia fi
cción a menudo presentan a la IA como una entidad
monolítica y consciente, similar o superior a la inteligencia humana. Sin embargo, es
crucial distinguir entre la IA que existe hoy y la que permanece en el ámbito teórico. La
principal distinción en las capacidades de la IA se traza entre la Inteligencia Arti fi cial
Estrecha (ANI) y la Inteligencia Arti ficial General (AGI).
. . Inteligencia Arti fi cial Estrecha (ANI)
La Inteligencia Arti ficial Estrecha (ANI), también conocida como IA Débil (Weak AI), se
refi ere a sistemas de IA que están diseñados y entrenados para realizar una tarea especí fica
o un conjunto muy limitado de tareas. Toda la IA que existe y se utiliza en la actualidad, sin
excepción, pertenece a esta categoría . Estos sistemas pueden superar el rendimiento
humano en su dominio particular, pero carecen de conciencia, intencionalidad o la
capacidad de transferir su habilidad a otros dominios para los que no fueron
explícitamente programados.
Ejemplos de ANI incluyen:
• Asistentes de voz como Siri de Apple o Alexa de Amazon, que responden a un
conjunto de comandos de voz para realizar tareas como reproducir música o informar
del clima.
• Sistemas de recomendación como los de Net flix o Spotify, que analizan el
comportamiento del usuario para sugerir contenido relevante.
• Modelos de lenguaje (LLMs) como GPT- o Claude , que, a pesar de su asombrosa
capacidad para generar texto coherente, están limitados a tareas de procesamiento
de lenguaje natural .
• Software de reconocimiento facial y vehículos con capacidades de conducción
asistida.
La fortaleza de la ANI reside en su e fi ciencia y precisión para tareas repetitivas o de análisis
de datos a gran escala, pero su inteligencia no es generalizable.
. . Inteligencia Arti fi cial General (AGI)
La Inteligencia Arti ficial General (AGI), o IA Fuerte (Strong AI), es un concepto puramente
teórico que describe una forma de IA con la capacidad de comprender, aprender y aplicar
su inteligencia para resolver cualquier problema intelectual que un ser humano pueda .
Una AGI no estaría limitada a un dominio especí fi co; poseería fl exibilidad cognitiva,
razonamiento abstracto y la habilidad de aprender de la experiencia para abordar tareas
completamente nuevas, de manera análoga a como lo hace un ser humano.
Actualmente, la AGI sigue siendo el objetivo a largo plazo de muchos investigadores, pero
no existe un consenso sobre cuándo, o incluso si, será alcanzada. Su desarrollo implicaría
superar enormes desafíos técnicos y conceptuales, como la replicación de la conciencia, la
comprensión del sentido común y la verdadera adaptabilidad contextual.
. . Superinteligencia Arti fi cial (ASI)
Más allá de la AGI, se encuentra el concepto de Superinteligencia Arti fi cial (ASI). Esta es
una forma hipotética de inteligencia que no solo igualaría, sino que superaría con creces la
inteligencia y capacidad cognitiva humana en prácticamente todos los dominios de interés,
incluyendo la creatividad cientí fi ca, la sabiduría general y las habilidades sociales. La ASI es
un tema recurrente en discusiones sobre el futuro a largo plazo y las implicaciones
existenciales de la IA .
Tipo de IA Capacidad Estado Actual Ejemplo
Realiza una tarea ChatGPT, Sistemas
especí fi
ca o un de recomendación,
ANI (Estrecha) Realidad Actual
conjunto limitado de Reconocimiento
ellas. facial.
Capaz de realizar El cerebro del robot
AGI (General) cualquier tarea Teórico / Hipotético de una película de
intelectual humana. ciencia fi
cción.
Supera la
Una entidad de IA
inteligencia humana
ASI (Super) Teórico / Hipotético omnisciente y
en todos los
omnipotente.
dominios.
. La Jerarquía de la Inteligencia Arti fi cial: De Conceptos
Amplios a Motores Especí fi cos
fi
La Inteligencia Arti cial no es un campo monolítico, sino un conjunto de disciplinas y
tecnologías interrelacionadas con distintos niveles de especialización. Para comprender su
funcionamiento, es útil visualizar una jerarquía, desde el concepto más amplio de IA hasta
los componentes especí fi cos que impulsan las aplicaciones más avanzadas de la
actualidad. La presentación del curso ilustra esta relación mediante un diagrama de
círculos concéntricos, que expandiremos a continuación.
• Inteligencia Arti fi cial (IA): Es el campo más externo y general. Como se de finió
anteriormente, abarca cualquier técnica que permita a las máquinas imitar la
inteligencia humana, utilizando lógica, reglas (if-then), árboles de decisión y, por
supuesto, el aprendizaje automático.
• Machine Learning (ML) o Aprendizaje Automático: Es un subcampo fundamental de
la IA. En lugar de ser programados explícitamente para una tarea, los sistemas de ML
utilizan algoritmos para analizar grandes volúmenes de datos, aprender de ellos e
identi fi
car patrones para realizar predicciones o tomar decisiones . El ML es el motor
que impulsa la mayoría de las aplicaciones de IA que utilizamos hoy, desde los fi ltros de
spam hasta los sistemas de recomendación.
• Deep Learning (DL) o Aprendizaje Profundo: Es una especialización dentro del
Machine Learning que se basa en Redes Neuronales Arti fi
ciales (RNA) con múltiples
capas (de ahí el término "profundo"). Estas redes neuronales están inspiradas en la
estructura y función del cerebro humano. El aprendizaje profundo ha sido el catalizador
de los avances más signi ficativos en IA en la última década, permitiendo resolver
problemas de alta complejidad en áreas como el reconocimiento de imágenes y el
procesamiento del lenguaje natural .
• Inteligencia Arti fi cial Generativa (IAG): Es una rama del Deep Learning que se enfoca
no solo en analizar o clasi fi car datos, sino en crear contenido nuevo y original. Los
modelos generativos aprenden los patrones y la estructura subyacente de los datos de
entrenamiento y los utilizan para generar texto, imágenes, música, código o video que
es similar, pero no idéntico, a los datos con los que fue entrenado .
• Large Language Models (LLM) o Grandes Modelos de Lenguaje: Son un tipo
especí fi co de IA Generativa, entrenados con cantidades masivas de datos de texto
(cientos de miles de millones de palabras). Su objetivo es comprender, resumir, generar
y predecir lenguaje natural con un alto grado de coherencia y contextualización. Son la
base de aplicaciones como ChatGPT.
• Generative Pre-Trained Transformers (GPT): Representa una familia de LLMs que se
caracteriza por dos elementos clave: utilizan la arquitectura Transformer (que se
detallará más adelante) y son "pre-entrenados", lo que signi fi ca que primero aprenden
patrones generales del lenguaje a partir de un vasto corpus de texto y luego pueden ser
ajustados para tareas especí fi cas ( fi ne-tuning).
. . Conceptos Transversales: Redes Neuronales y Transformers
Dos conceptos son cruciales y atraviesan varias de las capas mencionadas anteriormente.
Comprender su naturaleza es esencial para entender cómo funcionan los sistemas de IA
modernos, desde el reconocimiento de imágenes hasta la generación de texto.
Las Redes Neuronales Arti ficiales (RNA) constituyen el pilar fundamental del Deep
Learning y, por extensión, de toda la IA generativa actual. Su concepto se remonta a ,
cuando Warren McCulloch y Walter Pitts propusieron el primer modelo matemático de una
neurona arti ficial, demostrando que una red de neuronas simpli ficadas podía, en teoría,
computar cualquier función lógica. Más tarde, en , Frank Rosenblatt desarrolló el
Perceptón, la primera red neuronal capaz de aprender a clasi fi car patrones a partir de
datos. Sin embargo, las limitaciones computacionales de la época y las críticas teóricas
(como las de Minsky y Papert en ) frenaron su desarrollo durante décadas. No fue sino
hasta , con el avance de las GPUs y la disponibilidad de grandes conjuntos de datos,
que las redes neuronales profundas (con múltiples capas ocultas) demostraron su
verdadero potencial al ganar de manera contundente la competencia ImageNet, un hito
que marcó el inicio de la era moderna del Deep Learning . En esencia, una red neuronal
es un modelo matemático compuesto por capas de nodos interconectados que procesan
información de manera jerárquica: una capa de entrada recibe los datos, una o más capas
ocultas los transforman progresivamente, y una capa de salida produce el resultado. Cada
conexión tiene un peso (que determina la importancia de la señal) y cada nodo tiene un
sesgo (que ajusta su umbral de activación). Durante el entrenamiento, la red ajusta estos
millones de parámetros para minimizar el error en sus predicciones, un proceso que
constituye el "aprendizaje" de la máquina.
La Arquitectura Transformer, por su parte, es un tipo especí fico y revolucionario de red
neuronal que fue introducido en por un equipo de investigadores de Google en el
artículo "Attention Is All You Need" . Antes de los Transformers, los modelos de lenguaje
dependían de redes neuronales recurrentes (RNN) que procesaban el texto de manera
secuencial, palabra por palabra, lo que generaba cuellos de botella computacionales y
di fi
cultaba la captura de relaciones entre palabras distantes en un texto. El Transformer
resolvió este problema al introducir el mecanismo de auto-atención (self-attention), que
permite al modelo analizar todas las palabras de una secuencia simultáneamente y
calcular la relevancia de cada palabra respecto a todas las demás. Esta capacidad de
procesamiento en paralelo no solo mejoró drásticamente la comprensión del contexto, sino
que también permitió escalar el entrenamiento a conjuntos de datos y modelos de un
tamaño sin precedentes. La arquitectura Transformer es, sin exageración, la innovación
técnica más importante detrás de la revolución actual de la IA generativa: es la base de GPT,
BERT, Gemini, Claude y prácticamente todos los LLMs modernos.
. Intuición Digital: El Rol de las Redes Neuronales
Para que una máquina "aprenda", necesita un mecanismo que le permita ajustar su
comportamiento en función de la experiencia. En el aprendizaje profundo, este mecanismo
es la red neuronal artifi cial (RNA). Aunque su inspiración biológica es compleja, el concepto
funcional puede entenderse a través de dos elementos clave: pesos y sesgos.
Una red neuronal está compuesta por capas de "neuronas" (nodos computacionales). Cada
conexión entre neuronas de capas adyacentes tiene un peso asociado. Este peso es un
valor numérico que determina la importancia o la fuerza de la señal que pasa a través de
esa conexión. Durante el entrenamiento, la red ajusta estos pesos continuamente. Si una
conexión contribuye a una predicción correcta, su peso aumenta; si contribuye a un error,
su peso disminuye. De esta manera, la red "aprende" qué características de los datos de
entrada son más relevantes para la tarea en cuestión.
Además de los pesos, cada neurona tiene un sesgo. El sesgo es otro valor numérico que
actúa como un umbral de activación para la neurona. Permite que la función de activación
se desplace hacia la izquierda o hacia la derecha, lo que otorga mayor flexibilidad al
modelo para ajustarse a los datos. Sin el sesgo, la neurona solo se activaría cuando la suma
ponderada de las entradas supera cero, lo cual es una limitación muy restrictiva.
En conjunto, los pesos y los sesgos son los parámetros que la red neuronal "a fi na" durante
el proceso de entrenamiento. No es que la IA "entienda" el contenido en un sentido
humano; más bien, procesa patrones y probabilidades a través de la optimización de
millones o miles de millones de estos parámetros para minimizar el error en sus
predicciones. Este proceso de ajuste es lo que se denomina "aprendizaje" y es la base de la
"intuición digital" de los modelos modernos.
. Arquitectura Transformer: El Motor de la Revolución
Lingüística
Antes de , los modelos de lenguaje más avanzados se basaban en arquitecturas
recurrentes (RNN) o convolucionales (CNN), que procesaban el texto de manera secuencial
(palabra por palabra). Esto generaba un cuello de botella computacional y di fi cultaba la
captura de dependencias a largo plazo en el texto (por ejemplo, relacionar el inicio de un
párrafo con su fi nal).
En , un equipo de investigadores de Google publicó el artículo "Attention Is All You
Need", introduciendo la arquitectura Transformer . Este modelo representó un cambio
de paradigma al prescindir por completo de la recurrencia y basarse exclusivamente en un
mecanismo llamado atención (attention), y más especí fi camente, auto-atención (self-
attention).
El mecanismo de auto-atención permite al modelo sopesar la importancia de todas las
demás palabras en la secuencia de entrada al procesar una palabra especí fi ca. En lugar de
procesar la información en orden, el Transformer puede analizar la oración completa de
una sola vez y calcular "puntuaciones de atención" que determinan qué tan relevante es
cada palabra para las demás. Esto le permite capturar el contexto de manera mucho más
e fi caz y comprender relaciones sintácticas y semánticas complejas, sin importar la
distancia entre las palabras.
La arquitectura Transformer se compone fundamentalmente de dos partes:
. El Codi fi cador (Encoder): Procesa la secuencia de entrada completa y construye una
representación rica en contexto de cada palabra.
. El Decodi fi cador (Decoder): Utiliza la representación del codi fi cador para generar la
secuencia de salida, palabra por palabra, prestando atención a las partes más
relevantes de la entrada en cada paso.
Esta arquitectura no solo mejoró drásticamente el rendimiento en tareas de traducción
automática, sino que también permitió un procesamiento en paralelo mucho más e fi ciente,
escalando el entrenamiento a conjuntos de datos y modelos de un tamaño sin precedentes.
Es la innovación fundamental que ha hecho posibles los LLMs como GPT- .
. . Recursos Interactivos de Profundización
Para quienes deseen explorar estos conceptos de manera visual e interactiva, existen
excelentes herramientas en línea que permiten observar el funcionamiento interno de estas
arquitecturas:
Recurso Descripción Enlace
Visualización interactiva que
muestra cómo una red
[Link]/cnn-
CNN Explainer neuronal convolucional
explainer
procesa imágenes paso a
paso, capa por capa.
Herramienta interactiva que
descompone el
funcionamiento de la [Link]/transforme
Transformer Explainer
arquitectura Transformer, r-explainer
mostrando los mecanismos
de atención en tiempo real.
Visualización tridimensional
de un modelo GPT completo
(nano-GPT), que permite
LLM Visualization explorar cada componente [Link]/llm
del modelo, desde los
embeddings hasta la
generación de tokens.
Estos recursos son especialmente valiosos para desarrollar una comprensión intuitiva de
los procesos internos de la IA sin necesidad de profundizar en las fórmulas matemáticas
subyacentes.
. Tokenización: El Lenguaje de las Máquinas
Los modelos de lenguaje no procesan texto en su forma cruda (caracteres o palabras). Para
que una red neuronal pueda operar matemáticamente sobre el lenguaje, este debe ser
convertido en una representación numérica. Este proceso de conversión se conoce como
tokenización.
La tokenización consiste en dividir una secuencia de texto en unidades más pequeñas
llamadas tokens. Estos tokens pueden ser palabras completas, sub-palabras (como "-
ando" o "-ción"), o incluso caracteres individuales. Una vez que el texto se ha dividido en
tokens, a cada token único se le asigna un ID numérico a partir de un vocabulario
prede finido. Es esta secuencia de IDs la que fi nalmente se introduce en el modelo.
Existen varias estrategias de tokenización, pero las más comunes en los LLMs modernos
son los algoritmos de sub-palabras, como:
• Byte-Pair Encoding (BPE): Utilizado por los modelos GPT de OpenAI, BPE comienza
con un vocabulario de caracteres individuales y fusiona iterativamente los pares de
tokens más frecuentes para crear nuevos tokens de sub-palabras. Esto permite al
modelo manejar palabras raras o desconocidas descomponiéndolas en sub-unidades
conocidas, en lugar de marcarlas como "desconocidas" .
• WordPiece: Utilizado por BERT de Google, es similar a BPE pero utiliza un método
basado en la probabilidad para decidir qué fusiones realizar.
• SentencePiece: Es un enfoque que trata el texto como una secuencia de Unicode y
permite tokenizar sin depender de espacios, lo cual es muy útil para idiomas que no
separan las palabras de esa manera.
La elección del tokenizador es crucial, ya que de fine el vocabulario del modelo y afecta
directamente su rendimiento, e ficiencia y capacidad para manejar diferentes idiomas y
jergas. Herramientas como el Tokenizer de OpenAI permiten visualizar cómo un texto
especí fi co es descompuesto en tokens por sus modelos.
. Panorama Actual de los Modelos de Lenguaje ( )
El panorama de la IA está en constante y rápida evolución. A principios de , la industria
está marcada por varias tendencias clave que de fi nen la dirección de la investigación y el
desarrollo de productos:
• Consolidación de los Modelos Masivos de Lenguaje (LLMs): Los modelos insignia de
los principales laboratorios de IA, como la serie GPT de OpenAI, Gemini de Google y
Claude de Anthropic, continúan creciendo en tamaño y capacidad. Estos modelos, con
cientos de miles de millones o incluso billones de parámetros, demuestran capacidades
de razonamiento cada vez más so fi
sticadas, aunque su entrenamiento sigue siendo
extremadamente costoso en términos de recursos computacionales y energéticos.
• Auge de los Modelos de Lenguaje Pequeños (SLMs): En contraposición a la carrera
por el tamaño, ha surgido una fuerte tendencia hacia el desarrollo de Small Language
Models (SLMs). Estos son modelos más pequeños y optimizados (generalmente con
menos de mil millones de parámetros) diseñados para ser e ficientes y ejecutar tareas
específi cas con alta precisión. Su principal ventaja es que pueden operar en
dispositivos locales (como portátiles o smartphones) sin necesidad de una conexión
constante a la nube, lo que reduce la latencia, mejora la privacidad y disminuye los
costos operativos. Ejemplos notables incluyen la familia de modelos Phi de Microsoft y
Gemma de Google .
• Multimodalidad Nativa: La frontera de la IA ya no es solo el texto. Los modelos más
avanzados son inherentemente multimodales, lo que signi fi ca que pueden procesar,
comprender y generar información a través de diferentes tipos de datos
simultáneamente: texto, imágenes, audio y video. Un modelo multimodal puede, por
ejemplo, recibir una imagen y una pregunta en texto, y generar una respuesta coherente
que combine la comprensión de ambos. Gemini Pro de Google y GPT- . Pro de
OpenAI son ejemplos de esta tendencia, permitiendo interacciones mucho más ricas y
contextualizadas .
. Ecosistema y Actores Clave de la Industria
El desarrollo de la IA está liderado por un conjunto de laboratorios de investigación y
corporaciones tecnológicas que compiten e innovan a un ritmo vertiginoso. A continuación,
se presenta una tabla que resume los principales actores y sus enfoques estratégicos,
basada en la información de la presentación del curso para el año .
Actor Modelo Insignia Enfoque Principal Ventaja Clave
(Flagship)
Ecosistema maduro
Agentes Autónomos
OpenAI GPT- . Pro y versatilidad de su
y Razonamiento
API.
Google Gemini Pro Multimodalidad Ventana de contexto
Nativa masiva y profunda
integración con su
ecosistema de
productos.
Énfasis en la
seguridad, la
Seguridad y interpretabilidad y la
Anthropic Claude . Opus
Codi ficación precisión para flujos
de trabajo
empresariales.
Fomenta la
innovación abierta,
permitiendo a la
Open Weights (Pesos comunidad construir
Meta Llama (Scout)
Abiertos) sobre sus modelos y
garantizando
privacidad y control
local.
Liderazgo en coste-
rendimiento a través
fi
de arquitecturas
DeepSeek DeepSeek-R E ciencia (MoE)
efi cientes como la
Mezcla de Expertos
(MoE).
Modelos de alto
rendimiento con un
enfoque en la
Soberanía y
Mistral AI Mistral Large soberanía de los
Multilingüismo
datos y capacidades
multilingües
superiores.
Acceso a datos en
tiempo real de redes
Tiempo Real y sociales (X) para
xAI Grok .
Creatividad respuestas más
actuales y un estilo
más creativo y audaz.
. Ética y Seguridad en Inteligencia Arti fi
cial
A medida que los sistemas de IA se vuelven más potentes e integrados en nuestra vida
diaria, las consideraciones éticas y de seguridad adquieren una importancia crítica. El
desarrollo responsable de la IA exige una atención proactiva a los riesgos inherentes a esta
tecnología. Tres de los desafíos más signi ficativos son las alucinaciones, los sesgos
algorítmicos y la privacidad de los datos.
. . Alucinaciones
En el contexto de los LLMs, una alucinación se re fiere a la generación de información que
es factualmente incorrecta, no veri ficable o completamente inventada, pero que se
presenta con un tono de con fianza y veracidad . Los modelos no "mienten"
intencionadamente, sino que, al ser sistemas probabilísticos de generación de secuencias,
a veces pueden componer texto que es sintácticamente correcto y plausible, pero que no se
corresponde con la realidad. Esto puede ocurrir por diversas razones, como ambigüedades
en la pregunta del usuario, falta de conocimiento en los datos de entrenamiento sobre un
tema especí fi co, o errores en el proceso de razonamiento del modelo. La gestión de las
alucinaciones es un área de investigación activa y es fundamental para la fiabilidad de los
sistemas de IA, especialmente en dominios críticos como la medicina o las finanzas.
. . Sesgos Algorítmicos
Los modelos de IA aprenden de los datos con los que son entrenados. Si estos datos
refl ejan prejuicios, estereotipos o desigualdades existentes en la sociedad, el modelo
inevitablemente los aprenderá y los perpetuará, e incluso podría ampli fi carlos. Esto se
conoce como sesgo algorítmico . Un sistema de IA sesgado puede llevar a resultados
injustos o discriminatorios, como denegar un crédito de manera desproporcionada a un
grupo demográ fico, mostrar anuncios de empleo de manera sesgada por género, o generar
texto con estereotipos dañinos. Combatir el sesgo requiere un esfuerzo consciente en la
curación de conjuntos de datos más representativos y equitativos, así como el desarrollo de
técnicas de auditoría y mitigación de sesgos en los modelos.
. . Privacidad de los Datos
Los LLMs y otros sistemas de IA a menudo requieren grandes cantidades de datos para su
entrenamiento y funcionamiento. Esto plantea importantes preocupaciones sobre la
privacidad . ¿Cómo se recopilan, almacenan y utilizan los datos de los usuarios? ¿Existe
el riesgo de que la información sensible o personal introducida en un sistema de IA pueda
ser expuesta o utilizada de manera indebida? Para aplicaciones empresariales o
institucionales, es vital garantizar que los datos con fidenciales no se utilicen para re-
entrenar modelos públicos y que se implementen medidas de seguridad robustas, como el
cifrado y la anonimización, para proteger la información. La elección de modelos que
pueden ejecutarse localmente (como los SLMs) o en infraestructuras de nube privada es
una estrategia clave para mitigar estos riesgos.
. El Producto Mínimo Viable (MVP) y el Proyecto Final
El objetivo de este curso es eminentemente práctico: la creación de un agente de IA
funcional. Para abordar un proyecto de esta naturaleza de manera estructurada y e ficiente,
adoptaremos la metodología del Producto Mínimo Viable (MVP), un concepto
popularizado por Eric Ries en su libro The Lean Startup .
Un MVP no es un producto a medio hacer, sino "la versión más simple y funcional de un
producto que permite a un equipo recopilar la máxima cantidad de aprendizaje
validado sobre los clientes con el mínimo esfuerzo" . En el contexto de nuestro curso,
el MVP será la primera versión de nuestro agente de IA que puede ejecutar su tarea
principal de principio a fin, aunque sea con funcionalidades limitadas. El propósito del MVP
es validar rápidamente la idea central del proyecto: ¿resuelve el problema identi fi cado de
manera efectiva?
. . Hoja de Ruta del Proyecto Final
El desarrollo de nuestro agente de IA se articulará a lo largo de los cuatro módulos del
curso, siguiendo una hoja de ruta clara donde cada módulo contribuye con un componente
esencial para el proyecto fi
nal:
. Módulo : Estrategia. En esta fase inicial, nos centraremos en la identi ficación de un
problema real y la de fi nición del alcance del MVP. Esto implica defi nir claramente qué
datos recibirá el sistema (Entrada), qué lógica aplicará la IA (Proceso) y cuál será el
resultado tangible (Salida).
. Módulo : Activos. Una vez de finido el qué, nos enfocaremos en el cómo. Utilizaremos
modelos generativos para crear los activos digitales necesarios: la lógica de negocio en
forma de prompts maestros, y la identidad visual básica (como logos o esquemas de
color) para la interfaz de nuestra aplicación.
. Módulo : Construcción. Materializaremos nuestras ideas en software funcional.
Mediante técnicas de Vibe Coding y herramientas low-code, construiremos la interfaz
de usuario (frontend) de nuestra aplicación, guiando a la IA para que genere el código
por nosotros.
. Módulo : Acción. Finalmente, dotaremos a nuestra aplicación de autonomía.
Orquestaremos fl ujos de trabajo automatizados que conecten nuestra aplicación con
servicios externos (APIs), permitiendo que el agente ejecute tareas complejas de
manera proactiva y complete su objetivo.
. Agentes de Inteligencia Arti fi cial: Más Allá de la
Conversación
El concepto de agente de IA es central en este curso y representa un salto cualitativo con
respecto a las herramientas de IA más conocidas, como los chatbots. Mientras que un
chatbot está diseñado principalmente para conversar y responder preguntas dentro de un
marco prede fi nido, un agente de IA es un sistema más so fi sticado y proactivo.
Según la de fi nición clásica de Russell y Norvig en Arti fi cial Intelligence: A Modern Approach,
un agente es cualquier entidad que percibe su entorno a través de sensores y actúa sobre él
mediante actuadores para alcanzar objetivos . Llevando esta de finición al ámbito de la IA
moderna, un agente de IA es un sistema autónomo que no solo procesa información,
sino que también puede tomar decisiones, plani ficar y ejecutar acciones para lograr
metas especí ficas con una intervención humana mínima o nula .
Los agentes de IA modernos integran varias capacidades clave:
• Razonamiento Avanzado: Utilizan un LLM como "cerebro" para analizar situaciones
complejas, descomponer un objetivo en pasos más pequeños y elaborar un plan de
acción.
• Uso de Herramientas (Tools): Un agente puede interactuar con software externo a
través de APIs (Interfaces de Programación de Aplicaciones). Esto le permite "actuar" en
el mundo digital: puede leer y escribir en bases de datos, enviar correos electrónicos,
buscar información en la web, interactuar con otras aplicaciones, etc.
• Memoria Persistente: Pueden almacenar información de interacciones pasadas para
mantener el contexto a lo largo del tiempo y aprender de la experiencia.
• Plani fi cación y Ejecución: Son capaces de coordinar una secuencia de acciones,
monitorear su progreso y ajustar el plan si encuentran obstáculos, de manera similar a
como lo haría un humano al gestionar un proyecto.
. . Agente vs. Chatbot: La Diferencia Clave es la Acción
La distinción fundamental entre un agente y un chatbot radica en su propósito y capacidad
de acción. La siguiente tabla, adaptada de la presentación del curso, resume las diferencias
clave:
Aspecto Chatbot Agente de IA
Conversar y responder Resolver tareas y tomar
Propósito
preguntas. acciones.
Bajo. Generalmente sigue un Medio a Alto. Puede tomar
Nivel de Autonomía guion o un flujo decisiones y actuar de forma
conversacional. proactiva.
Ejecuta, decide y coordina.
Responde, no ejecuta.
Capacidad de Acción Realiza acciones en sistemas
Provee información.
externos.
Fundamental. Integra APIs,
Uso de Herramientas Limitado o nulo.
bases de datos, software, etc.
Alta. Puede aprender y
Básica. Se limita a su base de
Adaptabilidad ajustarse al contexto en
conocimiento.
tiempo real.
Complejidad Baja a media. Media a alta.
Automatización de procesos,
Soporte al cliente, FAQs,
Casos de Uso análisis de datos,
atención inicial.
optimización, monitoreo.
Un agente que gestiona el
Un bot de WhatsApp que
inventario, analiza las ventas
Ejemplo Típico responde preguntas
y ordena nuevo stock
frecuentes.
automáticamente.
En resumen, mientras que un chatbot es un interlocutor, un agente de IA es un trabajador
digital autónomo.
Referencias
[ ] McCarthy, J. ( fi
). What is Arti cial Intelligence? Stanford University. Recuperado de
[Link] — Nilsson, N. J. ( ). The Quest for
Arti fi
cial Intelligence: A History of Ideas and Achievements. Cambridge University Press.
[ ] McCarthy, J., Minsky, M. L., Rochester, N., & Shannon, C. E. ( ). A Proposal for the
Dartmouth Summer Research Project on Arti ficial Intelligence. AI Magazine, ( ), .
(Reimpresión del original de ).
[ ] IBM. (s.f.). Types of Arti fi cial Intelligence. IBM Think. Recuperado de
[ ] Codebots. ( , de octubre ). What are the types of AI? A guide to narrow, general,
and super intelligence. Recuperado de
[ ] Bostrom, N. ( ). Superintelligence: Paths, Dangers, Strategies. Oxford University
Press.
[ ] Samuel, A. L. ( ). Some Studies in Machine Learning Using the Game of Checkers. IBM
Journal of Research and Development, ( ), ‒ .
[ ] LeCun, Y., Bengio, Y., & Hinton, G. ( ). Deep learning. Nature, ( ), ‒ .
[ ] Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., ... & Bengio,
Y. ( ). Generative Adversarial Nets. Advances in Neural Information Processing Systems,
[ ] Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., ... &
Polosukhin, I. ( ). Attention is All you Need. Advances in Neural Information Processing
Systems, .
[ ] Sennrich, R., Haddow, B., & Birch, A. ( ). Neural Machine Translation of Rare Words
with Subword Units. Proceedings of the th Annual Meeting of the Association for
Computational Linguistics.
[ ] ODSC - Open Data Science. ( , de enero). The Top Small and Large Language
Models Kicking O ff . Medium. Recuperado de
[ ] The State of AI Report. ( , de octubre ). State of AI Report . Recuperado de
[ ] Ji, Z., Lee, N., Frieske, R., Yu, T., Su, D., Xu, Y., ... & Fung, P. ( ). A Survey on
Hallucination in Large Language Models. ACM Computing Surveys, ( ), - .
[ ] Hanna, M. G., et al. ( ). Ethical and Bias Considerations in Arti fi cial Intelligence.
ScienceDirect. Recuperado de
[ ] Ries, E. ( ). The Lean Startup: How Today's Entrepreneurs Use Continuous
Innovation to Create Radically Successful Businesses. Crown Business.
[ ] Russell, S. J., & Norvig, P. ( fi
). Arti cial Intelligence: A Modern Approach ( th ed.).
Pearson.
[ ] Salesforce. (s.f.). AI Agent vs. Chatbot — What's the Difference?. Agentforce. Recuperado
de