0% encontró este documento útil (0 votos)
12 vistas115 páginas

Plataforma Hiperconvergente para IA

El documento presenta el diseño de una plataforma tecnológica de alto rendimiento basada en hiperconvergencia y procesamiento gráfico, destinada a la implementación de inteligencia generativa en sistemas predictivos de información. Se busca optimizar la precisión de los modelos de IA mediante el uso de grandes modelos generativos de lenguaje y datos propietarios, con el objetivo de mejorar la productividad y calidad de vida en Perú. Además, se detallan especificaciones técnicas que incluyen tasas de transferencia de datos y capacidades de procesamiento avanzadas.

Cargado por

Jacortin WTF
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
12 vistas115 páginas

Plataforma Hiperconvergente para IA

El documento presenta el diseño de una plataforma tecnológica de alto rendimiento basada en hiperconvergencia y procesamiento gráfico, destinada a la implementación de inteligencia generativa en sistemas predictivos de información. Se busca optimizar la precisión de los modelos de IA mediante el uso de grandes modelos generativos de lenguaje y datos propietarios, con el objetivo de mejorar la productividad y calidad de vida en Perú. Además, se detallan especificaciones técnicas que incluyen tasas de transferencia de datos y capacidades de procesamiento avanzadas.

Cargado por

Jacortin WTF
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Diseño de una plataforma tecnológica de alto

rendimiento con procesamiento por gráfica y


basada en tecnología de hiperconvergencia para
la aplicación de la inteligencia generativa en el
desarrollo de sistemas predictivos de información con el
entrenamiento de modelos de Inteligencia Artificial (IA)

Item Type info:eu-repo/semantics/bachelorThesis

Authors Salgado Paraguay, Julio Cesar

Publisher Universidad Peruana de Ciencias Aplicadas (UPC)

Rights info:eu-repo/semantics/openAccess

Download date 28/05/2025 03:05:45

Item License [Link]

Link to Item [Link]


UNIVERSIDAD PERUANA DE CIENCIAS APLICADAS

FACULTAD DE INGENIERÍA

PROGRAMA ACADÉMICO DE INGENIERÍA DE REDES Y

COMUNICACIONES

Diseño de una plataforma tecnológica de alto rendimiento con procesamiento

por gráfica y basada en tecnología de hiperconvergencia para la aplicación de

la inteligencia generativa en el desarrollo de sistemas predictivos de

información con el entrenamiento de modelos de Inteligencia Artificial (IA)

TRABAJO DE SUFICIENCIA PROFESIONAL

Para optar el título profesional de Ingeniero de Redes y Comunicaciones

AUTOR

Salgado Paraguay, Julio César (ORCID ID: 0009-0005-9943-9463)

ASESOR

Gonzales Figueroa, Renatto Gustavo (ORCID ID: 0000-0003-3658-3415)

Lima, 03 de junio de 2024


DEDICATORIA

Al Todopoderoso, quien siempre tiene los mejores tiempos para uno, gracias por
permitirme vivir los gloriosos avances de la IA.

I
AGRADECIMIENTOS

A todos aquellos investigadores, especialistas, desarrolladores y apasionados de la


tecnología, que pululan en la red, cuyas divulgaciones permanentes mantienen vivo mi
inquieto espíritu curioso.

II
RESUMEN

Con los avances logrados actualmente en el campo del Aprendizaje Profundo (Deep
Learning), se busca formular el diseño conceptual de una plataforma tecnológica basada en
tecnología hiperconvergente, que incorpore infraestructura de procesamiento por gráfica o
GPU (Graphics Processing Unit o Unidad de Procesamiento Gráfico), capaz de soportar el
desarrollo de soluciones del tipo RAG (Retrieval Augmented Generation o Generación
Mejorada por Recuperación) con la aplicación de los grandes modelos generativos de
lenguaje de código abierto, que han sido entrenados previamente con miles de millones de
datos, para la codificación de sistemas de información predictivos (SPI) y que cuente,
además, con el entrenamiento de datos propietarios generados al interior de la misma
institución, provenientes de distintas fuentes de información, para optimizar la precisión de
la información, que pueda acompañar los procesos de innovación y emprendimiento a fin de
incrementar la productividad de las cadenas productivas del rubro nacional generando con
ella beneficios económicos que repercutan en la mejora de la calidad de vida de los peruanos.

Así, con el desarrollo del proyecto se incrementará el ancho de banda de la VRAM con tasas
de transferencia de la información iguales a 864GB/s y 2TB/s; también, se potenciará la
cantidad de operaciones de coma flotante por segundo con índices de procesamiento de 378
TFLOPS en precisión TF32, 756 TFLOPS en formato BFLOAT16, 756 TFLOPS en
precisión FP16 y 1513 TFLOPS en formato FP8; además, se elevará la velocidad de reloj de
los núcleos de cómputo a 1755MHz aprovechando las capacidades del procesamiento en
paralelo incorporando la tecnología NVIDIA NVLink; asimismo, se aumentará el número
de tokens de la ventana de contexto para conseguir máximos de 7,993 y 9,193 tokens/s en la
inferencia de salida y, finalmente, se elevará la cantidad de parámetros o variables internas
con la posibilidad de procesar modelos de lenguaje de 7B, 13B, 70B, 130B, entre otros.

Palabras clave: [Inteligencia artificial; modelos de lenguaje; aprendizaje profundo;


cuantización; embedding; entrenamiento; inferencia; dataset; fine-tuning; RAG; inteligencia
generativa; LLM; paralelización; token; ventana de contexto; Sparsity; GPU; benchmark]

III
Design of a high-performance technological platform with graph processing and based on
hyperconvergence technology for the application of generative intelligence in the
development of predictive information systems with the training of Artificial Intelligence
(AI) models.

ABSTRACT

With the advances currently made in the field of Deep Learning, we seek to formulate the
conceptual design of a technological platform based on hyperconverged technology, which
incorporates graphics processing infrastructure or GPU (Graphics Processing Unit), capable
of supporting the development of RAG (Retrieval Augmented Generation) type solutions
with the application of large open source language generative models, which have been
previously trained with billions of data, for coding of predictive information systems (PIS)
and that also has the training of proprietary data generated within the same institution,
coming from different sources of information, to optimize the precision of the information,
which can accompany the innovation processes and entrepreneurship in order to increase the
productivity of the productive chains of the national sector, thereby generating economic
benefits that have an impact on the improvement of the quality of life of Peruvians.

Thus, with the development of the project, the VRAM bandwidth will increase with
information transfer rates equal to 864GB/s and 2TB/s; also, the number of floating point
operations per second will be enhanced with processing rates of 378 TFLOPS in TF32
precision, 756 TFLOPS in BFLOAT16 format, 756 TFLOPS in FP16 precision and 1513
TFLOPS in FP8 format; in addition, the clock speed of the computing cores will be raised
to 1755MHz, taking advantage of the capabilities of parallel processing by incorporating
NVIDIA NVLink technology; likewise, the number of tokens in the context window will be
increased to achieve maximums of 7,993 and 9,193 tokens/s in the output inference and,
finally, the number of parameters or internal variables will be increased with the possibility
of processing language models 7B, 13B, 70B, 130B, among others.

Keywords: [Artificial intelligence; language models; deep learning; quantization;


embedding; training; inference; dataset; fine-tuning; RAG; generative intelligence; LLM;
parallelization; token; context window; Sparsity; GPU; benchmark]

IV
Trabajo_10013915
INFORME DE ORIGINALIDAD

12 %
INDICE DE SIMILITUD
12%
FUENTES DE INTERNET
2%
PUBLICACIONES
3%
TRABAJOS DEL
ESTUDIANTE

FUENTES PRIMARIAS

1
[Link]
Fuente de Internet 3%
2
[Link]
Fuente de Internet 1%
3
[Link]
Fuente de Internet 1%
4
[Link]
Fuente de Internet 1%
5
[Link]
Fuente de Internet 1%
6
[Link]
Fuente de Internet 1%
7
[Link]
Fuente de Internet <1 %
8
Submitted to Universidad Peruana de
Ciencias Aplicadas
<1 %
Trabajo del estudiante

9
[Link]
Fuente de Internet
TABLA DE CONTENIDOS

1 CAPÍTULO 1: DEFINICIÓN DEL PROYECTO ................................................. 10

1.1 INTRODUCCIÓN ..................................................................................................... 10


1.2 CASO DE ESTUDIO ................................................................................................ 11
1.3 ANÁLISIS DEL PROBLEMA .................................................................................... 17
1.3.1 Formulación del Problema ......................................................................... 18
1.3.2 Análisis.......................................................................................................... 18
1.4 OBJETIVOS ............................................................................................................ 20
1.4.1 Objetivo General ......................................................................................... 20
1.4.2 Objetivos Específicos ................................................................................... 21
1.5 PLANIFICACIÓN DEL PROYECTO.......................................................................... 21

2 CAPÍTULO 2: MARCO TEÓRICO ....................................................................... 26

2.1 MARCO CONCEPTUAL .......................................................................................... 26


2.2 ESTÁNDARES, FRAMEWORKS Y BUENAS PRÁCTICAS........................................... 32
2.3 BASES LEGALES Y MARCO NORMATIVO ............................................................. 42

3 CAPÍTULO 3: DESARROLLO DEL PROYECTO .............................................. 45

3.1 DISEÑO DE LA SOLUCIÓN ..................................................................................... 45


3.2 DESARROLLO DE LA SOLUCIÓN ........................................................................... 74
3.3 VALIDACIÓN DEL PROYECTO............................................................................... 88
3.4 INTERPRETACIÓN DE LOS RESULTADOS .............................................................. 93

4 CAPÍTULO 4: CONCLUSIONES Y RECOMENDACIONES ............................ 94

4.1 CONCLUSIONES..................................................................................................... 94
4.2 RECOMENDACIONES ............................................................................................. 95

5 CAPÍTULO 5: REFERENCIAS .............................................................................. 97

V
ÍNDICE DE TABLAS

Tabla 1. Relación de sedes de la Red CITE

Tabla 2. Características técnicas de los aceleradores GB200

Tabla 3. Capacidad de las gráficas HGX A100, L40S y HGX H100

Tabla 4. Frameworks de NVIDIA AI Enterprise

Tabla 5. Infraestructura de centro de datos de Callao

Tabla 6. Listado de modelos grandes de lenguaje

Tabla 7. Tasas de transferencia de InfiniBand

Tabla 8. Procesadores gráficos para computación de alta gama

Tabla 9. Características de los GPU A100 (80GB), L40, L40S, H100 (80GB) y H100 NVL

Tabla 10. Rendimiento convergente de NVIDIA H100 con PyTorch y TensorFlow

Tabla 11. Rendimiento de NVIDIA H100 con Nemo

Tabla 12. Rendimiento de NVIDIA H100 con Nemo, MXNet, PyTorch y Merlin (MLPerf)

Tabla 13. Inferencia de NVIDIA H100 con LLaMA v2 y Falcon

Tabla 14. Inferencia de NVIDIA H100 NVL con GPT-J y LLaMA v2

Tabla 15. Inferencia de NVIDIA L40S con GPT-J y LLaMA v2

Tabla 16. Resumen de los componentes de hardware de la solución de IA

Tabla 17. Características técnicas del gabinete Dell AR3100x717 Rack

Tabla 18. Características técnicas del servidor Dell PowerEdge R660

Tabla 19. Características técnicas del servidor Dell PowerEdge R760xa

Tabla 20. Características técnicas del servidor Dell PowerEdge XE8640

Tabla 21. Características técnicas del servidor Dell PowerEdge XE9680

VI
Tabla 22. Características técnicas del almacenamiento Dell PowerScale F600

Tabla 23. Características técnicas del switch Dell PowerSwitch S5232-ON

Tabla 24. Características técnicas del switch Dell Power Switch N3200-ON

Tabla 25. Resumen de los componentes de software de la solución de IA

Tabla 26. Resumen de los componentes de la solución de HCI

Tabla 27. Anchos de banda de las GPU L40S (48GB) y H100 (80GB)

Tabla 28. Índices de procesamiento de las GPU L40S (48GB) y H100 (80GB)

Tabla 29. Velocidad de reloj de la GPU H100 (80GB)

Tabla 30. Rendimiento en tokens por segundo de las GPU L40S (48GB) y H100 (80GB)

Tabla 31. Cantidad de parámetros de los modelos de lenguaje LLM

Tabla 32. Características técnicas del servidor Dell EMC VxRail P670F

Tabla 33. Características técnicas del enclosure Dell EMC UnityXT 380H

Tabla 34. Características técnicas del enclosure Dell EMC Unity DAE 15x3.5"

Tabla 35. Características técnicas del switch ToR Dell PowerSwitch S4128F-ON

Tabla 36. Características técnicas del switch Dell EMC Switch S4112F-ON

Tabla 37. Características técnicas del servidor Dell PowerEdge R450

Tabla 38. Características técnicas de la librería Dell EMC ML3

Tabla 39. Características técnicas del backup Dell PowerProtect DD6400

Tabla 40. Características técnicas del enclosure Dell ES40 SHELF 12G 15x8TB SAS

VII
ÍNDICE DE FIGURAS

Figura 1. Ubicación territorial de la Red CITE

Figura 2. Vista frontal del centro de datos ubicado en Callao

Figura 3. Diagrama del árbol del problema

Figura 4. Fases del diseño de la solución final

Figura 5. Arquitectura de procesamiento por GPU

Figura 6. Plataforma de NVIDIA AI Enterprise para el desarrollo de aplicaciones de IA

Figura 7. Generaciones de la tecnología NVLink

Figura 8. Procesamiento con bases de datos vectoriales

Figura 9. Plataforma VMware Private AI Foundation

Figura 10. Framework NVIDIA NeMO

Figura 11. Herramientas de desarrollo de NVIDIA AI Enterprise

Figura 12. Capacidad de cómputo general de la plataforma convencional

Figura 13. Resumen de los recursos de CPU y RAM de la plataforma

Figura 14. Capacidad de almacenamiento asignada y libre

Figura 15. Ciclo de producción de aplicaciones LLM

Figura 16. Tabla de clasificación de LLMs open source

Figura 17. Rendimiento de LLaMA 2

Figura 18. Rendimiento de LLaMA 3

Figura 19. Rendimiento de Falcon

Figura 20. Rendimiento de Mistral

Figura 21. Imagen referencial de la GPU NVIDIA L40S (48GB)

VIII
Figura 22. Imagen referencial de la GPU NVIDIA H100 (80GB)

Figura 23. Visión arquitectónica de la plataforma de IA

Figura 24. Topología tecnológica de la solución de IA

Figura 25. Organización de los gabinetes con la solución de IA

Figura 26. Topología tecnológica de la solución de HCI

Figura 27. Organización de los gabinetes con la solución de HCI

IX
1 CAPÍTULO 1: DEFINICIÓN DEL PROYECTO
1.1 Introducción
Desde la llegada de la versión 3.5 de ChatGPT, un 30 de noviembre de 2022, se ha
producido una real revolución tecnológica, pocas veces vista en la historia, en el
campo de la computación e informática y, más específicamente, en las ramas
dedicadas al tratamiento de los datos y la generación automática de la información.

Con la aplicación de los Transformadores (Transfomers), un tipo particular de


arquitectura de red neuronal desarrollado por los ingenieros de Google en 2017, se
han venido desarrollando potentes aplicaciones de generación de información
conocidos como LLM (Large Language Model o Modelo de Lenguaje Extenso),
que se pueden implementar en las entidades para dar como resultado información
bastante estructurada y consolidada como resultado del tratamiento de una gran
variedad de fuentes de datos (textos, imágenes, audios, videos, entre otros).

La información ha sido fundamental, a lo largo de la historia, para disminuir los


riesgos durante la toma de decisiones, que influyen en el desenvolvimiento de la
humanidad, ya sea en el sector de las finanzas, educación, negocios, salud,
innovación, ciencia, tecnología, economía, turismo, política y muchos más, por lo
que se busca que cumpla los tres requisitos básicos, es decir, que sea oportuna en
el tiempo, confiable en su creación y asequible con un menor costo.

Debido a la demanda creciente por contar con sistemas o aplicaciones que generen
información con las características mencionadas, en las décadas anteriores se han
dado grandes avances tecnológicos en la industria de la computación, redes de
datos, comunicaciones inalámbricas, smartphones y centros de datos.

Aunque no se pretende llegar a los niveles monstruosos de rendimiento de los


modelos más populares de la internet (como GPT, Bard, Bing Chat, Copilot,
LLaMA, entre otros), se requiere considerar seriamente el uso de las librerías más
potentes de inteligencia generativa, tales como TensorFlow y PyTorch, para la
producción de aplicaciones que sean capaces de identificar tendencias, patrones o
comportamientos al interior del dinámico mercado local y mundial.

Por lo anterior, se requiere contar con una plataforma de centro de datos basada en
tecnología hiperconvergente que esté implementada con infraestructura de potentes

10
tarjetas de video, que son los componentes neurálgicos, para el tratamiento de
ingentes cantidades de datos que son el insumo principal con el que se entrenan los
actuales modelos de IA, los populares LLM, por cuya razón se necesitan gran
capacidad de ancho de banda y espacio de memoria para procesar complejos
algoritmos matemáticos que permitan alcanzar el fin indicado.

1.2 Caso de Estudio


El Instituto Tecnológico de la Producción (ITP), antiguamente conocido como
Instituto Tecnológico Pesquero, es una institución pública sin fines de lucro adscrita
al Ministerio de la Producción (PRODUCE), que fue creada mediante la Vigésima
Quinta Disposición Complementaria Final de la Ley Nº 29951, Ley de Presupuesto
del Sector Público para el ejercicio 2013.

El ITP tiene como objetivo principal aportar con el aumento de la productividad, la


eficiencia y la rentabilidad de las empresas a nivel nacional, a través de las
actividades de innovación, investigación, desarrollo, producción y transferencia del
conocimiento considerando las políticas de sostenibilidad ambiental.

El ITP tiene a su cargo la gestión del conjunto de las unidades tecnológicas


descentralizadas conocidas como Red CITE (Centros de Innovación Productiva y
Transferencia Tecnológica) por medio de la cual tiene pleno radio de intervención
a nivel nacional en las cadenas productivas vinculadas a los sectores de la
agroindustria, forestal, calzado, pesca, acuicultura, madera, cuero, textil,
confecciones, minería, energía, materiales, logística y marketing.

La Red CITE representa el ente ejecutor y operativo del ITP por medio del cual
promueve el emprendimiento empresarial, la investigación aplicada, la
transferencia tecnológica y la difusión del conocimiento científico con la
implantación de tecnologías disruptivas en los distintos rubros de la producción
nacional y entre los distintos productores, empresas, asociaciones y cooperativas.

Actualmente, la Red CITE cuenta con cerca de 30 centros de innovación


tecnológica distribuidos estratégicamente en todo el territorio nacional para atender
los requerimientos de las empresas y sus asociados de acuerdo al sector productivo
predominante en cada zona intervenida.

11
En la siguiente tabla, se listan las actuales sedes que conforman la Red CITE que
están administradas por el ITP, donde se puede apreciar la clasificación de las
mismas de acuerdo a las regiones y cadenas productivas:

Tabla 1

Relación de sedes de la Red CITE

Ítem Sede Región Cadena Productiva


1 CITEacuícola pesquero Ahuashiyacu San Martín Acuícola
2 CITEacuícola Puno Puno Acuícola
3 CITEagroindustrial Chavimochic La Libertad Agroindustrial
4 CITEagroindustrial Huallaga Huánuco Agroindustrial
5 CITEagroindustrial Ica Ica Agroindustrial
6 CITEagroindustrial Majes Arequipa Agroindustrial
7 CITEagroindustrial Moquegua Moquegua Agroindustrial
8 CITEagroindustrial Oxapampa Pasco Agroindustrial
9 CITEagroindustrial VRAEM Cusco Agroindustrial
10 CITEcuero y calzado Arequipa Arequipa Cuero y calzado
11 CITEcuero y calzado Lima Lima Cuero y calzado
12 CITEcuero y calzado Trujillo La Libertad Cuero y calzado
13 CITEforestal Maynas Loreto Forestal
14 CITEforestal Pucallpa Ucayali Forestal
15 CITEmadera Lima Lima Madera
16 CITEpesquero amazónico Pucallpa Ucayali Pesquero
17 CITEpesquero Callao Callao Pesquero
18 CITEpesquero Ilo Moquegua Pesquero
19 CITEpesquero Piura Piura Pesquero
20 CITEproductivo Madre de Dios Madre de Dios Productivo
21 CITEproductivo Maynas Loreto Productivo
22 CITEtextil camélidos Arequipa Arequipa Textil camélidos
23 CITEtextil camélidos Cusco Cusco Textil camélidos
24 CITEtextil camélidos Puno Puno Textil camélidos
25 Unidad Técnica acuícola pesquero Huancavelica Huancavelica Acuícola
26 Unidad Técnica agroindustrial Ambo Huánuco Agroindustrial
27 Unidad Técnica agroindustrial Huaura Lima Agroindustrial
28 Unidad Técnica agroindustrial Lambayeque Lambayeque Agroindustrial
29 Unidad Técnica productivo Cajamarca Cajamarca Madera
30 Unidad Técnica textil confecciones Lima Lima Textil confecciones

Asimismo, para una mayor comprensión de la cobertura desplegada por el ITP a


nivel nacional para apoyar a los emprendedores de los diferentes sectores de la
producción, en la siguiente imagen se especifica la distribución territorial en la que

12
se brindan los diversos servicios tecnológicos cuya finalidad primordial es
contribuir con el fortalecimiento de la capacidad productiva y económica del país:

Figura 1

Ubicación territorial de la Red CITE

La Oficina de Tecnologías de la Información (OTI) del ITP es el órgano encargado


de la formulación, diseño y gestión de los procesos tecnológicos desarrollados en

13
el campo de las Tecnologías de la Información y Comunicaciones (TIC), cuyas
funciones están alineadas a las políticas centrales del marco normativo para la
Modernización Digital en el Gobierno Nacional establecida por la SeGDi
(Secretaría de Gobierno y Transformación Digital), que está, a su vez, adscrita a la
PCM (Presidencia del Consejo de Ministros).

Tiene a su cargo la planificación y administración del centro de datos, la


infraestructura de red empresarial, la plataforma tecnológica de virtualización, los
servicios de red, las comunicaciones unificadas, seguridad perimetral, desarrollo de
aplicaciones, soporte técnico, integración de soluciones, entre otros de su completa
responsabilidad como ente especializado en asuntos tecnológicos.

Los especialistas de la OTI tienen a su cargo la gestión del actual centro de datos
que en 2017 se implementó con una solución de infraestructura tecnológica
convergente basada en equipamiento de la marca HPE.

El centro de datos de ITP representa la infraestructura tecnológica para el soporte


de la actual plataforma computacional de servicios implementada con tecnología
de virtualización de la marca VMware. En la siguiente imagen se tiene una vista
rápida del actual centros de datos:

Figura 2

Vista frontal del centro de datos ubicado en Callao

14
Debido a su larga antigüedad, toda la plataforma de procesamiento, memoria,
almacenamiento y conectividad cumplió su ciclo o tiempo de vigencia tecnológica,
por lo que urge una renovación completa de todo el parque informático hospedado
en el centro de datos.

A pesar de los numerosos intentos desplegados en los últimos 4 años, donde se ha


trabajado arduamente para conseguir la actualización del centro de procesamiento
de datos con la presentación en cartera de diferentes alternativas tecnológicas, hasta
la fecha no se ha conseguido concretar ninguna propuesta debido a los cambios
repentinos de planes de cada nueva gestión pública que el Gobierno designa en la
alta dirección, pero, principalmente, a razones políticas, administrativas, jurídicas
y presupuestales que cada año se agudizan debido a la ‘tramitología burocrática’
del Estado.

En el año 2023 se estaba considerando una alternativa con la contratación de un


modelo IaaS (Infrastructure as a Service o Infraestructura como un Servicio) en
alguna de las plataformas de nube nacional con una empresa local (Optical
Technologies, GTD, Yachay, Claro, entre otras) o internacional con uno de los
grandes operadores (Amazon AWS, MS Azure o Google Cloud Platform), la idea
no tuvo acogida debido al impedimento presupuestal, ya que la Unidad
Formuladora de Presupuesto (UFP) manifestó que no se contaban con las garantías
necesarias para asegurar los fondos para mantener tal servicio en el largo plazo,
debido a los constantes recortes anuales en el presupuesto asignado por parte del
Ministerio de Economía y Finanzas (MEF).

Asimismo, se debe mencionar que en el año 2020, en plena emergencia mundial


por la propagación del COVID-19, se pretendió sanear varias deficiencias en la
infraestructura de red mediante la ejecución de un proyecto IOARR (Inversiones de
Optimización, de Ampliación Marginal, de Rehabilitación y de Reposición) para
asegurar la plataforma de servicios de red con la implementación de un site de
contingencia en el local de San Isidro y el fortalecimiento de la seguridad digital
con la instalación de distintos dispositivos de protección (para el control,
supervisión, filtrado y monitoreo de los accesos), soluciones que no se consiguieron
materializar en su totalidad hasta 2023 debido a cambios en la gestión.

15
Por lo mismo, el centro de datos actual mantiene las características tecnológicas
desde su despliegue inicial en la entidad, por lo que es idóneo para sostener sistemas
tradicionales basados en algoritmos estáticos, aunque con un bajo rendimiento
durante la prestación de los servicios, pero carece prácticamente de procesamiento
por gráfica (GPU, Graphics Processing Unit), que es el componente fundamental,
en estos tiempos, para entrenar grandes volúmenes de datos y desplegar sistemas
basados en inteligencia generativa siguiendo la línea de servicios en línea, tales
como ChatGPT (generador de textos), Dalle-e (generador de imágenes), Gemeni
(generador de textos), Copilot (generador de contenidos), Sora (generador de
videos), Codex (generador de códigos de programación), entre otros.

A todo lo mencionado en los apartados previos, se debe añadir que el área de


desarrollo de la OTI tiene una infraestructura técnica bastante precaria desde hace
varios años atrás, a la que no se la ha puesto en valor porque hasta la fecha no cuenta
con el personal requerido para ocupar los distintos roles designados de una línea de
producción para el desarrollo de sistemas de información que sirvan
estratégicamente para el cumplimiento de los objetivos institucionales en materia
de incremento de la productividad, rendimiento, innovación y valor de las empresas
nacionales.

Por lo mismo, al no contar con una infraestructura robusta de desarrollo de software


carece de profesionales dedicados en los perfiles de administrador de proyectos,
arquitecto de software, analista de requerimientos, diseñador UX/UI,
desarrollador de software, programador, analista de la calidad, especialista de
documentación, entre otros.

Ninguna de las gestiones anteriores se ha preocupado por fortalecer el área de


desarrollo con la instauración de algún estándar (como Agile, Lean o Extreme
Programming), plataforma (como OpenShift o Kubernetes) o metodología (como
DevOps, DevSecOps o MLOps) para contribuir con el análisis, desarrollo,
mantenimiento y despliegue de aplicaciones disruptivas en el entorno de la red de
servicios públicos.

Finalmente, se debe recalcar que aún no se cuenta con una implementación


tecnológica a nivel nacional, como el despliegue de una red WAN VPN, arrendada
a algún operador con cobertura nacional, en todo el territorio para la interconexión

16
de todas las sedes mencionadas solamente del interior del país con lo que se lograría
el despliegue de los servicios centralizados de red consolidados en la ciudad de
Lima, a saber, prestaciones tales como almacenamiento, telefonía, seguridad,
control de accesos, videovigilancia, filtrado web, internet, entre otros.

1.3 Análisis del Problema


Para el presente análisis del caso de estudio presentado se ha construido el
correspondiente Árbol del Problema, tal como se aprecia en la siguiente imagen,
donde se está identificando el problema principal, así como los principales motivos
que están influyendo en su causalidad, y la consecuencia principal que está
impactando en el desenvolvimiento de las empresas nacionales.

Figura 3

Diagrama del árbol del problema

17
1.3.1 Formulación del Problema
Baja capacidad de rendimiento en la plataforma tecnológica para la
aplicación de la inteligencia generativa en el desarrollo de sistemas
predictivos de información con el entrenamiento de grandes modelos de
Deep Learning.

1.3.2 Análisis
Como se ha descrito en el apartado anterior, la implementación del centro
datos carece de una plataforma para el procesamiento óptimo de los datos
(vectorización), lo cual no permite a los especialistas del área de software
desarrollar aplicaciones inteligentes con el entrenamiento de modelos
predictivos de información de código abierto, que pudiera ponerse a
disposición de las empresas nacionales para una mejor decisión en los
planes de inversión con el consiguiente aumento de la productividad, ello,
justamente, debido a las causas que se describen en los siguientes apartados.

Como primera causa principal, se puede indicar que se carece de capacidad


de ancho de banda adecuada, en la memoria de video, para continuar con el
proceso eficaz de transferencia de las unidades de información almacenadas
en disco, que provienen de las diferentes fuentes de datos seleccionadas
previamente. Ello se debe primordialmente al pobre desenvolvimiento
reportado por la muy limitada capacidad de los servidores en términos,
además, de rendimiento del procesador, memoria, almacenamiento y, sobre
todo, de la unidad gráfica, que es el componente clave, al día de hoy, para
el tratamiento de grandes volúmenes de datos.

Asimismo, como segunda causa principal, se debe enfatizar que no se


cuenta con capacidad instalada para procesar eficientemente las cargas de
trabajo relacionadas al embedding de los datos que engloban complejas
operaciones matemáticas de coma flotante, teniendo en cuenta que el
proceso de vectorización almacena la información de las distintas capas o
dimensiones en términos de valores numéricos reales.

También, como tercera causa principal, se tiene que resaltar que la


plataforma de sala de servidores carece de procesadores con altas
frecuencias de reloj para aprovechar las características del cómputo

18
paralelo, donde los millares de núcleos trabajan concurrentemente para
generar y grabar con eficacia las representaciones vectoriales de cada
conjunto de palabras y sus correspondientes parámetros entrenados en la
base de datos vectorial.

Por un lado, se debe destacar que las tres causas anteriores tienen un mismo
origen en común, que es el precario y obsoleto equipamiento de cómputo
de centro de datos, que no cuenta con una infraestructura basada en
tecnología de procesamiento por gráfica con las prestaciones exigidas para
el entrenamiento de los datos en propiedad de la institución.

Por otro lado, se debe tomar en cuenta, también, que los responsables del
área de tecnología aún no tienen la experiencia, preparación y dominio
necesarios para aplicar las tecnologías emergentes del campo de la IA en el
desarrollo de nuevas propuestas de valor que se pueden implementar para
beneficio económico de la misma entidad y las empresas nacionales, lo que
ha provocado las causas que se describen en los siguientes dos párrafos.

Así, por lo indicado previamente, como cuarta causa principal, se tiene que
mencionar que no se han considerado alternativas con modelos inteligentes
que permitan mayores tamaños para la ventana del contexto en términos de
tokens soportados, que permitan mantener la coherencia semántica de un
entorno de interacción más amplio sin pérdida de los niveles de
comprensión léxica y estructura sintáctica.

Además, como quinta y última causa principal, se debe informar que


tampoco se han considerado modelos generativos fundacionales con un
mayor número de parámetros de información, donde debe prevalecer la
calidad de los mismos sobre el volumen entrenado, para el mejoramiento de
la precisión gramatical de la respuesta generada, que debe ser enriquecida
con datos de la misma entidad.

Toda la causalidad anterior, en conjunto con la precaria situación mundial


surgida debido a la inflación y recesión de las grandes economías como
Estados Unidos y China, ha generado como consecuencia principal un clima
de alta incertidumbre en las empresas locales ante las decisiones que se
deben tomar para las acciones de inversión y emprendimiento, donde se

19
requiere información confiable y consolidada de diferentes fuentes de
información para contar con un panorama más claro de la realidad.

Por ello, como primera consecuencia primaria, se tiene que indicar que se
está experimentando un bajo apalancamiento financiero que está
impidiendo la apertura de nuevas líneas de producción y comercialización
de productos. Ello debido al alto riesgo que puede correr el sistema bancario
por la morosidad en la devolución de los préstamos, hipotecas y otros
créditos de índole empresarial.

Además, como segunda consecuencia primaria, se puede resaltar el aumento


constante en los precios finales de los bienes comercializados, debido en
gran parte al incremento de los costos fijos y variables de producción, ya
que se desconoce de insumos o materias primas más baratos con mayor
rendimiento productivo.

También, como tercera consecuencia primaria, se debe destacar que las


empresas peruanas están perdiendo muchas oportunidades de negocio, tanto
en la importación como exportación de bienes, debido a un alto
desconocimiento de las nuevas necesidades de los consumidores en los
mercados emergentes alrededor del mundo.

Asimismo, como cuarta y última consecuencia primaria, se tiene que


mencionar que las empresas pueden ver afectada su cuota de participación
en los mercados por la pérdida en los niveles de competitividad empresarial
debido al bajo nivel de explotación de los segmentos especializados de
consumo.

1.4 Objetivos
1.4.1 Objetivo General
Diseñar una plataforma tecnológica de alto rendimiento con procesamiento
por gráfica que esté basada en arquitectura hiperconvergente, cumpliendo la
normativa del estándar ANSI/TIA-942B, para la aplicación de la inteligencia
generativa en la producción de sistemas predictivos de información con el
entrenamiento de grandes modelos de IA.

20
1.4.2 Objetivos Específicos
 Incrementar el ancho de banda en la memoria de video (GB/s) del
componente gráfico (GPU, Graphics Processing Unit) para agilizar la
tasa de velocidad en la transmisión de grandes volúmenes de datos.
 Potenciar la cantidad de operaciones computacionales de coma flotante
por segundo (FLOPS) para mejorar el índice de procesamiento de los
valores numéricos reales que conforman las distintas dimensiones de la
información vectorial.
 Elevar la velocidad de reloj (Hz) de los núcleos de cómputo con el
aumento del nivel de la capacidad de procesamiento en paralelo de la
plataforma tecnológica para agilizar los trabajos de embedding de las
diferentes fuentes de datos.
 Aumentar el número de tokens de la ventana de contexto (TK/contexto)
para sostener los niveles de coherencia semántica del entorno sin
deficiencias en el proceso de inferencia léxica y sintáctica, que permitan
mantener la calidad de las respuestas (responses).
 Incrementar la cantidad de parámetros (variables automáticas) del
modelo generativo de IA, considerando la eficiencia sobre el tamaño,
para mejorar el nivel de precisión o exactitud gramatical de las consultas
(queries) durante la interacción con el sistema.

1.5 Planificación del Proyecto


La implementación del proyecto de solución al problema identificado va a consistir
fundamentalmente de cuatro grandes bloques o etapas que van a abarcar aspectos
relevantes desde la investigación de los modelos de IA más potentes hasta la
conceptualización final de la plataforma tecnológica de entrenamiento. Por lo
mismo, a continuación, se pasa a describir los detalles concernientes a cada fase de
la planificación del diseño tecnológico:

1.5.1 Análisis de Modelos

En esta primera fase del proyecto, se van a ejecutar tareas relacionadas a


investigar los modelos de IA basados en algoritmos de Machine Learning y

21
Deep Learning (Redes Neuronales), tanto propietarios como de código
abierto, más potentes de la red. Por lo mismo, se van a revisar las
documentaciones de los trabajos publicados por empresas del rubro de la IA,
tales como Microsoft, Google, OpenAI, Facebook, DeepMind, NVIDIA,
entre otros que puedan servir de sustento para este bloque.

Seguidamente, se va a proceder con el trabajo de clasificación de los modelos


de IA, identificados en el apartado anterior, de acuerdo a su campo de
aplicación, para lo que se tendrá en consideración las soluciones generativas
de texto, audio, imagen, video y código.

Asimismo, una vez que se tenga el catálogo de modelos de IA, se va a


proceder con la evaluación de la capacidad y rendimiento de cada modelo de
IA clasificado para determinar los algoritmos más eficaces en el
procesamiento de los datos que van a permitir la construcción de las bases
de datos vectoriales de consumo masivo.

1.5.2 Requerimientos Técnicos

En esta segunda fase de la implementación, se va a proceder con los trabajos


para calcular los requisitos tecnológicos en la parte del hardware
concerniente a los recursos computacionales necesarios para cubrir la
demanda exigida por los modelos identificados en la sección anterior en
términos de CPU, RAM, HDD y GPU, siendo este último, el componente
más importante, ya que es la tecnología más potente usada para el
procesamiento de la información, donde se puede remarcar los productos de
las compañías INTEL, AMD y NVIDIA, con este último, habiéndose
convertido en los últimos años en líder mundial indiscutible con la mayor
cuota de participación en el mercado debido a las propuestas innovadoras
basadas en la arquitectura CUDA.

Asimismo, se va a proceder con la evaluación de las alternativas tecnológicas


en términos de los requisitos de software a fin de determinar los componentes
lógicos más adecuados en cuanto a la selección de los sistemas operativos,
lenguajes de programación, bases de datos, tecnología de contenedores,

22
librerías de programación, plataformas web, entre otros, que van a
contribuir con el despliegue de la plataforma de desarrollo.

Finalmente, para complementar los anteriores elementos de hardware y


software, se va a terminar definiendo las arquitecturas de desarrollo (tales
como SOA), evaluando varios paradigmas de desarrollo (tales como Agile,
Lean o Extreme Programming), ponderando las plataformas de producción
(tales como OpenShift o Kubernetes) con miras a la posibilidad de contar con
un modelo del tipo PaaS (Platform as a Service o Plataforma como un
Servicio) y, por último, analizando las metodologías de codificación más
adoptadas en el campo del desarrollo de software (como DevOps,
DevSecOps o MLOps).

1.5.3 Estudio de Mercado

En esta tercera etapa de la solución, se continuará con la evaluación de las


dos tecnologías de hiperconvergencia (HCI y dHCI) ofertadas en el mercado
local para determinar las ventajas técnicas de cada una en cuanto a sus
capacidades de procesamiento, memoria, almacenamiento, gráfica,
conectividad y seguridad de la información, que se ajusten con los requisitos
técnicos determinados en el apartado anterior con altos niveles de
disponibilidad, escalabilidad, resiliencia y confiabilidad.

Por lo mismo, se va a indagar en el mercado actual para identificar a


fabricantes de soluciones con alternativas de hiperconvergencia que superen
con creces las expectativas de la implementación requerida, teniendo ya
registradas en la lista inicial a grandes marcas mundiales de la talla de HPE,
Dell, Nutanix, LENOVO y Huawei.

Para culminar esta etapa, se va a verificar los catálogos de las propuestas


tecnológicas de cada fabricante mencionado para constatar que todos los
componentes de hardware (CPU, RAM, HDD y GPU) mantienen un alto
grado de compatibilidad para así garantizar el mayor rendimiento durante los
trabajos de tokenización (embedding) de la información, sin el riesgo de

23
comprometer el resto de procesos concurrentes en la plataforma de
virtualización.

1.5.4 Propuesta Tecnológica

En esta fase final de la solución, se analizarán las tendencias tecnológicas en


el campo de la IA para definir al socio estratégico que se encargará de la
implementación de la solución cuyo entregable final será una plataforma de
desarrollo de software aplicando avanzados algoritmos estadísticos,
generativos y predictivos.

Una vez seleccionado al partner de la marca oficial ganadora, se procederá


con la programación de las reuniones de coordinación involucrando a los
especialistas designados por la marca para empezar a bosquejar la
implementación en el centro de datos.

Asimismo, se procederá con la selección de los componentes de software de


la infraestructura tecnológica, que fueron evaluados en la etapa de
REQUERIMIENTOS TÉCNICOS, de acuerdo a sus grados de efectividad,
rendimiento computacional, facilidad de adopción y productividad laboral.

Finalmente, con la identificación de todos los componentes de hardware,


software y demás tecnologías en la mesa de diseño, se procederá con la
formulación o construcción del diseño final de la plataforma de
infraestructura computacional, donde se señalarán todos los elementos de la
solución, así como su integración con el resto de soluciones para cumplir con
el objetivo principal del presente proyecto.

A continuación, el siguiente gráfico muestra las fases descritas previamente


a fin que sirva visualmente de mapa de ruta en la ejecución de los trabajos
formulados para la materialización de la propuesta sistémica actual:

24
Figura 4

Fases del diseño de la solución final

Se debe indicar que, para una mayor comprensión del proyecto, se ha incluido en
el Anexo C un corto glosario de varios de los términos técnicos que se están
mencionando en el presente desarrollo.

25
2 CAPÍTULO 2: MARCO TEÓRICO
2.1 Marco Conceptual
Desde hace varios años atrás, para las cargas de trabajo descritas previamente, el
mercado está apelando a otras tecnologías disruptivas como el procesamiento de la
información con la instalación de centros de datos basados en nodos equipados con
aceleradores de GPU, debido a las ventajas comparativas con las tradicionales CPU,
entre las que se pueden describir las siguientes:

 Cuentan con capacidades de cómputo en paralelo que permite la ejecución


concurrente y distribuida de las cargas de trabajo asignadas durante un mismo
ciclo o pulso de reloj, con lo que se consigue una mayor velocidad de
procesamiento en los centros de datos especializados en analítica, inteligencia
de negocios y ciencia de datos.
 Están diseñadas para tener un alto rendimiento en operaciones específicas,
complejas y muy especializadas en los rubros vinculados a la edición de video,
renderización, modelado 3D, word embedding, aprendizaje profundo,
desarrollo de GPTs, inferencia de IA, entre otros, a comparación de otras
opciones que son de propósito general.
 Incorporan en su arquitectura varios miles de cores o núcleos especializados
con los que, en forma conjunta, son capaces de alcanzar un alto rendimiento en
el procesamiento de los datos y bajas latencias en la transmisión de la
información en los grandes centros de cómputo.
 Soportan el procesamiento de valores en distintos formatos matemáticos de
coma flotante, tales como FP4, FP8, FP16, BF16, FP32 y FP64, los cuales
permiten la implementación de aplicaciones de inteligencia generativa con altos
niveles de precisión y confiabilidad.
 Alcanzan en las cargas de trabajo masivo elevados índices de rendimiento
computacional medidos en FLOPS (operaciones de coma flotante por segundo),
con los cuales los centros de datos avanzados llegan a niveles de TeraFLOPS,
pasando por los PetaFLOPS y alcanzando los ExaFLOPS, para las cargas de
procesamiento a nivel industrial, científico y financiero.

En consecuencia, se debe resaltar que es necesario contar con otro tipo de


implementación que se base en una nueva arquitectura computacional de
procesamiento por gráfica (GPU), que proporcione una infraestructura moderna

26
con capacidades de alto rendimiento y baja latencia para cumplir con las nuevas
cargas de trabajo, tal como se muestra a continuación en la siguiente imagen:

Figura 5

Arquitectura de procesamiento por GPU

Nota. Adaptado de “Reference Architecture for Generative AI Based on Large Language Models (LLMs)”, por
R. Daigle, 2023. ([Link]
large-language-models/)

Por ello mismo, teniendo en cuenta las características técnicas sobresalientes de las
GPU en el mercado actual de la IA generativa, la empresa AMD ofrece para dicho
segmento la línea de procesadores EPYC serie 9004 de 4ª. generación fabricados
bajo la arquitectura Zen 4 con hasta128 núcleos de procesamiento, que promete un
avanzado rendimiento y grandes capacidades de trabajo en el centro de datos para
tareas como aprendizaje profundo, almacenamiento masivo y transmisión de video
(streaming); asimismo, la compañía Intel propone la línea Xeon escalable de 5ª.
generación basada en la arquitectura Sapphire Rapids de 10 nm de litografía con 64
núcleos y 128 hilos por cada procesador, la misma que incorpora motores
aceleradores para el entrenamiento de la IA en forma nativa con el soporte de las
librerías de Deep Learning Boost para la agilización de las operaciones matemáticas
de números enteros y de coma flotante; y, finalmente, la corporación NVIDIA
plantea el ecosistema más avanzado con sus propuestas tecnológicas basadas en los

27
procesadores A100, L40S, H100, HGX A100, HGX H100, DGX GH200 hasta los
últimos B200 y GB200 (basados en arquitectura Blackwell), así como la suite
conocida comercialmente como NVIDIA AI Enterprise que integra todas las
librerías, controladores, frameworks y demás, tal como puede apreciarse en la
Figura 6, destinadas a la construcción de innumerables aplicaciones de inteligencia
generativa con el entrenamiento y reentrenamiento de LLMs de código abierto, con
las que ofrece, en hardware y software, las más ventajosas características
tecnológicas a los especialistas de las ramas de la computación de borde (Edge),
computación en la nube (Cloud), computación de alto rendimiento (HPC),
computación para la analítica de datos (Analytics) y computación para la
inteligencia artificial (IA), siendo en esta última donde destaca por encima de las
anteriores alternativas, debido a las capacidades inigualables que puede ofrecer en
el procesamiento de millones de operaciones, provenientes de la fase de
vectorización de grandes volúmenes de datos, con la ejecución de avanzados
algoritmos matemáticos de coma flotante a fin de garantizar un alto desempeño en
la precisión de la información final, por lo que a estas fechas es prácticamente
inalcanzable en el mundo de la computación a escala industrial.

Figura 6

Plataforma de NVIDIA AI Enterprise para el desarrollo de aplicaciones de IA

28
Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “AI Solution Architecture”, por Francisco Aguirre, 2024.

Asimismo, ya que se requieren los masivos datos almacenados en los distintos


LLMs open source, entrenados con varios millones de parámetros para una mejor
precisión semántica, para consolidar los nuevos datos con técnicas de RAG y
reprocesar los tokens con aplicaciones de fine-tuning, se tiene el inconveniente del
almacenamiento, debido a que dichos modelos consumen varios gigabytes en
memoria y disco, sobre todo, cuando se ponen en ejecución en su formato de
contenedor, por lo que se debe habilitar un ambiente propicio con tecnología
Docker que, de igual manera, va a requerir recursos informáticos adicionales.

Aparte, la solución de red debe contar con ventajas técnicas que permitan su
mantenimiento, actualización y desempeño, para lo cual se debe asegurar la
administración, compatibilidad y escalabilidad de la infraestructura de conexión,
que facilite la transmisión de millones de datos en las fases de desarrollo y
producción de las aplicaciones de RAG y fine-tuning contando con el soporte de la
tecnología NVLink en los enlaces internos del GPU, ya que posibilitan el cómputo
paralelo a diferentes niveles, tal como puede apreciarse en la siguiente imagen con
la presentación de las distintas velocidades de transmisión de datos:

Figura 7

Generaciones de la tecnología NVLink

Nota. Adaptado de “¿Qué es NVIDIA NVLink?”, por Ricky, 2023. ([Link]


[Link])

29
En el rubro de procesamiento por gráfica, se tiene un líder indiscutible a esta fecha
actual, como ya se había indicado, donde destaca primordialmente la empresa
americana NVIDIA Corporation, que, gracias a sus innovadores productos en el
mercado de las GPU, cuenta con una amplia cartera de alternativas relacionadas al
procesamiento de algoritmos de Deep Learning, manteniéndose muy por encima
de la competencia que le ofrecen otras compañías prestigiosas como INTEL o AMD.

Así, para los rubros doméstico, académico y profesional tiene los productos de las
líneas Titan y Quadro, mientras que para el sector de consumo general cuenta con
las líneas GeForce GTX (series 10 y 16) y GeForce RTX (series 20, 30 y 40),
basándose esta última en las arquitecturas Turing, Ampere y Ada Lovelace que
integran núcleos dedicados para el trazado de rayos en tiempo real y el
procesamiento de modelos de inteligencia artificial.

El procesamiento de embeddings usando tecnologías de gráfica (GPU) y datos


(DPU), dedicadas al entrenamiento de los modelos de IA, ha superado en dicho
trabajo, desde varios años atrás, a las convencionales CPU de casa u oficina por
distintas razones técnicas, entre las que podemos citar las siguientes, teniendo en
cuenta las gráficas de la compañía NVIDIA:

 La posibilidad de procesamiento computacional en paralelo que permite


alcanzar mayores tasas por segundo en los tiempos de entrenamiento de los
millones de tokens aprovechando tecnologías de cómputo paralelo como
NVIDIA NVLink y NVIDIA NVSwitch, además de NVIDIA GPUDirect
RDMA.
 La alta capacidad de computación con la incorporación de varios miles de
núcleos especializados que permiten la ejecución de millones de
operaciones matemáticas por segundo de coma flotante con precisión media
(FP16), precisión simple (FP32) y precisión doble (FP64), entre otras.
 El alto rendimiento de los procesadores de gráfica alcanzados en el
tratamiento de grandes volúmenes de información medidos en unidades de
FLOPS, que pueden llegar a los TeraFLOPS, como en los modelos NVIDIA
A100, NVIDIA L40 y NVIDIA H100 llegando, incluso, a los PetaFLOPS en
las líneas corporativas como NVIDIA DGX H100 y NVIDIA DGX GH200
para aplicaciones industriales, financieras y de laboratorio.

30
 La posibilidad de incorporar unidades o núcleos de procesamiento
altamente diferenciadas y especializadas para cargas de trabajo específicas
con tecnología CUDA para las tareas de propósito general, tecnología RT,
para la generación de imágenes y tecnología Tensor, para la inteligencia
generativa (Machine Learning y Deep Learning).
 La capacidad de soportar altas tasas de transferencia de datos con la
fabricación de memorias de video con grandes velocidades de anchos de
banda capaces de mover los tokens a ratios de 1555 GB/s en el modelo
A100, 864 GB/s en los modelos L40 y L40S, 2 TB/s en el modelo H100
(80GB) y 7.8 TB/s en el modelo H100 NVL.

Ahora recientemente en marzo de 2024, NVIDIA anunció el lanzamiento oficial de


los nuevos modelos Blackwell B200 y GB200 basados en la arquitectura del mismo
nombre, que promete tener un desempeño de hasta 30 veces más que cualquier otro
GPU que haya fabricado a la fecha.

La nueva línea destinada a la implementación de centros de dato de nivel industrial


presenta entre sus nuevas capacidades tecnológicas la incorporación de un motor
Transformer de segunda generación, interconexión NVLink de quinta generación,
motor RAS, seguridad para los modelos y un motor de descompresión para agilizar
las consultas hechas a la base de datos vectorial.

Teniendo en cuenta la nueva arquitectura Blackwell, la siguiente tabla muestra las


características técnicas de procesamiento de los modelos GB200 NVL72 y GB200
Grace:

Tabla 2

Características técnicas de los aceleradores GB200

Modelo GB200 NVL72 GB200 Grace Blackwell Superchip


36 CPUs Grace 1 CPU Grace
Configuración
72 GPUs Blackwell 2 GPUs Blackwell
Core Tensor FP4 1,440 PFLOPS 40 PFLOPS
Core Tensor FP6/FP8 720 PFLOPS 20 PFLOPS
Core Tensor INT8 720 POPS 20 POPS
Core Tensor FP16/BF16 360 PFLOPS 10 PFLOPS

31
Modelo GB200 NVL72 GB200 Grace Blackwell Superchip
Core Tensor FP32 180 PFLOPS 5 PFLOPS
Core Tensor FP64 3,240 TFLOPS 90 TFLOPS
Ancho de banda | Hasta 13.5 TB HBM3e | Hasta 384 GB HBM3e |
Memoria de GPU 576 TB/s 16 TB/s
Ancho de banda de NVLink 130TB/s 3.6TB/s
Cantidad de cores CPU 2,592 Arm Neoverse V2 cores 72 Arm Neoverse V2 cores
Ancho de banda | Hasta 17 TB LPDDR5X | Hasta 480GB LPDDR5X |
Memoria de CPU Hasta 18.4 TB/s Hasta 512 GB/s
Nota. Adaptado de “NVIDIA GB200 NVL72”, por NVIDIA, s.f.-d. ([Link]
center/gb200-nvl72/)

Asimismo, en la siguiente tabla, se muestra una comparación de las capacidades de


desenvolvimiento de las gráficas HGX A100, L40S y HGX H100 de NVIDIA, donde
se puede apreciar el rendimiento de la segunda de ellas en los trabajos de fine-
tuning, entrenamiento de modelos pequeños y de modelos fundacionales:

Tabla 3

Capacidad de las gráficas HGX A100, L40S y HGX H100

Carga de trabajo Modelo HGX A100 L40S HGX H100


Fine-tuning de modelos existentes GPT-40B LoRA (8 GPU) 12 hrs 1.7x 4.4x
(Tiempo para entrenar 860M de tokens) GPT-175B LoRA (16 GPU) 6 hrs 1.6x 4.3x
Entrenamiento de modelos pequeños GPT-7B (8 GPU) 17 hrs 1.3x 3.4x
(Tiempo para entrenar 10B de tokens) GPT-13B (8 GPU) 32 hrs 1.2x 3.6x
GPT-175B (256 GPU) 64 días 1.4x 4.5x
Entrenamiento de modelos fundacionales
GPT-175B (1K GPU) 16 días 1.3x 4.6x
(Tiempo para entrenar 300B de tokens)
GPT-175B (4K GPU) 4 días 1.2x 4.1x
Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “LLM Training & Inference”, por NVIDIA, 2023.

2.2 Estándares, Frameworks y buenas prácticas


Para el diseño de la infraestructura de cómputo se va a tener en cuenta las
consideraciones de la norma internacional ANSI/TIA-942-B, que comprende el

32
conjunto de medidas técnicas que regulan los distintos subsistemas de una
plataforma de centro de datos con perfil corporativo, con las cuales se va a fortalecer
las acciones vinculadas, por un lado, a los temas de disponibilidad, contingencia y
seguridad de los servicios y, por otro, a los de administración y operaciones de la
implementación sistémica.

Igualmente, para la gestión de la implementación informática de cómputo que se


va a desplegar con tecnología hiperconvergente y procesamiento por gráfica (GPU),
se requiere de una plataforma avanzada de administración que permita la
producción de aplicaciones de información con el establecimiento de una línea de
desarrollo de los sistemas, incorporando todos los componentes de software para el
análisis, desarrollo y publicación de las aplicaciones de IA, tal como lo que ofrece
la solución NVIDIA AI Enterprise con el despliegue de sus distintos frameworks,
tal como puede apreciarse en la siguiente tabla:

Tabla 4

Frameworks de NVIDIA AI Enterprise

Framework Campo de aplicación


Metropolis Analítica de video
NeMO Modelos grandes de lenguaje/IA Generativa
Omniverse Aplicaciones del metaverso
Merlin Sistemas de recomendación
Isaac Robótica
Riva Voz
RAPIDS Analítica de datos
Morpheus Ciberseguridad
TRITON Inferencia
Aerial Telecomunicaciones
Clara Cuidado de la salud
Drive Automotriz

Por lo mismo, se debe contar para la implantación de la línea de producción de IA,


fundamentalmente, con datos consistentes (materia prima de relevancia) que
provengan de distintas fuentes y más claramente de distintos formatos de
almacenamiento que, para el caso, pueden presentarse como documentos de texto,
hojas de cálculo, diapositivas con presentaciones, bases de datos convencionales;
así como en formato de audio, imagen, video, entre otros.

33
Así, para tal cometido que busca asegurar datos de alta calidad, se puede considerar
la intervención de los ingenieros y científicos del campo de la ciencia de datos
(Data Science), quienes se encargarían de las fases de selección y curación de los
datos iniciales, donde por medio de procedimientos estándares de homologación
(pipelines) y haciendo uso de aplicaciones como Apache Nifi o Apache Spark, se
encargarían de generar un repositorio homologado o Data Warehouse con todos los
datos formateados y listos para su consumo o procesamiento con lo que se estaría
garantizando un resultado más confiable en las salidas de inferencia.

Aparte de contar con repositorios de datos normalizados que pueden provenir de


otras tecnologías, disciplinas y campos, tales como Big Data, IoT (Internet of
Things o Internet de las Cosas) o Data Science, se requiere implementar el proceso
conocido como embedding, que consiste en la transformación de los tokens
(palabras o grupos de palabras) en sus respectivas representaciones simbólicas por
medio de la asignación de vectores matemáticos compuestos por valores numéricos
en formato de coma flotante, con lo que se consigue mantener el contexto, la
similitud y la semántica de los datos procesados.

Para el caso, se tiene una larga lista de algoritmos para la ejecución de la fase de
embedding, de entre los cuales se pueden citar a BERT (Bidirectional Encoder
Representations from Transformers) y Word2Vec desarrollados por Google, Text-
Embedding-3-Large implementado por OpenAI, fastText usado por Facebook y
GloVe publicado por la Universidad de Stanford.

Asimismo, para el resguardo de los datos provenientes de la fase de curación,


homologación, formateo y embedding, se requiere el soporte de un tipo
especializado de almacenamiento, las bases de datos vectoriales, tales como las que
figuran en la Figura 8, que están encargadas de guardar cientos o miles de
dimensiones como entidades vectoriales en formato de coma flotante para preservar
con dicha estructura la precisión gramatical de la información en las unidades de
disco, por lo que representan una importante base de información actualizada que
enriquecerán las consultas realizadas a los modelos fundacionales, los mismos que
han sido entrenados hasta una fecha en particular (período de corte).

34
Figura 8

Procesamiento con bases de datos vectoriales

Nota. Adaptado de “3 Ways Vector Databases Take Your LLM Use Cases to the Next Level”, por P. Mishra,
2023. ([Link]

En ese orden, se requiere de avanzadas herramientas y marcos de trabajo que


faciliten el desarrollo de aplicaciones y que estén dirigidos a la explotación de los
grandes modelos de lenguaje de código abierto en conjunto con los datos generados
por la misma entidad para satisfacer los diferentes casos de uso que se demanden,
abarcando los procesos de normalización, ingesta y estructuración de documentos,
entre los cuales se puede mencionar a LangChain, LLaMA Index, Semantic Kernel,
PrivateGPT, H2O, entre otros de código abierto y propietarios, los cuales pueden
diferenciarse por las características técnicas que ofrecen cada uno a los
desarrolladores de sistemas.

También, en la plataforma de software se requiere de una implementación virtual,


que tenga la capacidad de desplegar máquinas virtuales personalizadas para las
aplicaciones de Deep Learning, que estén optimizadas para las distintas
necesidades que exigen las cargas de trabajo de procesamiento exhaustivo

35
resguardando la compatibilidad durante la instalación de las librerías, frameworks
(como TensorFlow y PyTorch), controladores, IDEs, entre otros elementos
necesarios, con los que se eliminará cualquier problema o conflicto en la
configuración inicial, tal como VMware Private AI Foundation, cuya arquitectura
se puede apreciar rápidamente en la siguiente imagen:

Figura 9

Plataforma VMware Private AI Foundation

Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “NVIDIA AI Enterprise on Lenovo”, por LENOVO, 2024.

Además, se requiere de un framework bastante robusto para asegurar la


construcción, personalización y puesta en marcha de los sistemas basados en el
entrenamiento de los modelos generativos de IA con rapidez, versatilidad y
seguridad, tal como NVIDIA NeMO.

Este componente incorpora las librerías avanzadas necesarias que permiten la


curación de los datos, el entrenamiento de los tokens y la inferencia de las salidas,
así como una vasta gama de plantillas de modelos entrenados previamente con
perfiles de configuración definidos para soportar las distintas cargas de trabajo
específicas. En la siguiente imagen se tiene una sinopsis de NVIDIA NeMO como
alternativa para el desarrollo de aplicaciones de inteligencia generativa:

36
Figura 10

Framework NVIDIA NeMO

Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “NVIDIA AI Enterprise on Lenovo”, por LENOVO, 2024.

De igual modo, la propuesta puede incorporar técnicas de Aprendizaje Reforzado


con Retroalimentación Humana o Reinforcement Learning from Human Feedback
(RLHF) para permitir a los desarrolladores construir modelos más inteligentes con
información actualizada de relevancia de acuerdo a los campos de aplicación, así
como Reconocimiento Automático de Voz o Automatic Speech Recognition (ASR),
Procesamiento Natural del Lenguaje o Natural Language Processing (NLP) y
Texto a Voz o Text-to-Speech (TTS).

Asimismo, se necesita de un potente SDK (Software Development Kit o


Herramientas de Desarrollo de Software), como NVIDIA Riva, para la generación
personalizada de aplicaciones de voz en tiempo real. Para ello, el catálogo de
NVIDIA NGC contiene una larga lista de modelos preentrenados de voz que pueden
ser fácilmente exportados, mejorados y desplegados como un servicio de voz, ya
sea en un centro de procesamiento en sitio o en la nube.

Dicho kit de herramientas puede ser desplegado para el desarrollo de aplicaciones


de síntesis de voz y Reconocimiento Automático de Voz o Automatic Speech

37
Recognition (ASR), tales como asistentes virtuales y transcripciones en tiempo real
para múltiples idiomas.

Igualmente, se requiere un componente que permita la gestión de los modelos y el


procesamiento de las solicitudes de inferencia desde una interfaz intuitiva que
ofrezca baja latencia y alto rendimiento, como puede ser el caso de NVIDIA Triton
Inference Server, que permite la implementación de los modelos de IA ofreciendo
una capacidad destacable para cualquier tipo de consulta realizada, ya sea en tiempo
real, por lotes o por streaming de audio/video, por lo que en la siguiente imagen se
muestra a NVIDIA Triton, en sincronía con otras herramientas, como elemento
sustancial de la plataforma NVIDIA AI Enterprise que, como se dijo, es la suite de
frameworks para el desarrollo de aplicaciones inteligentes:

Figura 11

Herramientas de desarrollo de NVIDIA AI Enterprise

Nota. Adaptado de “Reference Architecture for Generative AI Based on Large Language Models (LLMs)”, por
R. Daigle, 2023. ([Link]
large-language-models/)

De igual modo, se requiere contar con un componente tecnológico adicional para


el uso más eficiente de los recursos de hardware que permita reducir la capacidad
inoperativa de la plataforma tecnológica, tal como puede ser la implantación de la
tecnología de contenedores con Dockers; así como un sistema de orquestación que

38
sea capaz de proporcionar un framework para la administración, despliegue y
escalamiento de las soluciones contenerizadas de IA generativa, tales como Red
Hat, Kubernetes o VMware Tanzu.

También, para el despliegue de la plataforma con tecnología de virtualización se


requiere una implementación que tenga la capacidad de proveer los entornos de
ejecución en forma rápida, segura y automatizada, en caso se requiera desplegar
instancias para la ejecución de servicios de inferencia y generación de respuestas.

Dicha plataforma debe contar con la habilidad de abstraer los recursos de


procesamiento, almacenamiento y conectividad para colaborar en forma eficiente
con la distribución de las cargas de trabajo en las distintas fases del desarrollo de
las aplicaciones de IA, por lo que debe asegurar la integridad de cada máquina
virtual mediante técnicas de aislamiento y control para evitar pérdidas de datos, así
como conflictos con otras instancias de cómputo.

Antes de pasar al siguiente apartado, se debe recalcar que un LLM es una aplicación
de aprendizaje profundo implementada con el uso de redes Transformer, un tipo
especial de red neuronal profunda, que ha sido entrenado con una diversidad de
datasets provenientes de distintos corpus de información como Wikipedia, Twitter,
Common Crawl, Reddit, The Pile, entre otras, que tiene la capacidad de cumplir
distintas tareas como absolver preguntas, resumir documentos, traducir idiomas,
pronosticar eventos, buscar información, crear contenidos y otras más, las cuales
procesa manteniendo la precisión textual por medio de su ventana de contexto, con
la que se garantiza una salida confiable con la menor tasa de error posible, por lo
que, entre sus ventajas más resaltantes se pueden mencionar las siguientes:

 Están entrenados preliminarmente con millones de datos provenientes de


distintas fuentes de información.
 Consolidan la base del conocimiento de varios campos del desarrollo
científico y tecnológico.
 Están optimizados con técnicas avanzadas de cuantización para hacer un
uso eficiente de los recursos de procesador, memoria y almacenamiento.
 Se pueden publicar con licenciamiento de código abierto para permitir su
estudio y uso en otros campos específicos.

39
Por la naturaleza técnica de la implementación, los LLM requieren de una
infraestructura distinta a la conocida en los centros de datos convencionales basados
en arquitectura de CPUs, por lo que la industria se ha encargado de proveer
equipamiento robusto basado en modernos aceleradores gráficos, que se ha estado
describiendo en las secciones previas, con grandes capacidades computacionales,
además de otras herramientas de software, que juntos representan la plataforma
tecnológica requerida para la producción de sistemas inteligentes con el
aprovechamiento de los modelos fundacionales puestos a disposición en la red por
las empresas dedicadas al desarrollo de los productos mencionados, entre los que
se puede destacar a OpenAI, Meta y Mistral,

Por ello, ya que se requiere trabajar con modelos de lenguaje de código abierto, se
presenta en la red toda una amplia variedad de repositorios de LLMs a las que se
puede recurrir para potenciar el desarrollo de las aplicaciones, por lo que se puede
mencionar a los siguientes:

a. Hugging Face. Es uno de los más grandes repositorios de modelos de


inteligencia artificial generativa de renombre en la comunidad de internet. El
repositorio cubre una amplia gama de campos de aplicación dentro de la IA, tales
como visión por computadora, inteligencia multimodal, reconocimiento de voz,
aprendizaje reforzado y procesamiento natural del lenguaje. Para este último rubro,
tiene diferentes modelos con los que se pueden desarrollar aplicaciones que
impliquen generación de texto, clasificación de texto, traducción del lenguaje,
resumen de documentos, inferencia lógica, resolución de preguntas, entre otros. La
página oficial de acceso es [Link]

b. NVIDIA GPU Cloud (NGC). Es una plataforma de recursos de NVIDIA que


ofrece a los investigadores y desarrolladores acceso a modelos de inteligencia
artificial (IA) optimizados para potenciar y acelerar los proyectos de despliegue a
gran escala. Sobresale por su vasto inventario de contenedores de software, que
están preconfigurados y precargados para ejecutarse en distintas implementaciones
de arquitectura con GPU. Además, incluye una amplia gama de aplicaciones de IA,
la cual la convierte en una herramienta muy flexible que puede aplicarse en distintos

40
campos como la industria, salud, educación, energía y trasporte. Se puede visitar
desde la web [Link]

c. TensorFlow Hub. Es una iniciativa sostenida por el gigante de internet Google.


Este repositorio es otro espacio destacado para los modelos de IA, el cual pone a
disposición de los desarrolladores una gran colección de modelos previamente
entrenados que están destinados a varios dominios del Deep Learning. TensorFlow
Hub proporciona modelos para distintas cargas de trabajos como clasificación de
imágenes, identificación de objetos, inferencia de texto y más, permitiendo a los
especialistas personalizar los modelos con datos propios, con lo que se consigue
desplegar aplicaciones de gran calidad. Para cualquier revisión de los contenidos se
puede visitar [Link]

d. PyTorch Hub. Es otro importante espacio de recursos de IA exclusivo para


desarrollos que incorporen PyTorch, el popular framework de aprendizaje
profundo, donde se proporciona un repositorio centralizado con modelos
entrenados previamente que se pueden disponer para desplegar proyectos basados
en el framework del mismo nombre. El servicio cubre una extensa gama de
dominios de la IA, donde se incluye la visión por computadora, el reconocimiento
de objetos, el procesamiento natural del lenguaje y el modelado del lenguaje. Dicho
repositorio permite ajustar los modelos y la transferencia del aprendizaje, lo que
facilita a los programadores personalizar los modelos existentes a los requisitos
específicos de los proyectos. La web oficial es [Link]

e. Model Zoo. Este repositorio es un proyecto de la conocida empresa OpenAI.


Este servicio incluye una colección seleccionada de modelos generativos de
aprendizaje profundo y muestras de código que resaltan los alcances de su
investigación en el campo de la IA. Se ofrece un amplio inventario de modelos,
incluidos aquellos para el desarrollo de aplicaciones que integren capacidades de
procesamiento natural del lenguaje, visión por computadora, generación de texto,
aprendizaje reforzado, entre otros. Los usuarios pueden trabajar con estos modelos
de última generación, acceder a modelos previamente entrenados y aprovechar los
códigos para poner en funcionamiento muchos de sus proyectos innovadores. Se
puede acceder desde el portal [Link]

41
f. Microsoft AI GitHub. Como se indica es un repositorio de modelos de IA de la
misma compañía Microsoft. Este recurso desplegado en la red es un repositorio
completo que hospeda una amplia variedad de recursos vinculados al desarrollo con
herramientas de IA. Comprende una numerosa cantidad de modelos, bibliotecas,
controladores y frameworks de inteligencia generativa para los diferentes campos
de dominios. Este repositorio de la casa de Redmond incluye modelos para trabajos
de visión por computadora, reconocimiento de imágenes y detección de objetos, así
como otros más para procesamiento de voz, traducción automática y otras tareas
del campo del procesamiento natural del lenguaje. Además, cuenta con otros
recursos que proporcionan códigos de muestra, tutoriales y documentación variada,
para facilitar el desarrollo de aplicaciones con IA. Para visitar los recursos de dicha
plataforma se debe acceder desde [Link]

Para el presente proyecto, se procederá inicialmente con la selección de las dos


primeras fuentes de modelos, Hugging Face, por un lado, por ser el repositorio más
recomendado por los desarrolladores, y NVIDIA GPU Cloud, por otro lado, ya que
se complementa con el ecosistema de recursos desplegados y el amplio repertorio
de aceleradores gráficos que facilitan el despliegue de soluciones con inteligencia
generativa.

No se descartan definitivamente las otras alternativas de repositorios en línea, ya


que para una experiencia más enriquecedora se planificará una segunda fase
destinada a la exploración de dichos modelos desarrollados para otros campos de
aplicación.

2.3 Bases Legales y Marco Normativo


Cabe destacar que la iniciativa tecnológica se sustenta en un nutrido acervo legal,
que ha sido formulado en estos años para impulsar el desarrollo de las TI en el
sector gubernamental, por lo que se puede mencionar las siguientes normativas
como parte del proyecto:

a. La Presidencia del Consejo de Ministros, con fecha 30 de abril de 2024, dispuso


el lanzamiento del proyecto destinado a reglamentar la Ley 31814, la misma que

42
promueve la aplicación de las tecnologías de la inteligencia artificial (TIAs) en
beneficio del progreso económico y social del Perú (Resolución Ministerial 132-
2024-PCM, 2024).

b. Teniendo en cuenta el Decreto Supremo 085-2023-PCM (2023), la Presidencia


del Consejo de Ministros, con fecha 28 de julio de 2023, dispuso la aprobación de
la Política General de Transformación Digital al año 2030.

c. El Congreso de la República del Perú, con fecha 5 de julio de 2023, dispuso la


aprobación del uso de las tecnologías de la inteligencia artificial (TIAs) en beneficio
del progreso económico y social del Perú, con el fin de promover la transformación
digital, en un ambiente seguro que garantice la ética, sostenibilidad, transparencia
y responsabilidad (Ley 31814, 2023).

d. Teniendo en cuenta el Decreto Supremo 042-2023-PCM (2023), la Presidencia


del Consejo de Ministros, con fecha 24 de marzo de 2023, dispuso la aprobación de
la Política General de Gobierno, que contempla en la quinta disposición
complementaria final la aplicación de las Tecnologías de la Información (TI), sobre
las cuales indica que “las entidades del Estado hacen uso intensivo de las TI para la
ejecución de la Política General de Gobierno en el actual mandato presidencial,
dentro del marco vinculado al desarrollo nacional de los planes de transformación
digital”.

e. Teniendo en cuenta el Decreto Supremo 157-2021-PCM (2021), la Presidencia


del Consejo de Ministros, con fecha 24 de setiembre de 2021, dispuso la aprobación
del Reglamento concerniente al Decreto de Urgencia 006-2020, que estableció el
Sistema Nacional de Transformación Digital (SNTD), para formular los
lineamientos de gobernanza de dicho ente, sus elementos y vinculación con otros
sectores, tales como organismos de la ciudadanía, empresas, academia y sociedad
en general; lo cual es congruente con el Decreto Legislativo 1412 que estableció
procedimientos, normas, medidas, instrumentos y otros para la organización y
funcionamiento del sistema con el objetivo de contribuir en proporcionar mayor
seguridad jurídica al proceso de transformación digital en el Perú.

f. Teniendo en cuenta el Decreto Supremo 029-2021-PCM (2021), la Presidencia


del Consejo de Ministros, con fecha 18 de febrero de 2021, dispuso la
reglamentación del Decreto Legislativo 1412, documento que aprobó la Ley de

43
Gobierno Digital y estableció lineamientos sobre las condiciones, requisitos y
explotación de las tecnologías digitales y medios electrónicos en el procedimiento
administrativo, reguló las actividades de gobernanza y gestión de las tecnologías
digitales en los organismos de la administración pública en materia de
modernización digital, y estableció el esquema jurídico aplicable al uso transversal
de las TI en la digitalización de los procesos y prestaciones de servicios
tecnológicos en los tres niveles de la estructura actual del Gobierno.

g. Teniendo en cuenta el Decreto de Urgencia 006-2020 (2020), el Poder Ejecutivo,


con fecha 8 de enero de 2020, dispuso la conformación del Sistema Nacional de
Transformación Digital (SNTD), con el objetivo de asegurar las acciones entre los
sectores público y privado para que el Gobierno formule lineamientos para todas
las prestaciones y plataformas digitales, tanto públicas como privadas, que se
desarrollen para incrementar la competitividad, generar las condiciones necesarias
para llevar a cabo emprendimientos de negocios, así como para aumentar la
productividad en las regiones al interior del Perú.

h. Teniendo en cuenta el Decreto Legislativo 1412 (2018), el Poder Ejecutivo, con


fecha 12 de setiembre de 2018, dispuso la aprobación de la Ley de Gobierno Digital,
que tiene por objetivo formular el marco jurídico de gobernanza del gobierno digital
para la adecuada administración de la identidad digital, prestaciones digitales,
arquitectura digital, interoperabilidad y protección digital, así como el régimen
legal aplicable a la explotación transversal de las TI en la digitalización de los
procesos y las prestaciones de servicios digitales, por parte de los entes de la
administración pública en los tres niveles de la actual estructura del Gobierno.

i. El Congreso de la República del Perú, con fecha 3 de julio de 2011, dispuso la


aprobación del marco legal que busca asegurar el derecho fundamental a la
seguridad de los datos personales o privados, por medio de un procesamiento
conforme a lo establecido por la Ley, dentro de un marco de respeto por los demás
derechos de los ciudadanos (Ley 29733, 2011).

44
3 CAPÍTULO 3: DESARROLLO DEL PROYECTO
3.1 Diseño de la Solución
3.1.1 Situación actual

Debido a la antigüedad de la actual infraestructura tecnológica, que ya cuenta con


más de 7 años de operatividad ininterrumpida, se hace muy urgente la renovación
de todo el parque informático instalado en centro de datos desde 2017.

La plataforma tecnológica se entregó incluyendo un período de soporte y garantía


de 3 años efectivos, condiciones que vencieron a inicios de 2020, próximo a la alerta
lanzada por motivo de la propagación del virus SARS-CoV-2.

Debido a la obsolescencia de la implementación tecnológica, varios de los


componentes instalados están presentando fallos en su funcionamiento, que están
poniendo en riesgo la operatividad y disponibilidad de las aplicaciones de red que
dan soporte sistémico a la gestión administrativa de la entidad.

Por lo mismo, se debe señalar los problemas actuales con el sistema de respaldos o
copias de la información, debido a que uno de los cabezales de escritura del
dispositivo HPE está prácticamente defectuoso desde hace más de 4 años, por lo
que solo uno está a cargo de la contingencia de la información en cintas magnéticas,
que siendo realistas también está presentando fallas eventualmente. Por ello, se
tiene un alto riesgo en las tareas de recuperación de los datos ante una eventualidad
que se presente cuando se requiera restablecer información histórica.

Asimismo, se debe destacar que el sistema de videovigilancia interna, que se


compone de 3 cámaras de seguridad, presenta fallas en 2 de ellas desde hace más
de un año, así como el dispositivo de grabación de los eventos (NVR) que no
responde adecuadamente cuando se intenta acceder a los contenidos de video. Por
ello, con solo una cámara no se tiene visualización completa del recinto, con lo que
no se puede hacer un seguimiento detallado de los eventos al interior del centro de
datos.

Si llegara a fallar por completo el compartimento del chasis, a pesar de ser un


componente pasivo, que soporta las fuentes de poder, los 8 nodos o servidores de
producción, los 2 equipos de conectividad, entre otros, prácticamente el centro de

45
datos dejaría de funcionar con lo que quedaría totalmente inhabilitado para
proporcionar los servicios básicos de red.

La degradación física del hardware se acentúa luego de los 3 o 4 años de


operatividad de los equipos, con lo que se pone en gran riesgo la disponibilidad y
la integridad de los recursos informáticos desplegados en la red institucional.

Luego de vencidos el soporte y la garantía contractuales del equipamiento, el centro


de datos no ha recibido ningún servicio de inspección, mantenimiento preventivo o
actualización, debido, inicialmente, en gran parte a los problemas mundiales
ocasionados por la pandemia del COVID-19 desde inicios de 2020 y,
posteriormente, a causa de los cambios constantes de jefatura y negligencia de las
gestiones a cargo.

También, se debe informar los problemas con el sistema de almacenamiento 3PAR,


que se conforma de discos duros mecánicos, dentro de la arquitectura tecnológica,
que son muy lentos durante las solicitudes de escritura y lectura de la información,
además de los inconvenientes que se experimenta con el espacio libre del actual
fileserver, que no cuenta con mantenimiento o actualización desde su
implementación.

Todo el equipamiento instalado en el centro de datos ya alcanzó la vida útil de


operación y vigencia tecnológica, por lo que los componentes o repuestos ya no se
fabrican ni comercializan a nivel mundial, salvo algunos, con lo que es casi
imposible encontrarlos en el mercado, salvo que haya algún saldo disponible en los
almacenes locales de los proveedores asociados a la marca.

A inicios del año 2022, para paliar en alguna medida la falta de apoyo por parte del
fabricante del hardware y software, se continuó con el proceso de renovación del
soporte y garantía del equipamiento de centro de datos, a través de la solicitud de
adquisición del servicio de mantenimiento preventivo y correctivo de la plataforma
tecnológica.

Debido a la impugnación de uno de los dos postores durante el proceso respectivo,


que apeló aduciendo que el ganador no estaba cumpliendo con los requisitos de
calificación de los especialistas, el Tribunal de Contrataciones del Estado, luego de
una corta deliberación, dejó a criterio de ITP la absolución del caso, por lo que la

46
entidad sentenció en favor de la anulación de oficio del mencionado pedido de
servicio.

A continuación, se menciona en forma resumida los eventos acontecidos en todo


este período de 7 años de servicio ininterrumpido, cumplidos entre fines de febrero
e inicios de marzo de 2024:

 Reemplazo por garantía de la solución de respaldos en cinta, que estuvo


presentando fallas durante el proceso de las copias de información, a los pocos
años de haber iniciado el sistema.
 Cambio por garantía de una de las dos controladoras que se encargan de
gestionar la solución de almacenamiento centralizado SAN (Storage Attached
Network).
 Reemplazo por garantía de los dos dispositivos de contingencia energética
(UPS), que mantienen energizados el clúster de servidores y el almacenamiento
SAN, ya que las baterías no respondían con los tiempos de tolerancia
establecidos.
 Cancelación de la adquisición de uno de los cabezales de escritura (drive) del
equipo de respaldos de la información, que luego de un largo proceso se indicó
que requería como respaldo el informe técnico de estandarización.
 Caída de uno de los servidores blade del clúster de contingencia, luego de un
mantenimiento programado del sistema eléctrico en planta externa, con lo que
se perdió capacidad de cómputo (CPU) y almacenamiento en memoria (RAM).
 Cancelación del servicio de mantenimiento general de sala de servidores y
sistema de ventilación de precisión, luego que el proveedor no atendiera el
requerimiento.
 Cancelación del pedido de soporte técnico y garantía extendida del
equipamiento de servidores y almacenamiento, debido a la falta del presupuesto
requerido.
 Cancelación de la adquisición de la solución de grupo electrógeno, cuyo
proceso de compra se truncó por no haberse respetado los plazos indicados en
la normativa actual.
 Anulación de la buena pro otorgada por el nuevo equipamiento en enero del
período 2023 debido, supuestamente, a irregularidades en la documentación
presentada por el proveedor ganador.

47
Actualmente, la plataforma de virtualización está soportada con el despliegue del
siguiente equipamiento de hardware desde el año 2017, la misma infraestructura
que se ha venido describiendo en la sección de la problemática recurrente:

Tabla 5

Infraestructura de centro de datos de Callao

Equipo Características Técnicas Cantidad


Device Bays : Half-Height Blade Servers (x8) 1
HPE BladeSystem Insight Display : BladeSystem c7000 Insight Display
c7000 Enclosure G3 Fan : Active Cool 200 Fan (x10)
Power Supply : HP 2650W HE PSU (x6)
CPU : Intel Xeon CPU E5-2630 v3 2.4 GHz (x2) 8
RAM : DIMM DDR4 128 GB
HPE ProLiant BL460c
HDD : SAS 300 GB RAID 1 (x2)
Gen9
Array Controller : Smart Array P244br
NIC : 10 Gbps (x2)
HPE BladeSystem 2
c7000 Onboard
Administrator
Subtype : 10 Gigabit Ethernet 2
MAC Table Size : 8K entries
HP VC FlexFabric Ports : 16 x 10Gb Ethernet (backplane) + 4 x 10Gb Ethernet/8Gb Fibre
10Gb/24-Port Module Channel SFP+
Fibre Channel : FC-AL, FC-AL-2, FC-FG, FC-FLA, FC-GS, FC-GS-2, FC-GS-3, FC-
PH
Controller Nodes : 2 1
Processors : 6-core 2.2 GHz (x2)
Total Cache : 832 GiB
Cache per node : 832 GiB
HPE 3PAR StoreServ
Max Host Ports : 12 ports
8000 Storage
RAID Levels : 0, 1, 5, 6
Drive Capacities : 600 GB SAS 15 K SFF HDD (x24)
4 TB SAS 7.2 K LFF HDD (x48)
Total Capacity : 180 TB
CPU : Intel Xeon 2.2 GHz 1
HPE ProLiant DL360 RAM : 32 GB
Gen9 HDD : SAS 1 TB (x2)
NIC : 1 Gbps (x4)
CPU : Intel Xeon 2.2 GHz 1
HPE ProLiant DL180 RAM : 16 GB
Gen9 HDD : SAS 1 TB (x4)
NIC : 1 Gbps (x2)
CPU : Intel Xeon 2.2 GHz 1
HPE ProLiant DL120 RAM : 16 GB
Gen9 HDD : SAS 1 TB
NIC : 1 Gbps (x2)
CPU : Intel Xeon 3.5 GHz 2
LENOVO System X RAM : 8 GB
3250 M5 HDD : SAS 300 GB
NIC : 1 Gbps (x2)
CPU : Intel Xeon 3.1 GHz 1
HP ProLiant DL320e RAM : 4 GB
Gen8 HDD : SAS 1 TB
NIC : 1 Gbps (x2)

48
Equipo Características Técnicas Cantidad
HPE MSL2024 0- 1
Drive Tape Library
HPE R7000 4U IEC- 2
32A HV INTL UPS
HIREF Air 2
Conditioner

Por un lado, en forma resumida, se puede apreciar en la siguiente imagen la


capacidad de cómputo total de la infraestructura de centro de datos, que representa
el total de la fuerza bruta (CPU, RAM y HDD) puesta a disposición para el soporte
de la plataforma de los servicios de red de la entidad:

Figura 12

Capacidad de cómputo general de la plataforma convencional

Por otro lado, la plataforma tecnológica se sostiene con la instalación de un chasis


o enclosure con 8 nodos físicos (servidores de producción), que se encuentran
configurados en un cluster con el fin de proporcionar altos niveles de rendimiento
a la funcionalidad de los sistemas.

La tecnología de clustering permite asegurar la vigencia de los servicios de red, en


caso uno de los host o nodos experimente caídas o fallos en su funcionamiento
general, permitiendo que las máquinas virtuales contenidas puedan ser ejecutadas
en los ambiente de los equipos restantes, aprovechando los recursos necesarios.

Por lo mismo, todos los nodos son uniformes en cuanto a la configuración de la


composición técnica de las características de procesamiento, memoria,
almacenamiento y conectividad, que es un requisito fundamental para la integración
de la solución de clustering.

49
En la siguiente imagen, se puede apreciar en forma resumida el consumo de los
recursos por las más de 70 máquinas virtuales generadas que se están ejecutando
para la consolidación de los recursos de red (aplicaciones y bases de datos):

Figura 13

Resumen de los recursos de CPU y RAM de la plataforma

De igual forma, en cuanto a los espacios de almacenamiento asignado y disponible


en disco, la siguiente imagen muestra las cuotas de los volúmenes de disco para
cada caso, donde se puede apreciar que un 61% del espacio ha sido asignado, luego
de todo este largo período de trabajo ininterrumpido de 7 años:

Figura 14

Capacidad de almacenamiento asignada y libre

Así, en cuanto a lo que se refiere al diseño de la solución, se debe indicar que se va


a formular una plataforma que sirva de infraestructura informática de soporte para

50
la instauración de una línea de producción de aplicaciones de información haciendo
uso de las tecnologías de la IA en la que, inicialmente, se va a recopilar todos los
contenidos de una materia en concreto (insumo temático), los que, posteriormente,
van a ser sometidos a un proceso de tokenización y vectorización en la fase de
entrenamiento haciendo uso de la potencia de los GPU para generar las unidades
de información, cuyos resultados van a ser almacenados en una base de datos
vectorial para, luego, con las consultas (queries) realizadas van a ser
contextualizadas u homologadas, junto a los prompts de los usuarios, por algún
modelo de lenguaje (LLM) para, finalmente, ser consumidos por los interesados a
través de los asistentes o agentes desplegados, que van a ser publicados en la red
por medio de una aplicación basada en tecnología de contenedores y plataformas
especialmente diseñadas para procesar las solicitudes de entrada.

En forma resumida, en la siguiente imagen se muestra una sinopsis de la línea de


producción con los distintos componentes de la infraestructura de desarrollo,
bastante conocidos en la industria informática, para la presente propuesta
tecnológica:

Figura 15

Ciclo de producción de aplicaciones LLM

51
3.1.2 Análisis del diseño tecnológico

[Link] Escenarios posibles de desarrollo

Para iniciar con el diseño conceptual de la solución definitiva, se debe


obligatoriamente determinar en detalle el resultado que se desea lograr con la
propuesta tecnológica en curso, adicionalmente al objetivo planteado previamente,
que busca conformar una infraestructura de alto poder de cómputo por gráfica para
la producción de aplicaciones LLM con el aprovechamiento de los millones de
parámetros almacenados en los modelos de lenguaje fundacionales.

Por ello, se debe resaltar que, aparte de la planificación de una plataforma


tecnológica con procesamiento por gráfica (GPU) basada en arquitectura
hiperconvergente (HCI), que es el eje principal del presente proyecto, se
implementará con el despliegue indicado una capa adicional consistente en una
amplia gama de herramientas avanzadas de Deep Learning para el desarrollo de
aplicaciones de IA personalizadas con el entrenamiento, enriquecimiento y
publicación de grandes modelos de lenguaje, contando, para ello, opcionalmente,
con los catálogos de modelos de código abierto disponibles en repositorios públicos
como, por ejemplo, Hugging Face ([Link]

Además, con la identificación del requerimiento anterior, se puede estar pensando


en la implementación de una plataforma más ambiciosa que trabajaría en un entorno
de desempeño más potente como podría ser un escenario de producción multi-LLM,
en el cual los resultados o salidas se verían enriquecidos a un nivel mayor con el
aporte de la consistencia, fiabilidad y precisión semántica de cada repositorio LLM
individual para una inferencia más relevante.

Así, sin escatimar otros posibles escenarios para la producción de LLMs


potenciados con fuentes de datos de gran calidad para un resultado más eficaz, que
supere las expectativas en el corto plazo, el proyecto actual se enfocará en el
procesamiento masivo de millones de unidades de tokens, dejando de lado
aplicaciones destinadas a los sectores doméstico y del entretenimiento, que no son
los objetivos de este caso en particular, donde se requerirá un equipamiento
tecnológico avanzado casi de nivel industrial dada la envergadura del proyecto.

52
También, se debe recalcar que se busca producir sistemas que proporcionen
información con altos niveles de predictibilidad, cuyos resultados puedan servir de
respaldo técnico para la toma de decisiones de emprendimiento en el campo
empresarial con el menor riesgo financiero buscando incrementar la productividad
en las distintas cadenas productivas que se atienden.

Con el despliegue de la presente propuesta se va a implantar una línea de desarrollo


de sistemas predictivos de información, aplicando tanto tecnología RAG, donde se
va a enriquecer el entrenamiento de los modelos con datos propios que los
especialistas van a generar desde distintas fuentes, como fine-tuning para
reentrenamiento de los modelos de lenguaje fundacionales de código abierto con
información incremental, que se considere relevante para el caso de uso, a fin de
generar finalmente un paquete de información con parámetros de gran calidad
semántica para mejorar la precisión de las salidas de inferencia, donde, también, se
apliquen criterios de valor estadístico y probabilístico.

[Link] Definición de los criterios de selección

Así, siendo los modelos de lenguaje una pieza fundamental para el proyecto, se han
establecido los siguientes criterios técnicos que deben cumplir para su
consideración en la implementación, los mismos que tienen su base legal en el
Artículo 4 (Principios rectores para el uso y desarrollo de la inteligencia artificial),
cuyo texto completo se puede revisar en el Anexo B, considerado en el proyecto del
Reglamento de la Ley 31814, a saber:

a. Personalización del modelo. Los modelos deberán tener un alto nivel de


flexibilidad para adaptarse a las exigencias y demandas de los proyectos de
desarrollo, con lo que se ajustarán a las necesidades propias de la entidad.

b. Soporte de la comunidad. El modelo deberá contar con el apoyo de los


miembros de la comunidad a fin de asegurar el acceso a distintos recursos de ayuda
como foros y documentación para lograr una eficiente resolución de problemas que
pudieran presentarse durante el desarrollo de las aplicaciones de IA.

53
c. Ahorro de costos. Los modelos de lenguaje no deberán representar un
significativo costo en cuanto a las licencias de uso, para no afectar las asignaciones
presupuestales que se destinarán a los proyectos de implementación.

d. Privacidad de los datos. En cumplimiento de la Ley 29733, mencionada en


Bases Legales, los modelos de lenguaje no deben atentar contra la privacidad del
usuario mediante cualquier exposición indiscriminada de sus datos personales que
pudiera afectar su integridad como ciudadano de pleno derecho.

e. Transparencia del código. El modelo deberá permitir un profundo análisis de


su codificación sin restricciones, permitiendo con ello el conocimiento exhaustivo
de las características y funcionalidades intrínsecas para su explotación posterior.

f. Interoperabilidad sistémica. El modelo de lenguaje deberá estar implementado


para una fácil y rápida integración sistémica con otras tecnologías para permitir el
intercambio de información en un entorno consolidado de desarrollo.

g. Seguridad de los parámetros. El modelo de código abierto deberá asegurar que


los parámetros hayan sido ajustados adecuadamente durante el entrenamiento,
procurando haber sido sometidos a revisiones de calidad para evitar la presencia de
cualquier sesgo que pudiera resultar ofensivo.

h. Responsabilidad ética. El modelo deberá ceñirse a las normas éticas de la


industria para evitar cualquier infracción o violación a la moral durante el consumo
de los servicios que se pondrán a disposición del público en la plataforma
tecnológica.

i. Precisión inferencial. Los modelos de código abierto deberán haber sido


implementados con varios millones de datos durante su entrenamiento para
garantizar una mayor congruencia semántica frente a las complejas y exigentes
consultas que demandarán información altamente confiable.

j. Rendimiento del modelo. Los modelos se deberán analizar con los coeficientes
alcanzados en las evaluaciones concernientes a la fluidez del idioma, coherencia
semántica, comprensión del contexto y precisión en las respuestas.

k. Dominio de campo. Se deberá considerar si se requieren modelos de lenguaje


que resuelvan casos de uso muy precisos o paquetes de trabajo que abarquen un
espectro más amplio de soluciones.
54
l. Calidad de los datos. Se deberá evaluar la composición y estructura de los datos
con los cuales los modelos fueron entrenados preliminarmente, así como las fuentes
de información proporcionadas por los mismos especialistas de la institución para
asegurar un resultado más óptimo.

[Link] Definición de las métricas de rendimiento (benchmarks)

Debe mencionarse que en el mercado de la IA se han diseñado varias métricas


(benchmarks) que son usados para determinar aspectos clave de la precisión y
confiabilidad de los modelos y algoritmos de inteligencia generativa. Así, los
benchmarks son conjuntos de pruebas estandarizadas que se han formulado para
analizar el rendimiento de los modelos de lenguaje. Constan de un conjunto de
tareas o desafíos que son aplicados a los modelos para conocer su desempeño en
aspectos básicos como conocimiento general, comprensión especializada de un
tema, entendimiento del contexto, razonamiento lógico, razonamiento matemático,
abstracción conceptual, entre otros. Así, entre los benchmarks de desempeño más
importantes, que se tendrán en cuenta para calificar a los modelos de lenguaje, se
pueden citar a los siguientes:

a. MMLU (Massive Multitask Language Understanding o Comprensión del


Lenguaje Multitarea Masiva). Conjunto de pruebas que miden el nivel de
conocimiento adquirido por un modelo en su etapa de entrenamiento. La métrica
comprende 16,000 preguntas de opción múltiple que abarcan 57 campos de estudio
(matemática, derecho, historia, filosofía, economía, medicina, entre otros). Su
finalidad es evaluar el razonamiento sobre temas complejos, la resolución de
problemas y el desenvolvimiento en distintos contextos de comunicación.

b. GPQA (Graduate-Level Google-Proof Q&A o Preguntas y Respuestas a


Prueba de Google a Nivel de Posgrado). Conjunto de ensayos desarrollados para
medir los instrumentos de supervisión y cognición de los modelos de lenguaje. Esta
métrica consta de 448 interrogantes de opción múltiple relacionadas a los campos
de la química, física y biología. Su finalidad es analizar la capacidad de

55
comprensión y razonamiento del modelo de lenguaje en campos tan complejos y
desafiantes del conocimiento humano.

c. GSM8K (Generative Semantic-Masked 8K Images o Imágenes Generativas


Semánticamente Enmascaradas de 8K). Conjunto de pruebas con contenidos
visuales en alta resolución de 8K que miden la capacidad del modelo en los
procesos de generación de imágenes. La métrica consta de 10 millones de gráficos
con regiones incompletas que el modelo debe procesar para generar imágenes
congruentes, de acuerdo al contexto. La finalidad es evaluar el nivel de
comprensión que tiene el modelo sobre los datos enmascarados y la capacidad de
razonamiento que debe desenvolver para superar el desafío.

d. HumanEval (Evaluación Humana). Conjunto de pruebas que se realizan sobre


un modelo de lenguaje contando con la intervención humana. Con la supervisión
personal se miden varios aspectos técnicos como el grado de eficiencia, precisión y
fiabilidad durante las tareas asignadas al modelo de lenguaje. La finalidad de la
métrica es evaluar los niveles de aprendizaje y respuesta del modelo en diferentes
contextos, pero a través de la supervisión humana.

e. BIG-Bench-Hard (BBH). Conjunto de pruebas que se encargan de medir los


niveles de inferencia lógica y comprensión gramatical alcanzados por un modelo
de lenguaje en la resolución de problemas que no fueron superados en etapas
previas de su evaluación. Esta métrica comprende un total de 23 trabajos muy
desafiantes que van más allá de las capacidades de los modelos de lenguaje. La
finalidad de los desafíos es evaluar las capacidades de razonamiento lógico frente
a situaciones complejas del entorno.

f. MATH (Mathematics for Artificial Thinking in Human-like fashion o


Matemáticas para el pensamiento artificial al estilo humano). Conjunto de pruebas
diseñadas para medir el nivel de razonamiento de los modelos de lenguaje en la
resolución de problemas matemáticos, que han sido entrenados con datos
provenientes de ramas como la ingeniería y las finanzas. Esta métrica se encarga de
evaluar el grado de comprensión de conceptos abstractos, representación de
símbolos y razonamiento profundo.

g. ARC-Challenge. Conjunto de tareas formuladas que se encargan de medir los


niveles de razonamiento de los modelos de lenguaje sobre problemas relacionados

56
con el lenguaje natural. Esta métrica se encarga de evaluar la capacidad de los
modelos en cuanto a comprensión de las relaciones entre objetos y personas, las
relaciones de causa y efecto, la complejidad del lenguaje natural y las reglas de la
lógica.

h. WinoGrande. Conjunto de preguntas que se encargan de medir el grado de


comprensión de un modelo de lenguaje sobre las ambigüedades conceptuales o
inexactitudes semánticas. Consta de una serie de casos que se encargan de evaluar
el nivel de entendimiento del lenguaje natural, así como la capacidad de
razonamiento ante situaciones complejas.

i. HellaSwag. Conjunto de pruebas que se llevan a cabo para medir el nivel de


coherencia de los contenidos generados por los modelos de lenguaje, que han sido
entrenados previamente con grandes volúmenes de libros, artículos y contenido
web. La finalidad de estas pruebas es determinar el grado de congruencia del texto,
la fluidez del estilo lingüístico, la precisión gramatical y la originalidad creativa del
modelo de lenguaje.

j. DROP. Conjunto de pruebas que se encargan de medir el nivel de precisión y


fluidez de los modelos de lenguaje ante preguntas complejas, donde la precisión
evalúa la proporción de las respuestas absueltas correctamente, mientras que la
fluidez, la facilidad de comprender y leer las respuestas. Se basa en un sistema de
penalizaciones que sanciona las respuestas que son demasiado cortas o que
presentan errores gramaticales.

k. MLPerf. Conjunto de pruebas que se encargan de medir el rendimiento de los


componentes de hardware y software que son usados en los sistemas para
desarrollar grandes modelos de lenguaje. Esta métrica se encarga de evaluar la
velocidad y la eficiencia de los sistemas durante los procesos de entrenamiento y
ejecución de los modelos con el uso de grandes volúmenes de datos.

[Link] Evaluación de los modelos de lenguaje

En consecuencia, atendiendo a los criterios mencionados, en el cuadro siguiente se


analizará la cantidad de parámetros, tamaño y tipo de licencia de algunos modelos

57
LLM de código abierto y propietarios más populares de la red, con los que se podrá
empezar a desarrollar las aplicaciones aprovechando su entrenamiento previo:

Tabla 6

Listado de modelos grandes de lenguaje

Modelo Fecha Empresa Parámetros Tamaño Licencia


3.3 mil millones de
BERT 2018 Google 340 millones Apache 2.0
palabras
33 mil millones de
XLNet 2019 Google ~340 millones
palabras
40GB (~10 mil
GPT-2 2019 OpenAI 1.5 mil millones MIT
millones de tokens)
175 mil 499 mil millones de API web
GPT-3 2020 OpenAI
millones tokens pública
GPT-Neo Marzo de 2021 EleutherAI 2.7 mil millones 825 GiB MIT
GPT-J Junio de 2021 EleutherAI 6 mil millones 825 GiB Apache 2.0
Megatron-Turing 530 mil 338.6 mil millones Acceso web
Octubre de 2021 Microsoft y Nvidia
NLG millones de tokens restringido
Diciembre de 260 mil
Ernie 3.0 Titan Baidu 4 Tb Patentado
2021 millones
Diciembre de 400 mil millones de
Claude Anthropic 52 mil millones Beta cerrada
2021 tokens
GLaM (Generalist Diciembre de 1.6 trillones de
Google 1.2 trillones Patentado
Language Model) 2021 tokens
Diciembre de 280 mil 300 mil millones de
Gopher DeepMind Patentado
2021 millones tokens
1.56T de
137 mil
LaMDA Enero de 2022 Google palabras, 168 mil Patentado
millones
millones de tokens
GPT-NeoX Febrero de 2022 EleutherAI 20 mil millones 825 GiB Apache 2.0
1.4 trillones de
Chinchilla Marzo de 2022 DeepMind 70 mil millones Patentado
tokens
PaLM (Pathways 540 mil 768 mil millones de
Abril de 2022 Google Patentado
Language Model) millones tokens
OPT (Open
175 mil 180 mil millones de Investigación no
Pretrained Mayo de 2022 Meta
millones tokens comercial
Transformer)
100 mil
YaLM 100B Junio de 2022 Yandex 1.7TB Apache 2.0
millones
38.5B de tokens de
540 mil páginas web filtradas
Minerva Junio de 2022 Google Patentado
millones de contenido
matemático
Colaboración 175 mil 350 mil millones de
BLOOM Julio de 2022 IA responsable
de Hugging Face millones tokens
Noviembre de 120 mil 106 mil millones de
Galactica Meta CC-BY-NC-4.0
2022 millones tokens
AlexaTM (Teacher Noviembre de API web
Amazon 20 billones 1.3 trillones
Models) 2022 pública
LLaMA (Large
Language Model Febrero de 2023 Meta 65 mil millones 1.4 trillones
Meta AI)
API web
GPT-4 Marzo de 2023 OpenAI ~1 billón Desconocido
pública
Cerebras-GPT Marzo de 2023 Cerebras 13 mil millones Apache 2.0

58
Modelo Fecha Empresa Parámetros Tamaño Licencia
Technology 1 trillón de tokens
Falcon Marzo de 2023 40 mil millones Patentado
Innovation Institute (1TB)
363 mil millones de
BloombergGPT Marzo de 2023 Bloomberg L.P. 50 mil millones Patentado
tokens
329 mil millones de
PanGu-Σ Marzo de 2023 Huawei 1.085 billones Patentado
tokens
1.5 mil millones de
OpenAssistant Marzo de 2023 LAION 17 mil millones Apache 2.0
tokens
Llama 2
7 mil millones
Community
LLaMA 2 Julio 2023 Meta 13 mil millones
License
70 mil millones
Agreement
Llama 2
8 mil millones 15 mil millones de Community
LLaMA 3 Abril 2024 Meta 70 mil millones tokens License
Agreement
Nota. Adaptado de “Modelo de lenguaje grande”, por Wikipedia, s.f.-b.
([Link]

De igual forma, se asumirá como marco referencial la tabla de clasificación de


rendimiento por LLM, conocida como LLM-Perf Leaderboard de Hugging Face,
tal como se aprecia en la Figura 16, donde se evalúan varias características técnicas
como uso de memoria, cantidad de parámetros, arquitectura, tokens por segundo,
formato de coma flotantes, entre otras, las cuales se van a ponderar para seleccionar
los modelos de lenguaje con las estructuras que se correspondan con las más altas
puntuaciones alcanzadas en dicho ránking.

Con dicho marco referencial, se asegurará que los modelos elegidos, con los
aspectos mencionados, están cumpliendo con varios de los criterios técnicos para
un despliegue más eficiente de las aplicaciones de IA bajo la plataforma tecnológica
de la entidad, por lo que en la siguiente imagen se alcanza una reducida muestra de
los modelos open source que ocupan las primeras posiciones:

59
Figura 16

Tabla de clasificación de LLMs open source

Nota. Adaptado de “LLM-Perf Leaderboard. Hugging Face”, por Hugging Face, s.f.
([Link]

Como puede apreciarse en la imagen anterior, se destacan los modelos basados en


las arquitecturas Mistral y LLaMA, que han sido evaluados con el uso del
framework PyTorch teniendo en cuenta los formato de precisión FP16 y FP32.

Se debe mencionar que las pruebas de entrenamiento previas se han realizado


haciendo uso de la gráfica NVIDIA A100 (80GB), cuyas características técnicas

60
adicionales se mostrarán en los apartados posteriores junto a otras alternativas de
GPU de la misma marca en mención.

Por ello, con el sustento técnico de las evaluaciones anteriores de los modelos de
código abierto, se ha hecho una primera selección con las implementaciones más
relevantes, cuyas características principales se detallan a continuación:

a. LLaMA 2. Este proyecto de Meta es una familia de modelos de lenguaje LLM


previamente procesados para su aplicación directa en los proyectos de IA
generativa. Fue liberado en formato de código abierto en 2023 para su uso en los
campos de la investigación, así como para uso comercial, con capacidades para
cubrir las tareas de procesamiento de lenguaje natural, que van desde la generación
de textos hasta la formulación de código de programación.

Soporta una ventana de contexto de 4 096 tokens, que el modelo puede mantener
en memoria durante la fase de inferencia para permitirle sostener una interacción
compleja y fluida con el usuario. Fue entrenado con un 40% más de datos que su
antecesor LLaMA 1, lo que significó un incremento de la base de conocimiento y
la comprensión semántica.

En la siguiente imagen pueden apreciarse las puntuaciones alcanzadas en varias


métricas durante el período de evaluación:

Figura 17

Rendimiento de LLaMA 2

Nota. Adaptado de “Llama 2: open source, free for research and commercial use”, por Meta, s.f.
([Link]

61
b. LLaMA 3. A diferencia de LLaMA 2 implementa un sistema de tokenización
que faculta el despliegue de un vocabulario de 128,000 tokens, con lo que codifica
el lenguaje mucho más eficientemente favoreciendo un alto rendimiento al modelo.

Se presenta en tres distintos formatos actualmente, una primera con 8B de


parámetros, una segunda con 80B de parámetros y, una tercera, con 400B de
parámetros, que se lanzará próximamente.

Ha sido entrenado previamente con un total de 15T de tokens, que han sido
recolectados con datos provenientes de diferentes fuentes públicas, con lo que la
alta calidad de los mismos asegura un mejor resultado en más de 30 idiomas.

Para el entrenamiento del modelo se han empleado tres tipos distintos de


paralelización, a saber, paralelización de datos, paralelización de modelos y
paralelización de canalización.

Asimismo, la precisión de los datos está garantizada con la implementación de tres


filtros fundamentales, siendo estos, los filtros heurísticos, los enfoques de
deduplicación semántica y los clasificadores de texto.

La siguiente imagen muestra las puntuaciones alcanzadas por el modelo en varias


métricas durante el período de evaluación:

Figura 18

Rendimiento de LLaMA 3

Nota. Adaptado de “LLaMA 3 Model Card”, por GitHub, s.f. ([Link]


llama/llama3/blob/main/MODEL_CARD.md/)

62
c. Falcon. Se ha convertido en una de las implementaciones de inteligencia artificial
más avanzadas de código abierto. Este modelo se presenta en la red con las variantes
de 180B, 40B, 7.5B y 1.3B, gracias a las cuales permite afrontar retos complejos
durante la puesta en marcha de muchas aplicaciones.

Su especial arquitectura de diseño lo ha dejado más que optimizado para cumplir


con las tareas relacionadas a la inferencia lingüística, lo cual lo convierte en líder
frente a otros rivales del mercado.

Ha sido entrenado previamente con un volumen cercano al billón de tokens, con el


soporte de una moderna infraestructura compuesta de los más avanzados
aceleradores gráficos.

Puede ser usado para implementar aplicaciones en varios campos vinculados a la


traducción automática, generación de texto, inferencia semántica y análisis de
sentimientos.

En la siguiente imagen pueden apreciarse las puntuaciones alcanzadas en varias


métricas durante el período de evaluación:

Figura 19

Rendimiento de Falcon

Nota. Elaborado a partir de “The Falcon Series of Open Language Models”, por E. Almazrouei et al., 2023.
([Link]

d. Mistral. Este modelo europeo se caracteriza por su especialización en trabajos


complejos como generación de código y comprensión de texto con el manejo de

63
una amplia cartera de idiomas, con lo que destaca por la potencia y capacidad de
retención gracias a la integración de una ventana de contexto de 32,000 tokens.

Se presenta en dos formatos o variantes bien definidos, a saber, Mistral Large y


Mistral Small, estando esta última diseñada para mantener una alta eficiencia en las
respuestas rápidas y complejas con un consumo bajo de recursos computacionales.

La siguiente imagen muestra las puntuaciones alcanzadas por el modelo en varias


métricas durante el período de evaluación:

Figura 20

Rendimiento de Mistral

Nota. Elaborado a partir de Mistral AI (2023a), Mistral AI (2023b), Mistral AI (2024a) y Mistral AI (2024b).

[Link] Evaluación del procesamiento paralelo

De igual forma, ya que se requiere aprovechar las características computacionales


del procesamiento en paralelo con tecnologías como NVIDIA NVLink y NVIDIA
NVSwitch, dentro de un mismo host, y NVIDIA GPUDirect RDMA (Remote Direct
Memory Access), entre distintos hosts, para contar con un mayor rendimiento en los
procesos vinculados al entrenamiento, reentrenamiento e inferencia con millones
de parámetros bajo un esquema multi-LLM y multi-GPU, se requiere la
implementación de una red de datos de alta velocidad y baja latencia, posiblemente
basada en tecnología InfiniBand (en sus versiones HDR, NDR o XDR) o Ethernet
de alto rendimiento en la infraestructura de comunicaciones con tasas de

64
transmisión comprendidas entre los 200Gbps y 400Gbps, para garantizar el
balanceo y la distribución de las pesadas cargas de trabajo en esquemas de
configuración que implementen más de un GPU en distintos nodos de
procesamiento de la solución de clúster.

Por ello, atendiendo al requerimiento anterior, la tabla siguiente describe las


distintas tasas de transmisión de los datos que se pueden alcanzar con la tecnología
InfiniBand en un entorno de IA:

Tabla 7

Tasas de transferencia de InfiniBand

Enlace Tasa de transferencia (Gb/s)


Año
InfiniBand 1x 4x 8x 12x
2001, 2003 SDR 2 8 16 24
2005 DDR 4 16 32 48
2007 QDR 8 32 64 96
2011 FDR10 10 40 80 120
2011 FDR 13,64 54,54 109,08 163,64
2014 EDR 25 100 200 300
2018 HDR 50 200 400 600
2022 NDR 100 400 800 1200
XDR 200 800 1600 2400
A confirmar
GDR 400 1600 3200 4800
Nota. Adaptado de “InfiniBand”, por Wikipedia, s.f.-a. ([Link]

[Link] Evaluación de la tarjeta de video

Para el tipo de trabajo descrito que se requiere ejecutar se debe recalcar que el
componente principal en el que se basará la infraestructura de modelamiento de
datos es la unidad de procesamiento gráfico o GPU, tal como se indicó, por lo que
para lograr altos ratios en la transferencia de los datos durante las diferentes etapas
del desarrollo se va a requerir de alternativas tecnológicas de última generación que
presenten las mayores capacidades de rendimiento, versatilidad y escalabilidad.

En esa línea, se debe mencionar que muchos de los grandes modelos de lenguaje
cuando se cargan ocupan un considerable espacio en memoria de video, debido a
los voluminosos parámetros con los que han sido empaquetados.

65
Por ello mismo, se requerirá contar con una infraestructura tecnológica que cuente
con una VRAM de 50GB a 80GB en promedio en la tarjeta gráfica, lo
suficientemente considerable para soportar la carga de varios modelos de lenguaje
en forma simultánea, con el fin de proyectar un ambiente de trabajo con la
configuración de un esquema del tipo multi-LLM en la plataforma, como se
mencionó anteriormente, que permita en forma conjunta un mayor nivel de
precisión en los resultados.

Por lo indicado, puede distinguirse en la Figura 16 que un solo modelo de lenguaje,


por ejemplo, cloudyu/Mixtral_11Bx2_MoE_19B, ocupa un espacio de 80GB en la
memoria de video, por lo que dicha variable se tendrá en cuenta para la selección
de la tecnología de gráfica.

Para atender esos requerimientos, en el mercado de la computación acelerada y de


gama alta, NVIDIA cuenta con los procesadores de la serie A16, A30, A40, A100,
L40, H100, entre otros, especializados en el campo de la IA generativa, que han
sido diseñados con características técnicas destacables para la ejecución de cargas
de trabajo tan complejas y demandantes, tal como se describen en la siguiente tabla:

Tabla 8

Procesadores gráficos para computación de alta gama

Marca Modelo Memoria Potencia Máxima Factor de forma Carga de trabajo


Factor de Forma - Adaptador PCIe
NVIDIA A16 64GB GDDR6 250W DW - FHHL VDI
NVIDIA A40, L40 48GB GDDR6 300W DW - FHHL Gráfica | Carga de trabajo múltiple
NVIDIA A30 24GB HBM2e 165W DW - FHHL Inferencia | Entrenamiento
NVIDIA A100, A800 80GB HBM2e 300W DW - FHHL Inferencia | HPC | Entrenamiento
NVIDIA H100 80GB HBM2e 300W - 350W DW - FHHL Inferencia | HPC | Entrenamiento
AMD MI210 64GB HBM2e 300W DW - FHHL HPC | Entrenamiento
Intel Max 1100 48GB HBM2e 300W DW - FHHL HPC | Entrenamiento
Intel Flex 140 12GB GDDR6 75W SW - HHHL | FHHL Entrenamiento
Factor de Forma SXM/OAM - no soportado en R760xa
NVIDIA HGX A100 80GB HBM2 500W SXM con NVLink HPC | Entrenamiento
NVIDIA HGX H100 80GB HBM3 700W SXM con NVLink HPC | Entrenamiento
Intel Max 1550 80GB HBM2e 600W OAM con XeLink HPC | Entrenamiento
Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “AI Solution Architecture”, por Francisco Aguirre, 2024.

66
En esa línea, tratándose de entrenar varios miles de millones de tokens, se requiere
de una avanzada arquitectura de GPU con altas tasas de transmisión de la
información para aprovechar las ventajas del cómputo paralelo, por lo que, para el
caso, se puede considerar una memoria de video (VRAM) con un ancho de banda
cercano a los 1000GB/s para asegurar un canal de gran capacidad durante las etapas
de entrenamiento de los datos, tales como las opciones basadas en las arquitecturas
Ampere, Ada Lovelace y Hopper, que se muestran en la tabla siguiente:

Tabla 9

Características de los GPU A100 (80GB), L40, L40S, H100 (80GB) y H100 NVL

Modelo A100 (80GB) L40 (48GB) L40S (48GB) H100 (80GB) H100 NVL
Arquitectura de GPU Ampere Ada Lovelace Ada Lovelace Hopper Hopper
Velocidad de reloj del GPU 1065~1410MHz 735~2490MHz 1110~2520MHz 1755MHz 1450~1830MHz
Memoria de GPU 80GB 48GB 48GB 80GB 188GB
Ancho de banda de Memoria 1555GB/s 864GB/s 864GB/s 2TB/s 7.8TB/s
Cores CUDA 6912 18176 18176 14592 14592
Cores RT - 142 142 - -
Rendimiento Core RT TFLOPS - 209 209 - -
Cores Tensor 432 568 568 576 576
FP64 TFLOPS 9.7 - - 26 68
Core Tensor FP64 TFLOPS 19.5 - - 51 134
FP32 TFLOPS 19.5 90.5 91.6 51 134
Core Tensor TF32 TFLOPS (with Sparsity) 156 (132) 90.5 (181) 183 (366) 378 (756) 989 (1979)
Core Tensor BFLOAT16 TFLOPS (with Sparsity) 312 (624) 181.05 (362.1) 362.5 (733) 756 (1513) 1979 (3958)
Core Tensor FP16 TFLOPS (with Sparsity) 312 (624) 181.05 (362.1) 362.5 (733) 756 (1513) 1979 (3958)
Core Tensor FP8 TFLOPS (with Sparsity) - 362 (724) 733 (1466) 1513 (3026) 3958 (7916)
Peak INT8 TOPS (with Sparsity) 624 (1248) 362 (724) 733 (1466) 1513 (3026) 3958 (7916)
Peak INT4 TOPS (with Sparsity) 1248 (2496) 724 (1448) 733 (1466) 1513 (3026) 3958 (7916)
NVLink Sí No No Sí Sí
Consumo máximo de energía (W) 300 300 350 350 800
Soporte de Software GPU Virtual (vGPU) Sí Sí Sí Sí Sí
Soporte vGPU Sí Sí Sí Sí Sí
Soporte MIG Sí No No Sí Sí
Generación PCIe PCIe Gen4 x16 PCIe Gen4 x16 PCIe Gen4 x16 PCIe Gen5 x16 PCIe Gen5 x16
Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “NVIDIA L40S”, por NVIDIA, 2023.

De entre los señalados en la tabla anterior, destaca una variante avanzada del
modelo L40, la versión NVIDIA L40S (48GB), que es la más versátil de todas las
enumeradas con una sobresaliente puntuación en las evaluaciones de

67
costo/beneficio, debido a que es una gráfica fabricada para dedicarse a la ejecución
de diversas cargas de trabajo, aparte del entrenamiento de modelos de IA, tales
como gráficos en 3D, edición de video, renderizado, streaming, aceleración de
medios, generación de imágenes, virtualización, entre otras.

Figura 21

Imagen referencial de la GPU NVIDIA L40S (48GB)

De igual forma, otra opción importante es la tarjeta NVIDIA H100, que cuenta con
hasta 188GB de VRAM y está fabricada para ofrecer un buen rendimiento en
trabajos relacionados al entrenamiento e inferencia debido a su arquitectura
Hopper, con la que puede alcanzar hasta 7.8TB/s de ancho de banda.

Asimismo, se debe resaltar que dicha GPU incorpora la tecnología NVLink para el
entrenamiento de los datos aprovechando la potencia del cómputo en paralelo, por
lo que es idónea para para las casuísticas que se van a ejecutar en la plataforma.

Figura 22

Imagen referencial de la GPU NVIDIA H100 (80GB)

68
[Link] Evaluación del rendimiento de los aceleradores

Siguiendo la línea de desarrollo, se continuará con la evaluación de las dos GPU


seleccionadas previamente a fin de identificar el rendimiento real de las alternativas
tecnológicas en las fases de entrenamiento e inferencia aplicando múltiples stacks
de inteligencia generativa.

Antes de continuar, se debe resaltar que calcular valores como el tiempo y el costo,
importantes para las evaluaciones presupuestales en las empresas, relacionados a
los procesos de entrenamiento e inferencia es difícil de estimar, aún ahora, debido
a la cantidad de variables que deben ponderarse teniendo en cuenta los componentes
de hardware y software con sus distintas variantes, por lo que, a pesar de ello, en
los siguientes apartados se dará a conocer algunas comparativas de rendimiento
computacional que involucran los numerosos componentes tecnológicos que se han
ido describiendo a lo largo del proyecto.

Con lo indicado, en la siguiente comparativa se puede apreciar el rendimiento, ya


sea en tokens, muestras, fotogramas, imágenes o moléculas por unidad de segundo,
que se consigue con el entrenamiento de varios modelos del repositorio NVIDIA
GPU Cloud (GPC), tales como Tacotron2, WaveGlow, GNMT v2, NCF,
Transformer XL Large, entre otros, con el uso de los conocidos frameworks
PyTorch y TensorFlow, y el acelerador gráfico NVIDIA H100 de 80GB.

Tabla 10

Rendimiento convergente de NVIDIA H100 con PyTorch y TensorFlow

Tiempo de
Framework Modelo entrenamiento Rendimiento GPU Formato Set de datos Versión del GPU
(días)
PyTorch 2.3.0a0 Tacotron2 67 469,109 mels/s 8x H100 Mixto LJSpeech 1.1 H100 SXM5 80GB
PyTorch 2.3.0a0 WaveGlow 119 3,645,916 muestras/s 8x H100 Mixto LJSpeech 1.1 H100 SXM5 80GB
PyTorch 2.3.0a0 GNMT v2 9 1,699,570 tokens/s 8x H100 Mixto wmt16-en-de H100 SXM5 80GB
PyTorch 2.3.0a0 NCF 0.27 218,094,053 muestras/s 8x H100 Mixto MovieLens 20M H100 SXM5 80GB
PyTorch 2.3.0a0 FastPitch 75 1,331,733 frames/s 8x H100 Mixto LJSpeech 1.1 H100 SXM5 80GB
PyTorch 2.3.0a0 Transformer XL Large 318 262,462 tokens/s 8x H100 Mixto WikiText-103 H100 SXM5 80GB
PyTorch 2.3.0a0 Transformer XL Base 141 952,253 tokens/s 8x H100 Mixto WikiText-103 H100 SXM5 80GB
PyTorch 2.3.0a0 EfficientNet-B4 1,667 5,231 imágenes/s 8x H100 Mixto Imagenet2012 H100 SXM5 80GB
PyTorch 2.1.0a0 EfficientDet-D0 325 2,658 imágenes /s 8x H100 Mixto COCO 2017 H100 SXM5 80GB
PyTorch 2.3.0a0 EfficientNet-WideSE-B4 1,673 5,218 imágenes /s 8x H100 Mixto Imagenet2012 H100 SXM5 80GB
PyTorch 2.2.0a0 TFT-Electricity 2 145,082 items/s 8x H100 Mixto Electricity H100 SXM5 80GB
PyTorch 2.3.0a0 HiFiGAN 948 115,461 mels/s 8x H100 Mixto LJSpeech 1.1 H100 SXM5 80GB
PyTorch 2.3.0a0 GPUNet-0 1,052 9,950 imágenes /s 8x H100 Mixto Imagenet2012 H100 SXM5 80GB

69
Tiempo de
Framework Modelo entrenamiento Rendimiento GPU Formato Set de datos Versión del GPU
(días)
PyTorch 2.3.0a0 GPUNet-1 960 10,946 imágenes /s 8x H100 Mixto Imagenet2012 H100 SXM5 80GB
PyTorch 2.3.0a0 MoFlow 35 46,451 moléculas/s 8x H100 Mixto ZINC H100 SXM5 80GB
Tensorflow 2.13.0 U-Net Medical 1 2,139 imágenes /s 8x H100 Mixto EM segmentation challenge H100 SXM5 80GB
Tensorflow 2.13.0 Electra Fine Tuning 2 5,062 secuencias/s 8x H100 Mixto SQuaD v1.1 H100 SXM5 80GB
Tensorflow 2.13.0 Wide and Deep 4 12,217,033 muestras /s 8x H100 Mixto Click Prediction H100 SXM5 80GB

Nota. Adaptado de “Converged Training Performance on NVIDIA Data Center GPUs”, por NVIDIA, s.f.-a.
([Link]

Asimismo, se tiene la siguiente tabla donde se muestra la capacidad medida en


número de tokens por segundo de los modelos de lenguaje GPT3 y Llama2
procesados en el entorno de la plataforma NVIDIA Nemo, donde se ha trabajado
con la gráfica NVIDIA H100 de 80GB y con una configuración de punto flotante
de precisión FP8.

Tabla 11

Rendimiento de NVIDIA H100 con Nemo

Tiempo de Rendimiento
Framework Modelo GPU Precisión Versión del GPU
entrenamiento (días) por GPU
Nemo 1.23 GPT3 5B 0.5 23,574 tokens/s 64x H100 FP8 H100 SXM5 80GB
Nemo 1.23 GPT3 20B 2 5,528 tokens/s 64x H100 FP8 H100 SXM5 80GB
Nemo 1.23 Llama2 7B 0.7 16,290 tokens/s 8x H100 FP8 H100 SXM5 80GB
Nemo 1.23 Llama2 13B 1.4 8,317 tokens/s 16x H100 FP8 H100 SXM5 80GB
Nemo 1.23 Llama2 70B 6.6 1,725 tokens/s 64x H100 FP8 H100 SXM5 80GB
Nota. Adaptado de “LLM Training Performance on NVIDIA Data Center Products”, por NVIDIA, s.f.-c.
([Link]

También, en la siguiente tabla se proporcionan los ratios de rendimiento calculados


en días de los modelos de IA generativa Stable Diffusion, ResNet-50, 3D U-Net,
BERT, Mask R-CNN y más, haciendo uso de los Frameworks Nemo, MXNet,
PyTorch y NVIDIA Merlin HugeCTR con el procesador gráfico NVIDIA H100 de
80GB.

70
Tabla 12

Rendimiento de NVIDIA H100 con Nemo, MXNet, PyTorch y Merlin (MLPerf)

Tiempo de
Framework Modelo entrenamiento GPU Formato Set de datos Versión del GPU
(días)
Nemo Stable Diffusion 46.8 8x H100 Mixto LAION-400M-filtered H100 SXM5 80GB
MXNet ResNet-50 v1.5 13.4 8x H100 Mixto ImageNet H100 SXM5 80GB
MXNet 3D U-Net 13.1 8x H100 Mixto KiTS19 H100 SXM5 80GB
PyTorch BERT 5.4 8x H100 Mixto Wikipedia 2020/01/01 H100 SXM5 80GB
PyTorch Mask R-CNN 19.2 8x H100 Mixto COCO2017 H100 SXM5 80GB
PyTorch RNN-T 16.2 8x H100 Mixto LibriSpeech H100 SXM5 80GB
PyTorch RetinaNet 36.0 8x H100 Mixto OpenImages H100 SXM5 80GB
NVIDIA Merlin HugeCTR DLRM-dcnv2 3.9 8x H100 Mixto Criteo 4TB H100 SXM5 80GB
Nota. Adaptado de “NVIDIA Performance on MLPerf 3.1’s AI Benchmarks: Single Node, Closed Division”,
por NVIDIA, s.f.-e. ([Link]

Además, se tiene la siguiente tabla donde se proporciona el rendimiento, tokens de


salida por segundo, conseguido en el proceso de inferencia con los modelos
LLaMA v2, en sus variantes de 7B y 70B, y Falcon, en su variante 180B, con el
soporte de una gráfica NVIDIA H100 de 80GB y una configuración FP8 para el
formato numérico de punto flotante.

Tabla 13

Inferencia de NVIDIA H100 con LLaMA v2 y Falcon

Tamaño de Tamaño de
Modelo Rendimiento por GPU GPU Precisión Framework Versión del GPU
la entrada la salida
LLaMA v2 7B 128 128 9,193 tokens/s de salida 1x H100 FP8 TRT-LLM 0.5.0 H100 SXM5 80GB
LLaMA v2 7B 128 2048 5,367 tokens/s de salida 1x H100 FP8 TRT-LLM 0.5.0 H100 SXM5 80GB
LLaMA v2 7B 2048 128 2,058 tokens/s de salida 1x H100 FP8 TRT-LLM 0.5.0 H100 SXM5 80GB
LLaMA v2 7B 2048 2048 2,230 tokens/s de salida 1x H100 FP8 TRT-LLM 0.5.0 H100 SXM5 80GB
LLaMA v2 70B 128 128 1,562 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
LLaMA v2 70B 128 2048 2,063 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
LLaMA v2 70B 2048 128 187 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
LLaMA v2 70B 2048 2048 443 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
Falcon 180B 128 128 868 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
Falcon 180B 128 2048 837 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
Falcon 180B 2048 2048 244 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
Nota. Adaptado de “LLM Inference Performance of NVIDIA Data Center Products”, por NVIDIA, s.f.-b.
([Link]

71
De igual forma, en la comparativa que se muestra a continuación, se puede
distinguir el rendimiento, medido en tokens de salida por segundo, de los modelos
de lenguaje GPT-J 6B, LLaMA v2 13B y LLaMA v2 70B conseguidos durante el
proceso de inferencia ejecutado con una gráfica NVIDIA H100 NVL y una
precisión matemática igual a FP8.

Tabla 14

Inferencia de NVIDIA H100 NVL con GPT-J y LLaMA v2

Tamaño de Tamaño de
Modelo Rendimiento por GPU GPU Precisión Framework Versión del GPU
la entrada la salida
GPT-J 6B 128 128 20,484 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
GPT-J 6B 128 2048 7,134 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
GPT-J 6B 128 4096 3,990 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
GPT-J 6B 2048 2048 3,062 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 13B 128 128 7,844 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 13B 128 2048 3,431 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 13B 128 4096 1,843 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 13B 2048 2048 1,417 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 70B 128 128 2,273 tokens/s de salida 2x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 70B 2048 128 248 tokens/s de salida 2x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 70B 2048 2048 846 tokens/s de salida 2x H100 FP8 TRT-LLM 0.8.0 H100 NVL
Nota. Adaptado de “LLM Inference Performance of NVIDIA Data Center Products”, por NVIDIA, s.f.-b.
([Link]

Para finalizar con la presentación de las tablas comparativas, se tiene en la última


el rendimiento, ponderado en tokens de salida por segundo, que se consiguió en los
ensayos de inferencia con el procesamiento de los modelos GPT-J 6B y LLaMA v2
7B, recurriendo al trabajo del acelerador gráfico NVIDIA L40S y el formato de
precisión decimal FP8.

Tabla 15

Inferencia de NVIDIA L40S con GPT-J y LLaMA v2

Tamaño de Tamaño de
Modelo Rendimiento por GPU GPU Precisión Framework Versión del GPU
la entrada la salida
GPT-J 6B 128 128 7,993 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
GPT-J 6B 128 2048 1,874 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
GPT-J 6B 2048 128 693 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
GPT-J 6B 2048 2048 768 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
LLaMA v2 7B 128 128 5,954 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S

72
Tamaño de Tamaño de
Modelo Rendimiento por GPU GPU Precisión Framework Versión del GPU
la entrada la salida
LLaMA v2 7B 128 2048 1,654 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
LLaMA v2 7B 2048 128 580 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
LLaMA v2 7B 2048 2048 543 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
Nota. Adaptado de “LLM Inference Performance of NVIDIA Data Center Products”, por NVIDIA, s.f.-b.
([Link]

Bien podrían considerarse los anteriores resultados como base para ir definiendo
posibles stacks de Machine Learning para el desarrollo y despliegue de las nuevas
aplicaciones de IA.

Asimismo, para el análisis del dimensionamiento se está teniendo en cuenta los


innumerables casos de aplicación que se presentan con la incorporación de las TIA
(Tecnologías de la Inteligencia Artificial) en los planes de desarrollo científico y
tecnológico, a saber, desarrollo de productos innovadores, descubrimiento de
nuevos materiales, mejora de procesos de producción, mejoramiento del material
genético, investigación molecular, entre otros.

Con el análisis de los rendimientos de las comparativas descritas, con lo que se


asume se trabajará con los modelos de lenguaje open source descritos
preliminarmente, se concluye que los aceleradores gráficos más adecuados para las
cargas de trabajo mencionadas, ya sea entrenamiento e inferencia, contando con la
inclusión de las herramientas de la suite NVIDIA AI Enterprise (RAPIDS, Merlin,
Riva, NeMO y Triton), también descritas previamente, son las opciones
correspondientes a las tarjetas NVIDIA H100 (80GB) para los trabajos de
entrenamiento y las NVIDIA L40S (48GB) para los trabajos de inferencia, aunque,
para este último caso, la GPU NVIDIA H100 (80GB), también ha mostrado un buen
desempeño, como puede apreciarse en las anteriores comparativas, por lo que
podría ser considerada para cumplir el trabajo sin mayores inconvenientes técnicos.

Por lo tanto, en el siguiente apartado se procederá con la selección del equipamiento


de hardware, que será parte integral de la propuesta tecnológica de infraestructura
on-premise basada en procesamiento por GPU, luego del análisis técnico efectuado
en base a los requerimientos identificados de los modelos de lenguaje, frameworks,
librerías, bases de datos vectoriales, aceleradores gráficos y otros, que ya fueron
evaluados en las etapas previas.

73
3.2 Desarrollo de la Solución
Por lo pronto, el proyecto apunta a servir de guía para la implementación de una
plataforma tecnológica que facilite la ejecución de grandes cargas de trabajo
diferenciadas permitiendo, con ello, la generación de aplicaciones puntuales como
las vinculadas a chatbots conversacionales, asistentes virtuales y agentes
inteligentes, haciendo uso de herramientas avanzadas para el despliegue de avatares
digitales, incluso como plataforma para el soporte de nodos de procesamiento
utilizando tecnología de Blockchain, que será objeto de trabajos posteriores.

Con los requerimientos indicados, se va a diseñar en el centro de datos una


arquitectura consistente en varias capas de implementación, que tenga un alto grado
de flexibilidad para que pueda ser resiliente frente a los nuevos desafíos que se
pudieran presentar en los aspectos relacionados a la actualización, escalabilidad y
mantenimiento del despliegue en el largo plazo.

Por ello, la primera capa, correspondiente al hardware, estará conformada por


servidores de gran capacidad de cómputo basada en GPUs, nodos de
almacenamiento y equipos de conectividad para la segmentación de los distintos
tráficos de datos.

En la segunda capa se conformarán los sistemas generales de administración de la


plataforma, orquestación de contenedores, aprovisionamiento de servicios, control
de las comunicaciones, actualización de los nodos, gestión de los recursos
computacionales y monitoreo de las actividades del clúster.

En la tercera capa se desplegará la suite de frameworks de la solución NVIDIA AI


Enterprise, que contiene todos los paquetes para el acompañamiento de los procesos
de preparación de los datos, entrenamiento de los datos y publicación de los
servicios de IA.

En la cuarta capa de la propuesta se consolidarán los modelos de lenguaje que se


han ido evaluando previamente para explotar todas las ventajas en cuanto a base de
conocimiento y nivel de confiabilidad.

En la quinta capa se considerará la implementación de las técnicas de desarrollo de


Fine-tuning y RAG para aprovechar los datos de los modelos de lenguaje con
mayores puntuaciones alcanzadas en las evaluaciones.

74
En la sexta y última capa se desplegarán las distintas aplicaciones de inteligencia
generativa que se hayan construido con las herramientas y recursos de IA.

La siguiente figura consolida el resumen de las capas o niveles mencionados en las


descripciones previas:

Figura 23

Visión arquitectónica de la plataforma de IA

Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])

75
Por ello, el desarrollo de la solución será dividido en dos secciones para un mayor
entendimiento del despliegue, que, en una primera instancia, mostrará los
componentes de la infraestructura para el procesamiento de la IA y, en una segunda,
los componentes de la infraestructura tradicional para la plataforma tecnológica de
virtualización con HCI.

La distribución indicada anteriormente obedece a criterios técnicos, donde la


tecnología basada en GPU ha requerido de un nuevo desarrollo en el equipamiento
teniendo en cuenta la gran capacidad de procesamiento necesaria en el centro de
datos, cuyo rendimiento ha sido demostrado en campos como la ciencia de datos,
el aprendizaje profundo y la inteligencia generativa, que son la base de las nuevas
aplicaciones de IA, que a comparación de un centro de datos convencional no
podría cumplir debido a su bajo desempeño demostrado en los rubros indicados.

3.2.1 Infraestructura para el procesamiento de aplicaciones de IA

Después de las etapas iniciales de análisis de los requerimientos técnicos, se ha


determinado una infraestructura de cómputo con equipamiento de la marca Dell,
para las cargas de trabajo vinculadas al entrenamiento e inferencia de IA, por lo
cual se ha hecho uso de la herramienta del fabricante conocida como Enterprise
Infrastructure Planning Tool ([Link] para conseguir
el dimensionamiento real de la arquitectura, cuyos componentes de cómputo se
listan en forma resumida en la siguiente tabla, para luego, ahondar en una breve
descripción técnica de cada uno de ellos:

Tabla 16

Resumen de los componentes de hardware de la solución de IA

Cantidad Equipamiento Tipo Rol


2 Dell AR3100x717 Rack Gabinete Protección física
3 Dell PowerEdge R660 Nodo/Servidor Administración
1 Dell PowerEdge R760xa Nodo/Servidor Procesamiento por gráfica (GPU)
1 Dell PowerEdge XE8640 Nodo/Servidor Procesamiento por gráfica (GPU)
1 Dell PowerEdge XE9680 Nodo/Servidor Procesamiento por gráfica (GPU)

76
Cantidad Equipamiento Tipo Rol
3 Dell PowerScale F600 Nodo/Servidor Almacenamiento NVMe SSD
4 Dell PowerSwitch S5232-ON Switch Conectividad de red a 100Gbps
1 Dell PowerSwitch N3200-ON Switch Conectividad de red a 1Gbps

Para iniciar con el desarrollo de la solución, se está considerando para la protección


y seguridad física de los distintos equipos de procesamiento avanzado dos gabinetes
Dell AR3100x717 de 42RU cada uno. Algunos detalles técnicos adicionales se
muestran en la siguiente tabla:

Tabla 17

Características técnicas del gabinete Dell AR3100x717 Rack

Componente Descripción
Altura 78.39 in (199.1 cm)
Anchura 23.62 in (60 cm)
Profundidad 42.13 in (107 cm)
Factor de forma 42U

Igualmente, para el presente proyecto se están incorporando tres equipos Dell


PowerEdge R660, ya que serán los sistemas que darán soporte a las
implementaciones de NVIDIA Base Command Manager Essentials, para las tareas
de gestión del clúster, y Kubernetes Control Plane, para las tareas de orquestación
de los contenedores. Las características técnicas más importantes de dichos
modelos son las siguientes:

Tabla 18

Características técnicas del servidor Dell PowerEdge R660

Componente Descripción
Servidor 3 x PowerEdge R660
CPU 1 x Intel Xeon Gold 6438M 2.2G, 32C/64T
Memoria 8 x 16 GB DDR5 4800 MT/s RDIMM
Sistema Operativo Tarjeta controladora BOSS-N1 con 2 M.2 960GB (RAID 1)
Controlador RAID PERC H755 con soportes de carga trasera
4 x 3.84 TB SSD SAS RI 24Gbps 512e 2.5in Hot-Plug, AG Drive
Almacenamiento
1DWPD
Red PXE Broadcom 5720 Dual Port 1 GbE Optional LOM

77
Componente Descripción
Red PXE/K8S NVIDIA ConnectX-6 Lx Dual Port 10/25GbE SFP28, OCP NIC 3.0
1 x NVIDIA ConnectX-6 Lx Dual Port 10/25GbE SFP28 Adapter, PCIe
Red de almacenamiento/K8S
(Opcional)
Factor de forma 1RU
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])

Asimismo, se está optando por un servidor Dell PowerEdge R760xa GPU que se
encargará de las cargas de trabajo relacionadas a las tareas de inferencia o
generación de texto, por lo que se está implementando el proyecto, ya sea con el
acelerador NVIDIA L40S (48GB) o NVIDIA H100 (80GB) que, como se ha
determinado en las etapas de análisis de los aceleradores, son dos opciones idóneas
para ese tipo de actividades. Se debe tomar en cuenta que la gráfica NVIDIA H100
(80GB) soporta NVIDIA NVLink Bridge para la interconexión de las GPUs con un
ancho de banda máximo de 600GB/s entre cada par de procesadores gráficos. Las
características técnicas más importantes de dicho modelo son las siguientes:

Tabla 19

Características técnicas del servidor Dell PowerEdge R760xa

Componente Descripción
Servidor 1 x PowerEdge R760xa
CPU 2 x Platinum 8468 2.1G, 48C/96T
Memoria 16 x 32 GB DDR5 4800 MT/s RDIMM
Sistema Operativo Tarjeta controladora BOSS-N1 con 2 M.2 960GB (RAID 1)
Almacenamiento 2 x 3.84 TB Data Center NVMe Read Intensive AG Drive U2 Gen4
Red PXE Broadcom 5720 Dual Port 1 GbE Optional LOM
• 1 x NVIDIA ConnectX-6 Lx Dual Port 10/25 GbE SFP28, No Crypto,
OCP NIC 3.0
Red de almacenamiento/K8S
• 1 x NVIDIA ConnectX-6 DX Dual Port 100 GbE QSFP56 Network
Adapter (Opcional)
Opciones:
GPU • 2 x o 4 x NVIDIA L40S, 48 GB PCIe GPU
• 2 x o 4 x NVIDIA Hopper H100, 80 GB, PCIe GPU NVLink Bridge
Factor de forma 2RU
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])

78
También, se está incluyendo un servidor Dell PowerEdge XE8640 GPU que se
encargará de los trabajos de entrenamiento o procesamiento de los datos, por lo que
se está implementando el sistema con el acelerador NVIDIA H100 SXM (80GB),
la opción que resultó con los mayores desempeños en el apartado de las
evaluaciones, ya que soporta la tecnología NVIDIA NVLink para la interconexión
entre las GPUs a una tasa de 900GB/s en el canal de transmisión. Las características
técnicas más importantes de dicho modelo son las siguientes:

Tabla 20

Características técnicas del servidor Dell PowerEdge XE8640

Componente Descripción
Servidor 1 x PowerEdge XE8640
CPU 2 x Intel Xeon Platinum 8468 2.1G, 48 C/96 T, 16 GT/s
Memoria 16 x 32 GB RDIMM, 4800MT/s Dual Rank
Sistema Operativo Tarjeta controladora BOSS-N1 con 2 M.2 960GB (RAID 1)
Almacenamiento 2 x 3.84 TB Data Center NVMe Read Intensive AG Drive U2 Gen4
Red PXE Broadcom 5720 Dual Port 1 GbE Optional LOM
• 1 x NVIDIA ConnectX-6 Dual Port 100 GbE QSFP56 Adapter, OCP
3.0
Red de almacenamiento/K8S
• 1 x NVIDIA ConnectX-6 DX Dual Port 100 GbE QSFP56 Network
Adapter (Opcional)
GPU 4 x NVIDIA H100 SXM NVLink
Factor de forma 4RU
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])

Además, se está considerando un servidor Dell PowerEdge XE9680 GPU que será
el nodo maestro que se encargará de los trabajos de entrenamiento o procesamiento
de los datos, por lo que se está implementando el sistema con el acelerador NVIDIA
H100 SXM (80GB), que soporta NVIDIA NVSwitch con un ancho de banda de
900GB/s para ofrecer un alto rendimiento con la más baja latencia durante la
transmisión de los datos. Las características técnicas más importantes de dicho
modelo son las siguientes:

79
Tabla 21

Características técnicas del servidor Dell PowerEdge XE9680

Componente Descripción
Servidor 1 x PowerEdge XE9680
CPU 2 x Platinum 8468 2.1G, 48C/96T
Memoria 16 x 64 GB RDIMM, 4800 MT/s Dual Rank
Sistema Operativo Tarjeta controladora BOSS-N1 con 2 M.2 960GB (RAID 1)
Almacenamiento 2 x 3.84 TB Data Center NVMe Read Intensive AG Drive U2 Gen4
Red PXE Broadcom 5720 Dual Port 1 GbE Optional LOM
2 x NVIDIA ConnectX-6 DX Dual Port 100 GbE QSFP56 Network
Red de almacenamiento/K8S
Adapter (Opcional)
GPU 8 x NVIDIA H100 SXM NVSwitch
Factor de forma 6RU
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])

Adicionalmente, como sistema de almacenamiento permanente para los modelos


de lenguaje se está optando por una solución basada en tres equipos Dell
PowerScale F600 como parte de la solución, que soporta unidades sólidas NVMe
y 100GbE en el canal de interconexión de red. El sistema de almacenamiento va a
servir de repositorio para las distintas versiones de los modelos con los que se
trabaje, además de archivamiento de datos de la inferencia. Las características
técnicas más importantes de dicho modelo son las siguientes:

Tabla 22

Características técnicas del almacenamiento Dell PowerScale F600

Componente Descripción
Dispositivo 3 x PowerScale F600
Tarjeta de red frontal FE 2x100GbE w/o Optics
Tarjeta de red de posterior BE 2x100GbE w/o Optics
Capacidad de almacenamiento Flash QLC SED 123TB (15.36TB x8) NVMe SSD AG
CPU 3.0 GHz Processor x2
Memoria 736GB 3200 DIMM Memory
TRPM Trusted Platform Module v3
Contraseña IDRAC IDRAC Legacy Password
Fuente de energía Dual PSU 1100W RDNT
Factor de forma 1RU

80
Para centralizar y agilizar las transacciones de red relacionadas a la administración
de la plataforma y las operaciones de almacenamiento entre los nodos del clúster,
se está incorporando cuatro equipos Dell PowerSwitch S5232-ON, que tiene 3.2
Tbps de capacidad de conmutación, 2.4 Bpps de throughput y una latencia de 877
ns. Los detalles técnicos adicionales más importantes se muestran en la siguiente
tabla:

Tabla 23

Características técnicas del switch Dell PowerSwitch S5232-ON

Componente Descripción
Puertos 32xQSFP28 2xSFP+
Max 10GbE density 124 (QSFP28 breakout) 2 (SFP+)
Max 25GbE density 124 (QSFP28 breakout)
Max 40GbE density 32 (QSFP28)
Max 50GbE density 64 (QSFP28 breakout)
Max 100GbE density 32 (QSFP28)
Capacidad de conmutación 3.2 Tbps (6.4 Tbps full duplex)
Throughput 2.4 Bpps (4.8 Bpps full duplex)
Latencia (ns) 877
Memoria de CPU 16GB
SSD 64GB
Buffer de paquete 32MB
Factor de forma 1RU

Terminando con el listado del hardware, para el control y monitoreo de los nodos
o servidores con la configuración de la red OOB (Out-of-band), así como de la red
PXE para la automatización del aprovisionamiento y despliegue de los sistemas
operativos, se está considerando un equipo Dell PowerSwitch N3200-ON, que tiene
576Gbps de capacidad de conmutación y 800Mpps de throughput. Los detalles
técnicos adicionales más importantes se muestran en la siguiente tabla:

Tabla 24

Características técnicas del switch Dell PowerSwitch N3200-ON

Componente Descripción
48 puertos RJ45 1GbE
Puertos 4 puertos SFP+ 10GbE
2 puertos QSFP28 100GbE
Capacidad de conmutación 576Gbps (full duplex)

81
Componente Descripción
Throughput 800Mpps
Memoria de CPU 4GB
SSD 32GB
Buffer de paquete 8MB
Administración Out-of-band 10/100/1000BASE-T
Factor de forma 1RU

Habiendo finalizado el dimensionamiento general de la capacidad de cómputo


requerida por la presente propuesta, se continuará con la exposición breve de los
componentes de software, que se configurarán en la plataforma para soportar la
línea de desarrollo de aplicaciones de IA, en la siguiente tabla:

Tabla 25

Resumen de los componentes de software de la solución de IA

Componente Software
Administración NVIDIA Base Command Manager Essentials v10.23.12
Sistema Operativo Ubuntu v22.04.1 LTS
Contenedorización Docker v23.0.5
Orquestación de Upstream Kubernetes v1.27.6
contenedores
Operador de GPU NVIDIA GPU Operator v22.9.2
Servidor de Inferencia NVIDIA Triton Inference Server v23.04
Motor de Inferencia NVIDIA TensorRT-LLM v0.7.1 and v0.8.0
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])

Para tener un panorama más claro de la implementación, en la Figura 24 se adjunta


la topología final del despliegue con el equipamiento descrito de la marca Dell,
donde se puede apreciar los dispositivos consignados para los trabajos de
procesamiento (con los aceleradores por GPU), almacenamiento de los modelos,
conectividad de la red y administración general de la plataforma.

82
Figura 24

Topología tecnológica de la solución de IA

Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])

83
Asimismo, en la Figura 25 siguiente, se muestra la posición general que tendría la
solución en los espacios de centro de datos, teniendo en cuenta las distribución con
los dos gabinetes, donde se está mostrando la arquitectura física final que se
asumiría, la misma que se diseñó con la herramienta de Planning Tool del
fabricante.

Figura 25

Organización de los gabinetes con la solución de IA

84
3.2.2 Infraestructura para la plataforma de virtualización con HCI

Como se había indicado, en esta segunda instancia se va a tratar la infraestructura


complementaria, en forma general, de la plataforma convencional con tecnología
de virtualización para el centro de datos.

Este despliegue va a tener como rol principal el hospedamiento de los servicios


tradicionales de red, que dan soporte a las actividades de los distintos especialistas
de ITP y la Red CITE, desplegada a nivel nacional.

Por ello, en la siguiente tabla, se mostrarán los distintos componentes de hardware


que conformarán la nueva plataforma tecnológica basada en tecnología
hiperconvergente, también de la marca Dell, para preservar la compatibilidad y la
congruencia tecnológica con el equipamiento avanzado de IA, que se describió para
el despliegue de la plataforma de aprendizaje automático con la ejecución de redes
Transformers:

Tabla 26

Resumen de los componentes de la solución de HCI

Cantidad Equipamiento Tipo Rol


4 Dell EMC VxRail P670F Nodo/Servidor Procesamiento
1 Dell EMC UnityXT 380H Enclosure Almacenamiento
2 Dell EMC Unity DAE 15x3.5" Enclosure Almacenamiento
2 Dell PowerSwitch S4128F-ON Switch ToR Conectividad
2 Dell EMC Switch S4112F-ON Switch Conectividad
1 Dell PowerEdge R450 Servidor de Backup Procesamiento
1 Dell EMC ML3 Librería de respaldo Respaldo a cinta
1 Dell PowerProtect DD6400 Backup Storage Respaldo a disco
1 Dell ES40 SHELF 12G 15x8TB SAS Enclosure Respaldo a disco

De la tabla anterior se debe mencionar que la capacidad de procesamiento y


memoria RAM estará potenciada con los servidores Dell EMC VxRail P670F, la
capacidad de almacenamiento con los sistemas Dell EMC UnityXT 380H y Dell
EMC Unity DAE 15x3.5", y la de conectividad con los dispositivos Dell
PowerSwitch S4128F-ON y Dell EMC Switch S4112F-ON.

85
De igual forma, para las políticas de respaldo de la información se va a contar con
dos implementaciones, una basada en cinta con los equipos Dell PowerEdge R450
y Dell EMC ML3, y otra basada en disco con los sistemas Dell PowerProtect
DD6400 y Dell ES40 SHELF 12G 15x8TB SAS.

Lo descrito en la tabla anterior es un resumen rápido de los equipos que conforman


la infraestructura hiperconvergente de red con tecnología de virtualización, cuyos
detalles más extensos se pueden revisar con mayor detenimiento en la información
contenida en el Anexo A al final de este mismo documento.

Además, para tener una visión más amplia de la infraestructura del centro de datos
convencional, se puede recurrir a la Figura 26 que muestra la topología de red final
donde se aprecian los distintos componentes de la plataforma en los aspectos
relacionados a la capacidad de procesamiento, almacenamiento de la información,
conectividad, respaldo a cinta y respaldo a disco.

Asimismo, en la Figura 27 se puede apreciar la distribución de los componentes de


la plataforma con HCI en el centro de datos, con lo que se espera tener un panorama
más amplio del despliegue.

En ese sentido, puede apreciarse que, en el primer gabinete, se van a concentrar las
capacidades diseñadas para las tareas de procesamiento y conectividad de red,
mientras que el segundo gabinete va a contener los subsistemas de almacenamiento
de los datos y respaldo de la información.

Con el diseño completo de las dos infraestructuras, una dedicada a la computación


avanzada con GPUs y otra a la tradicional con HCI, se tiene a mano la plataforma
computacional final para el soporte de los nuevos servicios de red, como son el
entrenamiento de modelos y la inferencia de predicciones, además, de las
prestaciones convencionales en la intranet.

86
Figura 26

Topología tecnológica de la solución de HCI

Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “Topología de solución con HCI”, por EQUANTI S.A.C., 2023.

87
Figura 27

Organización de los gabinetes con la solución de HCI

3.3 Validación del Proyecto


A continuación, se procederá con la validación del proyecto de acuerdo a los
objetivos específicos planteados en el Capítulo 1.

Objetivo Específico 1: Incrementar el ancho de banda en la memoria de video


(GB/s) del componente gráfico (GPU, Graphics Processing Unit) para agilizar la
tasa de velocidad en la transmisión de grandes volúmenes de datos.

Por ello, para alcanzar el primer objetivo específico, referente a incrementar el


ancho de banda de la memoria de video, se debe mencionar que con la nueva
propuesta se estará implementando una infraestructura de GPU que alcanzará tasas
de transferencias de información a velocidades iguales a 864GB/s y 2TB/s con los
modelos L40S (48GB) y H100 (80GB) respectivamente, a diferencia de la actual

88
plataforma con infraestructura convergente, que carece de tales prestaciones
tecnológicas, tal como se demuestra en la tabla siguiente:

Tabla 27

Anchos de banda de las GPU L40S (48GB) y H100 (80GB)

Plataforma Plataforma
Característica técnica actual propuesta con GPU
tradicional GPU L40S (48GB) GPU H100 (80GB)
Ancho de banda de Memoria - 864GB/s 2TB/s

Por lo tanto, con el incremento del ancho de banda en la memoria de video (GB/s)
del componente gráfico, como se está evidenciando en el análisis previo, se puede
concluir afirmando que se cumplió el Objetivo Específico 1.

Objetivo Específico 2: Potenciar la cantidad de operaciones computacionales de


coma flotante por segundo (FLOPS) para mejorar el índice de procesamiento de los
valores numéricos reales que conforman las distintas dimensiones de la
información vectorial.

Además, para alcanzar el segundo objetivo específico, respecto a potenciar la


cantidad de operaciones de coma flotante por segundo, se tiene que indicar que con
el nuevo proyecto se estará implementando una infraestructura basada en GPU que
conseguirá alcanzar índices de procesamiento de 183 TFLOPS (366 con Sparsity)
en formato de precisión TF32, 362.5 TFLOPS (733 con Sparsity) en formato de
precisión BFLOAT16, 362.5 TFLOPS (733 con Sparsity) en formato de precisión
FP16 y 733 TFLOPS (1466 con Sparsity) en formato de precisión FP8 con el
modelo L40S (48GB), asimismo, que logrará alcanzar índices de procesamiento de
378 TFLOPS (756 con Sparsity) en formato de precisión TF32, 756 TFLOPS (1513
con Sparsity) en formato de precisión BFLOAT16, 756 TFLOPS (1513 con
Sparsity) en formato de precisión FP16 y 1513 TFLOPS (3026 con Sparsity) en
formato de precisión FP8 con el modelo H100 (80GB), a diferencia de la actual
plataforma con infraestructura convergente, que carece de tales prestaciones
tecnológicas, tal como se puede apreciar en la siguiente tabla:

89
Tabla 28

Índices de procesamiento de las GPU L40S (48GB) y H100 (80GB)

Plataforma Plataforma
Característica técnica actual propuesta con GPU
tradicional L40S (48GB) H100 (80GB)
Core Tensor TF32 TFLOPS (with Sparsity) - 183 (366) 378 (756)
Core Tensor BFLOAT16 TFLOPS (with Sparsity) - 362.5 (733) 756 (1513)
Core Tensor FP16 TFLOPS (with Sparsity) - 362.5 (733) 756 (1513)
Core Tensor FP8 TFLOPS (with Sparsity) - 733 (1466) 1513 (3026)

Por lo tanto, con el potenciamiento de la cantidad de operaciones computacionales


de coma flotante por segundo (FLOPS), como se está evidenciando en el análisis
previo, se puede concluir afirmando que se cumplió el Objetivo Específico 2.

Objetivo Específico 3: Elevar la velocidad de reloj (Hz) de los núcleos de cómputo


con el aumento del nivel de la capacidad de procesamiento en paralelo de la
plataforma tecnológica para agilizar los trabajos de embedding de las diferentes
fuentes de datos.

También, para alcanzar el tercer objetivo específico, relacionado a elevar la


velocidad de reloj de los núcleos de cómputo con la incorporación de la técnica de
procesamiento en paralelo, se debe resaltar que con la propuesta tecnológica se
estará desplegando una plataforma que contará con gráficas cuyas frecuencias
tendrán 1755MHz con el modelo H100 (80GB) que incorpora la tecnología NVIDIA
NVLink para un mayor rendimiento, a diferencia de la actual plataforma
convergente, que carece de dicha ventaja competitiva, tal como se puede apreciar
en la siguiente tabla:

Tabla 29

Velocidad de reloj de la GPU H100 (80GB)

Plataforma Plataforma
Característica técnica actual propuesta con GPU
tradicional GPU H100 (80GB)

90
Velocidad de reloj del GPU - 1755MHz
NVLink - Sí

Por lo tanto, con el incremento de la velocidad de reloj (Hz) de los núcleos de


cómputo y el aumento del nivel de la capacidad de procesamiento en paralelo,
como se está evidenciando en el análisis previo, se puede concluir afirmando que
se cumplió el Objetivo Específico 3.

Objetivo Específico 4: Aumentar el número de tokens de la ventana de contexto


(TK/contexto) para sostener los niveles de coherencia semántica del entorno sin
deficiencias en el proceso de inferencia léxica y sintáctica, que permitan mantener
la calidad de las respuestas (responses).

Asimismo, para alcanzar el cuarto objetivo específico, vinculado al aumento del


número de tokens de la ventana de contexto (TK/contexto) para sostener los niveles
de coherencia semántica, se tiene que destacar que con la propuesta en mención se
podrá implementar una plataforma que conseguirá máximos de 7,993 y 9,193
tokens/s en la inferencia de salida con la incorporación de los modelos L40S
(48GB) y H100 (80GB) respectivamente y, en ese mismo orden, con el
procesamiento de los modelos de código abierto GPT-J 6B y LLaMA v2 7B, a
diferencia del actual despliegue con infraestructura convergente, que carece de tales
prestaciones tecnológicas, tal como se puede apreciar en la siguiente tabla:

Tabla 30

Rendimiento en tokens por segundo de las GPU L40S (48GB) y H100 (80GB)

Plataforma Plataforma
Característica técnica actual propuesta con GPU
tradicional GPU L40S (48GB) GPU H100 (80GB)
Modelo de lenguaje LLM GPT-J 6B LLaMA v2 7B
Tokens/s de salida - 7,993 9,193

Por lo tanto, con el aumento del número de tokens de la ventana de contexto


(TK/contexto) para sostener los niveles de coherencia semántica, como se está

91
evidenciando en el análisis previo, se puede concluir afirmando que se cumplió el
Objetivo Específico 4.

Objetivo Específico 5: Incrementar la cantidad de parámetros (variables


automáticas) del modelo generativo de IA, considerando la eficiencia sobre el
tamaño, para mejorar el nivel de precisión o exactitud gramatical de las consultas
(queries) durante la interacción con el sistema.

Finalmente, para alcanzar el quinto objetivo específico, respecto a incrementar la


cantidad de parámetros o variables internas de ajuste del modelo generativo, se debe
mencionar que con la propuesta de implementación basada en GPU se tendrá la
posibilidad de procesar modelos de lenguaje que hayan sido entrenados
previamente con varios miles de millones de parámetros, tales como 7B, 13B, 70B,
130B, entre otros, contando con la instalación de los modelos L40S (48GB) y H100
(80GB), a diferencia del actual despliegue con infraestructura convergente, que
carece de tales prestaciones tecnológicas, tal como se puede apreciar en la siguiente
tabla:

Tabla 31

Cantidad de parámetros de los modelos de lenguaje LLM

Plataforma Plataforma
Modelo actual propuesta con GPU
tradicional GPU L40S (48GB) GPU H100 (80GB)
Falcon 180B - - 180B
GPT3 5B - - 5B
GPT3 20B - - 20B
GPT-J 6B - 6B -
LLaMA v2 7B - 7B 7B
LLaMA v2 13B - - 13B
LLaMA v2 70B - - 70B

Por lo tanto, con el incremento de la cantidad de parámetros (variables


automáticas) del modelo generativo de IA, como se está evidenciando en el análisis
previo, se puede concluir afirmando que se cumplió el Objetivo Específico 5.

92
3.4 Interpretación de los Resultados
Con los valores obtenidos en la fase de validación del proyecto, donde se ha
evidenciado los resultados mediante distintas fuentes de información referencial,
ya sean tablas comparativas, gráficas demostrativas o documentación técnica, se
puede afirmar que se ha cumplido con todos los objetivos específicos planteados
desde el inicio, con lo que se garantiza que la propuesta de implementación presente
superará largamente las expectativas de los distintos especialistas durante el
desarrollo del proyecto.

93
4 CONCLUSIONES Y RECOMENDACIONES
4.1 Conclusiones
 La infraestructura de cómputo paralelo basada en la GPU H100(80GB), que
tiene una frecuencia de reloj de 1755MHz y que incorpora la tecnología
NVIDIA NVLink, permitirá materializar la implementación de una plataforma
dedicada al desarrollo de aplicaciones de inteligencia generativa con el
entrenamiento de modelos de código abierto.
 La solución tecnológica que se está proponiendo con la instalación de la GPU
H100 (80GB), cuya VRAM alcanza un ancho de banda base de 2TB por
segundo, va a facilitar la implementación de una línea de producción futura que
agilice la carga en memoria de múltiples modelos de lenguaje de código abierto.
 La plataforma de IA tiene la capacidad de procesar modelos de lenguaje que
hayan sido entrenados preliminarmente con una densidad de 5B, 6B, 7B, 13B,
20B, 70B y 180B de parámetros, con lo cual permitirá el uso de aplicaciones
optimizadas con técnicas avanzadas de cuantización preservando los niveles de
precisión y fiabilidad de los resultados.
 Se debe resaltar que la iniciativa para la implementación de la propuesta estará
respaldada jurídicamente por la Ley 31814, que el Gobierno está reglamentando
con la convocatoria del público especializado a fin de fortalecer el desarrollo de
la IA en beneficio del avance económico, social y académico.
 La plataforma de entrenamiento contará con un alto poder de optimización con
el uso de la tecnología NVIDIA Sparsity, que facilitará alcanzar índices de
procesamiento de 756 TFLOPS en precisión TF32, 1513 TFLOPS en precisión
BFLOAT16, 1513 TFLOPS en precisión FP16 y 3026 TFLOPS en precisión
FP8 con el modelo H100 (80GB), la cual agilizará el consumo de los datos que
provengan de distintas fuentes de información, tales como documentos de texto,
hojas de cálculo, presentaciones, bases de datos, imágenes, audios, videos, entre
otros.
 Con la capacidad inherente de procesar los modelos fundacionales publicados,
tales como Falcon 180B, GPT-J 6B, LLaMA v2 7B, LLaMA v2 13B y LLaMA
v2 70B, se facilitará el entrenamiento de múltiples modelos de lenguajes de
código abierto para enriquecer e incrementar los niveles de contextualización
semántica durante los procesos de inferencia,

94
 La infraestructura de procesamiento contempla el desarrollo de aplicaciones
que lograrán mantener una ventana de contexto de 7,993 tokens considerando
la gráfica L40S (48GB), con la implementación GPT-J 6B, la cual permitirá
desplegar la técnica conocida como fine-tuning para ajustar el modelo de
lenguaje preentrenado con el conjunto de datos de una materia específica.
 De igual forma, se estará en condiciones de producir aplicaciones que lograrán
consolidar una ventana de contexto de 9,193 tokens con la gráfica H100
(80GB), implementando LLaMA v2 7B y haciendo uso de la técnica basada en
RAG, con la cual los datos inferidos por el sistema se consolidarán con la
información contenida en los modelos de lenguaje fundacionales.
 Gracias a que la solución contará con un alto poder de optimización con la
tecnología NVIDIA Sparsity, que facilitará alcanzar índices de procesamiento
de 366 TFLOPS en precisión TF32, 733 TFLOPS en precisión BFLOAT16,
733 TFLOPS en precisión FP16 y 1466 TFLOPS en precisión FP8 con el
modelo L40S (48GB), la plataforma de inteligencia generativa estará equipada
para permitir el desarrollo de aplicaciones, tales como asistentes inteligentes,
agentes digitales y presentadores virtuales, que tengan la capacidad de procesar
y reconocer la voz humana para una mejor experiencia en la interacción con los
usuarios.
 La propuesta de implementación tecnológica tendrá también como sustento
legal el Decreto de Urgencia N.º 006-2020, que aprobó el Sistema Nacional de
Transformación Digital para incentivar la adopción de las TIC en la gestión
pública.

4.2 Recomendaciones
 Ensayar la aplicación de distintos stacks de entrenamiento e inferencia usando
nuevos modelos de lenguaje de código abierto, frameworks, librerías,
controladores, entre otros, para optimizar los recursos de cómputo.
 Configurar la interconexión del centro de cómputo basado en aceleradores,
mediante conexión directa o enlace VPN, con las instalaciones de
procesamiento de los diferentes proveedores locales y foráneos de servicios de
IA para ampliar la cartera de recursos computacionales.

95
 Conformar distintos equipos técnicos especializados de las diferentes cadenas
de producción para contar con una mayor base de conocimiento que sirva de
soporte para el desarrollo de aplicaciones enfocadas en materias específicas.
 Proceder con la adopción del paradigma de desarrollo basado en microservicios
para la producción y publicación de APIs, que puedan ser consumidos por los
usuarios a través de endpoints seguros.
 Organizar reuniones de capacitación con el objetivo de divulgar los alcances y
ventajas de la inteligencia artificial en los proyectos de desarrollo productivo.
 Coordinar con los encargados de la Secretaría de Gobierno y Transformación
Digital (SGTD) a fin de acceder a nuevos recursos tecnológicos de IA, que
pudieran contribuir con la exploración de mayores opciones de desarrollo de
aplicaciones con inteligencia generativa.
 Convertir a la plataforma propuesta de IA en un laboratorio de producción de
aplicaciones inteligentes poniendo a disposición de otras entidades privadas y
públicas las técnicas de entrenamiento e inferencia diseñadas.
 Coordinar con las distintas marcas o fabricantes, o en su defecto con sus
representantes locales, que intervinieron en la formulación del proyecto,
acuerdos basados en el acceso a la mayoría o todos los recursos de IA, que
mantengan en sus portafolios de soluciones, a fin de diversificar la oferta de
aplicaciones computacionales.
 Entrenar los modelos aprovechando como entrada los documentos o contenidos
generados por los propios especialistas de la entidad.
 Optimizar la producción de aplicaciones con el uso de técnicas modernas como
fine-tuning y RAG, que permitan mejorar la precisión y confiabilidad de los
modelos de lenguaje con el procesamiento de información actualizada.
 Diseñar una infraestructura de cómputo para el desarrollo de aplicaciones de
inteligencia generativa en las plataformas que mantienen en nube prestigiosas
compañías, tales como Amazon, Google, Microsoft e IBM.
 Considerar la participación de otras tecnologías disruptivas del mercado para
potenciar las aplicaciones con el uso de Big Data e Internet of Things, cuyos
repositorios pueden servir como fuentes de información.
 Evaluar el consumo de distintos datasets publicados en la red que puedan
contribuir con la mejora de la calidad de las aplicaciones futuras.

96
5 CAPÍTULO 5: REFERENCIAS

Almazrouei, E., Alobeidli, H., Alshamsi, A., Cappelli, A., Cojocaru, R., Debbah, M.,
Goffinet, E., Hesslow, D., Launay, J., Malartic, Q., Mazzotta, D., Noune, B.,
Pannier, B., & Penedo, G. (2023, 29 de noviembre). The Falcon Series of Open
Language Models. Technology Innovation Institute. Recuperado el 19 de mayo
de 2024, de [Link]

Daigle, R., & Huescas, J. (2023, 15 de diciembre). Reference Architecture for Generative
AI Based on Large Language Models (LLMs). Lenovo Press. Recuperado el 8 de
abril de 2024, de [Link]
for-generative-ai-based-on-large-language-models/

Decreto de Urgencia 006-2020. (2020). Decreto de Urgencia que crea el Sistema


Nacional de Transformación Digital. Poder Ejecutivo.

Decreto Legislativo 1412. (2018). Decreto Legislativo que aprueba la Ley de Gobierno
Digital. Poder Ejecutivo.

Decreto Supremo 029-2021-PCM. (2021). Decreto Supremo que aprueba el Reglamento


del Decreto Legislativo N° 1412, Decreto Legislativo que aprueba la Ley de
Gobierno Digital, y establece disposiciones sobre las condiciones, requisitos y
uso de las tecnologías y medios electrónicos en el procedimiento administrativo.
Presidencia del Consejo de Ministros.

Decreto Supremo 042-2023-PCM. (2023). Decreto Supremo que aprueba la Política


General de Gobierno para el presente mandato presidencial. Presidencia del
Consejo de Ministros.

Decreto Supremo 085-2023-PCM. (2023). Decreto Supremo que aprueba la Política


Nacional de Transformación Digital al 2030. Presidencia del Consejo de
Ministros.

Decreto Supremo 157-2021-PCM. (2021). Decreto Supremo que aprueba el Reglamento


del Decreto de Urgencia N° 006-2020, Decreto de Urgencia que crea el Sistema
Nacional de Transformación Digital. Presidencia del Consejo de Ministros.

97
Dell. (2024). Generative AI in the Enterprise - Model Customization. Dell Technologies.
Recuperado el 23 de mayo de 2024, de
[Link]
solutions/technical-support/[Link]

GitHub. (s.f.). LLaMA 3 Model Card. GitHub. Recuperado el 22 de mayo de 2024, de


[Link]

Hugging Face. (s.f.). LLM-Perf Leaderboard. Hugging Face. Recuperado el 6 de abril de


2024, de [Link]

Ley 29733. (2011). Ley de protección de datos personales. Congreso de la República del
Perú.

Ley 31814. (2023). Ley que promueve el uso de la inteligencia artificial en favor del
desarrollo económico y social del país. Congreso de la República del Perú.

Meta. (s.f.). Llama 2: open source, free for research and commercial use. Meta.
Recuperado el 21 de mayo de 2024, de [Link]

Mishra, P. (2023, 18 de junio). 3 Ways Vector Databases Take Your LLM Use Cases to
the Next Level [Imagen adjunta]. LinkedIn [Link]
ways-vector-databases-take-your-llm-use-cases-next-level-mishra/

Mistral AI. (2023a, 27 de setiembre). Mistral 7B. Mistral AI. Recuperado el 30 de mayo
de 2024, de [Link]

Mistral AI. (2023b, 11 de diciembre). Mixtral of experts. Mistral AI. Recuperado el 30 de


mayo de 2024, de [Link]

Mistral AI. (2024a, 26 de febrero). Au Large. Mistral AI. Recuperado el 30 de mayo de


2024, de [Link]

Mistral AI. (2024b, 17 de abril). Cheaper, Better, Faster, Stronger. Mistral AI.
Recuperado el 30 de mayo de 2024, de [Link]

NVIDIA. (s.f.-a). Converged Training Performance on NVIDIA Data Center GPUs.


NVIDIA Developer. Recuperado el 25 de abril de 2024, de
[Link]
inference/training/

98
NVIDIA. (s.f.-b). LLM Inference Performance of NVIDIA Data Center Products.
NVIDIA Developer. Recuperado el 27 de abril de 2024, de
[Link]
inference/

NVIDIA. (s.f.-c). LLM Training Performance on NVIDIA Data Center Products.


NVIDIA Developer. Recuperado el 25 de abril de 2024, de
[Link]
inference/training/

NVIDIA. (s.f.-d). NVIDIA GB200 NVL72. NVIDIA. Recuperado el 13 de abril de 2024,


de [Link]

NVIDIA. (s.f.-e). NVIDIA Performance on MLPerf 3.1’s AI Benchmarks: Single Node,


Closed Division. NVIDIA Developer. Recuperado el 25 de abril de 2024, de
[Link]
inference/training/

Resolución Ministerial 132-2024-PCM. (2024). Disponen la publicación del proyecto de


Reglamento de la Ley N° 31814, Ley que promueve el uso de la inteligencia
artificial en favor del desarrollo económico y social del país, del Decreto
Supremo que lo aprueba y de su respectiva Exposición de Motivos. Presidencia
del Consejo de Ministros.

Ricky. (2023, 20 de setiembre). ¿Qué es NVIDIA NVLink? FiberMall. Recuperado el 28


de abril de 2024, de [Link]
[Link]

Wikipedia. (s.f.-a). InfiniBand. Wikipedia. Recuperado el 14 de abril de 2024, de


[Link]

Wikipedia. (s.f.-b). Modelo de lenguaje grande. Wikipedia. Recuperado el 10 de abril de


2024, de [Link]

99
ANEXO A - Detalles técnicos de los componentes de la plataforma tecnológica
hiperconvergente

Tabla 32

Características técnicas del servidor Dell EMC VxRail P670F

Servidor - Dell EMC VxRail P670F


Dell EMC VxRail P670F - HCI Nodes
Dell EMC VxRail P670F, All Flash
Modelo
Dell EMC VxRail VMware, vSAN Advanced
Dell EMC VxRail VMware vSphere Enterprise Plus for 1 processor
2.5" Chassis with up to 24 HDDS (SAS/SATA) including 4 Universal Slots for 1CPU
Bahías
VxRail P670F, Riser Config 8, 1B+2A, Single CPU
Intel Xeon Silver 4314 2.4G, 16C/32T, 10.4GT/s, 24M Cache, Turbo, HT (135W)
Procesador DDR42666
Memoria RAM 16 x 32GB RDIMM, 3200MT/s, Dual Rank 16Gb BASE x8
3 x 800GB SSD SAS ISE, MU, up to 24Gbps 512e 2.5in Hot-Plug, AG Drive
15 x 3.84TB SSD SATA Read Intensive 6Gbps 512 2.5in Hot-plug AG Drive, 1 DWPD
Almacenamiento BOSS-S2 controller card + with 2 M.2 480GB (RAID 1)
vSAN Node
VxRail E660/F/N P670F/N V670F S670 Firmware Lock
Administración remota iDRAC9, Enterprise 15G
Tarjeta SAS Dell HBA355i Controller Front
Fuente de Poder Dual, Hot-Plug, Power Supply, 1100W MM (100-240Vac) Titanium, Redundant (1+1)
Broadcom 57412 Dual Port 10GbE SFP+ Adapter, PCIe Low Profile
Integrated Broadcom 5720 Dual Port 1Gb On-Board LOM
Intel Ethernet X710, Quad Port, 10GbE, SFP+, OCP NIC 3.0
15 x VxRail HCI System Software, Capacity Drive 3.84TB SATA, SSD
Interfaz de red
LKEY, SW, EMC, RES
16 x VxRail HCI System Software Memory, 32GB
VxRail HCI System Software, A
VxRail Software 7.0.450 Factory Install
ReadyRails Sliding Rails
Rieles para rack
Cable Management Arm, 2U

Tabla 33

Características técnicas del enclosure Dell EMC UnityXT 380H

Enclosure - Dell EMC UnityXT 380H


Dell EMC UnityXT 380H - Unified Storage
Modelo Dell EMC Unity XT 380 DPE 25 x 2.5 Dell FLD RCK
Pair of C13/C14 cables (Highline Power) or C19/C20 cables (480/680 Lowline Power)

100
Enclosure - Dell EMC UnityXT 380H
10 x Unity 1.8TB 10K SAS 25X2.5 DRIVE
Almacenamiento 6 x D4 800GB SAS FLASH 25X2.5 SSD
Unity SYSPACK 4X600GB 10K SAS 25X2.5
Unity CNA 4x10GbE OPT SFPs
Conectividad
2 x UNITY 2X5M ACTIVE TWINAX CBL 10G

Tabla 34

Características técnicas del enclosure Dell EMC Unity DAE 15x3.5"

Enclosure - Dell EMC Unity DAE 15x3.5"


Dell EMC Unity XT 3U 15x3.5 DAE
Modelo
Dell EMC Unity XT 3U 15x3.5 DAE FLD RCK
15 x D4 6TB NLSAS 15X3.5 DRIVE
Prodeploy for Dell EMC Unity 15 25 Drive DAE-LA
Almacenamiento
Prodeploy for Dell EMC Unity 15 25 Drive DAE Deployment Verification-LA
15 x ProSupport: Mission Critical 4-Hour 7x24 On-Site Hard Disk Drive Add-On

Tabla 35

Características técnicas del switch ToR Dell PowerSwitch S4128F-ON

Switch ToR - Dell PowerSwitch S4128F-ON


Modelo Dell PowerSwitch S4128F-ON - Switch ToR/DC
Puertos Dell EMC Switch S4128F-ON, 1U, 28 x 10GbE SFP+, 2 x QSFP28, IO to PSU, 2 PSU
Dell Networking, Transceiver, SFP+, 10GbE, SR, 850nm Wavelength, 300m Reach
Transceivers
Dell Networking, Transceiver, SFP, 1000BASE-T
Dell Networking Cable, 100GbE QSFP28 to QSFP28, Pass Cop Direct Attach Cable, 0.5m
Cable DAC Dell Networking, Cable, SFP+ to SFP+, 10GbE, Copper Twinax Direct Attach Cable, 5m
OS10 Enterprise S4128F-ON
Sistema operativo ProDeploy Plus Dell Networking S Series 4XXX Switch - Deployment
ProDeploy Plus Dell Networking S Series 4XXX Switch - Deployment Verification

Tabla 36

Características técnicas del switch Dell EMC Switch S4112F-ON

Switch - Dell EMC Switch S4112F-ON


Dell EMC Switch S4112F-ON, 12 x 10GbE SFP+, 3 x 100GbE, QSFP28, IO to FAN, 2 x
AC PSU
Modelo Dell EMC Networking S4112-ON Americas User Guide
2 x Power Cord, 125V, 15A, 10 Feet, NEMA 5-15/C13

101
Switch - Dell EMC Switch S4112F-ON
2 x Dell Networking, Jumper Cord, 250V, 12A, 2m, C13/C14, US
Cable a 100GbE Dell Networking Cable, 100GbE, QSFP28 to QSFP28
Cable DAC 4 x Dell Networking, Cable, SFP+ to SFP+, 10GbE
Sistema operativo OS10 Enterprise, S4112F
Bandeja Dell Networking Dual Tray, one Rack Unit, 4-post rack only, S4112

Tabla 37

Características técnicas del servidor Dell PowerEdge R450

Servidor de Backup - Dell PowerEdge R450


Modelo Dell PowerEdge R450
Bahías 8x2.5" (SAS/SATA) 1 CPU
Procesador 1 x Intel Xeon Silver 4309Y 2.8G, 8C/16T, 10.4GT/s, 12M Cache, Turbo, HT (105W)
Memoria RAM 64GB (4 x 16GB RDIMM, 3200MT/s, Dual Rank)
Controladora RAID PERC H755 SAS Front
2 x 480GB SSD SATA Mix Use 6Gbps 512 2.5in Hot-plug AG Drive, 3 DWPD
Almacenamiento
3 x 600GB Hard Drive SAS ISE 12Gbps 10k 512n 2.5in Hot-Plug
Integrado Broadcom 5720 Dual Port 1Gb On-Board LOM
Interfaz de red
Broadcom 57412 Dual Port 10GbE SFP+, OCP NIC 3.0
Bahías Riser Config 0, 1xOCP 3.0(x16) + 1x16LP
Administración remota iDRAC9, Enterprise 15G
TPM Trusted Platform Module 2.0 V3
Fuente de poder Dual, Hot-plug, Power Supply Redundant (1+1), 800W, Mixed Mode, NAF
Windows Server 2022 Standard, 16 cores, DF Recovery Image
Windows Server 2022 Standard, No Media, WS2019 Std Downgrade DF Media,
Sistema operativo Windows Server 2022 Standard,16 cores, FI, No Med, No CAL, Multi Language
Windows Server 2022 Standard,16 cores, Media Kit, Multi Language
Windows Server 2022 Standard, No Media, WS2019 Std Downgrade w/DVD Media
A11 drop-in/stab-in Combo Rails Without Cable Management Arm
Cable Management Arm
Rieles para rack
ProDeploy Dell Server R Series 1U/2U - Deployment
ProDeploy Dell Server R Series 1U/2U - Deployment Verification

Tabla 38

Características técnicas de la librería Dell EMC ML3

Librería de respaldo - Dell EMC ML3


Modelo Dell EMC ML3 - Tape Library
Drives 2 x ML3 LTO8 SAS Tape Drive
Etiquetas LTO8 Tape Labels, 1-200

102
Librería de respaldo - Dell EMC ML3
LTO Cleaning Tape, 1 Pack
Limpieza
Cleaning Tape Cartridge for LTO with Barcode Labels, 1 pack
Cintas 5 x LTO8 Tape Media, 5 Pack
Cable SAS 2 x 6Gb Mini to HD-Mini SAS Cable, 5M
Redundant Power Supply for ML3/ML3E Expansion
Fuente de poder C13 to C14, PDU Style, 12 AMP, 6.5 Feet (2m) Power Cord, North America
C13 to C14, PDU Style, 12 AMP, 6.5 Feet (2m) Power Cord, North America
ML3/ML3E Rack Rails
Rieles para rack ProDeploy Dell Storage TL Series 4U Library - Deployment
ProDeploy Dell Storage TL Series 4U Library - Deployment Verification

Tabla 39

Características técnicas del backup Dell PowerProtect DD6400

Backup Storage - Dell PowerProtect DD6400


Modelo Dell PowerProtect DD6400
Controller DD6400 NFS CIFS
DD6400 Capacity License Bundle 1TBu=CC
Controlador LICENSE BASE DD OE=IA
DD6400 Cloud Tier 1TB =CC
SYSTEM DD6400 PSNT
Caché DD6400 1.92TB Internal Cache SSD
XCVR 10GbE SR SFP Intel
DD 10GBASE-T IO MODULE 4PORT NDC INTEL
DD 10GSFP ENET 4PT INTEL
Conectividad DD OS 7.7X=IA
DD6400 Field Install Kit
Prodeploy for PowerProtect Data Domain 6XXX 9XXX
Prodeploy for PowerProtect Data Domain 6XXX 9XXX Deployment Verification

Tabla 40

Características técnicas del enclosure Dell ES40 SHELF 12G 15x8TB SAS

Dell ES40 SHELF 12G 15x8TB SAS


Dell ES40 SHELF 12G 15x8TB SAS
Dell ES40 SHELF 12G 15x8TB SAS Field DD6400
DD 3M SAS HD FLEX
Modelo
Certified Deployment Partner T2-LA
Prodeploy PowerProtect Data Domain Installation ES Expansion Shelf Deployment
Prodeploy PowerProtect Data Domain Installation ES Expansion Shelf

103
ANEXO B

REGLAMENTO DE LA LEY N° 31814, LEY QUE PROMUEVE EL USO DE LA


INTELIGENCIA ARTIFICIAL EN FAVOR DEL DESARROLLO
ECONÓMICO Y SOCIAL DEL PAÍS

CAPÍTULO I

DISPOSICIONES GENERALES

Artículo 4. Principios rectores para el uso y desarrollo de la inteligencia artificial

Las disposiciones contenidas en el presente Reglamento, así como su aplicación se rigen


por los principios del Título Preliminar de la Ley y por los siguientes principios rectores:

a) Centrado en la protección de la dignidad humana.- Se asegura que en todas las


etapas del ciclo de vida de la inteligencia artificial se incluyan mecanismos para garantizar
el respeto, promoción y protección de la dignidad, autonomía y los derechos
fundamentales de la persona humana.

b) Inclusión y equidad.- Se asegura el uso y desarrollo de la inteligencia artificial con la


participación de grupos diversos con énfasis en la población vulnerable, así como
considerar el impacto de los sistemas basados en inteligencia artificial hacia los mismos.
El Estado adopta un enfoque inclusivo para garantizar que los beneficios de los sistemas
basados en inteligencia artificial estén disponibles y sean accesibles para todos.

c) Sostenibilidad.- Se asegura que en el uso y desarrollo de los sistemas basados en


inteligencia artificial se tengan en cuenta y se evalúen las repercusiones humanas,
sociales, económicas, culturales y ambientales alineadas al logro de los objetivos de las
políticas nacionales y a los Objetivos de Desarrollo Sostenible de las Naciones Unidas.

d) Sensibilización y educación en inteligencia artificial.- Se promueve y asegura la


alfabetización digital y la formación de habilidades vinculadas al uso y desarrollo de la
inteligencia artificial en toda etapa del desarrollo de la persona con énfasis en matemática,
estadística, programación, ciencia de datos, ética, derechos humanos, entre otros; así

104
como, se garantiza la sensibilización, comprensión y concientización sobre el uso e
impacto de los sistemas basados en la inteligencia artificial para que las personas puedan
tomar decisiones informadas sobre su utilización.

e) Promoción del acceso compartido.- Se promueve el acceso compartido a las


capacidades computacionales de las entidades públicas, los datos gubernamentales y otros
recursos similares para el uso y desarrollo de la inteligencia artificial en favor del
desarrollo económico y social del país.

f) Seguridad, proporcionalidad y fiabilidad.- Los sistemas basados en inteligencia


artificial deben ser sólidos y seguros para garantizar su funcionamiento apropiado según
su finalidad prevista, y ante el uso indebido razonablemente previsible, y minimizar los
riesgos vinculados a dicho sistemas a través de un enfoque de riesgos. La decisión y uso
de un sistema basado en inteligencia artificial debe ser proporcional a su finalidad.

g) No discriminación.- En todas las etapas del ciclo de vida de un sistema basado en


inteligencia artificial, se implementan medidas para evitar la generación, reforzamiento y
perpetuación de resultados discriminatorios o sesgados a fin de evitar cualquier tipo de
discriminación de raza, género, origen étnico, condición económica o social, religión,
discapacidad o por cualquier otro motivo.

h) Protección de la privacidad y datos personales.- En todo el ciclo de vida de un


sistema basado en inteligencia artificial se establecen medidas para la protección de la
privacidad y los datos personales de acuerdo con las disposiciones normativas vigentes
en la materia.

i) Transparencia y explicabilidad.- Se asegura la transparencia y explicabilidad de los


sistemas basados en inteligencia artificial, como la incorporación de medidas de
transparencia algorítmica y de trazabilidad, así como brindar información sobre sus usos
para facilitar su comprensión y fácil entendimiento por parte de las personas que pueden
verse afectadas por su uso y las autoridades competentes.

j) Responsabilidad humana.- La responsabilidad generada por el uso y desarrollo de los


sistemas basados en inteligencia artificial recae en última instancia en la persona humana,
por lo que son pasibles de responsabilidad ética, civil, administrativa y penal en el marco
de las disposiciones normativas vigentes sobre la materia.

105
k) Rendición de cuentas y supervisión humana.- Los sistemas basados en inteligencia
artificial cuentan con mecanismos para la rendición de cuentas por su funcionamiento y
uso; así como con mecanismos adecuados para su supervisión.

Cuando las circunstancias lo ameriten, se incorporan mecanismos de supervisión humana


a los sistemas basados en inteligencia artificial.

106
ANEXO C - Glosario técnico

Algoritmo. Conjunto de instrucciones computacionales que dirigen y definen la


metodología del procesamiento de datos, selección de operaciones y ejecución de
acciones a fin de conseguir un objetivo predeterminado.

Aprendizaje automático. Rama de la inteligencia artificial que se encarga del estudio y


desarrollo de tecnologías que permitan que los sistemas computacionales aprendan y
razonen copiando las habilidades de la mente humana.

Aprendizaje profundo. Subcampo del área de aprendizaje automático (Machine


Learning) que se basa en la arquitectura de las redes neuronales para entrenar modelos de
lenguaje.

Base de datos vectorial. Sistema de persistencia donde los datos se salvan en formato
vectorial multidimensional, donde cada dimensión representa una propiedad específica
de los elementos almacenados.

Big Data. Tecnología basada en la recopilación, estandarización y procesamiento de


grandes volúmenes de datos estructurados y no estructurados provenientes de distintas
fuentes de información, cuyos resultados se usan en la mejora de los procesos de decisión.

Blockchain. Tecnología basada en el procesamiento distribuido de red, donde la


información de las transacciones se genera y comparte entre todos nodos participantes
para mantener los registros de bloques seguros e inmutables.

Ciencia de Datos. Campo de estudio que aplica la estadística, ingeniería e informática a


fin de obtener información relevante de conjuntos de datos estructurados y no
estructurados, que pueda ayudar en la toma de las mejores decisiones respecto a la
conducción de las organizaciones.

Conjunto de Datos. Colección de datos estandarizados que sirven de insumo durante el


entrenamiento de los modelos de inteligencia generativa.

Core CUDA (Compute Unified Device Arquitecture). Núcleo o procesador de la


arquitectura del GPU que es usado en cómputo paralelo para realizar tareas de propósito
general.

107
Core RT (Ray Tracing o Trazado de Rayo). Núcleo o procesador de la arquitectura del
GPU que es usado para mejorar la experiencia en el desarrollo de las aplicaciones de IA
que impliquen generación de gráficos en 3D.

Core Tensor. Núcleo o procesador de la arquitectura del GPU que es usado para ejecutar
cálculos relacionados a operaciones matriciales y vectoriales de modo más eficiente.

Corpus. Colección de datos en formato de texto, audio, imagen, video, entre otros, que
se usan para entrenar los modelos de lenguaje.

Cuantización. Técnica de optimización de los recursos computacionales consistente en


la disminución del tamaño de los modelos de lenguaje sin afectar la precisión, rapidez y
fiabilidad.

Data Science. Véase Ciencia de Datos.

Data Warehouse. Repositorio centralizado de datos cuyos registros se normalizan para


servir de base unificada a los especialistas, ingenieros y científicos encargados del análisis
de una realidad particular.

Dataset. Véase Conjunto de Datos.

Deep Learning. Véase Aprendizaje profundo.

DPU (Data Processing Unit o Unidad de Procesamiento de Datos). Unidad de


cómputo especializada en el procesamiento, transmisión, y análisis de los datos, que
ejecuta operaciones complejas a altas tasas de velocidad.

Embedding. Proceso que se encarga de la representación vectorial de los tokens.

Entrenamiento. Proceso computacional iterativo que se ejecuta con grandes volúmenes


de datos para dotar a un modelo de la capacidad de inferir o predecir respuestas
interactivamente con altos niveles de precisión semántica.

Fine-tuning (Ajuste Fino). Técnica usada para personalizar el entrenamiento de un


modelo con datos específicos con el fin de mejorar la precisión en determinadas tareas.

GPT (Generative Pre-trained Transformer o Transformador generativo


preentrenado). Tipo de modelo grande de lenguaje desarrollado dentro del campo de la
inteligencia generativa para producir texto como respuesta a la solicitud del usuario.

108
GPU (Graphics Processing Unit o Unidad de Procesamiento Gráfico). Dispositivo
electrónico diseñado para procesar a altas velocidades cargas pesadas de trabajo que
involucren operaciones sofisticadas y masivas de coma flotante.

HCI (Hyper-converged Infrastructure o Infraestructura Hiperconvergente).


Tecnología de infraestructura de computación definida por software cuya capa principal
se encarga de la virtualización de los componentes de procesamiento, almacenamiento y
conectividad.

Hiperparámetro. Variable numérica externa definida previamente al proceso de


entrenamiento de los datos, que se usa para configurar la arquitectura, comportamiento,
precisión y eficacia de un modelo.

Inferencia. Capacidad de un modelo de lenguaje de generar respuestas precisas de


acuerdo al contexto del requerimiento, basándose en la estructura del conocimiento
adquirido durante el entrenamiento previo.

Inteligencia artificial. Campo de la ciencia informática creado para el desarrollo de


sistemas que puedan imitar los procesos cognitivos de la mente humana, tales como el
aprendizaje, el razonamiento y la deducción.

Inteligencia generativa. Categoría de la inteligencia artificial que tiene la capacidad de


generar distintos recursos como texto, audio, imagen o video como resultado del proceso
de inferencia al que es sometido el modelo de inteligencia.

Internet de las Cosas. Tecnología basada en una red de dispositivos electrónicos


conectados a internet, que se encargan de recopilar, procesar y transmitir datos del entorno
hacia sistemas de control y monitorio de eventos.

Internet of Things. Véase Internet de las Cosas.

LLM (Large Language Model o Modelo Grande de Lenguaje). Aplicación


perteneciente al campo del Procesamiento Natural del Lenguaje (PNL) entrenado con
miles de millones de datos que tiene la capacidad de comprender la estructura del lenguaje
humano.

Machine Learning. Véase Aprendizaje automático.

109
Modelo. Representación o abstracción computacional de una realidad que ha sido
entrenada con millones de datos de una materia específica para conseguir predecir sucesos
futuros cercanos.

Modelo fundacional. Modelo de inteligencia generativa que ha sido entrenado con una
gran cantidad de datos no etiquetados haciendo uso de mecanismos de aprendizaje
autosupervisado, que sirve de base para el desarrollo de nuevas aplicaciones de IA.

MLOps (Machine Learning Operations u Operaciones de Aprendizaje Automático).


Paradigma de desarrollo de software que, para este caso, se concentra en el diseño,
implementación, despliegue y mantenimiento de aplicaciones de inteligencia artificial.

NVIDIA Merlin. Marco de trabajo de código abierto destinado al entrenamiento,


optimización y publicación de sistemas de recomendaciones basados en IA.

NVIDIA NeMO. Plataforma de inteligencia generativa para el entrenamiento y


despliegue de modelos de lenguaje de calidad empresarial e industrial.

NVIDIA RAPIDS. Biblioteca de software de código abierto enfocada en la


implementación, ejecución y seguimiento de procesos de la ciencia de datos.

NVIDIA Riva. Conjunto de microservicios destinados al desarrollo de aplicaciones de


IA basadas en el reconocimiento y procesamiento de la voz.

NVIDIA TRITON. Solución de código abierto que acompaña la implementación del


proceso de inferencia como parte del despliegue de los modelos generativos de lenguaje.

Paralelización de canalización. Técnica consistente en dividir un proceso complejo en


tareas más reducidas para que puedan ser procesadas simultáneamente por los distintos
sistemas computacionales de una plataforma.

Paralelización de datos. Técnica consistente en dividir un gran conjunto de datos en


grupos más reducidos para que puedan ser procesados en paralelo por los distintos
sistemas computacionales de una plataforma.

Paralelización de modelos. Técnica consistente en dividir una carga de trabajo en


operaciones más específicas para que puedan ser procesadas en paralelo por los distintos
sistemas computacionales de una plataforma.

110
Parámetro. Variable numérica interna que se va ajustando en forma iterativa durante la
fase de entrenamiento para mejorar el rendimiento del modelo de aprendizaje profundo.

Pipeline. Serie de etapas ejecutadas para el procesamiento de los datos o el entrenamiento


de los modelos de IA.

Punto o coma flotante. Notación computacional usada para preservar de manera


eficiente la precisión decimal de los valores del conjunto de los números reales con la que
se busca mejorar el entrenamiento y la inferencia de los modelos de IA.

PyTorch. Framework de código abierto basado en el lenguaje Python, que se usa para el
desarrollo de aplicaciones de aprendizaje automático.

RAG (Retrieval Augmented Generation o Generación Aumentada por


Recuperación). Técnica usada para mejorar la generación de texto de un modelo LLM
con el entrenamiento de información nueva adicional.

Red neuronal. Modelo computacional formado por varios nodos, a modo de neuronas
humanas, interconectados entre sí por medio de diferentes niveles o capas de abstracción
que facilitan el aprendizaje de las computadoras.

Realidad aumentada. Tipo de tecnología de realidad virtual que materializa el


despliegue de aplicaciones y servicios digitales sobre el entorno real.

Robótica. Tecnología que consolida la aplicación de la ciencia e ingeniería en el diseño


y fabricación de robots, que son máquinas con la capacidad de realizar trabajos físicos
propios de los humanos en forma automática.

Sparsity. Técnica de NVIDIA incorporada a sus gráficas para la optimización de los


modelos de lenguaje con la reducción de los cálculos computacionales aprovechando los
pesos con valor cero.

TensorFlow. Framework de código abierto implementado por Google, que se usa en el


desarrollo de aplicaciones de inteligencia artificial y el entrenamiento de redes
neuronales.

Token. Grupo de caracteres que se desglosan de un texto mayor durante el proceso de


entrenamiento de los modelos de lenguaje.

111
Tokenización. Proceso computacional que se encarga de la generación de los tokens o
unidades básicas semánticas de información.

Transformer. Tipo de red neuronal, basada en mecanismos de autoatención, que tiene la


capacidad de aprender y entender el contexto de una situación mediante la generación de
relaciones entre los datos que se crean durante el entrenamiento.

Ventana de contexto. Cantidad de tokens que un modelo puede procesar como máximo
para mantener la inferencia semántica, en un momento determinado de la interacción con
el usuario.

VRAM (Video RAM). Espacio de memoria del GPU que se usa para almacenar los datos
en forma temporal durante los procesos de entrenamiento con la ejecución de los
algoritmos de IA.

112

También podría gustarte