Plataforma Hiperconvergente para IA
Plataforma Hiperconvergente para IA
Rights info:eu-repo/semantics/openAccess
FACULTAD DE INGENIERÍA
COMUNICACIONES
AUTOR
ASESOR
Al Todopoderoso, quien siempre tiene los mejores tiempos para uno, gracias por
permitirme vivir los gloriosos avances de la IA.
I
AGRADECIMIENTOS
II
RESUMEN
Con los avances logrados actualmente en el campo del Aprendizaje Profundo (Deep
Learning), se busca formular el diseño conceptual de una plataforma tecnológica basada en
tecnología hiperconvergente, que incorpore infraestructura de procesamiento por gráfica o
GPU (Graphics Processing Unit o Unidad de Procesamiento Gráfico), capaz de soportar el
desarrollo de soluciones del tipo RAG (Retrieval Augmented Generation o Generación
Mejorada por Recuperación) con la aplicación de los grandes modelos generativos de
lenguaje de código abierto, que han sido entrenados previamente con miles de millones de
datos, para la codificación de sistemas de información predictivos (SPI) y que cuente,
además, con el entrenamiento de datos propietarios generados al interior de la misma
institución, provenientes de distintas fuentes de información, para optimizar la precisión de
la información, que pueda acompañar los procesos de innovación y emprendimiento a fin de
incrementar la productividad de las cadenas productivas del rubro nacional generando con
ella beneficios económicos que repercutan en la mejora de la calidad de vida de los peruanos.
Así, con el desarrollo del proyecto se incrementará el ancho de banda de la VRAM con tasas
de transferencia de la información iguales a 864GB/s y 2TB/s; también, se potenciará la
cantidad de operaciones de coma flotante por segundo con índices de procesamiento de 378
TFLOPS en precisión TF32, 756 TFLOPS en formato BFLOAT16, 756 TFLOPS en
precisión FP16 y 1513 TFLOPS en formato FP8; además, se elevará la velocidad de reloj de
los núcleos de cómputo a 1755MHz aprovechando las capacidades del procesamiento en
paralelo incorporando la tecnología NVIDIA NVLink; asimismo, se aumentará el número
de tokens de la ventana de contexto para conseguir máximos de 7,993 y 9,193 tokens/s en la
inferencia de salida y, finalmente, se elevará la cantidad de parámetros o variables internas
con la posibilidad de procesar modelos de lenguaje de 7B, 13B, 70B, 130B, entre otros.
III
Design of a high-performance technological platform with graph processing and based on
hyperconvergence technology for the application of generative intelligence in the
development of predictive information systems with the training of Artificial Intelligence
(AI) models.
ABSTRACT
With the advances currently made in the field of Deep Learning, we seek to formulate the
conceptual design of a technological platform based on hyperconverged technology, which
incorporates graphics processing infrastructure or GPU (Graphics Processing Unit), capable
of supporting the development of RAG (Retrieval Augmented Generation) type solutions
with the application of large open source language generative models, which have been
previously trained with billions of data, for coding of predictive information systems (PIS)
and that also has the training of proprietary data generated within the same institution,
coming from different sources of information, to optimize the precision of the information,
which can accompany the innovation processes and entrepreneurship in order to increase the
productivity of the productive chains of the national sector, thereby generating economic
benefits that have an impact on the improvement of the quality of life of Peruvians.
Thus, with the development of the project, the VRAM bandwidth will increase with
information transfer rates equal to 864GB/s and 2TB/s; also, the number of floating point
operations per second will be enhanced with processing rates of 378 TFLOPS in TF32
precision, 756 TFLOPS in BFLOAT16 format, 756 TFLOPS in FP16 precision and 1513
TFLOPS in FP8 format; in addition, the clock speed of the computing cores will be raised
to 1755MHz, taking advantage of the capabilities of parallel processing by incorporating
NVIDIA NVLink technology; likewise, the number of tokens in the context window will be
increased to achieve maximums of 7,993 and 9,193 tokens/s in the output inference and,
finally, the number of parameters or internal variables will be increased with the possibility
of processing language models 7B, 13B, 70B, 130B, among others.
IV
Trabajo_10013915
INFORME DE ORIGINALIDAD
12 %
INDICE DE SIMILITUD
12%
FUENTES DE INTERNET
2%
PUBLICACIONES
3%
TRABAJOS DEL
ESTUDIANTE
FUENTES PRIMARIAS
1
[Link]
Fuente de Internet 3%
2
[Link]
Fuente de Internet 1%
3
[Link]
Fuente de Internet 1%
4
[Link]
Fuente de Internet 1%
5
[Link]
Fuente de Internet 1%
6
[Link]
Fuente de Internet 1%
7
[Link]
Fuente de Internet <1 %
8
Submitted to Universidad Peruana de
Ciencias Aplicadas
<1 %
Trabajo del estudiante
9
[Link]
Fuente de Internet
TABLA DE CONTENIDOS
4.1 CONCLUSIONES..................................................................................................... 94
4.2 RECOMENDACIONES ............................................................................................. 95
V
ÍNDICE DE TABLAS
Tabla 9. Características de los GPU A100 (80GB), L40, L40S, H100 (80GB) y H100 NVL
Tabla 12. Rendimiento de NVIDIA H100 con Nemo, MXNet, PyTorch y Merlin (MLPerf)
VI
Tabla 22. Características técnicas del almacenamiento Dell PowerScale F600
Tabla 24. Características técnicas del switch Dell Power Switch N3200-ON
Tabla 27. Anchos de banda de las GPU L40S (48GB) y H100 (80GB)
Tabla 28. Índices de procesamiento de las GPU L40S (48GB) y H100 (80GB)
Tabla 30. Rendimiento en tokens por segundo de las GPU L40S (48GB) y H100 (80GB)
Tabla 32. Características técnicas del servidor Dell EMC VxRail P670F
Tabla 33. Características técnicas del enclosure Dell EMC UnityXT 380H
Tabla 34. Características técnicas del enclosure Dell EMC Unity DAE 15x3.5"
Tabla 35. Características técnicas del switch ToR Dell PowerSwitch S4128F-ON
Tabla 36. Características técnicas del switch Dell EMC Switch S4112F-ON
Tabla 40. Características técnicas del enclosure Dell ES40 SHELF 12G 15x8TB SAS
VII
ÍNDICE DE FIGURAS
VIII
Figura 22. Imagen referencial de la GPU NVIDIA H100 (80GB)
IX
1 CAPÍTULO 1: DEFINICIÓN DEL PROYECTO
1.1 Introducción
Desde la llegada de la versión 3.5 de ChatGPT, un 30 de noviembre de 2022, se ha
producido una real revolución tecnológica, pocas veces vista en la historia, en el
campo de la computación e informática y, más específicamente, en las ramas
dedicadas al tratamiento de los datos y la generación automática de la información.
Debido a la demanda creciente por contar con sistemas o aplicaciones que generen
información con las características mencionadas, en las décadas anteriores se han
dado grandes avances tecnológicos en la industria de la computación, redes de
datos, comunicaciones inalámbricas, smartphones y centros de datos.
Por lo anterior, se requiere contar con una plataforma de centro de datos basada en
tecnología hiperconvergente que esté implementada con infraestructura de potentes
10
tarjetas de video, que son los componentes neurálgicos, para el tratamiento de
ingentes cantidades de datos que son el insumo principal con el que se entrenan los
actuales modelos de IA, los populares LLM, por cuya razón se necesitan gran
capacidad de ancho de banda y espacio de memoria para procesar complejos
algoritmos matemáticos que permitan alcanzar el fin indicado.
La Red CITE representa el ente ejecutor y operativo del ITP por medio del cual
promueve el emprendimiento empresarial, la investigación aplicada, la
transferencia tecnológica y la difusión del conocimiento científico con la
implantación de tecnologías disruptivas en los distintos rubros de la producción
nacional y entre los distintos productores, empresas, asociaciones y cooperativas.
11
En la siguiente tabla, se listan las actuales sedes que conforman la Red CITE que
están administradas por el ITP, donde se puede apreciar la clasificación de las
mismas de acuerdo a las regiones y cadenas productivas:
Tabla 1
12
se brindan los diversos servicios tecnológicos cuya finalidad primordial es
contribuir con el fortalecimiento de la capacidad productiva y económica del país:
Figura 1
13
el campo de las Tecnologías de la Información y Comunicaciones (TIC), cuyas
funciones están alineadas a las políticas centrales del marco normativo para la
Modernización Digital en el Gobierno Nacional establecida por la SeGDi
(Secretaría de Gobierno y Transformación Digital), que está, a su vez, adscrita a la
PCM (Presidencia del Consejo de Ministros).
Los especialistas de la OTI tienen a su cargo la gestión del actual centro de datos
que en 2017 se implementó con una solución de infraestructura tecnológica
convergente basada en equipamiento de la marca HPE.
Figura 2
14
Debido a su larga antigüedad, toda la plataforma de procesamiento, memoria,
almacenamiento y conectividad cumplió su ciclo o tiempo de vigencia tecnológica,
por lo que urge una renovación completa de todo el parque informático hospedado
en el centro de datos.
15
Por lo mismo, el centro de datos actual mantiene las características tecnológicas
desde su despliegue inicial en la entidad, por lo que es idóneo para sostener sistemas
tradicionales basados en algoritmos estáticos, aunque con un bajo rendimiento
durante la prestación de los servicios, pero carece prácticamente de procesamiento
por gráfica (GPU, Graphics Processing Unit), que es el componente fundamental,
en estos tiempos, para entrenar grandes volúmenes de datos y desplegar sistemas
basados en inteligencia generativa siguiendo la línea de servicios en línea, tales
como ChatGPT (generador de textos), Dalle-e (generador de imágenes), Gemeni
(generador de textos), Copilot (generador de contenidos), Sora (generador de
videos), Codex (generador de códigos de programación), entre otros.
16
de todas las sedes mencionadas solamente del interior del país con lo que se lograría
el despliegue de los servicios centralizados de red consolidados en la ciudad de
Lima, a saber, prestaciones tales como almacenamiento, telefonía, seguridad,
control de accesos, videovigilancia, filtrado web, internet, entre otros.
Figura 3
17
1.3.1 Formulación del Problema
Baja capacidad de rendimiento en la plataforma tecnológica para la
aplicación de la inteligencia generativa en el desarrollo de sistemas
predictivos de información con el entrenamiento de grandes modelos de
Deep Learning.
1.3.2 Análisis
Como se ha descrito en el apartado anterior, la implementación del centro
datos carece de una plataforma para el procesamiento óptimo de los datos
(vectorización), lo cual no permite a los especialistas del área de software
desarrollar aplicaciones inteligentes con el entrenamiento de modelos
predictivos de información de código abierto, que pudiera ponerse a
disposición de las empresas nacionales para una mejor decisión en los
planes de inversión con el consiguiente aumento de la productividad, ello,
justamente, debido a las causas que se describen en los siguientes apartados.
18
paralelo, donde los millares de núcleos trabajan concurrentemente para
generar y grabar con eficacia las representaciones vectoriales de cada
conjunto de palabras y sus correspondientes parámetros entrenados en la
base de datos vectorial.
Por un lado, se debe destacar que las tres causas anteriores tienen un mismo
origen en común, que es el precario y obsoleto equipamiento de cómputo
de centro de datos, que no cuenta con una infraestructura basada en
tecnología de procesamiento por gráfica con las prestaciones exigidas para
el entrenamiento de los datos en propiedad de la institución.
Por otro lado, se debe tomar en cuenta, también, que los responsables del
área de tecnología aún no tienen la experiencia, preparación y dominio
necesarios para aplicar las tecnologías emergentes del campo de la IA en el
desarrollo de nuevas propuestas de valor que se pueden implementar para
beneficio económico de la misma entidad y las empresas nacionales, lo que
ha provocado las causas que se describen en los siguientes dos párrafos.
Así, por lo indicado previamente, como cuarta causa principal, se tiene que
mencionar que no se han considerado alternativas con modelos inteligentes
que permitan mayores tamaños para la ventana del contexto en términos de
tokens soportados, que permitan mantener la coherencia semántica de un
entorno de interacción más amplio sin pérdida de los niveles de
comprensión léxica y estructura sintáctica.
19
requiere información confiable y consolidada de diferentes fuentes de
información para contar con un panorama más claro de la realidad.
Por ello, como primera consecuencia primaria, se tiene que indicar que se
está experimentando un bajo apalancamiento financiero que está
impidiendo la apertura de nuevas líneas de producción y comercialización
de productos. Ello debido al alto riesgo que puede correr el sistema bancario
por la morosidad en la devolución de los préstamos, hipotecas y otros
créditos de índole empresarial.
1.4 Objetivos
1.4.1 Objetivo General
Diseñar una plataforma tecnológica de alto rendimiento con procesamiento
por gráfica que esté basada en arquitectura hiperconvergente, cumpliendo la
normativa del estándar ANSI/TIA-942B, para la aplicación de la inteligencia
generativa en la producción de sistemas predictivos de información con el
entrenamiento de grandes modelos de IA.
20
1.4.2 Objetivos Específicos
Incrementar el ancho de banda en la memoria de video (GB/s) del
componente gráfico (GPU, Graphics Processing Unit) para agilizar la
tasa de velocidad en la transmisión de grandes volúmenes de datos.
Potenciar la cantidad de operaciones computacionales de coma flotante
por segundo (FLOPS) para mejorar el índice de procesamiento de los
valores numéricos reales que conforman las distintas dimensiones de la
información vectorial.
Elevar la velocidad de reloj (Hz) de los núcleos de cómputo con el
aumento del nivel de la capacidad de procesamiento en paralelo de la
plataforma tecnológica para agilizar los trabajos de embedding de las
diferentes fuentes de datos.
Aumentar el número de tokens de la ventana de contexto (TK/contexto)
para sostener los niveles de coherencia semántica del entorno sin
deficiencias en el proceso de inferencia léxica y sintáctica, que permitan
mantener la calidad de las respuestas (responses).
Incrementar la cantidad de parámetros (variables automáticas) del
modelo generativo de IA, considerando la eficiencia sobre el tamaño,
para mejorar el nivel de precisión o exactitud gramatical de las consultas
(queries) durante la interacción con el sistema.
21
Deep Learning (Redes Neuronales), tanto propietarios como de código
abierto, más potentes de la red. Por lo mismo, se van a revisar las
documentaciones de los trabajos publicados por empresas del rubro de la IA,
tales como Microsoft, Google, OpenAI, Facebook, DeepMind, NVIDIA,
entre otros que puedan servir de sustento para este bloque.
22
librerías de programación, plataformas web, entre otros, que van a
contribuir con el despliegue de la plataforma de desarrollo.
23
comprometer el resto de procesos concurrentes en la plataforma de
virtualización.
24
Figura 4
Se debe indicar que, para una mayor comprensión del proyecto, se ha incluido en
el Anexo C un corto glosario de varios de los términos técnicos que se están
mencionando en el presente desarrollo.
25
2 CAPÍTULO 2: MARCO TEÓRICO
2.1 Marco Conceptual
Desde hace varios años atrás, para las cargas de trabajo descritas previamente, el
mercado está apelando a otras tecnologías disruptivas como el procesamiento de la
información con la instalación de centros de datos basados en nodos equipados con
aceleradores de GPU, debido a las ventajas comparativas con las tradicionales CPU,
entre las que se pueden describir las siguientes:
26
con capacidades de alto rendimiento y baja latencia para cumplir con las nuevas
cargas de trabajo, tal como se muestra a continuación en la siguiente imagen:
Figura 5
Nota. Adaptado de “Reference Architecture for Generative AI Based on Large Language Models (LLMs)”, por
R. Daigle, 2023. ([Link]
large-language-models/)
Por ello mismo, teniendo en cuenta las características técnicas sobresalientes de las
GPU en el mercado actual de la IA generativa, la empresa AMD ofrece para dicho
segmento la línea de procesadores EPYC serie 9004 de 4ª. generación fabricados
bajo la arquitectura Zen 4 con hasta128 núcleos de procesamiento, que promete un
avanzado rendimiento y grandes capacidades de trabajo en el centro de datos para
tareas como aprendizaje profundo, almacenamiento masivo y transmisión de video
(streaming); asimismo, la compañía Intel propone la línea Xeon escalable de 5ª.
generación basada en la arquitectura Sapphire Rapids de 10 nm de litografía con 64
núcleos y 128 hilos por cada procesador, la misma que incorpora motores
aceleradores para el entrenamiento de la IA en forma nativa con el soporte de las
librerías de Deep Learning Boost para la agilización de las operaciones matemáticas
de números enteros y de coma flotante; y, finalmente, la corporación NVIDIA
plantea el ecosistema más avanzado con sus propuestas tecnológicas basadas en los
27
procesadores A100, L40S, H100, HGX A100, HGX H100, DGX GH200 hasta los
últimos B200 y GB200 (basados en arquitectura Blackwell), así como la suite
conocida comercialmente como NVIDIA AI Enterprise que integra todas las
librerías, controladores, frameworks y demás, tal como puede apreciarse en la
Figura 6, destinadas a la construcción de innumerables aplicaciones de inteligencia
generativa con el entrenamiento y reentrenamiento de LLMs de código abierto, con
las que ofrece, en hardware y software, las más ventajosas características
tecnológicas a los especialistas de las ramas de la computación de borde (Edge),
computación en la nube (Cloud), computación de alto rendimiento (HPC),
computación para la analítica de datos (Analytics) y computación para la
inteligencia artificial (IA), siendo en esta última donde destaca por encima de las
anteriores alternativas, debido a las capacidades inigualables que puede ofrecer en
el procesamiento de millones de operaciones, provenientes de la fase de
vectorización de grandes volúmenes de datos, con la ejecución de avanzados
algoritmos matemáticos de coma flotante a fin de garantizar un alto desempeño en
la precisión de la información final, por lo que a estas fechas es prácticamente
inalcanzable en el mundo de la computación a escala industrial.
Figura 6
28
Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “AI Solution Architecture”, por Francisco Aguirre, 2024.
Aparte, la solución de red debe contar con ventajas técnicas que permitan su
mantenimiento, actualización y desempeño, para lo cual se debe asegurar la
administración, compatibilidad y escalabilidad de la infraestructura de conexión,
que facilite la transmisión de millones de datos en las fases de desarrollo y
producción de las aplicaciones de RAG y fine-tuning contando con el soporte de la
tecnología NVLink en los enlaces internos del GPU, ya que posibilitan el cómputo
paralelo a diferentes niveles, tal como puede apreciarse en la siguiente imagen con
la presentación de las distintas velocidades de transmisión de datos:
Figura 7
29
En el rubro de procesamiento por gráfica, se tiene un líder indiscutible a esta fecha
actual, como ya se había indicado, donde destaca primordialmente la empresa
americana NVIDIA Corporation, que, gracias a sus innovadores productos en el
mercado de las GPU, cuenta con una amplia cartera de alternativas relacionadas al
procesamiento de algoritmos de Deep Learning, manteniéndose muy por encima
de la competencia que le ofrecen otras compañías prestigiosas como INTEL o AMD.
Así, para los rubros doméstico, académico y profesional tiene los productos de las
líneas Titan y Quadro, mientras que para el sector de consumo general cuenta con
las líneas GeForce GTX (series 10 y 16) y GeForce RTX (series 20, 30 y 40),
basándose esta última en las arquitecturas Turing, Ampere y Ada Lovelace que
integran núcleos dedicados para el trazado de rayos en tiempo real y el
procesamiento de modelos de inteligencia artificial.
30
La posibilidad de incorporar unidades o núcleos de procesamiento
altamente diferenciadas y especializadas para cargas de trabajo específicas
con tecnología CUDA para las tareas de propósito general, tecnología RT,
para la generación de imágenes y tecnología Tensor, para la inteligencia
generativa (Machine Learning y Deep Learning).
La capacidad de soportar altas tasas de transferencia de datos con la
fabricación de memorias de video con grandes velocidades de anchos de
banda capaces de mover los tokens a ratios de 1555 GB/s en el modelo
A100, 864 GB/s en los modelos L40 y L40S, 2 TB/s en el modelo H100
(80GB) y 7.8 TB/s en el modelo H100 NVL.
Tabla 2
31
Modelo GB200 NVL72 GB200 Grace Blackwell Superchip
Core Tensor FP32 180 PFLOPS 5 PFLOPS
Core Tensor FP64 3,240 TFLOPS 90 TFLOPS
Ancho de banda | Hasta 13.5 TB HBM3e | Hasta 384 GB HBM3e |
Memoria de GPU 576 TB/s 16 TB/s
Ancho de banda de NVLink 130TB/s 3.6TB/s
Cantidad de cores CPU 2,592 Arm Neoverse V2 cores 72 Arm Neoverse V2 cores
Ancho de banda | Hasta 17 TB LPDDR5X | Hasta 480GB LPDDR5X |
Memoria de CPU Hasta 18.4 TB/s Hasta 512 GB/s
Nota. Adaptado de “NVIDIA GB200 NVL72”, por NVIDIA, s.f.-d. ([Link]
center/gb200-nvl72/)
Tabla 3
32
conjunto de medidas técnicas que regulan los distintos subsistemas de una
plataforma de centro de datos con perfil corporativo, con las cuales se va a fortalecer
las acciones vinculadas, por un lado, a los temas de disponibilidad, contingencia y
seguridad de los servicios y, por otro, a los de administración y operaciones de la
implementación sistémica.
Tabla 4
33
Así, para tal cometido que busca asegurar datos de alta calidad, se puede considerar
la intervención de los ingenieros y científicos del campo de la ciencia de datos
(Data Science), quienes se encargarían de las fases de selección y curación de los
datos iniciales, donde por medio de procedimientos estándares de homologación
(pipelines) y haciendo uso de aplicaciones como Apache Nifi o Apache Spark, se
encargarían de generar un repositorio homologado o Data Warehouse con todos los
datos formateados y listos para su consumo o procesamiento con lo que se estaría
garantizando un resultado más confiable en las salidas de inferencia.
Para el caso, se tiene una larga lista de algoritmos para la ejecución de la fase de
embedding, de entre los cuales se pueden citar a BERT (Bidirectional Encoder
Representations from Transformers) y Word2Vec desarrollados por Google, Text-
Embedding-3-Large implementado por OpenAI, fastText usado por Facebook y
GloVe publicado por la Universidad de Stanford.
34
Figura 8
Nota. Adaptado de “3 Ways Vector Databases Take Your LLM Use Cases to the Next Level”, por P. Mishra,
2023. ([Link]
35
resguardando la compatibilidad durante la instalación de las librerías, frameworks
(como TensorFlow y PyTorch), controladores, IDEs, entre otros elementos
necesarios, con los que se eliminará cualquier problema o conflicto en la
configuración inicial, tal como VMware Private AI Foundation, cuya arquitectura
se puede apreciar rápidamente en la siguiente imagen:
Figura 9
Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “NVIDIA AI Enterprise on Lenovo”, por LENOVO, 2024.
36
Figura 10
Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “NVIDIA AI Enterprise on Lenovo”, por LENOVO, 2024.
37
Recognition (ASR), tales como asistentes virtuales y transcripciones en tiempo real
para múltiples idiomas.
Figura 11
Nota. Adaptado de “Reference Architecture for Generative AI Based on Large Language Models (LLMs)”, por
R. Daigle, 2023. ([Link]
large-language-models/)
38
sea capaz de proporcionar un framework para la administración, despliegue y
escalamiento de las soluciones contenerizadas de IA generativa, tales como Red
Hat, Kubernetes o VMware Tanzu.
Antes de pasar al siguiente apartado, se debe recalcar que un LLM es una aplicación
de aprendizaje profundo implementada con el uso de redes Transformer, un tipo
especial de red neuronal profunda, que ha sido entrenado con una diversidad de
datasets provenientes de distintos corpus de información como Wikipedia, Twitter,
Common Crawl, Reddit, The Pile, entre otras, que tiene la capacidad de cumplir
distintas tareas como absolver preguntas, resumir documentos, traducir idiomas,
pronosticar eventos, buscar información, crear contenidos y otras más, las cuales
procesa manteniendo la precisión textual por medio de su ventana de contexto, con
la que se garantiza una salida confiable con la menor tasa de error posible, por lo
que, entre sus ventajas más resaltantes se pueden mencionar las siguientes:
39
Por la naturaleza técnica de la implementación, los LLM requieren de una
infraestructura distinta a la conocida en los centros de datos convencionales basados
en arquitectura de CPUs, por lo que la industria se ha encargado de proveer
equipamiento robusto basado en modernos aceleradores gráficos, que se ha estado
describiendo en las secciones previas, con grandes capacidades computacionales,
además de otras herramientas de software, que juntos representan la plataforma
tecnológica requerida para la producción de sistemas inteligentes con el
aprovechamiento de los modelos fundacionales puestos a disposición en la red por
las empresas dedicadas al desarrollo de los productos mencionados, entre los que
se puede destacar a OpenAI, Meta y Mistral,
Por ello, ya que se requiere trabajar con modelos de lenguaje de código abierto, se
presenta en la red toda una amplia variedad de repositorios de LLMs a las que se
puede recurrir para potenciar el desarrollo de las aplicaciones, por lo que se puede
mencionar a los siguientes:
40
campos como la industria, salud, educación, energía y trasporte. Se puede visitar
desde la web [Link]
41
f. Microsoft AI GitHub. Como se indica es un repositorio de modelos de IA de la
misma compañía Microsoft. Este recurso desplegado en la red es un repositorio
completo que hospeda una amplia variedad de recursos vinculados al desarrollo con
herramientas de IA. Comprende una numerosa cantidad de modelos, bibliotecas,
controladores y frameworks de inteligencia generativa para los diferentes campos
de dominios. Este repositorio de la casa de Redmond incluye modelos para trabajos
de visión por computadora, reconocimiento de imágenes y detección de objetos, así
como otros más para procesamiento de voz, traducción automática y otras tareas
del campo del procesamiento natural del lenguaje. Además, cuenta con otros
recursos que proporcionan códigos de muestra, tutoriales y documentación variada,
para facilitar el desarrollo de aplicaciones con IA. Para visitar los recursos de dicha
plataforma se debe acceder desde [Link]
42
promueve la aplicación de las tecnologías de la inteligencia artificial (TIAs) en
beneficio del progreso económico y social del Perú (Resolución Ministerial 132-
2024-PCM, 2024).
43
Gobierno Digital y estableció lineamientos sobre las condiciones, requisitos y
explotación de las tecnologías digitales y medios electrónicos en el procedimiento
administrativo, reguló las actividades de gobernanza y gestión de las tecnologías
digitales en los organismos de la administración pública en materia de
modernización digital, y estableció el esquema jurídico aplicable al uso transversal
de las TI en la digitalización de los procesos y prestaciones de servicios
tecnológicos en los tres niveles de la estructura actual del Gobierno.
44
3 CAPÍTULO 3: DESARROLLO DEL PROYECTO
3.1 Diseño de la Solución
3.1.1 Situación actual
Por lo mismo, se debe señalar los problemas actuales con el sistema de respaldos o
copias de la información, debido a que uno de los cabezales de escritura del
dispositivo HPE está prácticamente defectuoso desde hace más de 4 años, por lo
que solo uno está a cargo de la contingencia de la información en cintas magnéticas,
que siendo realistas también está presentando fallas eventualmente. Por ello, se
tiene un alto riesgo en las tareas de recuperación de los datos ante una eventualidad
que se presente cuando se requiera restablecer información histórica.
45
datos dejaría de funcionar con lo que quedaría totalmente inhabilitado para
proporcionar los servicios básicos de red.
A inicios del año 2022, para paliar en alguna medida la falta de apoyo por parte del
fabricante del hardware y software, se continuó con el proceso de renovación del
soporte y garantía del equipamiento de centro de datos, a través de la solicitud de
adquisición del servicio de mantenimiento preventivo y correctivo de la plataforma
tecnológica.
46
entidad sentenció en favor de la anulación de oficio del mencionado pedido de
servicio.
47
Actualmente, la plataforma de virtualización está soportada con el despliegue del
siguiente equipamiento de hardware desde el año 2017, la misma infraestructura
que se ha venido describiendo en la sección de la problemática recurrente:
Tabla 5
48
Equipo Características Técnicas Cantidad
HPE MSL2024 0- 1
Drive Tape Library
HPE R7000 4U IEC- 2
32A HV INTL UPS
HIREF Air 2
Conditioner
Figura 12
49
En la siguiente imagen, se puede apreciar en forma resumida el consumo de los
recursos por las más de 70 máquinas virtuales generadas que se están ejecutando
para la consolidación de los recursos de red (aplicaciones y bases de datos):
Figura 13
Figura 14
50
la instauración de una línea de producción de aplicaciones de información haciendo
uso de las tecnologías de la IA en la que, inicialmente, se va a recopilar todos los
contenidos de una materia en concreto (insumo temático), los que, posteriormente,
van a ser sometidos a un proceso de tokenización y vectorización en la fase de
entrenamiento haciendo uso de la potencia de los GPU para generar las unidades
de información, cuyos resultados van a ser almacenados en una base de datos
vectorial para, luego, con las consultas (queries) realizadas van a ser
contextualizadas u homologadas, junto a los prompts de los usuarios, por algún
modelo de lenguaje (LLM) para, finalmente, ser consumidos por los interesados a
través de los asistentes o agentes desplegados, que van a ser publicados en la red
por medio de una aplicación basada en tecnología de contenedores y plataformas
especialmente diseñadas para procesar las solicitudes de entrada.
Figura 15
51
3.1.2 Análisis del diseño tecnológico
52
También, se debe recalcar que se busca producir sistemas que proporcionen
información con altos niveles de predictibilidad, cuyos resultados puedan servir de
respaldo técnico para la toma de decisiones de emprendimiento en el campo
empresarial con el menor riesgo financiero buscando incrementar la productividad
en las distintas cadenas productivas que se atienden.
Así, siendo los modelos de lenguaje una pieza fundamental para el proyecto, se han
establecido los siguientes criterios técnicos que deben cumplir para su
consideración en la implementación, los mismos que tienen su base legal en el
Artículo 4 (Principios rectores para el uso y desarrollo de la inteligencia artificial),
cuyo texto completo se puede revisar en el Anexo B, considerado en el proyecto del
Reglamento de la Ley 31814, a saber:
53
c. Ahorro de costos. Los modelos de lenguaje no deberán representar un
significativo costo en cuanto a las licencias de uso, para no afectar las asignaciones
presupuestales que se destinarán a los proyectos de implementación.
j. Rendimiento del modelo. Los modelos se deberán analizar con los coeficientes
alcanzados en las evaluaciones concernientes a la fluidez del idioma, coherencia
semántica, comprensión del contexto y precisión en las respuestas.
55
comprensión y razonamiento del modelo de lenguaje en campos tan complejos y
desafiantes del conocimiento humano.
56
con el lenguaje natural. Esta métrica se encarga de evaluar la capacidad de los
modelos en cuanto a comprensión de las relaciones entre objetos y personas, las
relaciones de causa y efecto, la complejidad del lenguaje natural y las reglas de la
lógica.
57
LLM de código abierto y propietarios más populares de la red, con los que se podrá
empezar a desarrollar las aplicaciones aprovechando su entrenamiento previo:
Tabla 6
58
Modelo Fecha Empresa Parámetros Tamaño Licencia
Technology 1 trillón de tokens
Falcon Marzo de 2023 40 mil millones Patentado
Innovation Institute (1TB)
363 mil millones de
BloombergGPT Marzo de 2023 Bloomberg L.P. 50 mil millones Patentado
tokens
329 mil millones de
PanGu-Σ Marzo de 2023 Huawei 1.085 billones Patentado
tokens
1.5 mil millones de
OpenAssistant Marzo de 2023 LAION 17 mil millones Apache 2.0
tokens
Llama 2
7 mil millones
Community
LLaMA 2 Julio 2023 Meta 13 mil millones
License
70 mil millones
Agreement
Llama 2
8 mil millones 15 mil millones de Community
LLaMA 3 Abril 2024 Meta 70 mil millones tokens License
Agreement
Nota. Adaptado de “Modelo de lenguaje grande”, por Wikipedia, s.f.-b.
([Link]
Con dicho marco referencial, se asegurará que los modelos elegidos, con los
aspectos mencionados, están cumpliendo con varios de los criterios técnicos para
un despliegue más eficiente de las aplicaciones de IA bajo la plataforma tecnológica
de la entidad, por lo que en la siguiente imagen se alcanza una reducida muestra de
los modelos open source que ocupan las primeras posiciones:
59
Figura 16
Nota. Adaptado de “LLM-Perf Leaderboard. Hugging Face”, por Hugging Face, s.f.
([Link]
60
adicionales se mostrarán en los apartados posteriores junto a otras alternativas de
GPU de la misma marca en mención.
Por ello, con el sustento técnico de las evaluaciones anteriores de los modelos de
código abierto, se ha hecho una primera selección con las implementaciones más
relevantes, cuyas características principales se detallan a continuación:
Soporta una ventana de contexto de 4 096 tokens, que el modelo puede mantener
en memoria durante la fase de inferencia para permitirle sostener una interacción
compleja y fluida con el usuario. Fue entrenado con un 40% más de datos que su
antecesor LLaMA 1, lo que significó un incremento de la base de conocimiento y
la comprensión semántica.
Figura 17
Rendimiento de LLaMA 2
Nota. Adaptado de “Llama 2: open source, free for research and commercial use”, por Meta, s.f.
([Link]
61
b. LLaMA 3. A diferencia de LLaMA 2 implementa un sistema de tokenización
que faculta el despliegue de un vocabulario de 128,000 tokens, con lo que codifica
el lenguaje mucho más eficientemente favoreciendo un alto rendimiento al modelo.
Ha sido entrenado previamente con un total de 15T de tokens, que han sido
recolectados con datos provenientes de diferentes fuentes públicas, con lo que la
alta calidad de los mismos asegura un mejor resultado en más de 30 idiomas.
Figura 18
Rendimiento de LLaMA 3
62
c. Falcon. Se ha convertido en una de las implementaciones de inteligencia artificial
más avanzadas de código abierto. Este modelo se presenta en la red con las variantes
de 180B, 40B, 7.5B y 1.3B, gracias a las cuales permite afrontar retos complejos
durante la puesta en marcha de muchas aplicaciones.
Figura 19
Rendimiento de Falcon
Nota. Elaborado a partir de “The Falcon Series of Open Language Models”, por E. Almazrouei et al., 2023.
([Link]
63
una amplia cartera de idiomas, con lo que destaca por la potencia y capacidad de
retención gracias a la integración de una ventana de contexto de 32,000 tokens.
Figura 20
Rendimiento de Mistral
Nota. Elaborado a partir de Mistral AI (2023a), Mistral AI (2023b), Mistral AI (2024a) y Mistral AI (2024b).
64
transmisión comprendidas entre los 200Gbps y 400Gbps, para garantizar el
balanceo y la distribución de las pesadas cargas de trabajo en esquemas de
configuración que implementen más de un GPU en distintos nodos de
procesamiento de la solución de clúster.
Tabla 7
Para el tipo de trabajo descrito que se requiere ejecutar se debe recalcar que el
componente principal en el que se basará la infraestructura de modelamiento de
datos es la unidad de procesamiento gráfico o GPU, tal como se indicó, por lo que
para lograr altos ratios en la transferencia de los datos durante las diferentes etapas
del desarrollo se va a requerir de alternativas tecnológicas de última generación que
presenten las mayores capacidades de rendimiento, versatilidad y escalabilidad.
En esa línea, se debe mencionar que muchos de los grandes modelos de lenguaje
cuando se cargan ocupan un considerable espacio en memoria de video, debido a
los voluminosos parámetros con los que han sido empaquetados.
65
Por ello mismo, se requerirá contar con una infraestructura tecnológica que cuente
con una VRAM de 50GB a 80GB en promedio en la tarjeta gráfica, lo
suficientemente considerable para soportar la carga de varios modelos de lenguaje
en forma simultánea, con el fin de proyectar un ambiente de trabajo con la
configuración de un esquema del tipo multi-LLM en la plataforma, como se
mencionó anteriormente, que permita en forma conjunta un mayor nivel de
precisión en los resultados.
Tabla 8
66
En esa línea, tratándose de entrenar varios miles de millones de tokens, se requiere
de una avanzada arquitectura de GPU con altas tasas de transmisión de la
información para aprovechar las ventajas del cómputo paralelo, por lo que, para el
caso, se puede considerar una memoria de video (VRAM) con un ancho de banda
cercano a los 1000GB/s para asegurar un canal de gran capacidad durante las etapas
de entrenamiento de los datos, tales como las opciones basadas en las arquitecturas
Ampere, Ada Lovelace y Hopper, que se muestran en la tabla siguiente:
Tabla 9
Características de los GPU A100 (80GB), L40, L40S, H100 (80GB) y H100 NVL
Modelo A100 (80GB) L40 (48GB) L40S (48GB) H100 (80GB) H100 NVL
Arquitectura de GPU Ampere Ada Lovelace Ada Lovelace Hopper Hopper
Velocidad de reloj del GPU 1065~1410MHz 735~2490MHz 1110~2520MHz 1755MHz 1450~1830MHz
Memoria de GPU 80GB 48GB 48GB 80GB 188GB
Ancho de banda de Memoria 1555GB/s 864GB/s 864GB/s 2TB/s 7.8TB/s
Cores CUDA 6912 18176 18176 14592 14592
Cores RT - 142 142 - -
Rendimiento Core RT TFLOPS - 209 209 - -
Cores Tensor 432 568 568 576 576
FP64 TFLOPS 9.7 - - 26 68
Core Tensor FP64 TFLOPS 19.5 - - 51 134
FP32 TFLOPS 19.5 90.5 91.6 51 134
Core Tensor TF32 TFLOPS (with Sparsity) 156 (132) 90.5 (181) 183 (366) 378 (756) 989 (1979)
Core Tensor BFLOAT16 TFLOPS (with Sparsity) 312 (624) 181.05 (362.1) 362.5 (733) 756 (1513) 1979 (3958)
Core Tensor FP16 TFLOPS (with Sparsity) 312 (624) 181.05 (362.1) 362.5 (733) 756 (1513) 1979 (3958)
Core Tensor FP8 TFLOPS (with Sparsity) - 362 (724) 733 (1466) 1513 (3026) 3958 (7916)
Peak INT8 TOPS (with Sparsity) 624 (1248) 362 (724) 733 (1466) 1513 (3026) 3958 (7916)
Peak INT4 TOPS (with Sparsity) 1248 (2496) 724 (1448) 733 (1466) 1513 (3026) 3958 (7916)
NVLink Sí No No Sí Sí
Consumo máximo de energía (W) 300 300 350 350 800
Soporte de Software GPU Virtual (vGPU) Sí Sí Sí Sí Sí
Soporte vGPU Sí Sí Sí Sí Sí
Soporte MIG Sí No No Sí Sí
Generación PCIe PCIe Gen4 x16 PCIe Gen4 x16 PCIe Gen4 x16 PCIe Gen5 x16 PCIe Gen5 x16
Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “NVIDIA L40S”, por NVIDIA, 2023.
De entre los señalados en la tabla anterior, destaca una variante avanzada del
modelo L40, la versión NVIDIA L40S (48GB), que es la más versátil de todas las
enumeradas con una sobresaliente puntuación en las evaluaciones de
67
costo/beneficio, debido a que es una gráfica fabricada para dedicarse a la ejecución
de diversas cargas de trabajo, aparte del entrenamiento de modelos de IA, tales
como gráficos en 3D, edición de video, renderizado, streaming, aceleración de
medios, generación de imágenes, virtualización, entre otras.
Figura 21
De igual forma, otra opción importante es la tarjeta NVIDIA H100, que cuenta con
hasta 188GB de VRAM y está fabricada para ofrecer un buen rendimiento en
trabajos relacionados al entrenamiento e inferencia debido a su arquitectura
Hopper, con la que puede alcanzar hasta 7.8TB/s de ancho de banda.
Asimismo, se debe resaltar que dicha GPU incorpora la tecnología NVLink para el
entrenamiento de los datos aprovechando la potencia del cómputo en paralelo, por
lo que es idónea para para las casuísticas que se van a ejecutar en la plataforma.
Figura 22
68
[Link] Evaluación del rendimiento de los aceleradores
Antes de continuar, se debe resaltar que calcular valores como el tiempo y el costo,
importantes para las evaluaciones presupuestales en las empresas, relacionados a
los procesos de entrenamiento e inferencia es difícil de estimar, aún ahora, debido
a la cantidad de variables que deben ponderarse teniendo en cuenta los componentes
de hardware y software con sus distintas variantes, por lo que, a pesar de ello, en
los siguientes apartados se dará a conocer algunas comparativas de rendimiento
computacional que involucran los numerosos componentes tecnológicos que se han
ido describiendo a lo largo del proyecto.
Tabla 10
Tiempo de
Framework Modelo entrenamiento Rendimiento GPU Formato Set de datos Versión del GPU
(días)
PyTorch 2.3.0a0 Tacotron2 67 469,109 mels/s 8x H100 Mixto LJSpeech 1.1 H100 SXM5 80GB
PyTorch 2.3.0a0 WaveGlow 119 3,645,916 muestras/s 8x H100 Mixto LJSpeech 1.1 H100 SXM5 80GB
PyTorch 2.3.0a0 GNMT v2 9 1,699,570 tokens/s 8x H100 Mixto wmt16-en-de H100 SXM5 80GB
PyTorch 2.3.0a0 NCF 0.27 218,094,053 muestras/s 8x H100 Mixto MovieLens 20M H100 SXM5 80GB
PyTorch 2.3.0a0 FastPitch 75 1,331,733 frames/s 8x H100 Mixto LJSpeech 1.1 H100 SXM5 80GB
PyTorch 2.3.0a0 Transformer XL Large 318 262,462 tokens/s 8x H100 Mixto WikiText-103 H100 SXM5 80GB
PyTorch 2.3.0a0 Transformer XL Base 141 952,253 tokens/s 8x H100 Mixto WikiText-103 H100 SXM5 80GB
PyTorch 2.3.0a0 EfficientNet-B4 1,667 5,231 imágenes/s 8x H100 Mixto Imagenet2012 H100 SXM5 80GB
PyTorch 2.1.0a0 EfficientDet-D0 325 2,658 imágenes /s 8x H100 Mixto COCO 2017 H100 SXM5 80GB
PyTorch 2.3.0a0 EfficientNet-WideSE-B4 1,673 5,218 imágenes /s 8x H100 Mixto Imagenet2012 H100 SXM5 80GB
PyTorch 2.2.0a0 TFT-Electricity 2 145,082 items/s 8x H100 Mixto Electricity H100 SXM5 80GB
PyTorch 2.3.0a0 HiFiGAN 948 115,461 mels/s 8x H100 Mixto LJSpeech 1.1 H100 SXM5 80GB
PyTorch 2.3.0a0 GPUNet-0 1,052 9,950 imágenes /s 8x H100 Mixto Imagenet2012 H100 SXM5 80GB
69
Tiempo de
Framework Modelo entrenamiento Rendimiento GPU Formato Set de datos Versión del GPU
(días)
PyTorch 2.3.0a0 GPUNet-1 960 10,946 imágenes /s 8x H100 Mixto Imagenet2012 H100 SXM5 80GB
PyTorch 2.3.0a0 MoFlow 35 46,451 moléculas/s 8x H100 Mixto ZINC H100 SXM5 80GB
Tensorflow 2.13.0 U-Net Medical 1 2,139 imágenes /s 8x H100 Mixto EM segmentation challenge H100 SXM5 80GB
Tensorflow 2.13.0 Electra Fine Tuning 2 5,062 secuencias/s 8x H100 Mixto SQuaD v1.1 H100 SXM5 80GB
Tensorflow 2.13.0 Wide and Deep 4 12,217,033 muestras /s 8x H100 Mixto Click Prediction H100 SXM5 80GB
Nota. Adaptado de “Converged Training Performance on NVIDIA Data Center GPUs”, por NVIDIA, s.f.-a.
([Link]
Tabla 11
Tiempo de Rendimiento
Framework Modelo GPU Precisión Versión del GPU
entrenamiento (días) por GPU
Nemo 1.23 GPT3 5B 0.5 23,574 tokens/s 64x H100 FP8 H100 SXM5 80GB
Nemo 1.23 GPT3 20B 2 5,528 tokens/s 64x H100 FP8 H100 SXM5 80GB
Nemo 1.23 Llama2 7B 0.7 16,290 tokens/s 8x H100 FP8 H100 SXM5 80GB
Nemo 1.23 Llama2 13B 1.4 8,317 tokens/s 16x H100 FP8 H100 SXM5 80GB
Nemo 1.23 Llama2 70B 6.6 1,725 tokens/s 64x H100 FP8 H100 SXM5 80GB
Nota. Adaptado de “LLM Training Performance on NVIDIA Data Center Products”, por NVIDIA, s.f.-c.
([Link]
70
Tabla 12
Tiempo de
Framework Modelo entrenamiento GPU Formato Set de datos Versión del GPU
(días)
Nemo Stable Diffusion 46.8 8x H100 Mixto LAION-400M-filtered H100 SXM5 80GB
MXNet ResNet-50 v1.5 13.4 8x H100 Mixto ImageNet H100 SXM5 80GB
MXNet 3D U-Net 13.1 8x H100 Mixto KiTS19 H100 SXM5 80GB
PyTorch BERT 5.4 8x H100 Mixto Wikipedia 2020/01/01 H100 SXM5 80GB
PyTorch Mask R-CNN 19.2 8x H100 Mixto COCO2017 H100 SXM5 80GB
PyTorch RNN-T 16.2 8x H100 Mixto LibriSpeech H100 SXM5 80GB
PyTorch RetinaNet 36.0 8x H100 Mixto OpenImages H100 SXM5 80GB
NVIDIA Merlin HugeCTR DLRM-dcnv2 3.9 8x H100 Mixto Criteo 4TB H100 SXM5 80GB
Nota. Adaptado de “NVIDIA Performance on MLPerf 3.1’s AI Benchmarks: Single Node, Closed Division”,
por NVIDIA, s.f.-e. ([Link]
Tabla 13
Tamaño de Tamaño de
Modelo Rendimiento por GPU GPU Precisión Framework Versión del GPU
la entrada la salida
LLaMA v2 7B 128 128 9,193 tokens/s de salida 1x H100 FP8 TRT-LLM 0.5.0 H100 SXM5 80GB
LLaMA v2 7B 128 2048 5,367 tokens/s de salida 1x H100 FP8 TRT-LLM 0.5.0 H100 SXM5 80GB
LLaMA v2 7B 2048 128 2,058 tokens/s de salida 1x H100 FP8 TRT-LLM 0.5.0 H100 SXM5 80GB
LLaMA v2 7B 2048 2048 2,230 tokens/s de salida 1x H100 FP8 TRT-LLM 0.5.0 H100 SXM5 80GB
LLaMA v2 70B 128 128 1,562 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
LLaMA v2 70B 128 2048 2,063 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
LLaMA v2 70B 2048 128 187 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
LLaMA v2 70B 2048 2048 443 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
Falcon 180B 128 128 868 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
Falcon 180B 128 2048 837 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
Falcon 180B 2048 2048 244 tokens/s de salida 8x H100 FP8 TRT-LLM 0.8.0 H100 SXM5 80GB
Nota. Adaptado de “LLM Inference Performance of NVIDIA Data Center Products”, por NVIDIA, s.f.-b.
([Link]
71
De igual forma, en la comparativa que se muestra a continuación, se puede
distinguir el rendimiento, medido en tokens de salida por segundo, de los modelos
de lenguaje GPT-J 6B, LLaMA v2 13B y LLaMA v2 70B conseguidos durante el
proceso de inferencia ejecutado con una gráfica NVIDIA H100 NVL y una
precisión matemática igual a FP8.
Tabla 14
Tamaño de Tamaño de
Modelo Rendimiento por GPU GPU Precisión Framework Versión del GPU
la entrada la salida
GPT-J 6B 128 128 20,484 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
GPT-J 6B 128 2048 7,134 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
GPT-J 6B 128 4096 3,990 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
GPT-J 6B 2048 2048 3,062 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 13B 128 128 7,844 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 13B 128 2048 3,431 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 13B 128 4096 1,843 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 13B 2048 2048 1,417 tokens/s de salida 1x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 70B 128 128 2,273 tokens/s de salida 2x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 70B 2048 128 248 tokens/s de salida 2x H100 FP8 TRT-LLM 0.8.0 H100 NVL
LLaMA v2 70B 2048 2048 846 tokens/s de salida 2x H100 FP8 TRT-LLM 0.8.0 H100 NVL
Nota. Adaptado de “LLM Inference Performance of NVIDIA Data Center Products”, por NVIDIA, s.f.-b.
([Link]
Tabla 15
Tamaño de Tamaño de
Modelo Rendimiento por GPU GPU Precisión Framework Versión del GPU
la entrada la salida
GPT-J 6B 128 128 7,993 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
GPT-J 6B 128 2048 1,874 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
GPT-J 6B 2048 128 693 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
GPT-J 6B 2048 2048 768 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
LLaMA v2 7B 128 128 5,954 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
72
Tamaño de Tamaño de
Modelo Rendimiento por GPU GPU Precisión Framework Versión del GPU
la entrada la salida
LLaMA v2 7B 128 2048 1,654 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
LLaMA v2 7B 2048 128 580 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
LLaMA v2 7B 2048 2048 543 tokens/s de salida 1x L40S FP8 TRT-LLM 0.8.0 L40S
Nota. Adaptado de “LLM Inference Performance of NVIDIA Data Center Products”, por NVIDIA, s.f.-b.
([Link]
Bien podrían considerarse los anteriores resultados como base para ir definiendo
posibles stacks de Machine Learning para el desarrollo y despliegue de las nuevas
aplicaciones de IA.
73
3.2 Desarrollo de la Solución
Por lo pronto, el proyecto apunta a servir de guía para la implementación de una
plataforma tecnológica que facilite la ejecución de grandes cargas de trabajo
diferenciadas permitiendo, con ello, la generación de aplicaciones puntuales como
las vinculadas a chatbots conversacionales, asistentes virtuales y agentes
inteligentes, haciendo uso de herramientas avanzadas para el despliegue de avatares
digitales, incluso como plataforma para el soporte de nodos de procesamiento
utilizando tecnología de Blockchain, que será objeto de trabajos posteriores.
74
En la sexta y última capa se desplegarán las distintas aplicaciones de inteligencia
generativa que se hayan construido con las herramientas y recursos de IA.
Figura 23
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])
75
Por ello, el desarrollo de la solución será dividido en dos secciones para un mayor
entendimiento del despliegue, que, en una primera instancia, mostrará los
componentes de la infraestructura para el procesamiento de la IA y, en una segunda,
los componentes de la infraestructura tradicional para la plataforma tecnológica de
virtualización con HCI.
Tabla 16
76
Cantidad Equipamiento Tipo Rol
3 Dell PowerScale F600 Nodo/Servidor Almacenamiento NVMe SSD
4 Dell PowerSwitch S5232-ON Switch Conectividad de red a 100Gbps
1 Dell PowerSwitch N3200-ON Switch Conectividad de red a 1Gbps
Tabla 17
Componente Descripción
Altura 78.39 in (199.1 cm)
Anchura 23.62 in (60 cm)
Profundidad 42.13 in (107 cm)
Factor de forma 42U
Tabla 18
Componente Descripción
Servidor 3 x PowerEdge R660
CPU 1 x Intel Xeon Gold 6438M 2.2G, 32C/64T
Memoria 8 x 16 GB DDR5 4800 MT/s RDIMM
Sistema Operativo Tarjeta controladora BOSS-N1 con 2 M.2 960GB (RAID 1)
Controlador RAID PERC H755 con soportes de carga trasera
4 x 3.84 TB SSD SAS RI 24Gbps 512e 2.5in Hot-Plug, AG Drive
Almacenamiento
1DWPD
Red PXE Broadcom 5720 Dual Port 1 GbE Optional LOM
77
Componente Descripción
Red PXE/K8S NVIDIA ConnectX-6 Lx Dual Port 10/25GbE SFP28, OCP NIC 3.0
1 x NVIDIA ConnectX-6 Lx Dual Port 10/25GbE SFP28 Adapter, PCIe
Red de almacenamiento/K8S
(Opcional)
Factor de forma 1RU
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])
Asimismo, se está optando por un servidor Dell PowerEdge R760xa GPU que se
encargará de las cargas de trabajo relacionadas a las tareas de inferencia o
generación de texto, por lo que se está implementando el proyecto, ya sea con el
acelerador NVIDIA L40S (48GB) o NVIDIA H100 (80GB) que, como se ha
determinado en las etapas de análisis de los aceleradores, son dos opciones idóneas
para ese tipo de actividades. Se debe tomar en cuenta que la gráfica NVIDIA H100
(80GB) soporta NVIDIA NVLink Bridge para la interconexión de las GPUs con un
ancho de banda máximo de 600GB/s entre cada par de procesadores gráficos. Las
características técnicas más importantes de dicho modelo son las siguientes:
Tabla 19
Componente Descripción
Servidor 1 x PowerEdge R760xa
CPU 2 x Platinum 8468 2.1G, 48C/96T
Memoria 16 x 32 GB DDR5 4800 MT/s RDIMM
Sistema Operativo Tarjeta controladora BOSS-N1 con 2 M.2 960GB (RAID 1)
Almacenamiento 2 x 3.84 TB Data Center NVMe Read Intensive AG Drive U2 Gen4
Red PXE Broadcom 5720 Dual Port 1 GbE Optional LOM
• 1 x NVIDIA ConnectX-6 Lx Dual Port 10/25 GbE SFP28, No Crypto,
OCP NIC 3.0
Red de almacenamiento/K8S
• 1 x NVIDIA ConnectX-6 DX Dual Port 100 GbE QSFP56 Network
Adapter (Opcional)
Opciones:
GPU • 2 x o 4 x NVIDIA L40S, 48 GB PCIe GPU
• 2 x o 4 x NVIDIA Hopper H100, 80 GB, PCIe GPU NVLink Bridge
Factor de forma 2RU
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])
78
También, se está incluyendo un servidor Dell PowerEdge XE8640 GPU que se
encargará de los trabajos de entrenamiento o procesamiento de los datos, por lo que
se está implementando el sistema con el acelerador NVIDIA H100 SXM (80GB),
la opción que resultó con los mayores desempeños en el apartado de las
evaluaciones, ya que soporta la tecnología NVIDIA NVLink para la interconexión
entre las GPUs a una tasa de 900GB/s en el canal de transmisión. Las características
técnicas más importantes de dicho modelo son las siguientes:
Tabla 20
Componente Descripción
Servidor 1 x PowerEdge XE8640
CPU 2 x Intel Xeon Platinum 8468 2.1G, 48 C/96 T, 16 GT/s
Memoria 16 x 32 GB RDIMM, 4800MT/s Dual Rank
Sistema Operativo Tarjeta controladora BOSS-N1 con 2 M.2 960GB (RAID 1)
Almacenamiento 2 x 3.84 TB Data Center NVMe Read Intensive AG Drive U2 Gen4
Red PXE Broadcom 5720 Dual Port 1 GbE Optional LOM
• 1 x NVIDIA ConnectX-6 Dual Port 100 GbE QSFP56 Adapter, OCP
3.0
Red de almacenamiento/K8S
• 1 x NVIDIA ConnectX-6 DX Dual Port 100 GbE QSFP56 Network
Adapter (Opcional)
GPU 4 x NVIDIA H100 SXM NVLink
Factor de forma 4RU
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])
Además, se está considerando un servidor Dell PowerEdge XE9680 GPU que será
el nodo maestro que se encargará de los trabajos de entrenamiento o procesamiento
de los datos, por lo que se está implementando el sistema con el acelerador NVIDIA
H100 SXM (80GB), que soporta NVIDIA NVSwitch con un ancho de banda de
900GB/s para ofrecer un alto rendimiento con la más baja latencia durante la
transmisión de los datos. Las características técnicas más importantes de dicho
modelo son las siguientes:
79
Tabla 21
Componente Descripción
Servidor 1 x PowerEdge XE9680
CPU 2 x Platinum 8468 2.1G, 48C/96T
Memoria 16 x 64 GB RDIMM, 4800 MT/s Dual Rank
Sistema Operativo Tarjeta controladora BOSS-N1 con 2 M.2 960GB (RAID 1)
Almacenamiento 2 x 3.84 TB Data Center NVMe Read Intensive AG Drive U2 Gen4
Red PXE Broadcom 5720 Dual Port 1 GbE Optional LOM
2 x NVIDIA ConnectX-6 DX Dual Port 100 GbE QSFP56 Network
Red de almacenamiento/K8S
Adapter (Opcional)
GPU 8 x NVIDIA H100 SXM NVSwitch
Factor de forma 6RU
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])
Tabla 22
Componente Descripción
Dispositivo 3 x PowerScale F600
Tarjeta de red frontal FE 2x100GbE w/o Optics
Tarjeta de red de posterior BE 2x100GbE w/o Optics
Capacidad de almacenamiento Flash QLC SED 123TB (15.36TB x8) NVMe SSD AG
CPU 3.0 GHz Processor x2
Memoria 736GB 3200 DIMM Memory
TRPM Trusted Platform Module v3
Contraseña IDRAC IDRAC Legacy Password
Fuente de energía Dual PSU 1100W RDNT
Factor de forma 1RU
80
Para centralizar y agilizar las transacciones de red relacionadas a la administración
de la plataforma y las operaciones de almacenamiento entre los nodos del clúster,
se está incorporando cuatro equipos Dell PowerSwitch S5232-ON, que tiene 3.2
Tbps de capacidad de conmutación, 2.4 Bpps de throughput y una latencia de 877
ns. Los detalles técnicos adicionales más importantes se muestran en la siguiente
tabla:
Tabla 23
Componente Descripción
Puertos 32xQSFP28 2xSFP+
Max 10GbE density 124 (QSFP28 breakout) 2 (SFP+)
Max 25GbE density 124 (QSFP28 breakout)
Max 40GbE density 32 (QSFP28)
Max 50GbE density 64 (QSFP28 breakout)
Max 100GbE density 32 (QSFP28)
Capacidad de conmutación 3.2 Tbps (6.4 Tbps full duplex)
Throughput 2.4 Bpps (4.8 Bpps full duplex)
Latencia (ns) 877
Memoria de CPU 16GB
SSD 64GB
Buffer de paquete 32MB
Factor de forma 1RU
Terminando con el listado del hardware, para el control y monitoreo de los nodos
o servidores con la configuración de la red OOB (Out-of-band), así como de la red
PXE para la automatización del aprovisionamiento y despliegue de los sistemas
operativos, se está considerando un equipo Dell PowerSwitch N3200-ON, que tiene
576Gbps de capacidad de conmutación y 800Mpps de throughput. Los detalles
técnicos adicionales más importantes se muestran en la siguiente tabla:
Tabla 24
Componente Descripción
48 puertos RJ45 1GbE
Puertos 4 puertos SFP+ 10GbE
2 puertos QSFP28 100GbE
Capacidad de conmutación 576Gbps (full duplex)
81
Componente Descripción
Throughput 800Mpps
Memoria de CPU 4GB
SSD 32GB
Buffer de paquete 8MB
Administración Out-of-band 10/100/1000BASE-T
Factor de forma 1RU
Tabla 25
Componente Software
Administración NVIDIA Base Command Manager Essentials v10.23.12
Sistema Operativo Ubuntu v22.04.1 LTS
Contenedorización Docker v23.0.5
Orquestación de Upstream Kubernetes v1.27.6
contenedores
Operador de GPU NVIDIA GPU Operator v22.9.2
Servidor de Inferencia NVIDIA Triton Inference Server v23.04
Motor de Inferencia NVIDIA TensorRT-LLM v0.7.1 and v0.8.0
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])
82
Figura 24
Nota. Adaptado de “Generative AI in the Enterprise - Model Customization”, por Dell, 2024.
([Link]
[Link])
83
Asimismo, en la Figura 25 siguiente, se muestra la posición general que tendría la
solución en los espacios de centro de datos, teniendo en cuenta las distribución con
los dos gabinetes, donde se está mostrando la arquitectura física final que se
asumiría, la misma que se diseñó con la herramienta de Planning Tool del
fabricante.
Figura 25
84
3.2.2 Infraestructura para la plataforma de virtualización con HCI
Tabla 26
85
De igual forma, para las políticas de respaldo de la información se va a contar con
dos implementaciones, una basada en cinta con los equipos Dell PowerEdge R450
y Dell EMC ML3, y otra basada en disco con los sistemas Dell PowerProtect
DD6400 y Dell ES40 SHELF 12G 15x8TB SAS.
Además, para tener una visión más amplia de la infraestructura del centro de datos
convencional, se puede recurrir a la Figura 26 que muestra la topología de red final
donde se aprecian los distintos componentes de la plataforma en los aspectos
relacionados a la capacidad de procesamiento, almacenamiento de la información,
conectividad, respaldo a cinta y respaldo a disco.
En ese sentido, puede apreciarse que, en el primer gabinete, se van a concentrar las
capacidades diseñadas para las tareas de procesamiento y conectividad de red,
mientras que el segundo gabinete va a contener los subsistemas de almacenamiento
de los datos y respaldo de la información.
86
Figura 26
Nota. La información fue extraída de una fuente privada, la misma que es consecuencia de la recopilación y
análisis de la empresa de estudio. De “Topología de solución con HCI”, por EQUANTI S.A.C., 2023.
87
Figura 27
88
plataforma con infraestructura convergente, que carece de tales prestaciones
tecnológicas, tal como se demuestra en la tabla siguiente:
Tabla 27
Plataforma Plataforma
Característica técnica actual propuesta con GPU
tradicional GPU L40S (48GB) GPU H100 (80GB)
Ancho de banda de Memoria - 864GB/s 2TB/s
Por lo tanto, con el incremento del ancho de banda en la memoria de video (GB/s)
del componente gráfico, como se está evidenciando en el análisis previo, se puede
concluir afirmando que se cumplió el Objetivo Específico 1.
89
Tabla 28
Plataforma Plataforma
Característica técnica actual propuesta con GPU
tradicional L40S (48GB) H100 (80GB)
Core Tensor TF32 TFLOPS (with Sparsity) - 183 (366) 378 (756)
Core Tensor BFLOAT16 TFLOPS (with Sparsity) - 362.5 (733) 756 (1513)
Core Tensor FP16 TFLOPS (with Sparsity) - 362.5 (733) 756 (1513)
Core Tensor FP8 TFLOPS (with Sparsity) - 733 (1466) 1513 (3026)
Tabla 29
Plataforma Plataforma
Característica técnica actual propuesta con GPU
tradicional GPU H100 (80GB)
90
Velocidad de reloj del GPU - 1755MHz
NVLink - Sí
Tabla 30
Rendimiento en tokens por segundo de las GPU L40S (48GB) y H100 (80GB)
Plataforma Plataforma
Característica técnica actual propuesta con GPU
tradicional GPU L40S (48GB) GPU H100 (80GB)
Modelo de lenguaje LLM GPT-J 6B LLaMA v2 7B
Tokens/s de salida - 7,993 9,193
91
evidenciando en el análisis previo, se puede concluir afirmando que se cumplió el
Objetivo Específico 4.
Tabla 31
Plataforma Plataforma
Modelo actual propuesta con GPU
tradicional GPU L40S (48GB) GPU H100 (80GB)
Falcon 180B - - 180B
GPT3 5B - - 5B
GPT3 20B - - 20B
GPT-J 6B - 6B -
LLaMA v2 7B - 7B 7B
LLaMA v2 13B - - 13B
LLaMA v2 70B - - 70B
92
3.4 Interpretación de los Resultados
Con los valores obtenidos en la fase de validación del proyecto, donde se ha
evidenciado los resultados mediante distintas fuentes de información referencial,
ya sean tablas comparativas, gráficas demostrativas o documentación técnica, se
puede afirmar que se ha cumplido con todos los objetivos específicos planteados
desde el inicio, con lo que se garantiza que la propuesta de implementación presente
superará largamente las expectativas de los distintos especialistas durante el
desarrollo del proyecto.
93
4 CONCLUSIONES Y RECOMENDACIONES
4.1 Conclusiones
La infraestructura de cómputo paralelo basada en la GPU H100(80GB), que
tiene una frecuencia de reloj de 1755MHz y que incorpora la tecnología
NVIDIA NVLink, permitirá materializar la implementación de una plataforma
dedicada al desarrollo de aplicaciones de inteligencia generativa con el
entrenamiento de modelos de código abierto.
La solución tecnológica que se está proponiendo con la instalación de la GPU
H100 (80GB), cuya VRAM alcanza un ancho de banda base de 2TB por
segundo, va a facilitar la implementación de una línea de producción futura que
agilice la carga en memoria de múltiples modelos de lenguaje de código abierto.
La plataforma de IA tiene la capacidad de procesar modelos de lenguaje que
hayan sido entrenados preliminarmente con una densidad de 5B, 6B, 7B, 13B,
20B, 70B y 180B de parámetros, con lo cual permitirá el uso de aplicaciones
optimizadas con técnicas avanzadas de cuantización preservando los niveles de
precisión y fiabilidad de los resultados.
Se debe resaltar que la iniciativa para la implementación de la propuesta estará
respaldada jurídicamente por la Ley 31814, que el Gobierno está reglamentando
con la convocatoria del público especializado a fin de fortalecer el desarrollo de
la IA en beneficio del avance económico, social y académico.
La plataforma de entrenamiento contará con un alto poder de optimización con
el uso de la tecnología NVIDIA Sparsity, que facilitará alcanzar índices de
procesamiento de 756 TFLOPS en precisión TF32, 1513 TFLOPS en precisión
BFLOAT16, 1513 TFLOPS en precisión FP16 y 3026 TFLOPS en precisión
FP8 con el modelo H100 (80GB), la cual agilizará el consumo de los datos que
provengan de distintas fuentes de información, tales como documentos de texto,
hojas de cálculo, presentaciones, bases de datos, imágenes, audios, videos, entre
otros.
Con la capacidad inherente de procesar los modelos fundacionales publicados,
tales como Falcon 180B, GPT-J 6B, LLaMA v2 7B, LLaMA v2 13B y LLaMA
v2 70B, se facilitará el entrenamiento de múltiples modelos de lenguajes de
código abierto para enriquecer e incrementar los niveles de contextualización
semántica durante los procesos de inferencia,
94
La infraestructura de procesamiento contempla el desarrollo de aplicaciones
que lograrán mantener una ventana de contexto de 7,993 tokens considerando
la gráfica L40S (48GB), con la implementación GPT-J 6B, la cual permitirá
desplegar la técnica conocida como fine-tuning para ajustar el modelo de
lenguaje preentrenado con el conjunto de datos de una materia específica.
De igual forma, se estará en condiciones de producir aplicaciones que lograrán
consolidar una ventana de contexto de 9,193 tokens con la gráfica H100
(80GB), implementando LLaMA v2 7B y haciendo uso de la técnica basada en
RAG, con la cual los datos inferidos por el sistema se consolidarán con la
información contenida en los modelos de lenguaje fundacionales.
Gracias a que la solución contará con un alto poder de optimización con la
tecnología NVIDIA Sparsity, que facilitará alcanzar índices de procesamiento
de 366 TFLOPS en precisión TF32, 733 TFLOPS en precisión BFLOAT16,
733 TFLOPS en precisión FP16 y 1466 TFLOPS en precisión FP8 con el
modelo L40S (48GB), la plataforma de inteligencia generativa estará equipada
para permitir el desarrollo de aplicaciones, tales como asistentes inteligentes,
agentes digitales y presentadores virtuales, que tengan la capacidad de procesar
y reconocer la voz humana para una mejor experiencia en la interacción con los
usuarios.
La propuesta de implementación tecnológica tendrá también como sustento
legal el Decreto de Urgencia N.º 006-2020, que aprobó el Sistema Nacional de
Transformación Digital para incentivar la adopción de las TIC en la gestión
pública.
4.2 Recomendaciones
Ensayar la aplicación de distintos stacks de entrenamiento e inferencia usando
nuevos modelos de lenguaje de código abierto, frameworks, librerías,
controladores, entre otros, para optimizar los recursos de cómputo.
Configurar la interconexión del centro de cómputo basado en aceleradores,
mediante conexión directa o enlace VPN, con las instalaciones de
procesamiento de los diferentes proveedores locales y foráneos de servicios de
IA para ampliar la cartera de recursos computacionales.
95
Conformar distintos equipos técnicos especializados de las diferentes cadenas
de producción para contar con una mayor base de conocimiento que sirva de
soporte para el desarrollo de aplicaciones enfocadas en materias específicas.
Proceder con la adopción del paradigma de desarrollo basado en microservicios
para la producción y publicación de APIs, que puedan ser consumidos por los
usuarios a través de endpoints seguros.
Organizar reuniones de capacitación con el objetivo de divulgar los alcances y
ventajas de la inteligencia artificial en los proyectos de desarrollo productivo.
Coordinar con los encargados de la Secretaría de Gobierno y Transformación
Digital (SGTD) a fin de acceder a nuevos recursos tecnológicos de IA, que
pudieran contribuir con la exploración de mayores opciones de desarrollo de
aplicaciones con inteligencia generativa.
Convertir a la plataforma propuesta de IA en un laboratorio de producción de
aplicaciones inteligentes poniendo a disposición de otras entidades privadas y
públicas las técnicas de entrenamiento e inferencia diseñadas.
Coordinar con las distintas marcas o fabricantes, o en su defecto con sus
representantes locales, que intervinieron en la formulación del proyecto,
acuerdos basados en el acceso a la mayoría o todos los recursos de IA, que
mantengan en sus portafolios de soluciones, a fin de diversificar la oferta de
aplicaciones computacionales.
Entrenar los modelos aprovechando como entrada los documentos o contenidos
generados por los propios especialistas de la entidad.
Optimizar la producción de aplicaciones con el uso de técnicas modernas como
fine-tuning y RAG, que permitan mejorar la precisión y confiabilidad de los
modelos de lenguaje con el procesamiento de información actualizada.
Diseñar una infraestructura de cómputo para el desarrollo de aplicaciones de
inteligencia generativa en las plataformas que mantienen en nube prestigiosas
compañías, tales como Amazon, Google, Microsoft e IBM.
Considerar la participación de otras tecnologías disruptivas del mercado para
potenciar las aplicaciones con el uso de Big Data e Internet of Things, cuyos
repositorios pueden servir como fuentes de información.
Evaluar el consumo de distintos datasets publicados en la red que puedan
contribuir con la mejora de la calidad de las aplicaciones futuras.
96
5 CAPÍTULO 5: REFERENCIAS
Almazrouei, E., Alobeidli, H., Alshamsi, A., Cappelli, A., Cojocaru, R., Debbah, M.,
Goffinet, E., Hesslow, D., Launay, J., Malartic, Q., Mazzotta, D., Noune, B.,
Pannier, B., & Penedo, G. (2023, 29 de noviembre). The Falcon Series of Open
Language Models. Technology Innovation Institute. Recuperado el 19 de mayo
de 2024, de [Link]
Daigle, R., & Huescas, J. (2023, 15 de diciembre). Reference Architecture for Generative
AI Based on Large Language Models (LLMs). Lenovo Press. Recuperado el 8 de
abril de 2024, de [Link]
for-generative-ai-based-on-large-language-models/
Decreto Legislativo 1412. (2018). Decreto Legislativo que aprueba la Ley de Gobierno
Digital. Poder Ejecutivo.
97
Dell. (2024). Generative AI in the Enterprise - Model Customization. Dell Technologies.
Recuperado el 23 de mayo de 2024, de
[Link]
solutions/technical-support/[Link]
Ley 29733. (2011). Ley de protección de datos personales. Congreso de la República del
Perú.
Ley 31814. (2023). Ley que promueve el uso de la inteligencia artificial en favor del
desarrollo económico y social del país. Congreso de la República del Perú.
Meta. (s.f.). Llama 2: open source, free for research and commercial use. Meta.
Recuperado el 21 de mayo de 2024, de [Link]
Mishra, P. (2023, 18 de junio). 3 Ways Vector Databases Take Your LLM Use Cases to
the Next Level [Imagen adjunta]. LinkedIn [Link]
ways-vector-databases-take-your-llm-use-cases-next-level-mishra/
Mistral AI. (2023a, 27 de setiembre). Mistral 7B. Mistral AI. Recuperado el 30 de mayo
de 2024, de [Link]
Mistral AI. (2024b, 17 de abril). Cheaper, Better, Faster, Stronger. Mistral AI.
Recuperado el 30 de mayo de 2024, de [Link]
98
NVIDIA. (s.f.-b). LLM Inference Performance of NVIDIA Data Center Products.
NVIDIA Developer. Recuperado el 27 de abril de 2024, de
[Link]
inference/
99
ANEXO A - Detalles técnicos de los componentes de la plataforma tecnológica
hiperconvergente
Tabla 32
Tabla 33
100
Enclosure - Dell EMC UnityXT 380H
10 x Unity 1.8TB 10K SAS 25X2.5 DRIVE
Almacenamiento 6 x D4 800GB SAS FLASH 25X2.5 SSD
Unity SYSPACK 4X600GB 10K SAS 25X2.5
Unity CNA 4x10GbE OPT SFPs
Conectividad
2 x UNITY 2X5M ACTIVE TWINAX CBL 10G
Tabla 34
Tabla 35
Tabla 36
101
Switch - Dell EMC Switch S4112F-ON
2 x Dell Networking, Jumper Cord, 250V, 12A, 2m, C13/C14, US
Cable a 100GbE Dell Networking Cable, 100GbE, QSFP28 to QSFP28
Cable DAC 4 x Dell Networking, Cable, SFP+ to SFP+, 10GbE
Sistema operativo OS10 Enterprise, S4112F
Bandeja Dell Networking Dual Tray, one Rack Unit, 4-post rack only, S4112
Tabla 37
Tabla 38
102
Librería de respaldo - Dell EMC ML3
LTO Cleaning Tape, 1 Pack
Limpieza
Cleaning Tape Cartridge for LTO with Barcode Labels, 1 pack
Cintas 5 x LTO8 Tape Media, 5 Pack
Cable SAS 2 x 6Gb Mini to HD-Mini SAS Cable, 5M
Redundant Power Supply for ML3/ML3E Expansion
Fuente de poder C13 to C14, PDU Style, 12 AMP, 6.5 Feet (2m) Power Cord, North America
C13 to C14, PDU Style, 12 AMP, 6.5 Feet (2m) Power Cord, North America
ML3/ML3E Rack Rails
Rieles para rack ProDeploy Dell Storage TL Series 4U Library - Deployment
ProDeploy Dell Storage TL Series 4U Library - Deployment Verification
Tabla 39
Tabla 40
Características técnicas del enclosure Dell ES40 SHELF 12G 15x8TB SAS
103
ANEXO B
CAPÍTULO I
DISPOSICIONES GENERALES
104
como, se garantiza la sensibilización, comprensión y concientización sobre el uso e
impacto de los sistemas basados en la inteligencia artificial para que las personas puedan
tomar decisiones informadas sobre su utilización.
105
k) Rendición de cuentas y supervisión humana.- Los sistemas basados en inteligencia
artificial cuentan con mecanismos para la rendición de cuentas por su funcionamiento y
uso; así como con mecanismos adecuados para su supervisión.
106
ANEXO C - Glosario técnico
Base de datos vectorial. Sistema de persistencia donde los datos se salvan en formato
vectorial multidimensional, donde cada dimensión representa una propiedad específica
de los elementos almacenados.
107
Core RT (Ray Tracing o Trazado de Rayo). Núcleo o procesador de la arquitectura del
GPU que es usado para mejorar la experiencia en el desarrollo de las aplicaciones de IA
que impliquen generación de gráficos en 3D.
Core Tensor. Núcleo o procesador de la arquitectura del GPU que es usado para ejecutar
cálculos relacionados a operaciones matriciales y vectoriales de modo más eficiente.
Corpus. Colección de datos en formato de texto, audio, imagen, video, entre otros, que
se usan para entrenar los modelos de lenguaje.
108
GPU (Graphics Processing Unit o Unidad de Procesamiento Gráfico). Dispositivo
electrónico diseñado para procesar a altas velocidades cargas pesadas de trabajo que
involucren operaciones sofisticadas y masivas de coma flotante.
109
Modelo. Representación o abstracción computacional de una realidad que ha sido
entrenada con millones de datos de una materia específica para conseguir predecir sucesos
futuros cercanos.
Modelo fundacional. Modelo de inteligencia generativa que ha sido entrenado con una
gran cantidad de datos no etiquetados haciendo uso de mecanismos de aprendizaje
autosupervisado, que sirve de base para el desarrollo de nuevas aplicaciones de IA.
110
Parámetro. Variable numérica interna que se va ajustando en forma iterativa durante la
fase de entrenamiento para mejorar el rendimiento del modelo de aprendizaje profundo.
PyTorch. Framework de código abierto basado en el lenguaje Python, que se usa para el
desarrollo de aplicaciones de aprendizaje automático.
Red neuronal. Modelo computacional formado por varios nodos, a modo de neuronas
humanas, interconectados entre sí por medio de diferentes niveles o capas de abstracción
que facilitan el aprendizaje de las computadoras.
111
Tokenización. Proceso computacional que se encarga de la generación de los tokens o
unidades básicas semánticas de información.
Ventana de contexto. Cantidad de tokens que un modelo puede procesar como máximo
para mantener la inferencia semántica, en un momento determinado de la interacción con
el usuario.
VRAM (Video RAM). Espacio de memoria del GPU que se usa para almacenar los datos
en forma temporal durante los procesos de entrenamiento con la ejecución de los
algoritmos de IA.
112