Programa Experto en Ciencia de Datos con R
Programa Experto en Ciencia de Datos con R
EXPERTO EN CIENCIA
DE DATOS CON R
1
EXPERTO
EN CIENCIA
DE DATOS
1. Introducción
Conviértase en un Experto en Ciencia de Datos con R y domine las herramientas que están
dando forma al futuro de los negocios. Este programa está diseñado para capacitar a
profesionales como usted en el análisis de datos, permitiéndole tomar decisiones informadas
y transformar su organización. A través de este programa, aprenderá a interpretar, analizar y
aplicar datos de manera eficiente, desbloqueando todo su potencial para generar impacto en
su empresa.
10 años de experiencia enseñando 100% online respaldan este programa, el cual le permitirá
compartir experiencias con profesionales de todo el mundo, y acceder a sesiones grabadas
para mayor flexibilidad.
2
2. Perfil de Entrada de los Estudiantes
El Programa Experto en Ciencia de Datos con R está dirigido a personas de todas las
áreas que estén interesadas en adquirir habilidades en el análisis de datos, sin requerir
conocimientos previos en programación de computadoras.
• Estadísticos y economistas:
que buscan aplicar técnicas de minería de datos para generar insights clave
en sus estudios.
3
3. Objetivos Generales del Programa
El objetivo principal del Programa Experto en Ciencia de Datos con R
es formar a profesionales capaces de:
4
4. Posibilidades de Empleo
Este programa abre las puertas a múltiples oportunidades laborales en el creciente campo
de la ciencia de datos. Los egresados podrán desempeñarse en roles como:
• Científico de Datos:
Responsable de diseñar, desarrollar y aplicar modelos predictivos y de análisis para
resolver problemas complejos y generar valor en la empresa.
• Analista de Datos:
Interpretando y analizando grandes volúmenes de datos para proporcionar insights
útiles y guiar las decisiones estratégicas de las organizaciones.
5
5. Programa General
El Programa Experto en Ciencia de Datos con R tiene una duración total de 12 meses, con
módulos que pueden ser tomados en cualquier orden y a través de nuestra plataforma online.
Incluye clases en vivo por videoconferencia y acceso a un campus virtual 24/7, basado en
Moodle, donde los estudiantes pueden interactuar con sus tutores y compañeros, además de
acceder a grabaciones de las clases, materiales adicionales, software, y participar en debates
a través de foros.
1. CD100: 7. CD303:
Métodos Exploratorios en Ciencia de Datos Programación Avanzada en R
2. CD103: 8. CD306:
Métodos Predictivos en Ciencia de Datos Manipulación y Preparación de Datos
3. CD106: 9. CD309:
Métodos de Regresión en Ciencia de Datos Visualización e Interpretación de Datos
6
6. Metodología
El “Programa Experto en Ciencia de Datos con R” tendrá una duración de 12 meses calendario,
compartidos con estudiantes de todo el mundo y desarrollados 100% en la modalidad
presencial-remoto.
Las clases se impartirán vía web en vivo desde nuestras oficinas, usando Zoom, mediante una
vídeo conferencia, así el estudiante podrá seguir la lección desde cualquier lugar en donde se
encuentre usando su computadora e incluso usando un Smartphone o una Tablet.
En estas vídeo conferencias participarán todos los estudiantes, quienes podrán hacer
preguntas de forma oral o por medio del chat, en cualquier momento. Además, las
videoconferencias quedarán grabadas y se subirán en el aula virtual, de modo que los
estudiantes la puedan accesar tantas veces como lo necesiten, o en caso de que no pudieran
asistir a la clase presencial-remoto.
7
Nuestros cursos están basados en la teoría de la aplicación directa y práctica con casos reales
de los conceptos aprendidos y tendrán una duración de 4 semanas.
Una vídeo conferencia semanal, la cual quedará grabada en Zoom, para que
los alumnos la puedan acceder en cualquier momento, es decir, los estudiantes
recibirán las clases en línea en tiempo real, pueden ver al tutor, seguir su
presentación, hacerle preguntas y obtener respuestas en directo. Todas las
asignaturas del programa cuentan con docencia en línea en tiempo real o en
diferido, pueden ver las clases tantas veces como quiera según las necesidades
del estudiante.
8
7. Inversión
Horario de clases:
Martes 6:00 pm Costa Rica, la duración Precio Proyecto Final:
aproximada de la videoconferencia es $300 +2% de IVA.
de 2 horas.
Inversión total:
Duración: $2300 + 2% de IVA
12 meses
8. Información adicional:
Correo electrónico : info@[Link] Teléfono: +506 4030-1205
9
CD100
Métodos Exploratorios en
Ciencia de Datos
Descripción
En este curso se presentarán los principales conceptos y métodos en Ciencia de Datos. El
énfasis principal del curso será examinar dichos métodos desde un punto geométrico y de sus
aplicaciones concretas. Se le dará especial importancia al uso de los conceptos de Ciencia de
Datos en aplicaciones reales con bases de datos de gran tamaño, para esto se utilizarán los
programas especializados en Ciencia de Datos como discoveR sobre la plataforma de software
libre R y RStudio.
Objetivos
En este curso el estudiante será capaz de:
1. Entender la necesidad de la utilización de modelos, algoritmos, software especial para el
descubrimiento de conocimiento en grandes volúmenes de datos.
6. Utilizar el discoveR sobre la plataforma R para analizar ejemplos con datos reales.
10
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom,
para que los alumnos la puedan acceder en cualquier momento.
Contenido
1. Conceptos de la Ciencia de Datos.
a. Definiciones básicas en Ciencia de Datos.
b. Plano principal.
c. Círculo de correlaciones.
11
4. Clustering Jerárquico Aglomerativo.
a. ¿Qué es “cluster analysis”?
d. Agregaciones.
e. Jerarquías binarias.
b. Teorema de Fisher.
c. Problema combinatorio.
d. Método de Forgy.
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos. La
nota mínima de aprobación es de 70.
Bibliografía
[1] Analyses factorielles simples - Xavier Bry - Librairie Eyrolles. url: [Link]
simples-9782717828597/ (visited on10/17/2022).
[2] W. John Braun and Duncan J. Murdoch. A First Course in Statistical Programming with R. Google-Books-ID: NzorEAAAQBAJ.
Cambridge University Press, May 20, 2021.281 pp. isbn: 978-1-108-99514-6.
[3] Data Mining Techniques: For Marketing, Sales, and Customer Relationship Management, 3rd Edition | Wiley. [Link]. url:
[Link] hniques%3A+For+Marketing%2C+Sales%2C+and+Customer+Relationship+Manag
ement%2C+3rd+Edition-p-9781118087459 (visited on 10/17/2022).
[4] Trevor Hastie, Jerome Friedman, and Robert Tibshirani. The Elements of Statistical Learning. Springer Series in Statistics.
New York, NY: Springer, 2001. isbn: 978-1-4899-0519-2 978-0-387-21606-5. doi: 10.1007/978-0-387-21606-5. url: [Link]
[Link]/10.1007/978-0-387-21606-5 (visited on 10/17/2022).
[5] Michel Jambu. “Introduction au data mining”. In: (1999).
[6] Boris Mirkin and Boris Mirkin. Clustering for Data Mining: A Data Recovery Approach. New York: Chapman and Hall/CRC, Apr. 28,
2005. 296 pp. isbn: [Link]: 10.1201/9781420034912.
[7] R: The R Project for Statistical Computing. url: [Link]
[8] O Rodríguez, PJF Groenen S Winsberg, and E Diday. “I-Scal: Symbolic Multidimensional Scaling of Interval Dissimilarities”. In:
COMPUTATIONAL STATISTICS & DATA ANALYSIS the Official Journal of the International Association for Statistical Computing,
London (2006).
12
CD103
Métodos Predictivos en
Ciencia de Datos
Descripción
En este curso se presentarán los principales métodos en Ciencia de Datos, especialmente
enfocados en métodos predictivos, conocidos también como métodos de aprendizaje
supervisado. El énfasis principal del curso será examinar dichos métodos desde un punto de
vista algorítmico y de sus aplicaciones en casos reales. Se le dará especial importancia al
uso de los conceptos de Ciencia de Datos en aplicaciones reales con bases de datos de gran
tamaño, para esto se utilizarán los programas especializados en Ciencia de Datos, como son la
plataforma de desarrollo R y el paquete predictoR.
Objetivos
En este curso el estudiante será capaz de:
1. Comprender la diferencia entre modelos de aprendizaje supervisado (minería predictiva)
y modelos de aprendizaje no supervisado (minería descriptiva).
13
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom, para que los
alumnos la puedan acceder en cualquier momento.
Contenido
1. Conceptos de la Analítica Predictiva.
a. Conceptos y diferencias entre aprendizaje supervisado y aprendizaje no supervisado.
g. Curvas ROC.
b. El mejor valor de K.
c. Algoritmo de Aprendizaje.
14
3. Máquinas Vectoriales de Soporte.
a. Hiperplano de separación de las clases.
b. Vectores de soporte.
b. Árboles de auto-regresión.
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos.
La nota mínima de aprobación es de 70.
Bibliografía
[1] Esteban Alfaro, Matias Gamez, and Noelia García. “adabag: An R Package for Classification with Boosting and Bagging”. In:
Journal of Statistical Software 54 (Sept. 3, 2013), pp. 1–35. issn: 1548-7660. doi: 10.18637/jss.v054.i02. url: [Link]
637/jss.v054.i02 (visited on 10/19/2022).
[2] Gérard Biau and Erwan Scornet. “A random forest guided tour”. In: TEST 25.2 (June 1, 2016), pp. 197–227. issn: 1863-8260. doi:
10.1007/s11749-016-0481-7. url: [Link] (visited on 10/19/2022).
[3] Trevor Hastie, Jerome Friedman, and Robert Tibshirani. The Elements of Statistical Learning. Springer Series in Statistics.
New York, NY: Springer, 2001. isbn: 978-1-4899-0519-2 978-0-387-21606-5. doi: 10.1007/978-0-387-21606-5. url: [Link]
[Link]/10.1007/978-0-387-21606-5 (visited on 10/19/2022).
[4] Alexandros Karatzoglou, David Meyer, and Kurt Hornik. “Support Vector Machines in R”. In: Journal of Statistical Software 15 (Apr.
6, 2006), pp. 1–28. issn: 1548-7660. doi:10.18637/jss.v015.i09. url: [Link]
[5] Andy Liaw and Matthew Wiener. “Classification and Regression by randomForest”. In: 2 (2002), p. 5.
[6] Wei-Yin Loh. “Classification and regression trees”. In: WIREs Data Mining and Knowledge Discovery 1.1 (2011). _eprint: https://
[Link]/doi/pdf/10.1002/widm.8,pp. 14–23. issn: 1942-4795. doi: 10.1002/widm.8. url: [Link]
com/doi/abs/10.1002/widm.8.
[7] R: The R Project for Statistical Computing. url: [Link]
15
CD106
Métodos de Regresión
en Ciencia de Datos
Descripción
En este curso se presentarán los principales métodos en Ciencia de Datos, especialmente
enfocados en métodos de Regresión. El énfasis principal del curso será examinar dichos
métodos desde un punto de vista algorítmico y de sus aplicaciones en casos reales. Se le
dará especial importancia al uso de los conceptos de Ciencia de Datos en aplicaciones reales
con bases de datos de gran tamaño, para esto se utilizarán los programas especializados en
Ciencia de Datos, como son la plataforma de desarrollo R y el paquete regressoR.
Objetivos
En este curso el estudiante será capaz de:
1. Comprender la diferencia entre modelos de clasificación y modelos de regresión.
16
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom, para que los
alumnos la puedan acceder en cualquier momento.
Contenido
1. Conceptos Básicos de Regresión.
f. Índices de error. Error cuadrático medio, error absoluto medio, correlación y otros.
b. Interpretación de coeficientes.
b. Regresión RIDGE.
17
4. Árboles de Decisión para Regresión – Método CART.
a. Árboles de Regresión.
b. Bosques de Regresión.
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos. La
nota mínima de aprobación es de 70.
Bibliografía
[1] Gérard Biau and Erwan Scornet. “A random forest guided tour”. In: TEST 25.2 (June 1, 2016), pp. 197–227. issn: 1863-8260. doi:
10.1007/s11749-016-0481-7. url: [Link] (visited on 10/19/2022).
[2] Brad Boehmke and Brandon M. Greenwell. Hands-On Machine Learning with R. New York: Chapman and Hall/CRC, Nov. 14,
2019. 488 pp. isbn: 978-0-367-81637-7. doi:10.1201/9780367816377.
[3] John Fox and Sanford Weisberg. An R Companion to Applied Regression. Google-Books-ID: uPNrDwAAQBAJ. SAGE
Publications, Sept. 27, 2018. 608 pp. isbn: 978-1-5443-3648-0.
[4] Trevor Hastie, Jerome Friedman, and Robert Tibshirani. The Elements of Statistical Learning. Springer Series in Statistics.
New York, NY: Springer, 2001. isbn: 978-1-4899-0519-2 978-0-387-21606-5. doi: 10.1007/978-0-387-21606-5. url: [Link]
[Link]/10.1007/978-0-387-21606-5 (visited on 10/19/2022).
[5] Alexandros Karatzoglou, David Meyer, and Kurt Hornik. “Support Vector Machines inR”. In: Journal of Statistical Software 15 (Apr.
6, 2006), pp. 1–28. issn: 1548-7660. doi:10.18637/jss.v015.i09. url: [Link]
[6] Andy Liaw and Matthew Wiener. “Classification and Regression by randomForest”. In:2 (2002), p. 5.
[7] Wei-Yin Loh. “Classification and regression trees”. In: WIREs Data Mining and Knowledge Discovery 1.1 (2011). _eprint: https://
[Link]/doi/pdf/10.1002/widm.8,pp. 14–23. issn: 1942-4795. doi: 10.1002/widm.8. url: [Link]
com/doi/abs/10.1002/widm.8.
[8] R: The R Project for Statistical Computing. url: [Link]
[9] Simon Sheather. A Modern Approach to Regression with R. Google-Books-ID: IZ6Ra0efSdsC. Springer Science & Business
Media, Feb. 27, 2009. 398 pp. isbn: 978-0-387-09608-7.
18
CD200
Métodos Avanzados
en Ciencia de Datos
Descripción
En este curso se estudiarán en detalle las técnicas de Validación Cruzada (Cross-Validation)
y Remuestreo (boostrapping) con el objetivo de calibrar y seleccionar el mejor método de
Ciencia de Datos para un problema y juego de datos dado. Se estudiará como programar
y automatizar la Validación Cruzada (Cross-Validation) y Remuestreo (boostrapping) en el
lenguaje R. Los ejemplos de este curso estarán motivados por problemas reales en el campo.
Por lo tanto, los estudiantes adquieren conocimientos de muchas herramientas diferentes que
pueden combinarse para resolver problemas reales.
Objetivos
En este curso el estudiante será capaz de:
1. Usar el paquete predictoR para Validación Cruzada (Cross-Validation) y Remuestreo
(bootsrapping).
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom, para que los
alumnos la puedan acceder en cualquier momento.
19
3. Foros para plantear dudas al tutor y compañeros.
Contenido
1. Métodos Bayesianos
a. Método de Bayes.
b. Curva ROC.
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos. La
nota mínima de aprobación es de 70.
20
Bibliografía
[1] Hervé Abdi and Dominique Valentin. “Multiple Correspondence Analysis”. In: Multiple Correspondence Analysis (), p. 13.
[2] Michael Greenacre and Jorg Blasius, eds. Multiple Correspondence Analysis and Related Methods. New York: Chapman and
Hall/CRC, June 22, 2006. 608 pp. isbn: 978-0-429-14196-6. doi: 10.1201/9781420011319.
[3] H. Teil. “Correspondence factor analysis: An outline of its method”. In: Journal of the International Association for Mathematical
Geology 7.1 (Feb. 1, 1975), pp. 3–12. issn:1573-8868. doi: 10.1007/BF02080630. url: [Link] (visited
on 10/19/2022).
[4] The ‘K’ in K-fold Cross Validation. url: [Link] (visited on 10/19/2022).
[5] R. Vidal, Yi Ma, and S. Sastry. “Generalized principal component analysis (GPCA)”. In: IEEE Transactions on Pattern Analysis and
Machine Intelligence 27.12 (Dec. 2005). Conference Name: IEEE Transactions on Pattern Analysis and Machine Intelligence, pp.
1945–1959. issn: 1939-3539. doi: 10.1109/TPAMI.2005.244.
[6] Tzu-Tsung Wong. “Performance evaluation of classification algorithms by k-fold and leave-one-out cross validation”. In: Pattern
Recognition 48.9 (Sept. 1, 2015), pp. 2839–2846. issn: 0031-3203. doi: 10.1016/[Link].2015.03.009. url: [Link]
[Link]/science/article/pii/S0031320315000989 (visited on 10/19/2022).
21
CD203
Predicción de Inventarios
Series de Tiempo
Descripción
En este curso se presentarán los principales conceptos, algoritmos y métodos en Series
de Tiempo. El énfasis principal del curso será examinar dichos métodos desde un punto
geométrico y de sus aplicaciones concretas. Se le dará especial importancia al uso de los
conceptos en aplicaciones reales con bases de datos de gran tamaño, para esto se utilizarán
algunos paquetes especializados sobre la plataforma de software libre R.
Objetivos
En este curso el estudiante será capaz de:
1. Utilizar el paquete forecasteR en R para trabajar con Series de Tiempo.
4. Aprender las técnicas estadísticas aplicables a datos tipo series de tiempo para
preparar pronósticos.
6. Utilizar forecasteR para analizar ejemplos con datos reales de Series de Tiempo.
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom, para que los
alumnos la puedan acceder en cualquier momento.
22
2. Trabajos prácticos semanales.
Contenido
1. Análisis de Series de Tiempo
a. ¿Qué es una serie de tiempo?
d. Corrección de fechas.
e. Estacionalidad.
j. Periodograma.
2. Ajuste exponencial
a. Suavizado Exponencial.
3. Métodos ARIMA
a. Análisis de las autocorrelaciones y autocorrelaciones parciales.
23
c. Estimación de parámetros en los modelos ARIMA.
d. Modelado de ARIMA.
e. Uso de reglas.
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos. La
nota mínima de aprobación es de 70.
Bibliografía
[1] Peter J. Brockwell and Richard A. Davis. Time Series: Theory and Methods. Springer Series in Statistics. New York, NY: Springer,
1991. isbn: 978-1-4419-0319-8 978-1-4419-0320-4. doi: 10.1007/978-1-4419-0320-4. url: [Link]
1-4419-0320-4 (visited on 10/05/2022).
[2] John Chambers. Software for Data Analysis. Statistics and Computing. New York, NY: Springer, 2008. isbn: 978-0-387-75935-
7 978-0-387-75936-4. doi: 10.1007/978-0-387-7593 6-4. url: [Link] (visited on
10/05/2022).
[3] Avril Coghlan. “A Little Book of R For Time Series”. en. In: (), p. 81.
[4] John Cristian Borges Gamboa. Deep Learning for Time-Series Analysis. arXiv:1701.01887 [cs]. Jan. 2017. doi: 10.48550/
arXiv.1701.01887. url: [Link] (visited on 10/05/2022).
[5] Rami Krispin. Hands-On Time Series Analysis with R: Perform time series analysis and forecasting using R. en. Google-Books-ID:
tTmbDwAAQBAJ. Packt Publishing Ltd, May 2019. isbn: 978-1-78862-404-6.
[6] Andrew V. Metcalfe and Paul S.P. Cowpertwait. Introductory Time Series with R. en. New York, NY: Springer New York, 2009. isbn:
978-0-387-88697-8 978-0-387-88698-5. doi: 10.1007/978-0-387-88698-5. url: [Link]
88698-5 (visited on 10/05/2022).
[7] Wayne A. Woodward, Henry L. Gray, and Alan C. Elliott. Applied Time Series Analysis with R. 2nd ed. Boca Raton: CRC Press,
Jan. 2017. isbn: 978-1-315-16114-3. doi: 10.1201/9781315161143.4
24
CD300
Fundamentos de
Programación en R
Descripción
En este curso se presentarán desde cero los principales conceptos de programación y su
aplicación en lenguaje R, enfocado al ámbito de la ciencia de datos.
Objetivos
En este curso el estudiante será capaz de:
1. Crear scripts de R.
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom, para que los
alumnos la puedan acceder en cualquier momento.
25
Luego de este curso el estudiante será capaz de:
Desarrollar scripts en lenguaje R que permiten un análisis de datos básico.
Contenido
1. Instalación y preparación del entorno de trabajo.
a. Instalar RStudio.
b. Instalar R.
3. Tipos de datos.
a. Vectores Atómicos.
b. Matrices.
c. Listas.
d. Tablas de datos.
4. Lectura de datos.
a. Lectura de datos csv y xlsx.
26
5. Estructuras de control.
a. IF - ELSE.
b. Ciclos FOR.
c. Ciclos While.
6. Funciones.
a. Estructura de una función.
c. Manejo de errores.
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos. La
nota mínima de aprobación es de 70.
Bibliografía
[1] J.J. Allaire et al. Quarto. DOI: 10.5281/ZENODO.5960048. Zenodo, Jan. 10, 2022. doi: 10.5281/ZENODO.5960048. url: https://
[Link]/record/5960048.
[2] John M. Chambers. Software for data analysis: programming with R. Statistics and computing. OCLC: ocn191243189. New York:
Springer, 2008.
[3] chocolatey. Chocolatey Software Docs | Chocolatey - Software Management for Windows. 2022. url: [Link]
chocolateyorg/en-us.
[4] Colin Gillespie and Robin Lovelace. Efficient R programming: a practical guide to smarter programming. First edition. OCLC:
ocn964820738. Sebastopol, CA: O’Reilly Media, Inc, 2016.
[5] Norman S. Matloff. The art of R programming: tour of statistical software design. OCLC: ocn711045702. San Francisco: No
Starch Press, 2011.
[6] Hadley Wickham. “Tidy Data”. In: Journal of Statistical Software 59 (Sept. 12, 2014), pp. 1–23. doi: 10.18637/jss.v059.i10. url:
[Link]
[7] Hadley Wickham and Garrett Grolemund. R for data science: import, tidy, transform, visualize, and
27
CD303
Programación
Avanzada en R
Descripción
En este curso se presentan desde los elementos básicos hasta la elaboración de un proyecto
del proceso de manipulación, visualización de datos y la elaboración de reportes para resolver
un problema de Ciencia de Datos en R.
Objetivos
En este curso el estudiante será capaz de:
1. Verificar el formato correcto de los datos y realizar correcciones.
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom, para que los
alumnos la puedan acceder en cualquier momento.
28
Luego de este curso el estudiante será capaz de:
Implementar proyectos de Minería de Datos que involucre los pasos básicos de manipulación,
visualización y reportes de nivel empresarial utilizando el lenguaje de programación R.
Contenido
1. Creación de proyectos.
a. Control de rutas.
b. Estructura de carpetas.
b. Selección de individuos.
c. Resumenes de datos.
d. Ordenar tablas.
b. Árboles.
c. Bosques Aleatorios.
d. Potenciación y XGBoosting.
29
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos. La
nota mínima de aprobación es de 70.
Bibliografía
[1] J.J. Allaire et al. Quarto. DOI: 10.5281/ZENODO.5960048. Zenodo, Jan. 10, 2022. doi:
10.5281/ZENODO.5960048. url: [Link]
[2] John M. Chambers. Software for data analysis: programming with R. Statistics and
computing. OCLC: ocn191243189. New York: Springer, 2008.
[3] chocolatey. Chocolatey Software Docs | Chocolatey - Software Management for Windows.
2022. url: [Link]
[4] Colin Gillespie and Robin Lovelace. Efficient R programming: a practical guide to smarter
programming. First edition. OCLC: ocn964820738. Sebastopol, CA: O’Reilly Media, Inc, 2016.
[5] Norman S. Matloff. The art of R programming: tour of statistical software design. OCLC:
ocn711045702. San Francisco: No Starch Press, 2011.
[6] Hadley Wickham. “Tidy Data”. In: Journal of Statistical Software 59 (Sept. 12, 2014), pp.
1–23. doi: 10.18637/jss.v059.i10. url: [Link]
[7] Hadley Wickham and Garrett Grolemund. R for data science: import, tidy, transform,
visualize, and model data. First edition. OCLC: ocn968213225. Sebastopol, CA: O’Reilly, 2016.
30
CD306
Manipulación y
Preparación de Datos
Descripción
En este curso se presentarán los fundamentos del lenguaje R para el procesamiento de datos.
El énfasis principal del curso será examinar diversos componentes del lenguaje, como lo son
funciones, expresiones, librerías, entre otros. Se le dará especial importancia al uso del lenguaje
como herramienta de manipulación de información, como punto de partida para el desarrollo
de aplicaciones de minería de datos. Para esto se utilizarán diversos paquetes en R para
manipulación de datos, así como motores de bases de datos como SQLite y MySQL.
Objetivos
En este curso el estudiante será capaz de:
1. Utilizar el lenguaje R como mecanismo de extracción de datos e información a partir de
repositorios con grandes volúmenes de datos.
2. Hacer uso correcto del lenguaje para construir consultas complejas que permitan
manipular información de distintas tablas de datos simultáneamente.
31
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom, para que los
alumnos la puedan acceder en cualquier momento.
Contenido
1. Estructuración de datos.
a. ¿Qué es Data Wrangling?
• Separaciones.
• Transformaciones.
2. Manipulación de datos.
a. Uso de dplyr para el procesamiento y manipulación de datos en R.
3. Manipulación de Textos.
a. Manejo de variables categóricas.
32
c. Realizar conteos de patrones en los textos.
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos. La
nota mínima de aprobación es de 70.
Bibliografía
[1] Bradley C. Boehmke. Data Wrangling with R. Springer, 2016. url: [Link]
319-45599-0 (visited on 10/10/2022).
[2] Vikram Dayal. Quantitative Economics with R. Singapore: Springer Singapore, 2021. 326 pp. isbn: 9789811634345. doi:
10.1007/978-981-16-3434-5. url: [Link] (visited on 10/10/2022).
[3] “MySQL: My Structured Query Language”. In: Encyclopedia of Systems Biology. Ed. by Werner Dubitzky et al. New York, NY:
Springer New York, 2013, pp. 1485–1486. isbn: 978-1-4419-9863-7. doi: 10.1007/978-1-4419-9863-7_100986. url: [Link]
org/10.1007/978-1-4419-9863-7_100986.
[4] Alfredo Ferro et al. “MySQL Data Mining: Extending MySQL to Support Data Mining Primitives (Demo)”. In: Knowledge-Based and
Intelligent Information and Engineering Systems. Ed. by Rossitza Setchi et al. Berlin, Heidelberg: Springer Berlin Heidelberg, 2010,
pp. 438–444. isbn: 978-3-642-15393-8.
[5] Andreas Meier and Michael Kaufmann. SQL & NoSQL Databases: Models, Languages, Consistency Options and Architectures
for Big Data Management. Wiesbaden: Springer Fachmedien Wiesbaden, 2019. 229 pp. isbn: 978-3-658-24548-1 978-3-658-
24549-8. doi: 10.1007/978-3-658-24549-8. url: [Link] (visited on 10/10/2022).
[6] Laurie A. Schintler and Connie L. McNeely, eds. Encyclopedia of Big Data. Springer Cham, 2022. 976 pp. url: [Link]
[Link]/book/10.1007/978-3-319-32010-6 (visited on 10/10/2022).
[7] Geoffrey I. Webb and Claude Sammut, eds. Encyclopedia of Machine Learning and Data Mining. Second Edition. Springer New
York, 2017. 1335 pp. url: [Link] (visited on 10/10/2022).
33
CD309
Visualización e
Interpretación de Datos
Descripción
En este curso se presentarán desde los elementos básicos del proceso de visualización de
datos hasta los elementos más avanzados incluyendo la teoría para seleccionar el tipo y
los elementos que más se adaptan al problema. También se aprenderá a generar gráficos
interactivos y la elaboración de presentaciones usando el lenguaje R.
Objetivos
En este curso el estudiante será capaz de:
1. Verificar el formato correcto de los datos y realizar correcciones.
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom, para que los
alumnos la puedan acceder en cualquier momento.
34
Luego de este curso el estudiante será capaz de:
Desarrollar reportes de nivel empresarial utilizando el lenguaje de programación R.
Contenido
1. Principios de visualización de datos.
a. Teoría de la gramática de los gráficos.
b. Selección de gráficos.
c. Creación de mapas.
b. Gráficos interactivos.
c. Mapas interactivos.
4. Diseño de presentaciones.
a. Estructura de una presentacíon.
35
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos. La
nota mínima de aprobación es de 70.
Bibliografía
[1] Bradley C. Boehmke. Data Wrangling with R. Springer, 2016. url: [Link]
319-45599-0 (visited on 10/10/2022).
[2] Vikram Dayal. Quantitative Economics with R. Singapore: Springer Singapore, 2021.326 pp. isbn: 9789811634345. doi:
10.1007/978-981-16-3434-5. url: [Link] (visited on 10/10/2022).
[3] “MySQL: My Structured Query Language”. In: Encyclopedia of Systems Biology. Ed. by Werner Dubitzky et al. New York, NY:
Springer New York, 2013, pp. 1485–1486. isbn:978-1-4419-9863-7. doi: 10.1007/978-1-4419-9863-7_100986. url: [Link]
org/10.1007/978-1-4419-9863-7_100986.
[4] Alfredo Ferro et al. “MySQL Data Mining: Extending MySQL to Support Data Mining Primitives (Demo)”. In: Knowledge-Based and
Intelligent Information and Engineering Systems. Ed. by Rossitza Setchi et al. Berlin, Heidelberg: Springer Berlin Heidelberg, 2010,
pp. 438–444. isbn: 978-3-642-15393-8.
[5] Andreas Meier and Michael Kaufmann. SQL & NoSQL Databases: Models, Languages, Consistency Options and Architectures
for Big Data Management. Wiesbaden: Springer Fachmedien Wiesbaden, 2019. 229 pp. isbn: 978-3-658-24548-1 978-3-658-
24549-8. doi: 10.1007/978-3-658-24549-8. url: [Link] (visited on 10/10/2022).
[6] Laurie A. Schintler and Connie L. McNeely, eds. Encyclopedia of Big Data. Springer Cham, 2022. 976 pp. url: [Link]
[Link]/book/10.1007/978-3-319-32010-6 (visited on 10/10/2022).
[7] Geoffrey I. Webb and Claude Sammut, eds. Encyclopedia of Machine Learning and Data Mining. Second Edition. Springer New
York, 2017. 1335 pp. url: [Link] (visited on 10/10/2022).
36
CD400
Implementación de
Proyectos en Ciencia
de Datos
Descripción
En este curso se estudiarán en detalle las técnicas de Validación Cruzada (Cross-Validation)
y Remuestreo (boostrapping) con el objetivo de calibrar y seleccionar el mejor método de
Minería de Datos para un problema y juego de datos dado. Se estudiará como programar
y automatizar la Validación Cruzada (Cross-Validation) y Remuestreo (boostrapping) en el
lenguaje R. Los ejemplos de este curso estarán motivados por problemas reales en el campo.
Por lo tanto, los estudiantes adquieren conocimientos de muchas herramientas diferentes que
pueden combinarse para resolver problemas reales.
Objetivos
En este curso el estudiante será capaz de:
1. Implementar programas en R para Validación Cruzada (Cross-Validation) y Remuestreo
(bootsrapping) tanto en Clasificación como en Regresión.
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom, para que los
alumnos la puedan acceder en cualquier momento.
37
3. Foros para plantear dudas al tutor y compañeros.
Contenido
1. Implementación de métodos Métodos Exploratorios (Clustering o Aprendizaje no
Supervisado).
a. Análisis en Componentes Principales.
b. Clustering Jerárquico.
c. El método de K-medias.
b. Método de Bayes.
e. Árboles de Decisión.
h. Redes Neuronales.
d. Versiones en paralelo.
38
e. Implementación de la Calibración y Selección de Modelos.
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos. La
nota mínima de aprobación es de 70.
Bibliografía
[1] Esteban Alfaro, Matias Gamez, and Noelia García. “adabag: An R Package for Classification with Boosting and Bagging”. In:
Journal of Statistical Software 54 (Sept. 3, 2013), pp. 1–35. issn: 1548-7660. doi: 10.18637/jss.v054.i02. url: [Link]
637/jss.v054.i02 (visited on 10/19/2022).
[2] Alexandros Karatzoglou, David Meyer, and Kurt Hornik. “Support Vector Machines in R”. In: Journal of Statistical Software 15
(Apr. 6, 2006), pp. 1–28. issn: 1548-7660. doi: 10.18637/jss.v015.i09. url: [Link]
[3] Andy Liaw and Matthew Wiener. “Classification and Regression by randomForest”. In: 2 (2002), p. 5.
[4] Wei-Yin Loh. “Classification and regression trees”. In: WIREs Data Mining and Knowledge Discovery 1.1 (2011). _eprint: https://
[Link]/doi/pdf/10.1002/widm.8, pp. 14–23. issn: 1942-4795. doi: 10.1002/widm.8. url: [Link]
com/doi/abs/10.1002/widm.8.
[5] Boris Mirkin and Boris Mirkin. Clustering for Data Mining: A Data Recovery Approach. New York: Chapman and Hall/CRC, Apr. 28,
2005. 296 pp. isbn: 978-0-429-13754-9. doi: 10.1201/9781420034912.
[6] Simon Sheather. A Modern Approach to Regression with R. Google-Books-ID: IZ6Ra0efSdsC. Springer Science & Business
Media, Feb. 27, 2009. 398 pp. isbn: 978-0-387-09608-7.
[7] The ‘K’ in K-fold Cross Validation. url: [Link] (visited on 10/19/2022).
[8] Tzu-Tsung Wong. “Performance evaluation of classification algorithms by k-fold and leave-one-out cross validation”. In: Pattern
Recognition 48.9 (Sept. 1, 2015), pp. 2839–2846. issn: 0031-3203. doi: 10.1016/[Link].2015.03.009. url: [Link]
[Link]/science/article/pii/S0031320315000989 (visited on 10/19/2022). [9] Zhongheng Zhang. “Naïve Bayes classification in R”.
In: Annals of Translational Medicine 4.12 (June 2016), p. 241. issn: 2305-5839. doi: 10.21037/atm.2016.03.38. url: [Link]
[Link]/pmc/articles/PMC4930525/ (visited on 10/19/2022).
39
CD900
Proyecto Final
de Graduación
Descripción
En este curso el estudiante desarrollará un proyecto de principio a fin, siguiendo las buenas
prácticas de gestión de proyectos en Ciencia de Datos según la metodología CRISP-DM. Para
el proyecto el estudiante utilizará datos de la empresa en donde trabaja o datos en los cuales
está particularmente interesado(a).
Objetivos
En este curso el estudiante será capaz de:
1. Utilizar adecuadamente la metodología CRISP-DM para el desarrollo de proyectos en
Ciencia de Datos.
3. Elegir, para un problema concreto, qué técnicas de Ciencia de Datos son las más
apropiadas.
Metodología
Basado en la teoría y en la aplicación directa de los conceptos aprendidos. Para esto se
dispondrán de las siguientes herramientas:
1. Una vídeo conferencia semanal, las cuales quedarán grabadas en Zoom, para que los
alumnos la puedan acceder en cualquier momento.
40
2. Trabajos prácticos semanales.
Contenido
1. Fundamentos de la metodología para la implementación de proyectos en Ciencia de
Datos CRISP-DM.
Evaluación
El curso se evalúa con 4 tareas, una por semana, cada tarea tiene un valor de 25 puntos. La
nota mínima de aprobación es de 70.
Bibliografía
[1] José Alberto Gallardo Arancibia. “Metodología para la definición de requisitos en proyectos de data mining (er-dm)”. [Link]
org/dc/dcmitype/Text. Universidad Politécnica de Madrid, 2009. url: [Link] (visited
on 10/19/2022).
[2] Ana Azevedo and Manuel Filipe Santos. “KDD, SEMMA and CRISP-DM: a parallel overview”. In: IADS - DM (2008). Accepted:
2012-06-14T09:51:14Z. url: [Link] (visited on 10/19/2022).
[3] CRISP-DM 1.0: Step-by-step Data Mining Guide. Google-Books-ID: [Link], 2000. book.
[4] Graham J. Williams and Simeon J. Simoff. Data Mining: Theory, Methodology, Techniques, and Applications. Google-Books-ID:
44z0BwAAQBAJ. Springer, Jan. 22, 2006.341 pp. isbn: 978-3-540-32548-2.
41
Correo electrónico : info@[Link] Teléfono: +506 4030-1205
42