0% encontró este documento útil (0 votos)
4 vistas10 páginas

Rol y herramientas en ciencia de datos

Este módulo trata sobre lo que hacen los científicos de datos, incluyendo un día en la vida de un experto, las herramientas que usan como R y Python, y un debate sobre R vs Python.

Cargado por

Katy Pacheco
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
4 vistas10 páginas

Rol y herramientas en ciencia de datos

Este módulo trata sobre lo que hacen los científicos de datos, incluyendo un día en la vida de un experto, las herramientas que usan como R y Python, y un debate sobre R vs Python.

Cargado por

Katy Pacheco
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

Modulo II: Módulo 2: ¿Qué hace la gente de ciencia

de datos?

Objetivos de aprendizaje
En este módulo, aprenderá sobre lo que hace la gente de ciencia de datos:
o Un día en la vida de un experto en ciencia de datos

o ¿Qué herramientas usa la gente de ciencia de datos?

o ¿R versus Python?
Un día en la vida de un experto en ciencia de datos
(3:54)

Inicio de la transcripción. Salta hasta el final.

- Ya he construido un motor de recomendación como parte de una gran organización y he


trabajado con todo tipo de ingenieros y he tenido en cuenta

para diferentes partes del problema. Es uno de los que estoy más contento porque al final se
me ocurrió la solución muy simple que era fácil de entender desde todos los niveles, desde
los ejecutivos hasta los ingenieros y desarrolladores. Al final fue tan eficiente como algo
realmente complejo a lo que podría haber dedicado mucho más tiempo.

- En la universidad teníamos un problema que queríamos predecir la floración de algas.


Esta floración de algas podría causar el aumento de la toxicidad del agua

y podría causar problemas a la empresa de tratamiento de agua.

No podíamos predecirlo con nuestros conocimientos de ingeniería química, así que


utilizamos redes neuronales artificiales para predecir cuándo se produciría esta floración.

De este modo, las empresas de tratamiento de aguas podían gestionar mejor este problema.

- En Toronto, el transporte público está gestionado por la Comisión de Tránsito de Toronto.


Los llamamos TTC. Es una de las mayores autoridades de tránsito

Y un día se pusieron en contacto conmigo y me dijeron, "tenemos un problema" Y yo dije


bien, ¿cuál es el problema? Dijeron, 'bueno, tenemos datos de quejas y nos gustaría
analizarlos y necesitamos tu ayuda'. Dije que estaba bien, que estaría encantado de ayudar.
Así que les dije que cuántas quejas tenían. Dijeron: "unas cuantas". Dije que cuántas.

"Tal vez medio millón". Dije: "Bueno, empecemos a trabajar con ello". Así que conseguí
los datos y empecé a analizarlos. Así que básicamente han hecho un gran trabajo en

mantener los datos, algunos datos en formato tabular otros eran datos no estructurados. Y
en ese caso los datos tabulares eran cuándo llegó la queja, quién la recibió, cuál era el tipo
de queja, se resolvió,

de quién era la culpa. Y la parte no estructurada era el intercambio de correos electrónicos y


faxes Así que imagina mirar medio millón de intercambios de correos electrónicos

y tratar de obtener alguna respuesta de ella Así que empecé a trabajar con ella
y lo primero que quería saber es por qué la gente se queja y si hay un patrón. ¿Hay algunos
días en los que hay más quejas que otros? Y miré los datos y los analicé en todos los
formatos diferentes y no pude encontrar cuál era el ímpetu para que las quejas fueran más
altas

en un día determinado y más bajo en otros. Y continuó durante un mes más o menos y
luego un día me estaba bajando del autobús en Toronto

y seguía pensando en ello y salí sin mirar al suelo y me metí en un charco, un charco de
agua y ahora estaba como con los tobillos metidos en el agua y sólo tenía un pie mojado y
el otro seco

y estaba extremadamente molesto y estaba caminando de regreso y entonces me di cuenta

y dije bueno espera un segundo Hoy ha llovido inesperadamente y no estaba preparado para
ello Por eso estoy mojado y no lo estaba buscando ¿Y si hay una relación entre el clima
extremo y el tipo de quejas que recibe el TTC? Así que fui a la página web de Medio
Ambiente de Canadá

y obtuve datos sobre la lluvia y la precipitación, el viento y similares.

Y allí encontré algo muy interesante Los diez días más excesivos para las quejas los diez
días en que la gente se queja más

fueron los días en que el tiempo fue malo Fue una lluvia inesperada, un descenso extremo
de la temperatura, mucha nieve, un día muy ventoso.

Así que volví a los ejecutivos de la TTC y dije, tengo buenas y malas noticias. Dije, la
buena noticia es que sé por qué la gente se quejaba excesivamente en ciertos días. Sé la
razón de ello. La mala noticia es que no se puede hacer nada al respecto.

Traducción realizada con la versión gratuita del traductor [Link]/Translator

R vs Python
Como tengo una formación en ingeniería,
empecé a programar con C, luego pasé a Matlab,
y finalmente a Python.
Normalmente uso Matlab, C y C++,
pero para la ciencia de datos uso Python.
- R y Python.
- R.
- Soy un evangelista de R.
Estuve en la Conferencia UseR el año pasado
y creo que tiene una de las mejores comunidades,
También soy muy aficionado a SQL y creo que la gente no pasa
que la gente no pasa suficiente tiempo apreciándolo en sus diversas encarnaciones.
- Yo trabajo principalmente con R y Stata.
No trabajo mucho con big data así que para el tipo de
de conjuntos de datos que tengo, hay unos pocos millones de observaciones,
incluso los cientos de millones de observaciones
entonces puedo trabajar con los existentes Stata y R y SPSS,
no tengo ningún problema con ello,
pero como dije, si tuviera que trabajar con grandes conjuntos de datos,
utilizaría otras herramientas.
Mis herramientas preferidas son las tres: R, Stata y SPSS.
También trabajo mucho con datos espaciales
así que estos son conjuntos de datos que tienen un componente geográfico
...así que imagina 40 millones de californianos...
...y 40 millones de personas, algunas de ellas en California..,
algunos de ellos en los estados vecinos,
...y qué pasa si conozco la dirección exacta de la casa...
de todos y cada uno de ellos y dónde trabajan.
Y eso sería un increíble GIS,
una base de datos de sistemas de información geográfica espacial.
Así que también trabajo con ellos y la herramienta que uso
se llama Maptitude y MapInfo,
estas son las dos que más uso.

Traducción realizada con la versión gratuita del traductor [Link]/Translator

Herramientas y tecnología de ciencia de datos


(5:41)
Inicio de la transcripción. Salta hasta el final.
- Realmente disfruto de la regresión.
Yo diría que la regresión fue quizás uno de los primeros conceptos que
realmente me ayudó a comprender los datos, por lo que disfruto de la regresión.
- Me gusta mucho la visualización de datos.
Creo que es un elemento clave para que la gente obtenga
a través de su mensaje a la gente
que no entienden muy bien qué es la ciencia de datos.
- Redes neuronales artificiales.
- Soy un apasionado de las redes neuronales.
porque tenemos mucho que aprender de la naturaleza
así que cuando intentamos imitar nuestro cerebro,
Creo que podemos hacer algunas aplicaciones con este comportamiento,
este comportamiento biológico en algoritmos.
- Visualización de datos con R, me encanta hacer esto.
- Vecino más cercano, es el más simple,
pero obtiene los mejores resultados muchas más veces,
que un algoritmo exagerado y con exceso de trabajo
eso es igual de probable que se ajuste demasiado
como es para hacer un buen ajuste.
- Entonces, los datos estructurados se parecen más a los datos tabulares,
cosas con las que está familiarizado en formato de Microsoft Excel,
tienes filas y columnas,
y eso se llama datos estructurados.
Los datos no estructurados son básicamente datos que provienen de
principalmente desde la web, donde no es tabular.
No está en filas y columnas, es texto.
A veces es video y audio.
Tendría que implementar algoritmos más sofisticados
para extraer datos.
De hecho, muchas veces tomamos datos no estructurados
y dedica mucho tiempo y esfuerzo a conseguir
algo de estructura fuera de él y luego analizarlo.
Si tiene algo que encaja perfectamente en
las tablas, las columnas y las filas siguen adelante.
Esos son tus datos estructurados,
pero si ves si es un weblog,
o si está intentando obtener información de las páginas web,
y tienes miles de millones de páginas web,
eso es datos no estructurados,
eso requeriría un poco más de esfuerzo
para sacarle información.
El aprendizaje automático es básicamente un conjunto de estas herramientas avanzadas
la gente usa para encontrar respuestas.
No soy un gran fanático del aprendizaje automático
y te daré mi prejuicio ahora mismo.
Imagina que hay una isla
y hay unas 45.000 personas que viven en esa isla.
Está aislado del resto del mundo
nadie puede nadar en la isla o nadar fuera de la isla.
Ahora imagina que la isla tuvo un asesinato
y eres el detective al que se le ha encomendado la tarea
con encontrar quién es el culpable.
Ahora, hay varios enfoques que puede tomar.
Un enfoque es decir, bueno, quienquiera que haya matado a esta persona
está en esta isla.
Entonces hay 45.000 personas y hay 45.000 sospechosos.
Voy a ir uno a uno preguntando a cada uno
hasta que encuentre al sospechoso, cierto.
Eso es aprendizaje automático, porque no tiene otra razón,
ningún otro supuesto, ninguna otra hipótesis, ningún otro sentimiento.
Dices que no sé nada.
Solo voy a poner todo en mi modelo.
y ver quién es el culpable.
A veces llegas al culpable, a veces no
pero llevaría tiempo.
El aprendizaje automático es básicamente decir cuando no tienes
muchas suposiciones sobre sus datos, y le faltan
saber mucho sobre sus datos,
simplemente arrojas todo en este modelo,
y ver qué sale de él.
Es más un enfoque de caja negra.
Sé que una gran cantidad de profesionales lo viven.
A mí, por otro lado, me gusta mirar los datos con mis propios
nociones preconcebidas, porque se dice, un científico de datos
es alguien que es muy crítico.
Esa persona, un científico de datos, es aquella que tiene una opinión.
acerca de los datos.
¿Quién tiene una opinión sobre los fenómenos que están aprendiendo?
o están investigando.
No pueden simplemente creer
que voy a tener un enfoque de fregadero de cocina,
Voy a volcar todo en el modelo.
El aprendizaje automático consiste básicamente en decir, deshazte de todo,
mira lo que sale de ella.
Hay miles de libros escritos sobre regresión,
y millones de conferencias impartidas sobre regresión.
Y siempre siento que no hacen un buen trabajo
de explicar la regresión, porque entran en datos
y modelos y distribuciones estadísticas.
Olvidémoslo, déjame explicarte la regresión.
en los términos más simples posibles.
Si alguna vez ha tomado un viaje en taxi, un viaje en taxi,
entiendes la regresión.
Así es como funciona.
En el momento en que te sientas en un taxi, en un taxi,
ves que hay una cantidad fija allí, dice 2 dólares 50 centavos, $ 2,50
Prefieres que el taxi se mueva o te bajes,
esto es lo que le debes al conductor,
en el momento en que subes a un taxi.
Eso es una constante, tienes que pagar esa cantidad,
si ha subido a un taxi.
Luego, cuando comienza a moverse, por cada metro o 100 metros,
la tarifa aumenta en una cierta cantidad.
Entonces, hay una fracción, hay una relación
entre la distancia y la cantidad que pagarías,
por encima y más allá de esa constante.
Si no se está moviendo y está atrapado en el tráfico,
luego, cada minuto adicional, tienes que pagar más.
A medida que aumentan los minutos, aumenta su tarifa,
a medida que aumenta la distancia, aumenta su tarifa,
y mientras todo esto sucede, ya has
pagó una tarifa base, que es la constante.
Eso es la regresión.
La regresión te dice cuál es la tarifa base
y cual es la relacion entre el tiempo
y la tarifa que pagaste
y la distancia que has recorrido
y la tarifa que pagó.
Porque a falta de conocer esas relaciones,
y saber por cuánto viajó la gente,
y cuanto pagaron,
la regresión le permite calcular
esa constante que no sabías que era 2.50,
y calcularía la relación entre la tarifa
y la distancia, y la tarifa y el tiempo.
Eso es una regresión.

También podría gustarte