0% encontró este documento útil (0 votos)
39 vistas24 páginas

Éxito Musical: Patrones y Predicciones

Este documento presenta un proyecto de investigación que busca analizar las características musicales que favorecen la popularidad de las canciones en plataformas de streaming como Spotify y YouTube utilizando 16 variables. El objetivo es identificar los patrones que contribuyen al éxito de una canción para entregar recomendaciones a artistas que les permitan tener producciones populares en este mercado competitivo.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
39 vistas24 páginas

Éxito Musical: Patrones y Predicciones

Este documento presenta un proyecto de investigación que busca analizar las características musicales que favorecen la popularidad de las canciones en plataformas de streaming como Spotify y YouTube utilizando 16 variables. El objetivo es identificar los patrones que contribuyen al éxito de una canción para entregar recomendaciones a artistas que les permitan tener producciones populares en este mercado competitivo.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

Diplomado Data Science 2023

“Estudio del éxito de artistas musicales en base a patrones


de las características de sus canciones, para predecir la
popularidad de futuras producciones musicales”

Yaiza Rojas Ramírez: 19.950.006-6

Patricia Lozada Gonzalez RUT: 14.157.473-6

Benjamín Manríquez Soldado: 19.954.613-9


1. Introducción

Desde los inicios de la historia del ser humano, la música se presenta como una herramienta cultural
de expresión y comunicación que ha ido desarrollándose de forma paralela a los avances
tecnológicos de cada generación. En 1877, Tomas Edison inventó el primer dispositivo capaz de
reproducir y grabar música, el fonógrafo. Con este hito, se da inicio a la comercialización de
grabaciones musicales (Nieto, 2020). Años más tarde, a partir de la década de 1990, la industria
musical se encuentra atravesada por un proceso de transformación entre el modelo de broadcasting
al de networking, estimulado por la digitalización y el avance exponencial de ciberespacio (Jáuregui,
2016).

En este sentido, el origen del Streaming es indisoluble con la evolución del Internet, las conexiones
de banda ancha, el uso de Smartphone y precios cada vez más asequibles para el público general,
que con el paso del tiempo se han traducido en un incremento de nuevos usuarios (Nieto, 2020;
Jáuregui, 2016). Los primeros canales de radio y posteriormente las transmisiones de recitales en
vivo a finales de los 90’s se presentan como un antecedente de lo que hoy conocemos como
plataformas de Streaming, siendo un acontecimiento clave la divulgación de videos gracias al
lanzamiento de YouTube en el año 2005.

En la actualidad los servicios de Streaming han gestado un nuevo modelo de consumo de música
que permite al usuario recibir y reproducir archivos multimedia en el mismo instante en que éstos son
distribuidos por un proveedor mediante la difusión continua de una red informática en modalidad
digital (Jáuregui, 2016). Esta posibilidad de escucha instantánea en cualquier espacio físico-temporal
en diversas plataformas construyen una nueva forma discursiva e institucional de escuchar música
bautizada como Music on demand.

Este nuevo paradigma funciona a través de licencias, criterios de selección y recomendaciones


configurando una escucha al alcance de los usuarios. Esto ha significado grandes cambios en la
cultura musical y la forma en cómo consumimos este tipo de contenido: una escucha como
acompañamiento de la actividad social (Jáuregui, 2016). En palabras de Airoldi, Beraldo y Gandini
(2016): “La difusión de una variedad de fuentes de Internet que permiten un acceso generalizado a la
música ha tenido un impacto significativo en las culturas y prácticas de recepción de la música, así
como en las relaciones entre los oyentes individuales, el contenido musical y la tecnología” (s/p,
traducción propia).
Aquí se configura un nuevo mercado lleno de competidores entre los que se destacan Spotify,
YouTube, Apple Music, Deezer y Amazon Music. En miras de este proyecto de investigación,
pondremos especial énfasis en las dos primeras empresas multimedia.

YouTube juega un rol protagónico en el vertiginoso ascenso del modelo Music on demand. Fundado
en el 2005 como una página web independiente, fue adquirido por Google en 2006 consolidándose
como un repositorio global de música popular. Es una plataforma insigne en el mundo del Streaming,
cuya peculiaridad es la capacidad de transmisión de video, traduciéndose en nuevas formas de
consumir, crear y compartir música (Cayari, 2011; Airoldi et al, 2016). Hoy en día ver vídeos se ha
convertido en una de las actividades más populares del Internet, lo que ha consolidado a Youtube
como es uno de los gigantes en la industria de redes sociales y contando con una cantidad
exponencial de oyentes-consumidores (Airoldi et al, 2016; Lassi et al, 2015). Según fuentes oficiales,
YouTube posee una media de 32 mil millones de visitas mensuales, con un tiempo medio de
permanencia o reproducción de contenidos de más de 20 minutos por usuario (Garzón, 2022).

2. Entendimiento del problema de negocio y definición de la problemática

Una de las razones del éxito de YouTube se debe a su contenido musical que ocupa un lugar
destacado en las plataformas digitales de Streaming y contenidos. Según la Federación Internacional
de la Industria Fonográfica en el 2013 YouTube fue la marca de música digital más reconocida (IFPI,
2014 en Lassi et all., 2015). El 38,4% del contenido de YouTube está relacionado con la música
(ComScore, 2013 en Lassi et al, 2015) y entre el 23 y el 30% de sus videos están categorizados
como “Música” (Cheng et al., 2007, Gill et al., 2007 en Lassi et all., 2015). La investigación
académica también reconoce indirectamente la importancia de la música entre los diferentes tipos de
contenido (Broxton et all., 2013, Burgess and Green, 2009, Cunningham and Nichols, 2008 en Lassi
et all., 2015). A su vez, el 74% de los términos de búsquedas más populares están referidos a
artistas, siendo predominantes como más vistos de todos los tiempos los vídeos musicales (Youtube,
2013 en Lassi et all., 2015).

Por otro lado, Spotify es una compañía fundada en el año 2006 por Daniel Ek y Martin Lorentzon en
Estocolmo a partir del acuerdo de licencias con grandes compañías discográficas. Tras una serie de
trabas e impedimentos, la plataforma de Streaming asienta sus bases con el lanzamiento oficial de la
plataforma en Estados Unidos en 2011. A partir de allí, Spotify se desenvuelve como un espacio
clave en la transición de la industria fonográfica y de mediatización musical (Jáuregui, 2016).

La plataforma cuenta con una versión Free y Premium. La primera es gratuita para todos los
usuarios, quienes en un inicio disponían de un límite máximo de 20 horas mensuales de
reproducción, lo cual en 2014 es eliminado y es reemplazado por la introducción de publicidad
esporádica, lo cual convierte a esta plataforma en un negocio altamente lucrativo, la limitación del
salto de canciones y una calidad de audio menor. La versión de pago, Premium, permite una escucha
ininterrumpida, sin anuncios, una modalidad off-line, saltos sin límites, etc. (Nieto, 2020).

Al 2022 Spotify contaba con una media de 15.800.000 oyentes mensuales y 165 millones de
suscriptores Premium en todo el mundo (Cayuela, 2022).

En suma, en este contexto de transformación de la industria musical a raíz de la instalación de las


plataformas de Streaming en el mercado, los artistas actualmente precisan de herramientas para
enfrentarse a este nuevo modelo de industria.

2.1 Problemática del negocio

Un ejemplo de lo anterior es conocer los patrones de aquellas canciones que logran ser un éxito,
tanto en plataformas online como en otros medios de entretenimiento. Puesto que existe mayor
facilidad para compartir música por plataformas de Streaming y que la música es actualmente uno de
los negocios más lucrativos y populares, el presente proyecto busca realizar un análisis de las
características que poseen las canciones más exitosas de diversos artistas, definiendo éxito como la
cantidad de reproducciones con la variable Visitas en YouTube y Streams en Spotify.

A través de variables tales como danzabilidad (describe qué tan variable es una canción donde 0.0
es menos bailable y 1.0 más bailable), energía (una medida de 0.0 a 1.0 que representa una medida
de intensidad y actividad), valencia (positividad que emana una canción de 0.0 a 1.0, las pistas con
menos valencia son más negativas y con más valencia positivas) entre otras, buscaremos crear un
modelo a través de la metodología CRISP-DM, que permita entregar recomendaciones a artistas
para que sus canciones sean populares en un mercado cada vez más competitivo. ¿Cómo
podríamos lograr que una canción sea popular actualmente? Para poder resolver esta pregunta es
que planteamos el supuesto de que las canciones que han sido un éxito cumplen ciertas
características ligadas a su producción, tanto en composición como en sus rasgos musicales, por lo
tanto, siguen un patrón.

3. Objetivo:

El objetivo de este proyecto es analizar y relacionar las características musicales que favorecen la
popularidad de las canciones, identificando los valores y cualidades que contribuyen a su éxito, con
el fin de realizar recomendaciones para futuras producciones.

4. Alcance del proyecto:

En miras de responder a los objetivos de la presente investigación, utilizaremos un total de 16


variables las cuales se pueden revisar en la tabla a continuación junto a sus respectivas definiciones.
Tabla 1. Variables canciones de Spotify y Youtube.

Variables Descripción

Nombre de la canción Título de la pista

Artista Nombre del intérprete

Describe qué tan bailable es una canción, basada en: Tempo, ritmo,
estabilidad, fuerza del beat, regularidad del beat) valores de 0.0 donde 0.0
Danzabilidad es menos bailable y 1.0 es más bailable.

Una medida de 0.0 a 1.0 representa una medida de intensidad y actividad.


La música enérgica es más rápida, fuerte y ruidosa. Mientras que la música
menos enérgica presenta esos valores más bajos. Esto incluye rango
Intensidad/actividad dinámico, ruido percibido, timbre, etc.

Incluye registro del Pitch en valores: 0 = Do, 1 = Do#/Reb, etc. -1 Es si no


Tono se detecta el Tono

Decibeles Son los decibeles (dB) de la canción. Incluye rangos entre -60 a 0 dB.

Detecta la presencia de palabras en una canción. 1.0 es cuando una


canción sea más ligada a un podcast, programa de entrevista, audiolibro,
poesía. Valores sobre 0.66 son pistas cantadas. Valores entre 0.33 y 0.66
son pistas que tienen música y voz. Los valores bajo 0.33 son pistas sin
Voz voz.

Un valor de 0.0 a 1.0 de si la pista es acústica. 1.0 es un valor de una pista


Acusticidad “muy” acústica.

Predice si una pista tiene o no voces. Los sonidos “Ooh” y “aah” son
considerados como instrumentales en este contexto. El rap o las pistas
habladas son vocales. 1.0 es más cercano a instrumentales, mientras más
cercano a 1 menos probable que tenga vocales. Valores sobre 0.5 son
Instrumentalidad representadas como pistas instrumentales.

Va de valores de 0.0 a 1.0, es la positividad que emana una canción. Las


canciones con más valencia son más positivas (felicidad, animosas,
eufóricas). Las pistas con menos valencia son más negativas (triste,
Valencia (Emociones) deprimida, ira).
Tempo BPM (Velocidad pista)

Duración Duración de la canción en ms

Stream Número reproducciones Spotify

Visitas Número visitas del video

Likes Números de me gusta del video

Comentarios Número de comentarios en el video

Fuente: Elaboración propia en base a datos de: [Link]

Los aspectos a analizar a través del análisis de estas variables son los indicadores que se traducen
en un mayor éxito de las canciones, entendiendo éxito como un mayor número de reproducciones
(visitas en YouTube, Stream en Spotify). Conocer cómo estas variables se conjugan en el éxito de
una canción, nos permitirá realizar una análisis prescriptivo que busque predecir qué canciones serán
populares o cómo crear una canción con un éxito probable en base a sus cualidades musicales.

Esta observación se hará mediante el uso de la base de datos Spotify and Youtube de Kaggle,
plataforma web que reúne una de las comunidades de Data Science más grandes del mundo y
comparte Datasets de acceso libre y gratuito. En base a esto, el periodo de tiempo bajo observación
está definido por la fecha de finalización de la cobertura temporal de la base, que tiene por fecha el 7
de Febrero del 2023.

5. Descripción metodológica:

Para este proyecto utilizaremos la metodología CRISP-DM que se compone por diversas etapas en
su aplicación. En la figura 1 se observan los pasos de esta metodología:

Figura 1. Etapas de la metodología CRISP-DM


Fuente: La metodología CRISP-DM en ciencia de datos - IIC ([Link])

1. En el entendimiento del negocio, el presente estudio tiene como objetivo abordar la siguiente
interrogante: ¿Cuáles son las características que confieren a una canción en particular su
popularidad respecto a otras? Para tal fin, resulta crucial comprender que cada canción
exhibe ciertas variables que determinan su grado de popularidad. En el ámbito de la industria
musical, resulta de suma importancia comprender dichos parámetros a fin de poder proponer
modificaciones que agreguen el condimento necesario para aumentar la popularidad de los
artistas musicales.

2. Entendimiento de los datos: Nuestra base de datos comprende distintas características


musicales como el tono, energía, volumen/decibel, canción con o sin voz, acusticidad,
instrumentalidad, pista en vivo, valencia, tempo, danzabilidad, estos datos tienen valores
numéricos que se debemos entregarle un puntaje para poder estudiar cada variable y
relacionarlo con la pregunta o preguntas propuestas.

3. Preparación de los datos: Para asegurar la calidad y confiabilidad de los datos, se llevará a
cabo un exhaustivo análisis descriptivo en el proceso de preparación. Esta etapa implica un
estudio minucioso de los datos, donde se abordarán diversos aspectos como la identificación
y manejo de resultados faltantes, corrección de errores de tipeo, eliminación de datos
incompletos o anómalos, entre otros. Durante este proceso, se aplicarán técnicas de limpieza
y transformación de datos. Para abordar los resultados faltantes, se emplearán estrategias
adecuadas como la eliminación de registros incompletos, según corresponda. Asimismo, se
corregirán posibles errores de tipeo que puedan afectar la integridad de los datos. En
paralelo, se considerará la posibilidad de agregar variables adicionales con el propósito de
ampliar las oportunidades de respuesta a la pregunta planteada.

Con base en nuestros datos preliminares, se identificó la presencia de 576 datos faltantes,
los cuales serán tratados en el proceso de preparación. Este aspecto es fundamental para
garantizar la integridad y validez de los resultados.

4. Las etapas de Modelado, Evaluación y Despliegue serán abordadas en mayor detalle en


entregas posteriores.
6. Bosquejo esquemático o plan del proyecto:

Carta Gantt
2023 2024
Actividades Jun Jul Ago Sept Oct Nov Dic Ene
Semanas 1 2 3 41 2 3 412 3 4 1 2 3 4 1 2 3 4 1 2 3 4 1 2 3 4 12
Análisis descriptivo:
Exploración de los
datos, limpieza
Gráficos, Inferencias
Diseño de modelo:
Diagnóstico del modelo
Análisis de los modelos
Herramientas
estadísticas
Realización informe
Implementación del
modelo:
Modelo y elección de
variables
Ejecución del modelo
Realización informe
Visualización:
Presentación de datos
Realización informe
final
7. Limpieza de datos y transformación:

En este proceso se realizó un análisis, identificación y limpieza de datos de las variables:


danzabilidad, intensidad_actividad, decibel, acusticidad, voz, instrumentalidad, valencia, tempo y
duración. Esto ya que la descripción original de la base de datos en Kaggle, contenía rangos
valóricos de esas variables que no se condecían al momento de revisar el dataframe. Se corroboró
que gran parte de esos valores venían alterados. En concreto, valores que deberían haber sido, por
ejemplo, 0.818 estaban representados en centenas: 818. A continuación la modificación de cada
variable en específico:

Danzabilidad, intensidad_actividad, voz, instrumentalidad, acusticidad y valencia: De rangos de


0.0 a 1.000, fueron corregidos a rangos de 0.0 a 1.

Decibeles: Iban de valores de -66.000 a 0, corregidos a valores de -66 a 0.

Duración: Estaba representada en ms (milisegundos), fue convertida a duración en minutos.

Tras una corrección, los valores de las variables quedaron dentro de los parámetros descritos en el
origen de la data base:

Tabla 3. Muestra de base de datos limpia.

artista cancionsp album stream


danzabilidad(0.0a1)
intensidad_actividad
tono decibel voz
Gorillaz Feel Good Demon
Inc. Days1,04E+09 0,818 0,705 6 -6,679 0,177
Gorillaz RhinestonePlastic
Eyes Beach3,1E+08 0,676 0,703 8 -5,815 0,302
Gorillaz New Gold (feat.
New Gold
Tame(feat.
63063467
Impala
Tame
andImpala
Bootie
0,695and
Brown)
Bootie
0,923 Brown) 1 -3,93 0,522
Gorillaz On Melancholy
Plastic
Hill
Beach
4,35E+08 0,689 0,739 2 -5,81 0,026
Gorillaz Clint Eastwood
Gorillaz 6,17E+08 0,663 0,694 10 -8,627 0,171
Gorillaz DARE Demon Days3,24E+08 0,76 0,891 11 -5,852 0,372
acusticidad
instrumentalidad
valencia tempo
0,836 0,233 0,772 138,559
0,869 0,687 0,852 92,761
0,425 0,469 0,551 108,014
1,51E-05 0,509 0,578 120,423
0,253 0 0,525 167,953
0,229 0,869 0,966 120,264

En este proceso fueron corroboradas las 20.718 filas presentes en el dataframe, a través de múltiples
herramientas de programación, quedando todos los datos en los parámetros correspondientes. Otro
detalle a destacar es que se eliminó la variable en_vivo, la justificación de esto es que todas las
canciones de Spotify están subidas en sus versiones en estudio. Lo que aquella variable demostraba,
era la existencia de la probabilidad de que una canción tenga presencia de audiencia, ecos u otros
elementos que demostraran que la canción tiene menos o más chances de haber sido tocada en
vivo.

Adicionalmente, se eliminaron 576 datos faltantes dentro de la variable ‘stream’, es decir, 576
canciones dentro de Spotify que no tenían el conteo de sus reproducciones. Esto con el fin de
obtener resultados claros y limpios en los estadísticos descriptivos que no alteraran los resultados.
Todas las canciones eliminadas tenían la característica de ser remasterizaciones de las canciones ya
sacadas, por lo que sus versiones anteriores sí estaban presentes en la base de datos. Quedando
inicialmente un total de 20.140 datos con 15 variables.

7.1 Transformación de variables

Tras la limpieza de datos, fue necesario un proceso de transformación de variables para que
posteriormente se pudieran realizar las tablas de contingencia entre variables categóricas.

Variable Categoría nueva Valores


Stream Indice_popularidad: Creada a partir de las Poco popular: 0 a 2000000
reproducciones de las canciones en Spotify Medianamente popular
6. Bibliografía:

1. Nieto García, C. (2020). Construcción de una herramienta de predicción para la popularidad


de las canciones de Spotify.
2. Jáuregui, J. (2016). Streaming musical en Spotify: ubicuidad entre géneros y estados de
ánimo. InMediaciones De La Comunicación, 10(10), 76-90.
[Link]
3.
4. Airoldi, M., Beraldo, D., & Gandini, A. (2016). Follow the algorithm: An exploratory
investigation of music on YouTube. Poetics, 57, 1-13.
[Link]
5.
6. Lassi A. Liikkanen, & Antti Salovaara. (2015). Music on YouTube: User engagement with
traditional, user-appropriated and derivative videos. Computers in Human Behavior, 50, 108-
124. ISSN 0747-5632. [Link]
7.
8. Cayari, C. (2011). The YouTube effect: How YouTube has provided new ways to consume,
create, and share music. International Journal of Education & the Arts, 12(6). Retrieved
[date] from [Link]

Rúbrica entrega 2:
__________________________________________________________

BORRADOR ENTREGA 2:

1. Limpieza de datos y transformación

De un total de 20,718 datos en nuestra base de datos de Spotify, los cuales tienen diversas
variables asociadas a cada canción, se realizó un proceso de limpieza de datos. Durante el
análisis inicial, se identificaron errores en algunos valores. Por ejemplo, la canción 'Feel
Good Inc' de Gorillaz tenía un valor de 6,679 decibeles, mientras que el rango para este
parámetro es de -60 a 0 decibeles.

AGREGAR TABLA ORIGINAL AQUÍ


1. En primer lugar, se corrigieron los datos de las siguientes variables: danzabilidad
(rango: 0-1), intensidad de actividad (rango: 0-1), decibeles (rango: -60 a 0), voz
(valores: 0-1), acusticidad (valores: 0-1), instrumentalidad (valores: 0-1), valencia
(rango: 0-1) y tempo (se dividió en diferentes marcas de tempo, que van desde 20 a
más de 177 pulsaciones por minuto).
a. Esta corrección se realizó dividiendo por mil los valores presentes en el
dataframe, para que se correspondiera con los rangos preestablecidos por el
autor de la base de datos para cada parámetro.

2. Adicionalmente, se eliminaron las variables 'en_vivo', 'cancionyt', 'visitas', 'likes' y


'comentarios', ya que no se considerarán en el análisis de la popularidad.

3. Se identificaron datos faltantes en la variable 'stream', específicamente 576


registros. Dado que la popularidad se basará en el número de reproducciones, se
eliminaron estos datos faltantes de la muestra.

4. También se realizó una conversión de la variable 'duración', que originalmente


estaba medida en milisegundos. Esta medida se transformó a minutos para facilitar
la lectura de los datos.

5. Después de realizar estas correcciones y eliminaciones, se encontraron dos valores


nulos en el dataframe, los cuales fueron eliminados.

Como resultado de estos procesos de limpieza, se obtuvieron un total de 20,140 datos


limpios.

En este punto, se seleccionaron 14 variables para el estudio: número, artista, canción,


álbum, reproducciones, danzabilidad, intensidad de actividad, tono, decibeles, voz,
elasticidad, instrumentalidad, valencia, tempo y duración.

AGREGAR TABLA LIMPIA

2. Estadísticos descriptivos
3. Tablas de contingencia

Para realizar cruces en tablas de contingencia, se realizó una transformación de las


variables numéricas a categóricas. A continuación se describen las clasificaciones
realizadas para cada variable transformada:

1. Variable ‘stream’: Se dividió la popularidad en 5 categorías, que son "No popular",


"Poco popular", "Medianamente popular", "Popular" y "Muy popular".
2. Variable ‘danzabilidad’: Se dividió en 4 categorías, que son "Poco bailable",
"Medianamente bailable", "Muy bailable" y "Altamente bailable".

3. Variable ‘acusticidad’: Se dividió en 4 categorías, que son "No acústica", "Baja


acústica", "Medianamente acústica" y "Muy acústica".

4. Variable ‘decibeles’: Se dividió en 3 categorías, que son "Suave", "Moderado" y


"Fuerte".

5. Variable ‘intensidad_actividad’: Se dividió en 4 categorías, que son "Poco


energética", "Medianamente energética", "Energética" y "Muy energética".

6. Variable ‘voz’: Se dividió en 3 categorías, que son "Cantada", "Pista con música y
voz" y "Pista sin voz".

7. Variable ‘valencia’: Se dividió en 3 categorías “Emoción negativa”, “Emoción


neutra” y “Emoción positiva”

Estas divisiones permitieron agrupar los valores numéricos en categorías más


ilustrativas que facilitan posteriormente el análisis e interpretación de los datos. A
continuación se muestran dos ejemplos de cruces con las variables anteriormente
transformadas.

Tabla N°1: Cruce entre Streams y Valencia

indice_popularidad Emoción Negativa Emoción Neutra Emoción Positiva


Poco popular 8.22 7.17 12.25
Medianamente popular 19.27 16.22 26.96
Popular 3.03 2.83 4.04

La Tabla N°1 muestra el cruce entre las variables 'stream' y 'valencia'. Se puede
observar una predominancia de emociones positivas tanto en las canciones menos
populares (con un menor número de reproducciones) como en las más populares.
Un 12,2% de las canciones poco populares tienen una valencia de emociones
positivas, mientras que un 7,1% presenta emociones neutras. En el caso de las
canciones medianamente populares, un 26,9% de ellas manifiestan emociones
positivas, un 19,2% contienen emociones negativas y un 16,2% contiene emociones
neutras. Por último, en las canciones más populares, se observa un 4% de
emociones positivas, un 3% de emociones negativas y un 2,8% de emociones
neutras.

Tabla N°2: Cruce entre Streams y Decibeles


indice_popularidad Suave Moderado Fuerte

Medianamente 0.01 1.17 61.29


popular

Poco popular 0.04 1.48 25.97

Popular 0.0 0.03 10.02

En el cruce con la variable 'decibeles', se observa una preeminencia de canciones


con decibeles fuertes. En el caso de las canciones medianamente populares, el
61,2% de ellas presenta decibeles fuertes, en comparación con solo un 0,01% de
decibeles suaves. En las canciones poco populares, un 25,9% tiene decibeles
fuertes, mientras que solo un 0,04% contiene decibeles suaves. Por último, un 10%
de las canciones populares tiene decibeles fuertes, y un 0% tiene decibeles suaves
Lista de variables:
Anexo Excel:
[Link]
rWkGol0omxOdI/edit#gid=0

1. Nombre de la canción

2. Artista

3. Dirección link

4. Álbum de la canción

5. Tipo de álbum (Single o es parte de un álbum)

6. Uri (link de spotify)

7. Danzabilidad (Describe qué tan bailable es una canción, basada en: Tempo,
ritmo, estabilidad, fuerza del beat, regularidad del beat) valores de 0.0 donde
0.0 es menos bailable y 1.0 es más bailable.

8. Energía: Una medida de 0.0 a 1.0 representa una medida de intensidad y


actividad. La música enérgica es más rápida, fuerte y ruidosa. Mientras que la
música menos enérgica presenta esos valores más bajos. Esto incluye rango
dinámico, ruido percibido, timbre, etc.

9. Tono: Incluye registro del Pitch en valores: 0 = Do, 1 = Do#/Reb, etc. -1 Es si


no se detecta el Tono
10. Volumen/decibel: Son los decibeles (dB) de la canción. incluye rangos entre -
60 a 0 dB.

11. Canción con o sin voz: Detecta la presencia de palabras en una canción. 1.0
es cuando una canción sea más ligada a un podcast, programa de entrevista,
audiolibro, poesía. Valores sobre 0.66 son pistas cantadas. Valores entre
0.33 y 0.66 son pistas que tienen música y voz. Los valores bajo 0.33 son
pistas sin voz.

12. “Acusticidad”: un valor de 0.0 a 1.0 de si la pista es acustica. 1.0 es un valor


de una pista “muy” acustica.

13. “Instrumentalidad”: Predice si una pista tiene o no voces. Los sonidos “Ooh” y
“aah” son considerados como instrumentales en este contexto. El rap o las
pistas habladas son vocales. 1.0 es más cercano a instrumentales, mientras
más cercano a 1 menos probable que tenga vocales. Valores sobre 0.5 son
representadas como pistas instrumentales.

14. Pista en vivo: Detecta la presencia de audiencia en la grabación. Los valores


más altos de en vivo representan una alta probabilidad de que la pista fue
hecha en vivo. Un valor sobre 0.8 es más posible de que la pista sea en vivo.

15. Valencia: Va de valores de 0.0 a 1.0, es la positividad que emana una


canción. Las canciones con más valencia son más positivas (felicidad,
animosas, eufóricas). Las pistas con menos valencia son más negativas
(triste, deprimida, ira).

16. Tempo: BPMs

17. Duración: Duración de la pista en ms

18. Stream: Número de reproducciones en spotify

19. Url_yt: Link de la canción en yt #estas variables son descartables, en total


son 26

20. Título: nombre del video en yt

21. Canal: nombre del canal publicado

22. Vistas: Visitas del video

23. Likes: numero de me gusta


24. Comentarios: Número de comentarios

25. Licencia: Derechos de autor entre otros

26. Video oficial: Valor booleano que indica si el video es el video oficial de la
canción

Última actualización 7 de Febrero 2023

Preguntas coaching:
PREGUNTAS

Clusterizar, modelo.
Tener una buena estructura en la clasificación
Aplicación de metodología

- Partir contando sobre nuestro proyecto y base de datos

- Tiempo de observación → en nuestro caso son n° reproducciones de canciones desde


que fueron lanzadas hasta hoy

- el último punto de la rúbrica con planificación se refieren a carta gantt?

- Preguntar si tenemos que definir la metodología con bibliografía, metodología


CRISP-DM

- Carta Gantt, con fechas de acuerdo a las entregas

- Metodología usada mostrando las etapas usadas aplicadas a su negocio?

- Mapa conceptual

- ¿Las variables son suficientes?


- extensión y formato

- ¿Los supuestos son lo mismo que hipótesis?

- ¿Cuáles serían las variables para las características musicales? 10


variables?

- ¿Cuáles son las variables para evaluar la popularidad?

Proyectos realizables:

Análisis de popularidad y tendencias: Puedes analizar la popularidad de las


canciones en función de las variables como el número de reproducciones en Spotify,
el número de vistas en YouTube, el número de me gusta y comentarios. Esto te
permitirá identificar las canciones más populares y determinar si hay alguna relación
entre la popularidad en ambas plataformas.

Análisis de características musicales: Puedes explorar las características musicales


como danzabilidad, energía, tono, acusticidad e instrumentalidad. Esto te ayudará a
comprender mejor los diferentes aspectos de las canciones y cómo se relacionan
con su popularidad. Por ejemplo, ¿hay alguna correlación entre la danzabilidad y la
popularidad de una canción?

Modelado de recomendaciones: Puedes utilizar las características musicales y la


información de género (si está disponible) para construir un modelo de
recomendación de canciones. Esto permitirá que los usuarios descubran canciones
similares en función de sus preferencias y características musicales.

Segmentación de audiencia: Puedes utilizar las características musicales y la


información demográfica (si está disponible) para segmentar a los oyentes en
grupos con preferencias musicales similares. Esto puede ayudar a comprender
mejor los diferentes segmentos de audiencia y adaptar estrategias de marketing o
recomendaciones específicas para cada grupo.
¡Por supuesto! Aquí te dejo una idea de proyecto que puedes realizar utilizando la
base de datos "Spotify and Youtube" de Kaggle y técnicas de machine learning:

Predicción de popularidad de canciones en Spotify

La base de datos de Spotify and Youtube de Kaggle contiene información detallada


sobre canciones, incluyendo su popularidad en Spotify. Utilizando esta información,
puedes crear un modelo de machine learning que sea capaz de predecir la
popularidad de una canción en Spotify basándose en ciertas características de la
canción (por ejemplo, el género, la duración, la letra, la energía, el tempo, etc.).

Para hacer esto, podrías seguir los siguientes pasos:

1. Preprocesamiento de los datos: Antes de entrenar el modelo, debes realizar


algunas tareas de preprocesamiento de los datos, como la limpieza de los
datos y la eliminación de valores nulos o faltantes. También puedes realizar
una exploración de los datos para comprender mejor las características de
las canciones que influyen en su popularidad.
2. Selección de características: A continuación, debes seleccionar las
características que utilizarás para entrenar el modelo. Puedes utilizar
técnicas de selección de características para identificar las características
más importantes que influyen en la popularidad de una canción.
3. División de los datos: Dividir los datos en conjuntos de entrenamiento y
prueba para poder evaluar la capacidad de predicción del modelo.
4. Entrenamiento del modelo: Utiliza algoritmos de machine learning, como
regresión lineal, regresión logística o redes neuronales, para entrenar el
modelo con el conjunto de entrenamiento.
5. Evaluación del modelo: Evalúa la capacidad de predicción del modelo
utilizando el conjunto de prueba y métricas de evaluación como el error
cuadrático medio (MSE) o el coeficiente de determinación (R²).
6. Mejora del modelo: Si el modelo no tiene un rendimiento satisfactorio, puedes
explorar otras técnicas de machine learning, ajustar los parámetros del
modelo o agregar más características para mejorar su capacidad de
predicción.
7. Predicción: Una vez que tengas un modelo entrenado y evaluado, puedes
utilizarlo para predecir la popularidad de nuevas canciones que no están en la
base de datos.
Este es solo un ejemplo de proyecto que puedes realizar utilizando la base de datos
de Spotify and Youtube de Kaggle. Puedes adaptar este proyecto según tus
intereses y habilidades de programación, y experimentar con diferentes técnicas de
machine learning para mejorar la precisión del modelo.
Por supuesto, aquí te propongo algunas ideas para un proyecto de data science con
las variables proporcionadas:

1. Predecir el éxito de una canción en Spotify basado en sus características:


Puedes utilizar la variable "Stream" como medida de éxito y usar las demás
variables para entrenar un modelo de machine learning que pueda predecir
qué tan exitosa será una canción en la plataforma. Podrías explorar
diferentes algoritmos, como árboles de decisión, regresión lineal o redes
neuronales.
2. Identificar patrones en la popularidad de los artistas: Puedes utilizar las
variables "Artista" y "Stream" para analizar qué artistas son más populares
en Spotify. Luego, podrías utilizar las demás variables para intentar
identificar patrones en la popularidad de los artistas, por ejemplo, si las
canciones más bailables o más acústicas tienen más éxito en la plataforma.
3. Clasificar las canciones por género musical: Puedes utilizar las variables
"Nombre de la canción" y "Artista" para crear una base de datos de canciones
con sus respectivos géneros musicales. Luego, podrías utilizar las demás
variables, como "Energía" o "Danzabilidad", para entrenar un modelo de
machine learning que pueda clasificar automáticamente nuevas canciones en
los géneros correspondientes.
4. Analizar las tendencias en la música a lo largo del tiempo: Puedes utilizar la
variable "Álbum de la canción" y "Tipo de álbum" para analizar cómo han
cambiado las tendencias en la música a lo largo del tiempo. Por ejemplo,
podrías analizar si hay más álbumes "single" ahora que en el pasado, o si la
música más acústica ha aumentado o disminuido en popularidad.

Proyecto Data Science

Identificar patrones en la popularidad de los artistas: Puedes utilizar las variables


"Artista" y "Stream" para analizar qué artistas son más populares en Spotify. Luego,
podrías utilizar las demás variables para intentar identificar patrones en la
popularidad de las canciones, por ejemplo, si las canciones más bailables o más
acústicas tienen más éxito en la plataforma.
Link Base de datos Spotify y Youtube:
[Link]

Genero musical: [Link]

Borrador rúbrica: (Canciones más exitosas por género musical)

Palabras clave: streaming, éxito, entretenimiento, canciones.

DATAFRAME SIN LIMPIAR

artista cancionsp album stream danzabilidad(0.0a1)


intensidad_actividad
tono decibel voz
Gorillaz Feel Good Inc. Demon Days 1040234854 818 705 6.0 -6.679 177
Gorillaz Rhinestone Eyes
Plastic Beach 310083733 676 703 8.0 -5.815 302
Gorillaz New Gold ([Link]
Tame
Gold
Impala
([Link]
Tame
Bootie
63063467
Impala
Brown)
and Bootie
695 Brown)
923 1.0 -3.93 522
Gorillaz On Melancholy Plastic
Hill Beach 434663559 689 739 2.0 -5.81 26
Gorillaz Clint EastwoodGorillaz 617259738 663 694 10.0 -8.627 171
Gorillaz DARE Demon Days 323850327 0.76 891 11.0 -5.852 372

acusticidad instrumentalidad en_vivo valencia tempo


836 233 613 772 138.559
869 687 463 852 92.761
425 469 116 551 108.014
1.51e-05 509 64 578 120.423
253 0.0 698 525 167.953
229 869 298 966 120.264

number 0 artista 0 cancionsp 0 album 0 stream 576 danzabilidad(0.0a1) 2


intensidad_actividad 2 tono 2 decibel 2 voz 2 acusticidad 2
instrumentalidad 2 valencia 2 tempo 2 duracion 2 cancionyt 470 visitas
470 likes 541 comentarios 569

DATAFRAME LIMPIO

artista cancionsp album stream


danzabilidad(0.0a1)
intensidad_actividad
tono decibel voz
Gorillaz Feel Good Demon
Inc. Days1,04E+09 0,818 0,705 6 -6,679 0,177
Gorillaz RhinestonePlastic
Eyes Beach3,1E+08 0,676 0,703 8 -5,815 0,302
Gorillaz New Gold (feat.
New Gold
Tame(feat.
63063467
Impala
Tame
andImpala
Bootie
0,695and
Brown)
Bootie
0,923 Brown) 1 -3,93 0,522
Gorillaz On Melancholy
Plastic
Hill
Beach
4,35E+08 0,689 0,739 2 -5,81 0,026
Gorillaz Clint Eastwood
Gorillaz 6,17E+08 0,663 0,694 10 -8,627 0,171
Gorillaz DARE Demon Days3,24E+08 0,76 0,891 11 -5,852 0,372
acusticidad
instrumentalidad
valencia tempo
0,836 0,233 0,772 138,559
0,869 0,687 0,852 92,761
0,425 0,469 0,551 108,014
1,51E-05 0,509 0,578 120,423
0,253 0 0,525 167,953
0,229 0,869 0,966 120,264

También podría gustarte