0% encontró este documento útil (0 votos)
22 vistas10 páginas

Algoritmos de Deepfake: Comparativa y Tipos

El documento investiga los algoritmos de generación de deepfake más utilizados, clasificándolos en intercambio de rostros, sincronización de labios, síntesis de rostros y deepfakes de audio. Se comparan arquitecturas de algoritmos como DeepFaceLab y FSGAN, destacando sus características y resultados, así como sus métodos de detección, incluyendo SHAP y M2TR. Además, se discute la importancia de la regulación en el desarrollo de tecnologías de deepfake debido a los riesgos asociados a su uso.

Cargado por

Brayan Arismendi
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
22 vistas10 páginas

Algoritmos de Deepfake: Comparativa y Tipos

El documento investiga los algoritmos de generación de deepfake más utilizados, clasificándolos en intercambio de rostros, sincronización de labios, síntesis de rostros y deepfakes de audio. Se comparan arquitecturas de algoritmos como DeepFaceLab y FSGAN, destacando sus características y resultados, así como sus métodos de detección, incluyendo SHAP y M2TR. Además, se discute la importancia de la regulación en el desarrollo de tecnologías de deepfake debido a los riesgos asociados a su uso.

Cargado por

Brayan Arismendi
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

BRAYAN YESID ARISMENDI SERRANO

CENTRO EUROPEO DE POSTGRADO/ UNIVERSIDAD CESUMA

MAESTRIA EN INTELIGENCIA ARTIFICIAL

CASO PRÁCTICO ASIGNATURA INTRODUCCIÓN A LA INTELIGENCIA

ARTIFICIAL

TUTOR: MARIO CONEJOS

PIEDECUESTA, COLOMBIA

13 DE ENERO DE 2025
La idea es realizar una breve investigación acerca de los algoritmos de generación de

deepfake más empleados a día de hoy, con ejemplos visuales de sus resultados y una comparación

general entre sus arquitecturas. Inicialmente la palabra “deepfake” es una combinación de las

palabras: deep (profundo) y fake (falso). La primera palabra; deep (profundo) esta relacionado al

término deep learning (aprendizaje profundo), que pertenece al campo del Machine learning.

Cuando se emplean estos algoritmos basados en deep learning para crear contenido falso, el

resultado se denomina deep fake o falsificación profunda. (Gupta, 2023)

A partir de lo anterior la creación de deepfakes se puede clasificar en:

a) Intercambio de rostros: En el intercambio de rostros, el rostro de la persona del video

original se reemplaza por el rostro de la persona del video de destino. La figura 1 representa este

proceso de intercambio de rostros.

Figura No.1 Intercambio de rostros.

Fuente: (Gupta, 2023)

b) Sincronización de labios: En la sincronización de labios, utilizamos audio arbitrario para

generar un nuevo vídeo de forma que el vídeo generado se sincronice correctamente con las

expresiones faciales y el audio. En la figura 2, podemos ver que el vídeo de entrada, con la ayuda

del audio específico, se utiliza para generar diferentes clips falsos.


Figura No.2 Sincronización de labios

Fuente: (Gupta, 2023)

c) Síntesis de rostros y manipulación de atributos: La síntesis de rostros, se ocupa de la

creación de rostros falsos y manipula los diferentes atributos de los rostros originales. En la figura

3, en el lado izquierdo, tenemos la imagen original, que luego se manipula de diferentes maneras.

Podemos agregar cabello largo, anteojos, cambiar el género manipulando diferentes regiones

faciales de la foto.

Figura No.3 Síntesis de rostros

Fuente: (Gupta, 2023)

d) Deepfakes de audio, Las falsificaciones profundas de audio; se ocupan de la creación de

un discurso dirigido.
Existen varios métodos para crear deepfake, pero los métodos más populares es el uso de

autoencoder y el GAN. El autoencoder es un algoritmo de aprendizaje profundo que estudia los

datos de entrada dados deteniéndose en diferentes ángulos y condiciones ambientales, siendo capaz

de replicar el mismo contenido de entrada con mucha precisión. Un enfoque en GAN puede ser el

empleado por ejemplo en FSGAN con el objetico de manipular regiones faciales junto con la pose

y la expresión. Estas imágenes manipuladas son de muy alta calidad e incluso han superado a las

imágenes generadas con la ayuda de métodos de autocodificación.

Entrando en detalle un poco sobre las arquitecturas y sus respectivos resultados, realizaré

una comparación de propuestas entre lo que podemos encontrar en artículo de DeepFaceLab

titulado “: Integrated, flexible and extensible face-swapping framework” realizado por (Petrov,

Gao, Chervoniy, Liu, ET AL, 2021) destacando la frase “La mejor defensa es un buen ataque”, la

idea es explicar a nivel general la arquitectura y sus principales características y compararlas con

el reconocido algoritmo FSGAN y el articulo “Subject Agnostic Face Swapping and Reenactment”

de los investigadores (Nirkin, Keller & Hassner, 2019).

A nivel general en DeepFaceLab (DFL) se basa en una combinación de ideas previas bajo

un diseño que equilibra la velocidad y la facilidad de uso y el auge de la visión artificial en el

reconocimiento facial, la alineación, la reconstrucción, la segmentación, etc.

De manera general reconocen como fundamental que las técnicas de manipulación de

rostros con el uso de redes generativas antagónicas (GAN) son cada vez más incluidas en la

sinterización de rostros, por ejemplo, algoritmos como StyleGAN y StyleGAN2 hacen cada vez

los resultados más realistas y completamente indistinguibles para el sistema de visión humano.

La arquitectura principal del algoritmo de DeekFaceLab es:


Figura No.4 Arquitectura DeekFaceLab:

Face Detection

Face Alignment

Face Segmentation

Fuente: Imagen Propia, Información (Petrov, Gao, Chervoniy, Liu, ET AL, 2021)

La primera fase es la que se encarga de la detección del rostro, en esta se usa el algoritmo

llamado Single Shot Scale-invariant Face Detector (S³FD) (Academia de Ciencias de China, s.f.)

donde proponen una única red neuronal profunda, especialmente para rostros pequeños. Este

algoritmo trata de resolver el problema común de que los detectores basados en anclas que se

deterioran a medida que los objetos se vuelven más pequeños.

La segunda fase se enfoca en la alineación de rostros, en ella se introducen los puntos de

referencia faciales, claves para mantener la escalabilidad a lo largo del tiempo, en este punto DFL

proporciona dos tipos canónicos de algoritmos de extracción de puntos de referencia faciales; el

primero el algoritmo de puntos de referencia facial basado en mapas de calor 2DFAN (para rostros

con pose estándar) y PRNet con información previa del rostro en 3D (para rostros con un gran

ángulo de Euler (guiñada, cabeceo, balanceo).


Al final, dentro de la arquitectura de DFL se destaca su fase de segmentación justo después

de tener los rostros en vista lateral, frontal y estándar, emplear TernausNet, una red de

segmentación de grano fino para segmentar de manera exacta un rostro.

En contraste, FSGAN emplea la siguiente arquitectura:

Figura No.5 Arquitectura FSGAN:

Training Losses

Face reenactment and


segmentation

Face view
interpolaction

Face inpaiting

Face blending

Fuente: Imagen Propia, Información (Nirkin, Keller & Hassner, 2019)

Su primera fase se enfoca en un Trainning Losses en donde tratan de hacer las siguientes

subetapas, la primera identificar la perdida de percepción especifica del dominio, a través de los

mapas de características de un Red VGG previamente entrenada en un conjunto de datos genérico


como ImageNet, comparando detalles de alta frecuencia, utilizando una distancia euclidiana para

lograr capturar detalles faciales mínimos, posteriormente se enfoca en la perdida de

reconstrucción donde se aplica una perdida L1 a los pixeles, entendiendo dicha perdida como la

suma de los valores absolutos de la diferencia entre los valores predichos y los reales; al final una

perdida adversaria para mejorar aún más el realismo de la imágenes generadas utilizando un

objetivo adversario con un discriminador de múltiples escalas D1D2..Dn y un generador múltiples.

La siguiente etapa es Face reenactment y segmentation, donde se define el generador de

rostros teniendo en cuenta marcas y ángulos para generar puntos de referencias 2D dando como

resultado una salida de recreación recursiva donde se crea la imagen recreada y la máscara de

segmentación. En la siguiente fase de Face view interpolaction destacando el mismo como uno

de los pasos principales en su modelo, ya que se logra la construcción del mapa de apariencia

incorporando por ejemplo posturas de la cabeza, entre otros. En la Face inpaiting en esta se aplica

una llamada “pintura facial” que lo que haces es dar la imagen destino con el fondo eliminado. Por

último, la Face blending en donde se espera que ocurra la fusión de la cara completa con su

objetivo.

De cara a la detección de Deepfakes; realizaré una comparación destacando las fortalezas

o ventas de dos de los principales algoritmos empleados en este campo, a partir de ello generare

las debilidades que uno presenta frente al otro, en primer lugar destaco al algoritmo SHAP, que es

explicado en detalle en el artículo “SHap ley Additive exPlanations (SHAP)” de los investigadores

(Ge, Patino, Todisco & Evans, 2024), el otro algoritmo a validar es M2TR, que se puede encontrar

en el artículo “Multi-modal Multi-scale TRansformer (M2TR)”, por los autores (Wang,Wu,

Ouyang, Han, ET AL., 2022). De cara a SHAP tenemos principalmente las fortalezas encaminadas

a utilizar el análisis SHAP para resaltar la atención aplicada por un clasificador dado a intervalos
espectro-temporales de bajo nivel, igualmente, su capacidad de también ofrecer la base para

explorar explicaciones de nivel superior, también comparar sistemas que operan sobre

descomposiciones espectro-temporales hechas a mano con aquellos que operan directamente sobre

formas de onda sin procesar. En contraste, una de las principales ventajas o fortalezas de M2TR

es el uso d transformadores multiescalar para capturar la inconsistencia local sutil a múltiples

escalas y filtros de frecuencia para mejorar la robustez frente a la compresión de imágenes.

Además, presentan un conjunto de datos desafiante SR-DF que se genera con varios métodos de

intercambio de rostros y recreación facial de última generación, que facilita el entrenamiento de

algoritmos para tareas de detección y a su vez un sistema de evaluación para verificar

cuantitativamente que ese conjunto de datos (SR-DF) es mejor de los conjuntos de datos existentes

en términos de calidad visual y diversidad de datos.

Una vez identificadas las principales fortalezas de SHAP y M2TR podríamos resaltar como

SHAP tiene un enfoque en el análisis espectro-temporal de nivel superior y por supuesto de bajo

nivel, realizadas a mano, esta capacidad capacidad espectral se suma puntos al ser muy especifico

en un campo de la detección donde las imágenes tienen sombras principalmente, sin embargo, es

muy concreto en este campo, dejando quizás una inconsistencia en tareas que tienen que ver con

la multi-escala, en contraposición M2TR a través del uso de transformadores logra esta multi-

escala que le permite detectar inconsistencias de manera general incluso en la aplicación de filtros,

su principal desventaja en comparación a SHAP es la no capacidad tan fuerte en el campo temporal

relacionado a la descomposición de una imagen en pasos temporales, pero el brindar un conjunto

de datos considerado uno de los mejores en calidad visual y diversidad hacen que a través de este

conjunto sobrepongan la debilidad anteriormente detallada, ya que los datos de entrenamiento

permiten la detección temporal internamente que carece de manera general.


Posterior a su identificación, se plantea analizar cómo de sencillo es lograr un Deepfake

de la manera más natural posible, el despliegue de estos modelos a entornos de producción y a

través de un buen FrontEnd mejoran la interacción y hacen que realizar un cambio por ejemplo de

un rostro se una tarea de algunos segundos, para ente ejemplo adjuntaré tres imágenes de izquierda

derecha, la primera será la imagen original de mi persona seguida de dos imágenes, en la segunda

imagen logro la suplantación de Barack Obama en el gran salón Oval de la casa blanca y en la

tercera imagen logro ser James Bond y acompañar a una mujer en una gala de la película.

Fuente: (Pica AI, 2024)

Como podrán observar la sincronización de mi rostro en el entorno de la imagen donde se

implantó es muy buena, la idea no es llevar absolutamente todas las características porque lo que

se busca es conseguir la naturalidad de la imagen destino, de hecho, en la imagen 3, donde suplanto

a James Bond logro llevar características como mi tono de piel al rostro y cuello del objetivo

haciéndolo lucir muy natural sacando del resultado por ejemplo la sonrisa que tengo en la imagen

original.

Hemos alcanzado el punto donde la capacidad computacional y el desarrollo de algoritmos

que llevan cualquier cosa a números hacen que a través de la aplicación de diferentes técnicas y

apalancados en matemáticas principalmente logremos alcanzar casi cualquier cosa, el riesgo de lo

que acabo de mencionar es muy difícil de cuantificar en este momento, las regulaciones apenas
están surgiendo sobre la marcha, y al ser un campo de profunda investigación día a día se rompen

diferentes barreras, por tanto, es de gran importancia tanto que las principales compañías que se

dedicas al campo de la innovación en IA junto con los diferentes gobiernos avances en el desarrollo

de políticas de manera rápida, aproximándose al surgimiento de las diferentes tecnologías para que

apenas se desarrolle alguna que pueda poner en riesgo la vulnerabilidad de derechos de la persona,

casi de manera inmediata ya haya una regulación sobre ella, será difícil solapar el desarrollo de la

tecnología y al mismo tiempo el de la política de regulación pero si que al menos una vez

identificada la tecnología se ponga en marca estudios de validación de alcance de la tecnología

para lograr una identificación de su alcance y limitaciones para lograr una regulación eficiente.

Bibliografía

Academia de Ciencias de China. (s.f.). S³FD: Detector de rostros invariante de escala de disparo único.
Obtenido de [Link]
invariant_Face_Detector

Ge, Patino, Todisco & Evans. (2024). EXPLAINING DEEP LEARNING MODELS FOR SPOOFING AND
DEEPFAKE DETECTION. EURECOM, 1-5.

Gupta, B. (14 de 03 de 2023). DeepFake: un enfoque de aprendizaje profundo en la generación de


contenido artificial. Obtenido de [Link]
approach-in-artificial-content-generation-a626ceebe48f

Nirkin, Keller & Hassner. (2019). FSGAN: Subject Agnostic Face Swapping and Reenactment. Bar-Ilan
University, Israel, 1-16.

Petrov, Gao, Chervoniy, Liu, ET AL. (2021). Integrated, flexible and extensible face-swapping framework.
DeepFaceLab, 1-10.

Pica AI. (01 de 2024). Obtenido de [Link]

Wang,Wu, Ouyang, Han, ET AL. (2022). M2TR: Multi-modal Multi-scale Transformers for DeepFake
Detection. Shanghai Collaborative Innovation Center on Intelligent Visual Computing, 1-9.

También podría gustarte