BRAYAN YESID ARISMENDI SERRANO
CENTRO EUROPEO DE POSTGRADO/ UNIVERSIDAD CESUMA
MAESTRIA EN INTELIGENCIA ARTIFICIAL
CASO PRÁCTICO ASIGNATURA INTRODUCCIÓN A LA INTELIGENCIA
ARTIFICIAL
TUTOR: MARIO CONEJOS
PIEDECUESTA, COLOMBIA
13 DE ENERO DE 2025
La idea es realizar una breve investigación acerca de los algoritmos de generación de
deepfake más empleados a día de hoy, con ejemplos visuales de sus resultados y una comparación
general entre sus arquitecturas. Inicialmente la palabra “deepfake” es una combinación de las
palabras: deep (profundo) y fake (falso). La primera palabra; deep (profundo) esta relacionado al
término deep learning (aprendizaje profundo), que pertenece al campo del Machine learning.
Cuando se emplean estos algoritmos basados en deep learning para crear contenido falso, el
resultado se denomina deep fake o falsificación profunda. (Gupta, 2023)
A partir de lo anterior la creación de deepfakes se puede clasificar en:
a) Intercambio de rostros: En el intercambio de rostros, el rostro de la persona del video
original se reemplaza por el rostro de la persona del video de destino. La figura 1 representa este
proceso de intercambio de rostros.
Figura No.1 Intercambio de rostros.
Fuente: (Gupta, 2023)
b) Sincronización de labios: En la sincronización de labios, utilizamos audio arbitrario para
generar un nuevo vídeo de forma que el vídeo generado se sincronice correctamente con las
expresiones faciales y el audio. En la figura 2, podemos ver que el vídeo de entrada, con la ayuda
del audio específico, se utiliza para generar diferentes clips falsos.
Figura No.2 Sincronización de labios
Fuente: (Gupta, 2023)
c) Síntesis de rostros y manipulación de atributos: La síntesis de rostros, se ocupa de la
creación de rostros falsos y manipula los diferentes atributos de los rostros originales. En la figura
3, en el lado izquierdo, tenemos la imagen original, que luego se manipula de diferentes maneras.
Podemos agregar cabello largo, anteojos, cambiar el género manipulando diferentes regiones
faciales de la foto.
Figura No.3 Síntesis de rostros
Fuente: (Gupta, 2023)
d) Deepfakes de audio, Las falsificaciones profundas de audio; se ocupan de la creación de
un discurso dirigido.
Existen varios métodos para crear deepfake, pero los métodos más populares es el uso de
autoencoder y el GAN. El autoencoder es un algoritmo de aprendizaje profundo que estudia los
datos de entrada dados deteniéndose en diferentes ángulos y condiciones ambientales, siendo capaz
de replicar el mismo contenido de entrada con mucha precisión. Un enfoque en GAN puede ser el
empleado por ejemplo en FSGAN con el objetico de manipular regiones faciales junto con la pose
y la expresión. Estas imágenes manipuladas son de muy alta calidad e incluso han superado a las
imágenes generadas con la ayuda de métodos de autocodificación.
Entrando en detalle un poco sobre las arquitecturas y sus respectivos resultados, realizaré
una comparación de propuestas entre lo que podemos encontrar en artículo de DeepFaceLab
titulado “: Integrated, flexible and extensible face-swapping framework” realizado por (Petrov,
Gao, Chervoniy, Liu, ET AL, 2021) destacando la frase “La mejor defensa es un buen ataque”, la
idea es explicar a nivel general la arquitectura y sus principales características y compararlas con
el reconocido algoritmo FSGAN y el articulo “Subject Agnostic Face Swapping and Reenactment”
de los investigadores (Nirkin, Keller & Hassner, 2019).
A nivel general en DeepFaceLab (DFL) se basa en una combinación de ideas previas bajo
un diseño que equilibra la velocidad y la facilidad de uso y el auge de la visión artificial en el
reconocimiento facial, la alineación, la reconstrucción, la segmentación, etc.
De manera general reconocen como fundamental que las técnicas de manipulación de
rostros con el uso de redes generativas antagónicas (GAN) son cada vez más incluidas en la
sinterización de rostros, por ejemplo, algoritmos como StyleGAN y StyleGAN2 hacen cada vez
los resultados más realistas y completamente indistinguibles para el sistema de visión humano.
La arquitectura principal del algoritmo de DeekFaceLab es:
Figura No.4 Arquitectura DeekFaceLab:
Face Detection
Face Alignment
Face Segmentation
Fuente: Imagen Propia, Información (Petrov, Gao, Chervoniy, Liu, ET AL, 2021)
La primera fase es la que se encarga de la detección del rostro, en esta se usa el algoritmo
llamado Single Shot Scale-invariant Face Detector (S³FD) (Academia de Ciencias de China, s.f.)
donde proponen una única red neuronal profunda, especialmente para rostros pequeños. Este
algoritmo trata de resolver el problema común de que los detectores basados en anclas que se
deterioran a medida que los objetos se vuelven más pequeños.
La segunda fase se enfoca en la alineación de rostros, en ella se introducen los puntos de
referencia faciales, claves para mantener la escalabilidad a lo largo del tiempo, en este punto DFL
proporciona dos tipos canónicos de algoritmos de extracción de puntos de referencia faciales; el
primero el algoritmo de puntos de referencia facial basado en mapas de calor 2DFAN (para rostros
con pose estándar) y PRNet con información previa del rostro en 3D (para rostros con un gran
ángulo de Euler (guiñada, cabeceo, balanceo).
Al final, dentro de la arquitectura de DFL se destaca su fase de segmentación justo después
de tener los rostros en vista lateral, frontal y estándar, emplear TernausNet, una red de
segmentación de grano fino para segmentar de manera exacta un rostro.
En contraste, FSGAN emplea la siguiente arquitectura:
Figura No.5 Arquitectura FSGAN:
Training Losses
Face reenactment and
segmentation
Face view
interpolaction
Face inpaiting
Face blending
Fuente: Imagen Propia, Información (Nirkin, Keller & Hassner, 2019)
Su primera fase se enfoca en un Trainning Losses en donde tratan de hacer las siguientes
subetapas, la primera identificar la perdida de percepción especifica del dominio, a través de los
mapas de características de un Red VGG previamente entrenada en un conjunto de datos genérico
como ImageNet, comparando detalles de alta frecuencia, utilizando una distancia euclidiana para
lograr capturar detalles faciales mínimos, posteriormente se enfoca en la perdida de
reconstrucción donde se aplica una perdida L1 a los pixeles, entendiendo dicha perdida como la
suma de los valores absolutos de la diferencia entre los valores predichos y los reales; al final una
perdida adversaria para mejorar aún más el realismo de la imágenes generadas utilizando un
objetivo adversario con un discriminador de múltiples escalas D1D2..Dn y un generador múltiples.
La siguiente etapa es Face reenactment y segmentation, donde se define el generador de
rostros teniendo en cuenta marcas y ángulos para generar puntos de referencias 2D dando como
resultado una salida de recreación recursiva donde se crea la imagen recreada y la máscara de
segmentación. En la siguiente fase de Face view interpolaction destacando el mismo como uno
de los pasos principales en su modelo, ya que se logra la construcción del mapa de apariencia
incorporando por ejemplo posturas de la cabeza, entre otros. En la Face inpaiting en esta se aplica
una llamada “pintura facial” que lo que haces es dar la imagen destino con el fondo eliminado. Por
último, la Face blending en donde se espera que ocurra la fusión de la cara completa con su
objetivo.
De cara a la detección de Deepfakes; realizaré una comparación destacando las fortalezas
o ventas de dos de los principales algoritmos empleados en este campo, a partir de ello generare
las debilidades que uno presenta frente al otro, en primer lugar destaco al algoritmo SHAP, que es
explicado en detalle en el artículo “SHap ley Additive exPlanations (SHAP)” de los investigadores
(Ge, Patino, Todisco & Evans, 2024), el otro algoritmo a validar es M2TR, que se puede encontrar
en el artículo “Multi-modal Multi-scale TRansformer (M2TR)”, por los autores (Wang,Wu,
Ouyang, Han, ET AL., 2022). De cara a SHAP tenemos principalmente las fortalezas encaminadas
a utilizar el análisis SHAP para resaltar la atención aplicada por un clasificador dado a intervalos
espectro-temporales de bajo nivel, igualmente, su capacidad de también ofrecer la base para
explorar explicaciones de nivel superior, también comparar sistemas que operan sobre
descomposiciones espectro-temporales hechas a mano con aquellos que operan directamente sobre
formas de onda sin procesar. En contraste, una de las principales ventajas o fortalezas de M2TR
es el uso d transformadores multiescalar para capturar la inconsistencia local sutil a múltiples
escalas y filtros de frecuencia para mejorar la robustez frente a la compresión de imágenes.
Además, presentan un conjunto de datos desafiante SR-DF que se genera con varios métodos de
intercambio de rostros y recreación facial de última generación, que facilita el entrenamiento de
algoritmos para tareas de detección y a su vez un sistema de evaluación para verificar
cuantitativamente que ese conjunto de datos (SR-DF) es mejor de los conjuntos de datos existentes
en términos de calidad visual y diversidad de datos.
Una vez identificadas las principales fortalezas de SHAP y M2TR podríamos resaltar como
SHAP tiene un enfoque en el análisis espectro-temporal de nivel superior y por supuesto de bajo
nivel, realizadas a mano, esta capacidad capacidad espectral se suma puntos al ser muy especifico
en un campo de la detección donde las imágenes tienen sombras principalmente, sin embargo, es
muy concreto en este campo, dejando quizás una inconsistencia en tareas que tienen que ver con
la multi-escala, en contraposición M2TR a través del uso de transformadores logra esta multi-
escala que le permite detectar inconsistencias de manera general incluso en la aplicación de filtros,
su principal desventaja en comparación a SHAP es la no capacidad tan fuerte en el campo temporal
relacionado a la descomposición de una imagen en pasos temporales, pero el brindar un conjunto
de datos considerado uno de los mejores en calidad visual y diversidad hacen que a través de este
conjunto sobrepongan la debilidad anteriormente detallada, ya que los datos de entrenamiento
permiten la detección temporal internamente que carece de manera general.
Posterior a su identificación, se plantea analizar cómo de sencillo es lograr un Deepfake
de la manera más natural posible, el despliegue de estos modelos a entornos de producción y a
través de un buen FrontEnd mejoran la interacción y hacen que realizar un cambio por ejemplo de
un rostro se una tarea de algunos segundos, para ente ejemplo adjuntaré tres imágenes de izquierda
derecha, la primera será la imagen original de mi persona seguida de dos imágenes, en la segunda
imagen logro la suplantación de Barack Obama en el gran salón Oval de la casa blanca y en la
tercera imagen logro ser James Bond y acompañar a una mujer en una gala de la película.
Fuente: (Pica AI, 2024)
Como podrán observar la sincronización de mi rostro en el entorno de la imagen donde se
implantó es muy buena, la idea no es llevar absolutamente todas las características porque lo que
se busca es conseguir la naturalidad de la imagen destino, de hecho, en la imagen 3, donde suplanto
a James Bond logro llevar características como mi tono de piel al rostro y cuello del objetivo
haciéndolo lucir muy natural sacando del resultado por ejemplo la sonrisa que tengo en la imagen
original.
Hemos alcanzado el punto donde la capacidad computacional y el desarrollo de algoritmos
que llevan cualquier cosa a números hacen que a través de la aplicación de diferentes técnicas y
apalancados en matemáticas principalmente logremos alcanzar casi cualquier cosa, el riesgo de lo
que acabo de mencionar es muy difícil de cuantificar en este momento, las regulaciones apenas
están surgiendo sobre la marcha, y al ser un campo de profunda investigación día a día se rompen
diferentes barreras, por tanto, es de gran importancia tanto que las principales compañías que se
dedicas al campo de la innovación en IA junto con los diferentes gobiernos avances en el desarrollo
de políticas de manera rápida, aproximándose al surgimiento de las diferentes tecnologías para que
apenas se desarrolle alguna que pueda poner en riesgo la vulnerabilidad de derechos de la persona,
casi de manera inmediata ya haya una regulación sobre ella, será difícil solapar el desarrollo de la
tecnología y al mismo tiempo el de la política de regulación pero si que al menos una vez
identificada la tecnología se ponga en marca estudios de validación de alcance de la tecnología
para lograr una identificación de su alcance y limitaciones para lograr una regulación eficiente.
Bibliografía
Academia de Ciencias de China. (s.f.). S³FD: Detector de rostros invariante de escala de disparo único.
Obtenido de [Link]
invariant_Face_Detector
Ge, Patino, Todisco & Evans. (2024). EXPLAINING DEEP LEARNING MODELS FOR SPOOFING AND
DEEPFAKE DETECTION. EURECOM, 1-5.
Gupta, B. (14 de 03 de 2023). DeepFake: un enfoque de aprendizaje profundo en la generación de
contenido artificial. Obtenido de [Link]
approach-in-artificial-content-generation-a626ceebe48f
Nirkin, Keller & Hassner. (2019). FSGAN: Subject Agnostic Face Swapping and Reenactment. Bar-Ilan
University, Israel, 1-16.
Petrov, Gao, Chervoniy, Liu, ET AL. (2021). Integrated, flexible and extensible face-swapping framework.
DeepFaceLab, 1-10.
Pica AI. (01 de 2024). Obtenido de [Link]
Wang,Wu, Ouyang, Han, ET AL. (2022). M2TR: Multi-modal Multi-scale Transformers for DeepFake
Detection. Shanghai Collaborative Innovation Center on Intelligent Visual Computing, 1-9.