0% ont trouvé ce document utile (0 vote)
5 vues9 pages

Article

Cet article explore l'utilisation de mécanismes d'attention dans les entretiens vidéo d'embauche asynchrones pour extraire des informations clés influençant les décisions des recruteurs. Les auteurs présentent une méthodologie pour automatiser l'analyse de ces 'attention slices' afin d'améliorer l'interprétabilité des systèmes d'évaluation basés sur l'apprentissage profond. Ils soulignent l'importance de la transparence et de l'interprétabilité dans le contexte de l'embauche, tout en proposant des expériences pour valider l'utilité de ces tranches d'attention.

Transféré par

Rahma Youssef
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
5 vues9 pages

Article

Cet article explore l'utilisation de mécanismes d'attention dans les entretiens vidéo d'embauche asynchrones pour extraire des informations clés influençant les décisions des recruteurs. Les auteurs présentent une méthodologie pour automatiser l'analyse de ces 'attention slices' afin d'améliorer l'interprétabilité des systèmes d'évaluation basés sur l'apprentissage profond. Ils soulignent l'importance de la transparence et de l'interprétabilité dans le contexte de l'embauche, tout en proposant des expériences pour valider l'utilité de ces tranches d'attention.

Transféré par

Rahma Youssef
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Attention Slices dans les Entretiens d’Embauche Vidéo

Différés
Léo Hemamou, Arthur Guillon, Jean-Claude Martin, Chloé Clavel

To cite this version:


Léo Hemamou, Arthur Guillon, Jean-Claude Martin, Chloé Clavel. Attention Slices dans les Entre-
tiens d’Embauche Vidéo Différés. Workshop sur les Affects, Compagnons artificiels et Interactions
(WACAI 2020), CNRS, Université Toulouse Jean Jaurès, Université de Bordeaux, Jun 2020, Saint
Pierre d’Oléron, France. �hal-02933469�

HAL Id: hal-02933469


[Link]
Submitted on 8 Sep 2020

HAL is a multi-disciplinary open access L’archive ouverte pluridisciplinaire HAL, est


archive for the deposit and dissemination of sci- destinée au dépôt et à la diffusion de documents
entific research documents, whether they are pub- scientifiques de niveau recherche, publiés ou non,
lished or not. The documents may come from émanant des établissements d’enseignement et de
teaching and research institutions in France or recherche français ou étrangers, des laboratoires
abroad, or from public or private research centers. publics ou privés.

HAL Authorization
Attention Slices dans les Entretiens d’Embauche Vidéo Différés
Léo Hemamou∗† Arthur Guillon
EASYRECRUE EASYRECRUE
Paris, France Paris, France
[Link]@[Link] [Link]@[Link]

Jean-Claude Martin Chloé Clavel


LIMSI, CNRS, Paris-Sud University, Paris-Saclay LTCI, Télécom ParisTech, Paris-Saclay University
University, Orsay, France Palaiseau, France
[Link]@[Link] [Link]@[Link]

ABSTRACT l’entraînement des candidats mais aussi aux chercheurs et aux


Dans cet article, nous nous intéressons à l’étude de signaux in- recruteurs pour comprendre le processus d’évaluation et de sélec-
fluents dans les entretiens vidéo d’embauche asynchrones décou- tion opéré par ces derniers. Initialement menés en face-à-face ou
verts par des méthodes d’apprentissage profond. Le système que par téléphone, les entretiens d’embauche sont désormais souvent
nous étudions emploie des mécanismes d’attention, qui permettent réalisés par des systèmes de visioconférence en ligne ou par des
d’extraire d’un entretien les informations et les instants décisifs (qui enregistrements vidéo asynchrones. La procédure est la suivante :
ont influencé la décision du système au niveau de l’entretien), sans le candidat se connecte à une plateforme web et répond à une
requérir d’annotation locale. Alors que la majorité des approches séquence de questions prédéfinies par le recruteur en s’enregistrant
similaires évaluent les mécanismes d’attention en se contentant de en vidéo au moyen de sa webcam, son smartphone ou sa tablette.
visualiser les moments d’attention maximale, nous proposons ici Dans un second temps, les recruteurs se connectent à la même plate-
une méthodologie permettant d’automatiser l’analyse du contenu forme, regardent les réponses du candidat, évaluent les réponses et
de ces attention slices afin de fournir des éléments d’interprétation décident ensuite s’ils souhaitent inviter le candidat à un entretien
des prédictions du système. en face à face.
Les chercheurs développent déjà des systèmes pour prédire au-
KEYWORDS tomatiquement l’embauche sur la base d’indices non verbaux des
candidats dans des interviews vidéo asynchrones [4, 27]. Dans ce
entretiens d’embauche, entretiens vidéo, apprentissage profond,
contexte et en plus des nouvelles contraintes législatives (Règlement
interprétabilité
Général sur la Protection des Données), de tels systèmes automa-
ACM Reference Format: tiques nécessitent de l’interprétabilité et de la transparence. Grâce
Léo Hemamou, Arthur Guillon, Jean-Claude Martin, and Chloé Clavel. 2020. à ces systèmes, les candidats pourront améliorer leur stratégie com-
Attention Slices dans les Entretiens d’Embauche Vidéo Différés. In WACAI
portementale non verbale et les recruteurs pourront évaluer ces
2020, 03–05 Juin, 2020, Île d’Oléron, France. ACM, New York, NY, USA, 8 pages.
modèles d’aide à la décision. Ces modèles pourraient même aider les
[Link]
recruteurs à comprendre leurs propres biais. Nous avons précédem-
ment proposé un modèle d’apprentissage profond, baptisé HireNet,
1 INTRODUCTION
entraîné uniquement grâce à l’étiquette de la décision du recruteur
Parmi les procédures de sélection du personnel, les entretiens et des vidéos réponses d’entretiens d’embauche [14]. Notre modèle
d’embauche demeurent une méthode privilégiée des recruteurs [29]. est capable de prendre en compte la temporalité et les tranches
L’informatique affective a déjà prouvé, à de nombreux égards, son influentes des entretiens vidéos différés, grâce à l’utilisation d’un
utilité dans ce contexte : par exemple, des recruteurs virtuels ont mécanisme d’attention et d’un réseau de neurones récurrent. Une
été pensés pour aider les candidats à développer leurs compétences séquence de descripteurs est traitée par un réseau de neurones
sociales et à répéter l’exercice de l’entretien d’embauche [16]. Dès récurrent, et le mécanisme d’attention vise à apprendre un poids
lors, l’apport du traitement automatique peut être bénéfique à différent pour chaque élément (ou pas de temps) de cette séquence
∗ Also with LIMSI, CNRS, Paris-Sud University, Paris-Saclay University.
afin d’améliorer les performances de la tâche de classification. Dans
† Also with LTCI, Télécom ParisTech, Paris-Saclay University. l’ensemble, ces techniques pourraient être utiles pour comprendre
le comportement humain, car elles visent à séparer les pas de temps
Permission to make digital or hard copies of all or part of this work for personal or pertinents pour une tâche dans une séquence des pas de temps non
classroom use is granted without fee provided that copies are not made or distributed
for profit or commercial advantage and that copies bear this notice and the full citation pertinents [33]. Cependant, la recherche dans ce domaine se limite
on the first page. Copyrights for components of this work owned by others than ACM à montrer quelques exemples de pics de courbes d’attention [14, 33].
must be honored. Abstracting with credit is permitted. To copy otherwise, or republish, Par conséquent, une validation cohérente est nécessaire afin de véri-
to post on servers or to redistribute to lists, requires prior specific permission and/or a
fee. Request permissions from permissions@[Link]. fier l’utilité de la sortie d’un tel système pour prédire l’embauche
WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France telle qu’évaluée par les recruteurs.
© 2020 Association for Computing Machinery. Dans cet esprit, cet article décrit quatre expériences que nous
ACM ISBN XXX-X-XXXX-XXXX-X/XX/XX. . . $15.00
[Link] avons menées pour comprendre si des tranches d’entretiens vidéo
WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France Léo Hemamou, Arthur Guillon, Jean-Claude Martin, and Chloé Clavel

mises en évidence par le modèle d’attention contiennent des in- 2.2 Analyse automatique des entretiens
formations utiles aux recruteurs. Tout d’abord en section 2, nous d’embauche
présentons un état de l’art des méthodes d’analyse automatique
Les avancées récentes réduisent considérablement le temps passé
d’entretien d’embauche. La section 3 décrit le nouveau jeu de don-
à annoter manuellement les signaux comportementaux. Des out-
nées collectées et rappelle le modèle d’apprentissage profond que
ils sont désormais disponibles pour détecter automatiquement les
nous utilisons, HireNet, puis le compare à des modèles de l’état de
signaux vocaux [9] ou visuels [1]. Des études récentes utilisent
l’art. Enfin la section 4 propose une étude approfondie des courbes
le traitement du signal social et l’apprentissage automatique pour
d’attention produites par HireNet.
comprendre les liens entre les indices non verbaux et l’embauche.
Ces études ont été appliquées à différentes déclinaisons de l’ entre-
tien d’embauche : en entretiens en face à face [24, 25], en entretiens
2 ÉTAT DE L’ART vidéo asynchrones [4] ou entretiens par chat vidéo [26].
2.1 L’influence des comportements verbaux et Parmi les dimensions étudiées dans les entretiens d’embauche
non verbaux dans le contexte du (compétences communicationnelles [26], personnalité [4], etc.), la
recrutement performance en entretien reste la plus étudiée. La méthodologie
la plus usitée est l’extraction de descripteurs selon chacune des
Comportement non verbaux dans les entretiens. Les comportements
modalités, l’obtention d’un vecteur fixe par application de fonction-
non verbaux tels que les indices visuels et audio ont été étudiés par
nelles (moyenne, écart type, minimum ou maximum des valeurs
plusieurs auteurs dans le contexte du recrutement, notamment, en
des descripteurs au cours d’une réponse) puis l’entraînement d’un
lien avec la prédiction de l’anxiété [11], des performances lors
modèle d’apprentissage automatique. Cependant, cette méthode
de l’entretien [12], de la personnalité des candidats [7] ou des
présente des lacunes, notamment l’absence de la modélisation du
tentatives de tromperie [30]. De nombreuses caractéristiques vi-
caractère séquentiel de l’entretien et son aspect hiérarchique : un
suelles ont ainsi été étudiées, telles que l’attractivité du candidat, la
entretien d’embauche est une séquence de questions/réponses dont
gestuelle des mains, le sourire, le contact visuel, le hochement ou
chacune des réponses est elle-même une séquence de mots ou de
le mouvement de la tête, l’orientation du corps ou les expressions
fenêtres. Pour répondre à ce manque, nous avons proposé un mod-
faciales [11, 30]. Des travaux comparables ont été menés pour la
èle d’apprentissage profond [14] ayant démontré des meilleurs
voix, en particulier concernant l’impact de l’amplitude et du ton de
résultats sur la tâche de classification d’employabilité. Cependant,
la voix, les silences ou les dysfluences verbables [24, 27].
cette méthode étant basée sur l’apprentissage profond, le système
Contenu verbal dans les entretiens. En comparaison avec ces
d’apprentissage est bien plus opaque qu’un système basé sur l’ap-
travaux, peu d’études se sont focalisées sur l’influence du con-
prentissage automatique et des descripteurs construits à la main. Il
tenu verbal [22]. Celui-ci est pourtant central dans l’évaluation
est donc nécessaire d’effectuer une analyse approfondie du système
de la performance du candidat, puisqu’il est la modalité utilisée
afin de comprendre comment celui-ci fonctionne et nous informer
par le candidat pour répondre. En tant que tel, le contenu verbal
sur des possibles comportements intéressants à étudier dans le
constitue une grande source d’informations pour la plupart des
contexte du recrutement.
dimensions évaluées lors d’un entretien d’embauche telles que les
connaissances déclaratives liées au poste, les compétences sociales,
communicationnelles ou interpersonnelles [17]. 2.3 Réseaux de neurones et interprétabilité
L’annotation de chaque comportement du candidat, qu’il soit Les réseaux de neurones sont capables de modéliser une représen-
verbal ou non verbal, est coûteuse en temps. Une approche courante tation intermédiaire intégrant une information haut niveau directe-
pour alléger la tâche d’annotation consiste à annoter uniquement ment à partir des données signal [31]. Cependant, la liberté dont
une partie de l’entretien d’embauche. En fait, il a été démontré ils disposent pour construire cette représentation intermédiaire se
que, en utilisant seulement une petite quantité d’informations, les fait au prix d’une extrême opacité qui freine leur adoption pour
gens peuvent déduire correctement les caractéristiques, traits ou des applications critiques telles que dans le milieu de la santé, de
états personnels d’un individu [2, 23]. Cette approche est appelée la justice ou des ressources humaines. Pour ces raisons, de nom-
analyse en tranches fines (thin slices) et a déjà été utilisée dans breux travaux proposent des méthodes pour mieux expliquer ces
l’étude des interactions sociales [23], les premières impressions [2], réseaux. La notion de transparence et d’interprétabilité reste encore
la prise de parole en public [6] ou les entretiens d’embauche [25]. floue, notamment dans le cas où la vérité terrain n’est pas con-
Un autre avantage de cette méthode est qu’elle met en évidence nue [32]. [32] propose une catégorisation à deux dimensions pour
un comportement bref et non verbal par rapport aux impressions l’interprétabilité selon la dimension de l’interprétation (explique-t-
perçues. Néanmoins, la durée et la stratégie d’échantillonnage des on le modèle dans son ensemble, ou la prédiction sur une instance
tranches fines restent une question ouverte. Les études précédentes ?) et la méthode d’interprétation (intrinsèque au modèle, ou par une
se concentrent sur l’échantillonnage de tranches fines au hasard [6], méthode post-construction du modèle ?). Plusieurs méthodes ont
en utilisant la structure de l’entretien d’embauche (tranches basées ainsi été proposées comme la visualisation des états cachés, les ap-
sur des questions et réponses) [25], ou au début et à la fin des inter- proches par compression de modèle [20], l’utilisation de classifieurs
actions [7]. Des méthodes automatiques basées sur le traitement locaux [28]. Parmi ces méthodes, les mécanismes d’attention ont
du signal social pourraient laisser la place à une meilleure sélection récemment gagné en popularité pour améliorer les performances
des tranches fines et de leur durée, en sélectionnant des régions qui et l’interprétabilité [14, 33]. Cependant, la plupart des études ex-
véhiculent plus d’informations. istantes se contentent de valider la pertinence des mécanismes
Attention Slices dans les Entretiens d’Embauche Vidéo Différés WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France

d’attention en exhibant des exemples et ne conduisent pas d’analyse Jeu de données Train Val Test
approfondie [33]. De plus, la validité des courbes d’attention comme Nombre de candidats 3581 784 783
explication a récemment été remise en question [18]. Il est donc Nombre moyen de questions 5,43 5,46 5,41
nécessaire d’investiguer l’utilité du mécanisme d’attention comme Nombre de postes 455 225 219
outil pour la transparence. Proportion des
55 % 55 % 54 %
étiquettes Employable
3 JEUX DE DONNÉES ET MODÈLE Table 1: Nombre de candidats et statistiques à propos de cha-
cun des jeux de données.
Nous comparons tout d’abord les performances d’un modèle d’ap-
prentissage profond précédemment proposé [14] aux approches
plus classiques construites avec des descripteurs construits à la
main comme celles proposées par [25, 27]. Dans cette section, nous
décrivons le nouveau jeu de données constitué, les descripteurs
utilisés et le choix du modèle d’apprentisage profond (HireNet)
ainsi que les légères modifications effectuées à celui-ci. traduit uniquement le souhait du recruteur d’inviter le candidat
en entretien face-à-face. Si plusieurs annotateurs ont annoté le
3.1 Jeu de données même candidat, nous procédons à un vote majoritaire. Nous avons
Dans un souci de comparaison avec [14], nous avons décidé de sélec- divisé l’ensemble de données en un ensemble d’apprentissage, un
tionner un type d’emploi spécifique : les postes de vente. Après ensemble de validation pour la sélection d’hyperparamètres et un
filtrage basé sur des titres de poste spécifiques de la base de don- ensemble de test pour l’évaluation finale de chaque modèle. Chaque
nées ROME 1 , une liste des postes a été sélectionnée et vérifiée par ensemble constitue respectivement 70 %, 15 % et 15 % de l’ensemble
les auteurs et un expert des Ressources Humaines (RH). Enfin, en de données complet.
collaboration avec un acteur du secteur RH, nous avons obtenu
un ensemble de données d’entretiens vidéo français comprenant 3.2 Descripteurs utilisés
plus de 627 postes. La retranscription automatique de la parole est
Nous avons trois sources d’information : les vidéos réponses dont
obtenue grâce à l’API Google speech-to-text2 . Il est important de
nous extrayons les descripteurs textuels, prosodiques et faciaux,
noter que les vidéos sont très différentes de ce qui pourrait être
les titres des questions et le titre du poste. Pour chaque modalité
produit dans une configuration de laboratoire. Les vidéos peuvent
d’une réponse vidéo, nous avons sélectionné des descripteurs de bas
être enregistrées à partir d’une webcam, d’un smartphone ou d’une
niveau. Contenu verbal : Nous avons choisi d’utiliser des plonge-
tablette, ce qui signifie que les environnements bruyants et les
ments de mots contextualisés comme représentation du contenu ver-
équipements de mauvaise qualité sont au rendez-vous. En raison de
bal. De nombreuses tâches ont été améliorées en utilisant ces plonge-
ces conditions réelles, l’extraction de fonctionnalités peut échouer
ments de mots contextualisés notamment des taches d’inférence
pour une modalité pendant toute la réponse d’un candidat. Un ex-
du langage naturel [21]. En tant que représentation pour les mots
emple est la détection des unités d’action lorsque l’image a des
contextualisés, nous avons choisis d’utiliser une représentation pro-
problèmes d’éclairage. En ce sens, nous supprimons les vidéos si
duite par le modèle français pré-entraîné “CamemBERT” [21]. Nous
1) la confiance retournée par la reconnaissance automatique de la
obtenons ainsi comme représentation pour chacun des mots un
parole est inférieure à 85 %, 2) OpenFace n’a pas réussi à détecter
vecteur de dimension 768. Expression faciale : Nous extrayons
un visage dans plus de 20 % du total des fenêtres. Enfin, nous ne
des descripteurs visuels pour chacune des fenêtres grâce à l’outil
gardons que les candidats avec au moins une réponse pour laque-
OpenFace [1], un logiciel d’analyse comportementale visuelle à
lle le pipeline d’extraction des descripteurs a réussi pour les trois
la pointe de la technologie. Nous avons choisi d’extraire la posi-
modalités. Certaines statistiques sur l’ensemble de données sont
tion et la rotation de la tête, l’intensité et la présence des unités
disponibles dans le tableau 1. Bien que les candidats aient accepté
d’actions et la direction du regard. Comme de nombreuses vidéos
l’utilisation de leurs entretiens, l’ensemble de données ne sera pas
ont des fréquences d’échantillonnage différentes, nous avons dé-
rendu public en dehors du champ de cette étude car les vidéos
cidé de lisser les valeurs avec une fenêtre temporelle de 0,5s et
sont des données personnelles soumises à de fortes contraintes de
un chevauchement de 0,25s. indices prosodiques : nos descrip-
confidentialité.
teurs prosodiques au niveau de la fenêtre sont extraits à l’aide de
Étiquetage des données et mesures d’évaluation. Les recruteurs re- l’outil OpenSmile [10]. La configuration que nous utilisons est la
gardent les vidéos des candidats et peuvent “liker” ou “disliker” les même que celle utilisée pour obtenir les descripteurs eGeMAPS
candidats, les présélectionner, les évaluer sur des critères prédéfinis [9]. GeMAPS est un célèbre ensemble minimaliste de descripteurs
ou écrire des commentaires. Pour simplifier la tâche, nous avons sélectionnées pour leur importance dans l’informatique sociale, et
mis en place une classification binaire : les candidats présélection- eGeMAPS en est sa version étendue. Nous extrayons les descrip-
nés, ayant reçu une opinion positive ou une note élevée sont con- teurs pour chaque fenêtre de 0,01s. Nous lissons ensuite ,de la même
sidérés comme Employable, les autres candidats sont considérés manière que pour la modalité vidéo, ces descripteurs prosodiques.
comme Non employable. À noter ici que l’étiquette Employable Questions et titre du poste: Nous utilisons la représentation au
1 [Link] niveau de la phrase du même modèle BERT préalablement util-
emplois-rome/ isé pour représenter l’intitulé des questions et du titre de poste
2 [Link] résultant en un vecteur de dimension 768.
WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France Léo Hemamou, Arthur Guillon, Jean-Claude Martin, and Chloé Clavel

Baseline naïve AUC F1


Aléatoire 0,5 0,5
Vote majoritaire 0,5 0,354
Vote par poste 0,630 0,627
Modèle Texte Audio Video
𝐴𝑈𝐶 F1 𝐴𝑈𝐶 F1 𝐴𝑈 𝐶 F1
Non séquentiel 0,613 0,570 0,624 0,584 0,579 0,549
HireNet 0,727 0,659 0,738 0,662 0,661 0,612
Table 2: Résultats sur la tâche de classification de
l’employabilité

Le système de porte (𝜆) permet pour chaque instant de pondérer


l’adéquation de cet instant avec le contexte par rapport à son impor-
tance intrinsèque dans le modèle. Par exemple, dans un contexte
Figure 1: HireNet. Le bloc MLP correspond ici à un réseau où une question liée à la relation client est posée, les mots en rela-
de neurones à une couche. Le bloc Bi-GRU correspond à tion avec le concept de relation client devraient être mis en valeur
un réseau de neurones Bi-directionnel Gated Reccurent (lambda élevé). Cependant il y a aussi des mots qui doivent être con-
Unit. sidérés comme important indépendamment du contexte, comme
les insultes, les mots remplisseurs, l’usage du “je”, etc. Dès lors
le modèle peut apprendre l’importance des fenêtres ou des mots
3.3 HireNet qu’il rencontre dépendamment de leur contexte ou de leur valeur
Dans un article précédent, nous avons proposé HireNet, un réseau intrinsèque respectivement grâce au premier et au second terme.
de neurones d’attention pour prédire l’employabilité telle qu’évaluée
par les recruteurs à partir d’entretiens vidéo structurés. HireNet [14]
a été conçu pour représenter une séquence de questions-réponses 3.4 Évaluation expérimentale des classifieurs
contenant elles-mêmes une séquence de signaux sociaux ou de Nous proposons ici une comparaison du modèle HireNet à plusieurs
mots. Un schema rappelant l’architecture utilisé est disponible en baselines : i) vote aléatoire (un millier de tirages aléatoires respec-
figure 1. Nous avons procédé à plusieurs modifications vis-à-vis tant l’équilibre des étiquettes du jeu de données d’entraînement
de l’architecture de base. Ainsi, nous avons 1) remplacé l’encodeur ont été effectués. Le score AUC est ensuite moyenné ; ii) Vote par
des questions et des titres de job par une simple couche encodant majorité (cette méthode consiste simplement à attribuer l’étiquette
la représentation CamemBERT préentrainée; 2) modifié la fonction majoritaire ; iii) Vote par poste (cette méthode consiste simple-
du mécanisme d’attention pour que le contexte soit mieux pris en ment à attribuer l’étiquette majoritaire du poste concerné. Puisque
compte. Pour rappel, le mécanisme d’attention bas niveau est des- notre modèle pourrait simplement apprendre l’étiquette la plus
tiné à discerner les moments les plus importants pour l’entretien représentée pour chacun des postes, nous avons décidé d’inclure
d’embauche en fonction du contexte de l’intitulé de la question, ce modèle ; iv) Méthodes classiques non séquentielles nous
tandis que le mécanisme haut niveau est destiné à pondérer les appliquons des fonctions statistiques pour réduire la dimension
questions-réponses les plus importantes par rapport au contexte temporelle et pour obtenir un vecteur fixe pour chaque modal-
de l’intitulé du poste. ité. Les fonctionnelles moyenne, écart type, minimum, maximum,
Ce nouveau mécanisme d’attention est décrit ci-dessous. Pour somme des gradients positifs et somme des gradients négatifs sont
une séquence ℎ𝑡 et un vecteur de contexte fixe 𝑄, l’attention est appliqués aux descripteurs décrits dans la partie 3.2 pour obtenir
calculée de la façon suivante. une représentation de chaque réponse pour l’audio et la vidéo. Pour
la modalité de langage nous prenons la moyenne des représenta-
𝑢𝑖 = 𝑡𝑎𝑛ℎ(𝜆𝑖 (𝑊𝑞 𝑄 (𝑊ℎ ℎ𝑖 ) ⊤ ) + (1 − 𝜆𝑖 )(𝑏 ⊤ (𝑊𝑘 ℎ𝑖 ))) (1)
tions CamemBERT. Trois algorithmes d’apprentissage classiques (à
𝜆𝑖 = 𝜎 ([𝑊𝑞 𝑄 ∗ 𝑊ℎ ℎ𝑖 ; 𝑏 ∗ 𝑊𝑘 ℎ𝑖 ] (2) savoir SVM, régression Ridge et forêt aléatoire) sont utilisés pour la
baseline. Le meilleur résultat des trois algorithmes est retenu. Les
𝑒𝑥𝑝 (𝑢𝑖 ) métriques d’évaluation choisies sont l’aire sous la courbe (AUC) et
𝛼𝑖 = Í (3)
𝑖 ′ 𝑒𝑥𝑝 (𝑢𝑖 ′ ) la moyenne du score F1 des classes Employable et Non employable.
Õ Les résultats sont reportés dans le tableau 2. Nous constatons que
𝑣= 𝛼 𝑖 ℎ𝑖 (4)
𝑖 HireNet présente des meilleurs résultats par rapport aux méthodes
où 𝑊𝑞 , 𝑊ℎ , 𝑊𝑘 sont des matrices de poids, 𝑏 est un vecteur de non séquentielles. De plus, il est intéressant de noter que les modal-
poids, 𝜎 désigne la fonction sigmoïde, ; désigne la concatenation ités du langage et de la prosodie sont les modalités qui obtiennent
et ∗ désigne l’opération de produit terme à terme. les meilleurs résultats quel que soit le classifieur utilisée.
Attention Slices dans les Entretiens d’Embauche Vidéo Différés WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France

Modalité Audio Texte Vidéo


attention slices détectées 62400 65056 45636
attention slices par question (moyenne) 3,20 2,61 2,23
attention slices par entretien (moyenne) 12,63 12,86 9,54
Q10% Moyenne Q90% Q10% Moyenne Q90% Q10% Moyenne Q90%
Durée des attention slices 0,5s 1,2s 2s 2 mots 5,8 mots 10 mots 0,5s 1,45s 2,5s
Table 3: Statistiques descriptive des attention slices détectées. Q10% et Q90% dénotent les quantiles à 10 et 90 %

Figure 2: Exemple d’une courbe d’attention et de moments


saillants détectés par HireNet.
Figure 3: Densité des attention slices en fonction de leur mo-
ment d’apparition au regard de la longueur totale de réponse.
4 ANALYSE DES ATTENTION SLICES Les courbes bleu, rouge et verte représentent respectivement
les modalités vidéo, audio et texte
4.1 Les courbes d’attention exposent-elles
réellement des pics distincts?
Comme les réseaux de neurones sont soumis à diverses sources de faciales. Concernant le texte, des extraits de moins d’une dizaine de
variabilité telles que l’initialisation des poids aléatoires, la descente mots sont extraits. De plus, moins d’attention slices sont détectées
du gradient stochastique ou l’utilisation des méthodes de dropout, pour la modalité vidéo que pour les modalités audio et textuelle.
nous avons choisi d’entraîner cinq instances du modèle, puis de cal- Ensuite, nous fournissons les courbes de densité pour les instants
culer la moyenne des valeurs d’attention. La moyenne des valeurs d’apparitions des attention slices au regard de la durée totale de
de ces courbes est ensuite utilisée pour le reste de l’étude. De cette la réponse 3. Les attention slices pour les modalités audio et vidéo
façon, nous visons à capturer le comportement plus général des mé- se produisent plus souvent au début et à la fin d’une réponse. De
canismes d’attention [19]. Pour le reste de l’article, nous définissons tels indices pourraient indiquer que les comportement non verbaux
une attention slice comme une tranche sélectionnée en fonction de survenant au début (prise de parole) et à la fin de la réponse ont un
la courbe d’attention. impact important sur la décision d’employabilité, comme dans les
Méthodologie : Extraction des attention slices par détection des interactions face-à-face [3, 13].
valeurs aberrantes de façon non supervisée. Les courbes d’attention
consistent principalement en des séries temporelles bruitées avec 4.2 Les signaux sociaux lors des attention slices
des pics de valeur élevée [33]. Un exemple typique de courbes
d’attention est affiché en la figure 2. La première étape de notre
sont-ils différents de ceux des tranches
méthodologie consiste à filtrer les moments où ces pics d’attentions aléatoires ?
augmentent (attention slices). Pour ce faire, nous utilisons l’algo- Méthode: Classification supervisée entre les attention slices et des
rithme DBSCAN [8], un algorithme de clustering par densité qui tranches aléatoires. Les pics d’attention peuvent fortement dépen-
nous permet de sélectionner les régions d’attention maximale, il- dre du contexte et de la mémoire des cellules GRU et très peu des
lustrées par les boîtes bleues sur la figure 2. descripteurs d’entrée au moment de leur apparition. Nous émet-
Résultats et statistiques descriptives sur les pics extraits. Le tableau tons l’hypothèse qu’un pic d’attention est dû à un changement de
3 fournit un résumé des données servant de base à notre étude comportement dans une réponse et donc dépend principalement
en termes de pics d’attention détectés et leurs statistiques descrip- du pas du temps traité. Pour nous assurer que les pics d’attention
tives. Tout d’abord, il est intéressant de noter que la durée des proviennent principalement de ce qui se passe dans les pas de temps
tranches importantes extraites par le mécanisme de l’attention concernés, nous construisons une tâche de classification binaire.
pour les modalités audio et vidéo sont principalement comprises Cette tâche consiste à distinguer les moments à fortes attentions
entre 0,5s et 2,5s, durée qui parait en adéquation avec la durée d’une d’ autres moments aléatoires en se basant sur les comportements
expression faciale ou d’une disfluence. À noter que les attention verbaux et non verbaux se produisant durant ceux-ci. Ainsi, pour
slices audio semblent être plus courtes que celles des expressions notre tâche, nous prenons comme étiquette positive les attention
WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France Léo Hemamou, Arthur Guillon, Jean-Claude Martin, and Chloé Clavel

Texte Audio Video


Modèle F1 positif F1 négatif AUC F1 positif F1 négatif AUC F1 positif F1 négatif AUC
Aléatoire 0,199 0,799 0,499 0,199 0,799 0,499 0,199 0,799 0,499
Vote majoritaire 0 0,888 0,5 0 0,888 0,5 0 0,888 0,5
Ridge 0,3535 0,6142 0,7203 0,7798 0,9456 0,9615 0,5589 0,9131 0,8738
XGBoost 0,1749 0,8887 0,7553 0,8297 0,9550 0,9725 0,6203 0,9177 0,9069
Table 4: Résultats de classification entre les attention slices et les tranches aléatoires

slices extraites dans chacune des réponses du candidat. Comme sémantique n’est utilisé et la représentation vectorielle utilisée n’est
étiquette négative, pour chacune des attention slices détectées, nous peut être pas assez riche comparée à celle par plongement de mot.
échantillons quatre moments dans la réponse du candidat avec la
même durée que l’ attention slice précédemment sélectionnée. Notre 4.3 Analyse de l’importance des descripteurs
objectif étant de comprendre si les attention slices sont différentes et discriminant les attention slices
en quoi elles diffèrent, nous avons décidé d’utiliser les classifieurs
standards Ridge et XGBoost [5], pour lesquels une méthodologie Une expérience sur l’importance des descripteurs a également été
d’analyse d’importance des descripteurs est bien établie. Comme réalisée afin de mettre en évidence les descripteurs qui contribuent
ces classifieurs prennent comme entrée un vecteur fixe, nous con- le plus lors de l’identification des attention slices. Ainsi, nous inspec-
struisons pour chacune des modalités un set de descripteurs inter- tons les coefficients du modèle Ridge et nous les classons en fonction
prétables. Pour les descripteurs audio et vidéos, nous intégrons de leur magnitude. En ce qui concerne l’importance pour le modèle
les descripteurs des fenêtres temporelles des moments choisis en de XGBoost, nous inspectons les descripteurs ayant contribué le
utilisant les fonctionnelles suivantes: moyenne, moyenne des gradi- plus à diminuer l’impureté à chaque embranchement. Le tableau 5
ents positifs et moyenne des gradients négatifs. Ces fonctionnelles présente, pour chacune des modalités, les dix descripteurs les plus
sont appliquées sur le même ensemble de descripteurs que celui discriminants pour les deux méthodes. Pour les expressions fa-
utilisé dans la sous-section 3.2 pour entraîner notre précédent mod- ciales, les deux principaux descripteurs du bas du visage mis en ex-
èle. L’unique différence réside dans l’application d’une étape de ergue par notre méthode sont respectivement l’activation de l’AU17
pré-traitement de Z-normalisation par rapport à la réponse com- (l’élévation du menton) et la non activation de l’AU26(l’ouverture
plète. Pour les descripteurs textuels, nous construisons un set de la mâchoire). Les mouvements liés au sourcil ont aussi été dé-
de descripteurs compréhensibles pouvant nous informer sur quels tectés comme discriminants notamment les moments où l’AU02
aspects, une attention slice dérive du contenu verbal. Pour cela, (Remontée de la partie externe des sourcils) est moins activée. Enfin
nous utilisons des méthodes à base de dictionnaires notamment, le les rotations de la tête et plus précisément le tangage (Rx), et le
LIWC qui classent des mots selon des catégories haut niveau (ie roulis (Rz) sont détectés comme des descripteurs importants. Pour
travail, accomplissement, etc), le dictionnaire FEEL qui catégorise les indices audios, deux grands groupes de descripteurs émer-
des mots dans l’une des 6 emotions de base définies par Ekman, gent notamment ceux associés à la prosodie et les descripteurs
le dictionnaire LEXIQUE3 qui fournit des informations quant à de la qualité de la voix et spectraux. Le premier groupe semble
la fréquence de l’utlisation des mots dans la langue francaise et indiquer que les silences sont souvent considérés comme des mo-
la nature grammaticale des mots utilisés obtenu grâce à l’outil ments importants(coefficient négatif pour loudness), tandis que le
TreeTagger. Ces dictionnaires ont déjà prouvé leur utilité précédem- deuxième groupe semble lié à la respiration et à la tension dans
ment dans différentes tâches liées à la prédiction de l’employabilité la voix (harmonic noise ratio, logrelf0.h1.a3). Pour les indices de
[15]. Pour cette expérience, nous conservons les mêmes ensembles langage, aucun descripteur n’a une valeur 𝑑 de cohen supérieure
d’entraînement, de développement et de tests que dans la section à 0.5. Cependant, il existe un faible effet pour la singularité lex-
3.1 pour éviter toute fuite de données. icale (utilisation de mots plus ou moins fréquent dans la langue
Résultats et analyses. Comme indiqué dans le tableau 4, les per- francaise), les pronoms et pronoms personnels.
formances des classifieurs choisis présentent debons résultats pour
les modalités audio et vidéo, ce qui prouve que, malgré l’influence 4.4 Les attention slices portent-elles plus
de la modélisation de séquence et de l’utilisation des informations d’informations par rapport à la tache de
de contexte, l’importance d’un moment est encore principalement prédiction d’employabilité que des tranches
définie par les événements qui s’y produisent. Cela montre que aléatoires?
les moments précis où se produisent des pics d’attention se dis-
Méthode : Classification supervisée concernant l’employabilité grâce
tinguent des autres moments de la même réponse. Concernant la
aux tranches fines aléatoires ou aux attention slices. Nous avons établi
modalité textuelle, les résultats sont plus mitigés. L’AUC ne dépasse
que notre modèle pouvait mettre en exergue un certain nombre
pas le score de 0.75 et, bien que le résultat soit meilleur que les
de moments dans la réponse du candidat et avons constaté que les
modèles aléatoires et vote majoritaire, nous pouvons émettre des
attention slices étaient différentes des autres tranches de la réponse.
réserves quant à la possibilité de détecter les moments importants
Nous étudions maintenant leur utilité pour la tâche de prédiction
en utilisant notre set de descripteurs. En effet, aucun descripteur
de l’employabilité, en vérifiant que les moments contenus dans ces
attention slices ont un contenu prédictif supérieur par rapport à des
Attention Slices dans les Entretiens d’Embauche Vidéo Différés WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France

Groupe Ridge XGBoost


Coefficients positifs Coefficients négatifs
Bas du visage AU173 , AU149 AU102 , AU267 , AU208 , AU2810 , AU176 ,AU267 ,AU108 ,AU2510
Haut du visage AU025 AU044 AU021 ,AU049
Position et rotation de la R_z1 , R_x6 , R_x3 , R_z4
tête
Confidence d’OpenFace ↑success2 , success5
Descripteurs cepstraux mfcc22 , mfcc38 mfcc25 ,↑mfcc210
Descripteurs spectraux f1bandwidth9 spectralflux1 , f1amplitude7 , f1amplitude2 , spectralflux4 , f3amplitude7 ,
f3frequency10 ↑spectralflux8 , f1bandwidth9
Descripteurs de la prosodie loudness5 loudness6
Descripteurs de la qualité h1.a34 , slope500.15005 , h1.h26 hnr3 hnr1 , slope500.15003
de la voix
LIWC je2 , verbeprésent5 , verbefutur10
LEXIQUE3 freqlemfilms_sd2 , freqlemfilms_mean1 , freqlemfilms_max3 , nbsyll_max4 , freqlemfilms_q256 ,
freqlemlivres_mean3 , freqlemlivres_sd4 , nbhomoph_max9
freqlemlivres_max10 freqlemfilms_max8
Nature Grammaticale aux5 , verb6 , pron7 , det9 pron1 , aux7 , sconj8
Table 5: Analyse de l’importance des descripteurs

𝐹 𝑖 indique que le descripteur 𝐹 est classé en 𝑖𝑒𝑚𝑒 position. ↑ et ↓ représentent respectivement la moyenne des gradients positifs et négatifs. Les descripteurs
en gras F ont une taille d’effet au minimum "moyenne" basée sur un test d de cohen 𝑑 > 0.5

Texte Audio Video


Tranche aléatoire attention slice Tranche aléatoire attention slice Tranche aléatoire attention slice
Ridge 0,5259 ± 0,0171 0,5296 ± 0,0190 0,5092 ± 0,0246 0,5445 ± 0,0158 0,5149 ± 0,0182 0,5163 ± 0,0308
XGBoost 0,5179 ± 0,0199 0,5245 ± 0,0233 0,5142 ± 0,0227 0,5650 ± 0,0235 0,5151 ± 0,0192 0,5185 ± 0,0220
Table 6: Résultat de la tâche de classification de l’employabilité à partir des attention slices ou de tranches aléatoires

tranches aléatoires. En utilisant les mêmes descripteurs que dans de différence significative de performances. Nous concluons que
la sous-section 4.2, nous construisons une tâche de classification les attention slices contiennent effectivement plus d’information
basée sur une fenêtre temporelle minimale dans la réponse du can- permettant de prédire l’employabilité du candidat pour la modalité
didat. Pour ce faire, nous constituons deux sous-ensembles du jeu audio.
de données précédent : la première ne contient que les attention
slices ; la seconde est composée des tranches aléatoires sélection- 5 CONCLUSION
nées en section 4.2. Pour chacun des sous-ensembles du jeu de Dans cet article, nous étudions la possibilité d’utilisation d’un
données, nous effectuons la procédure de bootstrapping suivante : modèle d’apprentissage profond HireNet pour la prédiction de
nous formons 100 nouvelles instances d’ensemble d’apprentissage, l’employabilité de candidats dans le cadre d’entretiens d’embauche
chacune étant un échantillonage composé d’une seule attention slice vidéo différés. Nous utilisons séparément trois modalités (langage,
ou tranche aléatoire par candidat respectivement pour le premier et prosodie et expressions faciales) et nous comparons ce modèle à des
le deuxième sous-ensemble. Nous entraînons les classifieurs Ridge approches de la littérature sur un nouveau jeu de données réelles.
et XGBoost sur ces jeu de données et les testons sur deux sous- Nos expériences montrent que HireNet obtient des résultats signi-
ensembles d’une seule attention slice ou tranche aléatoire par candi- ficativement meilleurs que les autres approches. Cependant, un tel
dat respectivement pour le premier et le deuxième sous-ensemble. modèle troque ce gain de performances contre une opacité plus im-
Ainsi, nous obtenons un ensemble de scores d’AUC permettant de portante. Pour pallier cette opacité, nous proposons de nous appuyer
calculer l’intervalle de confiance des moyennes de nos résultats sur le mécanisme d’attention intrinsèque au modèle pour expliquer
pour avoir une idée de leur significativité statistique. A noter, que les prédictions. Pour ce faire, nous extrayons les tranches contenant
nous respectons toujours les mêmes divisions d’entraînement, de des pics d’attention, qui correspondent aux périodes de l’entretien
développement et de tests que dans la section 3.1 pour éviter toute jugées les plus significatives par le modèle. Nous montrons d’abord
fuite de données. que ces tranches apparaissent le plus souvent au début et à la fin
Résultats et discussions. Les résultats sont rapportés dans le ta- des réponses pour les modalités audio et vidéo. D’autre part, nous
bleau 6. Nous observons une moyenne d’AUC significativement avons qualifié ces moments en termes de comportements verbaux
plus élevée (p-values < 0.01) pour les attention slices que pour les et non verbaux grâce à une étude d’importance des descripteurs.
tranches aléatoires concernant la modalité audio, et ce pour les deux Nous montrons enfin que les tranches correspondant à la modalité
classifieurs. En revanche, les modalités texte et vidéo ne montre pas audio conservent une faible valeur prédictive en dépit de leur courte
WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France Léo Hemamou, Arthur Guillon, Jean-Claude Martin, and Chloé Clavel

durée. Nous n’observons pas ce résultat pour les deux autres modal- Analysis of Asynchronous Video Job Interviews. In AAAI.
ités, ce qui pourrait être dû à une information insuffisante dans [15] Léo Hemamou, Grégory Wajntrob, Jean-claude Martin, and Chloé Clavel. 2018.
Entretien vidéo différé : modèle prédictif pour pré-sélection de candidats sur la
une unique tranche. Les valeurs d’attention mettent en évidence base du contenu verbal. In Workshop sur les “Affects, Compagnons Artificiels et
l’importance des moments, mais n’incluent pas d’informations sur Interactions” (ACAI). 1–8.
[16] Mohammed Ehsan Hoque, Matthieu Courgeon, Jean-Claude Martin, Bilge Mutlu,
s’ils ont un impact positif ou négatif sur les décisions des recruteurs, and Rosalind W. Picard. 2013. MACH. In Proceedings of the 2013 ACM international
ce qui pourra faire l’objet de travaux futurs. De plus, comme notre joint conference on Pervasive and ubiquitous computing - UbiComp ’13. ACM Press,
approche est basée sur un modèle appris (HireNet), une direction New York, New York, USA, 697. [Link]
[17] Allen I Huffcutt, James M Conway, Philip L Roth, and Nancy J Stone. 2001.
de recherche consiste à l’améliorer en termes de performances et Identification and meta-analytic assessment of psychological constructs measured
de contrôle des possibles biais. Enfin, nous prévoyons de mener in employment interviews. Journal of Applied Psychology 86, 5 (2001), 897–913.
une tâche d’annotation et une étude utilisateur afin de: i) quanti- [Link]
[18] Sarthak Jain and Byron C. Wallace. 2019. Attention is not Explanation. In North
fier la transparence et l’utilité perçues d’HireNet et des attention American Chapter of the Association for Computational Linguistics. [Link]
slices extraites ; ii) créer une plateforme automatique capable de org/abs/1902.10186
[19] Saumya Jetley, Nicholas A Lord, Namhoon Lee, and Philip H S Torr. 2018. Learn
fournir des commentaires utiles aux candidats pour l’entraînement To Pay Attention. In International Conference on Learning Representations. 1–14.
à l’entretien d’embauche. [Link]
[20] Xuan Liu, Xiaoguang Wang, and Stan Matwin. 2019. Improving the interpretabil-
ity of deep neural networks with knowledge distillation. IEEE International
6 REMERCIEMENTS Conference on Data Mining Workshops, ICDMW 2018-Novem (2019), 905–912.
[Link]
Ce travail a été supporté par la société EASYRECRUE, nous tenions [21] Louis Martin, Benjamin Muller, Pedro Javier Ortiz Suárez, Yoann Dupont, Laurent
à remercier Florian Chaux et Amandine Reitz pour leur soutien. Romary, Éric Villemonte de la Clergerie, Djamé Seddah, and Benoît Sagot. 2019.
CamemBERT: a Tasty French Language Model. 2 (2019). [Link]
1911.03894
REFERENCES [22] Skanda Muralidhar, Laurent Nguyen, and Daniel Gatica-Perez. 2019. Words
[1] Tadas Baltrusaitis, Amir Zadeh, Yao Chong Lim, and Louis Philippe Morency. Worth: Verbal Content and Hirability Impressions in YouTube Video Resumes.
2018. OpenFace 2.0: Facial behavior analysis toolkit. Proceedings - 13th IEEE (2019), 322–327. [Link]
International Conference on Automatic Face and Gesture Recognition, FG 2018 [23] Nora A. Murphy, Judith A. Hall, Marianne Schmid Mast, Mollie A. Ruben, Denise
(2018), 59–66. [Link] Frauendorfer, Danielle Blanch-Hartigan, Debra L. Roter, and Laurent Nguyen.
[2] Dana R. Carney, C. Randall Colvin, and Judith A. Hall. 2007. A thin slice perspec- 2015. Reliability and Validity of Nonverbal Thin Slices in Social Interactions.
tive on the accuracy of first impressions. Journal of Research in Personality 41, 5 Personality and Social Psychology Bulletin 41, 2 (2 2015), 199–213. [Link]
(10 2007), 1054–1072. [Link] org/10.1177/0146167214559902
[3] Justine Cassell, Yukiko I Nakano, Timothy W Bickmore, Candace L Sidner, and [24] Iftekhar Naim, Md. Iftekhar Tanveer, Daniel Gildea, and Mohammed Ehsan
Charles Rich. 2001. Non-verbal cues for discourse structure. In Proceedings Hoque. 2018. Automated Analysis and Prediction of Job Interview Performance.
of the 39th Annual Meeting on Association for Computational Linguistics - ACL IEEE Transactions on Affective Computing 9, 2 (4 2018), 191–204. [Link]
’01. Association for Computational Linguistics, Morristown, NJ, USA, 114–123. 10.1109/TAFFC.2016.2614299
[Link] [25] Laurent Son Nguyen and Daniel Gatica-Perez. 2015. I Would Hire You in a
[4] Lei Chen, Ru Zhao, Chee Wee Leong, Blair Lehman, Gary Feng, and Mo- Minute. In Proceedings of the 2015 ACM on International Conference on Multimodal
hammed Ehsan Hoque. 2017. Automated video interview judgment on a large- Interaction - ICMI ’15. ACM Press, New York, New York, USA, 51–58. https:
sized corpus collected online. In 2017 Seventh International Conference on Affective //[Link]/10.1145/2818346.2820760
Computing and Intelligent Interaction (ACII). IEEE, 504–509. [26] Pooja Rao S. B, Sowmya Rasipuram, Rahul Das, and Dinesh Babu Jayagopi. 2017.
[5] Tianqi Chen and Carlos Guestrin. 2016. XGBoost: A scalable tree boosting system. Automatic assessment of communication skill in non-conventional interview
Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery settings: a comparative study. In Proceedings of the 19th ACM International Con-
and Data Mining 13-17-Augu (2016), 785–794. [Link] ference on Multimodal Interaction - ICMI 2017. ACM Press, New York, New York,
2939785 USA, 221–229. [Link]
[6] Mathieu Chollet and Stefan Scherer. 2017. Assessing Public Speaking Ability [27] Sowmya Rasipuram and Dinesh Babu Jayagopi. 2018. Automatic assessment
from Thin Slices of Behavior. Proceedings - 12th IEEE International Conference on of communication skill in interview-based interactions. Multimedia Tools and
Automatic Face and Gesture Recognition, FG 2017 - 1st International Workshop on Applications 77, 14 (2018), 18709–18739. [Link]
Adaptive Shot Learning for Gesture Understanding and Production, ASL4GUP 2017, 5654-9
Biometrics in the Wild, Bwild 2017, Heteroge (2017), 310–316. [28] Marco Ribeiro, Sameer Singh, and Carlos Guestrin. 2016. “Why Should I Trust
[7] Timothy Degroot and Janaki Gooty. 2009. Can nonverbal cues be used to make You?”: Explaining the Predictions of Any Classifier. In Proceedings of the 2016
meaningful personality attributions in employment interviews? Journal of Busi- Conference of the North American Chapter of the Association for Computational Lin-
ness and Psychology 24, 2 (2009), 179–192. guistics: Demonstrations. Association for Computational Linguistics, Stroudsburg,
[8] Martin Ester, Hans-peter Kriegel, Xiaowei Xu, and D Miinchen. 1996. A Density- PA, USA, 97–101. [Link]
Based Algorithm for Discovering Clusters in Large Spatial Databases with Noise. [29] Neal Schmitt (Ed.). 2012. The Oxford Handbook of Personnel Assessment and Selec-
(1996). tion. Oxford University Press. [Link]
[9] Florian Eyben, Klaus R. Scherer, Bjorn W. Schuller, Johan Sundberg, Elisabeth 001.0001
Andre, Carlos Busso, Laurence Y. Devillers, Julien Epps, Petri Laukka, Shrikanth S. [30] Leann Schneider, Deborah M. Powell, and Nicolas Roulin. 2015. Cues to deception
Narayanan, and Khiet P. Truong. 2016. The Geneva Minimalistic Acoustic Parame- in the employment interview. International Journal of Selection and Assessment
ter Set (GeMAPS) for Voice Research and Affective Computing. IEEE Transactions 23, 2 (2015), 182–190. [Link]
on Affective Computing 7, 2 (2016), 190–202. [31] George Trigeorgis, Fabien Ringeval, Raymond Brueckner, Erik Marchi, Mihalis A.
[10] Florian Eyben, Felix Weninger, Florian Gross, and Björn Schuller. 2013. Recent Nicolaou, Bjorn Schuller, and Stefanos Zafeiriou. 2016. Adieu features? End-to-
developments in openSMILE, the munich open-source multimedia feature ex- end speech emotion recognition using a deep convolutional recurrent network.
tractor. Proceedings of the 21st ACM international conference on Multimedia - MM ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing -
’13 May (2013), 835–838. [Link] Proceedings 2016-May (2016), 5200–5204. [Link]
[11] Amanda R. Feiler and Deborah M. Powell. 2016. Behavioral Expression of Job 7472669
Interview Anxiety. Journal of Business and Psychology 31, 1 (2016), 155–171. [32] Fan Yang, Mengnan Du, and Xia Hu. 2019. Evaluating Explanation Without
[Link] Ground Truth in Interpretable Machine Learning. (2019). [Link]
[12] Ray J. Forbes and Paul R. Jackson. 1980. Non-verbal behaviour and the outcome 1907.06831
of selection interviews. Journal of Occupational Psychology 53, 1 (1980), 65–72. [33] Hongliang Yu, Liangke Gui, Michael Madaio, Amy Ogan, Justine Cassell, and
[Link] Louis-Philippe Morency. 2017. Temporally Selective Attention Model for Social
[13] Wells Goodrich. 1979. Face-to-Face Interaction: Research, Methods, and Theory. and Affective State Recognition in Multimedia Content. Proceedings of the 2017
Family Process 18, 3 (9 1979), 355–356. ACM on Multimedia Conference (2017), 1743–1751.
[14] Leo Hemamou, Ghazi Felhi, Vincent Vandenbussche, Jean-claude Martin, and
Chloe Clavel. 2019. HireNet : a Hierarchical Attention Model for the Automatic

Vous aimerez peut-être aussi