Article
Article
Différés
Léo Hemamou, Arthur Guillon, Jean-Claude Martin, Chloé Clavel
HAL Authorization
Attention Slices dans les Entretiens d’Embauche Vidéo Différés
Léo Hemamou∗† Arthur Guillon
EASYRECRUE EASYRECRUE
Paris, France Paris, France
[Link]@[Link] [Link]@[Link]
mises en évidence par le modèle d’attention contiennent des in- 2.2 Analyse automatique des entretiens
formations utiles aux recruteurs. Tout d’abord en section 2, nous d’embauche
présentons un état de l’art des méthodes d’analyse automatique
Les avancées récentes réduisent considérablement le temps passé
d’entretien d’embauche. La section 3 décrit le nouveau jeu de don-
à annoter manuellement les signaux comportementaux. Des out-
nées collectées et rappelle le modèle d’apprentissage profond que
ils sont désormais disponibles pour détecter automatiquement les
nous utilisons, HireNet, puis le compare à des modèles de l’état de
signaux vocaux [9] ou visuels [1]. Des études récentes utilisent
l’art. Enfin la section 4 propose une étude approfondie des courbes
le traitement du signal social et l’apprentissage automatique pour
d’attention produites par HireNet.
comprendre les liens entre les indices non verbaux et l’embauche.
Ces études ont été appliquées à différentes déclinaisons de l’ entre-
tien d’embauche : en entretiens en face à face [24, 25], en entretiens
2 ÉTAT DE L’ART vidéo asynchrones [4] ou entretiens par chat vidéo [26].
2.1 L’influence des comportements verbaux et Parmi les dimensions étudiées dans les entretiens d’embauche
non verbaux dans le contexte du (compétences communicationnelles [26], personnalité [4], etc.), la
recrutement performance en entretien reste la plus étudiée. La méthodologie
la plus usitée est l’extraction de descripteurs selon chacune des
Comportement non verbaux dans les entretiens. Les comportements
modalités, l’obtention d’un vecteur fixe par application de fonction-
non verbaux tels que les indices visuels et audio ont été étudiés par
nelles (moyenne, écart type, minimum ou maximum des valeurs
plusieurs auteurs dans le contexte du recrutement, notamment, en
des descripteurs au cours d’une réponse) puis l’entraînement d’un
lien avec la prédiction de l’anxiété [11], des performances lors
modèle d’apprentissage automatique. Cependant, cette méthode
de l’entretien [12], de la personnalité des candidats [7] ou des
présente des lacunes, notamment l’absence de la modélisation du
tentatives de tromperie [30]. De nombreuses caractéristiques vi-
caractère séquentiel de l’entretien et son aspect hiérarchique : un
suelles ont ainsi été étudiées, telles que l’attractivité du candidat, la
entretien d’embauche est une séquence de questions/réponses dont
gestuelle des mains, le sourire, le contact visuel, le hochement ou
chacune des réponses est elle-même une séquence de mots ou de
le mouvement de la tête, l’orientation du corps ou les expressions
fenêtres. Pour répondre à ce manque, nous avons proposé un mod-
faciales [11, 30]. Des travaux comparables ont été menés pour la
èle d’apprentissage profond [14] ayant démontré des meilleurs
voix, en particulier concernant l’impact de l’amplitude et du ton de
résultats sur la tâche de classification d’employabilité. Cependant,
la voix, les silences ou les dysfluences verbables [24, 27].
cette méthode étant basée sur l’apprentissage profond, le système
Contenu verbal dans les entretiens. En comparaison avec ces
d’apprentissage est bien plus opaque qu’un système basé sur l’ap-
travaux, peu d’études se sont focalisées sur l’influence du con-
prentissage automatique et des descripteurs construits à la main. Il
tenu verbal [22]. Celui-ci est pourtant central dans l’évaluation
est donc nécessaire d’effectuer une analyse approfondie du système
de la performance du candidat, puisqu’il est la modalité utilisée
afin de comprendre comment celui-ci fonctionne et nous informer
par le candidat pour répondre. En tant que tel, le contenu verbal
sur des possibles comportements intéressants à étudier dans le
constitue une grande source d’informations pour la plupart des
contexte du recrutement.
dimensions évaluées lors d’un entretien d’embauche telles que les
connaissances déclaratives liées au poste, les compétences sociales,
communicationnelles ou interpersonnelles [17]. 2.3 Réseaux de neurones et interprétabilité
L’annotation de chaque comportement du candidat, qu’il soit Les réseaux de neurones sont capables de modéliser une représen-
verbal ou non verbal, est coûteuse en temps. Une approche courante tation intermédiaire intégrant une information haut niveau directe-
pour alléger la tâche d’annotation consiste à annoter uniquement ment à partir des données signal [31]. Cependant, la liberté dont
une partie de l’entretien d’embauche. En fait, il a été démontré ils disposent pour construire cette représentation intermédiaire se
que, en utilisant seulement une petite quantité d’informations, les fait au prix d’une extrême opacité qui freine leur adoption pour
gens peuvent déduire correctement les caractéristiques, traits ou des applications critiques telles que dans le milieu de la santé, de
états personnels d’un individu [2, 23]. Cette approche est appelée la justice ou des ressources humaines. Pour ces raisons, de nom-
analyse en tranches fines (thin slices) et a déjà été utilisée dans breux travaux proposent des méthodes pour mieux expliquer ces
l’étude des interactions sociales [23], les premières impressions [2], réseaux. La notion de transparence et d’interprétabilité reste encore
la prise de parole en public [6] ou les entretiens d’embauche [25]. floue, notamment dans le cas où la vérité terrain n’est pas con-
Un autre avantage de cette méthode est qu’elle met en évidence nue [32]. [32] propose une catégorisation à deux dimensions pour
un comportement bref et non verbal par rapport aux impressions l’interprétabilité selon la dimension de l’interprétation (explique-t-
perçues. Néanmoins, la durée et la stratégie d’échantillonnage des on le modèle dans son ensemble, ou la prédiction sur une instance
tranches fines restent une question ouverte. Les études précédentes ?) et la méthode d’interprétation (intrinsèque au modèle, ou par une
se concentrent sur l’échantillonnage de tranches fines au hasard [6], méthode post-construction du modèle ?). Plusieurs méthodes ont
en utilisant la structure de l’entretien d’embauche (tranches basées ainsi été proposées comme la visualisation des états cachés, les ap-
sur des questions et réponses) [25], ou au début et à la fin des inter- proches par compression de modèle [20], l’utilisation de classifieurs
actions [7]. Des méthodes automatiques basées sur le traitement locaux [28]. Parmi ces méthodes, les mécanismes d’attention ont
du signal social pourraient laisser la place à une meilleure sélection récemment gagné en popularité pour améliorer les performances
des tranches fines et de leur durée, en sélectionnant des régions qui et l’interprétabilité [14, 33]. Cependant, la plupart des études ex-
véhiculent plus d’informations. istantes se contentent de valider la pertinence des mécanismes
Attention Slices dans les Entretiens d’Embauche Vidéo Différés WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France
d’attention en exhibant des exemples et ne conduisent pas d’analyse Jeu de données Train Val Test
approfondie [33]. De plus, la validité des courbes d’attention comme Nombre de candidats 3581 784 783
explication a récemment été remise en question [18]. Il est donc Nombre moyen de questions 5,43 5,46 5,41
nécessaire d’investiguer l’utilité du mécanisme d’attention comme Nombre de postes 455 225 219
outil pour la transparence. Proportion des
55 % 55 % 54 %
étiquettes Employable
3 JEUX DE DONNÉES ET MODÈLE Table 1: Nombre de candidats et statistiques à propos de cha-
cun des jeux de données.
Nous comparons tout d’abord les performances d’un modèle d’ap-
prentissage profond précédemment proposé [14] aux approches
plus classiques construites avec des descripteurs construits à la
main comme celles proposées par [25, 27]. Dans cette section, nous
décrivons le nouveau jeu de données constitué, les descripteurs
utilisés et le choix du modèle d’apprentisage profond (HireNet)
ainsi que les légères modifications effectuées à celui-ci. traduit uniquement le souhait du recruteur d’inviter le candidat
en entretien face-à-face. Si plusieurs annotateurs ont annoté le
3.1 Jeu de données même candidat, nous procédons à un vote majoritaire. Nous avons
Dans un souci de comparaison avec [14], nous avons décidé de sélec- divisé l’ensemble de données en un ensemble d’apprentissage, un
tionner un type d’emploi spécifique : les postes de vente. Après ensemble de validation pour la sélection d’hyperparamètres et un
filtrage basé sur des titres de poste spécifiques de la base de don- ensemble de test pour l’évaluation finale de chaque modèle. Chaque
nées ROME 1 , une liste des postes a été sélectionnée et vérifiée par ensemble constitue respectivement 70 %, 15 % et 15 % de l’ensemble
les auteurs et un expert des Ressources Humaines (RH). Enfin, en de données complet.
collaboration avec un acteur du secteur RH, nous avons obtenu
un ensemble de données d’entretiens vidéo français comprenant 3.2 Descripteurs utilisés
plus de 627 postes. La retranscription automatique de la parole est
Nous avons trois sources d’information : les vidéos réponses dont
obtenue grâce à l’API Google speech-to-text2 . Il est important de
nous extrayons les descripteurs textuels, prosodiques et faciaux,
noter que les vidéos sont très différentes de ce qui pourrait être
les titres des questions et le titre du poste. Pour chaque modalité
produit dans une configuration de laboratoire. Les vidéos peuvent
d’une réponse vidéo, nous avons sélectionné des descripteurs de bas
être enregistrées à partir d’une webcam, d’un smartphone ou d’une
niveau. Contenu verbal : Nous avons choisi d’utiliser des plonge-
tablette, ce qui signifie que les environnements bruyants et les
ments de mots contextualisés comme représentation du contenu ver-
équipements de mauvaise qualité sont au rendez-vous. En raison de
bal. De nombreuses tâches ont été améliorées en utilisant ces plonge-
ces conditions réelles, l’extraction de fonctionnalités peut échouer
ments de mots contextualisés notamment des taches d’inférence
pour une modalité pendant toute la réponse d’un candidat. Un ex-
du langage naturel [21]. En tant que représentation pour les mots
emple est la détection des unités d’action lorsque l’image a des
contextualisés, nous avons choisis d’utiliser une représentation pro-
problèmes d’éclairage. En ce sens, nous supprimons les vidéos si
duite par le modèle français pré-entraîné “CamemBERT” [21]. Nous
1) la confiance retournée par la reconnaissance automatique de la
obtenons ainsi comme représentation pour chacun des mots un
parole est inférieure à 85 %, 2) OpenFace n’a pas réussi à détecter
vecteur de dimension 768. Expression faciale : Nous extrayons
un visage dans plus de 20 % du total des fenêtres. Enfin, nous ne
des descripteurs visuels pour chacune des fenêtres grâce à l’outil
gardons que les candidats avec au moins une réponse pour laque-
OpenFace [1], un logiciel d’analyse comportementale visuelle à
lle le pipeline d’extraction des descripteurs a réussi pour les trois
la pointe de la technologie. Nous avons choisi d’extraire la posi-
modalités. Certaines statistiques sur l’ensemble de données sont
tion et la rotation de la tête, l’intensité et la présence des unités
disponibles dans le tableau 1. Bien que les candidats aient accepté
d’actions et la direction du regard. Comme de nombreuses vidéos
l’utilisation de leurs entretiens, l’ensemble de données ne sera pas
ont des fréquences d’échantillonnage différentes, nous avons dé-
rendu public en dehors du champ de cette étude car les vidéos
cidé de lisser les valeurs avec une fenêtre temporelle de 0,5s et
sont des données personnelles soumises à de fortes contraintes de
un chevauchement de 0,25s. indices prosodiques : nos descrip-
confidentialité.
teurs prosodiques au niveau de la fenêtre sont extraits à l’aide de
Étiquetage des données et mesures d’évaluation. Les recruteurs re- l’outil OpenSmile [10]. La configuration que nous utilisons est la
gardent les vidéos des candidats et peuvent “liker” ou “disliker” les même que celle utilisée pour obtenir les descripteurs eGeMAPS
candidats, les présélectionner, les évaluer sur des critères prédéfinis [9]. GeMAPS est un célèbre ensemble minimaliste de descripteurs
ou écrire des commentaires. Pour simplifier la tâche, nous avons sélectionnées pour leur importance dans l’informatique sociale, et
mis en place une classification binaire : les candidats présélection- eGeMAPS en est sa version étendue. Nous extrayons les descrip-
nés, ayant reçu une opinion positive ou une note élevée sont con- teurs pour chaque fenêtre de 0,01s. Nous lissons ensuite ,de la même
sidérés comme Employable, les autres candidats sont considérés manière que pour la modalité vidéo, ces descripteurs prosodiques.
comme Non employable. À noter ici que l’étiquette Employable Questions et titre du poste: Nous utilisons la représentation au
1 [Link] niveau de la phrase du même modèle BERT préalablement util-
emplois-rome/ isé pour représenter l’intitulé des questions et du titre de poste
2 [Link] résultant en un vecteur de dimension 768.
WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France Léo Hemamou, Arthur Guillon, Jean-Claude Martin, and Chloé Clavel
slices extraites dans chacune des réponses du candidat. Comme sémantique n’est utilisé et la représentation vectorielle utilisée n’est
étiquette négative, pour chacune des attention slices détectées, nous peut être pas assez riche comparée à celle par plongement de mot.
échantillons quatre moments dans la réponse du candidat avec la
même durée que l’ attention slice précédemment sélectionnée. Notre 4.3 Analyse de l’importance des descripteurs
objectif étant de comprendre si les attention slices sont différentes et discriminant les attention slices
en quoi elles diffèrent, nous avons décidé d’utiliser les classifieurs
standards Ridge et XGBoost [5], pour lesquels une méthodologie Une expérience sur l’importance des descripteurs a également été
d’analyse d’importance des descripteurs est bien établie. Comme réalisée afin de mettre en évidence les descripteurs qui contribuent
ces classifieurs prennent comme entrée un vecteur fixe, nous con- le plus lors de l’identification des attention slices. Ainsi, nous inspec-
struisons pour chacune des modalités un set de descripteurs inter- tons les coefficients du modèle Ridge et nous les classons en fonction
prétables. Pour les descripteurs audio et vidéos, nous intégrons de leur magnitude. En ce qui concerne l’importance pour le modèle
les descripteurs des fenêtres temporelles des moments choisis en de XGBoost, nous inspectons les descripteurs ayant contribué le
utilisant les fonctionnelles suivantes: moyenne, moyenne des gradi- plus à diminuer l’impureté à chaque embranchement. Le tableau 5
ents positifs et moyenne des gradients négatifs. Ces fonctionnelles présente, pour chacune des modalités, les dix descripteurs les plus
sont appliquées sur le même ensemble de descripteurs que celui discriminants pour les deux méthodes. Pour les expressions fa-
utilisé dans la sous-section 3.2 pour entraîner notre précédent mod- ciales, les deux principaux descripteurs du bas du visage mis en ex-
èle. L’unique différence réside dans l’application d’une étape de ergue par notre méthode sont respectivement l’activation de l’AU17
pré-traitement de Z-normalisation par rapport à la réponse com- (l’élévation du menton) et la non activation de l’AU26(l’ouverture
plète. Pour les descripteurs textuels, nous construisons un set de la mâchoire). Les mouvements liés au sourcil ont aussi été dé-
de descripteurs compréhensibles pouvant nous informer sur quels tectés comme discriminants notamment les moments où l’AU02
aspects, une attention slice dérive du contenu verbal. Pour cela, (Remontée de la partie externe des sourcils) est moins activée. Enfin
nous utilisons des méthodes à base de dictionnaires notamment, le les rotations de la tête et plus précisément le tangage (Rx), et le
LIWC qui classent des mots selon des catégories haut niveau (ie roulis (Rz) sont détectés comme des descripteurs importants. Pour
travail, accomplissement, etc), le dictionnaire FEEL qui catégorise les indices audios, deux grands groupes de descripteurs émer-
des mots dans l’une des 6 emotions de base définies par Ekman, gent notamment ceux associés à la prosodie et les descripteurs
le dictionnaire LEXIQUE3 qui fournit des informations quant à de la qualité de la voix et spectraux. Le premier groupe semble
la fréquence de l’utlisation des mots dans la langue francaise et indiquer que les silences sont souvent considérés comme des mo-
la nature grammaticale des mots utilisés obtenu grâce à l’outil ments importants(coefficient négatif pour loudness), tandis que le
TreeTagger. Ces dictionnaires ont déjà prouvé leur utilité précédem- deuxième groupe semble lié à la respiration et à la tension dans
ment dans différentes tâches liées à la prédiction de l’employabilité la voix (harmonic noise ratio, logrelf0.h1.a3). Pour les indices de
[15]. Pour cette expérience, nous conservons les mêmes ensembles langage, aucun descripteur n’a une valeur 𝑑 de cohen supérieure
d’entraînement, de développement et de tests que dans la section à 0.5. Cependant, il existe un faible effet pour la singularité lex-
3.1 pour éviter toute fuite de données. icale (utilisation de mots plus ou moins fréquent dans la langue
Résultats et analyses. Comme indiqué dans le tableau 4, les per- francaise), les pronoms et pronoms personnels.
formances des classifieurs choisis présentent debons résultats pour
les modalités audio et vidéo, ce qui prouve que, malgré l’influence 4.4 Les attention slices portent-elles plus
de la modélisation de séquence et de l’utilisation des informations d’informations par rapport à la tache de
de contexte, l’importance d’un moment est encore principalement prédiction d’employabilité que des tranches
définie par les événements qui s’y produisent. Cela montre que aléatoires?
les moments précis où se produisent des pics d’attention se dis-
Méthode : Classification supervisée concernant l’employabilité grâce
tinguent des autres moments de la même réponse. Concernant la
aux tranches fines aléatoires ou aux attention slices. Nous avons établi
modalité textuelle, les résultats sont plus mitigés. L’AUC ne dépasse
que notre modèle pouvait mettre en exergue un certain nombre
pas le score de 0.75 et, bien que le résultat soit meilleur que les
de moments dans la réponse du candidat et avons constaté que les
modèles aléatoires et vote majoritaire, nous pouvons émettre des
attention slices étaient différentes des autres tranches de la réponse.
réserves quant à la possibilité de détecter les moments importants
Nous étudions maintenant leur utilité pour la tâche de prédiction
en utilisant notre set de descripteurs. En effet, aucun descripteur
de l’employabilité, en vérifiant que les moments contenus dans ces
attention slices ont un contenu prédictif supérieur par rapport à des
Attention Slices dans les Entretiens d’Embauche Vidéo Différés WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France
𝐹 𝑖 indique que le descripteur 𝐹 est classé en 𝑖𝑒𝑚𝑒 position. ↑ et ↓ représentent respectivement la moyenne des gradients positifs et négatifs. Les descripteurs
en gras F ont une taille d’effet au minimum "moyenne" basée sur un test d de cohen 𝑑 > 0.5
tranches aléatoires. En utilisant les mêmes descripteurs que dans de différence significative de performances. Nous concluons que
la sous-section 4.2, nous construisons une tâche de classification les attention slices contiennent effectivement plus d’information
basée sur une fenêtre temporelle minimale dans la réponse du can- permettant de prédire l’employabilité du candidat pour la modalité
didat. Pour ce faire, nous constituons deux sous-ensembles du jeu audio.
de données précédent : la première ne contient que les attention
slices ; la seconde est composée des tranches aléatoires sélection- 5 CONCLUSION
nées en section 4.2. Pour chacun des sous-ensembles du jeu de Dans cet article, nous étudions la possibilité d’utilisation d’un
données, nous effectuons la procédure de bootstrapping suivante : modèle d’apprentissage profond HireNet pour la prédiction de
nous formons 100 nouvelles instances d’ensemble d’apprentissage, l’employabilité de candidats dans le cadre d’entretiens d’embauche
chacune étant un échantillonage composé d’une seule attention slice vidéo différés. Nous utilisons séparément trois modalités (langage,
ou tranche aléatoire par candidat respectivement pour le premier et prosodie et expressions faciales) et nous comparons ce modèle à des
le deuxième sous-ensemble. Nous entraînons les classifieurs Ridge approches de la littérature sur un nouveau jeu de données réelles.
et XGBoost sur ces jeu de données et les testons sur deux sous- Nos expériences montrent que HireNet obtient des résultats signi-
ensembles d’une seule attention slice ou tranche aléatoire par candi- ficativement meilleurs que les autres approches. Cependant, un tel
dat respectivement pour le premier et le deuxième sous-ensemble. modèle troque ce gain de performances contre une opacité plus im-
Ainsi, nous obtenons un ensemble de scores d’AUC permettant de portante. Pour pallier cette opacité, nous proposons de nous appuyer
calculer l’intervalle de confiance des moyennes de nos résultats sur le mécanisme d’attention intrinsèque au modèle pour expliquer
pour avoir une idée de leur significativité statistique. A noter, que les prédictions. Pour ce faire, nous extrayons les tranches contenant
nous respectons toujours les mêmes divisions d’entraînement, de des pics d’attention, qui correspondent aux périodes de l’entretien
développement et de tests que dans la section 3.1 pour éviter toute jugées les plus significatives par le modèle. Nous montrons d’abord
fuite de données. que ces tranches apparaissent le plus souvent au début et à la fin
Résultats et discussions. Les résultats sont rapportés dans le ta- des réponses pour les modalités audio et vidéo. D’autre part, nous
bleau 6. Nous observons une moyenne d’AUC significativement avons qualifié ces moments en termes de comportements verbaux
plus élevée (p-values < 0.01) pour les attention slices que pour les et non verbaux grâce à une étude d’importance des descripteurs.
tranches aléatoires concernant la modalité audio, et ce pour les deux Nous montrons enfin que les tranches correspondant à la modalité
classifieurs. En revanche, les modalités texte et vidéo ne montre pas audio conservent une faible valeur prédictive en dépit de leur courte
WACAI 2020, 03–05 Juin, 2020, Île d’Oléron, France Léo Hemamou, Arthur Guillon, Jean-Claude Martin, and Chloé Clavel
durée. Nous n’observons pas ce résultat pour les deux autres modal- Analysis of Asynchronous Video Job Interviews. In AAAI.
ités, ce qui pourrait être dû à une information insuffisante dans [15] Léo Hemamou, Grégory Wajntrob, Jean-claude Martin, and Chloé Clavel. 2018.
Entretien vidéo différé : modèle prédictif pour pré-sélection de candidats sur la
une unique tranche. Les valeurs d’attention mettent en évidence base du contenu verbal. In Workshop sur les “Affects, Compagnons Artificiels et
l’importance des moments, mais n’incluent pas d’informations sur Interactions” (ACAI). 1–8.
[16] Mohammed Ehsan Hoque, Matthieu Courgeon, Jean-Claude Martin, Bilge Mutlu,
s’ils ont un impact positif ou négatif sur les décisions des recruteurs, and Rosalind W. Picard. 2013. MACH. In Proceedings of the 2013 ACM international
ce qui pourra faire l’objet de travaux futurs. De plus, comme notre joint conference on Pervasive and ubiquitous computing - UbiComp ’13. ACM Press,
approche est basée sur un modèle appris (HireNet), une direction New York, New York, USA, 697. [Link]
[17] Allen I Huffcutt, James M Conway, Philip L Roth, and Nancy J Stone. 2001.
de recherche consiste à l’améliorer en termes de performances et Identification and meta-analytic assessment of psychological constructs measured
de contrôle des possibles biais. Enfin, nous prévoyons de mener in employment interviews. Journal of Applied Psychology 86, 5 (2001), 897–913.
une tâche d’annotation et une étude utilisateur afin de: i) quanti- [Link]
[18] Sarthak Jain and Byron C. Wallace. 2019. Attention is not Explanation. In North
fier la transparence et l’utilité perçues d’HireNet et des attention American Chapter of the Association for Computational Linguistics. [Link]
slices extraites ; ii) créer une plateforme automatique capable de org/abs/1902.10186
[19] Saumya Jetley, Nicholas A Lord, Namhoon Lee, and Philip H S Torr. 2018. Learn
fournir des commentaires utiles aux candidats pour l’entraînement To Pay Attention. In International Conference on Learning Representations. 1–14.
à l’entretien d’embauche. [Link]
[20] Xuan Liu, Xiaoguang Wang, and Stan Matwin. 2019. Improving the interpretabil-
ity of deep neural networks with knowledge distillation. IEEE International
6 REMERCIEMENTS Conference on Data Mining Workshops, ICDMW 2018-Novem (2019), 905–912.
[Link]
Ce travail a été supporté par la société EASYRECRUE, nous tenions [21] Louis Martin, Benjamin Muller, Pedro Javier Ortiz Suárez, Yoann Dupont, Laurent
à remercier Florian Chaux et Amandine Reitz pour leur soutien. Romary, Éric Villemonte de la Clergerie, Djamé Seddah, and Benoît Sagot. 2019.
CamemBERT: a Tasty French Language Model. 2 (2019). [Link]
1911.03894
REFERENCES [22] Skanda Muralidhar, Laurent Nguyen, and Daniel Gatica-Perez. 2019. Words
[1] Tadas Baltrusaitis, Amir Zadeh, Yao Chong Lim, and Louis Philippe Morency. Worth: Verbal Content and Hirability Impressions in YouTube Video Resumes.
2018. OpenFace 2.0: Facial behavior analysis toolkit. Proceedings - 13th IEEE (2019), 322–327. [Link]
International Conference on Automatic Face and Gesture Recognition, FG 2018 [23] Nora A. Murphy, Judith A. Hall, Marianne Schmid Mast, Mollie A. Ruben, Denise
(2018), 59–66. [Link] Frauendorfer, Danielle Blanch-Hartigan, Debra L. Roter, and Laurent Nguyen.
[2] Dana R. Carney, C. Randall Colvin, and Judith A. Hall. 2007. A thin slice perspec- 2015. Reliability and Validity of Nonverbal Thin Slices in Social Interactions.
tive on the accuracy of first impressions. Journal of Research in Personality 41, 5 Personality and Social Psychology Bulletin 41, 2 (2 2015), 199–213. [Link]
(10 2007), 1054–1072. [Link] org/10.1177/0146167214559902
[3] Justine Cassell, Yukiko I Nakano, Timothy W Bickmore, Candace L Sidner, and [24] Iftekhar Naim, Md. Iftekhar Tanveer, Daniel Gildea, and Mohammed Ehsan
Charles Rich. 2001. Non-verbal cues for discourse structure. In Proceedings Hoque. 2018. Automated Analysis and Prediction of Job Interview Performance.
of the 39th Annual Meeting on Association for Computational Linguistics - ACL IEEE Transactions on Affective Computing 9, 2 (4 2018), 191–204. [Link]
’01. Association for Computational Linguistics, Morristown, NJ, USA, 114–123. 10.1109/TAFFC.2016.2614299
[Link] [25] Laurent Son Nguyen and Daniel Gatica-Perez. 2015. I Would Hire You in a
[4] Lei Chen, Ru Zhao, Chee Wee Leong, Blair Lehman, Gary Feng, and Mo- Minute. In Proceedings of the 2015 ACM on International Conference on Multimodal
hammed Ehsan Hoque. 2017. Automated video interview judgment on a large- Interaction - ICMI ’15. ACM Press, New York, New York, USA, 51–58. https:
sized corpus collected online. In 2017 Seventh International Conference on Affective //[Link]/10.1145/2818346.2820760
Computing and Intelligent Interaction (ACII). IEEE, 504–509. [26] Pooja Rao S. B, Sowmya Rasipuram, Rahul Das, and Dinesh Babu Jayagopi. 2017.
[5] Tianqi Chen and Carlos Guestrin. 2016. XGBoost: A scalable tree boosting system. Automatic assessment of communication skill in non-conventional interview
Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery settings: a comparative study. In Proceedings of the 19th ACM International Con-
and Data Mining 13-17-Augu (2016), 785–794. [Link] ference on Multimodal Interaction - ICMI 2017. ACM Press, New York, New York,
2939785 USA, 221–229. [Link]
[6] Mathieu Chollet and Stefan Scherer. 2017. Assessing Public Speaking Ability [27] Sowmya Rasipuram and Dinesh Babu Jayagopi. 2018. Automatic assessment
from Thin Slices of Behavior. Proceedings - 12th IEEE International Conference on of communication skill in interview-based interactions. Multimedia Tools and
Automatic Face and Gesture Recognition, FG 2017 - 1st International Workshop on Applications 77, 14 (2018), 18709–18739. [Link]
Adaptive Shot Learning for Gesture Understanding and Production, ASL4GUP 2017, 5654-9
Biometrics in the Wild, Bwild 2017, Heteroge (2017), 310–316. [28] Marco Ribeiro, Sameer Singh, and Carlos Guestrin. 2016. “Why Should I Trust
[7] Timothy Degroot and Janaki Gooty. 2009. Can nonverbal cues be used to make You?”: Explaining the Predictions of Any Classifier. In Proceedings of the 2016
meaningful personality attributions in employment interviews? Journal of Busi- Conference of the North American Chapter of the Association for Computational Lin-
ness and Psychology 24, 2 (2009), 179–192. guistics: Demonstrations. Association for Computational Linguistics, Stroudsburg,
[8] Martin Ester, Hans-peter Kriegel, Xiaowei Xu, and D Miinchen. 1996. A Density- PA, USA, 97–101. [Link]
Based Algorithm for Discovering Clusters in Large Spatial Databases with Noise. [29] Neal Schmitt (Ed.). 2012. The Oxford Handbook of Personnel Assessment and Selec-
(1996). tion. Oxford University Press. [Link]
[9] Florian Eyben, Klaus R. Scherer, Bjorn W. Schuller, Johan Sundberg, Elisabeth 001.0001
Andre, Carlos Busso, Laurence Y. Devillers, Julien Epps, Petri Laukka, Shrikanth S. [30] Leann Schneider, Deborah M. Powell, and Nicolas Roulin. 2015. Cues to deception
Narayanan, and Khiet P. Truong. 2016. The Geneva Minimalistic Acoustic Parame- in the employment interview. International Journal of Selection and Assessment
ter Set (GeMAPS) for Voice Research and Affective Computing. IEEE Transactions 23, 2 (2015), 182–190. [Link]
on Affective Computing 7, 2 (2016), 190–202. [31] George Trigeorgis, Fabien Ringeval, Raymond Brueckner, Erik Marchi, Mihalis A.
[10] Florian Eyben, Felix Weninger, Florian Gross, and Björn Schuller. 2013. Recent Nicolaou, Bjorn Schuller, and Stefanos Zafeiriou. 2016. Adieu features? End-to-
developments in openSMILE, the munich open-source multimedia feature ex- end speech emotion recognition using a deep convolutional recurrent network.
tractor. Proceedings of the 21st ACM international conference on Multimedia - MM ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing -
’13 May (2013), 835–838. [Link] Proceedings 2016-May (2016), 5200–5204. [Link]
[11] Amanda R. Feiler and Deborah M. Powell. 2016. Behavioral Expression of Job 7472669
Interview Anxiety. Journal of Business and Psychology 31, 1 (2016), 155–171. [32] Fan Yang, Mengnan Du, and Xia Hu. 2019. Evaluating Explanation Without
[Link] Ground Truth in Interpretable Machine Learning. (2019). [Link]
[12] Ray J. Forbes and Paul R. Jackson. 1980. Non-verbal behaviour and the outcome 1907.06831
of selection interviews. Journal of Occupational Psychology 53, 1 (1980), 65–72. [33] Hongliang Yu, Liangke Gui, Michael Madaio, Amy Ogan, Justine Cassell, and
[Link] Louis-Philippe Morency. 2017. Temporally Selective Attention Model for Social
[13] Wells Goodrich. 1979. Face-to-Face Interaction: Research, Methods, and Theory. and Affective State Recognition in Multimedia Content. Proceedings of the 2017
Family Process 18, 3 (9 1979), 355–356. ACM on Multimedia Conference (2017), 1743–1751.
[14] Leo Hemamou, Ghazi Felhi, Vincent Vandenbussche, Jean-claude Martin, and
Chloe Clavel. 2019. HireNet : a Hierarchical Attention Model for the Automatic