Multilingual Disinformation Detection for Digital Advertising
Maryline CHEN
Machine Learning Engineer
@ Criteo AI Lab
Žofia Trsťanová, Nadir El Manouzi, Maryline Chen, Andre L. V. da Cunha, Sergei Ivanov
Problem statement
Publishers
Advertisers
Internet Users
2
Related work
3
Our solution : Repurposed Embeddings for Disinformation Detection (REDD)
4
The REDD pipeline
Publisher text
Text embeddings
Topic projection
Disinformation Classifier
Human review
~0.5B
~12K
~4K
#pages
5
Dataset
6
Results: Topic filtering
| AUC-ROC |
REDD | 0.955 |
No topic filtering | 0.65 |
7
Results: text vs embeddings as the input
8
Results: Human review
more likely to be
ranked higher by REDD
9
Conclusion
10
Thank you!
Contact: @ Criteo AI Lab
ma.chen@criteo.com
Q&A
Contact: @ Criteo AI Lab
Appendix
The topic classification schema
13
Appendix
https://arxiv.org/pdf/1706.03762.pdf
https://arxiv.org/pdf/1911.02116.pdf
XLM-RoBERTa architecture
14
Appendix
Embedding prediction schema
15