Partie D3

Dossier 3 · Biais et décisions automatiques

Une décision automatique peut-elle être juste si ses données reflètent des inégalités ?

Question d'enquête : une décision automatique peut-elle être juste si ses données reflètent des inégalités ?

Situation d'entrée (imaginaire)

Deux candidats ont des CV presque identiques. Un logiciel de tri en retient un et écarte l'autre. Personne ne sait expliquer pourquoi.

Document 3.1La reconnaissance faciale et les erreurs

J. Buolamwini et T. Gebru, « Gender Shades », 2018. Étude en anglais, résumée ici.

Deux chercheuses ont testé trois systèmes commerciaux (IBM, Face++ et Microsoft) sur une tâche précise : deviner si un visage est celui d'une femme ou d'un homme. Elles ont construit un jeu de test de 1 270 personnes venant de 6 pays, avec des peaux claires et foncées. Les systèmes dataient de 2017.

Groupe testéIBMFace++Microsoft
Hommes à peau claire : taux d'erreur0,3 %0,8 %0,0 %
Femmes à peau foncée : taux d'erreur34,7 %34,5 %20,8 %

Les autrices expliquent que plusieurs jeux d'images utilisés alors pour entraîner ou tester ces systèmes contenaient surtout des visages à peau claire.

Document 3.2Un outil de recrutement abandonné

J. Dastin, agence Reuters, 10 octobre 2018 (lu dans une reprise du journal The Irish Times).

L'entreprise Amazon a développé à partir de 2014 un outil qui notait les CV de une à cinq étoiles. Il avait été entraîné sur les CV reçus pendant environ 10 ans, en grande majorité envoyés par des hommes, comme dans beaucoup d'entreprises du numérique. L'outil a appris à pénaliser les CV contenant le mot « women's » (par exemple « capitaine du club d'échecs féminin ») et ceux de diplômées de deux universités de femmes. Les ingénieurs ont essayé de corriger ces cas, mais sans garantie que l'outil ne trouve pas d'autres façons de discriminer. Le projet a été abandonné début 2017. Amazon indique que ses recruteurs ne s'appuyaient pas uniquement sur ces notes.

Document 3.3Deux façons de mesurer l'équité

J. Angwin, J. Larson, S. Mattu, L. Kirchner, ProPublica, « Machine Bias », 23 mai 2016 ; réponse de W. Flores, K. Bechtel et C. Lowenkamp, revue Federal Probation, septembre 2016.

Aux États-Unis, un logiciel appelé COMPAS donne aux juges un score du risque qu'une personne récidive. Des journalistes ont étudié plusieurs milliers de cas dans un comté de Floride, avec un suivi de deux ans. Ils ont trouvé que, parmi les personnes qui n'ont pas récidivé, 44,9 % des personnes noires avaient été classées « à risque élevé », contre 23,5 % des personnes blanches. À l'inverse, parmi celles qui ont récidivé, 47,7 % des personnes blanches avaient été classées « à risque faible », contre 28,0 % des personnes noires. Des chercheurs liés à l'entreprise qui a créé COMPAS répondent que, pour un même score, le taux de récidive est semblable dans les deux groupes : pour eux, l'outil est donc équitable. Les deux camps utilisent deux définitions différentes de « juste ».

Document 3.4À toi de calculer : un outil de recrutement (fictif)

Données inventées pour cet exercice. Un outil accepte ou refuse 500 candidatures. On sait ensuite qui convenait vraiment au poste.

Groupe AGroupe B
Candidatures300200
Candidats qui convenaient200120
Candidats qui ne convenaient pas10080
Acceptés parmi ceux qui convenaient16066
Acceptés parmi ceux qui ne convenaient pas2012
  1. Calcule, pour chaque groupe, le pourcentage de candidatures acceptées.
  2. Calcule le pourcentage de candidats qui convenaient et qui ont été refusés à tort.
  3. Calcule le pourcentage de candidats qui ne convenaient pas et qui ont été acceptés à tort.
  4. Quel groupe est avantagé ? Selon quel critère ?

Document 3.5 · approfondissementParcoursup et la transparence

Conseil constitutionnel, décision n° 2020-834 QPC, 3 avril 2020.

Parcoursup est la plateforme d'orientation après le lycée. Certaines formations utilisent des traitements automatisés pour classer les candidatures. Une association d'étudiants a contesté le secret de ces critères. Le Conseil constitutionnel a décidé que le droit d'accès aux documents administratifs s'applique : une fois la procédure terminée, les établissements doivent publier les critères utilisés et indiquer s'ils ont eu recours à des algorithmes, en protégeant la vie privée des candidats. Cette décision date de 2020 ; on ne dispose pas ici d'information plus récente.

Document 3.6 · approfondissementL'algorithme peut aussi aider

J. Kleinberg et collègues, « Human Decisions and Machine Predictions », 2017 (étude d'économistes, résumée par l'enseignant).

Des économistes ont étudié les décisions de juges américains pour libérer ou non des personnes avant leur procès. En simulant, sur des données de New York, ce qu'aurait donné un algorithme à la place des juges, ils estiment qu'on aurait pu soit réduire d'environ 25 % la criminalité sans incarcérer davantage, soit réduire d'environ 42 % le nombre de personnes en prison sans augmenter la criminalité. Il s'agit d'une simulation sur des décisions passées, pas d'un algorithme réellement utilisé. Les auteurs remarquent aussi que les juges réagissent parfois à du « bruit » comme s'il s'agissait d'une information utile.

Avant de t'exprimer

Relis les trois questions : qui publie et quand ? que montre le document ? que ne montre-t-il pas ? Méthode.