10 min de lecture - Fermeture de Mechanical Turk : rendez la revue humaine portable
AI Operations
Date de publication 27 août 2026 · Auteur Exceev Consulting
Une chaîne de revue humaine peut ressembler à une petite dépendance d’API. Vous envoyez une tâche, recevez une réponse, puis approuvez le travail. Les personnes, consignes, contrôles qualité et opérations de paiement derrière cet appel restent faciles à ignorer jusqu’au jour où le service annonce sa fin.
Amazon vient de fixer cette date. Sa FAQ de fermeture indique que Mechanical Turk fermera définitivement le 30 septembre 2026. Les contributeurs et donneurs d’ordre actuels peuvent poursuivre leurs activités jusque-là. L’annonce touche aussi l’option « Mechanical Turk Worker » utilisée dans les tâches d’étiquetage SageMaker Ground Truth et les processus de revue Amazon Augmented AI. Elle ne dit pas que toutes les fonctions de Ground Truth ou d’Augmented AI prendront fin.
Les utilisateurs de MTurk ont une échéance immédiate. Pour les autres, cette fermeture teste la conception : la revue humaine doit rester un processus métier portable, pas une fonction enfermée dans une plateforme.
La fermeture déclenche plusieurs échéances
Le média indépendant The Next Web a confirmé l’annonce le 26 août et rappelé son contexte : Amazon avait lancé MTurk en 2005 comme une place de marché consacrée aux petites tâches numériques difficiles à automatiser.
La fermeture suit un premier avertissement. Le 30 juin, AWS a placé Mechanical Turk et plusieurs fonctions de SageMaker AI en maintenance. Ces services n’acceptaient plus de nouveaux clients à partir du 30 juillet, mais les clients existants pouvaient continuer. Le passage en maintenance et la fermeture sont deux événements différents. Une équipe qui n’a consigné que le premier doit rouvrir sa décision.
AWS donne désormais plusieurs dates aux donneurs d’ordre :
| Date | Indication de la FAQ AWS |
|---|---|
| 30 septembre 2026 | Fin des soumissions ; expiration des HIT non soumis |
| 30 octobre 2026 | Fin des validations, rejets et primes sur les HIT soumis |
| 28 janvier 2027 | Fin de l’accès à l’historique des transactions |
La FAQ indique que le solde prépayé devrait être remboursé sous 30 jours et demande aux donneurs d’ordre de vérifier leurs informations de paiement. Ces opérations ne forment pas un plan de migration. Un remplaçant ne pourra pas reconstituer des critères de qualification, exemples, retours aux relecteurs ou raisons de confiance jamais documentés.
Commencer par trouver la vraie dépendance
MTurk peut apparaître dans le code, les appels aux SDK AWS, des scripts, notebooks, protocoles de recherche, processus financiers ou paramètres Ground Truth et Augmented AI. Demandez aussi aux responsables des données, des opérations produit et du support s’ils envoient du travail à une foule ou à un prestataire de revue.
Pour chaque processus actif, consignez :
- la décision métier ou le comportement du modèle soutenu par la réponse ;
- le modèle de tâche, ses exemples, son interface et sa version ;
- les qualifications, langues et règles d’exclusion des contributeurs ;
- les champs d’entrée et la classification des données ;
- le processus de validation, de rejet, de prime et de contestation ;
- les cas de référence, règles de redondance et voies d’escalade ;
- le schéma du résultat, son destinataire et la règle de conservation ;
- les responsables métier, technique et financier.
L’unité à déplacer peut être un questionnaire, un lot d’images, une file de modération, un jeu d’évaluation ou un repli manuel. Migrer l’API sans les règles d’exploitation préserve l’intégration et perd le contrôle.
Le guide développeur officiel de Mechanical Turk documente les HIT, missions, qualifications, validations, rejets et règles de gestion à retrouver. C’est une liste d’exploration, pas une conception cible.
Exporter les preuves avant de comparer les prestataires
La FAQ MTurk indique que les données des HIT et des missions sont normalement supprimées après 120 jours. La section consacrée à la fermeture maintient l’historique des transactions jusqu’au 28 janvier 2027. Exportez les dossiers que votre organisation peut et doit conserver pendant que le service fonctionne encore, puis vérifiez qu’ils restent lisibles sans MTurk.
Conservez le plus petit ensemble défendable : versions des tâches, résultats validés, décisions qualité, performances agrégées, paiements et changements. Une copie massive des profils ou du contenu sensible peut créer un problème. Les responsables des données, de la confidentialité et du juridique doivent décider ce qui peut être transféré, pourquoi et pour combien de temps.
Ne confondez pas historique des transactions et preuve d’évaluation. Une facture prouve que des tâches ont été exécutées. Elle ne prouve ni la qualité des consignes, ni l’accord des relecteurs, ni le respect d’un seuil de mise en production. Conservez le barème et les décisions d’arbitrage avec le résultat.
Notre guide sur l’actif d’évaluation métier explique pourquoi les cas de référence, désaccords d’experts et tests de régression doivent survivre à un modèle ou un fournisseur. Le même principe vaut pour la part humaine du système.
Comparer les remplaçants avec le même jeu de tests
Ne commencez pas par une grille de fonctionnalités. Constituez un petit lot représentatif à partir de données autorisées, puis exécutez-le dans le processus actuel et chaque solution candidate. Incluez des cas courants, des ambiguïtés, des échecs déjà connus, des demandes hors périmètre et des tâches qui exigent une escalade.
Évaluez l’ensemble du parcours opérationnel :
| Domaine de décision | Preuve à demander ou à tester |
|---|---|
| Adéquation des tâches | Médias, longueur, expertise et volume pris en charge |
| Adéquation des relecteurs | Langues vérifiées, disponibilité et méthode de qualification |
| Contrôle qualité | Cas de référence, redondance, désaccords et retours |
| Accès et données | Accès, lieux, sous-traitants, suppression et audit |
| Intégration | Modèles versionnés, limites API, reprises et exports |
| Opérations humaines | Paiement, rejet, recours et responsabilité du donneur d’ordre |
| Continuité | Panne, repli manuel, format d’export et aide à la sortie |
| Économie | Coût complet de tâche, revue, litige, intégration et gestion |
La solution peut être une foule gérée, un prestataire spécialisé, une équipe interne ou un mélange. Le prix unitaire le plus bas ne produit pas forcément le résultat revu le moins cher : reprises, désaccords et escalades peuvent dominer le coût total.
Gardez les définitions de tâches et cas de référence dans un dépôt contrôlé par l’organisation. Versionnez les schémas de résultat et placez l’adaptateur du fournisseur derrière une interface étroite. Le même jeu de tests doit pouvoir être rejoué sans exposer la production ni réécrire l’application.
Vérifier que l’intervention reste humaine
L’étiquette d’une plateforme ne prouve pas comment une tâche a été réalisée. Une étude de cas de l’EPFL publiée en 2023 a reproduit une tâche de résumé d’abstracts sur MTurk. Ses auteurs ont estimé que 33 % à 46 % des participants avaient utilisé de grands modèles de langage. Ils ont explicitement averti que ce résultat pouvait ne pas s’étendre aux tâches moins favorables aux LLM.
Ce constat circonscrit ne doit pas devenir une affirmation sur tous les travaux MTurk ou tous les contributeurs. Il révèle néanmoins une question de contrôle qui survivra à la fermeture : lorsqu’un processus exige un jugement humain indépendant, quelles preuves rendent cette exigence crédible ?
La réponse dépend de la tâche : règles de déclaration, interfaces contrôlées, cas cachés, doubles revues et arbitrage expert. Si l’assistance par IA est autorisée, précisez où et pourquoi. Un mélange dissimulé entre modèle et humain empêche de savoir quelle capacité a été évaluée.
Tester directement l’adéquation linguistique et régionale
Les équipes en France et au Maroc peuvent avoir besoin de revues en français, anglais, arabe ou darija, parfois dans le même processus. La promesse d’une communauté mondiale ne démontre aucune maîtrise de la langue, du métier ou du contexte local requis.
Créez des cas dans leur langue d’origine. Vérifiez les consignes, les termes locaux et les désaccords sur les tâches multilingues. Nommez la personne qui arbitre les cas difficiles. Notre guide sur l’IA en langues locales propose une méthode d’évaluation plus large pour le français, l’arabe, la darija et l’amazigh.
Le lieu des relecteurs et la propriété de la plateforme modifient les questions d’accès et de contrat. Vérifiez-les pour le processus concerné. Ne déduisez aucune résidence ou conformité d’une page marketing.
Une séquence de transition adaptée à l’échéance
Dans les 48 prochaines heures, identifiez les identifiants MTurk actifs, comptes donneurs d’ordre, appels aux SDK, paramètres de main-d’œuvre Ground Truth et lots en attente. Nommez un responsable de la fermeture et un responsable du rapprochement des paiements.
Pendant la semaine suivante, figez les modèles de tâches, exportez les dossiers autorisés, documentez les contrôles qualité et constituez le jeu de tests. Prévenez les utilisateurs et responsables des contestations ou escalades.
Exécutez ensuite en parallèle le parcours actuel et la solution candidate sur de nouveaux exemples autorisés. Comparez accord, effort d’arbitrage, délai, gestion des échecs et coût complet. Corrigez la définition de la tâche avant d’attribuer à de nouveaux relecteurs une ambiguïté déjà présente.
Avant le 30 septembre, cessez les travaux qui ne pourraient pas finir correctement, basculez l’adaptateur de production ou activez le repli manuel, puis vérifiez qu’aucune file cachée ne vise encore l’option « Mechanical Turk Worker ». Jusqu’au 30 octobre, terminez validations, rejets, primes et litiges. Avant le 28 janvier, contrôlez l’archive finale des transactions et retirez les identifiants devenus inutiles.
Sources et limites
- La FAQ de fermeture de Mechanical Turk fournit les dates de fermeture, validation, remboursement, prime et accès à l’historique, ainsi que les effets sur les processus AWS associés.
- L’ avis de disponibilité AWS du 30 juin 2026 consigne le passage antérieur en maintenance et la fin des nouveaux comptes.
- Le guide développeur d’Amazon Mechanical Turk définit les objets et concepts opérationnels repris dans l’inventaire.
- L’article de The Next Web du 26 août confirme indépendamment la nouvelle fermeture et l’historique du service.
- L’étude de l’EPFL « Artificial Artificial Artificial Intelligence » fournit l’estimation circonscrite sur l’usage des LLM dans une tâche de résumé et précise sa limite de généralisation.
AWS peut encore mettre à jour ses consignes. Cet article ne compare ni ne recommande de fournisseurs. Confirmez les obligations contractuelles, les droits des contributeurs, le traitement des données et la conservation pour votre processus.
Préserver le système de revue
L’export le plus précieux est le système de revue : la tâche, le jugement de qualité, l’escalade des cas difficiles et la raison de faire confiance au résultat. Un CSV ne permet pas d'expliquer ces décisions.
L’échéance de Mechanical Turk rend ce travail urgent pour ses utilisateurs. Chaque équipe IA devrait pourtant se poser la même question : si le prestataire de revue humaine fermait le mois prochain, l’organisation pourrait-elle déplacer le processus sans perdre ses preuves qualité ni ses responsabilités ?
Vous envisagez l'IA pour votre équipe ?
Nous aidons les entreprises à passer du prototype à la production, avec une architecture pérenne et des coûts maîtrisés.