Soumissionnaire
Reçoit un stimulus, enregistre, écoute, envoie. Il peut passer un stimulus qui ne lui convient pas plutôt que d'enregistrer à contrecœur.
La chaîne complète, de l'enregistrement à la livraison du corpus.
Huit états, deux étages de validation humaine. Chaque étape porte le statut technique que porte la donnée dans le système — ce n'est pas un schéma d'intention, c'est la machine à états réelle.
STIMULUS_AVAILABLEQui intervient : SoumissionnaireUn texte ou une image cadré par le projet s'affiche. Le contributeur enregistre sa voix depuis son navigateur, ou passe au suivant si la consigne ne lui convient pas.
AUDIO_SUBMITTEDQui intervient : SystèmeDès la réception : format, intégrité, durée, niveau sonore, silences, doublons. Un score de qualité est calculé avant qu'un humain n'écoute.
AUDIO_IN_REVIEWQui intervient : Validateur audioQuelqu'un d'autre que l'auteur écoute et décide : approuver, rejeter, ou demander une correction. Tout ce qui n'est pas une approbation exige un commentaire.
AUDIO_VALIDATEDAUDIO_REJECTEDQui intervient : SystèmeApprouvé, il rejoint la file des transcripteurs. Rejeté, il revient au soumissionnaire avec le motif — qui peut réenregistrer.
TRANSCRIPTION_IN_PROGRESSQui intervient : TranscripteurSeul l'audio validé est transcrit. La tâche est verrouillée sur son transcripteur le temps qu'il travaille : deux personnes ne transcrivent jamais le même segment.
TRANSCRIPTION_SUBMITTEDQui intervient : SystèmeLe texte rejoint la file de validation, apparié à son audio.
TRANSCRIPTION_IN_REVIEWQui intervient : Validateur de transcriptionAudio et texte côte à côte. Le valideur approuve, rejette, ou corrige directement la transcription.
COMPLETEDQui intervient : SystèmeAudio et transcription validés, avec leurs métadonnées et leur historique de décisions, prêts pour l'export.
La validation humaine n'est pas le seul filet. Un enregistrement passe six contrôles automatiques avant qu'un validateur y consacre une seconde.
Type MIME vérifié, fichier réellement lisible.
Empreinte SHA-256 : le même enregistrement soumis deux fois est repéré.
Durée, fréquence d'échantillonnage, niveau sonore.
Un enregistrement majoritairement vide est détecté.
Une note de 0 à 100, affichée au validateur avant qu'il écoute.
Sous le seuil défini par le projet, l'enregistrement ne va pas plus loin.
Chaque rôle a sa file de travail et ses propres écrans. Personne ne valide son propre travail.
Reçoit un stimulus, enregistre, écoute, envoie. Il peut passer un stimulus qui ne lui convient pas plutôt que d'enregistrer à contrecœur.
Une file d'écoutes. Approuve, rejette ou demande une correction, motif à l'appui.
Une file d'audios déjà validés. Écoute et saisit le texte, la tâche verrouillée le temps qu'il travaille.
Audio et texte côte à côte. Approuve, rejette, ou corrige directement.
Un même contributeur peut tenir des rôles différents sur des projets différents. L'accès à un rôle supérieur est accordé par l'administrateur du projet.
La plateforme se loue en marque blanche : vos stimuli, vos règles de validation, votre équipe, sous votre nom de domaine.
Vos textes ou vos images, versés en une fois.
Étapes de validation, seuils de qualité, barème de rémunération — ou pas de rémunération du tout.
Les informations que vous voulez sur vos contributeurs — dialecte, région, années de pratique — livrées avec le dataset.
Demandes d'accès, attribution des rôles, co-administrateurs.
Votre logo, votre couleur et votre propre nom de domaine pour la page de recrutement.
Volume par statut, qualité moyenne, progression, journal d'audit.
Les données validées, avec leurs métadonnées et leur chaîne de décisions.
La plateforme est construite par types de projet : ajouter un type ne demande pas de toucher au cœur du système. La voix est livrée aujourd'hui ; le reste suit, sans échéance annoncée tant qu'elle n'est pas tenable.
Collecte vocale, transcription et double validation humaine.
Lectures enregistrées pour la synthèse vocale.
Classification, entités nommées, sentiment, traduction.
Annotation et segmentation d'images.
Décrivez votre besoin : langues, volume, format, délai. Nous revenons vers vous avec un cadrage.