Le consentement précède l'enregistrement
Chaque contributeur consent à l'usage de sa voix avant d'enregistrer, et ce consentement suit la donnée jusqu'à la livraison. La chaîne de droits accompagne le corpus.
Comment la donnée est contrôlée, et à quoi nous nous engageons envers ceux qui la produisent.
Un corpus vocal se juge sur trois choses : la qualité du son, la fidélité de la transcription, et la légitimité de la collecte. Nous traitons les trois séparément, avec un mécanisme dédié à chacune. Rien de ce qui suit n'est déclaratif : chaque contrôle laisse une trace consultable.
Un enregistrement franchit quatre filtres avant d'entrer dans un corpus livrable. Le premier est une machine ; les trois autres sont des personnes, et aucune d'elles n'est l'auteur de ce qu'elle contrôle.
01
À la réception : format et intégrité du fichier, durée, niveau sonore, silences excessifs, empreinte SHA-256 pour écarter les doublons. Un score de 0 à 100 est calculé et affiché au validateur, et tout enregistrement sous le seuil du projet est rejeté sans passer par un humain.
02
Un contributeur différent de l'auteur écoute l'enregistrement et décide : approuver, rejeter, ou demander une correction. Un rejet ou une demande de correction exige un commentaire — c'est ce qui permet au soumissionnaire de progresser plutôt que de recommencer à l'aveugle.
03
Seul l'audio validé part en transcription. La tâche est verrouillée sur son transcripteur le temps qu'il travaille : deux personnes ne transcrivent jamais le même segment, et rien ne se perd entre deux sessions.
04
Un second valideur compare l'audio et le texte. Il approuve, rejette, ou corrige directement. Ce quatrième passage est ce qui distingue un corpus livrable d'un tas d'enregistrements.
Chaque étage de validation est activable ou désactivable, et le nombre de valideurs requis se règle projet par projet. Une chaîne plus courte est un choix documenté, pas un raccourci silencieux.
Qui a soumis, qui a validé, qui a rejeté et pourquoi, à quelle heure, avec quel score automatique : tout est consigné dans un journal que personne ne peut modifier après coup, y compris nous.
Si un client conteste un segment, la réponse est dans le journal, pas dans un souvenir.
Le même engagement, vu des deux côtés de la chaîne.
Chaque contributeur consent à l'usage de sa voix avant d'enregistrer, et ce consentement suit la donnée jusqu'à la livraison. La chaîne de droits accompagne le corpus.
Enregistrer, écouter, transcrire, relire : ce sont des tâches, elles prennent du temps, elles sont rémunérées. Le barème est fixé pour chaque projet et connu du contributeur avant qu'il commence, pas après. Le paiement part par Mobile Money, sur demande de retrait, dès que le solde atteint le seuil du projet.
Certains projets — communautaires, pédagogiques ou de test — ne sont pas rémunérés. C'est indiqué sur le projet avant que le contributeur le rejoigne.
Un corpus vocal contient des voix identifiables. Les contrôles ci-dessous ne sont pas des options de configuration : ils s'appliquent à tous les projets, tout le temps.
TLS 1.3 pour tout ce qui circule, chiffrement du stockage pour tout ce qui reste.
Les audios ne sont servis que par URL signée à durée limitée. Un lien qui fuite expire.
À chaque action, sans exception, jamais côté navigateur.
Un contributeur d'un projet ne voit rien d'un autre, y compris s'il participe aux deux.
La base est sauvegardée automatiquement chaque jour.
Décrivez votre besoin : langues, volume, format, délai. Nous revenons vers vous avec un cadrage.