Qualité & éthique

Comment la donnée est contrôlée, et à quoi nous nous engageons envers ceux qui la produisent.

Deux étages humains, un filet automatique

Un corpus vocal se juge sur trois choses : la qualité du son, la fidélité de la transcription, et la légitimité de la collecte. Nous traitons les trois séparément, avec un mécanisme dédié à chacune. Rien de ce qui suit n'est déclaratif : chaque contrôle laisse une trace consultable.

Les quatre niveaux de contrôle

Un enregistrement franchit quatre filtres avant d'entrer dans un corpus livrable. Le premier est une machine ; les trois autres sont des personnes, et aucune d'elles n'est l'auteur de ce qu'elle contrôle.

  1. Automatique

    01

    Contrôle automatique

    À la réception : format et intégrité du fichier, durée, niveau sonore, silences excessifs, empreinte SHA-256 pour écarter les doublons. Un score de 0 à 100 est calculé et affiché au validateur, et tout enregistrement sous le seuil du projet est rejeté sans passer par un humain.

  2. Humain

    02

    Validation audio

    Un contributeur différent de l'auteur écoute l'enregistrement et décide : approuver, rejeter, ou demander une correction. Un rejet ou une demande de correction exige un commentaire — c'est ce qui permet au soumissionnaire de progresser plutôt que de recommencer à l'aveugle.

  3. Humain

    03

    Transcription

    Seul l'audio validé part en transcription. La tâche est verrouillée sur son transcripteur le temps qu'il travaille : deux personnes ne transcrivent jamais le même segment, et rien ne se perd entre deux sessions.

  4. Humain

    04

    Validation de transcription

    Un second valideur compare l'audio et le texte. Il approuve, rejette, ou corrige directement. Ce quatrième passage est ce qui distingue un corpus livrable d'un tas d'enregistrements.

Chaque étage de validation est activable ou désactivable, et le nombre de valideurs requis se règle projet par projet. Une chaîne plus courte est un choix documenté, pas un raccourci silencieux.

Chaque décision est datée et signée

Qui a soumis, qui a validé, qui a rejeté et pourquoi, à quelle heure, avec quel score automatique : tout est consigné dans un journal que personne ne peut modifier après coup, y compris nous.

Si un client conteste un segment, la réponse est dans le journal, pas dans un souvenir.

Consentement et rémunération

Le même engagement, vu des deux côtés de la chaîne.

Le consentement précède l'enregistrement

Chaque contributeur consent à l'usage de sa voix avant d'enregistrer, et ce consentement suit la donnée jusqu'à la livraison. La chaîne de droits accompagne le corpus.

Le travail de collecte est un travail payé

Enregistrer, écouter, transcrire, relire : ce sont des tâches, elles prennent du temps, elles sont rémunérées. Le barème est fixé pour chaque projet et connu du contributeur avant qu'il commence, pas après. Le paiement part par Mobile Money, sur demande de retrait, dès que le solde atteint le seuil du projet.

Certains projets — communautaires, pédagogiques ou de test — ne sont pas rémunérés. C'est indiqué sur le projet avant que le contributeur le rejoigne.

Où vivent vos données

Un corpus vocal contient des voix identifiables. Les contrôles ci-dessous ne sont pas des options de configuration : ils s'appliquent à tous les projets, tout le temps.

  • Chiffrement en transit et au repos

    TLS 1.3 pour tout ce qui circule, chiffrement du stockage pour tout ce qui reste.

  • Aucun fichier en accès direct

    Les audios ne sont servis que par URL signée à durée limitée. Un lien qui fuite expire.

  • Droits vérifiés côté serveur

    À chaque action, sans exception, jamais côté navigateur.

  • Isolation stricte entre projets

    Un contributeur d'un projet ne voit rien d'un autre, y compris s'il participe aux deux.

  • Sauvegardes quotidiennes

    La base est sauvegardée automatiquement chaque jour.

Parlons de votre corpus.

Décrivez votre besoin : langues, volume, format, délai. Nous revenons vers vous avec un cadrage.

Se connecter