</>Documentation technique

Détails techniques

TranscriLive est un moteur de transcription, traduction, diarisation et vocalisation en temps réel, propulsé par des modèles d'IA exécutés localement sur GPU. Tout fonctionne sur votre infrastructure — aucune donnée n'est envoyée dans le cloud.

Architecture

Le pipeline temps réel

Entrée
Transcription
Traduction
Diarisation
Vocalisation
Sorties

Un orchestrateur in-process capture l'audio, le transcrit, le traduit, identifie les locuteurs puis le vocalise. Un bus pub/sub par langue alimente des « sinks » branchables : plusieurs sorties simultanées par langue.

Entrées & sorties

Ce qui entre, ce qui sort

Entrées

• Micro navigateur (WebRTC)

• Périphérique audio / carte son (CoreAudio, ASIO)

• Dante (Dante Virtual Soundcard)

• Flux réseau RTSP

• Flux HLS

• Fichiers audio/vidéo (mode batch)

Sorties (plusieurs par langue)

• Sous-titres WebSocket (JSON temps réel)

• WebVTT / SRT / TTML / EBU-TT Live

• Audio vocalisé par langue → device / canal Dante

• Diffusion réseau RTSP / SRT (ffmpeg)

• Flux HLS (viewers distants, QR code)

• Pages sous-titres web multi-langues (overlay, lower-third)

Traitements IA

Ce que fait le moteur

Transcription

Reconnaissance vocale en temps réel, y compris en environnement bruyant et avec plusieurs interlocuteurs.

Traduction

Traduction simultanée du texte transcrit, en direct, dans plusieurs langues à la fois.

Diarisation

Identification des locuteurs : qui parle, et quand — pour des transcriptions claires et attribuées.

Vocalisation

Synthèse vocale du texte traduit, voix naturelles, en temps réel — avec clonage de voix possible.

Tous les traitements s'exécutent localement sur GPU. Les modèles d'IA sont interchangeables selon la précision et la vitesse recherchées.

Langues & voix

Multilingue, du texte à la voix

Langues

• Transcription dans plus de 90 langues

• Mode ultra-rapide sur 25 langues européennes

• Traduction multilingue temps réel

• Sorties simultanées dans plusieurs langues

Voix de synthèse

• Bibliothèque de voix masculines et féminines

• Vocalisation par langue, en temps réel

• Prosodie et ponctuation naturelles

Clonage de voix

• À partir d'un extrait de 5 à 15 secondes

• Transcription automatique de l'extrait

• Voix clonée réutilisable pour la vocalisation

Temps réel & diffusion

Latences et diffusion de masse

Étape
Latence typique
Sous-titres WebSocket
20 – 100 ms
Transcription (STT)
200 – 500 ms
Traduction
~ 100 – 300 ms
Vocalisation
temps réel (streaming)

Diffusion de masse : partagez un lien accessible par QR code et tout l'auditoire suit en direct sur son propre appareil — jusqu'à des centaines de milliers de spectateurs. Overlays de sous-titres pour la régie et flux RTSP/SRT réinjectables dans une chaîne de diffusion existante.

Intégration

API & pilotage

API REST / WebSocket

• API versionnée /api/v1, auto-documentée (Swagger)

• Authentification par clé API

/ws/subtitles?lang= · /ws/listen · /subtitles/<lang>.vtt · /voices/upload · /routing

Exploitation

• Profils d'entrées/sorties sauvegardables

• Validation stricte des périphériques (UID CoreAudio)

• Redémarrage à l'identique, sans intervention

• Console web d'installation et de test

Sécurité & souveraineté

Tout reste chez vous

100% on-premise

Aucune donnée envoyée dans le cloud.

RGPD natif

Traitement local, pas de sous-traitant tiers.

Conforme EAA / RGAA

Accessibilité des directs.

Souveraineté

Vous gardez la main sur toute la chaîne.

Configuration requise

Matériel recommandé par environnement

TranscriLive s'appuie sur l'accélération GPU. La puissance dépend de la pile activée (transcription seule, + traduction, + vocalisation) et du nombre de langues diffusées simultanément.

Windows (NVIDIA CUDA)

• GPU : NVIDIA RTX 4090 24 Go recommandé (pile complète)

• Transcription + traduction : RTX 4070 / 4080 (12–16 Go)

• Multi-langues / diffusion : RTX 5090 ou RTX A6000

• CPU 8+ cœurs · 32 Go RAM · Windows 10 / 11

Linux (NVIDIA CUDA)

• Idéal serveur / régie, déploiement souverain

• GPU : RTX 4090 24 Go ou station RTX A6000 / L40S

• Plusieurs GPU pour de nombreuses langues en parallèle

• CPU 8+ cœurs · 32 Go RAM · Ubuntu 22.04+

macOS (Apple Silicon)

• Pipeline MLX natif Apple Silicon (M1 → M4)

• Recommandé : Mac Studio M2 / M3 Max ou Ultra

• 30+ cœurs GPU · 32–64 Go de mémoire unifiée

• MacBook Pro M-series pour transcription + traduction

Le traitement s'exécute sur le GPU (CUDA sur PC, Neural Engine / Metal sur Mac). Aucun cloud, aucune carte réseau spécifique requise en dehors du réseau local.

Comparatif

Ce que vous gagnez face aux autres

Notre concurrent le plus direct, KUDO, traduit les conférences dans le cloud et facture à l'usage (réunion, minute, langue) ; TranscriLive est illimité une fois installé, et rien ne quitte vos serveurs. Quant à la voix — vocalisation, clonage — elle n'existe quasiment qu'en cloud, sur des serveurs américains.

TranscriLive
on-premise
KUDO
cloud · facturation à l'usage
Interprétation événementielle
Wordly · Interprefy…
Transcription cloud
Otter · Deepgram · Google · Azure…
IA vocale cloud
OpenAI · ElevenLabs…
100% on-premise, sur vos serveurs~
Aucune donnée dans le cloud
Souveraineté / RGPD (hébergement UE)~~
Illimité — pas de facturation à la minute/heure
Transcription en temps réel~
Traduction temps réel multilingue~~
Diarisation (qui parle, quand)~~~
Vocalisation / voix de synthèse en direct
Clonage de voix~
Diffusion de masse (QR, sous-titres, RTSP/SRT)~~
Fonctionne hors-ligne / réseau local
Oui~ Partiel / en option NonComparatif indicatif par catégorie ; les offres évoluent.

Envie de tester TranscriLive ?

Sur votre infrastructure : on installe un pilote gratuit sur votre environnement, résultats mesurés sur vos propres directs. Ou tout de suite : une démo en ligne, accessible sur notre plateforme de test SaaS.