🎤 Realtime Copilot
Projet d'ingénierie · temps réelIl écoute la réunion, transcrit en continu, repère la question posée et streame une réponse contextualisée, mot à mot, en moins de 2 secondes. L'objectif réel est technique : maîtriser le pipeline audio → STT → LLM en streaming, de bout en bout.
Le temps réel est la prochaine interface des produits IA, et c'est une compétence qui ne s'apprend pas dans un tutoriel. L'architecture se dessine en une heure ; la sensation d'instantanéité, elle, se gagne au réglage : endpointing de la parole, latence du premier token, streaming continu sans à-coups.
Tout le pipeline est en streaming : transcription partielle dès les premiers mots, détection de fin de tour par VAD, premier token LLM visé sous 600 ms grâce au prompt caching. La réponse s'affiche pendant que la personne finit sa phrase.
F·01Latence < 2s
STT partiel, déclenchement à la fin de tour, premier token < 600 ms, prompt caching. Chaque maillon est optimisé pour le streaming.
F·02Capture & transcription live
AudioWorklet PCM 16 kHz → STT streaming Deepgram → VAD/endpointing pour détecter la fin de parole sans couper trop tôt.
F·03Gateway WebSocket
Service temps réel séparé : flux audio bidirectionnel, reconnexion + heartbeat, secrets côté serveur uniquement.
F·04Mock-first
STT et LLM mockés derrière un flag : le pipeline entier tourne et se teste sans clé API.
Onglet ou micro, AudioWorklet PCM 16 kHz.
Transcriptions partielles en continu.
VAD + endpointing, détection de question.
Réponse contextualisée (CV, docs), token par token.