Arquitectura de Traducción:
⚡ A/B COMPARACIÓN MOTOR DE VOZ MENTE 2:
⏩ VELOCIDAD DE LOCUCIÓN:
🎙️ FORMULACIÓN ORAL:
LISTO PARA INICIAR
🎧
PRIVATE_AUDIO_OUTPUT: Auriculares (AirPods / Bluetooth / Cable)
🔬
TELEMETRÍA FORENSE EN VIVO
RUN: PHYSICAL-PENDING
⏱️ Tiempo transcurrido desde START (T0):
AUDIO ES:
--
ANY OAI TEXT:
--
MATCHED TEXT:
--
SUBTITLE:
--
PUBLISH:
--
DISPLAY A:
--
DISPLAY B:
--
OAI EVENTS:
0 recibidos
ÚLTIMO EVENTO RECIBIDO DE OPENAI:
Esperando inicio de sesión...
⚡ Modo de Latencia / Presets A-B-C:
⚡ FULL-DUPLEX TEST (1 MENTE)
NOT YET CONFIRMED
MIC WHILE ES PLAYING:
NO
STT WHILE ES PLAYING:
NO
TRANSLATION WHILE ES:
NO
LOCAL response.cancel:
0
LONGEST OUTPUT GAP:
0 ms
INPUT DEVICE: INACTIVO
👂 MENTE 1 (ESCUCHA / TRAD)
INACTIVO
⇄
🗣️ MENTE 2 (LOCUCIÓN)
IDLE
Solapamiento Activo: 0 ms
Segs en Habla Concurrente: 0
Translation Lead: 0 ms
Buffer Depth: 0 ms
1. MIC
⏳ IDLE
Esperando audio
2. M1 TRAD
⏳ IDLE
0 deltas
3. QUEUE
⏳ IDLE
0 en cola
4. M2 REQ
⏳ IDLE
Sin solicitud
5. TTS REAL
⏳ IDLE
0 bytes
6. STREAM
⏳ IDLE
Buffer listo
7. PLAYING
⏳ IDLE
Silencio
8. AURICULAR
⏳ IDLE
Privado
DIRECCIÓN DE TRADUCCIÓN
🇺🇸 EN ➔ 🇪🇸 ES
ORIGEN (INPUT): English (Auto-detect)
DESTINO (OUTPUT): Español ('es')
🔬 AUDITORÍA EN VIVO (DATOS REALES M1 ➔ COLA ➔ M2)
● VIVO
1. MIC (Frames / Nivel):
INACTIVO (0 frames)
2. STT EN (Whisper):
-- (0 deltas)
3. TRAD ES (Mente 1):
-- (0 deltas)
4. CLASIFICADOR ESTABILIDAD:
IDLE (Sin deltas)
5. TRANSLATION QUEUE:
0 en cola | Encolados: 0 | Desencolados: 0
6. MENTE 2 (LOCUCIÓN):
IDLE (Razón: QUEUE EMPTY)
7. /api/tts NEURAL:
ESPERANDO SEGMENTO
⏱️ LATENCIA 2 MENTES POR ETAPAS (T0 ➔ T8)
Seg #--
T0➔T1 (MIC ➔ STT):
-- ms
T1➔T2 (STT ➔ TRAD):
-- ms
T2➔T3 (TRAD ➔ STABLE):
-- ms
T3➔T4 (STABLE ➔ QUEUE):
-- ms
T4➔T5 (QUEUE ➔ M2):
-- ms
T5➔T6 (M2 ➔ TTS REQ):
-- ms
T6➔T7 (TTS ➔ 1ST AUDIO):
-- ms
T7➔T8 (AUDIO ➔ PLAY):
-- ms
💬 LATENCIA DE SUBTÍTULOS vs AUDIO (¿DÓNDE ESTÁ EL ATRASO?):
T0➔SUB_1 (1er Texto):
-- ms
T0➔SUB_ESTABLE (Estable):
-- ms
SUB_ESTABLE➔AUDIO (M2):
-- ms
ADELANTO SUB vs VOZ:
-- ms
⚡ TOTAL PERCIBIDO (T0 ➔ T8):
Modo: M2 LOW LATENCY
-- ms
🛡️ SCHEDULER MENTE 2 (INVARIANTE DE CERO SUPERPOSICIÓN)
OVERLAP: 0 (OK)
1. M2_ACTIVE_VOICES (≤ 1):
0
2. OVERLAP_COUNT (0):
0
3. TTS_PREFETCH_SEGMENTS:
0
4. PLAYBACK_QUEUE_DEPTH:
0
5. AUDIO_BUFFERED_AHEAD:
0 ms
6. UNDERRUN_COUNT:
0
7. QUEUE_WAIT_MS:
0 ms
8. VALID_PENDING_AUDIO:
0 ms
9. PLAYED_AUDIO_MS:
0 ms
10. CANCELLED_AUDIO_MS:
0 ms
SUBTITLE_LEAD_VS_AUDIO:
-- ms
RECONCILIACIÓN DE CICLO DE VIDA (QUEUE):
Enqueued: 0 = Played: 0 + Cancelled: 0 + Discarded: 0 + Pending: 0
CUADRADO (OK)
📊 SEGUIMIENTO DE SEGMENTOS Y ATRASO ACUMULADO (PELÍCULA):
ORIGEN (ENTRANDO):
#--
SUBTÍTULO (PANTALLA):
#--
LOCUCIÓN (SONANDO M2):
#--
SPEECH_LAG (SEGS):
0 segs
SPEECH_LAG_MS (Atraso Real de Locución):
0 ms
⚖️ RELACIÓN DURACIÓN DE HABLA (VENTANA 30s):
HABLA EN (ORIGINAL):
0.0 s
HABLA ES (TRADUCIDO):
0.0 s
RATIO ES / EN (OUTPUT_SPEECH_RATIO):
(>1.05 indica que el español dura más que el inglés)
1.00x
⚡ CONTROLADOR DE RETRASO & CADENCIA (LAG CONTROLLER)
SYNC (OK)
VELOCIDAD M2 REAL:
1.15x
CADENCIA (WPM):
-- WPM
FORMULACIÓN ORAL:
COMPLETA
RECUPERACIÓN PAUSA:
0 ms (ACTIVA)
LATENCIA TTS (TTFB PERCENTILES):
Tiempo desde request hasta primer audio PCM
P50: -- | P90: -- | P95: --
🚀 DESGLOSE DE ARRANQUE INICIAL (START ➔ 1er AUDIO)
EN ESPERA DE ARRANQUE
1. START ➔ MIC READY:
-- ms
2. MIC ➔ WEBRTC CONN:
-- ms
3. WEBRTC ➔ 1er MIC AUDIO:
-- ms
4. AUDIO ➔ 1er STT (Whisper):
-- ms
5. STT ➔ 1er TRAD ES:
-- ms
6. TRAD ➔ FAST UNIT (3-4 pal):
-- ms
7. COLA ➔ DEQUEUE M2:
-- ms
8. DEQUEUE ➔ TTS REQUEST:
-- ms
9. TTS REQ ➔ 1er PCM BYTE:
-- ms
10. BYTE ➔ FÍSICO AURICULAR:
-- ms
⏱️ TIEMPO TOTAL DE ARRANQUE PERCIBIDO:
Desde click 'Start' hasta primera palabra hablada en auricular
-- ms
🎯 PRINCIPIO DE PRODUCTO: LIVE EDGE & PRESUPUESTO DURO DE ATRASO
LIVE EDGE (OK)
TARGET_LAG_MS (Objetivo):
2000 ms
SOFT_MAX_LAG_MS (Compensación):
4000 ms
HARD_MAX_LAG_MS (Límite Duro):
6000 ms
RECUPERACIONES AL LIVE EDGE:
0
📍 PHYSICAL_LAG_MS (Distancia Canónica al Diálogo de la Película):
Atraso real de locución física (sourceLive - playingSource), independiente del audio bufferizado a futuro
0 ms
⚖️ VELOCIDAD DE GENERACIÓN vs CONSUMO (VENTANA MÓVIL 10s)
EQUILIBRADO
AUDIO ENTRADA (10s):
0.0 s
AUDIO TTS GENERADO (10s):
0.0 s
AUDIO REPRODUCIDO (10s):
0.0 s
AUDIO PENDIENTE (COLA+TIMELINE):
0.0 s
TASA DE PRODUCCIÓN (Gen/In):
1.00x
TASA DE CONSUMO (Play/In):
1.00x
🛡️ AUDITORÍA DE INTEGRIDAD DE TEXTO (CERO DUPLICACIÓN):
Snapshots Convertidos: 0
Duplicados Omitidos: 0
Prefijos Traslapados: 0 B
⏱️ 00:00
🔊 0.0 min
💰 Est: $0.00
🧠 OPENAI SESSIONS: 0
🎧 LISTENERS: 0
📡 SALA DE TRANSMISIÓN CREADA
Escanea este código QR con la cámara del 2do iPhone o abre el enlace:
⏳ Esperando a que el 2do teléfono pulse "ESCUCHAR"...
3. SPANISH TRACK
NOT ATTACHED
4. LISTENER STATE
WAITING
⛪
TRANSMISIÓN EN PANTALLA / PROYECTOR
INACTIVA
CÓDIGO DE SALA:
CHURCH-4821
PANTALLAS CONECTADAS:
0 pantallas
IN-FLIGHT: 0
COALESCED: 0
LAST ACK: #0 (0ms)
Escanea con el proyector / iPad o abre este enlace:
💬
Subtítulos en Pantalla
SYNC
Esperando diálogo para subtitular...
"El audio en inglés reconocido aparecerá aquí..."
"La traducción hablada que escucharás por tus AirPods..."
⚡
Latencia total:
-- ms