Qwen3-Omni — Live-Dialog (Deutsch)

Sprich einfach. Kurze Sprechpause = deine Frage ist fertig. Du kannst jederzeit reinreden (Barge-in).

bereit

Diagnostik — letzter Turn

ab Sprechende bis erster Ton
Latenz-Aufschlüsselung
VAD-Sprechpause
denke → 1. Byte (Server + Netz)
Prebuffer-Wartezeit (Client)
Server-Detail
Thinker TTFT
Talker + Vocoder (1. Chunk)
→ 1. Audio erzeugt (Summe)
Frames / Audio-Länge
Thinker-Tokens
Peak-Deficit (nötiger Puffer)
Transkription (nach Antwort)
Wiedergabe
Chunks empfangen
Underruns (Lücken)
Deficit-Kurve je Chunk (rot = Puffer leert sich, grün = füllt sich)

Verlauf

#ab Sprech.Srv→AudioDeficitUnderr.Tok