検証: 発話終端判定にLLMは要るか: STTの句読点だけでHaiku並みだった

00:01:11 ・ source: https://zenn.dev/mskbhd/articles/lab-692-100ms

Transcript

hostenToday we test if a fast LLM is really needed to detect when users stop talking in voice chat.
guestja音声チャットでユーザーが話し終わったかを判定するのに、本当に高速LLMが必要なのかを検証した研究ですね。
hostenThey compared three methods: fixed silence timeout, small local models, and Claude Haiku 4.5.
guestja固定の無音待機時間、ローカルの小さいモデル、それにClaude Haiku 4.5という3つの方法を比較しました。
hostenThe surprising finding: just checking for punctuation marks at the STT output matched Haiku's accuracy perfectly.
guestja驚くべき結果として、STTの出力末尾の句読点を見るだけで、Haikuの判定精度とほぼ同じ性能が得られたんです。
hostenHowever, Haiku's 700ms latency was secretly hiding its own mistakes by acting as a fixed delay.
guestjaただし、Haikuの700msの遅延は無意識に待ち時間として機能することで、実は誤判定を隠していたんです。
hostenWhen you add speculative generation, even the fastest judge adds nothing because TTS becomes the bottleneck.
guestja投機的に事前生成する構成なら、どんなに速い判定器を使ってもTTSのレイテンシが限界になって意味がなくなります。