用户说话 → 等待说完 → 完整识别 → 翻译 → 语音合成 → 输出
   ↓         ↓         ↓         ↓       ↓         ↓
 开始说中文   等待结束   识别完成   翻译完成   合成完成   听到英文
 总延迟：3-5秒
