本記事はAIを活用して自動収集・要約しています。サムネイルおよび画像もAIツールを使用して生成しています。
概要
Hugging FaceとCerebrasが協業し、Gemma 4を活用したリアルタイム音声AIのデモを公開しました。音声AIでは応答の遅延(レイテンシ)が体験を大きく左右しますが、この取り組みでは人同士の会話に近いテンポでのやり取りを目指しています。
音声対話パイプラインの構成
オープンかつモジュール化された音声対話(Speech-to-Speech)パイプラインとして実装されています。
- 音声入力:NVIDIAのParakeetによる音声認識
- 処理:Cerebras基盤上でのGemma 4 VLM(視覚言語モデル)による推論
- 音声出力:AlibabaのQwen3TTSによる音声合成
各コンポーネントは差し替え・検証が可能で、用途に応じて開発者がカスタマイズできる構成です。
レイテンシへの取り組み
本番環境の音声システムでは、応答時間の中央値は許容範囲でも、P95(上位95パーセンタイル)で数秒の遅延が生じることがあります。Cerebrasが言語モデルの推論層を最適化することで、パイプライン全体で予測可能な性能を実現します。この安定性は、複数回の会話ターンを要するシステムで特に重要になります。
実用例
この技術はすでにロボット「Reachy Mini」で活用されており、9,000台以上が稼働しているとされています。応答性の高さは性能指標にとどまらず、身体性を持つAI(embodied AI)との対話体験の質を左右する要素と位置づけられています。
関連リソース
- デモ:Hugging Face Space(HF Realtime Voice)
- リポジトリ:GitHub上の huggingface/speech-to-speech
出典:Hugging Face「Hugging Face and Cerebras bring Gemma 4 to real-time voice AI」(2026年7月1日)https://huggingface.co/blog/cerebras-gemma4-voice-ai









