Skip to content

仕組みと技術情報 ​

処理フロー ​

マイク入力(音声)
    ↓
音声の前処理(ノイズ除去・正規化)
    ↓
WavLM ベースの感情推定モデル
    ↓
感情スコア(喜び・悲しみ・怒り・平静)
    ↓
OSC送信(ローカルネットワーク経由)
    ↓
VRChat アバター表情反映

使用モデル ​

コンポーネント内容
音声エンコーダーWavLM(Microsoft Research)
感情分類器SER-Odyssey-Baseline-WavLM-Categorical(微調整済み)
推論フレームワークPyTorch

ローカル処理について ​

VoxEmoのすべての処理はユーザーのPC内で完結します。

  • 音声データはインターネットに送信されません
  • 録音ファイルの保存は行いません
  • 外部サーバーへの接続は、初回セットアップ時のモデルダウンロードのみです

OSC通信 ​

感情スコアはOSC(Open Sound Control)プロトコルを使ってVRChatに送信されます。

  • 送信先: 127.0.0.1:9000(VRChatのOSCデフォルトポート)
  • 送信間隔: リアルタイム(音声入力に同期)

VoxEmo — あなたの声に表情がつくギミック