仕組みと技術情報
処理フロー
マイク入力(音声)
↓
音声の前処理(ノイズ除去・正規化)
↓
WavLM ベースの感情推定モデル
↓
感情スコア(喜び・悲しみ・怒り・平静)
↓
OSC送信(ローカルネットワーク経由)
↓
VRChat アバター表情反映使用モデル
| コンポーネント | 内容 |
|---|---|
| 音声エンコーダー | WavLM(Microsoft Research) |
| 感情分類器 | SER-Odyssey-Baseline-WavLM-Categorical(微調整済み) |
| 推論フレームワーク | PyTorch |
ローカル処理について
VoxEmoのすべての処理はユーザーのPC内で完結します。
- 音声データはインターネットに送信されません
- 録音ファイルの保存は行いません
- 外部サーバーへの接続は、初回セットアップ時のモデルダウンロードのみです
OSC通信
感情スコアはOSC(Open Sound Control)プロトコルを使ってVRChatに送信されます。
- 送信先:
127.0.0.1:9000(VRChatのOSCデフォルトポート) - 送信間隔: リアルタイム(音声入力に同期)
