AI

日本語 full-duplex 対話モデル J-Moshi-ext に「お嬢様口調」を追加学習する

AI

初めに デモ 開発環境 何をやったか うまくいったこと うまくいかなかったこと 副産物として得られた知見 fine-tune までの手順 1) お嬢様対話コーパスの合成 2) 軽量版: text 側だけを追加学習 3) フル版: 全パラメータを追加学習 4) checkpoint の後処理 5…

日本語 full-duplex 対話モデル J-Moshi-ext に「あみたろ」の声を追加学習する

AI

初めに 開発環境 何をやったか fine-tune までの手順 1) Irodori-TTS を「あみたろ」で fine-tune する 2) 合成対話データセットを作る 3) J-Moshi-ext を全 param fine-tune する 4) checkpoint の後処理 5) live 検証 詰まったポイントと解決 (a) Depforme…

StableTTS v1.1を日本語データセットで日本語継続事前学習をする

AI

初めに 結論 開発環境 g2p を pyopenjtalk-plus に置き換える 前処理 学習 ハマった点 本家 v1.1 との比較 つくよみちゃんで fine tuning 以下の記事で StableTTS をつくよみちゃんコーパスで fine tuning をしてみました。 ayousanz.hatenadiary.jp 今回は …

ModernBERT-Ja で日本語 TTS(G2P)の誤読を検出する

AI

はじめに demo 背景 データセットの作成 学習 評価 はじめに 日本語の TTS(音声合成)、特に OpenJTalk のような G2P(辞書)ベースの方式 を使っていて一番困るのが、固有名詞や新語の 誤読 です。Hugging Face がぎこちなく区切られたり、潤羽るしあ のような…

LFM2.5-Audio-1.5B-JP の音声対話を CUDA Graph でリアルタイム化する

AI

初めに 結論 開発環境 対策: Depthformer と backbone を CUDA Graph 化する Depthformer ループ backbone 初めに LFM2.5-Audio-1.5B-JP は、音声入力に対してテキストと音声を生成する日本語 speech-to-speech(s2s)会話モデルです。 前回までの記事で、こ…

LFM2.5-Audio-1.5B-JP に LoRA でずんだもんの声を追加学習をしてずんだもんの口調およびボイスのモデルを作る

AI

初めに デモ 開発環境 口調のみ版から声込み版で何を変えたか データ作成 1) VOICEVOX ずんだもん音声の合成 学習 初めに LFM2.5-Audio-1.5B-JP は、音声入力に対してテキストと音声を interleaved に生成できる日本語 speech-to-speech(s2s)会話モデルで…

LFM2.5-Audio-1.5B-JP に LoRA でずんだもん口調を追加学習する

AI

初めに 開発環境 環境構築 peft の入れ方 Windows の Triton 回避 データ作成 学習 評価 音声対話デモ 初めに LFM2.5-Audio-1.5B-JP は、音声入力に対して「新しい返答内容」を音声で返す日本語の speech-to-speech(s2s)会話モデルです。このモデルに LoRA…

windowsでLFM2.5-Audio-1.5B-JPのspeech-to-speechを動かす

AI

初めに 開発環境 環境構築 実行 初めに 以下で軽量な日本語speech to speechのモデルが公開されたので、触ってみます Today we’re releasing two new models for Japanese: LFM2.5-Audio-1.5B-JP (audio) and LFM2.5-1.2B-JP-202606 (text). pic.twitter.com…

X-VCをWindowsネイティブ + uvで動かして英語音声変換を試してみる

AI

初めに 開発環境 重要なポイント 環境構築 モデルの準備 実行 実行結果 初めに 今回は、ゼロショットの音声変換ライブラリ X-VC を Windows ネイティブ環境で動かして、英語音声のオフライン変換を試してみます。 github.com 開発環境 Windows 11 uv 0.9.x P…

TimesFM 2.5を使って東京の気温とVTI株価をゼロショット予測する

AI

初めに 開発環境 環境構築 Python バージョンの注意 仮想環境の作成 パッケージのインストール インストールの確認 データの取得 東京の気温(meteostat) VTI株価(yfinance) モデルの読み込みとコンパイル 重みのダウンロード ForecastConfigによるコンパ…

LongCat-AudioDiTの3.5Bモデルを使ってゼロショットTTSの推論をしてみる

AI

初めに 開発環境 環境構築 リポジトリのクローン Python バージョンの固定 pyproject.toml の作成 依存関係のインストール 3.5B モデルを動かすための工夫 VRAM の問題 inference.py の修正 Windows の cp932 エンコーディング問題 推論の実行 中国語テキス…

WebUtauをローカル構築して闇音レンリで日本語歌声合成を試してみた

AI

初めに 開発環境 WebUtauの全体構成 環境構築 リポジトリのクローン フロントエンドのセットアップ バックエンドのビルド ボイスバンクとボコーダーのダウンロード ボイスバンクディレクトリの準備 闇音レンリ DiffSingerのダウンロード NSF-HiFiGANボコーダ…

piper-plusの日本語TTSをOpenJTalkのアクセントラベルで改善してみた

初めに 開発環境 OpenJTalkのフルコンテキストラベルとは 韻律記号への変換 「N」の文脈依存変異 環境構築 前処理でのラベル適用 espeak-ng(ラベルなし)での前処理 OpenJTalk(ラベルあり)での前処理 学習への韻律情報注入 所感 初めに 日本語のTTSでは、…

piper-plusのPython SDKを使って日本語TTSの推論をしてみる

初めに 開発環境 環境構築 プロジェクトの作成 インストール 日本語モデルのダウンロード 基本的な推論 Pythonコードからの推論 GPU推論 CLIからの推論 ストリーミング合成 カスタム辞書と直接フォネム入力 所感 初めに 今回は、自分が開発しているTTSライブ…

日本語を含む6言語対応の軽量TTS「piper-plus」をバイナリファイルから実行して推論する

初めに 開発環境 バイナリのダウンロードと確認 モデルのダウンロード 推論 初めに スマホやIoTでも動かすことができる日本語を含む6言語対応の軽量TTSのpiper-plusを公開しています 学習も自由にできるようにOSSとして公開しています github.com piper-plus…

スピーカー参照条件付きのマルチスピーカー音声合成拡散モデル「Echo-TTS」をWindowsで推論をする

AI

初めに 開発環境 環境構築 実行 初めに 拡散モデルのTTSのEcho-TTSを動かしてみます github.com 制限事項としては以下になります 主に英語向け(学習データに日本語が含まれるかは不明) 音声出力は CC-BY-NC-SA-4.0(非商用)ライセンス 開発環境 Windows 1…

LuxTTSを日本語g2p対応をして学習を行い、日本語の音声合成に対応する

初めに 開発環境 環境構築 初めに ZipVoice をベースにして推論を高速化した LuxTTSを今回は日本語対応をしていきます github.com 基本的にpyopenjtalkを使って日本語のg2pを入れて学習をする流れです 対応済みのリポジトリは以下で公開しています github.co…

リアルタイム音声アプリケーション向けのオンデバイス音声認識(STT)ライブラリでマルチプラットフォームに対応している Moonshine VoiceをWindowsで動かす

AI

初めに 開発環境 環境構築 実行 初めに リアルタイム音声アプリケーション向けのオンデバイス音声認識(STT)ライブラリでマルチプラットフォームに対応している Moonshine Voiceを触ってみます github.com 開発環境 Windows 11 uv 0.9.x cuda 13.0 環境構築 …

動画セグメンテーションの軽量なエンコーダのみのViTモデルをWindowsで動かす

AI

初めに 開発環境 環境構築 1. Detectron2をクローンしてC++拡張を無効化 2. pyproject.toml の detectron2 ソースをローカルパスに変更 3. 依存パッケージをインストール CUDA バージョンについて 実行 初めに 以下のような動画の軽量なセグメンテーションの…

ACL 2024論文「EconAgent」でGPT-4.1-miniによる100人規模のマクロ経済シミュレーションを動かす

AI

初めに 開発環境 環境構築 シミュレーション実行 仕組み シミュレーション結果 マクロ経済指標 失業率 資産分布 結果からわかること 初めに EconAgentは、LLMを経済エージェントの意思決定エンジンとして使い、マクロ経済活動をシミュレートするフレームワー…

大規模社会シミュレーションを行うマルチエージェントシステム「Agent-Kernel」を用いて災害対応シミュレーションで多様性がもたらす推定を行う

AI

初めに 開発環境 実験設計 シナリオ 専門家のリング構造 エージェントの行動 実験条件 環境構築 実行 シミュレーション実行 実験結果 結果のポイント 可視化ダッシュボード まとめ 参考 初めに 大規模社会シミュレーションを行うフレームワーク Agent-Kernel…

音声から3Dフェイシャルアニメーションを生成する「UniTalker」を実行する

AI

初めに 開発環境 環境構築 実行 初めに 音声から3Dフェイシャルアニメーションを生成する統合ニューラルネットワークモデル「UniTalker」を実行してみます uvに統合 + ドキュメントの日本語対応したforkリポジトリは以下です github.com サンプル音声を実行…

自己教師あり音声特徴量に対する線形回帰のみで音声変換を行うLinearVCを動かす

AI

初めに 開発環境 環境構築 データの準備 LibriSpeech dev-clean のダウンロード サブセットの作成 実行 パターン1: LibriSpeech 1272 → つくよみちゃん(英語男性 → 日本語女性) パターン2: つくよみちゃん → LibriSpeech 1272(日本語女性 → 英語男性) パ…

Roboflow の trackers ライブラリで YOLO + ByteTrack による動画マルチオブジェクト追跡をする

AI

初めに 結果 開発環境 環境構築 テスト用動画のダウンロード デモスクリプトの解説 引数 検出 追跡 可視化 ソースコード全文 実行 初めに trackers は、Roboflow が提供するマルチオブジェクト追跡(MOT)アルゴリズムのクリーンルーム実装ライブラリです。A…

MaAI(間合い)は、リアルタイム・軽量な非言語行動生成ソフトウェア「MaAI」を使って、日本語音声ファイルからターンテイキング予測・相槌予測・うなずき予測を行う

AI

初めに 開発環境 環境構築 実行 初めに MaAIはリアルタイム・連続的な非言語行動生成ソフトウェアです。音声対話システムやロボット向けに、ターンテイキング予測・相槌予測・うなずき予測・VADされている. github.com 開発環境 Windows 10/11 Python 3.10以…

LLM推論ベースのツリーインデックスRAG「PageIndex」でPDF/Markdownから階層構造を抽出する

AI

初めに 開発環境 環境構築 PDFの処理 Markdownの処理 主なオプション 初めに github.com PageIndexは、ベクトルDBやチャンキングを使わず、LLMの推論によって階層ツリーインデックスを構築するRAGシステムです。PDF/Markdownから目次のようなツリー構造を自…

MegaTTS3の英語推論環境をWindowsで構築してGradioから音声合成をする

AI

初めに 開発環境 重要な制約 環境構築 実行 初めに bytedanceから英語・中国語に対応したTTSモデルが公開されたので動かしてみます github.com 開発環境 Windows uv が利用可能 Python 3.10 重要な制約 WeTextProcessing と pynini は Windows でのビルドが…

音声とテキストから発話の時間境界付きの Praat TextGrid を生成する「Wav2TextGrid」を英語音声で試してみる

AI

初めに モデル/アーキテクチャ 開発環境 環境構築 実行 初めに まだ試験的ですが以下のライブラリが出てきていたので触ってみます github.com 対応言語は英語のみのため、日本語を使いたい場合は自前で学習する必要があります。 モデル/アーキテクチャ Wav…

音楽生成モデルのheartlibで英語・日本語の歌詞付き音楽を生成をする

AI

初めに 開発環境 環境構築 実行 初めに 以下でOSSで音楽生成モデルが出たので、さわってみます github.com 開発環境 Python 3.10 CUDA 12.x対応GPU UV (Pythonパッケージマネージャー) 環境構築 以下の設定をpyproject.tomlに追加(CUDA 12.4 + Flash Attent…

CosyVoiceのonnxモデルをUnityで動かして音声合成をするときのopset versionについて

初めに 開発環境 ONNX Opsetバージョン問題 初めに 昨日に CosyVoice3をonnxにして pytorchに依存せずに動かしてみました ayousanz.hatenadiary.jp 今回はここで変換をしたonnxをUnityで動かして、UnityだけでCosyVoiceのモデルから推論をしてみたいと思いま…