AI
初めに デモ 開発環境 何をやったか うまくいったこと うまくいかなかったこと 副産物として得られた知見 fine-tune までの手順 1) お嬢様対話コーパスの合成 2) 軽量版: text 側だけを追加学習 3) フル版: 全パラメータを追加学習 4) checkpoint の後処理 5…
初めに 開発環境 何をやったか fine-tune までの手順 1) Irodori-TTS を「あみたろ」で fine-tune する 2) 合成対話データセットを作る 3) J-Moshi-ext を全 param fine-tune する 4) checkpoint の後処理 5) live 検証 詰まったポイントと解決 (a) Depforme…
初めに 結論 開発環境 g2p を pyopenjtalk-plus に置き換える 前処理 学習 ハマった点 本家 v1.1 との比較 つくよみちゃんで fine tuning 以下の記事で StableTTS をつくよみちゃんコーパスで fine tuning をしてみました。 ayousanz.hatenadiary.jp 今回は …
はじめに demo 背景 データセットの作成 学習 評価 はじめに 日本語の TTS(音声合成)、特に OpenJTalk のような G2P(辞書)ベースの方式 を使っていて一番困るのが、固有名詞や新語の 誤読 です。Hugging Face がぎこちなく区切られたり、潤羽るしあ のような…
初めに 結論 開発環境 対策: Depthformer と backbone を CUDA Graph 化する Depthformer ループ backbone 初めに LFM2.5-Audio-1.5B-JP は、音声入力に対してテキストと音声を生成する日本語 speech-to-speech(s2s)会話モデルです。 前回までの記事で、こ…
初めに デモ 開発環境 口調のみ版から声込み版で何を変えたか データ作成 1) VOICEVOX ずんだもん音声の合成 学習 初めに LFM2.5-Audio-1.5B-JP は、音声入力に対してテキストと音声を interleaved に生成できる日本語 speech-to-speech(s2s)会話モデルで…
初めに 開発環境 環境構築 peft の入れ方 Windows の Triton 回避 データ作成 学習 評価 音声対話デモ 初めに LFM2.5-Audio-1.5B-JP は、音声入力に対して「新しい返答内容」を音声で返す日本語の speech-to-speech(s2s)会話モデルです。このモデルに LoRA…
初めに 開発環境 環境構築 実行 初めに 以下で軽量な日本語speech to speechのモデルが公開されたので、触ってみます Today we’re releasing two new models for Japanese: LFM2.5-Audio-1.5B-JP (audio) and LFM2.5-1.2B-JP-202606 (text). pic.twitter.com…
初めに 開発環境 重要なポイント 環境構築 モデルの準備 実行 実行結果 初めに 今回は、ゼロショットの音声変換ライブラリ X-VC を Windows ネイティブ環境で動かして、英語音声のオフライン変換を試してみます。 github.com 開発環境 Windows 11 uv 0.9.x P…
初めに 開発環境 環境構築 Python バージョンの注意 仮想環境の作成 パッケージのインストール インストールの確認 データの取得 東京の気温(meteostat) VTI株価(yfinance) モデルの読み込みとコンパイル 重みのダウンロード ForecastConfigによるコンパ…
初めに 開発環境 環境構築 リポジトリのクローン Python バージョンの固定 pyproject.toml の作成 依存関係のインストール 3.5B モデルを動かすための工夫 VRAM の問題 inference.py の修正 Windows の cp932 エンコーディング問題 推論の実行 中国語テキス…
初めに 開発環境 WebUtauの全体構成 環境構築 リポジトリのクローン フロントエンドのセットアップ バックエンドのビルド ボイスバンクとボコーダーのダウンロード ボイスバンクディレクトリの準備 闇音レンリ DiffSingerのダウンロード NSF-HiFiGANボコーダ…
初めに 開発環境 OpenJTalkのフルコンテキストラベルとは 韻律記号への変換 「N」の文脈依存変異 環境構築 前処理でのラベル適用 espeak-ng(ラベルなし)での前処理 OpenJTalk(ラベルあり)での前処理 学習への韻律情報注入 所感 初めに 日本語のTTSでは、…
初めに 開発環境 環境構築 プロジェクトの作成 インストール 日本語モデルのダウンロード 基本的な推論 Pythonコードからの推論 GPU推論 CLIからの推論 ストリーミング合成 カスタム辞書と直接フォネム入力 所感 初めに 今回は、自分が開発しているTTSライブ…
初めに 開発環境 バイナリのダウンロードと確認 モデルのダウンロード 推論 初めに スマホやIoTでも動かすことができる日本語を含む6言語対応の軽量TTSのpiper-plusを公開しています 学習も自由にできるようにOSSとして公開しています github.com piper-plus…
初めに 開発環境 環境構築 実行 初めに 拡散モデルのTTSのEcho-TTSを動かしてみます github.com 制限事項としては以下になります 主に英語向け(学習データに日本語が含まれるかは不明) 音声出力は CC-BY-NC-SA-4.0(非商用)ライセンス 開発環境 Windows 1…
初めに 開発環境 環境構築 初めに ZipVoice をベースにして推論を高速化した LuxTTSを今回は日本語対応をしていきます github.com 基本的にpyopenjtalkを使って日本語のg2pを入れて学習をする流れです 対応済みのリポジトリは以下で公開しています github.co…
初めに 開発環境 環境構築 実行 初めに リアルタイム音声アプリケーション向けのオンデバイス音声認識(STT)ライブラリでマルチプラットフォームに対応している Moonshine Voiceを触ってみます github.com 開発環境 Windows 11 uv 0.9.x cuda 13.0 環境構築 …
初めに 開発環境 環境構築 1. Detectron2をクローンしてC++拡張を無効化 2. pyproject.toml の detectron2 ソースをローカルパスに変更 3. 依存パッケージをインストール CUDA バージョンについて 実行 初めに 以下のような動画の軽量なセグメンテーションの…
初めに 開発環境 環境構築 シミュレーション実行 仕組み シミュレーション結果 マクロ経済指標 失業率 資産分布 結果からわかること 初めに EconAgentは、LLMを経済エージェントの意思決定エンジンとして使い、マクロ経済活動をシミュレートするフレームワー…
初めに 開発環境 実験設計 シナリオ 専門家のリング構造 エージェントの行動 実験条件 環境構築 実行 シミュレーション実行 実験結果 結果のポイント 可視化ダッシュボード まとめ 参考 初めに 大規模社会シミュレーションを行うフレームワーク Agent-Kernel…
初めに 開発環境 環境構築 実行 初めに 音声から3Dフェイシャルアニメーションを生成する統合ニューラルネットワークモデル「UniTalker」を実行してみます uvに統合 + ドキュメントの日本語対応したforkリポジトリは以下です github.com サンプル音声を実行…
初めに 開発環境 環境構築 データの準備 LibriSpeech dev-clean のダウンロード サブセットの作成 実行 パターン1: LibriSpeech 1272 → つくよみちゃん(英語男性 → 日本語女性) パターン2: つくよみちゃん → LibriSpeech 1272(日本語女性 → 英語男性) パ…
初めに 結果 開発環境 環境構築 テスト用動画のダウンロード デモスクリプトの解説 引数 検出 追跡 可視化 ソースコード全文 実行 初めに trackers は、Roboflow が提供するマルチオブジェクト追跡(MOT)アルゴリズムのクリーンルーム実装ライブラリです。A…
初めに 開発環境 環境構築 実行 初めに MaAIはリアルタイム・連続的な非言語行動生成ソフトウェアです。音声対話システムやロボット向けに、ターンテイキング予測・相槌予測・うなずき予測・VADされている. github.com 開発環境 Windows 10/11 Python 3.10以…
初めに 開発環境 環境構築 PDFの処理 Markdownの処理 主なオプション 初めに github.com PageIndexは、ベクトルDBやチャンキングを使わず、LLMの推論によって階層ツリーインデックスを構築するRAGシステムです。PDF/Markdownから目次のようなツリー構造を自…
初めに 開発環境 重要な制約 環境構築 実行 初めに bytedanceから英語・中国語に対応したTTSモデルが公開されたので動かしてみます github.com 開発環境 Windows uv が利用可能 Python 3.10 重要な制約 WeTextProcessing と pynini は Windows でのビルドが…
初めに モデル/アーキテクチャ 開発環境 環境構築 実行 初めに まだ試験的ですが以下のライブラリが出てきていたので触ってみます github.com 対応言語は英語のみのため、日本語を使いたい場合は自前で学習する必要があります。 モデル/アーキテクチャ Wav…
初めに 開発環境 環境構築 実行 初めに 以下でOSSで音楽生成モデルが出たので、さわってみます github.com 開発環境 Python 3.10 CUDA 12.x対応GPU UV (Pythonパッケージマネージャー) 環境構築 以下の設定をpyproject.tomlに追加(CUDA 12.4 + Flash Attent…
初めに 開発環境 ONNX Opsetバージョン問題 初めに 昨日に CosyVoice3をonnxにして pytorchに依存せずに動かしてみました ayousanz.hatenadiary.jp 今回はここで変換をしたonnxをUnityで動かして、UnityだけでCosyVoiceのモデルから推論をしてみたいと思いま…