2024-01-01から1年間の記事一覧

Spatial Reality Display ELF-SR2のセットアップをする

初めに 開発環境 SDKのインストール Unity プラグインのダウンロード ディスプレイの設定 初めに ELF-2を触らせていただく機会があったので、とりあえずセットアップ方法をまとめます 開発環境 Windows 11 SDKのインストール 以下から開発用のSDKをインスト…

StableTTSでつくよみちゃんコーパスを使ってfine tuingをする

AI

初めに 環境 準備 ライブラリのインストール モデルのアップロード 音声ファイルのアップロードと学習用テキストの作成 前処理 fine tuningの実行 fine tuingモデルで推論 事前学習をする場合 初めに 以下の記事でStableTTSで推論をしてみました。今回はfine…

StableTTSで音声合成を試す

AI

初めに 環境 ライブラリのインストール モデルのアップロード WebUI画面の起動 音声合成 推論時間の計測 備考 初めに 拡散モデルのTTSで(一応)日本語対応されているライブラリの StableTTSを触っていきます github.com 環境 L4 GPU ubuntu22.04 ライブラリの…

時系列基盤amazon chronos-t5をサンプルデータでfine tuningをする

AI

初めに 環境 ライブラリのインストール データの取得と分析 データ形式の変換 推論 モデルのロード 推論実行及びグラフにプロット fine tuing ライブラリのインストール 学習用のデータの変換 参考サイト fine tuing 追加学習モデルを使った推論 初めに 過去…

Google ColobでDeepPhonemizerを使ってテキストを音素への変換をする

AI

初めに 開発環境 モデルのダウンロード ライブラリのインストール テキストから音素を取得 初めに 以下を使ってテキストから音素を取得してみます。モデルは日本語は対応していないみたいなので、英語で試します github.com 開発環境 Google Colob (Free) モ…

GoogleColobで音声ファイルのチャンネル数を確認する

開発環境 コード 開発環境 Google Colob コード # ffmpegのインストール !apt-get install ffmpeg # チャンネル数の確認 !ffprobe -i file_name -show_streams -select_streams a:0 -loglevel error | grep channels 以下のように出力されます channels=1

高速フーリエ変換(FFT)を使って音の解析および特定の周波数の除く

開発環境 音の解析 特定の周波数のみの音にする 開発環境 Google Colob T4(Free) 音の解析 以下で sample.wav に対する周波数別の解析をします import numpy as np import matplotlib.pyplot as plt import japanize_matplotlib from scipy.io import wavfil…

xvector_jtubespeechを使って日本語音声のxベクトル抽出器を行う

AI

初めに 開発環境 準備 モデルのダウンロード サンプル音声のアップロード x-vectorの実行 初めに 日本語の音声の話者表現ベクトルを抽出できるライブラリおよびモデルが公開されたので、使ってみます。この記事では、ReadMe + サンプリング変換コードのみに…

Google Colabで時系列基盤モデルのGoogle timesfmを試す

AI

初めに 開発環境 ライブラリのインストール データのダウンロードおよび整理 モデルのロード 推論 各種ライブラリのver 初めに 時系列基盤モデルでどんなことができるのか気になったので、以下の記事を実際に試してみます note.com 開発環境 Google Colob T4…

GoogleColobでstabilityai/stable-audio-open-1.0を動かす

AI

初めに 開発環境 ライブラリのインストール シークレットトークンの設定 モデルのロードおよび生成 初めに Audio生成でかなり精度が高いモデルが出たので触ってみます huggingface.co 開発環境 Google Colob T4(Free) ライブラリのインストール # 必要なパッ…

UnityでReadOnly状態AnimationClipをyamlファイルから変更してEventを追加する

初めに 開発環境 Animationにイベントを追加 アニメーションクリップのyamlの確認 アニメーションイベントのyaml定義の確認 任意の時間にイベントを追加 参考サイト 初めに UnityでAnimation Clipを使ってアニメーションを制御することはよくあります。しか…

画像処理・クラスタリングを用いて画像内の色を単色化する

初めに 開発環境 アプローチの方針 ライブラリのインストール k-means法 デモ コード DBSCAN法 デモ コード GMM法 デモ コード 初めに ある画像から近い色同士で色をまとめてほしい時があります。この際に使用できる画像処理やクラスタリングの手法を試して…

GCP-GPUでのCould not load library libcudnn_cnn_train.so.8.のエラー対応

初めに 開発環境 エラー詳細 解決方法 参考記事 初めに AI周りの学習でtorchを使うことがありますが、cudannのエラーによって学習が始めらない問題にぶつかったので解決方法をメモしておきます 開発環境 GCP torch version : 2.3.0+cu121 cuda 12.1 Python 3…

指定したディレクトリ内のすべてのwavファイルのパスを再帰的に取得してtxtファイルに保存する

開発環境 詳細 開発環境 Windows 11 Python 3.11.7 詳細 以下のコードで指定したディレクトリ内のwavファイルのパスを一覧にしたテキストファイルが出力されます # 指定したディレクトリ内のすべてのファイルのパスを再帰的に取得し、txtファイルに保存する…

TransformersのOptimumを使ってモデルをonnxに変換する

AI

開発環境 準備 モデルの変換 開発環境 Ubutntu 22.02 準備 まずは以下のライブラリをインストールします python -m pip install optimum モデルの変換 例として、cyberagent/open-calm-smallを変してみます。 変換する際には、以下のコマンドで変換すること…

NVidia MAXINE AFX SDKを使って音声のノイズ除去をする

AI

初めに 環境 準備 実行 NVIDIA Broadcastとの比較 参考記事 初めに 音声のノイズ除去はいろいろ方法がありますが、MAXINE-AFX-SDKを試していきます 環境 Windows 11 準備 まずは以下でライブラリをcloneしてきます git clone https://github.com/NVIDIA/MAXI…

GoogleColobでstabilityai/japanese-stablelm-2-instruct-1_6bを動かす

AI

初めに 環境 準備 モデルのロード 推論 初めに Stability AIから新しいLLMモデルが出たので試していきます。 日本語特化の言語モデル「Japanese Stable LM 2 1.6B」をリリースしましたJapanese Stable LM 2 1.6B(JSLM2 1.6B)は16億パラメータで学習した日…

Unity Sentisを使ってonnxでデバイスのみで動くSTTを実装する

初めに Demo 開発環境 ライブラリの準備 モデルの設定 スクリプトと音声の設定 実行 初めに 以下のモデルを触ってみます huggingface.co Demo 以下のように動作します!動画内の音声は、huggingfaceに含まれているサンプル音声になります www.youtube.com ま…

Unity Sentisを使ってonnxでデバイスのみで動くLLMを実装する

初めに Demo 開発環境 ライブラリのインストール モデルのダウンロード モデルとスクリプトのUnityへの配置 Unity側でLLMの実行 初めに Unityが Unity Sentisで動く phi 1.5のONNXのモデルを公開しているので、こちらを動かしていきます huggingface.co (注)…

Unity Sentisを使ってonnxでデバイスのみで動くTTSを実装する

初めに Demo 開発環境 ライブラリのインストール モデルの設定 スクリプトの設定 TTSの実行と再生 初めに UnityがUnitySentisを使ってTTSを実装できるようなサンプル?モデルを公開しているので、動かしていきます huggingface.co Demo デモでは、文字を入力…

Ubuntu 22.02の開発環境構築手順

AI

初めに 開発環境 詳細 現状の確認 システムの最新化 NVIDEA ドライバーのインストール CUDA toolkitのインストール システムの再起動 パスの追加 cuda toolkitの確認 初めに 開発環境 Ubuntu 22.02 詳細 現状の確認 lspci | grep -i nvidia システムの最新化…

datasets経由でoscar-corpus/OSCAR-2301をダウンロードする

初めに 開発環境 ライブラリのインストール データセットのダウンロード 初めに テキストのコーパスとして以下のoscar-corpus/OSCAR-2301があります。こちらをダウンロードするコードのメモになります huggingface.co 開発環境 Ubuntu 22.02 ライブラリのイ…

bertモデルを使ってlivedoorニュースの分類をする

AI

初めに 環境 準備 ライブラリのインストール データの取得と整理 モデルの学習 モデルの評価 モデルの保存とhuggingfaceへのアップロード 追加学習をしたモデルを使って分類 初めに 色々LLMを触ってきて、ちゃんと?bertを触ったことがないので以下の記事を自…

LinuxでnvitopでGPU・CPU・メモリの監視をする

初めに 開発環境 詳細 初めに CLI上でメモリやGPUの使用量を監視するためのコマンドは以下のようなものがあります top(CPUとメモリ) htop(CPUとメモリ) nvidia-smi(GPUがメイン) github.com 公式のReadMeを見ると以下のように見えるとのことです 開発環境 Ub…

huggingfaceのCacheパスを変更する

AI

開発環境 詳細 開発環境 Windows 11 詳細 以下を参考に参照するパスを変更します。ターミナルを立ち上げるごとに設定する必要があります huggingface.co $env:HF_DATASETS_CACHE = "full path"

日本語を含むZipファイルをコマンドから解凍する

初めに 開発環境 詳細 インストール 一つのファイルを解凍 フォルダ内すべてを解凍 初めに zipファイルを解凍するコマンドでは、日本語を含むzipファイルの場合文字化けをします。そこで違うコマンドを使用します 開発環境 Mac 詳細 インストール brew insta…

ESPNet2を使った音声とテキストのアライメント処理

AI

開発環境 ライブラリのインストール アライメント処理 開発環境 Ubuntu 22.02 Python 3.10 ライブラリのインストール 以下で必要なライブラリを入れます pip install soundfile espnet_model_zoo torch sudo pip install soundfile espnet_model_zoo torch …

KenLMで日本語文章の品質の評価

AI

初めに 開発環境 環境構築 評価コード 結果 sentencepieceを使った場合 参考サイト 初めに 以下でLLMを使って文章の評価をしていますが、速度が速いと言われるKenLMでも評価してみます ayousanz.hatenadiary.jp 開発環境 Ubuntu22.02 環境構築 sudo apt inst…

複数のLLMのPerplexityの精度を比較して、文章の自然さを判定を試す

AI

初めに 環境 準備 比較対象のモデル 対象のデータ 複数のモデルでPerplexityの値を取得 結果 初めに 環境 L4 GPU ubuntu22.04 準備 ライブラリをインストールします pip install torch transformers huggingface_hub 比較対象のモデル stabilityai/StableBel…

cl-tohoku/bert-base-japaneseを使って文章の自然さを判定する

AI

開発環境 ライブラリのインストール データの準備 文章の自然さの判定 開発環境 Ubuntu 22.02 Python 3.10 ライブラリのインストール pip install torch transformers pip install fugashi ipadic データの準備 以下のようなデータを準備します それと僕が材…