Kana & Mari

Kana & Mari's SoundRepos (Japanese)

※この番組は日本語でお届けします。 Kana と Mari が、GitHub で見つけた TTS・MIDI・Audio など “音” にまつわる注目リポジトリを声で紹介。 音とコードが交差するオープンソースの世界を軽やかにナビゲートします。 Kana と Mari のプロフィールはこちら: Kana – Newbie Esports Caster Mari – Newbie Esports Analyst ※ 本番組の原稿は生成 AI を用いて自動生成されています。内容には誤りを含む可能性がありますので参考情報としてお楽しみください。

Author

Kana & Mari

Category

Technology

Podcast website

www.aquariumy.co.jp

Latest episode

Jul 10, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

yl365/MoneyPrinterTurboEasy 10.07.2026

このリポジトリは、ユーザーが入力したテーマからAIで口述文案を生成し、Pexels/Pixabayの動画素材や音声と組み合わせて短尺の音声付き動画を作成するためのデスクトップアプリです。READMEでは「一句話で专业爆款短视频を生成」と説明されており、設定ファイルを編集して実行する形の動画生成ツールとして提供されています。

balisujohn/tortoise.cpp 09.07.2026

GGMLベースでTortoise-TTSをC++へ移植した音声合成(TTS)プロジェクトです。CPU/CUDA/一部Metalで動作し、モデルファイルと話者ボイスファイルを読み込んで、コマンドラインから音声を生成します。README上では、音声プロンプトの文字種制限やボイス追加方法も案内されています。

keonlee9420/Cross-Speaker-Emotion-Transfer 08.07.2026

PyTorchで実装された、話者条件付きLayer Normalizationと半教師あり学習を用いるクロススピーカー感情転送TTS(Text-to-Speech)モデルのリポジトリです。学習・推論・評価・前処理の一連の処理に対応しており、RAVDESSなどの感情音声データセットを使って、話者と感情を制御した音声合成を行います。

journey-ad/CosyVoice2-Ex 08.07.2026

CosyVoice2-Ex は、CosyVoice2 を拡張した音声合成(TTS)向けの WebUI/API リポジトリです。事前学習音色の利用、3秒程度の高速音色クローン、自然言語による発話制御、自動音声認識、音色保存、API 提供を行い、Windows / Linux / macOS での利用を想定しています。

Aratako/MioTTS-Inference 08.07.2026

MioTTSという軽量・高速なTTSモデルの推論用リポジトリで、OpenAI互換APIを持つLLM推論基盤(llama.cpp、Ollama、vLLMなど)をバックエンドとして音声合成を行います。REST APIと簡易WebUIを提供し、参照音声プリセットの登録やBest-of-Nによる品質選択にも対応しています。

sfortis/openai_tts 06.07.2026

Home Assistant向けのカスタムTTS統合で、OpenAIの音声合成APIおよびOpenAI互換バックエンドを使ってテキストを音声再生します。複数のTTSプロファイル、音声・モデル・音声形式の選択、ジングル追加、音量正規化、再生前後の音量復元や一時停止/再開など、アナウンス用途の機能が中心です。

yerfor/SyntaSpeech 05.07.2026

SyntaSpeechは、IJCAI 2022論文の公式PyTorch実装で、語法情報を取り入れた非自回帰Text-to-Speech(TTS)システムです。句法グラフの構築・エンコードと、多長度の敵対的学習を用いて、韻律や音質を改善しつつ推論を高速化することを目的としています。LJSpeech、Biaobei、LibriTTSに対応し、学習・推論・データ前処理の一連のパイプラインを提供します。

soobinseo/Tacotron-pytorch 04.07.2026

TacotronのPyTorch実装で、テキストから音声波形を生成するTTS(Text-to-Speech)モデルを学習・推論するためのリポジトリです。LJSpeechデータセットを前提に、テキスト前処理、メル/線形スペクトログラム生成、Tacotron本体の学習、チェックポイント保存、音声合成までを一通り提供しています。

dramaclaw/dramaclaw 03.07.2026

DramaClaw は、脚本の取り込みからキャラクター抽出、エピソード設計、台本生成、絵コンテ・初稿画像生成、音声合成、動画編集・書き出しまでを一気通貫で行う、短編ドラマ制作向けのソース公開型パイプラインです。個人クリエイターや小規模スタジオが、自前の環境で“ドラマ工場”を運用できることを目的としており、Freezone(無限キャンバス)やディレクター支援AI、スタイルテンプレート、タスク管理なども備えています。

karim23657/Persian-tts-coqui 02.07.2026

このリポジトリは、Coqui TTSを使ってペルシア語(Farsi)のテキスト読み上げモデルを学習・微調整・テストするためのサンプルコード集です。GlowTTS、VITS、マルチスピーカーVITSの学習ノートブックや推論例、事前学習済みモデルへのリンクが含まれています。

lucoiso/UEAzSpeech 01.07.2026

Unreal Engine向けのプラグイン「AzSpeech」で、Microsoft Azure Speech Cognitive Services を統合し、音声認識(Speech-to-Text)と音声合成(Text-to-Speech/SSML)を非同期タスクとして利用できるようにします。さらに、エディタ上で音声データをUSoundWaveとして生成・保存するツールや、認識/合成タスクの管理機能も提供します。

Deepest-Project/MelNet 30.06.2026

MelNetという、音声を周波数領域のメルスペクトログラムとして生成する深層生成モデルの実装です。学習用のトレーナーと、チェックポイントから音声をサンプリングしてスペクトログラム・波形・WAVを出力する推論スクリプトが含まれています。KSSやBlizzard、VoxCeleb2向けの設定が用意されており、条件付きTTS生成にも対応しています。

pkozul/ha-tts-bluetooth-speaker 29.06.2026

Home Assistant向けのカスタムコンポーネント集で、BluetoothスピーカーへTTS(音声合成)を再生するメディアプレーヤーを提供します。さらに、Bluetooth存在検知(device_tracker)と音声再生が同時にBluetoothを奪い合って音切れする問題を避けるため、Bluetoothトラッカーを一時停止・再開できる仕組みも含まれています。

sekift/so-vits-models 28.06.2026

このリポジトリは、LLM、音声変換(so-vits-svc/TTS)、Stable Diffusion、プロンプトエンジニアリングなどのAI関連モデル・アプリ・データセット・参考資料を集約したリンク集です。各分野ごとに代表的なサービス、GitHub、論文、Hugging Faceスペースなどを整理しており、特にDeepSeekの進化や各種AIアプリの比較情報も含まれています。

PiSugar/whisplay-ai-chatbot 27.06.2026

Raspberry Pi Zero 2W / Pi 5 向けのポケットサイズAIチャットボット端末を構築するリポジトリです。ボタン押下で音声入力し、ASR・LLM・TTSを使って応答するほか、LCD表示、RGB LED、ウェイクワード、画像生成、RAG、プラグイン拡張などに対応しています。

ZDisket/TensorVox 26.06.2026

TensorVoxは、Windowsデスクトップ向けの軽量なニューラル音声合成(TTS)アプリです。複数のAI音声モデルを読み込み、テキストから音声を生成したり、バッチで音声をデノイズ/リサンプルしたりできます。

gpustack/vox-box 25.06.2026

Vox Box は、OpenAI API 互換の音声認識(speech-to-text)/音声合成(text-to-speech)サーバーです。Whisper、FunASR、Bark、Dia、CosyVoice などのバックエンドモデルを切り替えて利用でき、/v1/audio/speech、/v1/audio/transcriptions、/v1/models、/v1/voices、/health などのAPIを提供します。

zhenye234/CoMoSpeech 24.06.2026

CoMoSpeechという、テキストから音声・歌声を生成するための拡散モデル/Consistency Modelベースの音声合成リポジトリです。1ステップ生成による高速推論を目指しており、教師モデルの蒸留による学生モデル学習、推論、LJSpeechを用いた学習コードが含まれています。HiFi-GAN вокoder を使ってメルスペクトログラムから波形を生成します。

jscrane/TTS 23.06.2026

Arduino向けのText-to-Speech(TTS)ライブラリです。英語の語彙・音素変換ルールと音声データをPROGMEMに保持し、PWMやDAC出力を使ってArduino系ボード上で音声合成を行います。

hegedustibor/htgo-tts 22.06.2026

Go言語向けのText-to-Speech(TTS)ライブラリです。Google Translateの音声生成APIを利用してテキストをMP3化し、ファイル保存や再生まで行えます。再生はmplayerを使う方法と、go-mp3 + oto/v2 を使うネイティブ再生の両方に対応しています。

mtkresearch/BreezeApp 21.06.2026

BreezeAPP 是一款為 Android 和 iOS 平台開發的純手機 AI 應用程式。從 App Store下載,即可在不連網的狀態下享受多項 AI 功能。源碼由聯發創新基地(MediaTek Research)提供。我們旨在推廣兩個概念: 人人都可以在自己的手機上自由選擇並運行不同的LLM - one is free to choose one's own LLM to run on a phone,以及任何app開發者都可以輕鬆寫作創意的純手機AI應用 - any dev can create purely phone-based AI apps easily。

netease-youdao/Confucius4-TTS 20.06.2026

Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine

Lyrcaxis/KokoroSharp 19.06.2026

Fast local TTS inference engine in C# with ONNX runtime. Multi-speaker, multi-platform and multilingual. Integrate on your .NET projects using a plug-and-play NuGet package, complete with all voices.

OEvortex/llm4free 18.06.2026

LLM4Free — All-in-one Python toolkit for web search, AI interaction (40+ free providers), digital utilities, and more. Formerly WebScout.

p0p4k/pflowtts_pytorch 17.06.2026

Unofficial implementation of NVIDIA P-Flow TTS paper

Listen to the Kana & Mari's SoundRepos (Japanese) podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.