ikuo suzuki
名古屋ではたらく社長のIT実験室
名古屋市に本社を置くシステムサーバーの社長が生成AIを使っていて思いついたことを試す実験場です。今のところ、たまたま私が興味を持ったテーマについて、GoogleのNotebookLMの音声概要機能を使って出力した音声データをアップロードしています。
Author
ikuo suzuki
Category
Podcast website
Latest episode
May 12, 2026
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
Ep.44 VibeVoice-7Bを試してみた結果(25ステップ版) 02.09.2025 0:29
スクリプト: Speaker 1: こんにちは、みんな。今日は新しいAIのデモをためしてみるんだよね? Speaker 2: そうそう。音声合成で自然な日本語が話せるか確認したいんだ。 Speaker 3: 楽しみだなぁ。どんな声になるのか想像できないよ。 Speaker 4: 私はちょっと不安。変なイントネーションにならないかな? Speaker 1: まあまあ、ためしてみないとわからないよ。とりあえずやってみよう。
Ep.43 VibeVoice-7Bを試してみた結果(10ステップ版) 02.09.2025 0:24
スクリプト: Speaker 1: こんにちは、みんな。今日は新しいAIのデモをためしてみるんだよね? Speaker 2: そうそう。音声合成で自然な日本語が話せるか確認したいんだ。 Speaker 3: 楽しみだなぁ。どんな声になるのか想像できないよ。 Speaker 4: 私はちょっと不安。変なイントネーションにならないかな? Speaker 1: まあまあ、ためしてみないとわからないよ。とりあえずやってみよう。
Ep.42 VibeVoice-1.5Bを試してみた結果 English(25ステップ版) 31.08.2025 0:18
Script: Speaker 1: Hi everyone. We’re going to try a new AI demo today, right? Speaker 2: Yeah. I want to check if it can speak natural Japanese with speech synthesis. Speaker 3: I’m looking forward to it. I can’t imagine what the voice will sound like. Speaker 4: I’m a little worried. What if the intonation sounds weird? Speaker 1: Well, we won’t know until we try. Let’s give it a shot.
Ep.41 VibeVoice-1.5Bを試してみた結果(25ステップ版) 30.08.2025 0:25
スクリプト: Speaker 1: こんにちは、みんな。今日は新しいAIのデモをためしてみるんだよね? Speaker 2: そうそう。音声合成で自然な日本語が話せるか確認したいんだ。 Speaker 3: 楽しみだなぁ。どんな声になるのか想像できないよ。 Speaker 4: 私はちょっと不安。変なイントネーションにならないかな? Speaker 1: まあまあ、ためしてみないとわからないよ。とりあえずやってみよう。
Ep.40 VibeVoice-1.5Bを試してみた結果(10ステップ版) 30.08.2025 0:24
スクリプト: Speaker 1: こんにちは、みんな。今日は新しいAIのデモをためしてみるんだよね? Speaker 2: そうそう。音声合成で自然な日本語が話せるか確認したいんだ。 Speaker 3: 楽しみだなぁ。どんな声になるのか想像できないよ。 Speaker 4: 私はちょっと不安。変なイントネーションにならないかな? Speaker 1: まあまあ、ためしてみないとわからないよ。とりあえずやってみよう。
Ep.38 「interview2jppodcast」対談動画のトランスクリプトから日本語ポッドキャストを生成するアプリ 24.08.2025 2:36
「interview2jppodcast」は以下の機能を持った便利なあぷりです。このアプリを使えば、聞き取れない言語の対談動画を日本語で聴けるようになります。 外国語のトランスクリプトを話者分離した日本語訳にする GeminiのAPIを用いてTTSする 長尺の場合、トランスクリプトをチャンク分けして並列でTTSをおこなうため短時間で音声にできる ユーザーが指定したBGMを合成する https://github.com/ikuo5710/interview2jppodcast
Ep.33 CVPR 2025 Best Student Paper Honorable Mentions : Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens 17.06.2025 9:21
Discrete Diffusion Timestep (DDT) Tokensに関するこの論文は、マルチモーダル大規模言語モデル (MLLMs)における視覚理解と生成を統合する革新的なアプローチを提案しています。既存のMLLMが使用する空間視覚トークンは、言語に固有の再帰的構造が欠けているため、LLMが完全に習得するのが困難であるという問題点を指摘しています。この課題に対処するため、著者は拡散タイムステップを活用して、離散的で再帰的な視覚トークンを...
Ep.32 CVPR 2025 Best Student Paper Honorable Mentions : 3D Student Splatting and Scooping 16.06.2025 8:11
この文書では、3D Gaussian Splatting (3DGS) という、新しい視点合成フレームワークの基本的な定式化を改善する研究が紹介されています。著者らは、3DGSのガウス分布の代わりに、より表現力豊かなStudentのt分布を使用する新しいモデル、Student Splatting and Scooping (SSS) を提案しています。SSSは、正の密度(スプラッティング)だけでなく**負の密度(スクーピング)**も利用することで、モデルの表現力とパラメータ効率を...
Ep.31 CVPR 2025 Best Paper Honorable Mentions : Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models 16.06.2025 6:15
提示された文書は、最先端の視覚言語モデル(VLM)であるMolmoの紹介とその開発について詳述しています。現在のVLMの多くが独自のモデルであり、合成データに大きく依存しているという問題に対処するため、Molmoはオープンソースの重みとデータ、特に外部VLMを使用せずに収集されたPixMoデータセットを提供しています。このPixMoデータセットは、詳細な画像キャプション、自由形式の質問応答データ、および革新的な2Dポインティン...
Ep.30 CVPR 2025 Best Paper Honorable Mentions : Navigation World Models 16.06.2025 10:16
この研究は、ロボットの視覚的ナビゲーションを改善するためのナビゲーションワールドモデル(NWM)と呼ばれる新しいアプローチを提案しています。NWMは、過去の視覚的観測とナビゲーション動作に基づいて将来の視覚的観測を予測する制御可能なビデオ生成モデルです。このモデルは、ロボットと人間のエージェントの両方からの多様な自己中心的なビデオで訓練され、複雑な環境力学を捉えるために条件付き拡散トランスフォーマー(CD...
Ep.29 CVPR 2025 Best Paper Honorable Mentions : MegaSaM: Accurate, Fast and Robust Structure and Motion from Casual Dynamic Videos 16.06.2025 7:40
本研究は、カジュアルな単眼動画から正確かつ高速にカメラパラメータと深度マップを推定するシステム「MegaSaM」を提案しています。従来のStructure from Motion(SfM)やSimultaneous Localization and Mapping(SLAM)手法は、静的なシーンと大きな視差を前提としていましたが、本システムは動的なシーンやカメラの視差が小さい状況でもロバストな推定を可能にします。そのために、ディープビジュアルSLAMフレームワークを改良し...
Ep.28 CVPR 2025 Best Student Paper: Neural Inverse Rendering from Propagating Light 16.06.2025 8:04
この学術論文では、フラッシュライダーシステムから得られる、伝播する光の多視点・時間分解測定を扱うニューラル逆レンダリング手法が紹介されています。提案されたシステムは、物理ベースのレンダリングモデルと時間分解されたラディアンスキャッシュを組み合わせており、これらはニューラルネットワークによってパラメータ化されています。このアプローチにより、強い間接光下での高精度な3Dシーン再構築や、伝播する光の新規視...
Ep.27 CVPR 2025 Best Paper: VGGT: Visual Geometry Grounded Transformer 16.06.2025 7:32
この論文は、VGGT (Visual Geometry Grounded Transformer)という新しい深層学習モデルを紹介しています。このモデルは、複数の入力画像から3Dシーンの属性(カメラの姿勢、深度マップ、点群マップ、および点トラッキング)を高速に推定します。従来の3D再構成手法が複雑な最適化プロセスに依存していたのに対し、VGGTはTransformerアーキテクチャを活用し、特にリアルタイム処理と多様なデータセットに対する高い汎用性において優...
Ep.26 海上輸送チョークポイントリスクと世界経済 30.05.2025 8:05
提示された文書は、海上輸送における重要な隘路である「チョークポイント」に焦点を当てています。特に、スエズ運河とパナマ運河の現状について詳細に分析しており、それぞれ中東情勢の悪化による紅海周辺での船舶攻撃や、異常気象による水不足といった要因が通航に大きな制約を与えていることを指摘しています。これらの問題により、迂回航路の利用が増加し、海上運賃や保険料が高騰している状況が述べられています。文書はまた、...
Ep.25 スキルベース人材育成報告書 28.05.2025 7:01
この文書は、Society 5.0時代に向けたデジタル人材育成に関する検討会の報告書です。日本の労働市場におけるスキル習得へのモチベーションの低さや企業の人材投資の遅れといった現状を指摘し、デジタル分野におけるスキルベースの学習、育成、雇用の実現を目指しています。政府全体のデジタル人材育成目標や経済産業省の既存施策に触れつつ、個人のスキル可視化とキャリア形成を支援するスキル情報基盤の必要性や、変化の速いデジ...
Ep.24 スペースX:最新情報 25.05.2025 8:05
提示された資料は、SpaceXが開発・運用する様々な宇宙機とミッションに関する最新情報を提供しています。具体的には、スターリンク衛星コンステレーションの展開とその技術的な課題、NASAとの協力による国際宇宙ステーションへの有人宇宙飛行の実現と進展、そして月や火星への輸送システムを目指すスターシップの開発とその試験飛行の結果について言及しています。さらに、民間人による宇宙飛行計画や惑星防衛ミッションにも触れて...
Ep.22 マイクロソフトCEO サティア・ナデラ氏、AIの未来を語る(サマリー解説) 23.05.2025 6:27
この対談では、マイクロソフトのCEOであるサティア・ナデラ氏が、人工知能の台頭がもたらすテクノロジーの未来について、マシュー・バーマン氏と議論しています。特に、AIエージェントの進化と、それがMicrosoft 365のような既存製品、そしてSaaS企業に与える影響について焦点を当てています。また、AIのエネルギー消費に関する懸念や、AIエージェントが企業資産となる未来、そして知能のコストがゼロに近づいた場合の潜在的な可能...
Ep.21 アルファベットCEOスンダー・ピチャイ氏AI時代を語る 22.05.2025 8:37
デビッド氏とのインタビューで、AlphabetのCEOであるスンダー・ピチャイ氏は、AIがGoogleの検索事業をどのように変革し、競合他社にどのように対応しているかについて議論しています。彼は、GoogleのAIへの「AIファースト」アプローチと、検索に導入されている新しいAI機能について説明しています。ピチャイ氏はまた、Googleのインフラストラクチャにおける優位性と、AIのコストを管理する上でのその重要性についても触れています...
Ep.20 スマートフォンの次に来るAIデバイスの覇権争い 22.05.2025 6:18
この記事や動画は、元Appleの著名デザイナーであるジョニー・アイブ氏とOpenAIのCEOであるサム・アルトマン氏の提携と、彼らが目指すAIハードウェアの未来について議論しています。アイブ氏の新しいデザイン会社LoveFrom、およびOpenAIに買収された彼のスタートアップ企業ioが、AIを活用した革新的なデバイスを開発していることが紹介されています。これらのソースは、既存のスマートフォンとは異なる新しいコンピューティング体験...
Ep.19 AlphaEvolve:科学的発見とアルゴリズムの進化 16.05.2025 6:47
最新のGoogle DeepMindの成果であるAlpha Evolveに関する議論では、人間とAIの協調的アプローチを用いて、長年の難問であった行列乗算を含む数学的および計算科学的な課題における画期的なアルゴリズムを発見したことが報告されています。このシステムは、大規模言語モデルの創造力と進化的な探索および自動評価を組み合わせることで、特に4x4行列乗算において、これまでの世界記録である49回の乗算を下回る48回での乗算方法を発見...
Ep.18 ザッカーバーグとナデラのAI対話 14.05.2025 20:28
マーク・ザッカーバーグ氏とサティア・ナデラ氏の対談は、AIとオープンソースエコシステムの重要性について焦点を当てています。両氏は、AIが過去のクライアントサーバーやウェブのような大きな技術的転換点であり、開発プロセスやアプリケーションの構築方法を根本的に変革すると論じます。特に、AIによるソフトウェア開発の生産性向上や、マイクロソフトのアジュールがオープンソースモデルとクローズドソースモデルの両方をサポ...
Ep.17 HunyuanCustom:マルチモーダル動画生成 14.05.2025 24:32
Tencent Hunyuan が開発した HunyuanCustom と呼ばれる新しいシステムが提示されています。これは、テキスト、画像、音声、ビデオ の複数の入力に基づいてビデオを生成できる マルチモーダルな動画生成モデル です。このシステムは、ビデオ全体で個々の主題のアイデンティティの一貫性 を維持することに重点を置いており、以前の方法では困難だった問題に対処しています。仮想人間の広告やバーチャルトライオン など、カスタマイズ...
Ep.16 世界の観光産業と日本の可能性 14.05.2025 11:23
世界の観光産業の動向について説明されています。多くの地域でコロナ禍以前の水準に回復していることが示され、特に中東やアフリカの観光地の人気が強調されています。また、ラグジュアリーなリゾートや、スペインのサンチャゴ・デ・コンポステーラのような巡礼、イタリアのアマルフィといった歩いて楽しむ旅への関心が高まっていることが紹介されています。日本国内でも、妻籠宿や小布施のような歴史的な景観を持つ場所が外国人観...
Ep.15 日本の農業・食料問題の深層 14.05.2025 23:57
この講演では、戦後からほとんど変わっていない日本の農業、漁業、林業の現状と課題について論じられています。高い高齢化率と労働力不足、低い食料自給率に加え、農協や漁協の存在が構造改革を妨げていることが指摘されます。諸外国の成功事例と比較しつつ、日本の農業が抱える問題点と、産業としての再構築や国際競争力の向上に向けた今後の方向性について提言がなされています。
Ep.14 二極化する不動産 14.05.2025 12:43
日本の不動産市場の二極化に焦点を当てています。全国的には人口減少による空き家の増加が見られる一方で、東京の都心部や一部の地域、特に沖縄の本島の一部や宮古島のような場所では不動産価格が上昇していると述べています。さらに、世界の富裕層が安全性や利便性を求めて東京の不動産に注目していることに触れ、特に一等地のマンションには将来的な価格上昇の可能性があると指摘しています。動画は、日本の不動産を考える際には...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.