weedge

AI Podcast

Latest podcasts about AI Technology and Papers.

Author

weedge

Category

Technology

Podcast website

podcast-997.pages.dev

Latest episode

Apr 17, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

AI Radio FM - 揭秘LUCY:情感、自然、更智能的语音交互 19.02.2025

本期播客深入探讨了腾讯优图实验室的最新研究成果LUCY,一个在情感控制、自然度和信息丰富度方面均有显著提升的端到端语音模型。通过精心策划的合成训练数据,LUCY不仅能理解并响应用户的情感,还能以自然流畅的风格进行对话,并利用外部工具回答实时问题。

AI Radio FM - Technology Channel 19.02.2025

深入探讨Step-Video-T2V技术报告,涵盖视频基础模型、模型架构、训练策略、系统优化及未来发展方向。

AI Radio FM - 科技频道 18.02.2025

深入探讨原生稀疏注意力机制(NSA)在长上下文建模中的应用和优势。

AI Radio FM - Technology Channel 18.02.2025

深入探讨Step-Audio,首个生产就绪的开源智能语音交互框架。

AudioLM:音频生成的语言模型方法 18.02.2025

我们介绍AudioLM,一个用于高质量音频生成并具有长期一致性的框架。AudioLM将输入音频映射到一系列离散标记,并将音频生成视为在此表示空间中的语言建模任务。

MuLan:音乐音频与自然语言的联合嵌入 18.02.2025

本次播客深入探讨了MuLan模型,这是一个连接音乐音频和自然语言描述的联合嵌入模型。我们讨论了它的架构、训练数据、应用以及在音乐信息检索任务中的表现。

AI Radio FM - 音乐生成技术 18.02.2025

本次播客深入探讨了MusicLM,一个能根据文本描述生成高保真音乐的模型。我们将讨论MusicLM的技术细节、实验结果、以及它与先前系统的比较。此外,我们还将介绍MusicCaps数据集,并探讨MusicLM在音乐创作领域的潜在应用和风险。

Transformer 和 SSM 的结构化状态空间对偶性 16.02.2025

探讨 Transformer 和状态空间模型(SSM)之间联系的播客,重点介绍 SSM 的优势和高效算法,以及新的 Mamba-2 架构。

Mamba: 线性时间序列建模与选择性状态空间 16.02.2025

深入探讨Mamba,一种无需注意力的架构,它通过选择性状态空间实现在语言、音频和基因组等多种模式下的卓越性能。

s1: 简单测试时缩放 12.02.2025

本播客讨论了一种新的语言建模方法,该方法使用额外的测试时计算来提高性能。我们介绍了 s1K,这是一个包含 1000 个问题的数据集,并开发了预算强制来控制测试时计算。

Sample-Efficient Reasoning with Test-Time Scaling: A Podcast Discussion 12.02.2025

A podcast delving into the innovative s1-32B model, exploring its sample-efficient reasoning capabilities and test-time scaling techniques.

Zonos-v0.1 Beta 发布:新一代文本转语音模型 12.02.2025

深入探讨Zyphra公司发布的Zonos-v0.1 Beta,一款具有高保真语音克隆功能的实时文本转语音模型。我们将分析其特性、定价、与其他模型的比较以及技术架构。

AI赋能视频创作:Goku模型解析 11.02.2025

深入探讨Goku,一种基于流动模型的视频生成基础模型,及其在图像和视频联合生成方面的突破性进展。

Seed-Music: 统一框架下的高质量可控音乐生成 11.02.2025

探索 Seed-Music,一个旨在生成具有细粒度风格控制的高质量音乐的音乐生成和编辑系统套件。我们的统一框架利用自回归语言建模和扩散方法来支持两种关键的音乐创作工作流程:受控音乐生成和后期制作编辑。

大型语言模型基础 11.02.2025

本播客讨论了大型语言模型(LLM)的基础知识,包括预训练方法、提示工程、对齐技术等。它涵盖了Transformer架构,自监督学习,以及如何将LLM用于各种NLP任务。

VoxInstruct: 统一多语编解码语言模型实现富有表现力的人工指令语音生成 10.02.2025

探讨VoxInstruct,一种新型框架,它扩展了传统文本到语音的任务,使其能够直接从人类指令生成语音,从而提升语音生成的表现力和泛化能力。

MiniCPM-o 2.6: GPT-4o 级别的多模态大语言模型 10.02.2025

探讨 MiniCPM-o 2.6,一个能在手机上运行,具备 GPT-4o 级别视觉、语音和多模态直播能力的多模态大语言模型。

多模态奖励模型:IXC-2.5-Reward 10.02.2025

探讨 InternLM-XComposer2.5-Reward (IXC-2.5-Reward),一个用于大型视觉语言模型 (LVLM) 的多模态奖励模型,它通过强化学习或测试时缩放来提升生成质量。该模型在多模态基准测试中表现出色,并在强化学习训练、测试时缩放和数据清洗方面具有应用。

Mini-InternVL:一款灵活迁移的口袋多模态模型 10.02.2025

本播客讨论了 Mini-InternVL,这是一款参数范围从 1B 到 4B 的多模态大型语言模型(MLLM),它仅用 5% 的参数实现了 90% 的性能。该模型具有统一的自适应框架,可以迁移并在自动驾驶、医学图像和遥感等下游任务中胜过专用模型。

增强多模态大型语言模型的推理能力:混合偏好优化 10.02.2025

探讨通过混合偏好优化增强多模态大型语言模型推理能力,结合数据和模型层面的改进,以提升模型在多模态推理任务中的性能。

InternVL 2.5:模型、数据和测试时扩展开放源代码多模态模型的性能边界 10.02.2025

本播客讨论 InternVL 2.5,这是一种先进的多模态大型语言模型(MLLM)系列,它以 InternVL 2.0 为基础,在训练和测试策略以及数据质量方面进行了重大改进。通过对各种基准的广泛评估,包括多学科推理、文档理解、多图像/视频理解、现实世界理解、多模态幻觉检测、视觉定位、多语言能力和纯语言处理,InternVL 2.5 展现出具有竞争力的性能,可与 GPT-4o 和 Claude-3.5-Sonnet 等领先的商业模型相媲美。

InternVideo2.5:通过长文本和丰富上下文建模增强视频多模态大型语言模型 10.02.2025

讨论 InternVideo2.5 如何通过长文本和丰富上下文建模来提升视频多模态大型语言模型(MLLM)的性能,包括其架构、训练方法以及在视频理解和特定视觉任务上的实验结果。

Reinforcement Learning: A Comprehensive Exploration 09.02.2025

A podcast delving into the core concepts, algorithms, and real-world applications of reinforcement learning, drawing from the renowned book by Sutton and Barto. This podcast will focus on making the content accessible and engaging for listeners interested in the field.

Reinforcement Learning: An Engaging Podcast Discussion 09.02.2025

A fast-paced and enthusiastic podcast conversation covering key concepts from the book "Reinforcement Learning: An Introduction," tailored for audio consumption and enhanced understanding.

AI的苦涩教训:计算力至上 09.02.2025

探讨AI研究中,通用方法如何凭借计算力超越人类知识,以及研究者们应该如何应对这一转变。

Listen to the AI Podcast podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.