weedge
AI Podcast
Latest podcasts about AI Technology and Papers.
Não deixe de visitar o site do podcast e apoiar quem o produz: podcast-997.pages.dev
Autor
weedge
Categoria
Site do podcast
Último episódio
17 de abr de 2026
Onde ouvir?
Podcasts no app Replaio Radio Em breveOs podcasts estão chegando ao app. Instale agora e seja o primeiro a descobrir um jeito totalmente novo de curtir podcasts
Episódios
IndexTTS2:革新语音合成的情感与时长控制 07.07.2025 8:19
深入探讨开创性的文本转语音模型IndexTTS2。我们讨论了它在自回归系统中精确控制语音时长的独特能力、其将声音与情感分离的先进情感控制功能,以及它如何为语音质量和表现力设定新标准。
Kwai Keye-VL: 赋能短视频时代的80亿参数多模态大模型 06.07.2025 5:39
深入探讨 Kwai Keye-VL 技术报告。我们将探讨其创新的架构、独特的四阶段预训练和两阶段后训练方法,以及其最先进的性能,尤其是在理解动态短视频方面。我们还将讨论其定制的基准测试 KC-MMBench 以及未来的挑战。
WavReward:教会AI“察言观色”的秘密武器 04.07.2025 7:46
本期播客深入探讨了WavReward,一个专为评估端到端语音对话模型而设计的创新奖励模型。我们讨论了当前评估方法的局限性,并详细介绍了WavReward如何通过强化学习、思维链推理和非线性奖励机制,准确评估模型的“智商”和“情商”。同时,我们还介绍了为其量身定制的ChatReward-30K数据集,它如何通过丰富的声学维度和隐式对话场景,推动语音AI向更自然、更人性化的方向发展。
MirrorMe: 实时高保真音频驱动的半身数字人动画 02.07.2025 9:15
本期节目深入探讨了MirrorMe框架,一个旨在解决实时、高保真、可控的音频驱动数字人动画挑战的先进技术。我们将讨论其基于LTX视频模型的创新架构,包括身份保留、音频融合和渐进式训练策略,以及它如何实现业界领先的性能和效率。
深入解读文心大模型4.5技术报告 01.07.2025 8:16
在本期节目中,我们将深入探讨百度最新发布的ERNIE 4.5技术报告。我们将解析其创新的多模态异构混合专家(MoE)架构、高效的训练与推理框架,以及在各大基准测试中取得的卓越性能,全面了解这款前沿大模型的背后技术。
GUIRoboTron-Speech:用声音操控万物,AI交互新革命 01.07.2025 8:42
在本期节目中,我们将深入探讨 GUIRoboTron-Speech,这是首个能够直接通过语音指令和屏幕截图来操作手机和电脑的端到端自主GUI代理。我们讨论了它如何解决现有基于文本的AI代理的局限性,特别是在需要解放双手的场景中。我们还将揭示其创新的数据收集方法,即利用随机音色的文本转语音技术(TTS)来创建训练数据,以及其独特的“混合指令训练策略”如何克服了预训练模型中的“模态不平衡”问题。最后,我们将分析其实验结果,证明语音...
Stream-Omni: 高效灵活的多模态交互新范式 29.06.2025 8:26
深入探讨Stream-Omni模型,解析其如何创新性地对齐文本、视觉和语音。我们将讨论其独特的架构、高效的训练过程,以及在创建无缝、实时多模态体验方面的卓越表现。
让他们开口:音频驱动的多人对话视频生成 28.06.2025 8:00
本期节目深入探讨了名为MultiTalk的创新框架,该框架专注于一项全新任务:音频驱动的多人对话视频生成。我们讨论了该技术如何解决多路音频与视频中人物的精确绑定问题,特别是通过一种名为L-RoPE(标签旋转位置嵌入)的新方法。此外,我们还将揭示其独特的训练策略,例如部分参数训练和多任务训练,是如何在保留模型指令遵循能力方面发挥关键作用的。
深入探讨OmniGen2:迈向高级多模态生成 26.06.2025 10:43
本期节目,我们深入探讨了OmniGen2这一先进的开源多模态生成模型,涵盖其创新的模型架构、独特的数据集构建策略、全新的OmniContext评测基准,以及在各项生成任务上的实验表现和未来展望。
深入探讨Ming-Omni:统一多模态感知与生成模型 23.06.2025 14:01
本期播客将深入探讨 Ming-Omni,一个统一的多模态模型,它能够处理图像、文本、音频和视频,并在语音和图像生成方面表现出色。我们将讨论其核心架构、训练方法、数据构建以及在各项基准测试中的卓越表现。
揭秘混元视频数字人:高保真音频驱动的多角色动画技术 20.06.2025 16:41
深入探讨腾讯混元最新的HunyuanVideo-Avatar技术,它如何通过创新的角色图像注入、音频情感模块和面部感知音频适配器,实现动态、情感可控的多角色对话视频生成。
AdaMesh深入解析:个性化3D面部动画的革新 16.06.2025 7:57
本期AI Radio FM技术频道,我们邀请专家weedge与主持人共同探讨AdaMesh技术。AdaMesh能够从短短10秒的参考视频中学习个性化的说话风格,生成包含丰富面部表情和多样头部姿态的3D面部动画。我们将深入剖析其核心组件,如针对表情的MoLoRA技术和针对头部姿态的语义感知适配策略,并讨论其在虚拟现实、电影制作等领域的巨大潜力。
EmoTalk:语音驱动的3D人脸动画情感解耦技术深度解析 16.06.2025 13:22
本期播客深入探讨了EmoTalk技术,一种旨在从语音中解耦内容和情感,以生成富有表现力的3D人脸动画的端到端神经网络。我们将讨论其核心组件、创新的数据集构建以及实验结果。
TaoAvatar:实时逼真的全身对话虚拟化身与增强现实 16.06.2025 13:05
本期播客深入探讨了 TaoAvatar 技术,一种基于三维高斯散点的实时、逼真全身对话虚拟化身创建方法,特别关注其在增强现实设备上的应用、创新点、性能表现以及面临的挑战。
LAM解读:单张图片生成可动高斯头部模型的革命 16.06.2025 14:02
深入探讨LAM(大型虚拟形象模型)如何通过单张图像实现可立即动画化和渲染的高斯头部模型。我们将讨论其创新方法、核心技术(如FLAME模型集成、Transformer架构和高斯溅射)、与现有方法的比较、多平台部署能力以及未来的应用前景与局限性。
MuseTalk专题:实时高保真视频配音的革新 16.06.2025 11:21
深入探讨MuseTalk如何通过创新的时空采样策略和两阶段训练框架,解决视频配音中的“三难困境”,实现实时、高保真的口型同步效果。讨论其核心技术、实验结果以及对未来多媒体应用的影响。
文本语音驱动的全身动画技术深度解析 16.06.2025 11:16
本期节目深入探讨了一项前沿的全身动画合成系统,该系统能够根据输入的文本和语音实时生成逼真的面部表情和身体动作。我们详细解析了其面部动画的深度学习方法和身体动画的图模型方法,以及它们如何协同工作,实现高度同步和富有表现力的虚拟形象动画。
深入探讨对数线性注意力机制 10.06.2025 9:59
本期播客,我们深入探讨了一篇关于“对数线性注意力”(Log-Linear Attention)的最新研究论文,这是一种旨在平衡传统注意力机制的表达能力与线性注意力机制计算效率的新方法。我们将讨论其核心思想、技术实现、实验结果以及潜在影响。
AI Radio FM - 技术频道:深入探讨Skywork R1V2的多模态混合强化学习推理 09.06.2025 15:23
本期播客深入探讨了下一代多模态推理模型 Skywork R1V2。我们讨论了其核心的混合强化学习范式(MPO 和 GRPO 的结合)、创新的选择性样本缓冲(SSB)机制,以及它如何在解决复杂推理任务的同时平衡泛化能力并减少视觉幻觉。节目还将涵盖其在多个基准测试中的卓越表现、与现有模型的对比,以及对未来多模态人工智能发展的启示。
ReTool深度解析:强化学习赋能大语言模型战略性工具应用 07.06.2025 13:24
本期播客深入探讨ReTool框架,解析其如何通过强化学习,特别是结合代码解释器,显著提升大语言模型在复杂数学推理等任务中的能力、效率和智能化水平。
AI Radio FM:深入探讨Search-R1——用强化学习训练大语言模型掌握推理与搜索 06.06.2025 11:19
本期节目,我们深入探讨了最新的研究Search-R1,它提出了一种创新的强化学习框架,旨在训练大语言模型(LLM)在进行逐步推理时,能够自主且高效地利用搜索引擎获取外部知识和最新信息。我们将讨论Search-R1的核心机制、实验成果及其对未来LLM发展的意义。
深入探讨强化学习在推理搜索型LLM智能体中的应用 06.06.2025 14:51
本期节目,我们将深入探讨一篇关于强化学习(RL)在训练大型语言模型(LLM)进行复杂推理和与搜索引擎交互的实证研究。我们将讨论奖励机制设计、底层LLM的选择以及搜索引擎在RL过程中的作用等关键因素。
深入探讨StreamRL:大规模语言模型强化学习的革新之路 06.06.2025 19:47
本期播客深入探讨了StreamRL这一创新的强化学习框架,它如何通过解耦架构优化大规模语言模型的训练,解决资源耦合、流水线气泡和长尾分布等核心痛点,并展望其在异构硬件和跨数据中心部署中的巨大潜力。
ProRL: 延长强化学习拓展大语言模型推理边界 03.06.2025 14:31
深入探讨ProRL(Prolonged Reinforcement Learning)如何通过延长强化学习训练,结合KL散度控制、参考策略重置和多样化任务,显著提升大语言模型的推理能力,甚至发掘出基础模型无法触及的全新解题策略。本期节目将详细解析ProRL的技术细节、Nemotron-Research-Reasoning-Qwen-1.5B模型的惊人表现,以及这对AI未来发展的深远影响。
深入剖析DAPO:大规模开源LLM强化学习系统 02.06.2025 12:23
本期播客深入探讨了DAPO(解耦裁剪与动态采样策略优化)算法,这是一个在Qwen2.5-32B基础模型上实现AIME 2024测试50分的先进大规模强化学习系统。我们详细讨论了其四项关键技术:Clip-Higher、动态采样、词元级策略梯度损失和超长奖励修正,以及它们如何解决熵塌陷、梯度消失、长CoT场景下的学习不平衡和奖励噪声等问题,并介绍了其开放源代码、训练代码和精心处理的数据集对社区的贡献。
Podcasts parecidos
O Replaio não é o publicador dos podcasts; os nomes dos programas, as capas e o áudio pertencem aos seus autores e são distribuídos por feeds RSS públicos