weedge

AI Podcast

Latest podcasts about AI Technology and Papers.

Author

weedge

Category

Technology

Podcast website

podcast-997.pages.dev

Latest episode

Apr 17, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

深度强化学习概览:从基础到前沿 20.08.2025

本期节目深入探讨了强化学习的各个方面,从核心概念、经典算法到前沿技术,旨在为听众提供一份全面且引人入胜的强化学习概览。我们将详细讨论价值学习、策略优化、基于模型的强化学习,以及处理稀疏奖励、部分可观测性等挑战的最新方法。此外,我们还将触及强化学习与大语言模型等新兴领域的交叉应用,并展望通用人工智能的未来。

AI前沿:ZipVoice - 极速高质零样本文本到语音的奥秘 19.08.2025

深入探讨ZipVoice,一个革命性的文本到语音模型!它如何通过紧凑的设计和创新的流匹配蒸馏技术,实现比现有技术快30倍的推理速度,同时保持卓越的语音质量。了解Zipformer骨干网络、平均上采样策略和流蒸馏如何共同打造下一代零样本TTS体验。

智绘乾坤:揭秘通义Qwen-Image的视觉生成突破 18.08.2025

本期AI电台FM科技频道,我们将深入探讨阿里通义团队推出的Qwen-Image模型。从其在复杂文本渲染和精准图像编辑上的重大突破,到其创新的数据管道和训练策略,以及在各项基准测试中展现出的卓越性能,我们将全面解析Qwen-Image如何重新定义生成式AI的边界,并展望其在未来视觉-语言交互领域的深远影响。

AI电台FM:露西:边缘运行智能体与动态思维向量的秘密 18.08.2025

本期节目深入探讨了Menlo Research的突破性项目“露西”,一个仅1.7亿参数的小型语言模型,如何通过创新的动态任务向量机制和两阶段强化学习框架,在移动和边缘设备上实现与大型模型相媲美的智能体式网页搜索能力。我们将揭示其如何通过优化思维过程而非增加模型规模来打破传统瓶颈,并探讨思维标签在任务向量中的关键作用以及其带来的出乎意料的自适应行为。

VeOmni:多模态大模型训练的革新者 14.08.2025

本期节目,我们将深入探讨字节跳动最新推出的VeOmni框架,它如何以模型为中心的分布式训练配方,高效扩展任意模态模型训练,突破多模态大模型开发瓶颈。从架构解耦到N维并行策略,再到实战表现,我们将为您揭示VeOmni的强大之处!

OpenCUA:开启通用计算机代理的新篇章 14.08.2025

本期播客深入探讨了OpenCUA框架,一个旨在为计算机使用代理(CUA)研究建立开放基础的创新项目。我们将详细解读其数据收集、处理、模型训练的独特方法,以及OpenCUA-32B如何在OSWorld-Verified基准测试中超越GPT-4o,成为开源模型的里程碑。

SecoustiCodec:下一代流媒体语音编解码技术 13.08.2025

深入探讨开创性的语音编解码器SecoustiCodec,它通过解耦语义和副语言信息,实现了高保真、低比特率和实时流媒体传输。我们将剖析其VAE+FSQ量化、跨模态对比学习等创新方法,并解读其令人瞩目的SOTA性能。

Sortformer: AI革命性的语音识别新篇章 13.08.2025

在本期节目中,我们深入探讨了英伟达(NVIDIA)的创新模型Sortformer。我们将揭示它如何通过一种名为“排序损失”(Sort Loss)的新颖方法,巧妙地解决了语音分离(说话人日志)中的“排列问题”,从而彻底改变了多说话人自动语音识别(ASR)技术。我们将讨论Sortformer如何与ASR系统无缝集成,通过创新的“说话人核函数”和“排序序列化转录”技术,实现端到端的联合优化。准备好了解这项让机器更懂对话的突破性技术吧!

流式 Sortformer:实时语音日记的新突破 13.08.2025

深入探讨 NVIDIA 的最新研究“流式 Sortformer”,这是一种基于说话人缓存的在线说话人日志框架。我们将解析其核心创新“按到达顺序排列的说话人缓存”(AOSC)如何解决实时多说话人追踪的难题,并讨论其在实时字幕、虚拟会议等领域的应用前景。

Llasa+: 加速和流式语音合成的免费午餐 13.08.2025

本期节目,我们将深入探讨 Llasa+,这是一种基于 Llasa 模型构建的加速和流式文本到语音(TTS)模型。我们将讨论其核心技术,包括多令牌预测(MTP)和创新的验证算法,如何实现显著的速度提升而又不牺牲语音质量。同时,我们还将介绍其流式声码器 XCodec2-S 的实现。

FP4一路狂飙:全量化训练大型语言模型的新纪元 12.08.2025

本期播客深入探讨了一项开创性的研究,该研究首次实现了使用4比特浮点数(FP4)对大型语言模型进行全面的量化训练。我们邀请了技术专家Weedge,共同讨论了这项技术如何通过优化FP4格式(如NVFP4)、创新的分裂式舍入策略以及一个关键的理论阈值,成功地在保持与BF16基线相当性能的同时,极大地提升了训练效率。我们将揭示FP4训练从理论到大规模实践的全过程,包括它如何巧妙地利用量化感知微调(QAF)来弥补最后的性能差距,预示着...

GLM-V:用强化学习打造通用多模态推理新标杆 12.08.2025

深入解读GLM-4.1V-Thinking和GLM-4.5V的技术报告。我们将探讨其创新的以推理为中心的训练框架,大规模强化学习中的挑战与突破,以及这些模型如何推动多模态人工智能的边界。

GLM-4.5深度解析:智能体、推理与编码三位一体的AI新王者 12.08.2025

本期节目,我们深入探讨智谱AI和清华大学联合发布的GLM-4.5模型。这款拥有3550亿参数的开源巨兽,如何在智能体(Agentic)、推理(Reasoning)和编码(Coding)三大核心能力上实现顶级性能?从独特的训练方法到惊艳的评测结果,我们为您全方位解读GLM-4.5的强大之处。

'高效流式语言模型与注意力汇聚点'(Efficient Streaming Language Models with Attention Sinks) 06.08.2025

深入探讨的是一篇关于'高效流式语言模型与注意力汇聚点'(Efficient Streaming Language Models with Attention Sinks)的论文。

深入探讨OpenAI的开源新贵:gpt-oss-120b与20b模型 06.08.2025

本期节目,我们将深入探讨OpenAI最新发布的两个开源权重模型,gpt-oss-120b和gpt-oss-20b。我们将讨论它们的模型架构、核心功能、性能评估,以及大家最关心的安全问题,包括OpenAI是如何进行对抗性测试来评估潜在风险的。

MiDashengLM:用通用音频字幕重新定义音频AI 05.08.2025

深入探讨小米公司推出的开源音频语言模型MiDashengLM。我们探索其创新的“通用音频字幕”方法,该方法将语音、声音和音乐融合成一个丰富的描述。我们将讨论这种方法如何挑战传统的基于ASR的模型,从而在音频理解方面取得卓越性能和令人难以置信的效率提升。我们还将解析驱动该模型的新型ACAVCaps和MECAT数据集。

深入解析CIF模型:语音识别领域的革命性突破 03.08.2025

在本期节目中,我们深入探讨了用于端到端语音识别的连续整合触发(CIF)模型。我们讨论了它如何解决传统注意力机制的局限性,其灵感来源、核心算法,以及一系列创新的支持策略,并分析了它在多个标准测试集上取得的卓越性能。

IWSLT 2025 CUNI系统:Whisper与EuroLLM联手打造实时同声传译新高度 03.08.2025

本期播客深入探讨了查尔斯大学(CUNI)在IWSLT 2025同声传译任务中提交的创新系统。我们详细解读了他们如何将离线的Whisper语音模型和大型语言模型EuroLLM应用于实时同声传译,并取得了超越基线2至22个BLEU点的惊人成果。内容涵盖捷克语到英语的直接翻译,以及英语到德语、中文、日语的级联翻译方法,同时还介绍了一种新颖的ASR延迟评估方法。

Simul-Whisper:让Whisper模型实现实时语音识别 03.08.2025

本期节目,我们深入探讨Simul-Whisper,一种无需微调即可将强大的Whisper模型应用于流式语音识别场景的创新策略。我们将讨论其核心技术:注意力引导解码和截断词检测,并分析其相比传统方法的显著优势和性能表现。

Whispy: 让Whisper模型实现实时语音转写 03.08.2025

本期播客深入探讨了Whispy系统,这是一个旨在为强大的OpenAI Whisper模型赋予实时处理能力的创新框架。我们将讨论Whisper模型在实时应用中的局限性,并详细介绍Whispy如何通过其独特的架构(包括输入管道、移位数据寄存器和转写器)来解决这些问题。我们还将重点介绍其核心算法,如基于莱文斯坦距离的建议生成机制,以及它在平衡转写准确性和低延迟方面的出色表现。

实时转写革命:揭秘Whisper-Streaming技术 03.08.2025

本期节目深入探讨了Whisper-Streaming,一个创新的系统,它将强大的离线模型Whisper转变为实时转写工具。我们将详细解析其核心的LocalAgreement算法,讨论在延迟和质量之间的权衡,并探索其在多语言会议等真实世界场景中的应用。

“ThinkSound”——一个利用多模态大语言模型和思维链(CoT)推理来实现视频到音频生成和编辑的框架。 03.08.2025

大家好,欢迎收听AI Radio FM - Technology Channel,您的专属生成式AI播客!今天我们要深入探讨一个非常前沿的技术话题,那就是“ThinkSound”——一个利用多模态大语言模型和思维链(CoT)推理来实现视频到音频生成和编辑的框架。

AI Radio FM - Technology Channel 02.08.2025

Exploring the cutting edge of AI and 3D world generation with HunyuanWorld 1.0.

CosyVoice 3 揭秘:迈向‘野生’语音合成的百万小时数据与十亿参数模型 31.07.2025

深入探讨阿里巴巴的 CosyVoice 3 模型。我们将剖析其关键创新,从新颖的语音分词器和强化学习技术,到其海量的数据和模型扩展。我们还将讨论它在多语言和情感语音合成方面的顶尖性能。

Step-Audio 2: The Next Leap in AI Speech Conversation 30.07.2025

In this episode, we dive deep into the Step-Audio 2 technical report. We explore how this end-to-end multi-modal large language model is revolutionizing audio understanding and speech conversation. We discuss its unique architecture, reasoning-centric reinforcement learning, innovative tool-calling capabilities like audio search, and its state-of-the-art performance against competitors like GPT-4o...

Listen to the AI Podcast podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.