weedge

AI Podcast

Latest podcasts about AI Technology and Papers.

Author

weedge

Category

Technology

Podcast website

podcast-997.pages.dev

Latest episode

Apr 17, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

Muon优化器:AI训练提速的秘密武器 14.10.2025

本期节目,我们将深入探讨Muon优化器,这个在神经网络隐藏层训练中表现卓越的新技术。它如何通过独特的正交化更新机制,显著提升CIFAR-10和NanoGPT等任务的训练速度,甚至超越AdamW等主流优化器?我们还将揭示其设计原理,包括Newton-Schulz迭代的巧妙应用、系数调优的奥秘,以及它如何有效解决优化器研究中常见的“基线不足”问题。此外,我们还将讨论其与Shampoo等先行者的异同,以及未来在大规模模型训练中的潜力。锁定AI Radio F...

月光私酿:边缘设备上的微型专业ASR模型 11.10.2025

深入探讨“月光私酿”项目,揭示了小型单语ASR模型如何在资源受限的边缘设备上,超越大型多语模型,为小语种提供卓越的语音识别能力。本期播客将详细介绍其独特架构、数据策略和令人瞩目的性能表现。

轻量级混合双通道语音增强系统:低信噪比下的清晰之声 03.10.2025

在AI电台FM科技频道,我们深入探讨了一篇关于轻量级混合双通道语音增强系统的前沿研究。该系统巧妙结合了独立向量分析(IVA)与改进的GTCRN网络,旨在解决低信噪比环境下语音增强面临的计算资源限制与性能挑战。我们讨论了其创新架构、关键技术细节、实验成果及其在边缘设备实时应用中的巨大潜力。

轻量级语音增强引导的目标语音提取:嘈杂多说话人场景的新突破 03.10.2025

本期节目我们深入探讨了一项关于在嘈杂多说话人场景中进行目标语音提取的最新研究。我们将一起了解LGTSE和D-LGTSE如何利用轻量级语音增强模型,通过降噪无关的参考语音指导和失真感知训练,显著提升语音提取的性能和鲁棒性。

UL-UNAS:面向实时语音增强的超轻量级U-Net与网络架构搜索之旅 03.10.2025

欢迎收听《AI电台FM - 科技频道》,本期节目我们将深入探讨一篇关于“通过网络架构搜索实现实时语音增强的超轻量级U-Net模型”的创新研究。我们将揭示UL-UNAS如何在极低的计算资源下,实现卓越的语音增强效果,并探讨其核心技术:高效卷积块、新型激活函数APReLU、因果时频注意力cTFA以及神经网络架构搜索的奥秘。本研究不仅超越了现有超轻量级模型,更与资源密集型基线模型性能媲美,为边缘设备的实时语音增强提供了强大的解决方案...

TileLang:AI系统可组合平铺编程模型 30.09.2025

本期节目深入探讨了TileLang,一个为AI系统设计的新型可组合平铺编程模型。我们讨论了现代AI工作负载中高性能内核编程的挑战,现有领域专用编译器的局限性,以及TileLang如何通过解耦数据流与调度、提供精细控制和自动化优化来实现卓越性能。节目还分享了TileLang在不同硬件平台和AI工作负载上的实验成果,展示了其在提升编程效率和计算性能方面的巨大潜力。

深入探索DeepSeek-V3.2-Exp:稀疏注意力如何提升长上下文效率? 29.09.2025

本期AI电台FM将深入探讨DeepSeek-AI最新推出的实验性稀疏注意力模型DeepSeek-V3.2-Exp。我们将揭秘其核心技术——DeepSeek稀疏注意力(DSA)如何通过闪电索引器和精细化令牌选择机制,在保持模型性能的同时,显著提升长上下文场景下的训练和推理效率。从架构设计到训练策略,再到实战评估,weedge专家将为您带来全面而生动的解读。

模态流形:神经网络优化的新范式 29.09.2025

深入探讨“模态流形”这一创新概念,揭示如何通过限制神经网络权重张量在特定流形上来优化训练过程,提升模型稳定性与性能。从张量健康的重要性,到流形优化算法的数学原理,再到模态流形如何实现跨层学习率预算,我们为您呈现一个激动人心的未来AI训练图景。

AI Radio FM - 技术频道: Qwen3-Omni 多模态模型的突破之旅 24.09.2025

本期节目深入探讨了Qwen团队发布的Qwen3-Omni技术报告,揭示了这一首次实现多模态(文本、图像、音频、视频)性能无损且达到SOTA的单一模型。我们将详细解析其创新的Thinker-Talker MoE架构、超低延迟的实时语音生成技术、以及在各项基准测试中超越闭源模型(如Gemini-2.5-Pro, GPT-4o-Transcribe)的卓越表现。此外,还将讨论其广泛的语言支持、独特的多模态位置编码以及未来的发展方向。

OneSearch:电商搜索端到端生成式框架的深度探索 20.09.2025

欢迎来到AI Radio FM - 科技频道!本期节目,我们将深入探讨快手科技提出的革命性电商搜索框架OneSearch。这个框架旨在克服传统多级级联架构的限制,通过引入关键词增强分层量化编码、多视图用户行为序列注入和偏好感知奖励系统,实现电商搜索的端到端生成。我们将详细解析OneSearch如何提升搜索效率、优化用户体验,并带来显著的业务增长和成本节约。

AI Radio FM - 科技频道:小米MiMo-Audio——通用语音智能的里程碑 19.09.2025

本期节目深入探讨了小米MiMo-Audio音频语言模型。通过前所未有的大规模预训练,MiMo-Audio展现出惊人的少样本学习能力,实现了语音领域的“GPT-3时刻”。我们详细讨论了其创新的分词器、多模态架构、分阶段训练策略,以及在语音理解、生成和对话方面取得的领先成果,包括超越开源模型并接近甚至超越闭源模型的表现。节目还将探讨该模型的独特优势、目前面临的挑战和未来的发展方向。

LLM推理的确定性之战:揭秘非确定性根源与解决方案 14.09.2025

欢迎收听AI Radio FM - 科技频道!本期节目,我们将深入探讨大型语言模型推理中令人头疼的非确定性问题。从浮点数非结合性到批量不变性,我们将一步步揭示LLM推理结果不一致的真正原因,并分享如何实现真正可复现、确定性结果的创新方法,包括对RMSNorm、矩阵乘法和注意力机制的批处理不变性改造。此外,我们还将讨论确定性推理对真实在线强化学习的关键意义。跟随我们的专家,weedge,一起攻克这个技术难题!

智能体AI的未来:小型语言模型将如何颠覆行业? 10.09.2025

本期节目深入探讨了一篇引人深思的论文,该论文提出小型语言模型(SLMs)将成为智能体AI的未来。我们将揭示SLMs为何在能力、经济性和灵活性上优于大型语言模型(LLMs),探讨其在智能体系统中的独特优势,并讨论将LLMs转换为SLMs的实际路径、面临的挑战以及未来的发展潜力。

XQuant:突破大型语言模型推理的内存瓶颈 10.09.2025

本期节目我们将深入探讨XQuant,一项通过巧妙利用计算能力超越内存限制的创新技术。它如何通过量化输入激活X而非KV缓存,实现高达12.5倍的内存节省,同时保持接近FP16的精度,为LLM推理带来革命性变革?我们还将揭示XQuant-CL如何利用跨层相似性,以及如何支持GQA模型,共同探讨这项面向未来的技术如何加速大模型应用!

腾讯混元大模型:语言翻译新篇章——低资源语种的突破与融合智慧 01.09.2025

本期节目,我们将深入探讨腾讯混元团队发布的开创性翻译模型Hunyuan-MT-7B和Hunyuan-MT-Chimera-7B。我们将解析其独特的训练框架,如何在通用预训练、面向翻译的预训练、SFT、强化学习和弱到强强化学习的结合下,实现卓越的翻译性能,尤其是在曼德林与少数民族语言双向翻译方面的突破。通过详尽的案例分析和权威的基准测试结果,揭示这些模型如何超越业界领先水平,甚至在某些特定场景下超越人类专家。

(VibeVoice版)腾讯混元大模型:语言翻译新篇章——低资源语种的突破与融合智慧 01.09.2025

本期节目,我们将深入探讨腾讯混元团队发布的开创性翻译模型Hunyuan-MT-7B和Hunyuan-MT-Chimera-7B。我们将解析其独特的训练框架,如何在通用预训练、面向翻译的预训练、SFT、强化学习和弱到强强化学习的结合下,实现卓越的翻译性能,尤其是在曼德林与少数民族语言双向翻译方面的突破。通过详尽的案例分析和权威的基准测试结果,揭示这些模型如何超越业界领先水平,甚至在某些特定场景下超越人类专家。

LongCat-Flash:5600亿参数 MoE 模型的效率与智能双重突破 01.09.2025

深入探讨美团LongCat团队发布的5600亿参数MoE语言模型LongCat-Flash。我们将解析其两大创新架构:零计算专家和快捷连接MoE,如何实现计算效率和代理能力的飞跃。同时,还会揭示其在万亿级数据训练、推理优化以及Agent任务上的卓越表现,并分享其背后的稳定训练策略和基础设施保障。

LongCat-Flash:5600亿参数 MoE 模型的效率与智能双重突破 (VibeVoice版本) 01.09.2025

深入探讨美团LongCat团队发布的5600亿参数MoE语言模型LongCat-Flash。我们将解析其两大创新架构:零计算专家和快捷连接MoE,如何实现计算效率和代理能力的飞跃。同时,还会揭示其在万亿级数据训练、推理优化以及Agent任务上的卓越表现,并分享其背后的稳定训练策略和基础设施保障。

AI自信深思:大语言模型推理效率与性能的飞跃 30.08.2025

深入探讨DeepConf这一创新方法,它如何通过模型内部的置信度信号,动态筛选低质量推理路径,显著提升大语言模型在复杂推理任务中的效率和准确性,同时大幅减少计算成本。

Step-Audio 2:赋能下一代智能语音交互 29.08.2025

本期节目深入探讨了Step-Audio 2,一个端到端的多模态大语音语言模型。我们将揭示它是如何通过创新的架构、海量数据训练和强化学习,在语音识别、音频理解、语音翻译和多模态对话等领域实现最先进性能的。更令人兴奋的是,Step-Audio 2如何理解并生成富有情感和风格的语音,甚至能调用外部工具进行实时信息检索和音色切换,为我们带来前所未有的智能语音交互体验。

VIBEVOICE深度解析:长篇多说话人语音合成的革命 26.08.2025

本期节目我们将深入探讨微软研究院推出的VIBEVOICE模型,一款专为长篇、多说话人对话式语音合成设计的创新技术。我们将剖析其核心优势,包括革命性的语音编码器、前所未有的合成时长,以及其在主观和客观评估中如何超越现有顶尖模型。同时,我们也将讨论其技术架构、应用前景以及潜在的风险与局限性。

DuPO:大语言模型自我验证的新范式 25.08.2025

深入探讨DuPO框架如何通过广义对偶学习实现大语言模型(LLM)的自我验证,摆脱昂贵的人工标注,提升翻译和数学推理等任务的性能,并实现训练与推理的双重优化。

AI Radio FM - 科技频道:ALIGNATT - 实时语音翻译的新突破 25.08.2025

本期节目深入探讨了ALIGNATT,一种利用注意力机制的音频-翻译对齐信息来指导实时语音翻译的新策略。我们揭示了它如何在离线训练模型上实现最先进的性能,显著提升翻译质量并降低延迟。

流媒体Sortformer:基于到达顺序的说话人缓存实时说话人识别 23.08.2025

本期节目深入探讨了NVIDIA最新发布的“流媒体Sortformer”技术,这是一种基于说话人到达时间顺序的实时说话人识别框架。我们将详细解析其核心创新——“到达顺序说话人缓存”(AOSC),以及它如何突破传统离线方法的局限,实现高效、低延迟的实时多说话人追踪。从Sortformer的诞生到流媒体扩展的精妙设计,再到在DIHARD III和CALLHOME等基准数据集上的卓越表现,我们将为您揭示这一技术如何为实时字幕、虚拟会议和对话分析等应用带来革命...

AI电台FM:技术频道 - 实时全频带语音增强的混合DSP与深度学习方法 21.08.2025

本期节目深入探讨了实时全频带语音增强的突破性进展,特别是Mozilla公司Jean-Marc Valin提出的混合DSP与深度学习方法。我们将揭示这种创新方法如何通过结合传统信号处理与现代神经网络的优势,在保持低复杂度的同时,显著提升语音去噪的质量,并讨论其在实时应用中的巨大潜力,例如视频会议系统。

Listen to the AI Podcast podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.