weedge

AI Podcast

Latest podcasts about AI Technology and Papers.

Author

weedge

Category

Technology

Podcast website

podcast-997.pages.dev

Latest episode

Apr 17, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

AI Radio FM - Technology Channel - 解密Comet:MoE的精细计算通信重叠技术 12.03.2025

本期播客深入探讨了Comet,这是一种为混合专家模型(MoE)设计的优化系统,通过精细的计算与通信重叠,显著提高了MoE模型的执行效率。我们将讨论Comet的两个关键设计:基于共享张量的依赖解析和自适应工作负载分配,以及它们如何克服现有MoE系统中的挑战。我们还将分享Comet在实际生产环境中的部署情况,以及它如何为大规模GPU集群节省数百万GPU小时。

AI Radio FM - 深入探索Flux:GPU上的快速通信重叠技术 12.03.2025

本期播客深入探讨Flux,一种通过内核融合在GPU上实现快速软件通信重叠的新方法。Flux通过将通信和计算操作分解为更细粒度的操作并融合到更大的内核中,有效隐藏通信延迟,同时不影响内核效率。

AI Radio FM - 揭秘YourTTS:零样本多说话人语音合成与语音转换的新突破 12.03.2025

本期播客深入探讨YourTTS,一个基于VITS模型并进行多项创新改进的零样本多说话人TTS和语音转换系统。我们详细讨论了YourTTS如何实现英语零样本多说话人TTS的SOTA结果,以及在VCTK数据集上与SOTA相当的零样本语音转换结果。此外,我们还探讨了YourTTS在目标语言单说话人数据集上的应用,以及通过少于1分钟语音微调模型以适应新说话人的能力。

XTTS:大规模多语言零样本语音合成模型 12.03.2025

本播客讨论了XTTS,一个在16种语言中实现最先进结果的大规模多语言零样本语音合成模型。XTTS是第一个支持低/中资源语言的大规模多语言ZS-TTS模型,并且可以在不需要并行训练数据集的情况下执行跨语言ZS-TTS。

AI Radio FM - 探索TorToise语音合成技术 12.03.2025

本期播客深入讨论James Betker的论文《Better speech synthesis through scaling》,重点介绍TorToise,一种富有表现力的多语音文本转语音系统。

AI Radio FM - 解密Spark-TTS:高效LLM语音合成新星 12.03.2025

深入探讨Spark-TTS,一个基于大型语言模型的高效文本转语音系统,具有单流解耦语音令牌。探索BiCodec、VoxBox数据集以及Spark-TTS的创新特性。

AI Radio FM - 高效Transformer模型深度解析 11.03.2025

本期播客深入探讨2020年及以后的高效Transformer模型,包括其架构、优缺点以及在自然语言处理和计算机视觉领域的应用。

AI Radio FM - 探索 IndexTTS:工业级可控高效的零样本语音合成系统 11.03.2025

本期播客深入探讨了 bilibili 发布的 IndexTTS 系统,这是一个基于大型语言模型(LLM)的文本转语音(TTS)系统。我们将讨论其在中文场景下的创新,包括字符-拼音混合建模方法,以及在语音编码方面的优化。我们还将比较 IndexTTS 与现有开源 TTS 系统的性能,并探讨其在实际应用中的优势。

AI Radio FM - 动态内存压缩技术 11.03.2025

本期播客深入探讨了动态内存压缩(DMC)技术,这是一种在推理时在线压缩键值(KV)缓存的方法,旨在提高大型语言模型(LLM)的效率。通过在预训练的LLM(如Llama 2)上应用DMC,可以在不增加额外参数的情况下显著提高推理吞吐量,同时保持原始模型的下游性能。

AI Radio FM - TorchTitan深度解析 11.03.2025

深入探讨TorchTitan,一个用于生产级LLM预训练的原生PyTorch解决方案。

AI Radio FM - 深度学习技术频道 10.03.2025

本期播客深入探讨了Tree Attention,一种针对GPU集群上长上下文注意力机制的拓扑感知解码方法。通过将自注意力表示为能量函数的梯度,Tree Attention实现了更快的跨设备解码速度、更低的通信量和更少的峰值内存。

AI Radio FM - 深入探索 Ring Attention 技术 10.03.2025

本期播客深入探讨了 Ring Attention with Blockwise Transformers (Ring Attention) 技术,这是一种新的内存高效方法,用于解决 Transformers 在处理长序列时的内存限制问题。我们将讨论其核心概念、优势、实验结果以及对未来 AI 发展的潜在影响。

DeepSpeed-MoE:推进专家混合推理和训练,助力下一代人工智能规模 09.03.2025

本次播客深入探讨了DeepSpeed-MoE,这是一个端到端的专家混合(MoE)训练和推理解决方案,旨在解决大型MoE模型在实际应用中的挑战。讨论涵盖了新颖的MoE架构设计、模型压缩技术以及高度优化的推理系统,这些技术显著降低了MoE模型的推理延迟和成本。

MegaBlocks:稀疏混合专家模型的高效训练 09.03.2025

本次播客讨论了MegaBlocks,这是一个在GPU上高效训练混合专家模型(MoE)的系统。MegaBlocks通过将MoE计算重新表述为块稀疏操作,并开发新的块稀疏GPU内核来有效处理MoE中存在的动态性,解决了现有框架的局限性。

AI Radio FM - FasterMoE技术解读 09.03.2025

本期播客深入探讨FasterMoE,一个用于高效训练大型动态预训练模型(如MoE模型)的分布式系统。我们将讨论其性能模型、动态阴影、智能调度和避免拥塞的专家选择策略。

FastMoE:稀疏门控混合专家模型训练系统 09.03.2025

本期播客深入探讨FastMoE,一个基于PyTorch的分布式混合专家(MoE)训练系统。FastMoE旨在通过算法和系统协同设计,实现高效的万亿级参数语言模型训练。它提供了一个分层接口,既能灵活设计模型,又能轻松适应Transformer-XL和Megatron-LM等不同应用。FastMoE通过高性能加速技术优化训练速度,并支持跨多个节点和GPU放置专家,从而实现专家数量随GPU数量线性扩展。

GPipe深度学习模型并行化技术 07.03.2025

本期播客深入探讨GPipe,一种用于训练大型神经网络的可扩展模型并行库。通过案例分析和技术讲解,揭示GPipe如何通过批次拆分流水线并行算法实现高效的模型扩展。

AI Radio FM - 深度学习框架OneFlow 07.03.2025

本期播客深入探讨了新型分布式深度学习框架OneFlow,该框架基于SBP抽象和Actor模型,旨在简化和优化大规模深度神经网络模型的训练。

AI Radio FM - 深度学习的Pathways 07.03.2025

本期播客深入探讨了Pathways,这是一个为分布式机器学习设计的新系统,旨在支持未来的ML工作负载,同时保持当前模型的性能。

PaLM:利用 Pathways 进行语言模型规模化 07.03.2025

本次播客深入探讨了谷歌最新的大型语言模型 PaLM,重点介绍了其架构、训练过程、在各种任务上的突破性能力,以及相关的偏见和伦理考量。

ZeRO: 内存优化实现万亿参数模型训练 06.03.2025

本次播客深入探讨了微软提出的ZeRO技术,该技术通过消除数据和模型并行训练中的内存冗余,显著提高了训练速度并增加了可高效训练的模型大小。

AI Radio FM - 深度神经网络的异步流水线并行训练 06.03.2025

本期播客深入探讨了名为PipeMare的新型DNN训练方法,该方法在流水线并行训练中实现了高硬件利用率和低内存占用。

GShard:使用条件计算和自动分片扩展巨型模型 06.03.2025

本播客讨论了GShard,这是一个由一组轻量级注释API和XLA编译器的扩展组成的模块。它提供了一种优雅的方式来表达各种并行计算模式,而对现有模型代码的更改最少。GShard使我们能够使用自动分片将具有稀疏门控专家混合的多语言神经机器翻译Transformer模型扩展到超过6000亿个参数。我们证明了这种巨型模型可以在2048个TPU v3加速器上高效地训练4天,与现有技术相比,从100种语言到英语的翻译质量要高得多。

PyTorch 分布式数据并行训练加速经验 06.03.2025

本播客讨论 PyTorch 分布式数据并行模块的设计、实现和评估。涵盖了梯度分桶、计算与通信重叠以及跳过同步等技术,以实现近线性可扩展性。

AI Radio FM - 深度学习模型训练加速 06.03.2025

本期节目探讨如何通过减少激活重计算来加速大型Transformer模型的训练。我们将深入研究序列并行和选择性激活重计算技术,以及它们如何与张量并行结合,以最大限度地减少激活重计算的需要。

Listen to the AI Podcast podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.