weedge

AI Podcast

Latest podcasts about AI Technology and Papers.

Author

weedge

Category

Technology

Podcast website

podcast-997.pages.dev

Latest episode

Apr 17, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

深入剖析MiniMax-Speech:引领TTS新时代的语音合成技术 17.05.2025

本期节目,我们将深入探讨MiniMax-Speech,一款基于自回归Transformer的文本转语音模型。我们将揭示其可学习说话人编码器和创新的Flow-VAE架构如何实现高质量的零样本语音克隆,支持32种语言,并在多项评测中取得SOTA成绩。同时,我们还会讨论其在情感控制、文本生成音色和专业语音克隆等方面的强大扩展能力。

AI Radio FM - 科技频道:快速文本到音频生成的对抗性后训练技术 ARC 深度解析 17.05.2025

本期 AI Radio FM 科技频道,我们深入探讨了创新的 ARC (对抗性相对性对比) 后训练技术,该技术旨在大幅提升文本到音频模型的生成速度,同时保持高质量和多样性输出。我们将讨论其核心机制、实验结果以及在边缘设备和创意应用中的潜力。

深入探讨DeepSeek-V3:扩展挑战与AI硬件架构的反思 16.05.2025

本期播客深入剖析了DeepSeek-V3模型,探讨了其在扩展性方面面临的挑战,以及对未来人工智能硬件架构的深刻反思。我们讨论了硬件感知模型协同设计的关键创新,如多头潜在注意力(MLA)、专家混合(MoE)架构、FP8混合精度训练和多平面网络拓扑,以及这些技术如何应对内存容量、计算效率和互连带宽的限制。

FastVLM:视觉语言模型的高效视觉编码 15.05.2025

本期节目深入探讨 FastVLM,一种旨在优化视觉语言模型(VLM)中图像编码效率的新模型。我们将讨论 FastVLM 如何通过其核心组件 FastViTHD 实现高分辨率图像的高效处理,显著降低延迟,并与现有技术进行性能比较。

深入解析Qwen3:通义千问的最新力作! 14.05.2025

本期节目,我们将深入探讨通义千问团队最新发布的Qwen3系列大语言模型。从创新的“思考模式”与“非思考模式”统一框架,到惊人的多语言能力和各项基准测试中的SOTA表现,我们将全面解读Qwen3的技术亮点和未来展望。

深入探讨 EAGLE-3:通过训练时测试扩展大语言模型推理加速 13.05.2025

本期节目深入探讨了 EAGLE-3 研究论文,讨论了其如何通过创新的训练时测试技术和多层特征融合,显著提升大语言模型的推理速度,并发现了推理加速的缩放定律。

EAGLE: 更高效的 LLM 推理推测采样 12.05.2025

深入探讨 EAGLE 框架,一种新颖的推测采样技术,旨在解决大型语言模型 (LLM) 推理速度慢的问题。了解 EAGLE 如何通过特征级自回归和解决特征不确定性来显著提高生成速度,同时保持与原始 LLM 完全一致的输出分布。

AI Radio FM: 多词元预测 - 训练更快更好的大语言模型 12.05.2025

本期节目探讨了“多词元预测”这一训练大语言模型的新方法。我们讨论了该方法如何通过同时预测多个未来词元来提高训练效率和模型性能,特别是在代码生成任务上,以及它如何实现更快的推理速度。我们深入分析了其原理、实验结果以及与传统下一个词元预测的区别。

加速自回归模型:深入探讨分块并行解码 12.05.2025

深入探讨 Mitchell Stern、Noam Shazeer 和 Jakob Uszkoreit 提出的分块并行解码技术,了解其如何显著提升 Transformer 等模型的生成速度,同时探讨其在机器翻译和图像超分辨率任务中的应用、效果与权衡。

VITA-Audio: 实时语音交互的未来之声 08.05.2025

本期节目深入探讨 VITA-Audio 技术,一种旨在解决大型语音语言模型高延迟问题的创新方法,特别是其核心的 MCTP 模块和多阶段训练策略,如何实现快速、高效的实时语音交互。

TDT模型:联合预测词元与时长的序列转换技术革新 07.05.2025

深入探讨新颖的TDT(词元与时长转换器)模型架构,它如何通过联合预测词元及其时长,在语音识别、语音翻译和口语理解任务中实现更高的准确性和显著的推理加速。我们将讨论其核心机制、实验结果以及相比传统转换器模型的优势。

深入剖析Fast Conformer:高效语音识别的新篇章 07.05.2025

本期播客将深入探讨Fast Conformer模型,一个在Conformer基础上进行了革新性设计,旨在提升语音处理任务训练和推理效率的新型架构。我们将讨论其核心的下采样机制优化、长音频处理能力、在自动语音识别、语音翻译和口语理解等任务上的卓越表现,以及其惊人的模型扩展性。

Whisper: 通过大规模弱监督实现鲁棒语音识别 06.05.2025

深入探讨OpenAI的Whisper模型,该模型通过在68万小时的多语言、多任务弱监督数据上进行训练,实现了革命性的零样本语音识别和翻译能力,并达到了接近人类水平的鲁棒性。我们将讨论其训练方法、性能表现、关键优势以及未来方向。

DeepSeek-Prover-V2: 形式化数学推理的新篇章 01.05.2025

本期节目深入探讨 DeepSeek-AI 开源的 DeepSeek-Prover-V2 模型。我们讨论了它如何利用 DeepSeek-V3 进行子目标分解,结合强化学习,在 Lean 4 形式化定理证明中取得突破性进展,特别是在 MiniF2F 和 PutnamBench 等基准测试上的卓越表现,以及新引入的 ProverBench 和 AIME 问题的挑战。

Step1X-Edit:缩小开源与闭源图像编辑差距 28.04.2025

本期节目深入探讨了最新的开源图像编辑模型 Step1X-Edit。我们将讨论其创新的数据创建流程、模型架构、全新的 GEdit-Bench 评估基准,以及它如何在性能上追赶甚至超越 GPT-4o 等顶尖闭源模型。

AI Radio FM: 深入探讨UI-TARS - 下一代原生GUI智能体 28.04.2025

本期AI Radio FM深入探讨了UI-TARS这篇开创性的论文,讨论了原生图形用户界面(GUI)智能体的演进、核心能力以及UI-TARS模型本身。我们分析了其架构、创新的感知、动作建模、系统2推理和迭代学习机制,并解读了其在多个基准测试中超越现有框架(如GPT-4o和Claude)的卓越表现。

AI Radio FM - Technology Channel: MoonCast 播客生成技术深度解析 26.04.2025

深入探讨 MoonCast 技术,一个用于高质量零样本播客生成的解决方案。讨论其如何解决长语音和自发性对话的挑战,采用长上下文语言模型和创新的剧本生成模块,实现从纯文本生成自然、多说话人的播客语音。

Kimi-Audio 技术报告深度解读 26.04.2025

深入探讨 Kimi-Audio,一个开源的音频基础模型。我们将讨论其架构、数据处理、训练方法、评估结果以及未来的挑战与机遇。

深入探讨MAGI-1:下一代自回归视频生成模型 22.04.2025

本期节目,我们深入探讨了Sand AI的最新研究成果MAGI-1,一个大规模自回归视频生成模型。我们讨论了它的核心原理、创新架构、训练策略、强大的功能(如实时流生成、块级可控性、物理模拟)以及其背后的先进基础设施和评估结果。

深入探讨MagiAttention:为超长上下文和异构掩码训练实现线性可扩展性 22.04.2025

本期AI Radio FM - 技术频道,我们将深入探讨MagiAttention,这是一种创新的分布式注意力机制,旨在解决训练具有超长上下文(如视频生成模型)和复杂异构注意力掩码的大规模模型时面临的挑战。我们将讨论其核心组件,包括Flex-Flash-Attention内核、计算负载均衡策略、零冗余通信原语以及多阶段重叠技术,并分析其如何在实验中实现近乎线性的可扩展性。

AI Radio FM: 深入探讨 BitNet b1.58 2B4T - 首个开源原生1比特大语言模型 19.04.2025

在本期 AI Radio FM - 技术频道中,我们深入探讨了 BitNet b1.58 2B4T 的技术报告。这是一款开创性的 20 亿参数、原生 1 比特大语言模型,经过 4 万亿 token 训练。我们讨论了它的架构创新、独特的训练方法、与全精度及其他量化模型的性能比较,以及它在大幅降低内存占用、能耗和延迟方面的显著优势。加入我们,了解这款模型如何挑战全精度权重对于高性能 LLM 的必要性,并为资源受限环境中的强大 AI 部署开辟新途径。

Muon 优化器:扩展大语言模型训练的新前沿 12.04.2025

本期 AI Radio FM - Technology Channel 深入探讨了基于矩阵正交化的 Muon 优化器如何通过关键技术扩展到大规模语言模型训练,并介绍了使用 Muon 训练的 Moonlight 模型及其卓越性能。

Kimi-VL: 高效开源混合专家视觉语言模型 10.04.2025

本播客将深入探讨 Kimi-VL,一款高效的开源混合专家(MoE)视觉语言模型(VLM)。它在多模态推理、长文本理解和强大的代理能力方面表现出色,同时仅激活语言解码器中的 28 亿参数。我们将讨论其架构、预训练阶段、性能以及未来的发展方向。

WavChat:语音对话模型综述 07.04.2025

深入探讨语音对话模型的最新进展,涵盖语音表示、训练范式、流媒体、双工和交互能力。

AI Radio FM: WavTokenizer - 极致压缩与高保真音频编码新突破 07.04.2025

本期节目深入探讨WavTokenizer,一种创新的音频编解码器,它利用单一量化器实现了前所未有的压缩率,同时保持了业界领先的重建质量和更丰富的语义信息。我们将讨论其核心技术、与现有SOTA模型的对比及其在下游任务(如TTS)中的潜力。

Listen to the AI Podcast podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.