weedge
AI Podcast
Latest podcasts about AI Technology and Papers.
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
LLaVA-OneVision: 易于实现的视觉任务迁移 09.02.2025 5:43
探讨 LLaVA-OneVision,一个开源的大型多模态模型家族,通过整合 LLaVA-NeXT 博客系列中的数据、模型和视觉表示方面的见解而开发。实验结果表明,LLaVA-OneVision 是首个能够同时推动开放 LMM 在单图像、多图像和视频场景中性能边界的单一模型。该设计允许跨不同模态/场景进行强大的迁移学习,从而产生新的新兴能力。
VITA-1.5:迈向GPT-4o水平的实时视觉和语音交互 09.02.2025 7:06
本期播客深入探讨VITA-1.5,一个旨在实现实时视觉和语音交互的多模态大型语言模型。我们将讨论其架构、训练策略以及在图像、视频和语音任务上的评估结果。
Hibiki: 高保真同步语音到语音翻译 08.02.2025 5:31
本播客深入探讨了 Hibiki,一种用于同步语音翻译的创新解码器模型。我们将讨论其架构、训练方法以及在法语-英语翻译任务中的卓越性能。此外,我们还将探讨其在设备上的实时部署潜力。
Kimi k1.5: 基于强化学习的大语言模型扩展 08.02.2025 9:06
本播客深入探讨了 Kimi 团队如何利用强化学习 (RL) 训练其最新的多模态大语言模型 Kimi k1.5。内容涵盖 RL 训练技术、多模态数据配方以及基础设施优化,重点关注长文本扩展和策略优化,以实现卓越的推理性能。
Omni-Emotion:通过详细的面部和音频建模扩展视频 MLLM 以进行多模态情感分析 07.02.2025 5:18
本播客讨论了Omni-Emotion模型,该模型通过集成音频和细粒度面部信息来增强视频多模态大型语言模型(MLLM),从而在情感识别和推理任务中实现了最先进的性能。此外,本播客还讨论了用于训练Omni-Emotion模型的高质量自审阅和人工审阅情感数据集。
HumanOmni:以人为中心的视频理解大型视觉语音语言模型 07.02.2025 8:05
深入探讨HumanOmni,一个为理解以人为中心的场景而设计的多模态大型语言模型。我们讨论了其数据集构建、模型架构以及在情感识别、面部表情理解和动作理解等任务上的表现。
Align-Anything: 多模态模型训练与语言反馈 06.02.2025 7:39
本播客讨论了一种名为 Align-Anything 的新框架,该框架旨在通过利用人类反馈,尤其是语言反馈,来提升多模态模型的性能。该框架包括一个大规模的多模态数据集、一种新颖的对齐算法以及一个全面的评估工具。
OmniHuman: 混合条件的人体动画模型 06.02.2025 6:46
探讨OmniHuman,一种基于Diffusion Transformer的框架,通过混合运动相关条件来扩展数据,实现高度逼真的人体视频生成。
Scaling LLM Test-Time Compute Optimally 01.02.2025 7:12
A podcast discussing how to optimize the use of test-time computation for large language models (LLMs), focusing on strategies like searching against verifiers and refining proposal distributions to improve performance on challenging tasks.
LLM Test-Time Compute Scaling: An In-Depth Analysis 01.02.2025 7:26
A podcast discussing how to optimally scale test-time compute for Large Language Models (LLMs), focusing on improving both verifiers and the model's response distribution.
AI Radio FM - Technology Channel, Your Personal Generative AI Podcast 28.01.2025 6:11
Discussing the Janus-Pro multimodal model.
JanusFlow: 统一多模态理解与生成框架 28.01.2025 5:28
这是一个关于JanusFlow的播客,JanusFlow是一种强大的框架,它将图像理解和生成统一到一个模型中,通过整合自回归语言模型和校正流来实现。
AI科技前沿:Janus多模态统一框架解析 28.01.2025 6:57
欢迎来到AI Radio FM - 科技频道,您的专属生成式AI播客!今天,我们将深入探讨一项名为Janus的创新多模态框架。Janus通过解耦视觉编码,实现了多模态理解和生成任务的统一,为下一代多模态模型的发展提供了新思路。让我们一起揭开Janus的神秘面纱!
Hunyuan3D 2.0: 高分辨率纹理3D资产生成的扩散模型 24.01.2025 11:06
本播客讨论Hunyuan3D 2.0,这是一个用于生成高分辨率纹理3D资产的先进大规模3D合成系统。该系统包括两个基础组件:一个大规模形状生成模型Hunyuan3D-DiT,以及一个大规模纹理合成模型Hunyuan3D-Paint。
DeepSeek-R1:通过强化学习激励大型语言模型的推理能力 24.01.2025 7:44
本播客深入探讨DeepSeek-R1模型,该模型通过大规模强化学习显著提升了大型语言模型的推理能力。我们将分析DeepSeek-R1-Zero和DeepSeek-R1的训练过程、性能表现,以及它们在不同任务上的卓越表现。同时,我们还将讨论如何通过知识蒸馏技术,使更小的模型也能具备强大的推理能力。
DistServe:面向高吞吐量的大型语言模型服务的分离式预填充和解码 23.01.2025 4:52
本播客讨论了DistServe,一种通过分离预填充和解码计算来提高大型语言模型(LLM)服务性能的系统。我们深入探讨了LLM推理的复杂性,并探讨了DistServe如何克服现有系统的局限性,从而在严格的延迟限制下显著提高服务性能。
大规模Transformer模型推理的效率优化 20.01.2025 7:07
本播客深入探讨了如何高效地部署大型Transformer模型进行生成式推理,特别是在延迟敏感和长序列长度的场景下。我们将讨论模型并行策略、内存优化和低级优化技术,这些技术共同实现了在延迟和模型FLOPS利用率方面的新的帕累托前沿。
AI Radio FM - Technology Channel, Your Personal Generative AI Podcast 19.01.2025 5:42
A podcast discussing the research paper 'Addressing Representation Collapse in Vector Quantized Models with One Linear Layer'
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation 19.01.2025 6:00
A podcast discussing a new approach to audio-driven portrait animation called Sonic, focusing on global audio perception rather than visual cues. The discussion covers the methodology behind Sonic, including context-enhanced audio learning, motion-decoupled controllers, and time-aware position shift fusion, as well as experimental results.
AI Radio FM - Technology Channel, Your Personal Generative AI Podcast 18.01.2025 6:27
A podcast discussing Titans: Learning to Memorize at Test Time.
AI Radio FM - Technology Channel 18.01.2025 5:48
A podcast discussing Tensor Product Attention, a novel attention mechanism for Large Language Models.
AI Radio FM - Technology Channel, Your Personal Generative AI Podcast 16.01.2025 7:07
A podcast discussing Classifier-Free Diffusion Guidance, a method for improving sample quality in diffusion models without relying on a separate classifier.
MinMo:多模态大型语言模型,实现无缝语音交互 15.01.2025 7:49
本播客深入探讨了阿里巴巴 Tongyi Lab 的 MinMo 模型,这是一种旨在实现无缝语音交互的多模态大型语言模型。我们讨论了其架构、训练过程以及在各种语音任务中的性能,包括语音识别、翻译、情感识别和全双工对话。
AI Radio FM - Technology Channel, Your Personal Generative AI Podcast 15.01.2025 5:34
A podcast discussing the paper Titans: Learning to Memorize at Test Time.
iSTFTNet: 快速轻量级梅尔频谱声码器 09.01.2025 5:19
探讨iSTFTNet如何通过逆短时傅里叶变换优化梅尔频谱声码器,提高速度和效率。
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.