DjvuLee

智涌多模

Technology ZH ↓ 7 episodes

探索多模态AI的前沿,解析复杂技术,洞见未来应用。

Be sure to visit the podcast's website and support the creator: www.xiaoyuzhoufm.com

Author

DjvuLee

Category

Technology

Podcast website

www.xiaoyuzhoufm.com

Latest episode

Nov 4, 2024

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android almost 10M downloads · 4.8 rating iOS soon

Episodes

[Google]AudioLM: 一种用于音频生成的语言建模方法 04.11.2024

一、概述 AudioLM 是 Google Research 提出的一种新型音频生成框架,旨在生成具有长期一致性和高质量的音频。其核心思想是将音频映射到离散的 token 序列,并将音频生成转换为该表征空间中的语言建模任务。 二、主要思路 AudioLM 利用现有的音频 tokenizer 来平衡重建质量和长期结构之间的权衡,并提出了一种混合的 tokenization 方案,以实现这两个目标。 * 语义 token: AudioLM 利用在音频上预训练的掩码语言模型的离散化激活来...

[DeepSeek]Janus: 解耦视觉编码以实现统一的多模态模型 21.10.2024

本文介绍了 Janus,一个统一的多模态理解和生成模型,其核心在于解耦视觉编码,以分别满足理解和生成任务的不同需求。 重要观点和事实: * **多模态模型的趋势:**近年来,多模态大模型在理解和生成领域都取得了显著进展。研究人员致力于构建更强大、更通用的多模态模型,将理解和生成任务结合起来。 * 现有统一模型的局限性: 传统的统一模型通常使用单一的视觉编码器来处理理解和生成任务,但这会导致两种任务之间产生冲突和权衡...

[Baichuan]BAICHUAN-OMNI多模态模型技术报告 16.10.2024

介绍了百川智能开发的首个开源 7B 多模态大语言模型 (MLLM) Baichuan-Omni。该模型能够同时处理和分析图像、视频、音频和文本等多种模态信息,提供先进的多模态交互体验,并在多个基准测试中表现出强大的性能。 核心思想: 1. 构建全面的多模态训练数据: Baichuan-Omni 的训练数据涵盖了图像、视频、音频和文本等多种模态,并融合了开源、合成和内部标注的数据集。 * 图像数据: 包括图像描述、交错图文、OCR 数据和图表数据等,...

[Apple]MM1.5:多模态大语言模型微调的方法、分析与见解 14.10.2024

一、 MM1.5 简介 MM1.5 是一系列多模态大型语言模型 (MLLM),包括密集模型(参数规模从1B到30B)和专家混合 (MoE) 模型。该模型在 MM1 [118] 的基础上进行了显著升级,能够出色地处理各种多模态任务,包括: * 通用领域和富文本图像理解:从理解简单图像到复杂的富文本图像。 * 粗粒度到细粒度理解: 从理解图像整体到具体细节。 * 单图像到多图像推理: 从单张图像理解到多张图像之间的推理。 二、 MM1.5 的主要能力 * 视觉指代和定...

Pixtral 12B: 兼顾文本和多模态任务的多模态模型 13.10.2024

介绍了 Pixtral 12B,一个由 Mistral AI 开发的 120 亿参数多模态语言模型。Pixtral 12B 能够理解自然图像和文本,并在多项多模态基准测试中取得领先成绩,超越了许多更大的模型。 重要特点: * 强大的多模态推理能力: Pixtral 12B 在多模态任务上表现出色,优于同等规模的开源模型,甚至超越了 Llama-3.2 90B 等更大的模型。 * 卓越的文本理解能力: 与许多专注于多模态能力而牺牲文本性能的开源模型不同,Pixtral 12B 在文本任...

Molmo and PixMo State-of-the-Art Multimodal Models 12.10.2024

本文介绍了Molmo,这是一系列最先进的开放式视觉语言模型(VLM)。Molmo的独特之处在于其完全开放的权重和数据,不依赖于任何专有VLM生成的合成数据,从而为构建高性能VLM奠定了基础。 主要发现 * Molmo家族中最有效的模型MolmoE-1B,基于OLMoE-1B-7B混合专家语言模型,在学术基准测试和用户偏好方面几乎与GPT-4V的性能相匹配。 * 基于OLMo-7B-1024和Qwen2 7B的Molmo-7B-O和Molmo-7B-D模型,在学术基准测试和用户偏好方面均优于GPT...

Aria: An Open Multimodal Native Mixture-of-Experts Model 11.10.2024

主题: 介绍 ARIA,第一个开源的多模态原生混合专家模型 (MoE),其在各种多模态、语言和编码任务中表现出最佳性能。 主要观点和事实: * 多模态原生: ARIA 是一个单一模型,能够理解多种输入模态(如文本、代码、图像、视频),其性能可与类似规模的模态特定模型相媲美或超越。它为用户提供无缝的多模态体验,无需区分不同模态的输入。 “多模态原生模型指的是一个单一模型,它能够跨多种输入模态(例如文本、代码、图像、视频)具备...

Listen to the 智涌多模 podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.