任雨山
Seventy3
73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
【第249期】R1-Searcher: RL for Enhanced LLM Search Capabilities 06.06.2025 18:55
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning Summary 这项研究介绍了一个名为 R1-Searcher 的新型框架,旨在通过强化学习提升大型语言模型(LLMs)的检索增强生成(RAG)能力。该框架采用两阶段的成果监督强化学习方法,使 LLMs 能够自主调用外部搜索系统获...
【第248期】VisualThinker-R1-Zero: Multimodal Reasoning via RL 05.06.2025 13:06
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model Summary 本研究报告成功复制了 DeepSeek-R1 模型中利用强化学习实现自主推理的显著特征,即所谓的“顿悟时刻”和响应长度的增加,这次是在一个较小的多模态模型上实现。通过直接在非 SFT (监督微调) Qwen2-VL-2B 模型上应用强化学习,...
【第247期】Vision-R1:推理视觉大模型 04.06.2025 16:32
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models Summary 本研究介绍 Vision-R1,这是一种多模态大型语言模型 (MLLM),旨在增强其推理能力,尤其是解决数学问题。该方法通过结合冷启动初始化和强化学习 (RL)...
【第246期】用LLM做Encoder,进行机器翻译 03.06.2025 24:27
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine Translation Summary 这项研究探索了一种结合大型语言模型(LLMs)和神经机器翻译(NMT)的方法,旨在创建一个高效、易于优化且具有通用性的翻译系统。研究人员提出...
【第245期】固定文本长度做RAG 02.06.2025 14:33
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: More Documents, Same Length: Isolating the Challenge of Multiple Documents in RAG Summary 这份研究探究了在检索增强生成(RAG)任务中,大型语言模型(LLM)处理多文档输入的挑战,尤其是在保持总上下文长度不变的情况下。 研究人员创建了特...
【第244期】TokenOCR:Token基本文本图像LLM 01.06.2025 19:07
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: A Token-level Text Image Foundation Model for Document Understanding Summary 来源描述了一种新型文本图像基础模型,称为 TokenOCR,以及利用它构建的文档理解多模态大语言模型 TokenVL。研究人员通过创建一个大规模、细粒度的标记级图像文本数...
【第243期】AppAgentX:智能手机上的Agent 31.05.2025 10:42
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: AppAgentX: Evolving GUI Agents as Proficient Smartphone Users Summary 这些文字介绍了一款名为 AppAgentX 的新型 GUI 代理框架,旨在 提高 基于大型语言模型(LLM)的代理在 智能手机 上执行任务的 效率 和 准确性。该框架通过 记忆 代理的 操...
【第242期】MPO:Meta Plan Optimization 30.05.2025 24:10
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: MPO: Boosting LLM Agents with Meta Plan Optimization Summary 本研究提出了 MPO(Meta Plan Optimization)框架,旨在提升大型语言模型(LLM)智能体的规划能力。 通过整合高级别的 元计划,MPO 提供了一种即插即用的方案,以有效改进智能体的表...
【第241期】LLaVE:一种新型视觉模型 29.05.2025 14:50
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning Summary 研究论文介绍了 LLaVE,一种新型大型语言和视觉嵌入模型,它通过一种被称为难度加权对比学习的创新框架来提升性能。研究人员发现,现有模...
【第240期】Optimal Brain Apoptosis 28.05.2025 15:47
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Optimal Brain Apoptosis Summary 这篇研究文章提出了名为Optimal Brain Apoptosis (OBA) 的神经网络剪枝新方法,旨在提高卷积神经网络和 Transformer 等大型模型的计算效率并降低资源需求。与之前依赖近似方法的工作不同,OBA 直接计算 Hessian-向...
【第239期】SoS1:O1和R1模型可以解决Hilbert第17问题难度相当大问题 27.05.2025 26:14
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: SoS1: O1 and R1-Like Reasoning LLMs are Sum-of-Square Solvers Summary 文本讨论了大型语言模型(LLMs)在解决复杂的数学问题方面的能力,特别是一个称为非负多项式判定的问题,该问题与Hilbert第17问题密切相关且在计算上难以解决。研究人员创...
【第238期】xAR:Next-X Prediction 26.05.2025 14:32
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation Summary 这项研究提出了 xAR,这是一种用于自回归视觉生成的新框架,旨在超越传统的基于 “下一词元” 预测的方法。通过将 “词元” 的概念扩展到更灵活的 “实体 X”,例如...
【第237期】PlanGEN:多智能体的计划生成框架 25.05.2025 19:47
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solving Summary 文本讨论了一种名为 PlanGEN 的多智能体框架,旨在改进大型语言模型 (LLM) 解决复杂规划和推理任务的能力。该框架包含...
【第236期】NeoBERT:新一代BERT 24.05.2025 18:26
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: NeoBERT: A Next-Generation BERT Summary 这项研究提出了 NeoBERT,这是一个新一代的 编码器模型,旨在弥合其 自回归 同类模型所取得的进展与 BERT 等现有 编码器 之间的差距。通过整合 最新的架构改进、更现代的数据集 和 优化的预训练方法,NeoB...
【第235期】AI co-scientist:AI协作科学家 23.05.2025 16:08
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Towards an AI co-scientist Summary 这些资料介绍了一款名为“AI共同科学家”的系统,该系统旨在通过模拟科学方法来 协助和加速科学发现 。这款基于Gemini 2.0的多智能体系统能够根据自然语言指定的研究目标, 检索并分析现有文献,提出新颖的假设和...
【第234期】Transformers without Normalization 22.05.2025 17:18
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Transformers without Normalization Summary 该来源介绍了一项研究,该研究挑战了神经网络中归一化层不可或缺的观点。研究人员提出了一种名为Dynamic Tanh (DyT) 的简单操作,作为 Transformer 架构中归一化层的替代。通过模仿归一化层 S 形的输入...
【第233期】A-MEM:LLM Agent的记忆系统 21.05.2025 16:03
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: A-MEM: Agentic Memory for LLM Agents Summary 这项研究提出了 A-MEM,一种为大型语言模型(LLM)代理设计的创新记忆系统。A-MEM 解决了现有记忆系统因固定操作和结构而缺乏适应性的问题。受卡片盒笔记法的启发,该系统通过动态索引和链接创建相互...
【第232期】KV-Edit:精确保留背景信息的图像编辑方法 20.05.2025 13:33
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: KV-Edit: Training-Free Image Editing for Precise Background Preservation Summary 这篇研究文章提出了名为KV-Edit的新方法,旨在通过精确保留背景信息来改进图像编辑。该方法利用Vision Transformer (DiT)架构中的键值(KV)缓存机制,在编辑过...
【第231期】DICEPTION:一种通用的视觉Diffusion模型 19.05.2025 29:18
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks Summary 这份文档介绍了一款名为 DICEPTION 的通用扩散模型,旨在解决多种视觉感知任务。该模型通过 利用预训练的文本到图像扩散模型的先验知识,将不同的感知任务输出统一到...
【第230期】olmOCR:PDF文档高质量提取模型 18.05.2025 15:47
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models Summary 这段文字介绍了一个名为 olmOCR 的开源工具,旨在处理 PDF 文档并提取高质量文本用于训练大型语言模型。该工具通过文档锚定技术结合一个经过微调的视觉语言模...
【第229期】Persona Hub:10亿个角色的数据合成方法 17.05.2025 18:09
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Scaling Synthetic Data Creation with 1,000,000,000 Personas Summary 本技术报告提出了一种新颖的基于角色的数据合成方法,利用大型语言模型(LLM)的不同视角来创建多样的合成数据。为了大规模应用此方法,研究者推出了 Persona Hub,一个包含...
【第228期】从优化角度理解Duffusion模型 16.05.2025 17:27
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Interpreting and Improving Diffusion Models from an Optimization Perspective Summary 这些资料的核心内容是从优化角度理解和改进扩散模型。它们将扩散模型中的去噪过程解释为近似投影,并进一步将其视为对欧几里德距离函数应用近似梯度下降。...
【第227期】NullFace:免于训练的面部匿名化方法 15.05.2025 14:32
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: NullFace: Training-Free Localized Face Anonymization Summary 来源文本介绍了NullFace,这是一种训练免费的面部匿名化方法,它能有效隐藏身份,同时保留凝视、表情和头部姿势等关键属性。与传统方法不同,NullFace 利用预训练的文本到图像扩散模...
【第226期】SegAgent:像素级理解能力探究 14.05.2025 20:19
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories Summary 这项研究介绍了一种名为 HLMAT 的新分割范例,其中大型多模态模型(MLLMs)通过模仿人类标注员使用交互式分割工具来执行像素级...
【第225期】OmniMamba:基于 Mamba-2 的多模态模型 13.05.2025 18:01
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models Summary 这篇研究文章介绍了 OmniMamba,这是一个基于 Mamba-2 的新型 多模态模型,能够处理图像理解和生成任务。与依赖大量数据的现有模型不同...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.