任雨山

Seventy3

73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。

Author

任雨山

Category

Technology

Podcast website

www.xiaoyuzhoufm.com

Latest episode

Jul 10, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

【第249期】R1-Searcher: RL for Enhanced LLM Search Capabilities 06.06.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning Summary 这项研究介绍了一个名为 R1-Searcher 的新型框架,旨在通过强化学习提升大型语言模型(LLMs)的检索增强生成(RAG)能力。该框架采用两阶段的成果监督强化学习方法,使 LLMs 能够自主调用外部搜索系统获...

【第248期】VisualThinker-R1-Zero: Multimodal Reasoning via RL 05.06.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model Summary 本研究报告成功复制了 DeepSeek-R1 模型中利用强化学习实现自主推理的显著特征,即所谓的“顿悟时刻”和响应长度的增加,这次是在一个较小的多模态模型上实现。通过直接在非 SFT (监督微调) Qwen2-VL-2B 模型上应用强化学习,...

【第247期】Vision-R1:推理视觉大模型 04.06.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models Summary 本研究介绍 Vision-R1,这是一种多模态大型语言模型 (MLLM),旨在增强其推理能力,尤其是解决数学问题。该方法通过结合冷启动初始化和强化学习 (RL)...

【第246期】用LLM做Encoder,进行机器翻译 03.06.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine Translation Summary 这项研究探索了一种结合大型语言模型(LLMs)和神经机器翻译(NMT)的方法,旨在创建一个高效、易于优化且具有通用性的翻译系统。研究人员提出...

【第245期】固定文本长度做RAG 02.06.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: More Documents, Same Length: Isolating the Challenge of Multiple Documents in RAG Summary 这份研究探究了在检索增强生成(RAG)任务中,大型语言模型(LLM)处理多文档输入的挑战,尤其是在保持总上下文长度不变的情况下。 研究人员创建了特...

【第244期】TokenOCR:Token基本文本图像LLM 01.06.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: A Token-level Text Image Foundation Model for Document Understanding Summary 来源描述了一种新型文本图像基础模型,称为 TokenOCR,以及利用它构建的文档理解多模态大语言模型 TokenVL。研究人员通过创建一个大规模、细粒度的标记级图像文本数...

【第243期】AppAgentX:智能手机上的Agent 31.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: AppAgentX: Evolving GUI Agents as Proficient Smartphone Users Summary 这些文字介绍了一款名为 AppAgentX 的新型 GUI 代理框架,旨在 提高 基于大型语言模型(LLM)的代理在 智能手机 上执行任务的 效率 和 准确性。该框架通过 记忆 代理的 操...

【第242期】MPO:Meta Plan Optimization 30.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: MPO: Boosting LLM Agents with Meta Plan Optimization Summary 本研究提出了 MPO(Meta Plan Optimization)框架,旨在提升大型语言模型(LLM)智能体的规划能力。 通过整合高级别的 元计划,MPO 提供了一种即插即用的方案,以有效改进智能体的表...

【第241期】LLaVE:一种新型视觉模型 29.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning Summary 研究论文介绍了 LLaVE,一种新型大型语言和视觉嵌入模型,它通过一种被称为难度加权对比学习的创新框架来提升性能。研究人员发现,现有模...

【第240期】Optimal Brain Apoptosis 28.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Optimal Brain Apoptosis Summary 这篇研究文章提出了名为Optimal Brain Apoptosis (OBA) 的神经网络剪枝新方法,旨在提高卷积神经网络和 Transformer 等大型模型的计算效率并降低资源需求。与之前依赖近似方法的工作不同,OBA 直接计算 Hessian-向...

【第239期】SoS1:O1和R1模型可以解决Hilbert第17问题难度相当大问题 27.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: SoS1: O1 and R1-Like Reasoning LLMs are Sum-of-Square Solvers Summary 文本讨论了大型语言模型(LLMs)在解决复杂的数学问题方面的能力,特别是一个称为非负多项式判定的问题,该问题与Hilbert第17问题密切相关且在计算上难以解决。研究人员创...

【第238期】xAR:Next-X Prediction 26.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation Summary 这项研究提出了 xAR,这是一种用于自回归视觉生成的新框架,旨在超越传统的基于 “下一词元” 预测的方法。通过将 “词元” 的概念扩展到更灵活的 “实体 X”,例如...

【第237期】PlanGEN:多智能体的计划生成框架 25.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solving Summary 文本讨论了一种名为 PlanGEN 的多智能体框架,旨在改进大型语言模型 (LLM) 解决复杂规划和推理任务的能力。该框架包含...

【第236期】NeoBERT:新一代BERT 24.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: NeoBERT: A Next-Generation BERT Summary 这项研究提出了 NeoBERT,这是一个新一代的 编码器模型,旨在弥合其 自回归 同类模型所取得的进展与 BERT 等现有 编码器 之间的差距。通过整合 最新的架构改进、更现代的数据集 和 优化的预训练方法,NeoB...

【第235期】AI co-scientist:AI协作科学家 23.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Towards an AI co-scientist Summary 这些资料介绍了一款名为“AI共同科学家”的系统,该系统旨在通过模拟科学方法来 协助和加速科学发现 。这款基于Gemini 2.0的多智能体系统能够根据自然语言指定的研究目标, 检索并分析现有文献,提出新颖的假设和...

【第234期】Transformers without Normalization 22.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Transformers without Normalization Summary 该来源介绍了一项研究,该研究挑战了神经网络中归一化层不可或缺的观点。研究人员提出了一种名为Dynamic Tanh (DyT) 的简单操作,作为 Transformer 架构中归一化层的替代。通过模仿归一化层 S 形的输入...

【第233期】A-MEM:LLM Agent的记忆系统 21.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: A-MEM: Agentic Memory for LLM Agents Summary 这项研究提出了 A-MEM,一种为大型语言模型(LLM)代理设计的创新记忆系统。A-MEM 解决了现有记忆系统因固定操作和结构而缺乏适应性的问题。受卡片盒笔记法的启发,该系统通过动态索引和链接创建相互...

【第232期】KV-Edit:精确保留背景信息的图像编辑方法 20.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: KV-Edit: Training-Free Image Editing for Precise Background Preservation Summary 这篇研究文章提出了名为KV-Edit的新方法,旨在通过精确保留背景信息来改进图像编辑。该方法利用Vision Transformer (DiT)架构中的键值(KV)缓存机制,在编辑过...

【第231期】DICEPTION:一种通用的视觉Diffusion模型 19.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks Summary 这份文档介绍了一款名为 DICEPTION 的通用扩散模型,旨在解决多种视觉感知任务。该模型通过 利用预训练的文本到图像扩散模型的先验知识,将不同的感知任务输出统一到...

【第230期】olmOCR:PDF文档高质量提取模型 18.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models Summary 这段文字介绍了一个名为 olmOCR 的开源工具,旨在处理 PDF 文档并提取高质量文本用于训练大型语言模型。该工具通过文档锚定技术结合一个经过微调的视觉语言模...

【第229期】Persona Hub:10亿个角色的数据合成方法 17.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Scaling Synthetic Data Creation with 1,000,000,000 Personas Summary 本技术报告提出了一种新颖的基于角色的数据合成方法,利用大型语言模型(LLM)的不同视角来创建多样的合成数据。为了大规模应用此方法,研究者推出了 Persona Hub,一个包含...

【第228期】从优化角度理解Duffusion模型 16.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: Interpreting and Improving Diffusion Models from an Optimization Perspective Summary 这些资料的核心内容是从优化角度理解和改进扩散模型。它们将扩散模型中的去噪过程解释为近似投影,并进一步将其视为对欧几里德距离函数应用近似梯度下降。...

【第227期】NullFace:免于训练的面部匿名化方法 15.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: NullFace: Training-Free Localized Face Anonymization Summary 来源文本介绍了NullFace,这是一种训练免费的面部匿名化方法,它能有效隐藏身份,同时保留凝视、表情和头部姿势等关键属性。与传统方法不同,NullFace 利用预训练的文本到图像扩散模...

【第226期】SegAgent:像素级理解能力探究 14.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories Summary 这项研究介绍了一种名为 HLMAT 的新分割范例,其中大型多模态模型(MLLMs)通过模仿人类标注员使用交互式分割工具来执行像素级...

【第225期】OmniMamba:基于 Mamba-2 的多模态模型 13.05.2025

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 进群添加小助手微信:seventy3_podcast 备注:小宇宙 今天的主题是: OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models Summary 这篇研究文章介绍了 OmniMamba,这是一个基于 Mamba-2 的新型 多模态模型,能够处理图像理解和生成任务。与依赖大量数据的现有模型不同...

Listen to the Seventy3 podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.