任雨山
Seventy3
73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
【第349期】(中文)强化预训练:下一词元推理 14.09.2025 8:03
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Reinforcement Pre-Training Summary 该论文介绍了一种名为强化预训练(RPT)的新范式,旨在通过强化学习(RL)改进大型语言模型(LLMs)的预训练。RPT将传统的下一个词元预测任务重新定义为推理任务,模型因正确预测下一个词元而获得可验证的奖励。这种方法允许LLMs利用海量的文本数据进行通用的强化...
【第348期】(中文)V-JEPA 2:视频基础模型新里程碑 13.09.2025 7:29
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning Summary 该来源介绍了V-JEPA 2,这是一种自监督学习方法,它结合了大规模网络视频数据和少量机器人交互数据,以构建能够理解、预测和规划物理世界的模型。通过预训练在超过一百万小时的视频上,V-JEPA 2在运动...
【第347期】(中文)OpenHands-Versa:通用问题解决编码代理 12.09.2025 8:41
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Coding Agents with Multimodal Browsing are Generalist Problem Solvers Summary 本研究介绍了一种名为 OpenHands-Versa 的通用智能体,旨在通过一套精简但全面的工具集解决各种任务,与专门智能体通常受限于特定领域的情况形成对比。该智能体结合了代码编辑与执行、多模态网络浏览和文件访问等核心...
【第346期】(中文)LLM推理:知识与推理的协同作用 11.09.2025 9:57
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains Summary 该研究深入探究了大型语言模型(LLMs)的内部推理过程,超越了仅仅评估最终答案准确性的传统方法。作者引入了一个精细的评估框架,将LLM的思维轨迹分解为知识正确性(通过知识指数KI衡量)和推理质量(通过信息增益Inf...
【第345期】(中文)ROBOT-R1: 强化具身推理的机器人控制 10.09.2025 11:42
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics Summary 该论文介绍了 ROBOT-R1 框架,这是一种利用 强化学习 来增强大型视觉语言模型 (LVLMs) 在机器人控制中 具身推理 能力的新方法。与传统的 监督微调 (SFT) 方法不同,ROBOT-R1 通过将机器人控制任务重新定义为 多...
【第344期】(中文)小型语言模型:智能体AI的未来 09.09.2025 9:05
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Small Language Models are the Future of Agentic AI Summary 该论文提出并论证了小型语言模型(SLM)是代理AI未来的核心。文章强调,尽管大型语言模型(LLM)因其通用能力而受到推崇,但在代理系统中,许多任务是重复、专业且非对话性的,这使得SLM成为更经济、更灵活且功能足够强大的选择。作者认为...
【第343期】(中文)作为程序的图像编辑 08.09.2025 6:33
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Image Editing As Programs with Diffusion Models Summary 这篇研究论文介绍了一种名为 图像编辑即程序(IEAP)的创新框架,旨在通过扩散模型实现更精确、更可控的图像编辑。IEAP通过将复杂的编辑指令分解为一系列原子操作 来克服现有扩散模型在处理结构不一致编辑方面的挑战。这些原子操作包括 感兴...
【第342期】(中文)金融量化策略的多智能体框架 07.09.2025 7:43
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: R&D-Agent-Quant: A Multi-Agent Framework for Data-Centric Factors and Model Joint Optimization Summary 这篇研究论文介绍了RD-Agent(Q),一个用于量化金融的多智能体框架,旨在自动化量化策略的整个研发过程。它通过协调因子-模型联合优化来解决金融市场固有的挑战,如高维度、非平稳性和波动性...
【第341期】(中文)R&D-Agent:自动化数据驱动AI解决方案构建 06.09.2025 8:37
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: R&D-Agent: Automating Data-Driven AI Solution Building Through LLM-Powered Automated Research, Development, and Evolution Summary 这篇技术报告介绍了 R&D-Agent,这是一个用于自动化数据驱动型人工智能解决方案构建的双代理框架。该系统旨在通过 研究员代理 生成创意并分析反馈,以及 开发人...
【第340期】(中文)ARPO:基于经验回放的GUI智能体策略优化 05.09.2025 10:13
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: ARPO: End-to-End Policy Optimization for GUI Agents with Experience Replay Summary 该研究介绍了一种端到端策略优化方法,名为Agentic Replay Policy Optimization (ARPO),用于训练基于视觉-语言模型 (VLM) 的图形用户界面 (GUI) 代理。ARPO 增强了 Group Relative Policy Optimization (GRPO),...
【第339期】(中文)达尔文哥德尔机器:自改进AI代理的演化 04.09.2025 8:57
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents Summary 这段资料主要介绍了达尔文-哥德尔机器 (DGM),这是一种自我改进的人工智能系统,它通过经验验证而非形式化证明来优化自身代码,模仿了生物进化的过程。DGM 旨在实现开放式创新,能够持续生成新颖且可学习的人工智能体,...
【第338期】(中文)用图像思考:GRIT实现MLLM具身推理 03.09.2025 8:08
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: GRIT: Teaching MLLMs to Think with Images Summary 这篇研究论文介绍了 GRIT(Grounded Reasoning with Images and Text),这是一种用于训练多模态大型语言模型(MLLMs)的新方法,使其能够通过图像进行思考。GRIT 引入了一种 基础推理范式,其中模型生成的推理链将自然语言与显式边界框坐标交织在...
【第337期】(中文)大语言模型推理的陷阱 02.09.2025 9:27
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: When Thinking Fails: The Pitfalls of Reasoning for Instruction-Following in LLMs Summary 这篇研究探讨了大型语言模型(LLMs)中一个令人惊讶的现象:显式推理,例如通过思维链(CoT)提示,反而会降低模型遵循指令的准确性。作者在两个不同的基准测试(IFEval和ComplexBench)上评估了15个模型,...
【第336期】(中文)视觉规划:只用图像思考 01.09.2025 9:13
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Visual Planning: Let’s Think Only with Images Summary 本研究引入了一种名为“视觉规划”的新范式,旨在通过纯粹的视觉表示来解决推理任务,而无需文本中介。它挑战了大型语言模型(LLMs)和多模态大型语言模型(MLLMs)中基于文本的传统推理方法,特别是在处理空间和几何信息时。作者提出了一种名为...
【第335期】(中文)AI Agents与Agentic AI:概念、应用与挑战 31.08.2025 8:47
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: AI Agents vs. Agentic AI: A Conceptual Taxonomy, Applications and Challenges Summary 该研究概述了人工智能代理(AI Agents)和智能代理系统(Agentic AI)的演变,从早期的特定任务系统发展到现代的复杂协作框架。文章首先定义了AI Agents的核心特性,例如其自主性、任务特异性和反应性,并解释...
【第334期】(中文)AlphaEvolve: 科学与算法发现编码智能体 30.08.2025 10:25
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: AlphaEvolve: A coding agent for scientific and algorithmic discovery Summary 本文档介绍了 AlphaEvolve,这是一种由 Google DeepMind 开发的进化式编码代理,旨在通过迭代修改和改进代码来解决复杂的科学和算法问题。AlphaEvolve 利用大型语言模型(LLMs)生成、批评和演化算法,并通过自动评估机...
【第333期】(中文)连续思想机器 29.08.2025 8:18
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Continuous Thought Machines Summary 该文本介绍了**“连续思想机器(CTM)”,这是一种新颖的神经网络架构,旨在通过明确整合神经时间作为其核心功能元素来弥补人工智能和生物智能之间的差距。与传统神经网络不同,CTM利用神经元级别模型(NLMs)和神经同步来生成复杂的神经活动动态**,这些动态独立于...
【第332期】(中文)OSUNIVERSE:多模态GUI导航AI基准 28.08.2025 20:35
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: OSUniverse: Benchmark for Multimodal GUI-navigation AI Agents Summary 这篇论文介绍了 OSUniverse,这是一个用于评估多模态GUI导航AI代理的新基准。作者指出,尽管现有基准**(如WebShop、Mind2Web和OSWorld)在评估网络或桌面任务方面存在局限性**,OSUniverse旨在通过提供更复杂、多应用程序的任...
【第331期】(中文)CoT:大模型中的程序变量 27.08.2025 15:23
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Chain-of-Thought Tokens are Computer Program Variables Summary 该研究探讨了思维链(CoT)在大型语言模型(LLMs)中解决复杂推理任务时的内部机制,特别关注其在多位乘法和动态规划等组合任务中的作用。研究人员提出,CoT令牌的功能类似于计算机程序中的变量,用于存储中间结果,这些结果对后续计...
【第330期】(中文)UniVLA: 通用机器人策略学习框架 26.08.2025 8:10
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Learning to Act Anywhere with Task-centric Latent Actions Summary 这篇研究介绍了 UniVLA,一个用于机器人学习的统一 视觉-语言-动作 (VLA) 框架。该框架的核心创新在于以无监督的方式从视频中学习以任务为中心的潜在动作,使其能够利用来自不同机器人和视角的大量数据,而无需动作标签。通过在大...
【第329期】(中文)WebThinker:深度研究大型推理模型 25.08.2025 7:31
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: WebThinker: Empowering Large Reasoning Models with Deep Research Capability Summary 该文档介绍了一种名为 WebThinker 的新型深度研究代理,旨在增强大型推理模型(LRMs)处理复杂、知识密集型任务的能力。WebThinker 通过 深度网络探索器 模块,使LRMs能够自主搜索网络、导航网页和提取信息,以...
【第328期】(中文)微调中的强化学习价值 24.08.2025 9:15
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: All Roads Lead to Likelihood: The Value of Reinforcement Learning in Fine-Tuning Summary 本研究探讨了基础模型微调中强化学习(RL)的两阶段训练流程,该流程通常优于直接的离线最大似然估计(MLE)方法,尽管从信息论角度看RL并不能创造新信息。作者通过理论和实证分析,驳斥了几种关于RL价值的...
【第327期】(中文)研讨式RAG:医学问答的新范式 23.08.2025 8:18
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Talk Before You Retrieve: Agent-Led Discussions for Better RAG in Medical QA Summary 这篇文章提出了一种名为 Discuss-RAG 的新型框架,旨在显著提高大型语言模型 (LLM) 在医学问答 (QA) 中的准确性。它通过模拟人类的推理过程来解决现有检索增强生成 (RAG) 系统中存在的局限性,这些局限性包括缺...
【第326期】(中文)动态RAG:大模型反馈驱动的动态重排序 22.08.2025 6:34
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: DynamicRAG: Leveraging Outputs of Large Language Model as Feedback for Dynamic Reranking in Retrieval-Augmented Generation Summary DynamicRAG 提出了一种新颖的检索增强生成(RAG)框架,旨在通过一个动态重排序器优化大型语言模型(LLM)的性能。这个重排序器被建模为一个强化学习智能体,它...
【第325期】(中文)UCGM:统一连续生成模型 21.08.2025 9:03
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Unified Continuous Generative Models Summary 该论文介绍了一个名为 UCGM 的统一框架,旨在整合并提升现有的连续生成模型,包括多步扩散模型、流匹配模型和少步一致性模型。UCGM 包含一个统一的训练器 UCGM-T 和一个统一的采样器 UCGM-S。UCGM-T 能够灵活地训练适用于不同推理场景的模型,而 UCGM-S...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.