任雨山
Seventy3
73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
【第299期】(中文)SWE-PolyBench:多语言代码智能体基准测试 26.07.2025 9:08
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents Summary 该论文介绍了 SWE-PolyBench,这是一个针对 代码代理 的 多语言基准测试,旨在弥补现有评估工具的局限性。它包含了 Java、JavaScript、TypeScript 和 Python 等多种语言的 2110 个实例,涵盖了...
【第298期】(中文)DocAgent:自动化代码文档生成的多智能体系统 25.07.2025 9:41
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: DocAgent: A Multi-Agent System for Automated Code Documentation Generation Summary DocAgent是一种新颖的多智能体系统,旨在通过模拟人类工作流程来自动化高质量代码文档的生成。该系统首先使用“导航器”模块对代码库进行依赖感知拓扑排序,确保在处理组件之前先处理其依赖项,从而实现增量上下文...
【第297期】(中文)AgentA/B:基于LLM的自动化可扩展网页A/B测试 24.07.2025 11:03
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: AgentA/B: Automated and Scalable Web A/BTesting with Interactive LLM Agents Summary 该论文介绍了 AgentA/B,这是一个利用 大型语言模型(LLM)驱动的自主代理 的新颖系统,旨在革新网络 A/B 测试。传统 A/B 测试依赖大量人工流量且耗时,而 AgentA/B 通过 模拟用户行为 克服了这些限制。该系统能...
【第296期】(中文)d1: 扩散LLM的强化学习推理 23.07.2025 9:45
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning Summary 这篇研究论文探讨了如何提升扩散大语言模型(dLLMs)的推理能力,此类模型与传统的自回归(AR)LLMs不同,采用非自回归的粗到细文本生成方式。作者提出了 d1 框架,通过结合监督微调(SFT)和一种名为 d...
【第295期】(中文)GUI-R1: GUI智能体的强化微调 22.07.2025 8:31
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: GUI-R1: A Generalist R1-Style Vision-Language Action Model For GUI Agents Summary 该来源介绍了一个名为 GUI-R1 的新型强化学习框架,旨在增强大型视觉语言模型 (LVLM) 在处理图形用户界面 (GUI) 代理任务方面的能力。与现有主要依赖监督微调 (SFT) 的方法不同,GUI-R1 采用规则驱动的强化微调 (R...
【第294期】(中文)NoProp:无需反向传播或前向传播的神经网络训练方法 21.07.2025 9:34
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: NoProp: Training Neural Networks without Back-propagation or Forward-propagation Summary 这篇研究论文介绍了一种名为 NoProp 的新型神经网络训练方法,该方法不依赖传统的反向传播或正向传播机制。与通过层级抽象学习的典型深度学习模型不同,NoProp 借鉴了扩散模型和流匹配方法,使每个层独立学...
【第293期】(中文)LightPROF:知识图谱上大型语言模型的轻量推理框架 20.07.2025 9:56
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: LightPROF: A Lightweight Reasoning Framework for Large Language Model on Knowledge Graph Summary 这篇研究论文介绍了 LightPROF,一个为知识图谱问答(KGQA)设计的轻量级、高效提示学习推理框架。该框架旨在解决大型语言模型(LLMs)在处理复杂知识图谱信息时面临的知识更新延迟和资源消耗高等...
【第292期】(中文)AI Scientist-v2:代理树搜索自动化科学发现 19.07.2025 6:56
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search Summary 本报告介绍了The AI Scientist-v2,这是一个显著改进的自动化科学发现框架,旨在克服其前身The AI Scientist-v1的局限性。v2版本通过引入代理树搜索、视觉语言模型(VLM)反馈和并行实验执行,增...
【第291期】(中文)attention sinks:LLMs倾向于将大部分注意力集中在第一个token 18.07.2025 7:34
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Why do LLMs attend to the first token? Summary 本研究探讨大型语言模型 (LLMs) 中“注意力槽”(attention sinks)现象的潜在原因和效用。注意力槽是指LLMs倾向于将大部分注意力集中在序列的第一个标记上,即使该标记语义不重要。作者认为,这种机制是LLMs为了避免“过度混合”信息而采取的一种策略,过...
【第290期】(中文)PLAY2PROMPT:LLM零样本优化 17.07.2025 8:14
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: PLAY2PROMPT: Zero-shot Tool Instruction Optimization for LLM Agents via Tool Play Summary 此文档介绍了 PLAY2PROMPT,这是一个旨在优化大型语言模型(LLMs)工具使用能力的新型自动化框架。该框架通过模拟工具交互的试错过程来学习,从而在没有预先标记数据的情况下,自动生成高质量的工具文档和...
【第289期】(中文)Chain-of-Tools:利用海量工具增强推理 16.07.2025 9:53
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Chain-of-Tools: Utilizing Massive Unseen Tools in the CoT Reasoning of Frozen Language Models Summary 本论文介绍了一种名为 Chain-of-Tools (CoTools) 的新型工具学习方法,旨在提升大型语言模型 (LLMs) 在 链式思维 (CoT) 推理过程中使用工具的能力。CoTools 克服了现有方法在处理 大量未见工...
【第288期】(中文)统一嵌入空间:捕捉大脑语言处理 15.07.2025 9:44
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: A unified acoustic-to-speech-to-language embedding space captures the neural basis of natural language processing in everyday conversations Summary 这份研究介绍了一个统一的计算框架,该框架将声学、语音和词级语言结构连接起来,以探索人类大脑在日常对话中自然语言处理的神经基础。通过使...
【第287期】(中文)AgentRxiv:迈向协作式自主研究 14.07.2025 11:05
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: AgentRxiv: Towards Collaborative Autonomous Research Summary 本研究介绍了AgentRxiv,这是一个创新框架,旨在促进大型语言模型(LLM)代理之间在科研方面的协作与共享。作者们通过让代理访问共享预印本服务器上的先前研究,证明了AgentRxiv能够显著提高性能,例如在MATH-500基准测试中取得了11.4%...
【第286期】(中文)扩散采样最佳步长 13.07.2025 9:01
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Optimal Stepsize for Diffusion Sampling Summary 这份文件介绍了一种用于 扩散模型 的 动态规划框架 ,旨在优化采样过程中的 步长调度 。作者通过将步长优化重新表述为递归误差最小化问题,从参考轨迹中提取了 理论上最优的步长序列 。该方法能够显著 加速文本到图像生成 ,同时保持高水平的性能,并...
【第285期】(中文)UI-R1: 强化学习提升GUI智能体动作预测 13.07.2025 10:32
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: UI-R1: Enhancing Action Prediction of GUI Agents by Reinforcement Learning Summary 文本介绍了 UI-R1 框架,这是一种通过 基于规则的强化学习 (RL) 提升多模态大型语言模型 (MLLM) 图形用户界面 (GUI) 动作预测能力的新方法。与传统的 监督微调 (SFT) 不同,UI-R1 仅使用少量高质量数据进行训练,...
【第284期】(中文)UniDisc :Unified Multimodal Discrete Diffusion 11.07.2025 8:07
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Unified Multimodal Discrete Diffusion Summary 这些来源介绍了一种名为 UniDisc 的新型多模态离散扩散模型,该模型能够统一地理解和生成图像和文本。与主流的自回归模型不同,UniDisc 利用 离散扩散 的优势,例如更好的生成样本质量与多样性控制、跨文本和图像领域的联合 inpainting 能力以及更高的...
【第283期】(中文)A-MEM:基于Agent的内存系统 10.07.2025 10:46
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: A-MEM: Agentic Memory for LLM Agents Summary 此文档介绍了一种名为 A-MEM 的新型代理式记忆系统,旨在提升大型语言模型(LLM)代理处理复杂现实任务的能力。该系统通过借鉴 Zettelkasten 方法,能够动态组织和演化记忆,从而克服了现有记忆系统固定操作和结构所带来的局限性。A-MEM 能够自主生成上...
【第282期】(中文)DeepSeek 模型的关键创新技术回顾 09.07.2025 9:43
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: A Review of DeepSeek Models’ Key Innovative Techniques Summary 本评论文章概述了 DeepSeek 模型的关键创新技术,其中包括 DeepSeek-V3 和 DeepSeek-R1。文章详细阐述了 transformer 架构的改进,如多头潜在注意力 (Multi-Head Latent Attention) 和 专家混合 (Mixture of Experts),这些都旨在提升...
【第281期】(中文)Cosmos-Reason1 08.07.2025 8:44
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning Summary Cosmos-Reason1 介绍了一个多模态大型语言模型系列,专注于物理世界理解和推理。该模型通过四个训练阶段进行开发:视觉预训练、通用监督微调(SFT)、物理AI SFT和物理AI强化学习(RL)。为了评估模型,研究人员定义了物理...
【第280期】(中文)RQI:超分辨率图像评估新视角 07.07.2025 10:14
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Rethinking Image Evaluation in Super-Resolution Summary 该论文探讨了图像超分辨率(SR)领域中人类感知评估与现有量化评估之间日益增长的不一致性。作者们认为,现有SR数据集中“地面实况(GT)”图像的质量不佳是导致这种评估偏差的一个关键因素。文章通过系统性分析,揭示了GT质量如何影响SR模型的...
【第279期】(中文)无反向传播的高效量化扩散模型个性化 06.07.2025 8:51
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Efficient Personalization of Quantized Diffusion Model without Backpropagation Summary 此篇研究论文介绍了一种名为 ZOODiP 的新型框架,旨在在内存受限的环境中高效地个性化扩散模型。该方法通过量化扩散模型并利用零阶优化,在无需反向传播的情况下实现微调,从而显著减少了内存消耗。为了克服...
【第278期】(中文)CLS-RL:一种基于规则的强化学习方法 05.07.2025 6:46
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning Summary 这篇研究论文探讨了多模态大型语言模型(MLLMs)在图像分类中的少样本微调问题。研究指出,传统的监督微调(SFT)可能导致灾难性遗忘,甚至降低性能。为解决此问题,研究团队提出了CLS-RL,...
【第277期】(中文)Fin-R1:金融推理大型语言模型 04.07.2025 8:40
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning Summary 文本介绍了 Fin-R1,一个专门为金融领域推理任务设计的大型语言模型。该模型旨在解决金融数据碎片化、推理逻辑不可控以及业务泛化能力弱等核心问题。通过构建一个包含**高质量思维链(CoT)的金融数据...
【第276期】(中文)Scale-wise Distillation 04.07.2025 11:00
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 本期开启中文播客 今天的主题是: Scale-wise Distillation of Diffusion Models Summary 这篇研究介绍了 SWD(Scale-wise Distillation),一个用于扩散模型的逐尺度蒸馏框架,它利用下一尺度预测的思想来加速图像生成。传统扩散模型在高分辨率下计算成本高昂,而 SWD 允许模型在较低分辨率下启动生成,然后逐步提高...
【第275期】InfiniteYou:身份保留图像生成 02.07.2025 11:48
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法方向,让大家跟着AI一起进步。 今天的主题是: InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity Summary 这项研究介绍了InfiniteYou (InfU),一个用于身份保留图像生成的新颖框架,它利用先进的扩散Transformer (DiT)技术来解决现有方法的不足。InfU的核心是InfuseNet,它通过残差连接将身份特征注入DiT基模型,从而提高身...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.