duan

HuggingFace 每日AI论文速递

每天10分钟,带您快速了解当日HuggingFace热门AI论文内容。每个工作日更新,欢迎订阅。📢播客节目在小宇宙、Apple Podcast平台搜索【HuggingFace 每日AI论文速递】🖼另外还有图文版,可在小红书搜索并关注【AI速递】

Forfatter

duan

Kategori

Technology

Podkastens nettsted

www.xiaoyuzhoufm.com

Siste episode

10. jul 2026

Hvor kan du lytte?

Podkaster i appen Replaio Radio Kommer snart

Podkaster kommer snart til appen. Installer nå, og bli den første som ser en helt ny tilnærming til podkaster

Last ned på Google Play Installer gratis Android 5 mill.+ nedlastinger · 4,8 i vurdering iOS snart

Episoder

2026.06.10 | 快手可灵长视频理解新突破;ABot-Earth三维生成仅需十分钟 10.06.2026

【目录】 本期的 15 篇论文如下: [00:32] 🎥 Kwai Keye-VL-2.0 Technical Report(快手可灵-VL-2.0技术报告) [01:24] 🌍 ABot-Earth 0.5: Generative 3D Earth Model(ABot-Earth 0.5:生成式三维地球模型) [02:13] 🤖 Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution(角色代理:通过双角色进化引导LLM代理) [03:08] 🔧 Retrospective Harness Optimization: Improving LLM Agents via Self-Preference over T...

2026.06.09 | 代码探索短板凸显;策略内蒸馏几何特性揭示 09.06.2026

【目录】 本期的 15 篇论文如下: [00:32] 🔍 SWE-Explore: Benchmarking How Coding Agents Explore Repositories(SWE-Explore:基准测试编码代理如何探索代码仓库) [01:34] 🔍 On the Geometry of On-Policy Distillation(论策略内蒸馏的几何特性) [02:26] 🧠 Latent Spatial Memory for Video World Models(面向视频世界模型的潜在空间记忆) [03:20] 🎬 CoVEBench: Can Video Editing Models Handle Complex Instructions...

2026.06.08 | 解嵌入矩阵是隐式特征透镜;EmbedFilter线性过滤提升文本嵌入效果。 08.06.2026

【目录】 本期的 15 篇论文如下: [00:33] 🔍 Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings(你的解嵌入矩阵实际上是文本嵌入的隐式特征透镜) [01:25] 🤝 SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations(SoCRATES:面向跨领域和社会认知变化的主动式大语言模型调解的可靠自动评估) [02:15] 🎧 MMAE: A Massive Multi...

【周末特辑】6月第2周最火AI论文 | 多智能体协同生成可编辑科学图形;PEFT实现万亿参数模型百万个性化 06.06.2026

【目录】 本期的 5 篇论文如下: [00:50] TOP1(🔥190) | 🎨 Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs(Crafter:一种用于从多样化输入生成可编辑科学图形的多智能体框架) [03:13] TOP2(🔥175) | 🧩 On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters(关于参数高效微调的规模化:迈向万亿参数级别的百万个性化模型) [06:08] TOP3(🔥140)...

2026.06.05 | ArcANE框架量化角色弧线;TIDE模型实现主动洞察 05.06.2026

【目录】 本期的 15 篇论文如下: [00:31] 🎭 ArcANE: Do Role-Playing Language Agents Stay in Character at the Right Time?(ArcANE:角色扮演语言代理在正确时刻保持角色一致性吗?) [01:26] 🔍 TIDE: Proactive Multi-Problem Discovery via Template-Guided Iteration(TIDE:通过模板引导的迭代实现主动多问题发现) [02:27] 🤖 AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World...

2026.06.04 | 全模态统一框架;音频实时主动交互 04.06.2026

【目录】 本期的 15 篇论文如下: [00:31] 🌌 Cosmos 3: Omnimodal World Models for Physical AI(宇宙3:面向物理AI的全模态世界模型) [01:36] 🎧 Audio Interaction Model(音频交互模型) [02:31] 🔍 Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories(深度研究型智能体错在哪里?智能体轨迹中的跨度级错误定位) [03:30] 🔍 Reproducing, Analyzing, and Detecting Reward Hac...

2026.06.03 | 信任区域教小模型;人形GPT追踪动作 03.06.2026

【目录】 本期的 15 篇论文如下: [00:31] 🎯 Trust Region On-Policy Distillation(信任区域同策略蒸馏) [01:17] 🤖 Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking(人形GPT:扩展数据与结构实现零样本运动追踪) [02:07] 🧠 A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL(多领域强化学习中跨域干扰与恢复的局部微扰理论) [03:06] 🧠 World Models...

2026.06.02 | 多智能体框架生成可编辑图表;参数高效微调支撑百万个性化模型 02.06.2026

【目录】 本期的 15 篇论文如下: [00:33] 🎨 Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs(Crafter:一种用于从多样化输入生成可编辑科学图形的多智能体框架) [01:39] 🧩 On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters(关于参数高效微调的规模化:迈向万亿参数级别的百万个性化模型) [02:35] 🧪 A Matter of TASTE: Improving Coverag...

2026.06.01 | 知识蒸馏炼技能;表示强制破瓶颈 01.06.2026

【目录】 本期的 15 篇论文如下: [00:30] 🧠 COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation(COLLEAGUE.SKILL:通过专家知识蒸馏实现自动化AI技能生成) [01:17] 🧠 Representation Forcing for Bottleneck-Free Unified Multimodal Models(表示强制:无瓶颈统一多模态模型) [02:07] 🎙 SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue(Swa...

【月末特辑】5月最火AI论文 | 多智能体世界建模;开源机器人VLA模型 01.06.2026

【目录】 本期的 10 篇论文如下: [00:45] TOP1(🔥407) | 🌍 Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players(Gamma-World:超越双玩家的生成式多智能体世界建模) [03:09] TOP2(🔥347) | 🤖 MolmoAct2: Action Reasoning Models for Real-world Deployment(MolmoAct2:面向实际部署的動作推理模型) [05:30] TOP3(🔥269) | 🔍 CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document In...

【周末特辑】5月第5周最火AI论文 | γ-World:多智能体世界建模新框架;SkillOpt:智能体技能优化新策略 31.05.2026

【目录】 本期的 5 篇论文如下: [00:41] TOP1(🔥357) | 🌍 Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players(Gamma-World:超越双玩家的生成式多智能体世界建模) [02:49] TOP2(🔥204) | 🧠 SkillOpt: Executive Strategy for Self-Evolving Agent Skills(SkillOpt:面向自进化智能体技能的执行策略) [04:37] TOP3(🔥131) | 🎯 DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-rewa...

2026.05.29 | AgentDoG 1.5实现毫秒级安全防护;Qwen-VLA统一跨任务动作建模。 29.05.2026

【目录】 本期的 14 篇论文如下: [00:25] 🛡 AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security(AgentDoG 1.5:一种轻量级且可扩展的AI代理安全与安保对齐框架) [01:06] 🤖 Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments(Qwen-VLA:统一跨任务、环境和机器人本体的视觉-语言-动作建模) [02:02] 🌐 OmniRetrieval: Un...

2026.05.28 | ProRL主动引导推荐;γ-World实现多智能体零样本泛化 28.05.2026

【目录】 本期的 15 篇论文如下: [00:24] 🎯 ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation(ProRL:通过修正策略梯度估计实现主动推荐的有效强化学习) [01:27] 🌍 Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players(Gamma-World:超越双玩家的生成式多智能体世界建模) [02:28] 🤖 Agent Explorative Policy Optimization for Multi...

2026.05.27 | 并行框解码提速十倍;空间评测揭示模型短板 27.05.2026

【目录】 本期的 15 篇论文如下: [00:24] 🎯 LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding(LocateAnything:基于并行框解码的快速高质量视觉-语言定位) [01:13] 🧩 SpatialBench: Is Your Spatial Foundation Model an All-Round Player?(SpatialBench:你的空间基础模型是全能选手吗?) [02:07] 🎬 EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Prof...

2026.05.26 | DVAO动态平衡多目标;WBench填补交互评估空白 26.05.2026

【目录】 本期的 15 篇论文如下: [00:25] 🎯 DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning(DVAO:面向多奖励强化学习的动态方差自适应优势优化) [01:15] 🎬 WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation(WBench:用于交互式视频世界模型评估的全面多轮基准) [02:13] 🖥 Macaron-A2UI: A Model for Generative UI in Pers...

2026.05.25 | SkillOpt实现技能自进化;Lens提升文生图训练效率 26.05.2026

【目录】 本期的 15 篇论文如下: [00:25] 🧠 SkillOpt: Executive Strategy for Self-Evolving Agent Skills(SkillOpt:面向自进化智能体技能的执行策略) [01:16] 🔍 Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models(Lens:重新思考基础文本到图像模型的训练效率) [02:20] 🔀 Rethinking Cross-Layer Information Routing in Diffusion Transformers(重新思考扩散变换器中的跨层信息路由) [03...

【周末特辑】5月第4周最火AI论文 | CiteVQA揭示归因幻觉;代码成为智能体框架 24.05.2026

【目录】 本期的 5 篇论文如下: [00:40] TOP1(🔥263) | 🔍 CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence(CiteVQA:为可信文档智能建立证据归因基准) [03:21] TOP2(🔥199) | 🤖 Code as Agent Harness(代码作为智能体框架) [05:25] TOP3(🔥191) | 🎯 DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards(DelTA:面向可验证奖励强化学...

2026.05.22 | 大模型内化地理空间;判别性令牌优化推理 22.05.2026

【目录】 本期的 15 篇论文如下: [00:25] 🚌 TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation(TransitLM: 面向无地图公交路线生成的大规模数据集与基准) [01:21] 🎯 DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards(DelTA:面向可验证奖励强化学习的判别性令牌信用分配) [02:15] 🤖 $π$-Bench: Evaluating Proactive Personal As...

2026.05.21 | Mega-ASR降噪减幻觉;Video2GUI数据预训练提效 21.05.2026

【目录】 本期的 15 篇论文如下: [00:23] 🎤 Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation(Mega-ASR:通过扩展真实世界声学模拟实现野外环境语音识别) [01:22] 🎬 Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining(Video2GUI:合成大规模交互轨迹以实现通用型GUI代理预训练) [02:11] 🎬 Enhancing Train-Free In...

2026.05.20 | 反自蒸馏优化推理;可验证环境测评智能体 20.05.2026

【目录】 本期的 15 篇论文如下: [00:24] 🧠 Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information(基于点互信息的反自蒸馏用于推理强化学习) [01:08] 🖥 OpenComputer: Verifiable Software Worlds for Computer-Use Agents(OpenComputer:为计算机使用智能体构建可验证的软件世界) [01:53] 🧠 GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment(GoLongRL...

2026.05.19 | 长视频生成提速降显存;轻量多模态模型超越大参数模型 19.05.2026

【目录】 本期的 15 篇论文如下: [00:23] 🎬 LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation(LongLive-2.0:用于长视频生成的NVFP4并行基础设施) [01:17] 🎨 Lance: Unified Multimodal Modeling by Multi-Task Synergy(Lance:通过多任务协同实现统一多模态建模) [02:24] 🤖 AI for Auto-Research: Roadmap & User Guide(人工智能自动研究:路线图与用户指南) [03:26] 🛠 SkillsVote: Lifecycl...

2026.05.18 | 人类视频炼物理常识;文档问答要查原文 18.05.2026

【目录】 本期的 15 篇论文如下: [00:23] 🧠 PhysBrain 1.0 Technical Report(PhysBrain 1.0 技术报告) [00:56] 🔍 CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence(CiteVQA:为可信文档智能建立证据归因基准) [01:45] 🤖 MMSkills: Towards Multimodal Skills for General Visual Agents(MMSkills:面向通用视觉智能体的多模态技能) [02:35] 👗 FashionChameleon: Towards Real-Time a...

【周末特辑】5月第3周最火AI论文 | MinT让百万LoRA秒挂基础模型;千层DiT均值尖叫MV-Split破局 18.05.2026

【目录】 本期的 5 篇论文如下: [00:44] TOP1(🔥211) | 🏗 MinT: Managed Infrastructure for Training and Serving Millions of LLMs(MinT:用于训练和服务数百万大语言模型的托管基础设施) [02:56] TOP2(🔥183) | 🧠 Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers(均值模式尖叫:面向千层扩散Transformer的均值-方差分裂残差) [04:44] TOP3(🔥171) | 🧠 SenseNova-U1: Unifyi...

2026.05.15 | 30B模型刷奥赛金牌;自蒸馏让3B小模型零外挂超能 17.05.2026

【目录】 本期的 15 篇论文如下: [00:23] 🥇 Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling(通过简单且统一的缩放实现金牌级别的奥赛推理) [01:00] 🤖 Self-Distilled Agentic Reinforcement Learning(自蒸馏智能体强化学习) [01:46] 🧠 MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models(MemLens:大型视觉语言模型中多模态长期记忆的基准测试) [02:5...

2026.05.14 | MinT用LoRA补丁解决大模型规模难题;MulTaBench对齐图文任务小模型胜大模型 14.05.2026

【目录】 本期的 15 篇论文如下: [00:25] 🏗 MinT: Managed Infrastructure for Training and Serving Millions of LLMs(MinT:用于训练和服务数百万大语言模型的托管基础设施) [01:08] 📊 MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image(MulTaBench:融合文本与图像的多模态表格学习基准测试) [02:14] 🎬 AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation(AnyFlo...

Hør på podkasten HuggingFace 每日AI论文速递 i Replaio

Radio og podkaster i én app - gratis og uten registrering. Installer i dag, og ikke gå glipp av lanseringen

Last ned på Google Play

Replaio er ikke podkastutgiver; programnavn, omslag og lyd tilhører opphavspersonene og distribueres via offentlige RSS-feeder.