duan

HuggingFace 每日AI论文速递

每天10分钟,带您快速了解当日HuggingFace热门AI论文内容。每个工作日更新,欢迎订阅。📢播客节目在小宇宙、Apple Podcast平台搜索【HuggingFace 每日AI论文速递】🖼另外还有图文版,可在小红书搜索并关注【AI速递】

Author

duan

Category

Technology

Podcast website

www.xiaoyuzhoufm.com

Latest episode

Jul 10, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

2025.06.09 | 常青问题分类提升问答系统;多模态融合优化音频描述。 10.06.2025

本期的 15 篇论文如下: [00:24] 🕰 Will It Still Be True Tomorrow? Multilingual Evergreen Question Classification to Improve Trustworthy QA(明日依旧为真吗?多语种常青问题分类以提升可信赖的问答系统) [01:04] 🎧 FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion(FusionAudio-1.2M:通过多模态上下文融合实现细粒度音频描述) [01:46] 🤔 Is Extending Modality The Righ...

【周末特辑】6月第2周最火AI论文 | LLM自我反思提升性能;高熵Token优化推理。 08.06.2025

本期的 5 篇论文如下: [00:47] TOP1(🔥169) | 💡 Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning(反思、重试、奖励:通过强化学习实现LLM的自我提升) [02:55] TOP2(🔥130) | 🧠 Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning(超越80/20法则:高熵少数Token驱动LLM推理的有效强化学习) [05:06] TOP3(🔥115) | 🧠 ProRL: Prolonge...

2025.06.06 | 智能助手加速ComfyUI开发;单步视频修复提升效率。 07.06.2025

本期的 15 篇论文如下: [00:24] 🤖 ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development(ComfyUI-Copilot:用于自动化工作流开发的智能助手) [00:59] 🎬 SeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Training(SeedVR2:基于扩散对抗后训练的单步视频修复) [01:39] 🤖 RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics(Rob...

2025.06.05 | 紧凑强大视觉模型;多阶段训练提升推理能力 06.06.2025

本期的 15 篇论文如下: [00:21] 🤖 MiMo-VL Technical Report(MiMo-VL 技术报告) [01:14] 💡 Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning(多模态推理进阶:从优化冷启动到分阶段强化学习) [01:57] 🤖 AmbiK: Dataset of Ambiguous Tasks in Kitchen Environment(AmbiK:厨房环境中歧义性任务数据集) [02:42] 🔄 CASS: Nvidia to AMD Transpilation with Data, Models, an...

2025.06.04 | 强化学习提升LLM性能;UniWorld统一视觉理解与生成。 05.06.2025

本期的 15 篇论文如下: [00:23] 💡 Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning(反思、重试、奖励:通过强化学习实现LLM的自我提升) [01:09] 🖼 UniWorld: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation(UniWorld:用于统一视觉理解与生成的高分辨率语义编码器) [01:53] 🧪 CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabil...

2025.06.03 | 高熵Token提升LLM推理;推理健身房优化强化学习环境。 03.06.2025

本期的 15 篇论文如下: [00:22] 🧠 Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning(超越80/20法则:高熵少数Token驱动LLM推理的有效强化学习) [01:05] 🧠 REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards(推理健身房:基于可验证奖励的强化学习推理环境) [01:46] 🤖 SmolVLA: A Vision-Language-Action Model f...

【月末特辑】5月最火AI论文 | 小型语言模型在翻译中表现优异;多模态推理模型发展历程综述。 03.06.2025

本期的 10 篇论文如下: [00:40] TOP1(🔥209) | 🌐 Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model(Mutarjim:利用小型语言模型推进阿拉伯语-英语双向翻译) [03:07] TOP2(🔥172) | 🧠 Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models(感知、推理、思考与规划:大型多模态推理模型综述) [05:19] TOP3(🔥171) | 🤖 Qwen3 Technical Report(Q...

2025.06.02 | 延长RL提升推理;快慢思考优化推理。 02.06.2025

本期的 15 篇论文如下: [00:23] 🧠 ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models(ProRL:延长的强化学习拓展大型语言模型的推理边界) [01:01] 🧠 AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time(AlphaOne:测试时驱动大模型进行快慢思考的推理框架) [01:42] 🤔 Time Blindness: Why Video-Language Models Can't See What Humans Can?(时间盲区:为何...

【周末特辑】6月第1周最火AI论文 | 小型模型在翻译中表现优异;数据中心压缩提升AI效率。 01.06.2025

本期的 5 篇论文如下: [00:43] TOP1(🔥205) | 🌐 Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model(Mutarjim:利用小型语言模型推进阿拉伯语-英语双向翻译) [03:10] TOP2(🔥139) | 🗜 Shifting AI Efficiency From Model-Centric to Data-Centric Compression(AI效率转移:从以模型为中心到以数据为中心的压缩) [04:55] TOP3(🔥106) | 📊 TabSTAR: A Foundation Tabular Model With...

2025.05.30 | 推理扩展提升表格推理;多模态模型视频反馈有待优化。 30.05.2025

本期的 15 篇论文如下: [00:22] 📊 Table-R1: Inference-Time Scaling for Table Reasoning(Table-R1:表格推理的推理时扩展) [01:02] 🤖 VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos(VF-Eval:评估多模态大语言模型生成AIGC视频反馈的能力) [01:45] 🧠 Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence(Spatial-MLLM:提升多模态大语言模型在基于视觉的空...

2025.05.29 | 熵机制提升模型性能;令牌路由优化推理效率。 29.05.2025

本期的 15 篇论文如下: [00:22] 🤖 The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models(用于推理语言模型的强化学习的熵机制) [00:56] 🛣 R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing(R2R:通过大小模型令牌路由高效导航不同的推理路径) [01:40] 🧠 Skywork Open Reasoner 1 Technical Report(Skywork开放推理器1技术报告) [02:20] 🔍 Sherl...

2025.05.28 | 多模态Agent科研任务成功率低;逻辑推理模型存在显著局限。 28.05.2025

本期的 15 篇论文如下: [00:23] 🧪 ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows(ScienceBoard:评估现实科学工作流程中的多模态自主Agent) [01:09] 🤔 MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs(MME-推理:多模态大型语言模型中逻辑推理的综合基准) [01:51] 🖼 Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers(P...

2025.05.27 | AI效率提升需数据压缩;小型模型翻译更高效。 27.05.2025

本期的 15 篇论文如下: [00:24] 🗜 Shifting AI Efficiency From Model-Centric to Data-Centric Compression(AI效率转移:从以模型为中心到以数据为中心的压缩) [01:05] 🌐 Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model(Mutarjim:利用小型语言模型推进阿拉伯语-英语双向翻译) [02:00] 📊 BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs...

2025.05.26 | TabSTAR提升表格数据分类性能;QwenLong-L1优化长文本推理 26.05.2025

本期的 15 篇论文如下: [00:23] 📊 TabSTAR: A Foundation Tabular Model With Semantically Target-Aware Representations(TabSTAR:具有语义目标感知表征的表格基础模型) [00:59] 🧠 QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning(QwenLong-L1:基于强化学习的长文本大型推理模型) [01:43] 🤔 Reasoning Model is Stubborn: Diagnosing Instruction Overriding in Reasoning Mode...

【周末特辑】5月第4周最火AI论文 | Qwen3提升LLMs性能;BAGEL增强多模态推理。 24.05.2025

本期的 5 篇论文如下: [00:42] TOP1(🔥146) | 🤖 Qwen3 Technical Report(Qwen3技术报告) [03:08] TOP2(🔥114) | 💡 Emerging Properties in Unified Multimodal Pretraining(统一多模态预训练中的涌现属性) [05:22] TOP3(🔥105) | 🔗 Chain-of-Model Learning for Language Model(模型链学习:一种用于语言模型的新型学习范式) [07:34] TOP4(🔥93) | 🧪 NovelSeek: When Agent Becomes the Scientist -- Building Closed-L...

2025.05.23 | 智能体加速科研;推理模型指令遵循不佳。 23.05.2025

本期的 15 篇论文如下: [00:22] 🧪 NovelSeek: When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification(NovelSeek:当智能体成为科学家——构建从假设到验证的闭环系统) [01:05] 🤔 Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models(规模化推理,失控的指令:评估大型推理模型中的指令遵循) [01:50] 🤖 Tool-Star: Empowering LLM-...

2025.05.22 | Web导航效率提升;量化误差优化。 22.05.2025

本期的 15 篇论文如下: [00:25] 🤖 Web-Shepherd: Advancing PRMs for Reinforcing Web Agents(Web-Shepherd:用于增强Web代理的PRM的进步) [01:13] 🧮 Scaling Law for Quantization-Aware Training(量化感知训练的缩放法则) [01:53] 🤖 UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning(基于强化学习和推理引导的通用视觉定位) [02:28] 🎨 MMaDA: Multimodal Large Diffusion Languag...

2025.05.21 | 多模态预训练提升复杂任务能力;注意力机制优化推理与训练效率。 21.05.2025

本期的 15 篇论文如下: [00:22] 💡 Emerging Properties in Unified Multimodal Pretraining(统一多模态预训练中的涌现属性) [01:03] 🚀 SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training(SageAttention3:用于推理的微缩FP4注意力机制与8位训练的探索) [01:42] 🖼 VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank(Visual...

2025.05.20 | 模型链学习提升效率;AdaptThink优化推理速度。 20.05.2025

本期的 15 篇论文如下: [00:23] 🔗 Chain-of-Model Learning for Language Model(模型链学习:一种用于语言模型的新型学习范式) [00:58] 🤔 AdaptThink: Reasoning Models Can Learn When to Think(AdaptThink:推理模型何时思考的学习) [01:45] 🧠 AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning(AdaCoT: 通过强化学习实现帕累托最优的自适应思维链触发) [02:21] 🚀 Delta Atte...

2025.05.19 | Qwen3提升LLMs性能;GuardReasoner-VL强化VLM安全。 19.05.2025

本期的 15 篇论文如下: [00:24] 🤖 Qwen3 Technical Report(Qwen3技术报告) [01:14] 🛡 GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning(GuardReasoner-VL:通过强化推理保护视觉语言模型) [02:01] 🖼 MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly(MMLongBench:有效且全面地评测长文本视觉语言模型) [02:40] 🖼 Visual Planning: Let's Think Only with Images...

【周末特辑】5月第3周最火AI论文 | Seed1.5-VL多模态推理领先;MiniMax-Speech零样本语音克隆 17.05.2025

本期的 5 篇论文如下: [00:38] TOP1(🔥126) | 💡 Seed1.5-VL Technical Report(Seed1.5-VL 技术报告) [03:11] TOP2(🔥109) | 🗣 MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder(MiniMax-Speech:具有可学习说话人编码器的内在零样本语音合成) [05:23] TOP3(🔥86) | 💡 Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models(超越“Aha!”时刻:迈向大...

2025.05.16 | 推理模型元能力提升;系统提示优化与鲁棒性增强 16.05.2025

本期的 15 篇论文如下: [00:24] 💡 Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models(超越“Aha!”时刻:迈向大型推理模型中系统性元能力对齐) [01:02] 🤖 System Prompt Optimization with Meta-Learning(基于元学习的系统提示优化) [01:47] 🤖 EnerVerse-AC: Envisioning Embodied Environments with Action Condition(EnerVerse-AC:通过动作条件设想具身环境) [02:29] 🧠 The CoT E...

2025.05.15 | 解耦学习提升感知性能;多模态模型优化图像生成。 15.05.2025

本期的 11 篇论文如下: [00:23] 🖼 DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception(DeCLIP:用于开放词汇密集感知的解耦学习) [01:02] 🖼 BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset(BLIP3-o:一族完全开放的统一多模态模型——架构、训练和数据集) [01:41] 💡 Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Archi...

2025.05.14 | 零样本语音合成新模型;多维度评估LLM指令能力 14.05.2025

本期的 8 篇论文如下: [00:25] 🗣 MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder(MiniMax-Speech:具有可学习说话人编码器的内在零样本语音合成) [01:00] 🤖 A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models(用于评估和改进大型语言模型指令遵循能力的多维度约束框架) [01:47] 🎮 Measuring General Intelli...

2025.05.13 | 视觉-语言模型提升多模态能力;优化训练策略增强推理潜力。 13.05.2025

本期的 15 篇论文如下: [00:24] 💡 Seed1.5-VL Technical Report(Seed1.5-VL 技术报告) [01:04] 🧠 MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining(MiMo:释放语言模型的推理潜力——从预训练到后训练) [01:48] 🖼 Step1X-3D: Towards High-Fidelity and Controllable Generation of Textured 3D Assets(Step1X-3D:迈向高质量和可控的纹理3D资产生成) [02:29] 🤝 Learning...

Listen to the HuggingFace 每日AI论文速递 podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.