duan
HuggingFace 每日AI论文速递
每天10分钟,带您快速了解当日HuggingFace热门AI论文内容。每个工作日更新,欢迎订阅。📢播客节目在小宇宙、Apple Podcast平台搜索【HuggingFace 每日AI论文速递】🖼另外还有图文版,可在小红书搜索并关注【AI速递】
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
2025.06.09 | 常青问题分类提升问答系统;多模态融合优化音频描述。 10.06.2025 11:00
本期的 15 篇论文如下: [00:24] 🕰 Will It Still Be True Tomorrow? Multilingual Evergreen Question Classification to Improve Trustworthy QA(明日依旧为真吗?多语种常青问题分类以提升可信赖的问答系统) [01:04] 🎧 FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion(FusionAudio-1.2M:通过多模态上下文融合实现细粒度音频描述) [01:46] 🤔 Is Extending Modality The Righ...
【周末特辑】6月第2周最火AI论文 | LLM自我反思提升性能;高熵Token优化推理。 08.06.2025 12:20
本期的 5 篇论文如下: [00:47] TOP1(🔥169) | 💡 Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning(反思、重试、奖励:通过强化学习实现LLM的自我提升) [02:55] TOP2(🔥130) | 🧠 Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning(超越80/20法则:高熵少数Token驱动LLM推理的有效强化学习) [05:06] TOP3(🔥115) | 🧠 ProRL: Prolonge...
2025.06.06 | 智能助手加速ComfyUI开发;单步视频修复提升效率。 07.06.2025 11:32
本期的 15 篇论文如下: [00:24] 🤖 ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development(ComfyUI-Copilot:用于自动化工作流开发的智能助手) [00:59] 🎬 SeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Training(SeedVR2:基于扩散对抗后训练的单步视频修复) [01:39] 🤖 RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics(Rob...
2025.06.05 | 紧凑强大视觉模型;多阶段训练提升推理能力 06.06.2025 11:34
本期的 15 篇论文如下: [00:21] 🤖 MiMo-VL Technical Report(MiMo-VL 技术报告) [01:14] 💡 Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning(多模态推理进阶:从优化冷启动到分阶段强化学习) [01:57] 🤖 AmbiK: Dataset of Ambiguous Tasks in Kitchen Environment(AmbiK:厨房环境中歧义性任务数据集) [02:42] 🔄 CASS: Nvidia to AMD Transpilation with Data, Models, an...
2025.06.04 | 强化学习提升LLM性能;UniWorld统一视觉理解与生成。 05.06.2025 11:20
本期的 15 篇论文如下: [00:23] 💡 Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning(反思、重试、奖励:通过强化学习实现LLM的自我提升) [01:09] 🖼 UniWorld: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation(UniWorld:用于统一视觉理解与生成的高分辨率语义编码器) [01:53] 🧪 CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabil...
2025.06.03 | 高熵Token提升LLM推理;推理健身房优化强化学习环境。 03.06.2025 10:52
本期的 15 篇论文如下: [00:22] 🧠 Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning(超越80/20法则:高熵少数Token驱动LLM推理的有效强化学习) [01:05] 🧠 REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards(推理健身房:基于可验证奖励的强化学习推理环境) [01:46] 🤖 SmolVLA: A Vision-Language-Action Model f...
【月末特辑】5月最火AI论文 | 小型语言模型在翻译中表现优异;多模态推理模型发展历程综述。 03.06.2025 24:12
本期的 10 篇论文如下: [00:40] TOP1(🔥209) | 🌐 Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model(Mutarjim:利用小型语言模型推进阿拉伯语-英语双向翻译) [03:07] TOP2(🔥172) | 🧠 Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models(感知、推理、思考与规划:大型多模态推理模型综述) [05:19] TOP3(🔥171) | 🤖 Qwen3 Technical Report(Q...
2025.06.02 | 延长RL提升推理;快慢思考优化推理。 02.06.2025 11:13
本期的 15 篇论文如下: [00:23] 🧠 ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models(ProRL:延长的强化学习拓展大型语言模型的推理边界) [01:01] 🧠 AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time(AlphaOne:测试时驱动大模型进行快慢思考的推理框架) [01:42] 🤔 Time Blindness: Why Video-Language Models Can't See What Humans Can?(时间盲区:为何...
【周末特辑】6月第1周最火AI论文 | 小型模型在翻译中表现优异;数据中心压缩提升AI效率。 01.06.2025 11:53
本期的 5 篇论文如下: [00:43] TOP1(🔥205) | 🌐 Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model(Mutarjim:利用小型语言模型推进阿拉伯语-英语双向翻译) [03:10] TOP2(🔥139) | 🗜 Shifting AI Efficiency From Model-Centric to Data-Centric Compression(AI效率转移:从以模型为中心到以数据为中心的压缩) [04:55] TOP3(🔥106) | 📊 TabSTAR: A Foundation Tabular Model With...
2025.05.30 | 推理扩展提升表格推理;多模态模型视频反馈有待优化。 30.05.2025 11:10
本期的 15 篇论文如下: [00:22] 📊 Table-R1: Inference-Time Scaling for Table Reasoning(Table-R1:表格推理的推理时扩展) [01:02] 🤖 VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos(VF-Eval:评估多模态大语言模型生成AIGC视频反馈的能力) [01:45] 🧠 Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence(Spatial-MLLM:提升多模态大语言模型在基于视觉的空...
2025.05.29 | 熵机制提升模型性能;令牌路由优化推理效率。 29.05.2025 11:29
本期的 15 篇论文如下: [00:22] 🤖 The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models(用于推理语言模型的强化学习的熵机制) [00:56] 🛣 R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing(R2R:通过大小模型令牌路由高效导航不同的推理路径) [01:40] 🧠 Skywork Open Reasoner 1 Technical Report(Skywork开放推理器1技术报告) [02:20] 🔍 Sherl...
2025.05.28 | 多模态Agent科研任务成功率低;逻辑推理模型存在显著局限。 28.05.2025 11:14
本期的 15 篇论文如下: [00:23] 🧪 ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows(ScienceBoard:评估现实科学工作流程中的多模态自主Agent) [01:09] 🤔 MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs(MME-推理:多模态大型语言模型中逻辑推理的综合基准) [01:51] 🖼 Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers(P...
2025.05.27 | AI效率提升需数据压缩;小型模型翻译更高效。 27.05.2025 11:35
本期的 15 篇论文如下: [00:24] 🗜 Shifting AI Efficiency From Model-Centric to Data-Centric Compression(AI效率转移:从以模型为中心到以数据为中心的压缩) [01:05] 🌐 Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model(Mutarjim:利用小型语言模型推进阿拉伯语-英语双向翻译) [02:00] 📊 BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs...
2025.05.26 | TabSTAR提升表格数据分类性能;QwenLong-L1优化长文本推理 26.05.2025 11:01
本期的 15 篇论文如下: [00:23] 📊 TabSTAR: A Foundation Tabular Model With Semantically Target-Aware Representations(TabSTAR:具有语义目标感知表征的表格基础模型) [00:59] 🧠 QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning(QwenLong-L1:基于强化学习的长文本大型推理模型) [01:43] 🤔 Reasoning Model is Stubborn: Diagnosing Instruction Overriding in Reasoning Mode...
【周末特辑】5月第4周最火AI论文 | Qwen3提升LLMs性能;BAGEL增强多模态推理。 24.05.2025 12:41
本期的 5 篇论文如下: [00:42] TOP1(🔥146) | 🤖 Qwen3 Technical Report(Qwen3技术报告) [03:08] TOP2(🔥114) | 💡 Emerging Properties in Unified Multimodal Pretraining(统一多模态预训练中的涌现属性) [05:22] TOP3(🔥105) | 🔗 Chain-of-Model Learning for Language Model(模型链学习:一种用于语言模型的新型学习范式) [07:34] TOP4(🔥93) | 🧪 NovelSeek: When Agent Becomes the Scientist -- Building Closed-L...
2025.05.23 | 智能体加速科研;推理模型指令遵循不佳。 23.05.2025 11:28
本期的 15 篇论文如下: [00:22] 🧪 NovelSeek: When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification(NovelSeek:当智能体成为科学家——构建从假设到验证的闭环系统) [01:05] 🤔 Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models(规模化推理,失控的指令:评估大型推理模型中的指令遵循) [01:50] 🤖 Tool-Star: Empowering LLM-...
2025.05.22 | Web导航效率提升;量化误差优化。 22.05.2025 10:46
本期的 15 篇论文如下: [00:25] 🤖 Web-Shepherd: Advancing PRMs for Reinforcing Web Agents(Web-Shepherd:用于增强Web代理的PRM的进步) [01:13] 🧮 Scaling Law for Quantization-Aware Training(量化感知训练的缩放法则) [01:53] 🤖 UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning(基于强化学习和推理引导的通用视觉定位) [02:28] 🎨 MMaDA: Multimodal Large Diffusion Languag...
2025.05.21 | 多模态预训练提升复杂任务能力;注意力机制优化推理与训练效率。 21.05.2025 10:50
本期的 15 篇论文如下: [00:22] 💡 Emerging Properties in Unified Multimodal Pretraining(统一多模态预训练中的涌现属性) [01:03] 🚀 SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training(SageAttention3:用于推理的微缩FP4注意力机制与8位训练的探索) [01:42] 🖼 VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank(Visual...
2025.05.20 | 模型链学习提升效率;AdaptThink优化推理速度。 20.05.2025 11:12
本期的 15 篇论文如下: [00:23] 🔗 Chain-of-Model Learning for Language Model(模型链学习:一种用于语言模型的新型学习范式) [00:58] 🤔 AdaptThink: Reasoning Models Can Learn When to Think(AdaptThink:推理模型何时思考的学习) [01:45] 🧠 AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning(AdaCoT: 通过强化学习实现帕累托最优的自适应思维链触发) [02:21] 🚀 Delta Atte...
2025.05.19 | Qwen3提升LLMs性能;GuardReasoner-VL强化VLM安全。 19.05.2025 11:22
本期的 15 篇论文如下: [00:24] 🤖 Qwen3 Technical Report(Qwen3技术报告) [01:14] 🛡 GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning(GuardReasoner-VL:通过强化推理保护视觉语言模型) [02:01] 🖼 MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly(MMLongBench:有效且全面地评测长文本视觉语言模型) [02:40] 🖼 Visual Planning: Let's Think Only with Images...
【周末特辑】5月第3周最火AI论文 | Seed1.5-VL多模态推理领先;MiniMax-Speech零样本语音克隆 17.05.2025 12:44
本期的 5 篇论文如下: [00:38] TOP1(🔥126) | 💡 Seed1.5-VL Technical Report(Seed1.5-VL 技术报告) [03:11] TOP2(🔥109) | 🗣 MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder(MiniMax-Speech:具有可学习说话人编码器的内在零样本语音合成) [05:23] TOP3(🔥86) | 💡 Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models(超越“Aha!”时刻:迈向大...
2025.05.16 | 推理模型元能力提升;系统提示优化与鲁棒性增强 16.05.2025 11:23
本期的 15 篇论文如下: [00:24] 💡 Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models(超越“Aha!”时刻:迈向大型推理模型中系统性元能力对齐) [01:02] 🤖 System Prompt Optimization with Meta-Learning(基于元学习的系统提示优化) [01:47] 🤖 EnerVerse-AC: Envisioning Embodied Environments with Action Condition(EnerVerse-AC:通过动作条件设想具身环境) [02:29] 🧠 The CoT E...
2025.05.15 | 解耦学习提升感知性能;多模态模型优化图像生成。 15.05.2025 8:10
本期的 11 篇论文如下: [00:23] 🖼 DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception(DeCLIP:用于开放词汇密集感知的解耦学习) [01:02] 🖼 BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset(BLIP3-o:一族完全开放的统一多模态模型——架构、训练和数据集) [01:41] 💡 Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Archi...
2025.05.14 | 零样本语音合成新模型;多维度评估LLM指令能力 14.05.2025 6:12
本期的 8 篇论文如下: [00:25] 🗣 MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder(MiniMax-Speech:具有可学习说话人编码器的内在零样本语音合成) [01:00] 🤖 A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models(用于评估和改进大型语言模型指令遵循能力的多维度约束框架) [01:47] 🎮 Measuring General Intelli...
2025.05.13 | 视觉-语言模型提升多模态能力;优化训练策略增强推理潜力。 13.05.2025 11:40
本期的 15 篇论文如下: [00:24] 💡 Seed1.5-VL Technical Report(Seed1.5-VL 技术报告) [01:04] 🧠 MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining(MiMo:释放语言模型的推理潜力——从预训练到后训练) [01:48] 🖼 Step1X-3D: Towards High-Fidelity and Controllable Generation of Textured 3D Assets(Step1X-3D:迈向高质量和可控的纹理3D资产生成) [02:29] 🤝 Learning...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.