duan

HuggingFace 每日AI论文速递

每天10分钟,带您快速了解当日HuggingFace热门AI论文内容。每个工作日更新,欢迎订阅。📢播客节目在小宇宙、Apple Podcast平台搜索【HuggingFace 每日AI论文速递】🖼另外还有图文版,可在小红书搜索并关注【AI速递】

Author

duan

Category

Technology

Podcast website

www.xiaoyuzhoufm.com

Latest episode

Jul 10, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

2025.12.24 | 语义蓝图提速视频生成;逐层剖析炼出强策略 24.12.2025

本期的 15 篇论文如下: [00:19] 🎬 SemanticGen: Video Generation in Semantic Space(SemanticGen:在语义空间中的视频生成) [01:01] 🔍 Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal Policies(自底向上策略优化:你的语言模型策略中暗含内部策略) [01:48] 🧠 SpatialTree: How Spatial Abilities Branch Out in MLLMs(SpatialTree:多模态大语言模型中的空间能力如何分支发展)...

2025.12.23 | 数据工厂提效;棱镜假说统合 23.12.2025

本期的 15 篇论文如下: [00:22] ⚙ DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI(DataFlow:面向数据为中心AI时代的统一数据准备与工作流自动化LLM驱动框架) [01:04] 🔍 The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding(棱镜假说:通过统一自编码协调语义与像素表示) [01:50] 🎬 Region-Constrai...

2025.12.22 | PhysBrain用第一人称视频让AI学会动手;大模型离科学家AI还差得远 22.12.2025

本期的 15 篇论文如下: [00:24] 🧠 PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence(PhysBrain:以人类第一人称数据为桥梁,从视觉语言模型迈向物理智能) [01:05] 🔬 Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows(通过科学家对齐的工作流程探究大语言模型的科学通用智能) [01:34] 🧠 When Reasoning Meets Its Laws(当推理遇见...

【周末特辑】12月第4周最火AI论文 | 全能生成Kling-Omni秒出4K影片;Step-GUI让手机代理本地跑 20.12.2025

本期的 5 篇论文如下: [00:37] TOP1(🔥117) | 🎬 Kling-Omni Technical Report(Kling-Omni技术报告) [02:55] TOP2(🔥116) | 🤖 Step-GUI Technical Report(Step-GUI技术报告) [05:54] TOP3(🔥112) | 🧠 MMGR: Multi-Modal Generative Reasoning(MMGR:多模态生成式推理评估与基准) [08:04] TOP4(🔥97) | 🎥 EgoX: Egocentric Video Generation from a Single Exocentric Video(EgoX:从单视角外中心视频生成自我中心视频)...

2025.12.19 | Kling-Omni一统视频生成;LLaDA2.0百亿扩散模型 19.12.2025

本期的 14 篇论文如下: [00:26] 🎬 Kling-Omni Technical Report(Kling-Omni技术报告) [01:02] 🚀 LLaDA2.0: Scaling Up Diffusion Language Models to 100B(LLaDA2.0:将扩散语言模型扩展至1000亿参数) [01:41] 🔮 Next-Embedding Prediction Makes Strong Vision Learners(下一嵌入预测构建强大的视觉学习器) [02:27] 👓 StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors(StereoPi...

2025.12.18 | 校准步长奖励砍成本;扩散草稿自回归验证提速 18.12.2025

本期的 14 篇论文如下: [00:25] 🤖 Step-GUI Technical Report(Step-GUI技术报告) [00:59] ⚡ DEER: Draft with Diffusion, Verify with Autoregressive Models(DEER:基于扩散模型生成草稿,基于自回归模型验证) [01:31] ⚡ Fast and Accurate Causal Parallel Decoding using Jacobi Forcing(使用雅可比强制实现快速准确的因果并行解码) [02:10] 🚀 HyperVL: An Efficient and Dynamic Multimodal Large Language Model f...

2025.12.17 | MMGR揭多模态推理短板;WorldPlay保几何一致实时建模 17.12.2025

本期的 15 篇论文如下: [00:23] 🧠 MMGR: Multi-Modal Generative Reasoning(MMGR:多模态生成式推理评估与基准) [01:14] 🎮 WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling(WorldPlay:面向实时交互式世界建模的长期几何一致性研究) [01:47] 🤖 Video Reality Test: Can AI-Generated ASMR Videos fool VLMs and Humans?(视频真实性测试:AI生成的ASMR视频能否欺骗视觉语言...

2025.12.16 | 代理记忆三维框架;VTP刷新生成纪录 16.12.2025

本期的 15 篇论文如下: [00:20] 🧠 Memory in the Age of AI Agents(人工智能代理时代下的记忆) [00:57] 🚀 Towards Scalable Pre-training of Visual Tokenizers for Generation(迈向可扩展的视觉分词器预训练用于生成任务) [01:42] 🎬 LongVie 2: Multimodal Controllable Ultra-Long Video World Model(LongVie 2:多模态可控超长视频世界模型) [02:41] ⚡ ReFusion: A Diffusion Large Language Model with Parallel Au...

2025.12.15 | 牙科小模型逆袭;扩散模型弃VAE 15.12.2025

本期的 14 篇论文如下: [00:22] 🦷 DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry(DentalGPT:激励牙科领域多模态复杂推理) [00:53] 🎨 SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder(SVG-T2I:无需变分自编码器即可扩展文本到图像潜在扩散模型) [01:41] 🎥 EgoX: Egocentric Video Generation from a Single Exocentric Video(EgoX:从单视角外中心视...

【周末特辑】12月第3周最火AI论文 | 潜轨迹制导视频运动;并行自蒸馏提速推理 13.12.2025

本期的 5 篇论文如下: [00:30] TOP1(🔥117) | 🎬 Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance(Wan-Move:通过潜在轨迹引导实现运动可控的视频生成) [02:11] TOP2(🔥71) | ⚡ Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning(原生并行推理器:通过自蒸馏强化学习实现并行推理) [04:18] TOP3(🔥71) | 🚀 Visionary: The World Model Carri...

2025.12.12 | RL捏3D新纪录;AI奥赛摘银牌 12.12.2025

本期的 15 篇论文如下: [00:25] 🤖 Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation(我们准备好将强化学习应用于文本到3D生成领域了吗?一项渐进式研究) [01:01] 🧠 Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving(用于奥赛级数学问题求解的长程推理智能体) [01:36] 🚀 T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground(T-pro 2.0:一...

2025.12.11 | StereoWorld单目秒变立体大片;BiCo跨域拼贴新概念 11.12.2025

本期的 15 篇论文如下: [00:22] 🎥 StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation(StereoWorld:几何感知的单目到立体视频生成) [00:59] 🎨 Composing Concepts from Images and Videos via Concept-prompt Binding(通过概念-提示绑定从图像和视频中组合概念) [01:43] 🧠 BrainExplore: Large-Scale Discovery of Interpretable Visual Representations in the Human Brain(BrainExplore:人脑中可解释...

2025.12.10 | 潜在轨迹控运动;WebGPU实时溅射 10.12.2025

本期的 15 篇论文如下: [00:24] 🎬 Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance(Wan-Move:通过潜在轨迹引导实现运动可控的视频生成) [00:55] 🚀 Visionary: The World Model Carrier Built on WebGPU-Powered Gaussian Splatting Platform(Visionary:基于WebGPU驱动的高斯溅射平台的世界模型载体) [01:32] 🎬 Preserving Source Video Realism: High-Fidelity Face Swapping for Cinem...

2025.12.09 | 并行自蒸馏提速4.6倍;虚部RoPE++长文本双优化 09.12.2025

本期的 15 篇论文如下: [00:20] ⚡ Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning(原生并行推理器:通过自蒸馏强化学习实现并行推理) [01:04] 🧠 Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs(超越实数:用于长上下文大语言模型的旋转位置编码虚部扩展) [01:54] 🎬 Unified Video Editing with Temporal Reasoner(基于时序推理...

2025.12.08 | 自对抗一步生成;外挂评审迭代编辑 08.12.2025

本期的 15 篇论文如下: [00:19] ⚡ TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows(TwinFlow:基于自对抗流实现大模型的一步生成) [00:49] 🤔 EditThinker: Unlocking Iterative Reasoning for Any Image Editor(EditThinker:为任意图像编辑器解锁迭代推理能力) [01:26] 🎨 PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeli...

【周末特辑】12月第2周最火AI论文 | 代码智能全链路拆解;开源DeepSeek-V3.2登顶 07.12.2025

本期的 5 篇论文如下: [00:32] TOP1(🔥239) | 🧠 From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence(从代码基础模型到智能体与应用:代码智能实用指南) [03:05] TOP2(🔥169) | 🚀 DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models(DeepSeek-V3.2:推动开放大型语言模型前沿) [04:58] TOP3(🔥148) | 🎬 LongVT: Incentivizing "Thinking with Long Videos"...

2025.12.05 | DAComp立Agent新靶;流式化身无限实时 05.12.2025

本期的 15 篇论文如下: [00:22] 📊 DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle(DAComp:跨全数据智能生命周期的数据智能体基准测试) [01:07] 🤖 Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length(实时虚拟化身:基于无限时长的流式实时音频驱动化身生成) [01:42] 🤖 Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Env...

2025.12.04 | Qwen3-VL多模态超长上下文;PretrainZero强化主动预训练 04.12.2025

本期的 15 篇论文如下: [00:24] 🧠 Qwen3-VL Technical Report(Qwen3-VL 技术报告) [00:57] 🧠 PretrainZero: Reinforcement Active Pretraining(PretrainZero:强化主动预训练) [01:36] 🎬 ViDiC: Video Difference Captioning(ViDiC:视频差异描述) [02:24] 🧠 OneThinker: All-in-one Reasoning Model for Image and Video(OneThinker:面向图像与视频的全能推理模型) [03:07] 🔄 Rethinking Prompt Design for Infere...

【月末特辑】11月最火AI论文 | Kandinsky 5.0全家桶开源;视频生成让模型边播边想 03.12.2025

本期的 10 篇论文如下: [00:35] TOP1(🔥219) | 🎨 Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation(Kandinsky 5.0:用于图像和视频生成的基础模型家族) [02:45] TOP2(🔥207) | 🎬 Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm(用视频思考:视频生成作为统一多模态推理新范式) [04:58] TOP3(🔥191) | 🌍 Lumine: An Open Recipe for Building Generali...

2025.12.02 | 代码智能四步落地;LongVT长视频精准理解 02.12.2025

本期的 15 篇论文如下: [00:20] 🧠 From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence(从代码基础模型到智能体与应用:代码智能实用指南) [01:05] 🎬 LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling(LongVT:通过原生工具调用激励“长视频思考”) [01:43] 🔍 Envision: Benchmarking Unified Understanding & Generation for Causal World Proces...

2025.12.01 | Z-Image小参高效夺冠;REASONEDIT先思后画登顶 01.12.2025

本期的 15 篇论文如下: [00:26] 🚀 Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer(Z-Image:基于单流扩散Transformer的高效图像生成基础模型) [01:00] 🤔 REASONEDIT: Towards Reasoning-Enhanced Image Editing Models(REASONEDIT:迈向推理增强的图像编辑模型) [01:25] 🎬 AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement...

【周末特辑】11月第5周最火AI论文 | 自适应正交稳训练;GAM代理即搜忆 29.11.2025

本期的 5 篇论文如下: [00:51] TOP1(🔥161) | ⚡ ROOT: Robust Orthogonalized Optimizer for Neural Network Training(ROOT:面向神经网络训练的鲁棒正交化优化器) [02:35] TOP2(🔥141) | 🧠 General Agentic Memory Via Deep Research(通过深度研究的通用代理记忆) [04:33] TOP3(🔥110) | 🧬 GigaEvo: An Open Source Optimization Framework Powered By LLMs And Evolution Algorithms(GigaEvo:基于大语言模型与进化算法...

2025.11.28 | 潜在奖励模型提速降显存;画布多模态生成碾压SOTA 28.11.2025

本期的 6 篇论文如下: [00:19] 🎬 Video Generation Models Are Good Latent Reward Models(视频生成模型是优秀的潜在奖励模型) [01:07] 🎨 Canvas-to-Image: Compositional Image Generation with Multimodal Controls(画布到图像:基于多模态控制的组合式图像生成) [01:49] 🎨 MIRA: Multimodal Iterative Reasoning Agent for Image Editing(MIRA:多模态迭代推理代理用于图像编辑) [02:30] 📊 Multi-Crit: Benchmarking...

2025.11.27 | 俄语多模态评测补空白;潜协作提速14% 27.11.2025

本期的 15 篇论文如下: [00:22] 🔍 Multimodal Evaluation of Russian-language Architectures(俄语多模态架构的评估框架) [01:15] 🧠 Latent Collaboration in Multi-Agent Systems(多智能体系统中的潜在协作) [01:47] 🌍 Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation(Inferix:基于块扩散的新一代世界模拟推理引擎) [02:18] 🎭 Harmony: Harmonizing Audio and Video Genera...

2025.11.26 | 大模型育种进化框架开源;MedSAM-3听懂临床精准分割 26.11.2025

本期的 15 篇论文如下: [00:17] 🧬 GigaEvo: An Open Source Optimization Framework Powered By LLMs And Evolution Algorithms(GigaEvo:基于大语言模型与进化算法的开源优化框架) [00:57] 🔬 MedSAM3: Delving into Segment Anything with Medical Concepts(MedSAM3:深入探索基于医学概念的通用分割模型) [01:34] 🔍 Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning(Agent0-VL...

Listen to the HuggingFace 每日AI论文速递 podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.