duan
HuggingFace 每日AI论文速递
每天10分钟,带您快速了解当日HuggingFace热门AI论文内容。每个工作日更新,欢迎订阅。📢播客节目在小宇宙、Apple Podcast平台搜索【HuggingFace 每日AI论文速递】🖼另外还有图文版,可在小红书搜索并关注【AI速递】
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
2025.12.24 | 语义蓝图提速视频生成;逐层剖析炼出强策略 24.12.2025 10:32
本期的 15 篇论文如下: [00:19] 🎬 SemanticGen: Video Generation in Semantic Space(SemanticGen:在语义空间中的视频生成) [01:01] 🔍 Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal Policies(自底向上策略优化:你的语言模型策略中暗含内部策略) [01:48] 🧠 SpatialTree: How Spatial Abilities Branch Out in MLLMs(SpatialTree:多模态大语言模型中的空间能力如何分支发展)...
2025.12.23 | 数据工厂提效;棱镜假说统合 23.12.2025 10:55
本期的 15 篇论文如下: [00:22] ⚙ DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI(DataFlow:面向数据为中心AI时代的统一数据准备与工作流自动化LLM驱动框架) [01:04] 🔍 The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding(棱镜假说:通过统一自编码协调语义与像素表示) [01:50] 🎬 Region-Constrai...
2025.12.22 | PhysBrain用第一人称视频让AI学会动手;大模型离科学家AI还差得远 22.12.2025 11:06
本期的 15 篇论文如下: [00:24] 🧠 PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence(PhysBrain:以人类第一人称数据为桥梁,从视觉语言模型迈向物理智能) [01:05] 🔬 Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows(通过科学家对齐的工作流程探究大语言模型的科学通用智能) [01:34] 🧠 When Reasoning Meets Its Laws(当推理遇见...
【周末特辑】12月第4周最火AI论文 | 全能生成Kling-Omni秒出4K影片;Step-GUI让手机代理本地跑 20.12.2025 13:23
本期的 5 篇论文如下: [00:37] TOP1(🔥117) | 🎬 Kling-Omni Technical Report(Kling-Omni技术报告) [02:55] TOP2(🔥116) | 🤖 Step-GUI Technical Report(Step-GUI技术报告) [05:54] TOP3(🔥112) | 🧠 MMGR: Multi-Modal Generative Reasoning(MMGR:多模态生成式推理评估与基准) [08:04] TOP4(🔥97) | 🎥 EgoX: Egocentric Video Generation from a Single Exocentric Video(EgoX:从单视角外中心视频生成自我中心视频)...
2025.12.19 | Kling-Omni一统视频生成;LLaDA2.0百亿扩散模型 19.12.2025 10:16
本期的 14 篇论文如下: [00:26] 🎬 Kling-Omni Technical Report(Kling-Omni技术报告) [01:02] 🚀 LLaDA2.0: Scaling Up Diffusion Language Models to 100B(LLaDA2.0:将扩散语言模型扩展至1000亿参数) [01:41] 🔮 Next-Embedding Prediction Makes Strong Vision Learners(下一嵌入预测构建强大的视觉学习器) [02:27] 👓 StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors(StereoPi...
2025.12.18 | 校准步长奖励砍成本;扩散草稿自回归验证提速 18.12.2025 10:15
本期的 14 篇论文如下: [00:25] 🤖 Step-GUI Technical Report(Step-GUI技术报告) [00:59] ⚡ DEER: Draft with Diffusion, Verify with Autoregressive Models(DEER:基于扩散模型生成草稿,基于自回归模型验证) [01:31] ⚡ Fast and Accurate Causal Parallel Decoding using Jacobi Forcing(使用雅可比强制实现快速准确的因果并行解码) [02:10] 🚀 HyperVL: An Efficient and Dynamic Multimodal Large Language Model f...
2025.12.17 | MMGR揭多模态推理短板;WorldPlay保几何一致实时建模 17.12.2025 11:26
本期的 15 篇论文如下: [00:23] 🧠 MMGR: Multi-Modal Generative Reasoning(MMGR:多模态生成式推理评估与基准) [01:14] 🎮 WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling(WorldPlay:面向实时交互式世界建模的长期几何一致性研究) [01:47] 🤖 Video Reality Test: Can AI-Generated ASMR Videos fool VLMs and Humans?(视频真实性测试:AI生成的ASMR视频能否欺骗视觉语言...
2025.12.16 | 代理记忆三维框架;VTP刷新生成纪录 16.12.2025 10:48
本期的 15 篇论文如下: [00:20] 🧠 Memory in the Age of AI Agents(人工智能代理时代下的记忆) [00:57] 🚀 Towards Scalable Pre-training of Visual Tokenizers for Generation(迈向可扩展的视觉分词器预训练用于生成任务) [01:42] 🎬 LongVie 2: Multimodal Controllable Ultra-Long Video World Model(LongVie 2:多模态可控超长视频世界模型) [02:41] ⚡ ReFusion: A Diffusion Large Language Model with Parallel Au...
2025.12.15 | 牙科小模型逆袭;扩散模型弃VAE 15.12.2025 9:23
本期的 14 篇论文如下: [00:22] 🦷 DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry(DentalGPT:激励牙科领域多模态复杂推理) [00:53] 🎨 SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder(SVG-T2I:无需变分自编码器即可扩展文本到图像潜在扩散模型) [01:41] 🎥 EgoX: Egocentric Video Generation from a Single Exocentric Video(EgoX:从单视角外中心视...
【周末特辑】12月第3周最火AI论文 | 潜轨迹制导视频运动;并行自蒸馏提速推理 13.12.2025 11:27
本期的 5 篇论文如下: [00:30] TOP1(🔥117) | 🎬 Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance(Wan-Move:通过潜在轨迹引导实现运动可控的视频生成) [02:11] TOP2(🔥71) | ⚡ Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning(原生并行推理器:通过自蒸馏强化学习实现并行推理) [04:18] TOP3(🔥71) | 🚀 Visionary: The World Model Carri...
2025.12.12 | RL捏3D新纪录;AI奥赛摘银牌 12.12.2025 11:01
本期的 15 篇论文如下: [00:25] 🤖 Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation(我们准备好将强化学习应用于文本到3D生成领域了吗?一项渐进式研究) [01:01] 🧠 Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving(用于奥赛级数学问题求解的长程推理智能体) [01:36] 🚀 T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground(T-pro 2.0:一...
2025.12.11 | StereoWorld单目秒变立体大片;BiCo跨域拼贴新概念 11.12.2025 11:17
本期的 15 篇论文如下: [00:22] 🎥 StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation(StereoWorld:几何感知的单目到立体视频生成) [00:59] 🎨 Composing Concepts from Images and Videos via Concept-prompt Binding(通过概念-提示绑定从图像和视频中组合概念) [01:43] 🧠 BrainExplore: Large-Scale Discovery of Interpretable Visual Representations in the Human Brain(BrainExplore:人脑中可解释...
2025.12.10 | 潜在轨迹控运动;WebGPU实时溅射 10.12.2025 10:39
本期的 15 篇论文如下: [00:24] 🎬 Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance(Wan-Move:通过潜在轨迹引导实现运动可控的视频生成) [00:55] 🚀 Visionary: The World Model Carrier Built on WebGPU-Powered Gaussian Splatting Platform(Visionary:基于WebGPU驱动的高斯溅射平台的世界模型载体) [01:32] 🎬 Preserving Source Video Realism: High-Fidelity Face Swapping for Cinem...
2025.12.09 | 并行自蒸馏提速4.6倍;虚部RoPE++长文本双优化 09.12.2025 10:39
本期的 15 篇论文如下: [00:20] ⚡ Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning(原生并行推理器:通过自蒸馏强化学习实现并行推理) [01:04] 🧠 Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs(超越实数:用于长上下文大语言模型的旋转位置编码虚部扩展) [01:54] 🎬 Unified Video Editing with Temporal Reasoner(基于时序推理...
2025.12.08 | 自对抗一步生成;外挂评审迭代编辑 08.12.2025 10:08
本期的 15 篇论文如下: [00:19] ⚡ TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows(TwinFlow:基于自对抗流实现大模型的一步生成) [00:49] 🤔 EditThinker: Unlocking Iterative Reasoning for Any Image Editor(EditThinker:为任意图像编辑器解锁迭代推理能力) [01:26] 🎨 PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeli...
【周末特辑】12月第2周最火AI论文 | 代码智能全链路拆解;开源DeepSeek-V3.2登顶 07.12.2025 11:36
本期的 5 篇论文如下: [00:32] TOP1(🔥239) | 🧠 From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence(从代码基础模型到智能体与应用:代码智能实用指南) [03:05] TOP2(🔥169) | 🚀 DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models(DeepSeek-V3.2:推动开放大型语言模型前沿) [04:58] TOP3(🔥148) | 🎬 LongVT: Incentivizing "Thinking with Long Videos"...
2025.12.05 | DAComp立Agent新靶;流式化身无限实时 05.12.2025 10:59
本期的 15 篇论文如下: [00:22] 📊 DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle(DAComp:跨全数据智能生命周期的数据智能体基准测试) [01:07] 🤖 Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length(实时虚拟化身:基于无限时长的流式实时音频驱动化身生成) [01:42] 🤖 Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Env...
2025.12.04 | Qwen3-VL多模态超长上下文;PretrainZero强化主动预训练 04.12.2025 11:26
本期的 15 篇论文如下: [00:24] 🧠 Qwen3-VL Technical Report(Qwen3-VL 技术报告) [00:57] 🧠 PretrainZero: Reinforcement Active Pretraining(PretrainZero:强化主动预训练) [01:36] 🎬 ViDiC: Video Difference Captioning(ViDiC:视频差异描述) [02:24] 🧠 OneThinker: All-in-one Reasoning Model for Image and Video(OneThinker:面向图像与视频的全能推理模型) [03:07] 🔄 Rethinking Prompt Design for Infere...
【月末特辑】11月最火AI论文 | Kandinsky 5.0全家桶开源;视频生成让模型边播边想 03.12.2025 23:07
本期的 10 篇论文如下: [00:35] TOP1(🔥219) | 🎨 Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation(Kandinsky 5.0:用于图像和视频生成的基础模型家族) [02:45] TOP2(🔥207) | 🎬 Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm(用视频思考:视频生成作为统一多模态推理新范式) [04:58] TOP3(🔥191) | 🌍 Lumine: An Open Recipe for Building Generali...
2025.12.02 | 代码智能四步落地;LongVT长视频精准理解 02.12.2025 10:57
本期的 15 篇论文如下: [00:20] 🧠 From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence(从代码基础模型到智能体与应用:代码智能实用指南) [01:05] 🎬 LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling(LongVT:通过原生工具调用激励“长视频思考”) [01:43] 🔍 Envision: Benchmarking Unified Understanding & Generation for Causal World Proces...
2025.12.01 | Z-Image小参高效夺冠;REASONEDIT先思后画登顶 01.12.2025 9:33
本期的 15 篇论文如下: [00:26] 🚀 Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer(Z-Image:基于单流扩散Transformer的高效图像生成基础模型) [01:00] 🤔 REASONEDIT: Towards Reasoning-Enhanced Image Editing Models(REASONEDIT:迈向推理增强的图像编辑模型) [01:25] 🎬 AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement...
【周末特辑】11月第5周最火AI论文 | 自适应正交稳训练;GAM代理即搜忆 29.11.2025 11:54
本期的 5 篇论文如下: [00:51] TOP1(🔥161) | ⚡ ROOT: Robust Orthogonalized Optimizer for Neural Network Training(ROOT:面向神经网络训练的鲁棒正交化优化器) [02:35] TOP2(🔥141) | 🧠 General Agentic Memory Via Deep Research(通过深度研究的通用代理记忆) [04:33] TOP3(🔥110) | 🧬 GigaEvo: An Open Source Optimization Framework Powered By LLMs And Evolution Algorithms(GigaEvo:基于大语言模型与进化算法...
2025.11.28 | 潜在奖励模型提速降显存;画布多模态生成碾压SOTA 28.11.2025 4:47
本期的 6 篇论文如下: [00:19] 🎬 Video Generation Models Are Good Latent Reward Models(视频生成模型是优秀的潜在奖励模型) [01:07] 🎨 Canvas-to-Image: Compositional Image Generation with Multimodal Controls(画布到图像:基于多模态控制的组合式图像生成) [01:49] 🎨 MIRA: Multimodal Iterative Reasoning Agent for Image Editing(MIRA:多模态迭代推理代理用于图像编辑) [02:30] 📊 Multi-Crit: Benchmarking...
2025.11.27 | 俄语多模态评测补空白;潜协作提速14% 27.11.2025 11:03
本期的 15 篇论文如下: [00:22] 🔍 Multimodal Evaluation of Russian-language Architectures(俄语多模态架构的评估框架) [01:15] 🧠 Latent Collaboration in Multi-Agent Systems(多智能体系统中的潜在协作) [01:47] 🌍 Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation(Inferix:基于块扩散的新一代世界模拟推理引擎) [02:18] 🎭 Harmony: Harmonizing Audio and Video Genera...
2025.11.26 | 大模型育种进化框架开源;MedSAM-3听懂临床精准分割 26.11.2025 11:05
本期的 15 篇论文如下: [00:17] 🧬 GigaEvo: An Open Source Optimization Framework Powered By LLMs And Evolution Algorithms(GigaEvo:基于大语言模型与进化算法的开源优化框架) [00:57] 🔬 MedSAM3: Delving into Segment Anything with Medical Concepts(MedSAM3:深入探索基于医学概念的通用分割模型) [01:34] 🔍 Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning(Agent0-VL...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.