duan

HuggingFace 每日AI论文速递

每天10分钟,带您快速了解当日HuggingFace热门AI论文内容。每个工作日更新,欢迎订阅。📢播客节目在小宇宙、Apple Podcast平台搜索【HuggingFace 每日AI论文速递】🖼另外还有图文版,可在小红书搜索并关注【AI速递】

Author

duan

Category

Technology

Podcast website

www.xiaoyuzhoufm.com

Latest episode

Jul 10, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

2024.12.20 每日AI论文 | 数据扩增提升LLMs性能,多模态推理框架创新突破 20.12.2024

本期的 14 篇论文如下: [00:22] 🤖 Qwen2.5 Technical Report(Qwen2.5技术报告) [01:00] 🧠 Progressive Multimodal Reasoning via Active Retrieval(通过主动检索实现渐进式多模态推理) [01:39] 🌐 MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval(MegaPairs:大规模数据合成用于通用多模态检索) [02:26] 🧠 LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context...

2024.12.19 每日AI论文 | AI代理任务表现有限,动画制作效率提升。 19.12.2024

本期的 18 篇论文如下: [00:24] 🤖 TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks(TheAgentCompany:在具有重要现实意义的任务上对LLM代理进行基准测试) [01:06] 🎥 AniDoc: Animation Creation Made Easier(AniDoc:让动画制作更简单) [01:44] 👗 FashionComposer: Compositional Fashion Image Generation(时尚组合器:组合式时尚图像生成) [02:28] 🤖 Efficient Diffusion Transformer P...

2024.12.18 每日AI论文 | 推理能力待提升,多模态模型需优化。 18.12.2024

本期的 8 篇论文如下: [00:24] 🧠 Are Your LLMs Capable of Stable Reasoning?(你的LLM是否具备稳定推理能力?) [01:06] 📊 Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models(多维度洞察:大型多模态模型在现实世界个性化中的基准测试) [01:52] 📊 OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain(OmniEval:金融领域全方位自...

2024.12.17 每日AI论文 | 提升检索生成效率,优化视觉生成评估。 17.12.2024

本期的 18 篇论文如下: [00:23] 🧠 RetroLLM: Empowering Large Language Models to Retrieve Fine-grained Evidence within Generation(RetroLLM:赋能大型语言模型在生成过程中检索细粒度证据) [01:05] ⚡ Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models(评估代理:高效且可提示的视觉生成模型评估框架) [01:45] 🎨 BrushEdit: All-In-One Image Inpainting and Editing(...

2024.12.16 每日AI论文 | 视频理解新突破,AI探索3D环境。 16.12.2024

本期的 14 篇论文如下: [00:23] 🎥 Apollo: An Exploration of Video Understanding in Large Multimodal Models(阿波罗:大型多模态模型中的视频理解探索) [01:11] 🌍 GenEx: Generating an Explorable World(GenEx:生成可探索的世界) [01:50] 🌐 SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding(协同生成-VL:基于视觉专家和令牌折叠的图像理解与生成) [02...

【周末特辑】12月第2周最火AI论文 | 扩展策略提升模型性能,多模态系统优化长期交互。 14.12.2024

本期的 5 篇论文如下: [00:43] TOP1(🔥95) | 🌐 Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling(扩展开源多模态模型性能边界:模型、数据与测试时扩展) [03:01] TOP2(🔥65) | 🎥 InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions(InternLM-XComposer2.5-OmniLive:一个用于长期流式视...

2024.12.13 每日AI论文 | 多模态系统提升长期交互,phi-4优化STEM问答表现。 13.12.2024

本期的 23 篇论文如下: [00:23] 🎥 InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions(InternLM-XComposer2.5-OmniLive:一个用于长期流式视频和音频交互的综合多模态系统) [01:03] 🧠 Phi-4 Technical Report(Phi-4 技术报告) [01:43] 🧠 Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions(欧几里得:通过...

2024.12.12 每日AI论文 | 多视角视频生成突破,复杂场景模型提升 12.12.2024

本期的 14 篇论文如下: [00:23] 🎥 SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints(SynCamMaster:同步多视角视频生成) [01:07] 🌐 LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations(LAION-SG:用于训练复杂图像-文本模型的增强型大规模数据集与结构化注释) [01:51] 🌐 POINTS1.5: Building a Vision-Language Model to...

2024.12.11 每日AI论文 | 代码模型评估改进,视频生成技术突破 11.12.2024

本期的 23 篇论文如下: [00:25] 🧑 Evaluating and Aligning CodeLLMs on Human Preference(评估与对齐代码大语言模型的人类偏好) [01:19] 🎥 STIV: Scalable Text and Image Conditioned Video Generation(STIV:可扩展的文本与图像条件视频生成) [01:59] 🎨 DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation(DiffSensei:连接多模态大语言模型与扩散模型以实现定制化漫画生成...

2024.12.10 每日AI论文 | 识别数学推理错误,评估强化学习记忆。 10.12.2024

本期的 9 篇论文如下: [00:23] 🧮 ProcessBench: Identifying Process Errors in Mathematical Reasoning(ProcessBench:识别数学推理中的过程错误) [01:13] 🧠 Unraveling the Complexity of Memory in RL Agents: an Approach for Classification and Evaluation(揭开强化学习代理中记忆复杂性的分类与评估方法) [01:58] 🧠 Training Large Language Models to Reason in a Continuous Latent Space(在连续潜在空间中训练...

2024.12.09 每日AI论文 | 提升多模态模型性能,优化文本到视频生成质量。 09.12.2024

本期的 11 篇论文如下: [00:27] 🌐 Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling(扩展开源多模态模型性能边界:模型、数据与测试时扩展) [00:58] 🎥 LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment(利用人类反馈进行文本到视频模型对齐) [01:41] 🧠 MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale(MAm...

【周末特辑】12月第1周最火AI论文 | SNOOPI提升文生图模型效率,PaliGemma 2优化视觉语言模型迁移性能 07.12.2024

本期的 5 篇论文如下: [00:40] TOP1(🔥102) | 🚀 SNOOPI: Supercharged One-step Diffusion Distillation with Proper Guidance(SNOOPI:超强一步扩散蒸馏与适当引导) [02:39] TOP2(🔥100) | 🔄 PaliGemma 2: A Family of Versatile VLMs for Transfer(PaliGemma 2:多功能视觉语言模型的迁移研究) [04:40] TOP3(🔥64) | 🔍 VisionZip: Longer is Better but Not Necessary in Vision Language Models(视觉压缩:视觉语言模...

2024.12.06 每日AI论文 | 视觉压缩提升效率,代码监控增强机器人可靠性。 06.12.2024

本期的 23 篇论文如下: [00:23] 🔍 VisionZip: Longer is Better but Not Necessary in Vision Language Models(视觉压缩:视觉语言模型中长度并非必要优势) [01:03] 🤖 Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection(代码即监控:约束感知的视觉编程用于反应性和前瞻性机器人故障检测) [01:43] 🖥 Aguvis: Unified Pure Vision Agents for Autonomous GUI Int...

2024.12.05 每日AI论文 | 提升文本到图像扩散模型,生成沉浸式360度视频。 05.12.2024

本期的 15 篇论文如下: [00:24] 🚀 SNOOPI: Supercharged One-step Diffusion Distillation with Proper Guidance(SNOOPI:超强一步扩散蒸馏与适当引导) [01:06] 🎥 Imagine360: Immersive 360 Video Generation from Perspective Anchor(Imagine360:从透视锚点生成沉浸式360度视频) [01:40] 🚗 Distilling Diffusion Models to Efficient 3D LiDAR Scene Completion(扩散模型在高效3D LiDAR场景补全中的蒸馏方法) [02:13]...

2024.12.04 每日AI论文 | 多镜头视频生成框架提升叙事连贯性,关键令牌识别增强LLM推理能力。 04.12.2024

本期的 15 篇论文如下: [00:24] 🎥 VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation(视频思维生成:多镜头视频生成的协作框架) [01:04] 🧠 Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability(关键令牌重要性:令牌级对比估计提升LLM的推理能力) [01:45] 🔄 Free Process Rewards without Process Labels(无过程标签的自由过程奖励) [02:3...

2024.12.03 每日AI论文 | X-Prompt提升图像生成,GATE OpenING评估图文生成。 03.12.2024

本期的 24 篇论文如下: [00:23] 🖼 X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models(X-Prompt:面向自回归视觉语言基础模型的通用上下文图像生成) [00:58] 📊 GATE OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation(GATE 开放:一个综合基准用于评估开放式交错图文生成) [01:32] 🖼 Switti: Designing Scale-Wis...

【月末特辑】11月最火AI论文 | OpenCoder性能媲美专有模型,SDXL Turbo增强图像模型可解释性。 03.12.2024

本期的 10 篇论文如下: [00:41] TOP1(🔥109) | 🔓 OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models(开放编码器:顶级代码大语言模型的开放食谱) [02:35] TOP2(🔥75) | 🔍 Unpacking SDXL Turbo: Interpreting Text-to-Image Models with Sparse Autoencoders(解构SDXL Turbo:使用稀疏自编码器解释文本到图像模型) [04:35] TOP3(🔥72) | 🖼 ROICtrl: Boosting Instance Control for Visual Generation...

2024.12.02 每日AI论文 | HiAR-ICL提升复杂任务表现,多模态模型领域适应增强。 02.12.2024

本期的 14 篇论文如下: [00:25] 🧠 Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS(超越示例:通过蒙特卡洛树搜索在上下文学习中的高级自动化推理范式) [01:06] 🌐 On Domain-Specific Post-Training for Multimodal Large Language Models(针对多模态大语言模型的领域特定后训练研究) [01:39] 🎥 Video Depth without Video Models(无需视频模型的视频深度估计) [02:10] 🧩 P...

【周末特辑】11月第5周最火AI论文 | 提升视觉生成实例控制,增强UI视觉代理交互能力。 30.11.2024

本期的 5 篇论文如下: [00:40] TOP1(🔥71) | 🖼 ROICtrl: Boosting Instance Control for Visual Generation(ROICtrl:提升视觉生成的实例控制) [02:30] TOP2(🔥59) | 🖥 ShowUI: One Vision-Language-Action Model for GUI Visual Agent(ShowUI:一种用于GUI视觉代理的视觉-语言-动作模型) [05:02] TOP3(🔥54) | 🚀 TÜLU 3: Pushing Frontiers in Open Language Model Post-Training(TÜLU 3:推动开放语言模型后训练的前沿)...

2024.11.29 每日AI论文 | 视觉语言模型提升,图像生成自动化 29.11.2024

本期的 6 篇论文如下: [00:26] 🧠 Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning(批评者-V:视觉语言模型批评者帮助捕捉多模态推理中的错误) [01:04] 🤖 ChatGen: Automatic Text-to-Image Generation From FreeStyle Chatting(ChatGen:从自由聊天中自动生成文本到图像) [01:43] 👕 TryOffDiff: Virtual-Try-Off via High-Fidelity Garment Reconstruction using Diffusion Models(TryOffDiff:基...

2024.11.28 每日AI论文 | 实例控制增强,4D场景生成突破 29.11.2024

本期的 21 篇论文如下: [00:24] 🖼 ROICtrl: Boosting Instance Control for Visual Generation(ROICtrl:提升视觉生成的实例控制) [01:08] 🎥 CAT4D: Create Anything in 4D with Multi-View Video Diffusion Models(CAT4D:使用多视角视频扩散模型在4D中创建任何内容) [01:55] 📚 Interleaved Scene Graph for Interleaved Text-and-Image Generation Assessment(交错场景图用于交错文本与图像生成评估) [02:38] 🌐 MARVEL...

2024.11.27 每日AI论文 | ShowUI提升GUI效率,F2F改进图像编辑。 27.11.2024

本期的 18 篇论文如下: [00:28] 🖥 ShowUI: One Vision-Language-Action Model for GUI Visual Agent(ShowUI:一种用于GUI视觉代理的视觉-语言-动作模型) [01:08] 🎥 Pathways on the Image Manifold: Image Editing via Video Generation(图像流形上的路径:通过视频生成进行图像编辑) [01:45] ⭐ Star Attention: Efficient LLM Inference over Long Sequences(星型注意力:长序列上高效的大型语言模型推理) [02:24] ⚡ Re...

2024.11.26 每日AI论文 | 3D材料生成自动化,零样本图像生成创新。 26.11.2024

本期的 21 篇论文如下: [00:26] 🌐 Material Anything: Generating Materials for Any 3D Object via Diffusion(材料生成:通过扩散生成任意3D对象的材料) [01:05] 🎨 Large-Scale Text-to-Image Model with Inpainting is a Zero-Shot Subject-Driven Image Generator(基于修复的大规模文本到图像模型:零样本主题驱动图像生成器) [01:48] 🤖 From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge...

2024.11.25 每日AI论文 | 风格友好SNR采样器提升图像生成,TÜLU 3开源模型性能超越。 25.11.2024

本期的 14 篇论文如下: [00:26] 🎨 Style-Friendly SNR Sampler for Style-Driven Generation(风格友好SNR采样器用于风格驱动生成) [01:08] 🚀 TÜLU 3: Pushing Frontiers in Open Language Model Post-Training(TÜLU 3:推动开放语言模型后训练的前沿) [01:53] 🌐 OminiControl: Minimal and Universal Control for Diffusion Transformer(OminiControl:扩散Transformer的最小且通用控制) [02:31] 🛡 A Flexible Large Lan...

【周末特辑】11月第4周最火AI论文 | LLaVA-o1提升多模态推理,Genex优化具身AI规划。 23.11.2024

本期的 5 篇论文如下: [00:41] TOP1(🔥93) | 🧠 LLaVA-o1: Let Vision Language Models Reason Step-by-Step(LLaVA-o1:让视觉语言模型逐步推理) [02:41] TOP2(🔥55) | 🌍 Generative World Explorer(生成世界探索者) [05:00] TOP3(🔥44) | 🧠 Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization(通过混合偏好优化提升多模态大语言模型的推理能力) [07:11] TOP4(🔥41...

Listen to the HuggingFace 每日AI论文速递 podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.