duan
HuggingFace 每日AI论文速递
每天10分钟,带您快速了解当日HuggingFace热门AI论文内容。每个工作日更新,欢迎订阅。📢播客节目在小宇宙、Apple Podcast平台搜索【HuggingFace 每日AI论文速递】🖼另外还有图文版,可在小红书搜索并关注【AI速递】
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
2024.12.20 每日AI论文 | 数据扩增提升LLMs性能,多模态推理框架创新突破 20.12.2024 10:47
本期的 14 篇论文如下: [00:22] 🤖 Qwen2.5 Technical Report(Qwen2.5技术报告) [01:00] 🧠 Progressive Multimodal Reasoning via Active Retrieval(通过主动检索实现渐进式多模态推理) [01:39] 🌐 MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval(MegaPairs:大规模数据合成用于通用多模态检索) [02:26] 🧠 LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context...
2024.12.19 每日AI论文 | AI代理任务表现有限,动画制作效率提升。 19.12.2024 13:25
本期的 18 篇论文如下: [00:24] 🤖 TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks(TheAgentCompany:在具有重要现实意义的任务上对LLM代理进行基准测试) [01:06] 🎥 AniDoc: Animation Creation Made Easier(AniDoc:让动画制作更简单) [01:44] 👗 FashionComposer: Compositional Fashion Image Generation(时尚组合器:组合式时尚图像生成) [02:28] 🤖 Efficient Diffusion Transformer P...
2024.12.18 每日AI论文 | 推理能力待提升,多模态模型需优化。 18.12.2024 6:24
本期的 8 篇论文如下: [00:24] 🧠 Are Your LLMs Capable of Stable Reasoning?(你的LLM是否具备稳定推理能力?) [01:06] 📊 Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models(多维度洞察:大型多模态模型在现实世界个性化中的基准测试) [01:52] 📊 OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain(OmniEval:金融领域全方位自...
2024.12.17 每日AI论文 | 提升检索生成效率,优化视觉生成评估。 17.12.2024 14:10
本期的 18 篇论文如下: [00:23] 🧠 RetroLLM: Empowering Large Language Models to Retrieve Fine-grained Evidence within Generation(RetroLLM:赋能大型语言模型在生成过程中检索细粒度证据) [01:05] ⚡ Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models(评估代理:高效且可提示的视觉生成模型评估框架) [01:45] 🎨 BrushEdit: All-In-One Image Inpainting and Editing(...
2024.12.16 每日AI论文 | 视频理解新突破,AI探索3D环境。 16.12.2024 11:21
本期的 14 篇论文如下: [00:23] 🎥 Apollo: An Exploration of Video Understanding in Large Multimodal Models(阿波罗:大型多模态模型中的视频理解探索) [01:11] 🌍 GenEx: Generating an Explorable World(GenEx:生成可探索的世界) [01:50] 🌐 SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding(协同生成-VL:基于视觉专家和令牌折叠的图像理解与生成) [02...
【周末特辑】12月第2周最火AI论文 | 扩展策略提升模型性能,多模态系统优化长期交互。 14.12.2024 12:24
本期的 5 篇论文如下: [00:43] TOP1(🔥95) | 🌐 Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling(扩展开源多模态模型性能边界:模型、数据与测试时扩展) [03:01] TOP2(🔥65) | 🎥 InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions(InternLM-XComposer2.5-OmniLive:一个用于长期流式视...
2024.12.13 每日AI论文 | 多模态系统提升长期交互,phi-4优化STEM问答表现。 13.12.2024 18:02
本期的 23 篇论文如下: [00:23] 🎥 InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions(InternLM-XComposer2.5-OmniLive:一个用于长期流式视频和音频交互的综合多模态系统) [01:03] 🧠 Phi-4 Technical Report(Phi-4 技术报告) [01:43] 🧠 Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions(欧几里得:通过...
2024.12.12 每日AI论文 | 多视角视频生成突破,复杂场景模型提升 12.12.2024 11:09
本期的 14 篇论文如下: [00:23] 🎥 SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints(SynCamMaster:同步多视角视频生成) [01:07] 🌐 LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations(LAION-SG:用于训练复杂图像-文本模型的增强型大规模数据集与结构化注释) [01:51] 🌐 POINTS1.5: Building a Vision-Language Model to...
2024.12.11 每日AI论文 | 代码模型评估改进,视频生成技术突破 11.12.2024 17:23
本期的 23 篇论文如下: [00:25] 🧑 Evaluating and Aligning CodeLLMs on Human Preference(评估与对齐代码大语言模型的人类偏好) [01:19] 🎥 STIV: Scalable Text and Image Conditioned Video Generation(STIV:可扩展的文本与图像条件视频生成) [01:59] 🎨 DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation(DiffSensei:连接多模态大语言模型与扩散模型以实现定制化漫画生成...
2024.12.10 每日AI论文 | 识别数学推理错误,评估强化学习记忆。 10.12.2024 7:23
本期的 9 篇论文如下: [00:23] 🧮 ProcessBench: Identifying Process Errors in Mathematical Reasoning(ProcessBench:识别数学推理中的过程错误) [01:13] 🧠 Unraveling the Complexity of Memory in RL Agents: an Approach for Classification and Evaluation(揭开强化学习代理中记忆复杂性的分类与评估方法) [01:58] 🧠 Training Large Language Models to Reason in a Continuous Latent Space(在连续潜在空间中训练...
2024.12.09 每日AI论文 | 提升多模态模型性能,优化文本到视频生成质量。 09.12.2024 8:23
本期的 11 篇论文如下: [00:27] 🌐 Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling(扩展开源多模态模型性能边界:模型、数据与测试时扩展) [00:58] 🎥 LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment(利用人类反馈进行文本到视频模型对齐) [01:41] 🧠 MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale(MAm...
【周末特辑】12月第1周最火AI论文 | SNOOPI提升文生图模型效率,PaliGemma 2优化视觉语言模型迁移性能 07.12.2024 10:47
本期的 5 篇论文如下: [00:40] TOP1(🔥102) | 🚀 SNOOPI: Supercharged One-step Diffusion Distillation with Proper Guidance(SNOOPI:超强一步扩散蒸馏与适当引导) [02:39] TOP2(🔥100) | 🔄 PaliGemma 2: A Family of Versatile VLMs for Transfer(PaliGemma 2:多功能视觉语言模型的迁移研究) [04:40] TOP3(🔥64) | 🔍 VisionZip: Longer is Better but Not Necessary in Vision Language Models(视觉压缩:视觉语言模...
2024.12.06 每日AI论文 | 视觉压缩提升效率,代码监控增强机器人可靠性。 06.12.2024 15:43
本期的 23 篇论文如下: [00:23] 🔍 VisionZip: Longer is Better but Not Necessary in Vision Language Models(视觉压缩:视觉语言模型中长度并非必要优势) [01:03] 🤖 Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection(代码即监控:约束感知的视觉编程用于反应性和前瞻性机器人故障检测) [01:43] 🖥 Aguvis: Unified Pure Vision Agents for Autonomous GUI Int...
2024.12.05 每日AI论文 | 提升文本到图像扩散模型,生成沉浸式360度视频。 05.12.2024 10:44
本期的 15 篇论文如下: [00:24] 🚀 SNOOPI: Supercharged One-step Diffusion Distillation with Proper Guidance(SNOOPI:超强一步扩散蒸馏与适当引导) [01:06] 🎥 Imagine360: Immersive 360 Video Generation from Perspective Anchor(Imagine360:从透视锚点生成沉浸式360度视频) [01:40] 🚗 Distilling Diffusion Models to Efficient 3D LiDAR Scene Completion(扩散模型在高效3D LiDAR场景补全中的蒸馏方法) [02:13]...
2024.12.04 每日AI论文 | 多镜头视频生成框架提升叙事连贯性,关键令牌识别增强LLM推理能力。 04.12.2024 11:06
本期的 15 篇论文如下: [00:24] 🎥 VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation(视频思维生成:多镜头视频生成的协作框架) [01:04] 🧠 Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability(关键令牌重要性:令牌级对比估计提升LLM的推理能力) [01:45] 🔄 Free Process Rewards without Process Labels(无过程标签的自由过程奖励) [02:3...
2024.12.03 每日AI论文 | X-Prompt提升图像生成,GATE OpenING评估图文生成。 03.12.2024 16:32
本期的 24 篇论文如下: [00:23] 🖼 X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models(X-Prompt:面向自回归视觉语言基础模型的通用上下文图像生成) [00:58] 📊 GATE OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation(GATE 开放:一个综合基准用于评估开放式交错图文生成) [01:32] 🖼 Switti: Designing Scale-Wis...
【月末特辑】11月最火AI论文 | OpenCoder性能媲美专有模型,SDXL Turbo增强图像模型可解释性。 03.12.2024 20:58
本期的 10 篇论文如下: [00:41] TOP1(🔥109) | 🔓 OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models(开放编码器:顶级代码大语言模型的开放食谱) [02:35] TOP2(🔥75) | 🔍 Unpacking SDXL Turbo: Interpreting Text-to-Image Models with Sparse Autoencoders(解构SDXL Turbo:使用稀疏自编码器解释文本到图像模型) [04:35] TOP3(🔥72) | 🖼 ROICtrl: Boosting Instance Control for Visual Generation...
2024.12.02 每日AI论文 | HiAR-ICL提升复杂任务表现,多模态模型领域适应增强。 02.12.2024 10:07
本期的 14 篇论文如下: [00:25] 🧠 Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS(超越示例:通过蒙特卡洛树搜索在上下文学习中的高级自动化推理范式) [01:06] 🌐 On Domain-Specific Post-Training for Multimodal Large Language Models(针对多模态大语言模型的领域特定后训练研究) [01:39] 🎥 Video Depth without Video Models(无需视频模型的视频深度估计) [02:10] 🧩 P...
【周末特辑】11月第5周最火AI论文 | 提升视觉生成实例控制,增强UI视觉代理交互能力。 30.11.2024 11:55
本期的 5 篇论文如下: [00:40] TOP1(🔥71) | 🖼 ROICtrl: Boosting Instance Control for Visual Generation(ROICtrl:提升视觉生成的实例控制) [02:30] TOP2(🔥59) | 🖥 ShowUI: One Vision-Language-Action Model for GUI Visual Agent(ShowUI:一种用于GUI视觉代理的视觉-语言-动作模型) [05:02] TOP3(🔥54) | 🚀 TÜLU 3: Pushing Frontiers in Open Language Model Post-Training(TÜLU 3:推动开放语言模型后训练的前沿)...
2024.11.29 每日AI论文 | 视觉语言模型提升,图像生成自动化 29.11.2024 4:50
本期的 6 篇论文如下: [00:26] 🧠 Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning(批评者-V:视觉语言模型批评者帮助捕捉多模态推理中的错误) [01:04] 🤖 ChatGen: Automatic Text-to-Image Generation From FreeStyle Chatting(ChatGen:从自由聊天中自动生成文本到图像) [01:43] 👕 TryOffDiff: Virtual-Try-Off via High-Fidelity Garment Reconstruction using Diffusion Models(TryOffDiff:基...
2024.11.28 每日AI论文 | 实例控制增强,4D场景生成突破 29.11.2024 14:50
本期的 21 篇论文如下: [00:24] 🖼 ROICtrl: Boosting Instance Control for Visual Generation(ROICtrl:提升视觉生成的实例控制) [01:08] 🎥 CAT4D: Create Anything in 4D with Multi-View Video Diffusion Models(CAT4D:使用多视角视频扩散模型在4D中创建任何内容) [01:55] 📚 Interleaved Scene Graph for Interleaved Text-and-Image Generation Assessment(交错场景图用于交错文本与图像生成评估) [02:38] 🌐 MARVEL...
2024.11.27 每日AI论文 | ShowUI提升GUI效率,F2F改进图像编辑。 27.11.2024 12:53
本期的 18 篇论文如下: [00:28] 🖥 ShowUI: One Vision-Language-Action Model for GUI Visual Agent(ShowUI:一种用于GUI视觉代理的视觉-语言-动作模型) [01:08] 🎥 Pathways on the Image Manifold: Image Editing via Video Generation(图像流形上的路径:通过视频生成进行图像编辑) [01:45] ⭐ Star Attention: Efficient LLM Inference over Long Sequences(星型注意力:长序列上高效的大型语言模型推理) [02:24] ⚡ Re...
2024.11.26 每日AI论文 | 3D材料生成自动化,零样本图像生成创新。 26.11.2024 14:43
本期的 21 篇论文如下: [00:26] 🌐 Material Anything: Generating Materials for Any 3D Object via Diffusion(材料生成:通过扩散生成任意3D对象的材料) [01:05] 🎨 Large-Scale Text-to-Image Model with Inpainting is a Zero-Shot Subject-Driven Image Generator(基于修复的大规模文本到图像模型:零样本主题驱动图像生成器) [01:48] 🤖 From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge...
2024.11.25 每日AI论文 | 风格友好SNR采样器提升图像生成,TÜLU 3开源模型性能超越。 25.11.2024 10:18
本期的 14 篇论文如下: [00:26] 🎨 Style-Friendly SNR Sampler for Style-Driven Generation(风格友好SNR采样器用于风格驱动生成) [01:08] 🚀 TÜLU 3: Pushing Frontiers in Open Language Model Post-Training(TÜLU 3:推动开放语言模型后训练的前沿) [01:53] 🌐 OminiControl: Minimal and Universal Control for Diffusion Transformer(OminiControl:扩散Transformer的最小且通用控制) [02:31] 🛡 A Flexible Large Lan...
【周末特辑】11月第4周最火AI论文 | LLaVA-o1提升多模态推理,Genex优化具身AI规划。 23.11.2024 11:59
本期的 5 篇论文如下: [00:41] TOP1(🔥93) | 🧠 LLaVA-o1: Let Vision Language Models Reason Step-by-Step(LLaVA-o1:让视觉语言模型逐步推理) [02:41] TOP2(🔥55) | 🌍 Generative World Explorer(生成世界探索者) [05:00] TOP3(🔥44) | 🧠 Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization(通过混合偏好优化提升多模态大语言模型的推理能力) [07:11] TOP4(🔥41...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.