duan

HuggingFace 每日AI论文速递

每天10分钟,带您快速了解当日HuggingFace热门AI论文内容。每个工作日更新,欢迎订阅。📢播客节目在小宇宙、Apple Podcast平台搜索【HuggingFace 每日AI论文速递】🖼另外还有图文版,可在小红书搜索并关注【AI速递】

Author

duan

Category

Technology

Podcast website

www.xiaoyuzhoufm.com

Latest episode

Jul 10, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

2024.09.26 每日AI论文 | 提升预训练数据质量,多模态模型开源创新 26.09.2024

本期的 10 篇论文如下: [00:32] 🤖 Programming Every Example: Lifting Pre-training Data Quality like Experts at Scale(编程每个示例:大规模提升预训练数据质量如专家) [01:13] 🌐 Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Multimodal Models(Molmo 和 PixMo:用于最先进多模态模型的开源权重和数据) [01:51] 🩺 Boosting Healthcare LLMs Through Retrieved Context(通过检索上下文提升医疗...

2024.09.25 每日AI论文 | HelloBench评估长文本生成,迈向通用全能语言模型的未来 25.09.2024

本期的 17 篇论文如下: [00:28] 📄 HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models(HelloBench:评估大型语言模型的长文本生成能力) [01:14] 🌐 Making Text Embedders Few-Shot Learners(利用大语言模型使多语言文本嵌入器成为少样本学习者) [01:51] 🌐 OmniBench: Towards The Future of Universal Omni-Language Models(OmniBench:迈向通用全能语言模型的未来) [02:29] 🔄 Presen...

2024.09.24 每日AI论文 | 语言指导增强机器人恢复,AI医生在医学领域展现潜力 24.09.2024

本期的 14 篇论文如下: [00:25] 🤖 RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning(RACER:基于丰富语言引导的模仿学习失败恢复策略) [01:00] 🩺 A Preliminary Study of o1 in Medicine: Are We Closer to an AI Doctor?(医学领域中o1的初步研究:我们离AI医生更近了吗?) [01:34] 🧙 PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions(PixWizard:...

2024.09.23 每日AI论文 | 无调优个性化图像生成,多模态讽刺理解评估 23.09.2024

本期的 11 篇论文如下: [00:26] 🎨 Imagine yourself: Tuning-Free Personalized Image Generation(想象自己:无调优个性化图像生成) [01:02] 😂 YesBut: A High-Quality Annotated Multimodal Dataset for evaluating Satire Comprehension capability of Vision-Language Models(YesBut:评估视觉语言模型讽刺理解能力的高质量多模态数据集) [01:40] 🌍 Prithvi WxC: Foundation Model for Weather and Climate(Prithvi Wx...

【周末特辑】9月第4周最火AI论文 | 代码模型获高关注,强化学习提升修正能力 21.09.2024

本期的 5 篇论文如下: [00:42] TOP1(🔥86) | 🚀 Qwen2.5-Coder Technical Report(Qwen2.5-Coder 技术报告) [03:55] TOP2(🔥74) | 🤖 Training Language Models to Self-Correct via Reinforcement Learning(通过强化学习训练语言模型进行自我修正) [05:47] TOP3(🔥67) | 🌐 OmniGen: Unified Image Generation(OmniGen:统一图像生成) [07:51] TOP4(🔥54) | 🌍 Qwen2-VL: Enhancing Vision-Language Model's Perception of...

2024.09.20 每日AI论文 | 强化学习提升语言模型准确率,多模态数据集增强数学推理。 20.09.2024

本期的 15 篇论文如下: [00:24] 🤖 Training Language Models to Self-Correct via Reinforcement Learning(通过强化学习训练语言模型进行自我修正) [01:03] 📚 InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning(InfiMM-WebMath-40B:推进多模态预训练以增强数学推理) [01:40] 🔍 MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines(MMSearch...

2024.09.19 每日AI论文 | Qwen2.5-Coder提升代码生成,Qwen2-VL增强视觉感知。 19.09.2024

本期的 11 篇论文如下: [00:28] 🚀 Qwen2.5-Coder Technical Report(Qwen2.5-Coder 技术报告) [01:06] 🌍 Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution(Qwen2-VL:增强视觉-语言模型在任意分辨率下的世界感知能力) [01:47] 🎯 LLMs + Persona-Plug = Personalized LLMs(LLMs + Persona-Plug = 个性化LLMs) [02:32] 🔍 To CoT or not to CoT? Chain-of-thought helps mainly on...

2024.09.18 每日AI论文 | OmniGen统一图像生成,NVLM多模态推理领先。 18.09.2024

本期的 15 篇论文如下: [00:26] 🌐 OmniGen: Unified Image Generation(OmniGen:统一图像生成) [01:02] 🌐 NVLM: Open Frontier-Class Multimodal LLMs(NVLM:开放前沿类多模态大语言模型) [01:41] 🔍 Fine-Tuning Image-Conditional Diffusion Models is Easier than You Think(微调图像条件扩散模型比你想象的更容易) [02:15] 🌐 Phidias: A Generative Model for Creating 3D Content from Text, Image, and 3D Conditi...

2024.09.17 每日AI论文 | 音乐生成系统创新,大语言模型推理加速 17.09.2024

本期的 13 篇论文如下: [00:26] 🎵 Seed-Music: A Unified Framework for High Quality and Controlled Music Generation(Seed-Music:高质量和可控音乐生成的统一框架) [01:03] ⚡ RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval(通过向量检索加速长上下文大语言模型推理) [01:46] 🌐 Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models(Ferret:大规模联邦...

2024.09.16 每日AI论文 | 多光照合成提升重光照效果,即时拖拽优化图像编辑交互性。 16.09.2024

本期的 7 篇论文如下: [00:23] 💡 A Diffusion Approach to Radiance Field Relighting using Multi-Illumination Synthesis(使用多光照合成的辐射场重光照的扩散方法) [00:56] 🖱 InstantDrag: Improving Interactivity in Drag-based Image Editing(即时拖拽:提升基于拖拽的图像编辑交互性) [01:31] 🎥 Robust Dual Gaussian Splatting for Immersive Human-centric Volumetric Videos(鲁棒双高斯散射用于沉浸式以人为中心...

【周末特辑】9月第3周最火AI论文 | 偏好学习提升LLMs,PingPong评估角色扮演 14.09.2024

本期的 5 篇论文如下: [00:41] TOP1(🔥65) | 📚 Towards a Unified View of Preference Learning for Large Language Models: A Survey(面向大型语言模型的偏好学习统一视图:综述) [02:48] TOP2(🔥50) | 🎭 PingPong: A Benchmark for Role-Playing Language Models with User Emulation and Multi-Model Evaluation(PingPong:用于用户模拟和多模型评估的角色扮演语言模型基准) [05:15] TOP3(🔥44) | 🩺 MEDIC: Towards a C...

2024.09.13 每日AI论文 | 多模态代理评估,大语言模型创新研究 13.09.2024

本期的 9 篇论文如下: [00:27] 💻 Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale(Windows Agent Arena: 大规模评估多模态操作系统代理) [01:03] 🤖 Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers(大语言模型能否生成新颖的研究想法?一项与100多名NLP研究人员合作的大规模人类研究) [01:37] 🖼 IFAdapter: Instance Feature Control for Grounded Text-to...

2024.09.12 每日AI论文 | 角色扮演模型评估,临床语言模型框架 12.09.2024

[00:25] 🎭 PingPong: A Benchmark for Role-Playing Language Models with User Emulation and Multi-Model Evaluation(PingPong:用户模拟和多模型评估的角色扮演语言模型基准) [01:05] 🩺 MEDIC: Towards a Comprehensive Framework for Evaluating LLMs in Clinical Applications(MEDIC:评估临床应用中大型语言模型的综合框架) [01:56] 🧠 Agent Workflow Memory(代理工作流程记忆) [02:38] 🔄 Gated Slot Attention fo...

2024.09.11 每日AI论文 | GroUSE提升RAG评估,INTRA优化功能定位。 11.09.2024

大家好,欢迎收听今天的'Hugging Face 每日AI论文速递'。今天是2024年9月11日,我们将带您快速浏览7篇热门AI论文,内容涵盖检索增强生成系统评估、弱监督功能定位、大型语言模型的语音交互、歌曲生成系统、视频到音频合成、扩散模型微调以及3D关节的潜在视图不变嵌入。现在,让我们立即进入今天的论文速递。 [00:31] 📊 GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering(GroUSE: 评估基于检索增强生成...

2024.09.10 每日AI论文 | 偏好学习综述,多模态模型进化提升 10.09.2024

大家好,欢迎来到'Hugging Face 每日AI论文速递'。今天是2024年9月10日,我们将带您快速浏览12篇热门AI论文,涵盖大语言模型、多模态学习、知识发现、机器翻译等多个前沿领域。现在,让我们立即进入今天的论文速递。 [00:24] 📚 Towards a Unified View of Preference Learning for Large Language Models: A Survey(面向大语言模型偏好学习的统一视角:综述) [01:04] 📊 MMEvol: Empowering Multimodal Large Language Models w...

2024.09.09 每日AI论文 | 数据优化提升模型性能,模块化构建增强模型适应性。 09.09.2024

各位听众朋友,大家好!今天是2024年9月09日。今天我们将带您快速浏览Hugging Face上的5篇热门AI论文,内容涵盖代码大语言模型的指令调优、可配置基础模型的模块化构建、开放式MAGVIT2的自回归视觉生成、奇虎-T2X的文本到任务扩散变换器,以及GST的高斯喷射变换器在3D人体重建中的应用。现在,让我们立即进入今天的论文速递! [00:34] 🔍 How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Da...

【周末特辑】9月第2周最火AI论文 | 高效图像编辑新方法,音频驱动头像创新技术 07.09.2024

各位听众朋友,大家好!欢迎收听本周的“Hugging Face 每日AI论文速递”周末特辑。每周日,我们都会为您带来一周内Hugging Face上最热门的AI论文汇总。本期节目涵盖了2024年9月2日至2024年9月8日期间的热门论文。 本期我们将为您介绍5篇精彩论文,内容涉及图像编辑的自引导机制、音频驱动的人物头像技术、胃肠道数据集的文本图像对、开放式混合专家语言模型,以及大语言模型中的注意力头调查。 现在,让我们立即进入本期论文的精彩内...

2024.09.06 每日AI论文 | 注意力头机制解析,模糊测试效率提升 06.09.2024

大家好,欢迎收听今天的'Hugging Face 每日AI论文速递'。今天是2024年9月06日,我们将带您快速浏览10篇热门AI论文,涵盖大语言模型、模糊测试、图像编辑、文档理解等多个前沿领域。现在,让我们立即进入今天的论文速递。 [00:23] 🔍 Attention Heads of Large Language Models: A Survey(大语言模型中的注意力头:一项调查) [01:10] 🧠 FuzzCoder: Byte-level Fuzzing Test via Large Language Model(FuzzCoder:基于大语言模型...

2024.09.05 每日AI论文 | 高效扩展多模态模型,音频驱动视频生成优化 05.09.2024

大家好,欢迎收听今天的'Hugging Face 每日AI论文速递'。今天是2024年9月5日,我们将带您快速浏览8篇热门AI论文。本期内容涵盖了多模态大语言模型的扩展、音频驱动的人像化身、长上下文问答中的引用生成、多学科多模态理解基准的提升,以及代码预训练中的数据解密等多个前沿领域。现在,让我们立即进入今天的论文速递。 [00:31] 📊 LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via Hybrid Architecture(Long...

2024.09.04 每日AI论文 | Kvasir-VQA提升医疗诊断,LongRecipe扩展语言模型上下文 04.09.2024

大家好,欢迎收听“Hugging Face 每日AI论文速递”。今天是2024年9月04日,我们将带您快速浏览16篇热门AI论文,涵盖数据集、语言模型、视频生成等多个领域。现在,让我们立即进入今天的论文速递。 [00:22] 📊 Kvasir-VQA: A Text-Image Pair GI Tract Dataset(Kvasir-VQA:一个带有文本图像对的胃肠道数据集) [00:58] 📚 LongRecipe: Recipe for Efficient Long Context Generalization in Large Languge Models(LongRecipe:大型...

2024.09.03 每日AI论文 | 视觉模型用于零样本时间序列预测,音频对话模型实时推理。 03.09.2024

大家好,欢迎收听“Hugging Face 每日AI论文速递”。今天是2024年9月03日,我们将带您快速了解两篇热门AI论文。首先是关于零样本时间序列预测的视觉掩码自编码器,其次是语言模型在流式传输中的多模态能力。精彩内容,马上开始! [00:24] 🔍 VisionTS: Visual Masked Autoencoders Are Free-Lunch Zero-Shot Time Series Forecasters(VisionTS:视觉掩码自编码器是零样本时间序列预测的免费午餐) [01:10] 🗣 Mini-Omni: Language Mo...

2024.09.02 每日AI论文 | 科学文献理解模型显著提升,文本到图像个性化方法优化。 02.09.2024

大家好,欢迎收听“Hugging Face 每日AI论文速递”。今天是2024年9月02日,我们将带您快速浏览14篇热门AI论文,涵盖科学文献理解、文本到图像个性化、多模态模型评估等多个前沿领域。现在,让我们立即进入精彩的论文世界。 [00:24] 📚 SciLitLLM: How to Adapt LLMs for Scientific Literature Understanding(SciLitLLM:如何适应大型语言模型以理解科学文献) [01:02] 🖼 CoRe: Context-Regularized Text Embedding Learning for Te...

【月末特辑】8月最火AI论文 | 交互式学习工具普及AI教育,边缘写作提升长上下文检索性能。 01.09.2024

大家好,欢迎收听“Hugging Face 每日AI论文速递”月末特辑。每个月的最后一天,我们都会为您带来当月Hugging Face上最热门的AI论文汇总。今天,我们将带您回顾2024年8月的精彩研究成果。 本期节目涵盖了从文本生成模型的交互式学习、长上下文检索的新推理模式,到实时游戏引擎中的扩散模型应用,以及图像与视频中的任意分割技术等多个前沿领域。此外,我们还将探讨AI在科学发现自动化、多模态大型语言模型的视觉表示等方面的最新进...

【周末特辑】8月第5周最火AI论文 | 边缘写作提升长上下文检索性能,扩散模型实现实时游戏模拟。 31.08.2024

大家好,欢迎收听《Hugging Face 每日AI论文速递》周末特辑。每周日,我们都会为您带来一周内Hugging Face上最受欢迎的AI论文摘要。本期节目涵盖的日期是从2024年8月26日至2024年9月01日。 在这一期中,我们将深入探讨五篇引人注目的论文,包括长上下文检索的推理模式、扩散模型在实时游戏引擎中的应用、视觉-语言模型的构建与理解、多模态大型语言模型中混合编码器的设计空间探索,以及多模态大型语言模型中的视觉表示定律。 现在...

2024.08.30 每日AI论文 | 视觉表示优化模型性能,CogVLM2提升图像视频理解 30.08.2024

大家好,欢迎收听“Hugging Face 每日AI论文速递”。今天是2024年8月30日,我们将带您快速浏览9篇热门AI论文,涵盖多模态大型语言模型、视觉语言模型、视频扩散模型等多个前沿领域。现在,让我们立即进入精彩的论文世界。 [00:24] 🔍 Law of Vision Representation in MLLMs(多模态大型语言模型中的视觉表示定律) [01:03] 🔍 CogVLM2: Visual Language Models for Image and Video Understanding(CogVLM2:用于图像和视频理解的视...

Listen to the HuggingFace 每日AI论文速递 podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.