duan
HuggingFace 每日AI论文速递
每天10分钟,带您快速了解当日HuggingFace热门AI论文内容。每个工作日更新,欢迎订阅。📢播客节目在小宇宙、Apple Podcast平台搜索【HuggingFace 每日AI论文速递】🖼另外还有图文版,可在小红书搜索并关注【AI速递】
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
2024.09.26 每日AI论文 | 提升预训练数据质量,多模态模型开源创新 26.09.2024 7:35
本期的 10 篇论文如下: [00:32] 🤖 Programming Every Example: Lifting Pre-training Data Quality like Experts at Scale(编程每个示例:大规模提升预训练数据质量如专家) [01:13] 🌐 Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Multimodal Models(Molmo 和 PixMo:用于最先进多模态模型的开源权重和数据) [01:51] 🩺 Boosting Healthcare LLMs Through Retrieved Context(通过检索上下文提升医疗...
2024.09.25 每日AI论文 | HelloBench评估长文本生成,迈向通用全能语言模型的未来 25.09.2024 11:56
本期的 17 篇论文如下: [00:28] 📄 HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models(HelloBench:评估大型语言模型的长文本生成能力) [01:14] 🌐 Making Text Embedders Few-Shot Learners(利用大语言模型使多语言文本嵌入器成为少样本学习者) [01:51] 🌐 OmniBench: Towards The Future of Universal Omni-Language Models(OmniBench:迈向通用全能语言模型的未来) [02:29] 🔄 Presen...
2024.09.24 每日AI论文 | 语言指导增强机器人恢复,AI医生在医学领域展现潜力 24.09.2024 9:37
本期的 14 篇论文如下: [00:25] 🤖 RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning(RACER:基于丰富语言引导的模仿学习失败恢复策略) [01:00] 🩺 A Preliminary Study of o1 in Medicine: Are We Closer to an AI Doctor?(医学领域中o1的初步研究:我们离AI医生更近了吗?) [01:34] 🧙 PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions(PixWizard:...
2024.09.23 每日AI论文 | 无调优个性化图像生成,多模态讽刺理解评估 23.09.2024 7:38
本期的 11 篇论文如下: [00:26] 🎨 Imagine yourself: Tuning-Free Personalized Image Generation(想象自己:无调优个性化图像生成) [01:02] 😂 YesBut: A High-Quality Annotated Multimodal Dataset for evaluating Satire Comprehension capability of Vision-Language Models(YesBut:评估视觉语言模型讽刺理解能力的高质量多模态数据集) [01:40] 🌍 Prithvi WxC: Foundation Model for Weather and Climate(Prithvi Wx...
【周末特辑】9月第4周最火AI论文 | 代码模型获高关注,强化学习提升修正能力 21.09.2024 13:07
本期的 5 篇论文如下: [00:42] TOP1(🔥86) | 🚀 Qwen2.5-Coder Technical Report(Qwen2.5-Coder 技术报告) [03:55] TOP2(🔥74) | 🤖 Training Language Models to Self-Correct via Reinforcement Learning(通过强化学习训练语言模型进行自我修正) [05:47] TOP3(🔥67) | 🌐 OmniGen: Unified Image Generation(OmniGen:统一图像生成) [07:51] TOP4(🔥54) | 🌍 Qwen2-VL: Enhancing Vision-Language Model's Perception of...
2024.09.20 每日AI论文 | 强化学习提升语言模型准确率,多模态数据集增强数学推理。 20.09.2024 10:30
本期的 15 篇论文如下: [00:24] 🤖 Training Language Models to Self-Correct via Reinforcement Learning(通过强化学习训练语言模型进行自我修正) [01:03] 📚 InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning(InfiMM-WebMath-40B:推进多模态预训练以增强数学推理) [01:40] 🔍 MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines(MMSearch...
2024.09.19 每日AI论文 | Qwen2.5-Coder提升代码生成,Qwen2-VL增强视觉感知。 19.09.2024 8:18
本期的 11 篇论文如下: [00:28] 🚀 Qwen2.5-Coder Technical Report(Qwen2.5-Coder 技术报告) [01:06] 🌍 Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution(Qwen2-VL:增强视觉-语言模型在任意分辨率下的世界感知能力) [01:47] 🎯 LLMs + Persona-Plug = Personalized LLMs(LLMs + Persona-Plug = 个性化LLMs) [02:32] 🔍 To CoT or not to CoT? Chain-of-thought helps mainly on...
2024.09.18 每日AI论文 | OmniGen统一图像生成,NVLM多模态推理领先。 18.09.2024 10:39
本期的 15 篇论文如下: [00:26] 🌐 OmniGen: Unified Image Generation(OmniGen:统一图像生成) [01:02] 🌐 NVLM: Open Frontier-Class Multimodal LLMs(NVLM:开放前沿类多模态大语言模型) [01:41] 🔍 Fine-Tuning Image-Conditional Diffusion Models is Easier than You Think(微调图像条件扩散模型比你想象的更容易) [02:15] 🌐 Phidias: A Generative Model for Creating 3D Content from Text, Image, and 3D Conditi...
2024.09.17 每日AI论文 | 音乐生成系统创新,大语言模型推理加速 17.09.2024 9:35
本期的 13 篇论文如下: [00:26] 🎵 Seed-Music: A Unified Framework for High Quality and Controlled Music Generation(Seed-Music:高质量和可控音乐生成的统一框架) [01:03] ⚡ RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval(通过向量检索加速长上下文大语言模型推理) [01:46] 🌐 Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models(Ferret:大规模联邦...
2024.09.16 每日AI论文 | 多光照合成提升重光照效果,即时拖拽优化图像编辑交互性。 16.09.2024 5:06
本期的 7 篇论文如下: [00:23] 💡 A Diffusion Approach to Radiance Field Relighting using Multi-Illumination Synthesis(使用多光照合成的辐射场重光照的扩散方法) [00:56] 🖱 InstantDrag: Improving Interactivity in Drag-based Image Editing(即时拖拽:提升基于拖拽的图像编辑交互性) [01:31] 🎥 Robust Dual Gaussian Splatting for Immersive Human-centric Volumetric Videos(鲁棒双高斯散射用于沉浸式以人为中心...
【周末特辑】9月第3周最火AI论文 | 偏好学习提升LLMs,PingPong评估角色扮演 14.09.2024 11:42
本期的 5 篇论文如下: [00:41] TOP1(🔥65) | 📚 Towards a Unified View of Preference Learning for Large Language Models: A Survey(面向大型语言模型的偏好学习统一视图:综述) [02:48] TOP2(🔥50) | 🎭 PingPong: A Benchmark for Role-Playing Language Models with User Emulation and Multi-Model Evaluation(PingPong:用于用户模拟和多模型评估的角色扮演语言模型基准) [05:15] TOP3(🔥44) | 🩺 MEDIC: Towards a C...
2024.09.13 每日AI论文 | 多模态代理评估,大语言模型创新研究 13.09.2024 6:46
本期的 9 篇论文如下: [00:27] 💻 Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale(Windows Agent Arena: 大规模评估多模态操作系统代理) [01:03] 🤖 Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers(大语言模型能否生成新颖的研究想法?一项与100多名NLP研究人员合作的大规模人类研究) [01:37] 🖼 IFAdapter: Instance Feature Control for Grounded Text-to...
2024.09.12 每日AI论文 | 角色扮演模型评估,临床语言模型框架 12.09.2024 9:35
[00:25] 🎭 PingPong: A Benchmark for Role-Playing Language Models with User Emulation and Multi-Model Evaluation(PingPong:用户模拟和多模型评估的角色扮演语言模型基准) [01:05] 🩺 MEDIC: Towards a Comprehensive Framework for Evaluating LLMs in Clinical Applications(MEDIC:评估临床应用中大型语言模型的综合框架) [01:56] 🧠 Agent Workflow Memory(代理工作流程记忆) [02:38] 🔄 Gated Slot Attention fo...
2024.09.11 每日AI论文 | GroUSE提升RAG评估,INTRA优化功能定位。 11.09.2024 5:23
大家好,欢迎收听今天的'Hugging Face 每日AI论文速递'。今天是2024年9月11日,我们将带您快速浏览7篇热门AI论文,内容涵盖检索增强生成系统评估、弱监督功能定位、大型语言模型的语音交互、歌曲生成系统、视频到音频合成、扩散模型微调以及3D关节的潜在视图不变嵌入。现在,让我们立即进入今天的论文速递。 [00:31] 📊 GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering(GroUSE: 评估基于检索增强生成...
2024.09.10 每日AI论文 | 偏好学习综述,多模态模型进化提升 10.09.2024 8:49
大家好,欢迎来到'Hugging Face 每日AI论文速递'。今天是2024年9月10日,我们将带您快速浏览12篇热门AI论文,涵盖大语言模型、多模态学习、知识发现、机器翻译等多个前沿领域。现在,让我们立即进入今天的论文速递。 [00:24] 📚 Towards a Unified View of Preference Learning for Large Language Models: A Survey(面向大语言模型偏好学习的统一视角:综述) [01:04] 📊 MMEvol: Empowering Multimodal Large Language Models w...
2024.09.09 每日AI论文 | 数据优化提升模型性能,模块化构建增强模型适应性。 09.09.2024 4:23
各位听众朋友,大家好!今天是2024年9月09日。今天我们将带您快速浏览Hugging Face上的5篇热门AI论文,内容涵盖代码大语言模型的指令调优、可配置基础模型的模块化构建、开放式MAGVIT2的自回归视觉生成、奇虎-T2X的文本到任务扩散变换器,以及GST的高斯喷射变换器在3D人体重建中的应用。现在,让我们立即进入今天的论文速递! [00:34] 🔍 How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Da...
【周末特辑】9月第2周最火AI论文 | 高效图像编辑新方法,音频驱动头像创新技术 07.09.2024 10:55
各位听众朋友,大家好!欢迎收听本周的“Hugging Face 每日AI论文速递”周末特辑。每周日,我们都会为您带来一周内Hugging Face上最热门的AI论文汇总。本期节目涵盖了2024年9月2日至2024年9月8日期间的热门论文。 本期我们将为您介绍5篇精彩论文,内容涉及图像编辑的自引导机制、音频驱动的人物头像技术、胃肠道数据集的文本图像对、开放式混合专家语言模型,以及大语言模型中的注意力头调查。 现在,让我们立即进入本期论文的精彩内...
2024.09.06 每日AI论文 | 注意力头机制解析,模糊测试效率提升 06.09.2024 6:58
大家好,欢迎收听今天的'Hugging Face 每日AI论文速递'。今天是2024年9月06日,我们将带您快速浏览10篇热门AI论文,涵盖大语言模型、模糊测试、图像编辑、文档理解等多个前沿领域。现在,让我们立即进入今天的论文速递。 [00:23] 🔍 Attention Heads of Large Language Models: A Survey(大语言模型中的注意力头:一项调查) [01:10] 🧠 FuzzCoder: Byte-level Fuzzing Test via Large Language Model(FuzzCoder:基于大语言模型...
2024.09.05 每日AI论文 | 高效扩展多模态模型,音频驱动视频生成优化 05.09.2024 5:49
大家好,欢迎收听今天的'Hugging Face 每日AI论文速递'。今天是2024年9月5日,我们将带您快速浏览8篇热门AI论文。本期内容涵盖了多模态大语言模型的扩展、音频驱动的人像化身、长上下文问答中的引用生成、多学科多模态理解基准的提升,以及代码预训练中的数据解密等多个前沿领域。现在,让我们立即进入今天的论文速递。 [00:31] 📊 LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via Hybrid Architecture(Long...
2024.09.04 每日AI论文 | Kvasir-VQA提升医疗诊断,LongRecipe扩展语言模型上下文 04.09.2024 11:17
大家好,欢迎收听“Hugging Face 每日AI论文速递”。今天是2024年9月04日,我们将带您快速浏览16篇热门AI论文,涵盖数据集、语言模型、视频生成等多个领域。现在,让我们立即进入今天的论文速递。 [00:22] 📊 Kvasir-VQA: A Text-Image Pair GI Tract Dataset(Kvasir-VQA:一个带有文本图像对的胃肠道数据集) [00:58] 📚 LongRecipe: Recipe for Efficient Long Context Generalization in Large Languge Models(LongRecipe:大型...
2024.09.03 每日AI论文 | 视觉模型用于零样本时间序列预测,音频对话模型实时推理。 03.09.2024 2:14
大家好,欢迎收听“Hugging Face 每日AI论文速递”。今天是2024年9月03日,我们将带您快速了解两篇热门AI论文。首先是关于零样本时间序列预测的视觉掩码自编码器,其次是语言模型在流式传输中的多模态能力。精彩内容,马上开始! [00:24] 🔍 VisionTS: Visual Masked Autoencoders Are Free-Lunch Zero-Shot Time Series Forecasters(VisionTS:视觉掩码自编码器是零样本时间序列预测的免费午餐) [01:10] 🗣 Mini-Omni: Language Mo...
2024.09.02 每日AI论文 | 科学文献理解模型显著提升,文本到图像个性化方法优化。 02.09.2024 10:07
大家好,欢迎收听“Hugging Face 每日AI论文速递”。今天是2024年9月02日,我们将带您快速浏览14篇热门AI论文,涵盖科学文献理解、文本到图像个性化、多模态模型评估等多个前沿领域。现在,让我们立即进入精彩的论文世界。 [00:24] 📚 SciLitLLM: How to Adapt LLMs for Scientific Literature Understanding(SciLitLLM:如何适应大型语言模型以理解科学文献) [01:02] 🖼 CoRe: Context-Regularized Text Embedding Learning for Te...
【月末特辑】8月最火AI论文 | 交互式学习工具普及AI教育,边缘写作提升长上下文检索性能。 01.09.2024 21:45
大家好,欢迎收听“Hugging Face 每日AI论文速递”月末特辑。每个月的最后一天,我们都会为您带来当月Hugging Face上最热门的AI论文汇总。今天,我们将带您回顾2024年8月的精彩研究成果。 本期节目涵盖了从文本生成模型的交互式学习、长上下文检索的新推理模式,到实时游戏引擎中的扩散模型应用,以及图像与视频中的任意分割技术等多个前沿领域。此外,我们还将探讨AI在科学发现自动化、多模态大型语言模型的视觉表示等方面的最新进...
【周末特辑】8月第5周最火AI论文 | 边缘写作提升长上下文检索性能,扩散模型实现实时游戏模拟。 31.08.2024 11:37
大家好,欢迎收听《Hugging Face 每日AI论文速递》周末特辑。每周日,我们都会为您带来一周内Hugging Face上最受欢迎的AI论文摘要。本期节目涵盖的日期是从2024年8月26日至2024年9月01日。 在这一期中,我们将深入探讨五篇引人注目的论文,包括长上下文检索的推理模式、扩散模型在实时游戏引擎中的应用、视觉-语言模型的构建与理解、多模态大型语言模型中混合编码器的设计空间探索,以及多模态大型语言模型中的视觉表示定律。 现在...
2024.08.30 每日AI论文 | 视觉表示优化模型性能,CogVLM2提升图像视频理解 30.08.2024 6:38
大家好,欢迎收听“Hugging Face 每日AI论文速递”。今天是2024年8月30日,我们将带您快速浏览9篇热门AI论文,涵盖多模态大型语言模型、视觉语言模型、视频扩散模型等多个前沿领域。现在,让我们立即进入精彩的论文世界。 [00:24] 🔍 Law of Vision Representation in MLLMs(多模态大型语言模型中的视觉表示定律) [01:03] 🔍 CogVLM2: Visual Language Models for Image and Video Understanding(CogVLM2:用于图像和视频理解的视...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.