Jingwen Liang, Gengyu Wang
Daily Paper Cast
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: dailypapercast.ai@gmail.comCreator:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-cast/id1777620236Cover Image by Kawen Kuang https://kawen.art
Author
Jingwen Liang, Gengyu Wang
Category
Podcast website
Latest episode
Jul 11, 2026
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
WebThinker: Empowering Large Reasoning Models with Deep Research Capability 02.05.2025 21:12
🤗 Upvotes: 27 | cs. CL, cs. AI, cs. IR Authors: Xiaoxi Li, Jiajie Jin, Guanting Dong, Hongjin Qian, Yutao Zhu, Yongkang Wu, Ji-Rong Wen, Zhicheng Dou Title: WebThinker: Empowering Large Reasoning Models with Deep Research Capability Arxiv: http://arxiv.org/abs/2504.21776v1 Abstract: Large reasoning models (LRMs), such as OpenAI-o1 and DeepSeek-R1, demonstrate impressive long-horizon reasoning cap...
Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math 02.05.2025 20:00
🤗 Upvotes: 24 | cs. CL Authors: Haoran Xu, Baolin Peng, Hany Awadalla, Dongdong Chen, Yen-Chun Chen, Mei Gao, Young Jin Kim, Yunsheng Li, Liliang Ren, Yelong Shen, Shuohang Wang, Weijian Xu, Jianfeng Gao, Weizhu Chen Title: Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math Arxiv: http://arxiv.org/abs/2504.21233v1 Abstract: Chain-of-Thought (CoT) significantly e...
COMPACT: COMPositional Atomic-to-Complex Visual Capability Tuning 02.05.2025 18:37
🤗 Upvotes: 22 | cs. CV Authors: Xindi Wu, Hee Seung Hwang, Polina Kirichenko, Olga Russakovsky Title: COMPACT: COMPositional Atomic-to-Complex Visual Capability Tuning Arxiv: http://arxiv.org/abs/2504.21850v1 Abstract: Multimodal Large Language Models (MLLMs) excel at simple vision-language tasks but struggle when faced with complex tasks that require multiple capabilities, such as simultaneously...
Reinforcement Learning for Reasoning in Large Language Models with One Training Example 01.05.2025 22:26
🤗 Upvotes: 49 | cs. LG, cs. AI, cs. CL Authors: Yiping Wang, Qing Yang, Zhiyuan Zeng, Liliang Ren, Lucas Liu, Baolin Peng, Hao Cheng, Xuehai He, Kuan Wang, Jianfeng Gao, Weizhu Chen, Shuohang Wang, Simon Shaolei Du, Yelong Shen Title: Reinforcement Learning for Reasoning in Large Language Models with One Training Example Arxiv: http://arxiv.org/abs/2504.20571v1 Abstract: We show that reinforcemen...
UniversalRAG: Retrieval-Augmented Generation over Multiple Corpora with Diverse Modalities and Granularities 01.05.2025 21:56
🤗 Upvotes: 44 | cs. CL, cs. AI, cs. CV, cs. IR, cs. LG Authors: Woongyeong Yeo, Kangsan Kim, Soyeong Jeong, Jinheon Baek, Sung Ju Hwang Title: UniversalRAG: Retrieval-Augmented Generation over Multiple Corpora with Diverse Modalities and Granularities Arxiv: http://arxiv.org/abs/2504.20734v1 Abstract: Retrieval-Augmented Generation (RAG) has shown substantial promise in improving factual accuracy...
ReasonIR: Training Retrievers for Reasoning Tasks 01.05.2025 21:22
🤗 Upvotes: 36 | cs. AI, cs. CL, cs. IR, cs. LG Authors: Rulin Shao, Rui Qiao, Varsha Kishore, Niklas Muennighoff, Xi Victoria Lin, Daniela Rus, Bryan Kian Hsiang Low, Sewon Min, Wen-tau Yih, Pang Wei Koh, Luke Zettlemoyer Title: ReasonIR: Training Retrievers for Reasoning Tasks Arxiv: http://arxiv.org/abs/2504.20595v1 Abstract: We present ReasonIR-8B, the first retriever specifically trained for...
The Leaderboard Illusion 01.05.2025 20:54
🤗 Upvotes: 36 | cs. AI, cs. CL, cs. LG, stat. ME Authors: Shivalika Singh, Yiyang Nan, Alex Wang, Daniel D'Souza, Sayash Kapoor, Ahmet Üstün, Sanmi Koyejo, Yuntian Deng, Shayne Longpre, Noah Smith, Beyza Ermis, Marzieh Fadaee, Sara Hooker Title: The Leaderboard Illusion Arxiv: http://arxiv.org/abs/2504.20879v1 Abstract: Measuring progress is fundamental to the advancement of any scientific field....
Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models 01.05.2025 21:07
🤗 Upvotes: 28 | cs. CL Authors: Zae Myung Kim, Chanwoo Park, Vipul Raheja, Dongyeop Kang Title: Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models Arxiv: http://arxiv.org/abs/2504.20157v1 Abstract: Reward-based alignment methods for large language models (LLMs) face two key limitations: vulnerability to reward hacking, where models exploit flaws in the reward signal;...
RepText: Rendering Visual Text via Replicating 30.04.2025 21:57
🤗 Upvotes: 22 | cs. CV Authors: Haofan Wang, Yujia Xu, Yimeng Li, Junchen Li, Chaowei Zhang, Jing Wang, Kejia Yang, Zhibo Chen Title: RepText: Rendering Visual Text via Replicating Arxiv: http://arxiv.org/abs/2504.19724v1 Abstract: Although contemporary text-to-image generation models have achieved remarkable breakthroughs in producing visually appealing images, their capacity to generate precise...
Towards Understanding Camera Motions in Any Video 29.04.2025 21:33
🤗 Upvotes: 127 | cs. CV, cs. AI, cs. CL, cs. LG, cs. MM Authors: Zhiqiu Lin, Siyuan Cen, Daniel Jiang, Jay Karhade, Hewei Wang, Chancharik Mitra, Tiffany Ling, Yuhan Huang, Sifan Liu, Mingyu Chen, Rushikesh Zawar, Xue Bai, Yilun Du, Chuang Gan, Deva Ramanan Title: Towards Understanding Camera Motions in Any Video Arxiv: http://arxiv.org/abs/2504.15376v1 Abstract: We introduce CameraBench, a large...
Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning 29.04.2025 21:29
🤗 Upvotes: 43 | cs. CV Authors: Chris, Yichen Wei, Yi Peng, Xiaokun Wang, Weijie Qiu, Wei Shen, Tianyidan Xie, Jiangbo Pei, Jianhao Zhang, Yunzhuo Hao, Xuchen Song, Yang Liu, Yahui Zhou Title: Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning Arxiv: http://arxiv.org/abs/2504.16656v2 Abstract: We present Skywork R1V2, a next-generation multimodal reasoning model and a major leap...
BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs 29.04.2025 20:32
🤗 Upvotes: 25 | cs. CL, cs. LG Authors: Hongyu Wang, Shuming Ma, Furu Wei Title: BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs Arxiv: http://arxiv.org/abs/2504.18415v1 Abstract: Efficient deployment of 1-bit Large Language Models (LLMs) is hindered by activation outliers, which complicate quantization to low bit-widths. We introduce BitNet v2, a novel framework e...
Step1X-Edit: A Practical Framework for General Image Editing 26.04.2025 20:44
🤗 Upvotes: 55 | cs. CV Authors: Shiyu Liu, Yucheng Han, Peng Xing, Fukun Yin, Rui Wang, Wei Cheng, Jiaqi Liao, Yingming Wang, Honghao Fu, Chunrui Han, Guopeng Li, Yuang Peng, Quan Sun, Jingwei Wu, Yan Cai, Zheng Ge, Ranchen Ming, Lei Xia, Xianfang Zeng, Yibo Zhu, Binxing Jiao, Xiangyu Zhang, Gang Yu, Daxin Jiang Title: Step1X-Edit: A Practical Framework for General Image Editing Arxiv: http://arx...
Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning 26.04.2025 22:01
🤗 Upvotes: 50 | cs. CL Authors: Minju Seo, Jinheon Baek, Seongyun Lee, Sung Ju Hwang Title: Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning Arxiv: http://arxiv.org/abs/2504.17192v1 Abstract: Despite the rapid growth of machine learning research, corresponding code implementations are often unavailable, making it slow and labor-intensive for researchers to reprodu...
RefVNLI: Towards Scalable Evaluation of Subject-driven Text-to-image Generation 26.04.2025 20:16
🤗 Upvotes: 47 | cs. CV Authors: Aviv Slobodkin, Hagai Taitelbaum, Yonatan Bitton, Brian Gordon, Michal Sokolik, Nitzan Bitton Guetta, Almog Gueta, Royi Rassin, Itay Laish, Dani Lischinski, Idan Szpektor Title: RefVNLI: Towards Scalable Evaluation of Subject-driven Text-to-image Generation Arxiv: http://arxiv.org/abs/2504.17502v1 Abstract: Subject-driven text-to-image (T2I) generation aims to prod...
Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs 26.04.2025 25:08
🤗 Upvotes: 28 | cs. CV Authors: Tiancheng Gu, Kaicheng Yang, Ziyong Feng, Xingjun Wang, Yanzhao Zhang, Dingkun Long, Yingda Chen, Weidong Cai, Jiankang Deng Title: Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs Arxiv: http://arxiv.org/abs/2504.17432v1 Abstract: The Contrastive Language-Image Pre-training (CLIP) framework has become a widely used approach for mult...
DreamID: High-Fidelity and Fast diffusion-based Face Swapping via Triplet ID Group Learning 25.04.2025 20:43
🤗 Upvotes: 39 | cs. CV, cs. AI Authors: Fulong Ye, Miao Hua, Pengze Zhang, Xinghui Li, Qichao Sun, Songtao Zhao, Qian He, Xinglong Wu Title: DreamID: High-Fidelity and Fast diffusion-based Face Swapping via Triplet ID Group Learning Arxiv: http://arxiv.org/abs/2504.14509v2 Abstract: In this paper, we introduce DreamID, a diffusion-based face swapping model that achieves high levels of ID similari...
Trillion 7B Technical Report 25.04.2025 25:48
🤗 Upvotes: 27 | cs. CL, cs. AI, cs. LG Authors: Sungjun Han, Juyoung Suk, Suyeong An, Hyungguk Kim, Kyuseok Kim, Wonsuk Yang, Seungtaek Choi, Jamin Shin Title: Trillion 7B Technical Report Arxiv: http://arxiv.org/abs/2504.15431v1 Abstract: We introduce Trillion-7B, the most token-efficient Korean-centric multilingual LLM available. Our novel Cross-lingual Document Attention (XLDA) mechanism enabl...
Tina: Tiny Reasoning Models via LoRA 25.04.2025 23:09
🤗 Upvotes: 27 | cs. CL, cs. LG Authors: Shangshang Wang, Julian Asilis, Ömer Faruk Akgül, Enes Burak Bilgin, Ollie Liu, Willie Neiswanger Title: Tina: Tiny Reasoning Models via LoRA Arxiv: http://arxiv.org/abs/2504.15777v1 Abstract: How cost-effectively can strong reasoning abilities be achieved in language models? Driven by this fundamental question, we present Tina, a family of tiny reasoning m...
I-Con: A Unifying Framework for Representation Learning 25.04.2025 21:00
🤗 Upvotes: 24 | cs. LG, cs. AI, cs. CV, cs. IT, math. IT Authors: Shaden Alshammari, John Hershey, Axel Feldmann, William T. Freeman, Mark Hamilton Title: I-Con: A Unifying Framework for Representation Learning Arxiv: http://arxiv.org/abs/2504.16929v1 Abstract: As the field of representation learning grows, there has been a proliferation of different loss functions to solve different classes of p...
Kuwain 1.5B: An Arabic SLM via Language Injection 24.04.2025 20:02
🤗 Upvotes: 94 | cs. CL, cs. AI Authors: Khalil Hennara, Sara Chrouf, Mohamed Motaism Hamed, Zeina Aldallal, Omar Hadid, Safwan AlModhayan Title: Kuwain 1.5B: An Arabic SLM via Language Injection Arxiv: http://arxiv.org/abs/2504.15120v1 Abstract: Enhancing existing models with new knowledge is a crucial aspect of AI development. This paper introduces a novel method for integrating a new language i...
TTRL: Test-Time Reinforcement Learning 24.04.2025 25:07
🤗 Upvotes: 60 | cs. CL, cs. LG Authors: Yuxin Zuo, Kaiyan Zhang, Shang Qu, Li Sheng, Xuekai Zhu, Biqing Qi, Youbang Sun, Ganqu Cui, Ning Ding, Bowen Zhou Title: TTRL: Test-Time Reinforcement Learning Arxiv: http://arxiv.org/abs/2504.16084v1 Abstract: This paper investigates Reinforcement Learning (RL) on data without explicit labels for reasoning tasks in Large Language Models (LLMs). The core ch...
The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks 24.04.2025 22:15
🤗 Upvotes: 51 | cs. CL Authors: Minghao Wu, Weixuan Wang, Sinuo Liu, Huifeng Yin, Xintong Wang, Yu Zhao, Chenyang Lyu, Longyue Wang, Weihua Luo, Kaifu Zhang Title: The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks Arxiv: http://arxiv.org/abs/2504.15521v1 Abstract: As large language models (LLMs) continue to advance in linguistic capabilities, robust multilingual evaluation has become...
Describe Anything: Detailed Localized Image and Video Captioning 24.04.2025 24:12
🤗 Upvotes: 42 | cs. CV, cs. AI Authors: Long Lian, Yifan Ding, Yunhao Ge, Sifei Liu, Hanzi Mao, Boyi Li, Marco Pavone, Ming-Yu Liu, Trevor Darrell, Adam Yala, Yin Cui Title: Describe Anything: Detailed Localized Image and Video Captioning Arxiv: http://arxiv.org/abs/2504.16072v1 Abstract: Generating detailed and accurate descriptions for specific regions in images and videos remains a fundamental...
Learning Adaptive Parallel Reasoning with Language Models 24.04.2025 21:02
🤗 Upvotes: 35 | cs. AI, cs. CL Authors: Jiayi Pan, Xiuyu Li, Long Lian, Charlie Snell, Yifei Zhou, Adam Yala, Trevor Darrell, Kurt Keutzer, Alane Suhr Title: Learning Adaptive Parallel Reasoning with Language Models Arxiv: http://arxiv.org/abs/2504.15466v1 Abstract: Scaling inference-time computation has substantially improved the reasoning capabilities of language models. However, existing metho...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.