Jingwen Liang, Gengyu Wang
Daily Paper Cast
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: dailypapercast.ai@gmail.comCreator:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-cast/id1777620236Cover Image by Kawen Kuang https://kawen.art
Author
Jingwen Liang, Gengyu Wang
Category
Podcast website
Latest episode
Jul 11, 2026
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense 11.10.2025 24:18
🤗 Upvotes: 26 | cs. CL, cs. LG Authors: Leitian Tao, Ilia Kulikov, Swarnadeep Saha, Tianlu Wang, Jing Xu, Yixuan Li, Jason E Weston, Ping Yu Title: Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense Arxiv: http://arxiv.org/abs/2510.07242v2 Abstract: Post-training for reasoning of large language models (LLMs) increasingly relies on verifiable rewards: deterministic checkers that...
Cache-to-Cache: Direct Semantic Communication Between Large Language Models 10.10.2025 24:59
🤗 Upvotes: 64 | cs. CL, cs. LG, 68T07, 68T50, I.2.7 Authors: Tianyu Fu, Zihan Min, Hanling Zhang, Jichao Yan, Guohao Dai, Wanli Ouyang, Yu Wang Title: Cache-to-Cache: Direct Semantic Communication Between Large Language Models Arxiv: http://arxiv.org/abs/2510.03215v1 Abstract: Multi-LLM systems harness the complementary strengths of diverse Large Language Models, achieving performance and efficie...
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer 10.10.2025 26:47
🤗 Upvotes: 60 | cs. CV Authors: Ziyuan Huang, DanDan Zheng, Cheng Zou, Rui Liu, Xiaolong Wang, Kaixiang Ji, Weilong Chai, Jianxin Sun, Libin Wang, Yongjie Lv, Taozhi Huang, Jiajia Liu, Qingpei Guo, Ming Yang, Jingdong Chen, Jun Zhou Title: Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer Arxiv: http://arxiv.org/abs/2510.06590v1 Abstract: Visual tokeniza...
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding 10.10.2025 21:15
🤗 Upvotes: 39 | cs. CV Authors: Yi Xin, Qi Qin, Siqi Luo, Kaiwen Zhu, Juncheng Yan, Yan Tai, Jiayi Lei, Yuewen Cao, Keqi Wang, Yibin Wang, Jinbin Bai, Qian Yu, Dengyang Jiang, Yuandong Pu, Haoxing Chen, Le Zhuo, Junjun He, Gen Luo, Tianbin Li, Ming Hu, Jin Ye, Shenglong Ye, Bo Zhang, Chang Xu, Wenhai Wang, Hongsheng Li, Guangtao Zhai, Tianfan Xue, Bin Fu, Xiaohong Liu, Yu Qiao, Yihao Liu Title: L...
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models 10.10.2025 24:34
🤗 Upvotes: 32 | cs. CL, eess. AS Authors: Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang Title: SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models Arxiv: http://arxiv.org/abs/2510.06917v1 Abstract: Current large language models (LLMs) and spoken language models (SLMs) begin thinking and t...
MATRIX: Mask Track Alignment for Interaction-aware Video Generation 10.10.2025 23:04
🤗 Upvotes: 30 | cs. CV Authors: Siyoon Jin, Seongchan Kim, Dahyun Chung, Jaeho Lee, Hyunwook Choi, Jisu Nam, Jiyoung Kim, Seungryong Kim Title: MATRIX: Mask Track Alignment for Interaction-aware Video Generation Arxiv: http://arxiv.org/abs/2510.07310v1 Abstract: Video DiTs have advanced video generation, yet they still struggle to model multi-instance or subject-object interactions. This raises a...
RLinf-VLA: A Unified and Efficient Framework for VLA+RL Training 10.10.2025 20:18
🤗 Upvotes: 30 | cs. RO Authors: Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao Yu, Yu Wang Title: RLinf-VLA: A Unified and Efficient Framework for VLA+RL Training Arxiv: http://arxiv.org/abs/2510.06710v1 Abstract: Recent progress in vision and language foundat...
Vibe Checker: Aligning Code Evaluation with Human Preference 10.10.2025 23:39
🤗 Upvotes: 28 | cs. CL, cs. AI, cs. LG, cs. SE Authors: Ming Zhong, Xiang Zhou, Ting-Yun Chang, Qingze Wang, Nan Xu, Xiance Si, Dan Garrette, Shyam Upadhyay, Jeremiah Liu, Jiawei Han, Benoit Schillings, Jiao Sun Title: Vibe Checker: Aligning Code Evaluation with Human Preference Arxiv: http://arxiv.org/abs/2510.07315v1 Abstract: Large Language Models (LLMs) have catalyzed vibe coding, where users...
Less is More: Recursive Reasoning with Tiny Networks 09.10.2025 21:41
🤗 Upvotes: 89 | cs. LG, cs. AI Authors: Alexia Jolicoeur-Martineau Title: Less is More: Recursive Reasoning with Tiny Networks Arxiv: http://arxiv.org/abs/2510.04871v1 Abstract: Hierarchical Reasoning Model (HRM) is a novel approach using two small neural networks recursing at different frequencies. This biologically inspired method beats Large Language models (LLMs) on hard puzzle tasks such as...
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning 09.10.2025 27:21
🤗 Upvotes: 59 | cs. AI, cs. CL, cs. LG Authors: Jiaru Zou, Soumya Roy, Vinay Kumar Verma, Ziyi Wang, David Wipf, Pan Lu, Sumit Negi, James Zou, Jingrui He Title: TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning Arxiv: http://arxiv.org/abs/2510.06217v1 Abstract: Process Reward Models (PRMs) have recently emerged as a powerful framework for enhancing the reasoning capab...
Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs 09.10.2025 23:46
🤗 Upvotes: 58 | cs. AI, cs. LG Authors: Shreyas Singh, Kunal Singh, Pradeep Moturi Title: Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs Arxiv: http://arxiv.org/abs/2509.24107v1 Abstract: Tool-integrated reasoning has emerged as a key focus for enabling agentic applications. Among these, DeepResearch Agents have gained significant attention for their stro...
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use 09.10.2025 27:45
🤗 Upvotes: 37 | cs. AI, cs. CL, cs. LG, cs. MA Authors: Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu Title: In-the-Flow Agentic System Optimization for Effective Planning and Tool Use Arxiv: http://arxiv.org/abs/2510.05592v1 Abstract: Outcome-driven reinforcement learning has advanced reasoning in large language models (LLMs), but preva...
Fast-dLLM v2: Efficient Block-Diffusion LLM 09.10.2025 23:35
🤗 Upvotes: 33 | cs. CL Authors: Chengyue Wu, Hao Zhang, Shuchen Xue, Shizhe Diao, Yonggan Fu, Zhijian Liu, Pavlo Molchanov, Ping Luo, Song Han, Enze Xie Title: Fast-dLLM v2: Efficient Block-Diffusion LLM Arxiv: http://arxiv.org/abs/2509.26328v1 Abstract: Autoregressive (AR) large language models (LLMs) have achieved remarkable performance across a wide range of natural language tasks, yet their i...
CoDA: Coding LM via Diffusion Adaptation 09.10.2025 22:12
🤗 Upvotes: 25 | cs. LG, cs. AI, I.2.7 Authors: Haolin Chen, Shiyu Wang, Can Qin, Bo Pang, Zuxin Liu, Jielin Qiu, Jianguo Zhang, Yingbo Zhou, Zeyuan Chen, Ran Xu, Shelby Heinecke, Silvio Savarese, Caiming Xiong, Huan Wang, Weiran Yao Title: CoDA: Coding LM via Diffusion Adaptation Arxiv: http://arxiv.org/abs/2510.03270v1 Abstract: Diffusion language models promise bidirectional context and infilli...
Drax: Speech Recognition with Discrete Flow Matching 09.10.2025 24:54
🤗 Upvotes: 22 | eess. AS, cs. LG, cs. SD Authors: Aviv Navon, Aviv Shamsian, Neta Glazer, Yael Segal-Feldman, Gill Hetz, Joseph Keshet, Ethan Fetaya Title: Drax: Speech Recognition with Discrete Flow Matching Arxiv: http://arxiv.org/abs/2510.04162v1 Abstract: Diffusion and flow-based non-autoregressive (NAR) models have shown strong promise in large language modeling, however, their potential for...
Paper2Video: Automatic Video Generation from Scientific Papers 08.10.2025 21:54
🤗 Upvotes: 55 | cs. CV, cs. AI, cs. CL, cs. MA, cs. MM Authors: Zeyu Zhu, Kevin Qinghong Lin, Mike Zheng Shou Title: Paper2Video: Automatic Video Generation from Scientific Papers Arxiv: http://arxiv.org/abs/2510.05096v1 Abstract: Academic presentation videos have become an essential medium for research communication, yet producing them remains highly labor-intensive, often requiring hours of sli...
MITS: Enhanced Tree Search Reasoning for LLMs via Pointwise Mutual Information 08.10.2025 25:31
🤗 Upvotes: 35 | cs. AI Authors: Jiaxi Li, Yucheng Shi, Jin Lu, Ninghao Liu Title: MITS: Enhanced Tree Search Reasoning for LLMs via Pointwise Mutual Information Arxiv: http://arxiv.org/abs/2510.03632v1 Abstract: Tree search has become as a representative framework for test-time reasoning with large language models (LLMs), exemplified by methods such as Tree-of-Thought and Monte Carlo Tree Search...
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models 08.10.2025 26:25
🤗 Upvotes: 35 | cs. CV Authors: Yunlong Tang, Jing Bi, Pinxin Liu, Zhenyu Pan, Zhangyun Tan, Qianxiang Shen, Jiani Liu, Hang Hua, Junjia Guo, Yunzhong Xiao, Chao Huang, Zhiyuan Wang, Susan Liang, Xinyi Liu, Yizhi Song, Yuhe Nie, Jia-Xing Zhong, Bozheng Li, Daiqing Qi, Ziyun Zeng, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Daiki Shimada, Han Liu, Jiebo Luo, Chenliang Xu Title: Video-LMM Post-Train...
VChain: Chain-of-Visual-Thought for Reasoning in Video Generation 08.10.2025 22:20
🤗 Upvotes: 31 | cs. CV Authors: Ziqi Huang, Ning Yu, Gordon Chen, Haonan Qiu, Paul Debevec, Ziwei Liu Title: VChain: Chain-of-Visual-Thought for Reasoning in Video Generation Arxiv: http://arxiv.org/abs/2510.05094v1 Abstract: Recent video generation models can produce smooth and visually appealing clips, but they often struggle to synthesize complex dynamics with a coherent chain of consequences....
Imperceptible Jailbreaking against Large Language Models 08.10.2025 20:49
🤗 Upvotes: 26 | cs. CL, cs. AI, cs. CR Authors: Kuofeng Gao, Yiming Li, Chao Du, Xin Wang, Xingjun Ma, Shu-Tao Xia, Tianyu Pang Title: Imperceptible Jailbreaking against Large Language Models Arxiv: http://arxiv.org/abs/2510.05025v1 Abstract: Jailbreaking attacks on the vision modality typically rely on imperceptible adversarial perturbations, whereas attacks on the textual modality are generally...
Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models 08.10.2025 26:37
🤗 Upvotes: 25 | cs. LG, cs. AI, cs. CL Authors: Qizheng Zhang, Changran Hu, Shubhangi Upasani, Boyuan Ma, Fenglu Hong, Vamsidhar Kamanuru, Jay Rainton, Chen Wu, Mengmeng Ji, Hanchen Li, Urmish Thakker, James Zou, Kunle Olukotun Title: Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models Arxiv: http://arxiv.org/abs/2510.04618v1 Abstract: Large language model (LLM) appl...
Hybrid Architectures for Language Models: Systematic Analysis and Design Insights 08.10.2025 23:07
🤗 Upvotes: 23 | cs. CL Authors: Sangmin Bae, Bilge Acun, Haroun Habeeb, Seungyeon Kim, Chien-Yu Lin, Liang Luo, Junjie Wang, Carole-Jean Wu Title: Hybrid Architectures for Language Models: Systematic Analysis and Design Insights Arxiv: http://arxiv.org/abs/2510.04800v1 Abstract: Recent progress in large language models demonstrates that hybrid architectures--combining self-attention mechanisms wi...
Optimal Scaling Needs Optimal Norm 08.10.2025 22:52
🤗 Upvotes: 22 | cs. LG, cs. AI, stat. ML Authors: Oleg Filatov, Jiangtao Wang, Jan Ebert, Stefan Kesselheim Title: Optimal Scaling Needs Optimal Norm Arxiv: http://arxiv.org/abs/2510.03871v1 Abstract: Despite recent progress in optimal hyperparameter transfer under model and dataset scaling, no unifying explanatory principle has been established. Using the Scion optimizer, we discover that joint...
Apriel-1.5-15b-Thinker 07.10.2025 25:25
🤗 Upvotes: 78 | cs. AI Authors: Shruthan Radhakrishna, Aman Tiwari, Aanjaneya Shukla, Masoud Hashemi, Rishabh Maheshwary, Shiva Krishna Reddy Malay, Jash Mehta, Pulkit Pattnaik, Saloni Mittal, Khalil Slimi, Kelechi Ogueji, Akintunde Oladipo, Soham Parikh, Oluwanifemi Bamgbose, Toby Liang, Ahmed Masry, Khyati Mahajan, Sai Rajeswar Mudumba, Vikas Yadav, Sathwik Tejaswi Madhusudhan, Torsten Scholak,...
Large Reasoning Models Learn Better Alignment from Flawed Thinking 07.10.2025 22:02
🤗 Upvotes: 34 | cs. LG Authors: ShengYun Peng, Eric Smith, Ivan Evtimov, Song Jiang, Pin-Yu Chen, Hongyuan Zhan, Haozhu Wang, Duen Horng Chau, Mahesh Pasupuleti, Jianfeng Chi Title: Large Reasoning Models Learn Better Alignment from Flawed Thinking Arxiv: http://arxiv.org/abs/2510.00938v1 Abstract: Large reasoning models (LRMs) "think" by generating structured chain-of-thought (CoT) before produc...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.