Jingwen Liang, Gengyu Wang
Daily Paper Cast
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: dailypapercast.ai@gmail.comCreator:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-cast/id1777620236Cover Image by Kawen Kuang https://kawen.art
Author
Jingwen Liang, Gengyu Wang
Category
Podcast website
Latest episode
Jul 11, 2026
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention 01.10.2025 24:35
🤗 Upvotes: 98 | cs. LG, cs. AI, cs. CV Authors: Jintao Zhang, Haoxu Wang, Kai Jiang, Shuo Yang, Kaiwen Zheng, Haocheng Xi, Ziteng Wang, Hongzhou Zhu, Min Zhao, Ion Stoica, Joseph E. Gonzalez, Jun Zhu, Jianfei Chen Title: SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention Arxiv: http://arxiv.org/abs/2509.24006v1 Abstract: In Diffusion Transformer (DiT) models,...
StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs 01.10.2025 21:00
🤗 Upvotes: 58 | cs. CL Authors: Yuhan Song, Linhao Zhang, Chuhan Wu, Aiwei Liu, Wei Jia, Houfeng Wang, Xiao Zhou Title: StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs Arxiv: http://arxiv.org/abs/2509.22220v1 Abstract: Prevalent semantic speech tokenizers, designed to capture linguistic content, are surprisingly fragile. We find they are not robust to meaning-irrele...
Multiplayer Nash Preference Optimization 01.10.2025 26:13
🤗 Upvotes: 52 | cs. AI, cs. CL Authors: Fang Wu, Xu Huang, Weihao Xuan, Zhiwei Zhang, Yijia Xiao, Guancheng Wan, Xiaomin Li, Bing Hu, Peng Xia, Jure Leskovec, Yejin Choi Title: Multiplayer Nash Preference Optimization Arxiv: http://arxiv.org/abs/2509.23102v1 Abstract: Reinforcement learning from human feedback (RLHF) has emerged as the standard paradigm for aligning large language models (LLMs) w...
RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark 01.10.2025 25:04
🤗 Upvotes: 41 | cs. AI Authors: Yang Shi, Yuhao Dong, Yue Ding, Yuran Wang, Xuanyu Zhu, Sheng Zhou, Wenting Liu, Haochen Tian, Rundong Wang, Huanqian Wang, Zuyan Liu, Bohan Zeng, Ruizhe Chen, Qixun Wang, Zhuoran Zhang, Xinlong Chen, Chengzhuo Tong, Bozhou Li, Chaoyou Fu, Qiang Liu, Haotian Wang, Wenjing Yang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang, Ziwei Liu Title: RealUnify: Do Unified Models...
Beyond the Exploration-Exploitation Trade-off: A Hidden State Approach for LLM Reasoning in RLVR 01.10.2025 24:39
🤗 Upvotes: 39 | cs. LG, cs. CL Authors: Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang Title: Beyond the Exploration-Exploitation Trade-off: A Hidden State Approach for LLM Reasoning in RLVR Arxiv: http://arxiv.org/abs/2509.23808v1 Abstract: A prevailing view in Reinforcement Learning for Verifiable Rewards (RLVR) in...
OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing 01.10.2025 19:35
🤗 Upvotes: 38 | cs. CV, cs. AI Authors: Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang Title: OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing Arxiv: http://arxiv.org/abs/2509.24900v1 Abstract: The performance of unified multimodal models for image genera...
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer 01.10.2025 26:23
🤗 Upvotes: 36 | cs. CV, cs. AI Authors: Junsong Chen, Yuyang Zhao, Jincheng Yu, Ruihang Chu, Junyu Chen, Shuai Yang, Xianbang Wang, Yicheng Pan, Daquan Zhou, Huan Ling, Haozhe Liu, Hongwei Yi, Hao Zhang, Muyang Li, Yukang Chen, Han Cai, Sanja Fidler, Ping Luo, Song Han, Enze Xie Title: SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer Arxiv: http://arxiv.org/abs/2509....
Democratizing AI scientists using ToolUniverse 01.10.2025 26:05
🤗 Upvotes: 33 | cs. AI, cs. LG Authors: Shanghua Gao, Richard Zhu, Pengwei Sui, Zhenglun Kong, Sufian Aldogom, Yepeng Huang, Ayush Noori, Reza Shamji, Krishna Parvataneni, Theodoros Tsiligkaridis, Marinka Zitnik Title: Democratizing AI scientists using ToolUniverse Arxiv: http://arxiv.org/abs/2509.23426v1 Abstract: AI scientists are emerging computational systems that serve as collaborative partn...
Visual Jigsaw Post-Training Improves MLLMs 01.10.2025 23:16
🤗 Upvotes: 33 | cs. CV Authors: Penghao Wu, Yushan Zhang, Haiwen Diao, Bo Li, Lewei Lu, Ziwei Liu Title: Visual Jigsaw Post-Training Improves MLLMs Arxiv: http://arxiv.org/abs/2509.25190v1 Abstract: Reinforcement learning based post-training has recently emerged as a powerful paradigm for enhancing the alignment and reasoning capabilities of multimodal large language models (MLLMs). While vision-...
When Does Reasoning Matter? A Controlled Study of Reasoning's Contribution to Model Performance 01.10.2025 24:47
🤗 Upvotes: 29 | cs. CL Authors: Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El-Haddad, Céline Hudelot, Pierre Colombo Title: When Does Reasoning Matter? A Controlled Study of Reasoning's Contribution to Model Performance Arxiv: http://arxiv.org/abs/2509.22193v1 Abstract: Large Language Models (LLMs) with reasoning capabilities have achieved state-of-the-art performance on a wide range of...
LongLive: Real-time Interactive Long Video Generation 30.09.2025 24:54
🤗 Upvotes: 136 | cs. CV Authors: Shuai Yang, Wei Huang, Ruihang Chu, Yicheng Xiao, Yuyang Zhao, Xianbang Wang, Muyang Li, Enze Xie, Yingcong Chen, Yao Lu, Song Han, Yukang Chen Title: LongLive: Real-time Interactive Long Video Generation Arxiv: http://arxiv.org/abs/2509.22622v1 Abstract: We present LongLive, a frame-level autoregressive (AR) framework for real-time and interactive long video gene...
Quantile Advantage Estimation for Entropy-Safe Reasoning 30.09.2025 23:16
🤗 Upvotes: 102 | cs. LG, cs. AI Authors: Junkang Wu, Kexin Huang, Jiancan Wu, An Zhang, Xiang Wang, Xiangnan He Title: Quantile Advantage Estimation for Entropy-Safe Reasoning Arxiv: http://arxiv.org/abs/2509.22611v1 Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) strengthens LLM reasoning, but training often oscillates between {entropy collapse} and {entropy explosion}. We trace...
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning 30.09.2025 27:27
🤗 Upvotes: 98 | cs. LG, cs. CL Authors: Xu Wujiang, Wentian Zhao, Zhenting Wang, Li Yu-Jhe, Jin Can, Jin Mingyu, Mei Kai, Wan Kun, Metaxas Dimitris Title: EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning Arxiv: http://arxiv.org/abs/2509.22576v1 Abstract: Training LLM agents in multi-turn environments with sparse rewards, where completing a single task requires 30...
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing 30.09.2025 25:00
🤗 Upvotes: 81 | cs. CV, cs. CL Authors: Junbo Niu, Zheng Liu, Zhuangcheng Gu, Bin Wang, Linke Ouyang, Zhiyuan Zhao, Tao Chu, Tianyao He, Fan Wu, Qintong Zhang, Zhenjiang Jin, Guang Liang, Rui Zhang, Wenzheng Zhang, Yuan Qu, Zhifei Ren, Yuefeng Sun, Yuanhong Zheng, Dongsheng Ma, Zirui Tang, Boyu Niu, Ziyang Miao, Hejun Dong, Siyi Qian, Junyuan Zhang, Jingzhou Chen, Fangdong Wang, Xiaomeng Zhao, Li...
ReviewScore: Misinformed Peer Review Detection with Large Language Models 30.09.2025 21:58
🤗 Upvotes: 54 | cs. CL Authors: Hyun Ryu, Doohyuk Jang, Hyemin S. Lee, Joonhyun Jeong, Gyeongman Kim, Donghyeon Cho, Gyouk Chu, Minyeong Hwang, Hyeongwon Jang, Changhun Kim, Haechan Kim, Jina Kim, Joowon Kim, Yoonjeon Kim, Kwanhyung Lee, Chanjae Park, Heecheol Yun, Gregor Betz, Eunho Yang Title: ReviewScore: Misinformed Peer Review Detection with Large Language Models Arxiv: http://arxiv.org/abs/...
Variational Reasoning for Language Models 30.09.2025 22:33
🤗 Upvotes: 51 | cs. CL, cs. AI, cs. LG Authors: Xiangxin Zhou, Zichen Liu, Haonan Wang, Chao Du, Min Lin, Chongxuan Li, Liang Wang, Tianyu Pang Title: Variational Reasoning for Language Models Arxiv: http://arxiv.org/abs/2509.22637v1 Abstract: We introduce a variational reasoning framework for language models that treats thinking traces as latent variables and optimizes them through variational i...
Language Models Can Learn from Verbal Feedback Without Scalar Rewards 30.09.2025 23:30
🤗 Upvotes: 48 | cs. CL, cs. AI, cs. LG Authors: Renjie Luo, Zichen Liu, Xiangyan Liu, Chao Du, Min Lin, Wenhu Chen, Wei Lu, Tianyu Pang Title: Language Models Can Learn from Verbal Feedback Without Scalar Rewards Arxiv: http://arxiv.org/abs/2509.22638v1 Abstract: LLMs are often trained with RL from human or AI feedback, yet such methods typically compress nuanced feedback into scalar rewards, dis...
MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial Reasoning 30.09.2025 25:33
🤗 Upvotes: 28 | cs. CV, cs. RO Authors: Jinkun Hao, Naifu Liang, Zhen Luo, Xudong Xu, Weipeng Zhong, Ran Yi, Yichen Jin, Zhaoyang Lyu, Feng Zheng, Lizhuang Ma, Jiangmiao Pang Title: MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial Reasoning Arxiv: http://arxiv.org/abs/2509.22281v1 Abstract: The ability of robots to interpret human instructions and execute manipulation tasks...
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning 30.09.2025 23:54
🤗 Upvotes: 28 | cs. CV, cs. AI, cs. CL Authors: Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin Title: CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning Arxiv: http://arxiv.org/abs/2509.22647v1 Abstract: Image captioning is a fundamental task that bridges the visual and linguistic domains, playing a critical...
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping 30.09.2025 27:53
🤗 Upvotes: 27 | cs. CL, cs. AI, cs. LG Authors: Thanh-Long V. Le, Myeongho Jeon, Kim Vu, Viet Lai, Eunho Yang Title: No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping Arxiv: http://arxiv.org/abs/2509.21880v1 Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) is a powerful framework for improving the reasoning ab...
VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models 27.09.2025 22:17
🤗 Upvotes: 95 | cs. LG, cs. CL Authors: Guochao Jiang, Wenfeng Feng, Guofeng Quan, Chuzhan Hao, Yuewei Zhang, Guohua Liu, Hao Wang Title: VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models Arxiv: http://arxiv.org/abs/2509.19803v1 Abstract: Policy-based reinforcement learning currently plays an important role in improving LLMs on mathematical reasoning tasks. However,...
SciReasoner: Laying the Scientific Reasoning Ground Across Disciplines 27.09.2025 23:35
🤗 Upvotes: 76 | cs. CL Authors: Yizhou Wang, Chen Tang, Han Deng, Jiabei Xiao, Jiaqi Liu, Jianyu Wu, Jun Yao, Pengze Li, Encheng Su, Lintao Wang, Guohang Zhuang, Yuchen Ren, Ben Fei, Ming Hu, Xin Chen, Dongzhan Zhou, Junjun He, Xiangyu Yue, Zhenfei Yin, Jiamin Wu, Qihao Zheng, Yuhao Zhou, Huihui Xu, Chenglong Ma, Yan Lu, Wenlong Zhang, Chunfeng Song, Philip Torr, Shixiang Tang, Xinzhu Ma, Wanli O...
MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources 27.09.2025 28:47
🤗 Upvotes: 67 | cs. CV Authors: Sicong Leng, Jing Wang, Jiaxi Li, Hao Zhang, Zhiqiang Hu, Boqiang Zhang, Yuming Jiang, Hang Zhang, Xin Li, Lidong Bing, Deli Zhao, Wei Lu, Yu Rong, Aixin Sun, Shijian Lu Title: MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources Arxiv: http://arxiv.org/abs/2509.21268v1 Abstract: Large multimodal reasoning models have achieved rapid...
Tree Search for LLM Agent Reinforcement Learning 27.09.2025 24:50
🤗 Upvotes: 58 | cs. LG, cs. AI Authors: Yuxiang Ji, Ziyu Ma, Yong Wang, Guanhua Chen, Xiangxiang Chu, Liaoni Wu Title: Tree Search for LLM Agent Reinforcement Learning Arxiv: http://arxiv.org/abs/2509.21240v1 Abstract: Recent advances in reinforcement learning (RL) have significantly enhanced the agentic capabilities of large language models (LLMs). In long-term and multi-turn agent tasks, existi...
Seedream 4.0: Toward Next-generation Multimodal Image Generation 27.09.2025 21:30
🤗 Upvotes: 46 | cs. CV Authors: Team Seedream, Yunpeng Chen, Yu Gao, Lixue Gong, Meng Guo, Qiushan Guo, Zhiyao Guo, Xiaoxia Hou, Weilin Huang, Yixuan Huang, Xiaowen Jian, Huafeng Kuang, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yanzuo Lu, Zhengxiong Luo, Tongtong Ou, Guang Shi, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xun Wang, Ye Wang,...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.