Jingwen Liang, Gengyu Wang
Daily Paper Cast
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: dailypapercast.ai@gmail.comCreator:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-cast/id1777620236Cover Image by Kawen Kuang https://kawen.art
Author
Jingwen Liang, Gengyu Wang
Category
Podcast website
Latest episode
Jul 11, 2026
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning 25.07.2025 19:25
🤗 Upvotes: 26 | cs. AI, cs. LG Authors: Yu Li, Zhuoshi Pan, Honglin Lin, Mengyuan Sun, Conghui He, Lijun Wu Title: Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning Arxiv: http://arxiv.org/abs/2507.17512v1 Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) has emerged as a powerful paradigm for enhancing the reasoning capabilities o...
Beyond Context Limits: Subconscious Threads for Long-Horizon Reasoning 24.07.2025 21:00
🤗 Upvotes: 77 | cs. CL Authors: Hongyin Luo, Nathaniel Morgan, Tina Li, Derek Zhao, Ai Vy Ngo, Philip Schroeder, Lijie Yang, Assaf Ben-Kish, Jack O'Brien, James Glass Title: Beyond Context Limits: Subconscious Threads for Long-Horizon Reasoning Arxiv: http://arxiv.org/abs/2507.16784v1 Abstract: To break the context limits of large language models (LLMs) that bottleneck reasoning accuracy and effi...
Step-Audio 2 Technical Report 24.07.2025 22:57
🤗 Upvotes: 42 | cs. CL, cs. SD, eess. AS Authors: Boyong Wu, Chao Yan, Chen Hu, Cheng Yi, Chengli Feng, Fei Tian, Feiyu Shen, Gang Yu, Haoyang Zhang, Jingbei Li, Mingrui Chen, Peng Liu, Wang You, Xiangyu Tony Zhang, Xingyuan Li, Xuerui Yang, Yayue Deng, Yechang Huang, Yuxin Li, Yuxin Zhang, Zhao You, Brian Li, Changyi Wan, Hanpeng Hu, Jiangjie Zhen, Siyu Chen, Song Yuan, Xuelin Zhang, Yimin Jiang...
MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning 24.07.2025 19:50
🤗 Upvotes: 37 | cs. CL, cs. AI, cs. LG Authors: Run-Ze Fan, Zengzhi Wang, Pengfei Liu Title: MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning Arxiv: http://arxiv.org/abs/2507.16812v1 Abstract: Scientific reasoning is critical for developing AI scientists and supporting human researchers in advancing the frontiers of natural science discovery. However, the open-so...
Upsample What Matters: Region-Adaptive Latent Sampling for Accelerated Diffusion Transformers 24.07.2025 19:23
🤗 Upvotes: 27 | cs. CV, eess. IV Authors: Wongi Jeong, Kyungryeol Lee, Hoigi Seo, Se Young Chun Title: Upsample What Matters: Region-Adaptive Latent Sampling for Accelerated Diffusion Transformers Arxiv: http://arxiv.org/abs/2507.08422v1 Abstract: Diffusion transformers have emerged as an alternative to U-net-based diffusion models for high-fidelity image and video generation, offering superior s...
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning 24.07.2025 18:55
🤗 Upvotes: 23 | cs. CV, cs. CL, cs. LG Authors: Ang Li, Charles Wang, Kaiyu Yue, Zikui Cai, Ollie Liu, Deqing Fu, Peng Guo, Wang Bill Zhu, Vatsal Sharan, Robin Jia, Willie Neiswanger, Furong Huang, Tom Goldstein, Micah Goldblum Title: Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning Arxiv: http://arxiv.org/abs/2507.16746v1 Abstract: Humans often use visual aids, for example diagrams...
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding 23.07.2025 24:35
🤗 Upvotes: 98 | cs. LG, cs. AI, cs. CL, cs. CV, cs. HC Authors: Fei Tang, Zhangxuan Gu, Zhengxi Lu, Xuyang Liu, Shuheng Shen, Changhua Meng, Wen Wang, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang Title: GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding Arxiv: http://arxiv.org/abs/2507.15846v2 Abstract: Graphical User Interface (GUI) grounding maps natural language instruc...
MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization 23.07.2025 23:11
🤗 Upvotes: 93 | cs. CL Authors: Xingxuan Li, Yao Xiao, Dianwen Ng, Hai Ye, Yue Deng, Xiang Lin, Bin Wang, Zhanfeng Mo, Chong Zhang, Yueyi Zhang, Zonglin Yang, Ruilin Li, Lei Lei, Shihao Xu, Han Zhao, Weiling Chen, Feng Ji, Lidong Bing Title: MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization Arxiv: http://arxiv.org/abs/2507.14683v1...
The Invisible Leash: Why RLVR May Not Escape Its Origin 23.07.2025 24:09
🤗 Upvotes: 63 | cs. LG, cs. AI, cs. CL Authors: Fang Wu, Weihao Xuan, Ximing Lu, Zaid Harchaoui, Yejin Choi Title: The Invisible Leash: Why RLVR May Not Escape Its Origin Arxiv: http://arxiv.org/abs/2507.14843v1 Abstract: Recent advances in large reasoning models highlight Reinforcement Learning with Verifiable Rewards (RLVR) as a promising method for enhancing AI's capabilities, particularly in...
NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining 23.07.2025 23:22
🤗 Upvotes: 36 | cs. CV, cs. AI, cs. CL, cs. LG Authors: Maksim Kuprashevich, Grigorii Alekseenko, Irina Tolstykh, Georgii Fedorov, Bulat Suleimanov, Vladimir Dokholyan, Aleksandr Gordeev Title: NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining Arxiv: http://arxiv.org/abs/2507.14119v1 Abstract: Recent advances in generative modeling enable image editing assistants that follow...
WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization 23.07.2025 20:38
🤗 Upvotes: 31 | cs. CL, cs. AI Authors: Zhengwei Tao, Jialong Wu, Wenbiao Yin, Junkai Zhang, Baixuan Li, Haiyang Shen, Kuan Li, Liwen Zhang, Xinyu Wang, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou Title: WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization Arxiv: http://arxiv.org/abs/2507.15061v1 Abstract: The advent of Large Language Model (LLM)-powered agents has...
GR-3 Technical Report 23.07.2025 25:59
🤗 Upvotes: 29 | cs. RO, cs. AI, cs. CV Authors: Chilam Cheang, Sijin Chen, Zhongren Cui, Yingdong Hu, Liqun Huang, Tao Kong, Hang Li, Yifeng Li, Yuxiao Liu, Xiao Ma, Hao Niu, Wenxuan Ou, Wanli Peng, Zeyu Ren, Haixin Shi, Jiawen Tian, Hongtao Wu, Xin Xiao, Yuyang Xiao, Jiafeng Xu, Yichu Yang Title: GR-3 Technical Report Arxiv: http://arxiv.org/abs/2507.15493v2 Abstract: We report our recent progre...
Robust 3D-Masked Part-level Editing in 3D Gaussian Splatting with Regularized Score Distillation Sampling 23.07.2025 22:29
🤗 Upvotes: 28 | cs. CV, cs. AI Authors: Hayeon Kim, Ji Ha Jang, Se Young Chun Title: Robust 3D-Masked Part-level Editing in 3D Gaussian Splatting with Regularized Score Distillation Sampling Arxiv: http://arxiv.org/abs/2507.11061v2 Abstract: Recent advances in 3D neural representations and instance-level editing models have enabled the efficient creation of high-quality 3D content. However, achie...
SeC: Advancing Complex Video Object Segmentation via Progressive Concept Construction 23.07.2025 21:40
🤗 Upvotes: 24 | cs. CV, cs. AI Authors: Zhixiong Zhang, Shuangrui Ding, Xiaoyi Dong, Songxin He, Jianfan Lin, Junsong Tang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang Title: SeC: Advancing Complex Video Object Segmentation via Progressive Concept Construction Arxiv: http://arxiv.org/abs/2507.15852v2 Abstract: Video Object Segmentation (VOS) is a core task in computer vision, requiring models...
Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos 23.07.2025 24:05
🤗 Upvotes: 22 | cs. CV, cs. LG, cs. RO Authors: Hao Luo, Yicheng Feng, Wanpeng Zhang, Sipeng Zheng, Ye Wang, Haoqi Yuan, Jiazheng Liu, Chaoyi Xu, Qin Jin, Zongqing Lu Title: Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos Arxiv: http://arxiv.org/abs/2507.15597v1 Abstract: We introduce Being-H0, a dexterous Vision-Language-Action model (VLA) trained on large-scale human...
The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs 22.07.2025 19:55
🤗 Upvotes: 45 | cs. CL Authors: Zichen Wen, Jiashu Qu, Dongrui Liu, Zhiyuan Liu, Ruixi Wu, Yicun Yang, Xiangqi Jin, Haoyun Xu, Xuyang Liu, Weijia Li, Chaochao Lu, Jing Shao, Conghui He, Linfeng Zhang Title: The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs Arxiv: http://arxiv.org/abs/2507.11097v1 Abstract: Diffusion-based large language models (dLLMs) have recently eme...
A Data-Centric Framework for Addressing Phonetic and Prosodic Challenges in Russian Speech Generative Models 22.07.2025 19:42
🤗 Upvotes: 42 | cs. CL, cs. SD, eess. AS Authors: Kirill Borodin, Nikita Vasiliev, Vasiliy Kudryavtsev, Maxim Maslov, Mikhail Gorodnichev, Oleg Rogov, Grach Mkrtchian Title: A Data-Centric Framework for Addressing Phonetic and Prosodic Challenges in Russian Speech Generative Models Arxiv: http://arxiv.org/abs/2507.13563v1 Abstract: Russian speech synthesis presents distinctive challenges, includi...
A Survey of Context Engineering for Large Language Models 19.07.2025 26:47
🤗 Upvotes: 96 | cs. CL Authors: Lingrui Mei, Jiayu Yao, Yuyao Ge, Yiwei Wang, Baolong Bi, Yujun Cai, Jiazhi Liu, Mingyu Li, Zhong-Zhi Li, Duzhen Zhang, Chenlin Zhou, Jiayi Mao, Tianze Xia, Jiafeng Guo, Shenghua Liu Title: A Survey of Context Engineering for Large Language Models Arxiv: http://arxiv.org/abs/2507.13334v1 Abstract: The performance of Large Language Models (LLMs) is fundamentally det...
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning 19.07.2025 22:32
🤗 Upvotes: 52 | cs. CV, cs. AI, cs. CL, cs. LG Authors: Senqiao Yang, Junyi Li, Xin Lai, Bei Yu, Hengshuang Zhao, Jiaya Jia Title: VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Arxiv: http://arxiv.org/abs/2507.13348v1 Abstract: Recent advancements in vision-language models (VLMs) have improved performance by increasing the number of visual tokens, which are oft...
$π^3$: Scalable Permutation-Equivariant Visual Geometry Learning 19.07.2025 20:25
🤗 Upvotes: 36 | cs. CV Authors: Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, Tong He Title: $π^3$: Scalable Permutation-Equivariant Visual Geometry Learning Arxiv: http://arxiv.org/abs/2507.13347v1 Abstract: We introduce $\pi^3$, a feed-forward neural network that offers a novel approach to visual geometry reconstruction, brea...
The Imitation Game: Turing Machine Imitator is Length Generalizable Reasoner 19.07.2025 23:38
🤗 Upvotes: 33 | cs. CL Authors: Zhouqi Hua, Wenwei Zhang, Chengqi Lyu, Yuzhe Gu, Songyang Gao, Kuikun Liu, Kai Chen Title: The Imitation Game: Turing Machine Imitator is Length Generalizable Reasoner Arxiv: http://arxiv.org/abs/2507.13332v1 Abstract: Length generalization, the ability to solve problems of longer sequences than those observed during training, poses a core challenge of Transformer-...
AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning 19.07.2025 22:53
🤗 Upvotes: 30 | cs. CV Authors: Yiming Ren, Zhiqiang Lin, Yu Li, Gao Meng, Weiyun Wang, Junjie Wang, Zicheng Lin, Jifeng Dai, Yujiu Yang, Wenhai Wang, Ruihang Chu Title: AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning Arxiv: http://arxiv.org/abs/2507.12841v1 Abstract: Controllable captioning is essential for precise multimodal alignment and instr...
Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models 19.07.2025 23:26
🤗 Upvotes: 29 | cs. CV Authors: Yudong Jin, Sida Peng, Xuan Wang, Tao Xie, Zhen Xu, Yifan Yang, Yujun Shen, Hujun Bao, Xiaowei Zhou Title: Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models Arxiv: http://arxiv.org/abs/2507.13344v1 Abstract: This paper addresses the challenge of high-fidelity view synthesis of humans with sparse-view videos...
RiemannLoRA: A Unified Riemannian Framework for Ambiguity-Free LoRA Optimization 19.07.2025 23:00
🤗 Upvotes: 23 | cs. LG, cs. CL, cs. NA, math. DG, math. NA, 68T07, 65F55, 53Z50 Authors: Vladimir Bogachev, Vladimir Aletov, Alexander Molozhavenko, Denis Bobkov, Vera Soboleva, Aibek Alanov, Maxim Rakhuba Title: RiemannLoRA: A Unified Riemannian Framework for Ambiguity-Free LoRA Optimization Arxiv: http://arxiv.org/abs/2507.12142v1 Abstract: Low-Rank Adaptation (LoRA) has become a widely adopted...
Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems in LLMs 18.07.2025 20:33
🤗 Upvotes: 50 | cs. CL, cs. AI Authors: Yangning Li, Weizhi Zhang, Yuyao Yang, Wei-Chieh Huang, Yaozu Wu, Junyu Luo, Yuanchen Bei, Henry Peng Zou, Xiao Luo, Yusheng Zhao, Chunkit Chan, Yankai Chen, Zhongfen Deng, Yinghui Li, Hai-Tao Zheng, Dongyuan Li, Renhe Jiang, Ming Zhang, Yangqiu Song, Philip S. Yu Title: Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems in LLMs Arxi...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.