Jingwen Liang, Gengyu Wang
Daily Paper Cast
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: dailypapercast.ai@gmail.comCreator:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-cast/id1777620236Cover Image by Kawen Kuang https://kawen.art
Author
Jingwen Liang, Gengyu Wang
Category
Podcast website
Latest episode
Jul 11, 2026
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text 07.06.2025 18:19
🤗 Upvotes: 22 | cs. CL, cs. LG Authors: Nikhil Kandpal, Brian Lester, Colin Raffel, Sebastian Majstorovic, Stella Biderman, Baber Abbasi, Luca Soldaini, Enrico Shippole, A. Feder Cooper, Aviya Skowron, John Kirchenbauer, Shayne Longpre, Lintang Sutawika, Alon Albalak, Zhenlin Xu, Guilherme Penedo, Loubna Ben Allal, Elie Bakouch, John David Pressman, Honglu Fan, Dashiell Stander, Guangyu Song, Aar...
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos 07.06.2025 20:34
🤗 Upvotes: 21 | cs. CV Authors: Hanoona Rasheed, Abdelrahman Shaker, Anqi Tang, Muhammad Maaz, Ming-Hsuan Yang, Salman Khan, Fahad Khan Title: VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos Arxiv: http://arxiv.org/abs/2506.05349v1 Abstract: Mathematical reasoning in real-world video settings presents a fundamentally different challenge than in static image...
MiMo-VL Technical Report 06.06.2025 19:19
🤗 Upvotes: 58 | cs. CL Authors: Xiaomi LLM-Core Team, :, Zihao Yue, Zhenru Lin, Yifan Song, Weikun Wang, Shuhuai Ren, Shuhao Gu, Shicheng Li, Peidian Li, Liang Zhao, Lei Li, Kainan Bao, Hao Tian, Hailin Zhang, Gang Wang, Dawei Zhu, Cici, Chenhong He, Bowen Ye, Bowen Shen, Zihan Zhang, Zihan Jiang, Zhixian Zheng, Zhichao Song, Zhenbo Luo, Yue Yu, Yudong Wang, Yuanyuan Tian, Yu Tu, Yihan Yan, Yi Hu...
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning 06.06.2025 20:09
🤗 Upvotes: 41 | cs. LG, cs. AI, cs. CL, cs. CV Authors: Shuang Chen, Yue Guo, Zhaochen Su, Yafu Li, Yulun Wu, Jiacheng Chen, Jiayu Chen, Weijie Wang, Xiaoye Qu, Yu Cheng Title: Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning Arxiv: http://arxiv.org/abs/2506.04207v1 Abstract: Inspired by the remarkable reasoning capabilities of Deepseek-R1 in complex text...
AmbiK: Dataset of Ambiguous Tasks in Kitchen Environment 06.06.2025 20:56
🤗 Upvotes: 39 | cs. LG, cs. AI, cs. CL, cs. RO Authors: Anastasiia Ivanova, Eva Bakaeva, Zoya Volovikova, Alexey K. Kovalev, Aleksandr I. Panov Title: AmbiK: Dataset of Ambiguous Tasks in Kitchen Environment Arxiv: http://arxiv.org/abs/2506.04089v1 Abstract: As a part of an embodied agent, Large Language Models (LLMs) are typically used for behavior planning given natural language instructions fr...
CASS: Nvidia to AMD Transpilation with Data, Models, and Benchmark 06.06.2025 22:48
🤗 Upvotes: 35 | cs. AR, cs. AI, cs. CL, cs. LG, cs. PL Authors: Ahmed Heakl, Sarim Hashmi, Gustavo Bertolo Stahl, Seung Hun Eddie Han, Salman Khan, Abdulrahman Mahmoud Title: CASS: Nvidia to AMD Transpilation with Data, Models, and Benchmark Arxiv: http://arxiv.org/abs/2505.16968v3 Abstract: We introduce CASS, the first large-scale dataset and model suite for cross-architecture GPU code transpila...
A Controllable Examination for Long-Context Language Models 06.06.2025 21:39
🤗 Upvotes: 30 | cs. CL Authors: Yijun Yang, Zeyu Huang, Wenhao Zhu, Zihan Qiu, Fei Yuan, Jeff Z. Pan, Ivan Titov Title: A Controllable Examination for Long-Context Language Models Arxiv: http://arxiv.org/abs/2506.02921v1 Abstract: Existing frameworks for evaluating long-context language models (LCLM) can be broadly categorized into real-world and synthetic tasks. Despite their utility, both appro...
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos 06.06.2025 23:16
🤗 Upvotes: 25 | cs. CV, cs. CL Authors: Kejian Zhu, Zhuoran Jin, Hongbang Yuan, Jiachun Li, Shangqing Tu, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao Title: MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos Arxiv: http://arxiv.org/abs/2506.04141v1 Abstract: The sequential structure of videos poses a challenge to the ability of multimodal large language models (MLLMs) t...
Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis 06.06.2025 20:17
🤗 Upvotes: 23 | cs. CL Authors: Kejian Zhu, Shangqing Tu, Zhuoran Jin, Lei Hou, Juanzi Li, Jun Zhao Title: Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis Arxiv: http://arxiv.org/abs/2506.04142v1 Abstract: The development of large language models (LLMs) depends on trustworthy evaluation. However, most current evaluations rely on public benchmarks, which are prone to data cont...
SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models 06.06.2025 22:04
🤗 Upvotes: 23 | cs. CL Authors: Yuhao Wu, Yushi Bai, Zhiqiang Hu, Juanzi Li, Roy Ka-Wei Lee Title: SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models Arxiv: http://arxiv.org/abs/2506.04180v1 Abstract: Long-form text generation remains a significant challenge for large language models (LLMs), particularly in maintaining coherence, ensuring logical consistency, and prese...
Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning 05.06.2025 22:54
🤗 Upvotes: 144 | cs. CL Authors: Shelly Bensal, Umar Jamil, Christopher Bryant, Melisa Russak, Kiran Kamble, Dmytro Mozolevskyi, Muayad Ali, Waseem AlShikh Title: Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning Arxiv: http://arxiv.org/abs/2505.24726v1 Abstract: We explore a method for improving the performance of large language models through self-reflection and reinforceme...
VS-Bench: Evaluating VLMs for Strategic Reasoning and Decision-Making in Multi-Agent Environments 05.06.2025 24:23
🤗 Upvotes: 51 | cs. AI Authors: Zelai Xu, Zhexuan Xu, Xiangmin Yi, Huining Yuan, Xinlei Chen, Yi Wu, Chao Yu, Yu Wang Title: VS-Bench: Evaluating VLMs for Strategic Reasoning and Decision-Making in Multi-Agent Environments Arxiv: http://arxiv.org/abs/2506.02387v1 Abstract: Recent advancements in Vision Language Models (VLMs) have expanded their capabilities to interactive agent tasks, yet existin...
UniWorld: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation 05.06.2025 19:11
🤗 Upvotes: 49 | cs. CV, cs. AI, cs. CL Authors: Bin Lin, Zongjian Li, Xinhua Cheng, Yuwei Niu, Yang Ye, Xianyi He, Shenghai Yuan, Wangbo Yu, Shaodong Wang, Yunyang Ge, Yatian Pang, Li Yuan Title: UniWorld: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation Arxiv: http://arxiv.org/abs/2506.03147v2 Abstract: Although existing unified models achieve strong performance...
SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis 05.06.2025 18:18
🤗 Upvotes: 46 | cs. LG, cs. CL, cs. CV Authors: Zijian Wu, Jinjie Ni, Xiangyan Liu, Zichen Liu, Hang Yan, Michael Qizhe Shieh Title: SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis Arxiv: http://arxiv.org/abs/2506.02096v1 Abstract: Vision-language models (VLMs) trained via reinforcement learning with verifiable reward (RLVR) have shown notable progress in scaling test-time comput...
CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs 05.06.2025 21:03
🤗 Upvotes: 43 | cs. CV, cs. AI Authors: Ai Jian, Weijie Qiu, Xiaokun Wang, Peiyu Wang, Yunzhuo Hao, Jiangbo Pei, Yichen Wei, Yi Peng, Xuchen Song Title: CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs Arxiv: http://arxiv.org/abs/2505.24120v1 Abstract: Vision-Language Models (VLMs) have demonstrated remarkable progress in multimodal understanding, yet their...
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents 05.06.2025 22:23
🤗 Upvotes: 29 | cs. CL, cs. AI, cs. CV Authors: Qianhui Wu, Kanzhi Cheng, Rui Yang, Chaoyun Zhang, Jianwei Yang, Huiqiang Jiang, Jian Mu, Baolin Peng, Bo Qiao, Reuben Tan, Si Qin, Lars Liden, Qingwei Lin, Huan Zhang, Tong Zhang, Jianbing Zhang, Dongmei Zhang, Jianfeng Gao Title: GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents Arxiv: http://arxiv.org/abs/2506.03143v1 Abstract: One of th...
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces 05.06.2025 22:17
🤗 Upvotes: 29 | cs. CV, cs. RO Authors: Gen Luo, Ganlin Yang, Ziyang Gong, Guanzhou Chen, Haonan Duan, Erfei Cui, Ronglei Tong, Zhi Hou, Tianyi Zhang, Zhe Chen, Shenglong Ye, Lewei Lu, Jingbo Wang, Wenhai Wang, Jifeng Dai, Yu Qiao, Rongrong Ji, Xizhou Zhu Title: Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces Arxiv: http://arxiv.org/abs/2506.00123v1 A...
OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning Mitigation 05.06.2025 24:28
🤗 Upvotes: 28 | cs. AI Authors: Shengjia Zhang, Junjie Wu, Jiawei Chen, Changwang Zhang, Xingyu Lou, Wangchunshu Zhou, Sheng Zhou, Can Wang, Jun Wang Title: OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning Mitigation Arxiv: http://arxiv.org/abs/2506.02397v1 Abstract: Recent advanced large reasoning models (LRMs) leverage extended chain-of-thought (CoT) reasoning to solve...
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning 04.06.2025 22:08
🤗 Upvotes: 99 | cs. CL, cs. AI, cs. LG Authors: Shenzhi Wang, Le Yu, Chang Gao, Chujie Zheng, Shixuan Liu, Rui Lu, Kai Dang, Xionghui Chen, Jianxin Yang, Zhenru Zhang, Yuqiong Liu, An Yang, Andrew Zhao, Yang Yue, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin Title: Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning Arxiv: http://arxiv.org/a...
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards 04.06.2025 21:38
🤗 Upvotes: 52 | cs. LG, cs. AI, cs. CL Authors: Zafir Stojanovski, Oliver Stanley, Joe Sharratt, Richard Jones, Abdulhakeem Adefioye, Jean Kaddour, Andreas Köpf Title: REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards Arxiv: http://arxiv.org/abs/2505.24760v1 Abstract: We introduce Reasoning Gym (RG), a library of reasoning environments for reinforcement lear...
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics 04.06.2025 21:06
🤗 Upvotes: 48 | cs. LG, cs. RO Authors: Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti, Simon Alibert, Matthieu Cord, Thomas Wolf, Remi Cadene Title: SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics Arxiv: http://arxiv.org/abs/2506.01844v1 Abstract: V...
Taming LLMs by Scaling Learning Rates with Gradient Grouping 04.06.2025 20:20
🤗 Upvotes: 33 | cs. LG, cs. AI Authors: Siyuan Li, Juanxi Tian, Zedong Wang, Xin Jin, Zicheng Liu, Wentao Zhang, Dan Xu Title: Taming LLMs by Scaling Learning Rates with Gradient Grouping Arxiv: http://arxiv.org/abs/2506.01049v1 Abstract: Training large language models (LLMs) poses challenges due to their massive scale and heterogeneous architectures. While adaptive optimizers like AdamW help add...
ARIA: Training Language Agents with Intention-Driven Reward Aggregation 04.06.2025 23:45
🤗 Upvotes: 26 | cs. CL Authors: Ruihan Yang, Yikai Zhang, Aili Chen, Xintao Wang, Siyu Yuan, Jiangjie Chen, Deqing Yang, Yanghua Xiao Title: ARIA: Training Language Agents with Intention-Driven Reward Aggregation Arxiv: http://arxiv.org/abs/2506.00539v1 Abstract: Large language models (LLMs) have enabled agents to perform complex reasoning and decision-making through free-form language interactio...
Temporal In-Context Fine-Tuning for Versatile Control of Video Diffusion Models 04.06.2025 20:03
🤗 Upvotes: 24 | cs. CV Authors: Kinam Kim, Junha Hyung, Jaegul Choo Title: Temporal In-Context Fine-Tuning for Versatile Control of Video Diffusion Models Arxiv: http://arxiv.org/abs/2506.00996v1 Abstract: Recent advances in text-to-video diffusion models have enabled high-quality video synthesis, but controllable generation remains challenging, particularly under limited data and compute. Existi...
LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks 04.06.2025 19:27
🤗 Upvotes: 24 | cs. RO, cs. AI Authors: Yi Yang, Jiaxuan Sun, Siqi Kou, Yihan Wang, Zhijie Deng Title: LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks Arxiv: http://arxiv.org/abs/2506.00411v1 Abstract: Real-world embodied agents face long-horizon tasks, characterized by high-level goals demanding multi-step solutions beyond single actions. Successfully navigating t...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.