Jingwen Liang, Gengyu Wang

Daily Paper Cast

Science EN ↓ 2000 episodes

We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: dailypapercast.ai@gmail.comCreator:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-cast/id1777620236Cover Image by Kawen Kuang https://kawen.art

Author

Jingwen Liang, Gengyu Wang

Category

Science

Latest episode

Jul 11, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assets 27.09.2025

🤗 Upvotes: 28 | cs. CV, cs. AI Authors: Team Hunyuan3D, :, Bowen Zhang, Chunchao Guo, Haolin Liu, Hongyu Yan, Huiwen Shi, Jingwei Huang, Junlin Yu, Kunhong Li, Linus, Penghao Wang, Qingxiang Lin, Sicong Liu, Xianghui Yang, Yixuan Tang, Yunfei Zhao, Zeqiang Lai, Zhihao Liang, Zibo Zhao Title: Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assets Arxiv: http://arxiv.org/abs/2...

AutoIntent: AutoML for Text Classification 27.09.2025

🤗 Upvotes: 22 | cs. CL Authors: Ilya Alekseev, Roman Solomatin, Darina Rustamova, Denis Kuznetsov Title: AutoIntent: AutoML for Text Classification Arxiv: http://arxiv.org/abs/2509.21138v1 Abstract: AutoIntent is an automated machine learning tool for text classification tasks. Unlike existing solutions, AutoIntent offers end-to-end automation with embedding model selection, classifier optimizati...

Video models are zero-shot learners and reasoners 26.09.2025

🤗 Upvotes: 49 | cs. LG, cs. AI, cs. CV, cs. RO Authors: Thaddäus Wiedemer, Yuxuan Li, Paul Vicol, Shixiang Shane Gu, Nick Matarese, Kevin Swersky, Been Kim, Priyank Jaini, Robert Geirhos Title: Video models are zero-shot learners and reasoners Arxiv: http://arxiv.org/abs/2509.20328v1 Abstract: The remarkable zero-shot capabilities of Large Language Models (LLMs) have propelled natural language pr...

SIM-CoT: Supervised Implicit Chain-of-Thought 26.09.2025

🤗 Upvotes: 28 | cs. CL, cs. AI Authors: Xilin Wei, Xiaoran Liu, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Xipeng Qiu, Dahua Lin Title: SIM-CoT: Supervised Implicit Chain-of-Thought Arxiv: http://arxiv.org/abs/2509.20317v2 Abstract: Implicit Chain-of-Thought (CoT) methods offer a token-efficient alternative to explicit CoT reasoning in Large Language Models (LLMs), but a persistent perform...

Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR 25.09.2025

🤗 Upvotes: 83 | cs. CV, cs. CL Authors: Khalil Hennara, Muhammad Hreden, Mohamed Motasim Hamed, Ahmad Bastati, Zeina Aldallal, Sara Chrouf, Safwan AlModhayan Title: Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR Arxiv: http://arxiv.org/abs/2509.18174v1 Abstract: Arabic document OCR remains a challenging task due to the language's cursive script, diverse fonts, diacritics, and...

Reinforcement Learning on Pre-Training Data 25.09.2025

🤗 Upvotes: 43 | cs. CL, cs. AI, cs. LG Authors: Siheng Li, Kejiao Li, Zenan Xu, Guanhua Huang, Evander Yang, Kun Li, Haoyuan Wu, Jiajia Wu, Zihao Zheng, Chenchen Zhang, Kun Shi, Kyrierl Deng, Qi Yi, Ruibin Xiong, Tingqiang Xu, Yuhao Jiang, Jianfeng Yan, Yuyuan Zeng, Guanghui Xu, Jinbao Xue, Zhijiang Xu, Zheng Fang, Shuai Li, Qibin Liu, Xiaoxue Li, Zhuoyu Li, Yangyu Tao, Fei Gao, Cheng Jiang, Bo C...

Do You Need Proprioceptive States in Visuomotor Policies? 25.09.2025

🤗 Upvotes: 43 | cs. RO, cs. AI Authors: Juntu Zhao, Wenbo Lu, Di Zhang, Yufeng Liu, Yushen Liang, Tianluo Zhang, Yifeng Cao, Junyuan Xie, Yingdong Hu, Shengjie Wang, Junliang Guo, Dequan Wang, Yang Gao Title: Do You Need Proprioceptive States in Visuomotor Policies? Arxiv: http://arxiv.org/abs/2509.18644v2 Abstract: Imitation-learning-based visuomotor policies have been widely used in robot manip...

MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe 25.09.2025

🤗 Upvotes: 32 | cs. LG, cs. CV Authors: Tianyu Yu, Zefan Wang, Chongyi Wang, Fuwei Huang, Wenshuo Ma, Zhihui He, Tianchi Cai, Weize Chen, Yuxiang Huang, Yuanqian Zhao, Bokai Xu, Junbo Cui, Yingjing Xu, Liqing Ruan, Luoyuan Zhang, Hanyu Liu, Jingkun Tang, Hongyuan Liu, Qining Guo, Wenhao Hu, Bingxiang He, Jie Zhou, Jie Cai, Ji Qi, Zonghao Guo, Chi Chen, Guoyang Zeng, Yuxuan Li, Ganqu Cui, Ning Din...

LIMI: Less is More for Agency 24.09.2025

🤗 Upvotes: 69 | cs. AI Authors: Yang Xiao, Mohan Jiang, Jie Sun, Keyu Li, Jifan Lin, Yumin Zhuang, Ji Zeng, Shijie Xia, Qishuo Hua, Xuefeng Li, Xiaojie Cai, Tongyu Wang, Yue Zhang, Liming Liu, Xia Wu, Jinlong Hou, Yuan Cheng, Wenjie Li, Xiang Wang, Dequan Wang, Pengfei Liu Title: LIMI: Less is More for Agency Arxiv: http://arxiv.org/abs/2509.17567v1 Abstract: We define Agency as the emergent capa...

Qwen3-Omni Technical Report 24.09.2025

🤗 Upvotes: 56 | cs. CL, cs. AI, cs. CV, eess. AS Authors: Jin Xu, Zhifang Guo, Hangrui Hu, Yunfei Chu, Xiong Wang, Jinzheng He, Yuxuan Wang, Xian Shi, Ting He, Xinfa Zhu, Yuanjun Lv, Yongqi Wang, Dake Guo, He Wang, Linhan Ma, Pei Zhang, Xinyu Zhang, Hongkun Hao, Zishan Guo, Baosong Yang, Bin Zhang, Ziyang Ma, Xipin Wei, Shuai Bai, Keqin Chen, Xuejing Liu, Peng Wang, Mingkun Yang, Dayiheng Liu, Xi...

OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models 24.09.2025

🤗 Upvotes: 49 | cs. CV Authors: Jinshu Chen, Xinghui Li, Xu Bai, Tianxiang Ma, Pengze Zhang, Zhuowei Chen, Gen Li, Lijie Liu, Songtao Zhao, Bingchuan Li, Qian He Title: OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models Arxiv: http://arxiv.org/abs/2509.17627v1 Abstract: Recent advances in video insertion based on diffusion models are impressive. However, exist...

OnePiece: Bringing Context Engineering and Reasoning to Industrial Cascade Ranking System 24.09.2025

🤗 Upvotes: 27 | cs. IR, cs. AI, cs. CL Authors: Sunhao Dai, Jiakai Tang, Jiahua Wu, Kun Wang, Yuxuan Zhu, Bingjun Chen, Bangyang Hong, Yu Zhao, Cong Fu, Kangle Wu, Yabo Ni, Anxiang Zeng, Wenjie Wang, Xu Chen, Jun Xu, See-Kiong Ng Title: OnePiece: Bringing Context Engineering and Reasoning to Industrial Cascade Ranking System Arxiv: http://arxiv.org/abs/2509.18091v1 Abstract: Despite the growing i...

TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs 24.09.2025

🤗 Upvotes: 26 | cs. CV Authors: Yunheng Li, Jing Cheng, Shaoyong Jia, Hangyi Kuang, Shaohui Jiao, Qibin Hou, Ming-Ming Cheng Title: TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs Arxiv: http://arxiv.org/abs/2509.18056v1 Abstract: This paper introduces TempSamp-R1, a new reinforcement fine-tuning framework designed to improve the effectiveness of adapting mu...

RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation 23.09.2025

🤗 Upvotes: 89 | cs. CL, cs. AI, cs. SE Authors: Jane Luo, Xin Zhang, Steven Liu, Jie Wu, Yiming Huang, Yangyu Huang, Chengyu Yin, Ying Xin, Jianfeng Liu, Yuefeng Zhan, Hao Sun, Qi Chen, Scarlett Li, Mao Yang Title: RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation Arxiv: http://arxiv.org/abs/2509.16198v1 Abstract: Large language models excel at function- and file-level...

MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer 23.09.2025

🤗 Upvotes: 37 | cs. CV, cs. CL, cs. LG Authors: Yanghao Li, Rui Qian, Bowen Pan, Haotian Zhang, Haoshuo Huang, Bowen Zhang, Jialing Tong, Haoxuan You, Xianzhi Du, Zhe Gan, Hyunjik Kim, Chao Jia, Zhenbang Wang, Yinfei Yang, Mingfei Gao, Zi-Yi Dou, Wenze Hu, Chang Gao, Dongxu Li, Philipp Dufter, Zirui Wang, Guoli Yin, Zhengdong Zhang, Chen Chen, Yang Zhao, Ruoming Pang, Zhifeng Chen Title: MANZANO:...

Latent Zoning Network: A Unified Principle for Generative Modeling, Representation Learning, and Classification 23.09.2025

🤗 Upvotes: 28 | cs. LG, cs. AI, cs. CV, stat. ML Authors: Zinan Lin, Enshu Liu, Xuefei Ning, Junyi Zhu, Wenyu Wang, Sergey Yekhanin Title: Latent Zoning Network: A Unified Principle for Generative Modeling, Representation Learning, and Classification Arxiv: http://arxiv.org/abs/2509.15591v1 Abstract: Generative modeling, representation learning, and classification are three core problems in machi...

ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data 20.09.2025

🤗 Upvotes: 81 | cs. CV Authors: Zhaoyang Liu, JingJing Xie, Zichen Ding, Zehao Li, Bowen Yang, Zhenyu Wu, Xuehui Wang, Qiushi Sun, Shi Liu, Weiyun Wang, Shenglong Ye, Qingyun Li, Zeyue Tian, Gen Luo, Xiangyu Yue, Biqing Qi, Kai Chen, Bowen Zhou, Yu Qiao, Qifeng Chen, Wenhai Wang Title: ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data Arxiv: http://arxiv.org/abs/2509.1522...

FlowRL: Matching Reward Distributions for LLM Reasoning 20.09.2025

🤗 Upvotes: 68 | cs. LG, cs. AI, cs. CL Authors: Xuekai Zhu, Daixuan Cheng, Dinghuai Zhang, Hengli Li, Kaiyan Zhang, Che Jiang, Youbang Sun, Ermo Hua, Yuxin Zuo, Xingtai Lv, Qizheng Zhang, Lin Chen, Fanghao Shao, Bo Xue, Yunchong Song, Zhenjie Yang, Ganqu Cui, Ning Ding, Jianfeng Gao, Xiaodong Liu, Bowen Zhou, Hongyuan Mei, Zhouhan Lin Title: FlowRL: Matching Reward Distributions for LLM Reasoning...

Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Delibration 20.09.2025

🤗 Upvotes: 45 | cs. CL Authors: Haoran Zhang, Yafu Li, Xuyang Hu, Dongrui Liu, Zhilin Wang, Bo Li, Yu Cheng Title: Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Delibration Arxiv: http://arxiv.org/abs/2509.14760v1 Abstract: Large language models (LLMs) are increasingly applied in diverse real-world scenarios, each governed by bespoke behavioral and safety specificatio...

Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation 20.09.2025

🤗 Upvotes: 30 | cs. LG, cs. CL Authors: Yujun Zhou, Zhenwen Liang, Haolin Liu, Wenhao Yu, Kishan Panaganti, Linfeng Song, Dian Yu, Xiangliang Zhang, Haitao Mi, Dong Yu Title: Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation Arxiv: http://arxiv.org/abs/2509.15194v1 Abstract: Large language models (LLMs) are increasingly trained with reinforcement learn...

FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning 20.09.2025

🤗 Upvotes: 22 | cs. LG, cs. AI Authors: Liang Hu, Jianpeng Jiao, Jiashuo Liu, Yanle Ren, Zhoufutu Wen, Kaiyuan Zhang, Xuanliang Zhang, Xiang Gao, Tianci He, Fei Hu, Yali Liao, Zaiyuan Wang, Chenghao Yang, Qianyu Yang, Mingren Yin, Zhiyuan Zeng, Ge Zhang, Xinyi Zhang, Xiying Zhao, Zhenwei Zhu, Hongseok Namkoong, Wenhao Huang, Yuwen Tang Title: FinSearchComp: Towards a Realistic, Expert-Level Evalu...

Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation 20.09.2025

🤗 Upvotes: 22 | cs. CV Authors: Xiaoyu Yue, Zidong Wang, Yuqing Wang, Wenlong Zhang, Xihui Liu, Wanli Ouyang, Lei Bai, Luping Zhou Title: Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation Arxiv: http://arxiv.org/abs/2509.15185v1 Abstract: Recent studies have demonstrated the importance of high-quality visual representations in image generation and have highl...

Hala Technical Report: Building Arabic-Centric Instruction & Translation Models at Scale 19.09.2025

🤗 Upvotes: 67 | cs. CL, cs. AI, cs. LG Authors: Hasan Abed Al Kader Hammoud, Mohammad Zbeeb, Bernard Ghanem Title: Hala Technical Report: Building Arabic-Centric Instruction & Translation Models at Scale Arxiv: http://arxiv.org/abs/2509.14008v1 Abstract: We present Hala, a family of Arabic-centric instruction and translation models built with our translate-and-tune pipeline. We first compress...

SAIL-VL2 Technical Report 19.09.2025

🤗 Upvotes: 29 | cs. CV Authors: Weijie Yin, Yongjie Ye, Fangxun Shu, Yue Liao, Zijian Kang, Hongyuan Dong, Haiyang Yu, Dingkang Yang, Jiacong Wang, Han Wang, Wenzhuo Liu, Xiao Liang, Shuicheng Yan, Chao Feng Title: SAIL-VL2 Technical Report Arxiv: http://arxiv.org/abs/2509.14033v1 Abstract: We introduce SAIL-VL2, an open-suite vision-language foundation model (LVM) for comprehensive multimodal un...

PANORAMA: The Rise of Omnidirectional Vision in the Embodied AI Era 19.09.2025

🤗 Upvotes: 21 | cs. CV Authors: Xu Zheng, Chenfei Liao, Ziqiao Weng, Kaiyu Lei, Zihao Dongfang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Lu Qi, Li Chen, Danda Pani Paudel, Kailun Yang, Linfeng Zhang, Luc Van Gool, Xuming Hu Title: PANORAMA: The Rise of Omnidirectional Vision in the Embodied AI Era Arxiv: http://arxiv.org/abs/2509.12989v1 Abstract: Omnidirectional vision, using 360-degree vision to...

Listen to the Daily Paper Cast podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.