Jingwen Liang, Gengyu Wang

Daily Paper Cast

Science EN ↓ 2000 episodes

We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: dailypapercast.ai@gmail.comCreator:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-cast/id1777620236Cover Image by Kawen Kuang https://kawen.art

Author

Jingwen Liang, Gengyu Wang

Category

Science

Latest episode

Jul 11, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

LLaDA2.0: Scaling Up Diffusion Language Models to 100B 20.12.2025

🤗 Upvotes: 54 | cs. LG, cs. AI, cs. CL Authors: Tiwei Bie, Maosong Cao, Kun Chen, Lun Du, Mingliang Gong, Zhuochen Gong, Yanmei Gu, Jiaqi Hu, Zenan Huang, Zhenzhong Lan, Chengxi Li, Chongxuan Li, Jianguo Li, Zehuan Li, Huabin Liu, Ling Liu, Guoshan Lu, Xiaocheng Lu, Yuxin Ma, Jianfeng Tan, Lanning Wei, Ji-Rong Wen, Yipeng Xing, Xiaolu Zhang, Junbo Zhao, Da Zheng, Jun Zhou, Junlin Zhou, Zhanchao Z...

Next-Embedding Prediction Makes Strong Vision Learners 20.12.2025

🤗 Upvotes: 49 | cs. CV Authors: Sihan Xu, Ziqiao Ma, Wenhao Chai, Xuweiyi Chen, Weiyang Jin, Joyce Chai, Saining Xie, Stella X. Yu Title: Next-Embedding Prediction Makes Strong Vision Learners Arxiv: http://arxiv.org/abs/2512.16922v1 Abstract: Inspired by the success of generative pretraining in natural language, we ask whether the same principles can yield strong self-supervised visual learners....

StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors 20.12.2025

🤗 Upvotes: 33 | cs. CV Authors: Guibao Shen, Yihua Du, Wenhang Ge, Jing He, Chirui Chang, Donghao Zhou, Zhen Yang, Luozhou Wang, Xin Tao, Ying-Cong Chen Title: StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors Arxiv: http://arxiv.org/abs/2512.16915v1 Abstract: The rapid growth of stereoscopic displays, including VR headsets and 3D cinemas, has led to increasing d...

Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model 20.12.2025

🤗 Upvotes: 30 | cs. CV Authors: Heyi Chen, Siyan Chen, Xin Chen, Yanfei Chen, Ying Chen, Zhuo Chen, Feng Cheng, Tianheng Cheng, Xinqi Cheng, Xuyan Chi, Jian Cong, Jing Cui, Qinpeng Cui, Qide Dong, Junliang Fan, Jing Fang, Zetao Fang, Chengjian Feng, Han Feng, Mingyuan Gao, Yu Gao, Dong Guo, Qiushan Guo, Boyang Hao, Qingkai Hao, Bibo He, Qian He, Tuyen Hoang, Ruoqing Hu, Xi Hu, Weilin Huang, Zhaoy...

Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation 20.12.2025

🤗 Upvotes: 28 | cs. CV Authors: Xin Lin, Meixi Song, Dizhe Zhang, Wenxuan Lu, Haodong Li, Bo Du, Ming-Hsuan Yang, Truong Nguyen, Lu Qi Title: Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation Arxiv: http://arxiv.org/abs/2512.16913v1 Abstract: In this work, we present a panoramic metric depth foundation model that generalizes across diverse scene distances. We explore a data-i...

Generative Refocusing: Flexible Defocus Control from a Single Image 20.12.2025

🤗 Upvotes: 26 | cs. CV Authors: Chun-Wei Tuan Mu, Jia-Bin Huang, Yu-Lun Liu Title: Generative Refocusing: Flexible Defocus Control from a Single Image Arxiv: http://arxiv.org/abs/2512.16923v1 Abstract: Depth-of-field control is essential in photography, but getting the perfect focus often takes several tries or special equipment. Single-image refocusing is still difficult. It involves recovering...

DeContext as Defense: Safe Image Editing in Diffusion Transformers 20.12.2025

🤗 Upvotes: 22 | cs. CV Authors: Linghui Shen, Mingyue Cui, Xingyi Yang Title: DeContext as Defense: Safe Image Editing in Diffusion Transformers Arxiv: http://arxiv.org/abs/2512.16625v1 Abstract: In-context diffusion models allow users to modify images with remarkable ease and realism. However, the same power raises serious privacy concerns: personal images can be easily manipulated for identity...

Step-GUI Technical Report 19.12.2025

🤗 Upvotes: 87 | cs. CV Authors: Haolong Yan, Jia Wang, Xin Huang, Yeqing Shen, Ziyang Meng, Zhimin Fan, Kaijun Tan, Jin Gao, Lieyu Shi, Mi Yang, Shiliang Yang, Zhirui Wang, Brian Li, Kang An, Chenyang Li, Lei Lei, Mengmeng Duan, Danxun Liang, Guodong Liu, Hang Cheng, Hao Wu, Jie Dong, Junhao Huang, Mei Chen, Renjie Yu, Shunshan Li, Xu Zhou, Yiting Dai, Yineng Deng, Yingdan Liang, Zelin Chen, Wen...

DEER: Draft with Diffusion, Verify with Autoregressive Models 19.12.2025

🤗 Upvotes: 39 | cs. LG, cs. AI Authors: Zicong Cheng, Guo-Wei Yang, Jia Li, Zhijie Deng, Meng-Hao Guo, Shi-Min Hu Title: DEER: Draft with Diffusion, Verify with Autoregressive Models Arxiv: http://arxiv.org/abs/2512.15176v1 Abstract: Efficiency, as a critical practical challenge for LLM-driven agentic and reasoning systems, is increasingly constrained by the inherent latency of autoregressive (AR...

Fast and Accurate Causal Parallel Decoding using Jacobi Forcing 19.12.2025

🤗 Upvotes: 36 | cs. CL Authors: Lanxiang Hu, Siqi Kou, Yichao Fu, Samyam Rajbhandari, Tajana Rosing, Yuxiong He, Zhijie Deng, Hao Zhang Title: Fast and Accurate Causal Parallel Decoding using Jacobi Forcing Arxiv: http://arxiv.org/abs/2512.14681v1 Abstract: Multi-token generation has emerged as a promising paradigm for accelerating transformer-based large model inference. Recent efforts primarily...

HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices 19.12.2025

🤗 Upvotes: 31 | cs. CV, cs. CL Authors: HyperAI Team, Yuchen Liu, Kaiyang Han, Zhiqiang Xia, Yuhang Dong, Chen Song, Kangyu Tang, Jiaming Xu, Xiushi Feng, WenXuan Yu, Li Peng, Mingyang Wang, Kai Wang, Changpeng Yang, Yang Li, Haoyu Lu, Hao Wang, Bingna Xu, Guangyao Liu, Long Huang, Kaibin Guo, Jinyang Wu, Dan Wu, Hongzhen Wang, Peng Zhou, Shuai Nie, Shande Wang, Runyu Shi, Ying Huang Title: Hyper...

Puzzle Curriculum GRPO for Vision-Centric Reasoning 19.12.2025

🤗 Upvotes: 30 | cs. CV Authors: Ahmadreza Jeddi, Hakki Can Karaimer, Hue Nguyen, Zhongling Wang, Ke Zhao, Javad Rajabi, Ran Zhang, Raghav Goyal, Babak Taati, Radek Grzeszczuk Title: Puzzle Curriculum GRPO for Vision-Centric Reasoning Arxiv: http://arxiv.org/abs/2512.14944v1 Abstract: Recent reinforcement learning (RL) approaches like outcome-supervised GRPO have advanced chain-of-thought reasonin...

MMGR: Multi-Modal Generative Reasoning 18.12.2025

🤗 Upvotes: 82 | cs. CL, cs. CV Authors: Zefan Cai, Haoyi Qiu, Tianyi Ma, Haozhe Zhao, Gengze Zhou, Kung-Hsiang Huang, Parisa Kordjamshidi, Minjia Zhang, Wen Xiao, Jiuxiang Gu, Nanyun Peng, Junjie Hu Title: MMGR: Multi-Modal Generative Reasoning Arxiv: http://arxiv.org/abs/2512.14691v2 Abstract: Video foundation models generate visually realistic and temporally coherent content, but their reliabil...

Video Reality Test: Can AI-Generated ASMR Videos fool VLMs and Humans? 18.12.2025

🤗 Upvotes: 53 | cs. CV Authors: Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin Title: Video Reality Test: Can AI-Generated ASMR Videos fool VLMs and Humans? Arxiv: http://arxiv.org/abs/2512.13281v2 Abstract: Recent advances in video generation have produced vivid content that are often indistinguishable from real videos, making AI-generate...

WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling 18.12.2025

🤗 Upvotes: 49 | cs. CV, cs. GR Authors: Wenqiang Sun, Haiyu Zhang, Haoyuan Wang, Junta Wu, Zehan Wang, Zhenwei Wang, Yunhong Wang, Jun Zhang, Tengfei Wang, Chunchao Guo Title: WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling Arxiv: http://arxiv.org/abs/2512.14614v1 Abstract: This paper presents WorldPlay, a streaming video diffusion model that enables re...

Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling 18.12.2025

🤗 Upvotes: 39 | cs. CV, cs. AI Authors: Yuran Wang, Bohan Zeng, Chengzhuo Tong, Wenxuan Liu, Yang Shi, Xiaochen Ma, Hao Liang, Yuanxing Zhang, Wentao Zhang Title: Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling Arxiv: http://arxiv.org/abs/2512.12675v1 Abstract: Subject-driven image generation has advanced from single- to...

RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics 18.12.2025

🤗 Upvotes: 31 | cs. RO, cs. CV Authors: Enshen Zhou, Cheng Chi, Yibo Li, Jingkun An, Jiayuan Zhang, Shanyu Rong, Yi Han, Yuheng Ji, Mengzhen Liu, Pengwei Wang, Zhongyuan Wang, Lu Sheng, Shanghang Zhang Title: RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics Arxiv: http://arxiv.org/abs/2512.13660v1 Abstract: Spatial tracing, as a fundamental embodied intera...

OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value 18.12.2025

🤗 Upvotes: 27 | cs. AI Authors: Mengzhang Cai, Xin Gao, Yu Li, Honglin Lin, Zheng Liu, Zhuoshi Pan, Qizhi Pei, Xiaoran Shang, Mengyuan Sun, Zinan Tang, Xiaoyang Wang, Zhanping Zhong, Yun Zhu, Dahua Lin, Conghui He, Lijun Wu Title: OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value Arxiv: http://arxiv.org/abs/2512.14051v1 Abstract: The rapid evolution of Large Langua...

ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding 17.12.2025

🤗 Upvotes: 75 | cs. CL, cs. AI, cs. LG Authors: Jia-Nan Li, Jian Guan, Wei Wu, Chongxuan Li Title: ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding Arxiv: http://arxiv.org/abs/2512.13586v1 Abstract: Autoregressive models (ARMs) are hindered by slow sequential inference. While masked diffusion models (MDMs) offer a parallel alternative, they suffer from critical dra...

Towards Scalable Pre-training of Visual Tokenizers for Generation 17.12.2025

🤗 Upvotes: 70 | cs. CV Authors: Jingfeng Yao, Yuda Song, Yucong Zhou, Xinggang Wang Title: Towards Scalable Pre-training of Visual Tokenizers for Generation Arxiv: http://arxiv.org/abs/2512.13687v1 Abstract: The quality of the latent space in visual tokenizers (e.g., VAEs) is crucial for modern generative models. However, the standard reconstruction-based training paradigm produces a latent space...

Memory in the Age of AI Agents 17.12.2025

🤗 Upvotes: 68 | cs. CL, cs. AI Authors: Yuyang Hu, Shichun Liu, Yanwei Yue, Guibin Zhang, Boyang Liu, Fangyi Zhu, Jiahang Lin, Honglin Guo, Shihan Dou, Zhiheng Xi, Senjie Jin, Jiejun Tan, Yanbin Yin, Jiongnan Liu, Zeyu Zhang, Zhongxiang Sun, Yutao Zhu, Hao Sun, Boci Peng, Zhenrong Cheng, Xuanbo Fan, Jiaxin Guo, Xinlei Yu, Zhenhong Zhou, Zewen Hu, Jiahao Huo, Junhao Wang, Yuwei Niu, Yu Wang, Zhenf...

QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management 17.12.2025

🤗 Upvotes: 59 | cs. CL Authors: Weizhou Shen, Ziyi Yang, Chenliang Li, Zhiyuan Lu, Miao Peng, Huashan Sun, Yingcheng Shi, Shengyi Liao, Shaopeng Lai, Bo Zhang, Dayiheng Liu, Fei Huang, Jingren Zhou, Ming Yan Title: QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management Arxiv: http://arxiv.org/abs/2512.12967v1 Abstract: We introduce QwenLong-L1.5, a model that achieve...

LongVie 2: Multimodal Controllable Ultra-Long Video World Model 17.12.2025

🤗 Upvotes: 53 | cs. CV Authors: Jianxiong Gao, Zhaoxi Chen, Xian Liu, Junhao Zhuang, Chengming Xu, Jianfeng Feng, Yu Qiao, Yanwei Fu, Chenyang Si, Ziwei Liu Title: LongVie 2: Multimodal Controllable Ultra-Long Video World Model Arxiv: http://arxiv.org/abs/2512.13604v1 Abstract: Building video world models upon pretrained video generation systems represents an important yet challenging step toward...

Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows 17.12.2025

🤗 Upvotes: 47 | cs. AI, cs. CE, cs. IR, cs. MA Authors: Haoyu Dong, Pengkun Zhang, Yan Gao, Xuanyu Dong, Yilin Cheng, Mingzhe Lu, Adina Yakefu, Shuxin Zheng Title: Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows Arxiv: http://arxiv.org/abs/2512.13168v1 Abstract: We introduce a finance & accounting benchmark (Finch) for evaluating AI agents on real-...

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents 17.12.2025

🤗 Upvotes: 39 | cs. CL Authors: Jingzhe Ding, Shengda Long, Changxin Pu, Huan Zhou, Hongwan Gao, Xiang Gao, Chao He, Yue Hou, Fei Hu, Zhaojian Li, Weiran Shi, Zaiyuan Wang, Daoguang Zan, Chenchen Zhang, Xiaoxu Zhang, Qizhi Chen, Xianfu Cheng, Bo Deng, Qingshui Gu, Kai Hua, Juntao Lin, Pai Liu, Mingchen Li, Xuanguang Pan, Zifan Peng, Yujia Qin, Yong Shan, Zhewen Tan, Weihao Xie, Zihan Wang, Yishuo...

Listen to the Daily Paper Cast podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.