毅仔_wi2e
周六9点半
周六9点半,算法工程师真人talk show。平日由ai提供推荐系统相关的论文结论和播报
Where to listen?
Podcasts in the app Replaio Radio Coming soonPodcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts
Episodes
AI Agent 论文播报·2026-05-22 23.05.2026 11:07
这是 AI Agent 论文播报 在 2026-05-22 的论文播报。本期内容由 AI 自动生成,欢迎留言交流。 本期重点 Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents Ratchet: A Minimal Hygiene Recipe for Self-Evolving LLM Agents Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems ['今天的关键词是 harness:改接口、...
AI 计算广告论文播报·2026-05-22 23.05.2026 7:44
这是 AI 计算广告论文播报 在 2026-05-22 的论文播报。本期内容由 AI 自动生成,欢迎留言交流。 本期重点 LLM Retrieval for Stable and Predictable Ad Recommendations Beyond Single Slot: Joint Optimization for Multi-Slot Guaranteed Display Advertising 在小宇宙查看该单集文稿
AI Agent 论文播报·2026-05-21 22.05.2026 9:12
这是 AI Agent 论文播报 在 2026-05-21 的论文播报。本期内容由 AI 自动生成,欢迎留言交流。 本期重点 SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling MemGym: a Long-Horizon Memory Environment for LLM Agents ['Agent研究的精度正下沉到runtime和子系统:每一层都被拆开单独评测和优化'] 在小宇宙查看该单集文稿
AI 计算广告论文播报·2026-05-21 22.05.2026 6:29
这是 AI 计算广告论文播报 在 2026-05-21 的论文播报。本期内容由 AI 自动生成,欢迎留言交流。 在小宇宙查看该单集文稿
AI 计算广告论文播报·2026-05-20 21.05.2026 8:47
这是 AI 计算广告论文播报 在 2026-05-20 的论文播报。本期内容由 AI 自动生成,欢迎留言交流。 本期重点 Generative Auto-Bidding with Unified Modeling and Exploration LWGR: Lagrangian-Constrained Personalized World Knowledge for Generative Recommendation 在小宇宙查看该单集文稿
AI Agent 论文播报·2026-05-20 21.05.2026 5:14
这是 AI Agent 论文播报 在 2026-05-20 的论文播报。本期内容由 AI 自动生成,欢迎留言交流。 本期重点 EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision ['Agent 研究继续从模型能力转向执行链与系统边界...
AI Agent 论文播报|记忆投毒、SaaS评测翻车与Skill编译治理(2026-05-18) 18.05.2026 11:04
这期聊三篇让人警醒的论文:Agent 记忆被潜伏投毒注入率高达 99.8%、最强模型在真实 SaaS 工作流上端到端通过率不足 2%、以及把 skill 从"每次重读说明书"编译成运行时接口后 token 直降 57%。Agent 正在从拼 prompt 跑 demo 被推向编译、契约、审计的工程化阶段。 本期重点 * 记忆潜伏投毒(Hidden in Memory: Sleeper Memory Poisoning in LLM Agents)——首次系统化证明:只要在用户读的文档里藏一段话,就能在 Agent 长期记忆里...
AI计算广告论文播报|0518 生成式查表替代GSU,美团长序列CTR新范式 18.05.2026 6:11
长序列广告CTR预估正在从"匹配"范式滑向"生成"范式——本期围绕美团上线的生成式长期兴趣建模方法展开深度拆解,同时梳理当天推荐系统稳定性、向量检索加速、Agent记忆等散点信号。 本期重点 * 生成式长期用户兴趣建模(Generative Long-term User Interest Modeling for CTR Prediction):用短期行为生成三张兴趣分布,再以 O(1) 哈希查表替代逐条相似度计算,美团线上 RPM +1.5%,是当天最贴广告排序的工作,值得精读。 * 搜索推...
AI Agent 论文播报|Harness 决定 Agent 上限,不是模型(2026-05-15) 16.05.2026 9:12
同一个模型,换一层执行外壳(harness),安全分就从 0.30 跳到 0.37——今天三篇重点论文从安全、评测、数据三个方向切入,落点出奇一致:Agent 系统的真正瓶颈正在从模型层迁到外壳层、从单点输出迁到完整轨迹、从手工标注迁到规模化合成。 本期重点 * Agent Harness 安全审计(Auditing Agent Harness Safety):把安全评估的单位从"最终答案"换成"完整执行轨迹",提出三层审计框架——边界合规、执行保真、系统稳定。实验发现任务...
AI计算广告论文播报|0515 Semantic ID接管召回排序,天猫与美团的工业实践 16.05.2026 9:06
生成式召回不再是"未来方向"——天猫APP的生成式召回已贡献超过一半曝光和七成成交。本期围绕 Semantic ID 如何真正接管工业搜索推荐链路,精读两篇重磅论文,并点评一篇值得广告同学关注的 OPE 策略设计工作。 本期重点 * 天猫电商生成式检索(Efficient Generative Retrieval for E-commerce Search with Semantic Cluster IDs and Expert-Guided RL):用语义簇 ID 替代一物一码,类目约束首层量化 + 四阶段渐进训练 + 专家引导 R...
AI Agent 论文播报|0514 Agent研究集体进入 15.05.2026 9:41
这期聊一个让人有点不舒服的事实:十个主流 Agent 评测榜单,九个可以被自动工具刷到接近满分——而 Agent 一道题都没真做。今天三篇重头论文,分别对评测分数、skill 安全规则、Agent 自称的"完成"发起审计,方法论惊人一致:把隐性契约形式化,把执行过程留痕,把违规当可达性目标来检测。 本期重点 * BenchJack:系统化审计 Agent Benchmark 的 Reward Hacking(Do Androids Dream of Breaking the Game?) 伯克利团队提出 8 类 b...
AI计算广告论文播报|0514 离线提升47%就该上线?别急 15.05.2026 9:47
离线replay提升47.7%的floor策略,该不该直接上线?今天两篇重点论文都在回答同一个底层问题:在不能完整试错的环境里,怎么把"看起来好"和"真的能上"明确分开。同时,生成式推荐三篇齐发,工程化收敛的趋势越来越清晰。 🎧 本期重点 * RTB策略上线评审框架(Decision Support for Marketplace Policies under Incomplete Evidence)——把"评估策略好不好"升级成"现有证据够不够支持上线"。六个离线门+一个在线门的完整协议,在iPin...
AI Agent 论文播报|0513 记忆依赖推理全军覆没与工具调用鲁棒性拆解 14.05.2026 11:23
今天三篇重点论文共同指向一个判断:Agent 栈最脆的地方不在模型推理本身,而在信息如何在 Agent、工具、记忆之间流动。记忆系统的依赖推理平均准确率只有 3%,工具调用被误导命名骗走 40% 准确率——这些「接缝处的结构性失败」才是当前最值得关注的方向。 本期重点 * MEME:多实体演化记忆评测(MEME: Multi-entity & Evolving Memory Evaluation)——六大主流记忆系统在「上游事实变了,下游依赖事实怎么办」这种题上几乎全军覆没...
AI计算广告论文播报|5月13日:跨市场联邦CTR与统一自回归广告图文生成 14.05.2026 9:20
当模型不能再大、数据不能再合并,下一个增量来自哪里?今天两篇直接命中广告的重磅论文给出答案:用"中介层"——码本或统一解码序列——在合规与效率约束下榨出新红利。 本期重点 * FedMM: Federated Collaborative Signal Quantization for Multi-Market CTR Prediction——用双层 RQ-VAE 码本作为联邦传输介质,绕开跨市场 ID 不对齐和隐私限制,只共享"语义原型"就能把跨域兴趣信号注入 CTR 模型,AUC 提升显著且通信开销比 FedAvg...
AI Agent 论文播报|0512:1MB脚本戳穿评测假象,Agent正在补基础设施债 13.05.2026 11:03
一个不看屏幕的1MB小脚本,在主流Agent评测榜单上打败了前沿大模型——这不是行为艺术,而是整个Agent评测体系被戳穿的起点。本期聚焦三篇论文,拼出一幅清晰的图景:研究社区正集体从"造更强Agent"转向"让Agent的分数和运行时真正可信"。 🎧 本期重点 * Computer Use at the Edge of the Statistical Precipice Meta超级智能实验室的工作。用盲重放脚本证明:在静态环境下,pass@k测的是记忆而非能力。论文提出PRISM五条环境设计原...
AI计算广告论文播报|2026-05-12 生成式广告变现三层同时推进 13.05.2026 8:42
生成式广告变现的内容层、位置层、出价层今天同时有论文推进——这是一个研究领域正式启动的信号。本期围绕一价拍卖出价学习、LLM原生广告数据集与神经元拍卖机制展开深度解读。 本期重点 * 一价拍卖下带预算/RoS约束的出价学习(Learning to Bid with Unknown Private Values in Budget-Constrained First-Price Auctions):首次在"广告价值需从删失数据反推"的现实条件下,给出完整的理论方案——split-sample估胜率 + IPW学uplift...
AI Agent 论文播报|0511:把隐性结构变成一等对象 13.05.2026 9:50
今天三篇论文不约而同地在做同一件事:把 Agent 里藏在框架代码、prompt 模板和日志碎片里的隐性结构,翻出来变成可操纵、可查询、可修复的一等公民。Agent 要从 demo 走向长生命周期生产,必须先有可治理的内部表示——这期值得每一个做 Agent 产品的人听。 本期重点 * 自编程执行(Self-Programmed Execution):直接挑战所有 Agent 框架的核心假设——harness 必须控制编排。作者设计了一门 Lisp(Spell),让模型补全本身就是下一...
AI计算广告论文播报|0511 信号解耦比模型更值钱 13.05.2026 7:38
当排序模型遇到天花板,问题可能不在网络多深,而在你喂进去的信号本身就是纠缠的。今天我们围绕"偏好与相关性解耦"这个核心命题展开,并从一篇看似无关的惯性定位论文中提炼出对广告精排的跨领域启发。 本期重点 * PRISM: Refracting the Entangled User Behavior Space for E-Commerce Search —— 电商搜索中曝光机制、反馈循环与语义匹配导致偏好和相关性信号深度纠缠,PRISM 用残差偏好矫正 + LLM 语义原型锚定 + 偏好条件证据...
AI Agent 论文播报|0508:可靠性下沉到激活层与运行时监控 09.05.2026 10:32
这期聚焦一个清晰的方向转变:Agent 的可靠性问题正在从 prompt 层彻底下沉——深入模型内部激活空间做实时纠偏、用形式化求解器重塑评测基准、从执行轨迹合成在线失败预警。未来 Agent 护栏的形态,可能不再是更长的 system prompt,而是可审计的监控器加激活层钩子。 本期重点 * TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering——在残差流里发现 overthinking/overacting 两条线性可分的...
AI计算广告论文播报|生成式推荐价值对齐与预算守恒 2026-05-08 09.05.2026 8:57
今天聊的核心问题:生成式推荐如果只对齐语义、不对齐商业价值,在广告场景下会漏钱。同时,从广告召回到多智能体调度,"预算约束"正在成为跨场景的共同方法论。 本期重点 * 广告生成式推荐的统一价值对齐(Unified Value Alignment for Generative Recommendation in Industrial Advertising)——腾讯把商业价值从训练loss这个单点,贯穿到语义ID构建、解码器双头融合、在线个性化beam搜索三个环节。最有意思的点:SID最后一层用"...
AI Agent 论文播报|0507:安全红队沙箱、上下文策略化与80小时造芯片 08.05.2026 10:02
这期聊的是 Agent 最薄弱的三个环节——安全、记忆、工具协议——如何从外挂 trick 升级为系统级一等公民。三篇论文分别给出了红队评测基础设施、上下文弹性管理、以及超长程硬件设计的前沿方案,值得所有在做 Agent 产品的人花时间看看。 本期重点 * DTap:可控交互式 AI Agent 红队平台(DecodingTrust-Agent Platform)——首个面向 Agent 的大规模红队基础设施,把 Gmail、PayPal、Slack 等 50+ 真实系统 1:1 仿真成可重置沙箱,配套...
AI计算广告论文播报|5月7日:搜索广告元素级归因与生成式推荐HBM动态调度 07.05.2026 8:32
这期聚焦两个问题:搜索结果页上注意力和点击到底是怎么被各种组件分走的?生成式推荐的GPU显存该怎么在embedding表和KV缓存之间动态切分?两篇重点论文分别从数据基础设施和在线服务系统层给出了答案。 本期重点 * AllSERP: Exhaustive Per-Element Enrichment of the Versatile AdSERP Dataset——把Google商业意图SERP的眼动+鼠标数据从只标广告位扩展到13种元素类型、像素级边界框。最有意思的发现:顶部购物广告注视率99.7%但点...
AI Agent 论文播报|0506:工单拆分绕过安全对齐,86%漏洞利用率敲响警报 07.05.2026 12:16
三张看似无害的 Jira 工单,丢给九家生产级 Coding Agent,端到端漏洞利用率最高 86%。今天三篇重点论文共同指向同一个转变:AI Agent 研究正在从「看结果」走向「看全链路」——安全、评测、记忆,都要能被复现、被审计、被定位到具体哪一步。 本期重点 * MOSAIC-Bench:组合式漏洞诱导基准(MOSAIC-Bench: Measuring Compositional Vulnerability Induction in Coding Agents)——把一个 CVE 拆成三张普通工单,9 家 Coding Agent...
AI计算广告论文播报|0506 双通道条件注入与检索范式迁移 06.05.2026 7:44
这期聚焦一个核心问题:当系统里的"硬约束"和"软信号"被塞在同一条通路里,效果一定会打折——无论是视频生成还是检索触发。今天的论文给出了结构化拆分的多种思路。 本期重点 * AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics:腾讯动漫视频生成,提出双通道双路径条件注入——结构化标签走 AdaLN 强制执行硬约束,创意描述走交叉注意力做软引导。这套机制可直接迁移到广告创意视频生成中"品牌规范 vs...
AI Agent 论文播报|0505:安全与评测集体下沉到行为层 06.05.2026 9:57
当 9 个人类审计员盯着 Agent 文本输出逐条审查却一个都判不对时,说明什么?——光看 Agent 说了什么,已经查不出它做了什么。本期三篇论文从不同角度集体宣告同一件事:Agent 治理的战场正从文本层下移到行为层与架构层。 本期重点 * 合规差距(The Compliance Gap):揭示 Agent "口头答应却不照做"的结构性漏洞。75 个主流基准全测"结果对不对",没人测"过程有没有照做"。作者用两条定理证明:RLHF 结构上必然产生过程偏差,且仅...
Similar podcasts
Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.