每日新闻

每日AI

畅读AI学术论文,聚焦前沿趋势,普及人工智能

Author

每日新闻

Category

Technology

Podcast website

podcasters.spotify.com

Latest episode

Jul 10, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

MemOS:LLM记忆操作系统 20.03.2026

MemOS  是一种为大语言模型设计的 内存操作系统 ,旨在解决现有模型在长文本推理、个性化和知识更新方面的局限。该系统将内存视为一种可调度的 系统资源 ,统一管理 纯文本 、 激活态 和 参数化 三种异构内存类型。通过核心单元  MemCube ,MemOS 封装了内存内容及其元数据,实现了内存全生命周期的 可控性 、 可塑性 与 演进性 。这种架构建立在 内存分级 理论之上,支持知识在不同形态间无缝转换,从而降低计算成本并增强长期记...

OpenMOSS:RLCF社区反馈强化学习训练AI科学家 20.03.2026

这份研究介绍了  OpenMOSS  团队开发的  RLCF(社区反馈强化学习)  训练范式,旨在提升人工智能的“ 科学品味 ”。研究者利用  700,000 对 基于引用量匹配的论文数据,训练出具备模拟科学共同体判断能力的模型。其中, Scientific Judge  模型能够精准评估研究想法的潜在影响力,其表现超越了 GPT-5.2 等主流商业大模型。此外,以该评价模型作为奖励机制,团队进一步开发了  Scientific Thinker ,使其能够自主提出更具学术价值和原...

DeepSeek:Engram死记硬背让AI更聪明 19.03.2026

这篇文章介绍了一种名为  Engram  的新型大型语言模型模块,旨在通过引入 条件内存 (Conditional Memory)来解决传统 Transformer 在处理静态知识检索时的低效问题。研究团队发现,现有模型常需消耗多层计算来模拟简单的信息查找,而 Engram 能够通过  O(1) 复杂度的查表操作 直接提取 $N-gram$ 知识。通过对 稀疏分配 问题的深入研究,作者揭示了神经计算与静态内存之间的  U型扩展法则 ,从而在保持计算量不变的情况下显著提升...

Google DeepMind:MedGemma看病比医生还准的4B模型 19.03.2026

这份技术报告介绍了由 Google Research 和 Google DeepMind 开发的  MedGemma ,这是一系列专为医疗领域优化的 多模态大模型 。该模型家族基于 Gemma 3 架构,涵盖了  4B 多模态版本 和  27B 文本版本 ,能够理解并推理复杂的医学图像与文本。研究表明,MedGemma 在 视觉问答、医学影像分类及放射报告生成 等任务中表现卓越,性能甚至逼近某些特定任务的专用模型。报告还推出了  MedSigLIP  视觉编码器,进一步增强了模型对皮肤病...

ServiceNow+Mila:EnterpriseOps-Gym评估企业级智能体 19.03.2026

ENTERPRISEOPS-GYM  是一个专门用于评估大语言模型在复杂企业场景中 自主规划与工具调用能力 的基准测试平台。该平台模拟了一个包含  164 个数据库表 和  512 个功能工具 的交互式沙箱环境,涵盖了人力资源、IT 服务和客户服务等八大核心业务领域。研究表明,即使是性能顶尖的模型在处理长周期任务和 政策合规性 要求时仍面临巨大挑战,成功率普遍较低。通过对比实验发现, 战略规划能力 而非工具识别是制约模型表现的主要瓶颈。该...

Astera: TTT-E2E让AI边读边改权重 18.03.2026

这篇论文提出了一种名为  TTT-E2E  的新型语言模型训练方法,旨在通过 测试时训练(Test-Time Training)解决长文本处理难题。该方法打破了传统的静态模型范式,让标准 Transformer 在推理阶段通过预测下一个标记 持续学习,将上下文信息直接压缩进模型权重中。研究团队通过**元学习(Meta-Learning)**优化模型初始化,确保其在推理时的在线更新能有效降低预测损失。实验表明,该方法在处理  128K  超长上下文时,性能表现堪比全...

普林斯顿:OpenClaw-RL让AI在对话中实时进化 18.03.2026

OpenClaw-RL  是一个由普林斯顿大学等机构提出的创新  强化学习 (RL)  框架,旨在通过挖掘智能体与环境交互中被忽视的“次态信号”来提升性能。该研究指出,无论是用户的对话回复、终端执行结果还是 GUI 状态变化,都蕴含了评估性的 奖励信号 和指引性的 修正信息 。框架采用 异步解耦架构 ,支持策略推理、环境交互、奖励判定和模型训练并行运行,确保训练过程不会中断服务。针对个人助手,它通过  Hindsight-Guided OPD  技术将用...

Google:ELIXR用LLM读懂X光片 18.03.2026

本研究介绍了一种名为  ELIXR  的新型多模态医学人工智能系统,旨在通过将 放射影像编码器 与 大型语言模型(PaLM 2)相结合,突破传统医学 AI 任务单一的限制。该模型利用日常收集的胸部 X 光片 及其对应的 自由文本报告 进行高效训练,无需昂贵的人工标注。 ELIXR  在 零样本分类 、 数据高效分类 和 语义搜索 方面达到了顶尖性能,仅需极少数据即可匹敌传统监督学习模型。此外,它还展示了在 视觉问答(VQA)和放射报告质量检测...

AI-Trader:全自动化实时金融大模型评估基准-美股、A股和加密货币 16.03.2026

AI-Trader  是由香港大学研究团队推出的首个 全自动化、实时且无数据污染 的金融大模型评估基准。该框架涵盖了 美股、A股和加密货币 三大市场,旨在测试自主智能体在极端不确定性下的 实时决策与风险管理 能力。与传统静态测试不同,该系统采用 极简信息范式 ,强制智能体独立通过搜索和分析工具获取市场情报并执行交易。实验结果显示, 通用智能并不等同于交易能力 ,多数领先模型在实战中仍面临盈利波动和跨市场适应性不足的挑战...

SPO:自监督Prompt提示词工程优化 16.03.2026

这篇学术论文介绍了一种名为 自我监督提示优化(SPO)的创新框架,旨在通过自动化手段提升大型语言模型的推理与任务对齐能力。与依赖外部标准答案或人工干预的传统方法不同,SPO 仅利用模型自身的生成结果,通过成对输出比较 来提取评估和优化信号。这种 无需外部参考 的机制显著降低了成本,实验显示其开销仅为现有主流技术的 1.1% 至 5.6%,且仅需极少样本即可运行。研究结果证明,该方法在封闭式和开放式任务中均表现优异,甚至...

SkillFortify:数学逻辑应对Agentic AI技能漏洞 16.03.2026

这份研究报告介绍了一个名为  SkillFortify  的形式化分析框架,旨在应对  Agentic AI 技能供应链 中日益严重的安全性挑战。由于 OpenClaw 和 Anthropic 等生态系统的扩张,恶意技能通过 凭证窃取 和 远程代码执行 等手段带来了巨大的攻击风险。作者利用  Dolev-Yao 攻击者模型 和 抽象解释理论 ,为技能的权限边界提供了严谨的数学证明。该框架不仅能自动推断技能所需的 资源权限 并生成 确定性的依赖锁定文件 ,还建立了一套具有...

TradingAgents:AI模拟真实交易公司 16.03.2026

这项由  Tauric Research 、 UCLA  与  MIT  合作开展的研究推出了一种名为  TradingAgents  的创新型股票交易框架。该系统通过大型语言模型(LLM)模拟真实交易公司的组织架构,构建了一个由 分析师 、 研究员 、 交易员 和 风控团队 组成的协作式多智能体环境。这些智能体通过结构化报告和辩论机制,综合分析基础面、市场情绪及技术指标,有效克服了传统系统在复杂决策中逻辑中断和解释性不足的缺陷。实验结果表明,该框架在 累...

Menlo VC:医疗保健行业竟成2025 AI领头羊 16.03.2026

这份报告深度剖析了  2025 年医疗保健行业 AI 应用的爆发式增长 ,指出该领域目前的采纳速度已达到整体经济的两倍以上。 医疗机构 正通过缩短采购周期和加大资金投入,利用 AI 解决行政负担、人员短缺及临床效率等核心痛点。虽然传统的  EHR 巨头 依然占据市场优势,但由于  生成式 AI 初创公司  具备更敏捷的创新能力,目前吸纳了高达  85%  的相关预算。资金流动方向正从传统的软件支出转向庞大的 人力服务自动化市场 ,重点涵盖...

Essential-Web:15分钟筛选24万亿数据 16.03.2026

这份名为  ESSENTIAL-WEB V1.0  的研究报告介绍了一个包含  24万亿 token  的大规模开源网络预训练数据集,其核心创新在于为每份文档标注了涵盖主题、格式、复杂度和质量等  12个维度的分类体系 。研究团队开发了高效的  EAI-Distill-0.5b  分类器,将复杂的语料筛选过程简化为快速的 SQL 风格查询,大幅提升了数据处理效率。实验证明,通过该分类体系筛选出的数学、代码、STEM 和医疗领域的专用数据集,在性能上可与甚至超越经过...

BeyondWeb:30亿小模型靠重构数据逆袭 13.03.2026

这项由  DatologyAI  团队开展的研究推出了  BeyondWeb ,这是一种旨在克服互联网预训练数据短缺(即“数据墙”)的合成数据生成框架。该研究系统地对比了 生成器驱动型 (从无到有创造知识)与 来源改写型 (对现有网页内容进行重塑)两种范式,证明了后者在效率和质量上的优越性。 BeyondWeb  通过针对性的文档改写、风格匹配和策略多样化,实现了比传统网页数据集高出  7.7 倍 的训练加速,并显著超越了  Cosmopedia  等主流合成...

DCLM:好数据胜过暴力算力 13.03.2026

本文介绍了  DataComp-LM (DCLM) ,这是一个旨在通过优化训练数据来提升语言模型性能的开放性基准测试平台。研究团队提供了包含  240T token  的大规模原始语料库、标准化的训练方案以及多达  53 项评估任务 ,用于探索数据清洗和筛选的最佳策略。实验表明,基于模型的 质量过滤 (尤其是使用 fastText 分类器)是提升模型效率的关键,能显著降低对计算资源的需求。基于此方法构建的  DCLM-BASELINE  数据集,使 7B 参数模型在 MML...

MMLU-Redux:AI竟然在背错题拿高分 13.03.2026

这项研究揭示了广泛使用的 MMLU基准测试 中存在严重的 数据错误 ,这些错误往往会误导对大语言模型真实能力的评估。通过对57个学科的5,700个问题进行手动复核,研究人员开发了 MMLU-Redux 数据集,估算原始基准的整体错误率约为 6.49% 。调查发现,某些特定学科(如病毒学)的错误率竟高达 57% ,涵盖了 标准答案错误 、题目模棱两可及选项解析失误等多种类型。实验证明,修正这些错误会显著改变顶级AI模型的 性能排名 ,凸显了高...

加州大学:Clawdrain掏空OpenClaw AI预算 12.03.2026

这项研究介绍了一种名为  Clawdrain  的新型网络攻击,专门针对基于  OpenClaw  框架的智能体系统进行 令牌(Token)消耗与资源耗竭 。通过植入恶意插件,攻击者利用一种 分段验证协议(SVP)诱导大模型进入冗长的工具调用循环,从而大幅增加 API 账单成本。实验证明,该攻击在维持任务正确性的同时,能实现高达 6至7倍的令牌放大率,甚至在模型尝试自动纠错时达到 9倍 的峰值。研究强调,这种隐蔽的经济拒绝服务攻击 在自动化执行...

MIT:2025年95%企业AI投资零回报 12.03.2026

这份2025年7月的报告由 MIT NANDA项目 发布,深入分析了企业在生成式AI应用中面临的“ 生成式AI鸿沟 ”。研究指出,尽管全球投入巨大,却有 95%的企业未能获得实际回报 ,形成了高采用率与低转型率并存的局面。报告强调,成功的关键不在于模型质量,而在于 系统的学习能力和工作流整合 ,目前仅有5%的试点项目真正实现了业务价值。 外部合作模式 的成功率被证明是内部自研的两倍,且中型企业在落地速度上优于大型企业。此外,员工自...

普华永道:2025全球AI就业指数-赋能效率与价值增长 12.03.2026

普华永道发布的 2025年全球人工智能就业指数报告 指出,人工智能正显著提升 劳动生产率 并加速企业价值创造。研究显示,AI暴露程度较高的行业,其 人均收入增长率 是其他行业的三倍,且掌握AI技能的员工可获得高达 56%的薪资溢价 。报告反驳了AI导致大规模失业的担忧,强调自动化实际上是在 重新定义工作本质 ,使员工能够从琐事中解脱以处理更复杂的任务。各行各业正通过 全企业转型 和引入 智能体AI(Agentic AI)来获取增长,而...

Anthropic:2026.1经济指数报告与AI影响分析 11.03.2026

这份2026年1月的报告通过 经济原语 分析了AI对全球经济的影响,重点关注了 Claude 在任务复杂度、自主性和成功率等维度的表现。研究发现,虽然AI能显著提升 高学历要求任务 的处理效率,但其成功率会随任务复杂度的增加而下降。 地理分布 显示,高收入国家更倾向于协作增强模式,而低收入地区则多用于教育。报告还指出,AI正在引发职业 去技能化 或 技能升级 的变革,其对生产力的实际贡献受限于任务的可靠性。总之,数据表明AI的...

Google:开源TranslateGemma小模型翻译反超大模型 11.03.2026

TranslateGemma  是由 Google 团队开发的一系列开源机器翻译模型,基于  Gemma 3  基础模型构建。该研究通过 监督微调 (SFT)  和 强化学习 (RL)  两个阶段,利用合成数据与人类翻译样本显著提升了多语言翻译质量。评估结果显示,这些模型在  WMT24++  等多个基准测试中表现优异,且较小尺寸的模型往往能达到甚至超越更大基准模型的性能。此外,该模型成功保留了原有的 多模态能力 ,能够有效处理图像中的文本翻译任务。这一成果为...

阿里:SWE-CI评估Agent在持续集成中的代码维护能力 11.03.2026

SWE-CI  是一个针对大语言模型(LLM)智能体设计的创新型基准测试,旨在评估其在真实场景下的 长期代码维护能力 。与传统的单次静态修复测试不同,该研究通过模拟 持续集成(CI)循环 ,要求由“架构师”和“程序员”组成的 双智能体系统 协同处理复杂的代码演进任务。该基准包含来自真实 GitHub 仓库的  100 个任务 ,平均每个任务涵盖长达  233 天 的开发历史。研究引入了  EvoScore  指标,通过衡量模型在多次迭代中 避免回归错误...

FinePhrase:万亿级合成数据实战指南 10.03.2026

该文件详细介绍了 Hugging Face 开发的  FinePhrase  合成数据集及其背后的系统性研究。作者通过  90 项实验 和超过  1 万亿令牌 的生成测试,揭示了将杂乱的网页文本转化为高质量预训练数据的最佳方案。研究强调 提示词设计 (如 FAQ、数学和图表格式)对模型性能的影响远超模型规模,且  1B 级的小型模型 已足以胜任生成任务。此外,文中还分享了利用  DataTrove  基础设施实现高效推理的硬件优化策略与吞吐量基准。最终结论指出...

Anthropic:助手轴与LLM角色人格 10.03.2026

Anthropic 研究人员发现的“ 助手轴 ”(Assistant Axis),这是一种存在于大语言模型神经激活空间中的特定方向。研究表明,模型在预训练阶段吸收了无数角色原型,而后期训练则试图将其锚定在“ 助手 ”这一特定人格上。然而,模型的人格往往并不稳定,在涉及 情感交流 或 深度自省 的对话中,模型容易偏离助手定位,产生鼓励自残或强化幻觉等有害行为。通过一种名为“ 激活限制 ”(activation capping)的技术,研究者可以物理性地约束...

Listen to the 每日AI podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.