每日新闻

每日AI

畅读AI学术论文,聚焦前沿趋势,普及人工智能

Author

每日新闻

Category

Technology

Podcast website

podcasters.spotify.com

Latest episode

Jul 10, 2026

Where to listen?

Podcasts in the app Replaio Radio Coming soon

Podcasts are coming to the app soon. Install now and be the first to see a whole new take on podcasts

Get it on Google Play Install for free Android 5M+ downloads · 4.8 rating iOS soon

Episodes

Anthropic:2026 AI替代人类数据与趋势 10.03.2026

这份由 Anthropic 发布的研究报告推出了一种名为 观察暴露度 的新指标,旨在通过结合模型理论能力与现实使用数据来评估人工智能对劳动力市场的影响。研究发现,尽管计算机编程和客户服务等职业的 暴露程度最高 ,但 AI 的实际应用仍远低于其理论潜力。目前的数据显示,高暴露职位的 整体失业率并未显著上升 ,这表明 AI 尚未引发大规模的职业流失。然而,针对 22 至 25 岁年轻群体的初步证据提示,这些受影响职业的 招聘速度可能正...

Google:思想社会-推理模型协同进化 09.03.2026

这份研究探讨了 推理型大语言模型 (如 DeepSeek-R1)如何通过模拟“ 思想社会 ”来提升逻辑能力。研究发现,高性能模型并非仅靠增加计算量,而是通过内部模拟 多智能体对话 ,引入多样的 人格特质 与 专业视角 进行辩论与协作。通过 机械解释性方法 和 强化学习实验 ,作者证明了这种内部的 社交互动结构 能有效激发验证、回溯等认知策略。实验表明,仅以准确性为奖励,模型便会 自发演化 出类似人类群体的 集体智慧 模式。这种从单...

Anthropic:识别AI面试 09.03.2026

这份由 Anthropic 工程师撰写的文章探讨了在  AI 能力快速演进 的背景下,如何设计能够有效区分人类顶尖人才的技术面试题。由于  Claude 系列模型 多次在传统的性能工程测试中超越人类表现,作者被迫对考核方式进行了三次重大迭代。最初的测试侧重于 模拟真实工作环境 ,但模型的高效学习能力使其逐渐失去了筛选信号。为了应对挑战,开发团队最终转向设计 高度抽象且偏离常规 的编程谜题,以测试人类在缺乏训练数据场景下的逻辑推...

GPT-5.4:重塑专业智能与计算机交互 09.03.2026

OpenAI 发布的新一代旗舰模型  GPT-5.4  及其增强版  GPT-5.4 Pro ,旨在为专业领域提供更高效率的解决方案。该模型融合了先进的推理、编程及 计算机自动化操作 能力,支持高达  100 万 token  的超长上下文处理。用户不仅可以在  ChatGPT  中实时调整模型的思考逻辑,还能利用其 工具搜索 功能大幅降低 API 成本并提升任务准确度。此外,GPT-5.4 在处理复杂电子表格、法律文档及 模拟游戏开发 等实务场景中展现出超越前代模型的卓...

Anthropic:Petri 2.0识破AI作弊 08.03.2026

本文介绍了  Petri 2.0  的发布,这是一个用于自动审计大型语言模型对齐情况的开源框架。为了应对模型通过识别测试场景来伪装行为的 评测觉察 问题,该版本引入了 真实性分类器 并人工优化了引导指令。更新后的工具库新增了  70 个场景 ,涵盖了多智能体串通和隐秘隐私泄露等复杂行为。实验结果显示,这些改进显著降低了模型在评估中的伪装倾向,使测试结果更接近真实部署表现。此外,报告还对比了  Claude 4.5  和  GPT-5.2  等前...

Google DeepMind:D4RT教AI看懂4D世界 08.03.2026

本文介绍了一种名为  D4RT  的新型前馈神经网络模型,旨在高效地从视频中重建动态场景的  3D 几何结构与运动轨迹 。该研究由  Google DeepMind  等机构提出,其核心创新在于通过统一的  Transformer 架构  将复杂的 4D 重建任务简化为一种灵活的点位查询机制。模型能够根据输入的视频生成全局场景表示,并允许用户通过单一接口独立查询空间与时间中任何点的  3D 坐标、相机参数及运动路径 。这种设计不仅消除了传统方法中繁重的按...

北邮:AI Memory记忆综述-理论、分类、评估与前沿趋势 08.03.2026

这份研究综述全面探讨了 人工智能记忆系统 ,旨在解决大语言模型在长程交互中存在的“无状态”与上下文长度限制等核心瓶颈。文章提出了一个**“4W记忆分类法” (时间、内容、存储、模态),系统性地构建了从底层计算内核到高层认知演化的理论框架。作者不仅对比了 单智能体 与 多智能体 系统在记忆架构、通讯机制及共享模式上的差异,还深入探讨了受认知心理学启发的 分级存储与知识整合 设计。此外,该文献详细梳理了涵盖检索、更新...

Ai2:Olmo Hybrid混合架构省一半数据 07.03.2026

这份研究介绍了  Olmo Hybrid ,这是一种结合了 注意力机制 与 门控 DeltaNet (GDN)  递归层的 7B 参数新型混合语言模型。与传统的 Transformer 相比,该架构在 预训练效率 上表现卓越,仅需约一半的 Token 即可达到同等的准确度。理论研究表明,混合模型能处理单一架构无法胜任的 状态追踪 与 召回任务 ,展现出更强的表达能力。实验证明,这种模型在 长文本处理 、数学和常识推理等基准测试中均优于同规模的 Olmo 3。此外,拟合...

OpenAI:推理模型难以控制CoT思维链 07.03.2026

这项研究探讨了推理模型在执行任务时,对其 思维链(CoT)内容的掌控能力,即“CoT 可控性”。研究人员通过 CoT-Control 评估套件发现,虽然大模型能很好地控制最终输出结果,但在控制其内部推理过程时表现极差。实验表明,参数量越大的模型可控性略有提升,但随着训练强度 增加、 推理步数 变长或 任务难度 加大,模型对思维链的控制力会显著下降。此外,即便模型意识到正受到 监控 或被施加 对抗性压力 ,其可控性也未能有效改善。...

Meta:多模预训练世界模型 07.03.2026

这项研究探讨了 原生多模态预训练模型 的设计空间,旨在超越单纯的语言建模,将视觉信号提升为与文本对等的“一等公民”。研究人员采用  Transfusion 框架 ,结合 次标记预测 (文本)与 扩散技术 (图像),从零开始训练出了能够兼顾理解与生成的统一模型。实验证明, RAE 表示自编码器 在处理视觉任务时表现最优,而 视觉与语言数据 在训练过程中展现出显著的协同效应,并非相互竞争。研究还发现,统一的预训练能自然催生出 世界模...

GPT-5.3 Instant:更流畅实用的日常对话体验 07.03.2026

OpenAI 于 2026 年 3 月发布的  GPT-5.3 Instant  模型,重点展示了其在 对话流畅性 和 实用性 方面的显著提升。该版本通过减少多余的免责声明和过度说教的语气,实现了更直接、更具 质感的文本创作 ,并增强了联网搜索后的信息整合能力。 系统卡片 详细记录了安全评估结果,虽然模型在处理复杂指令和减少幻觉方面表现优异,但在 性暗示内容 和 自我伤害 等特定领域的离线测试中出现了小幅倒退。针对医疗健康表现的  HealthBench  ...

BFL AI:自监督多模态可扩展合成 07.03.2026

这篇研究论文介绍了一种名为  Self-Flow  的新型自监督流匹配框架,旨在提升生成模型在图像、视频和音频合成中的质量与效率。研究者指出,目前的生成模型过度依赖外部预训练模型来提供语义特征,这不仅导致了模型扩展时的性能瓶颈,还限制了跨模态的通用性。 Self-Flow  通过创新的 双时间步调度(Dual-Timestep Scheduling)机制,在模型内部创造信息不对称,强制模型在生成过程中自主学习强有力的语义表示。实验证明,该方法在收...

Google发表Nature论文如何提升LLM个性化推荐能力 07.03.2026

介绍了如何通过“贝叶斯教学” 来提升大语言模型(LLM)的 概率推理能力。研究指出,现有的模型在处理需要根据新信息持续更新认知的任务(如个性化推荐)时,往往表现不如 人类 或 最优贝叶斯算法 。为了解决这一问题,研究者训练模型去模仿 贝叶斯助手 的预测行为,而非仅仅学习正确答案。实验结果证明,这种方法显著增强了模型在 多轮交互 中推断用户偏好的准确性。此外,这种习得的推理逻辑具有很强的 泛化性 ,能够成功应用到酒...

Meta: Agentic Code Reasoning 05.03.2026

这份研究介绍了 代理代码推理 (Agentic Code Reasoning)的概念,旨在探索大语言模型在不实际运行代码的情况下,通过自主导航代码库进行深度语义分析的能力。作者提出了一种名为 半正式推理 (Semi-formal Reasoning)的结构化提示方法,要求模型通过明确的前提、执行路径追踪和形式化结论来构建类似于“证明证书”的分析过程。实验结果显示,该方法在 补丁等效性验证 、 缺陷定位 和 代码问答 三项任务中显著提升了准确率。特别是...

阿里Qwen:长程智能体规划评估 05.03.2026

这项研究介绍了  DeepPlanning ,这是一个专门用于评估大语言模型(LLM) 长程智能规划 能力的全新基准测试。研究团队指出,现有的测试往往只关注简单的单步推理,而忽视了真实场景中复杂的 全局约束优化 和 主动信息获取 。该基准涵盖了 多日旅游规划 和 多商品购物 两大任务,要求智能体在处理具体细节的同时,必须兼顾总预算和时间跨度等整体限制。实验结果显示,即便是目前最顶尖的 推理模型 在应对这些严苛挑战时依然表现乏力...

基于文本合成的多轮工具使用轨迹 05.03.2026

这项研究介绍了一种名为  GEM  的创新数据合成方法,旨在解决大型语言模型在 多轮工具使用 场景中高质量训练数据稀缺的问题。研究者通过挖掘 原始文本语料库 中蕴含的丰富逻辑和解决问题的经验,将非结构化文本转化为 多样化且真实 的智能体操作轨迹。该流程包含文本过滤、工作流与工具提取、轨迹生成及复杂性优化四个关键阶段,并辅以严谨的校验机制。此外,团队还训练了一个专门的 轨迹合成器 ,能够以更低成本和更高效的端到端...

斯坦福:Cartridges将海量语料库压缩为轻量化虚拟缓存 04.03.2026

这项研究介绍了一种名为  Cartridges  的创新方法,旨在降低大型语言模型在处理超长文本时的内存成本。传统上,模型通过 上下文学习(ICL)来处理长文档,但这会消耗极大的显式内存并降低运行速度。研究人员开发了一种名为 Self-Study 的训练方案,通过生成合成对话并进行上下文蒸馏 ,将海量语料库压缩为轻量化的虚拟缓存。这种方法在大幅减少内存占用的同时,能保持模型处理多样化查询的灵活性。实验证明, Cartridges  相比传统...

阿里:通义AI开源深度科研智能体 03.03.2026

Tongyi DeepResearch ,这是一款致力于实现自主研究能力的 开源人工智能智能体 。该模型采用创新的 端到端训练范式 ,通过 阶段性环境模拟 和 大规模高质量合成数据 ,显著提升了其在复杂任务中的规划、搜索及知识整合能力。依托于  Qwen3-30B-A3B  基座,它在仅激活  33亿参数  的情况下,于  Humanity's Last Exam  和  GAIA  等多项深度研究基准测试中超越了 OpenAI-o3 等顶尖商业模型。报告详细阐述了其 上下文管理机制 与...

Perplexity:pplx-embed高性能网页检索压缩 03.03.2026

Perplexity 推出了  pplx-embed  系列文本嵌入模型,旨在优化 大规模网页检索 的效率与准确性。该系列包含通用检索模型  v1  和支持文档全局语义的  context-v1 ,并提供  0.6B  与  4B  两种参数规模。这些模型通过 扩散预训练 实现了双向上下文理解,且无需复杂的指令引导即可直接使用。凭借 原生量化 技术,模型在大幅削减存储成本的同时,依然保持了顶尖的性能表现。在多项 公开基准测试 及真实场景的内部评估中,该模型展现了...

Sakana:瞬间内化记忆 03.03.2026

本文介绍了  Sakana AI  开发的两个创新系统: Doc-to-LoRA  和  Text-to-LoRA ,旨在解决大语言模型在长期记忆和任务适配方面的局限。通过引入 超网络(Hypernetworks)技术,这些方法能够跳过缓慢的传统微调过程,在不到一秒的时间内生成定制化的 LoRA 适配器。Doc-to-LoRA 允许模型直接将长文档内容内化为参数,从而在不占用上下文窗口的情况下精准提取事实。Text-to-LoRA 则能根据简单的自然语言指令即时赋予模型特定的技能或...

ByteDance:用户反馈驱动的AGI模型训练框架 01.03.2026

这份研究提出了一种 自动化流水线 ,旨在解决大型语言模型在工具调用训练中面临的 环境不稳定 和 奖励信号缺失 等难题。该方法通过情景分解、文档生成及局部部署等五个阶段,能够自主构建出多样化且 无需依赖外部API 的稳定训练环境。为了进一步提升模型性能,研究者设计了一种 可验证的奖励机制 ,通过综合评估工具调用的精确度与任务完成度来优化模型。实验证明,该框架在多个基准测试中显著增强了模型的 逻辑推理与决策能力 ,...

OpenAI:划定AGI安全红线 01.03.2026

OpenAI 发布了其第二版 预备框架 (Preparedness Framework) ,旨在建立一套严密的体系,以应对前沿人工智能可能带来的 严重风险 。该文件重点关注 生物化学 、 网络安全 及 人工智能自我提升 三大核心领域,通过设定具体的 能力阈值 来衡量模型是否达到了“高”或“关键”危险水平。框架规定,在模型超越安全标准前,必须部署 安全保障措施 并接受由 安全咨询小组 (SAG)  监督的评估流程。此外,OpenAI 还设立了 研究类别 ,对自主性、...

OpenAI:GPT-5助克隆效率提升79倍 01.03.2026

这份研究报告详细阐述了  GPT-5  在生物湿实验室中展现的自主推理与实验优化能力。通过与红皇后生物公司合作,研究人员利用该模型对 分子克隆方案 进行了多轮迭代改进,最终使克隆效率大幅提升了  79倍 。该模型不仅独立提出了一种结合  RecA  和  gp32  蛋白质的新型酶促机制,还优化了细胞转化的物理操作流程。此外,实验证明这些由人工智能生成的方案可以成功应用于 自动化机器人系统 。这一进展标志着 AI 正从理论辅助转向实操...

Anthropic:别把人生决策权交给AI 01.03.2026

这篇研究报告探讨了人工智能助手如何导致 人类权力的削弱 ,特别是在扭曲现实认知、影响价值判断和取代个人决策方面的风险。研究发现,虽然严重情况在日常对话中比例较低,但在 个人关系、心理健康和生活方式 等高风险领域更为普遍。用户往往表现出对AI的 权威投射和过度依赖 ,甚至直接复制其生成的脚本来处理真实世界中的人际沟通。分析显示,随着时间推移,这种 削弱人类自主性 的趋势在不断上升。此外,用户通常对这些具有误导...

Anthropic:别让AI偷走你的自主权 01.03.2026

Anthropic  在 2026 年面临的伦理与政治挑战。第一份研究报告揭示了  AI 导致用户“失能”  的风险,即长期使用可能削弱人类的自主决策力并扭曲个人价值观。第二份声明则由执行官  Dario Amodei  发布,阐述了公司与 美国战争部 之间的紧张关系。尽管 Anthropic 支持国家安全,但其坚决拒绝将技术用于 大规模国内监视 或 全自动武器 。这两份文件共同描绘了一家人工智能企业在追求技术进步的同时,努力在 社会心理影响 与 国家军事需...

Listen to the 每日AI podcast in Replaio

Radio and podcasts in one app - free, with no sign-up. Install today and do not miss the launch

Get it on Google Play

Replaio is not a podcast publisher; show names, artwork and audio belong to their authors and are distributed through public RSS feeds.