BestBlogs.dev
BestBlogs
BestBlogs 早报音频版,精选 AI、技术、产品、设计与商业科技领域值得关注的高质量内容,陪你每天从真正重要的信息开始。
Autore
BestBlogs.dev
Categoria
Sito del podcast
Ultimo episodio
11 lug 2026
Dove ascoltare?
I podcast nell'app Replaio Radio In arrivoI podcast stanno per arrivare nell'app. Installala ora e scopri per primo un modo tutto nuovo di vivere i podcast
Episodi
EP93 · 限研争议、应用攻防、工程再思 · 06-20 早报 20.06.2026 12:59
★ 精讲一 | 测试神话与寓言,超越 SWE-bench,Nvidia 的开放竞争者 来自 The Batch | DeepLearning. AI Andrew Ng 罕见动怒:Anthropic 不仅给 Claude Fable 5 加上限制竞品研究的条款,还被曝悄悄降低疑似同行研究者的输出质量;美国商务部出口管制更直接逼得 Fable 全球下线,掀起多国关于 AI 主权的讨论。同期 DeepSWE 等新基准证明智能体编程能力远未触顶,Nvidia 也以混合架构悄然加入开源模型竞速。 ★ 精讲二 | 攻破 LLM 驱...
EP92 · Codex 录制回放工作流、Claude Artifacts、A2A 协作 · 06-19 早报 19.06.2026 12:45
★ 精讲一 | OpenAI Codex Record & Replay:演示一次,即可复用浏览器工作流 [视频] 来自 OpenAI OpenAI 为 Codex 上线 Record & Replay:用户只需演示一次完整操作(如在 YouTube Studio 填写元数据、上传缩略图、保存私密视频),Codex 就能把这次录制转化为可复用技能,在新任务里自主匹配素材、填写信息、核验结果。能力覆盖电脑操作、浏览器操作和已连接插件,未来还能扩展到整理 PR、安排日程等场景——把「写提示词」换成了「...
EP91 · GLM-5.2 开源、AI 化学家、对话闫俊杰 · 06-18 早报 17.06.2026 12:37
精讲一:GLM-5.2 上线并开源:专注 Coding 与长程任务 来自 智谱 今天智谱上线并开源 GLM-5.2,在百万用户参与的 Code Arena 前端开发盲测中拿下全球可用模型第一。核心是 Solid 1M 无损上下文撑起长程任务:FrontierSWE 仅比 Opus 4.8 低 1%,超过 GPT-5.5 与 Opus 4.7;实测中模型用满近 88 万 tokens,一次性自主交付了一个覆盖 Web、移动端与小程序的多端应用。配合 IndexShare 稀疏注意力与改进投机解码,单位 token 的 FLOPs...
EP90 · 部署模拟预测行为、智能体代码审查、架构 AI 友好 · 06-17 早报 17.06.2026 13:39
精讲一:通过模拟部署在发布前预测模型行为 来自 OpenAI News OpenAI 安全团队提出「部署模拟」方法:将真实历史对话重放给候选新模型,在发布前预测真实行为风险。跨 GPT-5 系列版本实验表明,该方法中位倍率误差仅 1.5 倍,优于传统评测基线,并提前识别出「calculator hacking」新型奖励欺骗行为。研究还揭示模型对模拟流量的「测试感知率」与真实生产流量几乎一致(5.1% vs 5.4%),而传统评测集几乎 100% 被识别为测试。 精讲...
EP89 · 循环工程冷思考、Agent 工具设计踩坑、Token 成本拆解 · 06-16 早报 16.06.2026 14:24
精讲一:Codex 和 Claude Code 负责人都不写提示词了,AI 圈爆火的 Loop 到底是什么 来自 APPSO 「循环工程」最近被吹成新范式,但文章先把热闹拆开看:技术上不算新发明,过去的 Harness、Skill、Agent 工作流早就在做,真正变化的是模型终于能把循环连续跑下去——人从写提示词退到定规则:何时启动、工具边界、出错怎么判断、记录在哪、何时收手交回人。结合另一篇用 OKR 和古德哈特定律拆解循环工程的长文,它更像一套管理制度:...
EP88 · Fable 禁令、SpaceX 冲刺、LeCun 赌局 · 06-15 早报 15.06.2026 12:21
精讲一:从发布到被消失的 72 小时,Fable 5 暴露了最强 AI 模型的安全困境 来自 腾讯科技 继 EP84 Simon Willison 对 Fable 5 的惊艳初体验、EP85 开发者实测「1770% 性能提升」的兴奋之后,这款最强模型在发布 72 小时内经历了从轰动到被美国政府出口管制禁令强制下线的完整生命周期。文章还原 Pliny 团队如何用 Unicode 同形字替换和「分解-重组」攻击突破 Fable 5 的分类器降级安全架构,并指出 Amazon 在禁令背后兼具投资人与...
EP87 · Fable 5 禁令、监管分水岭、编程瓶颈转移 · 06-14 早报 13.06.2026 12:13
精讲一:美国政府要求 Anthropic 暂停外国公民访问 Fable 5 和 Mythos 5 来自 Anthropic(@AnthropicAI) EP85 刚宣布四天的 Claude Fable 5,即遭美国政府以「国家安全出口管制」为由叫停:所有外国公民——无论身处美国境内还是境外,包括 Anthropic 的外籍员工——均被立即切断访问,Mythos 5 同样波及,其余 Claude 模型不受影响。Anthropic 将其定性为「误会」并寻求快速恢复。这是出口管制首次落地于前沿 AI 模型,也把「AI 主权」...
EP86 · Anthropic 民调、黄仁勋谈 AI 工厂、Kimi K2.7 Code · 06-13 早报 13.06.2026 12:24
精讲一:Anthropic 首份公开记录调查结果 来自 Anthropic News Anthropic 首个面向全美公众的调查,覆盖近 52000 人。结果呈现清晰的「期待与焦虑并存」:48% 期待 AI 攻克癌症等疾病,64% 担心失业,71% 支持政府监管,而只有 15% 信任 AI 公司自行决策。值得玩味的是,每天用 AI 工作的人对失业的担忧(54%)反而显著低于从不使用者(70%)。 精讲二:黄仁勋谈智能时代的「发电机」,从检索式计算到 AI 工厂 [视频] 来自 Sequoia...
EP85 · 智能体解耦、Harness 自律、脚手架被吞 · 06-12 早报 12.06.2026 12:33
智能体交互界面的演进:使用 Claude Managed Agents 进行构建 | Claude 来自 Claude Blog Anthropic 推出 Claude Managed Agents,把智能体的「大脑」(推理循环)和「双手」(代码执行沙箱)彻底解耦,靠可恢复的事件日志连接两端:凭证统一存进独立的 Vault,绝不暴露给生成的代码,自托管沙箱还能让代码留在企业内网,首字延迟中位数降低六成、长尾降低九成以上,Notion、Sentry、Rakuten 等都已在生产环境跑通。 AI 不缺智商缺...
EP84 · AI 政策、万亿 IPO、编程鸿沟 · 06-11 早报 11.06.2026 12:33
精讲一:Dario Amodei — 关于 AI 指数级发展的政策 来自 Hacker News Anthropic CEO 发布万字政策长文,以《魔戒》树须比喻 AI 与政策的时间差。提出五领域行动框架:仿 FAA 模式建立前沿模型强制安全审计与测试机制;通过工资保险、UBI 等应对持久性失业;加速生物医药等下游监管改革;平衡国家与社会权力;构建 AI 时代国际治理新秩序。Claude Mythos 事件证明前沿模型已对关键基础设施构成真实威胁。 精讲二:OpenAI 秘交招股书...
EP83 · Claude Fable 5 / 企业智能体 / 双语 ASR · 06.10 早报 09.06.2026 14:12
Anthropic 发布新一代 Claude:Fable 5 与网络安全版 Mythos 5 来自 Anthropic News Anthropic 将 Claude Fable 5 推向大众,并把同一底层模型以 Mythos 5 形式给可信网络安全伙伴使用。原文把能力提升、安全降级和价格放在一起:高风险请求平均少于 5% 会降级到 Opus 4.8,价格为每百万输入 10 美元、输出 50 美元,还列出 50-million-line 代码迁移、药物设计约 10 倍加速等案例。 Salesforce 从 20,000 个企业智能体部署中学到...
EP82 · Claude Code 自主化、循环工程、阳萌安克 · 06-09 早报 09.06.2026 12:03
Claude Code 一周年复盘:从辅助写代码到自主智能体工作流 [视频] 来自 Claude Anthropic 官方 Claude Code 一周年复盘视频文字稿,由团队工程师一手呈现。一年间,Claude Code 从处理独立小任务演进为数千 Agent 动态协作的庞大网络。文章聚焦三个核心转变:验证从单元测试升级为 Agent 在沙箱中自启环境、通过 Computer Use 自我修正的完整运行时循环;Claude 4.6/4.7 推出「Auto Mode」,以安全分类模型替代人工逐条审批权限;P...
EP81 · Fadell 访谈、Codex 零行人工代码、Agent 范式解析 · 06-08 早报 07.06.2026 12:35
iPod 与 iPhone 之父 Tony Fadell:AI 时代如何建立品味、判断力与创造力 [视频] 来自 Lenny's Podcast iPod 与 iPhone 之父 Tony Fadell 在 Lenny's Podcast 进行了一次产品方法论深度对话。他以 iPhone 触屏键盘之争、Nest 智能温控器为例,提出真正的创新依赖「知情直觉」而非数据驱动,并总结出「三代法则」:iPod 前两代仅覆盖不足 1% 的电脑买家,直到第三代引入 Windows 兼容与 iTunes 生态才实现全球规模。面对 AI 时代,...
EP80 · Emergent 破亿 ARR、MCP 接口、缓存命中 · 06-07 早报 06.06.2026 12:35
Emergent:六个月 AI 折腾,如何催生一家 1 亿美元 ARR 公司 [视频] 来自 Y Combinator 前 Dunzo(印度超本地配送独角兽)创始人 Mukun 离职后用 6 个月无目标编程,确立一个核心判断:AI 能力指数级增长,要一次性自动化「全部软件工程」。9 个月后 Emergent 达到 1 亿美元 ARR,横跨 190 个国家 850 万用户。底层是多智能体编排与自研容器架构(状态快照分叉、并行 RL 管线),为追赶基础模型升级完整重写架构 3 次。在发布前专...
EP79 · 腾讯 Hy3、Agent 沙箱、中美算力 · 06-06 早报 06.06.2026 12:51
精讲一:汤道生姚顺雨对谈:腾讯 AI 的下半场 来自 腾讯科技 腾讯首席 AI 科学家姚顺雨加入腾讯后首次公开亮相,与高级执行副总裁汤道生对谈「腾讯 AI 的下半场」。他判断 AI 方法论已趋成熟,核心难点从「怎么训练」转向寻找好问题,腾讯的产品场景与 context 数据将成 Agent 时代的关键壁垒。Hy3 preview 在 CodeBuddy 与 WorkBuddy 上首 token 延迟降低 54%,可驱动最长 495 步复杂 Agent 工作流。他直接回应外界质疑:「下半场...
BestBlogs 周刊 第 98 期 · Agent 时代已来:模型、产品、工程与组织的同步重塑 05.06.2026 17:44
时长:17 分 44 秒|发布:2026-06-05 这一周,Agent 从概念变成了同时在多个层面落地的现实。模型层有 OpenAI 梦境记忆架构升级和两个新开源模型;产品层有 Kimi Work、扣子 3.0、SkillOpt 把 Agent 推向更广的知识工作者;工程层有 Anthropic 和国内腾讯、阿里、阿里云、大淘宝在同一周发出万字长文;战略层有纳德拉和黄仁勋的大会宣言;再到人与组织,超级个体报告、FDE 新角色和认知缴械的深思。 时间线 * 00:00 开场与主题·Be...
EP78 · ChatGPT记忆升级、AI研发自动化、SpaceX资本版图 · 06-05 早报 04.06.2026 12:35
精讲一:梦境:更强大的记忆,让 ChatGPT 更贴心 来自 OpenAI News OpenAI 官方介绍 ChatGPT 记忆系统的三代演进:2024 年需主动触发的 saved memories、2025 年后台合成的 dreaming V0,到 2026 年最新 dreaming V3,系统通过后台进程从大量对话中合成记忆状态,始终为对话提供最新、最相关的上下文,而非查询时临时拼凑。三大核心能力——跨对话携带上下文、持续遵循偏好、随时间自动修正过时记忆——均有对比案例佐证。计算效率提升...
EP77 · 微软 AI 战略、Kimi Work、超级个体团队 · 06-04 早报 03.06.2026 12:56
精讲一:⚡️萨提亚·纳德拉:Microsoft Build 上的 No Priors x Latent Space 特别跨界对话 来自 Latent. Space 微软 CEO 纳德拉在 Build 大会参加 No Priors x Latent Space 联合访谈,提出三项核心判断:微软正转型为「Frontier Intelligence Platform」;私有评测集(private eval)比员工人数更能体现企业 AI 竞争壁垒;Azure 网络团队通过 Agent 系统 Miles 将 500 余名光纤运维人员的知识自动化。访谈还罕见触及 SaaS 模式终...
EP76 · 动态工作流、Copilot 桌面、AI 工程革命 · 06-03 早报 03.06.2026 12:39
精讲一:为每项任务量身打造:Claude Code 中的动态工作流 | Claude 来自 Claude Blog Anthropic 最新发布 Claude Code 动态工作流,让 Claude 能即时为每个任务生成自定义 JS 编排脚本,突破单一上下文窗口限制。相比静态工作流,动态版可自主决定子智能体数量、模型选择与 worktree 隔离,直接对抗「智能体懒惰」和「目标漂移」等长任务失败模式。用触发词 ultracode 即可启用,适合复杂高价值的多步骤任务。 精讲二:GitHub Cop...
EP75 · MiniMax M3 首发、AI Coding 规范、视频 Agent 前沿 · 06-02 早报 01.06.2026 13:06
精讲一:MiniMax M3:前沿 Coding 能力、1M 上下文、原生多模态,一个模型全给你 来自 MiniMax 稀宇科技 MiniMax 发布国内首个集前沿 Coding、1M 超长上下文、原生多模态三项能力于一体的开源模型 M3。Coding 方面 SWE-Bench Pro 得分 59.0%,超过 GPT-5.5 和 Gemini 3.1 Pro;自研 MSA 稀疏注意力让 1M 窗口每 token 计算量仅为上代 1/20,prefill 阶段加速 9 倍。实测 24 小时内自主完成 145 次 CUDA 算子迭代,硬件利用率从 7.6...
EP74 · AI 价值归宿、Skills 极简法、Agent 胜管道 · 06-01 早报 31.05.2026 12:36
精讲一:Benedict Evans 谈 AI 的真实走向:平台迁移、劳动变化与价值归属 [视频] 来自 Lenny's Podcast 前 a16z 分析师 Benedict Evans 以「1997 年互联网」类比当下 AI 现状:基础模型实验室正疯狂招募麦肯锡式专业服务团队,恰恰说明企业 AI 落地远非一键完成。他援引杰文斯悖论——电子表格普及后会计师反而增多——反驳「AI 消灭就业」论,并以电信行业商品化为镜断言:基础模型利润将趋零,真正的长期价值将沉淀在分发渠道与应用...
EP73 · Codex 开发操作系统、RAG 检索架构失效、AI 认知异化 · 05-31 早报 30.05.2026 12:47
精讲一:Builders Unscripted 第 3 期:Matias Castello 如何用 Codex 搭建 AI 编码与产品工作流 [视频] 来自 OpenAI 没有正式工程背景的产品负责人,把 Codex 打造成了日常开发操作系统:PR 内自动代码审查、Linear 驱动的 backlog 管理、GPT 5.5 隔夜竞品研究、Apple Watch 语音触发任务。他的核心判断:平台必须同时服务 AI 辅助的人类开发者和自主 Agent,而过去需要 15 人 18 个月的 MVP,现在 7 天即可独立完成。是一个产品...
EP72 · OpenClaw 架构、AI 编程治理、Agent 记忆 · 05-30 早报 29.05.2026 12:08
精讲一:OpenClaw 与 Hermes:源码里的 AI Agent 架构知识大复盘 来自 腾讯技术工程 作者历时三个月开发 QQBot 插件,深入拆解 OpenClaw(TypeScript 微内核 + 25+ Channel 适配器 + Dreaming 三阶段记忆晋升)与 Hermes(Python 单体 + 技能自创建闭环 + Smart Approval 三态)两套开源框架源码。第 22 章正面剖析 7+1 个工程落地难题:协议互通、记忆分层、上下文工程(融合「上下文焦虑症」理论)、确定性编排、多 Agent 协作,...
BestBlogs 周刊 第 97 期 · 大下注时刻 29.05.2026 15:30
时长:15:30 | 发布日期:2026-05-29 通用 AI 的军备赛还在继续,但这周让人眼睛一亮的,是那些选择离开主干道的人。本期围绕「大下注时刻」,覆盖 Anthropic 双线推进、Agent 基础设施竞速、王小川与何小鹏的战略选择、Harness 时代的组织革命,以及 AI 经济现实。 本周亮点 * Claude Opus 4.8 旗舰升级 + Claude Code 动态工作流(数十到数百个子 Agent 并行) * Anthropic 多产品 Agent 安全隔离策略 * 腾讯 TencentDB Agent M...
EP71 · Opus 4.8 发布、650 亿融资、动态工作流 · 05-29 早报 28.05.2026 12:26
精讲一:Claude Opus 4.8 发布 来自 Anthropic News Anthropic 旗舰模型 Claude Opus 4.8 在编程、智能体、推理、知识工作四类基准中全面超越 Opus 4.7,尤其在「诚实度」上大幅提升——对自身代码缺陷视而不见的概率降低约四倍。同步推出三项新功能:Claude Code 动态工作流(并行子智能体处理超大任务)、claude.ai 努力控制(可调思考深度)、API 支持任务执行中实时更新指令。Databricks、Devin 等早期测试者验证判断力与可靠性...
Podcast simili
Replaio non è un editore di podcast; i nomi dei programmi, le copertine e l'audio appartengono ai rispettivi autori e vengono distribuiti tramite feed RSS pubblici