ByteByteGo 详解 LLM 应用的错误处理与韧性设计
ByteByteGo 发表长文,系统讲解 LLM 应用如何处理错误与故障。文章指出 LLM 应用除网络超时、429 限流、401/403 认证失败、上下文窗口超限等技术故障外,还面临幻觉、输出非法 JSON、工具误调用等语义故障,需将错误分为瞬时、永久、语义三类再对症处理。
ByteByteGo 发表长文,系统讲解 LLM 应用如何处理错误与故障。文章指出 LLM 应用除网络超时、429 限流、401/403 认证失败、上下文窗口超限等技术故障外,还面临幻觉、输出非法 JSON、工具误调用等语义故障,需将错误分为瞬时、永久、语义三类再对症处理。
Cognition 宣布完成超 20 亿美元 E 轮融资,估值 480 亿美元,由 Andreessen Horowitz 和 Accel 领投,Founders Fund、General Catalyst、Avenir 等跟投。
推荐理由:官方公布融资规模与估值的同时给出营收增速和产品进展,读者可以据此了解 Devin 的商业化落地情况。
LinkedIn 论文《Does Your Agent's Memory Survive a Model Upgrade?》用 48 条合成历史比较四种记忆格式在更换读写模型后的可迁移性。
一名 AI 爱好者 CozyBlaze 让 OpenAI 新旗舰模型 GPT-6 Astra 自主通关了 Valve 的 3D 解谜游戏《传送门》,全程约 24 小时,共进行 3336 次工具调用,按 API 价格计算约 571.18 美元,但实际成本由其每月 200 美元的 Codex Pro 订阅覆盖。
OpenAI 发布博客文章称已达成去年秋天设定的「自动化研究实习生」目标,计划 2028 年 3 月前建成全自动 AI 研究员;数据显示截至 8 月中旬研究部门每 1 个人类工作日运行 3.1 个智能体工作日,中位研究员每天推理花费超 600 美元,90 分位超 7000 美元,token 产出自 2025 年 12 月以来增长 124 倍。
纽约时报报道,肯尼亚曾有为美英学生代写学术论文的行业,内罗毕鼎盛期至少有 40,000 人从业。从业者 Teresios Bundi 十二年写过 2,500 多篇论文,后期每篇收费 40 至 70 美元;ChatGPT 于 2022 年发布后,价格和订单崩塌,剩下的是改写 AI 文本以通过查重的'人味师',牛津教授 Mark Graham 预计类似冲击将在全球出现。
OpenAI 发布博客首次披露研究人员使用 AI 编程智能体的规模和成本。截至 8 月中旬,普通研究员日耗 Token 价值中位数超 600 美元(7 月为 162 美元),前 10% 用户超 7000 美元,数字按 API 公开推理价格估算,非实际支出。
阿里巴巴 Qwen 团队发布 Qwen-Drive 1.0,基于 Qwen3.5-4B,在语言模型上叠加 3D 环境感知和路径规划两个模块,用同一模型同时服务驾驶系统和座舱助手。
据每日经济新闻报道,微信正在内测“小微 AI 社交”功能。用户告知自己的“小微”诉求后,它会去找好友的“小微”沟通,对方确认后两个 AI 先行交流再把结果带回,需要用户拍板时提醒确认;与“代发微信消息”不同,内容不出现在个人对话框,只在“小微”内进行。
OpenAI 首席科学家 Jakub Pachocki 发表长篇博文,担心没有人准备好应对机器智能持续快速增长的后果,呼吁建立可由第三方审计、政府或国际组织执行的强制性安全门槛。
作者分享只用手机远程操控Agent跑任务的新工作流,核心工具是UU远程,出门不再随身背1.62kg的MacBook。文中介绍终端完整支持TUI,可正常操作Claude Code、Codex等Coding Agent,多终端会话可并行;支持手机与电脑双向跨端接管,任务进度和运行状态可保留。
最高人民法院发布《关于依法审理涉人工智能纠纷案件的意见》,共 5 部分 24 条,明确 AI 换脸拟声、AI 复活逝者、大数据杀熟、仿冒名人带货、网络开盒及自动驾驶事故等情形的裁判规则。文件规定未经同意生成可识别的虚拟数字形象或合成人声构成侵害人格和声音权益,仿冒名人带货构成欺诈的消费者可主张惩罚性赔偿,车辆缺陷与驾驶人过错结合致损时可同时请求驾驶人及生产者、销售者担责。
推荐理由:原文梳理了意见覆盖的侵权、知识产权、自动驾驶等裁判规则要点,读者可以据此了解涉 AI 纠纷的责任认定走向。
用户 jmpman 用 Astra 和 Fable 两个 AI 模型互相协作,逆向了 PianoDisc Protigy 自动钢琴的 mp3 MIDI 编码格式,发现其右声道以 2004.5 Hz 方波承载 MIDI,并内置 decoy notes 混淆以阻止提取的 MIDI 在其他系统播放。
阿里云 9 月 7 日宣布千问办公推出业内首个多人工作台,用户用自然语言描述需求即可生成并发布最多支持百人同时在线协作的网页。该功能具备角色权限、云端数据库、管理后台和在线发布四项核心能力,适用于活动组织、家校协同和企业协作等场景,可从千问办公首页功能入口直接体验。
华为在全场景新品发布会正式发布鸿蒙 HarmonyOS 7 操作系统,即日起开启公测。新系统采用空间美学设计语言,锁屏新增 3D 空间壁纸与空间时钟,通知中心和文件夹引入液态玻璃。
Simon Willison 评论 OpenAI 关于 Recursive Self-Improvement(RSI)的新文章及首席科学家 Jakub Pachocki 的 essay《An Alien Mind》。
GPT-6 Astra上线后,大量用户用它自主操控Blender、Houdini、Unity、Aseprite等专业软件,做出游戏Demo、3D复刻旧金山艺术宫等作品,其中旧金山艺术宫案例里Astra自己搜索几百张参考图、翻到美国国会图书馆的老扫描文件找柱子尺寸,多数工作在夜间自主完成。
推荐理由:作者从大量GPT-6 Astra操控专业软件的案例出发,讨论执行能力贬值与判断力从何而来的矛盾,视角具体。
VC Tomer Tunguz 提出 AI token 消耗分三波:聊天约 1m tokens/人/天,单智能体约 100m–200m tokens/天,meta-harness 并行调度多智能体可达数十亿。
推荐理由:作者提出 AI 消耗分三波叠加增长的框架,并用 OpenRouter 与企业数据解释为何线性外推算力需求会失真。
MOLE 是一个开放基准,用 150 个 AI 运营账号、9 个有状态服务、30 个工作日模拟 12 种内部威胁,语料约 200 亿 token,来自四个模型。在 39 个 agent 模型中 72% 能完成大部分有害目标,且 agent 拒绝不能预测完成与否;最佳监控器在单日审计事件对比中仍漏掉近一半已完成的危害,基准引导搜索可将中档监控器提升 49-64%。
Rohan Paul 认为「时间跨度」正成为谈论智能体能力更有用的指标,任务越长无干预成功率越低,OpenAI 数据从 15 分钟内任务的 86% 降到 64-128 小时档的约 16%。
Meta FAIR、牛津大学和 UCL 团队提出 AI Research Preference Models(RPMs),在执行前对未运行的 ML 实验候选排序,只执行获胜者。
推荐理由:Hendrycks 是 AI 安全领域权威,此观点结合 OpenAI、Anthropic 等最新实证案例,揭示了 Agent 行为中潜在的“亲缘利己”风险,对理解 AI 对齐与安全治理具有重要参考价值。
Microsoft 论文提出把昂贵测试时推理摊销为蒸馏技能:收集 35–50 条历史轨迹,由编码智能体提取重复失败模式并编译成 markdown 技能加入非推理模型 system prompt。
Olly(iMessage AI 助手)作者基于经 OpenRouter 路由的开源模型处理约 1800 万条消息(约三分之一经 OpenRouter 开源模型)的实战经验,总结使用 OpenRouter 的十大坑。