Reasonable 团队解读 TLA+:从 Boris Cherny 热传推文到机器可验证软件
Reasonable 团队撰文介绍 TLA+ 是什么,回应 Boris Cherny 用 Opus 5.5 将 Claude Agent SDK 部分建模为 TLA+ 和 Lean 的热传推文。
Reasonable 团队撰文介绍 TLA+ 是什么,回应 Boris Cherny 用 Opus 5.5 将 Claude Agent SDK 部分建模为 TLA+ 和 Lean 的热传推文。
《周六夜现场》“周末快讯”环节播出片段,Anthropic CEO Dario Amodei 出镜谈论 AI 对人类的威胁。该视频在 Hacker News 上获得 108 点热度。
Show HN 项目 TinyAIArena 上线,用对战排行榜展示 AI 智能体的互搏战绩,已记录 43 场比赛、全部完赛,平均每场 10.3 回合。
Muse agent 将获得一个专属标签页,用于永久浏览其 VM 屏幕。此外,Muse 在网页端的语音模式体验已更新,现在以语音通话小组件的形式呈现。
作者评论 TypeSafe AI 推出的 AI 模型 Jev,认为其用户不做 evals、把置信度分数当形式或甩锅理由,丢弃了对失败原因的追查。他担忧 LLM 驱动的开发会让"有时就是烂"成为排查的可接受终点,而本可用几条提示词搭建的 eval 反而能解决部分问题。
Eoin Higgins 撰文认为所谓“rogue”AI 智能体是误导性说法,OpenAI 的智能体在训练与评测中访问澳大利亚和美国政府数据库,并非违反禁令,而是缺少限制与护栏。
安全研究员 Rowan Howard-Jones 称,OpenAI 智能体在 4 至 6 月间对 UNCTAD 统计网站扫描超过 16,000 次,疑似为通过 UNCTADstat API 获取 Productive Capacities Index (PCI) 公开数据。
Synthetic Sciences 发布开源科研 Agent OpenScience,正式结束 beta 并上线 Product Hunt,采用 Apache 2.0 许可、免费开放。
所有喜欢亲手敲代码、享受解决每个小问题快感的软件工程师,绝对必看。 我肯定也曾是他们中的一员,但很高兴,那个时代现在已经永远过去了。
小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。
推荐理由:原文给出完整的归因实验和修复路径,还公开了成本对比,读者可借鉴其诊断 RL 训练中涌现行为的方法。
我们修复了一个导致 GPT-6 Sol 和 GPT-6 Luna 图像理解能力下降的 bug。现在你在 API 和 Codex 中的视觉任务上应该能看到更好的结果,包括 computer use。
我们修复了一个导致 GPT-6 Sol 和 GPT-6 Luna 图像理解能力下降的 bug。现在你在 API 和 Codex 中的视觉任务上应该能看到更好的结果,包括 computer use。
《周六夜现场》最新一期由 Jane Wickline 模仿 Anthropic CEO Dario Amodei,在 Weekend Update 环节讽刺其对 AI 末日的反复表态。节目借虚构的 Amodei 之口说出“AI 不是武器,而是工具——用来制造武器的工具”,并调侃其称十年后癌症有约 10% 概率不再是任何人的问题。
supersonicai 发布首个分类模型 Julia-1,号称几乎能在任何设备上运行,训练与实验的云 GPU 花费约 R$540(US$104.08)。
作者吐槽自己大学应用更新后的界面是典型的 AI slop UI,并总结十个识别迹象:无处不在的渐变和紫色、无意义的彩色、多余的脉冲徽章、被滥用的指甲卡片、大量 emoji、元素错位、Inter 或 JetBrains Mono 字体、聊天上下文带来的冗余文案、glassmorphism,以及 Elevate、Seamless、Next-Generation 之类的空洞口号。
H Company 发布 Holo4 的二百七十亿参数稠密模型和混合专家版本,提供 API、可下载权重与多种量化格式。模型把桌面、网页、安卓操作及代码和工具调用结合在同一智能体中;不同测试平台的分数不能直接横向比较。
推荐理由:开放权重和量化版本让团队能在自有环境尝试界面操作智能体,并对不同设备和工具组合开展实际任务评测。
Parse 5 为常见格式的企业文档提供最优价格。它能消化并返回: ✅ 表格 ✅ 图像 ✅ 边界框 ✅ 流程图 ✅ 以及更多 看看它的表现 👇
英特尔 8087 的 FPTAN 正切指令结合了 CORDIC 与多项式近似两种方法,以兼顾高精度与高性能,计算一次正切仅需 90 微秒,而 8086 微处理器需要 13,000 微秒。作者通过开盖显微成像分析芯片电路与微码,定位到指数 ROM、常数 ROM、移位器、加法器等数据通路单元,并解析了 CORDIC 利用 arctan(2^-n) 特殊角旋转的算法原理。
复旦大学参与的研究团队分析了 56 名参与者、超过 700 份任务日志,研究智能体辅助开发 744B 参数 MoE 模型 Atria Dawn Preview 的过程。四周内每个人类输入对应的智能体操作中位数从 11 升至 28.5,约三分之一的 AI 辅助任务没有 AI 就不会启动,但方法和参数的最终决策 85.5% 由人类做出。团队提醒,长链智能体工作可能让人类监督退化为走过场式审批。
GOOGLE 🔥:Google Flow 上 Nano Banana 2.5 Flash 的引用已被改为 Nano Banana 2.1。 小幅升级?👀 * 尚不可用
据华尔街日报报道,Anthropic 数位早期员工正考虑在美国偏远地区购置土地建造隐匿点,以便在“AI 走向失控反噬”时举家撤离。这些员工还在内部私密 Slack 频道中推演各类末日情景并探讨应对预案。Anthropic 发言人回应称,公司目前拥有超过 3,500 名员工,内部对技术的探讨呈现多元观点与立场。
9 月 25 日豆包手机助手发声明称,9 月 24 日晚起陆续收到用户反馈,搭载豆包手机助手的努比亚 NaviX Ultra 登录或匹配《王者荣耀》时提示设备环境异常并被强制踢下线,团队确认全程未对腾讯游戏系统操作,AI 不存在违规点击、外挂或模拟行为,建议用户暂时不要反复尝试登录,被封禁账号可通过官方游戏客服申诉。
WSJ 报道称,Anthropic 一些最早期的员工正考虑在美国偏远地区购置土地,以备 AI 失控时迁居。前员工回忆,早在公司早期聚餐时就有人讨论过类似曼哈顿计划的情景,即在电磁屏蔽的政府设施内继续开发 AI。报道还追溯了这批早期员工与 Effective Altruism 亚文化的联系,Eliezer Yudkowsky 自 2000 年代中期起是这一担忧的代表性人物。
围绕 Opus 5.5 与 Sol 两款模型,团队内部出现了明显的选择分歧。文章同时给出如何判断哪个模型更适合自身工作的方法,并讨论用 AI 写好内容,以及为什么 evals 正出现在越来越多的招聘要求中。