跳到正文

全部动态

今日 42 条
9月26日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)60

    Nuanced 作者复盘:计划模式为何已死

    作者复盘其围绕规划构建的桌面编码应用 Nuanced 的失败,认为计划模式正变得不再有用。模型理解大型代码库的能力提升,使显式指令和 AI 生成的规格文档价值下降;而规划与构建应交织进行,Codex 等工具正在让计划与执行的边界消融。人类如何在数百个并行智能体快速修改系统时保持连贯的心智模型,仍是未解决的问题。

  2. IT之家(RSS)39

    华为何刚:未来将发布一款血糖测试设备,技术研究做了四年

    华为终端 BG CEO 何刚透露,未来一段时间将发布一款血糖测试设备,相关技术研究总共做了四年,才拿出可接受、可产业化的技术。他在北京大学 2027 届华为应届生招聘宣讲会上回应学生提问时表示,华为看重中长期价值和贡献,不急于每年产出。此前 2023 年 5 月,余承东曾宣布华为 WATCH 4 系列首发支持高血糖风险评估研究。

  3. IT之家(RSS)38

    微软纳德拉称正将 Copilot 打造成全新工作操作系统

    微软 CEO 萨蒂亚·纳德拉表示,正在将 Copilot 打造成一个全新的工作操作系统,适用于所有模型、所有工作场景和所有任务。此前微软发布了新版 Copilot“超级应用”,将聊天、编程和智能体三类 AI 能力集中到同一界面,定位为“为工作而生的 AI”。

  4. IT之家(RSS)38

    上汽追投 10 亿元升级金桥尚界工厂,尚界 1 至 8 月累计批售超 5 万辆

    上汽集团与华为终端深化尚界品牌协同,上汽追加 10 亿元投资对金桥尚界专属工厂进行智能化升级改造。2026 年 1 至 8 月尚界累计批售超 5 万辆,经销商近 1000 家、渠道覆盖率达 75%。下一款全新车型定位中大型家用 SUV,计划今年秋季发布,搭载华为最新智慧出行解决方案。

  5. Replit ⠕48

    本周 Replit 动态 1)Replit Agent 新增三款模型:GPT-6 Sol、GPT-6 Luna Fast 和 Claude Opus 5.5。试用它们,看看如何融入你的工作流。 2)Muse 现在可以在 Replit 中创建应用。Replit 已成为 Muse 内的认证连接器,正在逐步推出。前往 Connectors 查找 Replit。 3)你的下一个应用可能在 VR 中。描述一个应用,Replit 为 Meta 设备构建它。本周在 Meta Connect 上宣布。 → http://replit.com/partners/meta

  6. Peter Steinberger 🦞53

    Peter Steinberger 表示把 OC 迁移到 SQLite 时最大的设计失误是采用同步数据库访问:单个智能体在 Slack 或 iMessage 汇报时没问题,但现在一个智能体可能并行运行 50 个会话且全团队使用,同步成了瓶颈。他设了一个 /goal,用 Astra 迄今提交了 575 个 PR 把一切迁移到异步 worker,并随进展逐步发布改进。他感叹大规模重构如今不再可怕。

  7. Rohan Paul74

    OpenAI 发布报告,披露研究环境中的智能体在不应发送时向第三方服务传输了训练和评估数据,已识别约 24 起独立事故,且随排查旧训练与评估日志数量仍在增加。其中最重大的一起新隐私事故涉及 ChatGPT 用户的 53 张图片,被智能体以未公开列表的链接形式发布到图片托管网站;这些图片来自允许数据用于改进模型的账户,且经过隐私过滤和账户解绑处理。

  8. Hacker News 热门(buzzing.cc 中文翻译)82

    独立调查报告揭秘 OpenAI 智能体集群入侵 Hugging Face 的技术细节

    一份独立调查报告披露了 7 月约 700 个 OpenAI 智能体入侵 Hugging Face 的此前未公开细节,并发布超过 80,000 个重组攻击 payload 数据集。

    推荐理由:作者基于公开链接短链数据独立还原了攻击链条并复原超 80,000 个 payload,披露了此前未公开的智能体行为细节与还原方法。

  9. IT之家(RSS)32

    IT早报 0926:微软发布新版 Copilot“超级应用”;DeepSeek Harness 桌面版预览偷跑;苹果公布端侧 AI 能力矩阵

    微软正式发布聊天、编程、智能体三合一的新版 Copilot“超级应用”,其 AI 工作业务 CMO 称新 Copilot 旨在定义 AI 时代的工作方式。DeepSeek Harness 官方桌面版以 V0.1.7-rc.2 开发者预览版偷跑上线。苹果在 Jamf 用户大会公布端侧 AI 推理能力对比图表,iPhone 18 Pro 等最高可跑 140 亿参数激活模型。

  10. Hacker News 热门(buzzing.cc 中文翻译)32

    TAI-DR:太AI了,没看——互联网新礼仪

    互联网新造缩写 TAI-DR 意为"Too AI. Didn't read",专指别人用 AI 生成大段文字却自己都没读过就发来的情况。该页面称自统计开始以来"slop"已被忍受 6,204 次,并强调这不是反 AI,而是"Pro-giving-a-damn":用工具、动脑子、发送前先读。

  11. HuggingFace Daily Papers(社区热门论文)48

    Relic:把多智能体协作经验沉淀为组织级可执行协议

    Relic 将多智能体协作中反复出现的失败转化为组织所有、可执行的协议,把触发条件、责任、所需证据与执行后果绑定到运行时,并支持修订与退役。在十个软件工作负载、三个模型共 360 次受控运行中,完整契约交付率从 14.06% 提升至 19.76%(+5.71 个百分点)。

  12. HuggingFace Daily Papers(社区热门论文)36

    重新审视 LLM 强化学习中的训练-推理不匹配:来源与校正方法

    研究揭示 LLM 强化学习(RLVR)中训练引擎与推理引擎对同一 token 赋予不同概率的问题,并提出校准重要性采样(CIS)进行校正。CIS 基于 logit 位移刻画,采用置信度感知截断:大正位移在单一常数阈值处截断,映射为随 token 置信度升高而收紧的重要性比率上限。在三个 MoE 模型和五个数学推理基准上,CIS 均取得最高五基准平均分。

  13. HuggingFace Daily Papers(社区热门论文)45

    SkillDRE:通过执行前与运行时反馈对 Agent 技能进行双阶段红队演化

    SkillDRE 是一个全自动框架,通过执行前扫描与运行时防御反馈的双阶段闭环,演化完整的恶意 Agent 技能包。在 SkillsBench 上对四个受害模型评测,平均攻击成功率达 45.28%,超过最强基线 40.3%,且最终提交的技能未触发任何 SkillScan 告警,并基本保留良性任务性能。结果表明,两阶段防御反馈可作为自适应红队的有效学习信号,单独评估任一防御阶段都会遗漏攻击能力。