小红书 AllSpark 提出 PACT:从信用分配到 Critic 对齐,SWE-bench Verified 达 67.4%
小红书 AllSpark 团队提出 PACT(Policy Aligned Critic Training),通过三个正则条件唯一确定长程 Agent 的信用分配,并用 BCE 回归有界 Value、采用 Actor-Then-Critic 更新顺序改进 Critic 与策略对齐。
小红书 AllSpark 团队提出 PACT(Policy Aligned Critic Training),通过三个正则条件唯一确定长程 Agent 的信用分配,并用 BCE 回归有界 Value、采用 Actor-Then-Critic 更新顺序改进 Critic 与策略对齐。
OpenAI DevDay 2026 公布 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
OpenAI 发布 GPT-6.1 Sol,官方称其在编码、电脑操作和专业工作方面接近 Astra 的智能水平。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,主打编码与电脑操作能力,API 价格降至 Astra 的五分之一。
微软在巴塞罗那 European Microsoft Fabric + SQL Community Conference 上发布 Fabric 与 Azure Databases 多项更新。
零跑汽车与火山引擎合作,将 TRAE 嵌入其全域自研体系,在本地安全网络、车规级工程约束和多团队协同环境中落地 AI Coding。TRAE 采用企业专属域名与网络配置接入受限网络,明确代码仅用于当次推理、不用于模型训练,并通过 Spec/Plan、Rules、Skills 约束 Agent 行为。TRAE 企业版还提供可视化数据看板与灵活模型资源管理,支持按团队设置模型权限和用量配额。
MIT 教授 Sherry Turkle 的新书《Artificial Intimacy: Who We Become When We Talk to Machines》由 Little, Brown and Company 出版,基于访谈论述聊天机器人的伪共情正在削弱儿童发展与成人社交能力。
OpenAI 推出名为 dots 的主动式助手,可在复杂项目和日常任务中持续工作。dots 让用户在工作推进过程中保持控制权。
Arena 宣布 GPT-6 Luna (Max) 进入 Agent Arena Pareto 前沿,净改进 +1.59%,中位成本每任务 $0.05。
Fireworks AI 发布 FireRouter with Opus,可在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间做缓存感知路由,并首次以独立路由模型形式作为 serverless 端点开放。
推荐理由:官方给出了内部 A/B 测试的成本与准确率数据,可帮助团队评估用缓存感知路由替代单一 Opus 的可行性。
OpenAI 客户 Basis 测试显示,GPT-6 Astra 完成一份 50 个标签页的复杂税务工作簿耗时比 GPT-5.6 Sol 少 50%,其内部评测分数提升约 20%。GPT-6 Astra 能更好理解用户意图,在任务开始时做出更优决策,并可按步骤难度动态调整推理量且保持缓存不失效,从而降低成本和响应时间。
xAI 推出 Team Bots,让团队共享的 Grok Bots 围绕角色或工作流构建,整合 Context、Plugins、Credentials 和 Memories 四类能力,并可在 Slack 中协作,个人对话仍保持私密。
推荐理由:原文详细拆解了共享 Bot 的上下文、插件、凭证和记忆四要素,并给出内部多部门与客户实例,读者可对照搭建自己的团队工作流。
Databricks 发布 Lakebase Search,为 Lakebase Postgres 带来 lakebase_vector(可扩展近似最近邻搜索)和 lakebase_text(BM25 全文搜索)两个扩展,已在 AWS 和 Azure 正式可用。
Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。
推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。
Anthropic 与 NVIDIA 合作加强 Agent 安全。NVIDIA 发布 Open Agent Safety Platform,Anthropic 推出 Claude Managed Agents。
推荐理由:Arena 用 8K 真实智能体会话数据给出 GPT-6 Luna (Max) 的排名与成本对比,读者可据此权衡其性价比定位。
Sierra 把 Ghostwriter 从需要提示的 copilot 改造成常驻 Slack 和 Teams 的主动型 AI 队友,用户将其加入频道后可通过 @ 提及获取客服解决率趋势、销售漏斗转化图表或发起新实验。
GitHub Security Lab 发布开源 seclab-taskflows 任务流,通过 gather_mobile_entry_point_info.yaml 和 classify_application_local.yaml 等提示词引导 LLM 审计 Android 应用,已发现并报告 24 个漏洞。
推荐理由:作者以第一手实践拆解了任务流设计与运行步骤,并给出真实漏洞案例和 LLM 局限,方法可直接迁移到自己的项目审计。
Artificial Analysis 发布对 Claude Sonnet 5.5 的评测:其智能指数得分 56,max effort 下比 Sonnet 5 高 18 分,升至第 2 名,仅落后 Opus 5.5 (max)。
推荐理由:Artificial Analysis 实测指出 Sonnet 5.5 逼近 Opus 5.5 依赖约 193k 输出 token,成本细节对选型有直接参考价值。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的定位、与 Opus 5.5 的分工以及 Bedrock 上的调用方式,便于判断何时选用。
Claude Code v2.1.284 将 Anthropic API 上的默认 Sonnet 模型升级为 Claude Sonnet 5.5(claude-sonnet-5-5),支持 1M 上下文,定价 $2/$10 per Mtok、缓存读取 $0.20/Mtok。
推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。
推荐理由:Artificial Analysis 用自家基准拆解了性能与 token 成本的权衡,为选型提供了可对比的量化参考。
Databricks 发布 Genie One 企业推广分步指南,建议从单一团队和一组明确问题起步,先定义语义层再逐步扩大范围。Genie One 让业务用户用自然语言提问并获得带来源引用的答案,配套 Genie Agents、Genie Ontology 和 Unity Catalog 分别负责领域智能体、业务语义图谱与权限治理。
来认识 The WebMCP Challenge 的获奖者。 这 10 个项目展示了,当网站开放智能体可用的结构化工具时,人与智能体能共同构建出什么。 🧵 查看获奖项目及其背后的开发者:
Arena 公布 Claude Opus 5.5 (High) 进入 Agent Arena 排名第 2,净改进分 +12.15%,仅次于 Fable 5.1 (Max)。
推荐理由:榜单给出了 Claude Opus 5.5 (High) 在 Agent Arena 的排名、价格与分项信号,读者可据此权衡它与 Opus 5 各档的成本与能力变化。
LlamaIndex 发布 LlamaParse 的 Enriched Forms 功能,将表单解析为字段与分组的 JSON 树,附带 bounding box 定位和归属信息,供下游审计验证。