跳到正文

#Agent

今日 9 条
9月29日周二
  1. 公众号:火山引擎30

    零跑汽车与火山引擎合作:TRAE 嵌入全域自研体系,落地本地研发环境

    零跑汽车与火山引擎合作,将 TRAE 嵌入其全域自研体系,在本地安全网络、车规级工程约束和多团队协同环境中落地 AI Coding。TRAE 采用企业专属域名与网络配置接入受限网络,明确代码仅用于当次推理、不用于模型训练,并通过 Spec/Plan、Rules、Skills 约束 Agent 行为。TRAE 企业版还提供可视化数据看板与灵活模型资源管理,支持按团队设置模型权限和用量配额。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)33

    Basis 用 GPT-6 Astra 将税务工作簿处理速度提升 2 倍

    OpenAI 客户 Basis 测试显示,GPT-6 Astra 完成一份 50 个标签页的复杂税务工作簿耗时比 GPT-5.6 Sol 少 50%,其内部评测分数提升约 20%。GPT-6 Astra 能更好理解用户意图,在任务开始时做出更优决策,并可按步骤难度动态调整推理量且保持缓存不失效,从而降低成本和响应时间。

  3. xAI:News(网页)72

    xAI 发布 Team Bots:可与团队共同学习工作的 Grok 智能体

    xAI 推出 Team Bots,让团队共享的 Grok Bots 围绕角色或工作流构建,整合 Context、Plugins、Credentials 和 Memories 四类能力,并可在 Slack 中协作,个人对话仍保持私密。

    推荐理由:原文详细拆解了共享 Bot 的上下文、插件、凭证和记忆四要素,并给出内部多部门与客户实例,读者可对照搭建自己的团队工作流。

  4. Databricks:Blog(RSS)65

    Databricks 如何让 12000 名员工在模型发布首日用上新前沿模型

    Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。

    推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。

  5. GitHub Blog71

    GitHub 安全团队如何用开源 AI 安全 Agent 找出 24 个 Android 漏洞

    GitHub Security Lab 发布开源 seclab-taskflows 任务流,通过 gather_mobile_entry_point_info.yaml 和 classify_application_local.yaml 等提示词引导 LLM 审计 Android 应用,已发现并报告 24 个漏洞。

    推荐理由:作者以第一手实践拆解了任务流设计与运行步骤,并给出真实漏洞案例和 LLM 局限,方法可直接迁移到自己的项目审计。

  6. Arena.ai69

    Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena,并开放投票。Agent Arena 基于全球用户数百万个真实的长程智能体任务评测模型,模型可使用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单用因果追踪方法衡量模型相对平均模型的结果表现。

    推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。

9月28日周一