#Agent
#Agent
今日 18 条
Arena.ai@arenaAI 评分4747IT之家(RSS)AI 评分7373 Anthropic 发布 Claude Sonnet 5.5:速度提升 30%,智能体编码表现反超 Opus 5.5
Anthropic 发布中端模型 Claude Sonnet 5.5,官方称速度比上一代提升 30%,Token 消耗速度明显更低,定位为编写代码和制作办公文档等日常任务的助手。
Peter Steinberger 🦞@steipeteAI 评分1919Fireworks AI(网页)精选AI 评分6262 Fireworks AI 推出 FireRouter with Opus,编码任务成本降 57%
Fireworks AI 发布 FireRouter with Opus,可在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间做缓存感知路由,并首次以独立路由模型形式作为 serverless 端点开放。
推荐理由:官方给出了内部 A/B 测试的成本与准确率数据,可帮助团队评估用缓存感知路由替代单一 Opus 的可行性。
elvis@omarsar0AI 评分4545OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3333 Basis 用 GPT-6 Astra 将税务工作簿处理速度提升 2 倍
OpenAI 客户 Basis 测试显示,GPT-6 Astra 完成一份 50 个标签页的复杂税务工作簿耗时比 GPT-5.6 Sol 少 50%,其内部评测分数提升约 20%。GPT-6 Astra 能更好理解用户意图,在任务开始时做出更优决策,并可按步骤难度动态调整推理量且保持缓存不失效,从而降低成本和响应时间。
The Verge:AI(RSS)AI 评分4444 OpenAI 的 AI 智能体为何落后了
OpenAI 在持续运行的消费级 AI 智能体赛道落后于 Meta、Google 等对手,2026 DevDay 上可能发布代号 Aeon 的智能体。Meta 的 Muse 本月上线后登顶 App Store,在美国日活达 60 万;Google 的 Gemini Spark 已接入 Dropbox、Uber、Spotify 等 30 多个外部服务。
xAI:News(网页)精选AI 评分7272 xAI 发布 Team Bots:可与团队共同学习工作的 Grok 智能体
xAI 推出 Team Bots,让团队共享的 Grok Bots 围绕角色或工作流构建,整合 Context、Plugins、Credentials 和 Memories 四类能力,并可在 Slack 中协作,个人对话仍保持私密。
推荐理由:原文详细拆解了共享 Bot 的上下文、插件、凭证和记忆四要素,并给出内部多部门与客户实例,读者可对照搭建自己的团队工作流。
Diogo Almeida@CompleteSkepticAI 评分5050围绕一个简单原语做真正工程实践的好例子!!! 不要把 Jev 直接接入高层决策,而是编程定义你想要的行为! (跟人说"去编程"听起来很奇怪,但这真的很酷)
Databricks:Blog(RSS)AI 评分5858 Databricks 为 Lakebase Postgres 推出 Lakebase Search 向量与全文搜索
Databricks 发布 Lakebase Search,为 Lakebase Postgres 带来 lakebase_vector(可扩展近似最近邻搜索)和 lakebase_text(BM25 全文搜索)两个扩展,已在 AWS 和 Azure 正式可用。
Databricks:Blog(RSS)精选AI 评分6565 Databricks 如何让 12000 名员工在模型发布首日用上新前沿模型
Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。
推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。
Replit ⠕@ReplitAI 评分2323Claude:Blog(网页)AI 评分7272 Anthropic 与 NVIDIA 合作推出 Claude Managed Agents 与 OpenShell 强化 Agent 安全管控
Anthropic 与 NVIDIA 合作加强 Agent 安全。NVIDIA 发布 Open Agent Safety Platform,Anthropic 推出 Claude Managed Agents。
Arena.ai@arena精选AI 评分7777推荐理由:Arena 用 8K 真实智能体会话数据给出 GPT-6 Luna (Max) 的排名与成本对比,读者可据此权衡其性价比定位。
ClaudeDevs@ClaudeDevsAI 评分5454
lauren@potetoAI 评分5555
Thariq@trq212AI 评分7171
Frank Wang 玉伯@lifesingerAI 评分3232
Andrew Ng@AndrewYNgAI 评分6363
Rohan Paul@rohanpaul_aiAI 评分6161TechCrunch:AI(RSS)AI 评分6363 Shopify 向浏览器端 AI 智能体开放 checkout 结账能力
Shopify 宣布浏览器端 AI 智能体可在其商家站点完成结账购买,能力从搜索商品、加入购物车扩展到提交交易。
Sierra:Blog(RSS)AI 评分4545 Sierra 将 Ghostwriter 从提示工具升级为 Slack 和 Teams 中的主动型 AI 队友
Sierra 把 Ghostwriter 从需要提示的 copilot 改造成常驻 Slack 和 Teams 的主动型 AI 队友,用户将其加入频道后可通过 @ 提及获取客服解决率趋势、销售漏斗转化图表或发起新实验。
Simon Willison 博客AI 评分3232 OpenAI 智能体安全团队 @joedaroo 谈 AI 能力突跳带来的安全挑战
OpenAI 智能体安全团队的 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关事件上的能力跳变之突然远超预期,而安全态势需要时间积累,不只是加固系统,还要把它植入公司文化。他呼吁各组织自问:人员、系统和流程能否应对 AI 能力的突然跃升,是否有正确的事件响应、沟通机制和待命人员。
GitHub Blog精选AI 评分7171 GitHub 安全团队如何用开源 AI 安全 Agent 找出 24 个 Android 漏洞
GitHub Security Lab 发布开源 seclab-taskflows 任务流,通过 gather_mobile_entry_point_info.yaml 和 classify_application_local.yaml 等提示词引导 LLM 审计 Android 应用,已发现并报告 24 个漏洞。
推荐理由:作者以第一手实践拆解了任务流设计与运行步骤,并给出真实漏洞案例和 LLM 局限,方法可直接迁移到自己的项目审计。
Frank Wang 玉伯@lifesingerAI 评分3838MarkTechPost(RSS)AI 评分7373 NVIDIA 发布 Open Agent Safety Platform:OpenShell 沙箱隔离 Agent,Sentry 借 BlueField-4 毫秒级隔离
NVIDIA 发布 NVIDIA Open Agent Safety Platform,一个面向 AI Agent 安全的开放软件平台和参考系统设计,组合 OpenShell 安全运行时与运行在 BlueField-4 DPU 上的带外看护组件 Sentry,称超过 100 家组织参与。
The Verge:AI(RSS)AI 评分6363 AI 加持黑客攻击,医院银行等小型机构防御能力跟不上
The Verge 报道 AI 智能体正在放大黑客攻击能力,小型医院、银行和非营利组织难以招架。Anthropic 曾披露一个网络犯罪团伙用 Claude Code 在一个月内勒索医疗机构。
Artificial Analysis 完整文章(网页)精选AI 评分8080 Claude Sonnet 5.5 达到 Artificial Analysis 智能指数第 2 名
Artificial Analysis 发布对 Claude Sonnet 5.5 的评测:其智能指数得分 56,max effort 下比 Sonnet 5 高 18 分,升至第 2 名,仅落后 Opus 5.5 (max)。
推荐理由:Artificial Analysis 实测指出 Sonnet 5.5 逼近 Opus 5.5 依赖约 193k 输出 token,成本细节对选型有直接参考价值。
Rohan Paul@rohanpaul_aiAI 评分8383
lauren@potetoAI 评分5555Grok Bot 推出 Finance 集成,可连接银行、银行卡和投资账户,帮助管理支出和投资。作者建议结合其他连接器构建业务仪表盘、家庭预算工具,并通过排查忘记取消的订阅来省钱。
TechCrunch:AI(RSS)AI 评分6262 Nvidia 发布 Open Agent Safety Platform,用软硬件独立安全层约束失控 AI 智能体
Nvidia CEO 黄仁勋周一发布 Nvidia Open Agent Safety Platform,将开源软件 OpenShell 与运行在 BlueField-4 数据处理器上的独立监控系统 Sentry 结合,在智能体之外提供隔离的安全层,宣称能在毫秒级隔离越界的智能体。
Arthur Mensch@arthurmenschAI 评分3737
Google AI@GoogleAIAI 评分4444AWS Machine Learning Blog精选AI 评分6262 Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:AWS 官方给出 Sonnet 5.5 的定位、与 Opus 5.5 的分工以及 Bedrock 上的调用方式,便于判断何时选用。
Claude Code:GitHub Releases(RSS)AI 评分4646 Claude Code v2.1.284 发布:默认 Sonnet 模型升级为 Claude Sonnet 5.5
Claude Code v2.1.284 将 Anthropic API 上的默认 Sonnet 模型升级为 Claude Sonnet 5.5(claude-sonnet-5-5),支持 1M 上下文,定价 $2/$10 per Mtok、缓存读取 $0.20/Mtok。
Arena.ai@arena精选AI 评分6969推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。
Artificial Analysis@ArtificialAnlys精选AI 评分8282推荐理由:Artificial Analysis 用自家基准拆解了性能与 token 成本的权衡,为选型提供了可对比的量化参考。
TechCrunch:AI(RSS)AI 评分7171 Anthropic 发布 Sonnet 5.5,称其比前代更快更便宜
Anthropic 发布中端模型 Sonnet 5.5,官方称其比前代 Sonnet 5 快 30%,token 消耗明显更低。公司基准显示该模型在 agentic 编码上优于 Opus 5.5,并称其具备与 Opus 5 相当的网络安全能力,因此成为首个适用与 Fable 和 Opus 相同网络安全防护的 Sonnet 模型;公司还计划在未来几周发布新版本 Haiku。
Hacker News:AI 热帖AI 评分8686 Anthropic 发布 Claude Sonnet 5.5:速度提升 30%+,每任务成本最多降 30%
Anthropic 发布 Claude Sonnet 5.5,为 Claude 5.5 家族第二款模型,生成速度比 Sonnet 5 快 30% 以上,每任务成本最多低 30%,定价维持每百万输入 token $2、输出 $10、缓存读取 $0.20。
Arena.ai@arenaAI 评分6868