#Agent
#Agent
今日 0 条
Rohan Paul@rohanpaul_aiAI 评分8282Hacker News 热门(buzzing.cc 中文翻译)AI 评分6565 i-have-adhd:一个防止编码智能体把答案深埋在输出中的 skill
GitHub 上的 i-have-adhd 项目提供一个 skill,用于防止编码智能体把最终答案深埋在输出里。该项目经由 Hacker News 热门讨论传播,HN 获得 101 分。
Sam Altman@samaAI 评分7878LangChain:Blog(RSS)AI 评分5858 LangChain 讲解 deepagents 多智能体框架中的上下文组织方式
LangChain 发布博客,介绍 deepagents 中的 context modes 如何帮助子智能体分叉 supervisor 的上下文或以隔离方式启动,从而让多智能体工作更快、更省、更聚焦。
Nathan Lambert@natolambertAI 评分5454
elvis@omarsar0AI 评分7979
🚨 AI News | TestingCatalog@testingcatalogAI 评分7676
Ethan Mollick@emollickAI 评分7575
Tianyi Cui@tianyiAI 评分5252
ClaudeDevs@ClaudeDevs精选AI 评分6868Anthropic 团队文章指出,优化 prompt cache 命中率、清除升级到前沿 Claude 模型后的提示词反模式、校准 effort 三个手段可在不牺牲性能的情况下降低成本。
推荐理由:官方团队给出提示词缓存、反模式清理和 effort 校准三条降本路径,并用公开基准实测数字支持,方法可迁移到自己的 Claude 应用。
TechCrunch:AI(RSS)AI 评分5757 Google Cloud 与 Accenture 成立 Gemini Enterprise 业务组加码企业 AI 部署
Google Cloud 与 Accenture 成立 Accenture Gemini Enterprise Business Group,Google 将培训至多 1,000 名 Accenture 前置部署工程师,帮助企业在 Gemini Enterprise 平台上构建定制 AI 应用。
Cognition 模型 / Devin 博客(网页)精选AI 评分7676 Cognition 团队用 Devin 完成 RSA-260 分解,刷新公开 RSA 挑战纪录
Cognition 研究团队驱动多个 Devin 智能体构建 GPU 格子筛,用约 4,900 GPU 天(约 40 万美元)完成 260 位 RSA-260 分解,创下公开 RSA 分解挑战新纪录,超越 2020 年 2 月的 RSA-250。
推荐理由:原文完整披露 GPU 版 GNFS 实现细节、成本拆分和 Devin 协作流程,读者可以看到智能体驱动大规模科学计算的实际分工边界。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6060 TradingAgents 开源多智能体 LLM 金融交易框架,v0.4.0 已发布
TradingAgents 是一个模仿真实交易公司分工的多智能体 LLM 金融交易框架,已完全开源,最新 v0.4.0 修复了 FRED 宏观、社交情绪和决策日志中的未来函数问题,并支持 GPT-5.6 和 GLM-5.3。
X.PIN@thexpinAI 评分5555科技记者撰文回应 Bill Gates 在 Gates Notes 发表的约 6000 字 AI 长文,认为其诊断过于着眼未来,缺少对推动当前热潮的创始人、投资者、银行和云厂商的问责机制。
Berkeley RDI:Blog(AI 安全与评测)精选AI 评分6161 Berkeley RDI 发布开源平台 CUA-Lite,面向计算机使用智能体
Berkeley RDI 推出开源平台 CUA-Lite,为计算机使用智能体提供三个标准化抽象。其环境接口下运行 15+ 个覆盖桌面、浏览器和移动端的基准,并提供含 30k+ 可验证任务的免 VM 桌面沙箱;统一监督数据格式已转换 10+ 个公开 CUA 数据集;每模型一个 harness 在评测、SFT 和 RL 间共享,支持 14 个模型族。
推荐理由:原文说明了平台的三项标准化抽象及覆盖规模,读者可以据此评估它在整合分散的计算机使用智能体资源上的可用性。
OpenBMB@OpenBMBAI 评分5353面壁智能 OpenBMB 在开源 MiniCPM5-2B 后,进一步开源其背后的 RL 训练栈。Meshy 是服务化 RL 训练框架,将推理、rollout 和训练解耦为统一数据平面上的独立服务。
IBM Research:AIAI 评分5151 IBM Research 展示用 llm-d 在 544 块 NVIDIA H100 上服务 GLM-5.2 智能体负载
IBM Research 联合 Red Hat、Google 的开源项目 llm-d 展示在 544 块 NVIDIA H100 GPU 上部署 753B 参数的开放权重 MoE 模型 GLM-5.2(约 39B 激活),在数百到 3000 个并发编码智能体负载下峰值输出超 6.6M tokens 每分钟,零抢占。
IT之家(RSS)AI 评分6363 微软提出让每张办公桌每个家庭拥有不受限制的智能的新愿景
微软 Windows 与设备销售企业副总裁 Mark Linton 在 IFA 2026 上提出新愿景,让每张办公桌、每个家庭都拥有不受限制的智能,即本地运行日常 AI 模型、云端只留给复杂任务。
X.PIN@thexpinAI 评分5454IT之家(RSS)AI 评分6666 微软发布 Project Opal:Copilot 智能体可连续数小时或数天自主完成任务
微软 CEO 纳德拉于 9 月 7 日宣布为 Microsoft 365 Copilot 推出 Project Opal,定位为在可控、可追踪环境中规划并执行复杂长周期任务的 AI 智能体,可连续工作数小时或数天。
IT之家(RSS)AI 评分5454 小米 MiMo 桌面客户端开放邀测:支持生成完整预览界面、自主控制浏览器
小米宣布 Xiaomi MiMo Desktop 桌面客户端正式开放邀测,通过申请的用户可限时限量免费体验 MiMo-X-Pro-Preview 和 MiMo-X-Flash-Preview 两款新一代模型 Preview 版。
IT之家(RSS)AI 评分6464 阿里发布数字员工产品 QoderWake 1.0,已有近 10 万个数字员工上岗
阿里宣布推出数字员工产品 QoderWake 1.0,用户用一句话描述岗位需求即可生成角色文档并创建数字员工,内置前端、后端、产品经理、数据分析师等 10 个岗位。产品已接入钉钉、飞书和企业微信,可读取组织内的文档、表格、待办、日历等作为持续更新的知识;系统默认拦截高危操作,命中预设规则时向用户申请授权。据介绍,过去三个月已有近 10 万个数字员工在真实工作场景上岗,执行约 200 万次有效任务。
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6565 7 个 AI 模型运营真实业务实验:开出 12,431 美元虚假发票,零收入亏损约 3,200 美元
Bottleneck Labs 让 7 个前沿模型各自获得 300 美元启动资金、一台解锁的 Mac mini 和 72 小时真实时间,指令是尽可能赚钱。
公众号:小米 MiMoAI 评分5757 Xiaomi MiMo Desktop 桌面客户端开放邀测,携 MiMo-X 系列 Preview 模型
Xiaomi MiMo Desktop 桌面客户端携两款新一代模型 Preview 版(MiMo-X-Pro-Preview、MiMo-X-Flash-Preview)正式开放邀测,用户可提交申请限时免费体验。
OpenBMB@OpenBMBAI 评分6262OpenBMB 发布 MiniCPM5 端侧模型,采用 Apache 2.0 协议,1B 与 2B 版本支持 128K 上下文、编码、推理和智能体工具调用。
公众号:卡尔的AI沃茨AI 评分5454 实测个人AI助手Today:记忆可改可删,晨间简报按日程偏好自动调整
作者以自己的日历、跑步训练和睡眠数据实测个人生活AI助手Today(Public Beta),认为其定位是个人生活连续性管理而非任务交付型工作Agent。文中记录了三个体验:日程被临时打乱时生成晨间简报并建议同步日历、睡眠不足时自动顺延非紧急待办、记忆面板可查看编辑删除每条事实且改动即时生效。作者建议按阶梯信任逐步开放权限,并指出语言切换不同步等早期产品问题。
公众号:面壁智能(MiniCPM)AI 评分5858 面壁智能联合 OpenBMB 开源 MiniCPM5-2B,AA 榜单 4B 以下综合第一
9 月 8 日,面壁智能联合 OpenBMB 开源 2B 端侧基座模型 MiniCPM5-2B,支持工具调用、深度搜索、代码生成。
MarkTechPost(RSS)AI 评分5656 Reducto 发布 r-1 单遍文档解析模型,错误率降 20%、每页 1 美分
Reducto 发布 r-1,用一次全页解析替代多阶段 agentic OCR 流水线,官方称相较自家旧管线错误率降低 20%,价格从每页 3 至 6 美分降至 1 美分全包。r-1 原生处理表格、阅读顺序、格式和边界框 grounding,需 V3 Parse API 通过 settings.model 开启,暂无开源权重;对标 Amazon Textract 等的评测为厂商自测,未公开数据集。
IT之家(RSS)AI 评分5656 Arm 发布第二代移动计算子系统 CSS for Mobile 2,搭载双 SME2 引擎与神经加速 GPU
Arm 在上海 Arm Everywhere China 活动上发布第二代移动终端计算子系统 CSS for Mobile 2,集成 Arm C2 CPU 集群、Mali G2-Ultra NX GPU 和 SI L2 系统互连,面向智能体 AI 与 AI 原生图形。
Rohan Paul@rohanpaul_aiAI 评分5353
MeshyAI@MeshyAIAI 评分5858公众号:数字生命卡兹克精选AI 评分7676 GPT-6 Astra操控Blender保姆级教程:三种玩法与踩坑实录
作者数字生命卡兹克发布GPT-6 Astra操控Blender的小白教程,介绍前期安装、官方MCP与Computer Use插件配置,并实测三种玩法。Computer Use花约4小时搭出天坛祈年殿,但耗掉200美刀Pro会员近半额度;MCP更快,可完成摩托车建模与组装动画,但复杂任务会单次运行超时,可拆分步骤或用CLI执行Python脚本解决。
推荐理由:作者实测了Computer Use、官方MCP和CLI三种方式并给出各自的速度、成本与适用边界,方法可直接照做。
Rohan Paul@rohanpaul_aiAI 评分6969HuggingFace Daily Papers(社区热门论文)AI 评分5959 Feyospace-v1:七人独立团队训练出领先的开源网络智能体模型
论文提出以数据为中心的 Feyospace-v1 框架,通过五套系统与可重置的编码、漏洞、CTF、内核历史、完整利用、固件和设备环境生成数据,经执行验证和证据审计后保留 164,269 条轨迹用于长上下文监督微调。
vLLM 官方博客(RSS)精选AI 评分6363 vLLM x AgentX:面向真实世界智能体推理服务的全栈优化
vLLM 团队发布针对智能体负载优化的博客,基于 SemiAnalysis 的公开 AgentX 基准展示成果:DeepSeek V4 Pro 在 GB300 上达到 83K total tokens/GPU-秒。
推荐理由:vLLM 团队结合 AgentX 实测数据讲解智能体负载的全栈优化方法与失败教训,读者可以借此理解并行策略如何跟随模型架构调整。
vLLM 官方博客(RSS)AI 评分5454 vLLM 推出 Hybrid HiSparse 优化,让 GLM 5.3 在单节点 8× H200 上跑满 100 万上下文
vLLM 团队为 GLM 5.3 引入 Hybrid HiSparse 混合稀疏卸载,在单个 8× H200 节点上首次实现 100 万完整上下文长度推理。该方法仅在 KV cache 压力出现时才将 top-K 之外的 KV 卸载到 CPU,热页与常驻页共享同一块池和张量,无需抢占或重新 prefill。
DAIR.AI@dair_aiAI 评分5353MarkTechPost(RSS)AI 评分6363 OpenBMB 发布 MiniCPM5-2B:2.52B 稠密模型,34 项基准平均 53.9,面向端侧运行
OpenBMB 发布 MiniCPM5 系列第二个 checkpoint MiniCPM5-2B,2.52B 稠密模型,原生 131,072 token 上下文,Apache 2.0 权重,采用标准 LlamaForCausalLM 架构,可通过 vLLM、SGLang、llama.cpp、Ollama 等主流引擎直接运行。
The Decoder:AI News(RSS)AI 评分6060 GPT-6 Astra 在无人工干预下约 23 小时 43 分钟通关 Portal
开发者 cozyblaze 在 X 上宣布,GPT-6 Astra 在设定初始目标后无需任何人工帮助通关了完整 Portal,用时约 23 小时 43 分钟,按 Astra 牌价 token 花费至少 570 美元,实际使用 200 美元的 Codex 订阅。
OpenBMB@OpenBMBAI 评分6262