作者 @frxiaobei 称刚把 OpenClaw 升级到 2026.8.1,并表示用得越久越觉得个人 Agent 不要在意“更聪明”,模型智商会快速同质化,长期可靠性不会自动出现。
#Agent
#Agent
今日 18 条
凡人小北@frxiaobeiAI 评分2828IT之家(RSS)AI 评分6565 Glassdoor 研究显示保险理赔员成为美国最反感 AI 的职业群体
据 WIRED 报道,Glassdoor 研究发现提到 AI 的保险理赔员评价中 98% 持批评态度,成为美国最反感 AI 的职业群体,主要抱怨管理层强推易出错的 AI 且错误后果由理赔员承担。
IT之家(RSS)AI 评分4545 罗永浩吐槽新能源车企 AI 大模型,称试了数十辆车无一家接入完整版 Top 大模型
罗永浩 9 月 1 日发微博称,试了好几十辆新能源车后发现没有一家接入完整版的豆包、千问、Kimi 这类中国 Top 大模型,认为车企想推自家模型但模型质量不佳。他建议车企为消费者体验接入最好的大模型,额外收费也可以,这样每天在车里的一个多小时还能做点正事。相关话题随后登上微博热搜。
凡人小北@frxiaobeiAI 评分3333
Frank Wang 玉伯@lifesingerAI 评分2626IT之家(RSS)AI 评分4848 努比亚 NaviX Ultra 获入网许可,9 月上市并内置豆包手机助手
努比亚宣布全球首款 AI 智能体手机 NaviX Ultra 正式获得入网许可证,9 月上市,将搭载豆包手机助手。该机不再读取屏幕、模拟点击操作应用,而是依赖各应用自行提供 MCP 服务接入;豆包团队正与头部应用厂商谈判开放接口。
Frank Wang 玉伯@lifesingerAI 评分2626公众号:昆仑万维(天工)AI 评分2929 昆仑万维获2025年度新质企业金牛奖,AI业务进入商业兑现期
昆仑万维在中国证券报主办的2026科技创新与产业高质量发展大会上获颁2025年度新质企业金牛奖(人工智能)。公司2026年上半年营收53.59亿元,同比增长43.55%,归母净利润10.88亿元,同比增长227.17%;AI短剧平台单月流水超6500万美元,FreeReels位列出海短剧APP下载量第一。
IT之家(RSS)AI 评分3232 腾讯 WorkBuddy 向在职教师和高校大学生发放 1000 开学专属积分
腾讯公关总监张军宣布,即日起在职教师和高校大学生完成身份认证即可领取 WorkBuddy 1000 开学专属积分。范围覆盖全国普通高等学校(除港澳台)在读大学生,以及通过教育部“中国教师”小程序完成认证的各级各类学校在职教师。
公众号:火山引擎AI 评分4848 火山引擎发布 AgentSentry 企业 Agent 集群统一安全管理平台
火山引擎发布 AgentSentry,作为面向企业 Agent 集群的统一安全管理平台,打通智能体身份与权限管理平台、智能体安全管理平台、AI助手安全平台三大产品,提供跨平台、跨生态、跨运行环境的 Agent 纳管服务。
IT之家(RSS)AI 评分6565 美国五角大楼在 GenAI.mil 内网部署定制版 ChatGPT 和 Grok AI 助手
美国国防部本周在 GenAI.mil 内网门户加入 OpenAI 的 ChatGPT Mil 和 Starshield AI 的 Grok for Government,供数百万军人和文职人员处理非机密任务。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 WebWorld:把浏览器当作世界模型实现自改进的网页代码生成
arXiv 论文提出 WebWorld,让 VLM 与浏览器这一确定性可执行模拟器交互,将 VLM 的批评编译为类型化交互契约,浏览器重新执行候选代码,只有目标进展与既有能力保持同时满足时才签发验收证书,证书化的转移累积为质量棘轮并作为 SFT 导出的唯一数据。
eric zakariasson@ericzakariassonAI 评分2222Eric Zakariasson 汇总用户对 grok @bot 的改进反馈,公布十大方向:提高用量上限、减缓 token 消耗、增加第一方 connectors 并修复不稳定项。
🚨 AI News | TestingCatalog@testingcatalogAI 评分2525Artificial Intelligence News(网页)AI 评分5050 MCP 服务器为何成为 AI 的新攻击面
文章分析 MCP 服务器为何成为 AI 的最新攻击面。MCP 于 2024 年 11 月由 Anthropic 作为开放标准发布,到 2025 年 12 月已有超过 10,000 个活跃公共 MCP 服务器,被 ChatGPT、Gemini、Microsoft Copilot、Cursor 和 Visual Studio Code 等采用。
François Chollet@fcholletAI 评分2424Google AI:DEV 作者专属(RSS)AI 评分5151 Google AI 教程:用 pandas 把 Inspect AI 评测日志导出为 Google Sheets 可视化数据
Google AI 的 AI Evals 系列第三篇介绍用 tocsv.py 脚本通过 pandas 把 Inspect AI 评测日志转换为适合 Google Sheets 的 CSV。
IT之家(RSS)AI 评分6666 Meta AI 编程工具 Muse Code 结束 Beta 测试,新增多项功能并开启订阅
Meta 宣布 AI 编程工具 Muse Code 正式结束 Beta 测试,推出会话间消息传递、Workflow 工作流和 Rewind 回退功能,并发布 SDK 开发者预览版。
IT之家(RSS)AI 评分6868 OpenAI 否认窃取苹果商业机密,称纠纷是苹果自己造成
OpenAI 周一向加州圣何塞联邦地区法院提交文件,否认苹果关于其窃取商业机密的指控,称苹果未能证明机密信息被离职员工带走。苹果今年 7 月起诉 OpenAI 及前员工 Tang Tan 和 Chang Liu,指控其侵占硬件设计、制造和供应链相关机密;OpenAI 反驳称苹果鼓励员工用个人 iCloud 账户处理工作文件,且已从苹果招募约 400 名员工,认为诉讼意在拖慢竞争对手并阻止员工离职。
IT之家(RSS)AI 评分4747 机智连接推出 AI 纪要 TWS 耳机 Plaud One,内置 eSIM,定价 249.99 美元
深圳 AI 纪要硬件企业机智连接(Plaud)上周宣布推出 AI 纪要 TWS 耳机 Plaud One,内置 4G LTE eSIM,定价 249.99 美元(约合 1,684 元人民币),限量 2000 台。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 MineAmongUs:研究 VLM 智能体在具身社交互动中的言语与非言语联合欺骗
论文提出 MineAmongUs,一个 3D 多模态 Among Us 沙盒,让 imposter 智能体通过言语与非言语联合行动欺骗船员,并配套可配置的 VLM 智能体框架 ARIA 和基于欺骗分类学的原子与弧级标注方案。
Rohan Paul@rohanpaul_aiAI 评分6767ContextLeak 论文提出用强化学习训练攻击 LLM 生成恶意工具名称和描述,诱导 Agent 选中该工具并把用户提示词、对话历史、已装工具列表等敏感上下文作为参数传出。
IT之家(RSS)AI 评分5555 Manus 宣布正式恢复独立运营,创始人肖弘及团队留任
Manus 宣布即日起正式恢复独立运营,由创始人肖弘(Red Xiao)、首席科学家季逸超(Peak Ji)及联合创始人张涛(Hidecloud)组成的创始团队继续领导公司。
IT之家(RSS)AI 评分3434 小米澎湃 HyperOS 4 超级小爱交互焕新:动效实时反馈、任务上岛运行
小米官方宣布澎湃 HyperOS 4 超级小爱交互焕新,包括轻盈动效实时反馈、任务上岛运行、思考结果自动展开三项变化。此前 8 月底上线的超级小爱 8.2 版本带来码号上岛和小爱备车能力,8.2 版本已于 8 月 28 日起向澎湃 OS 4 Beta 用户分批推送,5 天内完成。
IT之家(RSS)AI 评分4242 大连化物所联合科大讯飞、阿里云发布智能化工大模型 3.0 Pro
中国科学院大连化物所联合科大讯飞、阿里云等研发的智能化工大模型 3.0 Pro 于 8 月 31 日发布,从知识问答模型升级为化工任务智能执行系统。模型构建大模型、智能体、专业技能与工具、应用场景四层体系,集成超过 400 个化工智能体和工具,文本问答与多模态问答准确率分别为 81.96% 和 80.75%,综合得分较 3.0 版本相对提升 20.2% 和 31.4%。
WorkBuddy@WorkBuddy_AIAI 评分2323
Rohan Paul@rohanpaul_aiAI 评分6565
Qwen@Alibaba_QwenAI 评分3939IT之家(RSS)AI 评分5454 中央网信办:当前 AI 领域主要面临 5 方面安全风险挑战
中央网信办网络安全协调局副局长王丽宏在 2026 年国家网络安全宣传周新闻发布会上介绍,当前 AI 领域主要面临 5 方面安全风险挑战。包括深度学习算法可解释性欠缺、前沿模型失控风险显现、高权限智能体如 OpenClaw 带来安全隐患、误用滥用冲击社会秩序与伦理边界,以及个别国家技术霸权加剧治理鸿沟。
HuggingFace Daily Papers(社区热门论文)AI 评分4040 AutoSciRub 提出评估优先框架,用自动归纳评分标准提升科研 Agent 表现
论文提出 AutoSciRub,一个评估优先框架,在科研任务执行前自动归纳任务专属的可执行评分标准(rubric),用于指导执行、逐条验证和迭代修订。该框架将模糊指令分解为原子科学目标,结合文献和任务数据合成具体可验证的标准。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 MNIST-PRO 基准:将 MNIST 改造为面向 AI 智能体的部分可观测环境
研究者提出 MNIST-PRO 基准,把 MNIST 数字识别改造成带回看约束的序列化瞥视搜索任务,以隔离评测智能体的感知状态构建能力。评测覆盖十个多模态模型和四种记忆表征,发现模型在全可观测下表现良好,但部分可观测下暴露三类瓶颈:难以整合碎片化瞥视、过早停止探索、面对矛盾证据时难以修正早期错误信念。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 CAST:面向可靠长程工具调用智能体的批判感知监督训练框架
论文提出 CAST,一种批判感知训练框架,将稀疏任务结果转化为动作级监督,用于批判学习与策略优化,通过分析智能体轨迹合成解释动作有效性的结构化理由。在动态工具调用基准上微调 Qwen3 系列模型,Retail 任务 pass^4 超过 GPT-OSS-120B 达 10% 以上,域外 Telehealth 场景额外提升 9%。
HuggingFace Daily Papers(社区热门论文)AI 评分4444 NavMCP 框架将基础模型组合为物理世界智能体,推进长时程导航前沿
论文提出 NavMCP,一个将 VLM 推理智能体与导航基础模型(NFM)执行器耦合的智能体脚手架框架,通过意图、观察、记忆三条通道协作,无需重训任一模型即可实现长时程探索。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 PaperBanana-Interact:基于多轮人类反馈的科学图表精修系统
论文提出 PaperBanana-Interact,一个通过内部 critique-and-refine 循环精修科学图表的多智能体系统,并发布多轮图表生成基准 MTPaperBananaBench,含 292 张图像和 3,518 条用户需求标注。
公众号:百度智能云(文心)AI 评分3434 百度千帆Token Plan企业版更新:DeepSeek-V4-Pro-0813与GLM-5.3等三款模型上线并接入百度搜索工具
百度千帆Token Plan企业版更新,DeepSeek-V4-Pro-0813正式版与GLM-5.3、GLM-5.3-Flash三款模型上线,原有模型ID可直接调用。百度搜索工具正式接入,专属API-KEY即可调用,限时优惠每次2.5积分。Token福利包扩展覆盖语音、OCR、智能文档分析等AI开放能力,席位扩展为四档并有限时赠送积分、夜享Token低至2折等活动。
OpenClaw🦞@openclawAI 评分5151
Rohan Paul@rohanpaul_aiAI 评分5050IT之家(RSS)AI 评分6161 科大讯飞开源词元星火 X2.5-4B 和 1.7B 端侧模型,原生支持 100 万 Token 上下文
科大讯飞旗下词元星火发布并开源星火 X2.5-4B 和 X2.5-1.7B 两款端侧通用大模型,原生支持最长 100 万 Token 上下文窗口。
HuggingFace Daily Papers(社区热门论文)AI 评分4343 PaperGym:以评分标准为中心的研究计划生成演化框架
论文提出 PaperGym,将每篇科研论文转化为研究计划生成的完整训练环境,题目由研究目标与背景合成,评分标准来自方法与实验部分,标准泄漏降至 3.7%,低于现有数据集的 11.90% 至 34.10%。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 论文提出超越人类监督扩展大型推理模型的 L0-L4 路径框架
论文研究大型推理模型(LRM)如何在人类监督逐渐退出学习回路后继续提升,提出从 L0 到 L4 的五级阶梯框架,覆盖奖励轴(从人工判断到无需人类反馈的可复用验证器)和经验轴(从人工策划任务到自生成课程与自主协同进化)。