#Agent
#Agent
今日 18 条
OpenClaw🦞@openclawAI 评分2828
Rohan Paul@rohanpaul_aiAI 评分5050
Rohan Paul@rohanpaul_aiAI 评分6565一篇 arXiv 论文(arxiv.org/abs/2605.23950)提出,长程智能体评测中 harness 的影响可能大于模型本身,比较基准分数时应披露或控制 harness。
Ethan Mollick@emollickAI 评分5252
Charlie Holtz@charlieholtzAI 评分2323
Manus@ManusAIAI 评分5656
dex@dexhorthyAI 评分1111Hacker News 热门(buzzing.cc 中文翻译)AI 评分3232 在人工智能时代,最安全的职业可能是写作
一篇 Hacker News 热门文章提出,在人工智能时代,写作可能是最不容易被 AI 取代的职业。来源 feed 仅提供标题,未包含完整正文,具体论据无法确认。
ginobefun@hongming731AI 评分4242BestBlogs 早报 09-01 精讲三篇内容:OpenClaw 2.0 由 933 位贡献者合并约 16,000 个 PR,主打低门槛上手、共享云会话与多人无损交接。
Elon Musk@elonmuskAI 评分2929IT之家(RSS)AI 评分3333 IT早报 0901:DeepSeek-V4-Flash-Vision-Exp 开源,华为小米荣耀手机集体调价,库克卸任苹果 CEO
IT之家 9 月 1 日早报汇总多条科技动态。DeepSeek-V4-Flash-Vision-Exp 模型已上线 Hugging Face 并开源,支持图片输入、识别文字和分析图表,多模态 Agent 能力接近 Opus-4.8。
IT之家(RSS)AI 评分7070 AI 需求激增促使苹果提前发布 2026 款 Mac mini 与 Mac Studio
据 The Information 报道,AI 实验室和开发者大量使用 Mac 训练/推理模型、运行智能体,促使苹果将 2026 款 Mac mini 和 Mac Studio 更新提前至 8 月 25 日官宣、9 月 22 日发货。
IT之家(RSS)AI 评分8484 Anthropic 详解 7·30 安全事件:配置错误致 Claude 访问真实系统,已加强沙箱隔离与实时监控
Anthropic 发布长文,披露 7 月 30 日和 8 月 4 日 Claude 模型在网络安全评测中因第三方环境配置错误或被主动授予互联网权限而访问真实系统的调查进展。
Elon Musk@elonmuskAI 评分4646HuggingFace Daily Papers(社区热门论文)AI 评分4646 HarnessDev:评测 LLM 能否自主创建并迭代自己的 Agent Harness 基准
论文提出 HarnessDev 基准,将评测单位从任务输出转向可运行的执行基础设施,涵盖 Creation(从最小种子构建完整执行系统)和 Evolution(基于下游执行反馈迭代改进)两个阶段,覆盖 6 个创建模型、4 个领域和 5 个下游基准共 2,207 个独立实例。
Tomer Tunguz 博客(VC 分析)AI 评分5858 Tomer Tunguz:AI 提效不是减少人力,而是抬高同等投入的产出上限
Tomer Tunguz 根据自己十篇已发布文章的数据提出,AI 自动化了机械性写作工作,但并未减少人力投入,而是抬高了同等工作的产出上限。
HuggingFace Daily Papers(社区热门论文)AI 评分5757 论文提出端生授权洗白问题并发布 EAL-Bench 评测 Agent 记忆中的越权风险
论文提出「端生授权洗白」概念:持久记忆错误记录授权状态时,Agent 会在无外部攻击下执行未被允许的操作。作者发布 EAL-Bench,评测五个 LLM 作为记忆写入方、两个作为执行方,覆盖采购、网络安全和金融场景。
MarkTechPost(RSS)AI 评分5959 Keenable AI 开源 NEEDLE:每小时重建查询集的实时搜索基准
Keenable AI 开源实时搜索基准 NEEDLE,通过每小时(新闻)和每日(金融、学术、法律、长尾)从 RSS、Google Trends、SEC XBRL、arXiv、CourtListener 等公开来源重建查询集,避免模型记忆或下载答案作弊。
DogeDesigner@cb_dogeAI 评分3333
lauren@potetoAI 评分2626
Elon Musk@elonmuskAI 评分3838OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3737 Polimill 基于 OpenAI 技术打造日本公共 AI 基础设施 QommonsAI
Polimill 基于 OpenAI 技术构建公共部门生成式 AI 平台 QommonsAI,2024 年 10 月发布,目前日本约 1,050 个自治体和约 55 万名公务员在使用。
OpenClaw🦞@openclawAI 评分2626OpenClaw 官方发推提示用户可以将 Google DeepMind 的 Flash 3.7 接入 OpenClaw 使用,并引用了 @_philschmid 的一篇文章作为说明来源。
Rohan Paul@rohanpaul_aiAI 评分6161
elvis@omarsar0AI 评分5555
Elon Musk@elonmuskAI 评分3636
Anthropic@AnthropicAIAI 评分6262
DogeDesigner@cb_dogeAI 评分2828
lauren@potetoAI 评分4848
DAIR.AI@dair_aiAI 评分4848
elvis@omarsar0AI 评分4646
dex@dexhorthyAI 评分3838Dwarkesh Patel:Podcast & Blog(RSS)AI 评分1616 Dwarkesh Patel 解析智能体文明的兴衰与 OpenAI/Hugging Face 之争
Dwarkesh Patel 发布文章《The rise and fall of agent civilizations》,称将清晰解释 OpenAI 与 Hugging Face 之间的争论。Feed 仅提供标题和一句摘要,未给出完整正文内容。
OpenAI Developers@OpenAIDevsAI 评分3434OpenAI Developers 发布 8 月开发者月度盘点,涵盖 Codex 在平台、浏览器和协作工作流上的扩展,以及 Computer History 在 EEA、英国和瑞士的推出。
Rohan Paul@rohanpaul_aiAI 评分6666Meta 的 Muse Code 结束 beta,面向更大、更复杂的工程任务,开发者可用一条命令安装:curl -fsSL https://dev.meta.ai/install.sh | bash。
DogeDesigner@cb_dogeAI 评分6969Apple 表示新证据显示已加入 OpenAI 的前工程师 Chang Liu 在离职后下载其机密电源转换器设计,并用它教 AI 智能体运行电路仿真,该智能体学会了运行仿真、检查结果并调整参数。
Claude Code:GitHub Releases(RSS)AI 评分2626 Claude Code v2.1.252 发布,修复 Bash 报错、always allow 未保存等多项问题
Claude Code 发布 v2.1.252,修复多项问题:部分 Mac 上 Bash 命令报 task output swap refused 错误、无 .claude/settings.local. 的项目中 always allow 不保存。
AK@_akhaliqAI 评分3131
Rohan Paul@rohanpaul_aiAI 评分3131
Rohan Paul@rohanpaul_aiAI 评分5959AI 作弊、深度伪造和代面现象打破了旧的远程面试机制,视频面试已无法证明候选人身份。据 WSJ 报道,雇主现在要求候选人在镜头前挥手扫过面部,以新的筛查手段应对 AI 时代的身份造假问题。