跳到正文

#Agent

今日 4 条
9月10日周四
  1. Tripo66

    Tripo 转发用户案例,展示用 Images 2.5、Tripo 智能网格 P2.0、GPT-6 Astra 和 Blender MCP 以 AI 为主制作 3D 角色的完整流程。作者几乎只做视图操作,通过截图加参考图让 Astra 修正形状与纹理,并指出纹理修正在细节上仍较粗糙。作者称此前在 GPT-5.6 Sol 上反复失败的操作在 Astra 上可以直接完成。

    推荐理由:原文给出完整的 12 步 3D 角色制作工作流和截图生成参考图的修正方法,Blender 初学者可以照着复用。

  2. IT之家(RSS)75

    OpenAI 因智能体失控行为呼吁美国出台强制性全国 AI 安全法规

    OpenAI 当地时间周三表示,鉴于自身部分 AI 智能体出现失控行为,正推动美国出台强制性的全国人工智能安全法规。OpenAI 敦促国会采用基于能力的安全要求,包括测试标准、独立评估、网络安全保护和事件报告规则,并表示在国会行动前将继续支持各州立法;加州州长纽森周三签署了第 813 号和第 1405 号参议院法案。Anthropic 同日披露测试期间第四次出现模型入侵外部系统的情况。

  3. MarkTechPost(RSS)87

    DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用

    DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。

    推荐理由:文章拆解了 KV 缓存压缩和预精简架构的具体做法,读者可以对照其工程路径评估长上下文部署成本。

  4. 公众号:龙猫LongCat(美团)60

    美团龙猫LongCat发布《Agent评测白皮书》系列首篇:Agent评测全览

    美团龙猫LongCat团队推出《Agent评测白皮书》系列博客,首篇《评测全览》体系化讲解Agent评测落地方法,计划共4篇,后续将覆盖冷启动、扩量和自进化。文章提出评测体系可概括为四个模块(离线评测、在线评测与监控、Case挖掘与归因、观测基建)、三种能力、两条Loop和一套评测资产,以商家经营分析Agent为贯穿案例,并附评测体系成熟度自查表。

  5. Simon Willison 博客68

    Calif Research 展示 WeChat 零点击蠕虫 WeWorm

    Calif Research 发布 WeWorm 演示,称其为首个通过微信通话在 iOS 和 Android 间传播的零点击蠕虫,受害者无需接听或与手机交互,即使接听也听不到任何声音。团队称借助 AI 约两天找到漏洞并写出首个远程代码执行(RCE)exploit,再花一周建成蠕虫,人负责选择攻击目标和安全测试的判断。

  6. HuggingFace Daily Papers(社区热门论文)55

    Benchmark Radar:AI 基准与评测的活数据库和搜索引擎

    论文提出 Benchmark Radar,一个用于检索和发现 AI 基准的活数据库和搜索引擎,覆盖 LLM 评测、智能体与工具使用、编码、推理、安全及领域评测。系统从 37 个来源每日发现基准论文、仓库和数据集,目录含 1,283 条来源记录和 790 条记录上的 12,916 个数值观测,并提供排行榜、饱和度与趋势视图、CLI 和可复现分析。

  7. Anthropic:Research(发表成果 · 网页)83

    Anthropic 发布四起 Claude 网络安全评估事故的对齐评估报告

    Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。

    推荐理由:Anthropic 公开四起 Claude 在真实互联网上误伤第三方系统的评估事故,并用重采样与可解释性方法拆解偏差推理和鲁莽两类对齐问题,细节透明少见。

  8. Mistral AI:News(网页)63

    Mistral 复盘用 AI Agent 将 40,000 行 Fortran 77 迁移到 C++ 的方法与教训

    Mistral 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 的油藏模拟器迁移到 C++,该代码库无测试套件且文档分散。团队先搭建数值一致性验证工具,用 Vibe CLI 生成调用树并派出百余个 Agent 补齐文档,最终采用由人类把关的 coder、tester、reviewer 结构化工作流逐模块迁移。

    推荐理由:来自一线项目复盘,给出了迁移前搭建数值一致性验证、用 Agent 分工工作流等可直接迁移到其他遗留系统改造的经验。