跳到正文

全部动态

今日 2 条
9月14日周一
9月13日周日
  1. MarkTechPost(RSS)79

    Agent 长任务上下文工程解析:用预算控制、压缩、todo-state 和记忆对抗上下文溢出与目标丢失

    文章解析 Agent harness 层应对长任务中上下文溢出与目标丢失的四类机制:上下文预算与卸载、压缩、todo-state 复述和跨会话记忆。

    推荐理由:文章把解决长任务中上下文溢出与目标丢失的机制拆成四类,并对照多款主流 Agent 产品的具体实现和阈值,便于读者迁移到自己的系统。

9月12日周六
  1. Epoch AI:研究、数据与评测60

    Epoch AI 评审 ExploitBench v0.1:基于 41 个真实 V8 漏洞的利用基准评测

    Epoch AI 发布对 ExploitBench v0.1 的基准评审,该基准用 41 个真实公开 V8 CVE,按 5 层 16 项可验证能力阶梯为模型打分,最高到任意代码执行(ACE)。

    推荐理由:Epoch AI 独立评审 ExploitBench 的评分设计与局限,读者可借此理解如何解读该基准的模型分数与污染风险。

  2. Simon Willison 博客60

    Simon Willison 介绍使用 OpenRouter 的供应商路由陷阱与对策

    Simon Willison 转述 Mohamed Moustafa 对 OpenRouter 自动路由的问题分析。不同供应商的推理软件、优化设置不同,同一端点可能行为不一致,部分供应商的视觉模型缺少视觉能力,reasoning effort 参数的处理方式也有差异。可用 provider.only 指定供应商,并通过 /endpoints 方法查询某模型可用供应商列表。

9月11日周五
  1. 公众号:卡尔的AI沃茨76

    实测 DeepSeek V4.1 Flash:价格大降、原生带视觉,作者用游戏与城市生成任务验证表现

    作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。

    推荐理由:作者实测 DeepSeek V4.1 Flash 的价格、架构参数和多个生成任务,并给出与 GLM 5.3 Flash 的对比结果和暴露的缺陷。

  2. GitHub Blog53

    GitHub Copilot 应用入门教程:用 diff、终端和浏览器面板审查 AI 代码

    GitHub Copilot 应用新增 diff、终端、浏览器三个内置面板,让初学者在不离开应用的情况下完成 AI 智能体改动的审查、运行和预览。diff 面板以红绿高亮显示增删改行,用户可接受、评论或要求修改;终端面板可运行项目命令并支持多窗口,浏览器面板配合 Pick & Polish 工具选中界面元素让智能体调整,最后可直接在应用内接受变更并创建 pull request。

  3. LlamaIndex:产品、工程与评测65

    LlamaIndex 解析 just-in-time Agentic OCR:两遍式文档处理如何平衡成本与精度

    LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。

    推荐理由:作者用 84 份 SEC 文件实测两遍式文档处理流程,给出明确的适用边界和成本数字,方法可直接迁移到自己的数据室场景。

9月10日周四
  1. Tripo66

    Tripo 转发用户案例,展示用 Images 2.5、Tripo 智能网格 P2.0、GPT-6 Astra 和 Blender MCP 以 AI 为主制作 3D 角色的完整流程。作者几乎只做视图操作,通过截图加参考图让 Astra 修正形状与纹理,并指出纹理修正在细节上仍较粗糙。作者称此前在 GPT-5.6 Sol 上反复失败的操作在 Astra 上可以直接完成。

    推荐理由:原文给出完整的 12 步 3D 角色制作工作流和截图生成参考图的修正方法,Blender 初学者可以照着复用。

  2. 公众号:龙猫LongCat(美团)60

    美团龙猫LongCat发布《Agent评测白皮书》系列首篇:Agent评测全览

    美团龙猫LongCat团队推出《Agent评测白皮书》系列博客,首篇《评测全览》体系化讲解Agent评测落地方法,计划共4篇,后续将覆盖冷启动、扩量和自进化。文章提出评测体系可概括为四个模块(离线评测、在线评测与监控、Case挖掘与归因、观测基建)、三种能力、两条Loop和一套评测资产,以商家经营分析Agent为贯穿案例,并附评测体系成熟度自查表。