跳到正文

#Agent

今日 0 条
9月9日周三
  1. Tianyi Cui52

    DeepSeek 针对约 150 个资深后端/服务端工程师社招岗位重新设计了笔试和面试。笔试删除 ACM 类代码题改为系统设计题,算法题只需写思路或伪代码,面试流程时间跨度大幅缩短;校招仍沿用原有题目。岗位涵盖大模型研究平台、Agent 框架组件、DeepSeek API 等方向,工作地点北京(优先)或杭州,简历可投 talent@deepseek.com 或扫码投递。

  2. Cognition 模型 / Devin 博客(网页)76

    Cognition 团队用 Devin 完成 RSA-260 分解,刷新公开 RSA 挑战纪录

    Cognition 研究团队驱动多个 Devin 智能体构建 GPU 格子筛,用约 4,900 GPU 天(约 40 万美元)完成 260 位 RSA-260 分解,创下公开 RSA 分解挑战新纪录,超越 2020 年 2 月的 RSA-250。

    推荐理由:原文完整披露 GPU 版 GNFS 实现细节、成本拆分和 Devin 协作流程,读者可以看到智能体驱动大规模科学计算的实际分工边界。

9月8日周二
  1. Berkeley RDI:Blog(AI 安全与评测)61

    Berkeley RDI 发布开源平台 CUA-Lite,面向计算机使用智能体

    Berkeley RDI 推出开源平台 CUA-Lite,为计算机使用智能体提供三个标准化抽象。其环境接口下运行 15+ 个覆盖桌面、浏览器和移动端的基准,并提供含 30k+ 可验证任务的免 VM 桌面沙箱;统一监督数据格式已转换 10+ 个公开 CUA 数据集;每模型一个 harness 在评测、SFT 和 RL 间共享,支持 14 个模型族。

    推荐理由:原文说明了平台的三项标准化抽象及覆盖规模,读者可以据此评估它在整合分散的计算机使用智能体资源上的可用性。

  2. IT之家(RSS)64

    阿里发布数字员工产品 QoderWake 1.0,已有近 10 万个数字员工上岗

    阿里宣布推出数字员工产品 QoderWake 1.0,用户用一句话描述岗位需求即可生成角色文档并创建数字员工,内置前端、后端、产品经理、数据分析师等 10 个岗位。产品已接入钉钉、飞书和企业微信,可读取组织内的文档、表格、待办、日历等作为持续更新的知识;系统默认拦截高危操作,命中预设规则时向用户申请授权。据介绍,过去三个月已有近 10 万个数字员工在真实工作场景上岗,执行约 200 万次有效任务。

  3. 公众号:卡尔的AI沃茨54

    实测个人AI助手Today:记忆可改可删,晨间简报按日程偏好自动调整

    作者以自己的日历、跑步训练和睡眠数据实测个人生活AI助手Today(Public Beta),认为其定位是个人生活连续性管理而非任务交付型工作Agent。文中记录了三个体验:日程被临时打乱时生成晨间简报并建议同步日历、睡眠不足时自动顺延非紧急待办、记忆面板可查看编辑删除每条事实且改动即时生效。作者建议按阶梯信任逐步开放权限,并指出语言切换不同步等早期产品问题。

  4. MarkTechPost(RSS)56

    Reducto 发布 r-1 单遍文档解析模型,错误率降 20%、每页 1 美分

    Reducto 发布 r-1,用一次全页解析替代多阶段 agentic OCR 流水线,官方称相较自家旧管线错误率降低 20%,价格从每页 3 至 6 美分降至 1 美分全包。r-1 原生处理表格、阅读顺序、格式和边界框 grounding,需 V3 Parse API 通过 settings.model 开启,暂无开源权重;对标 Amazon Textract 等的评测为厂商自测,未公开数据集。

  5. 公众号:数字生命卡兹克76

    GPT-6 Astra操控Blender保姆级教程:三种玩法与踩坑实录

    作者数字生命卡兹克发布GPT-6 Astra操控Blender的小白教程,介绍前期安装、官方MCP与Computer Use插件配置,并实测三种玩法。Computer Use花约4小时搭出天坛祈年殿,但耗掉200美刀Pro会员近半额度;MCP更快,可完成摩托车建模与组装动画,但复杂任务会单次运行超时,可拆分步骤或用CLI执行Python脚本解决。

    推荐理由:作者实测了Computer Use、官方MCP和CLI三种方式并给出各自的速度、成本与适用边界,方法可直接照做。

  6. vLLM 官方博客(RSS)63

    vLLM x AgentX:面向真实世界智能体推理服务的全栈优化

    vLLM 团队发布针对智能体负载优化的博客,基于 SemiAnalysis 的公开 AgentX 基准展示成果:DeepSeek V4 Pro 在 GB300 上达到 83K total tokens/GPU-秒。

    推荐理由:vLLM 团队结合 AgentX 实测数据讲解智能体负载的全栈优化方法与失败教训,读者可以借此理解并行策略如何跟随模型架构调整。