跳到正文

#多模态

今日 4 条
9月22日周二
  1. Xiaomi MiMo73

    小米 MiMo 发布 MiMo-V2.6 Pro 与 Flash 两个全模态模型,通过规模化强化学习训练。Pro 在多数 Agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis Intelligence Index 得分 46,为开源模型中最高;能力覆盖编码、computer use、3D 推理和创作。

    推荐理由:官方发布全模态模型并开放权重、技术报告和训练代码,附与 Claude Opus 5、GPT-5.6 Sol 的 Agent 基准对比数据。

9月21日周一
9月20日周日
  1. HuggingFace Daily Papers(社区热门论文)33

    BoundInk:边界感知的在线手写生成框架

    针对现有方法难以捕捉字符间连接、间距和对齐等微观行为的问题,研究者提出 BoundInk。这是一个以写作者为条件的框架,将字符间边界视为显式生成单元,联合建模局部转换与上下文,从而在保持字形外观的同时改善连笔和间距。实验显示,该方法在三项基准测试中显著提升了边界质量指标,并将归一化动态时间规整距离降低了 17.6%--47.8%,在盲测人类评估中的偏好率为 78.0%--82.6%。

9月19日周六
  1. Hacker News:AI 热帖71

    阿里达摩院开源医学影像模型 Damo Radar,可识别近 150 种腹部病变

    阿里巴巴达摩院开源视觉语言模型 Damo Radar,可分析增强 CT 扫描,覆盖 18 个腹部器官并识别包括癌症在内的近 150 种腹部病变。在近 4 万例真实检查中,模型在 146 项临床发现的平均 AUC 为 0.913;与 26 名放射科医生的对比中,其平均准确率超过其中 23 人,医生借助该模型漏诊预防能力提升 10%,耗时减少逾 30%。研究已发表于《Science》。

9月18日周五
  1. Qwen:Blog Retrieval(API)69

    Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型,LAAL 降至 2.3 秒

    Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。

    推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。

  2. IT之家(RSS)76

    阿里发布全模态模型 Qwen3.8-Omni-Flash,支持 1M 上下文,百万 Token 图文音视频输入 0.8 元

    阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash,可同时处理文本、图像、音频和视频输入,支持 1M 上下文。在 30 项评测上相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%,官方称音视频能力接近 Gemini 3.8 Flash、音频能力整体超过 Gemini 3.8 Flash。

  3. IT之家(RSS)55

    Snap Specs 消费级 AR 眼镜上市,2195 美元起,无需外接计算单元

    Snap 首款面向普通消费者的独立式 AR 眼镜 Snap Specs 上市,Wi-Fi 版定价 2195 美元,与 Verizon 合作的蜂窝版定价 2395 美元,数据套餐每月 10 美元起。眼镜采用自研 LCoS 显示技术,51 度视场角,支持电致变色镜片 10 秒内切换墨镜模式,内置两颗高通骁龙处理器独立运行,混合使用续航约 4 小时,配合充电盒约 20 小时。

  4. HuggingFace Daily Papers(社区热门论文)85

    DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型主打 KV cache 压缩

    DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。

    推荐理由:论文给出了每 token KV cache 字节数等具体压缩指标,并与上一代模型直接对比,可评估长上下文 Agent 部署成本变化。

  5. Qwen:Blog Retrieval(API)78

    Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付

    Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。

    推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。

9月17日周四