跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-09-03AI 评分40

Last Translation Benchmark 发布,用人工评审的多模态样本测试机器翻译模型极限

Last Translation Benchmark

AI 导读

研究者推出 Last Translation Benchmark,收集经同行评审的人工创作样本(文本、图像、音频、视频),用于打破主流机器翻译模型。每个样本附带手工编写的验证规则,描述具体失败情形,使评估可靠且可操作;该数据集为持续接收投稿的 live dataset,当前版本 LTBv1 收录 2026 年 9 月 1 日前被接受的贡献。

整理与数据来源:AIHOT

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org