YouTube-ASL 数据集深度解读:基于 YouTube 挖掘的美国手语(ASL)-英语平行语料库
YouTube-ASL 数据集深度解读基于 YouTube 挖掘的美国手语ASL-英语平行语料库【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research导读YouTube-ASL 是 Google Research 发布的大规模、开放域美国手语American Sign LanguageASL视频数据集包含 11,093 段带英语字幕的 ASL 视频累计 984 小时、共 610,193 条英语字幕。本文以 youtube_asl/README.md 为核心系统讲解该数据集的构建流程、规模特征、获取方式与引用方法并结合仓库内 youtube_sl_25/README.md 等姊妹项目说明其在大规模手语语料研究中的定位。读完本文你将掌握 YouTube-ASL 的完整数据规格、获取视频 ID 的渠道以及在使用该数据集时应遵循的学术引用规范。YouTube-ASL 是什么YouTube-ASL 是一个大规模、开放域open-domain的美国手语视频数据集其核心特征是每一段视频都配有对应的英语字幕English captions从而构成手语-英语平行语料parallel corpus为手语识别、手语翻译、手语理解等研究任务提供数据基础。与许多在受控实验室环境下采集的手语数据集不同YouTube-ASL 直接从 YouTube 开放平台挖掘真实世界的 ASL 内容覆盖广泛的主题、场景与说话风格因此被定义为开放域数据集——这既是其规模优势也对下游模型的泛化能力提出了更高要求。该数据集发布在 Google Research 的 google-research 仓库中仓库根 README.md 声明仓库内所有数据集均以CC BY 4.0 International许可发布所有源代码以Apache 2.0许可发布。数据集构建流程Process根据 youtube_asl/README.mdYouTube-ASL 的构建遵循一个**两步骤two step process**流程第一步从 YouTube 大规模挖掘候选视频研究人员对 YouTube 上的 ASL 相关视频进行挖掘mining搜索途径是 YouTube 为每个视频自动生成的Knowledge Graph 实体标签machine-generated tags of Knowledge Graph entities。具体做法为检索所有被标记为与手语sign language整体相关或专门标记为美国手语American Sign Language的公开列表视频listed public videos采集时间范围截止到2022 年 1 月up to January 2022。这一阶段的关键在于利用知识图谱标签实现大规模粗筛不依赖人工逐条标注而是借助 YouTube 平台已有的结构化标签体系快速召回候选集合这也是该数据集能够达到上万段视频规模的前提。第二步聋人母语者人工精筛粗筛之后研究团队邀请了**母语为手语的聋人标注者native Deaf annotators**逐条审阅候选视频其目的是过滤掉质量较差的视频poor quality过滤掉字幕与手语内容不对齐的视频misaligned captions。这一人工环节保证了最终数据集中字幕与手语内容之间的对齐质量是平行语料可用性的关键保障。从源码结构看这种机器粗筛 人工精筛的流水线设计也是后续大规模手语语料构建工作的通用范式——仓库中的姊妹数据集 YouTube-SL-25 就明确说明其采用了**粗粒度人工过滤coarse human filtering**来扩展语言覆盖范围详见 youtube_sl_25/README.md。数据集规模特征Dataset CharacteristicsYouTube-ASL 的官方统计口径如下指标数值ASL 视频数量11,093 段视频总时长984 小时英语字幕caption数量610,193 条这些数字共同刻画了 YouTube-ASL 的量级视频数量破万为手语识别与翻译模型的训练提供了充足样本总时长近千小时远超多数受控手语数据集支撑长时序建模与连续手语理解研究字幕条数超过 60 万平均每段视频约含 55 条字幕为视频片段-字幕对齐的弱监督学习提供了天然监督信号。需要说明的是以上为数据集的发布口径由于数据集以视频 ID 形式发布见下节实际可用时长还取决于视频的在线可用状态与版权约束。视频 ID 发布与获取方式Video IDs与 YouTube 生态中广为使用的YouTube-8M数据集类似YouTube-ASL不直接分发视频文件本身而是发布视频 IDvideo IDs列表由使用者按需获取对应视频。这样做既能规避大规模视频文件分发的存储与带宽成本也符合 YouTube 平台的内容使用规范。视频 ID 清单托管在Google Cloud Storage上位于gresearch/youtube-asl存储桶中。获取方式为访问 Cloud Storage 浏览器并定位到gresearch/youtube-asl路径即可浏览或下载完整的视频 ID 文件。拿到 ID 列表后研究团队通常通过 YouTube Data API 等官方渠道解析元数据并拉取视频流再依据 youtube_asl/README.md 中描述的对齐规则建立视频片段与字幕的对应关系。姊妹数据集YouTube-SL-25在仓库的 youtube_sl_25/README.md 中Google Research 进一步发布了YouTube-SL-25——一个覆盖25 种以上手语、累计3200 小时以上视频的跨语言手语平行语料库。YouTube-SL-25 与 YouTube-ASL 的关系是YouTube-ASL 是 YouTube-SL-25 的一个子集subset。因此如果你同时使用了两个数据集需要同时引用 YouTube-SL-25 与 YouTube-ASL 两篇论文详见下节引用规范。从数据集演进脉络可以推断YouTube-ASL 的单语言ASL-英语平行语料经验被 YouTube-SL-25 推广到了多语言25 种手语场景后者在 youtube_sl_25/README.md 中同样以视频 ID 形式通过 Cloud Storage 的gresearch/youtube-sl-25路径发布。相关研究定位在 google-research 仓库中除数据集发布外还包含其他与手语相关的工程实现例如 sign_language_detection 项目——一个基于人体姿态估计Human Pose Estimation的实时手语检测 TensorFlow 实现发表于 SLRTP 2020它使用tfrecord格式的(fps, pose_data, pose_confidence, is_signing)四元组描述视频。虽然该项目使用德国手语DGS公共语料而非 YouTube-ASL 训练但它与 YouTube-ASL 同属于手语计算研究的技术栈可以视作仓库内对手语建模能力姿态表征、时序建模的补充佐证。对于以 YouTube-ASL 为训练语料的模型来说这类姿态估计管线可为其提供视频帧级的手部与身体关键点特征。引用 YouTube-ASLCiting如果你在论文或项目中使用了 YouTube-ASL请引用其配套论文见 youtube_asl/README.mdUthus, David and Tanzer, Garrett and Georg, Manfred.YouTube-ASL: A Large-Scale, Open-Domain American Sign Language-English Parallel Corpus, 2023, arXiv:2306.15162。对应的 BibTeX 条目如下misc{uthus2023youtubeasl, author {Uthus, David and Tanzer, Garrett and Georg, Manfred}, title {YouTube-ASL: A Large-Scale, Open-Domain American Sign Language-English Parallel Corpus}, year {2023}, eprint {2306.15162}, archivePrefix {arXiv}, url {https://arxiv.org/abs/2306.15162}, }此外若你的工作同时涉及 youtube_sl_25/README.md 中的多语言手语数据还需要一并引用 YouTube-SL-25 的论文misc{tanzer2024youtubesl25, title{YouTube-SL-25: A Large-Scale, Open-Domain Multilingual Sign Language Parallel Corpus}, author{Garrett Tanzer and Biao Zhang}, year{2024}, eprint{2407.11144}, archivePrefix{arXiv}, primaryClass{cs.CL}, url{https://arxiv.org/abs/2407.11144}, }使用建议与注意事项结合 youtube_asl/README.md 及仓库相关说明使用 YouTube-ASL 时有以下几点值得注意数据形态仓库仅发布视频 ID 清单位于 GCS 的gresearch/youtube-asl路径视频原始内容需自行通过 YouTube 渠道获取请遵守相关平台条款与版权约定许可协议数据集本体遵循仓库根 README.md 声明的 CC BY 4.0 许可使用时应保留出处并遵循署名要求质量特征虽然经过了聋人母语者的人工过滤但作为开放域大规模语料个别视频仍可能存在噪声建议在训练与评测时结合下游任务做针对性清洗引用义务使用 YouTube-ASL 请引用其论文同时使用 YouTube-SL-25 时请一并引用两者以尊重研究团队的贡献。综上YouTube-ASL 以其万级视频、近千小时、60 万条字幕的规模以及机器粗筛 人工精筛的构建范式为开放域手语识别与手语-英语翻译研究提供了高质量的数据基础也是理解 Google Research 在大规模手语语料方向研究脉络从 YouTube-ASL 到 YouTube-SL-25的关键入口。【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考