2026-10-07 09:27:02
icon loading...

TikTok 56亿条视频元数据开源:AI训练新燃料引法律争议

摘要
一位开发者在Hugging Face公开约56亿条TikTok视频元数据,涵盖标题、标签、互动指标等关键信息。该数据集虽免费开放,但其通过逆向工程获取的方式引发法律争议,涉及大规模数据抓取与版权合规问题,成为AI训练与平台监管的焦点。

一位名为 hashfunction 的开发者在开源平台 Hugging Face 上发布了一项规模达 56 亿条的 TikTok 视频元数据集,供公众免费下载。该数据由 datasocial 账号发布,时间跨度从 2014 年 7 月延续至 2026 年 10 月,为当前最大规模的短视频行为数据之一。

数据内容与结构特点

本数据集仅包含元数据而非原始视频内容,每条记录涵盖视频标题、标签、音频 ID、屏幕文字、商品及卖家信息,并附带浏览量、点赞数、评论数、分享数、收藏数和下载量等互动数据。整体容量达 460 GB,采用 Parquet 格式按月分片存储,便于高效读取与分析。

部分字段源自 TikTok 内部标记系统,如是否被标识为“AI生成”或是否曾被移出推荐页(For You Page)。由于数据来自历史档案,早期视频的这些标记字段多为空值,影响部分分析精度。

为何该数据集引发广泛关注?

对于人工智能研发团队而言,此类高质量、高维度的用户行为数据极具价值。标题、标签、音频使用模式与传播路径,是构建预测病毒内容趋势模型的核心输入,也是语言模型理解短视频创作语境的重要依据。

相比之下,TikTok 官方的数据获取渠道极为有限,主要面向美国、欧洲经济区、英国、加拿大及瑞士等地高校与非营利研究机构,且需提交申请并经审批。根据其服务条款第 3.4 条,未经书面授权,禁止使用自动化工具提取数据。

技术手段与法律边界争议

datasocial 声称,其通过模拟安卓设备身份、逆向解析 API 请求签名并复现 TLS 握手流程,成功接入 TikTok 私有移动接口。整个采集过程无需登录账户,三周内完成对 32.3 亿创作者资料、59.4 亿视频及 28 亿条评论的抓取。

尽管该方式未直接违反公开协议,但已触碰法律红线。2025 年 10 月,Reddit 对 Perplexity 及三家数据公司提起诉讼,指控其进行“工业级”内容采集用于 AI 训练。今年 7 月,联邦法官驳回被告要求撤销案件的动议,该案虽聚焦 Google 搜索结果抓取,但其中提出的 DMCA 违规指控表明,绕过反爬机制的行为可能构成侵权。

许可模式与商业化路径

当前公开版本采用 CC BY-NC 4.0 许可协议,明确限定仅限于学术研究与个人学习用途。商业应用、创作者资料完整版及每日增量更新均需访问官网获取,相关采集代码另售,价格为 1,699 美元。

虽然数据集中未直接标注“用户名”,但可通过标题、提及人物与用户 ID 等信息间接还原创作者身份。此外,另一套类似数据集也已在 Hugging Face 上架,覆盖 45 亿条视频,同样支持非商业用途,代码销售价格一致。

声明:文章不代表币圈网观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险自担!转载请注明出处!侵权必究!
币圈快讯
查看更多
回顶部