You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何合法发布Twitter数据集?80M量级数据合规发布问询

合规发布Twitter(X)数据的实操指南

核心规则前提

严格遵守X(原Twitter)的《开发者协议》与《服务条款》,同时需符合全球隐私法规(如GDPR、CCPA):

  • 推文内容的版权归原发布用户所有,未经直接授权不得大规模分发完整推文文本、用户个人标识信息(如用户名、用户ID)。
  • 禁止绕过官方API进行数据抓取,违规采集本身就会触发合规风险。

为什么大家只发推文ID?

推文ID是X平台对推文的唯一结构化标识,本身不包含受版权或隐私保护的内容,分发ID既不侵犯用户权益,也不违反平台规则。其他使用者可凭借ID,通过合法的X API(如学术研究API)自行获取对应推文内容(需满足API的使用条件),既规避了分发完整数据的风险,又能实现数据的研究价值。

合规发布的具体方案

优先选择:仅发布推文ID集合

这是当前最安全的合规方式:

  • 仅整理并发布纯推文ID的结构化文件(如CSV、JSON格式),确保数据中无任何推文文本、用户名、用户ID、位置信息等敏感内容。
  • 在配套的README文件中明确说明:使用者需通过X官方API获取完整内容,且必须遵守X的开发者协议与当地隐私法律,数据集仅用于非商业研究用途。

禁止操作

  • 绝对不要包含用户@用户名、个人资料、关注关系等隐私数据,这类内容未经授权发布会直接违反隐私法规。
  • 不要发布经过抓取的完整推文内容,哪怕是脱敏处理后的版本,仍存在版权侵权风险。

特殊场景的补充建议

如果因研究需求必须附带部分内容:

  • 仅使用X官方学术研究API授权获取的内容,且对所有可识别的用户信息进行彻底匿名化(如替换用户名、删除位置标签)。但此方式仍有潜在风险,仅建议在严格必要时采用。
  • 提前过滤掉涉及敏感个人信息、违法内容的推文ID,避免后续使用者获取内容时引发合规问题。

采集阶段的合规提醒

大规模采集前需申请符合需求的X API权限(如学术研究API),禁止使用爬虫绕过API限制,否则可能导致API密钥封禁,甚至面临法律追责。

内容的提问来源于stack exchange,提问作者Mahdi Amrollahi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.18 19:25:23