北京时间8月16日,艺恩【数据市场】正式上线,首批 34 个成品数据集公开上架,覆盖具身本体·Ego 数据、视频数据、社媒数据、电商数据、及文本语料五大类别。客户无需注册、无需联系销售,即可完整查阅每个数据集的规格参数、标注字段定义、样例记录结构与授权合规说明,并可直接申请免费样例包。
艺恩数据,作为AI 垂类数据基础设施企业,此次上线的【数据市场】是其从“定制化交付”向“标准化产品+自助服务”转型的关键一步。这一举措标志着AI训练数据从封闭采购走向开放浏览、按需试用的新阶段,让开发者能够像逛超市一样直观地挑选数据产品,推动行业从“找数据”向“选数据”转变。
这是国内 AI 训练数据行业首批将成品数据集以"商品目录"形式完整公开的实践之一。此前,训练数据的采购长期停留在项目制模式:买方需要经过询价、需求沟通、方案提报等多轮流程,才能获知供应商实际拥有哪些数据、标注到什么粒度、能否商用——整个周期通常需要六至十二周。
五大类 34 个数据集,细化至单一渠道
与以往按"能力描述"组织的产品页不同,艺恩数据市场按数据类型 × 具体渠道双维度组织货架。以社媒数据为例,市场中不再只有笼统的"海外社媒数据",而是细分为 X(Twitter)全球帖文集、TikTok 创作者与评论集、Instagram 图文创作者集、YouTube 评论与字幕集、Facebook 公开主页集等独立 SKU;电商数据则细化到 Amazon、Shopee、Lazada、Coupang、TikTok Shop 等具体平台。

图 1 首批上架数据集按类别分布。规模数字为艺恩产品口径,统计截至 2026 年第一季度。

图 2 渠道颗粒度对比。数据市场将笼统品类拆解为可独立采购的单一渠道 SKU,客户可按实际训练需求精确选取。
视频数据类同样细化到内容形态,包括电影级高质切片、纪录片物理世界影像、YouTube 长视频多语种集、TikTok 短视频创意集、微短剧内容数据集与直播流媒体片段集。具身本体·Ego 类则按场景族划分为家庭操作、厨房任务、室内导航、工业产线、零售场景等专项数据集,并配套多机位 4D 同步采集、遥操作轨迹与力触觉交互数据。
每个数据集公开六层信息
数据市场的每个 SKU 都配有独立详情页,按客户实际评估顺序组织六个板块:数据集概览、数据构成、标注体系、样例预览、交付与接入、合规说明。其中标注体系板块完整列出该数据集的字段定义表,并以动态演示呈现标注流水线的四个阶段——从原始帧到目标检测、关键点与语义标注,再到时序动作分段。

图 3 数据集详情页信息结构。六个板块按客户评估决策的实际顺序组织,全部无需登录即可查阅。
"数据这个品类最特殊的地方在于,买方在拿到数据之前,几乎无法独立判断质量。"艺恩数据相关负责人表示,"标注粒度、字段对齐方式、授权链路完整性——这些决定数据能不能直接进训练管线的关键信息,过去往往要到第三次会议才谈得到。我们的判断是,把这些信息前置公开,损失的是一点信息差,换来的是整个交易周期的压缩。"
免费样例机制:先跑通,再采购
数据市场同步推出免费样例机制。每个数据集提供 100 至 5,000 条规模的样例包,与正式数据集结构完全一致,包含完整元数据、标注与授权信息。客户在详情页提交申请并签署保密协议后,24 小时内可获得下载链接,有效期七天。
艺恩数据创始人郜寿智表示:“这个机制对我们不是没有成本的,一个跑过样例的客户,进入商务环节的沟通效率,是没跑过样例客户的数倍以上——他不再问‘你们数据质量怎么样?’,而是直接问‘这个场景族能不能加到 30%?’。
我们希望客户是带着自己的测试结论进入商务环节的。他不需要相信我们说的质量有多好,他自己用几千条样例在训练管线里跑一遍就知道了。这对双方都更高效。"
三层授权审计与国际认证背书
合规是数据市场公开上架的前提条件。艺恩对每份数据集执行三层版权审计:第一层为内容版权方书面商业授权,逐条对应授权编号;第二层处理背景音乐版权,提供授权证明或完成去除替换;第三层覆盖肖像权与个人信息,通过知情同意书与技术脱敏满足《个人信息保护法》与 GDPR 双轨要求。

图 4 艺恩数据合规体系。每个数据集详情页底部逐条列出适用的合规要点,不作统一模板化处理。
行业背景:数据供给正在被重新定价
数据市场的推出,与训练数据供需格局的结构性变化直接相关。研究机构 Epoch AI 的测算显示,公开可用的高质量人类文本语料预计将在 2026 至 2032 年间耗尽,中位数落在 2028 年前后。与此同时,合规成本正在快速抬升——Anthropic 就作者集体诉讼达成 15 亿美元和解,创下美国版权诉讼史上最大规模的和解金额;欧盟 AI 法案对通用模型训练数据的透明度义务也已进入实施阶段。
资本市场对数据资产的定价同样发生变化。Meta 以约 143 亿美元取得 Scale AI 少数股权(对应估值约 290 亿美元)后,多家头部模型厂商基于数据机密性顾虑削减了与其的合作——这一事件被行业普遍解读为:数据供应方的中立性本身构成核心资产。艺恩数据为新三板挂牌公司,不隶属于任何模型厂商,亦无自研大模型业务。
艺恩数据创始人郜寿智还表示:“数据这门生意的效率损耗,大部分不发生在生产端,而发生在交易端。当买方需要花六周才能搞清楚卖方有什么,这六周对双方都是纯粹的浪费。我们把信息摊开,不是让渡商业空间,而是把销售资源从‘解释我们有什么’,转移到‘讨论怎么用得更好’。”
后续规划
据悉,首批上架的 34 个数据集来自艺恩三十大类数据资产中的核心品类,后续将按季度扩充 SKU 数量并细化筛选维度。艺恩同时提供定制采集服务,支持按场景族、任务族、时长与交付格式定制,从需求评审到首批交付最快六周闭环。
艺恩数据市场即日起面向全球客户开放,中英文版本同步上线。
关于艺恩数据
北京艺恩世纪数据科技股份有限公司(Beijing ENDATA Technology Co., Ltd.,NEEQ:871430)成立于 2009 年,是 AI 垂类数据基础设施的建设者之一。公司以视频、图像、文本三大模态,覆盖社媒、电商、具身智能等多领域的高质量、合规、垂直数据资产,服务具身智能厂商、大模型厂商、互联网平台与全球化品牌。
艺恩已取得国家高新技术企业、北京市"专精特新"企业认定,以及 ISO 20000 信息技术服务管理、ISO 27001 信息安全管理、ISO 27701 隐私信息管理三项国际体系认证。2025 年度公司实现营业收入 3,735 万元,同比增长 49.86%,归母净利润 363 万元,连续两年保持盈利。








