SCR-SELF-2732026-06-01会员报告 · 单篇 ¥29922 分钟阅读

如何为数据资产定价

数据定价通常是手工波动和不精确的;数据集可以是免费的,或者价值数百万美元;很少有人知道如何给数据资产定价,甚至知道这样的计算标准是什么。这篇报告试图改变这种情况。

如何为数据资产定价

如何为数据资产定价

ABRAHAM THOMAS

数据定价通常是手工波动和不精确的;数据集可以是免费的,或者价值数百万美元;很少有人知道如何给数据资产定价,甚至知道这样的计算标准是什么。这篇报告试图改变这种情况。

引言

有人说,数据是新的石油;数据是新的黄金。很好,石油的价格是每桶80美元,黄金是每盎司2300美元。数据的价格是多少?

这是一个毫无意义的问题。

驱动油价的因素可能很复杂,但在交易标准:数量、位置、品位和日期上有一个公认的共识。有些交易所指定了WTI、布伦特原油和迪拜等基准合约的交货规则。当你买了一桶原油时,你就知道你得到了什么。

数据……并不是那样的。数据本身就是异构的。数据集A和数据集B可能都是某个驱动器上的位,但除此之外通常没有任何共同之处。不同的字段、模式、规格;不同的主题、覆盖范围、信息内容;不同的使用者、用例和价值。每桶WTI原油都是相同的;没有两个数据集是相同的。

这是否意味着数据定价完全是艺术,而不是科学?不完全是。数据固有的异质性意味着没有任何标准可以是绝对的;没有一个单一的公式可以应用。但是,有一些明确的原则可以适用于广泛的数据资产。

数据的新买家

历史上,有两个行业主导着数据交易:金融和广告技术.这是仅有的两个具有多个买家、多个有价值的数据资产、多个用例的行业;还能够为数据支付一致的物质经常性收入.

这种情况已经改变了。城里有了一个新的买家:人工智能。人工智能模型对训练数据有着贪得无厌的需求——这几乎肯定是当前它们能力增长的限制因素——因此它们的赞助商(MSFT、OpenAI、Anthropic和他们的朋友门)不遗余力地获取这些数据。但他们所需要的数据并不一定就像金融和广告技术所需要的数据一样,它们的效用/价值曲线也有所不同。这对训练数据的定价有影响,使得许多过去的直觉无关紧要。当我们浏览我们的定价原则列表时,我将试图强调其中一些新的影响。

有关数据的公理

数据没有内在的价值

从显而易见的(但经常被误解)开始:数据没有天生的价值。数据的价值来自于可以用它做什么的价值.因此,每一次关于价格的讨论都必须从理解这个价值开始:数据将如何被使用,以及由谁使用。

数据价值取决于用例

不指定数据将如何使用而讨论数据价值是没有意义的。财务报表对广告宣传活动没有什么用处。受众资料对股票分析没有什么用处。但是翻转这些,数据集不仅有用;它们是必不可少的。用例就是一切。

数据价值取决于用户

使用相同用例的相同数据集可能会为不同的用户提供不同的价值。训练数据对OpenAI的价值与它对单独黑客的价值是非常不同的。资本市场数据对城堡的价值与对散户投资者的价值是很大不同的。每个数据用户都是独一无二的。

其中一些只是规模效应;当同样的数据部署到数百万客户、数十亿资本或数万亿参数时,它们产生的影响更大。但这也是一种功能效应: Citadel和OpenAI可以从相同的数据中比一般的用户获得更多。数据定价的很大一部分是寻找这两种效应的有用代理。我们将回到这个想法上来。

数据从根本上是加性的

数据在某种程度上是附加的,而软件不是。如果你有一个CRM,你就不需要第二个;在你的Salesforce中添加HubSpot和Pipedrive并不会提高你的销售业绩。同样的道理也适用于你的机票跟踪系统、人力资源管理系统、工资和费用系统,甚至你所有的软件。重复投资是一种诅咒;不要重复。

这不是数据的情况!在潜在客户名单中添加更多的名字会使这个名单更有价值。事实上,您可以沿着多个维度添加数据:更多的名称,每个名称也有更多的字段,每个字段也有更多的细节;您甚至可以组合三个完全重叠的数据集来生成更高质量的合并。

数据实际上是相互竞争的。

一个几乎普遍的误解是,数据是“非竞争的好处”:人a使用数据集并不阻止人B使用相同的数据。这是错误的。

这是不正确的,因为它纯粹关注数据消费的机制。复制大多数数据集是很简单的,从这个意义上说,是的,A和B都可以“使用”相同的数据。但这并不意味着他们能从中得到相同的值。

金融市场提供了最明显的例子。如果一个特定的数据集(比如卫星图像或信用卡交易)持有未定价的信息内容,那么对冲基金a就可以利用该数据进行交易来赚钱。但一旦这样完成了,对冲基金B就不能做到了!机会消失了。这些数据实际上是竞争对手:只有一方可以采取行动。

非竞争对手的误解源于将数据视为具有先天价值。如果是这样的话,仅仅拥有这些数据就足够了。但正如我们所知,数据的价值在于你可以用它做什么的价值。而这通常取决于没有其他的人在做同样的事情。在实际的数据业务实践中,数据集越有价值,其所有者在保持独家、专有和保护上花费的精力就越多。如果数据不是竞争性的,这种情况就不会发生。

请注意,使用用于人工智能模型训练的地球尺度数据集,即使从一开始假设,复制和消耗数据很简单,也是不正确的;这些数据集是巨大的。

…直到它不是

优势不会永远持续下去——不论在资本市场,在人工智能培训中,还是在任何地方。数据集被商品化了,并产生了替代品。此时,这些数据就变成了非竞争性的。

这伤害了大多数数据供应商,但对少数人来说是一个巨大的提升。每个数据所有者的梦想是让他们的数据成为表注——商品化,但至关重要。

数据资产具有定义良好的生命周期

在为出售数据资产定价时,了解其特定生命周期中的位置至关重要。

在早期,数据集和市场都不够成熟,不足以推动价值。数据集不完整、不准确、速度慢、不相关。市场缺乏有效使用数据集的工具或复杂性。可能会有探索性的活动,但交易很少发生。

第二个阶段是当早期采用者意识到数据中存在alpha时——更好的针对性广告,或更好的模型价值,或超额的市场回报。(我在这里使用的是alpha这个词最广泛的含义——比行业其他公司更有优势)。在这一点上,数据是超级有价值的(相应定价),但受众仍然狭窄。顺便说一下,大多数数据资产永远不会

登录后查看全文

本报告为会员内容,登录后可根据权限阅读。

相关报告推荐

SCR-S269522026-06-04

构建企业级的数据资产交易合规审查流程:确保每笔对外数据授权都经过法务安全与业务的三重审批

本报告提出,企业级数据资产交易的合规性不能依赖事后补救或单一部门把关,而必须嵌入业务全生命周期,形成法务、安全与业务三方协同的刚性审批机制。实践中,多数机构的数据对外授权仍存在权责模糊、流程断点和标准缺失等问题,导致合规风险前移不足、响应滞后。为此,需构建覆盖“授权申请—合规初筛—三重联审—动态复核”的闭环流程:法务聚焦权属清晰性与合同约束力,安全侧重数据脱敏强度与传输可控性,业务则确保用途限定与价值匹配。该机制并非增设冗余环节,而是通过标准化清单、自动化校验与审批留痕,将合规要求转化为可执行、可追溯、可审计的操作动作。研究指出,当三重审批成为数据资产流通的前置门槛而非附加动作时,企业既能显著

SCR-S269552026-06-04

不再让企业的员工满意度调查变成形式主义的年度例行公事:AI驱动的员工情绪实时感知与即时响应

员工满意度调查不应止步于年度填表与滞后分析,而需转化为组织感知力与响应力的日常基础设施。本报告指出,将情绪洞察嵌入工作流本身,比依赖周期性问卷更能真实反映员工状态、预判流失风险并支撑管理决策。传统方式因时效滞后、反馈失真和行动脱节,易沦为形式主义;而基于自然语言处理与行为信号融合的实时感知技术,可在协作平台、会议记录、审批日志等场景中无感采集情绪线索,经算法校准后生成可操作的团队级洞察。关键不在于技术替代人工,而在于重构“感知—研判—干预”闭环:管理者获得轻量级预警与情境化建议,HR得以从数据整理转向策略协同,一线主管则能在问题萌芽阶段开展个性化沟通。这要求组织在数据治理、管理者能力与反馈文化

SCR-S269582026-06-04

让优秀红酒品鉴师的感官评价体系转化为智能选酒推荐助手:高端消费品的知识蒸馏与个性化服务

本报告提出一种将资深品鉴专家隐性知识系统化转化为可复用智能服务能力的实践路径。核心在于通过知识蒸馏机制,将高度依赖经验、情境与多维感官协同判断的专业评估逻辑,解构为结构化特征表征与可解释的决策规则,而非简单拟合评分数据。研究发现,专家评价并非孤立维度加权,而是气味、口感、余味等要素在特定风格语境下的动态耦合关系,需结合消费者偏好演化轨迹建模,才能支撑真正个性化的推荐。实践中,采用轻量化模型架构,在保障推理效率的同时保留关键感知维度间的非线性交互能力;推荐结果附带可理解的风味锚点与风格类比,增强用户信任与选择确定性。该方法不仅适用于高端酒饮场景,也为其他依赖专家直觉与主观体验的高价值消费品服务升