如何为数据资产定价
ABRAHAM THOMAS
数据定价通常是手工波动和不精确的;数据集可以是免费的,或者价值数百万美元;很少有人知道如何给数据资产定价,甚至知道这样的计算标准是什么。这篇报告试图改变这种情况。
引言
有人说,数据是新的石油;数据是新的黄金。很好,石油的价格是每桶80美元,黄金是每盎司2300美元。数据的价格是多少?
这是一个毫无意义的问题。
驱动油价的因素可能很复杂,但在交易标准:数量、位置、品位和日期上有一个公认的共识。有些交易所指定了WTI、布伦特原油和迪拜等基准合约的交货规则。当你买了一桶原油时,你就知道你得到了什么。
数据……并不是那样的。数据本身就是异构的。数据集A和数据集B可能都是某个驱动器上的位,但除此之外通常没有任何共同之处。不同的字段、模式、规格;不同的主题、覆盖范围、信息内容;不同的使用者、用例和价值。每桶WTI原油都是相同的;没有两个数据集是相同的。
这是否意味着数据定价完全是艺术,而不是科学?不完全是。数据固有的异质性意味着没有任何标准可以是绝对的;没有一个单一的公式可以应用。但是,有一些明确的原则可以适用于广泛的数据资产。
数据的新买家
历史上,有两个行业主导着数据交易:金融和广告技术.这是仅有的两个具有多个买家、多个有价值的数据资产、多个用例的行业;还能够为数据支付一致的物质经常性收入.
这种情况已经改变了。城里有了一个新的买家:人工智能。人工智能模型对训练数据有着贪得无厌的需求——这几乎肯定是当前它们能力增长的限制因素——因此它们的赞助商(MSFT、OpenAI、Anthropic和他们的朋友门)不遗余力地获取这些数据。但他们所需要的数据并不一定就像金融和广告技术所需要的数据一样,它们的效用/价值曲线也有所不同。这对训练数据的定价有影响,使得许多过去的直觉无关紧要。当我们浏览我们的定价原则列表时,我将试图强调其中一些新的影响。
有关数据的公理
数据没有内在的价值
从显而易见的(但经常被误解)开始:数据没有天生的价值。数据的价值来自于可以用它做什么的价值.因此,每一次关于价格的讨论都必须从理解这个价值开始:数据将如何被使用,以及由谁使用。
数据价值取决于用例
不指定数据将如何使用而讨论数据价值是没有意义的。财务报表对广告宣传活动没有什么用处。受众资料对股票分析没有什么用处。但是翻转这些,数据集不仅有用;它们是必不可少的。用例就是一切。
数据价值取决于用户
使用相同用例的相同数据集可能会为不同的用户提供不同的价值。训练数据对OpenAI的价值与它对单独黑客的价值是非常不同的。资本市场数据对城堡的价值与对散户投资者的价值是很大不同的。每个数据用户都是独一无二的。
其中一些只是规模效应;当同样的数据部署到数百万客户、数十亿资本或数万亿参数时,它们产生的影响更大。但这也是一种功能效应: Citadel和OpenAI可以从相同的数据中比一般的用户获得更多。数据定价的很大一部分是寻找这两种效应的有用代理。我们将回到这个想法上来。
数据从根本上是加性的
数据在某种程度上是附加的,而软件不是。如果你有一个CRM,你就不需要第二个;在你的Salesforce中添加HubSpot和Pipedrive并不会提高你的销售业绩。同样的道理也适用于你的机票跟踪系统、人力资源管理系统、工资和费用系统,甚至你所有的软件。重复投资是一种诅咒;不要重复。
这不是数据的情况!在潜在客户名单中添加更多的名字会使这个名单更有价值。事实上,您可以沿着多个维度添加数据:更多的名称,每个名称也有更多的字段,每个字段也有更多的细节;您甚至可以组合三个完全重叠的数据集来生成更高质量的合并。
数据实际上是相互竞争的。
一个几乎普遍的误解是,数据是“非竞争的好处”:人a使用数据集并不阻止人B使用相同的数据。这是错误的。
这是不正确的,因为它纯粹关注数据消费的机制。复制大多数数据集是很简单的,从这个意义上说,是的,A和B都可以“使用”相同的数据。但这并不意味着他们能从中得到相同的值。
金融市场提供了最明显的例子。如果一个特定的数据集(比如卫星图像或信用卡交易)持有未定价的信息内容,那么对冲基金a就可以利用该数据进行交易来赚钱。但一旦这样完成了,对冲基金B就不能做到了!机会消失了。这些数据实际上是竞争对手:只有一方可以采取行动。
非竞争对手的误解源于将数据视为具有先天价值。如果是这样的话,仅仅拥有这些数据就足够了。但正如我们所知,数据的价值在于你可以用它做什么的价值。而这通常取决于没有其他的人在做同样的事情。在实际的数据业务实践中,数据集越有价值,其所有者在保持独家、专有和保护上花费的精力就越多。如果数据不是竞争性的,这种情况就不会发生。
请注意,使用用于人工智能模型训练的地球尺度数据集,即使从一开始假设,复制和消耗数据很简单,也是不正确的;这些数据集是巨大的。
…直到它不是
优势不会永远持续下去——不论在资本市场,在人工智能培训中,还是在任何地方。数据集被商品化了,并产生了替代品。此时,这些数据就变成了非竞争性的。
这伤害了大多数数据供应商,但对少数人来说是一个巨大的提升。每个数据所有者的梦想是让他们的数据成为表注——商品化,但至关重要。
数据资产具有定义良好的生命周期
在为出售数据资产定价时,了解其特定生命周期中的位置至关重要。
在早期,数据集和市场都不够成熟,不足以推动价值。数据集不完整、不准确、速度慢、不相关。市场缺乏有效使用数据集的工具或复杂性。可能会有探索性的活动,但交易很少发生。
第二个阶段是当早期采用者意识到数据中存在alpha时——更好的针对性广告,或更好的模型价值,或超额的市场回报。(我在这里使用的是alpha这个词最广泛的含义——比行业其他公司更有优势)。在这一点上,数据是超级有价值的(相应定价),但受众仍然狭窄。顺便说一下,大多数数据资产永远不会