代币
大型语言模型处理文本的基本单位(约4个字符或0.75个单词)。
在自然语言处理和生成式人工智能领域,token 是模型处理数据的基本单位。它并不完全等同于单个单词,而是代表常见的字符序列或子词组合。在英语中,一个实用的经验法则是:100 个 token 大约相当于 75 个单词。 对于追踪人工智能经济的投资者而言,token 是货币化与成本的核心计量单位。基础模型提供商根据所处理的输入 token(提示词)和输出 token(生成内容)的数量,向开发者和企业收取费用。因此,token 处理量是衡量实际软件使用情况和需求的关键代理指标。 分析 token 定价趋势以及生成百万 token 的成本,有助于投资者评估软件公司的单位经济效益、模型开发商的定价权,以及云基础设施层的整体需求增长。token 定价的快速下降可能预示着模型提供商之间的激烈竞争,而 token 处理量的持续上升则表明企业采用率正在不断扩大。
一家企业软件公司处理一份包含 75,000 个单词的文档。按照行业标准换算,这大约相当于 100,000 个 token(75,000 个单词 / 每 token 0.75 个单词)。如果 API 提供商按每 1,000 个 token 收费 $0.015,则处理该文档的总成本计算如下:(100,000 个 token / 1,000) $0.015 = $1.50。