由IP区块链基础设施公司Story孵化的去中心化AI数据基础设施“波塞冬”,近日以“早期体验”形式发布了数据贡献应用“努莫”,旨在让每个人都能参与AI训练数据收集并获得相应奖励。
今年年初,波塞冬在社区进行的Beta应用测试中,于三周内收集了涵盖17种语言、总计超过33,000小时的音频数据。此次测试验证了分布式数据贡献模式的可行性。基于此经验,项目团队正式推出面向普通用户的数据贡献应用努莫,使大众能够便捷地参与AI训练数据建设并获得奖励。
努莫在发布初期将优先收集孟加拉语、印地语、泰米尔语和泰卢固语的语音数据。这些语言虽在全球拥有超过十亿使用者,却因缺乏权利清晰的高质量数据而未能充分融入当前AI语音系统。未来,波塞冬计划逐步扩展支持的国家与语言范围,并将收集范围延伸至视频、图像、动作、传感器等下一代AI系统训练所需的多样化现实世界数据。
现实世界数据——即人们在多样环境、语言和情境下的言语、动作与反应——是推动下一代AI发展的核心要素。语音作为人类最自然的交流方式,在AI交互中扮演着关键接口角色。要使AI语音系统在真实场景中有效运作,必须使其能够处理多样的语调、背景噪音及重叠对话等复杂因素,而这离不开基于现实世界与真实人类行为的高质量数据支持。
波塞冬通过努莫建立了从数据收集、处理到权利定义的全流程数据管道。所有通过努莫收集的数据将在获取时即注册至Story区块链并获得许可标识。这一机制使得AI开发者和企业能够合法合规地使用来源及权利关系清晰的数据。该系统的核心特点在于,并非在数据收集后才定义许可,而是从采集之初便将来源追溯与许可体系融入设计。
Story首席人工智能官兼波塞冬项目首席科学家桑迪普·钦查利表示:“AI若要在现实世界中可靠运行,必须充分汲取现实世界的语言、声音与环境数据。努莫是一款旨在让每个人都能为AI进步贡献力量并获得回报的贡献型应用。基于权利关系明确的高质量数据,它将助力提升AI模型的准确度与可信度,推动可在真实场景中扩展应用的AI服务发展。”