企业速览
北京海天瑞声科技股份有限公司(证券代码:688787,证券简称:海天瑞声)始终专注于人工智能基础数据服务领域,主营业务为AI训练数据的研发、生产与销售。公司作为国家级专精特新“小巨人”企业,是行业内少数掌握多模态数据采集、清洗、标注及质检全链条技术的服务商之一。
主营产品:覆盖智能语音、计算机视觉、自然语言理解三大核心方向的数据产品及解决方案。具体包括:多语种语音识别训练数据(支持超过100种语言及方言)、语音合成(TTS)语料库、人像/动作/场景标注数据集、OCR文本图像数据集、对话交互语义标注数据、多模态对齐数据等。此外,公司提供智慧城市、智能驾驶、金融、医疗等垂直行业的定制化训练数据服务。
技术方向:聚焦数据工程与算法协同创新。核心技术包括:自动化标注平台(支持半监督/弱监督学习)、数据质量智能评估系统、隐私计算(差分隐私、联邦学习框架下的数据脱敏)、面向大模型的指令微调与强化学习数据生成技术。公司近年重点布局大模型训练数据的可控合成与质量评价体系,以及多模态数据对齐技术(图文、音视频、3D点云等),服务于生成式AI、行业大模型等前沿应用。
市场定位:国内AI基础数据服务领域的头部企业之一。客户覆盖全球主流科技公司、AI初创企业、科研机构及政府单位(公开信息显示,公司与微软、亚马逊、百度、阿里巴巴、字节跳动等企业保持合作)。公司以“数据安全+专业品质”为核心竞争力,拥有ISO 27701隐私信息管理体系认证、ISO 27001信息安全管理体系认证,且通过数据出境安全评估,在合规性方面具备先发优势。其市场份额在语音数据领域较为突出,同时向多模态、大模型方向延伸,致力于成为“人工智能时代的数据基座”提供商。
发展动态:根据公开信息,公司2023年推出面向大语言模型(LLM)的自研数据产品“DOTS-LLM”,涵盖预训练、指令微调、RLHF全流程;2024年入选首批“北京市通用人工智能产业创新伙伴计划”成员(数据伙伴)。公司持续加大研发投入,技术中心被认定为北京市企业技术中心,累计获得发明专利超过50项。
免责声明:本简报基于企业工商字段及公开信息整理,不构成投资建议。