AI开始接管数据生产|爱分析访谈
数据生产方式正在被AI改造。
在语音、语言和文本等成熟场景中,超过90%的数据已经可以由模型自动处理。随着数据Agent进一步发展,一个智能体负责生产,另一个智能体负责质检,人将逐渐从生产闭环内部转向闭环外部,从逐条标注转向制定规则、监督过程和验收结果。
同时,在医疗、教育和模型后训练等高标准场景中,即使机器完成99%的工作,最后1%仍要由专家兜底。
伴随生产方式的变化,数据服务的边界也在同步扩展。
过去的数据标注主要依靠人给图片、语音和文本打标签;现在,数据厂商需要从需求规划开始,完成采集、治理、标注、质检和持续运营,最终交付能够直接进入模型训练的高质量数据集。数据公司的价值,也转向建设自动化生产能力、组织行业专家并持续提升模型效果。
飞数前身可以追溯至科大讯飞2001年成立的语音制作部门。2024年4月,相关数据团队孵化成立安徽飞数,将二十余年的数据生产经验转化为自动化平台和专家网络。
飞数执行总裁谭昶将飞数的能力概括为高难度、高知识密度和高效率。目前,飞数已储备数千名专家资源,并将业务从教育、医疗逐步延伸至科研和工业制造。
大模型后训练和具身智能正在带来新一轮数据需求。谭昶判断,大规模基础数据会率先经历生产高峰,随后转向难例、真机数据和高知识密度数据的竞争。
在本次与爱分析的交流中,谭昶系统分析了高质量数据的判断标准、自动化与专家的分工、具身数据的市场周期,以及飞数依靠技术平台和专家网络建立长期能力的路径。
核心观点
数据标注正在升级为完整的数据生产。 AI企业需要的是可以直接用于模型训练的数据产品,服务范围已经覆盖规划、采集、治理、标注、质检和持续运营。
模型效果是高质量数据的最终标准。 准确率、完整性和时效性是基础指标,数据能否提升模型性能,决定了它的实际价值。
机器可以完成99%,专家必须守住最后1%。 自动化会持续压缩人工工作量,但在高标准场景中,专家仍要制定规则、处理长尾错误并验收结果。
具身数据将从规模竞争转向知识密度竞争。 具身数据领域,基础数据会先经历生产高峰,随后转向难例、真机数据和高准确率、高知识密度数据。
数据产业必须长在产业里。 地方数据基地需要与优势产业结合,形成由真实数据、行业专家和应用场景共同支撑的长期能力。
01 数据标注正在升级为数据生产
爱分析:飞数从科大讯飞体系中孵化出来,是怎么考虑的?
谭昶:飞数前身为科大讯飞内部拥有逾20年历史的AI资源部、大数据研究院等数据团队。2023年底,在国家数据局成立及数据要素政策导向日趋明确的背景下,讯飞决策层将数据业务独立孵化,于2024年4月成立安徽飞数,专攻数据领域。
飞数从成立之初就定位为数据技术服务商,飞数业务链条覆盖原始数据采集、加工治理、人工标注及AI预标注深加工等全流程,最终目标是将数据资源转化为可市场化变现的数据资产。
爱分析:现在的数据标注产业,和过去有什么不同?
谭昶:过去提到数据标注,容易理解为人给图片、语音或者文本打标签。现在产业边界已经扩大到筛选、清洗、分类、注释、标记和质量检验等完整的数据加工过程。传统标注、大模型后训练数据、专家数据和具身智能数据都属于这一产业。
模型厂商寻找的已经不是单一标注供应商,而是数据供应商。它希望供应商完成原始数据的加工处理,交付的数据可以直接进入模型训练,尽量减少后续工作。
因此,数据标注正在升级为完整的数据生产,最终产品是能够支撑模型开发和能力提升的高质量数据集。
爱分析:飞数与传统人力密集型标注公司有什么区别?
谭昶:飞数不会把低门槛、人力密集型标注作为主要方向,而是发挥技术、行业知识和生产组织方面积累的优势。我们把能力概括为三个高:高难度、高知识密度和高效率。
高难度和高知识密度意味着进入语音、多语言、教育、医疗、司法等专业领域,由相应专家把行业知识转化为模型可用的数据。高效率则是快速组织合适的人完成任务,过去的一个项目经理,现在可以管理数百人的生产团队,甚至协调十几家供应商。
有些项目需要一个月内组织300-500人,有些任务只有100条数据,却需要找到少数教授级专家。两类任务规模不同,都考验数据公司的组织能力。
客户提出需求后,飞数可以从数据集规划开始,完成采集、治理、标注、质检和交付,并随着模型和场景变化持续补充、修正和优化数据。高质量数据集通常不是一次**付,而是伴随模型迭代持续运营。
我们的定位是人工智能高质量数据生产者。客户提出需求意向,飞数从数据方案规划与设计出发,完成采集、治理、标注、质检直至交付的全生命周期服务,并提供持续运营优化。
02 模型效果定义高质量数据
爱分析:什么样的数据才算高质量?
谭昶:准确率、完整性和时效性是数据质量的基础指标,更关键的标准是数据能否直接用于模型开发和训练,并有效提升模型性能。
判断数据质量需要以终为始。准确、完整、及时等是直接评价指标,模型训练后的效果是最终评价。真正决定一批数据是否具有高质量的,是它能不能提升模型效果。
数据是否经过人工标注,并不能直接决定它是不是高质量数据。未经人工标注的数据,只要经过适当处理,能够直接用于训练并提升模型效果,同样可以成为高质量数据。所以说,数据价值不能脱离模型和应用目标单独判断。
我之前开玩笑说,即使一条数据在人看来有些难以理解,只要确实提升了模型性能,也应该承认对模型有价值。这个说法有些夸张,但强调的是数据必须放到模型效果中评价。
爱分析:行业垂类数据可以怎样划分?
谭昶:行业垂类数据大致分为通识数据、行业通识数据和企业专有数据三个层次。
通识数据主要用于基础模型预训练,基础模型学习后像一个高中生,知识面很广,但每个领域都不够深入。
行业通识数据可以让模型成为某个行业的入门级专家,通过RAG、SFT微调等方式,加入化工、钢铁、数学或者代码等行业数据,模型能力会逐渐聚焦到具体领域。
企业专有数据来自一家企业的经营、生产和管理过程,包括技术文档、工艺记录和内部经验。模型学习这些数据后,才能进一步成为真正懂这家企业的专家。
三个层次逐步深入,知识密度和定制化程度也不断提高。
爱分析:哪些数据可以标准化,哪些必须定制?
谭昶:公开的通识数据和部分行业通识数据具有较强复用性,可以生产成标准化产品。比如公开渠道形成的钢铁行业基础数据,可以服务多家钢铁企业。
企业专有数据则高度定制。某座高炉十年的运行记录,只对特定企业和设备直接有效,还涉及工艺能力和商业秘密,只能在企业内部生产和使用。
数据能否规模化复用,既取决于知识的通用程度,也受到产权和授权方式影响。一般情况下,企业把数据作为竞争优势,就会长期留在私域,而科研机构经过脱敏、加工和授权,也可能把内部数据转化为行业数据产品。
数据的应用深度主要取决于质量和知识密度,应用广度则受到产权、授权方式和持有者意愿影响。此外,标准化产品与企业定制服务则会长期并存。
03 机器完成99%,专家守住最后1%
爱分析:飞数的数据生产可以实现多高程度的自动化?
谭昶:不同数据的技术成熟度差别很大。在语音、语言和文本等成熟场景中,90%以上的数据已经可以不经过人工标注或加工,部分预训练语料由模型自动处理后,就能作为弱监督数据进入训练。
弱监督数据介于有监督数据和无监督数据之间。它不是由人逐条精细标注,也不是完全没有标签,而是由模型完成基础处理和预标注。
后训练数据的要求更高。很多微调和强化学习数据仍需要先由模型预处理,再由标注人员或者行业专家复核、校准,自动化程度最终取决于数据类型、模型能力和客户质量要求,不能用一个比例概括所有场景。
爱分析:模型能力提升后,人工标注会消失吗?
谭昶:人的工作量会下降,但高标准、高利害场景中,人工兜底很难消失。比如,印刷体OCR识别率超过95%后可以接近全自动,但教育和医疗中的手写体识别,仍可能需要人工修正。
算法未来可能达到97%、98%甚至99%,但只要模型还会犯错,最后的错误就需要人处理。在医疗、教育等场景中,机器可以完成99%的工作,剩下1%仍可能决定系统能不能进入真实业务。
比如手写体识别准确率只有90%,业务要求达到95%,中间的差距就需要人工修正。专家的工作量可能降到1%,承担的质量责任不会随之消失。
爱分析:如果数据生产可以做到这么高的自动化,模型公司为什么还需要专业数据服务商?
谭昶:第一,模型公司无法长期储备所有领域的人才。今天需要日语,明天需要西班牙语,自建团队很难应对波动需求,而数据公司可以集中专业人才,同时服务多家客户。
一个数据团队可以储备一百名日语专业人员,同时为二十家模型企业服务,专业人才和规模化组织的优势由此形成。
第二,大规模数据处理需要专业生产体系。每天处理上亿条数据或者数百TB数据,必须建立专门的团队、流程和质量体系。
第三,模型训练和数据生产正在形成专业分工。科大讯飞早期把算法和数据团队放在企业内部,后来数据团队逐渐发展为专业服务公司,可以同时服务不同模型厂商和行业客户。
模型持续迭代,业务场景不断变化,数据也需要持续补充、修正和优化,所以高质量数据建设不会成为一次性工作。
爱分析:未来人会在数据生产流程中承担什么角色?
谭昶:人会逐渐从生产闭环内部转向闭环外部。一个智能体负责生产,另一个采用不同思路和架构的智能体负责质检,二者不断生成、检查和修正。
生产和质检智能体不能完全同构,否则可能在同一个地方犯错。两个智能体达到预设标准后,再由人进行最终审视。
数据工程师主要负责两件事:制定规则和验收结果,一般先定义数据生产的元规则,再对数据Agent生成的成果抽样检查和最终验收。
例如数据Agent生成一万条达标数据后,工程师不再逐条参与生产,而是检查样本和整体质量,避免人成为流水线中最慢的环节。
机器负责规模化生产,人负责定义质量并承担最终责任。未来的数据工程师和行业专家,将更多成为流水线的设计者、监督者和验收者。
04 具身数据将从规模竞争转向质量竞争
爱分析:合成数据对数据生产这件事情有什么价值?能够替代真实数据么?
谭昶:传统数据生产包括采集、治理、标注和质检。合成数据首先改变采集方式,根据目标和规则直接生成数据,也能减少后续治理和标注工作。
质检仍然不能取消。合成数据可能出现错误、偏差和分布不合理,只要生成模型不能保证百分之百正确,就需要检查最终结果。数据工程师和行业专家会转向设计、运营和验收合成数据流水线。
未来可以由不同架构的模型分别负责生成和检查,人位于闭环外制定标准、监督运行并验收结果。合成数据改变生产方式,不会取消质量责任。
爱分析:具身智能的技术路线是否形成了共识?
谭昶:技术路线还在发展,数据层面已经出现初步共识。第一阶段需要大规模仿真和第一视角数据,作为类似预训练语料的基础数据;第二阶段使用真机遥操作和实际生产数据,完成后训练、微调和能力增强。
目前真机数量有限,相关数据多由机器人企业内部团队采集,流向外部市场的数据较少。外部服务商主要参与大规模仿真和无本体数据生产,竞争重点是成本和交付效率。
一些头部企业已经开始把模型团队和数据团队分开,成立专门的数据公司,但整体仍处于早期。
爱分析:这个市场接下来会如何发展?
谭昶:大规模基础数据生产会经历明显高峰,但不一定长期保持相同规模,预训练数据跨过规模门槛后,新增的低难度数据需求会下降。
行业对具体门槛仍有不同判断,但基础数据从快速增长转向需求回落,是数据生产领域反复出现的规律。
这种规律在数据产业中很常见。新模型和新场景出现后,基础数据先快速增长;基础能力形成后,需求转向难例、长尾场景和高精度数据。具身智能前期竞争规模,后期竞争复杂任务、准确率和知识密度。
爱分析:飞数如何应对这种阶段性变化?
谭昶:飞数会参与当前的大规模采集和生产,但不会把长期能力只建立在低难度规模生产上。大规模生产帮助团队建立流程和工具,需求下降后,团队要进一步转向高难度、高知识密度任务。
飞数更关注团队能否从规模化采集单位,逐步升级为高质量数据生产单位。
具身数据市场前期拼规模和成本,长期仍然要拼技术、专家和质量控制能力。基础数据有周期,高难度数据和持续优化会长期存在。
05 数据产业必须长在产业里
爱分析:怎么看待这一轮数据标注基地发展前景?
谭昶:早期一些数据标注基地没有明确行业方向,各地主要比较房租、补贴和人力成本,最终引入的仍是相似的劳动密集型企业,容易陷入同质化竞争。
高质量数据越来越依赖行业知识。如果一个城市的优势产业是钢铁,与其引入十家传统自动驾驶标注企业,不如引入一家真正懂钢铁生产的数据服务商。
数据服务商进入当地产业,才能接触真实数据、业务专家和具体场景,并将它们转化为行业数据产品。数据产业不能只建园区,必须长在产业里。
飞数此前参与了合肥和南京相关数据标注基地的工作,重点也是推动数据技术、专家资源与地方产业结合。
爱分析:公共数据运营与高质量数据集建设是什么关系?
谭昶:两者已经在融合。以智能交通为例,完整的数据集既需要企业掌握的数据,也需要政府部门掌握的道路、车辆和公共交通数据,只依靠其中一类,数据就可能不完整。
医疗和教育领域也有大量公共数据。高质量数据集建设需要在合规授权、安全使用和质量治理的前提下,把公共数据、企业自有数据和市场数据连接起来。
这种融合已经开始发生。承担相关任务的城市和企业,正在把公共数据运营与行业高质量数据集建设放到同一个体系中推进。
爱分析:飞数准备依靠什么建立长期壁垒?
谭昶:飞数的核心壁垒是技术和人才。技术方面,我们推进数据生产智能平台建设,将AI预标注、自动化质检、流程调度与专家校准等能力深度集成于统一平台。通过平台化工具提升标准化环节的自动化处理比例,释放人力聚焦高难度、高知识密度的核心任务,同时强化专家在规则制定、关键校准与最终验收中的决策作用,形成规模化组织能力与高质量交付能力并重的效率壁垒。会持续建设自动化标注、数据生产智能体和平台。拥有自动化流水线的企业,相比依赖手工作坊的企业,在效率、质量和成本上会形成优势。
人才方面,飞数会巩固并扩充高知识密度专家网络。在教育、医疗等优势领域持续储备高质量专家资源,形成应对高难度、高知识密度任务的快速响应能力,构筑“模型能力越强、对高质量专家标注数据需求越深”的正向飞轮。
爱分析:飞数目前重点服务哪些客户?
谭昶:目前主要有三类客户。第一类是AI模型厂商,飞数按照模型训练需求提供定制化服务;第二类是高校、科研院所和实验室,为科研大模型生产相对标准化的高质量数据;第三类是工业制造企业,围绕化工、冶金等行业建设行业通识数据和企业专有数据。
无论需求来自模型厂商还是最终企业,目标都是通过行业数据和企业数据提升垂类模型效果。
科研机构更倾向于标准化数据集,工业企业则需要把自身工艺、文档和经验转化为企业专有数据。不同客户的交付方式不同,但都需要持续的数据生产和质量运营。
未来,飞数会围绕模型和业务效果持续提供数据服务。技术平台提升生产效率,专家网络解决高知识密度任务,两者共同构成长期发展的基础。
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


