编者按:随着国家“数据要素×”与“人工智能+”行动深入推进,数据已成为新的生产要素。日前,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》(以下简称《方案》),强化数据赋能人工智能创新发展。该《方案》将为油气行业人工智能的发展带来哪些机遇与挑战?未来油气行业在智慧能源等领域应如何推进行业高质量数据集建设?本期邀请专家予以解读,敬请关注。
什么是行业高质量数据集?
行业高质量数据集是经过采集、加工等数据处理,可直接用于开发和训练人工智能模型,能有效提升模型性能的行业数据的集合,包含行业通识和行业专识数据集。
实施强基扩容行动
拓宽数据供给渠道,丰富数据供给类型,加快建设行业高质量数据集,为人工智能的发展和应用提供充足的“燃料”。
实施标注攻坚行动
引导数据标注从“以人为主”向“人机协同、专家深度参与”的多层次标注模式转变,推动数据标注向专业化、智能化跃升。
实施提质增效行动
推动构建符合结构完整性、内容多样性、标注准确性、模型适配性等质量标准,满足人工智能就绪的高质量数据集。
实施应用赋能行动
坚持行业高质量数据集建设与实际应用深度融合,以模引数、用数赋模,促进高质量数据集建设与“数据要素×”“人工智能+”同频共振,全面赋能产业数智化转型。
实施管理服务行动
加强数据集管理,完善数据伦理和治理机制,推动落实数据权益相关制度,推进数据集建设体系更加规范有序。
实施价值释放行动
释放数据要素价值,推动数据集商业化、资产化,培育为数据付费的市场共识,探索以词元为基础的价值体系。(来源:国家数据局)
专家观点》》》
打通数据价值链路 重塑油气行业AI竞争力
□杨博 数智研究院创新中心数据集业务总监
近日,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》(以下简称《方案》),紧扣“人工智能+”行动,围绕行业数据集供给、流通、应用等关键环节,部署强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放六大专项行动。该《方案》是对数字时代生产要素演进规律的深刻把握,是对“以数强智、以智用数”发展路径的战略性校准,开启了数据要素与人工智能深度融合的全新格局。
《方案》为油气行业人工智能发展划定新赛道
当前人工智能发展面临结构性拐点:公域数据红利消退,通用大模型陷入“通识有余、专识不足”困境,难以有效支撑行业深度应用,行业私域数据正成为决定模型能力的核心变量。
《方案》将智慧能源列为重点建设领域,为油气行业带来三重战略机遇。一是数据治理规范化带来的基础能力提升。国家首次为行业高质量数据集内涵与外延作出系统界定,为油气行业数据从“自由生长”走向“规范治理”提供了顶层设计。二是链主地位强化带来的资源整合。中国石油作为链主单位可发挥牵引作用,整合勘探、炼化、销售全链条数据资源,推动产业链上下游协同共建。三是价值释放行动带来的商业模式创新。培育为高质量数据付费的市场共识,为AI创新从“项目级投入”走向“企业级运营”提供经济激励。
挑战同样严峻。一是行业数据普遍存在的“有数据无质量、有存量无治理、有资源无流通”的三重困境不容回避。二是油气数据关系国家能源安全,数据安全与共享的深层矛盾亟待破解。三是数据作为新型生产要素,其确权、定价与交易机制缺乏成熟范式。谁能率先破解数据治理、安全与资产化的三重难题,谁就能在油气行业智能化转型中赢得先机。
高质量数据集重塑油气行业AI竞争力
行业高质量数据集是经过深度加工、精准标注、系统治理,能够直接驱动模型训练、支撑场景应用的“高纯燃料”,在战略上已成为油气行业的核心竞争资产。
中国石油按业务领域成立专业语料工作组,采用“四阶八步”工作法,建立“数据—模型—应用—反馈与回流”的闭环,建成油气地震勘探大模型、地下资源地球物理测井等多项行业数据集,入选国务院国资委首批10余个行业30项央企人工智能行业高质量数据集优秀建设成果。中国石化启动“三个1”高质量数据集建设工程,中国海油获DCMM五级认证,国家管网推出行业首个可信数据空间……油气行业高质量数据集建设正从各自探索走向体系推进。
差距不容忽视。当前,行业数据集建设仍处于快速发展的早期阶段,多数企业将其视为“项目级数据准备”的一次性工程,导致其无法持续迭代及跨场景复用。数据集建设不能止步于项目级交付,应成为嵌入企业日常生产经营的“基础设施”,如同油田地质资料、炼厂工艺参数一样,成为每天被调用、持续被更新、不断被优化的核心资产,真正成为发展新质生产力的核心要素。
六大专项行动构成从建设到价值释放的完整闭环
六大专项行动沿着“供给—流通—应用—管理—变现”的数据价值链路依次展开,构成从建设到价值释放的完整闭环。
强基扩容与标注攻坚构成“供给侧双轮”,保障数据“供得出”与“供得精”。前者拓宽多模态数据采集渠道,后者推动标注从人力密集型向知识、智能密集型跃升。油气行业应全面梳理全链条数据资源,形成资源清单与需求清单,建立人机协同建设机制,让专家聚焦标准设计、复杂样本裁决和质量审核。
提质增效与应用赋能构成“需求侧双轮”,推动数据“用得好”与“能闭环”。前者强调数据集质量标准与“一次测评、全国互认”机制,后者打造“数据飞轮”应用闭环。油气行业应将数据集建设与日常业务运营深度耦合,实现更新与生产同步、标准与决策对齐,支撑跨业务单元可信复用。
管理服务与价值释放构成“制度侧双轮”,支撑数据“管得住”与“能变现”。前者落实数据持有权、使用权、经营权“三权”分置制度,后者鼓励资产化创新。油气行业应推动数据从“生产资料”走向“金融资产”,探索合规前提下的多元商业模式。
六大专项行动是环环相扣的系统性工程。供给侧质量决定需求侧效果,需求侧反馈驱动供给侧优化,制度侧提供全程保障。油气行业须建立统筹推进机制,将数据集建设纳入企业战略运营体系。
建立数据、模型与业务场景协同演进的良性循环
《方案》提出“场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值”的“数据飞轮”,核心是建立数据、模型与业务场景协同演进的良性循环。
流程上,以炼化装置运行优化为例。场景牵引数据,以常减压、催化裂化等关键装置操作优化为牵引,反向梳理工艺参数、设备状态、化验分析等数据需求;数据驱动模型,采集DCS实时数据、LIMS化验数据、设备振动监测等多模态数据,经标注对齐形成高质量数据集用于模型训练;模型赋能应用,部署到实际生产中,实时推荐最优操作参数组合,辅助操作人员精准控制,提高目标产品收率、降低能耗物耗;应用创造价值,模型推荐参数与实际操作反馈、装置运行结果比对后,偏差和校正记录回流至数据集,驱动模型持续迭代,使操作优化越做越准,目标产品收率持续提升、能耗物耗不断下降。四环首尾相接、循环往复,每一次旋转都在为下一轮积蓄更强的驱动力。
架构上,昆仑大模型“基础、行业、专业、场景”四层架构是“数据飞轮”逐层加速的组织载体。场景模型数据自上而下沉淀,持续提升行业模型能力;行业模型能力跃升,自下而上为场景模型建设提供更强底座。双向互动,逐层加速。
机制上,场景端建立遴选制度,确保围绕高价值场景旋转;数据端完善贡献考核激励机制,促进主动供数;模型端建立数据需求动态对接机制,加速模型迭代;应用端打造标杆案例,加速规模化落地。四端协同发力,推动“数据飞轮”从理念转化为可操作、可迭代的企业运营机制,让油气行业数据资产在循环中反复淬炼、持续增值,真正成为驱动行业智能化转型的价值引擎。
以统一AI中台为底座 推进高质量数据集建设
油气行业高质量数据集建设落地,应围绕“场景—能力—机制”推进。
以场景为起点,牵引建设方向。重点识别勘探开发、炼油化工、AI4S等核心领域高价值场景,聚焦井控风险、设备故障等低频高危长尾场景,构建“场景-数据”二维映射,确保建设方向与业务对齐。
以能力为支撑,锻造全链条工程化能力。统一AI中台作为六大专项行动落地的“技术底座”,提供贯通需、采、存、管、治、标、评、用全链路流水线,实现数据格式统一、接口标准一致、流程自动衔接、数据集中沉淀,杜绝“各自搭台、互不兼容”的重复建设。以此为基础,还需标准先行固根基,覆盖数据采集、标注、质量评估全流程,推动各环节规范统一;人机协同提效率,构建“机器预标注—专家精校准—模型再迭代”的协作方式,支撑规模化生产与专家精准把关相结合;迭代反馈促循环,通过模型训练反馈指导下一轮采集、增强与标注,支撑质量持续提升,最终形成标准规范、协同高效、持续迭代的完整工程化能力。
以机制为保障,推动长效运营。组织上建立业务主导、多方协同推进机制,明确权责分工;制度上配套全生命周期管理规范,促进数据集建设常态化;人才上组建“领域专家+算法工程师”双核团队,让算法“长”在业务上,而非“悬”在实验室里。三个维度协同发力,推动数据集建设从项目驱动迈向战略驱动。
企业案例》》》
覆盖20类主流装置 异常工况预警准确率达85%以上
炼化时序数据集在兰州石化首次应用
中国石油网消息(通讯员 翟德宏 记者 李茜)8月29日至9月4日,兰州石化榆林化工有限公司依托炼化时序数据集及多智能体应用平台,完成2号裂解炉收率提升线下验证,通过模型推荐值与人工参数调整对比,检验了其实战能力。
长期以来,炼化生产中海量时序数据“沉睡”,“数据孤岛”导致信息割裂,生产优化过度依赖经验,数据应用多停留在指标查询和图表展示层面。
2025年6月,数智研究院与兰州石化榆林化工有限公司联合启动“炼化时序数据集构建及应用”项目,基于数据集训练形成炼化时序大模型及多智能体应用平台。
团队构建覆盖常减压、乙烯裂解等20类典型炼化工艺装置的高质量时序数据集,规模达2.2TB。
建设过程中,团队研发智能清洗和标注引擎,攻克噪声干扰、数据缺失、标注效率低等难题,利用机理模型生成训练数据,保障异常工况下的覆盖度与泛化能力。同时,依托数据中台实现全生命周期管理,配套国密SM4加密与分级访问控制机制,筑牢数据安全防线。
在应用场景中,员工通过自然语言即可智能问数,实时掌握装置投入产出、产品质量等信息,大模型通过多参数关联研判,可以给出操作建议。实际优化测试结果显示,平台对乙烯收率的预测准确度超过99%,异常工况预警准确率达85%以上,推动乙烯收率相对提升0.373%,裂解炉投炉路径的智能规划使装置调整时间缩短10%以上。
覆盖16个油气田 支撑超6000井次智能常规资料解释
地下资源地球物理测井高质量数据集赋能测井智能化升级
中国石油网消息(记者 杨倩)9月1日,中油测井长庆分公司解释评价中心,依托地下资源地球物理测井高质量数据集,智能解释系统高效运转,辅助技术人员开展双42-45C9井储层划分及油藏段精细解释工作。曾经需要人工逐井翻阅的海量测井资料,如今实现标准化调用、智能化辅助解析。
我国测井行业积累了海量数据,但长期面临分散存储、多源异构、格式复杂、质量不一等挑战,价值难以充分释放。中油测井聚焦数据“采、传、存、管、治、用”全业务流程,建立地下资源地球物理测井高质量数据集。
研发支持多层次、多类型、多粒度的测井数据存储格式GDSX,填补国内行业统一格式空白,打通多源数据整合、互通复用的堵点。同时,采用“总库+分库”分布式架构,研发以井为单位的多源数据高可靠同步技术,搭建采集边端与总库管理的数据联通通道,为数据集的全域归集、统一管理、共享应用构建核心支撑。此外,围绕测井数据核心质量要素,构建数据多维度质量量化评价体系,研发测井数据自动化治理工具,实现数据自动搜索、清洗、特征预处理,支撑储层参数计算、油气智能识别等高价值场景智能化升级。
据悉,该数据集覆盖中国石油国内16个油气田的测井数据,目前,已支持长庆、大庆等油田超6000井次智能常规资料解释、万余井次智能固井质量评价,综合处理效率提升超30%,关键环节提速10倍以上,大幅降低油气评价成本和风险,提升勘探效率和准确性。
数据总量达220TB 地震解释效率提升9至12倍
油气地震勘探大模型高质量数据集实现创新突破
中国石油网消息(通讯员 林霞)9月4日,笔者获悉,由勘探开发研究院和东方物探联合攻关建立的油气地震勘探大模型高质量数据集,在长庆、塔里木等国内外油气田20多个勘探工区的地震勘探实践中取得较好的应用效果,地震解释效率提高9至12倍,有望推动传统地震解释工作模式变革。
油气勘探领域积累了海量的叠前叠后地震数据、测井曲线及解释成果数据、地质综合数据等多源异构数据,如何有效训练庞大且复杂的多学科数据,一直是制约模型训练效率及预测准确率的关键难题。
为此,勘探开发研究院和东方物探创新提出油气地震勘探大模型高质量数据集构建方法,并应用该高质量数据集在地震大模型构建技术研究等方面取得了显著成效。
据悉,该数据集聚焦地震勘探业务,收集包含松辽、鄂尔多斯、塔里木、四川、准噶尔、柴达木、渤海湾等国内主要含油气盆地高分辨率地震原始和成果数据,业务覆盖碳酸盐岩缝洞体、碳酸盐岩生物礁滩、火山岩、页岩、砂岩岩性体等主要油气勘探目标,数据集总量达到220TB。
该数据集支撑地震解释大模型预训练、智能二维地震波场正演应用场景建设。目前,数据集应用于9个地震处理、解释业务应用场景建设,包括基于智能化科学计算的正反演、碳酸盐岩走滑断裂识别、碳酸盐岩缝洞储集体智能预测、河道识别、致密砂岩岩性智能预测、断层智能解释等,均取得良好的应用效果。
微信公众号:zgsybwx