当前位置: 民进网站 > 民进风采 > 媒体聚焦

科学运维期刊版权 建设高质量数据集

发布时间:2026-07-31
【字体:

  当前,人工智能快速发展对高质量数据的需求持续增长,学术期刊作为创新成果的重要载体,正逐渐成为高质量数据集建设的重要基础资源。近年来,随着我国版权制度不断完善、数据要素市场化配置持续推进,高质量数据集建设进入体系化发展阶段。但与此同时,期刊版权授权不规范、版权资产运营能力不足、人工智能训练数据合规使用以及数据跨境流动安全等问题日益凸显,制约了学术资源价值释放和数据要素开发利用。推动期刊版权科学运维,既是完善版权治理体系的重要内容,也是建设高质量数据集、服务人工智能创新发展的基础性工作。应坚持版权保护与数据开发利用并重,以规范版权运维激活期刊数据资源价值,推动高质量数据集建设迈向制度化、规范化、产业化发展。

  完善制度,应对现实挑战

  自1990年《中华人民共和国著作权法》颁布以来,我国已构建了包括法律、法规、规章、规范性文件、司法解释等多层次的版权法律制度框架,为版权事业发展奠定了坚实的法治基础。在法律制度不断完善的基础上,版权治理体系持续优化,行政、司法和行业治理协同发力。

  与此同时,国家高度重视数据要素开发利用,为高质量数据集建设提供了政策支撑。2024年,国家数据局印发《“数据要素×”三年行动计划》推动数据要素市场化配置,以场景驱动融合应用,加强数据标注与行业数据集开发,夯实高质量数据集建设基础;2025年,国家数据局印发《高质量数据集建设指引》提出体系化、设施化、生态化建设思路,发布典型案例;2026年,国家数据局印发《推进行业高质量数据集建设实施方案》顶层部署六大行动,设“四个一批”目标,强化数据赋能人工智能创新发展。

  尽管政策体系不断完善,但在实践层面,期刊版权运维仍存在不少短板,主要体现在以下几个方面。第一是授权不规范。以“版权声明”代替“版权授权”。期刊授权和转让协议订立形式失范,授权版权种类、范围、时间失序,确权方式混乱,导致授权链条断裂、合规数据源严重匮乏。第二是版权运维缺失。期刊出版单位版权资产管理薄弱,运营体系尚未建立,缺乏专门版权事务部门;收益分配机制不公,作者与数据库平台利益冲突突出。开放科学背景下多元主体权益难以平衡,制约期刊可持续发展。第三是恶意维权突出。“版权蟑螂”以维权和学术打假为名,利用技术查重锁定年代久远的涉嫌抄袭文章,批量发起诉讼或要挟索赔,主观恶意明显,损害期刊利益、扰乱出版秩序。第四是人工智能挑战。AIGC深度介入学术创作,引发可版权性争议。生成式人工智能主体擅自爬取、使用期刊论文训练大模型,涉嫌侵犯复制权、改编权及数据权益。第五是数据主权与安全:高质量期刊数据跨境流动管理有待完善,部分境外平台长期垄断集成我国学术资源,既存在数据出境隐患,也使本土数据价值大量外溢。

  加强治理,激活数据价值

  科学运维期刊版权,是提升版权治理水平、建设高质量数据集的重要基础。针对当前存在的问题,应重点从以下几个方面完善版权运维体系。首先,要从源头规范版权授权。摒弃效力存疑的“版权声明”,与作者订立书面授权协议,明确许可权利种类、使用方式、地域范围、期限及付酬标准。

  其次,还应进一步加强版权资产全流程管理。期刊出版单位设立专员,统一管理版权合同签订、归档与合作对接。建立版权资产台账,优化收益分配机制,平衡多元利益冲突。同时,深化知识服务,实现“版权增益”。

  与此同时,应进一步健全版权风险防控机制。主动防控恶意维权,加强出版前学术不端防控,对历史文章开展自查自纠。规范版权转让与许可协议,在协议中明确作者对学术不端行为承担法律责任。保存审查记录作为尽到合理注意义务的证据,从源头压缩“版权蟑螂”的诉讼牟利空间。

  面对人工智能时代的数据安全需求,还应不断完善数据安全保障体系。保障数据主权与安全,加快推进我国自主期刊出版平台建设,改变对国外商业平台的过度依赖。在平台建设中嵌入数字水印、加密与区块链技术,实现上传即确权、流转可追溯。同时在制度、机制、技术层面保障出版数据的安全可控。

  高质量数据集建设是版权治理不断深化的重要体现,也是推动人工智能创新发展的关键支撑。未来,应立足期刊资源优势,加快构建版权清晰、质量可靠、安全可控的数据资源体系。期刊高质量数据集是依托经严格同行评议的学术文献,具备版权清晰、授权完整、元数据规范、内容标注精准、脱敏合规、动态更新等多重特征的学术数据集合。其形态涵盖全文文本、知识图谱、标注语料、实验数据、同行评议等衍生数据。期刊高质量数据集是AI模型训练的高价值“黄金语料”,更是支撑科技情报、科研诚信和文化科技战略决策的基础性战略资源,具有高智力密度、高可信度、高增值性的显著特征。

  协同发力,夯实发展基础

  围绕高质量数据集建设目标,需要从国家、社会和期刊三个层面协同发力。国家层面应进一步强化制度供给,为高质量数据集建设提供政策支撑和制度保障。健全标准规范与质量评测体系,加快推进高质量数据集格式、分类、标注、质量测评等国家标准的研制与实践应用。针对期刊出版领域文本、图像等多模态数据特征,制定出版业高质量数据集行业标准,明确采集、清洗、标注、验收等全生命周期规范。同时,应持续完善数据要素流通和价值实现机制。推动期刊数据资产化进程——出版数据需历经资源化、产品化方可向高价值资产形态转变,鼓励期刊发展“订阅模式”“定制模式”等多元服务形态。推动期刊数据资产入表,化解认定难、确权难、估值难等突出问题,加快从资源到资产再到资本的价值转化。此外,还应加强公共服务能力建设,推动资源共享和协同治理。建设国家出版数据集管理服务系统,实现数据集目录与供需信息互联互通。

  社会层面应构建产业生态与协同机制。培育数据流通服务与标注产业。支持数据机构深入期刊行业开发数据产品,提供采集、加工、流通交易等服务。发展“人机协同、专家参与”的智能化标注,依托产教融合培育专业标注人才,为期刊数据集建设提供产业支撑。同时,应充分发挥各类创新主体的作用。推动产学研用多方协同共建。鼓励期刊社、高校、科研院所等多元主体参与。发挥链主单位牵引作用,推动产业链上下游协同整合资源。搭建政产学研用金交流平台,建立共建共享机制,破解数据孤岛。在此基础上,应加快形成可复制、可推广的发展模式。打造集“数据集生产加工、流通利用、支撑模型训练”于一体的数据赋能工场。此外,还应推动团体标准研制与职业认证。支持行业协会牵头制定出版数据集团体标准,推动期刊数据产品化与市场化流通。联合高校开展数据治理专项培训,完善行业自律与职业认证体系。

  期刊层面应夯实资源基础与运营能力。首先,梳理资源清单与建设规划。系统梳理期刊数据资源底数和应用场景,建立数据资源清单和数据集需求清单。遵循数据需求、数据规划、数据采集、数据预处理、数据标注、模型验证的闭环流程,持续提升数据集质量。围绕出版业内容数据、用户数据、运营数据三类核心资源,构建差异化数据建设方案。其次,规范内容采集与质量控制。严格版权合规审查,确保数据来源权威、内容真实可靠。加强数据清洗、增强、标注、质检等全过程自动化工具研发应用,构建符合结构完整性、内容多样性、标注准确性、模型适配性等质量标准的数据集。最后,探索商业运营与价值转化。深化人工智能等新兴技术赋能,探索知识服务和文化服务应用场景,将单篇文献、类文献数据化、产品化,实现期刊数据从资源到资产的价值跃迁,实现“版权增益”。

  (作者为民进中央出版和传媒委员会秘书长、中国新闻技术工作者联合会副秘书长)

作者:段艳文
责任编辑:叶炜