尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Large Language Models for Summarizing Czech Historical Documents and Beyond

发布时间:2026/9/25 12:52:15

资讯中心
01
ARTICLE

Large Language Models for Summarizing Czech Historical Documents and Beyond

Large Language Models for Summarizing Czech Historical Documents and Beyond
文章主要内容与创新点总结一、主要内容本文聚焦捷克语文本摘要任务,尤其是历史文献摘要这一研究缺口,展开了系统性研究,具体内容如下:研究背景:文本摘要旨在精简文本同时保留核心信息,当前该领域研究多集中于英语等资源丰富语言,而捷克语(尤其是历史捷克语)因语言复杂性(如语言演变、词汇过时、语法不一致)和标注数据集稀缺,相关研究较为薄弱。数据集相关:梳理现有数据集:涵盖英语数据集(如含30余万篇英语新闻的CNN/Daily Mail、含22.6万条单句摘要的XSum等)和多语言数据集(如含百万级文章 - 摘要对的XLSum、含150万对的MLSUM),指出捷克语专用数据集匮乏,仅有面向现代捷克语的SumeCzech(含100万篇捷克新闻,支持标题生成等任务)。构建新数据集:针对历史捷克语文本摘要需求,基于历史期刊《Posel od ˇCerchova》创建同名数据集,借助GPT - 4和Claude 3 Opus生成摘要,经人工校验,包含页面级(POC - P,432页摘要)和文章级(POC - I,100期摘要)两类摘要,可免费用于研究。模型与实验:选用模型:采用mT5(多语言文本到文本转换Transformer,基于Transformer编解码器架构,训练于含捷克语的mC4数据集)和Mistral 7B(高效大语言模型,含70亿参数,采用分组查询注意力等机制)。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。