C
发布于 2026/09/03 · 阅读 0

挪威国家图书馆用2PB华为全闪存储训练挪威语大模型

  • #LLM
  • #存储
  • #华为
  • #全闪存储
  • #主权AI
挪威国家图书馆用2PB华为全闪存储训练挪威语大模型

挪威国家图书馆正在开发一个理解挪威语的大语言模型(LLM),并在其AI训练数据管道中使用了2 PB的华为OceanStor Dorado全闪存储。

该图书馆IT平台负责人Marius Husnes在巴黎华为ID论坛2026上讨论了该项目,他表示没有商业LLM提供商在开发本地(挪威语)LLM。他认为,任何拥有自己语言但没有主权LLM的国家都处于劣势,因为全球训练的英语LLM不了解该国以当地语言描述的历史、新闻和文化。

挪威文化部委托国家图书馆构建主权AI(LLM),因为该馆拥有国内最大的挪威语书籍、报纸、网页等数字馆藏。与许多国家图书馆一样,它有权接收每本出版书籍和广播内容的副本。其法定缴存职责不仅限于书籍,它还有义务收集和保护挪威的所有文化遗产。与挪威报纸的协议允许对受版权保护的内容进行LLM训练,Husnes表示:“没有私人公司能做到这一点。”

图书馆自2005年开始数字化馆藏,已积累20 PB独特数据,以3-2-1形式(3份副本、2种介质、1份异地)存储,总计约60 PB。原始文本、音频、视频、静态图像和网页内容的数字化过程涉及大量OCR扫描,生成了大量元数据和用于在线访问的API。大部分数据存放在磁盘加磁带存档的保存系统中。

Husnes的任务是将这些数据传输到LLM训练系统。他表示瓶颈不在于计算,而在于数据质量、清洗和管道吞吐量。有两个主要处理阶段:首先是在内部计算,使用Nvidia DGX H200系统、384核CPU集群和多个华为OceanStor Dorado全闪阵列,总计2 PB闪存容量,为数据管道和训练准备提供低延迟存储。管道包括数据摄取、清洗、去重、格式规范化、验证和准备步骤。

数据通过管道后,发送到挪威国家超级计算机Sigma2 Olivia系统进行实际训练运行。Olivia系统是HPE Cray Supercomputing EX系统,拥有448个GPU和64,512个CPU核心,使用5.3 PB的Cray ClusterStor E1000存储系统。

一个主要问题是克服两种不同存储系统的需求。60 PB的保存系统针对持久性和成本优化,而非快速IO,读取延迟高,专为不频繁访问设计。AI管道存储则针对高吞吐量、低延迟、并行数据IO设计。Husnes说,没有人讨论将PB级数据集从存档移动到并通过AI数据管道系统的问题,他的团队必须自己摸索。

LLM训练仍在进行中,他在演讲结束时总结了他的团队仍在学习的内容:评估——没有标准评估工具来评估主权挪威语LLM。该语言有两种书写形式、多种方言和历史变化,他们正在临时构建自己的评估工具。治理——谁控制主权LLM的访问?谁决定它可以用于什么?这些是机构和政治问题,没有简单答案。编排——使三个系统(保存存档+本地AI环境+国家Sigma2超级计算机)顺畅协同工作是一个持续的项目。

我们的观点是:首先,华为存储在欧洲市场发挥着重要且显著的作用;其次,任何开发主权本地语言LLM的国家最好咨询Husnes并了解其中的问题。正如Husnes所说:挪威是一个小国,正在解决每个非英语国家都将面临的问题:如何构建反映你的语言、文化和历史的AI?AI需要守护者,而不仅仅是构建者。

0 阅读0 评论0 点赞

评论

登录 / 注册即可发布评论!
暂无评论,成为第一个发表评论的用户吧。