大模型 活跃维护

unilm

microsoft/unilm

跨任务、语言和模态的大规模自监督预训练

22228
Stars 标星
2706
Forks 分支
296
Watchers 关注
687
Open Issues
Python
主要语言
MIT
开源协议
75.4 MB
仓库大小
3 天前
最后推送
一键安装扩展 / 插件指令
dsh plugin --profile web add github:microsoft/unilm
git clone https://github.com/microsoft/unilm.git
git clone git@github.com:microsoft/unilm.git
README.md master

机器翻译正文由机器翻译自项目原始文档(英文),排版经程序统一处理,可能存在偏差,请以原项目仓库为准。

aka.ms/GeneralAI

招聘

我们正在各个层级招聘(包括全职研究员和实习生)!如果您有兴趣与我们合作研究基础模型(即大规模预训练模型)以及通用人工智能、自然语言处理、机器翻译、语音、文档人工智能和多模态人工智能,请将您的简历发送至 fuwei@microsoft.com

基础架构

TorchScale - 基础架构库(仓库

基础研究以开发用于基础模型和人工智能的新架构,重点关注建模通用性和能力,以及训练的稳定性和效率。

稳定性 - DeepNet:将Transformer扩展到1000层及以上

通用性 - Foundation Transformers (Magneto):朝向跨任务和模态(包括语言、视觉、语音和多模态)的真正通用建模

能力 - 一个长度可外推的 Transformer

效率与可迁移性 - X-MoE:可扩展且可微调的稀疏专家混合模型(MoE)

模型架构的革命

BitNet:用于大语言模型的一位Transformer

RetNet:Retentive网络:大语言模型的Transformer继任者

LongNet:将Transformer扩展到10亿个Token

基础模型

(多模态)LLM(多模态大语言模型)的演进

Kosmos-2.5多模态读写模型

Kosmos-2将多模态大语言模型与现实世界接轨

Kosmos-1多模态大语言模型 (MLLM)

MetaLM语言模型是通用接口

大融合 - 大规模自监督预训练覆盖 tasks(预测和生成)、languages(100种语言)以及 modalities(语言、图像、音频、布局/格式 语言、视觉 语言、音频 语言等)

语言与多语言

UniLM:用于语言理解与生成的统一预训练

InfoXLM/XLM-E:支持100种语言的多语言/跨语言预训练模型

DeltaLM/mT6:用于语言生成和翻译的编码器-解码器预训练,支持100种语言

MiniLM:用于语言理解与生成的小型快速预训练模型

AdaLM:预训练模型的领域、语言和任务适配

EdgeLM( NEW ):在边缘/客户端设备上运行的小型预训练模型

SimLM( NEW ):用于相似性匹配的大规模预训练

E5 ( NEW ): 文本嵌入

MiniLLM( NEW ):大语言模型的知识蒸馏

视觉

BEiT/BEiT-2:视觉的生成自监督预训练 / 图像转换器的BERT预训练

DiT:文档图像转换器的自监督预训练

TextDiffuser/TextDiffuser-2( NEW ):作为文本绘画器的扩散模型

语音

WavLM:面向全栈任务的语音预训练

VALL-E:用于TTS的神经编解码器语言模型

多模态(X 与语言)

LayoutLM/LayoutLMv2/LayoutLMv3:多模态(文本 + 布局/格式 + 图像)文档基础模型,适用于文档AI(如扫描文档、PDF等)

LayoutXLM:用于多语言文档AI的多模态(文本 + 布局/格式 + 图像)文档基础模型

MarkupLM:用于视觉丰富文档理解的标记语言模型预训练

XDoc:跨格式文档理解的统一预训练

UniSpeech:用于自监督学习和ASR监督学习的统一预训练

UniSpeech-SAT:带说话人感知预训练的通用语音表示学习

SpeechT5:用于口语处理的编码器-解码器预训练

SpeechLM:利用非配对文本数据增强语音预训练

VLMo:统一视觉-语言预训练

VL-BEiT ( NEW ):生成式视觉-语言预训练——BEiT向多模态的进化

BEiT-3 ( NEW ):通用多模态基础模型,也是跨任务、语言和模态的大规模预训练大融合的重要里程碑。

工具包

s2s-ft:序列到序列微调工具包

Aggressive Decoding ( NEW ):无损且高效的序列到序列解码算法

应用

TrOCR:基于Transformer的OCR,带预训练模型

LayoutReader:用于阅读顺序检测的文本和布局预训练

XLM-T:利用预训练跨语言编码器的多语言NMT

链接

LLMOps (仓库)

通用技术,用于通过LLM和MLLM赋能AI能力。

RedStone (仓库)

为大型语言模型整理通用、代码、数学和问答数据。

新闻

发布

***** New October, 2022 : [XDoc]( https://github.com/microsoft/unilm/tree/master/xdoc ) 发布 ***\****

  • XDoc(2022年10月7日):XDoc 是一个统一的预训练模型,可在单一模型中处理不同的文档格式。为了提高参数效率,我们在不同格式之间共享骨干参数,如词嵌入层和 Transformer 层。同时,我们引入带有轻量参数的自适应层,以增强不同格式之间的区分度。实验结果表明,仅用 36.7% 的参数,XDoc 就能在各种下游任务上实现与单独预训练模型相当甚至更好的性能,这对于实际部署具有成本效益。《XDoc:跨格式文档理解的统一预训练》 EMNLP 2022

****** New May, 2022 : [激烈解码](https://github.com/microsoft/unilm/tree/master/decoding)释放 ****

  • Aggressive Decoding(2022年5月20日):Aggressive Decoding,是一种新型解码范式,用于无损加速seq2seq生成。与之前的努力(例如非自回归解码)通过牺牲质量来加速seq2seq生成不同,Aggressive Decoding旨在与自回归解码相比,以显著加速产生相同(或更好)的生成结果:对于具有高度相似输入输出的seq2seq任务(如语法错误纠正和文本简化),输入引导的Aggressive Decoding可以在GPU上为流行的6层Transformer引入7倍至9倍的加速,同时结果与贪婪解码相同;对于其他常规seq2seq任务(如机器翻译和抽象摘要),广义Aggressive Decoding可以实现3倍至5倍的加速,且质量相同甚至更好。"Lossless Acceleration for Seq2seq Generation with Aggressive Decoding"

***** New April, 2022 : [LayoutLMv3]( https://github.com/microsoft/unilm/tree/master/layoutlmv3 ) release **\****

  • LayoutLM 3.0(2022年4月19日):LayoutLMv3 是一种用于文档人工智能的多模态预训练 Transformer,采用统一的文本和图像掩码。此外,它还通过词-图像块对齐目标进行预训练,通过预测文本词对应的图像块是否被掩码来学习跨模态对齐。简洁的统一架构和训练目标使 LayoutLMv3 成为适用于文本中心和图像中心文档 AI 任务的通用预训练模型。实验结果表明,LayoutLMv3 不仅在文本中心任务(包括表单理解、收据理解和文档视觉问答)中取得了最先进的性能,而且在图像中心任务(如文档图像分类和文档布局分析)中也表现出色。LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking ACM MM 2022

**** March, 2022 : [EdgeFormer]( https://github.com/microsoft/unilm/tree/master/edgelm ) 发布 ***\***

  • EdgeFormer (2022年3月18日):EdgeFormer,是第一个公开可用的预训练参数高效Transformer,用于设备端的seq2seq生成。EdgeFormer仅有1100万个参数,经过int8量化和压缩后占用磁盘空间不到15MB,可以在两核中高端CPU上处理长度为20-30个token的句子,延迟可接受,内存占用低于50MB。预训练的EdgeFormer可以微调到英语seq2seq任务中,并取得有前景的结果——显著优于强参数高效Transformer基线(预训练的Universal Transformer)和未经预训练的全参数Transformer-base模型,我们相信这可以在实际中大大促进设备端seq2seq生成。 "EdgeFormer: A Parameter-Efficient Transformer for On-Device Seq2seq Generation"

**** March, 2022 : [DiT]( https://github.com/microsoft/unilm/tree/master/dit) 释放 ***\***

  • DiT (2022年3月4日):DiT,一种自监督预训练的文档图像Transformer模型,使用大规模未标注文本图像用于文档AI任务,这一点非常重要,因为由于缺乏人工标注文档图像,从未存在监督对应模型。我们在多种基于视觉的文档AI任务中将DiT作为骨干网络,包括文档图像分类、文档布局分析、表格检测以及OCR文本检测。实验结果表明,自监督预训练的DiT模型在这些下游任务中取得了新的最先进结果,例如文档图像分类(91.11 → 92.69)、文档布局分析(91.0 → 94.9)、表格检测(94.23 → 96.55)和OCR文本检测(93.07 → 94.29)。 "DiT: Self-supervised Pre-training for Document Image Transformer ACM MM 2022"

***** October, 2021 : [WavLM]( https://github.com/microsoft/unilm/tree/master/wavlm)发布 ***\***

  • WavLM(2021年10月27日):WavLM 是一个新的预训练语音模型,用于解决全栈下游语音任务。WavLM 集成了门控相对位置嵌入结构和话语混合方法,以建模语音内容和说话人身份的保留。WavLM 在 94,000 小时的公开音频数据上进行了训练,这比其他发布的英语语音建模检查点要大。WavLM Large 在 SUPERB 基准测试中达到了最先进的性能,并在其代表性基准上为各种语音处理任务带来了显著改进。WavLM:用于全栈语音处理的大规模自监督预训练

***** October, 2021 : [MarkupLM]( https://github.com/microsoft/unilm/tree/master/markuplm) release ***\***

  • MarkupLM(2021年10月19日):MarkupLM 是一种简单而有效的文本与标记语言预训练方法。利用 Transformer 架构,MarkupLM 集成了包括文本嵌入、位置嵌入和 XPath 嵌入在内的不同输入嵌入。此外,我们还提出了专门为理解标记语言而设计的新预训练目标。我们在 WebSRC 和 SWDE 数据集上评估了预训练的 MarkupLM 模型。实验表明,MarkupLM 在这些任务中显著优于几个最先进的基线方法。MarkupLM:用于视觉丰富文档理解的文本与标记语言预训练 ACL 2022

*** September, 2021 : [Trocr]( https://github.com/microsoft/unilm/tree/master/trocr) 发布 ********

  • TrOCR(2021年9月22日):基于Transformer的OCR,使用预训练模型,利用Transformer架构进行图像理解和BPE级别的文本生成。TrOCR模型简单但有效(无卷积),可以用大规模合成数据进行预训练,并使用人工标注的数据集进行微调。TrOCR: 基于Transformer的预训练模型光学字符识别 AAAI 2023

***** August, 2021 : [LayoutReader]( https://github.com/microsoft/unilm/tree/master/layoutreader) 发布 *****

***** August, 2021 : [DeltaLM]( https://github.com/microsoft/unilm/tree/master/deltalm) 发布 ***\***

*** July, 2021 : [ BEiT]( https://github.com/microsoft/unilm/tree/master/beit)释放 ***\***

  • BEiT(2021年6月15日):图像Transformer的BERT预训练。BEiT-large在 ADE20K语义分割任务 中获得最新最好结果(大幅跃升至57.0 mIoU)。BEiT-large在不使用除ImageNet-22k外的额外数据的情况下,实现 ImageNet top-1精度的最新最好成绩(88.6%)。“BEiT: 图像Transformer的BERT预训练

***** June, 2021: LayoutXLM | AdaLM | MiniLMv2 release *****

***** May, 2021: LayoutLMv2 | LayoutXLM release *****

  • LayoutLM 2.0(2020年12月29日):通过在单一框架中利用文本、布局和图像信息实现对视觉丰富文档的多模态预训练。它在各种文档理解任务中都带来了新的SOTA,包括FUNSD(0.7895 -> 0.8420)、CORD(0.9493 -> 0.9601)、SROIE(0.9524 -> 0.9781)、Kleister-NDA(0.834 -> 0.852)、RVL-CDIP(0.9443 -> 0.9564)和DocVQA(0.7295 -> 0.8672)。LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding ACL 2021

***** February, 2020: UniLM v2 | MiniLM v1 | LayoutLM v1 | s2s-ft v1 release *****

***** October 1st, 2019: UniLM v1 release *****

-->

许可证

本项目根据位于此源代码树根目录的 LICENSE 文件中的许可证进行许可。部分源代码基于 transformers 项目。

Microsoft Open Source Code of Conduct

联系信息

如需使用预训练模型的帮助或遇到问题,请提交 GitHub 问题。

如需其他沟通,请联系 Furu Weifuwei@microsoft.com)。

本站来源与版权声明
  • 本文标题:unilm - 跨任务
  • 本文链接:https://cn121.com/llm/microsoft-unilm.html
  • 原项目:microsoft/unilm 版权归原作者 microsoft 及贡献者所有
  • 收录信息:本站于 2026-09-24 收录本项目,本页所列协议与仓库指标均为收录当时的状态;该日期之后原项目的版本更新与协议变更,本页不作同步。
  • 开源协议:收录时本项目采用 MIT查看 LICENSE 原文),本站译文为其衍生内容;使用、修改、分发请以该仓库 LICENSE 原文为准。
  • 站点出处:本文首发于 OneTwoOne,收录自 GitHub 开源项目 microsoft/unilm。
  • 翻译说明:本页正文为人工智能生成内容——由机器翻译对原项目 README 初译、经程序校验排版,可能存在错漏,请以原项目文档为准。
  • 引用声明:商业转载、第三方聚合或 AI 检索训练引用时,请务必保留以上来源出处、本文永久链接,以及原项目的版权声明与许可信息
  • 下架通道:若原项目此后变更或收紧了许可协议、或作者/权利人认为本站的收录方式(译文、排版适配、简介翻译等)超出其授权范围,请通过 xyd3302001@163.com 发送下架通知,并附上项目地址与本页链接。本站核实后将第一时间删除本页内容,或改为不复制原文的目录性收录;署名更正等其他要求可一并提出。