您现在的位置是：首页 > 其他

当前栏目

PubMed GPT ：用于生物医学文本的特定领域大型语言模型

开发者语言数据

2023-03-07 09:09:55 时间

“我们很高兴发布一种在PubMed上训练的新生物医学模型，这是构建可支持生物医学研究的基础模型的第一步。”——CRFM主任Percy Liang

近日，斯坦福基础模型研究中心（CRFM）和MosaicML联合开发了PubMed GPT模型，一种经训练可以解释生物医学语言的大型语言模型。

目前的大型语言模型（LLM）通常使用于自然语言合成、图像合成及语音合成等，而已知在特定行业的应用很少。本文所要介绍的PubMed GPT即展示了特定行业大型语言模型的能力，尤其在生物医学领域。通过MosaicML云平台，CRFM的开发者在PubMed的生物医学数据集上训练了一个生成式预训练模型（GPT）。结果表明，特定领域的语言生成模型在实际应用中将会有很好的发展前景，同时，LLM也展现出更加优秀的性能和竞争力。注意：目前此模型仅用于研究开发，不适合生产。

PubMed GPT

模型。PubMed GPT 2.7B基于HuggingFace GPT模型，具有2.7B的参数和1024个标记的最大上下文长度。尽可能简单的设计展示了现有LLM训练方法的强大功能。

数据。采用Pile数据集的部分——PubMed Abstracts和PubMed Central。

计算。开发者选择在50B的令牌上多次训练PubMed GPT，达到一个较长的计算周期（300B）。结果表明，在数据受限的情况下仍可训练出优秀的LLM模型。

MosaicML云平台

MosaicML云。基于MosaicML云软件栈，开发者在具有128个NVIDIA A100-40GB GPU、节点间1600Gb/s网络带宽的集群上训练PubMed GPT，总训练时长约6.25天。

Composer库。由于MosaicML开源Composer库的高效性和包容性，开发者使用Composer库以及它的FSDP集成来训练模型。

流数据集。为快速、灵活且廉价地管理自定义训练数据集，开发者使用MosaicML的新StreamingDataset库来管理100GB多文本的训练数据集。

评估

开发者在几个问答基准上对PubMed GPT进行了评估。例如下面的一个医学问题摘要基准：

其对患者的疑问查询（其中会包含歧义、拼写错误等方面的信息）进行处理，并以清晰正确的格式呈现给医生。

同时开发者将结果与5个模型进行了比较（如上图）：DRAGON、GPT-Neo 2.7B、Galactica、BioLinkBERT、PubMedBERT。结果证明：

1、LLM非常全能，在特定领域中从头训练时其具有与专业设计的系统相当的性能；

2、针对特定领域数据的预训练胜过通用数据；

3、专注模型可以用较少的资源获得高质量结果。

总结

PubMed GPT的结果只是生物医学文本及其他领域研究的第一步，往后仍需要更多研究者来开发更加先进的成果。而且目前只是概念验证，最终的希望是在未来出现值得信赖的交互式AI系统，在与人类专家进行筛选的同时也促进可靠的交互。

参考资料

https://www.mosaicml.com/blog/introducing-pubmed-gpt

猜你喜欢

鲜为人知但很有用的 HTML 属性
在 Go 里用 CGO？这 7 个问题你要关注！
数据孤岛是业务效率的无声杀手
9款优秀的去中心化通讯软件 Matrix 的客户端
翻转再翻转！有意思的水平横向溢出滚动
发现 Linux SpaceFM 文件管理器的威力
图像处理工具Python扩展库，你了解吗？
求职数据分析，项目经验该怎么写
自定义计数器小技巧！CSS 实现长按点赞累加动画
在OKR中，我看到了数据驱动业务的未来
2023展望：新的一年将给大数据分析领域带来什么？
过五关！React高频面试题指南
阿里云ADB基于Hudi构建Lakehouse的实践
火山引擎云原生大数据在金融行业的实践
OpenHarmony富设备移植指南（二）—从postmarketOS获取移植资源
《数据成熟度指数》报告：64%的企业领袖认为大多数员工“不懂数据”
OpenHarmony 小型系统兼容性测试指南
肯睿中国（Cloudera）：2023年企业数字战略三大趋势预测
适用于 Linux 的十大命令行游戏
软件开发中的十个认知偏差

zl程序教程

当前栏目

PubMed GPT ：用于生物医学文本的特定领域大型语言模型

相关文章

当前栏目

PubMed GPT ： 用于生物医学文本的特定领域大型语言模型

相关文章

PubMed GPT ：用于生物医学文本的特定领域大型语言模型