目录
Word meaning depends on context
Transforming word vectors into word predictions
Can I have your attention please
Feed-forward networks reason with vector math
The attention and feed-forward layers have different jobs
How language models are trained
The surprising performance of GPT-3
前言
2017年是机器学习领域历史性的一年。Google Brain 团队的研究人员推出了 Transformer,它的性能迅速超越了大多数现有的深度学习方法。著名的注意力机制成为未来 Transformer 衍生模型的关键组成部分。Transformer 架构的惊人之处在于其巨大的灵活性:它可以有效地用于各种机器学习任务类型,包括 NLP、图像和视频处理问题。
在过去的几年里,人工智能(AI)领域取得了显著的进展,特别是在大型模型的应用方面。这些大型模型,如OpenAI的GPT-3和谷歌的BERT,已经在各种任务中展示了令人瞩目的性能。