arcsin2's blog
  • 首页
  • 归档
  • 分类
  • 标签
  • 关于
  • 友链
  • English

LLM Systems Assignment 3: Transformer Architecture

本次 homework 的任务是实现 Decoder-only 的 Transformer 模型,也就是 GPT-2,并在一个翻译任务数据集上进行模型训练。具体来说,包括以下几个子任务: 实现 CrossEntropy Loss 实现基础模块,包括 Linear/Dropout/LayerNorm1d/Embedding 实现 Transformer,包括:MultiHeadAtte
2026-10-05
ML System
#CMU 11868 #LLM System #GPT #Transformer #minitorch

LLM Systems Assignment 2: Minitorch Framework

本次 homework 需要编写的代码量实际上非常少(100 行左右),完成作业的关键是理解 minitorch 设计和已有代码。因此,本文主要介绍 minitorch 代码结构,解释其 Tensor、Parameter、Operator、Module、History 等关键设计和实现。 课程官方对 minitorch 有个 Jupyter Notebook 做了详细介绍可参考。本文
2026-10-05
ML System
#CMU 11868 #LLM System #minitorch

LLaMA: Open and Efficient Foundation Language Models

LLaMA: Open and Efficient Foundation Language Models arXiv 提交日期:27 Feb 2023(ChatGPT 发布后约 3 个月) GitHub 链接:https://github.com/meta-llama/llama 作者: 摘要: 我们提出了 LLaMA,一组从 7B 到 65B 参数的基础语言模型。我们
2026-10-05
ML System
#CMU 11868 #LLM System #LLaMA

GPT-3: Language Models are Few-Shot Learners

Language Models are Few-Shot Learners arXiv 提交日期:28 May 2020 OpenAI blog:Language models are few-shot learners 作者: 摘要: 近期工作表明,通过在大规模文本语料上预训练,再针对特定任务进行微调,可以在许多 NLP 任务和基准上取得显著提升。虽然这种方法在架
2026-10-05
ML System
#CMU 11868 #LLM System #GPT

GPT-2: Language Models are Unsupervised Multitask Learners

Language Models are Unsupervised Multitask Learners OpenAI Technical Report,blog 链接:Better language models and their implications ,发布日期:February 14, 2019 官方 GitHub repo(TF 实现):gpt-2 ,仅公布了小模型权重
2026-10-05
ML System
#CMU 11868 #LLM System #GPT

GPT-1: Improving Language Understanding by Generative Pre-Training

Improving Language Understanding by Generative Pre-Training OpenAI Technical Report,blog 链接:Improving language understanding with unsupervised learning ,发布日期:June 11, 2018(Transformer paper 发布后的
2026-10-05
ML System
#CMU 11868 #LLM System #GPT

The Annotated Transformer

The Annotated Transformer code 本文仅摘录原始 blog 部分代码并添加部分注释,不涉及原文全部内容,推荐阅读原文。 Model Architecture 1234567891011121314151617181920212223class EncoderDecoder(nn.Module): """
2026-10-05
ML System
#CMU 11868 #LLM System #Transformer

Transformer: Attention Is All You Need

Attention Is All You Need 发表于 NIPS 2017(arXiv 提交日期:12 Jun 2017) 作者: Abstract 主流的序列转换模型基于复杂的循环或卷积神经网络,这些网络包含一个编码器和一个解码器。性能最佳的模型还通过注意力机制连接编码器和解码器。我们提出了一种新的简单网络架构——Transformer,它完全基于注意力机制,彻底摒弃
2026-10-05
ML System
#CMU 11868 #LLM System #Transformer

TensorFlow: A system for large-scale machine learning

TensorFlow: A system for large-scale machine learning OSDI 2016 paper link 阅读该 paper 主要要了解: TensorFlow 诞生背景 DistBelief 存在的问题 设计原则 关键概念&实现(TensorFlow execution model) 如何支持大规模训练(E
2026-10-05
ML System
#CMU 11868 #LLM System #TensorFlow

LLM Systems 07: Pre-trained LLMs

0. Recap Sequence-to-sequence encoder-decoder framework for conditional generation, including Machine Translation Key components in Transformer Positional Embedding (to distinguish tokens at d
2026-10-05
ML System
#CMU 11868 #LLM System #Transformer
123…8

搜索

Hexo Fluid
总访问量 次 总访客数 人
苏ICP备2021026429号-1