PyTorch学习系列教程:何为Tensor?
导读本文继续PyTorch学习系列教程来介绍在深度学习中最为基础也最为关键的数据结构——Tensor。一方面Tensor之于PyTorch就好比是array之于Numpy或者DataFrame之于Pandas都是构建了整个框架中最为底层的数据结构另一方面Tensor又与普通的数据结构不同具有一个极为关键的特性——自动求导。今天本文就来介绍Tensor这一数据结构。作为Tensor的入门介绍篇本文主要探讨三大哲学问题何为TensorTensor如何创建Tensor有哪些特性01 何为Tensor什么是TensorTensor英文原义是张量在PyTorch官网中对其有如下介绍也就说一个Tensor是一个包含单一数据类型的高维矩阵简言之Tensor其实和Numpy里的array是一样的。那么高维矩阵几维算高维呢类似于深度学习多深的网络才算是深度的一般而言描述Tensor的高维特性通常用三维及以上的矩阵来描述例如下图所示单个元素叫标量scalar一个序列叫向量vector多个序列组成的平面叫矩阵matrix多个平面组成的立方体叫张量tensor。当然就像矩阵有一维矩阵和二维矩阵乃至多维矩阵一样张量也无需严格限制在三维以上才叫张量在深度学习的范畴内标量、向量和矩阵都统称为张量。熟悉机器学习的都知道有监督机器学习模型的标准输入通常是多个特征列组成的输入矩阵和单个特征列组成的标签向量多输出时标签也可以是二维矩阵用sklearn的约定规范就是训练数据集为X y其中大写X表示特征是一个二维的矩阵小写y表示标签是一个一维的向量。那么在深度学习领域中为何要约定高维数组——Tensor呢其实这是出于应用方向的实际需要以深度学习当前最成熟的两大应用方向莫过于CV和NLP两大领域前者面向图像和视频后者面向语音和文本二者分别以卷积神经网络和循环水神经网络为核心基础模块。而在这两个应用方向中标准的输入数据集都至少是三维以上例如图像数据集至少包含三个维度N×H×W即样本数×图像高×图像宽如果是彩色图像那么还要增加一个通道C变为N×C×H×W如果是视频图像那么可能还要再增加一个维度T文本数据集典型的输入包含三个维度N×L×H即样本数×序列长度×特征数源于这些应用的需要所以深度学习模型的输入数据结构一般都要3维以上这也就直接促使了Tensor的出现。更进一步的Tensor也不是PyTorch特有的定义而是众多深度学习框架广泛使用的数据结构例如TensorFlow更是形象的将Tensor加入了框架的命名之中。小结一下PyTorch中的Tensor是深度学习中广泛使用的数据结构本质上就是一个高维的矩阵甚至将其理解为NumPy中array的推广和升级也不为过。但由于其支持的一些特殊特性详见后文第3小节Tensor在用于支撑深度学习模型和训练时更为便利。02 如何创建Tensor前面介绍了何为Tensor那么接下来就需要了解如何创建Tensor。一般而言创建一个Tensor大体有三种方式从已有其他数据结构转化创建为Tensor随机初始化一个Tensor从已保存文件加载一个Tensor当然这大概也是一段计算机程序中所能创建数据的三种通用方式了比如基于NumPy创建一个Array其实大体也是这三种方式。下面依次予以介绍。1.从已有其他数据结构转化创建为Tensor这可能是实际应用中最常用的一种形式比如从一个列表、从一个NumPy的array中读取数据而后生成一个新的Tensor。为了实现这一目的常用的有两种方式torch.tensortorch.Tensor没错二者的区别就是前者用的是tensor函数t是小写后者用的是Tensor类T是大写。当然二者也有一些区别比如在创建Tensor的默认数据类型、支持传参以及个别细节的处理方面。举个例子首先是创建的Tensor默认数据类型不同其次应用Tensor类初始化输入一个整数将返回一个以此为长度的全零一维张量而tensor函数则返回一个只有该元素的零维张量当然上述有一个细节需要优先提及应用Tensor类接收一个序列创建Tensor时返回的数据类型为float型这是因为Tensor是FloatTensor的等价形式即除此之外还有ByteTensorIntTensorLongTensor以及DoubleTensor等不同的默认数据类型。基于已有数据创建Tensor还有两个常用函数from_numpyas_tensor二者与上述方法最大的不同在于它们返回的Tensor与原有数据是共享内存的而前述的tensor函数和Tensor类则是copy后创建一个新的对象。举个例子来说2.随机初始化一个Tensor随机初始化也是一种常用的形式比如在搭建一个神经网络模型中其实在添加了一个模块的背后也自动随机初始化了该模块的权重。整体而言这类方法大体分为两种形式torch.xxxx创建一个特定类型的tensor例如torch.onestorch.randn等等torch.xxx_liek即根据一个已有Tensor创建一个与其形状一致的特定类型tensor例如torch.ones_liketorch.randn_like等等例如随机构建一个PyTorch中的全连接单元Linear其会默认创建相应的权重系数和偏置注意由于网络参数一般是需要参与待后续的模型训练所以默认requires_gradTrue整体来看这两类方法与NumPy中的相应方法特性几乎一致基本可以从函数名中get到其相应的含义这里也不再展开。3.从已保存文件加载一个Tensor文件作为交互数据的常用形式PyTorch中自然也不会缺席。实际上PyTorch不会刻意区分要保存和加载的对象是何种形式可以是训练好的网络也可以是数据这在Python中就是pickle。实现这一对互逆功能的函数是torch.save和torch.load。另外值得指出的是保存后的文件没有明确的后缀格式要求常用的后缀格式有三种.pkl.pth.pt举个例子小结一下PyTorch中创建一个Tensor大体可分为三种方法即1从一个已有数据结构转换为Tensor2随机初始化生成一个Tensor3将已保存的文件加载为Tensor。其中第一种方法主要用于构建训练数据集第二种方法隐藏于网络模块参数的初始化而第三种方法则可用于大型数据集的保存和跨环境使用。03 Tensor的特性PyTorch之所以定义了Tensor来支持深度学习而没有直接使用Python中的一个list或者NumPy中的array终究是因为Tensor被赋予了一些独有的特性。这里我也将Tensor的特性概括为三个方面丰富的常用操作函数灵活的dtype和CPU/GPU自由切换存储自动梯度求解下面分别予以介绍。1.丰富的常用函数操作Tensor本质上是一个由数值型元素组成的高维矩阵而深度学习的过程其实也就是各种矩阵运算的过程所以Tensor作为其基础数据结构自然也就需要支持丰富的函数操作。构建一个Tensor实例通过Python中的dir属性获取tensor实例支持的所有API过滤以_开头的系统内置方法外例如str这种剩余结果仍有567种其支持的函数操作之丰富程度可见一斑。这些函数有的是对自身进行操作例如tensor.max(), tensor.abs()等等有的是用于与其他tensor进行相关操作例如tensor.add()用于与另一个tensor相加tensor.mm()用于与另一个tensor进行矩阵乘法等等。当然这里的相加和相乘对操作的两个tensor尺寸有所要求。除了支持的函数操作足够丰富外tensor的API函数还有另一个重要的便利特性绝大多数函数都支持两个版本带下划线版和不带下划线版例如tensor.abs()和tensor.abs_()二者均返回操作后的Tensor但同时带下划线版本属于inplace操作即调用后自身数据也随之改变。inplace版函数共有159种2.灵活的dtype和CPU/GPU自由切换前面在介绍Tensor的创建时已提到了dtype的概念其类似于NumPy和Pandas中的用法用于指定待创建Tensor的数据结构。PyTorch中定义了10种不同的数据结构包括不同长度的整型、不同长度的浮点型整个Tesor的所有元素必须数据类型相同且必须是数值类型NumPy中的array也要求数组中的元素是同质的但支持字符串类型的Tensor中的10种数据类型不完整版除了支持不同的数值数据类型外Tensor的另一大特色是其支持不同的计算单元CPU或GPU支持GPU加速也是深度学习得以大规模应用的一大关键。为了切换CPU计算数据存储于内存或GPU计算数据存储于显存Tensor支持灵活的设置存储设备包括如下两种方式创建tensor时通过device参数直接指定通过tensor.to()函数切换to()既可用于切换存储设备也可切换数据类型当然能够切换到GPU的一大前提是运行环境带有独立显卡并已配置CUDA……此外除了dtype和device这两大特性之外其实Tensor还有第三个特性即layout布局。主要包括strided和sparse_coo两种该特性一般不需要额外考虑。3.自动梯度求解如果说支持丰富和函数操作和灵活的特性那么Tensor还不足以支撑深度学习的基石关键是还需要自动梯度求解。深度学习模型的核心是在于神经元的连接而神经元之间连接的关键在于网络权重也就是各个模块的参数。正因为网络参数的不同所以才使得相同的网络结构能实现不同的模型应用价值。那么如何学习最优网络参数呢这就是深度学习中的的优化利器梯度下降法而梯度下降法的一大前提就是支持自动梯度求解。简言之Tensor为了支持自动梯度求解大体流程如下Tensor支持grad求解即requires_gradTrue根据Tensor参与计算的流程将Tensor及相应的操作函数记录为一个树结构或称之为有向无环图DAG计算的方向为从叶节点流向根节点根据根节点Tensor与目标值计算相应的差值loss然后利用链式求导法则反向逐步计算梯度也即梯度的反向传播Tensor中的自动梯度求导有很多细节值得展开这里仅稍加介绍并留待后续单独推文加以分享。小结一下Tensor具有很多特性这使得其可以支撑深度学习的复杂操作个人认为比较重要的包括三个方面即1丰富的操作函数2三大特性dtype、device和layout以及3自动梯度求导。04 小结本文从何为Tensor—如何构建Tensor—Tensor有何特性三个方面入手简要介绍了PyTorch中的核心数据结构——Tensor。理解并熟练运用Tensor的常用操作是深度学习的基石就像站在岸上学不会游泳一样学习Tensor的重点在于实践毕竟“无他唯手熟尔”如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线互联网企业工作十余年里指导过不少同行后辈。帮助很多人得到了学习和成长。我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限很多互联网行业朋友无法获得正确的资料得到学习提升故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。第一阶段10天初阶应用该阶段让大家对大模型 AI有一个最前沿的认识对大模型 AI 的理解超过 95% 的人可以在相关讨论时发表高级、不跟风、又接地气的见解别人只会和 AI 聊天而你能调教 AI并能用代码将大模型和业务衔接。大模型 AI 能干什么大模型是怎样获得「智能」的用好 AI 的核心心法大模型应用业务架构大模型应用技术架构代码示例向 GPT-3.5 灌入新知识提示工程的意义和核心思想Prompt 典型构成指令调优方法论思维链和思维树Prompt 攻击和防范…第二阶段30天高阶应用该阶段我们正式进入大模型 AI 进阶实战学习学会构造私有知识库扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架抓住最新的技术进展适合 Python 和 JavaScript 程序员。为什么要做 RAG搭建一个简单的 ChatPDF检索的基础概念什么是向量表示Embeddings向量数据库与向量检索基于向量检索的 RAG搭建 RAG 系统的扩展知识混合检索与 RAG-Fusion 简介向量模型本地部署…第三阶段30天模型训练恭喜你如果学到这里你基本可以找到一份大模型 AI相关的工作自己也能训练 GPT 了通过微调训练自己的垂直大模型能独立训练开源多模态大模型掌握更多技术方案。到此为止大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗为什么要做 RAG什么是模型什么是模型训练求解器 损失函数简介小实验2手写一个简单的神经网络并训练它什么是训练/预训练/微调/轻量化微调Transformer结构简介轻量化微调实验数据集的构建…第四阶段20天商业闭环对全球大模型从性能、吞吐量、成本等方面有一定的认知可以在云端和本地等多种环境下部署大模型找到适合自己的项目/创业方向做一名被 AI 武装的产品经理。硬件选型带你了解全球大模型使用国产大模型服务搭建 OpenAI 代理热身基于阿里云 PAI 部署 Stable Diffusion在本地计算机运行大模型大模型的私有化部署基于 vLLM 部署大模型案例如何优雅地在阿里云私有部署开源大模型部署一套开源 LLM 项目内容安全互联网信息服务算法备案…学习是一个过程只要学习就会有挑战。天道酬勤你越努力就会成为越优秀的自己。如果你能在15天内完成所有的任务那你堪称天才。然而如果你能完成 60-70% 的内容你就已经开始具备成为一名大模型 AI 的正确特征了。领取方式我会放在下面希望领取了的朋友不要忘了下方名片放心添加
