聊聊GLM-4-9B开源模型的微调loss计算

概述

Github官方地址：GLM-4

网上已经有很多关于微调的文章，介绍各种方式下的使用，这里不会赘述。我个人比较关心的是微调时的loss计算逻辑，这点在很多的文章都不会有相关的描述，因为大多数人都是关心如何使用之类的应用层，而不是其具体的底层逻辑，当然咱也说不清太底层的计算。

可了解其它loss计算的文章：

再聊多轮对话微调训练格式与长序列训练

 聊聊ChatGLM2与ChatGLM3微调多轮对话的设计逻辑及源码分析

 聊聊大模型多轮对话的训练及优化

微调

微调格式：

[

  {

    "messages": [

      {

        "role": "system",

        "content": "<system prompt text>",

        "tools": [

          {

            "name": "<tool name>",

            "args": {

              "<arg name>": "<arg value>"

            }

          }

        ]

      },

      {

        "role": "user",

        "content": "<user prompt text>"

      },

      {

        "role": "assistant",

        "content": "<assistant response text>"

      },

      {

        "role": "user",

        "content": "<user prompt text>"

      },

      {

        "role": "assistant",

        "content": "<assistant response text>"

      },

      {

        "role": "observation",

        "content": "<observation prompt text>"

      },

      {

        "role": "assistant",

        "content": "<assistant response observation>"

      },

      {

        "role": "user",

        "content": "<user prompt text>"

      },

      {

        "role": "assistant",

        "content": "<assistant response text>"

      }

    ]

  }

]

微调源码地址：finetune.py

Loss计算代码：

def process_batch(

        batch: Mapping[str, Sequence],

        tokenizer: PreTrainedTokenizer,

        max_input_length: int,

        max_output_length: int,

) -> dict[str, list]:

    batched_conv = batch['messages']

    batched_input_ids = []

    batched_labels = []

    # batched_conv 是一个数组

    # conv 是数组内的单个 message

    for conv in batched_conv:

        input_ids = [151331, 151333]

        loss_masks = [False, False]

        # conv 是数组内的单个 message

        # message 是 单个role json对象

        for message in conv:

            message = process_message(message)

            # 设置 mask 掩码，只有system,user,observation不参与mask计算，其余的角色参与计算

            loss_mask_val = False if message['role'] in ('system', 'user', 'observation') else True

            # 获取 input 文本的数字表示(ids)

            new_input_ids = tokenizer.apply_chat_template([message], tokenize=True, return_dict=False)[0][2:]

            # 计算整句的 mask

            new_loss_masks = [loss_mask_val] * len(new_input_ids)

            # 拼接message中的每段json

            input_ids += new_input_ids

            # 拼接message中每段json对应的mask

            loss_masks += new_loss_masks

        # 追加结尾的 token id

        input_ids.append(tokenizer.eos_token_id)

        loss_masks = [False, *loss_masks]

        labels = []

        for input_id, mask in zip(input_ids, loss_masks):

            if mask:

                # 添加到label,计算loss

                labels.append(input_id)

            else:

                # -100 不处理，即ignore_index

                labels.append(-100)

        max_length = max_input_length + max_output_length + 1

        # 截断

        batched_input_ids.append(input_ids[:max_length])

        batched_labels.append(labels[:max_length])

    return {'input_ids': batched_input_ids, 'labels': batched_labels}

注释在代码中已经写明。process_batch方法用于将输入转换为ids，并计算mask（用于Loss计算）。而该方法的调用是在数据集的遍历处理中，即如下所示：

tokenizer, model = load_tokenizer_and_model(model_dir, peft_config=ft_config.peft_config)

data_manager = DataManager(data_dir, ft_config.data_config)

# 数据集拆分遍历

train_dataset = data_manager.get_dataset(

    Split.TRAIN,

    functools.partial(

        process_batch,

        tokenizer=tokenizer,

        max_input_length=ft_config.max_input_length,

        max_output_length=ft_config.max_output_length,

    ),

    batched=True,

)

print('train_dataset:', train_dataset)

Loss计算如下图所示：

总结

相比较于之前的ChatGLM版本，GLM4开源版本的多轮对话loss计算更恰当且效率也会更高；在其它的开源模型/微调框架中早已支持该种loss计算，如InternLM、XTuner、Firefly等。对于loss格式的类别，可参考XTuner的官方文档说明：dataset_format.md。

更多大模型相关的文章，请上个人公众号查阅：

聊聊GLM-4-9B开源模型的微调loss计算的更多相关文章

GoogLeNet模型的微调
我从零开始训练了GoogLeNet模型. 但它没有给我带来希望的结果. 作为替代,我想对我的数据集中的GoogLeNet模型进行微调. 有谁知道我应该遵循什么步骤? 采纳答案: 假设你正在尝试做图像分 ...
R语言广义线性模型(GLM)、全子集回归模型选择、检验分析全国风向气候数据|附代码数据
全文链接:http://tecdat.cn/?p=30914 最近我们被客户要求撰写关于广义线性模型(GLM)的研究报告,包括一些图形和统计输出. 我们正和一位朋友讨论如何在R软件中用GLM模型处理全 ...
从开源模型、框架到自研，声网 Web 端虚拟背景算法正式发布
根据研究发现,在平均 38 分钟的视频会议里面,大概会有 13 分钟左右的时间用于处理和干扰相关的事情.同时研究也表明在参加在线会议的时候,人们更加倾向于语音会议,其中一个关键原因就是大家不希望个人隐 ...
[深度学习] 经典深度学习模型及其微调（Caffe）总结
目录经典模型 Caffe预训练模型经典模型 LeNet https://blog.csdn.net/kaido0/article/details/53161684 AlexNet https:// ...
LSF-SCNN：一种基于 CNN 的短文本表达模型及相似度计算的全新优化模型
欢迎大家前往腾讯云社区,获取更多腾讯海量技术实践干货哦~ 本篇文章是我在读期间,对自然语言处理中的文本相似度问题研究取得的一点小成果.如果你对自然语言处理 (natural language proc ...
[Pytorch]深度模型的显存计算以及优化
原文链接:https://oldpan.me/archives/how-to-calculate-gpu-memory 前言亲,显存炸了,你的显卡快冒烟了! torch.FatalError: cu ...
聊聊GIS中的坐标系|再版详细定义、计算及高程系统
本篇讲坐标系统的详细定义,有关坐标系的变换公式,以及简单说说高程坐标系统. 本文约6000字,阅读时间建议45分钟.硬内容比较多,如有疏漏错误请指出,建议有兴趣的朋友进一步阅读. 作者:博客园/B站/ ...
css盒模型宽高混合计算calc
例如: .element{ width:calc(expression); } 兼容性:在IE9+.FF4.0+.Chrome19+.Safari6+都得到了较好支持,但是在移动端的支持不是很好. 其 ...
DL开源框架Caffe | 模型微调（finetune）的场景、问题、技巧以及解决方案
转自:http://blog.csdn.net/u010402786/article/details/70141261 前言什么是模型的微调? 使用别人训练好的网络模型进行训练,前提是必须和别人 ...
聊聊同步、异步、阻塞、非阻塞以及IO模型
前言在使用Netty改造手写RPC框架的时候,需要给大家介绍一些相关的知识,这样很多东西大家就可以看明白了,手写RPC是一个支线任务,后续重点仍然是Kubernetes相关内容. 阻塞与非阻塞同步 ...

随机推荐

BizWorks助力企业应用的高效开发与复用
简介: BizWorks作为企业级云原生应用数字工作台,能很好地支撑企业数字中台建设.云原生应用开发.企业资产运营管理等场景.本文不会全面介绍BizWorks平台的能力,而是着重介绍BizWorks在 ...
SQL 开发任务超 50% ！滴滴实时计算的演进与优化
摘要:Apache Flink 是一个分布式大数据处理引擎,可对有限数据流和无限数据流进行有状态计算.可部署在各种集群环境,对各种大小的数据规模进行快速计算.滴滴基于 Apache Flink 做了大 ...
技术干货｜阿里云数据库PostgreSQL 13大版本揭秘
简介: 阿里云RDS PostgreSQL是一款兼容开源PostgreSQL的全托管云数据库产品,自2015年首次发布以来,根据用户需求不断升级迭代,已支持9.4.10.11.12等多个版本,覆盖了高 ...
使用友盟+的APM服务实现对移动端APP的性能监控
简介: 对于信息系统服务,一般我们的重点监控对象都是核心的后端服务,通常会采用一些主流的APM(Application Performance Management)框架进行监控.告警.分析.那么对 ...
实时数仓入门训练营：实时计算 Flink 版 SQL 实践
简介: <实时数仓入门训练营>由阿里云研究员王峰.阿里云资深技术专家金晓军.阿里云高级产品专家刘一鸣等实时计算 Flink 版和 Hologres 的多名技术/产品一线专家齐上阵,合力搭 ...
[Py] Python 接口数据用 pandas 高效写入 csv
通过 pandas 把 dict 数据封装,调用接口方法写入 csv 文件. import pandas as pd data = [{"name": "a"} ...
dotnet 推荐 LightWorkFlowManager 轻量的工作过程管理库
本文将和大家推荐我团队开源的 LightWorkFlowManager 轻量的工作过程管理库,适合任何需要执行工作过程的应用逻辑,可以方便将多个工作过程拼凑起来,且自动集成重试和失败处理,以及日志和上 ...
使用 Uno Islands 在现有 WPF 里面嵌入 Uno 框架
随着 2022 9 月份 Uno 发布了 4.5 版本,现有的 WPF 应用多了一个新的开发模式,那就是通过 Uno Islands 技术,在现有的 WPF 应用里面嵌入 Uno 应用.通过此方式可以 ...
vue-公共组件的注册
注册公共组件,在每个需要的页面直接输入文件名(<g-table/>)即可引用该组件步骤: 1.新建components/global文件夹,以及components/global/g-t ...
Competition Set - AtCoder I
这里记录的是这个账号的比赛情况. ARC172 2024-2-18 Solved:4/6 D(Hard-,2936) 给定所有数对 \((i,j),1\le i\lt j\le n\) 的一个排列 \ ...

聊聊GLM-4-9B开源模型的微调loss计算

概述

微调

总结

聊聊GLM-4-9B开源模型的微调loss计算的更多相关文章

随机推荐

热门专题