c++ float32 与 float16 互转

爱学习的小道长

已于 2023-04-15 13:38:10 修改

阅读量3.7k

点赞数 1

分类专栏： c/c++ 文章标签： c++

于 2023-04-15 12:01:59 首次发布

本文链接：https://blog.csdn.net/weixin_40378209/article/details/130167354

版权

c/c++ 专栏收录该内容

54 篇文章 3 订阅

订阅专栏

背景：

最近用到一块推理加速卡时，推理输入的数据是 float16 类型，而我们平常用到的数据是 float 类型，也就是 float32类型，这需要输入数据时float32 转 float16，解析输出数据时 float16 转 float。

参考：

正文：
方式一：
CPU平台：ARM
操作系统：Ubuntu 20.04
CMakeLists.txt

cmake_minimum_required(VERSION 3.10)
project(cpp)

set(CMAKE_CXX_STANDARD 14)
set(CMAKE_SYSTEM_NAME Linux)

SET(CMAKE_CXX_FLAGS_DEBUG "$ENV{CXXFLAGS} -O0 -Wall -g2 -ggdb -Wno-dev")
SET(CMAKE_BUILD_TYPE "Release")
#add_compile_options(-W)

add_executable(test_arm test_arm.cpp)

test_arm.cpp

#include <iostream>
#include <arm_neon.h>

int main()
{
    // float32 -->> float16
    float f32 = 3.14159265358979323846f;
    unsigned short f16;
   
    float32x4_t tmp = vld1q_dup_f32(&f32);
    float16_t res = vget_lane_f16(vcvt_f16_f32(tmp), 0);
    f16 = *reinterpret_cast<uint16_t*>(&res);
    std::cout << f32 << std::endl;
    std::cout << f16 << std::endl;
    
    // float16 -->> float32
    float f321;
    float16_t tmp1 = *reinterpret_cast<float16_t*>(&f16);
    float32x4_t res1 = vcvt_f32_f16(vld1_dup_f16(&tmp1));
    vst1q_lane_f32(&f321, res1, 0);
    std::cout << f321 << std::endl;
    
    return 0;
}

打印结果：

3.14159
16968
3.14062

上面 float32 -->> float16 代码中，通过 vld1q_dup_f32 函数将 f32 中的值复制到一个四元素向量 tmp 中。然后使用 vcvt_f16_f32 函数将 tmp 中的值转换为一个16位浮点数，并使用 vget_lane_f16 函数从该浮点数中取出第 0 个元素作为结果。最后，它使用 reinterpret_cast 将结果转换为一个16位无符号短整型，并将其存储到 f16 中。

float16 -->> float32代码中，使用 reinterpret_cast 将 f16 转换为一个16位浮点数变量tmp。接着，使用 vld1_dup_f16 函数将 tmp 中的值装载到一个四元素向量中，并使用vcvt_f32_f16 函数将该向量中的16位浮点数值转换为32位浮点数。最后，使用vst1q_lane_f32将结果写回 f321 变量。