Question

您如何使用__m256d？

假设我想在一个简单的Vector3类上使用英特尔AVX指令_mm256_add_pd，其中包含3-64位double精度分量x，y ，和z）。使用它的正确方法是什么？

由于x，y和z是Vector3类的成员，_我可以在union中声明它们一个__m256d变量？

union Vector3
{
  struct { double x,y,z ; } ;
  __m256d _register ;  // the Intel register?
} ;

然后我可以去：

Vector3 add( const Vector3& o )
{
  Vector3 result;
  result._register = _mm256_add_pd( _register, o._register ) ; // add 'em
  return result; 
}

这会起作用吗？或者我是否需要宣布临时，

Vector3 add( const Vector3& o )
{
  __m256d d1 = *(__m256d*)(&x) ; // ? Cast to __m256d?
  __m256d d2 = *(__m256d*)(&o.x) ; // ? Cast to __m256d?
  __m256d result = _mm256_add_pd( d1, d2 ) ; // add 'em
  return Vector3( result ) ; // make a ctor that accepts __m256d?
}

修改

我想出了这个例子，

#include <stdio.h>
#include <intrin.h>

int main()
{
  __m256d a, b, res;

  for( int i = 0; i < sizeof(__m256d)/sizeof(double); i++ )
  {
    a.m256d_f64[i] = i ;
    b.m256d_f64[i] = 2*i ;
  }

  // Perform __4__ adds.
  res = _mm256_add_pd(a, b);

  for( int i = 0; i < sizeof(__m256d)/sizeof(double); i++ )
  {
    printf("%f + %f = %f\n", a.m256d_f64[i], b.m256d_f64[i], res.m256d_f64[i]);
  }
  puts("");
}

我想现在的问题是， _mm256_add_pd 不要将我的__m256d寄存器声明为靠近使用它们的位置？（我害怕hotel room / deskdrawer类型的问题）

编辑2：

我尝试在我相当大的项目中添加__m256注册表，我得到了一大堆

错误C2719：'value'：带__declspec的形式参数（align（'32'））将不会对齐

错误，它让我相信你不能将__m256个寄存器保留在一个类中，而应该将它们声明为本地人？

Answer 1

首先，我想澄清一点混乱。 __m256d不是一种寄存器，它是可以加载到AVX寄存器中的数据类型。 __m256d不再是寄存器，而int是寄存器。有几种方法可以将数据输入和输出__m256d（或任何其他矢量类型）：

使用union：是的，union技巧有效。它工作得很好，因为联合通常会有正确的对齐方式（虽然malloc可能没有，但使用posix_memalign或_aligned_malloc）。

class Vector3 {
public:
    Vector3(double xx, double yy, double zz);
    Vector3(__m256d vvec);


    Vector3 operator+(const Vector3 &other) const
    {
        return Vector3(_mm256_add_pd(vec, other.vec));
    }

    union {
        struct {
            double x, y, z;
        };
        __m256d vec; // a data field, maybe a register, maybe not
    };
};

使用内在函数：在函数内部，通常使用内在函数更容易将数据输入和输出矢量类型。

__m256d vec = ...;
double x, y, z;
vec = _mm256_add_pd(vec, _mm256_set_pd(x, y, z, 0.0));

使用指针强制转换：由于以下几个原因，强制转换指针是最后的选择。

指针可能未正确对齐。
投射指针有时会影响编译器的别名分析。
指针式转换绕过了许多安全保障。

所以我只使用指针转换来浏览大量数据。

使用__m256d寄存器

修改

编辑2：

1 个答案: