Перетасовка каналов / полос для SSE и AVX?
Какие инструкции SSE/AVX перетасовывают полосы из a
в b
и c
?
float4 a = {data[0], data[1], data[2], data[3]};
float4 b = {data[1], data[2], data[3], data[0]}; // lanes shifted left
float4 c = {data[3], data[0], data[1], data[2]}; // lanes shifted right
float8 a = {data[0], data[1], data[2], data[3],
data[4], data[5], data[6], data[7]};
float8 b = {data[1], data[2], data[3], data[4],
data[5], data[6], data[7], data[0]}; // lanes shifted left
float8 c = {data[7], data[0], data[1], data[2],
data[3], data[4], data[5], data[6]}; // lanes shifted right
Предыстория:
У меня есть алгоритм, который требует значений из соседних точек; это означает, что в настоящее время я смешиваю выровненные нагрузки и несогласованные нагрузки:
(
plate[row + 1][column] // aligned
+ plate[row - 1][column] // aligned
+ plate[row][column + 1] // unaligned
+ plate[row][column - 1] // unaligned
+ (4 * plate[row][column]) // aligned
) / 8;
Вот он в SSE:
__m128 bottom = _mm_load_ps(&from[row-1][column]);
__m128 left = _mm_loadu_ps(&from[row][column-1]);
__m128 middle = _mm_load_ps(&from[row][column]);
__m128 right = _mm_loadu_ps(&from[row][column+1]);
__m128 top = _mm_load_ps&from[row+1][column]);
(top + bottom + left + right + _mm_set1_ps(4.0f) * middle) * _mm_set1_ps(0.125f);
Я понял, что значения в current и либо left, либо right отличаются только на одно значение. Поэтому у меня возникла идея, что вместо того, чтобы делать 2 не выровненные нагрузки, я мог бы, возможно, перетасовать полосы, а затем вставить одно значение, которое отличается. Мне нужно проверить задержку / пропускную способность по инструкциям, чтобы увидеть, будет ли это быстрее, но я не знаком ни с одним из этих видов инструкций SSE/AVX.1 ответ:
На последних процессорах Intel (Core i7 и др.) рассогласованная нагрузка является разумным подходом, но на более старых процессорах это относительно дорого. Альтернативный подход заключается в использовании
_mm_alignr_epi8
(PALIGNR
) - Обычно вы выполняете итерацию вдоль строки и поддерживаете 3 последовательных вектора - после каждой итерации вы перетасовываете эти векторы вдоль одного, а затем загружаете новый вектор, поэтому есть только одна нагрузка на итерацию.__m128 va = _mm_setzero_ps(); __m128 vb = _mm_load_ps(&from[row][0]); for (col = 0; col < N; col += 4) { __m128 vc = _mm_load_ps(&from[row][col + 4]); __m128 centre = vb; __m128 left = (__m128)_mm_alignr_epi8((__m128i)va, (__m128i)vb, sizeof(float)); __m128 right = (__m128)_mm_alignr_epi8((__m128i)vb, (__m128i)vc, 3 * sizeof(float)); // do stuff ... va = vb; // shuffle vectors along vb = vc; }
AVX немного сложнее из - за ограничений 128-битных полос-возможно, Вам будет лучше придерживаться с несогласованными нагрузками.