Developer knowledge network · moderated exchange

UnreliableCode қауымдастығы

Әзірлеушілерді зерттеу, кері инженерия және кодтау қауымдастығы

Knowledge indexТірі
4Categories
919Threads
2.8KЖазбалар
Analysis

AVX-512 vs AVX2 Pattern Scanning: benchmarks & cache line alignment

sig_scanner_sam
Pattern Master
MEMBER
Өкіл: 210
Қосылу күні: Dec 2019
Хабарламалар: 11
Рахмет: 51
1 ай бұрын · Jul 10, 2026 7:11 PM
#1

Benchmarking 512-bit vector scanning (_mm512_cmpeq_epi8_mask) on Zen 4 / Intel 14th Gen vs 256-bit AVX2:

  • AVX2: Scans 32 bytes per iteration (~4.8 GB/s).
  • AVX-512: Scans 64 bytes per iteration (~9.2 GB/s).
CPP
#include <immintrin.h>
uintptr_t ScanAVX512(const uint8_t* pBase, size_t sz, uint8_t firstByte) {
    __m512i target = _mm512_set1_epi8(firstByte);
    for (size_t i = 0; i < sz - 64; i += 64) {
        __m512i chunk = _mm512_loadu_si512((const __m512i*)(pBase + i));
        __mmask64 mask = _mm512_cmpeq_epi8_mask(chunk, target);
        if (mask != 0) {
            // Match candidate...
        }
    }
    return 0;
}

Scans a 400MB game binary in 43 milliseconds!

ptr_arithmetic
C++ Wizard
MEMBER
Өкіл: 162
Қосылу күні: May 2018
Хабарламалар: 73
Рахмет: 42
1 ай бұрын · Jul 10, 2026 8:22 PM
#2

_mm512_cmpeq_epi8_mask returning a native 64-bit bitmask directly into __mmask64 register avoids the vpmovmskb instruction completely. Huge speedup.

x64_assembler
Assembly Guru
MEMBER
Өкіл: 99
Қосылу күні: Sep 2022
Хабарламалар: 14
Рахмет: 16
1 ай бұрын · Jul 11, 2026 4:32 AM
#3

Impressive throughput. Make sure to check CPUID for AVX-512 support before invoking.