Developer knowledge network · moderated exchange

Zajednica UnreliableCode

Zajednica za istraživanje, obrnuti inženjering i programiranje programera

Knowledge indexŽivjeti
4Categories
919Threads
2.8KPostovi
Analysis

AVX-512 vs AVX2 Pattern Scanning: benchmarks & cache line alignment

sig_scanner_sam
Pattern Master
MEMBER
Rep: 210
Datum pridruživanja: Dec 2019
Postovi: 11
Hvala: 51
prije 1 mjeseci · Jul 10, 2026 7:11 PM
#1

Benchmarking 512-bit vector scanning (_mm512_cmpeq_epi8_mask) on Zen 4 / Intel 14th Gen vs 256-bit AVX2:

  • AVX2: Scans 32 bytes per iteration (~4.8 GB/s).
  • AVX-512: Scans 64 bytes per iteration (~9.2 GB/s).
CPP
#include <immintrin.h>
uintptr_t ScanAVX512(const uint8_t* pBase, size_t sz, uint8_t firstByte) {
    __m512i target = _mm512_set1_epi8(firstByte);
    for (size_t i = 0; i < sz - 64; i += 64) {
        __m512i chunk = _mm512_loadu_si512((const __m512i*)(pBase + i));
        __mmask64 mask = _mm512_cmpeq_epi8_mask(chunk, target);
        if (mask != 0) {
            // Match candidate...
        }
    }
    return 0;
}

Scans a 400MB game binary in 43 milliseconds!

ptr_arithmetic
C++ Wizard
MEMBER
Rep: 162
Datum pridruživanja: May 2018
Postovi: 73
Hvala: 42
prije 1 mjeseci · Jul 10, 2026 8:22 PM
#2

_mm512_cmpeq_epi8_mask returning a native 64-bit bitmask directly into __mmask64 register avoids the vpmovmskb instruction completely. Huge speedup.

x64_assembler
Assembly Guru
MEMBER
Rep: 99
Datum pridruživanja: Sep 2022
Postovi: 14
Hvala: 16
prije 1 mjeseci · Jul 11, 2026 4:32 AM
#3

Impressive throughput. Make sure to check CPUID for AVX-512 support before invoking.