[llvm] [X86] madd.ll - add SSE42 test coverage (PR #205299)

Simon Pilgrim via llvm-commits llvm-commits at lists.llvm.org
Tue Jun 23 01:58:07 PDT 2026


https://github.com/RKSimon updated https://github.com/llvm/llvm-project/pull/205299

>From 993fb2f9687367b67a046bcc38ee4e4f726bd13a Mon Sep 17 00:00:00 2001
From: Simon Pilgrim <llvm-dev at redking.me.uk>
Date: Tue, 23 Jun 2026 09:51:22 +0100
Subject: [PATCH] [X86] madd.ll - add SSE42 test coverage

---
 llvm/test/CodeGen/X86/madd.ll | 1032 +++++++++++++++++++++++----------
 1 file changed, 730 insertions(+), 302 deletions(-)

diff --git a/llvm/test/CodeGen/X86/madd.ll b/llvm/test/CodeGen/X86/madd.ll
index 201a0900e6eb9..39fbe706ff369 100644
--- a/llvm/test/CodeGen/X86/madd.ll
+++ b/llvm/test/CodeGen/X86/madd.ll
@@ -1,5 +1,6 @@
 ; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse2 | FileCheck %s --check-prefix=SSE2
+; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2
+; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE42
 ; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1
 ; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX256,AVX2
 ; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx512f | FileCheck %s --check-prefixes=AVX,AVX256,AVX512,AVX512F
@@ -32,6 +33,29 @@ define i32 @_Z10test_shortPsS_i_128(ptr nocapture readonly, ptr nocapture readon
 ; SSE2-NEXT:    movd %xmm1, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: _Z10test_shortPsS_i_128:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %edx, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %ecx, %ecx
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB0_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm1 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm2 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmaddwd %xmm1, %xmm2
+; SSE42-NEXT:    paddd %xmm2, %xmm0
+; SSE42-NEXT:    addq $8, %rcx
+; SSE42-NEXT:    cmpq %rcx, %rax
+; SSE42-NEXT:    jne .LBB0_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    movd %xmm0, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX-LABEL: _Z10test_shortPsS_i_128:
 ; AVX:       # %bb.0: # %entry
 ; AVX-NEXT:    movl %edx, %eax
@@ -81,30 +105,30 @@ middle.block:
 }
 
 define i32 @_Z10test_shortPsS_i_256(ptr nocapture readonly, ptr nocapture readonly, i32) local_unnamed_addr #0 {
-; SSE2-LABEL: _Z10test_shortPsS_i_256:
-; SSE2:       # %bb.0: # %entry
-; SSE2-NEXT:    movl %edx, %eax
-; SSE2-NEXT:    pxor %xmm0, %xmm0
-; SSE2-NEXT:    xorl %ecx, %ecx
-; SSE2-NEXT:    pxor %xmm1, %xmm1
-; SSE2-NEXT:    .p2align 4
-; SSE2-NEXT:  .LBB1_1: # %vector.body
-; SSE2-NEXT:    # =>This Inner Loop Header: Depth=1
-; SSE2-NEXT:    movdqu (%rdi,%rcx,2), %xmm2
-; SSE2-NEXT:    movdqu (%rsi,%rcx,2), %xmm3
-; SSE2-NEXT:    pmaddwd %xmm2, %xmm3
-; SSE2-NEXT:    paddd %xmm3, %xmm1
-; SSE2-NEXT:    addq $8, %rcx
-; SSE2-NEXT:    cmpq %rcx, %rax
-; SSE2-NEXT:    jne .LBB1_1
-; SSE2-NEXT:  # %bb.2: # %middle.block
-; SSE2-NEXT:    paddd %xmm0, %xmm1
-; SSE2-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT:    paddd %xmm1, %xmm0
-; SSE2-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT:    paddd %xmm0, %xmm1
-; SSE2-NEXT:    movd %xmm1, %eax
-; SSE2-NEXT:    retq
+; SSE-LABEL: _Z10test_shortPsS_i_256:
+; SSE:       # %bb.0: # %entry
+; SSE-NEXT:    movl %edx, %eax
+; SSE-NEXT:    pxor %xmm0, %xmm0
+; SSE-NEXT:    xorl %ecx, %ecx
+; SSE-NEXT:    pxor %xmm1, %xmm1
+; SSE-NEXT:    .p2align 4
+; SSE-NEXT:  .LBB1_1: # %vector.body
+; SSE-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE-NEXT:    movdqu (%rdi,%rcx,2), %xmm2
+; SSE-NEXT:    movdqu (%rsi,%rcx,2), %xmm3
+; SSE-NEXT:    pmaddwd %xmm2, %xmm3
+; SSE-NEXT:    paddd %xmm3, %xmm1
+; SSE-NEXT:    addq $8, %rcx
+; SSE-NEXT:    cmpq %rcx, %rax
+; SSE-NEXT:    jne .LBB1_1
+; SSE-NEXT:  # %bb.2: # %middle.block
+; SSE-NEXT:    paddd %xmm0, %xmm1
+; SSE-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE-NEXT:    paddd %xmm1, %xmm0
+; SSE-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE-NEXT:    paddd %xmm0, %xmm1
+; SSE-NEXT:    movd %xmm1, %eax
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: _Z10test_shortPsS_i_256:
 ; AVX1:       # %bb.0: # %entry
@@ -183,37 +207,37 @@ middle.block:
 }
 
 define i32 @_Z10test_shortPsS_i_512(ptr nocapture readonly, ptr nocapture readonly, i32) local_unnamed_addr #0 {
-; SSE2-LABEL: _Z10test_shortPsS_i_512:
-; SSE2:       # %bb.0: # %entry
-; SSE2-NEXT:    movl %edx, %eax
-; SSE2-NEXT:    pxor %xmm0, %xmm0
-; SSE2-NEXT:    xorl %ecx, %ecx
-; SSE2-NEXT:    pxor %xmm2, %xmm2
-; SSE2-NEXT:    pxor %xmm1, %xmm1
-; SSE2-NEXT:    .p2align 4
-; SSE2-NEXT:  .LBB2_1: # %vector.body
-; SSE2-NEXT:    # =>This Inner Loop Header: Depth=1
-; SSE2-NEXT:    movdqu (%rdi,%rcx,2), %xmm3
-; SSE2-NEXT:    movdqu 16(%rdi,%rcx,2), %xmm4
-; SSE2-NEXT:    movdqu (%rsi,%rcx,2), %xmm5
-; SSE2-NEXT:    pmaddwd %xmm3, %xmm5
-; SSE2-NEXT:    paddd %xmm5, %xmm2
-; SSE2-NEXT:    movdqu 16(%rsi,%rcx,2), %xmm3
-; SSE2-NEXT:    pmaddwd %xmm4, %xmm3
-; SSE2-NEXT:    paddd %xmm3, %xmm1
-; SSE2-NEXT:    addq $16, %rcx
-; SSE2-NEXT:    cmpq %rcx, %rax
-; SSE2-NEXT:    jne .LBB2_1
-; SSE2-NEXT:  # %bb.2: # %middle.block
-; SSE2-NEXT:    paddd %xmm0, %xmm2
-; SSE2-NEXT:    paddd %xmm0, %xmm1
-; SSE2-NEXT:    paddd %xmm2, %xmm1
-; SSE2-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT:    paddd %xmm1, %xmm0
-; SSE2-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT:    paddd %xmm0, %xmm1
-; SSE2-NEXT:    movd %xmm1, %eax
-; SSE2-NEXT:    retq
+; SSE-LABEL: _Z10test_shortPsS_i_512:
+; SSE:       # %bb.0: # %entry
+; SSE-NEXT:    movl %edx, %eax
+; SSE-NEXT:    pxor %xmm0, %xmm0
+; SSE-NEXT:    xorl %ecx, %ecx
+; SSE-NEXT:    pxor %xmm2, %xmm2
+; SSE-NEXT:    pxor %xmm1, %xmm1
+; SSE-NEXT:    .p2align 4
+; SSE-NEXT:  .LBB2_1: # %vector.body
+; SSE-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE-NEXT:    movdqu (%rdi,%rcx,2), %xmm3
+; SSE-NEXT:    movdqu 16(%rdi,%rcx,2), %xmm4
+; SSE-NEXT:    movdqu (%rsi,%rcx,2), %xmm5
+; SSE-NEXT:    pmaddwd %xmm3, %xmm5
+; SSE-NEXT:    paddd %xmm5, %xmm2
+; SSE-NEXT:    movdqu 16(%rsi,%rcx,2), %xmm3
+; SSE-NEXT:    pmaddwd %xmm4, %xmm3
+; SSE-NEXT:    paddd %xmm3, %xmm1
+; SSE-NEXT:    addq $16, %rcx
+; SSE-NEXT:    cmpq %rcx, %rax
+; SSE-NEXT:    jne .LBB2_1
+; SSE-NEXT:  # %bb.2: # %middle.block
+; SSE-NEXT:    paddd %xmm0, %xmm2
+; SSE-NEXT:    paddd %xmm0, %xmm1
+; SSE-NEXT:    paddd %xmm2, %xmm1
+; SSE-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE-NEXT:    paddd %xmm1, %xmm0
+; SSE-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE-NEXT:    paddd %xmm0, %xmm1
+; SSE-NEXT:    movd %xmm1, %eax
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: _Z10test_shortPsS_i_512:
 ; AVX1:       # %bb.0: # %entry
@@ -329,51 +353,51 @@ middle.block:
 }
 
 define i32 @_Z10test_shortPsS_i_1024(ptr nocapture readonly, ptr nocapture readonly, i32) local_unnamed_addr #0 {
-; SSE2-LABEL: _Z10test_shortPsS_i_1024:
-; SSE2:       # %bb.0: # %entry
-; SSE2-NEXT:    movl %edx, %eax
-; SSE2-NEXT:    pxor %xmm0, %xmm0
-; SSE2-NEXT:    xorl %ecx, %ecx
-; SSE2-NEXT:    pxor %xmm2, %xmm2
-; SSE2-NEXT:    pxor %xmm4, %xmm4
-; SSE2-NEXT:    pxor %xmm1, %xmm1
-; SSE2-NEXT:    pxor %xmm3, %xmm3
-; SSE2-NEXT:    .p2align 4
-; SSE2-NEXT:  .LBB3_1: # %vector.body
-; SSE2-NEXT:    # =>This Inner Loop Header: Depth=1
-; SSE2-NEXT:    movdqu (%rdi,%rcx,2), %xmm5
-; SSE2-NEXT:    movdqu 16(%rdi,%rcx,2), %xmm6
-; SSE2-NEXT:    movdqu 32(%rdi,%rcx,2), %xmm7
-; SSE2-NEXT:    movdqu 48(%rdi,%rcx,2), %xmm8
-; SSE2-NEXT:    movdqu (%rsi,%rcx,2), %xmm9
-; SSE2-NEXT:    pmaddwd %xmm5, %xmm9
-; SSE2-NEXT:    paddd %xmm9, %xmm2
-; SSE2-NEXT:    movdqu 16(%rsi,%rcx,2), %xmm5
-; SSE2-NEXT:    pmaddwd %xmm6, %xmm5
-; SSE2-NEXT:    paddd %xmm5, %xmm4
-; SSE2-NEXT:    movdqu 32(%rsi,%rcx,2), %xmm5
-; SSE2-NEXT:    pmaddwd %xmm7, %xmm5
-; SSE2-NEXT:    paddd %xmm5, %xmm1
-; SSE2-NEXT:    movdqu 48(%rsi,%rcx,2), %xmm5
-; SSE2-NEXT:    pmaddwd %xmm8, %xmm5
-; SSE2-NEXT:    paddd %xmm5, %xmm3
-; SSE2-NEXT:    addq $16, %rcx
-; SSE2-NEXT:    cmpq %rcx, %rax
-; SSE2-NEXT:    jne .LBB3_1
-; SSE2-NEXT:  # %bb.2: # %middle.block
-; SSE2-NEXT:    paddd %xmm0, %xmm4
-; SSE2-NEXT:    paddd %xmm0, %xmm3
-; SSE2-NEXT:    paddd %xmm4, %xmm3
-; SSE2-NEXT:    paddd %xmm0, %xmm2
-; SSE2-NEXT:    paddd %xmm0, %xmm1
-; SSE2-NEXT:    paddd %xmm2, %xmm1
-; SSE2-NEXT:    paddd %xmm3, %xmm1
-; SSE2-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT:    paddd %xmm1, %xmm0
-; SSE2-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT:    paddd %xmm0, %xmm1
-; SSE2-NEXT:    movd %xmm1, %eax
-; SSE2-NEXT:    retq
+; SSE-LABEL: _Z10test_shortPsS_i_1024:
+; SSE:       # %bb.0: # %entry
+; SSE-NEXT:    movl %edx, %eax
+; SSE-NEXT:    pxor %xmm0, %xmm0
+; SSE-NEXT:    xorl %ecx, %ecx
+; SSE-NEXT:    pxor %xmm2, %xmm2
+; SSE-NEXT:    pxor %xmm4, %xmm4
+; SSE-NEXT:    pxor %xmm1, %xmm1
+; SSE-NEXT:    pxor %xmm3, %xmm3
+; SSE-NEXT:    .p2align 4
+; SSE-NEXT:  .LBB3_1: # %vector.body
+; SSE-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE-NEXT:    movdqu (%rdi,%rcx,2), %xmm5
+; SSE-NEXT:    movdqu 16(%rdi,%rcx,2), %xmm6
+; SSE-NEXT:    movdqu 32(%rdi,%rcx,2), %xmm7
+; SSE-NEXT:    movdqu 48(%rdi,%rcx,2), %xmm8
+; SSE-NEXT:    movdqu (%rsi,%rcx,2), %xmm9
+; SSE-NEXT:    pmaddwd %xmm5, %xmm9
+; SSE-NEXT:    paddd %xmm9, %xmm2
+; SSE-NEXT:    movdqu 16(%rsi,%rcx,2), %xmm5
+; SSE-NEXT:    pmaddwd %xmm6, %xmm5
+; SSE-NEXT:    paddd %xmm5, %xmm4
+; SSE-NEXT:    movdqu 32(%rsi,%rcx,2), %xmm5
+; SSE-NEXT:    pmaddwd %xmm7, %xmm5
+; SSE-NEXT:    paddd %xmm5, %xmm1
+; SSE-NEXT:    movdqu 48(%rsi,%rcx,2), %xmm5
+; SSE-NEXT:    pmaddwd %xmm8, %xmm5
+; SSE-NEXT:    paddd %xmm5, %xmm3
+; SSE-NEXT:    addq $16, %rcx
+; SSE-NEXT:    cmpq %rcx, %rax
+; SSE-NEXT:    jne .LBB3_1
+; SSE-NEXT:  # %bb.2: # %middle.block
+; SSE-NEXT:    paddd %xmm0, %xmm4
+; SSE-NEXT:    paddd %xmm0, %xmm3
+; SSE-NEXT:    paddd %xmm4, %xmm3
+; SSE-NEXT:    paddd %xmm0, %xmm2
+; SSE-NEXT:    paddd %xmm0, %xmm1
+; SSE-NEXT:    paddd %xmm2, %xmm1
+; SSE-NEXT:    paddd %xmm3, %xmm1
+; SSE-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE-NEXT:    paddd %xmm1, %xmm0
+; SSE-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE-NEXT:    paddd %xmm0, %xmm1
+; SSE-NEXT:    movd %xmm1, %eax
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: _Z10test_shortPsS_i_1024:
 ; AVX1:       # %bb.0: # %entry
@@ -572,6 +596,29 @@ define i32 @_Z9test_charPcS_i_128(ptr nocapture readonly, ptr nocapture readonly
 ; SSE2-NEXT:    movd %xmm0, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: _Z9test_charPcS_i_128:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %edx, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %ecx, %ecx
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB4_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovsxbd (%rdi,%rcx), %xmm1
+; SSE42-NEXT:    pmovsxbd (%rsi,%rcx), %xmm2
+; SSE42-NEXT:    pmulld %xmm1, %xmm2
+; SSE42-NEXT:    paddd %xmm2, %xmm0
+; SSE42-NEXT:    addq $16, %rcx
+; SSE42-NEXT:    cmpq %rcx, %rax
+; SSE42-NEXT:    jne .LBB4_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    movd %xmm0, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX-LABEL: _Z9test_charPcS_i_128:
 ; AVX:       # %bb.0: # %entry
 ; AVX-NEXT:    movl %edx, %eax
@@ -650,6 +697,31 @@ define i32 @_Z9test_charPcS_i_256(ptr nocapture readonly, ptr nocapture readonly
 ; SSE2-NEXT:    movd %xmm1, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: _Z9test_charPcS_i_256:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %edx, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %ecx, %ecx
+; SSE42-NEXT:    pxor %xmm1, %xmm1
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB5_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovsxbw (%rdi,%rcx), %xmm2
+; SSE42-NEXT:    pmovsxbw (%rsi,%rcx), %xmm3
+; SSE42-NEXT:    pmaddwd %xmm2, %xmm3
+; SSE42-NEXT:    paddd %xmm3, %xmm1
+; SSE42-NEXT:    addq $16, %rcx
+; SSE42-NEXT:    cmpq %rcx, %rax
+; SSE42-NEXT:    jne .LBB5_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    movd %xmm1, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: _Z9test_charPcS_i_256:
 ; AVX1:       # %bb.0: # %entry
 ; AVX1-NEXT:    movl %edx, %eax
@@ -767,6 +839,38 @@ define i32 @_Z9test_charPcS_i_512(ptr nocapture readonly, ptr nocapture readonly
 ; SSE2-NEXT:    movd %xmm1, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: _Z9test_charPcS_i_512:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %edx, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %ecx, %ecx
+; SSE42-NEXT:    pxor %xmm2, %xmm2
+; SSE42-NEXT:    pxor %xmm1, %xmm1
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB6_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovsxbw 8(%rdi,%rcx), %xmm3
+; SSE42-NEXT:    pmovsxbw (%rdi,%rcx), %xmm4
+; SSE42-NEXT:    pmovsxbw 8(%rsi,%rcx), %xmm5
+; SSE42-NEXT:    pmaddwd %xmm3, %xmm5
+; SSE42-NEXT:    paddd %xmm5, %xmm1
+; SSE42-NEXT:    pmovsxbw (%rsi,%rcx), %xmm3
+; SSE42-NEXT:    pmaddwd %xmm4, %xmm3
+; SSE42-NEXT:    paddd %xmm3, %xmm2
+; SSE42-NEXT:    addq $16, %rcx
+; SSE42-NEXT:    cmpq %rcx, %rax
+; SSE42-NEXT:    jne .LBB6_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    paddd %xmm0, %xmm2
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    paddd %xmm2, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    movd %xmm1, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: _Z9test_charPcS_i_512:
 ; AVX1:       # %bb.0: # %entry
 ; AVX1-NEXT:    movl %edx, %eax
@@ -943,6 +1047,52 @@ define i32 @_Z9test_charPcS_i_1024(ptr nocapture readonly, ptr nocapture readonl
 ; SSE2-NEXT:    movd %xmm1, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: _Z9test_charPcS_i_1024:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %edx, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %ecx, %ecx
+; SSE42-NEXT:    pxor %xmm2, %xmm2
+; SSE42-NEXT:    pxor %xmm4, %xmm4
+; SSE42-NEXT:    pxor %xmm1, %xmm1
+; SSE42-NEXT:    pxor %xmm3, %xmm3
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB7_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovsxbw 16(%rdi,%rcx), %xmm5
+; SSE42-NEXT:    pmovsxbw 8(%rdi,%rcx), %xmm6
+; SSE42-NEXT:    pmovsxbw (%rdi,%rcx), %xmm7
+; SSE42-NEXT:    pmovsxbw 24(%rdi,%rcx), %xmm8
+; SSE42-NEXT:    pmovsxbw 16(%rsi,%rcx), %xmm9
+; SSE42-NEXT:    pmaddwd %xmm5, %xmm9
+; SSE42-NEXT:    paddd %xmm9, %xmm1
+; SSE42-NEXT:    pmovsxbw 8(%rsi,%rcx), %xmm5
+; SSE42-NEXT:    pmaddwd %xmm6, %xmm5
+; SSE42-NEXT:    paddd %xmm5, %xmm4
+; SSE42-NEXT:    pmovsxbw (%rsi,%rcx), %xmm5
+; SSE42-NEXT:    pmaddwd %xmm7, %xmm5
+; SSE42-NEXT:    paddd %xmm5, %xmm2
+; SSE42-NEXT:    pmovsxbw 24(%rsi,%rcx), %xmm5
+; SSE42-NEXT:    pmaddwd %xmm8, %xmm5
+; SSE42-NEXT:    paddd %xmm5, %xmm3
+; SSE42-NEXT:    addq $32, %rcx
+; SSE42-NEXT:    cmpq %rcx, %rax
+; SSE42-NEXT:    jne .LBB7_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    paddd %xmm0, %xmm4
+; SSE42-NEXT:    paddd %xmm0, %xmm3
+; SSE42-NEXT:    paddd %xmm4, %xmm3
+; SSE42-NEXT:    paddd %xmm0, %xmm2
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    paddd %xmm2, %xmm1
+; SSE42-NEXT:    paddd %xmm3, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    movd %xmm1, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: _Z9test_charPcS_i_1024:
 ; AVX1:       # %bb.0: # %entry
 ; AVX1-NEXT:    movl %edx, %eax
@@ -1146,6 +1296,29 @@ define i32 @test_unsigned_short_128(ptr nocapture readonly, ptr nocapture readon
 ; SSE2-NEXT:    movd %xmm0, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: test_unsigned_short_128:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %edx, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %ecx, %ecx
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB8_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm1 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm2 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm1, %xmm2
+; SSE42-NEXT:    paddd %xmm2, %xmm0
+; SSE42-NEXT:    addq $16, %rcx
+; SSE42-NEXT:    cmpq %rcx, %rax
+; SSE42-NEXT:    jne .LBB8_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    movd %xmm0, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX-LABEL: test_unsigned_short_128:
 ; AVX:       # %bb.0: # %entry
 ; AVX-NEXT:    movl %edx, %eax
@@ -1226,6 +1399,35 @@ define i32 @test_unsigned_short_256(ptr nocapture readonly, ptr nocapture readon
 ; SSE2-NEXT:    movd %xmm0, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: test_unsigned_short_256:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %edx, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %ecx, %ecx
+; SSE42-NEXT:    pxor %xmm1, %xmm1
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB9_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm2 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm3 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm4 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm2, %xmm4
+; SSE42-NEXT:    paddd %xmm4, %xmm1
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm2 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm3, %xmm2
+; SSE42-NEXT:    paddd %xmm2, %xmm0
+; SSE42-NEXT:    addq $16, %rcx
+; SSE42-NEXT:    cmpq %rcx, %rax
+; SSE42-NEXT:    jne .LBB9_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    movd %xmm0, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: test_unsigned_short_256:
 ; AVX1:       # %bb.0: # %entry
 ; AVX1-NEXT:    movl %edx, %eax
@@ -1355,6 +1557,47 @@ define i32 @test_unsigned_short_512(ptr nocapture readonly, ptr nocapture readon
 ; SSE2-NEXT:    movd %xmm1, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: test_unsigned_short_512:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %edx, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %ecx, %ecx
+; SSE42-NEXT:    pxor %xmm1, %xmm1
+; SSE42-NEXT:    pxor %xmm3, %xmm3
+; SSE42-NEXT:    pxor %xmm2, %xmm2
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB10_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm4 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm5 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm6 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm7 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm4, %xmm8
+; SSE42-NEXT:    paddd %xmm8, %xmm3
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm4 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm5, %xmm4
+; SSE42-NEXT:    paddd %xmm4, %xmm1
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm4 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm6, %xmm4
+; SSE42-NEXT:    paddd %xmm4, %xmm0
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm4 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm7, %xmm4
+; SSE42-NEXT:    paddd %xmm4, %xmm2
+; SSE42-NEXT:    addq $16, %rcx
+; SSE42-NEXT:    cmpq %rcx, %rax
+; SSE42-NEXT:    jne .LBB10_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    paddd %xmm3, %xmm0
+; SSE42-NEXT:    paddd %xmm2, %xmm1
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    movd %xmm1, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: test_unsigned_short_512:
 ; AVX1:       # %bb.0: # %entry
 ; AVX1-NEXT:    movl %edx, %eax
@@ -1560,6 +1803,71 @@ define i32 @test_unsigned_short_1024(ptr nocapture readonly, ptr nocapture reado
 ; SSE2-NEXT:    movd %xmm1, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: test_unsigned_short_1024:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %edx, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %ecx, %ecx
+; SSE42-NEXT:    pxor %xmm3, %xmm3
+; SSE42-NEXT:    pxor %xmm1, %xmm1
+; SSE42-NEXT:    pxor %xmm2, %xmm2
+; SSE42-NEXT:    pxor %xmm4, %xmm4
+; SSE42-NEXT:    pxor %xmm6, %xmm6
+; SSE42-NEXT:    pxor %xmm5, %xmm5
+; SSE42-NEXT:    pxor %xmm7, %xmm7
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB11_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm8, %xmm9
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    paddd %xmm9, %xmm1
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm8, %xmm9
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    paddd %xmm9, %xmm3
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm8, %xmm9
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    paddd %xmm9, %xmm0
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm8, %xmm9
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    paddd %xmm9, %xmm2
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm8, %xmm9
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    paddd %xmm9, %xmm4
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm8, %xmm9
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    paddd %xmm9, %xmm6
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm8, %xmm9
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    paddd %xmm9, %xmm5
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT:    pmulld %xmm8, %xmm9
+; SSE42-NEXT:    paddd %xmm9, %xmm7
+; SSE42-NEXT:    addq $16, %rcx
+; SSE42-NEXT:    cmpq %rcx, %rax
+; SSE42-NEXT:    jne .LBB11_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    paddd %xmm6, %xmm3
+; SSE42-NEXT:    paddd %xmm7, %xmm2
+; SSE42-NEXT:    paddd %xmm3, %xmm2
+; SSE42-NEXT:    paddd %xmm4, %xmm0
+; SSE42-NEXT:    paddd %xmm5, %xmm1
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    paddd %xmm2, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    movd %xmm1, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: test_unsigned_short_1024:
 ; AVX1:       # %bb.0: # %entry
 ; AVX1-NEXT:    movl %edx, %eax
@@ -1738,10 +2046,10 @@ middle.block:
 }
 
 define <4 x i32> @pmaddwd_8(<8 x i16> %A, <8 x i16> %B) {
-; SSE2-LABEL: pmaddwd_8:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd %xmm1, %xmm0
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_8:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd %xmm1, %xmm0
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: pmaddwd_8:
 ; AVX:       # %bb.0:
@@ -1757,10 +2065,10 @@ define <4 x i32> @pmaddwd_8(<8 x i16> %A, <8 x i16> %B) {
 }
 
 define <4 x i32> @pmaddwd_8_swapped(<8 x i16> %A, <8 x i16> %B) {
-; SSE2-LABEL: pmaddwd_8_swapped:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd %xmm1, %xmm0
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_8_swapped:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd %xmm1, %xmm0
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: pmaddwd_8_swapped:
 ; AVX:       # %bb.0:
@@ -1775,7 +2083,7 @@ define <4 x i32> @pmaddwd_8_swapped(<8 x i16> %A, <8 x i16> %B) {
    ret <4 x i32> %ret
 }
 
-; FIXME: SSE fails to match PMADDWD
+; FIXME: SSE2 fails to match PMADDWD
 define <4 x i32> @larger_mul(<16 x i16> %A, <16 x i16> %B) {
 ; SSE2-LABEL: larger_mul:
 ; SSE2:       # %bb.0:
@@ -1791,6 +2099,19 @@ define <4 x i32> @larger_mul(<16 x i16> %A, <16 x i16> %B) {
 ; SSE2-NEXT:    paddd %xmm1, %xmm0
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: larger_mul:
+; SSE42:       # %bb.0:
+; SSE42-NEXT:    pxor %xmm1, %xmm1
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm3 = xmm2[0],zero,xmm2[1],zero,xmm2[2],zero,xmm2[3],zero
+; SSE42-NEXT:    punpckhwd {{.*#+}} xmm2 = xmm2[4],xmm1[4],xmm2[5],xmm1[5],xmm2[6],xmm1[6],xmm2[7],xmm1[7]
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm1 = xmm0[0],zero,xmm0[1],zero,xmm0[2],zero,xmm0[3],zero
+; SSE42-NEXT:    punpckhwd {{.*#+}} xmm0 = xmm0[4,4,5,5,6,6,7,7]
+; SSE42-NEXT:    pmaddwd %xmm2, %xmm0
+; SSE42-NEXT:    pmaddwd %xmm3, %xmm1
+; SSE42-NEXT:    phaddd %xmm0, %xmm1
+; SSE42-NEXT:    movdqa %xmm1, %xmm0
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: larger_mul:
 ; AVX1:       # %bb.0:
 ; AVX1-NEXT:    vpmaddwd %xmm1, %xmm0, %xmm0
@@ -1822,11 +2143,11 @@ define <4 x i32> @larger_mul(<16 x i16> %A, <16 x i16> %B) {
 }
 
 define <8 x i32> @pmaddwd_16(<16 x i16> %A, <16 x i16> %B) {
-; SSE2-LABEL: pmaddwd_16:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd %xmm2, %xmm0
-; SSE2-NEXT:    pmaddwd %xmm3, %xmm1
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_16:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd %xmm2, %xmm0
+; SSE-NEXT:    pmaddwd %xmm3, %xmm1
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: pmaddwd_16:
 ; AVX1:       # %bb.0:
@@ -1851,13 +2172,13 @@ define <8 x i32> @pmaddwd_16(<16 x i16> %A, <16 x i16> %B) {
 }
 
 define <16 x i32> @pmaddwd_32(<32 x i16> %A, <32 x i16> %B) {
-; SSE2-LABEL: pmaddwd_32:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd %xmm4, %xmm0
-; SSE2-NEXT:    pmaddwd %xmm5, %xmm1
-; SSE2-NEXT:    pmaddwd %xmm6, %xmm2
-; SSE2-NEXT:    pmaddwd %xmm7, %xmm3
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_32:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd %xmm4, %xmm0
+; SSE-NEXT:    pmaddwd %xmm5, %xmm1
+; SSE-NEXT:    pmaddwd %xmm6, %xmm2
+; SSE-NEXT:    pmaddwd %xmm7, %xmm3
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: pmaddwd_32:
 ; AVX1:       # %bb.0:
@@ -1902,10 +2223,10 @@ define <16 x i32> @pmaddwd_32(<32 x i16> %A, <32 x i16> %B) {
 }
 
 define <4 x i32> @pmaddwd_const(<8 x i16> %A) {
-; SSE2-LABEL: pmaddwd_const:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0 # [32767,32768,0,0,1,7,42,32]
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_const:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0 # [32767,32768,0,0,1,7,42,32]
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: pmaddwd_const:
 ; AVX:       # %bb.0:
@@ -1935,6 +2256,19 @@ define <4 x i32> @pmaddwd_negative1(<8 x i16> %A, <8 x i16> %B) {
 ; SSE2-NEXT:    paddd %xmm2, %xmm0
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: pmaddwd_negative1:
+; SSE42:       # %bb.0:
+; SSE42-NEXT:    pxor %xmm3, %xmm3
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm4 = xmm0[0],zero,xmm0[1],zero,xmm0[2],zero,xmm0[3],zero
+; SSE42-NEXT:    punpckhwd {{.*#+}} xmm0 = xmm0[4],xmm3[4],xmm0[5],xmm3[5],xmm0[6],xmm3[6],xmm0[7],xmm3[7]
+; SSE42-NEXT:    pmovzxwd {{.*#+}} xmm2 = xmm1[0],zero,xmm1[1],zero,xmm1[2],zero,xmm1[3],zero
+; SSE42-NEXT:    punpckhwd {{.*#+}} xmm1 = xmm1[4],xmm3[4],xmm1[5],xmm3[5],xmm1[6],xmm3[6],xmm1[7],xmm3[7]
+; SSE42-NEXT:    pmulld %xmm0, %xmm1
+; SSE42-NEXT:    pmulld %xmm4, %xmm2
+; SSE42-NEXT:    phaddd %xmm1, %xmm2
+; SSE42-NEXT:    movdqa %xmm2, %xmm0
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: pmaddwd_negative1:
 ; AVX1:       # %bb.0:
 ; AVX1-NEXT:    vpxor %xmm2, %xmm2, %xmm2
@@ -1983,6 +2317,16 @@ define <4 x i32> @pmaddwd_negative2(<8 x i16> %A) {
 ; SSE2-NEXT:    movdqa %xmm1, %xmm0
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: pmaddwd_negative2:
+; SSE42:       # %bb.0:
+; SSE42-NEXT:    pmovsxwd %xmm0, %xmm1
+; SSE42-NEXT:    punpckhwd {{.*#+}} xmm0 = xmm0[4,4,5,5,6,6,7,7]
+; SSE42-NEXT:    pmaddwd {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0 # [1,0,7,0,42,0,32,0]
+; SSE42-NEXT:    pmulld {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm1 # [32768,4294934528,0,0]
+; SSE42-NEXT:    phaddd %xmm0, %xmm1
+; SSE42-NEXT:    movdqa %xmm1, %xmm0
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: pmaddwd_negative2:
 ; AVX1:       # %bb.0:
 ; AVX1-NEXT:    vpmovsxwd %xmm0, %xmm1
@@ -2009,10 +2353,10 @@ define <4 x i32> @pmaddwd_negative2(<8 x i16> %A) {
 }
 
 define <4 x i32> @jumbled_indices4(<8 x i16> %A, <8 x i16> %B) {
-; SSE2-LABEL: jumbled_indices4:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd %xmm1, %xmm0
-; SSE2-NEXT:    retq
+; SSE-LABEL: jumbled_indices4:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd %xmm1, %xmm0
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: jumbled_indices4:
 ; AVX:       # %bb.0:
@@ -2028,11 +2372,11 @@ define <4 x i32> @jumbled_indices4(<8 x i16> %A, <8 x i16> %B) {
 }
 
 define <8 x i32> @jumbled_indices8(<16 x i16> %A, <16 x i16> %B) {
-; SSE2-LABEL: jumbled_indices8:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd %xmm2, %xmm0
-; SSE2-NEXT:    pmaddwd %xmm3, %xmm1
-; SSE2-NEXT:    retq
+; SSE-LABEL: jumbled_indices8:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd %xmm2, %xmm0
+; SSE-NEXT:    pmaddwd %xmm3, %xmm1
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: jumbled_indices8:
 ; AVX1:       # %bb.0:
@@ -2057,13 +2401,13 @@ define <8 x i32> @jumbled_indices8(<16 x i16> %A, <16 x i16> %B) {
 }
 
 define <16 x i32> @jumbled_indices16(<32 x i16> %A, <32 x i16> %B) {
-; SSE2-LABEL: jumbled_indices16:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd %xmm4, %xmm0
-; SSE2-NEXT:    pmaddwd %xmm5, %xmm1
-; SSE2-NEXT:    pmaddwd %xmm6, %xmm2
-; SSE2-NEXT:    pmaddwd %xmm7, %xmm3
-; SSE2-NEXT:    retq
+; SSE-LABEL: jumbled_indices16:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd %xmm4, %xmm0
+; SSE-NEXT:    pmaddwd %xmm5, %xmm1
+; SSE-NEXT:    pmaddwd %xmm6, %xmm2
+; SSE-NEXT:    pmaddwd %xmm7, %xmm3
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: jumbled_indices16:
 ; AVX1:       # %bb.0:
@@ -2108,26 +2452,26 @@ define <16 x i32> @jumbled_indices16(<32 x i16> %A, <32 x i16> %B) {
 }
 
 define <32 x i32> @jumbled_indices32(<64 x i16> %A, <64 x i16> %B) {
-; SSE2-LABEL: jumbled_indices32:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    movq %rdi, %rax
-; SSE2-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm0
-; SSE2-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm1
-; SSE2-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm2
-; SSE2-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm3
-; SSE2-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm4
-; SSE2-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm5
-; SSE2-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm6
-; SSE2-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm7
-; SSE2-NEXT:    movdqa %xmm7, 112(%rdi)
-; SSE2-NEXT:    movdqa %xmm6, 96(%rdi)
-; SSE2-NEXT:    movdqa %xmm5, 80(%rdi)
-; SSE2-NEXT:    movdqa %xmm4, 64(%rdi)
-; SSE2-NEXT:    movdqa %xmm3, 48(%rdi)
-; SSE2-NEXT:    movdqa %xmm2, 32(%rdi)
-; SSE2-NEXT:    movdqa %xmm1, 16(%rdi)
-; SSE2-NEXT:    movdqa %xmm0, (%rdi)
-; SSE2-NEXT:    retq
+; SSE-LABEL: jumbled_indices32:
+; SSE:       # %bb.0:
+; SSE-NEXT:    movq %rdi, %rax
+; SSE-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm0
+; SSE-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm1
+; SSE-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm2
+; SSE-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm3
+; SSE-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm4
+; SSE-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm5
+; SSE-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm6
+; SSE-NEXT:    pmaddwd {{[0-9]+}}(%rsp), %xmm7
+; SSE-NEXT:    movdqa %xmm7, 112(%rdi)
+; SSE-NEXT:    movdqa %xmm6, 96(%rdi)
+; SSE-NEXT:    movdqa %xmm5, 80(%rdi)
+; SSE-NEXT:    movdqa %xmm4, 64(%rdi)
+; SSE-NEXT:    movdqa %xmm3, 48(%rdi)
+; SSE-NEXT:    movdqa %xmm2, 32(%rdi)
+; SSE-NEXT:    movdqa %xmm1, 16(%rdi)
+; SSE-NEXT:    movdqa %xmm0, (%rdi)
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: jumbled_indices32:
 ; AVX1:       # %bb.0:
@@ -2192,11 +2536,11 @@ define <32 x i32> @jumbled_indices32(<64 x i16> %A, <64 x i16> %B) {
 ; NOTE: We're testing with loads because ABI lowering creates a concat_vectors that extract_vector_elt creation can see through.
 ; This would require the combine to recreate the concat_vectors.
 define <4 x i32> @pmaddwd_128(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_128:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    movdqa (%rdi), %xmm0
-; SSE2-NEXT:    pmaddwd (%rsi), %xmm0
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_128:
+; SSE:       # %bb.0:
+; SSE-NEXT:    movdqa (%rdi), %xmm0
+; SSE-NEXT:    pmaddwd (%rsi), %xmm0
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: pmaddwd_128:
 ; AVX:       # %bb.0:
@@ -2220,13 +2564,13 @@ define <4 x i32> @pmaddwd_128(ptr %Aptr, ptr %Bptr) {
 }
 
 define <8 x i32> @pmaddwd_256(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_256:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    movdqa (%rdi), %xmm0
-; SSE2-NEXT:    movdqa 16(%rdi), %xmm1
-; SSE2-NEXT:    pmaddwd (%rsi), %xmm0
-; SSE2-NEXT:    pmaddwd 16(%rsi), %xmm1
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_256:
+; SSE:       # %bb.0:
+; SSE-NEXT:    movdqa (%rdi), %xmm0
+; SSE-NEXT:    movdqa 16(%rdi), %xmm1
+; SSE-NEXT:    pmaddwd (%rsi), %xmm0
+; SSE-NEXT:    pmaddwd 16(%rsi), %xmm1
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: pmaddwd_256:
 ; AVX1:       # %bb.0:
@@ -2259,17 +2603,17 @@ define <8 x i32> @pmaddwd_256(ptr %Aptr, ptr %Bptr) {
 }
 
 define <16 x i32> @pmaddwd_512(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_512:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    movdqa (%rdi), %xmm0
-; SSE2-NEXT:    movdqa 16(%rdi), %xmm1
-; SSE2-NEXT:    movdqa 32(%rdi), %xmm2
-; SSE2-NEXT:    movdqa 48(%rdi), %xmm3
-; SSE2-NEXT:    pmaddwd (%rsi), %xmm0
-; SSE2-NEXT:    pmaddwd 16(%rsi), %xmm1
-; SSE2-NEXT:    pmaddwd 32(%rsi), %xmm2
-; SSE2-NEXT:    pmaddwd 48(%rsi), %xmm3
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_512:
+; SSE:       # %bb.0:
+; SSE-NEXT:    movdqa (%rdi), %xmm0
+; SSE-NEXT:    movdqa 16(%rdi), %xmm1
+; SSE-NEXT:    movdqa 32(%rdi), %xmm2
+; SSE-NEXT:    movdqa 48(%rdi), %xmm3
+; SSE-NEXT:    pmaddwd (%rsi), %xmm0
+; SSE-NEXT:    pmaddwd 16(%rsi), %xmm1
+; SSE-NEXT:    pmaddwd 32(%rsi), %xmm2
+; SSE-NEXT:    pmaddwd 48(%rsi), %xmm3
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: pmaddwd_512:
 ; AVX1:       # %bb.0:
@@ -2324,34 +2668,34 @@ define <16 x i32> @pmaddwd_512(ptr %Aptr, ptr %Bptr) {
 }
 
 define <32 x i32> @pmaddwd_1024(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_1024:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    movq %rdi, %rax
-; SSE2-NEXT:    movdqa (%rsi), %xmm0
-; SSE2-NEXT:    movdqa 16(%rsi), %xmm1
-; SSE2-NEXT:    movdqa 32(%rsi), %xmm2
-; SSE2-NEXT:    movdqa 48(%rsi), %xmm3
-; SSE2-NEXT:    pmaddwd (%rdx), %xmm0
-; SSE2-NEXT:    pmaddwd 16(%rdx), %xmm1
-; SSE2-NEXT:    pmaddwd 32(%rdx), %xmm2
-; SSE2-NEXT:    pmaddwd 48(%rdx), %xmm3
-; SSE2-NEXT:    movdqa 64(%rsi), %xmm4
-; SSE2-NEXT:    pmaddwd 64(%rdx), %xmm4
-; SSE2-NEXT:    movdqa 80(%rsi), %xmm5
-; SSE2-NEXT:    pmaddwd 80(%rdx), %xmm5
-; SSE2-NEXT:    movdqa 96(%rsi), %xmm6
-; SSE2-NEXT:    pmaddwd 96(%rdx), %xmm6
-; SSE2-NEXT:    movdqa 112(%rsi), %xmm7
-; SSE2-NEXT:    pmaddwd 112(%rdx), %xmm7
-; SSE2-NEXT:    movdqa %xmm7, 112(%rdi)
-; SSE2-NEXT:    movdqa %xmm6, 96(%rdi)
-; SSE2-NEXT:    movdqa %xmm5, 80(%rdi)
-; SSE2-NEXT:    movdqa %xmm4, 64(%rdi)
-; SSE2-NEXT:    movdqa %xmm3, 48(%rdi)
-; SSE2-NEXT:    movdqa %xmm2, 32(%rdi)
-; SSE2-NEXT:    movdqa %xmm1, 16(%rdi)
-; SSE2-NEXT:    movdqa %xmm0, (%rdi)
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_1024:
+; SSE:       # %bb.0:
+; SSE-NEXT:    movq %rdi, %rax
+; SSE-NEXT:    movdqa (%rsi), %xmm0
+; SSE-NEXT:    movdqa 16(%rsi), %xmm1
+; SSE-NEXT:    movdqa 32(%rsi), %xmm2
+; SSE-NEXT:    movdqa 48(%rsi), %xmm3
+; SSE-NEXT:    pmaddwd (%rdx), %xmm0
+; SSE-NEXT:    pmaddwd 16(%rdx), %xmm1
+; SSE-NEXT:    pmaddwd 32(%rdx), %xmm2
+; SSE-NEXT:    pmaddwd 48(%rdx), %xmm3
+; SSE-NEXT:    movdqa 64(%rsi), %xmm4
+; SSE-NEXT:    pmaddwd 64(%rdx), %xmm4
+; SSE-NEXT:    movdqa 80(%rsi), %xmm5
+; SSE-NEXT:    pmaddwd 80(%rdx), %xmm5
+; SSE-NEXT:    movdqa 96(%rsi), %xmm6
+; SSE-NEXT:    pmaddwd 96(%rdx), %xmm6
+; SSE-NEXT:    movdqa 112(%rsi), %xmm7
+; SSE-NEXT:    pmaddwd 112(%rdx), %xmm7
+; SSE-NEXT:    movdqa %xmm7, 112(%rdi)
+; SSE-NEXT:    movdqa %xmm6, 96(%rdi)
+; SSE-NEXT:    movdqa %xmm5, 80(%rdi)
+; SSE-NEXT:    movdqa %xmm4, 64(%rdi)
+; SSE-NEXT:    movdqa %xmm3, 48(%rdi)
+; SSE-NEXT:    movdqa %xmm2, 32(%rdi)
+; SSE-NEXT:    movdqa %xmm1, 16(%rdi)
+; SSE-NEXT:    movdqa %xmm0, (%rdi)
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: pmaddwd_1024:
 ; AVX1:       # %bb.0:
@@ -2427,11 +2771,11 @@ define <32 x i32> @pmaddwd_1024(ptr %Aptr, ptr %Bptr) {
 }
 
 define <4 x i32> @pmaddwd_commuted_mul(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_commuted_mul:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    movdqa (%rdi), %xmm0
-; SSE2-NEXT:    pmaddwd (%rsi), %xmm0
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_commuted_mul:
+; SSE:       # %bb.0:
+; SSE-NEXT:    movdqa (%rdi), %xmm0
+; SSE-NEXT:    pmaddwd (%rsi), %xmm0
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: pmaddwd_commuted_mul:
 ; AVX:       # %bb.0:
@@ -2455,11 +2799,11 @@ define <4 x i32> @pmaddwd_commuted_mul(ptr %Aptr, ptr %Bptr) {
 }
 
 define <4 x i32> @pmaddwd_swapped_indices(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_swapped_indices:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    movdqa (%rdi), %xmm0
-; SSE2-NEXT:    pmaddwd (%rsi), %xmm0
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_swapped_indices:
+; SSE:       # %bb.0:
+; SSE-NEXT:    movdqa (%rdi), %xmm0
+; SSE-NEXT:    pmaddwd (%rsi), %xmm0
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: pmaddwd_swapped_indices:
 ; AVX:       # %bb.0:
@@ -2484,12 +2828,12 @@ define <4 x i32> @pmaddwd_swapped_indices(ptr %Aptr, ptr %Bptr) {
 
 ; Negative test where indices aren't paired properly
 define <4 x i32> @pmaddwd_bad_indices(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_bad_indices:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pshuflw {{.*#+}} xmm0 = mem[1,0,2,3,4,5,6,7]
-; SSE2-NEXT:    pshufhw {{.*#+}} xmm0 = xmm0[0,1,2,3,5,4,6,7]
-; SSE2-NEXT:    pmaddwd (%rsi), %xmm0
-; SSE2-NEXT:    retq
+; SSE-LABEL: pmaddwd_bad_indices:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pshuflw {{.*#+}} xmm0 = mem[1,0,2,3,4,5,6,7]
+; SSE-NEXT:    pshufhw {{.*#+}} xmm0 = xmm0[0,1,2,3,5,4,6,7]
+; SSE-NEXT:    pmaddwd (%rsi), %xmm0
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: pmaddwd_bad_indices:
 ; AVX:       # %bb.0:
@@ -2516,21 +2860,21 @@ define <4 x i32> @pmaddwd_bad_indices(ptr %Aptr, ptr %Bptr) {
 ; This test contains two multiplies joined by an add. The result of that add is then reduced to a single element.
 ; SelectionDAGBuilder should tag the joining add as a vector reduction. We need to recognize that both sides can use pmaddwd
 define i32 @madd_double_reduction(ptr %arg, ptr %arg1, ptr %arg2, ptr %arg3) {
-; SSE2-LABEL: madd_double_reduction:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    movdqu (%rdi), %xmm0
-; SSE2-NEXT:    movdqu (%rsi), %xmm1
-; SSE2-NEXT:    pmaddwd %xmm0, %xmm1
-; SSE2-NEXT:    movdqu (%rdx), %xmm0
-; SSE2-NEXT:    movdqu (%rcx), %xmm2
-; SSE2-NEXT:    pmaddwd %xmm0, %xmm2
-; SSE2-NEXT:    paddd %xmm1, %xmm2
-; SSE2-NEXT:    pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
-; SSE2-NEXT:    paddd %xmm2, %xmm0
-; SSE2-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT:    paddd %xmm0, %xmm1
-; SSE2-NEXT:    movd %xmm1, %eax
-; SSE2-NEXT:    retq
+; SSE-LABEL: madd_double_reduction:
+; SSE:       # %bb.0:
+; SSE-NEXT:    movdqu (%rdi), %xmm0
+; SSE-NEXT:    movdqu (%rsi), %xmm1
+; SSE-NEXT:    pmaddwd %xmm0, %xmm1
+; SSE-NEXT:    movdqu (%rdx), %xmm0
+; SSE-NEXT:    movdqu (%rcx), %xmm2
+; SSE-NEXT:    pmaddwd %xmm0, %xmm2
+; SSE-NEXT:    paddd %xmm1, %xmm2
+; SSE-NEXT:    pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; SSE-NEXT:    paddd %xmm2, %xmm0
+; SSE-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE-NEXT:    paddd %xmm0, %xmm1
+; SSE-NEXT:    movd %xmm1, %eax
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: madd_double_reduction:
 ; AVX:       # %bb.0:
@@ -2561,31 +2905,31 @@ define i32 @madd_double_reduction(ptr %arg, ptr %arg1, ptr %arg2, ptr %arg3) {
 }
 
 define i32 @madd_quad_reduction(ptr %arg, ptr %arg1, ptr %arg2, ptr %arg3, ptr %arg4, ptr %arg5, ptr %arg6, ptr %arg7) {
-; SSE2-LABEL: madd_quad_reduction:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    movq {{[0-9]+}}(%rsp), %rax
-; SSE2-NEXT:    movq {{[0-9]+}}(%rsp), %r10
-; SSE2-NEXT:    movdqu (%rdi), %xmm0
-; SSE2-NEXT:    movdqu (%rsi), %xmm1
-; SSE2-NEXT:    pmaddwd %xmm0, %xmm1
-; SSE2-NEXT:    movdqu (%rdx), %xmm0
-; SSE2-NEXT:    movdqu (%rcx), %xmm2
-; SSE2-NEXT:    pmaddwd %xmm0, %xmm2
-; SSE2-NEXT:    paddd %xmm1, %xmm2
-; SSE2-NEXT:    movdqu (%r8), %xmm0
-; SSE2-NEXT:    movdqu (%r9), %xmm1
-; SSE2-NEXT:    pmaddwd %xmm0, %xmm1
-; SSE2-NEXT:    paddd %xmm2, %xmm1
-; SSE2-NEXT:    movdqu (%r10), %xmm0
-; SSE2-NEXT:    movdqu (%rax), %xmm2
-; SSE2-NEXT:    pmaddwd %xmm0, %xmm2
-; SSE2-NEXT:    paddd %xmm1, %xmm2
-; SSE2-NEXT:    pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
-; SSE2-NEXT:    paddd %xmm2, %xmm0
-; SSE2-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT:    paddd %xmm0, %xmm1
-; SSE2-NEXT:    movd %xmm1, %eax
-; SSE2-NEXT:    retq
+; SSE-LABEL: madd_quad_reduction:
+; SSE:       # %bb.0:
+; SSE-NEXT:    movq {{[0-9]+}}(%rsp), %rax
+; SSE-NEXT:    movq {{[0-9]+}}(%rsp), %r10
+; SSE-NEXT:    movdqu (%rdi), %xmm0
+; SSE-NEXT:    movdqu (%rsi), %xmm1
+; SSE-NEXT:    pmaddwd %xmm0, %xmm1
+; SSE-NEXT:    movdqu (%rdx), %xmm0
+; SSE-NEXT:    movdqu (%rcx), %xmm2
+; SSE-NEXT:    pmaddwd %xmm0, %xmm2
+; SSE-NEXT:    paddd %xmm1, %xmm2
+; SSE-NEXT:    movdqu (%r8), %xmm0
+; SSE-NEXT:    movdqu (%r9), %xmm1
+; SSE-NEXT:    pmaddwd %xmm0, %xmm1
+; SSE-NEXT:    paddd %xmm2, %xmm1
+; SSE-NEXT:    movdqu (%r10), %xmm0
+; SSE-NEXT:    movdqu (%rax), %xmm2
+; SSE-NEXT:    pmaddwd %xmm0, %xmm2
+; SSE-NEXT:    paddd %xmm1, %xmm2
+; SSE-NEXT:    pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; SSE-NEXT:    paddd %xmm2, %xmm0
+; SSE-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE-NEXT:    paddd %xmm0, %xmm1
+; SSE-NEXT:    movd %xmm1, %eax
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: madd_quad_reduction:
 ; AVX:       # %bb.0:
@@ -2679,6 +3023,44 @@ define i64 @sum_and_sum_of_squares(ptr %a, i32 %n) {
 ; SSE2-NEXT:    orq %rcx, %rax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: sum_and_sum_of_squares:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %esi, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    pxor %xmm1, %xmm1
+; SSE42-NEXT:    pxor %xmm2, %xmm2
+; SSE42-NEXT:    pxor %xmm3, %xmm3
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB33_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovzxbd {{.*#+}} xmm4 = mem[0],zero,zero,zero,mem[1],zero,zero,zero,mem[2],zero,zero,zero,mem[3],zero,zero,zero
+; SSE42-NEXT:    pmovzxbd {{.*#+}} xmm5 = mem[0],zero,zero,zero,mem[1],zero,zero,zero,mem[2],zero,zero,zero,mem[3],zero,zero,zero
+; SSE42-NEXT:    paddd %xmm5, %xmm3
+; SSE42-NEXT:    paddd %xmm4, %xmm2
+; SSE42-NEXT:    pmaddwd %xmm4, %xmm4
+; SSE42-NEXT:    paddd %xmm4, %xmm0
+; SSE42-NEXT:    pmaddwd %xmm5, %xmm5
+; SSE42-NEXT:    paddd %xmm5, %xmm1
+; SSE42-NEXT:    addq $8, %rdi
+; SSE42-NEXT:    addq $-8, %rax
+; SSE42-NEXT:    jne .LBB33_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    paddd %xmm3, %xmm2
+; SSE42-NEXT:    pshufd {{.*#+}} xmm3 = xmm2[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm2, %xmm3
+; SSE42-NEXT:    pshufd {{.*#+}} xmm2 = xmm3[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm3, %xmm2
+; SSE42-NEXT:    movd %xmm2, %ecx
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    movd %xmm0, %eax
+; SSE42-NEXT:    shlq $32, %rcx
+; SSE42-NEXT:    orq %rcx, %rax
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: sum_and_sum_of_squares:
 ; AVX1:       # %bb.0: # %entry
 ; AVX1-NEXT:    movl %esi, %eax
@@ -2814,6 +3196,32 @@ define i32 @sum_of_square_differences(ptr %a, ptr %b, i32 %n) {
 ; SSE2-NEXT:    movd %xmm1, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: sum_of_square_differences:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    movl %edx, %eax
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %ecx, %ecx
+; SSE42-NEXT:    pxor %xmm1, %xmm1
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB34_1: # %vector.body
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovzxbw {{.*#+}} xmm2 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero,mem[4],zero,mem[5],zero,mem[6],zero,mem[7],zero
+; SSE42-NEXT:    pmovzxbw {{.*#+}} xmm3 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero,mem[4],zero,mem[5],zero,mem[6],zero,mem[7],zero
+; SSE42-NEXT:    psubw %xmm2, %xmm3
+; SSE42-NEXT:    pmaddwd %xmm3, %xmm3
+; SSE42-NEXT:    paddd %xmm3, %xmm1
+; SSE42-NEXT:    addq $8, %rcx
+; SSE42-NEXT:    cmpq %rcx, %rax
+; SSE42-NEXT:    jne .LBB34_1
+; SSE42-NEXT:  # %bb.2: # %middle.block
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    movd %xmm1, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: sum_of_square_differences:
 ; AVX1:       # %bb.0: # %entry
 ; AVX1-NEXT:    movl %edx, %eax
@@ -2898,10 +3306,10 @@ middle.block:
 ; PR49716 - https://llvm.org/PR49716
 
 define <4 x i32> @input_size_mismatch(<16 x i16> %x, ptr %p) {
-; SSE2-LABEL: input_size_mismatch:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd (%rdi), %xmm0
-; SSE2-NEXT:    retq
+; SSE-LABEL: input_size_mismatch:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd (%rdi), %xmm0
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: input_size_mismatch:
 ; AVX:       # %bb.0:
@@ -2924,10 +3332,10 @@ define <4 x i32> @input_size_mismatch(<16 x i16> %x, ptr %p) {
 }
 
 define <4 x i32> @output_size_mismatch(<16 x i16> %x, <16 x i16> %y) {
-; SSE2-LABEL: output_size_mismatch:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd %xmm2, %xmm0
-; SSE2-NEXT:    retq
+; SSE-LABEL: output_size_mismatch:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd %xmm2, %xmm0
+; SSE-NEXT:    retq
 ;
 ; AVX-LABEL: output_size_mismatch:
 ; AVX:       # %bb.0:
@@ -2949,11 +3357,11 @@ define <4 x i32> @output_size_mismatch(<16 x i16> %x, <16 x i16> %y) {
 }
 
 define <4 x i32> @output_size_mismatch_high_subvector(<16 x i16> %x, <16 x i16> %y) {
-; SSE2-LABEL: output_size_mismatch_high_subvector:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    movdqa %xmm1, %xmm0
-; SSE2-NEXT:    pmaddwd %xmm2, %xmm0
-; SSE2-NEXT:    retq
+; SSE-LABEL: output_size_mismatch_high_subvector:
+; SSE:       # %bb.0:
+; SSE-NEXT:    movdqa %xmm1, %xmm0
+; SSE-NEXT:    pmaddwd %xmm2, %xmm0
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: output_size_mismatch_high_subvector:
 ; AVX1:       # %bb.0:
@@ -3022,6 +3430,39 @@ define i32 @add_used_by_loop_phi(ptr %a, ptr %b, i64 %offset_a, i64 %offset_b, i
 ; SSE2-NEXT:    movd %xmm1, %eax
 ; SSE2-NEXT:    retq
 ;
+; SSE42-LABEL: add_used_by_loop_phi:
+; SSE42:       # %bb.0: # %entry
+; SSE42-NEXT:    addq %rdx, %rdi
+; SSE42-NEXT:    addq %rcx, %rsi
+; SSE42-NEXT:    pxor %xmm0, %xmm0
+; SSE42-NEXT:    xorl %eax, %eax
+; SSE42-NEXT:    pxor %xmm2, %xmm2
+; SSE42-NEXT:    pxor %xmm1, %xmm1
+; SSE42-NEXT:    .p2align 4
+; SSE42-NEXT:  .LBB38_1: # %loop
+; SSE42-NEXT:    # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT:    pmovsxbw 8(%rdi,%rax), %xmm3
+; SSE42-NEXT:    pmovsxbw (%rdi,%rax), %xmm4
+; SSE42-NEXT:    pmovsxbw 8(%rsi,%rax), %xmm5
+; SSE42-NEXT:    pmaddwd %xmm3, %xmm5
+; SSE42-NEXT:    paddd %xmm5, %xmm1
+; SSE42-NEXT:    pmovsxbw (%rsi,%rax), %xmm3
+; SSE42-NEXT:    pmaddwd %xmm4, %xmm3
+; SSE42-NEXT:    paddd %xmm3, %xmm2
+; SSE42-NEXT:    addq $16, %rax
+; SSE42-NEXT:    cmpq %r8, %rax
+; SSE42-NEXT:    jb .LBB38_1
+; SSE42-NEXT:  # %bb.2: # %afterloop
+; SSE42-NEXT:    paddd %xmm0, %xmm2
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    paddd %xmm2, %xmm1
+; SSE42-NEXT:    pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT:    paddd %xmm1, %xmm0
+; SSE42-NEXT:    pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT:    paddd %xmm0, %xmm1
+; SSE42-NEXT:    movd %xmm1, %eax
+; SSE42-NEXT:    retq
+;
 ; AVX1-LABEL: add_used_by_loop_phi:
 ; AVX1:       # %bb.0: # %entry
 ; AVX1-NEXT:    addq %rdx, %rdi
@@ -3145,26 +3586,13 @@ afterloop:
 }
 
 define <16 x i32> @extract_concat_pmaddwd(<32 x i16> %a, <32 x i16> %b) {
-; CHECK-LABEL: extract_concat_pmaddwd:
-; CHECK:       # %bb.0:
-; CHECK-NEXT:    vextractf128 $1, %ymm2, %xmm4
-; CHECK-NEXT:    vextractf128 $1, %ymm0, %xmm5
-; CHECK-NEXT:    vpmaddwd %xmm4, %xmm5, %xmm4
-; CHECK-NEXT:    vpmaddwd %xmm2, %xmm0, %xmm0
-; CHECK-NEXT:    vinsertf128 $1, %xmm4, %ymm0, %ymm0
-; CHECK-NEXT:    vextractf128 $1, %ymm3, %xmm2
-; CHECK-NEXT:    vextractf128 $1, %ymm1, %xmm4
-; CHECK-NEXT:    vpmaddwd %xmm2, %xmm4, %xmm2
-; CHECK-NEXT:    vpmaddwd %xmm3, %xmm1, %xmm1
-; CHECK-NEXT:    vinsertf128 $1, %xmm2, %ymm1, %ymm1
-; CHECK-NEXT:    retq
-; SSE2-LABEL: extract_concat_pmaddwd:
-; SSE2:       # %bb.0:
-; SSE2-NEXT:    pmaddwd %xmm4, %xmm0
-; SSE2-NEXT:    pmaddwd %xmm5, %xmm1
-; SSE2-NEXT:    pmaddwd %xmm6, %xmm2
-; SSE2-NEXT:    pmaddwd %xmm7, %xmm3
-; SSE2-NEXT:    retq
+; SSE-LABEL: extract_concat_pmaddwd:
+; SSE:       # %bb.0:
+; SSE-NEXT:    pmaddwd %xmm4, %xmm0
+; SSE-NEXT:    pmaddwd %xmm5, %xmm1
+; SSE-NEXT:    pmaddwd %xmm6, %xmm2
+; SSE-NEXT:    pmaddwd %xmm7, %xmm3
+; SSE-NEXT:    retq
 ;
 ; AVX1-LABEL: extract_concat_pmaddwd:
 ; AVX1:       # %bb.0:



More information about the llvm-commits mailing list