This is an archive of the discontinued LLVM Phabricator instance.

AMDGPU: Expand remaining system atomic operations
Needs ReviewPublic

Authored by arsenm on Aug 8 2023, 1:38 PM.

Download Raw Diff

Details

Reviewers

rampitec
doru1004
yaxunl
kerbowa
JonChesterfield
b-sumner

Group Reviewers

Restricted Project

Summary

System scope atomics need to use cmpxchg
loops. aea5980e26e6a87dab9f8acb10eb3a59dd143cb1 started this, this
expands the set to cover the remaining integer operations.

Don't expand xchg and add, those theoretically should work over PCIe.

Diff Detail

Unit TestsFailed

	Time	Test
	2,360 ms	x64 debian > LLVM.CodeGen/AMDGPU::flat_atomics_i32_system.ll
	2,540 ms	x64 debian > LLVM.CodeGen/AMDGPU::flat_atomics_i64_system.ll
	2,510 ms	x64 debian > LLVM.CodeGen/AMDGPU::global_atomics_i32_system.ll
	2,700 ms	x64 debian > LLVM.CodeGen/AMDGPU::global_atomics_i64_system.ll
	970 ms	x64 debian > LLVM.CodeGen/AMDGPU::llvm.amdgcn.atomic.dec.ll
		View Full Test Results (6 Failed)

Event Timeline

arsenm created this revision.Aug 8 2023, 1:38 PM

Herald added a project: Restricted Project. · View Herald TranscriptAug 8 2023, 1:38 PM

Herald added subscribers: foad, hiraditya, tpr and 3 others. · View Herald Transcript

arsenm requested review of this revision.Aug 8 2023, 1:38 PM

Herald added a project: Restricted Project. · View Herald TranscriptAug 8 2023, 1:38 PM

Herald added a subscriber: wdng. · View Herald Transcript

Harbormaster completed remote builds in B251183: Diff 548335.Aug 8 2023, 1:39 PM

rampitec added a reviewer: b-sumner.Aug 8 2023, 1:45 PM

PCIe supports integer fetch-add, swap, and compare-and-swap.

Don't expand xchg or add

It seems unfair to me, we give an option to override it for FP atomics, but not for INT.

llvm/lib/Target/AMDGPU/SIISelLowering.cpp
14166	It does not support it for system scope atomics, it just supports it.

In D157437#4571294, @rampitec wrote:

It seems unfair to me, we give an option to override it for FP atomics, but not for INT.

The FP option is also broken and should be removed. There are two separate properties. We should have something for the FP properties that can be ignored on the specific instruction, and one for ignore the scope (although I don't know why the unsafe usage can't just use the wrong scope)

arsenm added inline comments.Aug 8 2023, 4:58 PM

llvm/lib/Target/AMDGPU/SIISelLowering.cpp
14166	so what's the distinction? It's there but useless ?

rampitec added inline comments.Aug 8 2023, 5:02 PM

llvm/lib/Target/AMDGPU/SIISelLowering.cpp
14166	'system' here is just an indicator (quite imperfect) it can go over PCIe. But the PCIe itself just supports these and does not know about scopes.

In D157437#4571323, @arsenm wrote:

In D157437#4571294, @rampitec wrote:

It seems unfair to me, we give an option to override it for FP atomics, but not for INT.

The FP option is also broken and should be removed. There are two separate properties. We should have something for the FP properties that can be ignored on the specific instruction, and one for ignore the scope (although I don't know why the unsafe usage can't just use the wrong scope)

My understanding is that there are 3 situations:

corse-grained memory: all integer atomic ops work, fp atomics (if available) work
fine-grained memory with PCIE: only integer add/xchg/cmpxchg work, others need to be transformed to cmpxchg loop
fine-grained memory with XGMI: all integer atomic ops work, fp atomics not work

so we need separate options for unsafe-fp-atomics and unsafe-pcie-integer-atomics

If users make sure they only use certain memories, then they can specify suitable options for their usecase:

corse-grained memory only: -unsafe-fp-atomics -unsafe-pcie-integer-atomics
fine-grained memory with PCIE:
fine-grained memory with XGMI: -unsafe-pcie-integer-atomics

Harbormaster completed remote builds in B251232: Diff 548397.Aug 8 2023, 9:11 PM

In D157437#4571594, @yaxunl wrote:

If users make sure they only use certain memories, then they can specify suitable options for their usecase:

corse-grained memory only: -unsafe-fp-atomics -unsafe-pcie-integer-atomics
fine-grained memory with PCIE:
fine-grained memory with XGMI: -unsafe-pcie-integer-atomics

I'm not totally sure I'm following the setup here. It sounds like someone writes fetch_or to a global in addrspace(1) and gets it expanded to CAS unless they also pass a scary command line flag which will miscompile other atomic operations which do actually need the expansion.

We could use 'system' scope to mean 'flat CAS instruction' but as pointed out above that'll kill performance on non-pcie systems, plus it's really easy to emit system scope instructions unintentionally since that's the default.

Is the root problem that addrspace annotation is inaccurate? It seems that architecture + which memory contains the variable is exactly sufficient to pick the instruction, at which point I don't see what the command line flags would be for.

@jhuber6 I think libc uses system scope everywhere because the only intrinsics that give access to device scope are opencl ones with constraints on the right type of atomic type argument. If it expands fetch_or to CAS we're losing performance.

arsenm mentioned this in D157389: AutoUpgrade: Use syncscope("agent") atomic.inc/dec intrinsic upgrade.Aug 9 2023, 3:58 PM

In D157437#4572665, @JonChesterfield wrote:

In D157437#4571594, @yaxunl wrote:

If users make sure they only use certain memories, then they can specify suitable options for their usecase:

corse-grained memory only: -unsafe-fp-atomics -unsafe-pcie-integer-atomics
fine-grained memory with PCIE:
fine-grained memory with XGMI: -unsafe-pcie-integer-atomics

I'm not totally sure I'm following the setup here. It sounds like someone writes fetch_or to a global in addrspace(1) and gets it expanded to CAS unless they also pass a scary command line flag which will miscompile other atomic operations which do actually need the expansion.

We kind of need to have a parameter or set of atomic functions which correspond to the various restrictions, that end up emitting some kind of qualifier on regular atomicrmw. The current unsafe-fp-atomics flag is bogus, it came to mean too many things (both ignore memory safety, and ignore FP mode mismatches) and the core issue has absolutely nothing to do with floating point (there is a dimension of floating point issues, which is also underspecified) but we can ignore that part for the moment. The corresponding attribute also breaks on inlining, such that unsafe code can infect safe code.

We could use 'system' scope to mean 'flat CAS instruction' but as pointed out above that'll kill performance on non-pcie systems, plus it's really easy to emit system scope instructions unintentionally since that's the default.

Yes, that is what we must do. Doesn't matter what the performance, an undecorated atomic should always work no matter what.

Is the root problem that addrspace annotation is inaccurate? It seems that architecture + which memory contains the variable is exactly sufficient to pick the instruction, at which point I don't see what the command line flags would be for.

This isn't covered by address space, it's possibly should be a few new scopes. If not a scope, some other per-instruction metadata.

@jhuber6 I think libc uses system scope everywhere because the only intrinsics that give access to device scope are opencl ones with constraints on the right type of atomic type argument. If it expands fetch_or to CAS we're losing performance.

These just need to thread a choice through. I think the openmp device RTL isn't threading through the appropriate scope either

ping, I think we just need to go with this and add in the new thing later. Also would like clarification on whether add/xchg at system scope are supposed to work

ping

In D157437#4614101, @arsenm wrote:

ping, I think we just need to go with this and add in the new thing later. Also would like clarification on whether add/xchg at system scope are supposed to work

This will cause perf regression for XGMI users. We cannot afford that.

Maybe add another option -amdgpu-safe-pcie-atomics to enable the new changes (default off).

In D157437#4644295, @yaxunl wrote:

In D157437#4614101, @arsenm wrote:

ping, I think we just need to go with this and add in the new thing later. Also would like clarification on whether add/xchg at system scope are supposed to work

This will cause perf regression for XGMI users. We cannot afford that.

Nobody complained when the last batch were fixed

Maybe add another option -amdgpu-safe-pcie-atomics to enable the new changes (default off).

Absolutely not

In D157437#4644366, @arsenm wrote:

In D157437#4644295, @yaxunl wrote:

In D157437#4614101, @arsenm wrote:

ping, I think we just need to go with this and add in the new thing later. Also would like clarification on whether add/xchg at system scope are supposed to work

This will cause perf regression for XGMI users. We cannot afford that.

Nobody complained when the last batch were fixed

Also correctness trumps speed. We should establish a working baseline

In D157437#4644367, @arsenm wrote:

In D157437#4644366, @arsenm wrote:

In D157437#4644295, @yaxunl wrote:

In D157437#4614101, @arsenm wrote:

ping, I think we just need to go with this and add in the new thing later. Also would like clarification on whether add/xchg at system scope are supposed to work

This will cause perf regression for XGMI users. We cannot afford that.

Nobody complained when the last batch were fixed

Also correctness trumps speed. We should establish a working baseline

If the XGMI users complain, do we have an existing approach to recover the performance by modifying their code?

How about making the default always work but adding an option -amdgpu-unsafe-integer-ops to allow integer atomic rmw ops? Then at least they have a way to recover the performance.

Revision Contents

Path

Size

llvm/

lib/

Target/

AMDGPU/

SIISelLowering.cpp

25 lines

test/

CodeGen/

AMDGPU/

GlobalISel/

atomicrmw_udec_wrap.ll

1132 lines

atomicrmw_uinc_wrap.ll

1092 lines

flat_atomics_i32_system.ll

2688 lines

flat_atomics_i64_system.ll

3740 lines

global_atomics_i32_system.ll

2790 lines

global_atomics_i64_system.ll

3524 lines

Transforms/

AtomicExpand/

AMDGPU/

expand-atomic-i16-system.ll

39 lines

expand-atomic-i8-system.ll

39 lines

Diff 548397

llvm/lib/Target/AMDGPU/SIISelLowering.cpp

This file is larger than 256 KB, so syntax highlighting is disabled by default.

	Show First 20 Lines • Show All 9,991 Lines • ▼ Show 20 Lines
	});			});
	return Kind;			return Kind;
	};			};

	bool HasSystemScope =			bool HasSystemScope =
	SSID == SyncScope::System \|\|			SSID == SyncScope::System \|\|
	SSID == RMW->getContext().getOrInsertSyncScopeID("one-as");			SSID == RMW->getContext().getOrInsertSyncScopeID("one-as");

	switch (RMW->getOperation()) {			auto Op = RMW->getOperation();
				switch (Op) {
	case AtomicRMWInst::FAdd: {			case AtomicRMWInst::FAdd: {
	Type *Ty = RMW->getType();			Type *Ty = RMW->getType();

	if (Ty->isHalfTy())			if (Ty->isHalfTy())
	return AtomicExpansionKind::CmpXChg;			return AtomicExpansionKind::CmpXChg;

	if (!Ty->isFloatTy() && (!Subtarget->hasGFX90AInsts() \|\| !Ty->isDoubleTy()))			if (!Ty->isFloatTy() && (!Subtarget->hasGFX90AInsts() \|\| !Ty->isDoubleTy()))
	return AtomicExpansionKind::CmpXChg;			return AtomicExpansionKind::CmpXChg;
	▲ Show 20 Lines • Show All 58 Lines • ▼ Show 20 Lines
	->getFnAttribute("amdgpu-unsafe-fp-atomics")			->getFnAttribute("amdgpu-unsafe-fp-atomics")
	.getValueAsString() == "true"			.getValueAsString() == "true"
	? ReportUnsafeHWInst(AtomicExpansionKind::None)			? ReportUnsafeHWInst(AtomicExpansionKind::None)
	: AtomicExpansionKind::CmpXChg;			: AtomicExpansionKind::CmpXChg;
	}			}

	return AtomicExpansionKind::CmpXChg;			return AtomicExpansionKind::CmpXChg;
	}			}
	case AtomicRMWInst::FMin:			case AtomicRMWInst::Xchg:
	case AtomicRMWInst::FMax:			case AtomicRMWInst::Add:
	case AtomicRMWInst::Min:			// PCIe supports add and xchg for system atomics.
				rampitecUnsubmitted Not Done Reply Inline Actions It does not support it for system scope atomics, it just supports it. rampitec: It does not support it for system scope atomics, it just supports it.
				arsenmAuthorUnsubmitted Done Reply Inline Actions so what's the distinction? It's there but useless ? arsenm: so what's the distinction? It's there but useless ?
				rampitecUnsubmitted Not Done Reply Inline Actions 'system' here is just an indicator (quite imperfect) it can go over PCIe. But the PCIe itself just supports these and does not know about scopes. rampitec: 'system' here is just an indicator (quite imperfect) it can go over PCIe. But the PCIe itself…
				break;
				case AtomicRMWInst::Sub:
				case AtomicRMWInst::And:
				case AtomicRMWInst::Or:
				case AtomicRMWInst::Xor:
	case AtomicRMWInst::Max:			case AtomicRMWInst::Max:
				case AtomicRMWInst::Min:
				case AtomicRMWInst::UMax:
	case AtomicRMWInst::UMin:			case AtomicRMWInst::UMin:
	case AtomicRMWInst::UMax: {			case AtomicRMWInst::FMin:
				case AtomicRMWInst::FMax:
				case AtomicRMWInst::UIncWrap:
				case AtomicRMWInst::UDecWrap: {
	if (AMDGPU::isFlatGlobalAddrSpace(AS)) {			if (AMDGPU::isFlatGlobalAddrSpace(AS)) {
	if (RMW->getType()->isFloatTy() &&			if (AtomicRMWInst::isFPOperation(Op) &&
	unsafeFPAtomicsDisabled(RMW->getFunction()))			unsafeFPAtomicsDisabled(RMW->getFunction()))
	return AtomicExpansionKind::CmpXChg;			return AtomicExpansionKind::CmpXChg;

	// Always expand system scope min/max atomics.			// Always expand system scope atomics.
	if (HasSystemScope)			if (HasSystemScope)
	return AtomicExpansionKind::CmpXChg;			return AtomicExpansionKind::CmpXChg;
	}			}
	break;			break;
	}			}
	default:			default:
	break;			break;
	}			}
	▲ Show 20 Lines • Show All 335 Lines • Show Last 20 Lines

llvm/test/CodeGen/AMDGPU/GlobalISel/atomicrmw_udec_wrap.ll

Show First 20 Lines • Show All 471 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 42 syncscope("agent") seq_cst, align 4		%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 42 syncscope("agent") seq_cst, align 4
store i32 %result, ptr addrspace(1) %out, align 4		store i32 %result, ptr addrspace(1) %out, align 4
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_dec_ret_i32_offset_system(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_dec_ret_i32_offset_system(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_dec_ret_i32_offset_system:		; CI-LABEL: global_atomic_dec_ret_i32_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; CI-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v2, 42		; CI-NEXT: s_mov_b64 s[2:3], 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s2, s2, 16		; CI-NEXT: s_load_dword s0, s[6:7], 0x4
; CI-NEXT: s_addc_u32 s3, s3, 0		; CI-NEXT: s_add_u32 s6, s6, 16
; CI-NEXT: v_mov_b32_e32 v0, s2		; CI-NEXT: s_addc_u32 s7, s7, 0
; CI-NEXT: v_mov_b32_e32 v1, s3		; CI-NEXT: s_waitcnt lgkmcnt(0)
		; CI-NEXT: v_mov_b32_e32 v0, s0
		; CI-NEXT: .LBB6_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: v_mov_b32_e32 v1, v0
		; CI-NEXT: v_subrev_i32_e32 v0, vcc, 1, v1
		; CI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; CI-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; CI-NEXT: v_mov_b32_e32 v2, s6
		; CI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; CI-NEXT: v_mov_b32_e32 v3, s7
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_dec v2, v[0:1], v2 glc		; CI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; CI-NEXT: s_waitcnt vmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
; CI-NEXT: v_mov_b32_e32 v0, s0		; CI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
; CI-NEXT: v_mov_b32_e32 v1, s1		; CI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
; CI-NEXT: flat_store_dword v[0:1], v2		; CI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; CI-NEXT: s_cbranch_execnz .LBB6_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
		; CI-NEXT: s_or_b64 exec, exec, s[2:3]
		; CI-NEXT: v_mov_b32_e32 v1, s4
		; CI-NEXT: v_mov_b32_e32 v2, s5
		; CI-NEXT: flat_store_dword v[1:2], v0
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: global_atomic_dec_ret_i32_offset_system:		; VI-LABEL: global_atomic_dec_ret_i32_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; VI-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v2, 42		; VI-NEXT: s_mov_b64 s[2:3], 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s2, s2, 16		; VI-NEXT: s_load_dword s0, s[6:7], 0x10
; VI-NEXT: s_addc_u32 s3, s3, 0		; VI-NEXT: s_add_u32 s6, s6, 16
; VI-NEXT: v_mov_b32_e32 v0, s2		; VI-NEXT: s_addc_u32 s7, s7, 0
; VI-NEXT: v_mov_b32_e32 v1, s3		; VI-NEXT: s_waitcnt lgkmcnt(0)
		; VI-NEXT: v_mov_b32_e32 v0, s0
		; VI-NEXT: .LBB6_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: v_mov_b32_e32 v1, v0
		; VI-NEXT: v_subrev_u32_e32 v0, vcc, 1, v1
		; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; VI-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; VI-NEXT: v_mov_b32_e32 v2, s6
		; VI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; VI-NEXT: v_mov_b32_e32 v3, s7
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_dec v2, v[0:1], v2 glc		; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; VI-NEXT: s_waitcnt vmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
; VI-NEXT: v_mov_b32_e32 v0, s0		; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
; VI-NEXT: v_mov_b32_e32 v1, s1		; VI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
; VI-NEXT: flat_store_dword v[0:1], v2		; VI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; VI-NEXT: s_cbranch_execnz .LBB6_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
		; VI-NEXT: s_or_b64 exec, exec, s[2:3]
		; VI-NEXT: v_mov_b32_e32 v1, s4
		; VI-NEXT: v_mov_b32_e32 v2, s5
		; VI-NEXT: flat_store_dword v[1:2], v0
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: global_atomic_dec_ret_i32_offset_system:		; GFX9-LABEL: global_atomic_dec_ret_i32_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[2:3], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0		; GFX9-NEXT: v_mov_b32_e32 v0, 0
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: s_load_dword s0, s[6:7], 0x10
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: v_mov_b32_e32 v1, s0
		; GFX9-NEXT: .LBB6_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: v_mov_b32_e32 v2, v1
		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v2
		; GFX9-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v2
		; GFX9-NEXT: v_subrev_u32_e32 v1, 1, v2
		; GFX9-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; GFX9-NEXT: v_cndmask_b32_e64 v1, v1, 42, s[0:1]
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: global_atomic_dec v0, v1, v0, s[2:3] offset:16 glc		; GFX9-NEXT: global_atomic_cmpswap v1, v0, v[1:2], s[6:7] offset:16 glc
; GFX9-NEXT: s_waitcnt vmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
; GFX9-NEXT: global_store_dword v1, v0, s[0:1]		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v1, v2
		; GFX9-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; GFX9-NEXT: s_cbranch_execnz .LBB6_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX9-NEXT: s_or_b64 exec, exec, s[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v0, 0
		; GFX9-NEXT: global_store_dword v0, v1, s[4:5]
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: global_atomic_dec_ret_i32_offset_system:		; GFX10-LABEL: global_atomic_dec_ret_i32_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42		; GFX10-NEXT: v_mov_b32_e32 v0, 0
; GFX10-NEXT: v_mov_b32_e32 v1, 0		; GFX10-NEXT: s_mov_b32 s1, 0
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: s_load_dword s0, s[6:7], 0x10
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v1, s0
		; GFX10-NEXT: .LBB6_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: v_mov_b32_e32 v2, v1
		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, 0, v2
		; GFX10-NEXT: v_cmp_lt_u32_e64 s0, 42, v2
		; GFX10-NEXT: v_subrev_nc_u32_e32 v1, 1, v2
		; GFX10-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v1, v1, 42, s0
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: global_atomic_dec v0, v1, v0, s[2:3] offset:16 glc		; GFX10-NEXT: global_atomic_cmpswap v1, v0, v[1:2], s[6:7] offset:16 glc
; GFX10-NEXT: s_waitcnt vmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
; GFX10-NEXT: global_store_dword v1, v0, s[0:1]		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, v1, v2
		; GFX10-NEXT: s_or_b32 s1, vcc_lo, s1
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s1
		; GFX10-NEXT: s_cbranch_execnz .LBB6_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX10-NEXT: s_or_b32 exec_lo, exec_lo, s1
		; GFX10-NEXT: v_mov_b32_e32 v0, 0
		; GFX10-NEXT: global_store_dword v0, v1, s[4:5]
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: global_atomic_dec_ret_i32_offset_system:		; GFX11-LABEL: global_atomic_dec_ret_i32_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0		; GFX11-NEXT: s_load_b128 s[4:7], s[0:1], 0x0
; GFX11-NEXT: v_dual_mov_b32 v0, 42 :: v_dual_mov_b32 v1, 0		; GFX11-NEXT: s_mov_b32 s1, 0
		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: s_load_b32 s0, s[6:7], 0x10
		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v0, 0 :: v_dual_mov_b32 v1, s0
		; GFX11-NEXT: .LBB6_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(NEXT) \| instid1(VALU_DEP_1)
		; GFX11-NEXT: v_mov_b32_e32 v2, v1
		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, 0, v2
		; GFX11-NEXT: v_cmp_lt_u32_e64 s0, 42, v2
		; GFX11-NEXT: v_subrev_nc_u32_e32 v1, 1, v2
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2)
		; GFX11-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instid1(SALU_CYCLE_1)
		; GFX11-NEXT: v_cndmask_b32_e64 v1, v1, 42, s0
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: global_atomic_dec_u32 v0, v1, v0, s[2:3] offset:16 glc		; GFX11-NEXT: global_atomic_cmpswap_b32 v1, v0, v[1:2], s[6:7] offset:16 glc
; GFX11-NEXT: s_waitcnt vmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
; GFX11-NEXT: global_store_b32 v1, v0, s[0:1]		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, v1, v2
		; GFX11-NEXT: s_or_b32 s1, vcc_lo, s1
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s1
		; GFX11-NEXT: s_cbranch_execnz .LBB6_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX11-NEXT: s_or_b32 exec_lo, exec_lo, s1
		; GFX11-NEXT: v_mov_b32_e32 v0, 0
		; GFX11-NEXT: global_store_b32 v0, v1, s[4:5]
; GFX11-NEXT: s_nop 0		; GFX11-NEXT: s_nop 0
; GFX11-NEXT: s_sendmsg sendmsg(MSG_DEALLOC_VGPRS)		; GFX11-NEXT: s_sendmsg sendmsg(MSG_DEALLOC_VGPRS)
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i32, ptr addrspace(1) %ptr, i32 4		%gep = getelementptr i32, ptr addrspace(1) %ptr, i32 4
%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 42 seq_cst, align 4		%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 42 seq_cst, align 4
store i32 %result, ptr addrspace(1) %out, align 4		store i32 %result, ptr addrspace(1) %out, align 4
ret void		ret void
}		}
▲ Show 20 Lines • Show All 134 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 42 syncscope("agent") seq_cst, align 4		%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 42 syncscope("agent") seq_cst, align 4
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_dec_noret_i32_offset_system(ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_dec_noret_i32_offset_system(ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_dec_noret_i32_offset_system:		; CI-LABEL: global_atomic_dec_noret_i32_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v2, 42		; CI-NEXT: s_mov_b64 s[2:3], 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s0, s0, 16		; CI-NEXT: s_load_dword s6, s[0:1], 0x4
; CI-NEXT: s_addc_u32 s1, s1, 0		; CI-NEXT: s_add_u32 s4, s0, 16
; CI-NEXT: v_mov_b32_e32 v0, s0		; CI-NEXT: s_addc_u32 s5, s1, 0
; CI-NEXT: v_mov_b32_e32 v1, s1		; CI-NEXT: s_waitcnt lgkmcnt(0)
		; CI-NEXT: v_mov_b32_e32 v1, s6
		; CI-NEXT: .LBB9_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: v_subrev_i32_e32 v0, vcc, 1, v1
		; CI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; CI-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; CI-NEXT: v_mov_b32_e32 v2, s4
		; CI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; CI-NEXT: v_mov_b32_e32 v3, s5
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_dec v[0:1], v2		; CI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; CI-NEXT: s_waitcnt vmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
		; CI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; CI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; CI-NEXT: v_mov_b32_e32 v1, v0
		; CI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; CI-NEXT: s_cbranch_execnz .LBB9_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: global_atomic_dec_noret_i32_offset_system:		; VI-LABEL: global_atomic_dec_noret_i32_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v2, 42		; VI-NEXT: s_mov_b64 s[2:3], 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s0, s0, 16		; VI-NEXT: s_load_dword s6, s[0:1], 0x10
; VI-NEXT: s_addc_u32 s1, s1, 0		; VI-NEXT: s_add_u32 s4, s0, 16
; VI-NEXT: v_mov_b32_e32 v0, s0		; VI-NEXT: s_addc_u32 s5, s1, 0
; VI-NEXT: v_mov_b32_e32 v1, s1		; VI-NEXT: s_waitcnt lgkmcnt(0)
		; VI-NEXT: v_mov_b32_e32 v1, s6
		; VI-NEXT: .LBB9_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: v_subrev_u32_e32 v0, vcc, 1, v1
		; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; VI-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; VI-NEXT: v_mov_b32_e32 v2, s4
		; VI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; VI-NEXT: v_mov_b32_e32 v3, s5
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_dec v[0:1], v2		; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; VI-NEXT: s_waitcnt vmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
		; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; VI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; VI-NEXT: v_mov_b32_e32 v1, v0
		; VI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; VI-NEXT: s_cbranch_execnz .LBB9_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: global_atomic_dec_noret_i32_offset_system:		; GFX9-LABEL: global_atomic_dec_noret_i32_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[4:5], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0		; GFX9-NEXT: v_mov_b32_e32 v2, 0
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: s_load_dword s0, s[2:3], 0x10
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: v_mov_b32_e32 v1, s0
		; GFX9-NEXT: .LBB9_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; GFX9-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; GFX9-NEXT: v_subrev_u32_e32 v0, 1, v1
		; GFX9-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: global_atomic_dec v1, v0, s[0:1] offset:16		; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[2:3] offset:16 glc
; GFX9-NEXT: s_waitcnt vmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; GFX9-NEXT: v_mov_b32_e32 v1, v0
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; GFX9-NEXT: s_cbranch_execnz .LBB9_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: global_atomic_dec_noret_i32_offset_system:		; GFX10-LABEL: global_atomic_dec_noret_i32_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42		; GFX10-NEXT: v_mov_b32_e32 v2, 0
; GFX10-NEXT: v_mov_b32_e32 v1, 0		; GFX10-NEXT: s_mov_b32 s1, 0
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: s_load_dword s0, s[2:3], 0x10
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v1, s0
		; GFX10-NEXT: .LBB9_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, 0, v1
		; GFX10-NEXT: v_cmp_lt_u32_e64 s0, 42, v1
		; GFX10-NEXT: v_subrev_nc_u32_e32 v0, 1, v1
		; GFX10-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 42, s0
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: global_atomic_dec v1, v0, s[0:1] offset:16		; GFX10-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[2:3] offset:16 glc
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt vmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
		; GFX10-NEXT: v_mov_b32_e32 v1, v0
		; GFX10-NEXT: s_or_b32 s1, vcc_lo, s1
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s1
		; GFX10-NEXT: s_cbranch_execnz .LBB9_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: global_atomic_dec_noret_i32_offset_system:		; GFX11-LABEL: global_atomic_dec_noret_i32_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0		; GFX11-NEXT: s_load_b64 s[2:3], s[0:1], 0x0
; GFX11-NEXT: v_dual_mov_b32 v0, 42 :: v_dual_mov_b32 v1, 0		; GFX11-NEXT: s_mov_b32 s1, 0
		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: s_load_b32 s0, s[2:3], 0x10
		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v2, 0 :: v_dual_mov_b32 v1, s0
		; GFX11-NEXT: .LBB9_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(SKIP_2) \| instid1(VALU_DEP_2)
		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, 0, v1
		; GFX11-NEXT: v_cmp_lt_u32_e64 s0, 42, v1
		; GFX11-NEXT: v_subrev_nc_u32_e32 v0, 1, v1
		; GFX11-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instid1(SALU_CYCLE_1)
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 42, s0
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: global_atomic_dec_u32 v1, v0, s[0:1] offset:16		; GFX11-NEXT: global_atomic_cmpswap_b32 v0, v2, v[0:1], s[2:3] offset:16 glc
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt vmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
		; GFX11-NEXT: v_mov_b32_e32 v1, v0
		; GFX11-NEXT: s_or_b32 s1, vcc_lo, s1
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s1
		; GFX11-NEXT: s_cbranch_execnz .LBB9_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i32, ptr addrspace(1) %ptr, i32 4		%gep = getelementptr i32, ptr addrspace(1) %ptr, i32 4
%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 42 seq_cst, align 4		%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 42 seq_cst, align 4
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_dec_ret_i32_offset_addr64(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_dec_ret_i32_offset_addr64(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_dec_ret_i32_offset_addr64:		; CI-LABEL: global_atomic_dec_ret_i32_offset_addr64:
▲ Show 20 Lines • Show All 349 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%result = atomicrmw udec_wrap ptr %gep, i32 42 syncscope("agent") seq_cst, align 4		%result = atomicrmw udec_wrap ptr %gep, i32 42 syncscope("agent") seq_cst, align 4
store i32 %result, ptr %out, align 4		store i32 %result, ptr %out, align 4
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_dec_ret_i32_offset_system(ptr %out, ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_dec_ret_i32_offset_system(ptr %out, ptr %ptr) #1 {
; CI-LABEL: flat_atomic_dec_ret_i32_offset_system:		; CI-LABEL: flat_atomic_dec_ret_i32_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; CI-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v2, 42
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s2, s2, 16		; CI-NEXT: s_add_u32 s2, s6, 16
; CI-NEXT: s_addc_u32 s3, s3, 0		; CI-NEXT: s_addc_u32 s3, s7, 0
; CI-NEXT: v_mov_b32_e32 v0, s2		; CI-NEXT: v_mov_b32_e32 v0, s2
; CI-NEXT: v_mov_b32_e32 v1, s3		; CI-NEXT: v_mov_b32_e32 v1, s3
		; CI-NEXT: flat_load_dword v0, v[0:1]
		; CI-NEXT: s_mov_b64 s[6:7], 0
		; CI-NEXT: .LBB14_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; CI-NEXT: v_mov_b32_e32 v1, v0
		; CI-NEXT: v_subrev_i32_e32 v0, vcc, 1, v1
		; CI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; CI-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; CI-NEXT: v_mov_b32_e32 v2, s2
		; CI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; CI-NEXT: v_mov_b32_e32 v3, s3
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_dec v2, v[0:1], v2 glc		; CI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
; CI-NEXT: v_mov_b32_e32 v0, s0		; CI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
; CI-NEXT: v_mov_b32_e32 v1, s1		; CI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
; CI-NEXT: flat_store_dword v[0:1], v2		; CI-NEXT: s_andn2_b64 exec, exec, s[6:7]
		; CI-NEXT: s_cbranch_execnz .LBB14_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
		; CI-NEXT: s_or_b64 exec, exec, s[6:7]
		; CI-NEXT: v_mov_b32_e32 v1, s4
		; CI-NEXT: v_mov_b32_e32 v2, s5
		; CI-NEXT: flat_store_dword v[1:2], v0
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: flat_atomic_dec_ret_i32_offset_system:		; VI-LABEL: flat_atomic_dec_ret_i32_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; VI-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v2, 42
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s2, s2, 16		; VI-NEXT: s_add_u32 s2, s6, 16
; VI-NEXT: s_addc_u32 s3, s3, 0		; VI-NEXT: s_addc_u32 s3, s7, 0
; VI-NEXT: v_mov_b32_e32 v0, s2		; VI-NEXT: v_mov_b32_e32 v0, s2
; VI-NEXT: v_mov_b32_e32 v1, s3		; VI-NEXT: v_mov_b32_e32 v1, s3
		; VI-NEXT: flat_load_dword v0, v[0:1]
		; VI-NEXT: s_mov_b64 s[6:7], 0
		; VI-NEXT: .LBB14_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; VI-NEXT: v_mov_b32_e32 v1, v0
		; VI-NEXT: v_subrev_u32_e32 v0, vcc, 1, v1
		; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; VI-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; VI-NEXT: v_mov_b32_e32 v2, s2
		; VI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; VI-NEXT: v_mov_b32_e32 v3, s3
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_dec v2, v[0:1], v2 glc		; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
; VI-NEXT: v_mov_b32_e32 v0, s0		; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
; VI-NEXT: v_mov_b32_e32 v1, s1		; VI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
; VI-NEXT: flat_store_dword v[0:1], v2		; VI-NEXT: s_andn2_b64 exec, exec, s[6:7]
		; VI-NEXT: s_cbranch_execnz .LBB14_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
		; VI-NEXT: s_or_b64 exec, exec, s[6:7]
		; VI-NEXT: v_mov_b32_e32 v1, s4
		; VI-NEXT: v_mov_b32_e32 v2, s5
		; VI-NEXT: flat_store_dword v[1:2], v0
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: flat_atomic_dec_ret_i32_offset_system:		; GFX9-LABEL: flat_atomic_dec_ret_i32_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v2, 42		; GFX9-NEXT: s_mov_b64 s[2:3], 0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, s2		; GFX9-NEXT: v_mov_b32_e32 v0, s6
; GFX9-NEXT: v_mov_b32_e32 v1, s3		; GFX9-NEXT: v_mov_b32_e32 v1, s7
		; GFX9-NEXT: flat_load_dword v0, v[0:1] offset:16
		; GFX9-NEXT: .LBB14_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX9-NEXT: v_mov_b32_e32 v1, v0
		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; GFX9-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; GFX9-NEXT: v_mov_b32_e32 v2, s6
		; GFX9-NEXT: v_subrev_u32_e32 v0, 1, v1
		; GFX9-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; GFX9-NEXT: v_mov_b32_e32 v3, s7
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: flat_atomic_dec v2, v[0:1], v2 offset:16 glc		; GFX9-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
; GFX9-NEXT: v_mov_b32_e32 v0, s0		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
; GFX9-NEXT: v_mov_b32_e32 v1, s1		; GFX9-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
; GFX9-NEXT: flat_store_dword v[0:1], v2		; GFX9-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; GFX9-NEXT: s_cbranch_execnz .LBB14_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX9-NEXT: s_or_b64 exec, exec, s[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v1, s4
		; GFX9-NEXT: v_mov_b32_e32 v2, s5
		; GFX9-NEXT: flat_store_dword v[1:2], v0
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: flat_atomic_dec_ret_i32_offset_system:		; GFX10-LABEL: flat_atomic_dec_ret_i32_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v2, 42		; GFX10-NEXT: s_mov_b32 s1, 0
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
; GFX10-NEXT: s_add_u32 s2, s2, 16		; GFX10-NEXT: s_add_u32 s2, s6, 16
; GFX10-NEXT: s_addc_u32 s3, s3, 0		; GFX10-NEXT: s_addc_u32 s3, s7, 0
; GFX10-NEXT: v_mov_b32_e32 v0, s2		; GFX10-NEXT: v_mov_b32_e32 v0, s2
; GFX10-NEXT: v_mov_b32_e32 v1, s3		; GFX10-NEXT: v_mov_b32_e32 v1, s3
		; GFX10-NEXT: flat_load_dword v0, v[0:1]
		; GFX10-NEXT: .LBB14_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v1, v0
		; GFX10-NEXT: v_mov_b32_e32 v2, s2
		; GFX10-NEXT: v_mov_b32_e32 v3, s3
		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, 0, v1
		; GFX10-NEXT: v_cmp_lt_u32_e64 s0, 42, v1
		; GFX10-NEXT: v_subrev_nc_u32_e32 v0, 1, v1
		; GFX10-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 42, s0
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: flat_atomic_dec v2, v[0:1], v2 glc		; GFX10-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
; GFX10-NEXT: v_mov_b32_e32 v0, s0		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
; GFX10-NEXT: v_mov_b32_e32 v1, s1		; GFX10-NEXT: s_or_b32 s1, vcc_lo, s1
; GFX10-NEXT: flat_store_dword v[0:1], v2		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s1
		; GFX10-NEXT: s_cbranch_execnz .LBB14_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX10-NEXT: s_or_b32 exec_lo, exec_lo, s1
		; GFX10-NEXT: v_mov_b32_e32 v1, s4
		; GFX10-NEXT: v_mov_b32_e32 v2, s5
		; GFX10-NEXT: flat_store_dword v[1:2], v0
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: flat_atomic_dec_ret_i32_offset_system:		; GFX11-LABEL: flat_atomic_dec_ret_i32_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0		; GFX11-NEXT: s_load_b128 s[4:7], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v2, 42		; GFX11-NEXT: s_mov_b32 s1, 0
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v0, s2 :: v_dual_mov_b32 v1, s3		; GFX11-NEXT: v_dual_mov_b32 v0, s6 :: v_dual_mov_b32 v1, s7
		; GFX11-NEXT: flat_load_b32 v0, v[0:1] offset:16
		; GFX11-NEXT: .LBB14_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v1, v0 :: v_dual_mov_b32 v2, s6
		; GFX11-NEXT: v_mov_b32_e32 v3, s7
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) \| instskip(SKIP_2) \| instid1(VALU_DEP_2)
		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, 0, v1
		; GFX11-NEXT: v_cmp_lt_u32_e64 s0, 42, v1
		; GFX11-NEXT: v_subrev_nc_u32_e32 v0, 1, v1
		; GFX11-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instid1(SALU_CYCLE_1)
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 42, s0
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: flat_atomic_dec_u32 v2, v[0:1], v2 offset:16 glc		; GFX11-NEXT: flat_atomic_cmpswap_b32 v0, v[2:3], v[0:1] offset:16 glc
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
; GFX11-NEXT: v_dual_mov_b32 v0, s0 :: v_dual_mov_b32 v1, s1		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
; GFX11-NEXT: flat_store_b32 v[0:1], v2		; GFX11-NEXT: s_or_b32 s1, vcc_lo, s1
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s1
		; GFX11-NEXT: s_cbranch_execnz .LBB14_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX11-NEXT: s_or_b32 exec_lo, exec_lo, s1
		; GFX11-NEXT: v_dual_mov_b32 v1, s4 :: v_dual_mov_b32 v2, s5
		; GFX11-NEXT: flat_store_b32 v[1:2], v0
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i32, ptr %ptr, i32 4		%gep = getelementptr i32, ptr %ptr, i32 4
%result = atomicrmw udec_wrap ptr %gep, i32 42 seq_cst, align 4		%result = atomicrmw udec_wrap ptr %gep, i32 42 seq_cst, align 4
store i32 %result, ptr %out, align 4		store i32 %result, ptr %out, align 4
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_dec_noret_i32(ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_dec_noret_i32(ptr %ptr) #1 {
▲ Show 20 Lines • Show All 150 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%result = atomicrmw udec_wrap ptr %gep, i32 42 syncscope("agent") seq_cst, align 4		%result = atomicrmw udec_wrap ptr %gep, i32 42 syncscope("agent") seq_cst, align 4
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_dec_noret_i32_offset_system(ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_dec_noret_i32_offset_system(ptr %ptr) #1 {
; CI-LABEL: flat_atomic_dec_noret_i32_offset_system:		; CI-LABEL: flat_atomic_dec_noret_i32_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v2, 42		; CI-NEXT: s_mov_b64 s[4:5], 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s0, s0, 16		; CI-NEXT: s_add_u32 s2, s0, 16
; CI-NEXT: s_addc_u32 s1, s1, 0		; CI-NEXT: s_addc_u32 s3, s1, 0
; CI-NEXT: v_mov_b32_e32 v0, s0		; CI-NEXT: v_mov_b32_e32 v0, s2
; CI-NEXT: v_mov_b32_e32 v1, s1		; CI-NEXT: v_mov_b32_e32 v1, s3
		; CI-NEXT: flat_load_dword v1, v[0:1]
		; CI-NEXT: .LBB17_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; CI-NEXT: v_subrev_i32_e32 v0, vcc, 1, v1
		; CI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; CI-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; CI-NEXT: v_mov_b32_e32 v2, s2
		; CI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; CI-NEXT: v_mov_b32_e32 v3, s3
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_dec v[0:1], v2		; CI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
		; CI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; CI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; CI-NEXT: v_mov_b32_e32 v1, v0
		; CI-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; CI-NEXT: s_cbranch_execnz .LBB17_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: flat_atomic_dec_noret_i32_offset_system:		; VI-LABEL: flat_atomic_dec_noret_i32_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v2, 42		; VI-NEXT: s_mov_b64 s[4:5], 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s0, s0, 16		; VI-NEXT: s_add_u32 s2, s0, 16
; VI-NEXT: s_addc_u32 s1, s1, 0		; VI-NEXT: s_addc_u32 s3, s1, 0
; VI-NEXT: v_mov_b32_e32 v0, s0		; VI-NEXT: v_mov_b32_e32 v0, s2
; VI-NEXT: v_mov_b32_e32 v1, s1		; VI-NEXT: v_mov_b32_e32 v1, s3
		; VI-NEXT: flat_load_dword v1, v[0:1]
		; VI-NEXT: .LBB17_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; VI-NEXT: v_subrev_u32_e32 v0, vcc, 1, v1
		; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; VI-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; VI-NEXT: v_mov_b32_e32 v2, s2
		; VI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; VI-NEXT: v_mov_b32_e32 v3, s3
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_dec v[0:1], v2		; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
		; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; VI-NEXT: v_mov_b32_e32 v1, v0
		; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; VI-NEXT: s_cbranch_execnz .LBB17_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: flat_atomic_dec_noret_i32_offset_system:		; GFX9-LABEL: flat_atomic_dec_noret_i32_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v2, 42		; GFX9-NEXT: s_mov_b64 s[4:5], 0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, s0		; GFX9-NEXT: v_mov_b32_e32 v0, s2
; GFX9-NEXT: v_mov_b32_e32 v1, s1		; GFX9-NEXT: v_mov_b32_e32 v1, s3
		; GFX9-NEXT: flat_load_dword v1, v[0:1] offset:16
		; GFX9-NEXT: .LBB17_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
		; GFX9-NEXT: v_cmp_lt_u32_e64 s[0:1], 42, v1
		; GFX9-NEXT: v_subrev_u32_e32 v0, 1, v1
		; GFX9-NEXT: v_mov_b32_e32 v2, s2
		; GFX9-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; GFX9-NEXT: v_mov_b32_e32 v3, s3
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: flat_atomic_dec v[0:1], v2 offset:16		; GFX9-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; GFX9-NEXT: v_mov_b32_e32 v1, v0
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; GFX9-NEXT: s_cbranch_execnz .LBB17_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: flat_atomic_dec_noret_i32_offset_system:		; GFX10-LABEL: flat_atomic_dec_noret_i32_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v2, 42
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
; GFX10-NEXT: s_add_u32 s0, s0, 16		; GFX10-NEXT: s_add_u32 s2, s0, 16
; GFX10-NEXT: s_addc_u32 s1, s1, 0		; GFX10-NEXT: s_addc_u32 s3, s1, 0
; GFX10-NEXT: v_mov_b32_e32 v0, s0		; GFX10-NEXT: v_mov_b32_e32 v0, s2
; GFX10-NEXT: v_mov_b32_e32 v1, s1		; GFX10-NEXT: v_mov_b32_e32 v1, s3
		; GFX10-NEXT: s_mov_b32 s1, 0
		; GFX10-NEXT: flat_load_dword v1, v[0:1]
		; GFX10-NEXT: .LBB17_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, 0, v1
		; GFX10-NEXT: v_cmp_lt_u32_e64 s0, 42, v1
		; GFX10-NEXT: v_subrev_nc_u32_e32 v0, 1, v1
		; GFX10-NEXT: v_mov_b32_e32 v2, s2
		; GFX10-NEXT: v_mov_b32_e32 v3, s3
		; GFX10-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 42, s0
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: flat_atomic_dec v[0:1], v2		; GFX10-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
		; GFX10-NEXT: v_mov_b32_e32 v1, v0
		; GFX10-NEXT: s_or_b32 s1, vcc_lo, s1
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s1
		; GFX10-NEXT: s_cbranch_execnz .LBB17_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: flat_atomic_dec_noret_i32_offset_system:		; GFX11-LABEL: flat_atomic_dec_noret_i32_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0		; GFX11-NEXT: s_load_b64 s[2:3], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v2, 42		; GFX11-NEXT: s_mov_b32 s1, 0
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v0, s0 :: v_dual_mov_b32 v1, s1		; GFX11-NEXT: v_dual_mov_b32 v0, s2 :: v_dual_mov_b32 v1, s3
		; GFX11-NEXT: flat_load_b32 v1, v[0:1] offset:16
		; GFX11-NEXT: .LBB17_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, 0, v1
		; GFX11-NEXT: v_cmp_lt_u32_e64 s0, 42, v1
		; GFX11-NEXT: v_subrev_nc_u32_e32 v0, 1, v1
		; GFX11-NEXT: v_dual_mov_b32 v2, s2 :: v_dual_mov_b32 v3, s3
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3)
		; GFX11-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) \| instid1(SALU_CYCLE_1)
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 42, s0
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: flat_atomic_dec_u32 v[0:1], v2 offset:16		; GFX11-NEXT: flat_atomic_cmpswap_b32 v0, v[2:3], v[0:1] offset:16 glc
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
		; GFX11-NEXT: v_mov_b32_e32 v1, v0
		; GFX11-NEXT: s_or_b32 s1, vcc_lo, s1
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s1
		; GFX11-NEXT: s_cbranch_execnz .LBB17_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i32, ptr %ptr, i32 4		%gep = getelementptr i32, ptr %ptr, i32 4
%result = atomicrmw udec_wrap ptr %gep, i32 42 seq_cst, align 4		%result = atomicrmw udec_wrap ptr %gep, i32 42 seq_cst, align 4
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_dec_ret_i32_offset_addr64(ptr %out, ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_dec_ret_i32_offset_addr64(ptr %out, ptr %ptr) #1 {
; CI-LABEL: flat_atomic_dec_ret_i32_offset_addr64:		; CI-LABEL: flat_atomic_dec_ret_i32_offset_addr64:
▲ Show 20 Lines • Show All 592 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%result = atomicrmw udec_wrap ptr %gep, i64 42 syncscope("agent") seq_cst, align 8		%result = atomicrmw udec_wrap ptr %gep, i64 42 syncscope("agent") seq_cst, align 8
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_dec_noret_i64_offset_system(ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_dec_noret_i64_offset_system(ptr %ptr) #1 {
; CI-LABEL: flat_atomic_dec_noret_i64_offset_system:		; CI-LABEL: flat_atomic_dec_noret_i64_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v0, 42		; CI-NEXT: s_mov_b64 s[4:5], 0
; CI-NEXT: v_mov_b32_e32 v1, 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s0, s0, 32		; CI-NEXT: s_add_u32 s2, s0, 32
		; CI-NEXT: s_addc_u32 s3, s1, 0
		; CI-NEXT: s_add_u32 s0, s0, 36
; CI-NEXT: s_addc_u32 s1, s1, 0		; CI-NEXT: s_addc_u32 s1, s1, 0
; CI-NEXT: v_mov_b32_e32 v3, s1		; CI-NEXT: v_mov_b32_e32 v0, s2
; CI-NEXT: v_mov_b32_e32 v2, s0		; CI-NEXT: v_mov_b32_e32 v4, s1
		; CI-NEXT: v_mov_b32_e32 v1, s3
		; CI-NEXT: v_mov_b32_e32 v3, s0
		; CI-NEXT: flat_load_dword v2, v[0:1]
		; CI-NEXT: flat_load_dword v3, v[3:4]
		; CI-NEXT: .LBB24_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; CI-NEXT: v_subrev_i32_e32 v0, vcc, 1, v2
		; CI-NEXT: v_subbrev_u32_e32 v1, vcc, 0, v3, vcc
		; CI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
		; CI-NEXT: v_cmp_lt_u64_e64 s[0:1], 42, v[2:3]
		; CI-NEXT: v_mov_b32_e32 v5, s3
		; CI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; CI-NEXT: v_mov_b32_e32 v4, s2
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
		; CI-NEXT: v_cndmask_b32_e64 v1, v1, 0, s[0:1]
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]		; CI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
		; CI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; CI-NEXT: v_mov_b32_e32 v3, v1
		; CI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; CI-NEXT: v_mov_b32_e32 v2, v0
		; CI-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; CI-NEXT: s_cbranch_execnz .LBB24_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: flat_atomic_dec_noret_i64_offset_system:		; VI-LABEL: flat_atomic_dec_noret_i64_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v0, 42		; VI-NEXT: s_mov_b64 s[4:5], 0
; VI-NEXT: v_mov_b32_e32 v1, 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s0, s0, 32		; VI-NEXT: s_add_u32 s2, s0, 32
		; VI-NEXT: s_addc_u32 s3, s1, 0
		; VI-NEXT: s_add_u32 s0, s0, 36
; VI-NEXT: s_addc_u32 s1, s1, 0		; VI-NEXT: s_addc_u32 s1, s1, 0
; VI-NEXT: v_mov_b32_e32 v3, s1		; VI-NEXT: v_mov_b32_e32 v0, s2
; VI-NEXT: v_mov_b32_e32 v2, s0		; VI-NEXT: v_mov_b32_e32 v4, s1
		; VI-NEXT: v_mov_b32_e32 v1, s3
		; VI-NEXT: v_mov_b32_e32 v3, s0
		; VI-NEXT: flat_load_dword v2, v[0:1]
		; VI-NEXT: flat_load_dword v3, v[3:4]
		; VI-NEXT: .LBB24_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; VI-NEXT: v_subrev_u32_e32 v0, vcc, 1, v2
		; VI-NEXT: v_subbrev_u32_e32 v1, vcc, 0, v3, vcc
		; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
		; VI-NEXT: v_cmp_lt_u64_e64 s[0:1], 42, v[2:3]
		; VI-NEXT: v_mov_b32_e32 v5, s3
		; VI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; VI-NEXT: v_mov_b32_e32 v4, s2
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
		; VI-NEXT: v_cndmask_b32_e64 v1, v1, 0, s[0:1]
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]		; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
		; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; VI-NEXT: v_mov_b32_e32 v3, v1
		; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; VI-NEXT: v_mov_b32_e32 v2, v0
		; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; VI-NEXT: s_cbranch_execnz .LBB24_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: flat_atomic_dec_noret_i64_offset_system:		; GFX9-LABEL: flat_atomic_dec_noret_i64_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[4:5], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v3, s1		; GFX9-NEXT: v_mov_b32_e32 v0, s2
; GFX9-NEXT: v_mov_b32_e32 v2, s0		; GFX9-NEXT: v_mov_b32_e32 v1, s3
		; GFX9-NEXT: flat_load_dwordx2 v[2:3], v[0:1] offset:32
		; GFX9-NEXT: .LBB24_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX9-NEXT: v_subrev_co_u32_e32 v0, vcc, 1, v2
		; GFX9-NEXT: v_subbrev_co_u32_e32 v1, vcc, 0, v3, vcc
		; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
		; GFX9-NEXT: v_cmp_lt_u64_e64 s[0:1], 42, v[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v5, s3
		; GFX9-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; GFX9-NEXT: v_mov_b32_e32 v4, s2
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
		; GFX9-NEXT: v_cndmask_b32_e64 v1, v1, 0, s[0:1]
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1] offset:32		; GFX9-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
		; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v3, v1
		; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; GFX9-NEXT: v_mov_b32_e32 v2, v0
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; GFX9-NEXT: s_cbranch_execnz .LBB24_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: flat_atomic_dec_noret_i64_offset_system:		; GFX10-LABEL: flat_atomic_dec_noret_i64_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42		; GFX10-NEXT: s_mov_b32 s4, 0
; GFX10-NEXT: v_mov_b32_e32 v1, 0
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
; GFX10-NEXT: s_add_u32 s0, s0, 32		; GFX10-NEXT: s_add_u32 s2, s0, 32
; GFX10-NEXT: s_addc_u32 s1, s1, 0		; GFX10-NEXT: s_addc_u32 s3, s1, 0
; GFX10-NEXT: v_mov_b32_e32 v3, s1		; GFX10-NEXT: v_mov_b32_e32 v0, s2
; GFX10-NEXT: v_mov_b32_e32 v2, s0		; GFX10-NEXT: v_mov_b32_e32 v1, s3
		; GFX10-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
		; GFX10-NEXT: .LBB24_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX10-NEXT: v_cmp_eq_u64_e32 vcc_lo, 0, v[2:3]
		; GFX10-NEXT: v_cmp_lt_u64_e64 s0, 42, v[2:3]
		; GFX10-NEXT: v_sub_co_u32 v0, s1, v2, 1
		; GFX10-NEXT: v_subrev_co_ci_u32_e64 v1, s1, 0, v3, s1
		; GFX10-NEXT: v_mov_b32_e32 v5, s3
		; GFX10-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX10-NEXT: v_mov_b32_e32 v4, s2
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 42, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v1, v1, 0, s0
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]		; GFX10-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
		; GFX10-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[2:3]
		; GFX10-NEXT: v_mov_b32_e32 v3, v1
		; GFX10-NEXT: v_mov_b32_e32 v2, v0
		; GFX10-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s4
		; GFX10-NEXT: s_cbranch_execnz .LBB24_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: flat_atomic_dec_noret_i64_offset_system:		; GFX11-LABEL: flat_atomic_dec_noret_i64_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0		; GFX11-NEXT: s_load_b64 s[2:3], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v0, 42		; GFX11-NEXT: s_mov_b32 s4, 0
; GFX11-NEXT: v_mov_b32_e32 v1, 0
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v3, s1 :: v_dual_mov_b32 v2, s0		; GFX11-NEXT: v_dual_mov_b32 v0, s2 :: v_dual_mov_b32 v1, s3
		; GFX11-NEXT: flat_load_b64 v[2:3], v[0:1] offset:32
		; GFX11-NEXT: .p2align 6
		; GFX11-NEXT: .LBB24_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX11-NEXT: v_cmp_eq_u64_e32 vcc_lo, 0, v[2:3]
		; GFX11-NEXT: v_cmp_lt_u64_e64 s0, 42, v[2:3]
		; GFX11-NEXT: v_sub_co_u32 v0, s1, v2, 1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(SKIP_1) \| instid1(VALU_DEP_4)
		; GFX11-NEXT: v_subrev_co_ci_u32_e64 v1, s1, 0, v3, s1
		; GFX11-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2
		; GFX11-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) \| instid1(SALU_CYCLE_1)
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 42, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3)
		; GFX11-NEXT: v_cndmask_b32_e64 v1, v1, 0, s0
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: flat_atomic_dec_u64 v[2:3], v[0:1] offset:32		; GFX11-NEXT: flat_atomic_cmpswap_b64 v[0:1], v[4:5], v[0:3] offset:32 glc
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
		; GFX11-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[2:3]
		; GFX11-NEXT: v_dual_mov_b32 v3, v1 :: v_dual_mov_b32 v2, v0
		; GFX11-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s4
		; GFX11-NEXT: s_cbranch_execnz .LBB24_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i64, ptr %ptr, i32 4		%gep = getelementptr i64, ptr %ptr, i32 4
%result = atomicrmw udec_wrap ptr %gep, i64 42 seq_cst, align 8		%result = atomicrmw udec_wrap ptr %gep, i64 42 seq_cst, align 8
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_dec_ret_i64_offset_addr64(ptr %out, ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_dec_ret_i64_offset_addr64(ptr %out, ptr %ptr) #1 {
; CI-LABEL: flat_atomic_dec_ret_i64_offset_addr64:		; CI-LABEL: flat_atomic_dec_ret_i64_offset_addr64:
▲ Show 20 Lines • Show All 816 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 42 syncscope("agent") seq_cst, align 8		%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 42 syncscope("agent") seq_cst, align 8
store i64 %result, ptr addrspace(1) %out, align 4		store i64 %result, ptr addrspace(1) %out, align 4
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_dec_ret_i64_offset_system(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_dec_ret_i64_offset_system(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_dec_ret_i64_offset_system:		; CI-LABEL: global_atomic_dec_ret_i64_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; CI-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v0, 42		; CI-NEXT: s_mov_b64 s[8:9], 0
; CI-NEXT: v_mov_b32_e32 v1, 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s2, s2, 32		; CI-NEXT: s_load_dwordx2 s[0:1], s[6:7], 0x8
; CI-NEXT: s_addc_u32 s3, s3, 0		; CI-NEXT: s_add_u32 s6, s6, 32
; CI-NEXT: v_mov_b32_e32 v2, s2		; CI-NEXT: s_addc_u32 s7, s7, 0
; CI-NEXT: v_mov_b32_e32 v3, s3		; CI-NEXT: s_waitcnt lgkmcnt(0)
		; CI-NEXT: v_mov_b32_e32 v0, s0
		; CI-NEXT: v_mov_b32_e32 v1, s1
		; CI-NEXT: .LBB34_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: v_mov_b32_e32 v3, v1
		; CI-NEXT: v_mov_b32_e32 v2, v0
		; CI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
		; CI-NEXT: v_cmp_lt_u64_e64 s[0:1], 42, v[2:3]
		; CI-NEXT: v_subrev_i32_e64 v0, s[2:3], 1, v2
		; CI-NEXT: v_mov_b32_e32 v4, s6
		; CI-NEXT: v_subbrev_u32_e64 v1, s[2:3], 0, v3, s[2:3]
		; CI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; CI-NEXT: v_mov_b32_e32 v5, s7
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
		; CI-NEXT: v_cndmask_b32_e64 v1, v1, 0, s[0:1]
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3], v[0:1] glc		; CI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; CI-NEXT: s_waitcnt vmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
; CI-NEXT: v_mov_b32_e32 v3, s1		; CI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
; CI-NEXT: v_mov_b32_e32 v2, s0		; CI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
		; CI-NEXT: s_andn2_b64 exec, exec, s[8:9]
		; CI-NEXT: s_cbranch_execnz .LBB34_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
		; CI-NEXT: s_or_b64 exec, exec, s[8:9]
		; CI-NEXT: v_mov_b32_e32 v2, s4
		; CI-NEXT: v_mov_b32_e32 v3, s5
; CI-NEXT: flat_store_dwordx2 v[2:3], v[0:1]		; CI-NEXT: flat_store_dwordx2 v[2:3], v[0:1]
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: global_atomic_dec_ret_i64_offset_system:		; VI-LABEL: global_atomic_dec_ret_i64_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; VI-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v0, 42		; VI-NEXT: s_mov_b64 s[8:9], 0
; VI-NEXT: v_mov_b32_e32 v1, 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s2, s2, 32		; VI-NEXT: s_load_dwordx2 s[0:1], s[6:7], 0x20
; VI-NEXT: s_addc_u32 s3, s3, 0		; VI-NEXT: s_add_u32 s6, s6, 32
; VI-NEXT: v_mov_b32_e32 v2, s2		; VI-NEXT: s_addc_u32 s7, s7, 0
; VI-NEXT: v_mov_b32_e32 v3, s3		; VI-NEXT: s_waitcnt lgkmcnt(0)
		; VI-NEXT: v_mov_b32_e32 v0, s0
		; VI-NEXT: v_mov_b32_e32 v1, s1
		; VI-NEXT: .LBB34_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: v_mov_b32_e32 v3, v1
		; VI-NEXT: v_mov_b32_e32 v2, v0
		; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
		; VI-NEXT: v_cmp_lt_u64_e64 s[0:1], 42, v[2:3]
		; VI-NEXT: v_subrev_u32_e64 v0, s[2:3], 1, v2
		; VI-NEXT: v_mov_b32_e32 v4, s6
		; VI-NEXT: v_subbrev_u32_e64 v1, s[2:3], 0, v3, s[2:3]
		; VI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; VI-NEXT: v_mov_b32_e32 v5, s7
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
		; VI-NEXT: v_cndmask_b32_e64 v1, v1, 0, s[0:1]
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3], v[0:1] glc		; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; VI-NEXT: s_waitcnt vmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
; VI-NEXT: v_mov_b32_e32 v3, s1		; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
; VI-NEXT: v_mov_b32_e32 v2, s0		; VI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
		; VI-NEXT: s_andn2_b64 exec, exec, s[8:9]
		; VI-NEXT: s_cbranch_execnz .LBB34_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
		; VI-NEXT: s_or_b64 exec, exec, s[8:9]
		; VI-NEXT: v_mov_b32_e32 v2, s4
		; VI-NEXT: v_mov_b32_e32 v3, s5
; VI-NEXT: flat_store_dwordx2 v[2:3], v[0:1]		; VI-NEXT: flat_store_dwordx2 v[2:3], v[0:1]
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: global_atomic_dec_ret_i64_offset_system:		; GFX9-LABEL: global_atomic_dec_ret_i64_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[8:9], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0
; GFX9-NEXT: v_mov_b32_e32 v2, 0		; GFX9-NEXT: v_mov_b32_e32 v2, 0
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: s_load_dwordx2 s[0:1], s[6:7], 0x20
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: v_mov_b32_e32 v0, s0
		; GFX9-NEXT: v_mov_b32_e32 v1, s1
		; GFX9-NEXT: .LBB34_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: v_mov_b32_e32 v6, v1
		; GFX9-NEXT: v_mov_b32_e32 v5, v0
		; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[5:6]
		; GFX9-NEXT: v_cmp_lt_u64_e64 s[0:1], 42, v[5:6]
		; GFX9-NEXT: v_subrev_co_u32_e64 v0, s[2:3], 1, v5
		; GFX9-NEXT: v_subbrev_co_u32_e64 v1, s[2:3], 0, v6, s[2:3]
		; GFX9-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; GFX9-NEXT: v_cndmask_b32_e64 v3, v0, 42, s[0:1]
		; GFX9-NEXT: v_cndmask_b32_e64 v4, v1, 0, s[0:1]
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: global_atomic_dec_x2 v[0:1], v2, v[0:1], s[2:3] offset:32 glc		; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[6:7] offset:32 glc
; GFX9-NEXT: s_waitcnt vmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
; GFX9-NEXT: global_store_dwordx2 v2, v[0:1], s[0:1]		; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
		; GFX9-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[8:9]
		; GFX9-NEXT: s_cbranch_execnz .LBB34_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX9-NEXT: s_or_b64 exec, exec, s[8:9]
		; GFX9-NEXT: v_mov_b32_e32 v2, 0
		; GFX9-NEXT: global_store_dwordx2 v2, v[0:1], s[4:5]
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: global_atomic_dec_ret_i64_offset_system:		; GFX10-LABEL: global_atomic_dec_ret_i64_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx4 s[4:7], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42
; GFX10-NEXT: v_mov_b32_e32 v1, 0
; GFX10-NEXT: v_mov_b32_e32 v2, 0		; GFX10-NEXT: v_mov_b32_e32 v2, 0
		; GFX10-NEXT: s_mov_b32 s2, 0
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: s_load_dwordx2 s[0:1], s[6:7], 0x20
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v0, s0
		; GFX10-NEXT: v_mov_b32_e32 v1, s1
		; GFX10-NEXT: .LBB34_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: v_mov_b32_e32 v6, v1
		; GFX10-NEXT: v_mov_b32_e32 v5, v0
		; GFX10-NEXT: v_cmp_eq_u64_e32 vcc_lo, 0, v[5:6]
		; GFX10-NEXT: v_cmp_lt_u64_e64 s0, 42, v[5:6]
		; GFX10-NEXT: v_sub_co_u32 v0, s1, v5, 1
		; GFX10-NEXT: v_subrev_co_ci_u32_e64 v1, s1, 0, v6, s1
		; GFX10-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v3, v0, 42, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v4, v1, 0, s0
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: global_atomic_dec_x2 v[0:1], v2, v[0:1], s[2:3] offset:32 glc		; GFX10-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[6:7] offset:32 glc
; GFX10-NEXT: s_waitcnt vmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
; GFX10-NEXT: global_store_dwordx2 v2, v[0:1], s[0:1]		; GFX10-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[5:6]
		; GFX10-NEXT: s_or_b32 s2, vcc_lo, s2
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s2
		; GFX10-NEXT: s_cbranch_execnz .LBB34_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX10-NEXT: s_or_b32 exec_lo, exec_lo, s2
		; GFX10-NEXT: v_mov_b32_e32 v2, 0
		; GFX10-NEXT: global_store_dwordx2 v2, v[0:1], s[4:5]
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: global_atomic_dec_ret_i64_offset_system:		; GFX11-LABEL: global_atomic_dec_ret_i64_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0		; GFX11-NEXT: s_load_b128 s[4:7], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v0, 42		; GFX11-NEXT: s_mov_b32 s2, 0
; GFX11-NEXT: v_dual_mov_b32 v1, 0 :: v_dual_mov_b32 v2, 0		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: s_load_b64 s[0:1], s[6:7], 0x20
		; GFX11-NEXT: v_mov_b32_e32 v2, 0
		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v0, s0 :: v_dual_mov_b32 v1, s1
		; GFX11-NEXT: .p2align 6
		; GFX11-NEXT: .LBB34_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(NEXT) \| instid1(VALU_DEP_1)
		; GFX11-NEXT: v_dual_mov_b32 v6, v1 :: v_dual_mov_b32 v5, v0
		; GFX11-NEXT: v_cmp_eq_u64_e32 vcc_lo, 0, v[5:6]
		; GFX11-NEXT: v_cmp_lt_u64_e64 s0, 42, v[5:6]
		; GFX11-NEXT: v_sub_co_u32 v0, s1, v5, 1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(NEXT) \| instid1(VALU_DEP_3)
		; GFX11-NEXT: v_subrev_co_ci_u32_e64 v1, s1, 0, v6, s1
		; GFX11-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) \| instid1(SALU_CYCLE_1)
		; GFX11-NEXT: v_cndmask_b32_e64 v3, v0, 42, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2)
		; GFX11-NEXT: v_cndmask_b32_e64 v4, v1, 0, s0
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: global_atomic_dec_u64 v[0:1], v2, v[0:1], s[2:3] offset:32 glc		; GFX11-NEXT: global_atomic_cmpswap_b64 v[0:1], v2, v[3:6], s[6:7] offset:32 glc
; GFX11-NEXT: s_waitcnt vmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
; GFX11-NEXT: global_store_b64 v2, v[0:1], s[0:1]		; GFX11-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[5:6]
		; GFX11-NEXT: s_or_b32 s2, vcc_lo, s2
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s2
		; GFX11-NEXT: s_cbranch_execnz .LBB34_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX11-NEXT: s_or_b32 exec_lo, exec_lo, s2
		; GFX11-NEXT: v_mov_b32_e32 v2, 0
		; GFX11-NEXT: global_store_b64 v2, v[0:1], s[4:5]
; GFX11-NEXT: s_nop 0		; GFX11-NEXT: s_nop 0
; GFX11-NEXT: s_sendmsg sendmsg(MSG_DEALLOC_VGPRS)		; GFX11-NEXT: s_sendmsg sendmsg(MSG_DEALLOC_VGPRS)
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i64, ptr addrspace(1) %ptr, i32 4		%gep = getelementptr i64, ptr addrspace(1) %ptr, i32 4
%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 42 seq_cst, align 8		%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 42 seq_cst, align 8
store i64 %result, ptr addrspace(1) %out, align 4		store i64 %result, ptr addrspace(1) %out, align 4
ret void		ret void
}		}
▲ Show 20 Lines • Show All 144 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 42 syncscope("agent") seq_cst, align 8		%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 42 syncscope("agent") seq_cst, align 8
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_dec_noret_i64_offset_system(ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_dec_noret_i64_offset_system(ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_dec_noret_i64_offset_system:		; CI-LABEL: global_atomic_dec_noret_i64_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v0, 42		; CI-NEXT: s_mov_b64 s[2:3], 0
; CI-NEXT: v_mov_b32_e32 v1, 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s0, s0, 32		; CI-NEXT: s_load_dwordx2 s[6:7], s[0:1], 0x8
; CI-NEXT: s_addc_u32 s1, s1, 0		; CI-NEXT: s_add_u32 s4, s0, 32
; CI-NEXT: v_mov_b32_e32 v3, s1		; CI-NEXT: s_addc_u32 s5, s1, 0
; CI-NEXT: v_mov_b32_e32 v2, s0		; CI-NEXT: s_waitcnt lgkmcnt(0)
		; CI-NEXT: v_mov_b32_e32 v2, s6
		; CI-NEXT: v_mov_b32_e32 v3, s7
		; CI-NEXT: .LBB37_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: v_subrev_i32_e32 v0, vcc, 1, v2
		; CI-NEXT: v_subbrev_u32_e32 v1, vcc, 0, v3, vcc
		; CI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
		; CI-NEXT: v_cmp_lt_u64_e64 s[0:1], 42, v[2:3]
		; CI-NEXT: v_mov_b32_e32 v4, s4
		; CI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; CI-NEXT: v_mov_b32_e32 v5, s5
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
		; CI-NEXT: v_cndmask_b32_e64 v1, v1, 0, s[0:1]
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]		; CI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; CI-NEXT: s_waitcnt vmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
		; CI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; CI-NEXT: v_mov_b32_e32 v3, v1
		; CI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; CI-NEXT: v_mov_b32_e32 v2, v0
		; CI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; CI-NEXT: s_cbranch_execnz .LBB37_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: global_atomic_dec_noret_i64_offset_system:		; VI-LABEL: global_atomic_dec_noret_i64_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v0, 42		; VI-NEXT: s_mov_b64 s[2:3], 0
; VI-NEXT: v_mov_b32_e32 v1, 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s0, s0, 32		; VI-NEXT: s_load_dwordx2 s[6:7], s[0:1], 0x20
; VI-NEXT: s_addc_u32 s1, s1, 0		; VI-NEXT: s_add_u32 s4, s0, 32
; VI-NEXT: v_mov_b32_e32 v3, s1		; VI-NEXT: s_addc_u32 s5, s1, 0
; VI-NEXT: v_mov_b32_e32 v2, s0		; VI-NEXT: s_waitcnt lgkmcnt(0)
		; VI-NEXT: v_mov_b32_e32 v2, s6
		; VI-NEXT: v_mov_b32_e32 v3, s7
		; VI-NEXT: .LBB37_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: v_subrev_u32_e32 v0, vcc, 1, v2
		; VI-NEXT: v_subbrev_u32_e32 v1, vcc, 0, v3, vcc
		; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
		; VI-NEXT: v_cmp_lt_u64_e64 s[0:1], 42, v[2:3]
		; VI-NEXT: v_mov_b32_e32 v4, s4
		; VI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; VI-NEXT: v_mov_b32_e32 v5, s5
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
		; VI-NEXT: v_cndmask_b32_e64 v1, v1, 0, s[0:1]
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]		; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; VI-NEXT: s_waitcnt vmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
		; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; VI-NEXT: v_mov_b32_e32 v3, v1
		; VI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; VI-NEXT: v_mov_b32_e32 v2, v0
		; VI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; VI-NEXT: s_cbranch_execnz .LBB37_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: global_atomic_dec_noret_i64_offset_system:		; GFX9-LABEL: global_atomic_dec_noret_i64_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx2 s[4:5], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[6:7], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0		; GFX9-NEXT: v_mov_b32_e32 v4, 0
; GFX9-NEXT: v_mov_b32_e32 v2, 0		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x20
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: v_mov_b32_e32 v3, s1
		; GFX9-NEXT: v_mov_b32_e32 v2, s0
		; GFX9-NEXT: .LBB37_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
		; GFX9-NEXT: v_cmp_lt_u64_e64 s[0:1], 42, v[2:3]
		; GFX9-NEXT: v_subrev_co_u32_e64 v0, s[2:3], 1, v2
		; GFX9-NEXT: v_subbrev_co_u32_e64 v1, s[2:3], 0, v3, s[2:3]
		; GFX9-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 42, s[0:1]
		; GFX9-NEXT: v_cndmask_b32_e64 v1, v1, 0, s[0:1]
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: global_atomic_dec_x2 v2, v[0:1], s[0:1] offset:32		; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] offset:32 glc
; GFX9-NEXT: s_waitcnt vmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
		; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v3, v1
		; GFX9-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
		; GFX9-NEXT: v_mov_b32_e32 v2, v0
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[6:7]
		; GFX9-NEXT: s_cbranch_execnz .LBB37_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: global_atomic_dec_noret_i64_offset_system:		; GFX10-LABEL: global_atomic_dec_noret_i64_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42		; GFX10-NEXT: v_mov_b32_e32 v4, 0
; GFX10-NEXT: v_mov_b32_e32 v1, 0		; GFX10-NEXT: s_mov_b32 s4, 0
; GFX10-NEXT: v_mov_b32_e32 v2, 0		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: s_load_dwordx2 s[0:1], s[2:3], 0x20
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v3, s1
		; GFX10-NEXT: v_mov_b32_e32 v2, s0
		; GFX10-NEXT: .LBB37_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: v_cmp_eq_u64_e32 vcc_lo, 0, v[2:3]
		; GFX10-NEXT: v_cmp_lt_u64_e64 s0, 42, v[2:3]
		; GFX10-NEXT: v_sub_co_u32 v0, s1, v2, 1
		; GFX10-NEXT: v_subrev_co_ci_u32_e64 v1, s1, 0, v3, s1
		; GFX10-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 42, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v1, v1, 0, s0
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: global_atomic_dec_x2 v2, v[0:1], s[0:1] offset:32		; GFX10-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[2:3] offset:32 glc
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt vmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
		; GFX10-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[2:3]
		; GFX10-NEXT: v_mov_b32_e32 v3, v1
		; GFX10-NEXT: v_mov_b32_e32 v2, v0
		; GFX10-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s4
		; GFX10-NEXT: s_cbranch_execnz .LBB37_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: global_atomic_dec_noret_i64_offset_system:		; GFX11-LABEL: global_atomic_dec_noret_i64_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0		; GFX11-NEXT: s_load_b64 s[2:3], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v0, 42		; GFX11-NEXT: s_mov_b32 s4, 0
; GFX11-NEXT: v_dual_mov_b32 v1, 0 :: v_dual_mov_b32 v2, 0		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: s_load_b64 s[0:1], s[2:3], 0x20
		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v4, 0 :: v_dual_mov_b32 v3, s1
		; GFX11-NEXT: v_mov_b32_e32 v2, s0
		; GFX11-NEXT: .p2align 6
		; GFX11-NEXT: .LBB37_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(SKIP_2) \| instid1(VALU_DEP_1)
		; GFX11-NEXT: v_cmp_eq_u64_e32 vcc_lo, 0, v[2:3]
		; GFX11-NEXT: v_cmp_lt_u64_e64 s0, 42, v[2:3]
		; GFX11-NEXT: v_sub_co_u32 v0, s1, v2, 1
		; GFX11-NEXT: v_subrev_co_ci_u32_e64 v1, s1, 0, v3, s1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3)
		; GFX11-NEXT: s_or_b32 s0, vcc_lo, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) \| instid1(SALU_CYCLE_1)
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 42, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2)
		; GFX11-NEXT: v_cndmask_b32_e64 v1, v1, 0, s0
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: global_atomic_dec_u64 v2, v[0:1], s[0:1] offset:32		; GFX11-NEXT: global_atomic_cmpswap_b64 v[0:1], v4, v[0:3], s[2:3] offset:32 glc
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt vmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
		; GFX11-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[2:3]
		; GFX11-NEXT: v_dual_mov_b32 v3, v1 :: v_dual_mov_b32 v2, v0
		; GFX11-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s4
		; GFX11-NEXT: s_cbranch_execnz .LBB37_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i64, ptr addrspace(1) %ptr, i32 4		%gep = getelementptr i64, ptr addrspace(1) %ptr, i32 4
%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 42 seq_cst, align 8		%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 42 seq_cst, align 8
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_dec_ret_i64_offset_addr64(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_dec_ret_i64_offset_addr64(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_dec_ret_i64_offset_addr64:		; CI-LABEL: global_atomic_dec_ret_i64_offset_addr64:
▲ Show 20 Lines • Show All 286 Lines • Show Last 20 Lines

llvm/test/CodeGen/AMDGPU/GlobalISel/atomicrmw_uinc_wrap.ll

Show First 20 Lines • Show All 472 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
store i32 %result, ptr addrspace(1) %out, align 4		store i32 %result, ptr addrspace(1) %out, align 4
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_inc_ret_i32_offset_sistem(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_inc_ret_i32_offset_sistem(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_inc_ret_i32_offset_sistem:		; CI-LABEL: global_atomic_inc_ret_i32_offset_sistem:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v2, 42		; CI-NEXT: s_mov_b64 s[4:5], 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
		; CI-NEXT: s_load_dword s6, s[2:3], 0x4
; CI-NEXT: s_add_u32 s2, s2, 16		; CI-NEXT: s_add_u32 s2, s2, 16
; CI-NEXT: s_addc_u32 s3, s3, 0		; CI-NEXT: s_addc_u32 s3, s3, 0
; CI-NEXT: v_mov_b32_e32 v0, s2		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: v_mov_b32_e32 v1, s3		; CI-NEXT: v_mov_b32_e32 v0, s6
		; CI-NEXT: .LBB6_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: v_mov_b32_e32 v1, v0
		; CI-NEXT: v_add_i32_e32 v0, vcc, 1, v1
		; CI-NEXT: v_mov_b32_e32 v2, s2
		; CI-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; CI-NEXT: v_mov_b32_e32 v3, s3
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_inc v2, v[0:1], v2 glc		; CI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; CI-NEXT: s_waitcnt vmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
; CI-NEXT: v_mov_b32_e32 v0, s0		; CI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
; CI-NEXT: v_mov_b32_e32 v1, s1		; CI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
; CI-NEXT: flat_store_dword v[0:1], v2		; CI-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; CI-NEXT: s_cbranch_execnz .LBB6_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
		; CI-NEXT: s_or_b64 exec, exec, s[4:5]
		; CI-NEXT: v_mov_b32_e32 v2, s1
		; CI-NEXT: v_mov_b32_e32 v1, s0
		; CI-NEXT: flat_store_dword v[1:2], v0
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: global_atomic_inc_ret_i32_offset_sistem:		; VI-LABEL: global_atomic_inc_ret_i32_offset_sistem:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v2, 42		; VI-NEXT: s_mov_b64 s[4:5], 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
		; VI-NEXT: s_load_dword s6, s[2:3], 0x10
; VI-NEXT: s_add_u32 s2, s2, 16		; VI-NEXT: s_add_u32 s2, s2, 16
; VI-NEXT: s_addc_u32 s3, s3, 0		; VI-NEXT: s_addc_u32 s3, s3, 0
; VI-NEXT: v_mov_b32_e32 v0, s2		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: v_mov_b32_e32 v1, s3		; VI-NEXT: v_mov_b32_e32 v0, s6
		; VI-NEXT: .LBB6_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: v_mov_b32_e32 v1, v0
		; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v1
		; VI-NEXT: v_mov_b32_e32 v2, s2
		; VI-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; VI-NEXT: v_mov_b32_e32 v3, s3
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_inc v2, v[0:1], v2 glc		; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; VI-NEXT: s_waitcnt vmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
; VI-NEXT: v_mov_b32_e32 v0, s0		; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
; VI-NEXT: v_mov_b32_e32 v1, s1		; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
; VI-NEXT: flat_store_dword v[0:1], v2		; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; VI-NEXT: s_cbranch_execnz .LBB6_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
		; VI-NEXT: s_or_b64 exec, exec, s[4:5]
		; VI-NEXT: v_mov_b32_e32 v2, s1
		; VI-NEXT: v_mov_b32_e32 v1, s0
		; VI-NEXT: flat_store_dword v[1:2], v0
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: global_atomic_inc_ret_i32_offset_sistem:		; GFX9-LABEL: global_atomic_inc_ret_i32_offset_sistem:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[4:5], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0		; GFX9-NEXT: v_mov_b32_e32 v0, 0
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: s_load_dword s6, s[2:3], 0x10
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: v_mov_b32_e32 v1, s6
		; GFX9-NEXT: .LBB6_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: v_mov_b32_e32 v2, v1
		; GFX9-NEXT: v_add_u32_e32 v1, 1, v2
		; GFX9-NEXT: v_cmp_le_u32_e32 vcc, 42, v2
		; GFX9-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: global_atomic_inc v0, v1, v0, s[2:3] offset:16 glc		; GFX9-NEXT: global_atomic_cmpswap v1, v0, v[1:2], s[2:3] offset:16 glc
; GFX9-NEXT: s_waitcnt vmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
; GFX9-NEXT: global_store_dword v1, v0, s[0:1]		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v1, v2
		; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; GFX9-NEXT: s_cbranch_execnz .LBB6_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
		; GFX9-NEXT: v_mov_b32_e32 v0, 0
		; GFX9-NEXT: global_store_dword v0, v1, s[0:1]
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: global_atomic_inc_ret_i32_offset_sistem:		; GFX10-LABEL: global_atomic_inc_ret_i32_offset_sistem:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42		; GFX10-NEXT: v_mov_b32_e32 v0, 0
; GFX10-NEXT: v_mov_b32_e32 v1, 0		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: s_load_dword s4, s[2:3], 0x10
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v1, s4
		; GFX10-NEXT: s_mov_b32 s4, 0
		; GFX10-NEXT: .LBB6_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: v_mov_b32_e32 v2, v1
		; GFX10-NEXT: v_add_nc_u32_e32 v1, 1, v2
		; GFX10-NEXT: v_cmp_le_u32_e32 vcc_lo, 42, v2
		; GFX10-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc_lo
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: global_atomic_inc v0, v1, v0, s[2:3] offset:16 glc		; GFX10-NEXT: global_atomic_cmpswap v1, v0, v[1:2], s[2:3] offset:16 glc
; GFX10-NEXT: s_waitcnt vmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
; GFX10-NEXT: global_store_dword v1, v0, s[0:1]		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, v1, v2
		; GFX10-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s4
		; GFX10-NEXT: s_cbranch_execnz .LBB6_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX10-NEXT: s_or_b32 exec_lo, exec_lo, s4
		; GFX10-NEXT: v_mov_b32_e32 v0, 0
		; GFX10-NEXT: global_store_dword v0, v1, s[0:1]
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: global_atomic_inc_ret_i32_offset_sistem:		; GFX11-LABEL: global_atomic_inc_ret_i32_offset_sistem:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0		; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0
; GFX11-NEXT: v_dual_mov_b32 v0, 42 :: v_dual_mov_b32 v1, 0		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: s_load_b32 s4, s[2:3], 0x10
		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v0, 0 :: v_dual_mov_b32 v1, s4
		; GFX11-NEXT: s_mov_b32 s4, 0
		; GFX11-NEXT: .LBB6_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(NEXT) \| instid1(VALU_DEP_1)
		; GFX11-NEXT: v_mov_b32_e32 v2, v1
		; GFX11-NEXT: v_add_nc_u32_e32 v1, 1, v2
		; GFX11-NEXT: v_cmp_le_u32_e32 vcc_lo, 42, v2
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2)
		; GFX11-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc_lo
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: global_atomic_inc_u32 v0, v1, v0, s[2:3] offset:16 glc		; GFX11-NEXT: global_atomic_cmpswap_b32 v1, v0, v[1:2], s[2:3] offset:16 glc
; GFX11-NEXT: s_waitcnt vmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
; GFX11-NEXT: global_store_b32 v1, v0, s[0:1]		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, v1, v2
		; GFX11-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s4
		; GFX11-NEXT: s_cbranch_execnz .LBB6_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX11-NEXT: s_or_b32 exec_lo, exec_lo, s4
		; GFX11-NEXT: v_mov_b32_e32 v0, 0
		; GFX11-NEXT: global_store_b32 v0, v1, s[0:1]
; GFX11-NEXT: s_nop 0		; GFX11-NEXT: s_nop 0
; GFX11-NEXT: s_sendmsg sendmsg(MSG_DEALLOC_VGPRS)		; GFX11-NEXT: s_sendmsg sendmsg(MSG_DEALLOC_VGPRS)
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i32, ptr addrspace(1) %ptr, i32 4		%gep = getelementptr i32, ptr addrspace(1) %ptr, i32 4
%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 42 seq_cst, align 4		%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 42 seq_cst, align 4
store i32 %result, ptr addrspace(1) %out, align 4		store i32 %result, ptr addrspace(1) %out, align 4
ret void		ret void
}		}
▲ Show 20 Lines • Show All 133 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%gep = getelementptr i32, ptr addrspace(1) %ptr, i32 4		%gep = getelementptr i32, ptr addrspace(1) %ptr, i32 4
%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 42 syncscope("agent") seq_cst, align 4		%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 42 syncscope("agent") seq_cst, align 4
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_inc_noret_i32_offset_system(ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_inc_noret_i32_offset_system(ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_inc_noret_i32_offset_system:		; CI-LABEL: global_atomic_inc_noret_i32_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; CI-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v2, 42		; CI-NEXT: s_mov_b64 s[0:1], 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s0, s0, 16		; CI-NEXT: s_load_dword s4, s[2:3], 0x4
; CI-NEXT: s_addc_u32 s1, s1, 0		; CI-NEXT: s_add_u32 s2, s2, 16
; CI-NEXT: v_mov_b32_e32 v0, s0		; CI-NEXT: s_addc_u32 s3, s3, 0
; CI-NEXT: v_mov_b32_e32 v1, s1		; CI-NEXT: s_waitcnt lgkmcnt(0)
		; CI-NEXT: v_mov_b32_e32 v1, s4
		; CI-NEXT: .LBB9_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: v_add_i32_e32 v0, vcc, 1, v1
		; CI-NEXT: v_mov_b32_e32 v2, s2
		; CI-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; CI-NEXT: v_mov_b32_e32 v3, s3
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_inc v[0:1], v2		; CI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; CI-NEXT: s_waitcnt vmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
		; CI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; CI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; CI-NEXT: v_mov_b32_e32 v1, v0
		; CI-NEXT: s_andn2_b64 exec, exec, s[0:1]
		; CI-NEXT: s_cbranch_execnz .LBB9_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: global_atomic_inc_noret_i32_offset_system:		; VI-LABEL: global_atomic_inc_noret_i32_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; VI-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v2, 42		; VI-NEXT: s_mov_b64 s[0:1], 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s0, s0, 16		; VI-NEXT: s_load_dword s4, s[2:3], 0x10
; VI-NEXT: s_addc_u32 s1, s1, 0		; VI-NEXT: s_add_u32 s2, s2, 16
; VI-NEXT: v_mov_b32_e32 v0, s0		; VI-NEXT: s_addc_u32 s3, s3, 0
; VI-NEXT: v_mov_b32_e32 v1, s1		; VI-NEXT: s_waitcnt lgkmcnt(0)
		; VI-NEXT: v_mov_b32_e32 v1, s4
		; VI-NEXT: .LBB9_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v1
		; VI-NEXT: v_mov_b32_e32 v2, s2
		; VI-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; VI-NEXT: v_mov_b32_e32 v3, s3
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_inc v[0:1], v2		; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; VI-NEXT: s_waitcnt vmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
		; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; VI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; VI-NEXT: v_mov_b32_e32 v1, v0
		; VI-NEXT: s_andn2_b64 exec, exec, s[0:1]
		; VI-NEXT: s_cbranch_execnz .LBB9_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: global_atomic_inc_noret_i32_offset_system:		; GFX9-LABEL: global_atomic_inc_noret_i32_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[2:3], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0		; GFX9-NEXT: v_mov_b32_e32 v2, 0
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: s_load_dword s4, s[0:1], 0x10
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: v_mov_b32_e32 v1, s4
		; GFX9-NEXT: .LBB9_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: v_add_u32_e32 v0, 1, v1
		; GFX9-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: global_atomic_inc v1, v0, s[0:1] offset:16		; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[0:1] offset:16 glc
; GFX9-NEXT: s_waitcnt vmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; GFX9-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v1, v0
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; GFX9-NEXT: s_cbranch_execnz .LBB9_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: global_atomic_inc_noret_i32_offset_system:		; GFX10-LABEL: global_atomic_inc_noret_i32_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42		; GFX10-NEXT: v_mov_b32_e32 v2, 0
; GFX10-NEXT: v_mov_b32_e32 v1, 0		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: s_load_dword s2, s[0:1], 0x10
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v1, s2
		; GFX10-NEXT: s_mov_b32 s2, 0
		; GFX10-NEXT: .LBB9_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: v_add_nc_u32_e32 v0, 1, v1
		; GFX10-NEXT: v_cmp_le_u32_e32 vcc_lo, 42, v1
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: global_atomic_inc v1, v0, s[0:1] offset:16		; GFX10-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[0:1] offset:16 glc
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt vmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
		; GFX10-NEXT: v_mov_b32_e32 v1, v0
		; GFX10-NEXT: s_or_b32 s2, vcc_lo, s2
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s2
		; GFX10-NEXT: s_cbranch_execnz .LBB9_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: global_atomic_inc_noret_i32_offset_system:		; GFX11-LABEL: global_atomic_inc_noret_i32_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0		; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0
; GFX11-NEXT: v_dual_mov_b32 v0, 42 :: v_dual_mov_b32 v1, 0		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: s_load_b32 s2, s[0:1], 0x10
		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v2, 0 :: v_dual_mov_b32 v1, s2
		; GFX11-NEXT: s_mov_b32 s2, 0
		; GFX11-NEXT: .LBB9_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(SKIP_1) \| instid1(VALU_DEP_2)
		; GFX11-NEXT: v_add_nc_u32_e32 v0, 1, v1
		; GFX11-NEXT: v_cmp_le_u32_e32 vcc_lo, 42, v1
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: global_atomic_inc_u32 v1, v0, s[0:1] offset:16		; GFX11-NEXT: global_atomic_cmpswap_b32 v0, v2, v[0:1], s[0:1] offset:16 glc
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt vmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
		; GFX11-NEXT: v_mov_b32_e32 v1, v0
		; GFX11-NEXT: s_or_b32 s2, vcc_lo, s2
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s2
		; GFX11-NEXT: s_cbranch_execnz .LBB9_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i32, ptr addrspace(1) %ptr, i32 4		%gep = getelementptr i32, ptr addrspace(1) %ptr, i32 4
%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 42 seq_cst, align 4		%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 42 seq_cst, align 4
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_inc_ret_i32_offset_addr64(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_inc_ret_i32_offset_addr64(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_inc_ret_i32_offset_addr64:		; CI-LABEL: global_atomic_inc_ret_i32_offset_addr64:
▲ Show 20 Lines • Show All 753 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
store i64 %result, ptr addrspace(1) %out, align 4		store i64 %result, ptr addrspace(1) %out, align 4
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_inc_ret_i64_offset_system(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_inc_ret_i64_offset_system(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_inc_ret_i64_offset_system:		; CI-LABEL: global_atomic_inc_ret_i64_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v0, 42		; CI-NEXT: s_mov_b64 s[4:5], 0
; CI-NEXT: v_mov_b32_e32 v1, 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
		; CI-NEXT: s_load_dwordx2 s[6:7], s[2:3], 0x8
; CI-NEXT: s_add_u32 s2, s2, 32		; CI-NEXT: s_add_u32 s2, s2, 32
; CI-NEXT: s_addc_u32 s3, s3, 0		; CI-NEXT: s_addc_u32 s3, s3, 0
; CI-NEXT: v_mov_b32_e32 v2, s2		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: v_mov_b32_e32 v3, s3		; CI-NEXT: v_mov_b32_e32 v0, s6
		; CI-NEXT: v_mov_b32_e32 v1, s7
		; CI-NEXT: .LBB19_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: v_mov_b32_e32 v3, v1
		; CI-NEXT: v_mov_b32_e32 v2, v0
		; CI-NEXT: v_add_i32_e32 v0, vcc, 1, v2
		; CI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
		; CI-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; CI-NEXT: v_mov_b32_e32 v5, s3
		; CI-NEXT: v_mov_b32_e32 v4, s2
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; CI-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc		; CI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; CI-NEXT: s_waitcnt vmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
		; CI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; CI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; CI-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; CI-NEXT: s_cbranch_execnz .LBB19_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
		; CI-NEXT: s_or_b64 exec, exec, s[4:5]
; CI-NEXT: v_mov_b32_e32 v3, s1		; CI-NEXT: v_mov_b32_e32 v3, s1
; CI-NEXT: v_mov_b32_e32 v2, s0		; CI-NEXT: v_mov_b32_e32 v2, s0
; CI-NEXT: flat_store_dwordx2 v[2:3], v[0:1]		; CI-NEXT: flat_store_dwordx2 v[2:3], v[0:1]
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: global_atomic_inc_ret_i64_offset_system:		; VI-LABEL: global_atomic_inc_ret_i64_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v0, 42		; VI-NEXT: s_mov_b64 s[4:5], 0
; VI-NEXT: v_mov_b32_e32 v1, 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
		; VI-NEXT: s_load_dwordx2 s[6:7], s[2:3], 0x20
; VI-NEXT: s_add_u32 s2, s2, 32		; VI-NEXT: s_add_u32 s2, s2, 32
; VI-NEXT: s_addc_u32 s3, s3, 0		; VI-NEXT: s_addc_u32 s3, s3, 0
; VI-NEXT: v_mov_b32_e32 v2, s2		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: v_mov_b32_e32 v3, s3		; VI-NEXT: v_mov_b32_e32 v0, s6
		; VI-NEXT: v_mov_b32_e32 v1, s7
		; VI-NEXT: .LBB19_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: v_mov_b32_e32 v3, v1
		; VI-NEXT: v_mov_b32_e32 v2, v0
		; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v2
		; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
		; VI-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; VI-NEXT: v_mov_b32_e32 v5, s3
		; VI-NEXT: v_mov_b32_e32 v4, s2
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; VI-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc		; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; VI-NEXT: s_waitcnt vmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
		; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; VI-NEXT: s_cbranch_execnz .LBB19_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
		; VI-NEXT: s_or_b64 exec, exec, s[4:5]
; VI-NEXT: v_mov_b32_e32 v3, s1		; VI-NEXT: v_mov_b32_e32 v3, s1
; VI-NEXT: v_mov_b32_e32 v2, s0		; VI-NEXT: v_mov_b32_e32 v2, s0
; VI-NEXT: flat_store_dwordx2 v[2:3], v[0:1]		; VI-NEXT: flat_store_dwordx2 v[2:3], v[0:1]
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: global_atomic_inc_ret_i64_offset_system:		; GFX9-LABEL: global_atomic_inc_ret_i64_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[4:5], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0
; GFX9-NEXT: v_mov_b32_e32 v2, 0		; GFX9-NEXT: v_mov_b32_e32 v2, 0
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: s_load_dwordx2 s[6:7], s[2:3], 0x20
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: v_mov_b32_e32 v0, s6
		; GFX9-NEXT: v_mov_b32_e32 v1, s7
		; GFX9-NEXT: .LBB19_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: v_mov_b32_e32 v6, v1
		; GFX9-NEXT: v_mov_b32_e32 v5, v0
		; GFX9-NEXT: v_add_co_u32_e32 v0, vcc, 1, v5
		; GFX9-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v6, vcc
		; GFX9-NEXT: v_cmp_le_u64_e32 vcc, 42, v[5:6]
		; GFX9-NEXT: v_cndmask_b32_e64 v3, v0, 0, vcc
		; GFX9-NEXT: v_cndmask_b32_e64 v4, v1, 0, vcc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: global_atomic_inc_x2 v[0:1], v2, v[0:1], s[2:3] offset:32 glc		; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[2:3] offset:32 glc
; GFX9-NEXT: s_waitcnt vmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
		; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
		; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; GFX9-NEXT: s_cbranch_execnz .LBB19_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
		; GFX9-NEXT: v_mov_b32_e32 v2, 0
; GFX9-NEXT: global_store_dwordx2 v2, v[0:1], s[0:1]		; GFX9-NEXT: global_store_dwordx2 v2, v[0:1], s[0:1]
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: global_atomic_inc_ret_i64_offset_system:		; GFX10-LABEL: global_atomic_inc_ret_i64_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42
; GFX10-NEXT: v_mov_b32_e32 v1, 0
; GFX10-NEXT: v_mov_b32_e32 v2, 0		; GFX10-NEXT: v_mov_b32_e32 v2, 0
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: s_load_dwordx2 s[4:5], s[2:3], 0x20
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v0, s4
		; GFX10-NEXT: v_mov_b32_e32 v1, s5
		; GFX10-NEXT: s_mov_b32 s4, 0
		; GFX10-NEXT: .LBB19_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: v_mov_b32_e32 v6, v1
		; GFX10-NEXT: v_mov_b32_e32 v5, v0
		; GFX10-NEXT: v_add_co_u32 v0, vcc_lo, v5, 1
		; GFX10-NEXT: v_add_co_ci_u32_e32 v1, vcc_lo, 0, v6, vcc_lo
		; GFX10-NEXT: v_cmp_le_u64_e32 vcc_lo, 42, v[5:6]
		; GFX10-NEXT: v_cndmask_b32_e64 v3, v0, 0, vcc_lo
		; GFX10-NEXT: v_cndmask_b32_e64 v4, v1, 0, vcc_lo
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: global_atomic_inc_x2 v[0:1], v2, v[0:1], s[2:3] offset:32 glc		; GFX10-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[2:3] offset:32 glc
; GFX10-NEXT: s_waitcnt vmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
		; GFX10-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[5:6]
		; GFX10-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s4
		; GFX10-NEXT: s_cbranch_execnz .LBB19_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX10-NEXT: s_or_b32 exec_lo, exec_lo, s4
		; GFX10-NEXT: v_mov_b32_e32 v2, 0
; GFX10-NEXT: global_store_dwordx2 v2, v[0:1], s[0:1]		; GFX10-NEXT: global_store_dwordx2 v2, v[0:1], s[0:1]
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: global_atomic_inc_ret_i64_offset_system:		; GFX11-LABEL: global_atomic_inc_ret_i64_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0		; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v0, 42		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v1, 0 :: v_dual_mov_b32 v2, 0		; GFX11-NEXT: s_load_b64 s[4:5], s[2:3], 0x20
		; GFX11-NEXT: v_mov_b32_e32 v2, 0
		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v0, s4 :: v_dual_mov_b32 v1, s5
		; GFX11-NEXT: s_mov_b32 s4, 0
		; GFX11-NEXT: .LBB19_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(NEXT) \| instid1(VALU_DEP_1)
		; GFX11-NEXT: v_dual_mov_b32 v6, v1 :: v_dual_mov_b32 v5, v0
		; GFX11-NEXT: v_add_co_u32 v0, vcc_lo, v5, 1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) \| instskip(SKIP_1) \| instid1(VALU_DEP_3)
		; GFX11-NEXT: v_add_co_ci_u32_e32 v1, vcc_lo, 0, v6, vcc_lo
		; GFX11-NEXT: v_cmp_le_u64_e32 vcc_lo, 42, v[5:6]
		; GFX11-NEXT: v_cndmask_b32_e64 v3, v0, 0, vcc_lo
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3)
		; GFX11-NEXT: v_cndmask_b32_e64 v4, v1, 0, vcc_lo
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: global_atomic_inc_u64 v[0:1], v2, v[0:1], s[2:3] offset:32 glc		; GFX11-NEXT: global_atomic_cmpswap_b64 v[0:1], v2, v[3:6], s[2:3] offset:32 glc
; GFX11-NEXT: s_waitcnt vmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
		; GFX11-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[5:6]
		; GFX11-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s4
		; GFX11-NEXT: s_cbranch_execnz .LBB19_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX11-NEXT: s_or_b32 exec_lo, exec_lo, s4
		; GFX11-NEXT: v_mov_b32_e32 v2, 0
; GFX11-NEXT: global_store_b64 v2, v[0:1], s[0:1]		; GFX11-NEXT: global_store_b64 v2, v[0:1], s[0:1]
; GFX11-NEXT: s_nop 0		; GFX11-NEXT: s_nop 0
; GFX11-NEXT: s_sendmsg sendmsg(MSG_DEALLOC_VGPRS)		; GFX11-NEXT: s_sendmsg sendmsg(MSG_DEALLOC_VGPRS)
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i64, ptr addrspace(1) %ptr, i32 4		%gep = getelementptr i64, ptr addrspace(1) %ptr, i32 4
%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 42 seq_cst, align 8		%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 42 seq_cst, align 8
store i64 %result, ptr addrspace(1) %out, align 4		store i64 %result, ptr addrspace(1) %out, align 4
ret void		ret void
▲ Show 20 Lines • Show All 144 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%gep = getelementptr i64, ptr addrspace(1) %ptr, i32 4		%gep = getelementptr i64, ptr addrspace(1) %ptr, i32 4
%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 42 syncscope("agent") seq_cst, align 8		%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 42 syncscope("agent") seq_cst, align 8
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_inc_noret_i64_offset_system(ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_inc_noret_i64_offset_system(ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_inc_noret_i64_offset_system:		; CI-LABEL: global_atomic_inc_noret_i64_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; CI-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v0, 42		; CI-NEXT: s_mov_b64 s[0:1], 0
; CI-NEXT: v_mov_b32_e32 v1, 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s0, s0, 32		; CI-NEXT: s_load_dwordx2 s[4:5], s[2:3], 0x8
; CI-NEXT: s_addc_u32 s1, s1, 0		; CI-NEXT: s_add_u32 s2, s2, 32
; CI-NEXT: v_mov_b32_e32 v3, s1		; CI-NEXT: s_addc_u32 s3, s3, 0
; CI-NEXT: v_mov_b32_e32 v2, s0		; CI-NEXT: s_waitcnt lgkmcnt(0)
		; CI-NEXT: v_mov_b32_e32 v2, s4
		; CI-NEXT: v_mov_b32_e32 v3, s5
		; CI-NEXT: .LBB22_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: v_add_i32_e32 v0, vcc, 1, v2
		; CI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
		; CI-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; CI-NEXT: v_mov_b32_e32 v5, s3
		; CI-NEXT: v_mov_b32_e32 v4, s2
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; CI-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]		; CI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; CI-NEXT: s_waitcnt vmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
		; CI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; CI-NEXT: v_mov_b32_e32 v3, v1
		; CI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; CI-NEXT: v_mov_b32_e32 v2, v0
		; CI-NEXT: s_andn2_b64 exec, exec, s[0:1]
		; CI-NEXT: s_cbranch_execnz .LBB22_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: global_atomic_inc_noret_i64_offset_system:		; VI-LABEL: global_atomic_inc_noret_i64_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; VI-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v0, 42		; VI-NEXT: s_mov_b64 s[0:1], 0
; VI-NEXT: v_mov_b32_e32 v1, 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s0, s0, 32		; VI-NEXT: s_load_dwordx2 s[4:5], s[2:3], 0x20
; VI-NEXT: s_addc_u32 s1, s1, 0		; VI-NEXT: s_add_u32 s2, s2, 32
; VI-NEXT: v_mov_b32_e32 v3, s1		; VI-NEXT: s_addc_u32 s3, s3, 0
; VI-NEXT: v_mov_b32_e32 v2, s0		; VI-NEXT: s_waitcnt lgkmcnt(0)
		; VI-NEXT: v_mov_b32_e32 v2, s4
		; VI-NEXT: v_mov_b32_e32 v3, s5
		; VI-NEXT: .LBB22_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v2
		; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
		; VI-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; VI-NEXT: v_mov_b32_e32 v5, s3
		; VI-NEXT: v_mov_b32_e32 v4, s2
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; VI-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]		; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; VI-NEXT: s_waitcnt vmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
		; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; VI-NEXT: v_mov_b32_e32 v3, v1
		; VI-NEXT: s_or_b64 s[0:1], vcc, s[0:1]
		; VI-NEXT: v_mov_b32_e32 v2, v0
		; VI-NEXT: s_andn2_b64 exec, exec, s[0:1]
		; VI-NEXT: s_cbranch_execnz .LBB22_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: global_atomic_inc_noret_i64_offset_system:		; GFX9-LABEL: global_atomic_inc_noret_i64_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[2:3], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0		; GFX9-NEXT: v_mov_b32_e32 v4, 0
; GFX9-NEXT: v_mov_b32_e32 v2, 0		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: s_load_dwordx2 s[4:5], s[0:1], 0x20
		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
		; GFX9-NEXT: v_mov_b32_e32 v2, s4
		; GFX9-NEXT: v_mov_b32_e32 v3, s5
		; GFX9-NEXT: .LBB22_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: v_add_co_u32_e32 v0, vcc, 1, v2
		; GFX9-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v3, vcc
		; GFX9-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; GFX9-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: global_atomic_inc_x2 v2, v[0:1], s[0:1] offset:32		; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[0:1] offset:32 glc
; GFX9-NEXT: s_waitcnt vmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
		; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v3, v1
		; GFX9-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v2, v0
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; GFX9-NEXT: s_cbranch_execnz .LBB22_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: global_atomic_inc_noret_i64_offset_system:		; GFX10-LABEL: global_atomic_inc_noret_i64_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42		; GFX10-NEXT: v_mov_b32_e32 v4, 0
; GFX10-NEXT: v_mov_b32_e32 v1, 0		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
; GFX10-NEXT: v_mov_b32_e32 v2, 0		; GFX10-NEXT: s_load_dwordx2 s[2:3], s[0:1], 0x20
		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v2, s2
		; GFX10-NEXT: v_mov_b32_e32 v3, s3
		; GFX10-NEXT: s_mov_b32 s2, 0
		; GFX10-NEXT: .LBB22_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: v_add_co_u32 v0, vcc_lo, v2, 1
		; GFX10-NEXT: v_add_co_ci_u32_e32 v1, vcc_lo, 0, v3, vcc_lo
		; GFX10-NEXT: v_cmp_le_u64_e32 vcc_lo, 42, v[2:3]
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
		; GFX10-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc_lo
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: global_atomic_inc_x2 v2, v[0:1], s[0:1] offset:32		; GFX10-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[0:1] offset:32 glc
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt vmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
		; GFX10-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[2:3]
		; GFX10-NEXT: v_mov_b32_e32 v3, v1
		; GFX10-NEXT: v_mov_b32_e32 v2, v0
		; GFX10-NEXT: s_or_b32 s2, vcc_lo, s2
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s2
		; GFX10-NEXT: s_cbranch_execnz .LBB22_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: global_atomic_inc_noret_i64_offset_system:		; GFX11-LABEL: global_atomic_inc_noret_i64_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0		; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v0, 42		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v1, 0 :: v_dual_mov_b32 v2, 0		; GFX11-NEXT: s_load_b64 s[2:3], s[0:1], 0x20
		; GFX11-NEXT: v_mov_b32_e32 v4, 0
		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v2, s2 :: v_dual_mov_b32 v3, s3
		; GFX11-NEXT: s_mov_b32 s2, 0
		; GFX11-NEXT: .LBB22_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(NEXT) \| instid1(VALU_DEP_2)
		; GFX11-NEXT: v_add_co_u32 v0, vcc_lo, v2, 1
		; GFX11-NEXT: v_add_co_ci_u32_e32 v1, vcc_lo, 0, v3, vcc_lo
		; GFX11-NEXT: v_cmp_le_u64_e32 vcc_lo, 42, v[2:3]
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) \| instskip(NEXT) \| instid1(VALU_DEP_3)
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
		; GFX11-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc_lo
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: global_atomic_inc_u64 v2, v[0:1], s[0:1] offset:32		; GFX11-NEXT: global_atomic_cmpswap_b64 v[0:1], v4, v[0:3], s[0:1] offset:32 glc
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt vmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
		; GFX11-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[2:3]
		; GFX11-NEXT: v_dual_mov_b32 v3, v1 :: v_dual_mov_b32 v2, v0
		; GFX11-NEXT: s_or_b32 s2, vcc_lo, s2
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s2
		; GFX11-NEXT: s_cbranch_execnz .LBB22_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i64, ptr addrspace(1) %ptr, i32 4		%gep = getelementptr i64, ptr addrspace(1) %ptr, i32 4
%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 42 seq_cst, align 8		%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 42 seq_cst, align 8
ret void		ret void
}		}

define amdgpu_kernel void @global_atomic_inc_ret_i64_offset_addr64(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {		define amdgpu_kernel void @global_atomic_inc_ret_i64_offset_addr64(ptr addrspace(1) %out, ptr addrspace(1) %ptr) #1 {
; CI-LABEL: global_atomic_inc_ret_i64_offset_addr64:		; CI-LABEL: global_atomic_inc_ret_i64_offset_addr64:
▲ Show 20 Lines • Show All 360 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
store i32 %result, ptr %out, align 4		store i32 %result, ptr %out, align 4
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_inc_ret_i32_offset_system(ptr %out, ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_inc_ret_i32_offset_system(ptr %out, ptr %ptr) #1 {
; CI-LABEL: flat_atomic_inc_ret_i32_offset_system:		; CI-LABEL: flat_atomic_inc_ret_i32_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v2, 42		; CI-NEXT: s_mov_b64 s[4:5], 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s2, s2, 16		; CI-NEXT: s_add_u32 s2, s2, 16
; CI-NEXT: s_addc_u32 s3, s3, 0		; CI-NEXT: s_addc_u32 s3, s3, 0
; CI-NEXT: v_mov_b32_e32 v0, s2		; CI-NEXT: v_mov_b32_e32 v0, s2
; CI-NEXT: v_mov_b32_e32 v1, s3		; CI-NEXT: v_mov_b32_e32 v1, s3
		; CI-NEXT: flat_load_dword v0, v[0:1]
		; CI-NEXT: .LBB27_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_inc v2, v[0:1], v2 glc		; CI-NEXT: v_mov_b32_e32 v1, v0
		; CI-NEXT: v_add_i32_e32 v0, vcc, 1, v1
		; CI-NEXT: v_mov_b32_e32 v2, s2
		; CI-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; CI-NEXT: v_mov_b32_e32 v3, s3
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; CI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
; CI-NEXT: v_mov_b32_e32 v0, s0		; CI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
; CI-NEXT: v_mov_b32_e32 v1, s1		; CI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
; CI-NEXT: flat_store_dword v[0:1], v2		; CI-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; CI-NEXT: s_cbranch_execnz .LBB27_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
		; CI-NEXT: s_or_b64 exec, exec, s[4:5]
		; CI-NEXT: v_mov_b32_e32 v2, s1
		; CI-NEXT: v_mov_b32_e32 v1, s0
		; CI-NEXT: flat_store_dword v[1:2], v0
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: flat_atomic_inc_ret_i32_offset_system:		; VI-LABEL: flat_atomic_inc_ret_i32_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v2, 42		; VI-NEXT: s_mov_b64 s[4:5], 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s2, s2, 16		; VI-NEXT: s_add_u32 s2, s2, 16
; VI-NEXT: s_addc_u32 s3, s3, 0		; VI-NEXT: s_addc_u32 s3, s3, 0
; VI-NEXT: v_mov_b32_e32 v0, s2		; VI-NEXT: v_mov_b32_e32 v0, s2
; VI-NEXT: v_mov_b32_e32 v1, s3		; VI-NEXT: v_mov_b32_e32 v1, s3
		; VI-NEXT: flat_load_dword v0, v[0:1]
		; VI-NEXT: .LBB27_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_inc v2, v[0:1], v2 glc		; VI-NEXT: v_mov_b32_e32 v1, v0
		; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v1
		; VI-NEXT: v_mov_b32_e32 v2, s2
		; VI-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; VI-NEXT: v_mov_b32_e32 v3, s3
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
; VI-NEXT: v_mov_b32_e32 v0, s0		; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
; VI-NEXT: v_mov_b32_e32 v1, s1		; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
; VI-NEXT: flat_store_dword v[0:1], v2		; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; VI-NEXT: s_cbranch_execnz .LBB27_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
		; VI-NEXT: s_or_b64 exec, exec, s[4:5]
		; VI-NEXT: v_mov_b32_e32 v2, s1
		; VI-NEXT: v_mov_b32_e32 v1, s0
		; VI-NEXT: flat_store_dword v[1:2], v0
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: flat_atomic_inc_ret_i32_offset_system:		; GFX9-LABEL: flat_atomic_inc_ret_i32_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v2, 42		; GFX9-NEXT: s_mov_b64 s[4:5], 0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, s2		; GFX9-NEXT: v_mov_b32_e32 v0, s2
; GFX9-NEXT: v_mov_b32_e32 v1, s3		; GFX9-NEXT: v_mov_b32_e32 v1, s3
		; GFX9-NEXT: flat_load_dword v0, v[0:1] offset:16
		; GFX9-NEXT: .LBB27_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: flat_atomic_inc v2, v[0:1], v2 offset:16 glc		; GFX9-NEXT: v_mov_b32_e32 v1, v0
		; GFX9-NEXT: v_mov_b32_e32 v2, s2
		; GFX9-NEXT: v_add_u32_e32 v0, 1, v1
		; GFX9-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; GFX9-NEXT: v_mov_b32_e32 v3, s3
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX9-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
; GFX9-NEXT: v_mov_b32_e32 v0, s0		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
; GFX9-NEXT: v_mov_b32_e32 v1, s1		; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
; GFX9-NEXT: flat_store_dword v[0:1], v2		; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; GFX9-NEXT: s_cbranch_execnz .LBB27_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
		; GFX9-NEXT: v_mov_b32_e32 v2, s1
		; GFX9-NEXT: v_mov_b32_e32 v1, s0
		; GFX9-NEXT: flat_store_dword v[1:2], v0
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: flat_atomic_inc_ret_i32_offset_system:		; GFX10-LABEL: flat_atomic_inc_ret_i32_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v2, 42		; GFX10-NEXT: s_mov_b32 s4, 0
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
; GFX10-NEXT: s_add_u32 s2, s2, 16		; GFX10-NEXT: s_add_u32 s2, s2, 16
; GFX10-NEXT: s_addc_u32 s3, s3, 0		; GFX10-NEXT: s_addc_u32 s3, s3, 0
; GFX10-NEXT: v_mov_b32_e32 v0, s2		; GFX10-NEXT: v_mov_b32_e32 v0, s2
; GFX10-NEXT: v_mov_b32_e32 v1, s3		; GFX10-NEXT: v_mov_b32_e32 v1, s3
		; GFX10-NEXT: flat_load_dword v0, v[0:1]
		; GFX10-NEXT: .LBB27_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v1, v0
		; GFX10-NEXT: v_mov_b32_e32 v2, s2
		; GFX10-NEXT: v_mov_b32_e32 v3, s3
		; GFX10-NEXT: v_add_nc_u32_e32 v0, 1, v1
		; GFX10-NEXT: v_cmp_le_u32_e32 vcc_lo, 42, v1
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: flat_atomic_inc v2, v[0:1], v2 glc		; GFX10-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
; GFX10-NEXT: v_mov_b32_e32 v0, s0		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
; GFX10-NEXT: v_mov_b32_e32 v1, s1		; GFX10-NEXT: s_or_b32 s4, vcc_lo, s4
; GFX10-NEXT: flat_store_dword v[0:1], v2		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s4
		; GFX10-NEXT: s_cbranch_execnz .LBB27_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX10-NEXT: s_or_b32 exec_lo, exec_lo, s4
		; GFX10-NEXT: v_mov_b32_e32 v2, s1
		; GFX10-NEXT: v_mov_b32_e32 v1, s0
		; GFX10-NEXT: flat_store_dword v[1:2], v0
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: flat_atomic_inc_ret_i32_offset_system:		; GFX11-LABEL: flat_atomic_inc_ret_i32_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0		; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v2, 42		; GFX11-NEXT: s_mov_b32 s4, 0
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v0, s2 :: v_dual_mov_b32 v1, s3		; GFX11-NEXT: v_dual_mov_b32 v0, s2 :: v_dual_mov_b32 v1, s3
		; GFX11-NEXT: flat_load_b32 v0, v[0:1] offset:16
		; GFX11-NEXT: .LBB27_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v1, v0 :: v_dual_mov_b32 v2, s2
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_1) \| instskip(SKIP_1) \| instid1(VALU_DEP_2)
		; GFX11-NEXT: v_dual_mov_b32 v3, s3 :: v_dual_add_nc_u32 v0, 1, v1
		; GFX11-NEXT: v_cmp_le_u32_e32 vcc_lo, 42, v1
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: flat_atomic_inc_u32 v2, v[0:1], v2 offset:16 glc		; GFX11-NEXT: flat_atomic_cmpswap_b32 v0, v[2:3], v[0:1] offset:16 glc
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
; GFX11-NEXT: v_dual_mov_b32 v0, s0 :: v_dual_mov_b32 v1, s1		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
; GFX11-NEXT: flat_store_b32 v[0:1], v2		; GFX11-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s4
		; GFX11-NEXT: s_cbranch_execnz .LBB27_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX11-NEXT: s_or_b32 exec_lo, exec_lo, s4
		; GFX11-NEXT: v_dual_mov_b32 v2, s1 :: v_dual_mov_b32 v1, s0
		; GFX11-NEXT: flat_store_b32 v[1:2], v0
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i32, ptr %ptr, i32 4		%gep = getelementptr i32, ptr %ptr, i32 4
%result = atomicrmw uinc_wrap ptr %gep, i32 42 seq_cst, align 4		%result = atomicrmw uinc_wrap ptr %gep, i32 42 seq_cst, align 4
store i32 %result, ptr %out, align 4		store i32 %result, ptr %out, align 4
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_inc_noret_i32(ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_inc_noret_i32(ptr %ptr) #1 {
▲ Show 20 Lines • Show All 150 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%result = atomicrmw uinc_wrap ptr %gep, i32 42 syncscope("agent") seq_cst, align 4		%result = atomicrmw uinc_wrap ptr %gep, i32 42 syncscope("agent") seq_cst, align 4
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_inc_noret_i32_offset_system(ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_inc_noret_i32_offset_system(ptr %ptr) #1 {
; CI-LABEL: flat_atomic_inc_noret_i32_offset_system:		; CI-LABEL: flat_atomic_inc_noret_i32_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v2, 42		; CI-NEXT: s_mov_b64 s[2:3], 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s0, s0, 16		; CI-NEXT: s_add_u32 s0, s0, 16
; CI-NEXT: s_addc_u32 s1, s1, 0		; CI-NEXT: s_addc_u32 s1, s1, 0
; CI-NEXT: v_mov_b32_e32 v0, s0		; CI-NEXT: v_mov_b32_e32 v0, s0
; CI-NEXT: v_mov_b32_e32 v1, s1		; CI-NEXT: v_mov_b32_e32 v1, s1
		; CI-NEXT: flat_load_dword v1, v[0:1]
		; CI-NEXT: .LBB30_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_inc v[0:1], v2		; CI-NEXT: v_add_i32_e32 v0, vcc, 1, v1
		; CI-NEXT: v_mov_b32_e32 v3, s1
		; CI-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; CI-NEXT: v_mov_b32_e32 v2, s0
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; CI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
		; CI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; CI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; CI-NEXT: v_mov_b32_e32 v1, v0
		; CI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; CI-NEXT: s_cbranch_execnz .LBB30_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: flat_atomic_inc_noret_i32_offset_system:		; VI-LABEL: flat_atomic_inc_noret_i32_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v2, 42		; VI-NEXT: s_mov_b64 s[2:3], 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s0, s0, 16		; VI-NEXT: s_add_u32 s0, s0, 16
; VI-NEXT: s_addc_u32 s1, s1, 0		; VI-NEXT: s_addc_u32 s1, s1, 0
; VI-NEXT: v_mov_b32_e32 v0, s0		; VI-NEXT: v_mov_b32_e32 v0, s0
; VI-NEXT: v_mov_b32_e32 v1, s1		; VI-NEXT: v_mov_b32_e32 v1, s1
		; VI-NEXT: flat_load_dword v1, v[0:1]
		; VI-NEXT: .LBB30_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_inc v[0:1], v2		; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v1
		; VI-NEXT: v_mov_b32_e32 v3, s1
		; VI-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; VI-NEXT: v_mov_b32_e32 v2, s0
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
		; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; VI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; VI-NEXT: v_mov_b32_e32 v1, v0
		; VI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; VI-NEXT: s_cbranch_execnz .LBB30_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: flat_atomic_inc_noret_i32_offset_system:		; GFX9-LABEL: flat_atomic_inc_noret_i32_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v2, 42		; GFX9-NEXT: s_mov_b64 s[2:3], 0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v0, s0		; GFX9-NEXT: v_mov_b32_e32 v0, s0
; GFX9-NEXT: v_mov_b32_e32 v1, s1		; GFX9-NEXT: v_mov_b32_e32 v1, s1
		; GFX9-NEXT: flat_load_dword v1, v[0:1] offset:16
		; GFX9-NEXT: .LBB30_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: flat_atomic_inc v[0:1], v2 offset:16		; GFX9-NEXT: v_add_u32_e32 v0, 1, v1
		; GFX9-NEXT: v_mov_b32_e32 v3, s1
		; GFX9-NEXT: v_cmp_le_u32_e32 vcc, 42, v1
		; GFX9-NEXT: v_mov_b32_e32 v2, s0
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX9-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
		; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
		; GFX9-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v1, v0
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; GFX9-NEXT: s_cbranch_execnz .LBB30_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: flat_atomic_inc_noret_i32_offset_system:		; GFX10-LABEL: flat_atomic_inc_noret_i32_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v2, 42		; GFX10-NEXT: s_mov_b32 s2, 0
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
; GFX10-NEXT: s_add_u32 s0, s0, 16		; GFX10-NEXT: s_add_u32 s0, s0, 16
; GFX10-NEXT: s_addc_u32 s1, s1, 0		; GFX10-NEXT: s_addc_u32 s1, s1, 0
; GFX10-NEXT: v_mov_b32_e32 v0, s0		; GFX10-NEXT: v_mov_b32_e32 v0, s0
; GFX10-NEXT: v_mov_b32_e32 v1, s1		; GFX10-NEXT: v_mov_b32_e32 v1, s1
		; GFX10-NEXT: flat_load_dword v1, v[0:1]
		; GFX10-NEXT: .LBB30_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX10-NEXT: v_add_nc_u32_e32 v0, 1, v1
		; GFX10-NEXT: v_cmp_le_u32_e32 vcc_lo, 42, v1
		; GFX10-NEXT: v_mov_b32_e32 v3, s1
		; GFX10-NEXT: v_mov_b32_e32 v2, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: flat_atomic_inc v[0:1], v2		; GFX10-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
		; GFX10-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
		; GFX10-NEXT: v_mov_b32_e32 v1, v0
		; GFX10-NEXT: s_or_b32 s2, vcc_lo, s2
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s2
		; GFX10-NEXT: s_cbranch_execnz .LBB30_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: flat_atomic_inc_noret_i32_offset_system:		; GFX11-LABEL: flat_atomic_inc_noret_i32_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0		; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v2, 42		; GFX11-NEXT: s_mov_b32 s2, 0
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v0, s0 :: v_dual_mov_b32 v1, s1		; GFX11-NEXT: v_dual_mov_b32 v0, s0 :: v_dual_mov_b32 v1, s1
		; GFX11-NEXT: flat_load_b32 v1, v[0:1] offset:16
		; GFX11-NEXT: .LBB30_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v3, s1 :: v_dual_add_nc_u32 v0, 1, v1
		; GFX11-NEXT: v_cmp_le_u32_e32 vcc_lo, 42, v1
		; GFX11-NEXT: v_mov_b32_e32 v2, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3)
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: flat_atomic_inc_u32 v[0:1], v2 offset:16		; GFX11-NEXT: flat_atomic_cmpswap_b32 v0, v[2:3], v[0:1] offset:16 glc
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
		; GFX11-NEXT: v_cmp_eq_u32_e32 vcc_lo, v0, v1
		; GFX11-NEXT: v_mov_b32_e32 v1, v0
		; GFX11-NEXT: s_or_b32 s2, vcc_lo, s2
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s2
		; GFX11-NEXT: s_cbranch_execnz .LBB30_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i32, ptr %ptr, i32 4		%gep = getelementptr i32, ptr %ptr, i32 4
%result = atomicrmw uinc_wrap ptr %gep, i32 42 seq_cst, align 4		%result = atomicrmw uinc_wrap ptr %gep, i32 42 seq_cst, align 4
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_inc_ret_i32_offset_addr64(ptr %out, ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_inc_ret_i32_offset_addr64(ptr %out, ptr %ptr) #1 {
; CI-LABEL: flat_atomic_inc_ret_i32_offset_addr64:		; CI-LABEL: flat_atomic_inc_ret_i32_offset_addr64:
▲ Show 20 Lines • Show All 525 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
store i64 %result, ptr %out, align 4		store i64 %result, ptr %out, align 4
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_inc_ret_i64_offset_system(ptr %out, ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_inc_ret_i64_offset_system(ptr %out, ptr %ptr) #1 {
; CI-LABEL: flat_atomic_inc_ret_i64_offset_system:		; CI-LABEL: flat_atomic_inc_ret_i64_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; CI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v0, 42
; CI-NEXT: v_mov_b32_e32 v1, 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s2, s2, 32		; CI-NEXT: s_add_u32 s4, s2, 32
		; CI-NEXT: s_addc_u32 s5, s3, 0
		; CI-NEXT: v_mov_b32_e32 v0, s4
		; CI-NEXT: s_add_u32 s2, s2, 36
		; CI-NEXT: v_mov_b32_e32 v1, s5
; CI-NEXT: s_addc_u32 s3, s3, 0		; CI-NEXT: s_addc_u32 s3, s3, 0
; CI-NEXT: v_mov_b32_e32 v2, s2		; CI-NEXT: v_mov_b32_e32 v2, s2
; CI-NEXT: v_mov_b32_e32 v3, s3		; CI-NEXT: v_mov_b32_e32 v3, s3
		; CI-NEXT: flat_load_dword v0, v[0:1]
		; CI-NEXT: flat_load_dword v1, v[2:3]
		; CI-NEXT: s_mov_b64 s[2:3], 0
		; CI-NEXT: .LBB36_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; CI-NEXT: v_mov_b32_e32 v3, v1
		; CI-NEXT: v_mov_b32_e32 v2, v0
		; CI-NEXT: v_add_i32_e32 v0, vcc, 1, v2
		; CI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
		; CI-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; CI-NEXT: v_mov_b32_e32 v4, s4
		; CI-NEXT: v_mov_b32_e32 v5, s5
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; CI-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc		; CI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
		; CI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; CI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; CI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; CI-NEXT: s_cbranch_execnz .LBB36_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
		; CI-NEXT: s_or_b64 exec, exec, s[2:3]
; CI-NEXT: v_mov_b32_e32 v3, s1		; CI-NEXT: v_mov_b32_e32 v3, s1
; CI-NEXT: v_mov_b32_e32 v2, s0		; CI-NEXT: v_mov_b32_e32 v2, s0
; CI-NEXT: s_add_u32 s0, s0, 4		; CI-NEXT: s_add_u32 s0, s0, 4
; CI-NEXT: s_addc_u32 s1, s1, 0		; CI-NEXT: s_addc_u32 s1, s1, 0
; CI-NEXT: v_mov_b32_e32 v5, s1
; CI-NEXT: v_mov_b32_e32 v4, s0
; CI-NEXT: flat_store_dword v[2:3], v0		; CI-NEXT: flat_store_dword v[2:3], v0
; CI-NEXT: flat_store_dword v[4:5], v1		; CI-NEXT: v_mov_b32_e32 v3, s1
		; CI-NEXT: v_mov_b32_e32 v2, s0
		; CI-NEXT: flat_store_dword v[2:3], v1
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: flat_atomic_inc_ret_i64_offset_system:		; VI-LABEL: flat_atomic_inc_ret_i64_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; VI-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v0, 42
; VI-NEXT: v_mov_b32_e32 v1, 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s2, s2, 32		; VI-NEXT: s_add_u32 s4, s2, 32
		; VI-NEXT: s_addc_u32 s5, s3, 0
		; VI-NEXT: v_mov_b32_e32 v0, s4
		; VI-NEXT: s_add_u32 s2, s2, 36
		; VI-NEXT: v_mov_b32_e32 v1, s5
; VI-NEXT: s_addc_u32 s3, s3, 0		; VI-NEXT: s_addc_u32 s3, s3, 0
; VI-NEXT: v_mov_b32_e32 v2, s2		; VI-NEXT: v_mov_b32_e32 v2, s2
; VI-NEXT: v_mov_b32_e32 v3, s3		; VI-NEXT: v_mov_b32_e32 v3, s3
		; VI-NEXT: flat_load_dword v0, v[0:1]
		; VI-NEXT: flat_load_dword v1, v[2:3]
		; VI-NEXT: s_mov_b64 s[2:3], 0
		; VI-NEXT: .LBB36_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; VI-NEXT: v_mov_b32_e32 v3, v1
		; VI-NEXT: v_mov_b32_e32 v2, v0
		; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v2
		; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
		; VI-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; VI-NEXT: v_mov_b32_e32 v4, s4
		; VI-NEXT: v_mov_b32_e32 v5, s5
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; VI-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc		; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
		; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; VI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; VI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; VI-NEXT: s_cbranch_execnz .LBB36_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
		; VI-NEXT: s_or_b64 exec, exec, s[2:3]
; VI-NEXT: v_mov_b32_e32 v3, s1		; VI-NEXT: v_mov_b32_e32 v3, s1
; VI-NEXT: v_mov_b32_e32 v2, s0		; VI-NEXT: v_mov_b32_e32 v2, s0
; VI-NEXT: s_add_u32 s0, s0, 4		; VI-NEXT: s_add_u32 s0, s0, 4
; VI-NEXT: s_addc_u32 s1, s1, 0		; VI-NEXT: s_addc_u32 s1, s1, 0
; VI-NEXT: v_mov_b32_e32 v5, s1
; VI-NEXT: v_mov_b32_e32 v4, s0
; VI-NEXT: flat_store_dword v[2:3], v0		; VI-NEXT: flat_store_dword v[2:3], v0
; VI-NEXT: flat_store_dword v[4:5], v1		; VI-NEXT: v_mov_b32_e32 v3, s1
		; VI-NEXT: v_mov_b32_e32 v2, s0
		; VI-NEXT: flat_store_dword v[2:3], v1
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: flat_atomic_inc_ret_i64_offset_system:		; GFX9-LABEL: flat_atomic_inc_ret_i64_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[4:5], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v2, s2		; GFX9-NEXT: v_mov_b32_e32 v0, s2
; GFX9-NEXT: v_mov_b32_e32 v3, s3		; GFX9-NEXT: v_mov_b32_e32 v1, s3
		; GFX9-NEXT: flat_load_dwordx2 v[0:1], v[0:1] offset:32
		; GFX9-NEXT: .LBB36_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX9-NEXT: v_mov_b32_e32 v3, v1
		; GFX9-NEXT: v_mov_b32_e32 v2, v0
		; GFX9-NEXT: v_add_co_u32_e32 v0, vcc, 1, v2
		; GFX9-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v3, vcc
		; GFX9-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v5, s3
		; GFX9-NEXT: v_mov_b32_e32 v4, s2
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; GFX9-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] offset:32 glc		; GFX9-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
		; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
		; GFX9-NEXT: s_cbranch_execnz .LBB36_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
; GFX9-NEXT: v_mov_b32_e32 v3, s1		; GFX9-NEXT: v_mov_b32_e32 v3, s1
; GFX9-NEXT: v_mov_b32_e32 v2, s0		; GFX9-NEXT: v_mov_b32_e32 v2, s0
; GFX9-NEXT: flat_store_dwordx2 v[2:3], v[0:1]		; GFX9-NEXT: flat_store_dwordx2 v[2:3], v[0:1]
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: flat_atomic_inc_ret_i64_offset_system:		; GFX10-LABEL: flat_atomic_inc_ret_i64_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx4 s[0:3], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42		; GFX10-NEXT: s_mov_b32 s4, 0
; GFX10-NEXT: v_mov_b32_e32 v1, 0
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
; GFX10-NEXT: s_add_u32 s2, s2, 32		; GFX10-NEXT: s_add_u32 s2, s2, 32
; GFX10-NEXT: s_addc_u32 s3, s3, 0		; GFX10-NEXT: s_addc_u32 s3, s3, 0
; GFX10-NEXT: v_mov_b32_e32 v2, s2		; GFX10-NEXT: v_mov_b32_e32 v0, s2
; GFX10-NEXT: v_mov_b32_e32 v3, s3		; GFX10-NEXT: v_mov_b32_e32 v1, s3
		; GFX10-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
		; GFX10-NEXT: .LBB36_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX10-NEXT: v_mov_b32_e32 v3, v1
		; GFX10-NEXT: v_mov_b32_e32 v2, v0
		; GFX10-NEXT: v_mov_b32_e32 v5, s3
		; GFX10-NEXT: v_mov_b32_e32 v4, s2
		; GFX10-NEXT: v_add_co_u32 v0, vcc_lo, v2, 1
		; GFX10-NEXT: v_add_co_ci_u32_e32 v1, vcc_lo, 0, v3, vcc_lo
		; GFX10-NEXT: v_cmp_le_u64_e32 vcc_lo, 42, v[2:3]
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
		; GFX10-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc_lo
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc		; GFX10-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
		; GFX10-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[2:3]
		; GFX10-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s4
		; GFX10-NEXT: s_cbranch_execnz .LBB36_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX10-NEXT: s_or_b32 exec_lo, exec_lo, s4
; GFX10-NEXT: v_mov_b32_e32 v3, s1		; GFX10-NEXT: v_mov_b32_e32 v3, s1
; GFX10-NEXT: v_mov_b32_e32 v2, s0		; GFX10-NEXT: v_mov_b32_e32 v2, s0
; GFX10-NEXT: flat_store_dwordx2 v[2:3], v[0:1]		; GFX10-NEXT: flat_store_dwordx2 v[2:3], v[0:1]
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: flat_atomic_inc_ret_i64_offset_system:		; GFX11-LABEL: flat_atomic_inc_ret_i64_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0		; GFX11-NEXT: s_load_b128 s[0:3], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v0, 42		; GFX11-NEXT: s_mov_b32 s4, 0
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v1, 0 :: v_dual_mov_b32 v2, s2		; GFX11-NEXT: v_dual_mov_b32 v0, s2 :: v_dual_mov_b32 v1, s3
; GFX11-NEXT: v_mov_b32_e32 v3, s3		; GFX11-NEXT: flat_load_b64 v[0:1], v[0:1] offset:32
		; GFX11-NEXT: .p2align 6
		; GFX11-NEXT: .LBB36_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX11-NEXT: v_dual_mov_b32 v3, v1 :: v_dual_mov_b32 v2, v0
		; GFX11-NEXT: v_dual_mov_b32 v5, s3 :: v_dual_mov_b32 v4, s2
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_2) \| instskip(NEXT) \| instid1(VALU_DEP_3)
		; GFX11-NEXT: v_add_co_u32 v0, vcc_lo, v2, 1
		; GFX11-NEXT: v_add_co_ci_u32_e32 v1, vcc_lo, 0, v3, vcc_lo
		; GFX11-NEXT: v_cmp_le_u64_e32 vcc_lo, 42, v[2:3]
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_3) \| instskip(NEXT) \| instid1(VALU_DEP_3)
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
		; GFX11-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc_lo
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: flat_atomic_inc_u64 v[0:1], v[2:3], v[0:1] offset:32 glc		; GFX11-NEXT: flat_atomic_cmpswap_b64 v[0:1], v[4:5], v[0:3] offset:32 glc
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
		; GFX11-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[2:3]
		; GFX11-NEXT: s_or_b32 s4, vcc_lo, s4
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s4
		; GFX11-NEXT: s_cbranch_execnz .LBB36_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
		; GFX11-NEXT: s_or_b32 exec_lo, exec_lo, s4
; GFX11-NEXT: v_dual_mov_b32 v3, s1 :: v_dual_mov_b32 v2, s0		; GFX11-NEXT: v_dual_mov_b32 v3, s1 :: v_dual_mov_b32 v2, s0
; GFX11-NEXT: flat_store_b64 v[2:3], v[0:1]		; GFX11-NEXT: flat_store_b64 v[2:3], v[0:1]
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i64, ptr %ptr, i32 4		%gep = getelementptr i64, ptr %ptr, i32 4
%result = atomicrmw uinc_wrap ptr %gep, i64 42 seq_cst, align 8		%result = atomicrmw uinc_wrap ptr %gep, i64 42 seq_cst, align 8
store i64 %result, ptr %out, align 4		store i64 %result, ptr %out, align 4
ret void		ret void
}		}
▲ Show 20 Lines • Show All 161 Lines • ▼ Show 20 Lines	; GFX11-NEXT: s_endpgm
%gep = getelementptr i64, ptr %ptr, i32 4		%gep = getelementptr i64, ptr %ptr, i32 4
%result = atomicrmw uinc_wrap ptr %gep, i64 42 syncscope("agent") seq_cst, align 8		%result = atomicrmw uinc_wrap ptr %gep, i64 42 syncscope("agent") seq_cst, align 8
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_inc_noret_i64_offset_system(ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_inc_noret_i64_offset_system(ptr %ptr) #1 {
; CI-LABEL: flat_atomic_inc_noret_i64_offset_system:		; CI-LABEL: flat_atomic_inc_noret_i64_offset_system:
; CI: ; %bb.0:		; CI: ; %bb.0:
; CI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; CI-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; CI-NEXT: v_mov_b32_e32 v0, 42
; CI-NEXT: v_mov_b32_e32 v1, 0
; CI-NEXT: s_waitcnt lgkmcnt(0)		; CI-NEXT: s_waitcnt lgkmcnt(0)
; CI-NEXT: s_add_u32 s0, s0, 32		; CI-NEXT: s_add_u32 s0, s2, 32
; CI-NEXT: s_addc_u32 s1, s1, 0		; CI-NEXT: s_addc_u32 s1, s3, 0
; CI-NEXT: v_mov_b32_e32 v3, s1		; CI-NEXT: s_add_u32 s2, s2, 36
; CI-NEXT: v_mov_b32_e32 v2, s0		; CI-NEXT: s_addc_u32 s3, s3, 0
		; CI-NEXT: v_mov_b32_e32 v0, s0
		; CI-NEXT: v_mov_b32_e32 v4, s3
		; CI-NEXT: v_mov_b32_e32 v1, s1
		; CI-NEXT: v_mov_b32_e32 v3, s2
		; CI-NEXT: flat_load_dword v2, v[0:1]
		; CI-NEXT: flat_load_dword v3, v[3:4]
		; CI-NEXT: s_mov_b64 s[2:3], 0
		; CI-NEXT: .LBB39_1: ; %atomicrmw.start
		; CI-NEXT: ; =>This Inner Loop Header: Depth=1
		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; CI-NEXT: v_add_i32_e32 v0, vcc, 1, v2
		; CI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
		; CI-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; CI-NEXT: v_mov_b32_e32 v5, s1
		; CI-NEXT: v_mov_b32_e32 v4, s0
		; CI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; CI-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]		; CI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; CI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; CI-NEXT: buffer_wbinvl1_vol		; CI-NEXT: buffer_wbinvl1_vol
		; CI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; CI-NEXT: v_mov_b32_e32 v3, v1
		; CI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; CI-NEXT: v_mov_b32_e32 v2, v0
		; CI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; CI-NEXT: s_cbranch_execnz .LBB39_1
		; CI-NEXT: ; %bb.2: ; %atomicrmw.end
; CI-NEXT: s_endpgm		; CI-NEXT: s_endpgm
;		;
; VI-LABEL: flat_atomic_inc_noret_i64_offset_system:		; VI-LABEL: flat_atomic_inc_noret_i64_offset_system:
; VI: ; %bb.0:		; VI: ; %bb.0:
; VI-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; VI-NEXT: s_load_dwordx2 s[2:3], s[4:5], 0x0
; VI-NEXT: v_mov_b32_e32 v0, 42
; VI-NEXT: v_mov_b32_e32 v1, 0
; VI-NEXT: s_waitcnt lgkmcnt(0)		; VI-NEXT: s_waitcnt lgkmcnt(0)
; VI-NEXT: s_add_u32 s0, s0, 32		; VI-NEXT: s_add_u32 s0, s2, 32
; VI-NEXT: s_addc_u32 s1, s1, 0		; VI-NEXT: s_addc_u32 s1, s3, 0
; VI-NEXT: v_mov_b32_e32 v3, s1		; VI-NEXT: s_add_u32 s2, s2, 36
; VI-NEXT: v_mov_b32_e32 v2, s0		; VI-NEXT: s_addc_u32 s3, s3, 0
		; VI-NEXT: v_mov_b32_e32 v0, s0
		; VI-NEXT: v_mov_b32_e32 v4, s3
		; VI-NEXT: v_mov_b32_e32 v1, s1
		; VI-NEXT: v_mov_b32_e32 v3, s2
		; VI-NEXT: flat_load_dword v2, v[0:1]
		; VI-NEXT: flat_load_dword v3, v[3:4]
		; VI-NEXT: s_mov_b64 s[2:3], 0
		; VI-NEXT: .LBB39_1: ; %atomicrmw.start
		; VI-NEXT: ; =>This Inner Loop Header: Depth=1
		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v2
		; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
		; VI-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; VI-NEXT: v_mov_b32_e32 v5, s1
		; VI-NEXT: v_mov_b32_e32 v4, s0
		; VI-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; VI-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]		; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; VI-NEXT: buffer_wbinvl1_vol		; VI-NEXT: buffer_wbinvl1_vol
		; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; VI-NEXT: v_mov_b32_e32 v3, v1
		; VI-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; VI-NEXT: v_mov_b32_e32 v2, v0
		; VI-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; VI-NEXT: s_cbranch_execnz .LBB39_1
		; VI-NEXT: ; %bb.2: ; %atomicrmw.end
; VI-NEXT: s_endpgm		; VI-NEXT: s_endpgm
;		;
; GFX9-LABEL: flat_atomic_inc_noret_i64_offset_system:		; GFX9-LABEL: flat_atomic_inc_noret_i64_offset_system:
; GFX9: ; %bb.0:		; GFX9: ; %bb.0:
; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX9-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; GFX9-NEXT: v_mov_b32_e32 v0, 42		; GFX9-NEXT: s_mov_b64 s[2:3], 0
; GFX9-NEXT: v_mov_b32_e32 v1, 0
; GFX9-NEXT: s_waitcnt lgkmcnt(0)		; GFX9-NEXT: s_waitcnt lgkmcnt(0)
; GFX9-NEXT: v_mov_b32_e32 v3, s1		; GFX9-NEXT: v_mov_b32_e32 v0, s0
; GFX9-NEXT: v_mov_b32_e32 v2, s0		; GFX9-NEXT: v_mov_b32_e32 v1, s1
		; GFX9-NEXT: flat_load_dwordx2 v[2:3], v[0:1] offset:32
		; GFX9-NEXT: .LBB39_1: ; %atomicrmw.start
		; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX9-NEXT: v_add_co_u32_e32 v0, vcc, 1, v2
		; GFX9-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v3, vcc
		; GFX9-NEXT: v_cmp_le_u64_e32 vcc, 42, v[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v5, s1
		; GFX9-NEXT: v_mov_b32_e32 v4, s0
		; GFX9-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc
		; GFX9-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1] offset:32		; GFX9-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX9-NEXT: buffer_wbinvl1_vol		; GFX9-NEXT: buffer_wbinvl1_vol
		; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v3, v1
		; GFX9-NEXT: s_or_b64 s[2:3], vcc, s[2:3]
		; GFX9-NEXT: v_mov_b32_e32 v2, v0
		; GFX9-NEXT: s_andn2_b64 exec, exec, s[2:3]
		; GFX9-NEXT: s_cbranch_execnz .LBB39_1
		; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX9-NEXT: s_endpgm		; GFX9-NEXT: s_endpgm
;		;
; GFX10-LABEL: flat_atomic_inc_noret_i64_offset_system:		; GFX10-LABEL: flat_atomic_inc_noret_i64_offset_system:
; GFX10: ; %bb.0:		; GFX10: ; %bb.0:
; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0		; GFX10-NEXT: s_load_dwordx2 s[0:1], s[4:5], 0x0
; GFX10-NEXT: v_mov_b32_e32 v0, 42		; GFX10-NEXT: s_mov_b32 s2, 0
; GFX10-NEXT: v_mov_b32_e32 v1, 0
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt lgkmcnt(0)
; GFX10-NEXT: s_add_u32 s0, s0, 32		; GFX10-NEXT: s_add_u32 s0, s0, 32
; GFX10-NEXT: s_addc_u32 s1, s1, 0		; GFX10-NEXT: s_addc_u32 s1, s1, 0
; GFX10-NEXT: v_mov_b32_e32 v3, s1		; GFX10-NEXT: v_mov_b32_e32 v0, s0
; GFX10-NEXT: v_mov_b32_e32 v2, s0		; GFX10-NEXT: v_mov_b32_e32 v1, s1
		; GFX10-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
		; GFX10-NEXT: .LBB39_1: ; %atomicrmw.start
		; GFX10-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX10-NEXT: v_add_co_u32 v0, vcc_lo, v2, 1
		; GFX10-NEXT: v_add_co_ci_u32_e32 v1, vcc_lo, 0, v3, vcc_lo
		; GFX10-NEXT: v_cmp_le_u64_e32 vcc_lo, 42, v[2:3]
		; GFX10-NEXT: v_mov_b32_e32 v5, s1
		; GFX10-NEXT: v_mov_b32_e32 v4, s0
		; GFX10-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
		; GFX10-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc_lo
; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0		; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]		; GFX10-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
; GFX10-NEXT: s_waitcnt lgkmcnt(0)		; GFX10-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX10-NEXT: s_waitcnt_vscnt null, 0x0
; GFX10-NEXT: buffer_gl0_inv		; GFX10-NEXT: buffer_gl0_inv
; GFX10-NEXT: buffer_gl1_inv		; GFX10-NEXT: buffer_gl1_inv
		; GFX10-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[2:3]
		; GFX10-NEXT: v_mov_b32_e32 v3, v1
		; GFX10-NEXT: v_mov_b32_e32 v2, v0
		; GFX10-NEXT: s_or_b32 s2, vcc_lo, s2
		; GFX10-NEXT: s_andn2_b32 exec_lo, exec_lo, s2
		; GFX10-NEXT: s_cbranch_execnz .LBB39_1
		; GFX10-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX10-NEXT: s_endpgm		; GFX10-NEXT: s_endpgm
;		;
; GFX11-LABEL: flat_atomic_inc_noret_i64_offset_system:		; GFX11-LABEL: flat_atomic_inc_noret_i64_offset_system:
; GFX11: ; %bb.0:		; GFX11: ; %bb.0:
; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0		; GFX11-NEXT: s_load_b64 s[0:1], s[0:1], 0x0
; GFX11-NEXT: v_mov_b32_e32 v0, 42		; GFX11-NEXT: s_mov_b32 s2, 0
; GFX11-NEXT: v_mov_b32_e32 v1, 0
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt lgkmcnt(0)
; GFX11-NEXT: v_dual_mov_b32 v3, s1 :: v_dual_mov_b32 v2, s0		; GFX11-NEXT: v_dual_mov_b32 v0, s0 :: v_dual_mov_b32 v1, s1
		; GFX11-NEXT: flat_load_b64 v[2:3], v[0:1] offset:32
		; GFX11-NEXT: .p2align 6
		; GFX11-NEXT: .LBB39_1: ; %atomicrmw.start
		; GFX11-NEXT: ; =>This Inner Loop Header: Depth=1
		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
		; GFX11-NEXT: v_add_co_u32 v0, vcc_lo, v2, 1
		; GFX11-NEXT: v_add_co_ci_u32_e32 v1, vcc_lo, 0, v3, vcc_lo
		; GFX11-NEXT: v_cmp_le_u64_e32 vcc_lo, 42, v[2:3]
		; GFX11-NEXT: v_dual_mov_b32 v5, s1 :: v_dual_mov_b32 v4, s0
		; GFX11-NEXT: s_delay_alu instid0(VALU_DEP_4) \| instskip(NEXT) \| instid1(VALU_DEP_4)
		; GFX11-NEXT: v_cndmask_b32_e64 v0, v0, 0, vcc_lo
		; GFX11-NEXT: v_cndmask_b32_e64 v1, v1, 0, vcc_lo
; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0		; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: flat_atomic_inc_u64 v[2:3], v[0:1] offset:32		; GFX11-NEXT: flat_atomic_cmpswap_b64 v[0:1], v[4:5], v[0:3] offset:32 glc
; GFX11-NEXT: s_waitcnt lgkmcnt(0)		; GFX11-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
; GFX11-NEXT: s_waitcnt_vscnt null, 0x0
; GFX11-NEXT: buffer_gl0_inv		; GFX11-NEXT: buffer_gl0_inv
; GFX11-NEXT: buffer_gl1_inv		; GFX11-NEXT: buffer_gl1_inv
		; GFX11-NEXT: v_cmp_eq_u64_e32 vcc_lo, v[0:1], v[2:3]
		; GFX11-NEXT: v_dual_mov_b32 v3, v1 :: v_dual_mov_b32 v2, v0
		; GFX11-NEXT: s_or_b32 s2, vcc_lo, s2
		; GFX11-NEXT: s_delay_alu instid0(SALU_CYCLE_1)
		; GFX11-NEXT: s_and_not1_b32 exec_lo, exec_lo, s2
		; GFX11-NEXT: s_cbranch_execnz .LBB39_1
		; GFX11-NEXT: ; %bb.2: ; %atomicrmw.end
; GFX11-NEXT: s_endpgm		; GFX11-NEXT: s_endpgm
%gep = getelementptr i64, ptr %ptr, i32 4		%gep = getelementptr i64, ptr %ptr, i32 4
%result = atomicrmw uinc_wrap ptr %gep, i64 42 seq_cst, align 8		%result = atomicrmw uinc_wrap ptr %gep, i64 42 seq_cst, align 8
ret void		ret void
}		}

define amdgpu_kernel void @flat_atomic_inc_ret_i64_offset_addr64(ptr %out, ptr %ptr) #1 {		define amdgpu_kernel void @flat_atomic_inc_ret_i64_offset_addr64(ptr %out, ptr %ptr) #1 {
; CI-LABEL: flat_atomic_inc_ret_i64_offset_addr64:		; CI-LABEL: flat_atomic_inc_ret_i64_offset_addr64:
▲ Show 20 Lines • Show All 354 Lines • Show Last 20 Lines

llvm/test/CodeGen/AMDGPU/flat_atomics_i32_system.ll

This file is larger than 256 KB, so syntax highlighting is disabled by default.

	Show First 20 Lines • Show All 905 Lines • ▼ Show 20 Lines
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw sub			; atomicrmw sub
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_sub_i32_noret(ptr %ptr, i32 %in) {			define void @flat_atomic_sub_i32_noret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_sub_i32_noret:			; GCN1-LABEL: flat_atomic_sub_i32_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub v[0:1], v2			; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB24_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_sub_i32_e32 v3, vcc, v4, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB24_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i32_noret:			; GCN2-LABEL: flat_atomic_sub_i32_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub v[0:1], v2			; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB24_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_sub_u32_e32 v3, vcc, v4, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB24_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i32_noret:			; GCN3-LABEL: flat_atomic_sub_i32_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub v[0:1], v2			; GCN3-NEXT: flat_load_dword v4, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB24_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_sub_u32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB24_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw sub ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw sub ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_sub_i32_noret_offset(ptr %out, i32 %in) {			define void @flat_atomic_sub_i32_noret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_sub_i32_noret_offset:			; GCN1-LABEL: flat_atomic_sub_i32_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB25_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_sub_i32_e32 v3, vcc, v4, v2
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub v[0:1], v2			; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB25_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i32_noret_offset:			; GCN2-LABEL: flat_atomic_sub_i32_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB25_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_sub_u32_e32 v3, vcc, v4, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub v[0:1], v2			; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB25_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i32_noret_offset:			; GCN3-LABEL: flat_atomic_sub_i32_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub v[0:1], v2 offset:16			; GCN3-NEXT: flat_load_dword v4, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB25_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_sub_u32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB25_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw sub ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw sub ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @flat_atomic_sub_i32_ret(ptr %ptr, i32 %in) {			define i32 @flat_atomic_sub_i32_ret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_sub_i32_ret:			; GCN1-LABEL: flat_atomic_sub_i32_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB26_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: v_sub_i32_e32 v3, vcc, v4, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB26_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v0, v3
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i32_ret:			; GCN2-LABEL: flat_atomic_sub_i32_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB26_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: v_sub_u32_e32 v3, vcc, v4, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB26_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v0, v3
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i32_ret:			; GCN3-LABEL: flat_atomic_sub_i32_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB26_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_sub_u32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB26_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw sub ptr %ptr, i32 %in seq_cst			%result = atomicrmw sub ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @flat_atomic_sub_i32_ret_offset(ptr %out, i32 %in) {			define i32 @flat_atomic_sub_i32_ret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_sub_i32_ret_offset:			; GCN1-LABEL: flat_atomic_sub_i32_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v3, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v0, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB27_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_sub_i32_e32 v0, vcc, v1, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB27_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i32_ret_offset:			; GCN2-LABEL: flat_atomic_sub_i32_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v0, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB27_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_sub_u32_e32 v0, vcc, v1, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB27_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i32_ret_offset:			; GCN3-LABEL: flat_atomic_sub_i32_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB27_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_sub_u32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB27_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw sub ptr %gep, i32 %in seq_cst			%result = atomicrmw sub ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @flat_atomic_sub_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_sub_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_sub_i32_noret_scalar:			; GCN1-LABEL: flat_atomic_sub_i32_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB28_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub v[0:1], v2			; GCN1-NEXT: v_subrev_i32_e32 v0, vcc, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB28_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i32_noret_scalar:			; GCN2-LABEL: flat_atomic_sub_i32_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB28_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub v[0:1], v2			; GCN2-NEXT: v_subrev_u32_e32 v0, vcc, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB28_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i32_noret_scalar:			; GCN3-LABEL: flat_atomic_sub_i32_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB28_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub v[0:1], v2			; GCN3-NEXT: v_subrev_u32_e32 v0, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB28_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw sub ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw sub ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_sub_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_sub_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_sub_i32_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_sub_i32_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s34, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB29_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_subrev_i32_e32 v0, vcc, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub v[0:1], v2			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB29_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i32_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_sub_i32_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s34, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB29_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub v[0:1], v2			; GCN2-NEXT: v_subrev_u32_e32 v0, vcc, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB29_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i32_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_sub_i32_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB29_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub v[0:1], v2 offset:16			; GCN3-NEXT: v_subrev_u32_e32 v0, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB29_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw sub ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw sub ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @flat_atomic_sub_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_sub_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_sub_i32_ret_scalar:			; GCN1-LABEL: flat_atomic_sub_i32_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB30_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: v_subrev_i32_e32 v0, vcc, s6, v1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB30_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i32_ret_scalar:			; GCN2-LABEL: flat_atomic_sub_i32_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB30_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
				; GCN2-NEXT: v_subrev_u32_e32 v0, vcc, s6, v1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB30_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i32_ret_scalar:			; GCN3-LABEL: flat_atomic_sub_i32_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB30_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_subrev_u32_e32 v0, s6, v1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB30_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw sub ptr %ptr, i32 %in seq_cst			%result = atomicrmw sub ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @flat_atomic_sub_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_sub_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_sub_i32_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_sub_i32_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s34, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB31_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: v_subrev_i32_e32 v0, vcc, s6, v1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB31_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i32_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_sub_i32_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s34, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB31_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: v_subrev_u32_e32 v0, vcc, s6, v1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB31_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i32_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_sub_i32_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB31_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_subrev_u32_e32 v0, s6, v1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB31_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw sub ptr %gep, i32 %in seq_cst			%result = atomicrmw sub ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw and			; atomicrmw and
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_and_i32_noret(ptr %ptr, i32 %in) {			define void @flat_atomic_and_i32_noret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_and_i32_noret:			; GCN1-LABEL: flat_atomic_and_i32_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and v[0:1], v2			; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB32_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_and_b32_e32 v3, v4, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB32_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i32_noret:			; GCN2-LABEL: flat_atomic_and_i32_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and v[0:1], v2			; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB32_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_and_b32_e32 v3, v4, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB32_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i32_noret:			; GCN3-LABEL: flat_atomic_and_i32_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and v[0:1], v2			; GCN3-NEXT: flat_load_dword v4, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB32_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_and_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB32_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw and ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw and ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_and_i32_noret_offset(ptr %out, i32 %in) {			define void @flat_atomic_and_i32_noret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_and_i32_noret_offset:			; GCN1-LABEL: flat_atomic_and_i32_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB33_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_and_b32_e32 v3, v4, v2
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and v[0:1], v2			; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB33_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i32_noret_offset:			; GCN2-LABEL: flat_atomic_and_i32_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB33_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_and_b32_e32 v3, v4, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and v[0:1], v2			; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB33_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i32_noret_offset:			; GCN3-LABEL: flat_atomic_and_i32_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and v[0:1], v2 offset:16			; GCN3-NEXT: flat_load_dword v4, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB33_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_and_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB33_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw and ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw and ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @flat_atomic_and_i32_ret(ptr %ptr, i32 %in) {			define i32 @flat_atomic_and_i32_ret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_and_i32_ret:			; GCN1-LABEL: flat_atomic_and_i32_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB34_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: v_and_b32_e32 v3, v4, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB34_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v0, v3
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i32_ret:			; GCN2-LABEL: flat_atomic_and_i32_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB34_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: v_and_b32_e32 v3, v4, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB34_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v0, v3
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i32_ret:			; GCN3-LABEL: flat_atomic_and_i32_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB34_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_and_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB34_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw and ptr %ptr, i32 %in seq_cst			%result = atomicrmw and ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @flat_atomic_and_i32_ret_offset(ptr %out, i32 %in) {			define i32 @flat_atomic_and_i32_ret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_and_i32_ret_offset:			; GCN1-LABEL: flat_atomic_and_i32_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v3, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v0, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB35_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_and_b32_e32 v0, v1, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB35_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i32_ret_offset:			; GCN2-LABEL: flat_atomic_and_i32_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v0, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB35_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_and_b32_e32 v0, v1, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB35_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i32_ret_offset:			; GCN3-LABEL: flat_atomic_and_i32_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB35_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_and_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB35_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw and ptr %gep, i32 %in seq_cst			%result = atomicrmw and ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @flat_atomic_and_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_and_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_and_i32_noret_scalar:			; GCN1-LABEL: flat_atomic_and_i32_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB36_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_and_b32_e32 v0, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and v[0:1], v2			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB36_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i32_noret_scalar:			; GCN2-LABEL: flat_atomic_and_i32_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB36_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_and_b32_e32 v0, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and v[0:1], v2			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB36_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i32_noret_scalar:			; GCN3-LABEL: flat_atomic_and_i32_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB36_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_and_b32_e32 v0, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and v[0:1], v2			; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB36_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw and ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw and ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_and_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_and_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_and_i32_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_and_i32_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s34, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB37_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and v[0:1], v2			; GCN1-NEXT: v_and_b32_e32 v0, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB37_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i32_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_and_i32_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s34, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB37_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_and_b32_e32 v0, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and v[0:1], v2			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB37_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i32_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_and_i32_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB37_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and v[0:1], v2 offset:16			; GCN3-NEXT: v_and_b32_e32 v0, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB37_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw and ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw and ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @flat_atomic_and_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_and_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_and_i32_ret_scalar:			; GCN1-LABEL: flat_atomic_and_i32_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB38_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: v_and_b32_e32 v0, s6, v1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB38_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i32_ret_scalar:			; GCN2-LABEL: flat_atomic_and_i32_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB38_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
				; GCN2-NEXT: v_and_b32_e32 v0, s6, v1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB38_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i32_ret_scalar:			; GCN3-LABEL: flat_atomic_and_i32_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB38_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_and_b32_e32 v0, s6, v1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB38_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw and ptr %ptr, i32 %in seq_cst			%result = atomicrmw and ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @flat_atomic_and_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_and_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_and_i32_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_and_i32_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s34, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB39_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: v_and_b32_e32 v0, s6, v1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB39_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i32_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_and_i32_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s34, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB39_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: v_and_b32_e32 v0, s6, v1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB39_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i32_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_and_i32_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB39_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_and_b32_e32 v0, s6, v1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB39_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw and ptr %gep, i32 %in seq_cst			%result = atomicrmw and ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw nand			; atomicrmw nand
	▲ Show 20 Lines • Show All 658 Lines • ▼ Show 20 Lines
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw or			; atomicrmw or
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_or_i32_noret(ptr %ptr, i32 %in) {			define void @flat_atomic_or_i32_noret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_or_i32_noret:			; GCN1-LABEL: flat_atomic_or_i32_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or v[0:1], v2			; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB48_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_or_b32_e32 v3, v4, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB48_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i32_noret:			; GCN2-LABEL: flat_atomic_or_i32_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or v[0:1], v2			; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB48_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_or_b32_e32 v3, v4, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB48_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i32_noret:			; GCN3-LABEL: flat_atomic_or_i32_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or v[0:1], v2			; GCN3-NEXT: flat_load_dword v4, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB48_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_or_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB48_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw or ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw or ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_or_i32_noret_offset(ptr %out, i32 %in) {			define void @flat_atomic_or_i32_noret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_or_i32_noret_offset:			; GCN1-LABEL: flat_atomic_or_i32_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB49_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or v[0:1], v2			; GCN1-NEXT: v_or_b32_e32 v3, v4, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB49_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i32_noret_offset:			; GCN2-LABEL: flat_atomic_or_i32_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB49_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or v[0:1], v2			; GCN2-NEXT: v_or_b32_e32 v3, v4, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB49_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i32_noret_offset:			; GCN3-LABEL: flat_atomic_or_i32_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or v[0:1], v2 offset:16			; GCN3-NEXT: flat_load_dword v4, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB49_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_or_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB49_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw or ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw or ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @flat_atomic_or_i32_ret(ptr %ptr, i32 %in) {			define i32 @flat_atomic_or_i32_ret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_or_i32_ret:			; GCN1-LABEL: flat_atomic_or_i32_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB50_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: v_or_b32_e32 v3, v4, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB50_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v0, v3
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i32_ret:			; GCN2-LABEL: flat_atomic_or_i32_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB50_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: v_or_b32_e32 v3, v4, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB50_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v0, v3
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i32_ret:			; GCN3-LABEL: flat_atomic_or_i32_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB50_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_or_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB50_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw or ptr %ptr, i32 %in seq_cst			%result = atomicrmw or ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @flat_atomic_or_i32_ret_offset(ptr %out, i32 %in) {			define i32 @flat_atomic_or_i32_ret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_or_i32_ret_offset:			; GCN1-LABEL: flat_atomic_or_i32_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v3, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v0, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB51_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_or_b32_e32 v0, v1, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB51_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i32_ret_offset:			; GCN2-LABEL: flat_atomic_or_i32_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v0, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB51_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_or_b32_e32 v0, v1, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB51_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i32_ret_offset:			; GCN3-LABEL: flat_atomic_or_i32_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB51_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_or_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB51_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw or ptr %gep, i32 %in seq_cst			%result = atomicrmw or ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @flat_atomic_or_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_or_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_or_i32_noret_scalar:			; GCN1-LABEL: flat_atomic_or_i32_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB52_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or v[0:1], v2			; GCN1-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB52_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i32_noret_scalar:			; GCN2-LABEL: flat_atomic_or_i32_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB52_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or v[0:1], v2			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB52_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i32_noret_scalar:			; GCN3-LABEL: flat_atomic_or_i32_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB52_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or v[0:1], v2			; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB52_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw or ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw or ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_or_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_or_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_or_i32_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_or_i32_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s34, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB53_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or v[0:1], v2			; GCN1-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB53_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i32_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_or_i32_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s34, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB53_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or v[0:1], v2			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB53_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i32_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_or_i32_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB53_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or v[0:1], v2 offset:16			; GCN3-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB53_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw or ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw or ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @flat_atomic_or_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_or_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_or_i32_ret_scalar:			; GCN1-LABEL: flat_atomic_or_i32_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB54_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: v_or_b32_e32 v0, s6, v1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB54_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i32_ret_scalar:			; GCN2-LABEL: flat_atomic_or_i32_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB54_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
				; GCN2-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB54_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i32_ret_scalar:			; GCN3-LABEL: flat_atomic_or_i32_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB54_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB54_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw or ptr %ptr, i32 %in seq_cst			%result = atomicrmw or ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @flat_atomic_or_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_or_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_or_i32_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_or_i32_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s34, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB55_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB55_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i32_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_or_i32_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s34, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB55_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB55_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i32_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_or_i32_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB55_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_or_b32_e32 v0, s6, v1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB55_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw or ptr %gep, i32 %in seq_cst			%result = atomicrmw or ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw xor			; atomicrmw xor
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_xor_i32_noret(ptr %ptr, i32 %in) {			define void @flat_atomic_xor_i32_noret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_xor_i32_noret:			; GCN1-LABEL: flat_atomic_xor_i32_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor v[0:1], v2			; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB56_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_xor_b32_e32 v3, v4, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB56_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i32_noret:			; GCN2-LABEL: flat_atomic_xor_i32_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor v[0:1], v2			; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB56_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_xor_b32_e32 v3, v4, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB56_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i32_noret:			; GCN3-LABEL: flat_atomic_xor_i32_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor v[0:1], v2			; GCN3-NEXT: flat_load_dword v4, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB56_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_xor_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB56_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw xor ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw xor ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_xor_i32_noret_offset(ptr %out, i32 %in) {			define void @flat_atomic_xor_i32_noret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_xor_i32_noret_offset:			; GCN1-LABEL: flat_atomic_xor_i32_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB57_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor v[0:1], v2			; GCN1-NEXT: v_xor_b32_e32 v3, v4, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB57_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i32_noret_offset:			; GCN2-LABEL: flat_atomic_xor_i32_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB57_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor v[0:1], v2			; GCN2-NEXT: v_xor_b32_e32 v3, v4, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB57_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i32_noret_offset:			; GCN3-LABEL: flat_atomic_xor_i32_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor v[0:1], v2 offset:16			; GCN3-NEXT: flat_load_dword v4, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB57_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_xor_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB57_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw xor ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw xor ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @flat_atomic_xor_i32_ret(ptr %ptr, i32 %in) {			define i32 @flat_atomic_xor_i32_ret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_xor_i32_ret:			; GCN1-LABEL: flat_atomic_xor_i32_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB58_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: v_xor_b32_e32 v3, v4, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB58_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v0, v3
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i32_ret:			; GCN2-LABEL: flat_atomic_xor_i32_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB58_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: v_xor_b32_e32 v3, v4, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB58_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v0, v3
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i32_ret:			; GCN3-LABEL: flat_atomic_xor_i32_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB58_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_xor_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB58_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw xor ptr %ptr, i32 %in seq_cst			%result = atomicrmw xor ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @flat_atomic_xor_i32_ret_offset(ptr %out, i32 %in) {			define i32 @flat_atomic_xor_i32_ret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_xor_i32_ret_offset:			; GCN1-LABEL: flat_atomic_xor_i32_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v3, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v0, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB59_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_xor_b32_e32 v0, v1, v2
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; GCN1-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB59_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i32_ret_offset:			; GCN2-LABEL: flat_atomic_xor_i32_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v0, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB59_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_xor_b32_e32 v0, v1, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; GCN2-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB59_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i32_ret_offset:			; GCN3-LABEL: flat_atomic_xor_i32_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB59_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_xor_b32_e32 v3, v4, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB59_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw xor ptr %gep, i32 %in seq_cst			%result = atomicrmw xor ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @flat_atomic_xor_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_xor_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_xor_i32_noret_scalar:			; GCN1-LABEL: flat_atomic_xor_i32_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB60_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor v[0:1], v2			; GCN1-NEXT: v_xor_b32_e32 v0, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB60_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i32_noret_scalar:			; GCN2-LABEL: flat_atomic_xor_i32_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB60_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_xor_b32_e32 v0, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor v[0:1], v2			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB60_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i32_noret_scalar:			; GCN3-LABEL: flat_atomic_xor_i32_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB60_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor v[0:1], v2			; GCN3-NEXT: v_xor_b32_e32 v0, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB60_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw xor ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw xor ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_xor_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_xor_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_xor_i32_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_xor_i32_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s34, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB61_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor v[0:1], v2			; GCN1-NEXT: v_xor_b32_e32 v0, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB61_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i32_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_xor_i32_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s34, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB61_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor v[0:1], v2			; GCN2-NEXT: v_xor_b32_e32 v0, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB61_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i32_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_xor_i32_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB61_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor v[0:1], v2 offset:16			; GCN3-NEXT: v_xor_b32_e32 v0, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB61_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw xor ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw xor ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @flat_atomic_xor_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_xor_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_xor_i32_ret_scalar:			; GCN1-LABEL: flat_atomic_xor_i32_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB62_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: v_xor_b32_e32 v0, s6, v1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB62_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i32_ret_scalar:			; GCN2-LABEL: flat_atomic_xor_i32_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB62_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
				; GCN2-NEXT: v_xor_b32_e32 v0, s6, v1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB62_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i32_ret_scalar:			; GCN3-LABEL: flat_atomic_xor_i32_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB62_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_xor_b32_e32 v0, s6, v1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB62_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw xor ptr %ptr, i32 %in seq_cst			%result = atomicrmw xor ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @flat_atomic_xor_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_xor_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_xor_i32_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_xor_i32_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s34, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB63_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: v_xor_b32_e32 v0, s6, v1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB63_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i32_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_xor_i32_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s34, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB63_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: v_xor_b32_e32 v0, s6, v1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB63_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i32_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_xor_i32_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB63_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_xor_b32_e32 v0, s6, v1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB63_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw xor ptr %gep, i32 %in seq_cst			%result = atomicrmw xor ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw max			; atomicrmw max
	▲ Show 20 Lines • Show All 3,744 Lines • ▼ Show 20 Lines
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw uinc_wrap			; atomicrmw uinc_wrap
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_uinc_wrap_i32_noret(ptr %ptr, i32 %in) {			define void @flat_atomic_uinc_wrap_i32_noret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i32_noret:			; GCN1-LABEL: flat_atomic_uinc_wrap_i32_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc v[0:1], v2			; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB107_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_add_i32_e32 v3, vcc, 1, v4
				; GCN1-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GCN1-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB107_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i32_noret:			; GCN2-LABEL: flat_atomic_uinc_wrap_i32_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc v[0:1], v2			; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB107_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_add_u32_e32 v3, vcc, 1, v4
				; GCN2-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GCN2-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB107_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i32_noret:			; GCN3-LABEL: flat_atomic_uinc_wrap_i32_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc v[0:1], v2			; GCN3-NEXT: flat_load_dword v4, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB107_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_add_u32_e32 v3, 1, v4
				; GCN3-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GCN3-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB107_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw uinc_wrap ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_uinc_wrap_i32_noret_offset(ptr %out, i32 %in) {			define void @flat_atomic_uinc_wrap_i32_noret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i32_noret_offset:			; GCN1-LABEL: flat_atomic_uinc_wrap_i32_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB108_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc v[0:1], v2			; GCN1-NEXT: v_add_i32_e32 v3, vcc, 1, v4
				; GCN1-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GCN1-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB108_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i32_noret_offset:			; GCN2-LABEL: flat_atomic_uinc_wrap_i32_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB108_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc v[0:1], v2			; GCN2-NEXT: v_add_u32_e32 v3, vcc, 1, v4
				; GCN2-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GCN2-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB108_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i32_noret_offset:			; GCN3-LABEL: flat_atomic_uinc_wrap_i32_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc v[0:1], v2 offset:16			; GCN3-NEXT: flat_load_dword v4, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB108_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_add_u32_e32 v3, 1, v4
				; GCN3-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GCN3-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB108_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw uinc_wrap ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @flat_atomic_uinc_wrap_i32_ret(ptr %ptr, i32 %in) {			define i32 @flat_atomic_uinc_wrap_i32_ret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i32_ret:			; GCN1-LABEL: flat_atomic_uinc_wrap_i32_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB109_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: v_add_i32_e32 v3, vcc, 1, v4
				; GCN1-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GCN1-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB109_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v0, v3
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i32_ret:			; GCN2-LABEL: flat_atomic_uinc_wrap_i32_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB109_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: v_add_u32_e32 v3, vcc, 1, v4
				; GCN2-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GCN2-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB109_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v0, v3
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i32_ret:			; GCN3-LABEL: flat_atomic_uinc_wrap_i32_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB109_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_add_u32_e32 v3, 1, v4
				; GCN3-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GCN3-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB109_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw uinc_wrap ptr %ptr, i32 %in seq_cst			%result = atomicrmw uinc_wrap ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @flat_atomic_uinc_wrap_i32_ret_offset(ptr %out, i32 %in) {			define i32 @flat_atomic_uinc_wrap_i32_ret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i32_ret_offset:			; GCN1-LABEL: flat_atomic_uinc_wrap_i32_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v3, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v0, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB110_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v1
				; GCN1-NEXT: v_cmp_lt_u32_e32 vcc, v1, v2
				; GCN1-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; GCN1-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB110_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i32_ret_offset:			; GCN2-LABEL: flat_atomic_uinc_wrap_i32_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v0, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB110_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v1
				; GCN2-NEXT: v_cmp_lt_u32_e32 vcc, v1, v2
				; GCN2-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB110_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i32_ret_offset:			; GCN3-LABEL: flat_atomic_uinc_wrap_i32_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB110_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_add_u32_e32 v3, 1, v4
				; GCN3-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GCN3-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB110_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw uinc_wrap ptr %gep, i32 %in seq_cst			%result = atomicrmw uinc_wrap ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @flat_atomic_uinc_wrap_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_uinc_wrap_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i32_noret_scalar:			; GCN1-LABEL: flat_atomic_uinc_wrap_i32_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB111_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
				; GCN1-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc v[0:1], v2			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB111_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i32_noret_scalar:			; GCN2-LABEL: flat_atomic_uinc_wrap_i32_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB111_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
				; GCN2-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc v[0:1], v2			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB111_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i32_noret_scalar:			; GCN3-LABEL: flat_atomic_uinc_wrap_i32_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB111_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc v[0:1], v2			; GCN3-NEXT: v_add_u32_e32 v0, 1, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB111_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw uinc_wrap ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_uinc_wrap_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_uinc_wrap_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i32_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_uinc_wrap_i32_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s34, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB112_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc v[0:1], v2			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB112_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i32_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_uinc_wrap_i32_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s34, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB112_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc v[0:1], v2			; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB112_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i32_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_uinc_wrap_i32_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB112_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc v[0:1], v2 offset:16			; GCN3-NEXT: v_add_u32_e32 v0, 1, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB112_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw uinc_wrap ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @flat_atomic_uinc_wrap_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_uinc_wrap_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i32_ret_scalar:			; GCN1-LABEL: flat_atomic_uinc_wrap_i32_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB113_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
				; GCN1-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB113_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i32_ret_scalar:			; GCN2-LABEL: flat_atomic_uinc_wrap_i32_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB113_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
				; GCN2-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB113_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i32_ret_scalar:			; GCN3-LABEL: flat_atomic_uinc_wrap_i32_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB113_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_add_u32_e32 v0, 1, v1
				; GCN3-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB113_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw uinc_wrap ptr %ptr, i32 %in seq_cst			%result = atomicrmw uinc_wrap ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @flat_atomic_uinc_wrap_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_uinc_wrap_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i32_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_uinc_wrap_i32_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s34, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB114_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB114_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i32_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_uinc_wrap_i32_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s34, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB114_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB114_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i32_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_uinc_wrap_i32_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB114_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_add_u32_e32 v0, 1, v1
				; GCN3-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB114_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw uinc_wrap ptr %gep, i32 %in seq_cst			%result = atomicrmw uinc_wrap ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw udec_wrap			; atomicrmw udec_wrap
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_udec_wrap_i32_noret(ptr %ptr, i32 %in) {			define void @flat_atomic_udec_wrap_i32_noret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i32_noret:			; GCN1-LABEL: flat_atomic_udec_wrap_i32_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec v[0:1], v2			; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[6:7], 0
				; GCN1-NEXT: .LBB115_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_add_i32_e32 v3, vcc, -1, v4
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GCN1-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN1-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN1-NEXT: s_cbranch_execnz .LBB115_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[6:7]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i32_noret:			; GCN2-LABEL: flat_atomic_udec_wrap_i32_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec v[0:1], v2			; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[6:7], 0
				; GCN2-NEXT: .LBB115_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_add_u32_e32 v3, vcc, -1, v4
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GCN2-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN2-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN2-NEXT: s_cbranch_execnz .LBB115_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[6:7]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i32_noret:			; GCN3-LABEL: flat_atomic_udec_wrap_i32_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec v[0:1], v2			; GCN3-NEXT: flat_load_dword v4, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[6:7], 0
				; GCN3-NEXT: .LBB115_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GCN3-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GCN3-NEXT: v_add_u32_e32 v3, -1, v4
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN3-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN3-NEXT: s_cbranch_execnz .LBB115_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[6:7]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw udec_wrap ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_udec_wrap_i32_noret_offset(ptr %out, i32 %in) {			define void @flat_atomic_udec_wrap_i32_noret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i32_noret_offset:			; GCN1-LABEL: flat_atomic_udec_wrap_i32_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[6:7], 0
				; GCN1-NEXT: .LBB116_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec v[0:1], v2			; GCN1-NEXT: v_add_i32_e32 v3, vcc, -1, v4
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GCN1-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN1-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN1-NEXT: s_cbranch_execnz .LBB116_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[6:7]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i32_noret_offset:			; GCN2-LABEL: flat_atomic_udec_wrap_i32_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[6:7], 0
				; GCN2-NEXT: .LBB116_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec v[0:1], v2			; GCN2-NEXT: v_add_u32_e32 v3, vcc, -1, v4
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GCN2-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN2-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN2-NEXT: s_cbranch_execnz .LBB116_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[6:7]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i32_noret_offset:			; GCN3-LABEL: flat_atomic_udec_wrap_i32_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec v[0:1], v2 offset:16			; GCN3-NEXT: flat_load_dword v4, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[6:7], 0
				; GCN3-NEXT: .LBB116_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GCN3-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GCN3-NEXT: v_add_u32_e32 v3, -1, v4
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN3-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN3-NEXT: s_cbranch_execnz .LBB116_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[6:7]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw udec_wrap ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @flat_atomic_udec_wrap_i32_ret(ptr %ptr, i32 %in) {			define i32 @flat_atomic_udec_wrap_i32_ret(ptr %ptr, i32 %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i32_ret:			; GCN1-LABEL: flat_atomic_udec_wrap_i32_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[6:7], 0
				; GCN1-NEXT: .LBB117_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v4, v3
				; GCN1-NEXT: v_add_i32_e32 v3, vcc, -1, v4
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GCN1-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN1-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN1-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN1-NEXT: s_cbranch_execnz .LBB117_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v0, v3
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i32_ret:			; GCN2-LABEL: flat_atomic_udec_wrap_i32_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[6:7], 0
				; GCN2-NEXT: .LBB117_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v4, v3
				; GCN2-NEXT: v_add_u32_e32 v3, vcc, -1, v4
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GCN2-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN2-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN2-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN2-NEXT: s_cbranch_execnz .LBB117_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v0, v3
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i32_ret:			; GCN3-LABEL: flat_atomic_udec_wrap_i32_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[6:7], 0
				; GCN3-NEXT: .LBB117_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GCN3-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GCN3-NEXT: v_add_u32_e32 v3, -1, v4
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN3-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN3-NEXT: s_cbranch_execnz .LBB117_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw udec_wrap ptr %ptr, i32 %in seq_cst			%result = atomicrmw udec_wrap ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @flat_atomic_udec_wrap_i32_ret_offset(ptr %out, i32 %in) {			define i32 @flat_atomic_udec_wrap_i32_ret_offset(ptr %out, i32 %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i32_ret_offset:			; GCN1-LABEL: flat_atomic_udec_wrap_i32_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 16, v0			; GCN1-NEXT: v_add_i32_e32 v3, vcc, 16, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v0, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[6:7], 0
				; GCN1-NEXT: .LBB118_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, -1, v1
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN1-NEXT: v_cmp_gt_u32_e64 s[4:5], v1, v2
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN1-NEXT: v_cndmask_b32_e32 v0, v0, v2, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; GCN1-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN1-NEXT: s_cbranch_execnz .LBB118_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[6:7]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i32_ret_offset:			; GCN2-LABEL: flat_atomic_udec_wrap_i32_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; GCN2-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v0, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[6:7], 0
				; GCN2-NEXT: .LBB118_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, -1, v1
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN2-NEXT: v_cmp_gt_u32_e64 s[4:5], v1, v2
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN2-NEXT: v_cndmask_b32_e32 v0, v0, v2, vcc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; GCN2-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN2-NEXT: s_cbranch_execnz .LBB118_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[6:7]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i32_ret_offset:			; GCN3-LABEL: flat_atomic_udec_wrap_i32_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: flat_load_dword v3, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[6:7], 0
				; GCN3-NEXT: .LBB118_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v4, v3
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GCN3-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GCN3-NEXT: v_add_u32_e32 v3, -1, v4
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN3-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GCN3-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GCN3-NEXT: s_cbranch_execnz .LBB118_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v0, v3
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw udec_wrap ptr %gep, i32 %in seq_cst			%result = atomicrmw udec_wrap ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @flat_atomic_udec_wrap_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_udec_wrap_i32_noret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i32_noret_scalar:			; GCN1-LABEL: flat_atomic_udec_wrap_i32_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB119_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec v[0:1], v2			; GCN1-NEXT: v_add_i32_e32 v0, vcc, -1, v1
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN1-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v4, s6
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: v_cndmask_b32_e32 v0, v0, v4, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB119_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i32_noret_scalar:			; GCN2-LABEL: flat_atomic_udec_wrap_i32_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB119_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec v[0:1], v2			; GCN2-NEXT: v_add_u32_e32 v0, vcc, -1, v1
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN2-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v4, s6
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
				; GCN2-NEXT: v_cndmask_b32_e32 v0, v0, v4, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB119_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i32_noret_scalar:			; GCN3-LABEL: flat_atomic_udec_wrap_i32_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[36:37], 0
				; GCN3-NEXT: .LBB119_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec v[0:1], v2			; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN3-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN3-NEXT: v_add_u32_e32 v0, -1, v1
				; GCN3-NEXT: v_mov_b32_e32 v4, s6
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v0, v0, v4, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN3-NEXT: s_cbranch_execnz .LBB119_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw udec_wrap ptr %ptr, i32 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_udec_wrap_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx void @flat_atomic_udec_wrap_i32_noret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i32_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_udec_wrap_i32_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s36, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s37, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s36
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s37
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[38:39], 0
				; GCN1-NEXT: .LBB120_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, -1, v1
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN1-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v4, s6
				; GCN1-NEXT: v_mov_b32_e32 v2, s36
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v3, s37
				; GCN1-NEXT: v_cndmask_b32_e32 v0, v0, v4, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec v[0:1], v2			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GCN1-NEXT: s_cbranch_execnz .LBB120_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[38:39]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i32_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_udec_wrap_i32_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s36, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s37, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s36
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s37
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[38:39], 0
				; GCN2-NEXT: .LBB120_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec v[0:1], v2			; GCN2-NEXT: v_add_u32_e32 v0, vcc, -1, v1
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN2-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v4, s6
				; GCN2-NEXT: v_mov_b32_e32 v2, s36
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v3, s37
				; GCN2-NEXT: v_cndmask_b32_e32 v0, v0, v4, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GCN2-NEXT: s_cbranch_execnz .LBB120_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[38:39]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i32_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_udec_wrap_i32_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v1, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[36:37], 0
				; GCN3-NEXT: .LBB120_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec v[0:1], v2 offset:16			; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN3-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN3-NEXT: v_add_u32_e32 v0, -1, v1
				; GCN3-NEXT: v_mov_b32_e32 v4, s6
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v0, v0, v4, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN3-NEXT: s_cbranch_execnz .LBB120_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%tmp0 = atomicrmw udec_wrap ptr %gep, i32 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @flat_atomic_udec_wrap_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_udec_wrap_i32_ret_scalar(ptr inreg %ptr, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i32_ret_scalar:			; GCN1-LABEL: flat_atomic_udec_wrap_i32_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s4			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s5			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB121_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_add_i32_e32 v4, vcc, -1, v1
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN1-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v0, s6
				; GCN1-NEXT: v_mov_b32_e32 v2, s4
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v3, s5
				; GCN1-NEXT: v_cndmask_b32_e32 v0, v4, v0, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB121_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i32_ret_scalar:			; GCN2-LABEL: flat_atomic_udec_wrap_i32_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s4			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s5			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB121_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_add_u32_e32 v4, vcc, -1, v1
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN2-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v0, s6
				; GCN2-NEXT: v_mov_b32_e32 v2, s4
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v3, s5
				; GCN2-NEXT: v_cndmask_b32_e32 v0, v4, v0, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB121_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i32_ret_scalar:			; GCN3-LABEL: flat_atomic_udec_wrap_i32_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1]
				; GCN3-NEXT: s_mov_b64 s[36:37], 0
				; GCN3-NEXT: .LBB121_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN3-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v0, s6
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_add_u32_e32 v4, -1, v1
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v0, v4, v0, vcc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN3-NEXT: s_cbranch_execnz .LBB121_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw udec_wrap ptr %ptr, i32 %in seq_cst			%result = atomicrmw udec_wrap ptr %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @flat_atomic_udec_wrap_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @flat_atomic_udec_wrap_i32_ret_offset_scalar(ptr inreg %out, i32 inreg %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i32_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_udec_wrap_i32_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 16			; GCN1-NEXT: s_add_u32 s36, s4, 16
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s37, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v0, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s36
	; GCN1-NEXT: v_mov_b32_e32 v1, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s37
	; GCN1-NEXT: v_mov_b32_e32 v2, s6			; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: s_mov_b64 s[38:39], 0
				; GCN1-NEXT: .LBB122_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v1, v0
				; GCN1-NEXT: v_add_i32_e32 v4, vcc, -1, v1
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN1-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN1-NEXT: v_mov_b32_e32 v0, s6
				; GCN1-NEXT: v_mov_b32_e32 v2, s36
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v3, s37
				; GCN1-NEXT: v_cndmask_b32_e32 v0, v4, v0, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; GCN1-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN1-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GCN1-NEXT: s_cbranch_execnz .LBB122_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[38:39]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i32_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_udec_wrap_i32_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 16			; GCN2-NEXT: s_add_u32 s36, s4, 16
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s37, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v0, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s36
	; GCN2-NEXT: v_mov_b32_e32 v1, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s37
	; GCN2-NEXT: v_mov_b32_e32 v2, s6			; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: s_mov_b64 s[38:39], 0
				; GCN2-NEXT: .LBB122_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; GCN2-NEXT: v_mov_b32_e32 v1, v0
				; GCN2-NEXT: v_add_u32_e32 v4, vcc, -1, v1
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN2-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN2-NEXT: v_mov_b32_e32 v0, s6
				; GCN2-NEXT: v_mov_b32_e32 v2, s36
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v3, s37
				; GCN2-NEXT: v_cndmask_b32_e32 v0, v4, v0, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN2-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GCN2-NEXT: s_cbranch_execnz .LBB122_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[38:39]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i32_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_udec_wrap_i32_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s4			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s5			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s6			; GCN3-NEXT: flat_load_dword v0, v[0:1] offset:16
				; GCN3-NEXT: s_mov_b64 s[36:37], 0
				; GCN3-NEXT: .LBB122_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec v0, v[0:1], v2 offset:16 glc			; GCN3-NEXT: v_mov_b32_e32 v1, v0
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GCN3-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GCN3-NEXT: v_mov_b32_e32 v0, s6
				; GCN3-NEXT: v_mov_b32_e32 v2, s4
				; GCN3-NEXT: v_add_u32_e32 v4, -1, v1
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v3, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v0, v4, v0, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] offset:16 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GCN3-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN3-NEXT: s_cbranch_execnz .LBB122_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr %out, i32 4			%gep = getelementptr i32, ptr %out, i32 4
	%result = atomicrmw udec_wrap ptr %gep, i32 %in seq_cst			%result = atomicrmw udec_wrap ptr %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

llvm/test/CodeGen/AMDGPU/flat_atomics_i64_system.ll

This file is larger than 256 KB, so syntax highlighting is disabled by default.

	Show First 20 Lines • Show All 941 Lines • ▼ Show 20 Lines
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw sub			; atomicrmw sub
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_sub_i64_noret(ptr %ptr, i64 %in) {			define void @flat_atomic_sub_i64_noret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_sub_i64_noret:			; GCN1-LABEL: flat_atomic_sub_i64_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v6, v[0:1]
				; GCN1-NEXT: flat_load_dword v7, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB24_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_sub_i32_e32 v4, vcc, v6, v2
				; GCN1-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB24_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i64_noret:			; GCN2-LABEL: flat_atomic_sub_i64_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3]			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v6, v[0:1]
				; GCN2-NEXT: flat_load_dword v7, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB24_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_sub_u32_e32 v4, vcc, v6, v2
				; GCN2-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB24_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i64_noret:			; GCN3-LABEL: flat_atomic_sub_i64_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3]			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB24_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_sub_co_u32_e32 v4, vcc, v6, v2
				; GCN3-NEXT: v_subb_co_u32_e32 v5, vcc, v7, v3, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB24_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw sub ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw sub ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_sub_i64_noret_offset(ptr %out, i64 %in) {			define void @flat_atomic_sub_i64_noret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_sub_i64_noret_offset:			; GCN1-LABEL: flat_atomic_sub_i64_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v8, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v7, v[0:1]
				; GCN1-NEXT: flat_load_dword v6, v[8:9]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB25_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_sub_i32_e32 v4, vcc, v6, v2
				; GCN1-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v1
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v6, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB25_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i64_noret_offset:			; GCN2-LABEL: flat_atomic_sub_i64_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v8, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v7, v[0:1]
				; GCN2-NEXT: flat_load_dword v6, v[8:9]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB25_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_sub_u32_e32 v4, vcc, v6, v2
				; GCN2-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3]			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v1
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v6, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB25_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i64_noret_offset:			; GCN3-LABEL: flat_atomic_sub_i64_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3] offset:32			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB25_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_sub_co_u32_e32 v4, vcc, v6, v2
				; GCN3-NEXT: v_subb_co_u32_e32 v5, vcc, v7, v3, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB25_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw sub ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw sub ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @flat_atomic_sub_i64_ret(ptr %ptr, i64 %in) {			define i64 @flat_atomic_sub_i64_ret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_sub_i64_ret:			; GCN1-LABEL: flat_atomic_sub_i64_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: v_add_i32_e32 v5, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: flat_load_dword v5, v[5:6]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB26_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: v_sub_i32_e32 v4, vcc, v6, v2
				; GCN1-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB26_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v0, v4
				; GCN1-NEXT: v_mov_b32_e32 v1, v5
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i64_ret:			; GCN2-LABEL: flat_atomic_sub_i64_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: v_add_u32_e32 v5, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: flat_load_dword v5, v[5:6]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB26_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: v_sub_u32_e32 v4, vcc, v6, v2
				; GCN2-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB26_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v0, v4
				; GCN2-NEXT: v_mov_b32_e32 v1, v5
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i64_ret:			; GCN3-LABEL: flat_atomic_sub_i64_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub_x2 v[0:1], v[0:1], v[2:3] glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB26_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_sub_co_u32_e32 v4, vcc, v6, v2
				; GCN3-NEXT: v_subb_co_u32_e32 v5, vcc, v7, v3, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB26_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw sub ptr %ptr, i64 %in seq_cst			%result = atomicrmw sub ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @flat_atomic_sub_i64_ret_offset(ptr %out, i64 %in) {			define i64 @flat_atomic_sub_i64_ret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_sub_i64_ret_offset:			; GCN1-LABEL: flat_atomic_sub_i64_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB27_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: v_mov_b32_e32 v9, v1
				; GCN1-NEXT: v_mov_b32_e32 v8, v0
				; GCN1-NEXT: v_sub_i32_e32 v6, vcc, v8, v2
				; GCN1-NEXT: v_subb_u32_e32 v7, vcc, v9, v3, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB27_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i64_ret_offset:			; GCN2-LABEL: flat_atomic_sub_i64_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB27_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: v_mov_b32_e32 v9, v1
				; GCN2-NEXT: v_mov_b32_e32 v8, v0
				; GCN2-NEXT: v_sub_u32_e32 v6, vcc, v8, v2
				; GCN2-NEXT: v_subb_u32_e32 v7, vcc, v9, v3, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB27_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i64_ret_offset:			; GCN3-LABEL: flat_atomic_sub_i64_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub_x2 v[0:1], v[0:1], v[2:3] offset:32 glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB27_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_sub_co_u32_e32 v4, vcc, v6, v2
				; GCN3-NEXT: v_subb_co_u32_e32 v5, vcc, v7, v3, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB27_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw sub ptr %gep, i64 %in seq_cst			%result = atomicrmw sub ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @flat_atomic_sub_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_sub_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_sub_i64_noret_scalar:			; GCN1-LABEL: flat_atomic_sub_i64_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
				; GCN1-NEXT: s_add_u32 s34, s4, 4
				; GCN1-NEXT: v_mov_b32_e32 v1, s5
				; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v3, s34
				; GCN1-NEXT: v_mov_b32_e32 v4, s35
				; GCN1-NEXT: flat_load_dword v2, v[0:1]
				; GCN1-NEXT: flat_load_dword v3, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB28_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: v_mov_b32_e32 v1, s7
	; GCN1-NEXT: v_mov_b32_e32 v2, s4
	; GCN1-NEXT: v_mov_b32_e32 v3, s5
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub_x2 v[2:3], v[0:1]			; GCN1-NEXT: v_subrev_i32_e32 v0, vcc, s6, v2
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
				; GCN1-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB28_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i64_noret_scalar:			; GCN2-LABEL: flat_atomic_sub_i64_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
				; GCN2-NEXT: s_add_u32 s34, s4, 4
				; GCN2-NEXT: v_mov_b32_e32 v1, s5
				; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v3, s34
				; GCN2-NEXT: v_mov_b32_e32 v4, s35
				; GCN2-NEXT: flat_load_dword v2, v[0:1]
				; GCN2-NEXT: flat_load_dword v3, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB28_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: v_mov_b32_e32 v1, s7
	; GCN2-NEXT: v_mov_b32_e32 v2, s4
	; GCN2-NEXT: v_mov_b32_e32 v3, s5
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub_x2 v[2:3], v[0:1]			; GCN2-NEXT: v_subrev_u32_e32 v0, vcc, s6, v2
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
				; GCN2-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB28_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i64_noret_scalar:			; GCN3-LABEL: flat_atomic_sub_i64_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
				; GCN3-NEXT: v_mov_b32_e32 v1, s5
				; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB28_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s7
	; GCN3-NEXT: v_mov_b32_e32 v2, s4
	; GCN3-NEXT: v_mov_b32_e32 v3, s5
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub_x2 v[2:3], v[0:1]			; GCN3-NEXT: v_subrev_co_u32_e32 v0, vcc, s6, v2
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_subb_co_u32_e32 v1, vcc, v3, v1, vcc
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB28_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw sub ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw sub ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_sub_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_sub_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_sub_i64_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_sub_i64_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s34, s4, 32
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: s_add_u32 s36, s4, 36
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: s_addc_u32 s37, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v0, s36
				; GCN1-NEXT: v_mov_b32_e32 v1, s37
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: flat_load_dword v2, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB29_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: v_mov_b32_e32 v1, s7
	; GCN1-NEXT: v_mov_b32_e32 v3, s35
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub_x2 v[2:3], v[0:1]			; GCN1-NEXT: v_subrev_i32_e32 v0, vcc, s6, v2
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB29_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i64_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_sub_i64_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s34, s4, 32
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: s_add_u32 s36, s4, 36
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: s_addc_u32 s37, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v0, s36
				; GCN2-NEXT: v_mov_b32_e32 v1, s37
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: flat_load_dword v2, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB29_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: v_mov_b32_e32 v1, s7
	; GCN2-NEXT: v_mov_b32_e32 v3, s35
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub_x2 v[2:3], v[0:1]			; GCN2-NEXT: v_subrev_u32_e32 v0, vcc, s6, v2
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB29_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i64_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_sub_i64_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
				; GCN3-NEXT: v_mov_b32_e32 v1, s5
				; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB29_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s7
	; GCN3-NEXT: v_mov_b32_e32 v2, s4
	; GCN3-NEXT: v_mov_b32_e32 v3, s5
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub_x2 v[2:3], v[0:1] offset:32			; GCN3-NEXT: v_subrev_co_u32_e32 v0, vcc, s6, v2
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_subb_co_u32_e32 v1, vcc, v3, v1, vcc
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB29_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw sub ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw sub ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @flat_atomic_sub_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_sub_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_sub_i64_ret_scalar:			; GCN1-LABEL: flat_atomic_sub_i64_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
				; GCN1-NEXT: s_add_u32 s34, s4, 4
				; GCN1-NEXT: v_mov_b32_e32 v1, s5
				; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: flat_load_dword v1, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB30_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: v_mov_b32_e32 v1, s7
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v4, s4
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: v_subrev_i32_e32 v0, vcc, s6, v2
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB30_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i64_ret_scalar:			; GCN2-LABEL: flat_atomic_sub_i64_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
				; GCN2-NEXT: s_add_u32 s34, s4, 4
				; GCN2-NEXT: v_mov_b32_e32 v1, s5
				; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: flat_load_dword v1, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB30_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: v_mov_b32_e32 v1, s7
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v4, s4
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: v_subrev_u32_e32 v0, vcc, s6, v2
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
				; GCN2-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB30_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i64_ret_scalar:			; GCN3-LABEL: flat_atomic_sub_i64_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
				; GCN3-NEXT: v_mov_b32_e32 v1, s5
				; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB30_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s7
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: v_mov_b32_e32 v4, s4
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: v_subrev_co_u32_e32 v0, vcc, s6, v2
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_subb_co_u32_e32 v1, vcc, v3, v1, vcc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3], v[0:1] glc			; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB30_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw sub ptr %ptr, i64 %in seq_cst			%result = atomicrmw sub ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @flat_atomic_sub_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_sub_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_sub_i64_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_sub_i64_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s34, s4, 32
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: s_add_u32 s36, s4, 36
				; GCN1-NEXT: s_addc_u32 s37, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v0, s36
				; GCN1-NEXT: v_mov_b32_e32 v1, s37
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: v_mov_b32_e32 v2, s34
	; GCN1-NEXT: v_mov_b32_e32 v0, s6
	; GCN1-NEXT: v_mov_b32_e32 v1, s7
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB31_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_mov_b32_e32 v1, s7
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_subrev_i32_e32 v0, vcc, s6, v2
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB31_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_sub_i64_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_sub_i64_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s34, s4, 32
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: s_add_u32 s36, s4, 36
				; GCN2-NEXT: s_addc_u32 s37, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v0, s36
				; GCN2-NEXT: v_mov_b32_e32 v1, s37
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: v_mov_b32_e32 v2, s34
	; GCN2-NEXT: v_mov_b32_e32 v0, s6
	; GCN2-NEXT: v_mov_b32_e32 v1, s7
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB31_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_mov_b32_e32 v1, s7
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_subrev_u32_e32 v0, vcc, s6, v2
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB31_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_sub_i64_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_sub_i64_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
				; GCN3-NEXT: v_mov_b32_e32 v1, s5
				; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB31_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s7
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: v_mov_b32_e32 v4, s4
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: v_subrev_co_u32_e32 v0, vcc, s6, v2
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_subb_co_u32_e32 v1, vcc, v3, v1, vcc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3], v[0:1] offset:32 glc			; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB31_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw sub ptr %gep, i64 %in seq_cst			%result = atomicrmw sub ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw and			; atomicrmw and
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_and_i64_noret(ptr %ptr, i64 %in) {			define void @flat_atomic_and_i64_noret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_and_i64_noret:			; GCN1-LABEL: flat_atomic_and_i64_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v6, v[0:1]
				; GCN1-NEXT: flat_load_dword v7, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB32_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_and_b32_e32 v5, v7, v3
				; GCN1-NEXT: v_and_b32_e32 v4, v6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB32_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i64_noret:			; GCN2-LABEL: flat_atomic_and_i64_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and_x2 v[0:1], v[2:3]			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v6, v[0:1]
				; GCN2-NEXT: flat_load_dword v7, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB32_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_and_b32_e32 v5, v7, v3
				; GCN2-NEXT: v_and_b32_e32 v4, v6, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB32_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i64_noret:			; GCN3-LABEL: flat_atomic_and_i64_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and_x2 v[0:1], v[2:3]			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB32_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_and_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_and_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB32_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw and ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw and ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_and_i64_noret_offset(ptr %out, i64 %in) {			define void @flat_atomic_and_i64_noret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_and_i64_noret_offset:			; GCN1-LABEL: flat_atomic_and_i64_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v8, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v7, v[0:1]
				; GCN1-NEXT: flat_load_dword v6, v[8:9]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB33_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_and_b32_e32 v5, v7, v3
				; GCN1-NEXT: v_and_b32_e32 v4, v6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v1
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v6, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB33_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i64_noret_offset:			; GCN2-LABEL: flat_atomic_and_i64_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v8, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v7, v[0:1]
				; GCN2-NEXT: flat_load_dword v6, v[8:9]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB33_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_and_b32_e32 v5, v7, v3
				; GCN2-NEXT: v_and_b32_e32 v4, v6, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and_x2 v[0:1], v[2:3]			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v1
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v6, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB33_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i64_noret_offset:			; GCN3-LABEL: flat_atomic_and_i64_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and_x2 v[0:1], v[2:3] offset:32			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB33_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_and_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_and_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB33_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw and ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw and ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @flat_atomic_and_i64_ret(ptr %ptr, i64 %in) {			define i64 @flat_atomic_and_i64_ret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_and_i64_ret:			; GCN1-LABEL: flat_atomic_and_i64_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: v_add_i32_e32 v5, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: flat_load_dword v5, v[5:6]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB34_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: v_and_b32_e32 v5, v7, v3
				; GCN1-NEXT: v_and_b32_e32 v4, v6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB34_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v0, v4
				; GCN1-NEXT: v_mov_b32_e32 v1, v5
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i64_ret:			; GCN2-LABEL: flat_atomic_and_i64_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: v_add_u32_e32 v5, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: flat_load_dword v5, v[5:6]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB34_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: v_and_b32_e32 v5, v7, v3
				; GCN2-NEXT: v_and_b32_e32 v4, v6, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB34_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v0, v4
				; GCN2-NEXT: v_mov_b32_e32 v1, v5
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i64_ret:			; GCN3-LABEL: flat_atomic_and_i64_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and_x2 v[0:1], v[0:1], v[2:3] glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB34_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_and_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_and_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB34_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw and ptr %ptr, i64 %in seq_cst			%result = atomicrmw and ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @flat_atomic_and_i64_ret_offset(ptr %out, i64 %in) {			define i64 @flat_atomic_and_i64_ret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_and_i64_ret_offset:			; GCN1-LABEL: flat_atomic_and_i64_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB35_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v9, v1
				; GCN1-NEXT: v_mov_b32_e32 v8, v0
				; GCN1-NEXT: v_and_b32_e32 v7, v9, v3
				; GCN1-NEXT: v_and_b32_e32 v6, v8, v2
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB35_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i64_ret_offset:			; GCN2-LABEL: flat_atomic_and_i64_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB35_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v9, v1
				; GCN2-NEXT: v_mov_b32_e32 v8, v0
				; GCN2-NEXT: v_and_b32_e32 v7, v9, v3
				; GCN2-NEXT: v_and_b32_e32 v6, v8, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB35_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i64_ret_offset:			; GCN3-LABEL: flat_atomic_and_i64_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and_x2 v[0:1], v[0:1], v[2:3] offset:32 glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB35_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_and_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_and_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB35_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw and ptr %gep, i64 %in seq_cst			%result = atomicrmw and ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @flat_atomic_and_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_and_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_and_i64_noret_scalar:			; GCN1-LABEL: flat_atomic_and_i64_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: s_add_u32 s34, s4, 4
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v3, s34
				; GCN1-NEXT: v_mov_b32_e32 v4, s35
				; GCN1-NEXT: flat_load_dword v2, v[0:1]
				; GCN1-NEXT: flat_load_dword v3, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB36_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and_x2 v[2:3], v[0:1]			; GCN1-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB36_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i64_noret_scalar:			; GCN2-LABEL: flat_atomic_and_i64_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: s_add_u32 s34, s4, 4
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v3, s34
				; GCN2-NEXT: v_mov_b32_e32 v4, s35
				; GCN2-NEXT: flat_load_dword v2, v[0:1]
				; GCN2-NEXT: flat_load_dword v3, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB36_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and_x2 v[2:3], v[0:1]			; GCN2-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB36_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i64_noret_scalar:			; GCN3-LABEL: flat_atomic_and_i64_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB36_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and_x2 v[2:3], v[0:1]			; GCN3-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB36_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw and ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw and ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_and_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_and_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_and_i64_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_and_i64_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s34, s4, 32
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: s_add_u32 s36, s4, 36
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: s_addc_u32 s37, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: v_mov_b32_e32 v0, s36
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s37
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: flat_load_dword v2, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB37_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and_x2 v[2:3], v[0:1]			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB37_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i64_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_and_i64_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s34, s4, 32
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: s_add_u32 s36, s4, 36
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: s_addc_u32 s37, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: v_mov_b32_e32 v0, s36
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s37
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: flat_load_dword v2, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB37_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and_x2 v[2:3], v[0:1]			; GCN2-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB37_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i64_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_and_i64_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1] offset:32
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB37_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and_x2 v[2:3], v[0:1] offset:32			; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB37_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw and ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw and ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @flat_atomic_and_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_and_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_and_i64_ret_scalar:			; GCN1-LABEL: flat_atomic_and_i64_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: s_add_u32 s34, s4, 4
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: flat_load_dword v1, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB38_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB38_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i64_ret_scalar:			; GCN2-LABEL: flat_atomic_and_i64_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: s_add_u32 s34, s4, 4
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: flat_load_dword v1, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB38_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
				; GCN2-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB38_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i64_ret_scalar:			; GCN3-LABEL: flat_atomic_and_i64_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB38_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and_x2 v[0:1], v[2:3], v[0:1] glc			; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB38_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw and ptr %ptr, i64 %in seq_cst			%result = atomicrmw and ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @flat_atomic_and_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_and_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_and_i64_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_and_i64_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s34, s4, 32
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: s_add_u32 s36, s4, 36
				; GCN1-NEXT: s_addc_u32 s37, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v0, s36
				; GCN1-NEXT: v_mov_b32_e32 v1, s37
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: v_mov_b32_e32 v2, s34
	; GCN1-NEXT: v_mov_b32_e32 v0, s6
	; GCN1-NEXT: v_mov_b32_e32 v1, s7
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB39_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_and_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB39_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_and_i64_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_and_i64_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s34, s4, 32
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: s_add_u32 s36, s4, 36
				; GCN2-NEXT: s_addc_u32 s37, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v0, s36
				; GCN2-NEXT: v_mov_b32_e32 v1, s37
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: v_mov_b32_e32 v2, s34
	; GCN2-NEXT: v_mov_b32_e32 v0, s6
	; GCN2-NEXT: v_mov_b32_e32 v1, s7
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB39_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_and_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB39_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_and_i64_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_and_i64_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1] offset:32
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB39_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_and_x2 v[0:1], v[2:3], v[0:1] offset:32 glc			; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_and_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_and_b32_e32 v0, s6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB39_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw and ptr %gep, i64 %in seq_cst			%result = atomicrmw and ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw nand			; atomicrmw nand
	▲ Show 20 Lines • Show All 798 Lines • ▼ Show 20 Lines
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw or			; atomicrmw or
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_or_i64_noret(ptr %ptr, i64 %in) {			define void @flat_atomic_or_i64_noret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_or_i64_noret:			; GCN1-LABEL: flat_atomic_or_i64_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v6, v[0:1]
				; GCN1-NEXT: flat_load_dword v7, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB48_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_or_b32_e32 v5, v7, v3
				; GCN1-NEXT: v_or_b32_e32 v4, v6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB48_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i64_noret:			; GCN2-LABEL: flat_atomic_or_i64_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or_x2 v[0:1], v[2:3]			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v6, v[0:1]
				; GCN2-NEXT: flat_load_dword v7, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB48_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_or_b32_e32 v5, v7, v3
				; GCN2-NEXT: v_or_b32_e32 v4, v6, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB48_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i64_noret:			; GCN3-LABEL: flat_atomic_or_i64_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or_x2 v[0:1], v[2:3]			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB48_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_or_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_or_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB48_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw or ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw or ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_or_i64_noret_offset(ptr %out, i64 %in) {			define void @flat_atomic_or_i64_noret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_or_i64_noret_offset:			; GCN1-LABEL: flat_atomic_or_i64_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v8, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v7, v[0:1]
				; GCN1-NEXT: flat_load_dword v6, v[8:9]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB49_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_or_b32_e32 v5, v7, v3
				; GCN1-NEXT: v_or_b32_e32 v4, v6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v1
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v6, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB49_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i64_noret_offset:			; GCN2-LABEL: flat_atomic_or_i64_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v8, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v7, v[0:1]
				; GCN2-NEXT: flat_load_dword v6, v[8:9]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB49_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_or_b32_e32 v5, v7, v3
				; GCN2-NEXT: v_or_b32_e32 v4, v6, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or_x2 v[0:1], v[2:3]			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v1
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v6, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB49_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i64_noret_offset:			; GCN3-LABEL: flat_atomic_or_i64_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or_x2 v[0:1], v[2:3] offset:32			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB49_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_or_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_or_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB49_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw or ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw or ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @flat_atomic_or_i64_ret(ptr %ptr, i64 %in) {			define i64 @flat_atomic_or_i64_ret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_or_i64_ret:			; GCN1-LABEL: flat_atomic_or_i64_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: v_add_i32_e32 v5, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: flat_load_dword v5, v[5:6]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB50_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: v_or_b32_e32 v5, v7, v3
				; GCN1-NEXT: v_or_b32_e32 v4, v6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB50_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v0, v4
				; GCN1-NEXT: v_mov_b32_e32 v1, v5
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i64_ret:			; GCN2-LABEL: flat_atomic_or_i64_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: v_add_u32_e32 v5, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: flat_load_dword v5, v[5:6]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB50_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: v_or_b32_e32 v5, v7, v3
				; GCN2-NEXT: v_or_b32_e32 v4, v6, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB50_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v0, v4
				; GCN2-NEXT: v_mov_b32_e32 v1, v5
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i64_ret:			; GCN3-LABEL: flat_atomic_or_i64_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or_x2 v[0:1], v[0:1], v[2:3] glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB50_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_or_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_or_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB50_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw or ptr %ptr, i64 %in seq_cst			%result = atomicrmw or ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @flat_atomic_or_i64_ret_offset(ptr %out, i64 %in) {			define i64 @flat_atomic_or_i64_ret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_or_i64_ret_offset:			; GCN1-LABEL: flat_atomic_or_i64_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB51_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v9, v1
				; GCN1-NEXT: v_mov_b32_e32 v8, v0
				; GCN1-NEXT: v_or_b32_e32 v7, v9, v3
				; GCN1-NEXT: v_or_b32_e32 v6, v8, v2
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB51_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i64_ret_offset:			; GCN2-LABEL: flat_atomic_or_i64_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB51_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v9, v1
				; GCN2-NEXT: v_mov_b32_e32 v8, v0
				; GCN2-NEXT: v_or_b32_e32 v7, v9, v3
				; GCN2-NEXT: v_or_b32_e32 v6, v8, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB51_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i64_ret_offset:			; GCN3-LABEL: flat_atomic_or_i64_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or_x2 v[0:1], v[0:1], v[2:3] offset:32 glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB51_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_or_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_or_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB51_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw or ptr %gep, i64 %in seq_cst			%result = atomicrmw or ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @flat_atomic_or_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_or_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_or_i64_noret_scalar:			; GCN1-LABEL: flat_atomic_or_i64_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: s_add_u32 s34, s4, 4
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v3, s34
				; GCN1-NEXT: v_mov_b32_e32 v4, s35
				; GCN1-NEXT: flat_load_dword v2, v[0:1]
				; GCN1-NEXT: flat_load_dword v3, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB52_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or_x2 v[2:3], v[0:1]			; GCN1-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_or_b32_e32 v0, s6, v2
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB52_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i64_noret_scalar:			; GCN2-LABEL: flat_atomic_or_i64_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: s_add_u32 s34, s4, 4
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v3, s34
				; GCN2-NEXT: v_mov_b32_e32 v4, s35
				; GCN2-NEXT: flat_load_dword v2, v[0:1]
				; GCN2-NEXT: flat_load_dword v3, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB52_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_or_b32_e32 v0, s6, v2
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or_x2 v[2:3], v[0:1]			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB52_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i64_noret_scalar:			; GCN3-LABEL: flat_atomic_or_i64_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB52_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or_x2 v[2:3], v[0:1]			; GCN3-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_or_b32_e32 v0, s6, v2
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB52_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw or ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw or ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_or_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_or_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_or_i64_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_or_i64_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s34, s4, 32
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: s_add_u32 s36, s4, 36
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: s_addc_u32 s37, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: v_mov_b32_e32 v0, s36
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s37
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: flat_load_dword v2, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB53_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_or_b32_e32 v0, s6, v2
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or_x2 v[2:3], v[0:1]			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB53_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i64_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_or_i64_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s34, s4, 32
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: s_add_u32 s36, s4, 36
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: s_addc_u32 s37, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: v_mov_b32_e32 v0, s36
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s37
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: flat_load_dword v2, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB53_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or_x2 v[2:3], v[0:1]			; GCN2-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_or_b32_e32 v0, s6, v2
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB53_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i64_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_or_i64_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1] offset:32
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB53_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or_x2 v[2:3], v[0:1] offset:32			; GCN3-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_or_b32_e32 v0, s6, v2
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB53_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw or ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw or ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @flat_atomic_or_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_or_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_or_i64_ret_scalar:			; GCN1-LABEL: flat_atomic_or_i64_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: s_add_u32 s34, s4, 4
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: flat_load_dword v1, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB54_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_or_b32_e32 v0, s6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB54_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i64_ret_scalar:			; GCN2-LABEL: flat_atomic_or_i64_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: s_add_u32 s34, s4, 4
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: flat_load_dword v1, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB54_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
				; GCN2-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_or_b32_e32 v0, s6, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB54_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i64_ret_scalar:			; GCN3-LABEL: flat_atomic_or_i64_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB54_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or_x2 v[0:1], v[2:3], v[0:1] glc			; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_or_b32_e32 v0, s6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB54_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw or ptr %ptr, i64 %in seq_cst			%result = atomicrmw or ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @flat_atomic_or_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_or_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_or_i64_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_or_i64_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s34, s4, 32
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: s_add_u32 s36, s4, 36
				; GCN1-NEXT: s_addc_u32 s37, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v0, s36
				; GCN1-NEXT: v_mov_b32_e32 v1, s37
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: v_mov_b32_e32 v2, s34
	; GCN1-NEXT: v_mov_b32_e32 v0, s6
	; GCN1-NEXT: v_mov_b32_e32 v1, s7
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB55_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_or_b32_e32 v0, s6, v2
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_or_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB55_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_or_i64_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_or_i64_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s34, s4, 32
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: s_add_u32 s36, s4, 36
				; GCN2-NEXT: s_addc_u32 s37, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v0, s36
				; GCN2-NEXT: v_mov_b32_e32 v1, s37
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: v_mov_b32_e32 v2, s34
	; GCN2-NEXT: v_mov_b32_e32 v0, s6
	; GCN2-NEXT: v_mov_b32_e32 v1, s7
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB55_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_or_b32_e32 v0, s6, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_or_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB55_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_or_i64_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_or_i64_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1] offset:32
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB55_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_or_x2 v[0:1], v[2:3], v[0:1] offset:32 glc			; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_or_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_or_b32_e32 v0, s6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB55_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw or ptr %gep, i64 %in seq_cst			%result = atomicrmw or ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw xor			; atomicrmw xor
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_xor_i64_noret(ptr %ptr, i64 %in) {			define void @flat_atomic_xor_i64_noret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_xor_i64_noret:			; GCN1-LABEL: flat_atomic_xor_i64_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v6, v[0:1]
				; GCN1-NEXT: flat_load_dword v7, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB56_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_xor_b32_e32 v5, v7, v3
				; GCN1-NEXT: v_xor_b32_e32 v4, v6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB56_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i64_noret:			; GCN2-LABEL: flat_atomic_xor_i64_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3]			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v6, v[0:1]
				; GCN2-NEXT: flat_load_dword v7, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB56_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_xor_b32_e32 v5, v7, v3
				; GCN2-NEXT: v_xor_b32_e32 v4, v6, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB56_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i64_noret:			; GCN3-LABEL: flat_atomic_xor_i64_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3]			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB56_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_xor_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_xor_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB56_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw xor ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw xor ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_xor_i64_noret_offset(ptr %out, i64 %in) {			define void @flat_atomic_xor_i64_noret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_xor_i64_noret_offset:			; GCN1-LABEL: flat_atomic_xor_i64_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v8, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v7, v[0:1]
				; GCN1-NEXT: flat_load_dword v6, v[8:9]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB57_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_xor_b32_e32 v5, v7, v3
				; GCN1-NEXT: v_xor_b32_e32 v4, v6, v2
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3]			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v1
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v6, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB57_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i64_noret_offset:			; GCN2-LABEL: flat_atomic_xor_i64_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v8, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v7, v[0:1]
				; GCN2-NEXT: flat_load_dword v6, v[8:9]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB57_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3]			; GCN2-NEXT: v_xor_b32_e32 v5, v7, v3
				; GCN2-NEXT: v_xor_b32_e32 v4, v6, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v1
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v6, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB57_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i64_noret_offset:			; GCN3-LABEL: flat_atomic_xor_i64_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3] offset:32			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB57_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_xor_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_xor_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB57_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw xor ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw xor ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @flat_atomic_xor_i64_ret(ptr %ptr, i64 %in) {			define i64 @flat_atomic_xor_i64_ret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_xor_i64_ret:			; GCN1-LABEL: flat_atomic_xor_i64_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: v_add_i32_e32 v5, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: flat_load_dword v5, v[5:6]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB58_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: v_xor_b32_e32 v5, v7, v3
				; GCN1-NEXT: v_xor_b32_e32 v4, v6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB58_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v0, v4
				; GCN1-NEXT: v_mov_b32_e32 v1, v5
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i64_ret:			; GCN2-LABEL: flat_atomic_xor_i64_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: v_add_u32_e32 v5, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: flat_load_dword v5, v[5:6]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB58_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: v_xor_b32_e32 v5, v7, v3
				; GCN2-NEXT: v_xor_b32_e32 v4, v6, v2
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB58_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v0, v4
				; GCN2-NEXT: v_mov_b32_e32 v1, v5
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i64_ret:			; GCN3-LABEL: flat_atomic_xor_i64_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor_x2 v[0:1], v[0:1], v[2:3] glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB58_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_xor_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_xor_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB58_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw xor ptr %ptr, i64 %in seq_cst			%result = atomicrmw xor ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @flat_atomic_xor_i64_ret_offset(ptr %out, i64 %in) {			define i64 @flat_atomic_xor_i64_ret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_xor_i64_ret_offset:			; GCN1-LABEL: flat_atomic_xor_i64_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB59_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: v_mov_b32_e32 v9, v1
				; GCN1-NEXT: v_mov_b32_e32 v8, v0
				; GCN1-NEXT: v_xor_b32_e32 v7, v9, v3
				; GCN1-NEXT: v_xor_b32_e32 v6, v8, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB59_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i64_ret_offset:			; GCN2-LABEL: flat_atomic_xor_i64_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB59_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v9, v1
				; GCN2-NEXT: v_mov_b32_e32 v8, v0
				; GCN2-NEXT: v_xor_b32_e32 v7, v9, v3
				; GCN2-NEXT: v_xor_b32_e32 v6, v8, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB59_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i64_ret_offset:			; GCN3-LABEL: flat_atomic_xor_i64_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor_x2 v[0:1], v[0:1], v[2:3] offset:32 glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB59_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_xor_b32_e32 v5, v7, v3
				; GCN3-NEXT: v_xor_b32_e32 v4, v6, v2
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB59_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw xor ptr %gep, i64 %in seq_cst			%result = atomicrmw xor ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @flat_atomic_xor_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_xor_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_xor_i64_noret_scalar:			; GCN1-LABEL: flat_atomic_xor_i64_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: s_add_u32 s34, s4, 4
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v3, s34
				; GCN1-NEXT: v_mov_b32_e32 v4, s35
				; GCN1-NEXT: flat_load_dword v2, v[0:1]
				; GCN1-NEXT: flat_load_dword v3, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB60_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_xor_b32_e32 v0, s6, v2
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor_x2 v[2:3], v[0:1]			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB60_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i64_noret_scalar:			; GCN2-LABEL: flat_atomic_xor_i64_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: s_add_u32 s34, s4, 4
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v3, s34
				; GCN2-NEXT: v_mov_b32_e32 v4, s35
				; GCN2-NEXT: flat_load_dword v2, v[0:1]
				; GCN2-NEXT: flat_load_dword v3, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB60_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_xor_b32_e32 v0, s6, v2
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor_x2 v[2:3], v[0:1]			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB60_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i64_noret_scalar:			; GCN3-LABEL: flat_atomic_xor_i64_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB60_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_xor_b32_e32 v0, s6, v2
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor_x2 v[2:3], v[0:1]			; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB60_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw xor ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw xor ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_xor_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_xor_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_xor_i64_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_xor_i64_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s34, s4, 32
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: s_add_u32 s36, s4, 36
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: s_addc_u32 s37, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: v_mov_b32_e32 v0, s36
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s37
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: flat_load_dword v2, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB61_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor_x2 v[2:3], v[0:1]			; GCN1-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_xor_b32_e32 v0, s6, v2
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB61_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i64_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_xor_i64_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s34, s4, 32
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: s_add_u32 s36, s4, 36
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: s_addc_u32 s37, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: v_mov_b32_e32 v0, s36
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s37
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: flat_load_dword v2, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB61_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor_x2 v[2:3], v[0:1]			; GCN2-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_xor_b32_e32 v0, s6, v2
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB61_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i64_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_xor_i64_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1] offset:32
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB61_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor_x2 v[2:3], v[0:1] offset:32			; GCN3-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_xor_b32_e32 v0, s6, v2
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB61_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw xor ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw xor ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @flat_atomic_xor_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_xor_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_xor_i64_ret_scalar:			; GCN1-LABEL: flat_atomic_xor_i64_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: s_add_u32 s34, s4, 4
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: flat_load_dword v1, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB62_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_xor_b32_e32 v0, s6, v2
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB62_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i64_ret_scalar:			; GCN2-LABEL: flat_atomic_xor_i64_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: s_add_u32 s34, s4, 4
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: flat_load_dword v1, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB62_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
				; GCN2-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_xor_b32_e32 v0, s6, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB62_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i64_ret_scalar:			; GCN3-LABEL: flat_atomic_xor_i64_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB62_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_xor_b32_e32 v0, s6, v2
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3], v[0:1] glc			; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB62_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw xor ptr %ptr, i64 %in seq_cst			%result = atomicrmw xor ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @flat_atomic_xor_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_xor_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_xor_i64_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_xor_i64_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s34, s4, 32
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: s_add_u32 s36, s4, 36
				; GCN1-NEXT: s_addc_u32 s37, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v0, s36
				; GCN1-NEXT: v_mov_b32_e32 v1, s37
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: v_mov_b32_e32 v2, s34
	; GCN1-NEXT: v_mov_b32_e32 v0, s6
	; GCN1-NEXT: v_mov_b32_e32 v1, s7
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB63_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN1-NEXT: v_xor_b32_e32 v0, s6, v2
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB63_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_xor_i64_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_xor_i64_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s34, s4, 32
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: s_add_u32 s36, s4, 36
				; GCN2-NEXT: s_addc_u32 s37, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v0, s36
				; GCN2-NEXT: v_mov_b32_e32 v1, s37
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: v_mov_b32_e32 v2, s34
	; GCN2-NEXT: v_mov_b32_e32 v0, s6
	; GCN2-NEXT: v_mov_b32_e32 v1, s7
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB63_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN2-NEXT: v_xor_b32_e32 v0, s6, v2
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB63_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_xor_i64_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_xor_i64_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1] offset:32
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB63_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_xor_b32_e32 v1, s7, v3
				; GCN3-NEXT: v_xor_b32_e32 v0, s6, v2
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3], v[0:1] offset:32 glc			; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB63_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw xor ptr %gep, i64 %in seq_cst			%result = atomicrmw xor ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw max			; atomicrmw max
	▲ Show 20 Lines • Show All 4,496 Lines • ▼ Show 20 Lines
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw uinc_wrap			; atomicrmw uinc_wrap
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_uinc_wrap_i64_noret(ptr %ptr, i64 %in) {			define void @flat_atomic_uinc_wrap_i64_noret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i64_noret:			; GCN1-LABEL: flat_atomic_uinc_wrap_i64_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v6, v[0:1]
				; GCN1-NEXT: flat_load_dword v7, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB107_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_add_i32_e32 v4, vcc, 1, v6
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v7, vcc
				; GCN1-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GCN1-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB107_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i64_noret:			; GCN2-LABEL: flat_atomic_uinc_wrap_i64_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3]			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v6, v[0:1]
				; GCN2-NEXT: flat_load_dword v7, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB107_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_add_u32_e32 v4, vcc, 1, v6
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v7, vcc
				; GCN2-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GCN2-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB107_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i64_noret:			; GCN3-LABEL: flat_atomic_uinc_wrap_i64_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3]			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB107_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_add_co_u32_e32 v4, vcc, 1, v6
				; GCN3-NEXT: v_addc_co_u32_e32 v5, vcc, 0, v7, vcc
				; GCN3-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GCN3-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB107_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw uinc_wrap ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_uinc_wrap_i64_noret_offset(ptr %out, i64 %in) {			define void @flat_atomic_uinc_wrap_i64_noret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i64_noret_offset:			; GCN1-LABEL: flat_atomic_uinc_wrap_i64_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v8, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v7, v[0:1]
				; GCN1-NEXT: flat_load_dword v6, v[8:9]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB108_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v6
				; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v7, vcc
				; GCN1-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GCN1-NEXT: v_cndmask_b32_e32 v5, 0, v1, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v4, 0, v0, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v1
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v6, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB108_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i64_noret_offset:			; GCN2-LABEL: flat_atomic_uinc_wrap_i64_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v8, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v7, v[0:1]
				; GCN2-NEXT: flat_load_dword v6, v[8:9]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB108_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3]			; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v6
				; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v7, vcc
				; GCN2-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GCN2-NEXT: v_cndmask_b32_e32 v5, 0, v1, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v4, 0, v0, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v1
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v6, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB108_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i64_noret_offset:			; GCN3-LABEL: flat_atomic_uinc_wrap_i64_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3] offset:32			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB108_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_add_co_u32_e32 v4, vcc, 1, v6
				; GCN3-NEXT: v_addc_co_u32_e32 v5, vcc, 0, v7, vcc
				; GCN3-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GCN3-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB108_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw uinc_wrap ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @flat_atomic_uinc_wrap_i64_ret(ptr %ptr, i64 %in) {			define i64 @flat_atomic_uinc_wrap_i64_ret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i64_ret:			; GCN1-LABEL: flat_atomic_uinc_wrap_i64_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: v_add_i32_e32 v5, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: flat_load_dword v5, v[5:6]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB109_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: v_add_i32_e32 v4, vcc, 1, v6
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v7, vcc
				; GCN1-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GCN1-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB109_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN1-NEXT: v_mov_b32_e32 v0, v4
				; GCN1-NEXT: v_mov_b32_e32 v1, v5
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i64_ret:			; GCN2-LABEL: flat_atomic_uinc_wrap_i64_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: v_add_u32_e32 v5, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: flat_load_dword v5, v[5:6]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB109_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: v_add_u32_e32 v4, vcc, 1, v6
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v7, vcc
				; GCN2-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GCN2-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB109_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN2-NEXT: v_mov_b32_e32 v0, v4
				; GCN2-NEXT: v_mov_b32_e32 v1, v5
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i64_ret:			; GCN3-LABEL: flat_atomic_uinc_wrap_i64_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc_x2 v[0:1], v[0:1], v[2:3] glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB109_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_add_co_u32_e32 v4, vcc, 1, v6
				; GCN3-NEXT: v_addc_co_u32_e32 v5, vcc, 0, v7, vcc
				; GCN3-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GCN3-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB109_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw uinc_wrap ptr %ptr, i64 %in seq_cst			%result = atomicrmw uinc_wrap ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @flat_atomic_uinc_wrap_i64_ret_offset(ptr %out, i64 %in) {			define i64 @flat_atomic_uinc_wrap_i64_ret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i64_ret_offset:			; GCN1-LABEL: flat_atomic_uinc_wrap_i64_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[4:5], 0
				; GCN1-NEXT: .LBB110_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v9, v1
				; GCN1-NEXT: v_mov_b32_e32 v8, v0
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v8
				; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v9, vcc
				; GCN1-NEXT: v_cmp_lt_u64_e32 vcc, v[8:9], v[2:3]
				; GCN1-NEXT: v_cndmask_b32_e32 v7, 0, v1, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v6, 0, v0, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN1-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN1-NEXT: s_cbranch_execnz .LBB110_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i64_ret_offset:			; GCN2-LABEL: flat_atomic_uinc_wrap_i64_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[4:5], 0
				; GCN2-NEXT: .LBB110_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: v_mov_b32_e32 v9, v1
				; GCN2-NEXT: v_mov_b32_e32 v8, v0
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v8
				; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v9, vcc
				; GCN2-NEXT: v_cmp_lt_u64_e32 vcc, v[8:9], v[2:3]
				; GCN2-NEXT: v_cndmask_b32_e32 v7, 0, v1, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v6, 0, v0, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN2-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN2-NEXT: s_cbranch_execnz .LBB110_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[4:5]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i64_ret_offset:			; GCN3-LABEL: flat_atomic_uinc_wrap_i64_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc_x2 v[0:1], v[0:1], v[2:3] offset:32 glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[4:5], 0
				; GCN3-NEXT: .LBB110_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_add_co_u32_e32 v4, vcc, 1, v6
				; GCN3-NEXT: v_addc_co_u32_e32 v5, vcc, 0, v7, vcc
				; GCN3-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GCN3-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GCN3-NEXT: s_cbranch_execnz .LBB110_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[4:5]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw uinc_wrap ptr %gep, i64 %in seq_cst			%result = atomicrmw uinc_wrap ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @flat_atomic_uinc_wrap_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_uinc_wrap_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i64_noret_scalar:			; GCN1-LABEL: flat_atomic_uinc_wrap_i64_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: s_add_u32 s34, s4, 4
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v3, s34
				; GCN1-NEXT: v_mov_b32_e32 v4, s35
				; GCN1-NEXT: flat_load_dword v2, v[0:1]
				; GCN1-NEXT: flat_load_dword v3, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB111_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]			; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v2
				; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; GCN1-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB111_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i64_noret_scalar:			; GCN2-LABEL: flat_atomic_uinc_wrap_i64_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: s_add_u32 s34, s4, 4
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v3, s34
				; GCN2-NEXT: v_mov_b32_e32 v4, s35
				; GCN2-NEXT: flat_load_dword v2, v[0:1]
				; GCN2-NEXT: flat_load_dword v3, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB111_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]			; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v2
				; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; GCN2-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
				; GCN2-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB111_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i64_noret_scalar:			; GCN3-LABEL: flat_atomic_uinc_wrap_i64_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB111_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]			; GCN3-NEXT: v_add_co_u32_e32 v0, vcc, 1, v2
				; GCN3-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v3, vcc
				; GCN3-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB111_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw uinc_wrap ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_uinc_wrap_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_uinc_wrap_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i64_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_uinc_wrap_i64_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s34, s4, 32
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: s_add_u32 s36, s4, 36
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: s_addc_u32 s37, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: v_mov_b32_e32 v0, s36
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v1, s37
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: flat_load_dword v2, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB112_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]			; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v2
				; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; GCN1-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB112_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i64_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_uinc_wrap_i64_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s34, s4, 32
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: s_add_u32 s36, s4, 36
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: s_addc_u32 s37, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: v_mov_b32_e32 v0, s36
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v1, s37
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: flat_load_dword v2, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB112_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]			; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v2
				; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; GCN2-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB112_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i64_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_uinc_wrap_i64_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1] offset:32
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB112_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1] offset:32			; GCN3-NEXT: v_add_co_u32_e32 v0, vcc, 1, v2
				; GCN3-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v3, vcc
				; GCN3-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB112_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw uinc_wrap ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @flat_atomic_uinc_wrap_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_uinc_wrap_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i64_ret_scalar:			; GCN1-LABEL: flat_atomic_uinc_wrap_i64_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: s_add_u32 s34, s4, 4
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: flat_load_dword v1, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[34:35], 0
				; GCN1-NEXT: .LBB113_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v2
				; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; GCN1-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN1-NEXT: s_cbranch_execnz .LBB113_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i64_ret_scalar:			; GCN2-LABEL: flat_atomic_uinc_wrap_i64_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: s_add_u32 s34, s4, 4
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: flat_load_dword v1, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[34:35], 0
				; GCN2-NEXT: .LBB113_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v2
				; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; GCN2-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
				; GCN2-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN2-NEXT: s_cbranch_execnz .LBB113_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i64_ret_scalar:			; GCN3-LABEL: flat_atomic_uinc_wrap_i64_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB113_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: v_add_co_u32_e32 v0, vcc, 1, v2
				; GCN3-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v3, vcc
				; GCN3-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc			; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB113_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw uinc_wrap ptr %ptr, i64 %in seq_cst			%result = atomicrmw uinc_wrap ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @flat_atomic_uinc_wrap_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_uinc_wrap_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_uinc_wrap_i64_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_uinc_wrap_i64_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s34, s4, 32
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: s_add_u32 s36, s4, 36
				; GCN1-NEXT: s_addc_u32 s37, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v0, s36
				; GCN1-NEXT: v_mov_b32_e32 v1, s37
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: v_mov_b32_e32 v2, s34
	; GCN1-NEXT: v_mov_b32_e32 v0, s6
	; GCN1-NEXT: v_mov_b32_e32 v1, s7
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB114_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 1, v2
				; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; GCN1-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v4, s34
				; GCN1-NEXT: v_mov_b32_e32 v5, s35
				; GCN1-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB114_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_uinc_wrap_i64_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_uinc_wrap_i64_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s34, s4, 32
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: s_add_u32 s36, s4, 36
				; GCN2-NEXT: s_addc_u32 s37, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v0, s36
				; GCN2-NEXT: v_mov_b32_e32 v1, s37
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: v_mov_b32_e32 v2, s34
	; GCN2-NEXT: v_mov_b32_e32 v0, s6
	; GCN2-NEXT: v_mov_b32_e32 v1, s7
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB114_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 1, v2
				; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; GCN2-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v4, s34
				; GCN2-NEXT: v_mov_b32_e32 v5, s35
				; GCN2-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB114_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_uinc_wrap_i64_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_uinc_wrap_i64_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1] offset:32
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[34:35], 0
				; GCN3-NEXT: .LBB114_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] offset:32 glc			; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: v_add_co_u32_e32 v0, vcc, 1, v2
				; GCN3-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v3, vcc
				; GCN3-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GCN3-NEXT: s_cbranch_execnz .LBB114_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[34:35]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw uinc_wrap ptr %gep, i64 %in seq_cst			%result = atomicrmw uinc_wrap ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw udec_wrap			; atomicrmw udec_wrap
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @flat_atomic_udec_wrap_i64_noret(ptr %ptr, i64 %in) {			define void @flat_atomic_udec_wrap_i64_noret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i64_noret:			; GCN1-LABEL: flat_atomic_udec_wrap_i64_noret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v6, v[0:1]
				; GCN1-NEXT: flat_load_dword v7, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[8:9], 0
				; GCN1-NEXT: .LBB115_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GCN1-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GCN1-NEXT: v_add_i32_e64 v4, s[6:7], -1, v6
				; GCN1-NEXT: v_addc_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN1-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN1-NEXT: s_cbranch_execnz .LBB115_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[8:9]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i64_noret:			; GCN2-LABEL: flat_atomic_udec_wrap_i64_noret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3]			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v6, v[0:1]
				; GCN2-NEXT: flat_load_dword v7, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[8:9], 0
				; GCN2-NEXT: .LBB115_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GCN2-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GCN2-NEXT: v_add_u32_e64 v4, s[6:7], -1, v6
				; GCN2-NEXT: v_addc_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN2-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN2-NEXT: s_cbranch_execnz .LBB115_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[8:9]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i64_noret:			; GCN3-LABEL: flat_atomic_udec_wrap_i64_noret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3]			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[8:9], 0
				; GCN3-NEXT: .LBB115_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GCN3-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GCN3-NEXT: v_add_co_u32_e64 v4, s[6:7], -1, v6
				; GCN3-NEXT: v_addc_co_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN3-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN3-NEXT: s_cbranch_execnz .LBB115_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[8:9]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw udec_wrap ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @flat_atomic_udec_wrap_i64_noret_offset(ptr %out, i64 %in) {			define void @flat_atomic_udec_wrap_i64_noret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i64_noret_offset:			; GCN1-LABEL: flat_atomic_udec_wrap_i64_noret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v8, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v7, v[0:1]
				; GCN1-NEXT: flat_load_dword v6, v[8:9]
				; GCN1-NEXT: s_mov_b64 s[8:9], 0
				; GCN1-NEXT: .LBB116_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3]			; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GCN1-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GCN1-NEXT: v_add_i32_e64 v0, s[6:7], -1, v6
				; GCN1-NEXT: v_addc_u32_e64 v1, s[6:7], -1, v7, s[6:7]
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN1-NEXT: v_cndmask_b32_e32 v5, v1, v3, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v4, v0, v2, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN1-NEXT: v_mov_b32_e32 v7, v1
				; GCN1-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN1-NEXT: v_mov_b32_e32 v6, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN1-NEXT: s_cbranch_execnz .LBB116_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[8:9]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i64_noret_offset:			; GCN2-LABEL: flat_atomic_udec_wrap_i64_noret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v8, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v9, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v7, v[0:1]
				; GCN2-NEXT: flat_load_dword v6, v[8:9]
				; GCN2-NEXT: s_mov_b64 s[8:9], 0
				; GCN2-NEXT: .LBB116_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3]			; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GCN2-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GCN2-NEXT: v_add_u32_e64 v0, s[6:7], -1, v6
				; GCN2-NEXT: v_addc_u32_e64 v1, s[6:7], -1, v7, s[6:7]
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN2-NEXT: v_cndmask_b32_e32 v5, v1, v3, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v4, v0, v2, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[8:9], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[6:7]
				; GCN2-NEXT: v_mov_b32_e32 v7, v1
				; GCN2-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN2-NEXT: v_mov_b32_e32 v6, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN2-NEXT: s_cbranch_execnz .LBB116_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[8:9]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i64_noret_offset:			; GCN3-LABEL: flat_atomic_udec_wrap_i64_noret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3] offset:32			; GCN3-NEXT: flat_load_dwordx2 v[6:7], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[8:9], 0
				; GCN3-NEXT: .LBB116_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GCN3-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GCN3-NEXT: v_add_co_u32_e64 v4, s[6:7], -1, v6
				; GCN3-NEXT: v_addc_co_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN3-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN3-NEXT: s_cbranch_execnz .LBB116_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[8:9]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw udec_wrap ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @flat_atomic_udec_wrap_i64_ret(ptr %ptr, i64 %in) {			define i64 @flat_atomic_udec_wrap_i64_ret(ptr %ptr, i64 %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i64_ret:			; GCN1-LABEL: flat_atomic_udec_wrap_i64_ret:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: v_add_i32_e32 v5, vcc, 4, v0
				; GCN1-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v4, v[0:1]
				; GCN1-NEXT: flat_load_dword v5, v[5:6]
				; GCN1-NEXT: s_mov_b64 s[8:9], 0
				; GCN1-NEXT: .LBB117_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_mov_b32_e32 v7, v5
				; GCN1-NEXT: v_mov_b32_e32 v6, v4
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GCN1-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GCN1-NEXT: v_add_i32_e64 v4, s[6:7], -1, v6
				; GCN1-NEXT: v_addc_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN1-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN1-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN1-NEXT: s_cbranch_execnz .LBB117_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[8:9]
				; GCN1-NEXT: v_mov_b32_e32 v0, v4
				; GCN1-NEXT: v_mov_b32_e32 v1, v5
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i64_ret:			; GCN2-LABEL: flat_atomic_udec_wrap_i64_ret:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: v_add_u32_e32 v5, vcc, 4, v0
				; GCN2-NEXT: v_addc_u32_e32 v6, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v4, v[0:1]
				; GCN2-NEXT: flat_load_dword v5, v[5:6]
				; GCN2-NEXT: s_mov_b64 s[8:9], 0
				; GCN2-NEXT: .LBB117_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v7, v5
				; GCN2-NEXT: v_mov_b32_e32 v6, v4
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GCN2-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GCN2-NEXT: v_add_u32_e64 v4, s[6:7], -1, v6
				; GCN2-NEXT: v_addc_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN2-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN2-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN2-NEXT: s_cbranch_execnz .LBB117_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[8:9]
				; GCN2-NEXT: v_mov_b32_e32 v0, v4
				; GCN2-NEXT: v_mov_b32_e32 v1, v5
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i64_ret:			; GCN3-LABEL: flat_atomic_udec_wrap_i64_ret:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec_x2 v[0:1], v[0:1], v[2:3] glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; GCN3-NEXT: s_mov_b64 s[8:9], 0
				; GCN3-NEXT: .LBB117_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GCN3-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GCN3-NEXT: v_add_co_u32_e64 v4, s[6:7], -1, v6
				; GCN3-NEXT: v_addc_co_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN3-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN3-NEXT: s_cbranch_execnz .LBB117_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[8:9]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw udec_wrap ptr %ptr, i64 %in seq_cst			%result = atomicrmw udec_wrap ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @flat_atomic_udec_wrap_i64_ret_offset(ptr %out, i64 %in) {			define i64 @flat_atomic_udec_wrap_i64_ret_offset(ptr %out, i64 %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i64_ret_offset:			; GCN1-LABEL: flat_atomic_udec_wrap_i64_ret_offset:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_add_i32_e32 v0, vcc, 32, v0			; GCN1-NEXT: v_add_i32_e32 v4, vcc, 32, v0
				; GCN1-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, 36, v0
	; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN1-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[8:9], 0
				; GCN1-NEXT: .LBB118_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec_x2 v[0:1], v[0:1], v[2:3] glc			; GCN1-NEXT: v_mov_b32_e32 v9, v1
				; GCN1-NEXT: v_mov_b32_e32 v8, v0
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[8:9]
				; GCN1-NEXT: v_cmp_gt_u64_e64 s[4:5], v[8:9], v[2:3]
				; GCN1-NEXT: v_add_i32_e64 v0, s[6:7], -1, v8
				; GCN1-NEXT: v_addc_u32_e64 v1, s[6:7], -1, v9, s[6:7]
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN1-NEXT: v_cndmask_b32_e32 v7, v1, v3, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v6, v0, v2, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN1-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN1-NEXT: s_cbranch_execnz .LBB118_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[8:9]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i64_ret_offset:			; GCN2-LABEL: flat_atomic_udec_wrap_i64_ret_offset:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; GCN2-NEXT: v_add_u32_e32 v4, vcc, 32, v0
				; GCN2-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, 36, v0
	; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; GCN2-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[8:9], 0
				; GCN2-NEXT: .LBB118_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec_x2 v[0:1], v[0:1], v[2:3] glc			; GCN2-NEXT: v_mov_b32_e32 v9, v1
				; GCN2-NEXT: v_mov_b32_e32 v8, v0
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[8:9]
				; GCN2-NEXT: v_cmp_gt_u64_e64 s[4:5], v[8:9], v[2:3]
				; GCN2-NEXT: v_add_u32_e64 v0, s[6:7], -1, v8
				; GCN2-NEXT: v_addc_u32_e64 v1, s[6:7], -1, v9, s[6:7]
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN2-NEXT: v_cndmask_b32_e32 v7, v1, v3, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v6, v0, v2, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; GCN2-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN2-NEXT: s_cbranch_execnz .LBB118_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[8:9]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i64_ret_offset:			; GCN3-LABEL: flat_atomic_udec_wrap_i64_ret_offset:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec_x2 v[0:1], v[0:1], v[2:3] offset:32 glc			; GCN3-NEXT: flat_load_dwordx2 v[4:5], v[0:1] offset:32
				; GCN3-NEXT: s_mov_b64 s[8:9], 0
				; GCN3-NEXT: .LBB118_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: v_mov_b32_e32 v7, v5
				; GCN3-NEXT: v_mov_b32_e32 v6, v4
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GCN3-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GCN3-NEXT: v_add_co_u32_e64 v4, s[6:7], -1, v6
				; GCN3-NEXT: v_addc_co_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GCN3-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GCN3-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GCN3-NEXT: s_cbranch_execnz .LBB118_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[8:9]
				; GCN3-NEXT: v_mov_b32_e32 v0, v4
				; GCN3-NEXT: v_mov_b32_e32 v1, v5
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw udec_wrap ptr %gep, i64 %in seq_cst			%result = atomicrmw udec_wrap ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @flat_atomic_udec_wrap_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_udec_wrap_i64_noret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i64_noret_scalar:			; GCN1-LABEL: flat_atomic_udec_wrap_i64_noret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: s_add_u32 s34, s4, 4
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v3, s34
				; GCN1-NEXT: v_mov_b32_e32 v4, s35
				; GCN1-NEXT: flat_load_dword v2, v[0:1]
				; GCN1-NEXT: flat_load_dword v3, v[3:4]
				; GCN1-NEXT: s_mov_b64 s[36:37], 0
				; GCN1-NEXT: .LBB119_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: v_add_i32_e32 v0, vcc, -1, v2
				; GCN1-NEXT: v_addc_u32_e32 v1, vcc, -1, v3, vcc
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN1-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v6, s7
				; GCN1-NEXT: v_mov_b32_e32 v7, s6
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: v_cndmask_b32_e32 v1, v1, v6, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v0, v0, v7, vcc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]			; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN1-NEXT: s_cbranch_execnz .LBB119_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i64_noret_scalar:			; GCN2-LABEL: flat_atomic_udec_wrap_i64_noret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: s_add_u32 s34, s4, 4
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v3, s34
				; GCN2-NEXT: v_mov_b32_e32 v4, s35
				; GCN2-NEXT: flat_load_dword v2, v[0:1]
				; GCN2-NEXT: flat_load_dword v3, v[3:4]
				; GCN2-NEXT: s_mov_b64 s[36:37], 0
				; GCN2-NEXT: .LBB119_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_add_u32_e32 v0, vcc, -1, v2
				; GCN2-NEXT: v_addc_u32_e32 v1, vcc, -1, v3, vcc
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN2-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v6, s7
				; GCN2-NEXT: v_mov_b32_e32 v7, s6
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
				; GCN2-NEXT: v_cndmask_b32_e32 v1, v1, v6, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v0, v0, v7, vcc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN2-NEXT: s_cbranch_execnz .LBB119_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i64_noret_scalar:			; GCN3-LABEL: flat_atomic_udec_wrap_i64_noret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[36:37], 0
				; GCN3-NEXT: .LBB119_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]			; GCN3-NEXT: v_add_co_u32_e32 v0, vcc, -1, v2
				; GCN3-NEXT: v_addc_co_u32_e32 v1, vcc, -1, v3, vcc
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN3-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v6, s7
				; GCN3-NEXT: v_mov_b32_e32 v7, s6
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v1, v1, v6, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v0, v0, v7, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN3-NEXT: s_cbranch_execnz .LBB119_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw udec_wrap ptr %ptr, i64 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @flat_atomic_udec_wrap_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx void @flat_atomic_udec_wrap_i64_noret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i64_noret_offset_scalar:			; GCN1-LABEL: flat_atomic_udec_wrap_i64_noret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s36, s4, 32
				; GCN1-NEXT: s_addc_u32 s37, s5, 0
				; GCN1-NEXT: s_add_u32 s34, s4, 36
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: v_mov_b32_e32 v4, s36
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v5, s37
				; GCN1-NEXT: flat_load_dword v3, v[0:1]
				; GCN1-NEXT: flat_load_dword v2, v[4:5]
				; GCN1-NEXT: s_mov_b64 s[38:39], 0
				; GCN1-NEXT: .LBB120_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]			; GCN1-NEXT: v_add_i32_e32 v0, vcc, -1, v2
				; GCN1-NEXT: v_addc_u32_e32 v1, vcc, -1, v3, vcc
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN1-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v6, s7
				; GCN1-NEXT: v_mov_b32_e32 v7, s6
				; GCN1-NEXT: v_mov_b32_e32 v4, s36
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v5, s37
				; GCN1-NEXT: v_cndmask_b32_e32 v1, v1, v6, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v0, v0, v7, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GCN1-NEXT: s_cbranch_execnz .LBB120_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[38:39]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i64_noret_offset_scalar:			; GCN2-LABEL: flat_atomic_udec_wrap_i64_noret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s36, s4, 32
				; GCN2-NEXT: s_addc_u32 s37, s5, 0
				; GCN2-NEXT: s_add_u32 s34, s4, 36
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: v_mov_b32_e32 v4, s36
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v5, s37
				; GCN2-NEXT: flat_load_dword v3, v[0:1]
				; GCN2-NEXT: flat_load_dword v2, v[4:5]
				; GCN2-NEXT: s_mov_b64 s[38:39], 0
				; GCN2-NEXT: .LBB120_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]			; GCN2-NEXT: v_add_u32_e32 v0, vcc, -1, v2
				; GCN2-NEXT: v_addc_u32_e32 v1, vcc, -1, v3, vcc
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN2-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v6, s7
				; GCN2-NEXT: v_mov_b32_e32 v7, s6
				; GCN2-NEXT: v_mov_b32_e32 v4, s36
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v5, s37
				; GCN2-NEXT: v_cndmask_b32_e32 v1, v1, v6, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v0, v0, v7, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GCN2-NEXT: s_cbranch_execnz .LBB120_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[38:39]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i64_noret_offset_scalar:			; GCN3-LABEL: flat_atomic_udec_wrap_i64_noret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[2:3], v[0:1] offset:32
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[36:37], 0
				; GCN3-NEXT: .LBB120_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1] offset:32			; GCN3-NEXT: v_add_co_u32_e32 v0, vcc, -1, v2
				; GCN3-NEXT: v_addc_co_u32_e32 v1, vcc, -1, v3, vcc
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN3-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v6, s7
				; GCN3-NEXT: v_mov_b32_e32 v7, s6
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v1, v1, v6, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v0, v0, v7, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GCN3-NEXT: s_cbranch_execnz .LBB120_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[36:37]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%tmp0 = atomicrmw udec_wrap ptr %gep, i64 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @flat_atomic_udec_wrap_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_udec_wrap_i64_ret_scalar(ptr inreg %ptr, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i64_ret_scalar:			; GCN1-LABEL: flat_atomic_udec_wrap_i64_ret_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v0, s4
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: s_add_u32 s34, s4, 4
	; GCN1-NEXT: v_mov_b32_e32 v2, s4			; GCN1-NEXT: v_mov_b32_e32 v1, s5
	; GCN1-NEXT: v_mov_b32_e32 v3, s5			; GCN1-NEXT: s_addc_u32 s35, s5, 0
				; GCN1-NEXT: v_mov_b32_e32 v2, s34
				; GCN1-NEXT: v_mov_b32_e32 v3, s35
				; GCN1-NEXT: flat_load_dword v0, v[0:1]
				; GCN1-NEXT: flat_load_dword v1, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[38:39], 0
				; GCN1-NEXT: .LBB121_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN1-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN1-NEXT: v_add_i32_e64 v7, s[36:37], -1, v2
				; GCN1-NEXT: v_mov_b32_e32 v0, s7
				; GCN1-NEXT: v_mov_b32_e32 v6, s6
				; GCN1-NEXT: v_mov_b32_e32 v4, s4
				; GCN1-NEXT: v_addc_u32_e64 v1, s[36:37], -1, v3, s[36:37]
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v5, s5
				; GCN1-NEXT: v_cndmask_b32_e32 v1, v1, v0, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v0, v7, v6, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GCN1-NEXT: s_cbranch_execnz .LBB121_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[38:39]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i64_ret_scalar:			; GCN2-LABEL: flat_atomic_udec_wrap_i64_ret_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v0, s4
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: s_add_u32 s34, s4, 4
	; GCN2-NEXT: v_mov_b32_e32 v2, s4			; GCN2-NEXT: v_mov_b32_e32 v1, s5
	; GCN2-NEXT: v_mov_b32_e32 v3, s5			; GCN2-NEXT: s_addc_u32 s35, s5, 0
				; GCN2-NEXT: v_mov_b32_e32 v2, s34
				; GCN2-NEXT: v_mov_b32_e32 v3, s35
				; GCN2-NEXT: flat_load_dword v0, v[0:1]
				; GCN2-NEXT: flat_load_dword v1, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[38:39], 0
				; GCN2-NEXT: .LBB121_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN2-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN2-NEXT: v_add_u32_e64 v7, s[36:37], -1, v2
				; GCN2-NEXT: v_mov_b32_e32 v0, s7
				; GCN2-NEXT: v_mov_b32_e32 v6, s6
				; GCN2-NEXT: v_mov_b32_e32 v4, s4
				; GCN2-NEXT: v_addc_u32_e64 v1, s[36:37], -1, v3, s[36:37]
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v5, s5
				; GCN2-NEXT: v_cndmask_b32_e32 v1, v1, v0, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v0, v7, v6, vcc
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GCN2-NEXT: s_cbranch_execnz .LBB121_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[38:39]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i64_ret_scalar:			; GCN3-LABEL: flat_atomic_udec_wrap_i64_ret_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[38:39], 0
				; GCN3-NEXT: .LBB121_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3], v[0:1] glc			; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN3-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN3-NEXT: v_add_co_u32_e64 v7, s[36:37], -1, v2
				; GCN3-NEXT: v_mov_b32_e32 v0, s7
				; GCN3-NEXT: v_mov_b32_e32 v6, s6
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_addc_co_u32_e64 v1, s[36:37], -1, v3, s[36:37]
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v1, v1, v0, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v0, v7, v6, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GCN3-NEXT: s_cbranch_execnz .LBB121_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[38:39]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw udec_wrap ptr %ptr, i64 %in seq_cst			%result = atomicrmw udec_wrap ptr %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @flat_atomic_udec_wrap_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @flat_atomic_udec_wrap_i64_ret_offset_scalar(ptr inreg %out, i64 inreg %in) {
	; GCN1-LABEL: flat_atomic_udec_wrap_i64_ret_offset_scalar:			; GCN1-LABEL: flat_atomic_udec_wrap_i64_ret_offset_scalar:
	; GCN1: ; %bb.0:			; GCN1: ; %bb.0:
	; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN1-NEXT: s_add_u32 s34, s4, 32			; GCN1-NEXT: s_add_u32 s38, s4, 32
				; GCN1-NEXT: s_addc_u32 s39, s5, 0
				; GCN1-NEXT: s_add_u32 s34, s4, 36
	; GCN1-NEXT: s_addc_u32 s35, s5, 0			; GCN1-NEXT: s_addc_u32 s35, s5, 0
	; GCN1-NEXT: v_mov_b32_e32 v2, s34			; GCN1-NEXT: v_mov_b32_e32 v0, s34
	; GCN1-NEXT: v_mov_b32_e32 v0, s6			; GCN1-NEXT: v_mov_b32_e32 v1, s35
	; GCN1-NEXT: v_mov_b32_e32 v1, s7			; GCN1-NEXT: v_mov_b32_e32 v2, s38
	; GCN1-NEXT: v_mov_b32_e32 v3, s35			; GCN1-NEXT: v_mov_b32_e32 v3, s39
				; GCN1-NEXT: flat_load_dword v1, v[0:1]
				; GCN1-NEXT: flat_load_dword v0, v[2:3]
				; GCN1-NEXT: s_mov_b64 s[40:41], 0
				; GCN1-NEXT: .LBB122_1: ; %atomicrmw.start
				; GCN1-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3], v[0:1] glc			; GCN1-NEXT: v_mov_b32_e32 v3, v1
				; GCN1-NEXT: v_mov_b32_e32 v2, v0
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN1-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN1-NEXT: v_add_i32_e64 v7, s[36:37], -1, v2
				; GCN1-NEXT: v_mov_b32_e32 v0, s7
				; GCN1-NEXT: v_mov_b32_e32 v6, s6
				; GCN1-NEXT: v_mov_b32_e32 v4, s38
				; GCN1-NEXT: v_addc_u32_e64 v1, s[36:37], -1, v3, s[36:37]
				; GCN1-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN1-NEXT: v_mov_b32_e32 v5, s39
				; GCN1-NEXT: v_cndmask_b32_e32 v1, v1, v0, vcc
				; GCN1-NEXT: v_cndmask_b32_e32 v0, v7, v6, vcc
				; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN1-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN1-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN1-NEXT: buffer_wbinvl1_vol			; GCN1-NEXT: buffer_wbinvl1_vol
				; GCN1-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN1-NEXT: s_or_b64 s[40:41], vcc, s[40:41]
				; GCN1-NEXT: s_andn2_b64 exec, exec, s[40:41]
				; GCN1-NEXT: s_cbranch_execnz .LBB122_1
				; GCN1-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN1-NEXT: s_or_b64 exec, exec, s[40:41]
	; GCN1-NEXT: s_setpc_b64 s[30:31]			; GCN1-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN2-LABEL: flat_atomic_udec_wrap_i64_ret_offset_scalar:			; GCN2-LABEL: flat_atomic_udec_wrap_i64_ret_offset_scalar:
	; GCN2: ; %bb.0:			; GCN2: ; %bb.0:
	; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN2-NEXT: s_add_u32 s34, s4, 32			; GCN2-NEXT: s_add_u32 s38, s4, 32
				; GCN2-NEXT: s_addc_u32 s39, s5, 0
				; GCN2-NEXT: s_add_u32 s34, s4, 36
	; GCN2-NEXT: s_addc_u32 s35, s5, 0			; GCN2-NEXT: s_addc_u32 s35, s5, 0
	; GCN2-NEXT: v_mov_b32_e32 v2, s34			; GCN2-NEXT: v_mov_b32_e32 v0, s34
	; GCN2-NEXT: v_mov_b32_e32 v0, s6			; GCN2-NEXT: v_mov_b32_e32 v1, s35
	; GCN2-NEXT: v_mov_b32_e32 v1, s7			; GCN2-NEXT: v_mov_b32_e32 v2, s38
	; GCN2-NEXT: v_mov_b32_e32 v3, s35			; GCN2-NEXT: v_mov_b32_e32 v3, s39
				; GCN2-NEXT: flat_load_dword v1, v[0:1]
				; GCN2-NEXT: flat_load_dword v0, v[2:3]
				; GCN2-NEXT: s_mov_b64 s[40:41], 0
				; GCN2-NEXT: .LBB122_1: ; %atomicrmw.start
				; GCN2-NEXT: ; =>This Inner Loop Header: Depth=1
				; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN2-NEXT: v_mov_b32_e32 v3, v1
				; GCN2-NEXT: v_mov_b32_e32 v2, v0
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN2-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN2-NEXT: v_add_u32_e64 v7, s[36:37], -1, v2
				; GCN2-NEXT: v_mov_b32_e32 v0, s7
				; GCN2-NEXT: v_mov_b32_e32 v6, s6
				; GCN2-NEXT: v_mov_b32_e32 v4, s38
				; GCN2-NEXT: v_addc_u32_e64 v1, s[36:37], -1, v3, s[36:37]
				; GCN2-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN2-NEXT: v_mov_b32_e32 v5, s39
				; GCN2-NEXT: v_cndmask_b32_e32 v1, v1, v0, vcc
				; GCN2-NEXT: v_cndmask_b32_e32 v0, v7, v6, vcc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3], v[0:1] glc			; GCN2-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN2-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN2-NEXT: buffer_wbinvl1_vol			; GCN2-NEXT: buffer_wbinvl1_vol
				; GCN2-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN2-NEXT: s_or_b64 s[40:41], vcc, s[40:41]
				; GCN2-NEXT: s_andn2_b64 exec, exec, s[40:41]
				; GCN2-NEXT: s_cbranch_execnz .LBB122_1
				; GCN2-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN2-NEXT: s_or_b64 exec, exec, s[40:41]
	; GCN2-NEXT: s_setpc_b64 s[30:31]			; GCN2-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GCN3-LABEL: flat_atomic_udec_wrap_i64_ret_offset_scalar:			; GCN3-LABEL: flat_atomic_udec_wrap_i64_ret_offset_scalar:
	; GCN3: ; %bb.0:			; GCN3: ; %bb.0:
	; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GCN3-NEXT: v_mov_b32_e32 v0, s6			; GCN3-NEXT: v_mov_b32_e32 v0, s4
	; GCN3-NEXT: v_mov_b32_e32 v1, s7			; GCN3-NEXT: v_mov_b32_e32 v1, s5
	; GCN3-NEXT: v_mov_b32_e32 v2, s4			; GCN3-NEXT: flat_load_dwordx2 v[0:1], v[0:1] offset:32
	; GCN3-NEXT: v_mov_b32_e32 v3, s5			; GCN3-NEXT: s_mov_b64 s[38:39], 0
				; GCN3-NEXT: .LBB122_1: ; %atomicrmw.start
				; GCN3-NEXT: ; =>This Inner Loop Header: Depth=1
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3], v[0:1] offset:32 glc			; GCN3-NEXT: v_mov_b32_e32 v3, v1
				; GCN3-NEXT: v_mov_b32_e32 v2, v0
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GCN3-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GCN3-NEXT: v_add_co_u32_e64 v7, s[36:37], -1, v2
				; GCN3-NEXT: v_mov_b32_e32 v0, s7
				; GCN3-NEXT: v_mov_b32_e32 v6, s6
				; GCN3-NEXT: v_mov_b32_e32 v4, s4
				; GCN3-NEXT: v_addc_co_u32_e64 v1, s[36:37], -1, v3, s[36:37]
				; GCN3-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GCN3-NEXT: v_mov_b32_e32 v5, s5
				; GCN3-NEXT: v_cndmask_b32_e32 v1, v1, v0, vcc
				; GCN3-NEXT: v_cndmask_b32_e32 v0, v7, v6, vcc
				; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GCN3-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] offset:32 glc
	; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GCN3-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GCN3-NEXT: buffer_wbinvl1_vol			; GCN3-NEXT: buffer_wbinvl1_vol
				; GCN3-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GCN3-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GCN3-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GCN3-NEXT: s_cbranch_execnz .LBB122_1
				; GCN3-NEXT: ; %bb.2: ; %atomicrmw.end
				; GCN3-NEXT: s_or_b64 exec, exec, s[38:39]
	; GCN3-NEXT: s_setpc_b64 s[30:31]			; GCN3-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr %out, i64 4			%gep = getelementptr i64, ptr %out, i64 4
	%result = atomicrmw udec_wrap ptr %gep, i64 %in seq_cst			%result = atomicrmw udec_wrap ptr %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

llvm/test/CodeGen/AMDGPU/global_atomics_i32_system.ll

This file is larger than 256 KB, so syntax highlighting is disabled by default.

	Show First 20 Lines • Show All 1,665 Lines • ▼ Show 20 Lines
	define void @global_atomic_sub_i32_noret(ptr addrspace(1) %ptr, i32 %in) {			define void @global_atomic_sub_i32_noret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_sub_i32_noret:			; SI-LABEL: global_atomic_sub_i32_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB24_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_sub_i32_e32 v3, vcc, v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub v2, v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB24_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i32_noret:			; VI-LABEL: global_atomic_sub_i32_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub v[0:1], v2			; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB24_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_sub_u32_e32 v3, vcc, v4, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB24_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i32_noret:			; GFX9-LABEL: global_atomic_sub_i32_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub v[0:1], v2, off			; GFX9-NEXT: global_load_dword v4, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB24_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_sub_u32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB24_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw sub ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw sub ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_sub_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {			define void @global_atomic_sub_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_sub_i32_noret_offset:			; SI-LABEL: global_atomic_sub_i32_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[4:7], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB25_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_sub_i32_e32 v3, vcc, v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub v2, v[0:1], s[4:7], 0 addr64 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[4:7], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB25_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i32_noret_offset:			; VI-LABEL: global_atomic_sub_i32_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB25_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_sub_u32_e32 v3, vcc, v4, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB25_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i32_noret_offset:			; GFX9-LABEL: global_atomic_sub_i32_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub v[0:1], v2, off offset:16			; GFX9-NEXT: global_load_dword v4, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB25_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_sub_u32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB25_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw sub ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw sub ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @global_atomic_sub_i32_ret(ptr addrspace(1) %ptr, i32 %in) {			define i32 @global_atomic_sub_i32_ret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_sub_i32_ret:			; SI-LABEL: global_atomic_sub_i32_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB26_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_sub_i32_e32 v4, vcc, v5, v2
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub v2, v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB26_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i32_ret:			; VI-LABEL: global_atomic_sub_i32_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; VI-NEXT: flat_load_dword v3, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB26_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: v_sub_u32_e32 v3, vcc, v4, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB26_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v0, v3
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i32_ret:			; GFX9-LABEL: global_atomic_sub_i32_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub v0, v[0:1], v2, off glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB26_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_sub_u32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB26_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw sub ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw sub ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @global_atomic_sub_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {			define i32 @global_atomic_sub_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_sub_i32_ret_offset:			; SI-LABEL: global_atomic_sub_i32_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[4:7], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB27_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_sub_i32_e32 v4, vcc, v5, v2
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub v2, v[0:1], s[4:7], 0 addr64 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[4:7], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB27_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i32_ret_offset:			; VI-LABEL: global_atomic_sub_i32_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v0, v[3:4]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB27_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_sub_u32_e32 v0, vcc, v1, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB27_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i32_ret_offset:			; GFX9-LABEL: global_atomic_sub_i32_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub v0, v[0:1], v2, off offset:16 glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB27_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_sub_u32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB27_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw sub ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw sub ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @global_atomic_sub_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_sub_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_sub_i32_noret_scalar:			; SI-LABEL: global_atomic_sub_i32_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB28_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_subrev_i32_e32 v1, vcc, s34, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub v1, off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB28_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i32_noret_scalar:			; VI-LABEL: global_atomic_sub_i32_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB28_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_subrev_u32_e32 v0, vcc, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s5
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB28_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i32_noret_scalar:			; GFX9-LABEL: global_atomic_sub_i32_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB28_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_subrev_u32_e32 v0, s6, v1
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub v0, v1, s[4:5]			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB28_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw sub ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw sub ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_sub_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_sub_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_sub_i32_noret_offset_scalar:			; SI-LABEL: global_atomic_sub_i32_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB29_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_subrev_i32_e32 v1, vcc, s34, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub v1, off, s[4:7], 0 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB29_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i32_noret_offset_scalar:			; VI-LABEL: global_atomic_sub_i32_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s34, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB29_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v2, s34
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_subrev_u32_e32 v0, vcc, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s35
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB29_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i32_noret_offset_scalar:			; GFX9-LABEL: global_atomic_sub_i32_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB29_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_subrev_u32_e32 v0, s6, v1
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub v0, v1, s[4:5] offset:16			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB29_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw sub ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw sub ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @global_atomic_sub_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_sub_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_sub_i32_ret_scalar:			; SI-LABEL: global_atomic_sub_i32_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB30_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_subrev_i32_e32 v3, vcc, s34, v4
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub v0, off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB30_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i32_ret_scalar:			; VI-LABEL: global_atomic_sub_i32_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB30_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: v_mov_b32_e32 v3, s5
				; VI-NEXT: v_subrev_u32_e32 v0, vcc, s6, v1
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB30_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i32_ret_scalar:			; GFX9-LABEL: global_atomic_sub_i32_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB30_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_subrev_u32_e32 v2, s6, v3
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub v0, v0, v1, s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB30_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw sub ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw sub ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @global_atomic_sub_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_sub_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_sub_i32_ret_offset_scalar:			; SI-LABEL: global_atomic_sub_i32_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB31_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_subrev_i32_e32 v3, vcc, s34, v4
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub v0, off, s[4:7], 0 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB31_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i32_ret_offset_scalar:			; VI-LABEL: global_atomic_sub_i32_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s34, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB31_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_mov_b32_e32 v2, s34
				; VI-NEXT: v_mov_b32_e32 v3, s35
				; VI-NEXT: v_subrev_u32_e32 v0, vcc, s6, v1
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB31_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i32_ret_offset_scalar:			; GFX9-LABEL: global_atomic_sub_i32_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB31_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_subrev_u32_e32 v2, s6, v3
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub v0, v0, v1, s[4:5] offset:16 glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB31_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw sub ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw sub ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw and			; atomicrmw and
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @global_atomic_and_i32_noret(ptr addrspace(1) %ptr, i32 %in) {			define void @global_atomic_and_i32_noret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_and_i32_noret:			; SI-LABEL: global_atomic_and_i32_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB32_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_and_b32_e32 v3, v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and v2, v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB32_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i32_noret:			; VI-LABEL: global_atomic_and_i32_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and v[0:1], v2			; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB32_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_and_b32_e32 v3, v4, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB32_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i32_noret:			; GFX9-LABEL: global_atomic_and_i32_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and v[0:1], v2, off			; GFX9-NEXT: global_load_dword v4, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB32_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_and_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB32_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw and ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw and ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_and_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {			define void @global_atomic_and_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_and_i32_noret_offset:			; SI-LABEL: global_atomic_and_i32_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[4:7], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB33_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_and_b32_e32 v3, v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and v2, v[0:1], s[4:7], 0 addr64 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[4:7], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB33_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i32_noret_offset:			; VI-LABEL: global_atomic_and_i32_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB33_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_and_b32_e32 v3, v4, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB33_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i32_noret_offset:			; GFX9-LABEL: global_atomic_and_i32_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and v[0:1], v2, off offset:16			; GFX9-NEXT: global_load_dword v4, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB33_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_and_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB33_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw and ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw and ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @global_atomic_and_i32_ret(ptr addrspace(1) %ptr, i32 %in) {			define i32 @global_atomic_and_i32_ret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_and_i32_ret:			; SI-LABEL: global_atomic_and_i32_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB34_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_and_b32_e32 v4, v5, v2
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and v2, v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB34_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i32_ret:			; VI-LABEL: global_atomic_and_i32_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; VI-NEXT: flat_load_dword v3, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB34_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: v_and_b32_e32 v3, v4, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB34_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v0, v3
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i32_ret:			; GFX9-LABEL: global_atomic_and_i32_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and v0, v[0:1], v2, off glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB34_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_and_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB34_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw and ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw and ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @global_atomic_and_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {			define i32 @global_atomic_and_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_and_i32_ret_offset:			; SI-LABEL: global_atomic_and_i32_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[4:7], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB35_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_and_b32_e32 v4, v5, v2
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and v2, v[0:1], s[4:7], 0 addr64 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[4:7], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB35_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i32_ret_offset:			; VI-LABEL: global_atomic_and_i32_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v0, v[3:4]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB35_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_and_b32_e32 v0, v1, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB35_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i32_ret_offset:			; GFX9-LABEL: global_atomic_and_i32_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and v0, v[0:1], v2, off offset:16 glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB35_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_and_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB35_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw and ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw and ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @global_atomic_and_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_and_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_and_i32_noret_scalar:			; SI-LABEL: global_atomic_and_i32_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB36_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_and_b32_e32 v1, s34, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and v1, off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB36_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i32_noret_scalar:			; VI-LABEL: global_atomic_and_i32_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB36_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_and_b32_e32 v0, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s5
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB36_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i32_noret_scalar:			; GFX9-LABEL: global_atomic_and_i32_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB36_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_and_b32_e32 v0, s6, v1
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and v0, v1, s[4:5]			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB36_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw and ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw and ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_and_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_and_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_and_i32_noret_offset_scalar:			; SI-LABEL: global_atomic_and_i32_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB37_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_and_b32_e32 v1, s34, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and v1, off, s[4:7], 0 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB37_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i32_noret_offset_scalar:			; VI-LABEL: global_atomic_and_i32_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s34, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB37_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v2, s34
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_and_b32_e32 v0, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s35
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB37_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i32_noret_offset_scalar:			; GFX9-LABEL: global_atomic_and_i32_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB37_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_and_b32_e32 v0, s6, v1
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and v0, v1, s[4:5] offset:16			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB37_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw and ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw and ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @global_atomic_and_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_and_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_and_i32_ret_scalar:			; SI-LABEL: global_atomic_and_i32_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB38_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_and_b32_e32 v3, s34, v4
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and v0, off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB38_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i32_ret_scalar:			; VI-LABEL: global_atomic_and_i32_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB38_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: v_mov_b32_e32 v3, s5
				; VI-NEXT: v_and_b32_e32 v0, s6, v1
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB38_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i32_ret_scalar:			; GFX9-LABEL: global_atomic_and_i32_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB38_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_and_b32_e32 v2, s6, v3
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and v0, v0, v1, s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB38_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw and ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw and ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @global_atomic_and_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_and_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_and_i32_ret_offset_scalar:			; SI-LABEL: global_atomic_and_i32_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB39_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_and_b32_e32 v3, s34, v4
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and v0, off, s[4:7], 0 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB39_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i32_ret_offset_scalar:			; VI-LABEL: global_atomic_and_i32_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s34, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB39_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_mov_b32_e32 v2, s34
				; VI-NEXT: v_mov_b32_e32 v3, s35
				; VI-NEXT: v_and_b32_e32 v0, s6, v1
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB39_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i32_ret_offset_scalar:			; GFX9-LABEL: global_atomic_and_i32_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB39_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_and_b32_e32 v2, s6, v3
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and v0, v0, v1, s[4:5] offset:16 glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB39_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw and ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw and ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw nand			; atomicrmw nand
	▲ Show 20 Lines • Show All 733 Lines • ▼ Show 20 Lines
	define void @global_atomic_or_i32_noret(ptr addrspace(1) %ptr, i32 %in) {			define void @global_atomic_or_i32_noret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_or_i32_noret:			; SI-LABEL: global_atomic_or_i32_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB48_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_or_b32_e32 v3, v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or v2, v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB48_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i32_noret:			; VI-LABEL: global_atomic_or_i32_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or v[0:1], v2			; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB48_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_or_b32_e32 v3, v4, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB48_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i32_noret:			; GFX9-LABEL: global_atomic_or_i32_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or v[0:1], v2, off			; GFX9-NEXT: global_load_dword v4, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB48_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_or_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB48_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw or ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw or ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_or_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {			define void @global_atomic_or_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_or_i32_noret_offset:			; SI-LABEL: global_atomic_or_i32_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[4:7], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB49_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_or_b32_e32 v3, v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or v2, v[0:1], s[4:7], 0 addr64 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[4:7], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB49_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i32_noret_offset:			; VI-LABEL: global_atomic_or_i32_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB49_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_or_b32_e32 v3, v4, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB49_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i32_noret_offset:			; GFX9-LABEL: global_atomic_or_i32_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or v[0:1], v2, off offset:16			; GFX9-NEXT: global_load_dword v4, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB49_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_or_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB49_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw or ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw or ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @global_atomic_or_i32_ret(ptr addrspace(1) %ptr, i32 %in) {			define i32 @global_atomic_or_i32_ret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_or_i32_ret:			; SI-LABEL: global_atomic_or_i32_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB50_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_or_b32_e32 v4, v5, v2
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or v2, v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB50_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i32_ret:			; VI-LABEL: global_atomic_or_i32_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; VI-NEXT: flat_load_dword v3, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB50_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: v_or_b32_e32 v3, v4, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB50_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v0, v3
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i32_ret:			; GFX9-LABEL: global_atomic_or_i32_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or v0, v[0:1], v2, off glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB50_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_or_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB50_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw or ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw or ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @global_atomic_or_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {			define i32 @global_atomic_or_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_or_i32_ret_offset:			; SI-LABEL: global_atomic_or_i32_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[4:7], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB51_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_or_b32_e32 v4, v5, v2
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or v2, v[0:1], s[4:7], 0 addr64 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[4:7], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB51_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i32_ret_offset:			; VI-LABEL: global_atomic_or_i32_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v0, v[3:4]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB51_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_or_b32_e32 v0, v1, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB51_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i32_ret_offset:			; GFX9-LABEL: global_atomic_or_i32_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or v0, v[0:1], v2, off offset:16 glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB51_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_or_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB51_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw or ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw or ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @global_atomic_or_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_or_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_or_i32_noret_scalar:			; SI-LABEL: global_atomic_or_i32_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB52_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_or_b32_e32 v1, s34, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or v1, off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB52_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i32_noret_scalar:			; VI-LABEL: global_atomic_or_i32_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB52_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_or_b32_e32 v0, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s5
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB52_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i32_noret_scalar:			; GFX9-LABEL: global_atomic_or_i32_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB52_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_or_b32_e32 v0, s6, v1
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or v0, v1, s[4:5]			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB52_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw or ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw or ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_or_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_or_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_or_i32_noret_offset_scalar:			; SI-LABEL: global_atomic_or_i32_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB53_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_or_b32_e32 v1, s34, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or v1, off, s[4:7], 0 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB53_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i32_noret_offset_scalar:			; VI-LABEL: global_atomic_or_i32_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s34, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB53_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v2, s34
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_or_b32_e32 v0, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s35
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB53_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i32_noret_offset_scalar:			; GFX9-LABEL: global_atomic_or_i32_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB53_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_or_b32_e32 v0, s6, v1
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or v0, v1, s[4:5] offset:16			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB53_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw or ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw or ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @global_atomic_or_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_or_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_or_i32_ret_scalar:			; SI-LABEL: global_atomic_or_i32_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB54_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_or_b32_e32 v3, s34, v4
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or v0, off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB54_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i32_ret_scalar:			; VI-LABEL: global_atomic_or_i32_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB54_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: v_mov_b32_e32 v3, s5
				; VI-NEXT: v_or_b32_e32 v0, s6, v1
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB54_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i32_ret_scalar:			; GFX9-LABEL: global_atomic_or_i32_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB54_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_or_b32_e32 v2, s6, v3
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or v0, v0, v1, s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB54_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw or ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw or ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @global_atomic_or_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_or_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_or_i32_ret_offset_scalar:			; SI-LABEL: global_atomic_or_i32_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB55_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_or_b32_e32 v3, s34, v4
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or v0, off, s[4:7], 0 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB55_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i32_ret_offset_scalar:			; VI-LABEL: global_atomic_or_i32_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s34, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB55_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_mov_b32_e32 v2, s34
				; VI-NEXT: v_mov_b32_e32 v3, s35
				; VI-NEXT: v_or_b32_e32 v0, s6, v1
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB55_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i32_ret_offset_scalar:			; GFX9-LABEL: global_atomic_or_i32_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB55_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_or_b32_e32 v2, s6, v3
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or v0, v0, v1, s[4:5] offset:16 glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB55_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw or ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw or ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw xor			; atomicrmw xor
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @global_atomic_xor_i32_noret(ptr addrspace(1) %ptr, i32 %in) {			define void @global_atomic_xor_i32_noret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_xor_i32_noret:			; SI-LABEL: global_atomic_xor_i32_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB56_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_xor_b32_e32 v3, v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor v2, v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB56_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i32_noret:			; VI-LABEL: global_atomic_xor_i32_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor v[0:1], v2			; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB56_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_xor_b32_e32 v3, v4, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB56_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i32_noret:			; GFX9-LABEL: global_atomic_xor_i32_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor v[0:1], v2, off			; GFX9-NEXT: global_load_dword v4, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB56_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_xor_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB56_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw xor ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw xor ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_xor_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {			define void @global_atomic_xor_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_xor_i32_noret_offset:			; SI-LABEL: global_atomic_xor_i32_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[4:7], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB57_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_xor_b32_e32 v3, v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor v2, v[0:1], s[4:7], 0 addr64 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[4:7], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB57_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i32_noret_offset:			; VI-LABEL: global_atomic_xor_i32_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB57_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_xor_b32_e32 v3, v4, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB57_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i32_noret_offset:			; GFX9-LABEL: global_atomic_xor_i32_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor v[0:1], v2, off offset:16			; GFX9-NEXT: global_load_dword v4, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB57_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_xor_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB57_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw xor ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw xor ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @global_atomic_xor_i32_ret(ptr addrspace(1) %ptr, i32 %in) {			define i32 @global_atomic_xor_i32_ret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_xor_i32_ret:			; SI-LABEL: global_atomic_xor_i32_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB58_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_xor_b32_e32 v4, v5, v2
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor v2, v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB58_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i32_ret:			; VI-LABEL: global_atomic_xor_i32_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; VI-NEXT: flat_load_dword v3, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB58_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: v_xor_b32_e32 v3, v4, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB58_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v0, v3
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i32_ret:			; GFX9-LABEL: global_atomic_xor_i32_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor v0, v[0:1], v2, off glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB58_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_xor_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB58_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw xor ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw xor ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @global_atomic_xor_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {			define i32 @global_atomic_xor_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_xor_i32_ret_offset:			; SI-LABEL: global_atomic_xor_i32_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[4:7], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB59_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_xor_b32_e32 v4, v5, v2
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor v2, v[0:1], s[4:7], 0 addr64 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[4:7], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB59_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i32_ret_offset:			; VI-LABEL: global_atomic_xor_i32_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v0, v[3:4]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB59_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_xor_b32_e32 v0, v1, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB59_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i32_ret_offset:			; GFX9-LABEL: global_atomic_xor_i32_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor v0, v[0:1], v2, off offset:16 glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB59_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_xor_b32_e32 v3, v4, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB59_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw xor ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw xor ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @global_atomic_xor_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_xor_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_xor_i32_noret_scalar:			; SI-LABEL: global_atomic_xor_i32_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB60_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_xor_b32_e32 v1, s34, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor v1, off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB60_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i32_noret_scalar:			; VI-LABEL: global_atomic_xor_i32_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB60_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_xor_b32_e32 v0, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s5
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB60_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i32_noret_scalar:			; GFX9-LABEL: global_atomic_xor_i32_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB60_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_xor_b32_e32 v0, s6, v1
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor v0, v1, s[4:5]			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB60_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw xor ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw xor ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_xor_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_xor_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_xor_i32_noret_offset_scalar:			; SI-LABEL: global_atomic_xor_i32_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB61_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_xor_b32_e32 v1, s34, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor v1, off, s[4:7], 0 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB61_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i32_noret_offset_scalar:			; VI-LABEL: global_atomic_xor_i32_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s34, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB61_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v2, s34
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_xor_b32_e32 v0, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s35
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB61_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i32_noret_offset_scalar:			; GFX9-LABEL: global_atomic_xor_i32_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB61_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_xor_b32_e32 v0, s6, v1
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor v0, v1, s[4:5] offset:16			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB61_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw xor ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw xor ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @global_atomic_xor_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_xor_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_xor_i32_ret_scalar:			; SI-LABEL: global_atomic_xor_i32_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB62_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_xor_b32_e32 v3, s34, v4
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor v0, off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB62_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i32_ret_scalar:			; VI-LABEL: global_atomic_xor_i32_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB62_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: v_mov_b32_e32 v3, s5
				; VI-NEXT: v_xor_b32_e32 v0, s6, v1
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB62_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i32_ret_scalar:			; GFX9-LABEL: global_atomic_xor_i32_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB62_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_xor_b32_e32 v2, s6, v3
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor v0, v0, v1, s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB62_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw xor ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw xor ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @global_atomic_xor_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_xor_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_xor_i32_ret_offset_scalar:			; SI-LABEL: global_atomic_xor_i32_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB63_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_xor_b32_e32 v3, s34, v4
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor v0, off, s[4:7], 0 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB63_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i32_ret_offset_scalar:			; VI-LABEL: global_atomic_xor_i32_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s34, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB63_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_mov_b32_e32 v2, s34
				; VI-NEXT: v_mov_b32_e32 v3, s35
				; VI-NEXT: v_xor_b32_e32 v0, s6, v1
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB63_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i32_ret_offset_scalar:			; GFX9-LABEL: global_atomic_xor_i32_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB63_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_xor_b32_e32 v2, s6, v3
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor v0, v0, v1, s[4:5] offset:16 glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB63_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw xor ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw xor ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw max			; atomicrmw max
	▲ Show 20 Lines • Show All 4,015 Lines • ▼ Show 20 Lines
	define void @global_atomic_uinc_wrap_i32_noret(ptr addrspace(1) %ptr, i32 %in) {			define void @global_atomic_uinc_wrap_i32_noret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i32_noret:			; SI-LABEL: global_atomic_uinc_wrap_i32_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB107_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v3, vcc, 1, v4
				; SI-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; SI-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc v2, v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB107_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i32_noret:			; VI-LABEL: global_atomic_uinc_wrap_i32_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc v[0:1], v2			; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB107_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v3, vcc, 1, v4
				; VI-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; VI-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB107_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i32_noret:			; GFX9-LABEL: global_atomic_uinc_wrap_i32_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc v[0:1], v2, off			; GFX9-NEXT: global_load_dword v4, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB107_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_add_u32_e32 v3, 1, v4
				; GFX9-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GFX9-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB107_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_uinc_wrap_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {			define void @global_atomic_uinc_wrap_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i32_noret_offset:			; SI-LABEL: global_atomic_uinc_wrap_i32_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[4:7], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB108_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v3, vcc, 1, v4
				; SI-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; SI-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc v2, v[0:1], s[4:7], 0 addr64 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[4:7], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB108_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i32_noret_offset:			; VI-LABEL: global_atomic_uinc_wrap_i32_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB108_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v3, vcc, 1, v4
				; VI-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; VI-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB108_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i32_noret_offset:			; GFX9-LABEL: global_atomic_uinc_wrap_i32_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc v[0:1], v2, off offset:16			; GFX9-NEXT: global_load_dword v4, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB108_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_add_u32_e32 v3, 1, v4
				; GFX9-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GFX9-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB108_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @global_atomic_uinc_wrap_i32_ret(ptr addrspace(1) %ptr, i32 %in) {			define i32 @global_atomic_uinc_wrap_i32_ret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i32_ret:			; SI-LABEL: global_atomic_uinc_wrap_i32_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB109_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_add_i32_e32 v3, vcc, 1, v5
				; SI-NEXT: v_cmp_lt_u32_e32 vcc, v5, v2
				; SI-NEXT: v_cndmask_b32_e32 v4, 0, v3, vcc
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc v2, v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB109_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i32_ret:			; VI-LABEL: global_atomic_uinc_wrap_i32_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; VI-NEXT: flat_load_dword v3, v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB109_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: v_add_u32_e32 v3, vcc, 1, v4
				; VI-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; VI-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB109_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v0, v3
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i32_ret:			; GFX9-LABEL: global_atomic_uinc_wrap_i32_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc v0, v[0:1], v2, off glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB109_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_add_u32_e32 v3, 1, v4
				; GFX9-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GFX9-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB109_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @global_atomic_uinc_wrap_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {			define i32 @global_atomic_uinc_wrap_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i32_ret_offset:			; SI-LABEL: global_atomic_uinc_wrap_i32_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[4:7], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB110_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_add_i32_e32 v3, vcc, 1, v5
				; SI-NEXT: v_cmp_lt_u32_e32 vcc, v5, v2
				; SI-NEXT: v_cndmask_b32_e32 v4, 0, v3, vcc
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc v2, v[0:1], s[4:7], 0 addr64 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[4:7], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB110_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i32_ret_offset:			; VI-LABEL: global_atomic_uinc_wrap_i32_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v0, v[3:4]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB110_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v1
				; VI-NEXT: v_cmp_lt_u32_e32 vcc, v1, v2
				; VI-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB110_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i32_ret_offset:			; GFX9-LABEL: global_atomic_uinc_wrap_i32_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc v0, v[0:1], v2, off offset:16 glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB110_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_add_u32_e32 v3, 1, v4
				; GFX9-NEXT: v_cmp_lt_u32_e32 vcc, v4, v2
				; GFX9-NEXT: v_cndmask_b32_e32 v3, 0, v3, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB110_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @global_atomic_uinc_wrap_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_uinc_wrap_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i32_noret_scalar:			; SI-LABEL: global_atomic_uinc_wrap_i32_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB111_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v1, vcc, 1, v2
				; SI-NEXT: v_cmp_gt_u32_e32 vcc, s34, v2
				; SI-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc v1, off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB111_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i32_noret_scalar:			; VI-LABEL: global_atomic_uinc_wrap_i32_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB111_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v1
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s5
				; VI-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB111_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i32_noret_scalar:			; GFX9-LABEL: global_atomic_uinc_wrap_i32_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB111_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_add_u32_e32 v0, 1, v1
				; GFX9-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GFX9-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc v0, v1, s[4:5]			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB111_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_uinc_wrap_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_uinc_wrap_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i32_noret_offset_scalar:			; SI-LABEL: global_atomic_uinc_wrap_i32_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB112_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v1, vcc, 1, v2
				; SI-NEXT: v_cmp_gt_u32_e32 vcc, s34, v2
				; SI-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc v1, off, s[4:7], 0 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB112_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i32_noret_offset_scalar:			; VI-LABEL: global_atomic_uinc_wrap_i32_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s34, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB112_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v1
				; VI-NEXT: v_mov_b32_e32 v2, s34
				; VI-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s35
				; VI-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB112_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i32_noret_offset_scalar:			; GFX9-LABEL: global_atomic_uinc_wrap_i32_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB112_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_add_u32_e32 v0, 1, v1
				; GFX9-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; GFX9-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc v0, v1, s[4:5] offset:16			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB112_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @global_atomic_uinc_wrap_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_uinc_wrap_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i32_ret_scalar:			; SI-LABEL: global_atomic_uinc_wrap_i32_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB113_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_add_i32_e32 v0, vcc, 1, v4
				; SI-NEXT: v_cmp_gt_u32_e32 vcc, s34, v4
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_cndmask_b32_e32 v3, 0, v0, vcc
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc v0, off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB113_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i32_ret_scalar:			; VI-LABEL: global_atomic_uinc_wrap_i32_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB113_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v1
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s5
				; VI-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB113_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i32_ret_scalar:			; GFX9-LABEL: global_atomic_uinc_wrap_i32_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB113_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_add_u32_e32 v0, 1, v3
				; GFX9-NEXT: v_cmp_gt_u32_e32 vcc, s6, v3
				; GFX9-NEXT: v_cndmask_b32_e32 v2, 0, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc v0, v0, v1, s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB113_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @global_atomic_uinc_wrap_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_uinc_wrap_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i32_ret_offset_scalar:			; SI-LABEL: global_atomic_uinc_wrap_i32_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB114_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_add_i32_e32 v0, vcc, 1, v4
				; SI-NEXT: v_cmp_gt_u32_e32 vcc, s34, v4
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_cndmask_b32_e32 v3, 0, v0, vcc
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc v0, off, s[4:7], 0 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB114_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i32_ret_offset_scalar:			; VI-LABEL: global_atomic_uinc_wrap_i32_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s34, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB114_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v1
				; VI-NEXT: v_mov_b32_e32 v2, s34
				; VI-NEXT: v_cmp_gt_u32_e32 vcc, s6, v1
				; VI-NEXT: v_mov_b32_e32 v3, s35
				; VI-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB114_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i32_ret_offset_scalar:			; GFX9-LABEL: global_atomic_uinc_wrap_i32_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB114_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_add_u32_e32 v0, 1, v3
				; GFX9-NEXT: v_cmp_gt_u32_e32 vcc, s6, v3
				; GFX9-NEXT: v_cndmask_b32_e32 v2, 0, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc v0, v0, v1, s[4:5] offset:16 glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB114_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw udec_wrap			; atomicrmw udec_wrap
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @global_atomic_udec_wrap_i32_noret(ptr addrspace(1) %ptr, i32 %in) {			define void @global_atomic_udec_wrap_i32_noret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_udec_wrap_i32_noret:			; SI-LABEL: global_atomic_udec_wrap_i32_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s10, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s11, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s8, s10
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s9, s10
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[8:11], 0 addr64
				; SI-NEXT: s_mov_b64 s[6:7], 0
				; SI-NEXT: .LBB115_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v3, vcc, -1, v4
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; SI-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; SI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; SI-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec v2, v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[8:11], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; SI-NEXT: s_cbranch_execnz .LBB115_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[6:7]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i32_noret:			; VI-LABEL: global_atomic_udec_wrap_i32_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec v[0:1], v2			; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[6:7], 0
				; VI-NEXT: .LBB115_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v3, vcc, -1, v4
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; VI-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; VI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; VI-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; VI-NEXT: s_cbranch_execnz .LBB115_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[6:7]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i32_noret:			; GFX9-LABEL: global_atomic_udec_wrap_i32_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec v[0:1], v2, off			; GFX9-NEXT: global_load_dword v4, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[6:7], 0
				; GFX9-NEXT: .LBB115_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GFX9-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GFX9-NEXT: v_add_u32_e32 v3, -1, v4
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GFX9-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GFX9-NEXT: s_cbranch_execnz .LBB115_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[6:7]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_udec_wrap_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {			define void @global_atomic_udec_wrap_i32_noret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_udec_wrap_i32_noret_offset:			; SI-LABEL: global_atomic_udec_wrap_i32_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s10, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s11, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s8, s10
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s9, s10
				; SI-NEXT: buffer_load_dword v4, v[0:1], s[8:11], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[6:7], 0
				; SI-NEXT: .LBB116_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v3, vcc, -1, v4
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; SI-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; SI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; SI-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v6, v4
				; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec v2, v[0:1], s[4:7], 0 addr64 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[5:6], v[0:1], s[8:11], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v5, v4
				; SI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; SI-NEXT: v_mov_b32_e32 v4, v5
				; SI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; SI-NEXT: s_cbranch_execnz .LBB116_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[6:7]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i32_noret_offset:			; VI-LABEL: global_atomic_udec_wrap_i32_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v4, v[0:1]
				; VI-NEXT: s_mov_b64 s[6:7], 0
				; VI-NEXT: .LBB116_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v3, vcc, -1, v4
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; VI-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; VI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; VI-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; VI-NEXT: s_cbranch_execnz .LBB116_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[6:7]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i32_noret_offset:			; GFX9-LABEL: global_atomic_udec_wrap_i32_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec v[0:1], v2, off offset:16			; GFX9-NEXT: global_load_dword v4, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[6:7], 0
				; GFX9-NEXT: .LBB116_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GFX9-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GFX9-NEXT: v_add_u32_e32 v3, -1, v4
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GFX9-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GFX9-NEXT: s_cbranch_execnz .LBB116_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[6:7]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define i32 @global_atomic_udec_wrap_i32_ret(ptr addrspace(1) %ptr, i32 %in) {			define i32 @global_atomic_udec_wrap_i32_ret(ptr addrspace(1) %ptr, i32 %in) {
	; SI-LABEL: global_atomic_udec_wrap_i32_ret:			; SI-LABEL: global_atomic_udec_wrap_i32_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s10, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s11, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s8, s10
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s9, s10
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[8:11], 0 addr64
				; SI-NEXT: s_mov_b64 s[6:7], 0
				; SI-NEXT: .LBB117_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_add_i32_e32 v3, vcc, -1, v5
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v5
				; SI-NEXT: v_cmp_gt_u32_e64 s[4:5], v5, v2
				; SI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; SI-NEXT: v_cndmask_b32_e32 v4, v3, v2, vcc
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec v2, v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[8:11], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; SI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; SI-NEXT: s_cbranch_execnz .LBB117_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[6:7]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i32_ret:			; VI-LABEL: global_atomic_udec_wrap_i32_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; VI-NEXT: flat_load_dword v3, v[0:1]
				; VI-NEXT: s_mov_b64 s[6:7], 0
				; VI-NEXT: .LBB117_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v4, v3
				; VI-NEXT: v_add_u32_e32 v3, vcc, -1, v4
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; VI-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; VI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; VI-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap v3, v[0:1], v[3:4] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; VI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; VI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; VI-NEXT: s_cbranch_execnz .LBB117_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[6:7]
				; VI-NEXT: v_mov_b32_e32 v0, v3
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i32_ret:			; GFX9-LABEL: global_atomic_udec_wrap_i32_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec v0, v[0:1], v2, off glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[6:7], 0
				; GFX9-NEXT: .LBB117_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GFX9-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GFX9-NEXT: v_add_u32_e32 v3, -1, v4
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GFX9-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GFX9-NEXT: s_cbranch_execnz .LBB117_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw udec_wrap ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw udec_wrap ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define i32 @global_atomic_udec_wrap_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {			define i32 @global_atomic_udec_wrap_i32_ret_offset(ptr addrspace(1) %out, i32 %in) {
	; SI-LABEL: global_atomic_udec_wrap_i32_ret_offset:			; SI-LABEL: global_atomic_udec_wrap_i32_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s10, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s11, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s8, s10
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s9, s10
				; SI-NEXT: buffer_load_dword v3, v[0:1], s[8:11], 0 addr64 offset:16
				; SI-NEXT: s_mov_b64 s[6:7], 0
				; SI-NEXT: .LBB118_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_add_i32_e32 v3, vcc, -1, v5
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v5
				; SI-NEXT: v_cmp_gt_u32_e64 s[4:5], v5, v2
				; SI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; SI-NEXT: v_cndmask_b32_e32 v4, v3, v2, vcc
				; SI-NEXT: v_mov_b32_e32 v3, v4
				; SI-NEXT: v_mov_b32_e32 v4, v5
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec v2, v[0:1], s[4:7], 0 addr64 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[3:4], v[0:1], s[8:11], 0 addr64 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v5
				; SI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; SI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; SI-NEXT: s_cbranch_execnz .LBB118_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[6:7]
				; SI-NEXT: v_mov_b32_e32 v0, v3
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i32_ret_offset:			; VI-LABEL: global_atomic_udec_wrap_i32_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 16, v0			; VI-NEXT: v_add_u32_e32 v3, vcc, 16, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v4, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dword v0, v[3:4]
				; VI-NEXT: s_mov_b64 s[6:7], 0
				; VI-NEXT: .LBB118_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_add_u32_e32 v0, vcc, -1, v1
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; VI-NEXT: v_cmp_gt_u32_e64 s[4:5], v1, v2
				; VI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; VI-NEXT: v_cndmask_b32_e32 v0, v0, v2, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[3:4], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; VI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; VI-NEXT: s_cbranch_execnz .LBB118_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[6:7]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i32_ret_offset:			; GFX9-LABEL: global_atomic_udec_wrap_i32_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec v0, v[0:1], v2, off offset:16 glc			; GFX9-NEXT: global_load_dword v3, v[0:1], off offset:16
				; GFX9-NEXT: s_mov_b64 s[6:7], 0
				; GFX9-NEXT: .LBB118_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v4, v3
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; GFX9-NEXT: v_cmp_gt_u32_e64 s[4:5], v4, v2
				; GFX9-NEXT: v_add_u32_e32 v3, -1, v4
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GFX9-NEXT: v_cndmask_b32_e32 v3, v3, v2, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap v3, v[0:1], v[3:4], off offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v3, v4
				; GFX9-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; GFX9-NEXT: s_cbranch_execnz .LBB118_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v0, v3
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx void @global_atomic_udec_wrap_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_udec_wrap_i32_noret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_udec_wrap_i32_noret_scalar:			; SI-LABEL: global_atomic_udec_wrap_i32_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[38:39], 0
				; SI-NEXT: .LBB119_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v1, vcc, -1, v2
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v2
				; SI-NEXT: v_cmp_lt_u32_e64 s[36:37], s34, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v3, s34
				; SI-NEXT: s_or_b64 vcc, vcc, s[36:37]
				; SI-NEXT: v_cndmask_b32_e32 v1, v1, v3, vcc
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec v1, off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; SI-NEXT: s_cbranch_execnz .LBB119_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[38:39]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i32_noret_scalar:			; VI-LABEL: global_atomic_udec_wrap_i32_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB119_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v0, vcc, -1, v1
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; VI-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; VI-NEXT: v_mov_b32_e32 v4, s6
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v3, s5
				; VI-NEXT: v_cndmask_b32_e32 v0, v0, v4, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB119_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i32_noret_scalar:			; GFX9-LABEL: global_atomic_udec_wrap_i32_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[36:37], 0
				; GFX9-NEXT: .LBB119_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GFX9-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GFX9-NEXT: v_add_u32_e32 v0, -1, v1
				; GFX9-NEXT: v_mov_b32_e32 v3, s6
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GFX9-NEXT: v_cndmask_b32_e32 v0, v0, v3, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec v0, v1, s[4:5]			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GFX9-NEXT: s_cbranch_execnz .LBB119_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[36:37]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %ptr, i32 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %ptr, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_udec_wrap_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx void @global_atomic_udec_wrap_i32_noret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_udec_wrap_i32_noret_offset_scalar:			; SI-LABEL: global_atomic_udec_wrap_i32_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[38:39], 0
				; SI-NEXT: .LBB120_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v1, vcc, -1, v2
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v2
				; SI-NEXT: v_cmp_lt_u32_e64 s[36:37], s34, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v3, s34
				; SI-NEXT: s_or_b64 vcc, vcc, s[36:37]
				; SI-NEXT: v_cndmask_b32_e32 v1, v1, v3, vcc
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v3, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec v1, off, s[4:7], 0 offset:16			; SI-NEXT: buffer_atomic_cmpswap v[3:4], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v3, v2
				; SI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; SI-NEXT: s_cbranch_execnz .LBB120_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[38:39]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i32_noret_offset_scalar:			; VI-LABEL: global_atomic_udec_wrap_i32_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s36, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s37, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s36
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s37
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v1, v[0:1]
				; VI-NEXT: s_mov_b64 s[38:39], 0
				; VI-NEXT: .LBB120_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v0, vcc, -1, v1
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; VI-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; VI-NEXT: v_mov_b32_e32 v4, s6
				; VI-NEXT: v_mov_b32_e32 v2, s36
				; VI-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v3, s37
				; VI-NEXT: v_cndmask_b32_e32 v0, v0, v4, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec v[0:1], v2			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; VI-NEXT: s_cbranch_execnz .LBB120_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[38:39]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i32_noret_offset_scalar:			; GFX9-LABEL: global_atomic_udec_wrap_i32_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v1, v2, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[36:37], 0
				; GFX9-NEXT: .LBB120_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; GFX9-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; GFX9-NEXT: v_add_u32_e32 v0, -1, v1
				; GFX9-NEXT: v_mov_b32_e32 v3, s6
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GFX9-NEXT: v_cndmask_b32_e32 v0, v0, v3, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec v0, v1, s[4:5] offset:16			; GFX9-NEXT: global_atomic_cmpswap v0, v2, v[0:1], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; GFX9-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GFX9-NEXT: v_mov_b32_e32 v1, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GFX9-NEXT: s_cbranch_execnz .LBB120_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[36:37]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i32 @global_atomic_udec_wrap_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_udec_wrap_i32_ret_scalar(ptr addrspace(1) inreg %ptr, i32 inreg %in) {
	; SI-LABEL: global_atomic_udec_wrap_i32_ret_scalar:			; SI-LABEL: global_atomic_udec_wrap_i32_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[38:39], 0
				; SI-NEXT: .LBB121_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_add_i32_e32 v0, vcc, -1, v4
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; SI-NEXT: v_cmp_lt_u32_e64 s[36:37], s34, v4
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v2, s34
				; SI-NEXT: s_or_b64 vcc, vcc, s[36:37]
				; SI-NEXT: v_cndmask_b32_e32 v3, v0, v2, vcc
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec v0, off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; SI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; SI-NEXT: s_cbranch_execnz .LBB121_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[38:39]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i32_ret_scalar:			; VI-LABEL: global_atomic_udec_wrap_i32_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s4			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s5			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB121_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_add_u32_e32 v4, vcc, -1, v1
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; VI-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; VI-NEXT: v_mov_b32_e32 v0, s6
				; VI-NEXT: v_mov_b32_e32 v2, s4
				; VI-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v3, s5
				; VI-NEXT: v_cndmask_b32_e32 v0, v4, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB121_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i32_ret_scalar:			; GFX9-LABEL: global_atomic_udec_wrap_i32_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[36:37], 0
				; GFX9-NEXT: .LBB121_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v3
				; GFX9-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v3
				; GFX9-NEXT: v_mov_b32_e32 v0, s6
				; GFX9-NEXT: v_add_u32_e32 v2, -1, v3
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GFX9-NEXT: v_cndmask_b32_e32 v2, v2, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec v0, v0, v1, s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GFX9-NEXT: s_cbranch_execnz .LBB121_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[36:37]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw udec_wrap ptr addrspace(1) %ptr, i32 %in seq_cst			%result = atomicrmw udec_wrap ptr addrspace(1) %ptr, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

	define amdgpu_gfx i32 @global_atomic_udec_wrap_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {			define amdgpu_gfx i32 @global_atomic_udec_wrap_i32_ret_offset_scalar(ptr addrspace(1) inreg %out, i32 inreg %in) {
	; SI-LABEL: global_atomic_udec_wrap_i32_ret_offset_scalar:			; SI-LABEL: global_atomic_udec_wrap_i32_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v1, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v1, s6, 0			; SI-NEXT: v_writelane_b32 v1, s6, 0
	; SI-NEXT: v_writelane_b32 v1, s7, 1			; SI-NEXT: v_writelane_b32 v1, s7, 1
	; SI-NEXT: s_mov_b32 s34, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s34			; SI-NEXT: buffer_load_dword v2, off, s[4:7], 0 offset:16
				; SI-NEXT: s_mov_b64 s[38:39], 0
				; SI-NEXT: .LBB122_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_add_i32_e32 v0, vcc, -1, v4
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v4
				; SI-NEXT: v_cmp_lt_u32_e64 s[36:37], s34, v4
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v2, s34
				; SI-NEXT: s_or_b64 vcc, vcc, s[36:37]
				; SI-NEXT: v_cndmask_b32_e32 v3, v0, v2, vcc
				; SI-NEXT: v_mov_b32_e32 v2, v3
				; SI-NEXT: v_mov_b32_e32 v3, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec v0, off, s[4:7], 0 offset:16 glc			; SI-NEXT: buffer_atomic_cmpswap v[2:3], off, s[4:7], 0 offset:16 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u32_e32 vcc, v2, v4
				; SI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; SI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; SI-NEXT: s_cbranch_execnz .LBB122_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[38:39]
				; SI-NEXT: v_mov_b32_e32 v0, v2
	; SI-NEXT: v_readlane_b32 s7, v1, 1			; SI-NEXT: v_readlane_b32 s7, v1, 1
	; SI-NEXT: v_readlane_b32 s6, v1, 0			; SI-NEXT: v_readlane_b32 s6, v1, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v1, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i32_ret_offset_scalar:			; VI-LABEL: global_atomic_udec_wrap_i32_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 16			; VI-NEXT: s_add_u32 s36, s4, 16
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s37, s5, 0
	; VI-NEXT: v_mov_b32_e32 v0, s34			; VI-NEXT: v_mov_b32_e32 v0, s36
	; VI-NEXT: v_mov_b32_e32 v1, s35			; VI-NEXT: v_mov_b32_e32 v1, s37
	; VI-NEXT: v_mov_b32_e32 v2, s6			; VI-NEXT: flat_load_dword v0, v[0:1]
				; VI-NEXT: s_mov_b64 s[38:39], 0
				; VI-NEXT: .LBB122_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v1, v0
				; VI-NEXT: v_add_u32_e32 v4, vcc, -1, v1
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, 0, v1
				; VI-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v1
				; VI-NEXT: v_mov_b32_e32 v0, s6
				; VI-NEXT: v_mov_b32_e32 v2, s36
				; VI-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v3, s37
				; VI-NEXT: v_cndmask_b32_e32 v0, v4, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec v0, v[0:1], v2 glc			; VI-NEXT: flat_atomic_cmpswap v0, v[2:3], v[0:1] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u32_e32 vcc, v0, v1
				; VI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; VI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; VI-NEXT: s_cbranch_execnz .LBB122_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[38:39]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i32_ret_offset_scalar:			; GFX9-LABEL: global_atomic_udec_wrap_i32_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, 0			; GFX9-NEXT: v_mov_b32_e32 v1, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s6			; GFX9-NEXT: global_load_dword v0, v1, s[4:5] offset:16
				; GFX9-NEXT: s_mov_b64 s[36:37], 0
				; GFX9-NEXT: .LBB122_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v3, v0
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, 0, v3
				; GFX9-NEXT: v_cmp_lt_u32_e64 s[34:35], s6, v3
				; GFX9-NEXT: v_mov_b32_e32 v0, s6
				; GFX9-NEXT: v_add_u32_e32 v2, -1, v3
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GFX9-NEXT: v_cndmask_b32_e32 v2, v2, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec v0, v0, v1, s[4:5] offset:16 glc			; GFX9-NEXT: global_atomic_cmpswap v0, v1, v[2:3], s[4:5] offset:16 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u32_e32 vcc, v0, v3
				; GFX9-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GFX9-NEXT: s_cbranch_execnz .LBB122_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[36:37]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i32, ptr addrspace(1) %out, i32 4			%gep = getelementptr i32, ptr addrspace(1) %out, i32 4
	%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 %in seq_cst			%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i32 %in seq_cst
	ret i32 %result			ret i32 %result
	}			}

llvm/test/CodeGen/AMDGPU/global_atomics_i64_system.ll

This file is larger than 256 KB, so syntax highlighting is disabled by default.

	Show First 20 Lines • Show All 1,707 Lines • ▼ Show 20 Lines
	define void @global_atomic_sub_i64_noret(ptr addrspace(1) %ptr, i64 %in) {			define void @global_atomic_sub_i64_noret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_sub_i64_noret:			; SI-LABEL: global_atomic_sub_i64_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB24_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_sub_i32_e32 v4, vcc, v6, v2
				; SI-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub_x2 v[2:3], v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB24_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i64_noret:			; VI-LABEL: global_atomic_sub_i64_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3]			; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB24_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_sub_u32_e32 v4, vcc, v6, v2
				; VI-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB24_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i64_noret:			; GFX9-LABEL: global_atomic_sub_i64_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub_x2 v[0:1], v[2:3], off			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB24_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_sub_co_u32_e32 v4, vcc, v6, v2
				; GFX9-NEXT: v_subb_co_u32_e32 v5, vcc, v7, v3, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB24_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw sub ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw sub ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_sub_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {			define void @global_atomic_sub_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_sub_i64_noret_offset:			; SI-LABEL: global_atomic_sub_i64_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[4:7], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB25_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_sub_i32_e32 v4, vcc, v6, v2
				; SI-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[4:7], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB25_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i64_noret_offset:			; VI-LABEL: global_atomic_sub_i64_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB25_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_sub_u32_e32 v4, vcc, v6, v2
				; VI-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3]			; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB25_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i64_noret_offset:			; GFX9-LABEL: global_atomic_sub_i64_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub_x2 v[0:1], v[2:3], off offset:32			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB25_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_sub_co_u32_e32 v4, vcc, v6, v2
				; GFX9-NEXT: v_subb_co_u32_e32 v5, vcc, v7, v3, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB25_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw sub ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw sub ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @global_atomic_sub_i64_ret(ptr addrspace(1) %ptr, i64 %in) {			define i64 @global_atomic_sub_i64_ret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_sub_i64_ret:			; SI-LABEL: global_atomic_sub_i64_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v3
				; SI-NEXT: v_mov_b32_e32 v5, v2
				; SI-NEXT: v_mov_b32_e32 v7, v1
				; SI-NEXT: v_mov_b32_e32 v6, v0
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB26_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: v_sub_i32_e32 v8, vcc, v10, v5
				; SI-NEXT: v_subb_u32_e32 v9, vcc, v11, v4, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub_x2 v[2:3], v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB26_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i64_ret:			; VI-LABEL: global_atomic_sub_i64_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB26_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: v_sub_u32_e32 v4, vcc, v6, v2
				; VI-NEXT: v_subb_u32_e32 v5, vcc, v7, v3, vcc
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB26_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v0, v4
				; VI-NEXT: v_mov_b32_e32 v1, v5
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i64_ret:			; GFX9-LABEL: global_atomic_sub_i64_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub_x2 v[0:1], v[0:1], v[2:3], off glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB26_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_sub_co_u32_e32 v4, vcc, v6, v2
				; GFX9-NEXT: v_subb_co_u32_e32 v5, vcc, v7, v3, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB26_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw sub ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw sub ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @global_atomic_sub_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {			define i64 @global_atomic_sub_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_sub_i64_ret_offset:			; SI-LABEL: global_atomic_sub_i64_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v3
				; SI-NEXT: v_mov_b32_e32 v5, v2
				; SI-NEXT: v_mov_b32_e32 v7, v1
				; SI-NEXT: v_mov_b32_e32 v6, v0
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[4:7], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB27_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: v_sub_i32_e32 v8, vcc, v10, v5
				; SI-NEXT: v_subb_u32_e32 v9, vcc, v11, v4, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[4:7], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB27_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i64_ret_offset:			; VI-LABEL: global_atomic_sub_i64_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v4, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[0:1], v[4:5]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB27_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v9, v1
				; VI-NEXT: v_mov_b32_e32 v8, v0
				; VI-NEXT: v_sub_u32_e32 v6, vcc, v8, v2
				; VI-NEXT: v_subb_u32_e32 v7, vcc, v9, v3, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB27_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i64_ret_offset:			; GFX9-LABEL: global_atomic_sub_i64_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub_x2 v[0:1], v[0:1], v[2:3], off offset:32 glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB27_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_sub_co_u32_e32 v4, vcc, v6, v2
				; GFX9-NEXT: v_subb_co_u32_e32 v5, vcc, v7, v3, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB27_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw sub ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw sub ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @global_atomic_sub_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_sub_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_sub_i64_noret_scalar:			; SI-LABEL: global_atomic_sub_i64_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
	; SI-NEXT: v_mov_b32_e32 v2, s34			; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB28_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: v_mov_b32_e32 v2, s35
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_subrev_i32_e32 v1, vcc, s34, v3
				; SI-NEXT: v_subb_u32_e32 v2, vcc, v4, v2, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub_x2 v[1:2], off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB28_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i64_noret_scalar:			; VI-LABEL: global_atomic_sub_i64_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
				; VI-NEXT: v_mov_b32_e32 v1, s5
				; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB28_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s7
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: v_subrev_u32_e32 v0, vcc, s6, v2
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
				; VI-NEXT: v_mov_b32_e32 v5, s5
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB28_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i64_noret_scalar:			; GFX9-LABEL: global_atomic_sub_i64_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
				; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB28_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_subrev_co_u32_e32 v0, vcc, s6, v2
				; GFX9-NEXT: v_subb_co_u32_e32 v1, vcc, v3, v1, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub_x2 v2, v[0:1], s[4:5]			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB28_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw sub ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw sub ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_sub_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_sub_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_sub_i64_noret_offset_scalar:			; SI-LABEL: global_atomic_sub_i64_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: v_mov_b32_e32 v1, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v2, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB29_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: v_mov_b32_e32 v2, s35
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_subrev_i32_e32 v1, vcc, s34, v3
				; SI-NEXT: v_subb_u32_e32 v2, vcc, v4, v2, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub_x2 v[1:2], off, s[4:7], 0 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB29_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i64_noret_offset_scalar:			; VI-LABEL: global_atomic_sub_i64_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s34, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s35
				; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB29_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s7
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_subrev_u32_e32 v0, vcc, s6, v2
				; VI-NEXT: v_mov_b32_e32 v4, s34
				; VI-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
				; VI-NEXT: v_mov_b32_e32 v5, s35
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB29_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i64_noret_offset_scalar:			; GFX9-LABEL: global_atomic_sub_i64_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
				; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5] offset:32
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB29_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_subrev_co_u32_e32 v0, vcc, s6, v2
				; GFX9-NEXT: v_subb_co_u32_e32 v1, vcc, v3, v1, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub_x2 v2, v[0:1], s[4:5] offset:32			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB29_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw sub ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw sub ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @global_atomic_sub_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_sub_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_sub_i64_ret_scalar:			; SI-LABEL: global_atomic_sub_i64_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB30_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
	; SI-NEXT: v_mov_b32_e32 v0, s35			; SI-NEXT: v_mov_b32_e32 v0, s35
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_subrev_i32_e32 v5, vcc, s34, v7
				; SI-NEXT: v_subb_u32_e32 v6, vcc, v8, v0, vcc
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub_x2 v[0:1], off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB30_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i64_ret_scalar:			; VI-LABEL: global_atomic_sub_i64_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
				; VI-NEXT: v_mov_b32_e32 v1, s5
				; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
				; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB30_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s7
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: v_mov_b32_e32 v4, s4
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: v_subrev_u32_e32 v0, vcc, s6, v2
				; VI-NEXT: v_mov_b32_e32 v5, s5
				; VI-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB30_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i64_ret_scalar:			; GFX9-LABEL: global_atomic_sub_i64_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB30_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_mov_b32_e32 v0, s7
				; GFX9-NEXT: v_subrev_co_u32_e32 v3, vcc, s6, v5
				; GFX9-NEXT: v_subb_co_u32_e32 v4, vcc, v6, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub_x2 v[0:1], v2, v[0:1], s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB30_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw sub ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw sub ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @global_atomic_sub_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_sub_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_sub_i64_ret_offset_scalar:			; SI-LABEL: global_atomic_sub_i64_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: v_mov_b32_e32 v0, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v1, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB31_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v0, s35
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_subrev_i32_e32 v5, vcc, s34, v7
				; SI-NEXT: v_subb_u32_e32 v6, vcc, v8, v0, vcc
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_sub_x2 v[0:1], off, s[4:7], 0 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB31_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_sub_i64_ret_offset_scalar:			; VI-LABEL: global_atomic_sub_i64_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s34, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s35
				; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
				; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB31_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s7
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: v_mov_b32_e32 v4, s34
				; VI-NEXT: v_subrev_u32_e32 v0, vcc, s6, v2
				; VI-NEXT: v_mov_b32_e32 v5, s35
				; VI-NEXT: v_subb_u32_e32 v1, vcc, v3, v1, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_sub_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB31_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_sub_i64_ret_offset_scalar:			; GFX9-LABEL: global_atomic_sub_i64_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5] offset:32
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB31_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_mov_b32_e32 v0, s7
				; GFX9-NEXT: v_subrev_co_u32_e32 v3, vcc, s6, v5
				; GFX9-NEXT: v_subb_co_u32_e32 v4, vcc, v6, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_sub_x2 v[0:1], v2, v[0:1], s[4:5] offset:32 glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB31_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw sub ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw sub ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw and			; atomicrmw and
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @global_atomic_and_i64_noret(ptr addrspace(1) %ptr, i64 %in) {			define void @global_atomic_and_i64_noret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_and_i64_noret:			; SI-LABEL: global_atomic_and_i64_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB32_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_and_b32_e32 v5, v7, v3
				; SI-NEXT: v_and_b32_e32 v4, v6, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and_x2 v[2:3], v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB32_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i64_noret:			; VI-LABEL: global_atomic_and_i64_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and_x2 v[0:1], v[2:3]			; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB32_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_and_b32_e32 v5, v7, v3
				; VI-NEXT: v_and_b32_e32 v4, v6, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB32_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i64_noret:			; GFX9-LABEL: global_atomic_and_i64_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and_x2 v[0:1], v[2:3], off			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB32_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_and_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_and_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB32_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw and ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw and ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_and_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {			define void @global_atomic_and_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_and_i64_noret_offset:			; SI-LABEL: global_atomic_and_i64_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[4:7], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB33_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_and_b32_e32 v5, v7, v3
				; SI-NEXT: v_and_b32_e32 v4, v6, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[4:7], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB33_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i64_noret_offset:			; VI-LABEL: global_atomic_and_i64_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB33_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_and_b32_e32 v5, v7, v3
				; VI-NEXT: v_and_b32_e32 v4, v6, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and_x2 v[0:1], v[2:3]			; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB33_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i64_noret_offset:			; GFX9-LABEL: global_atomic_and_i64_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and_x2 v[0:1], v[2:3], off offset:32			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB33_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_and_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_and_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB33_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw and ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw and ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @global_atomic_and_i64_ret(ptr addrspace(1) %ptr, i64 %in) {			define i64 @global_atomic_and_i64_ret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_and_i64_ret:			; SI-LABEL: global_atomic_and_i64_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v3
				; SI-NEXT: v_mov_b32_e32 v5, v2
				; SI-NEXT: v_mov_b32_e32 v7, v1
				; SI-NEXT: v_mov_b32_e32 v6, v0
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB34_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: v_and_b32_e32 v9, v11, v4
				; SI-NEXT: v_and_b32_e32 v8, v10, v5
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and_x2 v[2:3], v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB34_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i64_ret:			; VI-LABEL: global_atomic_and_i64_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB34_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: v_and_b32_e32 v5, v7, v3
				; VI-NEXT: v_and_b32_e32 v4, v6, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB34_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v0, v4
				; VI-NEXT: v_mov_b32_e32 v1, v5
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i64_ret:			; GFX9-LABEL: global_atomic_and_i64_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and_x2 v[0:1], v[0:1], v[2:3], off glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB34_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_and_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_and_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB34_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw and ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw and ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @global_atomic_and_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {			define i64 @global_atomic_and_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_and_i64_ret_offset:			; SI-LABEL: global_atomic_and_i64_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v3
				; SI-NEXT: v_mov_b32_e32 v5, v2
				; SI-NEXT: v_mov_b32_e32 v7, v1
				; SI-NEXT: v_mov_b32_e32 v6, v0
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[4:7], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB35_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: v_and_b32_e32 v9, v11, v4
				; SI-NEXT: v_and_b32_e32 v8, v10, v5
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[4:7], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB35_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i64_ret_offset:			; VI-LABEL: global_atomic_and_i64_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v4, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[0:1], v[4:5]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB35_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v9, v1
				; VI-NEXT: v_mov_b32_e32 v8, v0
				; VI-NEXT: v_and_b32_e32 v7, v9, v3
				; VI-NEXT: v_and_b32_e32 v6, v8, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB35_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i64_ret_offset:			; GFX9-LABEL: global_atomic_and_i64_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and_x2 v[0:1], v[0:1], v[2:3], off offset:32 glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB35_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_and_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_and_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB35_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw and ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw and ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @global_atomic_and_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_and_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_and_i64_noret_scalar:			; SI-LABEL: global_atomic_and_i64_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
	; SI-NEXT: v_mov_b32_e32 v2, s34			; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB36_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_and_b32_e32 v2, s35, v4
				; SI-NEXT: v_and_b32_e32 v1, s34, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and_x2 v[1:2], off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB36_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i64_noret_scalar:			; VI-LABEL: global_atomic_and_i64_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB36_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_and_b32_e32 v1, s7, v3
				; VI-NEXT: v_and_b32_e32 v0, s6, v2
				; VI-NEXT: v_mov_b32_e32 v5, s5
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB36_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i64_noret_scalar:			; GFX9-LABEL: global_atomic_and_i64_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5]
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB36_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_and_b32_e32 v1, s7, v3
				; GFX9-NEXT: v_and_b32_e32 v0, s6, v2
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and_x2 v2, v[0:1], s[4:5]			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB36_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw and ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw and ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_and_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_and_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_and_i64_noret_offset_scalar:			; SI-LABEL: global_atomic_and_i64_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: v_mov_b32_e32 v1, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v2, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB37_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_and_b32_e32 v2, s35, v4
				; SI-NEXT: v_and_b32_e32 v1, s34, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and_x2 v[1:2], off, s[4:7], 0 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB37_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i64_noret_offset_scalar:			; VI-LABEL: global_atomic_and_i64_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s34, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB37_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v4, s34
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_and_b32_e32 v1, s7, v3
				; VI-NEXT: v_and_b32_e32 v0, s6, v2
				; VI-NEXT: v_mov_b32_e32 v5, s35
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB37_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i64_noret_offset_scalar:			; GFX9-LABEL: global_atomic_and_i64_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5] offset:32
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB37_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_and_b32_e32 v1, s7, v3
				; GFX9-NEXT: v_and_b32_e32 v0, s6, v2
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and_x2 v2, v[0:1], s[4:5] offset:32			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB37_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw and ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw and ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @global_atomic_and_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_and_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_and_i64_ret_scalar:			; SI-LABEL: global_atomic_and_i64_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB38_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_and_b32_e32 v6, s35, v8
				; SI-NEXT: v_and_b32_e32 v5, s34, v7
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and_x2 v[0:1], off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB38_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i64_ret_scalar:			; VI-LABEL: global_atomic_and_i64_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB38_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: v_mov_b32_e32 v5, s5
				; VI-NEXT: v_and_b32_e32 v1, s7, v3
				; VI-NEXT: v_and_b32_e32 v0, s6, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB38_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i64_ret_scalar:			; GFX9-LABEL: global_atomic_and_i64_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB38_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_and_b32_e32 v4, s7, v6
				; GFX9-NEXT: v_and_b32_e32 v3, s6, v5
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and_x2 v[0:1], v2, v[0:1], s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB38_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw and ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw and ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @global_atomic_and_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_and_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_and_i64_ret_offset_scalar:			; SI-LABEL: global_atomic_and_i64_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: v_mov_b32_e32 v0, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v1, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB39_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_and_b32_e32 v6, s35, v8
				; SI-NEXT: v_and_b32_e32 v5, s34, v7
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_and_x2 v[0:1], off, s[4:7], 0 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB39_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_and_i64_ret_offset_scalar:			; VI-LABEL: global_atomic_and_i64_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s34, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB39_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: v_mov_b32_e32 v4, s34
				; VI-NEXT: v_mov_b32_e32 v5, s35
				; VI-NEXT: v_and_b32_e32 v1, s7, v3
				; VI-NEXT: v_and_b32_e32 v0, s6, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_and_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB39_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_and_i64_ret_offset_scalar:			; GFX9-LABEL: global_atomic_and_i64_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5] offset:32
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB39_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_and_b32_e32 v4, s7, v6
				; GFX9-NEXT: v_and_b32_e32 v3, s6, v5
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_and_x2 v[0:1], v2, v[0:1], s[4:5] offset:32 glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB39_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw and ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw and ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw nand			; atomicrmw nand
	▲ Show 20 Lines • Show All 836 Lines • ▼ Show 20 Lines
	define void @global_atomic_or_i64_noret(ptr addrspace(1) %ptr, i64 %in) {			define void @global_atomic_or_i64_noret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_or_i64_noret:			; SI-LABEL: global_atomic_or_i64_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB48_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_or_b32_e32 v5, v7, v3
				; SI-NEXT: v_or_b32_e32 v4, v6, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or_x2 v[2:3], v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB48_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i64_noret:			; VI-LABEL: global_atomic_or_i64_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or_x2 v[0:1], v[2:3]			; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB48_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_or_b32_e32 v5, v7, v3
				; VI-NEXT: v_or_b32_e32 v4, v6, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB48_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i64_noret:			; GFX9-LABEL: global_atomic_or_i64_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or_x2 v[0:1], v[2:3], off			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB48_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_or_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_or_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB48_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw or ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw or ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_or_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {			define void @global_atomic_or_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_or_i64_noret_offset:			; SI-LABEL: global_atomic_or_i64_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[4:7], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB49_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_or_b32_e32 v5, v7, v3
				; SI-NEXT: v_or_b32_e32 v4, v6, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[4:7], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB49_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i64_noret_offset:			; VI-LABEL: global_atomic_or_i64_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB49_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_or_b32_e32 v5, v7, v3
				; VI-NEXT: v_or_b32_e32 v4, v6, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or_x2 v[0:1], v[2:3]			; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB49_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i64_noret_offset:			; GFX9-LABEL: global_atomic_or_i64_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or_x2 v[0:1], v[2:3], off offset:32			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB49_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_or_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_or_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB49_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw or ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw or ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @global_atomic_or_i64_ret(ptr addrspace(1) %ptr, i64 %in) {			define i64 @global_atomic_or_i64_ret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_or_i64_ret:			; SI-LABEL: global_atomic_or_i64_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v3
				; SI-NEXT: v_mov_b32_e32 v5, v2
				; SI-NEXT: v_mov_b32_e32 v7, v1
				; SI-NEXT: v_mov_b32_e32 v6, v0
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB50_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: v_or_b32_e32 v9, v11, v4
				; SI-NEXT: v_or_b32_e32 v8, v10, v5
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or_x2 v[2:3], v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB50_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i64_ret:			; VI-LABEL: global_atomic_or_i64_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB50_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: v_or_b32_e32 v5, v7, v3
				; VI-NEXT: v_or_b32_e32 v4, v6, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB50_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v0, v4
				; VI-NEXT: v_mov_b32_e32 v1, v5
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i64_ret:			; GFX9-LABEL: global_atomic_or_i64_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or_x2 v[0:1], v[0:1], v[2:3], off glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB50_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_or_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_or_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB50_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw or ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw or ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @global_atomic_or_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {			define i64 @global_atomic_or_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_or_i64_ret_offset:			; SI-LABEL: global_atomic_or_i64_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v3
				; SI-NEXT: v_mov_b32_e32 v5, v2
				; SI-NEXT: v_mov_b32_e32 v7, v1
				; SI-NEXT: v_mov_b32_e32 v6, v0
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[4:7], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB51_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: v_or_b32_e32 v9, v11, v4
				; SI-NEXT: v_or_b32_e32 v8, v10, v5
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[4:7], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB51_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i64_ret_offset:			; VI-LABEL: global_atomic_or_i64_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v4, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[0:1], v[4:5]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB51_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v9, v1
				; VI-NEXT: v_mov_b32_e32 v8, v0
				; VI-NEXT: v_or_b32_e32 v7, v9, v3
				; VI-NEXT: v_or_b32_e32 v6, v8, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB51_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i64_ret_offset:			; GFX9-LABEL: global_atomic_or_i64_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or_x2 v[0:1], v[0:1], v[2:3], off offset:32 glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB51_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_or_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_or_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB51_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw or ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw or ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @global_atomic_or_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_or_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_or_i64_noret_scalar:			; SI-LABEL: global_atomic_or_i64_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
	; SI-NEXT: v_mov_b32_e32 v2, s34			; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB52_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_or_b32_e32 v2, s35, v4
				; SI-NEXT: v_or_b32_e32 v1, s34, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or_x2 v[1:2], off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB52_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i64_noret_scalar:			; VI-LABEL: global_atomic_or_i64_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB52_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_or_b32_e32 v1, s7, v3
				; VI-NEXT: v_or_b32_e32 v0, s6, v2
				; VI-NEXT: v_mov_b32_e32 v5, s5
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB52_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i64_noret_scalar:			; GFX9-LABEL: global_atomic_or_i64_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5]
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB52_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_or_b32_e32 v1, s7, v3
				; GFX9-NEXT: v_or_b32_e32 v0, s6, v2
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or_x2 v2, v[0:1], s[4:5]			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB52_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw or ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw or ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_or_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_or_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_or_i64_noret_offset_scalar:			; SI-LABEL: global_atomic_or_i64_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: v_mov_b32_e32 v1, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v2, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB53_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_or_b32_e32 v2, s35, v4
				; SI-NEXT: v_or_b32_e32 v1, s34, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or_x2 v[1:2], off, s[4:7], 0 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB53_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i64_noret_offset_scalar:			; VI-LABEL: global_atomic_or_i64_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s34, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB53_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v4, s34
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_or_b32_e32 v1, s7, v3
				; VI-NEXT: v_or_b32_e32 v0, s6, v2
				; VI-NEXT: v_mov_b32_e32 v5, s35
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB53_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i64_noret_offset_scalar:			; GFX9-LABEL: global_atomic_or_i64_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5] offset:32
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB53_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_or_b32_e32 v1, s7, v3
				; GFX9-NEXT: v_or_b32_e32 v0, s6, v2
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or_x2 v2, v[0:1], s[4:5] offset:32			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB53_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw or ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw or ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @global_atomic_or_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_or_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_or_i64_ret_scalar:			; SI-LABEL: global_atomic_or_i64_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB54_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_or_b32_e32 v6, s35, v8
				; SI-NEXT: v_or_b32_e32 v5, s34, v7
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or_x2 v[0:1], off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB54_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i64_ret_scalar:			; VI-LABEL: global_atomic_or_i64_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB54_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: v_mov_b32_e32 v5, s5
				; VI-NEXT: v_or_b32_e32 v1, s7, v3
				; VI-NEXT: v_or_b32_e32 v0, s6, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB54_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i64_ret_scalar:			; GFX9-LABEL: global_atomic_or_i64_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB54_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_or_b32_e32 v4, s7, v6
				; GFX9-NEXT: v_or_b32_e32 v3, s6, v5
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or_x2 v[0:1], v2, v[0:1], s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB54_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw or ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw or ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @global_atomic_or_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_or_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_or_i64_ret_offset_scalar:			; SI-LABEL: global_atomic_or_i64_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: v_mov_b32_e32 v0, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v1, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB55_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_or_b32_e32 v6, s35, v8
				; SI-NEXT: v_or_b32_e32 v5, s34, v7
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_or_x2 v[0:1], off, s[4:7], 0 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB55_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_or_i64_ret_offset_scalar:			; VI-LABEL: global_atomic_or_i64_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s34, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB55_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: v_mov_b32_e32 v4, s34
				; VI-NEXT: v_mov_b32_e32 v5, s35
				; VI-NEXT: v_or_b32_e32 v1, s7, v3
				; VI-NEXT: v_or_b32_e32 v0, s6, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_or_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB55_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_or_i64_ret_offset_scalar:			; GFX9-LABEL: global_atomic_or_i64_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5] offset:32
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB55_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_or_b32_e32 v4, s7, v6
				; GFX9-NEXT: v_or_b32_e32 v3, s6, v5
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_or_x2 v[0:1], v2, v[0:1], s[4:5] offset:32 glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB55_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw or ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw or ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw xor			; atomicrmw xor
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @global_atomic_xor_i64_noret(ptr addrspace(1) %ptr, i64 %in) {			define void @global_atomic_xor_i64_noret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_xor_i64_noret:			; SI-LABEL: global_atomic_xor_i64_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB56_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_xor_b32_e32 v5, v7, v3
				; SI-NEXT: v_xor_b32_e32 v4, v6, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor_x2 v[2:3], v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB56_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i64_noret:			; VI-LABEL: global_atomic_xor_i64_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3]			; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB56_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_xor_b32_e32 v5, v7, v3
				; VI-NEXT: v_xor_b32_e32 v4, v6, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB56_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i64_noret:			; GFX9-LABEL: global_atomic_xor_i64_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor_x2 v[0:1], v[2:3], off			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB56_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_xor_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_xor_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB56_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw xor ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw xor ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_xor_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {			define void @global_atomic_xor_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_xor_i64_noret_offset:			; SI-LABEL: global_atomic_xor_i64_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[4:7], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB57_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_xor_b32_e32 v5, v7, v3
				; SI-NEXT: v_xor_b32_e32 v4, v6, v2
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[4:7], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB57_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i64_noret_offset:			; VI-LABEL: global_atomic_xor_i64_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB57_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_xor_b32_e32 v5, v7, v3
				; VI-NEXT: v_xor_b32_e32 v4, v6, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3]			; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB57_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i64_noret_offset:			; GFX9-LABEL: global_atomic_xor_i64_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor_x2 v[0:1], v[2:3], off offset:32			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB57_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_xor_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_xor_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB57_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw xor ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw xor ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @global_atomic_xor_i64_ret(ptr addrspace(1) %ptr, i64 %in) {			define i64 @global_atomic_xor_i64_ret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_xor_i64_ret:			; SI-LABEL: global_atomic_xor_i64_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v3
				; SI-NEXT: v_mov_b32_e32 v5, v2
				; SI-NEXT: v_mov_b32_e32 v7, v1
				; SI-NEXT: v_mov_b32_e32 v6, v0
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB58_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: v_xor_b32_e32 v9, v11, v4
				; SI-NEXT: v_xor_b32_e32 v8, v10, v5
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor_x2 v[2:3], v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB58_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i64_ret:			; VI-LABEL: global_atomic_xor_i64_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB58_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: v_xor_b32_e32 v5, v7, v3
				; VI-NEXT: v_xor_b32_e32 v4, v6, v2
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB58_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v0, v4
				; VI-NEXT: v_mov_b32_e32 v1, v5
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i64_ret:			; GFX9-LABEL: global_atomic_xor_i64_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor_x2 v[0:1], v[0:1], v[2:3], off glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB58_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_xor_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_xor_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB58_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw xor ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw xor ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @global_atomic_xor_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {			define i64 @global_atomic_xor_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_xor_i64_ret_offset:			; SI-LABEL: global_atomic_xor_i64_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v4, v3
				; SI-NEXT: v_mov_b32_e32 v5, v2
				; SI-NEXT: v_mov_b32_e32 v7, v1
				; SI-NEXT: v_mov_b32_e32 v6, v0
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[4:7], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB59_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: v_xor_b32_e32 v9, v11, v4
				; SI-NEXT: v_xor_b32_e32 v8, v10, v5
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[4:7], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB59_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i64_ret_offset:			; VI-LABEL: global_atomic_xor_i64_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v4, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[0:1], v[4:5]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB59_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v9, v1
				; VI-NEXT: v_mov_b32_e32 v8, v0
				; VI-NEXT: v_xor_b32_e32 v7, v9, v3
				; VI-NEXT: v_xor_b32_e32 v6, v8, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB59_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i64_ret_offset:			; GFX9-LABEL: global_atomic_xor_i64_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor_x2 v[0:1], v[0:1], v[2:3], off offset:32 glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB59_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_xor_b32_e32 v5, v7, v3
				; GFX9-NEXT: v_xor_b32_e32 v4, v6, v2
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB59_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw xor ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw xor ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @global_atomic_xor_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_xor_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_xor_i64_noret_scalar:			; SI-LABEL: global_atomic_xor_i64_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
	; SI-NEXT: v_mov_b32_e32 v2, s34			; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB60_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_xor_b32_e32 v2, s35, v4
				; SI-NEXT: v_xor_b32_e32 v1, s34, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor_x2 v[1:2], off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB60_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i64_noret_scalar:			; VI-LABEL: global_atomic_xor_i64_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB60_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_xor_b32_e32 v1, s7, v3
				; VI-NEXT: v_xor_b32_e32 v0, s6, v2
				; VI-NEXT: v_mov_b32_e32 v5, s5
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB60_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i64_noret_scalar:			; GFX9-LABEL: global_atomic_xor_i64_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5]
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB60_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_xor_b32_e32 v1, s7, v3
				; GFX9-NEXT: v_xor_b32_e32 v0, s6, v2
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor_x2 v2, v[0:1], s[4:5]			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB60_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw xor ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw xor ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_xor_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_xor_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_xor_i64_noret_offset_scalar:			; SI-LABEL: global_atomic_xor_i64_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: v_mov_b32_e32 v1, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v2, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB61_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_xor_b32_e32 v2, s35, v4
				; SI-NEXT: v_xor_b32_e32 v1, s34, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor_x2 v[1:2], off, s[4:7], 0 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB61_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i64_noret_offset_scalar:			; VI-LABEL: global_atomic_xor_i64_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s34, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB61_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: v_mov_b32_e32 v4, s34
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_xor_b32_e32 v1, s7, v3
				; VI-NEXT: v_xor_b32_e32 v0, s6, v2
				; VI-NEXT: v_mov_b32_e32 v5, s35
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB61_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i64_noret_offset_scalar:			; GFX9-LABEL: global_atomic_xor_i64_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5] offset:32
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB61_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_xor_b32_e32 v1, s7, v3
				; GFX9-NEXT: v_xor_b32_e32 v0, s6, v2
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor_x2 v2, v[0:1], s[4:5] offset:32			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB61_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw xor ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw xor ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @global_atomic_xor_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_xor_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_xor_i64_ret_scalar:			; SI-LABEL: global_atomic_xor_i64_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB62_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_xor_b32_e32 v6, s35, v8
				; SI-NEXT: v_xor_b32_e32 v5, s34, v7
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor_x2 v[0:1], off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB62_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i64_ret_scalar:			; VI-LABEL: global_atomic_xor_i64_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB62_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: v_mov_b32_e32 v5, s5
				; VI-NEXT: v_xor_b32_e32 v1, s7, v3
				; VI-NEXT: v_xor_b32_e32 v0, s6, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB62_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i64_ret_scalar:			; GFX9-LABEL: global_atomic_xor_i64_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB62_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_xor_b32_e32 v4, s7, v6
				; GFX9-NEXT: v_xor_b32_e32 v3, s6, v5
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor_x2 v[0:1], v2, v[0:1], s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB62_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw xor ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw xor ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @global_atomic_xor_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_xor_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_xor_i64_ret_offset_scalar:			; SI-LABEL: global_atomic_xor_i64_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: v_mov_b32_e32 v0, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v1, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB63_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_xor_b32_e32 v6, s35, v8
				; SI-NEXT: v_xor_b32_e32 v5, s34, v7
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_xor_x2 v[0:1], off, s[4:7], 0 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB63_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_xor_i64_ret_offset_scalar:			; VI-LABEL: global_atomic_xor_i64_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s34, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB63_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: v_mov_b32_e32 v4, s34
				; VI-NEXT: v_mov_b32_e32 v5, s35
				; VI-NEXT: v_xor_b32_e32 v1, s7, v3
				; VI-NEXT: v_xor_b32_e32 v0, s6, v2
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_xor_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB63_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_xor_i64_ret_offset_scalar:			; GFX9-LABEL: global_atomic_xor_i64_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5] offset:32
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB63_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_xor_b32_e32 v4, s7, v6
				; GFX9-NEXT: v_xor_b32_e32 v3, s6, v5
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_xor_x2 v[0:1], v2, v[0:1], s[4:5] offset:32 glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB63_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw xor ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw xor ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw max			; atomicrmw max
	▲ Show 20 Lines • Show All 4,676 Lines • ▼ Show 20 Lines
	define void @global_atomic_uinc_wrap_i64_noret(ptr addrspace(1) %ptr, i64 %in) {			define void @global_atomic_uinc_wrap_i64_noret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i64_noret:			; SI-LABEL: global_atomic_uinc_wrap_i64_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB107_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v4, vcc, 1, v6
				; SI-NEXT: v_addc_u32_e32 v5, vcc, 0, v7, vcc
				; SI-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; SI-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; SI-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc_x2 v[2:3], v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB107_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i64_noret:			; VI-LABEL: global_atomic_uinc_wrap_i64_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3]			; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB107_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v4, vcc, 1, v6
				; VI-NEXT: v_addc_u32_e32 v5, vcc, 0, v7, vcc
				; VI-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; VI-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; VI-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB107_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i64_noret:			; GFX9-LABEL: global_atomic_uinc_wrap_i64_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc_x2 v[0:1], v[2:3], off			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB107_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_add_co_u32_e32 v4, vcc, 1, v6
				; GFX9-NEXT: v_addc_co_u32_e32 v5, vcc, 0, v7, vcc
				; GFX9-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GFX9-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB107_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_uinc_wrap_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {			define void @global_atomic_uinc_wrap_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i64_noret_offset:			; SI-LABEL: global_atomic_uinc_wrap_i64_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[4:7], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB108_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v4, vcc, 1, v6
				; SI-NEXT: v_addc_u32_e32 v5, vcc, 0, v7, vcc
				; SI-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; SI-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; SI-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[4:7], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB108_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i64_noret_offset:			; VI-LABEL: global_atomic_uinc_wrap_i64_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB108_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v4, vcc, 1, v6
				; VI-NEXT: v_addc_u32_e32 v5, vcc, 0, v7, vcc
				; VI-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; VI-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; VI-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3]			; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB108_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i64_noret_offset:			; GFX9-LABEL: global_atomic_uinc_wrap_i64_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc_x2 v[0:1], v[2:3], off offset:32			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB108_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_add_co_u32_e32 v4, vcc, 1, v6
				; GFX9-NEXT: v_addc_co_u32_e32 v5, vcc, 0, v7, vcc
				; GFX9-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GFX9-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB108_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @global_atomic_uinc_wrap_i64_ret(ptr addrspace(1) %ptr, i64 %in) {			define i64 @global_atomic_uinc_wrap_i64_ret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i64_ret:			; SI-LABEL: global_atomic_uinc_wrap_i64_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v7, v1
				; SI-NEXT: v_mov_b32_e32 v6, v0
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[4:7], 0 addr64
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB109_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_add_i32_e32 v0, vcc, 1, v10
				; SI-NEXT: v_addc_u32_e32 v1, vcc, 0, v11, vcc
				; SI-NEXT: v_cmp_lt_u64_e32 vcc, v[10:11], v[4:5]
				; SI-NEXT: v_cndmask_b32_e32 v9, 0, v1, vcc
				; SI-NEXT: v_cndmask_b32_e32 v8, 0, v0, vcc
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc_x2 v[2:3], v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[4:7], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB109_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i64_ret:			; VI-LABEL: global_atomic_uinc_wrap_i64_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB109_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: v_add_u32_e32 v4, vcc, 1, v6
				; VI-NEXT: v_addc_u32_e32 v5, vcc, 0, v7, vcc
				; VI-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; VI-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; VI-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB109_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
				; VI-NEXT: v_mov_b32_e32 v0, v4
				; VI-NEXT: v_mov_b32_e32 v1, v5
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i64_ret:			; GFX9-LABEL: global_atomic_uinc_wrap_i64_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc_x2 v[0:1], v[0:1], v[2:3], off glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB109_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_add_co_u32_e32 v4, vcc, 1, v6
				; GFX9-NEXT: v_addc_co_u32_e32 v5, vcc, 0, v7, vcc
				; GFX9-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GFX9-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB109_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @global_atomic_uinc_wrap_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {			define i64 @global_atomic_uinc_wrap_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i64_ret_offset:			; SI-LABEL: global_atomic_uinc_wrap_i64_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, v3
				; SI-NEXT: v_mov_b32_e32 v4, v2
				; SI-NEXT: v_mov_b32_e32 v7, v1
				; SI-NEXT: v_mov_b32_e32 v6, v0
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s6, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s4, s6
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s5, s6
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[4:7], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[8:9], 0
				; SI-NEXT: .LBB110_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_add_i32_e32 v0, vcc, 1, v10
				; SI-NEXT: v_addc_u32_e32 v1, vcc, 0, v11, vcc
				; SI-NEXT: v_cmp_lt_u64_e32 vcc, v[10:11], v[4:5]
				; SI-NEXT: v_cndmask_b32_e32 v9, 0, v1, vcc
				; SI-NEXT: v_cndmask_b32_e32 v8, 0, v0, vcc
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[4:7], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; SI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; SI-NEXT: s_cbranch_execnz .LBB110_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[8:9]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i64_ret_offset:			; VI-LABEL: global_atomic_uinc_wrap_i64_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v4, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[0:1], v[4:5]
				; VI-NEXT: s_mov_b64 s[4:5], 0
				; VI-NEXT: .LBB110_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v9, v1
				; VI-NEXT: v_mov_b32_e32 v8, v0
				; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v8
				; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v9, vcc
				; VI-NEXT: v_cmp_lt_u64_e32 vcc, v[8:9], v[2:3]
				; VI-NEXT: v_cndmask_b32_e32 v7, 0, v1, vcc
				; VI-NEXT: v_cndmask_b32_e32 v6, 0, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; VI-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; VI-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; VI-NEXT: s_cbranch_execnz .LBB110_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[4:5]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i64_ret_offset:			; GFX9-LABEL: global_atomic_uinc_wrap_i64_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc_x2 v[0:1], v[0:1], v[2:3], off offset:32 glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[4:5], 0
				; GFX9-NEXT: .LBB110_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_add_co_u32_e32 v4, vcc, 1, v6
				; GFX9-NEXT: v_addc_co_u32_e32 v5, vcc, 0, v7, vcc
				; GFX9-NEXT: v_cmp_lt_u64_e32 vcc, v[6:7], v[2:3]
				; GFX9-NEXT: v_cndmask_b32_e32 v5, 0, v5, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v4, 0, v4, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[4:5], vcc, s[4:5]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[4:5]
				; GFX9-NEXT: s_cbranch_execnz .LBB110_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[4:5]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @global_atomic_uinc_wrap_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_uinc_wrap_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i64_noret_scalar:			; SI-LABEL: global_atomic_uinc_wrap_i64_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
	; SI-NEXT: v_mov_b32_e32 v2, s34			; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB111_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v1, vcc, 1, v3
				; SI-NEXT: v_addc_u32_e32 v2, vcc, 0, v4, vcc
				; SI-NEXT: v_cmp_gt_u64_e32 vcc, s[34:35], v[3:4]
				; SI-NEXT: v_cndmask_b32_e32 v2, 0, v2, vcc
				; SI-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc_x2 v[1:2], off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB111_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i64_noret_scalar:			; VI-LABEL: global_atomic_uinc_wrap_i64_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB111_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v2
				; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; VI-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: v_mov_b32_e32 v5, s5
				; VI-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; VI-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB111_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i64_noret_scalar:			; GFX9-LABEL: global_atomic_uinc_wrap_i64_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5]
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB111_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_add_co_u32_e32 v0, vcc, 1, v2
				; GFX9-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v3, vcc
				; GFX9-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GFX9-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc_x2 v2, v[0:1], s[4:5]			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB111_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_uinc_wrap_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_uinc_wrap_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i64_noret_offset_scalar:			; SI-LABEL: global_atomic_uinc_wrap_i64_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: v_mov_b32_e32 v1, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v2, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB112_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v1, vcc, 1, v3
				; SI-NEXT: v_addc_u32_e32 v2, vcc, 0, v4, vcc
				; SI-NEXT: v_cmp_gt_u64_e32 vcc, s[34:35], v[3:4]
				; SI-NEXT: v_cndmask_b32_e32 v2, 0, v2, vcc
				; SI-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc_x2 v[1:2], off, s[4:7], 0 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB112_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i64_noret_offset_scalar:			; VI-LABEL: global_atomic_uinc_wrap_i64_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s34, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB112_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v2
				; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; VI-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v4, s34
				; VI-NEXT: v_mov_b32_e32 v5, s35
				; VI-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; VI-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB112_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i64_noret_offset_scalar:			; GFX9-LABEL: global_atomic_uinc_wrap_i64_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5] offset:32
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB112_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_add_co_u32_e32 v0, vcc, 1, v2
				; GFX9-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v3, vcc
				; GFX9-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; GFX9-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc_x2 v2, v[0:1], s[4:5] offset:32			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB112_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @global_atomic_uinc_wrap_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_uinc_wrap_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i64_ret_scalar:			; SI-LABEL: global_atomic_uinc_wrap_i64_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB113_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_add_i32_e32 v0, vcc, 1, v7
				; SI-NEXT: v_addc_u32_e32 v1, vcc, 0, v8, vcc
				; SI-NEXT: v_cmp_gt_u64_e32 vcc, s[34:35], v[7:8]
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_cndmask_b32_e32 v6, 0, v1, vcc
				; SI-NEXT: v_cndmask_b32_e32 v5, 0, v0, vcc
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc_x2 v[0:1], off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB113_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i64_ret_scalar:			; VI-LABEL: global_atomic_uinc_wrap_i64_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: s_mov_b64 s[34:35], 0
				; VI-NEXT: .LBB113_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v2
				; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; VI-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: v_mov_b32_e32 v5, s5
				; VI-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; VI-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; VI-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; VI-NEXT: s_cbranch_execnz .LBB113_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[34:35]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i64_ret_scalar:			; GFX9-LABEL: global_atomic_uinc_wrap_i64_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB113_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_add_co_u32_e32 v0, vcc, 1, v5
				; GFX9-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v6, vcc
				; GFX9-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[5:6]
				; GFX9-NEXT: v_cndmask_b32_e32 v4, 0, v1, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v3, 0, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc_x2 v[0:1], v2, v[0:1], s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB113_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw uinc_wrap ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @global_atomic_uinc_wrap_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_uinc_wrap_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_uinc_wrap_i64_ret_offset_scalar:			; SI-LABEL: global_atomic_uinc_wrap_i64_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: v_mov_b32_e32 v0, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v1, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[36:37], 0
				; SI-NEXT: .LBB114_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_add_i32_e32 v0, vcc, 1, v7
				; SI-NEXT: v_addc_u32_e32 v1, vcc, 0, v8, vcc
				; SI-NEXT: v_cmp_gt_u64_e32 vcc, s[34:35], v[7:8]
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_cndmask_b32_e32 v6, 0, v1, vcc
				; SI-NEXT: v_cndmask_b32_e32 v5, 0, v0, vcc
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_inc_x2 v[0:1], off, s[4:7], 0 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; SI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; SI-NEXT: s_cbranch_execnz .LBB114_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[36:37]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_uinc_wrap_i64_ret_offset_scalar:			; VI-LABEL: global_atomic_uinc_wrap_i64_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s34, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s35, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s34
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s35
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB114_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: v_add_u32_e32 v0, vcc, 1, v2
				; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v3, vcc
				; VI-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v4, s34
				; VI-NEXT: v_mov_b32_e32 v5, s35
				; VI-NEXT: v_cndmask_b32_e32 v1, 0, v1, vcc
				; VI-NEXT: v_cndmask_b32_e32 v0, 0, v0, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_inc_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB114_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_uinc_wrap_i64_ret_offset_scalar:			; GFX9-LABEL: global_atomic_uinc_wrap_i64_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5] offset:32
				; GFX9-NEXT: s_mov_b64 s[34:35], 0
				; GFX9-NEXT: .LBB114_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_add_co_u32_e32 v0, vcc, 1, v5
				; GFX9-NEXT: v_addc_co_u32_e32 v1, vcc, 0, v6, vcc
				; GFX9-NEXT: v_cmp_gt_u64_e32 vcc, s[6:7], v[5:6]
				; GFX9-NEXT: v_cndmask_b32_e32 v4, 0, v1, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v3, 0, v0, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_inc_x2 v[0:1], v2, v[0:1], s[4:5] offset:32 glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[34:35], vcc, s[34:35]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[34:35]
				; GFX9-NEXT: s_cbranch_execnz .LBB114_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[34:35]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw uinc_wrap ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------
	; atomicrmw udec_wrap			; atomicrmw udec_wrap
	; ---------------------------------------------------------------------			; ---------------------------------------------------------------------

	define void @global_atomic_udec_wrap_i64_noret(ptr addrspace(1) %ptr, i64 %in) {			define void @global_atomic_udec_wrap_i64_noret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_udec_wrap_i64_noret:			; SI-LABEL: global_atomic_udec_wrap_i64_noret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s10, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s11, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s8, s10
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s9, s10
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[8:11], 0 addr64
				; SI-NEXT: s_mov_b64 s[6:7], 0
				; SI-NEXT: .LBB115_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v4, vcc, -1, v6
				; SI-NEXT: v_addc_u32_e32 v5, vcc, -1, v7, vcc
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; SI-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; SI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; SI-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; SI-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec_x2 v[2:3], v[0:1], s[4:7], 0 addr64			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[8:11], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; SI-NEXT: s_cbranch_execnz .LBB115_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[6:7]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i64_noret:			; VI-LABEL: global_atomic_udec_wrap_i64_noret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3]			; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[8:9], 0
				; VI-NEXT: .LBB115_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; VI-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; VI-NEXT: v_add_u32_e64 v4, s[6:7], -1, v6
				; VI-NEXT: v_addc_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; VI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; VI-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; VI-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; VI-NEXT: s_cbranch_execnz .LBB115_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[8:9]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i64_noret:			; GFX9-LABEL: global_atomic_udec_wrap_i64_noret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec_x2 v[0:1], v[2:3], off			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[8:9], 0
				; GFX9-NEXT: .LBB115_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GFX9-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GFX9-NEXT: v_add_co_u32_e64 v4, s[6:7], -1, v6
				; GFX9-NEXT: v_addc_co_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GFX9-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GFX9-NEXT: s_cbranch_execnz .LBB115_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[8:9]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define void @global_atomic_udec_wrap_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {			define void @global_atomic_udec_wrap_i64_noret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_udec_wrap_i64_noret_offset:			; SI-LABEL: global_atomic_udec_wrap_i64_noret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: s_mov_b32 s10, 0
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s11, 0xf000
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: s_mov_b32 s8, s10
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: s_mov_b32 s9, s10
				; SI-NEXT: buffer_load_dwordx2 v[6:7], v[0:1], s[8:11], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[6:7], 0
				; SI-NEXT: .LBB116_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v4, vcc, -1, v6
				; SI-NEXT: v_addc_u32_e32 v5, vcc, -1, v7, vcc
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; SI-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; SI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; SI-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; SI-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v7
				; SI-NEXT: v_mov_b32_e32 v10, v6
				; SI-NEXT: v_mov_b32_e32 v9, v5
				; SI-NEXT: v_mov_b32_e32 v8, v4
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[8:11], v[0:1], s[8:11], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[8:9], v[6:7]
				; SI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; SI-NEXT: v_mov_b32_e32 v6, v8
				; SI-NEXT: v_mov_b32_e32 v7, v9
				; SI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; SI-NEXT: s_cbranch_execnz .LBB116_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[6:7]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i64_noret_offset:			; VI-LABEL: global_atomic_udec_wrap_i64_noret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[6:7], v[0:1]
				; VI-NEXT: s_mov_b64 s[8:9], 0
				; VI-NEXT: .LBB116_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; VI-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; VI-NEXT: v_add_u32_e64 v4, s[6:7], -1, v6
				; VI-NEXT: v_addc_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; VI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; VI-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; VI-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3]			; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; VI-NEXT: s_cbranch_execnz .LBB116_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[8:9]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i64_noret_offset:			; GFX9-LABEL: global_atomic_udec_wrap_i64_noret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec_x2 v[0:1], v[2:3], off offset:32			; GFX9-NEXT: global_load_dwordx2 v[6:7], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[8:9], 0
				; GFX9-NEXT: .LBB116_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GFX9-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GFX9-NEXT: v_add_co_u32_e64 v4, s[6:7], -1, v6
				; GFX9-NEXT: v_addc_co_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GFX9-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GFX9-NEXT: s_cbranch_execnz .LBB116_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[8:9]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define i64 @global_atomic_udec_wrap_i64_ret(ptr addrspace(1) %ptr, i64 %in) {			define i64 @global_atomic_udec_wrap_i64_ret(ptr addrspace(1) %ptr, i64 %in) {
	; SI-LABEL: global_atomic_udec_wrap_i64_ret:			; SI-LABEL: global_atomic_udec_wrap_i64_ret:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: v_mov_b32_e32 v4, v2
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: v_mov_b32_e32 v7, v1
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: v_mov_b32_e32 v6, v0
				; SI-NEXT: s_mov_b32 s10, 0
				; SI-NEXT: s_mov_b32 s11, 0xf000
				; SI-NEXT: s_mov_b32 s8, s10
				; SI-NEXT: s_mov_b32 s9, s10
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[8:11], 0 addr64
				; SI-NEXT: s_mov_b64 s[6:7], 0
				; SI-NEXT: .LBB117_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_add_i32_e32 v0, vcc, -1, v10
				; SI-NEXT: v_addc_u32_e32 v1, vcc, -1, v11, vcc
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[10:11]
				; SI-NEXT: v_cmp_gt_u64_e64 s[4:5], v[10:11], v[4:5]
				; SI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; SI-NEXT: v_cndmask_b32_e32 v9, v1, v5, vcc
				; SI-NEXT: v_cndmask_b32_e32 v8, v0, v4, vcc
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec_x2 v[2:3], v[0:1], s[4:7], 0 addr64 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[8:11], 0 addr64 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; SI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; SI-NEXT: s_cbranch_execnz .LBB117_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[6:7]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i64_ret:			; VI-LABEL: global_atomic_udec_wrap_i64_ret:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_load_dwordx2 v[4:5], v[0:1]
				; VI-NEXT: s_mov_b64 s[8:9], 0
				; VI-NEXT: .LBB117_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v7, v5
				; VI-NEXT: v_mov_b32_e32 v6, v4
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; VI-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; VI-NEXT: v_add_u32_e64 v4, s[6:7], -1, v6
				; VI-NEXT: v_addc_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; VI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; VI-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; VI-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; VI-NEXT: flat_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; VI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; VI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; VI-NEXT: s_cbranch_execnz .LBB117_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[8:9]
				; VI-NEXT: v_mov_b32_e32 v0, v4
				; VI-NEXT: v_mov_b32_e32 v1, v5
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i64_ret:			; GFX9-LABEL: global_atomic_udec_wrap_i64_ret:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec_x2 v[0:1], v[0:1], v[2:3], off glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off
				; GFX9-NEXT: s_mov_b64 s[8:9], 0
				; GFX9-NEXT: .LBB117_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GFX9-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GFX9-NEXT: v_add_co_u32_e64 v4, s[6:7], -1, v6
				; GFX9-NEXT: v_addc_co_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GFX9-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GFX9-NEXT: s_cbranch_execnz .LBB117_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[8:9]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw udec_wrap ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw udec_wrap ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define i64 @global_atomic_udec_wrap_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {			define i64 @global_atomic_udec_wrap_i64_ret_offset(ptr addrspace(1) %out, i64 %in) {
	; SI-LABEL: global_atomic_udec_wrap_i64_ret_offset:			; SI-LABEL: global_atomic_udec_wrap_i64_ret_offset:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_mov_b32 s6, 0			; SI-NEXT: v_mov_b32_e32 v5, v3
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: v_mov_b32_e32 v4, v2
	; SI-NEXT: s_mov_b32 s4, s6			; SI-NEXT: v_mov_b32_e32 v7, v1
	; SI-NEXT: s_mov_b32 s5, s6			; SI-NEXT: v_mov_b32_e32 v6, v0
				; SI-NEXT: s_mov_b32 s10, 0
				; SI-NEXT: s_mov_b32 s11, 0xf000
				; SI-NEXT: s_mov_b32 s8, s10
				; SI-NEXT: s_mov_b32 s9, s10
				; SI-NEXT: buffer_load_dwordx2 v[0:1], v[6:7], s[8:11], 0 addr64 offset:32
				; SI-NEXT: s_mov_b64 s[6:7], 0
				; SI-NEXT: .LBB118_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v11, v1
				; SI-NEXT: v_mov_b32_e32 v10, v0
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_add_i32_e32 v0, vcc, -1, v10
				; SI-NEXT: v_addc_u32_e32 v1, vcc, -1, v11, vcc
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[10:11]
				; SI-NEXT: v_cmp_gt_u64_e64 s[4:5], v[10:11], v[4:5]
				; SI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; SI-NEXT: v_cndmask_b32_e32 v9, v1, v5, vcc
				; SI-NEXT: v_cndmask_b32_e32 v8, v0, v4, vcc
				; SI-NEXT: v_mov_b32_e32 v0, v8
				; SI-NEXT: v_mov_b32_e32 v1, v9
				; SI-NEXT: v_mov_b32_e32 v2, v10
				; SI-NEXT: v_mov_b32_e32 v3, v11
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec_x2 v[2:3], v[0:1], s[4:7], 0 addr64 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[0:3], v[6:7], s[8:11], 0 addr64 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
	; SI-NEXT: v_mov_b32_e32 v0, v2			; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[10:11]
	; SI-NEXT: v_mov_b32_e32 v1, v3			; SI-NEXT: s_or_b64 s[6:7], vcc, s[6:7]
				; SI-NEXT: s_andn2_b64 exec, exec, s[6:7]
				; SI-NEXT: s_cbranch_execnz .LBB118_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[6:7]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i64_ret_offset:			; VI-LABEL: global_atomic_udec_wrap_i64_ret_offset:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_add_u32_e32 v0, vcc, 32, v0			; VI-NEXT: v_add_u32_e32 v4, vcc, 32, v0
	; VI-NEXT: v_addc_u32_e32 v1, vcc, 0, v1, vcc			; VI-NEXT: v_addc_u32_e32 v5, vcc, 0, v1, vcc
				; VI-NEXT: flat_load_dwordx2 v[0:1], v[4:5]
				; VI-NEXT: s_mov_b64 s[8:9], 0
				; VI-NEXT: .LBB118_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v9, v1
				; VI-NEXT: v_mov_b32_e32 v8, v0
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[8:9]
				; VI-NEXT: v_cmp_gt_u64_e64 s[4:5], v[8:9], v[2:3]
				; VI-NEXT: v_add_u32_e64 v0, s[6:7], -1, v8
				; VI-NEXT: v_addc_u32_e64 v1, s[6:7], -1, v9, s[6:7]
				; VI-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; VI-NEXT: v_cndmask_b32_e32 v7, v1, v3, vcc
				; VI-NEXT: v_cndmask_b32_e32 v6, v0, v2, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec_x2 v[0:1], v[0:1], v[2:3] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[6:9] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[8:9]
				; VI-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; VI-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; VI-NEXT: s_cbranch_execnz .LBB118_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[8:9]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i64_ret_offset:			; GFX9-LABEL: global_atomic_udec_wrap_i64_ret_offset:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec_x2 v[0:1], v[0:1], v[2:3], off offset:32 glc			; GFX9-NEXT: global_load_dwordx2 v[4:5], v[0:1], off offset:32
				; GFX9-NEXT: s_mov_b64 s[8:9], 0
				; GFX9-NEXT: .LBB118_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v7, v5
				; GFX9-NEXT: v_mov_b32_e32 v6, v4
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[6:7]
				; GFX9-NEXT: v_cmp_gt_u64_e64 s[4:5], v[6:7], v[2:3]
				; GFX9-NEXT: v_add_co_u32_e64 v4, s[6:7], -1, v6
				; GFX9-NEXT: v_addc_co_u32_e64 v5, s[6:7], -1, v7, s[6:7]
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[4:5]
				; GFX9-NEXT: v_cndmask_b32_e32 v5, v5, v3, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v4, v4, v2, vcc
				; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
				; GFX9-NEXT: global_atomic_cmpswap_x2 v[4:5], v[0:1], v[4:7], off offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[4:5], v[6:7]
				; GFX9-NEXT: s_or_b64 s[8:9], vcc, s[8:9]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[8:9]
				; GFX9-NEXT: s_cbranch_execnz .LBB118_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[8:9]
				; GFX9-NEXT: v_mov_b32_e32 v0, v4
				; GFX9-NEXT: v_mov_b32_e32 v1, v5
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx void @global_atomic_udec_wrap_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_udec_wrap_i64_noret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_udec_wrap_i64_noret_scalar:			; SI-LABEL: global_atomic_udec_wrap_i64_noret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v1, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
	; SI-NEXT: v_mov_b32_e32 v2, s34			; SI-NEXT: s_mov_b64 s[38:39], 0
				; SI-NEXT: .LBB119_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v1, vcc, -1, v3
				; SI-NEXT: v_addc_u32_e32 v2, vcc, -1, v4, vcc
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[3:4]
				; SI-NEXT: v_cmp_lt_u64_e64 s[36:37], s[34:35], v[3:4]
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, s35
				; SI-NEXT: s_or_b64 vcc, vcc, s[36:37]
				; SI-NEXT: v_cndmask_b32_e32 v2, v2, v5, vcc
				; SI-NEXT: v_mov_b32_e32 v5, s34
				; SI-NEXT: v_cndmask_b32_e32 v1, v1, v5, vcc
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec_x2 v[1:2], off, s[4:7], 0			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; SI-NEXT: s_cbranch_execnz .LBB119_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[38:39]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i64_noret_scalar:			; VI-LABEL: global_atomic_udec_wrap_i64_noret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: s_mov_b64 s[36:37], 0
				; VI-NEXT: .LBB119_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v0, vcc, -1, v2
				; VI-NEXT: v_addc_u32_e32 v1, vcc, -1, v3, vcc
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; VI-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v6, s7
				; VI-NEXT: v_mov_b32_e32 v7, s6
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v5, s5
				; VI-NEXT: v_cndmask_b32_e32 v1, v1, v6, vcc
				; VI-NEXT: v_cndmask_b32_e32 v0, v0, v7, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; VI-NEXT: s_cbranch_execnz .LBB119_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[36:37]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i64_noret_scalar:			; GFX9-LABEL: global_atomic_udec_wrap_i64_noret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5]
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_mov_b64 s[36:37], 0
				; GFX9-NEXT: .LBB119_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_add_co_u32_e32 v0, vcc, -1, v2
				; GFX9-NEXT: v_addc_co_u32_e32 v1, vcc, -1, v3, vcc
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GFX9-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v5, s7
				; GFX9-NEXT: v_mov_b32_e32 v6, s6
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GFX9-NEXT: v_cndmask_b32_e32 v1, v1, v5, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v0, v0, v6, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec_x2 v2, v[0:1], s[4:5]			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GFX9-NEXT: s_cbranch_execnz .LBB119_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[36:37]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %ptr, i64 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %ptr, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx void @global_atomic_udec_wrap_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx void @global_atomic_udec_wrap_i64_noret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_udec_wrap_i64_noret_offset_scalar:			; SI-LABEL: global_atomic_udec_wrap_i64_noret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v0, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v0, s6, 0			; SI-NEXT: v_writelane_b32 v0, s6, 0
	; SI-NEXT: v_writelane_b32 v0, s7, 1			; SI-NEXT: v_writelane_b32 v0, s7, 1
	; SI-NEXT: v_mov_b32_e32 v1, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v2, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[38:39], 0
				; SI-NEXT: .LBB120_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_add_i32_e32 v1, vcc, -1, v3
				; SI-NEXT: v_addc_u32_e32 v2, vcc, -1, v4, vcc
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[3:4]
				; SI-NEXT: v_cmp_lt_u64_e64 s[36:37], s[34:35], v[3:4]
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v5, s35
				; SI-NEXT: s_or_b64 vcc, vcc, s[36:37]
				; SI-NEXT: v_cndmask_b32_e32 v2, v2, v5, vcc
				; SI-NEXT: v_mov_b32_e32 v5, s34
				; SI-NEXT: v_cndmask_b32_e32 v1, v1, v5, vcc
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_mov_b32_e32 v6, v2
				; SI-NEXT: v_mov_b32_e32 v5, v1
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec_x2 v[1:2], off, s[4:7], 0 offset:32			; SI-NEXT: buffer_atomic_cmpswap_x2 v[5:8], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[5:6], v[3:4]
				; SI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; SI-NEXT: s_cbranch_execnz .LBB120_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[38:39]
	; SI-NEXT: v_readlane_b32 s7, v0, 1			; SI-NEXT: v_readlane_b32 s7, v0, 1
	; SI-NEXT: v_readlane_b32 s6, v0, 0			; SI-NEXT: v_readlane_b32 s6, v0, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v0, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i64_noret_offset_scalar:			; VI-LABEL: global_atomic_udec_wrap_i64_noret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s36, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s37, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s36
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s37
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: flat_load_dwordx2 v[2:3], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_mov_b64 s[38:39], 0
				; VI-NEXT: .LBB120_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_add_u32_e32 v0, vcc, -1, v2
				; VI-NEXT: v_addc_u32_e32 v1, vcc, -1, v3, vcc
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; VI-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v6, s7
				; VI-NEXT: v_mov_b32_e32 v7, s6
				; VI-NEXT: v_mov_b32_e32 v4, s36
				; VI-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v5, s37
				; VI-NEXT: v_cndmask_b32_e32 v1, v1, v6, vcc
				; VI-NEXT: v_cndmask_b32_e32 v0, v0, v7, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec_x2 v[2:3], v[0:1]			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; VI-NEXT: s_cbranch_execnz .LBB120_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[38:39]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i64_noret_offset_scalar:			; GFX9-LABEL: global_atomic_udec_wrap_i64_noret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6			; GFX9-NEXT: v_mov_b32_e32 v4, 0
	; GFX9-NEXT: v_mov_b32_e32 v1, s7			; GFX9-NEXT: global_load_dwordx2 v[2:3], v4, s[4:5] offset:32
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: s_mov_b64 s[36:37], 0
				; GFX9-NEXT: .LBB120_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_add_co_u32_e32 v0, vcc, -1, v2
				; GFX9-NEXT: v_addc_co_u32_e32 v1, vcc, -1, v3, vcc
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; GFX9-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v5, s7
				; GFX9-NEXT: v_mov_b32_e32 v6, s6
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GFX9-NEXT: v_cndmask_b32_e32 v1, v1, v5, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v0, v0, v6, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec_x2 v2, v[0:1], s[4:5] offset:32			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v4, v[0:3], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; GFX9-NEXT: v_mov_b32_e32 v3, v1
				; GFX9-NEXT: s_or_b64 s[36:37], vcc, s[36:37]
				; GFX9-NEXT: v_mov_b32_e32 v2, v0
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[36:37]
				; GFX9-NEXT: s_cbranch_execnz .LBB120_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[36:37]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 %in seq_cst			%tmp0 = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 %in seq_cst
	ret void			ret void
	}			}

	define amdgpu_gfx i64 @global_atomic_udec_wrap_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_udec_wrap_i64_ret_scalar(ptr addrspace(1) inreg %ptr, i64 inreg %in) {
	; SI-LABEL: global_atomic_udec_wrap_i64_ret_scalar:			; SI-LABEL: global_atomic_udec_wrap_i64_ret_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: s_mov_b32 s34, s7			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: s_mov_b32 s35, s6			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
	; SI-NEXT: v_mov_b32_e32 v0, s35			; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0
				; SI-NEXT: s_mov_b64 s[38:39], 0
				; SI-NEXT: .LBB121_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_add_i32_e32 v0, vcc, -1, v7
				; SI-NEXT: v_addc_u32_e32 v1, vcc, -1, v8, vcc
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[7:8]
				; SI-NEXT: v_cmp_lt_u64_e64 s[36:37], s[34:35], v[7:8]
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v3, s35
				; SI-NEXT: s_or_b64 vcc, vcc, s[36:37]
				; SI-NEXT: v_cndmask_b32_e32 v6, v1, v3, vcc
	; SI-NEXT: v_mov_b32_e32 v1, s34			; SI-NEXT: v_mov_b32_e32 v1, s34
				; SI-NEXT: v_cndmask_b32_e32 v5, v0, v1, vcc
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec_x2 v[0:1], off, s[4:7], 0 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; SI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; SI-NEXT: s_cbranch_execnz .LBB121_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[38:39]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i64_ret_scalar:			; VI-LABEL: global_atomic_udec_wrap_i64_ret_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v0, s4
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: v_mov_b32_e32 v1, s5
	; VI-NEXT: v_mov_b32_e32 v2, s4			; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s5			; VI-NEXT: s_mov_b64 s[38:39], 0
				; VI-NEXT: .LBB121_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; VI-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; VI-NEXT: v_add_u32_e64 v7, s[36:37], -1, v2
				; VI-NEXT: v_mov_b32_e32 v0, s7
				; VI-NEXT: v_mov_b32_e32 v6, s6
				; VI-NEXT: v_mov_b32_e32 v4, s4
				; VI-NEXT: v_addc_u32_e64 v1, s[36:37], -1, v3, s[36:37]
				; VI-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v5, s5
				; VI-NEXT: v_cndmask_b32_e32 v1, v1, v0, vcc
				; VI-NEXT: v_cndmask_b32_e32 v0, v7, v6, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; VI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; VI-NEXT: s_cbranch_execnz .LBB121_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[38:39]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i64_ret_scalar:			; GFX9-LABEL: global_atomic_udec_wrap_i64_ret_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5]
				; GFX9-NEXT: s_mov_b64 s[38:39], 0
				; GFX9-NEXT: .LBB121_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[5:6]
				; GFX9-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[5:6]
				; GFX9-NEXT: v_add_co_u32_e64 v3, s[36:37], -1, v5
				; GFX9-NEXT: v_mov_b32_e32 v0, s7
				; GFX9-NEXT: v_mov_b32_e32 v1, s6
				; GFX9-NEXT: v_addc_co_u32_e64 v4, s[36:37], -1, v6, s[36:37]
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GFX9-NEXT: v_cndmask_b32_e32 v4, v4, v0, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v3, v3, v1, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec_x2 v[0:1], v2, v[0:1], s[4:5] glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GFX9-NEXT: s_cbranch_execnz .LBB121_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[38:39]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%result = atomicrmw udec_wrap ptr addrspace(1) %ptr, i64 %in seq_cst			%result = atomicrmw udec_wrap ptr addrspace(1) %ptr, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

	define amdgpu_gfx i64 @global_atomic_udec_wrap_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {			define amdgpu_gfx i64 @global_atomic_udec_wrap_i64_ret_offset_scalar(ptr addrspace(1) inreg %out, i64 inreg %in) {
	; SI-LABEL: global_atomic_udec_wrap_i64_ret_offset_scalar:			; SI-LABEL: global_atomic_udec_wrap_i64_ret_offset_scalar:
	; SI: ; %bb.0:			; SI: ; %bb.0:
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill			; SI-NEXT: buffer_store_dword v2, off, s[0:3], s32 ; 4-byte Folded Spill
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt expcnt(0)			; SI-NEXT: s_waitcnt expcnt(0)
	; SI-NEXT: v_writelane_b32 v2, s6, 0			; SI-NEXT: v_writelane_b32 v2, s6, 0
	; SI-NEXT: v_writelane_b32 v2, s7, 1			; SI-NEXT: v_writelane_b32 v2, s7, 1
	; SI-NEXT: v_mov_b32_e32 v0, s6			; SI-NEXT: s_mov_b32 s35, s7
	; SI-NEXT: v_mov_b32_e32 v1, s7			; SI-NEXT: s_mov_b32 s34, s6
	; SI-NEXT: s_mov_b32 s7, 0xf000			; SI-NEXT: s_mov_b32 s7, 0xf000
	; SI-NEXT: s_mov_b32 s6, -1			; SI-NEXT: s_mov_b32 s6, -1
				; SI-NEXT: buffer_load_dwordx2 v[3:4], off, s[4:7], 0 offset:32
				; SI-NEXT: s_mov_b64 s[38:39], 0
				; SI-NEXT: .LBB122_1: ; %atomicrmw.start
				; SI-NEXT: ; =>This Inner Loop Header: Depth=1
				; SI-NEXT: s_waitcnt vmcnt(0)
				; SI-NEXT: v_mov_b32_e32 v8, v4
				; SI-NEXT: v_mov_b32_e32 v7, v3
				; SI-NEXT: v_add_i32_e32 v0, vcc, -1, v7
				; SI-NEXT: v_addc_u32_e32 v1, vcc, -1, v8, vcc
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[7:8]
				; SI-NEXT: v_cmp_lt_u64_e64 s[36:37], s[34:35], v[7:8]
				; SI-NEXT: s_waitcnt expcnt(0)
				; SI-NEXT: v_mov_b32_e32 v3, s35
				; SI-NEXT: s_or_b64 vcc, vcc, s[36:37]
				; SI-NEXT: v_cndmask_b32_e32 v6, v1, v3, vcc
				; SI-NEXT: v_mov_b32_e32 v1, s34
				; SI-NEXT: v_cndmask_b32_e32 v5, v0, v1, vcc
				; SI-NEXT: v_mov_b32_e32 v3, v5
				; SI-NEXT: v_mov_b32_e32 v4, v6
				; SI-NEXT: v_mov_b32_e32 v5, v7
				; SI-NEXT: v_mov_b32_e32 v6, v8
	; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; SI-NEXT: buffer_atomic_dec_x2 v[0:1], off, s[4:7], 0 offset:32 glc			; SI-NEXT: buffer_atomic_cmpswap_x2 v[3:6], off, s[4:7], 0 offset:32 glc
	; SI-NEXT: s_waitcnt vmcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0)
	; SI-NEXT: buffer_wbinvl1			; SI-NEXT: buffer_wbinvl1
				; SI-NEXT: v_cmp_eq_u64_e32 vcc, v[3:4], v[7:8]
				; SI-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; SI-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; SI-NEXT: s_cbranch_execnz .LBB122_1
				; SI-NEXT: ; %bb.2: ; %atomicrmw.end
				; SI-NEXT: s_or_b64 exec, exec, s[38:39]
				; SI-NEXT: v_mov_b32_e32 v0, v3
				; SI-NEXT: v_mov_b32_e32 v1, v4
	; SI-NEXT: v_readlane_b32 s7, v2, 1			; SI-NEXT: v_readlane_b32 s7, v2, 1
	; SI-NEXT: v_readlane_b32 s6, v2, 0			; SI-NEXT: v_readlane_b32 s6, v2, 0
	; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1			; SI-NEXT: s_xor_saveexec_b64 s[34:35], -1
	; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload			; SI-NEXT: buffer_load_dword v2, off, s[0:3], s32 ; 4-byte Folded Reload
	; SI-NEXT: s_mov_b64 exec, s[34:35]			; SI-NEXT: s_mov_b64 exec, s[34:35]
	; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)			; SI-NEXT: s_waitcnt vmcnt(0) expcnt(0)
	; SI-NEXT: s_setpc_b64 s[30:31]			; SI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; VI-LABEL: global_atomic_udec_wrap_i64_ret_offset_scalar:			; VI-LABEL: global_atomic_udec_wrap_i64_ret_offset_scalar:
	; VI: ; %bb.0:			; VI: ; %bb.0:
	; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; VI-NEXT: s_add_u32 s34, s4, 32			; VI-NEXT: s_add_u32 s38, s4, 32
	; VI-NEXT: s_addc_u32 s35, s5, 0			; VI-NEXT: s_addc_u32 s39, s5, 0
	; VI-NEXT: v_mov_b32_e32 v2, s34			; VI-NEXT: v_mov_b32_e32 v0, s38
	; VI-NEXT: v_mov_b32_e32 v0, s6			; VI-NEXT: v_mov_b32_e32 v1, s39
	; VI-NEXT: v_mov_b32_e32 v1, s7			; VI-NEXT: flat_load_dwordx2 v[0:1], v[0:1]
	; VI-NEXT: v_mov_b32_e32 v3, s35			; VI-NEXT: s_mov_b64 s[40:41], 0
				; VI-NEXT: .LBB122_1: ; %atomicrmw.start
				; VI-NEXT: ; =>This Inner Loop Header: Depth=1
				; VI-NEXT: s_waitcnt vmcnt(0)
				; VI-NEXT: v_mov_b32_e32 v3, v1
				; VI-NEXT: v_mov_b32_e32 v2, v0
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[2:3]
				; VI-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[2:3]
				; VI-NEXT: v_add_u32_e64 v7, s[36:37], -1, v2
				; VI-NEXT: v_mov_b32_e32 v0, s7
				; VI-NEXT: v_mov_b32_e32 v6, s6
				; VI-NEXT: v_mov_b32_e32 v4, s38
				; VI-NEXT: v_addc_u32_e64 v1, s[36:37], -1, v3, s[36:37]
				; VI-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; VI-NEXT: v_mov_b32_e32 v5, s39
				; VI-NEXT: v_cndmask_b32_e32 v1, v1, v0, vcc
				; VI-NEXT: v_cndmask_b32_e32 v0, v7, v6, vcc
	; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; VI-NEXT: flat_atomic_dec_x2 v[0:1], v[2:3], v[0:1] glc			; VI-NEXT: flat_atomic_cmpswap_x2 v[0:1], v[4:5], v[0:3] glc
	; VI-NEXT: s_waitcnt vmcnt(0)			; VI-NEXT: s_waitcnt vmcnt(0)
	; VI-NEXT: buffer_wbinvl1_vol			; VI-NEXT: buffer_wbinvl1_vol
				; VI-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[2:3]
				; VI-NEXT: s_or_b64 s[40:41], vcc, s[40:41]
				; VI-NEXT: s_andn2_b64 exec, exec, s[40:41]
				; VI-NEXT: s_cbranch_execnz .LBB122_1
				; VI-NEXT: ; %bb.2: ; %atomicrmw.end
				; VI-NEXT: s_or_b64 exec, exec, s[40:41]
	; VI-NEXT: s_setpc_b64 s[30:31]			; VI-NEXT: s_setpc_b64 s[30:31]
	;			;
	; GFX9-LABEL: global_atomic_udec_wrap_i64_ret_offset_scalar:			; GFX9-LABEL: global_atomic_udec_wrap_i64_ret_offset_scalar:
	; GFX9: ; %bb.0:			; GFX9: ; %bb.0:
	; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) expcnt(0) lgkmcnt(0)
	; GFX9-NEXT: v_mov_b32_e32 v0, s6
	; GFX9-NEXT: v_mov_b32_e32 v1, s7
	; GFX9-NEXT: v_mov_b32_e32 v2, 0			; GFX9-NEXT: v_mov_b32_e32 v2, 0
				; GFX9-NEXT: global_load_dwordx2 v[0:1], v2, s[4:5] offset:32
				; GFX9-NEXT: s_mov_b64 s[38:39], 0
				; GFX9-NEXT: .LBB122_1: ; %atomicrmw.start
				; GFX9-NEXT: ; =>This Inner Loop Header: Depth=1
				; GFX9-NEXT: s_waitcnt vmcnt(0)
				; GFX9-NEXT: v_mov_b32_e32 v6, v1
				; GFX9-NEXT: v_mov_b32_e32 v5, v0
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, 0, v[5:6]
				; GFX9-NEXT: v_cmp_lt_u64_e64 s[34:35], s[6:7], v[5:6]
				; GFX9-NEXT: v_add_co_u32_e64 v3, s[36:37], -1, v5
				; GFX9-NEXT: v_mov_b32_e32 v0, s7
				; GFX9-NEXT: v_mov_b32_e32 v1, s6
				; GFX9-NEXT: v_addc_co_u32_e64 v4, s[36:37], -1, v6, s[36:37]
				; GFX9-NEXT: s_or_b64 vcc, vcc, s[34:35]
				; GFX9-NEXT: v_cndmask_b32_e32 v4, v4, v0, vcc
				; GFX9-NEXT: v_cndmask_b32_e32 v3, v3, v1, vcc
	; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0) lgkmcnt(0)
	; GFX9-NEXT: global_atomic_dec_x2 v[0:1], v2, v[0:1], s[4:5] offset:32 glc			; GFX9-NEXT: global_atomic_cmpswap_x2 v[0:1], v2, v[3:6], s[4:5] offset:32 glc
	; GFX9-NEXT: s_waitcnt vmcnt(0)			; GFX9-NEXT: s_waitcnt vmcnt(0)
	; GFX9-NEXT: buffer_wbinvl1_vol			; GFX9-NEXT: buffer_wbinvl1_vol
				; GFX9-NEXT: v_cmp_eq_u64_e32 vcc, v[0:1], v[5:6]
				; GFX9-NEXT: s_or_b64 s[38:39], vcc, s[38:39]
				; GFX9-NEXT: s_andn2_b64 exec, exec, s[38:39]
				; GFX9-NEXT: s_cbranch_execnz .LBB122_1
				; GFX9-NEXT: ; %bb.2: ; %atomicrmw.end
				; GFX9-NEXT: s_or_b64 exec, exec, s[38:39]
	; GFX9-NEXT: s_setpc_b64 s[30:31]			; GFX9-NEXT: s_setpc_b64 s[30:31]
	%gep = getelementptr i64, ptr addrspace(1) %out, i64 4			%gep = getelementptr i64, ptr addrspace(1) %out, i64 4
	%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 %in seq_cst			%result = atomicrmw udec_wrap ptr addrspace(1) %gep, i64 %in seq_cst
	ret i64 %result			ret i64 %result
	}			}

llvm/test/Transforms/AtomicExpand/AMDGPU/expand-atomic-i16-system.ll

	Show First 20 Lines • Show All 147 Lines • ▼ Show 20 Lines
	; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3			; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3
	; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3			; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3
	; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32			; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32
	; CHECK-NEXT: [[MASK:%.*]] = shl i32 65535, [[SHIFTAMT]]			; CHECK-NEXT: [[MASK:%.*]] = shl i32 65535, [[SHIFTAMT]]
	; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1			; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1
	; CHECK-NEXT: [[TMP3:%.]] = zext i16 [[VALUE:%.]] to i32			; CHECK-NEXT: [[TMP3:%.]] = zext i16 [[VALUE:%.]] to i32
	; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]			; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]
	; CHECK-NEXT: [[ANDOPERAND:%.*]] = or i32 [[INV_MASK]], [[VALOPERAND_SHIFTED]]			; CHECK-NEXT: [[ANDOPERAND:%.*]] = or i32 [[INV_MASK]], [[VALOPERAND_SHIFTED]]
	; CHECK-NEXT: [[TMP4:%.*]] = atomicrmw and ptr addrspace(1) [[ALIGNEDADDR]], i32 [[ANDOPERAND]] seq_cst, align 4			; CHECK-NEXT: [[TMP4:%.*]] = load i32, ptr addrspace(1) [[ALIGNEDADDR]], align 4
	; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[TMP4]], [[SHIFTAMT]]			; CHECK-NEXT: br label [[ATOMICRMW_START:%.*]]
				; CHECK: atomicrmw.start:
				; CHECK-NEXT: [[LOADED:%.]] = phi i32 [ [[TMP4]], [[TMP0:%.]] ], [ [[NEWLOADED:%.*]], [[ATOMICRMW_START]] ]
				; CHECK-NEXT: [[NEW:%.*]] = and i32 [[LOADED]], [[ANDOPERAND]]
				; CHECK-NEXT: [[TMP5:%.*]] = cmpxchg ptr addrspace(1) [[ALIGNEDADDR]], i32 [[LOADED]], i32 [[NEW]] seq_cst seq_cst, align 4
				; CHECK-NEXT: [[SUCCESS:%.*]] = extractvalue { i32, i1 } [[TMP5]], 1
				; CHECK-NEXT: [[NEWLOADED]] = extractvalue { i32, i1 } [[TMP5]], 0
				; CHECK-NEXT: br i1 [[SUCCESS]], label [[ATOMICRMW_END:%.*]], label [[ATOMICRMW_START]]
				; CHECK: atomicrmw.end:
				; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[NEWLOADED]], [[SHIFTAMT]]
	; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i16			; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i16
	; CHECK-NEXT: ret i16 [[EXTRACTED]]			; CHECK-NEXT: ret i16 [[EXTRACTED]]
	;			;
	%res = atomicrmw and ptr addrspace(1) %ptr, i16 %value seq_cst			%res = atomicrmw and ptr addrspace(1) %ptr, i16 %value seq_cst
	ret i16 %res			ret i16 %res
	}			}

	define i16 @test_atomicrmw_nand_i16_global_system(ptr addrspace(1) %ptr, i16 %value) {			define i16 @test_atomicrmw_nand_i16_global_system(ptr addrspace(1) %ptr, i16 %value) {
	Show All 35 Lines
	; CHECK-NEXT: [[TMP1:%.*]] = ptrtoint ptr addrspace(1) [[PTR]] to i64			; CHECK-NEXT: [[TMP1:%.*]] = ptrtoint ptr addrspace(1) [[PTR]] to i64
	; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3			; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3
	; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3			; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3
	; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32			; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32
	; CHECK-NEXT: [[MASK:%.*]] = shl i32 65535, [[SHIFTAMT]]			; CHECK-NEXT: [[MASK:%.*]] = shl i32 65535, [[SHIFTAMT]]
	; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1			; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1
	; CHECK-NEXT: [[TMP3:%.]] = zext i16 [[VALUE:%.]] to i32			; CHECK-NEXT: [[TMP3:%.]] = zext i16 [[VALUE:%.]] to i32
	; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]			; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]
	; CHECK-NEXT: [[TMP4:%.*]] = atomicrmw or ptr addrspace(1) [[ALIGNEDADDR]], i32 [[VALOPERAND_SHIFTED]] seq_cst, align 4			; CHECK-NEXT: [[TMP4:%.*]] = load i32, ptr addrspace(1) [[ALIGNEDADDR]], align 4
	; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[TMP4]], [[SHIFTAMT]]			; CHECK-NEXT: br label [[ATOMICRMW_START:%.*]]
				; CHECK: atomicrmw.start:
				; CHECK-NEXT: [[LOADED:%.]] = phi i32 [ [[TMP4]], [[TMP0:%.]] ], [ [[NEWLOADED:%.*]], [[ATOMICRMW_START]] ]
				; CHECK-NEXT: [[NEW:%.*]] = or i32 [[LOADED]], [[VALOPERAND_SHIFTED]]
				; CHECK-NEXT: [[TMP5:%.*]] = cmpxchg ptr addrspace(1) [[ALIGNEDADDR]], i32 [[LOADED]], i32 [[NEW]] seq_cst seq_cst, align 4
				; CHECK-NEXT: [[SUCCESS:%.*]] = extractvalue { i32, i1 } [[TMP5]], 1
				; CHECK-NEXT: [[NEWLOADED]] = extractvalue { i32, i1 } [[TMP5]], 0
				; CHECK-NEXT: br i1 [[SUCCESS]], label [[ATOMICRMW_END:%.*]], label [[ATOMICRMW_START]]
				; CHECK: atomicrmw.end:
				; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[NEWLOADED]], [[SHIFTAMT]]
	; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i16			; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i16
	; CHECK-NEXT: ret i16 [[EXTRACTED]]			; CHECK-NEXT: ret i16 [[EXTRACTED]]
	;			;
	%res = atomicrmw or ptr addrspace(1) %ptr, i16 %value seq_cst			%res = atomicrmw or ptr addrspace(1) %ptr, i16 %value seq_cst
	ret i16 %res			ret i16 %res
	}			}

	define i16 @test_atomicrmw_xor_i16_global_system(ptr addrspace(1) %ptr, i16 %value) {			define i16 @test_atomicrmw_xor_i16_global_system(ptr addrspace(1) %ptr, i16 %value) {
	; CHECK-LABEL: @test_atomicrmw_xor_i16_global_system(			; CHECK-LABEL: @test_atomicrmw_xor_i16_global_system(
	; CHECK-NEXT: [[ALIGNEDADDR:%.]] = call ptr addrspace(1) @llvm.ptrmask.p1.i64(ptr addrspace(1) [[PTR:%.]], i64 -4)			; CHECK-NEXT: [[ALIGNEDADDR:%.]] = call ptr addrspace(1) @llvm.ptrmask.p1.i64(ptr addrspace(1) [[PTR:%.]], i64 -4)
	; CHECK-NEXT: [[TMP1:%.*]] = ptrtoint ptr addrspace(1) [[PTR]] to i64			; CHECK-NEXT: [[TMP1:%.*]] = ptrtoint ptr addrspace(1) [[PTR]] to i64
	; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3			; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3
	; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3			; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3
	; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32			; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32
	; CHECK-NEXT: [[MASK:%.*]] = shl i32 65535, [[SHIFTAMT]]			; CHECK-NEXT: [[MASK:%.*]] = shl i32 65535, [[SHIFTAMT]]
	; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1			; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1
	; CHECK-NEXT: [[TMP3:%.]] = zext i16 [[VALUE:%.]] to i32			; CHECK-NEXT: [[TMP3:%.]] = zext i16 [[VALUE:%.]] to i32
	; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]			; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]
	; CHECK-NEXT: [[TMP4:%.*]] = atomicrmw xor ptr addrspace(1) [[ALIGNEDADDR]], i32 [[VALOPERAND_SHIFTED]] seq_cst, align 4			; CHECK-NEXT: [[TMP4:%.*]] = load i32, ptr addrspace(1) [[ALIGNEDADDR]], align 4
	; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[TMP4]], [[SHIFTAMT]]			; CHECK-NEXT: br label [[ATOMICRMW_START:%.*]]
				; CHECK: atomicrmw.start:
				; CHECK-NEXT: [[LOADED:%.]] = phi i32 [ [[TMP4]], [[TMP0:%.]] ], [ [[NEWLOADED:%.*]], [[ATOMICRMW_START]] ]
				; CHECK-NEXT: [[NEW:%.*]] = xor i32 [[LOADED]], [[VALOPERAND_SHIFTED]]
				; CHECK-NEXT: [[TMP5:%.*]] = cmpxchg ptr addrspace(1) [[ALIGNEDADDR]], i32 [[LOADED]], i32 [[NEW]] seq_cst seq_cst, align 4
				; CHECK-NEXT: [[SUCCESS:%.*]] = extractvalue { i32, i1 } [[TMP5]], 1
				; CHECK-NEXT: [[NEWLOADED]] = extractvalue { i32, i1 } [[TMP5]], 0
				; CHECK-NEXT: br i1 [[SUCCESS]], label [[ATOMICRMW_END:%.*]], label [[ATOMICRMW_START]]
				; CHECK: atomicrmw.end:
				; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[NEWLOADED]], [[SHIFTAMT]]
	; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i16			; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i16
	; CHECK-NEXT: ret i16 [[EXTRACTED]]			; CHECK-NEXT: ret i16 [[EXTRACTED]]
	;			;
	%res = atomicrmw xor ptr addrspace(1) %ptr, i16 %value seq_cst			%res = atomicrmw xor ptr addrspace(1) %ptr, i16 %value seq_cst
	ret i16 %res			ret i16 %res
	}			}

	define i16 @test_atomicrmw_max_i16_global_system(ptr addrspace(1) %ptr, i16 %value) {			define i16 @test_atomicrmw_max_i16_global_system(ptr addrspace(1) %ptr, i16 %value) {
	▲ Show 20 Lines • Show All 568 Lines • Show Last 20 Lines

llvm/test/Transforms/AtomicExpand/AMDGPU/expand-atomic-i8-system.ll

	Show First 20 Lines • Show All 156 Lines • ▼ Show 20 Lines
	; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3			; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3
	; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3			; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3
	; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32			; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32
	; CHECK-NEXT: [[MASK:%.*]] = shl i32 255, [[SHIFTAMT]]			; CHECK-NEXT: [[MASK:%.*]] = shl i32 255, [[SHIFTAMT]]
	; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1			; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1
	; CHECK-NEXT: [[TMP3:%.]] = zext i8 [[VALUE:%.]] to i32			; CHECK-NEXT: [[TMP3:%.]] = zext i8 [[VALUE:%.]] to i32
	; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]			; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]
	; CHECK-NEXT: [[ANDOPERAND:%.*]] = or i32 [[INV_MASK]], [[VALOPERAND_SHIFTED]]			; CHECK-NEXT: [[ANDOPERAND:%.*]] = or i32 [[INV_MASK]], [[VALOPERAND_SHIFTED]]
	; CHECK-NEXT: [[TMP4:%.*]] = atomicrmw and ptr addrspace(1) [[ALIGNEDADDR]], i32 [[ANDOPERAND]] seq_cst, align 4			; CHECK-NEXT: [[TMP4:%.*]] = load i32, ptr addrspace(1) [[ALIGNEDADDR]], align 4
	; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[TMP4]], [[SHIFTAMT]]			; CHECK-NEXT: br label [[ATOMICRMW_START:%.*]]
				; CHECK: atomicrmw.start:
				; CHECK-NEXT: [[LOADED:%.]] = phi i32 [ [[TMP4]], [[TMP0:%.]] ], [ [[NEWLOADED:%.*]], [[ATOMICRMW_START]] ]
				; CHECK-NEXT: [[NEW:%.*]] = and i32 [[LOADED]], [[ANDOPERAND]]
				; CHECK-NEXT: [[TMP5:%.*]] = cmpxchg ptr addrspace(1) [[ALIGNEDADDR]], i32 [[LOADED]], i32 [[NEW]] seq_cst seq_cst, align 4
				; CHECK-NEXT: [[SUCCESS:%.*]] = extractvalue { i32, i1 } [[TMP5]], 1
				; CHECK-NEXT: [[NEWLOADED]] = extractvalue { i32, i1 } [[TMP5]], 0
				; CHECK-NEXT: br i1 [[SUCCESS]], label [[ATOMICRMW_END:%.*]], label [[ATOMICRMW_START]]
				; CHECK: atomicrmw.end:
				; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[NEWLOADED]], [[SHIFTAMT]]
	; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i8			; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i8
	; CHECK-NEXT: ret i8 [[EXTRACTED]]			; CHECK-NEXT: ret i8 [[EXTRACTED]]
	;			;
	%res = atomicrmw and ptr addrspace(1) %ptr, i8 %value seq_cst			%res = atomicrmw and ptr addrspace(1) %ptr, i8 %value seq_cst
	ret i8 %res			ret i8 %res
	}			}

	define i8 @test_atomicrmw_nand_i8_global_system(ptr addrspace(1) %ptr, i8 %value) {			define i8 @test_atomicrmw_nand_i8_global_system(ptr addrspace(1) %ptr, i8 %value) {
	Show All 35 Lines
	; CHECK-NEXT: [[TMP1:%.*]] = ptrtoint ptr addrspace(1) [[PTR]] to i64			; CHECK-NEXT: [[TMP1:%.*]] = ptrtoint ptr addrspace(1) [[PTR]] to i64
	; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3			; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3
	; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3			; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3
	; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32			; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32
	; CHECK-NEXT: [[MASK:%.*]] = shl i32 255, [[SHIFTAMT]]			; CHECK-NEXT: [[MASK:%.*]] = shl i32 255, [[SHIFTAMT]]
	; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1			; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1
	; CHECK-NEXT: [[TMP3:%.]] = zext i8 [[VALUE:%.]] to i32			; CHECK-NEXT: [[TMP3:%.]] = zext i8 [[VALUE:%.]] to i32
	; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]			; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]
	; CHECK-NEXT: [[TMP4:%.*]] = atomicrmw or ptr addrspace(1) [[ALIGNEDADDR]], i32 [[VALOPERAND_SHIFTED]] seq_cst, align 4			; CHECK-NEXT: [[TMP4:%.*]] = load i32, ptr addrspace(1) [[ALIGNEDADDR]], align 4
	; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[TMP4]], [[SHIFTAMT]]			; CHECK-NEXT: br label [[ATOMICRMW_START:%.*]]
				; CHECK: atomicrmw.start:
				; CHECK-NEXT: [[LOADED:%.]] = phi i32 [ [[TMP4]], [[TMP0:%.]] ], [ [[NEWLOADED:%.*]], [[ATOMICRMW_START]] ]
				; CHECK-NEXT: [[NEW:%.*]] = or i32 [[LOADED]], [[VALOPERAND_SHIFTED]]
				; CHECK-NEXT: [[TMP5:%.*]] = cmpxchg ptr addrspace(1) [[ALIGNEDADDR]], i32 [[LOADED]], i32 [[NEW]] seq_cst seq_cst, align 4
				; CHECK-NEXT: [[SUCCESS:%.*]] = extractvalue { i32, i1 } [[TMP5]], 1
				; CHECK-NEXT: [[NEWLOADED]] = extractvalue { i32, i1 } [[TMP5]], 0
				; CHECK-NEXT: br i1 [[SUCCESS]], label [[ATOMICRMW_END:%.*]], label [[ATOMICRMW_START]]
				; CHECK: atomicrmw.end:
				; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[NEWLOADED]], [[SHIFTAMT]]
	; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i8			; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i8
	; CHECK-NEXT: ret i8 [[EXTRACTED]]			; CHECK-NEXT: ret i8 [[EXTRACTED]]
	;			;
	%res = atomicrmw or ptr addrspace(1) %ptr, i8 %value seq_cst			%res = atomicrmw or ptr addrspace(1) %ptr, i8 %value seq_cst
	ret i8 %res			ret i8 %res
	}			}

	define i8 @test_atomicrmw_xor_i8_global_system(ptr addrspace(1) %ptr, i8 %value) {			define i8 @test_atomicrmw_xor_i8_global_system(ptr addrspace(1) %ptr, i8 %value) {
	; CHECK-LABEL: @test_atomicrmw_xor_i8_global_system(			; CHECK-LABEL: @test_atomicrmw_xor_i8_global_system(
	; CHECK-NEXT: [[ALIGNEDADDR:%.]] = call ptr addrspace(1) @llvm.ptrmask.p1.i64(ptr addrspace(1) [[PTR:%.]], i64 -4)			; CHECK-NEXT: [[ALIGNEDADDR:%.]] = call ptr addrspace(1) @llvm.ptrmask.p1.i64(ptr addrspace(1) [[PTR:%.]], i64 -4)
	; CHECK-NEXT: [[TMP1:%.*]] = ptrtoint ptr addrspace(1) [[PTR]] to i64			; CHECK-NEXT: [[TMP1:%.*]] = ptrtoint ptr addrspace(1) [[PTR]] to i64
	; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3			; CHECK-NEXT: [[PTRLSB:%.*]] = and i64 [[TMP1]], 3
	; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3			; CHECK-NEXT: [[TMP2:%.*]] = shl i64 [[PTRLSB]], 3
	; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32			; CHECK-NEXT: [[SHIFTAMT:%.*]] = trunc i64 [[TMP2]] to i32
	; CHECK-NEXT: [[MASK:%.*]] = shl i32 255, [[SHIFTAMT]]			; CHECK-NEXT: [[MASK:%.*]] = shl i32 255, [[SHIFTAMT]]
	; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1			; CHECK-NEXT: [[INV_MASK:%.*]] = xor i32 [[MASK]], -1
	; CHECK-NEXT: [[TMP3:%.]] = zext i8 [[VALUE:%.]] to i32			; CHECK-NEXT: [[TMP3:%.]] = zext i8 [[VALUE:%.]] to i32
	; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]			; CHECK-NEXT: [[VALOPERAND_SHIFTED:%.*]] = shl i32 [[TMP3]], [[SHIFTAMT]]
	; CHECK-NEXT: [[TMP4:%.*]] = atomicrmw xor ptr addrspace(1) [[ALIGNEDADDR]], i32 [[VALOPERAND_SHIFTED]] seq_cst, align 4			; CHECK-NEXT: [[TMP4:%.*]] = load i32, ptr addrspace(1) [[ALIGNEDADDR]], align 4
	; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[TMP4]], [[SHIFTAMT]]			; CHECK-NEXT: br label [[ATOMICRMW_START:%.*]]
				; CHECK: atomicrmw.start:
				; CHECK-NEXT: [[LOADED:%.]] = phi i32 [ [[TMP4]], [[TMP0:%.]] ], [ [[NEWLOADED:%.*]], [[ATOMICRMW_START]] ]
				; CHECK-NEXT: [[NEW:%.*]] = xor i32 [[LOADED]], [[VALOPERAND_SHIFTED]]
				; CHECK-NEXT: [[TMP5:%.*]] = cmpxchg ptr addrspace(1) [[ALIGNEDADDR]], i32 [[LOADED]], i32 [[NEW]] seq_cst seq_cst, align 4
				; CHECK-NEXT: [[SUCCESS:%.*]] = extractvalue { i32, i1 } [[TMP5]], 1
				; CHECK-NEXT: [[NEWLOADED]] = extractvalue { i32, i1 } [[TMP5]], 0
				; CHECK-NEXT: br i1 [[SUCCESS]], label [[ATOMICRMW_END:%.*]], label [[ATOMICRMW_START]]
				; CHECK: atomicrmw.end:
				; CHECK-NEXT: [[SHIFTED:%.*]] = lshr i32 [[NEWLOADED]], [[SHIFTAMT]]
	; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i8			; CHECK-NEXT: [[EXTRACTED:%.*]] = trunc i32 [[SHIFTED]] to i8
	; CHECK-NEXT: ret i8 [[EXTRACTED]]			; CHECK-NEXT: ret i8 [[EXTRACTED]]
	;			;
	%res = atomicrmw xor ptr addrspace(1) %ptr, i8 %value seq_cst			%res = atomicrmw xor ptr addrspace(1) %ptr, i8 %value seq_cst
	ret i8 %res			ret i8 %res
	}			}

	define i8 @test_atomicrmw_max_i8_global_system(ptr addrspace(1) %ptr, i8 %value) {			define i8 @test_atomicrmw_max_i8_global_system(ptr addrspace(1) %ptr, i8 %value) {
	▲ Show 20 Lines • Show All 569 Lines • Show Last 20 Lines

This is an archive of the discontinued LLVM Phabricator instance.

AMDGPU: Expand remaining system atomic operationsNeeds ReviewPublic

Details

Diff Detail

Unit TestsFailed

Event Timeline

Revision Contents

Diff 548397

llvm/lib/Target/AMDGPU/SIISelLowering.cpp

llvm/test/CodeGen/AMDGPU/GlobalISel/atomicrmw_udec_wrap.ll

llvm/test/CodeGen/AMDGPU/GlobalISel/atomicrmw_uinc_wrap.ll

llvm/test/CodeGen/AMDGPU/flat_atomics_i32_system.ll

llvm/test/CodeGen/AMDGPU/flat_atomics_i64_system.ll

llvm/test/CodeGen/AMDGPU/global_atomics_i32_system.ll

llvm/test/CodeGen/AMDGPU/global_atomics_i64_system.ll

llvm/test/Transforms/AtomicExpand/AMDGPU/expand-atomic-i16-system.ll

llvm/test/Transforms/AtomicExpand/AMDGPU/expand-atomic-i8-system.ll

AMDGPU: Expand remaining system atomic operations
Needs ReviewPublic