Lines Matching refs:SSE2
2 ; RUN: llc < %s -mtriple=x86_64-apple-darwin -mattr=+sse2 | FileCheck %s --check-prefix=SSE2
9 ; SSE2-LABEL: round_f16:
10 ; SSE2: ## %bb.0: ## %entry
11 ; SSE2-NEXT: pushq %rax
12 ; SSE2-NEXT: .cfi_def_cfa_offset 16
13 ; SSE2-NEXT: callq ___extendhfsf2
14 ; SSE2-NEXT: callq _roundf
15 ; SSE2-NEXT: callq ___truncsfhf2
16 ; SSE2-NEXT: popq %rax
17 ; SSE2-NEXT: retq
77 ; SSE2-LABEL: round_f32:
78 ; SSE2: ## %bb.0:
79 ; SSE2-NEXT: jmp _roundf ## TAILCALL
112 ; SSE2-LABEL: round_f64:
113 ; SSE2: ## %bb.0:
114 ; SSE2-NEXT: jmp _round ## TAILCALL
148 ; SSE2-LABEL: round_v4f32:
149 ; SSE2: ## %bb.0:
150 ; SSE2-NEXT: subq $56, %rsp
151 ; SSE2-NEXT: .cfi_def_cfa_offset 64
152 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
153 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[3,3,3,3]
154 ; SSE2-NEXT: callq _roundf
155 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
156 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
157 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
158 ; SSE2-NEXT: callq _roundf
159 ; SSE2-NEXT: unpcklps (%rsp), %xmm0 ## 16-byte Folded Reload
160 ; SSE2-NEXT: ## xmm0 = xmm0[0],mem[0],xmm0[1],mem[1]
161 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
162 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
163 ; SSE2-NEXT: callq _roundf
164 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
165 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
166 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[1,1,1,1]
167 ; SSE2-NEXT: callq _roundf
168 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
169 ; SSE2-NEXT: unpcklps {{.*#+}} xmm1 = xmm1[0],xmm0[0],xmm1[1],xmm0[1]
170 ; SSE2-NEXT: unpcklpd (%rsp), %xmm1 ## 16-byte Folded Reload
171 ; SSE2-NEXT: ## xmm1 = xmm1[0],mem[0]
172 ; SSE2-NEXT: movaps %xmm1, %xmm0
173 ; SSE2-NEXT: addq $56, %rsp
174 ; SSE2-NEXT: retq
205 ; SSE2-LABEL: round_v2f64:
206 ; SSE2: ## %bb.0:
207 ; SSE2-NEXT: subq $40, %rsp
208 ; SSE2-NEXT: .cfi_def_cfa_offset 48
209 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
210 ; SSE2-NEXT: callq _round
211 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
212 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
213 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
214 ; SSE2-NEXT: callq _round
215 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
216 ; SSE2-NEXT: movlhps {{.*#+}} xmm1 = xmm1[0],xmm0[0]
217 ; SSE2-NEXT: movaps %xmm1, %xmm0
218 ; SSE2-NEXT: addq $40, %rsp
219 ; SSE2-NEXT: retq
250 ; SSE2-LABEL: round_v8f32:
251 ; SSE2: ## %bb.0:
252 ; SSE2-NEXT: subq $72, %rsp
253 ; SSE2-NEXT: .cfi_def_cfa_offset 80
254 ; SSE2-NEXT: movaps %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
255 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
256 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[3,3,3,3]
257 ; SSE2-NEXT: callq _roundf
258 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
259 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
260 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
261 ; SSE2-NEXT: callq _roundf
262 ; SSE2-NEXT: unpcklps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Folded Reload
263 ; SSE2-NEXT: ## xmm0 = xmm0[0],mem[0],xmm0[1],mem[1]
264 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
265 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
266 ; SSE2-NEXT: callq _roundf
267 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
268 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
269 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[1,1,1,1]
270 ; SSE2-NEXT: callq _roundf
271 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
272 ; SSE2-NEXT: unpcklps {{.*#+}} xmm1 = xmm1[0],xmm0[0],xmm1[1],xmm0[1]
273 ; SSE2-NEXT: unpcklpd {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Folded Reload
274 ; SSE2-NEXT: ## xmm1 = xmm1[0],mem[0]
275 ; SSE2-NEXT: movaps %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
276 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
277 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[3,3,3,3]
278 ; SSE2-NEXT: callq _roundf
279 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
280 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
281 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
282 ; SSE2-NEXT: callq _roundf
283 ; SSE2-NEXT: unpcklps (%rsp), %xmm0 ## 16-byte Folded Reload
284 ; SSE2-NEXT: ## xmm0 = xmm0[0],mem[0],xmm0[1],mem[1]
285 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
286 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
287 ; SSE2-NEXT: callq _roundf
288 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
289 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
290 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[1,1,1,1]
291 ; SSE2-NEXT: callq _roundf
292 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
293 ; SSE2-NEXT: unpcklps {{.*#+}} xmm1 = xmm1[0],xmm0[0],xmm1[1],xmm0[1]
294 ; SSE2-NEXT: unpcklpd (%rsp), %xmm1 ## 16-byte Folded Reload
295 ; SSE2-NEXT: ## xmm1 = xmm1[0],mem[0]
296 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
297 ; SSE2-NEXT: addq $72, %rsp
298 ; SSE2-NEXT: retq
335 ; SSE2-LABEL: round_v4f64:
336 ; SSE2: ## %bb.0:
337 ; SSE2-NEXT: subq $56, %rsp
338 ; SSE2-NEXT: .cfi_def_cfa_offset 64
339 ; SSE2-NEXT: movaps %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
340 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
341 ; SSE2-NEXT: callq _round
342 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
343 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
344 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
345 ; SSE2-NEXT: callq _round
346 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
347 ; SSE2-NEXT: movlhps {{.*#+}} xmm1 = xmm1[0],xmm0[0]
348 ; SSE2-NEXT: movaps %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
349 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
350 ; SSE2-NEXT: callq _round
351 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
352 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
353 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
354 ; SSE2-NEXT: callq _round
355 ; SSE2-NEXT: movaps (%rsp), %xmm1 ## 16-byte Reload
356 ; SSE2-NEXT: movlhps {{.*#+}} xmm1 = xmm1[0],xmm0[0]
357 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
358 ; SSE2-NEXT: addq $56, %rsp
359 ; SSE2-NEXT: retq
396 ; SSE2-LABEL: round_v16f32:
397 ; SSE2: ## %bb.0:
398 ; SSE2-NEXT: subq $104, %rsp
399 ; SSE2-NEXT: .cfi_def_cfa_offset 112
400 ; SSE2-NEXT: movaps %xmm3, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
401 ; SSE2-NEXT: movaps %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
402 ; SSE2-NEXT: movaps %xmm1, (%rsp) ## 16-byte Spill
403 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
404 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[3,3,3,3]
405 ; SSE2-NEXT: callq _roundf
406 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
407 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
408 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
409 ; SSE2-NEXT: callq _roundf
410 ; SSE2-NEXT: unpcklps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Folded Reload
411 ; SSE2-NEXT: ## xmm0 = xmm0[0],mem[0],xmm0[1],mem[1]
412 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
413 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
414 ; SSE2-NEXT: callq _roundf
415 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
416 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
417 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[1,1,1,1]
418 ; SSE2-NEXT: callq _roundf
419 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
420 ; SSE2-NEXT: unpcklps {{.*#+}} xmm1 = xmm1[0],xmm0[0],xmm1[1],xmm0[1]
421 ; SSE2-NEXT: unpcklpd {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Folded Reload
422 ; SSE2-NEXT: ## xmm1 = xmm1[0],mem[0]
423 ; SSE2-NEXT: movaps %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
424 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
425 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[3,3,3,3]
426 ; SSE2-NEXT: callq _roundf
427 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
428 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
429 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
430 ; SSE2-NEXT: callq _roundf
431 ; SSE2-NEXT: unpcklps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Folded Reload
432 ; SSE2-NEXT: ## xmm0 = xmm0[0],mem[0],xmm0[1],mem[1]
433 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
434 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
435 ; SSE2-NEXT: callq _roundf
436 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
437 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
438 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[1,1,1,1]
439 ; SSE2-NEXT: callq _roundf
440 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
441 ; SSE2-NEXT: unpcklps {{.*#+}} xmm1 = xmm1[0],xmm0[0],xmm1[1],xmm0[1]
442 ; SSE2-NEXT: unpcklpd {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Folded Reload
443 ; SSE2-NEXT: ## xmm1 = xmm1[0],mem[0]
444 ; SSE2-NEXT: movaps %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
445 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
446 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[3,3,3,3]
447 ; SSE2-NEXT: callq _roundf
448 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
449 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
450 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
451 ; SSE2-NEXT: callq _roundf
452 ; SSE2-NEXT: unpcklps (%rsp), %xmm0 ## 16-byte Folded Reload
453 ; SSE2-NEXT: ## xmm0 = xmm0[0],mem[0],xmm0[1],mem[1]
454 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
455 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
456 ; SSE2-NEXT: callq _roundf
457 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
458 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
459 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[1,1,1,1]
460 ; SSE2-NEXT: callq _roundf
461 ; SSE2-NEXT: movaps (%rsp), %xmm1 ## 16-byte Reload
462 ; SSE2-NEXT: unpcklps {{.*#+}} xmm1 = xmm1[0],xmm0[0],xmm1[1],xmm0[1]
463 ; SSE2-NEXT: unpcklpd {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Folded Reload
464 ; SSE2-NEXT: ## xmm1 = xmm1[0],mem[0]
465 ; SSE2-NEXT: movaps %xmm1, (%rsp) ## 16-byte Spill
466 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
467 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[3,3,3,3]
468 ; SSE2-NEXT: callq _roundf
469 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
470 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
471 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
472 ; SSE2-NEXT: callq _roundf
473 ; SSE2-NEXT: unpcklps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Folded Reload
474 ; SSE2-NEXT: ## xmm0 = xmm0[0],mem[0],xmm0[1],mem[1]
475 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
476 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
477 ; SSE2-NEXT: callq _roundf
478 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
479 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
480 ; SSE2-NEXT: shufps {{.*#+}} xmm0 = xmm0[1,1,1,1]
481 ; SSE2-NEXT: callq _roundf
482 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm3 ## 16-byte Reload
483 ; SSE2-NEXT: unpcklps {{.*#+}} xmm3 = xmm3[0],xmm0[0],xmm3[1],xmm0[1]
484 ; SSE2-NEXT: unpcklpd {{[-0-9]+}}(%r{{[sb]}}p), %xmm3 ## 16-byte Folded Reload
485 ; SSE2-NEXT: ## xmm3 = xmm3[0],mem[0]
486 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
487 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
488 ; SSE2-NEXT: movaps (%rsp), %xmm2 ## 16-byte Reload
489 ; SSE2-NEXT: addq $104, %rsp
490 ; SSE2-NEXT: retq
543 ; SSE2-LABEL: round_v8f64:
544 ; SSE2: ## %bb.0:
545 ; SSE2-NEXT: subq $88, %rsp
546 ; SSE2-NEXT: .cfi_def_cfa_offset 96
547 ; SSE2-NEXT: movaps %xmm3, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
548 ; SSE2-NEXT: movaps %xmm2, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
549 ; SSE2-NEXT: movaps %xmm1, (%rsp) ## 16-byte Spill
550 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
551 ; SSE2-NEXT: callq _round
552 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
553 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
554 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
555 ; SSE2-NEXT: callq _round
556 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
557 ; SSE2-NEXT: movlhps {{.*#+}} xmm1 = xmm1[0],xmm0[0]
558 ; SSE2-NEXT: movaps %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
559 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
560 ; SSE2-NEXT: callq _round
561 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
562 ; SSE2-NEXT: movaps (%rsp), %xmm0 ## 16-byte Reload
563 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
564 ; SSE2-NEXT: callq _round
565 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
566 ; SSE2-NEXT: movlhps {{.*#+}} xmm1 = xmm1[0],xmm0[0]
567 ; SSE2-NEXT: movaps %xmm1, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
568 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
569 ; SSE2-NEXT: callq _round
570 ; SSE2-NEXT: movaps %xmm0, (%rsp) ## 16-byte Spill
571 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
572 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
573 ; SSE2-NEXT: callq _round
574 ; SSE2-NEXT: movaps (%rsp), %xmm1 ## 16-byte Reload
575 ; SSE2-NEXT: movlhps {{.*#+}} xmm1 = xmm1[0],xmm0[0]
576 ; SSE2-NEXT: movaps %xmm1, (%rsp) ## 16-byte Spill
577 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
578 ; SSE2-NEXT: callq _round
579 ; SSE2-NEXT: movaps %xmm0, {{[-0-9]+}}(%r{{[sb]}}p) ## 16-byte Spill
580 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
581 ; SSE2-NEXT: movhlps {{.*#+}} xmm0 = xmm0[1,1]
582 ; SSE2-NEXT: callq _round
583 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm3 ## 16-byte Reload
584 ; SSE2-NEXT: movlhps {{.*#+}} xmm3 = xmm3[0],xmm0[0]
585 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm0 ## 16-byte Reload
586 ; SSE2-NEXT: movaps {{[-0-9]+}}(%r{{[sb]}}p), %xmm1 ## 16-byte Reload
587 ; SSE2-NEXT: movaps (%rsp), %xmm2 ## 16-byte Reload
588 ; SSE2-NEXT: addq $88, %rsp
589 ; SSE2-NEXT: retq