add bgra as 1st class format

This is a start to eliminating swap_rb as a stage.

I've just hit the main hot spots here.  Going to look into
the ~dozen other spots to see how they should work next.

Change-Id: I26fb46a042facf7bd6fff3b47c9fcee86d7142fd
Reviewed-on: https://skia-review.googlesource.com/20982
Commit-Queue: Mike Klein <mtklein@chromium.org>
Reviewed-by: Mike Reed <reed@google.com>
diff --git a/src/core/SkRasterPipeline.h b/src/core/SkRasterPipeline.h
index 2e07f37..a02b0e9 100644
--- a/src/core/SkRasterPipeline.h
+++ b/src/core/SkRasterPipeline.h
@@ -64,16 +64,18 @@
     M(move_src_dst) M(move_dst_src)                              \
     M(clamp_0) M(clamp_1) M(clamp_a) M(clamp_a_dst)              \
     M(unpremul) M(premul)                                        \
-    M(set_rgb) M(swap_rb) M(swap_rb_dst)                         \
+    M(set_rgb) M(swap_rb)                                        \
     M(from_srgb) M(from_srgb_dst) M(to_srgb)                     \
     M(constant_color) M(seed_shader) M(dither)                   \
-    M(load_a8)   M(load_a8_dst)   M(store_a8)                    \
-    M(load_g8)   M(load_g8_dst)                                  \
-    M(load_565)  M(load_565_dst)  M(store_565)                   \
-    M(load_4444) M(load_4444_dst) M(store_4444)                  \
-    M(load_f16)  M(load_f16_dst)  M(store_f16)                   \
+                                                M(gather_i8)     \
+    M(load_a8)   M(load_a8_dst)   M(store_a8)   M(gather_a8)     \
+    M(load_g8)   M(load_g8_dst)                 M(gather_g8)     \
+    M(load_565)  M(load_565_dst)  M(store_565)  M(gather_565)    \
+    M(load_4444) M(load_4444_dst) M(store_4444) M(gather_4444)   \
+    M(load_f16)  M(load_f16_dst)  M(store_f16)  M(gather_f16)    \
     M(load_f32)  M(load_f32_dst)  M(store_f32)                   \
-    M(load_8888) M(load_8888_dst) M(store_8888)                  \
+    M(load_8888) M(load_8888_dst) M(store_8888) M(gather_8888)   \
+    M(load_bgra) M(load_bgra_dst) M(store_bgra) M(gather_bgra)   \
     M(load_u16_be) M(load_rgb_u16_be) M(store_u16_be)            \
     M(load_tables_u16_be) M(load_tables_rgb_u16_be)              \
     M(load_tables) M(load_rgba) M(store_rgba)                    \
@@ -96,8 +98,6 @@
     M(clamp_x)   M(mirror_x)   M(repeat_x)                       \
     M(clamp_y)   M(mirror_y)   M(repeat_y)                       \
     M(clamp_x_1) M(mirror_x_1) M(repeat_x_1)                     \
-    M(gather_a8) M(gather_g8) M(gather_i8)                       \
-    M(gather_565) M(gather_4444) M(gather_8888) M(gather_f16)    \
     M(bilinear_nx) M(bilinear_px) M(bilinear_ny) M(bilinear_py)  \
     M(bicubic_n3x) M(bicubic_n1x) M(bicubic_p1x) M(bicubic_p3x)  \
     M(bicubic_n3y) M(bicubic_n1y) M(bicubic_p1y) M(bicubic_p3y)  \
diff --git a/src/core/SkRasterPipelineBlitter.cpp b/src/core/SkRasterPipelineBlitter.cpp
index 07e4922..fff3d8b 100644
--- a/src/core/SkRasterPipelineBlitter.cpp
+++ b/src/core/SkRasterPipelineBlitter.cpp
@@ -227,13 +227,10 @@
         case kAlpha_8_SkColorType:   p->append(SkRasterPipeline::load_a8_dst,   &fDstPtr); break;
         case kRGB_565_SkColorType:   p->append(SkRasterPipeline::load_565_dst,  &fDstPtr); break;
         case kARGB_4444_SkColorType: p->append(SkRasterPipeline::load_4444_dst, &fDstPtr); break;
-        case kBGRA_8888_SkColorType:
+        case kBGRA_8888_SkColorType: p->append(SkRasterPipeline::load_bgra_dst, &fDstPtr); break;
         case kRGBA_8888_SkColorType: p->append(SkRasterPipeline::load_8888_dst, &fDstPtr); break;
         case kRGBA_F16_SkColorType:  p->append(SkRasterPipeline::load_f16_dst,  &fDstPtr); break;
-        default: break;
-    }
-    if (fDst.info().colorType() == kBGRA_8888_SkColorType) {
-        p->append(SkRasterPipeline::swap_rb_dst);
+        default:                                                                           break;
     }
     if (fDst.info().gammaCloseToSRGB()) {
         p->append_from_srgb_dst(fDst.info().alphaType());
@@ -250,15 +247,12 @@
         p->append(SkRasterPipeline::dither, &fDitherRate);
     }
 
-    if (fDst.info().colorType() == kBGRA_8888_SkColorType) {
-        p->append(SkRasterPipeline::swap_rb);
-    }
     switch (fDst.info().colorType()) {
         case kGray_8_SkColorType:    p->append(SkRasterPipeline::luminance_to_alpha); // fallthru
         case kAlpha_8_SkColorType:   p->append(SkRasterPipeline::store_a8,   &fDstPtr); break;
         case kRGB_565_SkColorType:   p->append(SkRasterPipeline::store_565,  &fDstPtr); break;
         case kARGB_4444_SkColorType: p->append(SkRasterPipeline::store_4444, &fDstPtr); break;
-        case kBGRA_8888_SkColorType:
+        case kBGRA_8888_SkColorType: p->append(SkRasterPipeline::store_bgra, &fDstPtr); break;
         case kRGBA_8888_SkColorType: p->append(SkRasterPipeline::store_8888, &fDstPtr); break;
         case kRGBA_F16_SkColorType:  p->append(SkRasterPipeline::store_f16,  &fDstPtr); break;
         default: break;
diff --git a/src/jumper/SkJumper.cpp b/src/jumper/SkJumper.cpp
index 31a6a52..4d01e6f 100644
--- a/src/jumper/SkJumper.cpp
+++ b/src/jumper/SkJumper.cpp
@@ -75,9 +75,10 @@
     M(set_rgb)           \
     M(premul)            \
     M(load_8888) M(load_8888_dst) M(store_8888) \
+    M(load_bgra) M(load_bgra_dst) M(store_bgra) \
     M(load_a8)   M(load_a8_dst)   M(store_a8)   \
     M(load_g8)   M(load_g8_dst)                 \
-    M(swap_rb)   M(swap_rb_dst)                 \
+    M(swap_rb)           \
     M(srcover_rgba_8888) \
     M(lerp_1_float)      \
     M(lerp_u8)           \
diff --git a/src/jumper/SkJumper_generated.S b/src/jumper/SkJumper_generated.S
index b3f533d..09cc8c9 100644
--- a/src/jumper/SkJumper_generated.S
+++ b/src/jumper/SkJumper_generated.S
@@ -1395,16 +1395,6 @@
   .long  0x4eb01e02                          // mov           v2.16b, v16.16b
   .long  0xd61f00a0                          // br            x5
 
-HIDDEN _sk_swap_rb_dst_aarch64
-.globl _sk_swap_rb_dst_aarch64
-FUNCTION(_sk_swap_rb_dst_aarch64)
-_sk_swap_rb_dst_aarch64:
-  .long  0xf8408425                          // ldr           x5, [x1], #8
-  .long  0x4ea41c90                          // mov           v16.16b, v4.16b
-  .long  0x4ea61cc4                          // mov           v4.16b, v6.16b
-  .long  0x4eb01e06                          // mov           v6.16b, v16.16b
-  .long  0xd61f00a0                          // br            x5
-
 HIDDEN _sk_move_src_dst_aarch64
 .globl _sk_move_src_dst_aarch64
 FUNCTION(_sk_move_src_dst_aarch64)
@@ -1754,7 +1744,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50002e4                          // cbnz          x4, 1744 <sk_scale_u8_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 1730 <sk_scale_u8_aarch64+0x68>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -1779,12 +1769,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          1790 <sk_scale_u8_aarch64+0xb4>  // b.none
+  .long  0x54000220                          // b.eq          177c <sk_scale_u8_aarch64+0xb4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e410                          // movi          d16, #0x0
-  .long  0x540000c0                          // b.eq          1770 <sk_scale_u8_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          175c <sk_scale_u8_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd61                          // b.ne          170c <sk_scale_u8_aarch64+0x30>  // b.any
+  .long  0x54fffd61                          // b.ne          16f8 <sk_scale_u8_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x4e0a1d30                          // mov           v16.h[2], w9
@@ -1795,11 +1785,11 @@
   .long  0x0e401a31                          // uzp1          v17.4h, v17.4h, v0.4h
   .long  0x2e112210                          // ext           v16.8b, v16.8b, v17.8b, #4
   .long  0x2e102210                          // ext           v16.8b, v16.8b, v16.8b, #4
-  .long  0x17ffffe0                          // b             170c <sk_scale_u8_aarch64+0x30>
+  .long  0x17ffffe0                          // b             16f8 <sk_scale_u8_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x4e021d10                          // mov           v16.h[0], w8
-  .long  0x17ffffdc                          // b             170c <sk_scale_u8_aarch64+0x30>
+  .long  0x17ffffdc                          // b             16f8 <sk_scale_u8_aarch64+0x30>
 
 HIDDEN _sk_lerp_1_float_aarch64
 .globl _sk_lerp_1_float_aarch64
@@ -1828,7 +1818,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50003e4                          // cbnz          x4, 1864 <sk_lerp_u8_aarch64+0x88>
+  .long  0xb50003e4                          // cbnz          x4, 1850 <sk_lerp_u8_aarch64+0x88>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -1861,12 +1851,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          18b0 <sk_lerp_u8_aarch64+0xd4>  // b.none
+  .long  0x54000220                          // b.eq          189c <sk_lerp_u8_aarch64+0xd4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e410                          // movi          d16, #0x0
-  .long  0x540000c0                          // b.eq          1890 <sk_lerp_u8_aarch64+0xb4>  // b.none
+  .long  0x540000c0                          // b.eq          187c <sk_lerp_u8_aarch64+0xb4>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffc61                          // b.ne          180c <sk_lerp_u8_aarch64+0x30>  // b.any
+  .long  0x54fffc61                          // b.ne          17f8 <sk_lerp_u8_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x4e0a1d30                          // mov           v16.h[2], w9
@@ -1877,11 +1867,11 @@
   .long  0x0e401a31                          // uzp1          v17.4h, v17.4h, v0.4h
   .long  0x2e112210                          // ext           v16.8b, v16.8b, v17.8b, #4
   .long  0x2e102210                          // ext           v16.8b, v16.8b, v16.8b, #4
-  .long  0x17ffffd8                          // b             180c <sk_lerp_u8_aarch64+0x30>
+  .long  0x17ffffd8                          // b             17f8 <sk_lerp_u8_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x4e021d10                          // mov           v16.h[0], w8
-  .long  0x17ffffd4                          // b             180c <sk_lerp_u8_aarch64+0x30>
+  .long  0x17ffffd4                          // b             17f8 <sk_lerp_u8_aarch64+0x30>
 
 HIDDEN _sk_lerp_565_aarch64
 .globl _sk_lerp_565_aarch64
@@ -1890,7 +1880,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
-  .long  0xb50005c4                          // cbnz          x4, 1984 <sk_lerp_565_aarch64+0xc4>
+  .long  0xb50005c4                          // cbnz          x4, 1970 <sk_lerp_565_aarch64+0xc4>
   .long  0xfd400110                          // ldr           d16, [x8]
   .long  0x321b17e8                          // orr           w8, wzr, #0x7e0
   .long  0x4e040d12                          // dup           v18.4s, w8
@@ -1938,12 +1928,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          19d0 <sk_lerp_565_aarch64+0x110>  // b.none
+  .long  0x54000220                          // b.eq          19bc <sk_lerp_565_aarch64+0x110>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e410                          // movi          d16, #0x0
-  .long  0x540000c0                          // b.eq          19b0 <sk_lerp_565_aarch64+0xf0>  // b.none
+  .long  0x540000c0                          // b.eq          199c <sk_lerp_565_aarch64+0xf0>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fff9a1                          // b.ne          18d4 <sk_lerp_565_aarch64+0x14>  // b.any
+  .long  0x54fff9a1                          // b.ne          18c0 <sk_lerp_565_aarch64+0x14>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x0d405130                          // ld1           {v16.h}[2], [x9]
@@ -1954,10 +1944,10 @@
   .long  0x0e401a31                          // uzp1          v17.4h, v17.4h, v0.4h
   .long  0x2e112210                          // ext           v16.8b, v16.8b, v17.8b, #4
   .long  0x2e102210                          // ext           v16.8b, v16.8b, v16.8b, #4
-  .long  0x17ffffc2                          // b             18d4 <sk_lerp_565_aarch64+0x14>
+  .long  0x17ffffc2                          // b             18c0 <sk_lerp_565_aarch64+0x14>
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x0d404110                          // ld1           {v16.h}[0], [x8]
-  .long  0x17ffffbf                          // b             18d4 <sk_lerp_565_aarch64+0x14>
+  .long  0x17ffffbf                          // b             18c0 <sk_lerp_565_aarch64+0x14>
 
 HIDDEN _sk_load_tables_aarch64
 .globl _sk_load_tables_aarch64
@@ -1966,7 +1956,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400109                          // ldr           x9, [x8]
   .long  0x8b020929                          // add           x9, x9, x2, lsl #2
-  .long  0xb50006e4                          // cbnz          x4, 1ac4 <sk_load_tables_aarch64+0xe8>
+  .long  0xb50006e4                          // cbnz          x4, 1ab0 <sk_load_tables_aarch64+0xe8>
   .long  0x3dc00122                          // ldr           q2, [x9]
   .long  0xa940a909                          // ldp           x9, x10, [x8, #8]
   .long  0x6f00e620                          // movi          v0.2d, #0xff000000ff
@@ -2023,22 +2013,22 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x1200048a                          // and           w10, w4, #0x3
   .long  0x7100055f                          // cmp           w10, #0x1
-  .long  0x540001a0                          // b.eq          1b00 <sk_load_tables_aarch64+0x124>  // b.none
+  .long  0x540001a0                          // b.eq          1aec <sk_load_tables_aarch64+0x124>  // b.none
   .long  0x7100095f                          // cmp           w10, #0x2
   .long  0x6f00e402                          // movi          v2.2d, #0x0
-  .long  0x540000c0                          // b.eq          1af0 <sk_load_tables_aarch64+0x114>  // b.none
+  .long  0x540000c0                          // b.eq          1adc <sk_load_tables_aarch64+0x114>  // b.none
   .long  0x71000d5f                          // cmp           w10, #0x3
-  .long  0x54fff881                          // b.ne          19f0 <sk_load_tables_aarch64+0x14>  // b.any
+  .long  0x54fff881                          // b.ne          19dc <sk_load_tables_aarch64+0x14>  // b.any
   .long  0x9100212a                          // add           x10, x9, #0x8
   .long  0x4e040fe2                          // dup           v2.4s, wzr
   .long  0x4d408142                          // ld1           {v2.s}[2], [x10]
   .long  0xfd400120                          // ldr           d0, [x9]
   .long  0x6e004040                          // ext           v0.16b, v2.16b, v0.16b, #8
   .long  0x6e004002                          // ext           v2.16b, v0.16b, v0.16b, #8
-  .long  0x17ffffbd                          // b             19f0 <sk_load_tables_aarch64+0x14>
+  .long  0x17ffffbd                          // b             19dc <sk_load_tables_aarch64+0x14>
   .long  0x4e040fe2                          // dup           v2.4s, wzr
   .long  0x0d408122                          // ld1           {v2.s}[0], [x9]
-  .long  0x17ffffba                          // b             19f0 <sk_load_tables_aarch64+0x14>
+  .long  0x17ffffba                          // b             19dc <sk_load_tables_aarch64+0x14>
 
 HIDDEN _sk_load_tables_u16_be_aarch64
 .globl _sk_load_tables_u16_be_aarch64
@@ -2047,7 +2037,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400109                          // ldr           x9, [x8]
   .long  0x8b020d29                          // add           x9, x9, x2, lsl #3
-  .long  0xb5000744                          // cbnz          x4, 1c00 <sk_load_tables_u16_be_aarch64+0xf4>
+  .long  0xb5000744                          // cbnz          x4, 1bec <sk_load_tables_u16_be_aarch64+0xf4>
   .long  0x0c400520                          // ld4           {v0.4h-v3.4h}, [x9]
   .long  0xa940a909                          // ldp           x9, x10, [x8, #8]
   .long  0x2f07b7e0                          // bic           v0.4h, #0xff, lsl #8
@@ -2107,14 +2097,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d606120                          // ld4           {v0.h-v3.h}[0], [x9]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fff8c0                          // b.eq          1b20 <sk_load_tables_u16_be_aarch64+0x14>  // b.none
+  .long  0x54fff8c0                          // b.eq          1b0c <sk_load_tables_u16_be_aarch64+0x14>  // b.none
   .long  0x9100212a                          // add           x10, x9, #0x8
   .long  0x0d606940                          // ld4           {v0.h-v3.h}[1], [x10]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fff843                          // b.cc          1b20 <sk_load_tables_u16_be_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fff843                          // b.cc          1b0c <sk_load_tables_u16_be_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91004129                          // add           x9, x9, #0x10
   .long  0x0d607120                          // ld4           {v0.h-v3.h}[2], [x9]
-  .long  0x17ffffbf                          // b             1b20 <sk_load_tables_u16_be_aarch64+0x14>
+  .long  0x17ffffbf                          // b             1b0c <sk_load_tables_u16_be_aarch64+0x14>
 
 HIDDEN _sk_load_tables_rgb_u16_be_aarch64
 .globl _sk_load_tables_rgb_u16_be_aarch64
@@ -2124,7 +2114,7 @@
   .long  0x321f07ea                          // orr           w10, wzr, #0x6
   .long  0xf9400109                          // ldr           x9, [x8]
   .long  0x9b0a2449                          // madd          x9, x2, x10, x9
-  .long  0xb5000664                          // cbnz          x4, 1d04 <sk_load_tables_rgb_u16_be_aarch64+0xdc>
+  .long  0xb5000664                          // cbnz          x4, 1cf0 <sk_load_tables_rgb_u16_be_aarch64+0xdc>
   .long  0x0c404520                          // ld3           {v0.4h-v2.4h}, [x9]
   .long  0xa940a909                          // ldp           x9, x10, [x8, #8]
   .long  0x2f07b7e0                          // bic           v0.4h, #0xff, lsl #8
@@ -2177,14 +2167,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d406120                          // ld3           {v0.h-v2.h}[0], [x9]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fff9a0                          // b.eq          1c40 <sk_load_tables_rgb_u16_be_aarch64+0x18>  // b.none
+  .long  0x54fff9a0                          // b.eq          1c2c <sk_load_tables_rgb_u16_be_aarch64+0x18>  // b.none
   .long  0x9100192a                          // add           x10, x9, #0x6
   .long  0x0d406940                          // ld3           {v0.h-v2.h}[1], [x10]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fff923                          // b.cc          1c40 <sk_load_tables_rgb_u16_be_aarch64+0x18>  // b.lo, b.ul, b.last
+  .long  0x54fff923                          // b.cc          1c2c <sk_load_tables_rgb_u16_be_aarch64+0x18>  // b.lo, b.ul, b.last
   .long  0x91003129                          // add           x9, x9, #0xc
   .long  0x0d407120                          // ld3           {v0.h-v2.h}[2], [x9]
-  .long  0x17ffffc6                          // b             1c40 <sk_load_tables_rgb_u16_be_aarch64+0x18>
+  .long  0x17ffffc6                          // b             1c2c <sk_load_tables_rgb_u16_be_aarch64+0x18>
 
 HIDDEN _sk_byte_tables_aarch64
 .globl _sk_byte_tables_aarch64
@@ -2829,7 +2819,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50002e4                          // cbnz          x4, 26a8 <sk_load_a8_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 2694 <sk_load_a8_aarch64+0x68>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -2854,12 +2844,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          26f4 <sk_load_a8_aarch64+0xb4>  // b.none
+  .long  0x54000220                          // b.eq          26e0 <sk_load_a8_aarch64+0xb4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e402                          // movi          d2, #0x0
-  .long  0x540000c0                          // b.eq          26d4 <sk_load_a8_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          26c0 <sk_load_a8_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd61                          // b.ne          2670 <sk_load_a8_aarch64+0x30>  // b.any
+  .long  0x54fffd61                          // b.ne          265c <sk_load_a8_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020fe2                          // dup           v2.4h, wzr
   .long  0x4e0a1d22                          // mov           v2.h[2], w9
@@ -2870,11 +2860,11 @@
   .long  0x0e401800                          // uzp1          v0.4h, v0.4h, v0.4h
   .long  0x2e002040                          // ext           v0.8b, v2.8b, v0.8b, #4
   .long  0x2e002002                          // ext           v2.8b, v0.8b, v0.8b, #4
-  .long  0x17ffffe0                          // b             2670 <sk_load_a8_aarch64+0x30>
+  .long  0x17ffffe0                          // b             265c <sk_load_a8_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020fe2                          // dup           v2.4h, wzr
   .long  0x4e021d02                          // mov           v2.h[0], w8
-  .long  0x17ffffdc                          // b             2670 <sk_load_a8_aarch64+0x30>
+  .long  0x17ffffdc                          // b             265c <sk_load_a8_aarch64+0x30>
 
 HIDDEN _sk_load_a8_dst_aarch64
 .globl _sk_load_a8_dst_aarch64
@@ -2883,7 +2873,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50002e4                          // cbnz          x4, 276c <sk_load_a8_dst_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 2758 <sk_load_a8_dst_aarch64+0x68>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -2908,12 +2898,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          27b8 <sk_load_a8_dst_aarch64+0xb4>  // b.none
+  .long  0x54000220                          // b.eq          27a4 <sk_load_a8_dst_aarch64+0xb4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e406                          // movi          d6, #0x0
-  .long  0x540000c0                          // b.eq          2798 <sk_load_a8_dst_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          2784 <sk_load_a8_dst_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd61                          // b.ne          2734 <sk_load_a8_dst_aarch64+0x30>  // b.any
+  .long  0x54fffd61                          // b.ne          2720 <sk_load_a8_dst_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020fe6                          // dup           v6.4h, wzr
   .long  0x4e0a1d26                          // mov           v6.h[2], w9
@@ -2924,11 +2914,11 @@
   .long  0x0e401884                          // uzp1          v4.4h, v4.4h, v0.4h
   .long  0x2e0420c4                          // ext           v4.8b, v6.8b, v4.8b, #4
   .long  0x2e042086                          // ext           v6.8b, v4.8b, v4.8b, #4
-  .long  0x17ffffe0                          // b             2734 <sk_load_a8_dst_aarch64+0x30>
+  .long  0x17ffffe0                          // b             2720 <sk_load_a8_dst_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020fe6                          // dup           v6.4h, wzr
   .long  0x4e021d06                          // mov           v6.h[0], w8
-  .long  0x17ffffdc                          // b             2734 <sk_load_a8_dst_aarch64+0x30>
+  .long  0x17ffffdc                          // b             2720 <sk_load_a8_dst_aarch64+0x30>
 
 HIDDEN _sk_gather_a8_aarch64
 .globl _sk_gather_a8_aarch64
@@ -2977,7 +2967,7 @@
   .long  0x6e21aa10                          // fcvtnu        v16.4s, v16.4s
   .long  0x0e612a10                          // xtn           v16.4h, v16.4s
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb5000184                          // cbnz          x4, 2890 <sk_store_a8_aarch64+0x50>
+  .long  0xb5000184                          // cbnz          x4, 287c <sk_store_a8_aarch64+0x50>
   .long  0x0e0e3e09                          // umov          w9, v16.h[3]
   .long  0x0e0a3e0a                          // umov          w10, v16.h[2]
   .long  0x0e063e0b                          // umov          w11, v16.h[1]
@@ -2991,21 +2981,21 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000180                          // b.eq          28c8 <sk_store_a8_aarch64+0x88>  // b.none
+  .long  0x54000180                          // b.eq          28b4 <sk_store_a8_aarch64+0x88>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
-  .long  0x540000a0                          // b.eq          28b4 <sk_store_a8_aarch64+0x74>  // b.none
+  .long  0x540000a0                          // b.eq          28a0 <sk_store_a8_aarch64+0x74>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffee1                          // b.ne          2884 <sk_store_a8_aarch64+0x44>  // b.any
+  .long  0x54fffee1                          // b.ne          2870 <sk_store_a8_aarch64+0x44>  // b.any
   .long  0x0e0a3e09                          // umov          w9, v16.h[2]
   .long  0x39000909                          // strb          w9, [x8, #2]
   .long  0x0e023e09                          // umov          w9, v16.h[0]
   .long  0x0e063e0a                          // umov          w10, v16.h[1]
   .long  0x3900050a                          // strb          w10, [x8, #1]
   .long  0x39000109                          // strb          w9, [x8]
-  .long  0x17fffff0                          // b             2884 <sk_store_a8_aarch64+0x44>
+  .long  0x17fffff0                          // b             2870 <sk_store_a8_aarch64+0x44>
   .long  0x0e023e09                          // umov          w9, v16.h[0]
   .long  0x39000109                          // strb          w9, [x8]
-  .long  0x17ffffed                          // b             2884 <sk_store_a8_aarch64+0x44>
+  .long  0x17ffffed                          // b             2870 <sk_store_a8_aarch64+0x44>
 
 HIDDEN _sk_load_g8_aarch64
 .globl _sk_load_g8_aarch64
@@ -3014,7 +3004,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50002e4                          // cbnz          x4, 293c <sk_load_g8_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 2928 <sk_load_g8_aarch64+0x68>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -3039,12 +3029,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          2988 <sk_load_g8_aarch64+0xb4>  // b.none
+  .long  0x54000220                          // b.eq          2974 <sk_load_g8_aarch64+0xb4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e400                          // movi          d0, #0x0
-  .long  0x540000c0                          // b.eq          2968 <sk_load_g8_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          2954 <sk_load_g8_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd61                          // b.ne          2904 <sk_load_g8_aarch64+0x30>  // b.any
+  .long  0x54fffd61                          // b.ne          28f0 <sk_load_g8_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x4e0a1d20                          // mov           v0.h[2], w9
@@ -3055,11 +3045,11 @@
   .long  0x0e401821                          // uzp1          v1.4h, v1.4h, v0.4h
   .long  0x2e012000                          // ext           v0.8b, v0.8b, v1.8b, #4
   .long  0x2e002000                          // ext           v0.8b, v0.8b, v0.8b, #4
-  .long  0x17ffffe0                          // b             2904 <sk_load_g8_aarch64+0x30>
+  .long  0x17ffffe0                          // b             28f0 <sk_load_g8_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x4e021d00                          // mov           v0.h[0], w8
-  .long  0x17ffffdc                          // b             2904 <sk_load_g8_aarch64+0x30>
+  .long  0x17ffffdc                          // b             28f0 <sk_load_g8_aarch64+0x30>
 
 HIDDEN _sk_load_g8_dst_aarch64
 .globl _sk_load_g8_dst_aarch64
@@ -3068,7 +3058,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50002e4                          // cbnz          x4, 2a00 <sk_load_g8_dst_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 29ec <sk_load_g8_dst_aarch64+0x68>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -3093,12 +3083,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          2a4c <sk_load_g8_dst_aarch64+0xb4>  // b.none
+  .long  0x54000220                          // b.eq          2a38 <sk_load_g8_dst_aarch64+0xb4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e404                          // movi          d4, #0x0
-  .long  0x540000c0                          // b.eq          2a2c <sk_load_g8_dst_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          2a18 <sk_load_g8_dst_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd61                          // b.ne          29c8 <sk_load_g8_dst_aarch64+0x30>  // b.any
+  .long  0x54fffd61                          // b.ne          29b4 <sk_load_g8_dst_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x4e0a1d24                          // mov           v4.h[2], w9
@@ -3109,11 +3099,11 @@
   .long  0x0e4018a5                          // uzp1          v5.4h, v5.4h, v0.4h
   .long  0x2e052084                          // ext           v4.8b, v4.8b, v5.8b, #4
   .long  0x2e042084                          // ext           v4.8b, v4.8b, v4.8b, #4
-  .long  0x17ffffe0                          // b             29c8 <sk_load_g8_dst_aarch64+0x30>
+  .long  0x17ffffe0                          // b             29b4 <sk_load_g8_dst_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x4e021d04                          // mov           v4.h[0], w8
-  .long  0x17ffffdc                          // b             29c8 <sk_load_g8_dst_aarch64+0x30>
+  .long  0x17ffffdc                          // b             29b4 <sk_load_g8_dst_aarch64+0x30>
 
 HIDDEN _sk_gather_g8_aarch64
 .globl _sk_gather_g8_aarch64
@@ -3156,9 +3146,9 @@
 _sk_gather_i8_aarch64:
   .long  0xaa0103e8                          // mov           x8, x1
   .long  0xf8408429                          // ldr           x9, [x1], #8
-  .long  0xb4000069                          // cbz           x9, 2ae8 <sk_gather_i8_aarch64+0x14>
+  .long  0xb4000069                          // cbz           x9, 2ad4 <sk_gather_i8_aarch64+0x14>
   .long  0xaa0903ea                          // mov           x10, x9
-  .long  0x14000003                          // b             2af0 <sk_gather_i8_aarch64+0x1c>
+  .long  0x14000003                          // b             2adc <sk_gather_i8_aarch64+0x1c>
   .long  0xf940050a                          // ldr           x10, [x8, #8]
   .long  0x91004101                          // add           x1, x8, #0x10
   .long  0xf8410548                          // ldr           x8, [x10], #16
@@ -3221,7 +3211,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
-  .long  0xb50003c4                          // cbnz          x4, 2c44 <sk_load_565_aarch64+0x84>
+  .long  0xb50003c4                          // cbnz          x4, 2c30 <sk_load_565_aarch64+0x84>
   .long  0xfd400100                          // ldr           d0, [x8]
   .long  0x321b17e8                          // orr           w8, wzr, #0x7e0
   .long  0x4e040d02                          // dup           v2.4s, w8
@@ -3253,12 +3243,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          2c90 <sk_load_565_aarch64+0xd0>  // b.none
+  .long  0x54000220                          // b.eq          2c7c <sk_load_565_aarch64+0xd0>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e400                          // movi          d0, #0x0
-  .long  0x540000c0                          // b.eq          2c70 <sk_load_565_aarch64+0xb0>  // b.none
+  .long  0x540000c0                          // b.eq          2c5c <sk_load_565_aarch64+0xb0>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffba1                          // b.ne          2bd4 <sk_load_565_aarch64+0x14>  // b.any
+  .long  0x54fffba1                          // b.ne          2bc0 <sk_load_565_aarch64+0x14>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x0d405120                          // ld1           {v0.h}[2], [x9]
@@ -3269,10 +3259,10 @@
   .long  0x0e401821                          // uzp1          v1.4h, v1.4h, v0.4h
   .long  0x2e012000                          // ext           v0.8b, v0.8b, v1.8b, #4
   .long  0x2e002000                          // ext           v0.8b, v0.8b, v0.8b, #4
-  .long  0x17ffffd2                          // b             2bd4 <sk_load_565_aarch64+0x14>
+  .long  0x17ffffd2                          // b             2bc0 <sk_load_565_aarch64+0x14>
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x0d404100                          // ld1           {v0.h}[0], [x8]
-  .long  0x17ffffcf                          // b             2bd4 <sk_load_565_aarch64+0x14>
+  .long  0x17ffffcf                          // b             2bc0 <sk_load_565_aarch64+0x14>
 
 HIDDEN _sk_load_565_dst_aarch64
 .globl _sk_load_565_dst_aarch64
@@ -3281,7 +3271,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
-  .long  0xb50003c4                          // cbnz          x4, 2d20 <sk_load_565_dst_aarch64+0x84>
+  .long  0xb50003c4                          // cbnz          x4, 2d0c <sk_load_565_dst_aarch64+0x84>
   .long  0xfd400104                          // ldr           d4, [x8]
   .long  0x321b17e8                          // orr           w8, wzr, #0x7e0
   .long  0x4e040d06                          // dup           v6.4s, w8
@@ -3313,12 +3303,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          2d6c <sk_load_565_dst_aarch64+0xd0>  // b.none
+  .long  0x54000220                          // b.eq          2d58 <sk_load_565_dst_aarch64+0xd0>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e404                          // movi          d4, #0x0
-  .long  0x540000c0                          // b.eq          2d4c <sk_load_565_dst_aarch64+0xb0>  // b.none
+  .long  0x540000c0                          // b.eq          2d38 <sk_load_565_dst_aarch64+0xb0>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffba1                          // b.ne          2cb0 <sk_load_565_dst_aarch64+0x14>  // b.any
+  .long  0x54fffba1                          // b.ne          2c9c <sk_load_565_dst_aarch64+0x14>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x0d405124                          // ld1           {v4.h}[2], [x9]
@@ -3329,10 +3319,10 @@
   .long  0x0e4018a5                          // uzp1          v5.4h, v5.4h, v0.4h
   .long  0x2e052084                          // ext           v4.8b, v4.8b, v5.8b, #4
   .long  0x2e042084                          // ext           v4.8b, v4.8b, v4.8b, #4
-  .long  0x17ffffd2                          // b             2cb0 <sk_load_565_dst_aarch64+0x14>
+  .long  0x17ffffd2                          // b             2c9c <sk_load_565_dst_aarch64+0x14>
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x0d404104                          // ld1           {v4.h}[0], [x8]
-  .long  0x17ffffcf                          // b             2cb0 <sk_load_565_dst_aarch64+0x14>
+  .long  0x17ffffcf                          // b             2c9c <sk_load_565_dst_aarch64+0x14>
 
 HIDDEN _sk_gather_565_aarch64
 .globl _sk_gather_565_aarch64
@@ -3404,24 +3394,24 @@
   .long  0x4eb01e30                          // orr           v16.16b, v17.16b, v16.16b
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
   .long  0x0e612a10                          // xtn           v16.4h, v16.4s
-  .long  0xb50000a4                          // cbnz          x4, 2e80 <sk_store_565_aarch64+0x58>
+  .long  0xb50000a4                          // cbnz          x4, 2e6c <sk_store_565_aarch64+0x58>
   .long  0xfd000110                          // str           d16, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000120                          // b.eq          2eac <sk_store_565_aarch64+0x84>  // b.none
+  .long  0x54000120                          // b.eq          2e98 <sk_store_565_aarch64+0x84>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
-  .long  0x540000a0                          // b.eq          2ea4 <sk_store_565_aarch64+0x7c>  // b.none
+  .long  0x540000a0                          // b.eq          2e90 <sk_store_565_aarch64+0x7c>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffee1                          // b.ne          2e74 <sk_store_565_aarch64+0x4c>  // b.any
+  .long  0x54fffee1                          // b.ne          2e60 <sk_store_565_aarch64+0x4c>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0d005130                          // st1           {v16.h}[2], [x9]
   .long  0x91000909                          // add           x9, x8, #0x2
   .long  0x0d004930                          // st1           {v16.h}[1], [x9]
   .long  0x0d004110                          // st1           {v16.h}[0], [x8]
-  .long  0x17fffff1                          // b             2e74 <sk_store_565_aarch64+0x4c>
+  .long  0x17fffff1                          // b             2e60 <sk_store_565_aarch64+0x4c>
 
 HIDDEN _sk_load_4444_aarch64
 .globl _sk_load_4444_aarch64
@@ -3430,7 +3420,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
-  .long  0xb5000444                          // cbnz          x4, 2f48 <sk_load_4444_aarch64+0x94>
+  .long  0xb5000444                          // cbnz          x4, 2f34 <sk_load_4444_aarch64+0x94>
   .long  0xfd400100                          // ldr           d0, [x8]
   .long  0x52a6f108                          // mov           w8, #0x37880000
   .long  0x2f10a400                          // uxtl          v0.4s, v0.4h
@@ -3466,12 +3456,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          2f94 <sk_load_4444_aarch64+0xe0>  // b.none
+  .long  0x54000220                          // b.eq          2f80 <sk_load_4444_aarch64+0xe0>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e400                          // movi          d0, #0x0
-  .long  0x540000c0                          // b.eq          2f74 <sk_load_4444_aarch64+0xc0>  // b.none
+  .long  0x540000c0                          // b.eq          2f60 <sk_load_4444_aarch64+0xc0>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffb21                          // b.ne          2ec8 <sk_load_4444_aarch64+0x14>  // b.any
+  .long  0x54fffb21                          // b.ne          2eb4 <sk_load_4444_aarch64+0x14>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x0d405120                          // ld1           {v0.h}[2], [x9]
@@ -3482,10 +3472,10 @@
   .long  0x0e401821                          // uzp1          v1.4h, v1.4h, v0.4h
   .long  0x2e012000                          // ext           v0.8b, v0.8b, v1.8b, #4
   .long  0x2e002000                          // ext           v0.8b, v0.8b, v0.8b, #4
-  .long  0x17ffffce                          // b             2ec8 <sk_load_4444_aarch64+0x14>
+  .long  0x17ffffce                          // b             2eb4 <sk_load_4444_aarch64+0x14>
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x0d404100                          // ld1           {v0.h}[0], [x8]
-  .long  0x17ffffcb                          // b             2ec8 <sk_load_4444_aarch64+0x14>
+  .long  0x17ffffcb                          // b             2eb4 <sk_load_4444_aarch64+0x14>
 
 HIDDEN _sk_load_4444_dst_aarch64
 .globl _sk_load_4444_dst_aarch64
@@ -3494,7 +3484,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
-  .long  0xb5000444                          // cbnz          x4, 3034 <sk_load_4444_dst_aarch64+0x94>
+  .long  0xb5000444                          // cbnz          x4, 3020 <sk_load_4444_dst_aarch64+0x94>
   .long  0xfd400104                          // ldr           d4, [x8]
   .long  0x52a6f108                          // mov           w8, #0x37880000
   .long  0x2f10a484                          // uxtl          v4.4s, v4.4h
@@ -3530,12 +3520,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          3080 <sk_load_4444_dst_aarch64+0xe0>  // b.none
+  .long  0x54000220                          // b.eq          306c <sk_load_4444_dst_aarch64+0xe0>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e404                          // movi          d4, #0x0
-  .long  0x540000c0                          // b.eq          3060 <sk_load_4444_dst_aarch64+0xc0>  // b.none
+  .long  0x540000c0                          // b.eq          304c <sk_load_4444_dst_aarch64+0xc0>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffb21                          // b.ne          2fb4 <sk_load_4444_dst_aarch64+0x14>  // b.any
+  .long  0x54fffb21                          // b.ne          2fa0 <sk_load_4444_dst_aarch64+0x14>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x0d405124                          // ld1           {v4.h}[2], [x9]
@@ -3546,10 +3536,10 @@
   .long  0x0e4018a5                          // uzp1          v5.4h, v5.4h, v0.4h
   .long  0x2e052084                          // ext           v4.8b, v4.8b, v5.8b, #4
   .long  0x2e042084                          // ext           v4.8b, v4.8b, v4.8b, #4
-  .long  0x17ffffce                          // b             2fb4 <sk_load_4444_dst_aarch64+0x14>
+  .long  0x17ffffce                          // b             2fa0 <sk_load_4444_dst_aarch64+0x14>
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x0d404104                          // ld1           {v4.h}[0], [x8]
-  .long  0x17ffffcb                          // b             2fb4 <sk_load_4444_dst_aarch64+0x14>
+  .long  0x17ffffcb                          // b             2fa0 <sk_load_4444_dst_aarch64+0x14>
 
 HIDDEN _sk_gather_4444_aarch64
 .globl _sk_gather_4444_aarch64
@@ -3628,24 +3618,24 @@
   .long  0x4eb01e30                          // orr           v16.16b, v17.16b, v16.16b
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
   .long  0x0e612a10                          // xtn           v16.4h, v16.4s
-  .long  0xb50000a4                          // cbnz          x4, 31b0 <sk_store_4444_aarch64+0x60>
+  .long  0xb50000a4                          // cbnz          x4, 319c <sk_store_4444_aarch64+0x60>
   .long  0xfd000110                          // str           d16, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000120                          // b.eq          31dc <sk_store_4444_aarch64+0x8c>  // b.none
+  .long  0x54000120                          // b.eq          31c8 <sk_store_4444_aarch64+0x8c>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
-  .long  0x540000a0                          // b.eq          31d4 <sk_store_4444_aarch64+0x84>  // b.none
+  .long  0x540000a0                          // b.eq          31c0 <sk_store_4444_aarch64+0x84>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffee1                          // b.ne          31a4 <sk_store_4444_aarch64+0x54>  // b.any
+  .long  0x54fffee1                          // b.ne          3190 <sk_store_4444_aarch64+0x54>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0d005130                          // st1           {v16.h}[2], [x9]
   .long  0x91000909                          // add           x9, x8, #0x2
   .long  0x0d004930                          // st1           {v16.h}[1], [x9]
   .long  0x0d004110                          // st1           {v16.h}[0], [x8]
-  .long  0x17fffff1                          // b             31a4 <sk_store_4444_aarch64+0x54>
+  .long  0x17fffff1                          // b             3190 <sk_store_4444_aarch64+0x54>
 
 HIDDEN _sk_load_8888_aarch64
 .globl _sk_load_8888_aarch64
@@ -3654,7 +3644,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020908                          // add           x8, x8, x2, lsl #2
-  .long  0xb50002e4                          // cbnz          x4, 324c <sk_load_8888_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 3238 <sk_load_8888_aarch64+0x68>
   .long  0x3dc00100                          // ldr           q0, [x8]
   .long  0x6f00e621                          // movi          v1.2d, #0xff000000ff
   .long  0x52a77008                          // mov           w8, #0x3b800000
@@ -3679,22 +3669,22 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x540001a0                          // b.eq          3288 <sk_load_8888_aarch64+0xa4>  // b.none
+  .long  0x540001a0                          // b.eq          3274 <sk_load_8888_aarch64+0xa4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x6f00e400                          // movi          v0.2d, #0x0
-  .long  0x540000c0                          // b.eq          3278 <sk_load_8888_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          3264 <sk_load_8888_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffc81                          // b.ne          31f8 <sk_load_8888_aarch64+0x14>  // b.any
+  .long  0x54fffc81                          // b.ne          31e4 <sk_load_8888_aarch64+0x14>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4e040fe0                          // dup           v0.4s, wzr
   .long  0x4d408120                          // ld1           {v0.s}[2], [x9]
   .long  0xfd400101                          // ldr           d1, [x8]
   .long  0x6e014000                          // ext           v0.16b, v0.16b, v1.16b, #8
   .long  0x6e004000                          // ext           v0.16b, v0.16b, v0.16b, #8
-  .long  0x17ffffdd                          // b             31f8 <sk_load_8888_aarch64+0x14>
+  .long  0x17ffffdd                          // b             31e4 <sk_load_8888_aarch64+0x14>
   .long  0x4e040fe0                          // dup           v0.4s, wzr
   .long  0x0d408100                          // ld1           {v0.s}[0], [x8]
-  .long  0x17ffffda                          // b             31f8 <sk_load_8888_aarch64+0x14>
+  .long  0x17ffffda                          // b             31e4 <sk_load_8888_aarch64+0x14>
 
 HIDDEN _sk_load_8888_dst_aarch64
 .globl _sk_load_8888_dst_aarch64
@@ -3703,7 +3693,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020908                          // add           x8, x8, x2, lsl #2
-  .long  0xb50002e4                          // cbnz          x4, 32fc <sk_load_8888_dst_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 32e8 <sk_load_8888_dst_aarch64+0x68>
   .long  0x3dc00104                          // ldr           q4, [x8]
   .long  0x6f00e625                          // movi          v5.2d, #0xff000000ff
   .long  0x52a77008                          // mov           w8, #0x3b800000
@@ -3728,22 +3718,22 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x540001a0                          // b.eq          3338 <sk_load_8888_dst_aarch64+0xa4>  // b.none
+  .long  0x540001a0                          // b.eq          3324 <sk_load_8888_dst_aarch64+0xa4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x6f00e404                          // movi          v4.2d, #0x0
-  .long  0x540000c0                          // b.eq          3328 <sk_load_8888_dst_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          3314 <sk_load_8888_dst_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffc81                          // b.ne          32a8 <sk_load_8888_dst_aarch64+0x14>  // b.any
+  .long  0x54fffc81                          // b.ne          3294 <sk_load_8888_dst_aarch64+0x14>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4e040fe4                          // dup           v4.4s, wzr
   .long  0x4d408124                          // ld1           {v4.s}[2], [x9]
   .long  0xfd400105                          // ldr           d5, [x8]
   .long  0x6e054084                          // ext           v4.16b, v4.16b, v5.16b, #8
   .long  0x6e044084                          // ext           v4.16b, v4.16b, v4.16b, #8
-  .long  0x17ffffdd                          // b             32a8 <sk_load_8888_dst_aarch64+0x14>
+  .long  0x17ffffdd                          // b             3294 <sk_load_8888_dst_aarch64+0x14>
   .long  0x4e040fe4                          // dup           v4.4s, wzr
   .long  0x0d408104                          // ld1           {v4.s}[0], [x8]
-  .long  0x17ffffda                          // b             32a8 <sk_load_8888_dst_aarch64+0x14>
+  .long  0x17ffffda                          // b             3294 <sk_load_8888_dst_aarch64+0x14>
 
 HIDDEN _sk_gather_8888_aarch64
 .globl _sk_gather_8888_aarch64
@@ -3811,24 +3801,207 @@
   .long  0x4eb21e31                          // orr           v17.16b, v17.16b, v18.16b
   .long  0x8b020908                          // add           x8, x8, x2, lsl #2
   .long  0x4eb01e30                          // orr           v16.16b, v17.16b, v16.16b
-  .long  0xb50000a4                          // cbnz          x4, 343c <sk_store_8888_aarch64+0x60>
+  .long  0xb50000a4                          // cbnz          x4, 3428 <sk_store_8888_aarch64+0x60>
   .long  0x3d800110                          // str           q16, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000120                          // b.eq          3468 <sk_store_8888_aarch64+0x8c>  // b.none
+  .long  0x54000120                          // b.eq          3454 <sk_store_8888_aarch64+0x8c>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
-  .long  0x540000a0                          // b.eq          3460 <sk_store_8888_aarch64+0x84>  // b.none
+  .long  0x540000a0                          // b.eq          344c <sk_store_8888_aarch64+0x84>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffee1                          // b.ne          3430 <sk_store_8888_aarch64+0x54>  // b.any
+  .long  0x54fffee1                          // b.ne          341c <sk_store_8888_aarch64+0x54>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4d008130                          // st1           {v16.s}[2], [x9]
   .long  0xfd000110                          // str           d16, [x8]
-  .long  0x17fffff3                          // b             3430 <sk_store_8888_aarch64+0x54>
+  .long  0x17fffff3                          // b             341c <sk_store_8888_aarch64+0x54>
   .long  0x0d008110                          // st1           {v16.s}[0], [x8]
-  .long  0x17fffff1                          // b             3430 <sk_store_8888_aarch64+0x54>
+  .long  0x17fffff1                          // b             341c <sk_store_8888_aarch64+0x54>
+
+HIDDEN _sk_load_bgra_aarch64
+.globl _sk_load_bgra_aarch64
+FUNCTION(_sk_load_bgra_aarch64)
+_sk_load_bgra_aarch64:
+  .long  0xf9400028                          // ldr           x8, [x1]
+  .long  0xf9400108                          // ldr           x8, [x8]
+  .long  0x8b020908                          // add           x8, x8, x2, lsl #2
+  .long  0xb50002e4                          // cbnz          x4, 34c4 <sk_load_bgra_aarch64+0x68>
+  .long  0x3dc00100                          // ldr           q0, [x8]
+  .long  0x6f00e621                          // movi          v1.2d, #0xff000000ff
+  .long  0x52a77008                          // mov           w8, #0x3b800000
+  .long  0x6f380402                          // ushr          v2.4s, v0.4s, #8
+  .long  0x6f300403                          // ushr          v3.4s, v0.4s, #16
+  .long  0xf9400425                          // ldr           x5, [x1, #8]
+  .long  0x72901028                          // movk          w8, #0x8081
+  .long  0x6f280410                          // ushr          v16.4s, v0.4s, #24
+  .long  0x4e211c00                          // and           v0.16b, v0.16b, v1.16b
+  .long  0x4e211c42                          // and           v2.16b, v2.16b, v1.16b
+  .long  0x4e211c61                          // and           v1.16b, v3.16b, v1.16b
+  .long  0x4e040d11                          // dup           v17.4s, w8
+  .long  0x4e21da03                          // scvtf         v3.4s, v16.4s
+  .long  0x4e21d800                          // scvtf         v0.4s, v0.4s
+  .long  0x4e21d850                          // scvtf         v16.4s, v2.4s
+  .long  0x4e21d832                          // scvtf         v18.4s, v1.4s
+  .long  0x6e31dc63                          // fmul          v3.4s, v3.4s, v17.4s
+  .long  0x6e31dc02                          // fmul          v2.4s, v0.4s, v17.4s
+  .long  0x6e31de01                          // fmul          v1.4s, v16.4s, v17.4s
+  .long  0x6e31de40                          // fmul          v0.4s, v18.4s, v17.4s
+  .long  0x91004021                          // add           x1, x1, #0x10
+  .long  0xd61f00a0                          // br            x5
+  .long  0x12000489                          // and           w9, w4, #0x3
+  .long  0x7100053f                          // cmp           w9, #0x1
+  .long  0x540001a0                          // b.eq          3500 <sk_load_bgra_aarch64+0xa4>  // b.none
+  .long  0x7100093f                          // cmp           w9, #0x2
+  .long  0x6f00e400                          // movi          v0.2d, #0x0
+  .long  0x540000c0                          // b.eq          34f0 <sk_load_bgra_aarch64+0x94>  // b.none
+  .long  0x71000d3f                          // cmp           w9, #0x3
+  .long  0x54fffc81                          // b.ne          3470 <sk_load_bgra_aarch64+0x14>  // b.any
+  .long  0x91002109                          // add           x9, x8, #0x8
+  .long  0x4e040fe0                          // dup           v0.4s, wzr
+  .long  0x4d408120                          // ld1           {v0.s}[2], [x9]
+  .long  0xfd400101                          // ldr           d1, [x8]
+  .long  0x6e014000                          // ext           v0.16b, v0.16b, v1.16b, #8
+  .long  0x6e004000                          // ext           v0.16b, v0.16b, v0.16b, #8
+  .long  0x17ffffdd                          // b             3470 <sk_load_bgra_aarch64+0x14>
+  .long  0x4e040fe0                          // dup           v0.4s, wzr
+  .long  0x0d408100                          // ld1           {v0.s}[0], [x8]
+  .long  0x17ffffda                          // b             3470 <sk_load_bgra_aarch64+0x14>
+
+HIDDEN _sk_load_bgra_dst_aarch64
+.globl _sk_load_bgra_dst_aarch64
+FUNCTION(_sk_load_bgra_dst_aarch64)
+_sk_load_bgra_dst_aarch64:
+  .long  0xf9400028                          // ldr           x8, [x1]
+  .long  0xf9400108                          // ldr           x8, [x8]
+  .long  0x8b020908                          // add           x8, x8, x2, lsl #2
+  .long  0xb50002e4                          // cbnz          x4, 3574 <sk_load_bgra_dst_aarch64+0x68>
+  .long  0x3dc00104                          // ldr           q4, [x8]
+  .long  0x6f00e625                          // movi          v5.2d, #0xff000000ff
+  .long  0x52a77008                          // mov           w8, #0x3b800000
+  .long  0x6f380486                          // ushr          v6.4s, v4.4s, #8
+  .long  0x6f300487                          // ushr          v7.4s, v4.4s, #16
+  .long  0xf9400425                          // ldr           x5, [x1, #8]
+  .long  0x72901028                          // movk          w8, #0x8081
+  .long  0x6f280490                          // ushr          v16.4s, v4.4s, #24
+  .long  0x4e251c84                          // and           v4.16b, v4.16b, v5.16b
+  .long  0x4e251cc6                          // and           v6.16b, v6.16b, v5.16b
+  .long  0x4e251ce5                          // and           v5.16b, v7.16b, v5.16b
+  .long  0x4e040d11                          // dup           v17.4s, w8
+  .long  0x4e21da07                          // scvtf         v7.4s, v16.4s
+  .long  0x4e21d884                          // scvtf         v4.4s, v4.4s
+  .long  0x4e21d8d0                          // scvtf         v16.4s, v6.4s
+  .long  0x4e21d8b2                          // scvtf         v18.4s, v5.4s
+  .long  0x6e31dce7                          // fmul          v7.4s, v7.4s, v17.4s
+  .long  0x6e31dc86                          // fmul          v6.4s, v4.4s, v17.4s
+  .long  0x6e31de05                          // fmul          v5.4s, v16.4s, v17.4s
+  .long  0x6e31de44                          // fmul          v4.4s, v18.4s, v17.4s
+  .long  0x91004021                          // add           x1, x1, #0x10
+  .long  0xd61f00a0                          // br            x5
+  .long  0x12000489                          // and           w9, w4, #0x3
+  .long  0x7100053f                          // cmp           w9, #0x1
+  .long  0x540001a0                          // b.eq          35b0 <sk_load_bgra_dst_aarch64+0xa4>  // b.none
+  .long  0x7100093f                          // cmp           w9, #0x2
+  .long  0x6f00e404                          // movi          v4.2d, #0x0
+  .long  0x540000c0                          // b.eq          35a0 <sk_load_bgra_dst_aarch64+0x94>  // b.none
+  .long  0x71000d3f                          // cmp           w9, #0x3
+  .long  0x54fffc81                          // b.ne          3520 <sk_load_bgra_dst_aarch64+0x14>  // b.any
+  .long  0x91002109                          // add           x9, x8, #0x8
+  .long  0x4e040fe4                          // dup           v4.4s, wzr
+  .long  0x4d408124                          // ld1           {v4.s}[2], [x9]
+  .long  0xfd400105                          // ldr           d5, [x8]
+  .long  0x6e054084                          // ext           v4.16b, v4.16b, v5.16b, #8
+  .long  0x6e044084                          // ext           v4.16b, v4.16b, v4.16b, #8
+  .long  0x17ffffdd                          // b             3520 <sk_load_bgra_dst_aarch64+0x14>
+  .long  0x4e040fe4                          // dup           v4.4s, wzr
+  .long  0x0d408104                          // ld1           {v4.s}[0], [x8]
+  .long  0x17ffffda                          // b             3520 <sk_load_bgra_dst_aarch64+0x14>
+
+HIDDEN _sk_gather_bgra_aarch64
+.globl _sk_gather_bgra_aarch64
+FUNCTION(_sk_gather_bgra_aarch64)
+_sk_gather_bgra_aarch64:
+  .long  0xa8c11428                          // ldp           x8, x5, [x1], #16
+  .long  0x4ea1b821                          // fcvtzs        v1.4s, v1.4s
+  .long  0x4ea1b800                          // fcvtzs        v0.4s, v0.4s
+  .long  0x91004109                          // add           x9, x8, #0x10
+  .long  0x4d40c922                          // ld1r          {v2.4s}, [x9]
+  .long  0xf9400108                          // ldr           x8, [x8]
+  .long  0x4ea19440                          // mla           v0.4s, v2.4s, v1.4s
+  .long  0x1e26000c                          // fmov          w12, s0
+  .long  0x8b2c490c                          // add           x12, x8, w12, uxtw #2
+  .long  0x0e0c3c09                          // mov           w9, v0.s[1]
+  .long  0x0e143c0a                          // mov           w10, v0.s[2]
+  .long  0x0e1c3c0b                          // mov           w11, v0.s[3]
+  .long  0x0d408180                          // ld1           {v0.s}[0], [x12]
+  .long  0x8b294909                          // add           x9, x8, w9, uxtw #2
+  .long  0xb86a590a                          // ldr           w10, [x8, w10, uxtw #2]
+  .long  0xb86b5908                          // ldr           w8, [x8, w11, uxtw #2]
+  .long  0x0d409120                          // ld1           {v0.s}[1], [x9]
+  .long  0x6f00e621                          // movi          v1.2d, #0xff000000ff
+  .long  0x52a77009                          // mov           w9, #0x3b800000
+  .long  0x72901029                          // movk          w9, #0x8081
+  .long  0x4e141d40                          // mov           v0.s[2], w10
+  .long  0x4e1c1d00                          // mov           v0.s[3], w8
+  .long  0x6f380403                          // ushr          v3.4s, v0.4s, #8
+  .long  0x6f300411                          // ushr          v17.4s, v0.4s, #16
+  .long  0x4e211c02                          // and           v2.16b, v0.16b, v1.16b
+  .long  0x6f280400                          // ushr          v0.4s, v0.4s, #24
+  .long  0x4e211c63                          // and           v3.16b, v3.16b, v1.16b
+  .long  0x4e211e21                          // and           v1.16b, v17.16b, v1.16b
+  .long  0x4e040d30                          // dup           v16.4s, w9
+  .long  0x4e21d842                          // scvtf         v2.4s, v2.4s
+  .long  0x4e21d800                          // scvtf         v0.4s, v0.4s
+  .long  0x4e21d871                          // scvtf         v17.4s, v3.4s
+  .long  0x4e21d832                          // scvtf         v18.4s, v1.4s
+  .long  0x6e30dc42                          // fmul          v2.4s, v2.4s, v16.4s
+  .long  0x6e30dc03                          // fmul          v3.4s, v0.4s, v16.4s
+  .long  0x6e30de21                          // fmul          v1.4s, v17.4s, v16.4s
+  .long  0x6e30de40                          // fmul          v0.4s, v18.4s, v16.4s
+  .long  0xd61f00a0                          // br            x5
+
+HIDDEN _sk_store_bgra_aarch64
+.globl _sk_store_bgra_aarch64
+FUNCTION(_sk_store_bgra_aarch64)
+_sk_store_bgra_aarch64:
+  .long  0x52a86fe9                          // mov           w9, #0x437f0000
+  .long  0xf9400028                          // ldr           x8, [x1]
+  .long  0x4e040d30                          // dup           v16.4s, w9
+  .long  0x6e30dc32                          // fmul          v18.4s, v1.4s, v16.4s
+  .long  0x6e30dc51                          // fmul          v17.4s, v2.4s, v16.4s
+  .long  0x6e21aa52                          // fcvtnu        v18.4s, v18.4s
+  .long  0x6e21aa31                          // fcvtnu        v17.4s, v17.4s
+  .long  0x4f285652                          // shl           v18.4s, v18.4s, #8
+  .long  0x4eb11e51                          // orr           v17.16b, v18.16b, v17.16b
+  .long  0x6e30dc12                          // fmul          v18.4s, v0.4s, v16.4s
+  .long  0xf9400108                          // ldr           x8, [x8]
+  .long  0x6e30dc70                          // fmul          v16.4s, v3.4s, v16.4s
+  .long  0x6e21aa52                          // fcvtnu        v18.4s, v18.4s
+  .long  0x6e21aa10                          // fcvtnu        v16.4s, v16.4s
+  .long  0x4f305652                          // shl           v18.4s, v18.4s, #16
+  .long  0x4f385610                          // shl           v16.4s, v16.4s, #24
+  .long  0x4eb21e31                          // orr           v17.16b, v17.16b, v18.16b
+  .long  0x8b020908                          // add           x8, x8, x2, lsl #2
+  .long  0x4eb01e30                          // orr           v16.16b, v17.16b, v16.16b
+  .long  0xb50000a4                          // cbnz          x4, 36b4 <sk_store_bgra_aarch64+0x60>
+  .long  0x3d800110                          // str           q16, [x8]
+  .long  0xf9400425                          // ldr           x5, [x1, #8]
+  .long  0x91004021                          // add           x1, x1, #0x10
+  .long  0xd61f00a0                          // br            x5
+  .long  0x12000489                          // and           w9, w4, #0x3
+  .long  0x7100053f                          // cmp           w9, #0x1
+  .long  0x54000120                          // b.eq          36e0 <sk_store_bgra_aarch64+0x8c>  // b.none
+  .long  0x7100093f                          // cmp           w9, #0x2
+  .long  0x540000a0                          // b.eq          36d8 <sk_store_bgra_aarch64+0x84>  // b.none
+  .long  0x71000d3f                          // cmp           w9, #0x3
+  .long  0x54fffee1                          // b.ne          36a8 <sk_store_bgra_aarch64+0x54>  // b.any
+  .long  0x91002109                          // add           x9, x8, #0x8
+  .long  0x4d008130                          // st1           {v16.s}[2], [x9]
+  .long  0xfd000110                          // str           d16, [x8]
+  .long  0x17fffff3                          // b             36a8 <sk_store_bgra_aarch64+0x54>
+  .long  0x0d008110                          // st1           {v16.s}[0], [x8]
+  .long  0x17fffff1                          // b             36a8 <sk_store_bgra_aarch64+0x54>
 
 HIDDEN _sk_load_f16_aarch64
 .globl _sk_load_f16_aarch64
@@ -3837,7 +4010,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020d08                          // add           x8, x8, x2, lsl #3
-  .long  0xb5000124                          // cbnz          x4, 34a0 <sk_load_f16_aarch64+0x30>
+  .long  0xb5000124                          // cbnz          x4, 3718 <sk_load_f16_aarch64+0x30>
   .long  0x0c400510                          // ld4           {v16.4h-v19.4h}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x0e217a00                          // fcvtl         v0.4s, v16.4h
@@ -3848,14 +4021,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d606110                          // ld4           {v16.h-v19.h}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fffee0                          // b.eq          3484 <sk_load_f16_aarch64+0x14>  // b.none
+  .long  0x54fffee0                          // b.eq          36fc <sk_load_f16_aarch64+0x14>  // b.none
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x0d606930                          // ld4           {v16.h-v19.h}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffe63                          // b.cc          3484 <sk_load_f16_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffe63                          // b.cc          36fc <sk_load_f16_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91004108                          // add           x8, x8, #0x10
   .long  0x0d607110                          // ld4           {v16.h-v19.h}[2], [x8]
-  .long  0x17fffff0                          // b             3484 <sk_load_f16_aarch64+0x14>
+  .long  0x17fffff0                          // b             36fc <sk_load_f16_aarch64+0x14>
 
 HIDDEN _sk_load_f16_dst_aarch64
 .globl _sk_load_f16_dst_aarch64
@@ -3864,7 +4037,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020d08                          // add           x8, x8, x2, lsl #3
-  .long  0xb5000124                          // cbnz          x4, 34f8 <sk_load_f16_dst_aarch64+0x30>
+  .long  0xb5000124                          // cbnz          x4, 3770 <sk_load_f16_dst_aarch64+0x30>
   .long  0x0c400510                          // ld4           {v16.4h-v19.4h}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x0e217a04                          // fcvtl         v4.4s, v16.4h
@@ -3875,14 +4048,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d606110                          // ld4           {v16.h-v19.h}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fffee0                          // b.eq          34dc <sk_load_f16_dst_aarch64+0x14>  // b.none
+  .long  0x54fffee0                          // b.eq          3754 <sk_load_f16_dst_aarch64+0x14>  // b.none
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x0d606930                          // ld4           {v16.h-v19.h}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffe63                          // b.cc          34dc <sk_load_f16_dst_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffe63                          // b.cc          3754 <sk_load_f16_dst_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91004108                          // add           x8, x8, #0x10
   .long  0x0d607110                          // ld4           {v16.h-v19.h}[2], [x8]
-  .long  0x17fffff0                          // b             34dc <sk_load_f16_dst_aarch64+0x14>
+  .long  0x17fffff0                          // b             3754 <sk_load_f16_dst_aarch64+0x14>
 
 HIDDEN _sk_gather_f16_aarch64
 .globl _sk_gather_f16_aarch64
@@ -3936,21 +4109,21 @@
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x0e216873                          // fcvtn         v19.4h, v3.4s
   .long  0x8b020d08                          // add           x8, x8, x2, lsl #3
-  .long  0xb50000a4                          // cbnz          x4, 35e0 <sk_store_f16_aarch64+0x30>
+  .long  0xb50000a4                          // cbnz          x4, 3858 <sk_store_f16_aarch64+0x30>
   .long  0x0c000510                          // st4           {v16.4h-v19.4h}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0xf100049f                          // cmp           x4, #0x1
   .long  0x0d206110                          // st4           {v16.h-v19.h}[0], [x8]
-  .long  0x54ffff60                          // b.eq          35d4 <sk_store_f16_aarch64+0x24>  // b.none
+  .long  0x54ffff60                          // b.eq          384c <sk_store_f16_aarch64+0x24>  // b.none
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0xf1000c9f                          // cmp           x4, #0x3
   .long  0x0d206930                          // st4           {v16.h-v19.h}[1], [x9]
-  .long  0x54fffee3                          // b.cc          35d4 <sk_store_f16_aarch64+0x24>  // b.lo, b.ul, b.last
+  .long  0x54fffee3                          // b.cc          384c <sk_store_f16_aarch64+0x24>  // b.lo, b.ul, b.last
   .long  0x91004108                          // add           x8, x8, #0x10
   .long  0x0d207110                          // st4           {v16.h-v19.h}[2], [x8]
-  .long  0x17fffff4                          // b             35d4 <sk_store_f16_aarch64+0x24>
+  .long  0x17fffff4                          // b             384c <sk_store_f16_aarch64+0x24>
 
 HIDDEN _sk_load_u16_be_aarch64
 .globl _sk_load_u16_be_aarch64
@@ -3959,7 +4132,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020d08                          // add           x8, x8, x2, lsl #3
-  .long  0xb5000404                          // cbnz          x4, 3694 <sk_load_u16_be_aarch64+0x8c>
+  .long  0xb5000404                          // cbnz          x4, 390c <sk_load_u16_be_aarch64+0x8c>
   .long  0x0c400500                          // ld4           {v0.4h-v3.4h}, [x8]
   .long  0x0f185410                          // shl           v16.4h, v0.4h, #8
   .long  0x2f180411                          // ushr          v17.4h, v0.4h, #8
@@ -3993,14 +4166,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d606100                          // ld4           {v0.h-v3.h}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fffc00                          // b.eq          361c <sk_load_u16_be_aarch64+0x14>  // b.none
+  .long  0x54fffc00                          // b.eq          3894 <sk_load_u16_be_aarch64+0x14>  // b.none
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x0d606920                          // ld4           {v0.h-v3.h}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffb83                          // b.cc          361c <sk_load_u16_be_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffb83                          // b.cc          3894 <sk_load_u16_be_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91004108                          // add           x8, x8, #0x10
   .long  0x0d607100                          // ld4           {v0.h-v3.h}[2], [x8]
-  .long  0x17ffffd9                          // b             361c <sk_load_u16_be_aarch64+0x14>
+  .long  0x17ffffd9                          // b             3894 <sk_load_u16_be_aarch64+0x14>
 
 HIDDEN _sk_load_rgb_u16_be_aarch64
 .globl _sk_load_rgb_u16_be_aarch64
@@ -4010,7 +4183,7 @@
   .long  0x321f07e9                          // orr           w9, wzr, #0x6
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x9b092048                          // madd          x8, x2, x9, x8
-  .long  0xb5000384                          // cbnz          x4, 373c <sk_load_rgb_u16_be_aarch64+0x80>
+  .long  0xb5000384                          // cbnz          x4, 39b4 <sk_load_rgb_u16_be_aarch64+0x80>
   .long  0x0c404500                          // ld3           {v0.4h-v2.4h}, [x8]
   .long  0x0f185403                          // shl           v3.4h, v0.4h, #8
   .long  0x2f180410                          // ushr          v16.4h, v0.4h, #8
@@ -4040,14 +4213,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d406100                          // ld3           {v0.h-v2.h}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fffc80                          // b.eq          36d4 <sk_load_rgb_u16_be_aarch64+0x18>  // b.none
+  .long  0x54fffc80                          // b.eq          394c <sk_load_rgb_u16_be_aarch64+0x18>  // b.none
   .long  0x91001909                          // add           x9, x8, #0x6
   .long  0x0d406920                          // ld3           {v0.h-v2.h}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffc03                          // b.cc          36d4 <sk_load_rgb_u16_be_aarch64+0x18>  // b.lo, b.ul, b.last
+  .long  0x54fffc03                          // b.cc          394c <sk_load_rgb_u16_be_aarch64+0x18>  // b.lo, b.ul, b.last
   .long  0x91003108                          // add           x8, x8, #0xc
   .long  0x0d407100                          // ld3           {v0.h-v2.h}[2], [x8]
-  .long  0x17ffffdd                          // b             36d4 <sk_load_rgb_u16_be_aarch64+0x18>
+  .long  0x17ffffdd                          // b             394c <sk_load_rgb_u16_be_aarch64+0x18>
 
 HIDDEN _sk_store_u16_be_aarch64
 .globl _sk_store_u16_be_aarch64
@@ -4083,21 +4256,21 @@
   .long  0x2f180694                          // ushr          v20.4h, v20.4h, #8
   .long  0x8b020d08                          // add           x8, x8, x2, lsl #3
   .long  0x0eb41eb3                          // orr           v19.8b, v21.8b, v20.8b
-  .long  0xb50000a4                          // cbnz          x4, 37f0 <sk_store_u16_be_aarch64+0x8c>
+  .long  0xb50000a4                          // cbnz          x4, 3a68 <sk_store_u16_be_aarch64+0x8c>
   .long  0x0c000510                          // st4           {v16.4h-v19.4h}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0xf100049f                          // cmp           x4, #0x1
   .long  0x0d206110                          // st4           {v16.h-v19.h}[0], [x8]
-  .long  0x54ffff60                          // b.eq          37e4 <sk_store_u16_be_aarch64+0x80>  // b.none
+  .long  0x54ffff60                          // b.eq          3a5c <sk_store_u16_be_aarch64+0x80>  // b.none
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0xf1000c9f                          // cmp           x4, #0x3
   .long  0x0d206930                          // st4           {v16.h-v19.h}[1], [x9]
-  .long  0x54fffee3                          // b.cc          37e4 <sk_store_u16_be_aarch64+0x80>  // b.lo, b.ul, b.last
+  .long  0x54fffee3                          // b.cc          3a5c <sk_store_u16_be_aarch64+0x80>  // b.lo, b.ul, b.last
   .long  0x91004108                          // add           x8, x8, #0x10
   .long  0x0d207110                          // st4           {v16.h-v19.h}[2], [x8]
-  .long  0x17fffff4                          // b             37e4 <sk_store_u16_be_aarch64+0x80>
+  .long  0x17fffff4                          // b             3a5c <sk_store_u16_be_aarch64+0x80>
 
 HIDDEN _sk_load_f32_aarch64
 .globl _sk_load_f32_aarch64
@@ -4106,21 +4279,21 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b021108                          // add           x8, x8, x2, lsl #4
-  .long  0xb50000a4                          // cbnz          x4, 3838 <sk_load_f32_aarch64+0x20>
+  .long  0xb50000a4                          // cbnz          x4, 3ab0 <sk_load_f32_aarch64+0x20>
   .long  0x4c400900                          // ld4           {v0.4s-v3.4s}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x0d60a100                          // ld4           {v0.s-v3.s}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54ffff60                          // b.eq          382c <sk_load_f32_aarch64+0x14>  // b.none
+  .long  0x54ffff60                          // b.eq          3aa4 <sk_load_f32_aarch64+0x14>  // b.none
   .long  0x91004109                          // add           x9, x8, #0x10
   .long  0x0d60b120                          // ld4           {v0.s-v3.s}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffee3                          // b.cc          382c <sk_load_f32_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffee3                          // b.cc          3aa4 <sk_load_f32_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91008108                          // add           x8, x8, #0x20
   .long  0x4d60a100                          // ld4           {v0.s-v3.s}[2], [x8]
-  .long  0x17fffff4                          // b             382c <sk_load_f32_aarch64+0x14>
+  .long  0x17fffff4                          // b             3aa4 <sk_load_f32_aarch64+0x14>
 
 HIDDEN _sk_load_f32_dst_aarch64
 .globl _sk_load_f32_dst_aarch64
@@ -4129,21 +4302,21 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b021108                          // add           x8, x8, x2, lsl #4
-  .long  0xb50000a4                          // cbnz          x4, 3880 <sk_load_f32_dst_aarch64+0x20>
+  .long  0xb50000a4                          // cbnz          x4, 3af8 <sk_load_f32_dst_aarch64+0x20>
   .long  0x4c400904                          // ld4           {v4.4s-v7.4s}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x0d60a104                          // ld4           {v4.s-v7.s}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54ffff60                          // b.eq          3874 <sk_load_f32_dst_aarch64+0x14>  // b.none
+  .long  0x54ffff60                          // b.eq          3aec <sk_load_f32_dst_aarch64+0x14>  // b.none
   .long  0x91004109                          // add           x9, x8, #0x10
   .long  0x0d60b124                          // ld4           {v4.s-v7.s}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffee3                          // b.cc          3874 <sk_load_f32_dst_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffee3                          // b.cc          3aec <sk_load_f32_dst_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91008108                          // add           x8, x8, #0x20
   .long  0x4d60a104                          // ld4           {v4.s-v7.s}[2], [x8]
-  .long  0x17fffff4                          // b             3874 <sk_load_f32_dst_aarch64+0x14>
+  .long  0x17fffff4                          // b             3aec <sk_load_f32_dst_aarch64+0x14>
 
 HIDDEN _sk_store_f32_aarch64
 .globl _sk_store_f32_aarch64
@@ -4152,21 +4325,21 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b021108                          // add           x8, x8, x2, lsl #4
-  .long  0xb50000a4                          // cbnz          x4, 38c8 <sk_store_f32_aarch64+0x20>
+  .long  0xb50000a4                          // cbnz          x4, 3b40 <sk_store_f32_aarch64+0x20>
   .long  0x4c000900                          // st4           {v0.4s-v3.4s}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0xf100049f                          // cmp           x4, #0x1
   .long  0x0d20a100                          // st4           {v0.s-v3.s}[0], [x8]
-  .long  0x54ffff60                          // b.eq          38bc <sk_store_f32_aarch64+0x14>  // b.none
+  .long  0x54ffff60                          // b.eq          3b34 <sk_store_f32_aarch64+0x14>  // b.none
   .long  0x91004109                          // add           x9, x8, #0x10
   .long  0xf1000c9f                          // cmp           x4, #0x3
   .long  0x0d20b120                          // st4           {v0.s-v3.s}[1], [x9]
-  .long  0x54fffee3                          // b.cc          38bc <sk_store_f32_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffee3                          // b.cc          3b34 <sk_store_f32_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91008108                          // add           x8, x8, #0x20
   .long  0x4d20a100                          // st4           {v0.s-v3.s}[2], [x8]
-  .long  0x17fffff4                          // b             38bc <sk_store_f32_aarch64+0x14>
+  .long  0x17fffff4                          // b             3b34 <sk_store_f32_aarch64+0x14>
 
 HIDDEN _sk_clamp_x_aarch64
 .globl _sk_clamp_x_aarch64
@@ -4625,7 +4798,7 @@
   .long  0x6f00e411                          // movi          v17.2d, #0x0
   .long  0xf9400109                          // ldr           x9, [x8]
   .long  0xf100093f                          // cmp           x9, #0x2
-  .long  0x540001c3                          // b.cc          3ee8 <sk_gradient_aarch64+0x58>  // b.lo, b.ul, b.last
+  .long  0x540001c3                          // b.cc          4160 <sk_gradient_aarch64+0x58>  // b.lo, b.ul, b.last
   .long  0xf940250a                          // ldr           x10, [x8, #72]
   .long  0xd1000529                          // sub           x9, x9, #0x1
   .long  0x6f00e401                          // movi          v1.2d, #0x0
@@ -4636,7 +4809,7 @@
   .long  0x6e23e403                          // fcmge         v3.4s, v0.4s, v3.4s
   .long  0x4e221c63                          // and           v3.16b, v3.16b, v2.16b
   .long  0x4ea18461                          // add           v1.4s, v3.4s, v1.4s
-  .long  0xb5ffff69                          // cbnz          x9, 3ec8 <sk_gradient_aarch64+0x38>
+  .long  0xb5ffff69                          // cbnz          x9, 4140 <sk_gradient_aarch64+0x38>
   .long  0x6f20a431                          // uxtl2         v17.2d, v1.4s
   .long  0x2f20a421                          // uxtl          v1.2d, v1.2s
   .long  0xa940b10a                          // ldp           x10, x12, [x8, #8]
@@ -6660,16 +6833,6 @@
   .long  0xeeb02b60                          // vmov.f64      d2, d16
   .long  0xe12fff1c                          // bx            ip
 
-HIDDEN _sk_swap_rb_dst_vfp4
-.globl _sk_swap_rb_dst_vfp4
-FUNCTION(_sk_swap_rb_dst_vfp4)
-_sk_swap_rb_dst_vfp4:
-  .long  0xeef00b44                          // vmov.f64      d16, d4
-  .long  0xe491c004                          // ldr           ip, [r1], #4
-  .long  0xeeb04b46                          // vmov.f64      d4, d6
-  .long  0xeeb06b60                          // vmov.f64      d6, d16
-  .long  0xe12fff1c                          // bx            ip
-
 HIDDEN _sk_move_src_dst_vfp4
 .globl _sk_move_src_dst_vfp4
 FUNCTION(_sk_move_src_dst_vfp4)
@@ -6719,7 +6882,6 @@
   .long  0xf3012d92                          // vmul.f32      d2, d17, d2
   .long  0xecbd8b04                          // vpop          {d8-d9}
   .long  0xe12fff1c                          // bx            ip
-  .long  0xe320f000                          // nop           {0}
 
 HIDDEN _sk_from_srgb_vfp4
 .globl _sk_from_srgb_vfp4
@@ -7075,7 +7237,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a000014                          // beq           1a80 <sk_scale_u8_vfp4+0x78>
+  .long  0x0a000014                          // beq           1a68 <sk_scale_u8_vfp4+0x78>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b4                          // strh          ip, [sp, #4]
   .long  0xe28dc004                          // add           ip, sp, #4
@@ -7100,7 +7262,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf8a03                          // vldr          s17, [pc, #12]
   .long  0xee08ca10                          // vmov          s16, ip
-  .long  0xeaffffec                          // b             1a44 <sk_scale_u8_vfp4+0x3c>
+  .long  0xeaffffec                          // b             1a2c <sk_scale_u8_vfp4+0x3c>
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x00000000                          // .word         0x00000000
@@ -7141,7 +7303,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a00001e                          // beq           1b88 <sk_lerp_u8_vfp4+0xa0>
+  .long  0x0a00001e                          // beq           1b70 <sk_lerp_u8_vfp4+0xa0>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b4                          // strh          ip, [sp, #4]
   .long  0xe28dc004                          // add           ip, sp, #4
@@ -7176,7 +7338,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf8a03                          // vldr          s17, [pc, #12]
   .long  0xee08ca10                          // vmov          s16, ip
-  .long  0xeaffffe2                          // b             1b24 <sk_lerp_u8_vfp4+0x3c>
+  .long  0xeaffffe2                          // b             1b0c <sk_lerp_u8_vfp4+0x3c>
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x00000000                          // .word         0x00000000
@@ -7194,7 +7356,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc082                          // add           ip, ip, r2, lsl #1
-  .long  0x0a00002e                          // beq           1c88 <sk_lerp_565_vfp4+0xe0>
+  .long  0x0a00002e                          // beq           1c70 <sk_lerp_565_vfp4+0xe0>
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe58dc004                          // str           ip, [sp, #4]
   .long  0xe28dc004                          // add           ip, sp, #4
@@ -7245,7 +7407,7 @@
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xeddf8a07                          // vldr          s17, [pc, #28]
   .long  0xee08ca10                          // vmov          s16, ip
-  .long  0xeaffffd1                          // b             1be0 <sk_lerp_565_vfp4+0x38>
+  .long  0xeaffffd1                          // b             1bc8 <sk_lerp_565_vfp4+0x38>
   .long  0x3d042108                          // .word         0x3d042108
   .long  0x3d042108                          // .word         0x3d042108
   .long  0x3a020821                          // .word         0x3a020821
@@ -7265,7 +7427,7 @@
   .long  0xe59ce000                          // ldr           lr, [ip]
   .long  0xe3540001                          // cmp           r4, #1
   .long  0xe08ee102                          // add           lr, lr, r2, lsl #2
-  .long  0x0a000023                          // beq           1d64 <sk_load_tables_vfp4+0xac>
+  .long  0x0a000023                          // beq           1d4c <sk_load_tables_vfp4+0xac>
   .long  0xed9e0b00                          // vldr          d0, [lr]
   .long  0xf3c7001f                          // vmov.i32      d16, #255
   .long  0xe59c7004                          // ldr           r7, [ip, #4]
@@ -7304,7 +7466,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xeddf0a03                          // vldr          s1, [pc, #12]
   .long  0xed9e0a00                          // vldr          s0, [lr]
-  .long  0xeaffffd9                          // b             1cd8 <sk_load_tables_vfp4+0x20>
+  .long  0xeaffffd9                          // b             1cc0 <sk_load_tables_vfp4+0x20>
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x00000000                          // .word         0x00000000
@@ -7321,7 +7483,7 @@
   .long  0xe3540000                          // cmp           r4, #0
   .long  0xe08ee182                          // add           lr, lr, r2, lsl #3
   .long  0xf4ee070f                          // vld4.16       {d16[0],d17[0],d18[0],d19[0]}, [lr]
-  .long  0x1a000001                          // bne           1da8 <sk_load_tables_u16_be_vfp4+0x28>
+  .long  0x1a000001                          // bne           1d90 <sk_load_tables_u16_be_vfp4+0x28>
   .long  0xe28e4008                          // add           r4, lr, #8
   .long  0xf4e4074f                          // vld4.16       {d16[1],d17[1],d18[1],d19[1]}, [r4]
   .long  0xee924bb0                          // vmov.u16      r4, d18[0]
@@ -7393,7 +7555,7 @@
   .long  0xe59d4020                          // ldr           r4, [sp, #32]
   .long  0xf4ee060f                          // vld3.16       {d16[0],d17[0],d18[0]}, [lr]
   .long  0xe3540000                          // cmp           r4, #0
-  .long  0x1a000001                          // bne           1eb4 <sk_load_tables_rgb_u16_be_vfp4+0x2c>
+  .long  0x1a000001                          // bne           1e9c <sk_load_tables_rgb_u16_be_vfp4+0x2c>
   .long  0xe28e4006                          // add           r4, lr, #6
   .long  0xf4e4064f                          // vld3.16       {d16[1],d17[1],d18[1]}, [r4]
   .long  0xee924bb0                          // vmov.u16      r4, d18[0]
@@ -8108,7 +8270,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a000012                          // beq           2934 <sk_load_a8_vfp4+0x6c>
+  .long  0x0a000012                          // beq           291c <sk_load_a8_vfp4+0x6c>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b0                          // strh          ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8131,7 +8293,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf0a04                          // vldr          s1, [pc, #16]
   .long  0xee00ca10                          // vmov          s0, ip
-  .long  0xeaffffee                          // b             2900 <sk_load_a8_vfp4+0x38>
+  .long  0xeaffffee                          // b             28e8 <sk_load_a8_vfp4+0x38>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -8149,7 +8311,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a000012                          // beq           29c4 <sk_load_a8_dst_vfp4+0x6c>
+  .long  0x0a000012                          // beq           29ac <sk_load_a8_dst_vfp4+0x6c>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b0                          // strh          ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8172,7 +8334,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf4a04                          // vldr          s9, [pc, #16]
   .long  0xee04ca10                          // vmov          s8, ip
-  .long  0xeaffffee                          // b             2990 <sk_load_a8_dst_vfp4+0x38>
+  .long  0xeaffffee                          // b             2978 <sk_load_a8_dst_vfp4+0x38>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -8226,7 +8388,7 @@
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
   .long  0xf3fb07a1                          // vcvt.u32.f32  d16, d17
-  .long  0x0a000007                          // beq           2aa4 <sk_store_a8_vfp4+0x4c>
+  .long  0x0a000007                          // beq           2a8c <sk_store_a8_vfp4+0x4c>
   .long  0xee30eb90                          // vmov.32       lr, d16[1]
   .long  0xee104b90                          // vmov.32       r4, d16[0]
   .long  0xe5cce001                          // strb          lr, [ip, #1]
@@ -8237,7 +8399,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xee10eb90                          // vmov.32       lr, d16[0]
   .long  0xe5cce000                          // strb          lr, [ip]
-  .long  0xeafffff8                          // b             2a94 <sk_store_a8_vfp4+0x3c>
+  .long  0xeafffff8                          // b             2a7c <sk_store_a8_vfp4+0x3c>
   .long  0x437f0000                          // .word         0x437f0000
   .long  0x437f0000                          // .word         0x437f0000
 
@@ -8252,7 +8414,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a000012                          // beq           2b24 <sk_load_g8_vfp4+0x6c>
+  .long  0x0a000012                          // beq           2b0c <sk_load_g8_vfp4+0x6c>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b0                          // strh          ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8275,7 +8437,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf0a04                          // vldr          s1, [pc, #16]
   .long  0xee00ca10                          // vmov          s0, ip
-  .long  0xeaffffee                          // b             2af0 <sk_load_g8_vfp4+0x38>
+  .long  0xeaffffee                          // b             2ad8 <sk_load_g8_vfp4+0x38>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -8293,7 +8455,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a000012                          // beq           2bb4 <sk_load_g8_dst_vfp4+0x6c>
+  .long  0x0a000012                          // beq           2b9c <sk_load_g8_dst_vfp4+0x6c>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b0                          // strh          ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8316,7 +8478,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf4a04                          // vldr          s9, [pc, #16]
   .long  0xee04ca10                          // vmov          s8, ip
-  .long  0xeaffffee                          // b             2b80 <sk_load_g8_dst_vfp4+0x38>
+  .long  0xeaffffee                          // b             2b68 <sk_load_g8_dst_vfp4+0x38>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -8420,7 +8582,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc082                          // add           ip, ip, r2, lsl #1
-  .long  0x0a00001a                          // beq           2d94 <sk_load_565_vfp4+0x8c>
+  .long  0x0a00001a                          // beq           2d7c <sk_load_565_vfp4+0x8c>
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe58dc000                          // str           ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8451,7 +8613,7 @@
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xeddf0a08                          // vldr          s1, [pc, #32]
   .long  0xee00ca10                          // vmov          s0, ip
-  .long  0xeaffffe5                          // b             2d3c <sk_load_565_vfp4+0x34>
+  .long  0xeaffffe5                          // b             2d24 <sk_load_565_vfp4+0x34>
   .long  0xe320f000                          // nop           {0}
   .long  0x37842108                          // .word         0x37842108
   .long  0x37842108                          // .word         0x37842108
@@ -8473,7 +8635,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc082                          // add           ip, ip, r2, lsl #1
-  .long  0x0a00001a                          // beq           2e54 <sk_load_565_dst_vfp4+0x8c>
+  .long  0x0a00001a                          // beq           2e3c <sk_load_565_dst_vfp4+0x8c>
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe58dc000                          // str           ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8504,7 +8666,7 @@
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xeddf4a08                          // vldr          s9, [pc, #32]
   .long  0xee04ca10                          // vmov          s8, ip
-  .long  0xeaffffe5                          // b             2dfc <sk_load_565_dst_vfp4+0x34>
+  .long  0xeaffffe5                          // b             2de4 <sk_load_565_dst_vfp4+0x34>
   .long  0xe320f000                          // nop           {0}
   .long  0x37842108                          // .word         0x37842108
   .long  0x37842108                          // .word         0x37842108
@@ -8587,7 +8749,7 @@
   .long  0xf2eb1531                          // vshl.s32      d17, d17, #11
   .long  0xf26001b1                          // vorr          d16, d16, d17
   .long  0xf26001b2                          // vorr          d16, d16, d18
-  .long  0x0a000005                          // beq           2fa0 <sk_store_565_vfp4+0x70>
+  .long  0x0a000005                          // beq           2f88 <sk_store_565_vfp4+0x70>
   .long  0xf3f60121                          // vuzp.16       d16, d17
   .long  0xf4cc080f                          // vst1.32       {d16[0]}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -8596,7 +8758,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xee10eb90                          // vmov.32       lr, d16[0]
   .long  0xe1cce0b0                          // strh          lr, [ip]
-  .long  0xeafffff8                          // b             2f90 <sk_store_565_vfp4+0x60>
+  .long  0xeafffff8                          // b             2f78 <sk_store_565_vfp4+0x60>
   .long  0xe320f000                          // nop           {0}
   .long  0x427c0000                          // .word         0x427c0000
   .long  0x427c0000                          // .word         0x427c0000
@@ -8612,7 +8774,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc082                          // add           ip, ip, r2, lsl #1
-  .long  0x0a00001d                          // beq           3050 <sk_load_4444_vfp4+0x98>
+  .long  0x0a00001d                          // beq           3038 <sk_load_4444_vfp4+0x98>
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe58dc000                          // str           ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8646,7 +8808,7 @@
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xeddf0a09                          // vldr          s1, [pc, #36]
   .long  0xee00ca10                          // vmov          s0, ip
-  .long  0xeaffffe2                          // b             2fec <sk_load_4444_vfp4+0x34>
+  .long  0xeaffffe2                          // b             2fd4 <sk_load_4444_vfp4+0x34>
   .long  0x37888889                          // .word         0x37888889
   .long  0x37888889                          // .word         0x37888889
   .long  0x39888889                          // .word         0x39888889
@@ -8669,7 +8831,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc082                          // add           ip, ip, r2, lsl #1
-  .long  0x0a00001d                          // beq           3120 <sk_load_4444_dst_vfp4+0x98>
+  .long  0x0a00001d                          // beq           3108 <sk_load_4444_dst_vfp4+0x98>
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe58dc000                          // str           ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8703,7 +8865,7 @@
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xeddf4a09                          // vldr          s9, [pc, #36]
   .long  0xee04ca10                          // vmov          s8, ip
-  .long  0xeaffffe2                          // b             30bc <sk_load_4444_dst_vfp4+0x34>
+  .long  0xeaffffe2                          // b             30a4 <sk_load_4444_dst_vfp4+0x34>
   .long  0x37888889                          // .word         0x37888889
   .long  0x37888889                          // .word         0x37888889
   .long  0x39888889                          // .word         0x39888889
@@ -8797,7 +8959,7 @@
   .long  0xf26201b0                          // vorr          d16, d18, d16
   .long  0xf26001b3                          // vorr          d16, d16, d19
   .long  0xf26001b1                          // vorr          d16, d16, d17
-  .long  0x0a000005                          // beq           3298 <sk_store_4444_vfp4+0x80>
+  .long  0x0a000005                          // beq           3280 <sk_store_4444_vfp4+0x80>
   .long  0xf3f60121                          // vuzp.16       d16, d17
   .long  0xf4cc080f                          // vst1.32       {d16[0]}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -8806,7 +8968,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xee10eb90                          // vmov.32       lr, d16[0]
   .long  0xe1cce0b0                          // strh          lr, [ip]
-  .long  0xeafffff8                          // b             3288 <sk_store_4444_vfp4+0x70>
+  .long  0xeafffff8                          // b             3270 <sk_store_4444_vfp4+0x70>
   .long  0xe320f000                          // nop           {0}
 
 HIDDEN _sk_load_8888_vfp4
@@ -8819,7 +8981,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc102                          // add           ip, ip, r2, lsl #2
-  .long  0x0a000014                          // beq           3318 <sk_load_8888_vfp4+0x70>
+  .long  0x0a000014                          // beq           3300 <sk_load_8888_vfp4+0x70>
   .long  0xed9c0b00                          // vldr          d0, [ip]
   .long  0xf3c7001f                          // vmov.i32      d16, #255
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -8843,7 +9005,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xeddf0a04                          // vldr          s1, [pc, #16]
   .long  0xed9c0a00                          // vldr          s0, [ip]
-  .long  0xeaffffe8                          // b             32c8 <sk_load_8888_vfp4+0x20>
+  .long  0xeaffffe8                          // b             32b0 <sk_load_8888_vfp4+0x20>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -8860,7 +9022,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc102                          // add           ip, ip, r2, lsl #2
-  .long  0x0a000014                          // beq           33a8 <sk_load_8888_dst_vfp4+0x70>
+  .long  0x0a000014                          // beq           3390 <sk_load_8888_dst_vfp4+0x70>
   .long  0xed9c4b00                          // vldr          d4, [ip]
   .long  0xf3c7001f                          // vmov.i32      d16, #255
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -8884,7 +9046,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xeddf4a04                          // vldr          s9, [pc, #16]
   .long  0xed9c4a00                          // vldr          s8, [ip]
-  .long  0xeaffffe8                          // b             3358 <sk_load_8888_dst_vfp4+0x20>
+  .long  0xeaffffe8                          // b             3340 <sk_load_8888_dst_vfp4+0x20>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -8961,14 +9123,178 @@
   .long  0xf2f81533                          // vshl.s32      d17, d19, #24
   .long  0xf26001b2                          // vorr          d16, d16, d18
   .long  0xf26001b1                          // vorr          d16, d16, d17
-  .long  0x0a000004                          // beq           34d4 <sk_store_8888_vfp4+0x7c>
+  .long  0x0a000004                          // beq           34bc <sk_store_8888_vfp4+0x7c>
   .long  0xedcc0b00                          // vstr          d16, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
   .long  0xe2811008                          // add           r1, r1, #8
   .long  0xe8bd4800                          // pop           {fp, lr}
   .long  0xe12fff1c                          // bx            ip
   .long  0xf4cc083f                          // vst1.32       {d16[0]}, [ip :32]
-  .long  0xeafffff9                          // b             34c4 <sk_store_8888_vfp4+0x6c>
+  .long  0xeafffff9                          // b             34ac <sk_store_8888_vfp4+0x6c>
+  .long  0xe320f000                          // nop           {0}
+  .long  0x437f0000                          // .word         0x437f0000
+  .long  0x437f0000                          // .word         0x437f0000
+
+HIDDEN _sk_load_bgra_vfp4
+.globl _sk_load_bgra_vfp4
+FUNCTION(_sk_load_bgra_vfp4)
+_sk_load_bgra_vfp4:
+  .long  0xe92d4800                          // push          {fp, lr}
+  .long  0xe591c000                          // ldr           ip, [r1]
+  .long  0xe59de008                          // ldr           lr, [sp, #8]
+  .long  0xe59cc000                          // ldr           ip, [ip]
+  .long  0xe35e0001                          // cmp           lr, #1
+  .long  0xe08cc102                          // add           ip, ip, r2, lsl #2
+  .long  0x0a000014                          // beq           3540 <sk_load_bgra_vfp4+0x70>
+  .long  0xed9c0b00                          // vldr          d0, [ip]
+  .long  0xf3c7001f                          // vmov.i32      d16, #255
+  .long  0xe591c004                          // ldr           ip, [r1, #4]
+  .long  0xf3f01010                          // vshr.u32      d17, d0, #16
+  .long  0xe2811008                          // add           r1, r1, #8
+  .long  0xf3f83010                          // vshr.u32      d19, d0, #8
+  .long  0xf3e82010                          // vshr.u32      d18, d0, #24
+  .long  0xf24111b0                          // vand          d17, d17, d16
+  .long  0xf2404130                          // vand          d20, d0, d16
+  .long  0xf24301b0                          // vand          d16, d19, d16
+  .long  0xf3fb3624                          // vcvt.f32.s32  d19, d20
+  .long  0xeddf4b0c                          // vldr          d20, [pc, #48]
+  .long  0xf3fb2622                          // vcvt.f32.s32  d18, d18
+  .long  0xf3fb1621                          // vcvt.f32.s32  d17, d17
+  .long  0xf3fb0620                          // vcvt.f32.s32  d16, d16
+  .long  0xf3032db4                          // vmul.f32      d2, d19, d20
+  .long  0xf3023db4                          // vmul.f32      d3, d18, d20
+  .long  0xf3010db4                          // vmul.f32      d0, d17, d20
+  .long  0xf3001db4                          // vmul.f32      d1, d16, d20
+  .long  0xe8bd4800                          // pop           {fp, lr}
+  .long  0xe12fff1c                          // bx            ip
+  .long  0xeddf0a04                          // vldr          s1, [pc, #16]
+  .long  0xed9c0a00                          // vldr          s0, [ip]
+  .long  0xeaffffe8                          // b             34f0 <sk_load_bgra_vfp4+0x20>
+  .long  0xe320f000                          // nop           {0}
+  .long  0x3b808081                          // .word         0x3b808081
+  .long  0x3b808081                          // .word         0x3b808081
+  .long  0x00000000                          // .word         0x00000000
+  .long  0xe320f000                          // .word         0xe320f000
+
+HIDDEN _sk_load_bgra_dst_vfp4
+.globl _sk_load_bgra_dst_vfp4
+FUNCTION(_sk_load_bgra_dst_vfp4)
+_sk_load_bgra_dst_vfp4:
+  .long  0xe92d4800                          // push          {fp, lr}
+  .long  0xe591c000                          // ldr           ip, [r1]
+  .long  0xe59de008                          // ldr           lr, [sp, #8]
+  .long  0xe59cc000                          // ldr           ip, [ip]
+  .long  0xe35e0001                          // cmp           lr, #1
+  .long  0xe08cc102                          // add           ip, ip, r2, lsl #2
+  .long  0x0a000014                          // beq           35d0 <sk_load_bgra_dst_vfp4+0x70>
+  .long  0xed9c4b00                          // vldr          d4, [ip]
+  .long  0xf3c7001f                          // vmov.i32      d16, #255
+  .long  0xe591c004                          // ldr           ip, [r1, #4]
+  .long  0xf3f01014                          // vshr.u32      d17, d4, #16
+  .long  0xe2811008                          // add           r1, r1, #8
+  .long  0xf3f83014                          // vshr.u32      d19, d4, #8
+  .long  0xf3e82014                          // vshr.u32      d18, d4, #24
+  .long  0xf24111b0                          // vand          d17, d17, d16
+  .long  0xf2444130                          // vand          d20, d4, d16
+  .long  0xf24301b0                          // vand          d16, d19, d16
+  .long  0xf3fb3624                          // vcvt.f32.s32  d19, d20
+  .long  0xeddf4b0c                          // vldr          d20, [pc, #48]
+  .long  0xf3fb2622                          // vcvt.f32.s32  d18, d18
+  .long  0xf3fb1621                          // vcvt.f32.s32  d17, d17
+  .long  0xf3fb0620                          // vcvt.f32.s32  d16, d16
+  .long  0xf3036db4                          // vmul.f32      d6, d19, d20
+  .long  0xf3027db4                          // vmul.f32      d7, d18, d20
+  .long  0xf3014db4                          // vmul.f32      d4, d17, d20
+  .long  0xf3005db4                          // vmul.f32      d5, d16, d20
+  .long  0xe8bd4800                          // pop           {fp, lr}
+  .long  0xe12fff1c                          // bx            ip
+  .long  0xeddf4a04                          // vldr          s9, [pc, #16]
+  .long  0xed9c4a00                          // vldr          s8, [ip]
+  .long  0xeaffffe8                          // b             3580 <sk_load_bgra_dst_vfp4+0x20>
+  .long  0xe320f000                          // nop           {0}
+  .long  0x3b808081                          // .word         0x3b808081
+  .long  0x3b808081                          // .word         0x3b808081
+  .long  0x00000000                          // .word         0x00000000
+  .long  0xe320f000                          // .word         0xe320f000
+
+HIDDEN _sk_gather_bgra_vfp4
+.globl _sk_gather_bgra_vfp4
+FUNCTION(_sk_gather_bgra_vfp4)
+_sk_gather_bgra_vfp4:
+  .long  0xe92d4070                          // push          {r4, r5, r6, lr}
+  .long  0xe591e000                          // ldr           lr, [r1]
+  .long  0xf3fb0701                          // vcvt.s32.f32  d16, d1
+  .long  0xf3fb1700                          // vcvt.s32.f32  d17, d0
+  .long  0xe591c004                          // ldr           ip, [r1, #4]
+  .long  0xe2811008                          // add           r1, r1, #8
+  .long  0xe49e4008                          // ldr           r4, [lr], #8
+  .long  0xf4ee2c9f                          // vld1.32       {d18[]}, [lr :32]
+  .long  0xf26219a0                          // vmla.i32      d17, d18, d16
+  .long  0xee11eb90                          // vmov.32       lr, d17[0]
+  .long  0xee316b90                          // vmov.32       r6, d17[1]
+  .long  0xf3c7101f                          // vmov.i32      d17, #255
+  .long  0xe084510e                          // add           r5, r4, lr, lsl #2
+  .long  0xe0846106                          // add           r6, r4, r6, lsl #2
+  .long  0xf4e5083f                          // vld1.32       {d16[0]}, [r5 :32]
+  .long  0xf4e608bf                          // vld1.32       {d16[1]}, [r6 :32]
+  .long  0xf24021b1                          // vand          d18, d16, d17
+  .long  0xf3f03030                          // vshr.u32      d19, d16, #16
+  .long  0xf3e84030                          // vshr.u32      d20, d16, #24
+  .long  0xf3f80030                          // vshr.u32      d16, d16, #8
+  .long  0xf24331b1                          // vand          d19, d19, d17
+  .long  0xf24001b1                          // vand          d16, d16, d17
+  .long  0xeddf1b0a                          // vldr          d17, [pc, #40]
+  .long  0xf3fb2622                          // vcvt.f32.s32  d18, d18
+  .long  0xf3fb4624                          // vcvt.f32.s32  d20, d20
+  .long  0xf3fb3623                          // vcvt.f32.s32  d19, d19
+  .long  0xf3fb0620                          // vcvt.f32.s32  d16, d16
+  .long  0xf3022db1                          // vmul.f32      d2, d18, d17
+  .long  0xf3043db1                          // vmul.f32      d3, d20, d17
+  .long  0xf3030db1                          // vmul.f32      d0, d19, d17
+  .long  0xf3001db1                          // vmul.f32      d1, d16, d17
+  .long  0xe8bd4070                          // pop           {r4, r5, r6, lr}
+  .long  0xe12fff1c                          // bx            ip
+  .long  0xe320f000                          // nop           {0}
+  .long  0x3b808081                          // .word         0x3b808081
+  .long  0x3b808081                          // .word         0x3b808081
+
+HIDDEN _sk_store_bgra_vfp4
+.globl _sk_store_bgra_vfp4
+FUNCTION(_sk_store_bgra_vfp4)
+_sk_store_bgra_vfp4:
+  .long  0xe92d4800                          // push          {fp, lr}
+  .long  0xeddf0b1f                          // vldr          d16, [pc, #124]
+  .long  0xf2c3261f                          // vmov.i32      d18, #1056964608
+  .long  0xf2402c30                          // vfma.f32      d18, d0, d16
+  .long  0xe591c000                          // ldr           ip, [r1]
+  .long  0xf2c3361f                          // vmov.i32      d19, #1056964608
+  .long  0xe59de008                          // ldr           lr, [sp, #8]
+  .long  0xf2c3161f                          // vmov.i32      d17, #1056964608
+  .long  0xf2413c30                          // vfma.f32      d19, d1, d16
+  .long  0xe59cc000                          // ldr           ip, [ip]
+  .long  0xf2c3461f                          // vmov.i32      d20, #1056964608
+  .long  0xe35e0001                          // cmp           lr, #1
+  .long  0xf2421c30                          // vfma.f32      d17, d2, d16
+  .long  0xe08cc102                          // add           ip, ip, r2, lsl #2
+  .long  0xf2434c30                          // vfma.f32      d20, d3, d16
+  .long  0xf3fb07a2                          // vcvt.u32.f32  d16, d18
+  .long  0xf3fb27a3                          // vcvt.u32.f32  d18, d19
+  .long  0xf3fb17a1                          // vcvt.u32.f32  d17, d17
+  .long  0xf3fb37a4                          // vcvt.u32.f32  d19, d20
+  .long  0xf2f00530                          // vshl.s32      d16, d16, #16
+  .long  0xf2e82532                          // vshl.s32      d18, d18, #8
+  .long  0xf26101b0                          // vorr          d16, d17, d16
+  .long  0xf2f81533                          // vshl.s32      d17, d19, #24
+  .long  0xf26001b2                          // vorr          d16, d16, d18
+  .long  0xf26001b1                          // vorr          d16, d16, d17
+  .long  0x0a000004                          // beq           36fc <sk_store_bgra_vfp4+0x7c>
+  .long  0xedcc0b00                          // vstr          d16, [ip]
+  .long  0xe591c004                          // ldr           ip, [r1, #4]
+  .long  0xe2811008                          // add           r1, r1, #8
+  .long  0xe8bd4800                          // pop           {fp, lr}
+  .long  0xe12fff1c                          // bx            ip
+  .long  0xf4cc083f                          // vst1.32       {d16[0]}, [ip :32]
+  .long  0xeafffff9                          // b             36ec <sk_store_bgra_vfp4+0x6c>
   .long  0xe320f000                          // nop           {0}
   .long  0x437f0000                          // .word         0x437f0000
   .long  0x437f0000                          // .word         0x437f0000
@@ -8984,7 +9310,7 @@
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc182                          // add           ip, ip, r2, lsl #3
   .long  0xf4ec070f                          // vld4.16       {d16[0],d17[0],d18[0],d19[0]}, [ip]
-  .long  0x1a000001                          // bne           3510 <sk_load_f16_vfp4+0x28>
+  .long  0x1a000001                          // bne           3738 <sk_load_f16_vfp4+0x28>
   .long  0xe28cc008                          // add           ip, ip, #8
   .long  0xf4ec074f                          // vld4.16       {d16[1],d17[1],d18[1],d19[1]}, [ip]
   .long  0xf3b60720                          // vcvt.f32.f16  q0, d16
@@ -9009,7 +9335,7 @@
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc182                          // add           ip, ip, r2, lsl #3
   .long  0xf4ec070f                          // vld4.16       {d16[0],d17[0],d18[0],d19[0]}, [ip]
-  .long  0x1a000001                          // bne           3560 <sk_load_f16_dst_vfp4+0x28>
+  .long  0x1a000001                          // bne           3788 <sk_load_f16_dst_vfp4+0x28>
   .long  0xe28cc008                          // add           ip, ip, #8
   .long  0xf4ec074f                          // vld4.16       {d16[1],d17[1],d18[1],d19[1]}, [ip]
   .long  0xf3b64720                          // vcvt.f32.f16  q2, d16
@@ -9079,7 +9405,7 @@
   .long  0xf3f65622                          // vcvt.f16.f32  d21, q9
   .long  0xf3f64600                          // vcvt.f16.f32  d20, q0
   .long  0xf4cc470f                          // vst4.16       {d20[0],d21[0],d22[0],d23[0]}, [ip]
-  .long  0x1a000001                          // bne           3650 <sk_store_f16_vfp4+0x40>
+  .long  0x1a000001                          // bne           3878 <sk_store_f16_vfp4+0x40>
   .long  0xe28cc008                          // add           ip, ip, #8
   .long  0xf4cc474f                          // vst4.16       {d20[1],d21[1],d22[1],d23[1]}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -9100,7 +9426,7 @@
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc182                          // add           ip, ip, r2, lsl #3
   .long  0xf4ec070f                          // vld4.16       {d16[0],d17[0],d18[0],d19[0]}, [ip]
-  .long  0x1a000001                          // bne           3690 <sk_load_u16_be_vfp4+0x28>
+  .long  0x1a000001                          // bne           38b8 <sk_load_u16_be_vfp4+0x28>
   .long  0xe28cc008                          // add           ip, ip, #8
   .long  0xf4ec074f                          // vld4.16       {d16[1],d17[1],d18[1],d19[1]}, [ip]
   .long  0xee90cbb0                          // vmov.u16      ip, d16[0]
@@ -9168,7 +9494,7 @@
   .long  0xe59de018                          // ldr           lr, [sp, #24]
   .long  0xf4ec060f                          // vld3.16       {d16[0],d17[0],d18[0]}, [ip]
   .long  0xe35e0000                          // cmp           lr, #0
-  .long  0x1a000001                          // bne           378c <sk_load_rgb_u16_be_vfp4+0x2c>
+  .long  0x1a000001                          // bne           39b4 <sk_load_rgb_u16_be_vfp4+0x2c>
   .long  0xe28cc006                          // add           ip, ip, #6
   .long  0xf4ec064f                          // vld3.16       {d16[1],d17[1],d18[1]}, [ip]
   .long  0xee90cbb0                          // vmov.u16      ip, d16[0]
@@ -9260,7 +9586,7 @@
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xf3f60124                          // vuzp.16       d16, d20
   .long  0xf4cc070f                          // vst4.16       {d16[0],d17[0],d18[0],d19[0]}, [ip]
-  .long  0x1a000001                          // bne           38e8 <sk_store_u16_be_vfp4+0xb0>
+  .long  0x1a000001                          // bne           3b10 <sk_store_u16_be_vfp4+0xb0>
   .long  0xe28cc008                          // add           ip, ip, #8
   .long  0xf4cc074f                          // vst4.16       {d16[1],d17[1],d18[1],d19[1]}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -9280,14 +9606,14 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc202                          // add           ip, ip, r2, lsl #4
-  .long  0x1a000004                          // bne           3930 <sk_load_f32_vfp4+0x30>
+  .long  0x1a000004                          // bne           3b58 <sk_load_f32_vfp4+0x30>
   .long  0xf42c008f                          // vld4.32       {d0-d3}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
   .long  0xe2811008                          // add           r1, r1, #8
   .long  0xe8bd4800                          // pop           {fp, lr}
   .long  0xe12fff1c                          // bx            ip
   .long  0xf4ac0f8f                          // vld4.32       {d0[]-d3[]}, [ip]
-  .long  0xeafffff9                          // b             3920 <sk_load_f32_vfp4+0x20>
+  .long  0xeafffff9                          // b             3b48 <sk_load_f32_vfp4+0x20>
 
 HIDDEN _sk_load_f32_dst_vfp4
 .globl _sk_load_f32_dst_vfp4
@@ -9299,14 +9625,14 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc202                          // add           ip, ip, r2, lsl #4
-  .long  0x1a000004                          // bne           3968 <sk_load_f32_dst_vfp4+0x30>
+  .long  0x1a000004                          // bne           3b90 <sk_load_f32_dst_vfp4+0x30>
   .long  0xf42c408f                          // vld4.32       {d4-d7}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
   .long  0xe2811008                          // add           r1, r1, #8
   .long  0xe8bd4800                          // pop           {fp, lr}
   .long  0xe12fff1c                          // bx            ip
   .long  0xf4ac4f8f                          // vld4.32       {d4[]-d7[]}, [ip]
-  .long  0xeafffff9                          // b             3958 <sk_load_f32_dst_vfp4+0x20>
+  .long  0xeafffff9                          // b             3b80 <sk_load_f32_dst_vfp4+0x20>
 
 HIDDEN _sk_store_f32_vfp4
 .globl _sk_store_f32_vfp4
@@ -9318,14 +9644,14 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc202                          // add           ip, ip, r2, lsl #4
-  .long  0x1a000004                          // bne           39a0 <sk_store_f32_vfp4+0x30>
+  .long  0x1a000004                          // bne           3bc8 <sk_store_f32_vfp4+0x30>
   .long  0xf40c008f                          // vst4.32       {d0-d3}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
   .long  0xe2811008                          // add           r1, r1, #8
   .long  0xe8bd4800                          // pop           {fp, lr}
   .long  0xe12fff1c                          // bx            ip
   .long  0xf48c0b0f                          // vst4.32       {d0[0],d1[0],d2[0],d3[0]}, [ip]
-  .long  0xeafffff9                          // b             3990 <sk_store_f32_vfp4+0x20>
+  .long  0xeafffff9                          // b             3bb8 <sk_store_f32_vfp4+0x20>
 
 HIDDEN _sk_clamp_x_vfp4
 .globl _sk_clamp_x_vfp4
@@ -9901,7 +10227,7 @@
   .long  0xe591c000                          // ldr           ip, [r1]
   .long  0xe59c4000                          // ldr           r4, [ip]
   .long  0xe3540002                          // cmp           r4, #2
-  .long  0x3a00000b                          // bcc           4170 <sk_gradient_vfp4+0x58>
+  .long  0x3a00000b                          // bcc           4398 <sk_gradient_vfp4+0x58>
   .long  0xe59c5024                          // ldr           r5, [ip, #36]
   .long  0xf2c01010                          // vmov.i32      d17, #0
   .long  0xf2c02011                          // vmov.i32      d18, #1
@@ -9913,7 +10239,7 @@
   .long  0xf3403e23                          // vcge.f32      d19, d0, d19
   .long  0xf35231b1                          // vbsl          d19, d18, d17
   .long  0xf26308a0                          // vadd.i32      d16, d19, d16
-  .long  0x1afffff9                          // bne           4158 <sk_gradient_vfp4+0x40>
+  .long  0x1afffff9                          // bne           4380 <sk_gradient_vfp4+0x40>
   .long  0xee304b90                          // vmov.32       r4, d16[1]
   .long  0xe59c6010                          // ldr           r6, [ip, #16]
   .long  0xee10eb90                          // vmov.32       lr, d16[0]
@@ -10546,7 +10872,7 @@
   .byte  197,249,110,194                     // vmovd         %edx,%xmm0
   .byte  196,226,125,88,192                  // vpbroadcastd  %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,201,82,0,0        // vbroadcastss  0x52c9(%rip),%ymm1        # 5360 <_sk_callback_hsw+0x144>
+  .byte  196,226,125,24,13,241,84,0,0        // vbroadcastss  0x54f1(%rip),%ymm1        # 5588 <_sk_callback_hsw+0x144>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,88,7                        // vaddps        (%rdi),%ymm0,%ymm0
   .byte  197,249,110,209                     // vmovd         %ecx,%xmm2
@@ -10554,7 +10880,7 @@
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  197,236,88,201                      // vaddps        %ymm1,%ymm2,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,21,169,82,0,0        // vbroadcastss  0x52a9(%rip),%ymm2        # 5364 <_sk_callback_hsw+0x148>
+  .byte  196,226,125,24,21,209,84,0,0        // vbroadcastss  0x54d1(%rip),%ymm2        # 558c <_sk_callback_hsw+0x148>
   .byte  197,228,87,219                      // vxorps        %ymm3,%ymm3,%ymm3
   .byte  197,220,87,228                      // vxorps        %ymm4,%ymm4,%ymm4
   .byte  197,212,87,237                      // vxorps        %ymm5,%ymm5,%ymm5
@@ -10573,13 +10899,13 @@
   .byte  197,121,110,201                     // vmovd         %ecx,%xmm9
   .byte  196,66,125,88,201                   // vpbroadcastd  %xmm9,%ymm9
   .byte  196,65,53,239,200                   // vpxor         %ymm8,%ymm9,%ymm9
-  .byte  196,98,125,88,21,112,82,0,0         // vpbroadcastd  0x5270(%rip),%ymm10        # 5368 <_sk_callback_hsw+0x14c>
+  .byte  196,98,125,88,21,152,84,0,0         // vpbroadcastd  0x5498(%rip),%ymm10        # 5590 <_sk_callback_hsw+0x14c>
   .byte  196,65,53,219,218                   // vpand         %ymm10,%ymm9,%ymm11
   .byte  196,193,37,114,243,5                // vpslld        $0x5,%ymm11,%ymm11
   .byte  196,65,61,219,210                   // vpand         %ymm10,%ymm8,%ymm10
   .byte  196,193,45,114,242,4                // vpslld        $0x4,%ymm10,%ymm10
-  .byte  196,98,125,88,37,85,82,0,0          // vpbroadcastd  0x5255(%rip),%ymm12        # 536c <_sk_callback_hsw+0x150>
-  .byte  196,98,125,88,45,80,82,0,0          // vpbroadcastd  0x5250(%rip),%ymm13        # 5370 <_sk_callback_hsw+0x154>
+  .byte  196,98,125,88,37,125,84,0,0         // vpbroadcastd  0x547d(%rip),%ymm12        # 5594 <_sk_callback_hsw+0x150>
+  .byte  196,98,125,88,45,120,84,0,0         // vpbroadcastd  0x5478(%rip),%ymm13        # 5598 <_sk_callback_hsw+0x154>
   .byte  196,65,53,219,245                   // vpand         %ymm13,%ymm9,%ymm14
   .byte  196,193,13,114,246,2                // vpslld        $0x2,%ymm14,%ymm14
   .byte  196,65,61,219,237                   // vpand         %ymm13,%ymm8,%ymm13
@@ -10594,8 +10920,8 @@
   .byte  196,65,61,235,194                   // vpor          %ymm10,%ymm8,%ymm8
   .byte  196,65,61,235,193                   // vpor          %ymm9,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,2,82,0,0           // vbroadcastss  0x5202(%rip),%ymm9        # 5374 <_sk_callback_hsw+0x158>
-  .byte  196,98,125,24,21,253,81,0,0         // vbroadcastss  0x51fd(%rip),%ymm10        # 5378 <_sk_callback_hsw+0x15c>
+  .byte  196,98,125,24,13,42,84,0,0          // vbroadcastss  0x542a(%rip),%ymm9        # 559c <_sk_callback_hsw+0x158>
+  .byte  196,98,125,24,21,37,84,0,0          // vbroadcastss  0x5425(%rip),%ymm10        # 55a0 <_sk_callback_hsw+0x15c>
   .byte  196,66,61,184,209                   // vfmadd231ps   %ymm9,%ymm8,%ymm10
   .byte  196,98,125,24,0                     // vbroadcastss  (%rax),%ymm8
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
@@ -10664,7 +10990,7 @@
 FUNCTION(_sk_srcatop_hsw)
 _sk_srcatop_hsw:
   .byte  197,252,89,199                      // vmulps        %ymm7,%ymm0,%ymm0
-  .byte  196,98,125,24,5,85,81,0,0           // vbroadcastss  0x5155(%rip),%ymm8        # 537c <_sk_callback_hsw+0x160>
+  .byte  196,98,125,24,5,125,83,0,0          // vbroadcastss  0x537d(%rip),%ymm8        # 55a4 <_sk_callback_hsw+0x160>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,226,61,184,196                  // vfmadd231ps   %ymm4,%ymm8,%ymm0
   .byte  197,244,89,207                      // vmulps        %ymm7,%ymm1,%ymm1
@@ -10680,7 +11006,7 @@
 .globl _sk_dstatop_hsw
 FUNCTION(_sk_dstatop_hsw)
 _sk_dstatop_hsw:
-  .byte  196,98,125,24,5,40,81,0,0           // vbroadcastss  0x5128(%rip),%ymm8        # 5380 <_sk_callback_hsw+0x164>
+  .byte  196,98,125,24,5,80,83,0,0           // vbroadcastss  0x5350(%rip),%ymm8        # 55a8 <_sk_callback_hsw+0x164>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  196,226,101,184,196                 // vfmadd231ps   %ymm4,%ymm3,%ymm0
@@ -10719,7 +11045,7 @@
 .globl _sk_srcout_hsw
 FUNCTION(_sk_srcout_hsw)
 _sk_srcout_hsw:
-  .byte  196,98,125,24,5,207,80,0,0          // vbroadcastss  0x50cf(%rip),%ymm8        # 5384 <_sk_callback_hsw+0x168>
+  .byte  196,98,125,24,5,247,82,0,0          // vbroadcastss  0x52f7(%rip),%ymm8        # 55ac <_sk_callback_hsw+0x168>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -10732,7 +11058,7 @@
 .globl _sk_dstout_hsw
 FUNCTION(_sk_dstout_hsw)
 _sk_dstout_hsw:
-  .byte  196,226,125,24,5,178,80,0,0         // vbroadcastss  0x50b2(%rip),%ymm0        # 5388 <_sk_callback_hsw+0x16c>
+  .byte  196,226,125,24,5,218,82,0,0         // vbroadcastss  0x52da(%rip),%ymm0        # 55b0 <_sk_callback_hsw+0x16c>
   .byte  197,252,92,219                      // vsubps        %ymm3,%ymm0,%ymm3
   .byte  197,228,89,196                      // vmulps        %ymm4,%ymm3,%ymm0
   .byte  197,228,89,205                      // vmulps        %ymm5,%ymm3,%ymm1
@@ -10745,7 +11071,7 @@
 .globl _sk_srcover_hsw
 FUNCTION(_sk_srcover_hsw)
 _sk_srcover_hsw:
-  .byte  196,98,125,24,5,149,80,0,0          // vbroadcastss  0x5095(%rip),%ymm8        # 538c <_sk_callback_hsw+0x170>
+  .byte  196,98,125,24,5,189,82,0,0          // vbroadcastss  0x52bd(%rip),%ymm8        # 55b4 <_sk_callback_hsw+0x170>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,93,184,192                  // vfmadd231ps   %ymm8,%ymm4,%ymm0
   .byte  196,194,85,184,200                  // vfmadd231ps   %ymm8,%ymm5,%ymm1
@@ -10758,7 +11084,7 @@
 .globl _sk_dstover_hsw
 FUNCTION(_sk_dstover_hsw)
 _sk_dstover_hsw:
-  .byte  196,98,125,24,5,116,80,0,0          // vbroadcastss  0x5074(%rip),%ymm8        # 5390 <_sk_callback_hsw+0x174>
+  .byte  196,98,125,24,5,156,82,0,0          // vbroadcastss  0x529c(%rip),%ymm8        # 55b8 <_sk_callback_hsw+0x174>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  196,226,61,168,196                  // vfmadd213ps   %ymm4,%ymm8,%ymm0
   .byte  196,226,61,168,205                  // vfmadd213ps   %ymm5,%ymm8,%ymm1
@@ -10782,7 +11108,7 @@
 .globl _sk_multiply_hsw
 FUNCTION(_sk_multiply_hsw)
 _sk_multiply_hsw:
-  .byte  196,98,125,24,5,63,80,0,0           // vbroadcastss  0x503f(%rip),%ymm8        # 5394 <_sk_callback_hsw+0x178>
+  .byte  196,98,125,24,5,103,82,0,0          // vbroadcastss  0x5267(%rip),%ymm8        # 55bc <_sk_callback_hsw+0x178>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,208                       // vmulps        %ymm0,%ymm9,%ymm10
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -10830,7 +11156,7 @@
 .globl _sk_xor__hsw
 FUNCTION(_sk_xor__hsw)
 _sk_xor__hsw:
-  .byte  196,98,125,24,5,186,79,0,0          // vbroadcastss  0x4fba(%rip),%ymm8        # 5398 <_sk_callback_hsw+0x17c>
+  .byte  196,98,125,24,5,226,81,0,0          // vbroadcastss  0x51e2(%rip),%ymm8        # 55c0 <_sk_callback_hsw+0x17c>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -10864,7 +11190,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,95,209                  // vmaxps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,66,79,0,0           // vbroadcastss  0x4f42(%rip),%ymm8        # 539c <_sk_callback_hsw+0x180>
+  .byte  196,98,125,24,5,106,81,0,0          // vbroadcastss  0x516a(%rip),%ymm8        # 55c4 <_sk_callback_hsw+0x180>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -10889,7 +11215,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,241,78,0,0          // vbroadcastss  0x4ef1(%rip),%ymm8        # 53a0 <_sk_callback_hsw+0x184>
+  .byte  196,98,125,24,5,25,81,0,0           // vbroadcastss  0x5119(%rip),%ymm8        # 55c8 <_sk_callback_hsw+0x184>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -10917,7 +11243,7 @@
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,148,78,0,0          // vbroadcastss  0x4e94(%rip),%ymm8        # 53a4 <_sk_callback_hsw+0x188>
+  .byte  196,98,125,24,5,188,80,0,0          // vbroadcastss  0x50bc(%rip),%ymm8        # 55cc <_sk_callback_hsw+0x188>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -10939,7 +11265,7 @@
   .byte  197,236,89,214                      // vmulps        %ymm6,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,82,78,0,0           // vbroadcastss  0x4e52(%rip),%ymm8        # 53a8 <_sk_callback_hsw+0x18c>
+  .byte  196,98,125,24,5,122,80,0,0          // vbroadcastss  0x507a(%rip),%ymm8        # 55d0 <_sk_callback_hsw+0x18c>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -10949,7 +11275,7 @@
 .globl _sk_colorburn_hsw
 FUNCTION(_sk_colorburn_hsw)
 _sk_colorburn_hsw:
-  .byte  196,98,125,24,5,64,78,0,0           // vbroadcastss  0x4e40(%rip),%ymm8        # 53ac <_sk_callback_hsw+0x190>
+  .byte  196,98,125,24,5,104,80,0,0          // vbroadcastss  0x5068(%rip),%ymm8        # 55d4 <_sk_callback_hsw+0x190>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,216                       // vmulps        %ymm0,%ymm9,%ymm11
   .byte  196,65,44,87,210                    // vxorps        %ymm10,%ymm10,%ymm10
@@ -11007,7 +11333,7 @@
 FUNCTION(_sk_colordodge_hsw)
 _sk_colordodge_hsw:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
-  .byte  196,98,125,24,13,75,77,0,0          // vbroadcastss  0x4d4b(%rip),%ymm9        # 53b0 <_sk_callback_hsw+0x194>
+  .byte  196,98,125,24,13,115,79,0,0         // vbroadcastss  0x4f73(%rip),%ymm9        # 55d8 <_sk_callback_hsw+0x194>
   .byte  197,52,92,215                       // vsubps        %ymm7,%ymm9,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,52,92,203                       // vsubps        %ymm3,%ymm9,%ymm9
@@ -11060,7 +11386,7 @@
 .globl _sk_hardlight_hsw
 FUNCTION(_sk_hardlight_hsw)
 _sk_hardlight_hsw:
-  .byte  196,98,125,24,5,108,76,0,0          // vbroadcastss  0x4c6c(%rip),%ymm8        # 53b4 <_sk_callback_hsw+0x198>
+  .byte  196,98,125,24,5,148,78,0,0          // vbroadcastss  0x4e94(%rip),%ymm8        # 55dc <_sk_callback_hsw+0x198>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -11111,7 +11437,7 @@
 .globl _sk_overlay_hsw
 FUNCTION(_sk_overlay_hsw)
 _sk_overlay_hsw:
-  .byte  196,98,125,24,5,164,75,0,0          // vbroadcastss  0x4ba4(%rip),%ymm8        # 53b8 <_sk_callback_hsw+0x19c>
+  .byte  196,98,125,24,5,204,77,0,0          // vbroadcastss  0x4dcc(%rip),%ymm8        # 55e0 <_sk_callback_hsw+0x19c>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -11172,10 +11498,10 @@
   .byte  196,65,20,88,197                    // vaddps        %ymm13,%ymm13,%ymm8
   .byte  196,65,60,88,192                    // vaddps        %ymm8,%ymm8,%ymm8
   .byte  196,66,61,168,192                   // vfmadd213ps   %ymm8,%ymm8,%ymm8
-  .byte  196,98,125,24,29,175,74,0,0         // vbroadcastss  0x4aaf(%rip),%ymm11        # 53c0 <_sk_callback_hsw+0x1a4>
+  .byte  196,98,125,24,29,215,76,0,0         // vbroadcastss  0x4cd7(%rip),%ymm11        # 55e8 <_sk_callback_hsw+0x1a4>
   .byte  196,65,20,88,227                    // vaddps        %ymm11,%ymm13,%ymm12
   .byte  196,65,28,89,192                    // vmulps        %ymm8,%ymm12,%ymm8
-  .byte  196,98,125,24,37,160,74,0,0         // vbroadcastss  0x4aa0(%rip),%ymm12        # 53c4 <_sk_callback_hsw+0x1a8>
+  .byte  196,98,125,24,37,200,76,0,0         // vbroadcastss  0x4cc8(%rip),%ymm12        # 55ec <_sk_callback_hsw+0x1a8>
   .byte  196,66,21,184,196                   // vfmadd231ps   %ymm12,%ymm13,%ymm8
   .byte  196,65,124,82,245                   // vrsqrtps      %ymm13,%ymm14
   .byte  196,65,124,83,246                   // vrcpps        %ymm14,%ymm14
@@ -11185,7 +11511,7 @@
   .byte  197,4,194,255,2                     // vcmpleps      %ymm7,%ymm15,%ymm15
   .byte  196,67,13,74,240,240                // vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   .byte  197,116,88,249                      // vaddps        %ymm1,%ymm1,%ymm15
-  .byte  196,98,125,24,5,99,74,0,0           // vbroadcastss  0x4a63(%rip),%ymm8        # 53bc <_sk_callback_hsw+0x1a0>
+  .byte  196,98,125,24,5,139,76,0,0          // vbroadcastss  0x4c8b(%rip),%ymm8        # 55e4 <_sk_callback_hsw+0x1a0>
   .byte  196,65,60,92,237                    // vsubps        %ymm13,%ymm8,%ymm13
   .byte  197,132,92,195                      // vsubps        %ymm3,%ymm15,%ymm0
   .byte  196,98,125,168,235                  // vfmadd213ps   %ymm3,%ymm0,%ymm13
@@ -11298,11 +11624,11 @@
   .byte  196,65,28,89,210                    // vmulps        %ymm10,%ymm12,%ymm10
   .byte  196,65,44,94,214                    // vdivps        %ymm14,%ymm10,%ymm10
   .byte  196,67,45,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  .byte  196,98,125,24,53,103,72,0,0         // vbroadcastss  0x4867(%rip),%ymm14        # 53c8 <_sk_callback_hsw+0x1ac>
-  .byte  196,98,125,24,61,98,72,0,0          // vbroadcastss  0x4862(%rip),%ymm15        # 53cc <_sk_callback_hsw+0x1b0>
+  .byte  196,98,125,24,53,143,74,0,0         // vbroadcastss  0x4a8f(%rip),%ymm14        # 55f0 <_sk_callback_hsw+0x1ac>
+  .byte  196,98,125,24,61,138,74,0,0         // vbroadcastss  0x4a8a(%rip),%ymm15        # 55f4 <_sk_callback_hsw+0x1b0>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,66,93,184,238                   // vfmadd231ps   %ymm14,%ymm4,%ymm13
-  .byte  196,226,125,24,5,83,72,0,0          // vbroadcastss  0x4853(%rip),%ymm0        # 53d0 <_sk_callback_hsw+0x1b4>
+  .byte  196,226,125,24,5,123,74,0,0         // vbroadcastss  0x4a7b(%rip),%ymm0        # 55f8 <_sk_callback_hsw+0x1b4>
   .byte  196,98,77,184,232                   // vfmadd231ps   %ymm0,%ymm6,%ymm13
   .byte  196,65,116,89,215                   // vmulps        %ymm15,%ymm1,%ymm10
   .byte  196,66,53,184,214                   // vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -11357,7 +11683,7 @@
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
   .byte  196,65,36,95,200                    // vmaxps        %ymm8,%ymm11,%ymm9
   .byte  196,65,116,95,192                   // vmaxps        %ymm8,%ymm1,%ymm8
-  .byte  196,226,125,24,13,64,71,0,0         // vbroadcastss  0x4740(%rip),%ymm1        # 53d4 <_sk_callback_hsw+0x1b8>
+  .byte  196,226,125,24,13,104,73,0,0        // vbroadcastss  0x4968(%rip),%ymm1        # 55fc <_sk_callback_hsw+0x1b8>
   .byte  197,116,92,215                      // vsubps        %ymm7,%ymm1,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,116,92,219                      // vsubps        %ymm3,%ymm1,%ymm11
@@ -11411,11 +11737,11 @@
   .byte  196,65,28,89,210                    // vmulps        %ymm10,%ymm12,%ymm10
   .byte  196,65,44,94,214                    // vdivps        %ymm14,%ymm10,%ymm10
   .byte  196,67,45,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  .byte  196,98,125,24,53,87,70,0,0          // vbroadcastss  0x4657(%rip),%ymm14        # 53d8 <_sk_callback_hsw+0x1bc>
-  .byte  196,98,125,24,61,82,70,0,0          // vbroadcastss  0x4652(%rip),%ymm15        # 53dc <_sk_callback_hsw+0x1c0>
+  .byte  196,98,125,24,53,127,72,0,0         // vbroadcastss  0x487f(%rip),%ymm14        # 5600 <_sk_callback_hsw+0x1bc>
+  .byte  196,98,125,24,61,122,72,0,0         // vbroadcastss  0x487a(%rip),%ymm15        # 5604 <_sk_callback_hsw+0x1c0>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,66,93,184,238                   // vfmadd231ps   %ymm14,%ymm4,%ymm13
-  .byte  196,226,125,24,5,67,70,0,0          // vbroadcastss  0x4643(%rip),%ymm0        # 53e0 <_sk_callback_hsw+0x1c4>
+  .byte  196,226,125,24,5,107,72,0,0         // vbroadcastss  0x486b(%rip),%ymm0        # 5608 <_sk_callback_hsw+0x1c4>
   .byte  196,98,77,184,232                   // vfmadd231ps   %ymm0,%ymm6,%ymm13
   .byte  196,65,116,89,215                   // vmulps        %ymm15,%ymm1,%ymm10
   .byte  196,66,53,184,214                   // vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -11470,7 +11796,7 @@
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
   .byte  196,65,36,95,200                    // vmaxps        %ymm8,%ymm11,%ymm9
   .byte  196,65,116,95,192                   // vmaxps        %ymm8,%ymm1,%ymm8
-  .byte  196,226,125,24,13,48,69,0,0         // vbroadcastss  0x4530(%rip),%ymm1        # 53e4 <_sk_callback_hsw+0x1c8>
+  .byte  196,226,125,24,13,88,71,0,0         // vbroadcastss  0x4758(%rip),%ymm1        # 560c <_sk_callback_hsw+0x1c8>
   .byte  197,116,92,215                      // vsubps        %ymm7,%ymm1,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,116,92,219                      // vsubps        %ymm3,%ymm1,%ymm11
@@ -11498,11 +11824,11 @@
   .byte  197,108,89,199                      // vmulps        %ymm7,%ymm2,%ymm8
   .byte  197,116,89,215                      // vmulps        %ymm7,%ymm1,%ymm10
   .byte  197,52,89,223                       // vmulps        %ymm7,%ymm9,%ymm11
-  .byte  196,98,125,24,45,201,68,0,0         // vbroadcastss  0x44c9(%rip),%ymm13        # 53e8 <_sk_callback_hsw+0x1cc>
-  .byte  196,98,125,24,53,196,68,0,0         // vbroadcastss  0x44c4(%rip),%ymm14        # 53ec <_sk_callback_hsw+0x1d0>
+  .byte  196,98,125,24,45,241,70,0,0         // vbroadcastss  0x46f1(%rip),%ymm13        # 5610 <_sk_callback_hsw+0x1cc>
+  .byte  196,98,125,24,53,236,70,0,0         // vbroadcastss  0x46ec(%rip),%ymm14        # 5614 <_sk_callback_hsw+0x1d0>
   .byte  196,65,84,89,230                    // vmulps        %ymm14,%ymm5,%ymm12
   .byte  196,66,93,184,229                   // vfmadd231ps   %ymm13,%ymm4,%ymm12
-  .byte  196,98,125,24,61,181,68,0,0         // vbroadcastss  0x44b5(%rip),%ymm15        # 53f0 <_sk_callback_hsw+0x1d4>
+  .byte  196,98,125,24,61,221,70,0,0         // vbroadcastss  0x46dd(%rip),%ymm15        # 5618 <_sk_callback_hsw+0x1d4>
   .byte  196,66,77,184,231                   // vfmadd231ps   %ymm15,%ymm6,%ymm12
   .byte  196,65,44,89,206                    // vmulps        %ymm14,%ymm10,%ymm9
   .byte  196,66,61,184,205                   // vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -11558,7 +11884,7 @@
   .byte  196,193,116,95,206                  // vmaxps        %ymm14,%ymm1,%ymm1
   .byte  196,65,44,95,198                    // vmaxps        %ymm14,%ymm10,%ymm8
   .byte  196,65,124,95,206                   // vmaxps        %ymm14,%ymm0,%ymm9
-  .byte  196,226,125,24,5,151,67,0,0         // vbroadcastss  0x4397(%rip),%ymm0        # 53f4 <_sk_callback_hsw+0x1d8>
+  .byte  196,226,125,24,5,191,69,0,0         // vbroadcastss  0x45bf(%rip),%ymm0        # 561c <_sk_callback_hsw+0x1d8>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -11586,11 +11912,11 @@
   .byte  197,100,89,196                      // vmulps        %ymm4,%ymm3,%ymm8
   .byte  197,100,89,213                      // vmulps        %ymm5,%ymm3,%ymm10
   .byte  197,100,89,222                      // vmulps        %ymm6,%ymm3,%ymm11
-  .byte  196,98,125,24,45,48,67,0,0          // vbroadcastss  0x4330(%rip),%ymm13        # 53f8 <_sk_callback_hsw+0x1dc>
-  .byte  196,98,125,24,53,43,67,0,0          // vbroadcastss  0x432b(%rip),%ymm14        # 53fc <_sk_callback_hsw+0x1e0>
+  .byte  196,98,125,24,45,88,69,0,0          // vbroadcastss  0x4558(%rip),%ymm13        # 5620 <_sk_callback_hsw+0x1dc>
+  .byte  196,98,125,24,53,83,69,0,0          // vbroadcastss  0x4553(%rip),%ymm14        # 5624 <_sk_callback_hsw+0x1e0>
   .byte  196,65,116,89,230                   // vmulps        %ymm14,%ymm1,%ymm12
   .byte  196,66,109,184,229                  // vfmadd231ps   %ymm13,%ymm2,%ymm12
-  .byte  196,98,125,24,61,28,67,0,0          // vbroadcastss  0x431c(%rip),%ymm15        # 5400 <_sk_callback_hsw+0x1e4>
+  .byte  196,98,125,24,61,68,69,0,0          // vbroadcastss  0x4544(%rip),%ymm15        # 5628 <_sk_callback_hsw+0x1e4>
   .byte  196,66,53,184,231                   // vfmadd231ps   %ymm15,%ymm9,%ymm12
   .byte  196,65,44,89,206                    // vmulps        %ymm14,%ymm10,%ymm9
   .byte  196,66,61,184,205                   // vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -11646,7 +11972,7 @@
   .byte  196,193,116,95,206                  // vmaxps        %ymm14,%ymm1,%ymm1
   .byte  196,65,44,95,198                    // vmaxps        %ymm14,%ymm10,%ymm8
   .byte  196,65,124,95,206                   // vmaxps        %ymm14,%ymm0,%ymm9
-  .byte  196,226,125,24,5,254,65,0,0         // vbroadcastss  0x41fe(%rip),%ymm0        # 5404 <_sk_callback_hsw+0x1e8>
+  .byte  196,226,125,24,5,38,68,0,0          // vbroadcastss  0x4426(%rip),%ymm0        # 562c <_sk_callback_hsw+0x1e8>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -11674,17 +12000,17 @@
   .byte  77,133,192                          // test          %r8,%r8
   .byte  15,133,180,0,0,0                    // jne           1315 <_sk_srcover_rgba_8888_hsw+0xcd>
   .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
-  .byte  197,196,84,37,114,69,0,0            // vandps        0x4572(%rip),%ymm7,%ymm4        # 57e0 <_sk_callback_hsw+0x5c4>
+  .byte  197,196,84,37,178,71,0,0            // vandps        0x47b2(%rip),%ymm7,%ymm4        # 5a20 <_sk_callback_hsw+0x5dc>
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,69,0,45,133,69,0,0          // vpshufb       0x4585(%rip),%ymm7,%ymm5        # 5800 <_sk_callback_hsw+0x5e4>
+  .byte  196,226,69,0,45,197,71,0,0          // vpshufb       0x47c5(%rip),%ymm7,%ymm5        # 5a40 <_sk_callback_hsw+0x5fc>
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,226,69,0,53,152,69,0,0          // vpshufb       0x4598(%rip),%ymm7,%ymm6        # 5820 <_sk_callback_hsw+0x604>
+  .byte  196,226,69,0,53,216,71,0,0          // vpshufb       0x47d8(%rip),%ymm7,%ymm6        # 5a60 <_sk_callback_hsw+0x61c>
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
   .byte  197,197,114,215,24                  // vpsrld        $0x18,%ymm7,%ymm7
   .byte  197,252,91,255                      // vcvtdq2ps     %ymm7,%ymm7
-  .byte  196,98,125,24,5,106,65,0,0          // vbroadcastss  0x416a(%rip),%ymm8        # 5408 <_sk_callback_hsw+0x1ec>
+  .byte  196,98,125,24,5,146,67,0,0          // vbroadcastss  0x4392(%rip),%ymm8        # 5630 <_sk_callback_hsw+0x1ec>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
-  .byte  196,98,125,24,13,97,65,0,0          // vbroadcastss  0x4161(%rip),%ymm9        # 540c <_sk_callback_hsw+0x1f0>
+  .byte  196,98,125,24,13,137,67,0,0         // vbroadcastss  0x4389(%rip),%ymm9        # 5634 <_sk_callback_hsw+0x1f0>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,194,93,184,192                  // vfmadd231ps   %ymm8,%ymm4,%ymm0
   .byte  196,193,116,89,201                  // vmulps        %ymm9,%ymm1,%ymm1
@@ -11744,7 +12070,7 @@
 .globl _sk_clamp_1_hsw
 FUNCTION(_sk_clamp_1_hsw)
 _sk_clamp_1_hsw:
-  .byte  196,98,125,24,5,134,64,0,0          // vbroadcastss  0x4086(%rip),%ymm8        # 5410 <_sk_callback_hsw+0x1f4>
+  .byte  196,98,125,24,5,174,66,0,0          // vbroadcastss  0x42ae(%rip),%ymm8        # 5638 <_sk_callback_hsw+0x1f4>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
@@ -11756,7 +12082,7 @@
 .globl _sk_clamp_a_hsw
 FUNCTION(_sk_clamp_a_hsw)
 _sk_clamp_a_hsw:
-  .byte  196,98,125,24,5,105,64,0,0          // vbroadcastss  0x4069(%rip),%ymm8        # 5414 <_sk_callback_hsw+0x1f8>
+  .byte  196,98,125,24,5,145,66,0,0          // vbroadcastss  0x4291(%rip),%ymm8        # 563c <_sk_callback_hsw+0x1f8>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  197,252,93,195                      // vminps        %ymm3,%ymm0,%ymm0
   .byte  197,244,93,203                      // vminps        %ymm3,%ymm1,%ymm1
@@ -11768,7 +12094,7 @@
 .globl _sk_clamp_a_dst_hsw
 FUNCTION(_sk_clamp_a_dst_hsw)
 _sk_clamp_a_dst_hsw:
-  .byte  196,98,125,24,5,79,64,0,0           // vbroadcastss  0x404f(%rip),%ymm8        # 5418 <_sk_callback_hsw+0x1fc>
+  .byte  196,98,125,24,5,119,66,0,0          // vbroadcastss  0x4277(%rip),%ymm8        # 5640 <_sk_callback_hsw+0x1fc>
   .byte  196,193,68,93,248                   // vminps        %ymm8,%ymm7,%ymm7
   .byte  197,220,93,231                      // vminps        %ymm7,%ymm4,%ymm4
   .byte  197,212,93,239                      // vminps        %ymm7,%ymm5,%ymm5
@@ -11797,16 +12123,6 @@
   .byte  197,124,41,194                      // vmovaps       %ymm8,%ymm2
   .byte  255,224                             // jmpq          *%rax
 
-HIDDEN _sk_swap_rb_dst_hsw
-.globl _sk_swap_rb_dst_hsw
-FUNCTION(_sk_swap_rb_dst_hsw)
-_sk_swap_rb_dst_hsw:
-  .byte  197,124,40,196                      // vmovaps       %ymm4,%ymm8
-  .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  197,252,40,230                      // vmovaps       %ymm6,%ymm4
-  .byte  197,124,41,198                      // vmovaps       %ymm8,%ymm6
-  .byte  255,224                             // jmpq          *%rax
-
 HIDDEN _sk_move_src_dst_hsw
 .globl _sk_move_src_dst_hsw
 FUNCTION(_sk_move_src_dst_hsw)
@@ -11845,7 +12161,7 @@
 _sk_unpremul_hsw:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,65,100,194,200,0                // vcmpeqps      %ymm8,%ymm3,%ymm9
-  .byte  196,98,125,24,21,187,63,0,0         // vbroadcastss  0x3fbb(%rip),%ymm10        # 541c <_sk_callback_hsw+0x200>
+  .byte  196,98,125,24,21,243,65,0,0         // vbroadcastss  0x41f3(%rip),%ymm10        # 5644 <_sk_callback_hsw+0x200>
   .byte  197,44,94,211                       // vdivps        %ymm3,%ymm10,%ymm10
   .byte  196,67,45,74,192,144                // vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
@@ -11858,16 +12174,16 @@
 .globl _sk_from_srgb_hsw
 FUNCTION(_sk_from_srgb_hsw)
 _sk_from_srgb_hsw:
-  .byte  196,98,125,24,5,156,63,0,0          // vbroadcastss  0x3f9c(%rip),%ymm8        # 5420 <_sk_callback_hsw+0x204>
+  .byte  196,98,125,24,5,212,65,0,0          // vbroadcastss  0x41d4(%rip),%ymm8        # 5648 <_sk_callback_hsw+0x204>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  197,124,89,208                      // vmulps        %ymm0,%ymm0,%ymm10
-  .byte  196,98,125,24,29,142,63,0,0         // vbroadcastss  0x3f8e(%rip),%ymm11        # 5424 <_sk_callback_hsw+0x208>
-  .byte  196,98,125,24,37,137,63,0,0         // vbroadcastss  0x3f89(%rip),%ymm12        # 5428 <_sk_callback_hsw+0x20c>
+  .byte  196,98,125,24,29,198,65,0,0         // vbroadcastss  0x41c6(%rip),%ymm11        # 564c <_sk_callback_hsw+0x208>
+  .byte  196,98,125,24,37,193,65,0,0         // vbroadcastss  0x41c1(%rip),%ymm12        # 5650 <_sk_callback_hsw+0x20c>
   .byte  196,65,124,40,236                   // vmovaps       %ymm12,%ymm13
   .byte  196,66,125,168,235                  // vfmadd213ps   %ymm11,%ymm0,%ymm13
-  .byte  196,98,125,24,53,122,63,0,0         // vbroadcastss  0x3f7a(%rip),%ymm14        # 542c <_sk_callback_hsw+0x210>
+  .byte  196,98,125,24,53,178,65,0,0         // vbroadcastss  0x41b2(%rip),%ymm14        # 5654 <_sk_callback_hsw+0x210>
   .byte  196,66,45,168,238                   // vfmadd213ps   %ymm14,%ymm10,%ymm13
-  .byte  196,98,125,24,21,112,63,0,0         // vbroadcastss  0x3f70(%rip),%ymm10        # 5430 <_sk_callback_hsw+0x214>
+  .byte  196,98,125,24,21,168,65,0,0         // vbroadcastss  0x41a8(%rip),%ymm10        # 5658 <_sk_callback_hsw+0x214>
   .byte  196,193,124,194,194,1               // vcmpltps      %ymm10,%ymm0,%ymm0
   .byte  196,195,21,74,193,0                 // vblendvps     %ymm0,%ymm9,%ymm13,%ymm0
   .byte  196,65,116,89,200                   // vmulps        %ymm8,%ymm1,%ymm9
@@ -11890,16 +12206,16 @@
 .globl _sk_from_srgb_dst_hsw
 FUNCTION(_sk_from_srgb_dst_hsw)
 _sk_from_srgb_dst_hsw:
-  .byte  196,98,125,24,5,24,63,0,0           // vbroadcastss  0x3f18(%rip),%ymm8        # 5434 <_sk_callback_hsw+0x218>
+  .byte  196,98,125,24,5,80,65,0,0           // vbroadcastss  0x4150(%rip),%ymm8        # 565c <_sk_callback_hsw+0x218>
   .byte  196,65,92,89,200                    // vmulps        %ymm8,%ymm4,%ymm9
   .byte  197,92,89,212                       // vmulps        %ymm4,%ymm4,%ymm10
-  .byte  196,98,125,24,29,10,63,0,0          // vbroadcastss  0x3f0a(%rip),%ymm11        # 5438 <_sk_callback_hsw+0x21c>
-  .byte  196,98,125,24,37,5,63,0,0           // vbroadcastss  0x3f05(%rip),%ymm12        # 543c <_sk_callback_hsw+0x220>
+  .byte  196,98,125,24,29,66,65,0,0          // vbroadcastss  0x4142(%rip),%ymm11        # 5660 <_sk_callback_hsw+0x21c>
+  .byte  196,98,125,24,37,61,65,0,0          // vbroadcastss  0x413d(%rip),%ymm12        # 5664 <_sk_callback_hsw+0x220>
   .byte  196,65,124,40,236                   // vmovaps       %ymm12,%ymm13
   .byte  196,66,93,168,235                   // vfmadd213ps   %ymm11,%ymm4,%ymm13
-  .byte  196,98,125,24,53,246,62,0,0         // vbroadcastss  0x3ef6(%rip),%ymm14        # 5440 <_sk_callback_hsw+0x224>
+  .byte  196,98,125,24,53,46,65,0,0          // vbroadcastss  0x412e(%rip),%ymm14        # 5668 <_sk_callback_hsw+0x224>
   .byte  196,66,45,168,238                   // vfmadd213ps   %ymm14,%ymm10,%ymm13
-  .byte  196,98,125,24,21,236,62,0,0         // vbroadcastss  0x3eec(%rip),%ymm10        # 5444 <_sk_callback_hsw+0x228>
+  .byte  196,98,125,24,21,36,65,0,0          // vbroadcastss  0x4124(%rip),%ymm10        # 566c <_sk_callback_hsw+0x228>
   .byte  196,193,92,194,226,1                // vcmpltps      %ymm10,%ymm4,%ymm4
   .byte  196,195,21,74,225,64                // vblendvps     %ymm4,%ymm9,%ymm13,%ymm4
   .byte  196,65,84,89,200                    // vmulps        %ymm8,%ymm5,%ymm9
@@ -11923,19 +12239,19 @@
 FUNCTION(_sk_to_srgb_hsw)
 _sk_to_srgb_hsw:
   .byte  197,124,82,200                      // vrsqrtps      %ymm0,%ymm9
-  .byte  196,98,125,24,5,144,62,0,0          // vbroadcastss  0x3e90(%rip),%ymm8        # 5448 <_sk_callback_hsw+0x22c>
+  .byte  196,98,125,24,5,200,64,0,0          // vbroadcastss  0x40c8(%rip),%ymm8        # 5670 <_sk_callback_hsw+0x22c>
   .byte  196,65,124,89,208                   // vmulps        %ymm8,%ymm0,%ymm10
-  .byte  196,98,125,24,29,134,62,0,0         // vbroadcastss  0x3e86(%rip),%ymm11        # 544c <_sk_callback_hsw+0x230>
-  .byte  196,98,125,24,37,129,62,0,0         // vbroadcastss  0x3e81(%rip),%ymm12        # 5450 <_sk_callback_hsw+0x234>
+  .byte  196,98,125,24,29,190,64,0,0         // vbroadcastss  0x40be(%rip),%ymm11        # 5674 <_sk_callback_hsw+0x230>
+  .byte  196,98,125,24,37,185,64,0,0         // vbroadcastss  0x40b9(%rip),%ymm12        # 5678 <_sk_callback_hsw+0x234>
   .byte  196,65,124,40,236                   // vmovaps       %ymm12,%ymm13
   .byte  196,66,53,168,235                   // vfmadd213ps   %ymm11,%ymm9,%ymm13
-  .byte  196,98,125,24,53,114,62,0,0         // vbroadcastss  0x3e72(%rip),%ymm14        # 5454 <_sk_callback_hsw+0x238>
+  .byte  196,98,125,24,53,170,64,0,0         // vbroadcastss  0x40aa(%rip),%ymm14        # 567c <_sk_callback_hsw+0x238>
   .byte  196,66,53,168,238                   // vfmadd213ps   %ymm14,%ymm9,%ymm13
-  .byte  196,98,125,24,61,104,62,0,0         // vbroadcastss  0x3e68(%rip),%ymm15        # 5458 <_sk_callback_hsw+0x23c>
+  .byte  196,98,125,24,61,160,64,0,0         // vbroadcastss  0x40a0(%rip),%ymm15        # 5680 <_sk_callback_hsw+0x23c>
   .byte  196,65,52,88,207                    // vaddps        %ymm15,%ymm9,%ymm9
   .byte  196,65,124,83,201                   // vrcpps        %ymm9,%ymm9
   .byte  196,65,20,89,201                    // vmulps        %ymm9,%ymm13,%ymm9
-  .byte  196,98,125,24,45,84,62,0,0          // vbroadcastss  0x3e54(%rip),%ymm13        # 545c <_sk_callback_hsw+0x240>
+  .byte  196,98,125,24,45,140,64,0,0         // vbroadcastss  0x408c(%rip),%ymm13        # 5684 <_sk_callback_hsw+0x240>
   .byte  196,193,124,194,197,1               // vcmpltps      %ymm13,%ymm0,%ymm0
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  197,124,82,201                      // vrsqrtps      %ymm1,%ymm9
@@ -11969,26 +12285,26 @@
   .byte  197,124,93,201                      // vminps        %ymm1,%ymm0,%ymm9
   .byte  197,52,93,202                       // vminps        %ymm2,%ymm9,%ymm9
   .byte  196,65,60,92,209                    // vsubps        %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,29,201,61,0,0         // vbroadcastss  0x3dc9(%rip),%ymm11        # 5460 <_sk_callback_hsw+0x244>
+  .byte  196,98,125,24,29,1,64,0,0           // vbroadcastss  0x4001(%rip),%ymm11        # 5688 <_sk_callback_hsw+0x244>
   .byte  196,65,36,94,218                    // vdivps        %ymm10,%ymm11,%ymm11
   .byte  197,116,92,226                      // vsubps        %ymm2,%ymm1,%ymm12
   .byte  197,116,194,234,1                   // vcmpltps      %ymm2,%ymm1,%ymm13
-  .byte  196,98,125,24,53,182,61,0,0         // vbroadcastss  0x3db6(%rip),%ymm14        # 5464 <_sk_callback_hsw+0x248>
+  .byte  196,98,125,24,53,238,63,0,0         // vbroadcastss  0x3fee(%rip),%ymm14        # 568c <_sk_callback_hsw+0x248>
   .byte  196,65,4,87,255                     // vxorps        %ymm15,%ymm15,%ymm15
   .byte  196,67,5,74,238,208                 // vblendvps     %ymm13,%ymm14,%ymm15,%ymm13
   .byte  196,66,37,168,229                   // vfmadd213ps   %ymm13,%ymm11,%ymm12
   .byte  197,236,92,208                      // vsubps        %ymm0,%ymm2,%ymm2
   .byte  197,124,92,233                      // vsubps        %ymm1,%ymm0,%ymm13
-  .byte  196,98,125,24,53,157,61,0,0         // vbroadcastss  0x3d9d(%rip),%ymm14        # 546c <_sk_callback_hsw+0x250>
+  .byte  196,98,125,24,53,213,63,0,0         // vbroadcastss  0x3fd5(%rip),%ymm14        # 5694 <_sk_callback_hsw+0x250>
   .byte  196,66,37,168,238                   // vfmadd213ps   %ymm14,%ymm11,%ymm13
-  .byte  196,98,125,24,53,139,61,0,0         // vbroadcastss  0x3d8b(%rip),%ymm14        # 5468 <_sk_callback_hsw+0x24c>
+  .byte  196,98,125,24,53,195,63,0,0         // vbroadcastss  0x3fc3(%rip),%ymm14        # 5690 <_sk_callback_hsw+0x24c>
   .byte  196,194,37,168,214                  // vfmadd213ps   %ymm14,%ymm11,%ymm2
   .byte  197,188,194,201,0                   // vcmpeqps      %ymm1,%ymm8,%ymm1
   .byte  196,227,21,74,202,16                // vblendvps     %ymm1,%ymm2,%ymm13,%ymm1
   .byte  197,188,194,192,0                   // vcmpeqps      %ymm0,%ymm8,%ymm0
   .byte  196,195,117,74,196,0                // vblendvps     %ymm0,%ymm12,%ymm1,%ymm0
   .byte  196,193,60,88,201                   // vaddps        %ymm9,%ymm8,%ymm1
-  .byte  196,98,125,24,29,110,61,0,0         // vbroadcastss  0x3d6e(%rip),%ymm11        # 5474 <_sk_callback_hsw+0x258>
+  .byte  196,98,125,24,29,166,63,0,0         // vbroadcastss  0x3fa6(%rip),%ymm11        # 569c <_sk_callback_hsw+0x258>
   .byte  196,193,116,89,211                  // vmulps        %ymm11,%ymm1,%ymm2
   .byte  197,36,194,218,1                    // vcmpltps      %ymm2,%ymm11,%ymm11
   .byte  196,65,12,92,224                    // vsubps        %ymm8,%ymm14,%ymm12
@@ -11998,7 +12314,7 @@
   .byte  197,172,94,201                      // vdivps        %ymm1,%ymm10,%ymm1
   .byte  196,195,125,74,199,128              // vblendvps     %ymm8,%ymm15,%ymm0,%ymm0
   .byte  196,195,117,74,207,128              // vblendvps     %ymm8,%ymm15,%ymm1,%ymm1
-  .byte  196,98,125,24,5,49,61,0,0           // vbroadcastss  0x3d31(%rip),%ymm8        # 5470 <_sk_callback_hsw+0x254>
+  .byte  196,98,125,24,5,105,63,0,0          // vbroadcastss  0x3f69(%rip),%ymm8        # 5698 <_sk_callback_hsw+0x254>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -12015,30 +12331,30 @@
   .byte  197,252,17,92,36,128                // vmovups       %ymm3,-0x80(%rsp)
   .byte  197,252,40,233                      // vmovaps       %ymm1,%ymm5
   .byte  197,252,40,224                      // vmovaps       %ymm0,%ymm4
-  .byte  196,98,125,24,5,254,60,0,0          // vbroadcastss  0x3cfe(%rip),%ymm8        # 5478 <_sk_callback_hsw+0x25c>
+  .byte  196,98,125,24,5,54,63,0,0           // vbroadcastss  0x3f36(%rip),%ymm8        # 56a0 <_sk_callback_hsw+0x25c>
   .byte  197,60,194,202,2                    // vcmpleps      %ymm2,%ymm8,%ymm9
   .byte  197,84,89,210                       // vmulps        %ymm2,%ymm5,%ymm10
   .byte  196,65,84,92,218                    // vsubps        %ymm10,%ymm5,%ymm11
   .byte  196,67,45,74,203,144                // vblendvps     %ymm9,%ymm11,%ymm10,%ymm9
   .byte  197,52,88,210                       // vaddps        %ymm2,%ymm9,%ymm10
-  .byte  196,98,125,24,13,225,60,0,0         // vbroadcastss  0x3ce1(%rip),%ymm9        # 547c <_sk_callback_hsw+0x260>
+  .byte  196,98,125,24,13,25,63,0,0          // vbroadcastss  0x3f19(%rip),%ymm9        # 56a4 <_sk_callback_hsw+0x260>
   .byte  196,66,109,170,202                  // vfmsub213ps   %ymm10,%ymm2,%ymm9
-  .byte  196,98,125,24,29,215,60,0,0         // vbroadcastss  0x3cd7(%rip),%ymm11        # 5480 <_sk_callback_hsw+0x264>
+  .byte  196,98,125,24,29,15,63,0,0          // vbroadcastss  0x3f0f(%rip),%ymm11        # 56a8 <_sk_callback_hsw+0x264>
   .byte  196,65,92,88,219                    // vaddps        %ymm11,%ymm4,%ymm11
   .byte  196,67,125,8,227,1                  // vroundps      $0x1,%ymm11,%ymm12
   .byte  196,65,36,92,252                    // vsubps        %ymm12,%ymm11,%ymm15
   .byte  196,65,44,92,217                    // vsubps        %ymm9,%ymm10,%ymm11
-  .byte  196,98,125,24,45,193,60,0,0         // vbroadcastss  0x3cc1(%rip),%ymm13        # 5488 <_sk_callback_hsw+0x26c>
+  .byte  196,98,125,24,45,249,62,0,0         // vbroadcastss  0x3ef9(%rip),%ymm13        # 56b0 <_sk_callback_hsw+0x26c>
   .byte  196,193,4,89,197                    // vmulps        %ymm13,%ymm15,%ymm0
-  .byte  196,98,125,24,53,183,60,0,0         // vbroadcastss  0x3cb7(%rip),%ymm14        # 548c <_sk_callback_hsw+0x270>
+  .byte  196,98,125,24,53,239,62,0,0         // vbroadcastss  0x3eef(%rip),%ymm14        # 56b4 <_sk_callback_hsw+0x270>
   .byte  197,12,92,224                       // vsubps        %ymm0,%ymm14,%ymm12
   .byte  196,66,37,168,225                   // vfmadd213ps   %ymm9,%ymm11,%ymm12
-  .byte  196,226,125,24,29,157,60,0,0        // vbroadcastss  0x3c9d(%rip),%ymm3        # 5484 <_sk_callback_hsw+0x268>
+  .byte  196,226,125,24,29,213,62,0,0        // vbroadcastss  0x3ed5(%rip),%ymm3        # 56ac <_sk_callback_hsw+0x268>
   .byte  196,193,100,194,255,2               // vcmpleps      %ymm15,%ymm3,%ymm7
   .byte  196,195,29,74,249,112               // vblendvps     %ymm7,%ymm9,%ymm12,%ymm7
   .byte  196,65,60,194,231,2                 // vcmpleps      %ymm15,%ymm8,%ymm12
   .byte  196,227,45,74,255,192               // vblendvps     %ymm12,%ymm7,%ymm10,%ymm7
-  .byte  196,98,125,24,37,136,60,0,0         // vbroadcastss  0x3c88(%rip),%ymm12        # 5490 <_sk_callback_hsw+0x274>
+  .byte  196,98,125,24,37,192,62,0,0         // vbroadcastss  0x3ec0(%rip),%ymm12        # 56b8 <_sk_callback_hsw+0x274>
   .byte  196,65,28,194,255,2                 // vcmpleps      %ymm15,%ymm12,%ymm15
   .byte  196,194,37,168,193                  // vfmadd213ps   %ymm9,%ymm11,%ymm0
   .byte  196,99,125,74,255,240               // vblendvps     %ymm15,%ymm7,%ymm0,%ymm15
@@ -12054,7 +12370,7 @@
   .byte  197,156,194,192,2                   // vcmpleps      %ymm0,%ymm12,%ymm0
   .byte  196,194,37,168,249                  // vfmadd213ps   %ymm9,%ymm11,%ymm7
   .byte  196,227,69,74,201,0                 // vblendvps     %ymm0,%ymm1,%ymm7,%ymm1
-  .byte  196,226,125,24,5,52,60,0,0          // vbroadcastss  0x3c34(%rip),%ymm0        # 5494 <_sk_callback_hsw+0x278>
+  .byte  196,226,125,24,5,108,62,0,0         // vbroadcastss  0x3e6c(%rip),%ymm0        # 56bc <_sk_callback_hsw+0x278>
   .byte  197,220,88,192                      // vaddps        %ymm0,%ymm4,%ymm0
   .byte  196,227,125,8,224,1                 // vroundps      $0x1,%ymm0,%ymm4
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
@@ -12102,12 +12418,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,58                              // jne           1941 <_sk_scale_u8_hsw+0x44>
+  .byte  117,58                              // jne           1931 <_sk_scale_u8_hsw+0x44>
   .byte  196,66,121,48,4,19                  // vpmovzxbw     (%r11,%rdx,1),%xmm8
-  .byte  197,57,219,5,11,65,0,0              // vpand         0x410b(%rip),%xmm8,%xmm8        # 5a20 <_sk_callback_hsw+0x804>
+  .byte  197,57,219,5,123,68,0,0             // vpand         0x447b(%rip),%xmm8,%xmm8        # 5d80 <_sk_callback_hsw+0x93c>
   .byte  196,66,125,51,192                   // vpmovzxwd     %xmm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,112,59,0,0         // vbroadcastss  0x3b70(%rip),%ymm9        # 5498 <_sk_callback_hsw+0x27c>
+  .byte  196,98,125,24,13,168,61,0,0         // vbroadcastss  0x3da8(%rip),%ymm9        # 56c0 <_sk_callback_hsw+0x27c>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -12120,15 +12436,15 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,183                             // ja            190d <_sk_scale_u8_hsw+0x10>
+  .byte  119,183                             // ja            18fd <_sk_scale_u8_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,123,0,0,0                 // lea           0x7b(%rip),%r10        # 19dc <_sk_scale_u8_hsw+0xdf>
+  .byte  76,141,21,123,0,0,0                 // lea           0x7b(%rip),%r10        # 19cc <_sk_scale_u8_hsw+0xdf>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  235,152                             // jmp           190d <_sk_scale_u8_hsw+0x10>
+  .byte  235,152                             // jmp           18fd <_sk_scale_u8_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,2                    // vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -12136,7 +12452,7 @@
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,57,2,193,1                   // vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,111,255,255,255                 // jmpq          190d <_sk_scale_u8_hsw+0x10>
+  .byte  233,111,255,255,255                 // jmpq          18fd <_sk_scale_u8_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,6                    // vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -12147,7 +12463,7 @@
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,49,2,192,12                  // vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  .byte  233,51,255,255,255                  // jmpq          190d <_sk_scale_u8_hsw+0x10>
+  .byte  233,51,255,255,255                  // jmpq          18fd <_sk_scale_u8_hsw+0x10>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  142,255                             // mov           %edi,%?
   .byte  255                                 // (bad)
@@ -12155,7 +12471,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  232,255,255,255,221                 // callq         ffffffffde0019ec <_sk_callback_hsw+0xffffffffddffc7d0>
+  .byte  232,255,255,255,221                 // callq         ffffffffde0019dc <_sk_callback_hsw+0xffffffffddffc598>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,210                             // callq         *%rdx
@@ -12190,12 +12506,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,78                              // jne           1a7f <_sk_lerp_u8_hsw+0x58>
+  .byte  117,78                              // jne           1a6f <_sk_lerp_u8_hsw+0x58>
   .byte  196,66,121,48,4,19                  // vpmovzxbw     (%r11,%rdx,1),%xmm8
-  .byte  197,57,219,5,241,63,0,0             // vpand         0x3ff1(%rip),%xmm8,%xmm8        # 5a30 <_sk_callback_hsw+0x814>
+  .byte  197,57,219,5,97,67,0,0              // vpand         0x4361(%rip),%xmm8,%xmm8        # 5d90 <_sk_callback_hsw+0x94c>
   .byte  196,66,125,51,192                   // vpmovzxwd     %xmm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,74,58,0,0          // vbroadcastss  0x3a4a(%rip),%ymm9        # 549c <_sk_callback_hsw+0x280>
+  .byte  196,98,125,24,13,130,60,0,0         // vbroadcastss  0x3c82(%rip),%ymm9        # 56c4 <_sk_callback_hsw+0x280>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,226,61,168,196                  // vfmadd213ps   %ymm4,%ymm8,%ymm0
@@ -12212,15 +12528,15 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,163                             // ja            1a37 <_sk_lerp_u8_hsw+0x10>
+  .byte  119,163                             // ja            1a27 <_sk_lerp_u8_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,121,0,0,0                 // lea           0x79(%rip),%r10        # 1b18 <_sk_lerp_u8_hsw+0xf1>
+  .byte  76,141,21,121,0,0,0                 // lea           0x79(%rip),%r10        # 1b08 <_sk_lerp_u8_hsw+0xf1>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  235,132                             // jmp           1a37 <_sk_lerp_u8_hsw+0x10>
+  .byte  235,132                             // jmp           1a27 <_sk_lerp_u8_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,2                    // vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -12228,7 +12544,7 @@
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,57,2,193,1                   // vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,91,255,255,255                  // jmpq          1a37 <_sk_lerp_u8_hsw+0x10>
+  .byte  233,91,255,255,255                  // jmpq          1a27 <_sk_lerp_u8_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,6                    // vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -12239,7 +12555,7 @@
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,49,2,192,12                  // vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  .byte  233,31,255,255,255                  // jmpq          1a37 <_sk_lerp_u8_hsw+0x10>
+  .byte  233,31,255,255,255                  // jmpq          1a27 <_sk_lerp_u8_hsw+0x10>
   .byte  144                                 // nop
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -12268,23 +12584,23 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,169,0,0,0                    // jne           1beb <_sk_lerp_565_hsw+0xb7>
+  .byte  15,133,169,0,0,0                    // jne           1bdb <_sk_lerp_565_hsw+0xb7>
   .byte  196,65,122,111,4,83                 // vmovdqu       (%r11,%rdx,2),%xmm8
   .byte  196,66,125,51,192                   // vpmovzxwd     %xmm8,%ymm8
-  .byte  196,98,125,88,13,74,57,0,0          // vpbroadcastd  0x394a(%rip),%ymm9        # 54a0 <_sk_callback_hsw+0x284>
+  .byte  196,98,125,88,13,130,59,0,0         // vpbroadcastd  0x3b82(%rip),%ymm9        # 56c8 <_sk_callback_hsw+0x284>
   .byte  196,65,61,219,201                   // vpand         %ymm9,%ymm8,%ymm9
   .byte  196,65,124,91,201                   // vcvtdq2ps     %ymm9,%ymm9
-  .byte  196,98,125,24,21,59,57,0,0          // vbroadcastss  0x393b(%rip),%ymm10        # 54a4 <_sk_callback_hsw+0x288>
+  .byte  196,98,125,24,21,115,59,0,0         // vbroadcastss  0x3b73(%rip),%ymm10        # 56cc <_sk_callback_hsw+0x288>
   .byte  196,65,52,89,202                    // vmulps        %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,88,21,49,57,0,0          // vpbroadcastd  0x3931(%rip),%ymm10        # 54a8 <_sk_callback_hsw+0x28c>
+  .byte  196,98,125,88,21,105,59,0,0         // vpbroadcastd  0x3b69(%rip),%ymm10        # 56d0 <_sk_callback_hsw+0x28c>
   .byte  196,65,61,219,210                   // vpand         %ymm10,%ymm8,%ymm10
   .byte  196,65,124,91,210                   // vcvtdq2ps     %ymm10,%ymm10
-  .byte  196,98,125,24,29,34,57,0,0          // vbroadcastss  0x3922(%rip),%ymm11        # 54ac <_sk_callback_hsw+0x290>
+  .byte  196,98,125,24,29,90,59,0,0          // vbroadcastss  0x3b5a(%rip),%ymm11        # 56d4 <_sk_callback_hsw+0x290>
   .byte  196,65,44,89,211                    // vmulps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,88,29,24,57,0,0          // vpbroadcastd  0x3918(%rip),%ymm11        # 54b0 <_sk_callback_hsw+0x294>
+  .byte  196,98,125,88,29,80,59,0,0          // vpbroadcastd  0x3b50(%rip),%ymm11        # 56d8 <_sk_callback_hsw+0x294>
   .byte  196,65,61,219,195                   // vpand         %ymm11,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,29,9,57,0,0           // vbroadcastss  0x3909(%rip),%ymm11        # 54b4 <_sk_callback_hsw+0x298>
+  .byte  196,98,125,24,29,65,59,0,0          // vbroadcastss  0x3b41(%rip),%ymm11        # 56dc <_sk_callback_hsw+0x298>
   .byte  196,65,60,89,195                    // vmulps        %ymm11,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,226,53,168,196                  // vfmadd213ps   %ymm4,%ymm9,%ymm0
@@ -12305,27 +12621,27 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,68,255,255,255               // ja            1b48 <_sk_lerp_565_hsw+0x14>
+  .byte  15,135,68,255,255,255               // ja            1b38 <_sk_lerp_565_hsw+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,101,0,0,0                 // lea           0x65(%rip),%r10        # 1c74 <_sk_lerp_565_hsw+0x140>
+  .byte  76,141,21,101,0,0,0                 // lea           0x65(%rip),%r10        # 1c64 <_sk_lerp_565_hsw+0x140>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  233,34,255,255,255                  // jmpq          1b48 <_sk_lerp_565_hsw+0x14>
+  .byte  233,34,255,255,255                  // jmpq          1b38 <_sk_lerp_565_hsw+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,65,57,196,68,83,4,2             // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,121,110,12,83                // vmovd         (%r11,%rdx,2),%xmm9
   .byte  196,67,57,2,193,1                   // vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,4,255,255,255                   // jmpq          1b48 <_sk_lerp_565_hsw+0x14>
+  .byte  233,4,255,255,255                   // jmpq          1b38 <_sk_lerp_565_hsw+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,65,57,196,68,83,12,6            // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,57,196,68,83,10,5            // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,57,196,68,83,8,4             // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,122,126,12,83                // vmovq         (%r11,%rdx,2),%xmm9
   .byte  196,67,49,2,192,12                  // vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  .byte  233,214,254,255,255                 // jmpq          1b48 <_sk_lerp_565_hsw+0x14>
+  .byte  233,214,254,255,255                 // jmpq          1b38 <_sk_lerp_565_hsw+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  164                                 // movsb         %ds:(%rsi),%es:(%rdi)
   .byte  255                                 // (bad)
@@ -12358,23 +12674,23 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,105                             // jne           1d0e <_sk_load_tables_hsw+0x7e>
+  .byte  117,105                             // jne           1cfe <_sk_load_tables_hsw+0x7e>
   .byte  196,193,124,16,26                   // vmovups       (%r10),%ymm3
-  .byte  197,228,84,13,142,59,0,0            // vandps        0x3b8e(%rip),%ymm3,%ymm1        # 5840 <_sk_callback_hsw+0x624>
+  .byte  197,228,84,13,222,61,0,0            // vandps        0x3dde(%rip),%ymm3,%ymm1        # 5a80 <_sk_callback_hsw+0x63c>
   .byte  196,65,61,118,192                   // vpcmpeqd      %ymm8,%ymm8,%ymm8
   .byte  72,139,72,8                         // mov           0x8(%rax),%rcx
   .byte  76,139,80,16                        // mov           0x10(%rax),%r10
   .byte  197,237,118,210                     // vpcmpeqd      %ymm2,%ymm2,%ymm2
   .byte  196,226,109,146,4,137               // vgatherdps    %ymm2,(%rcx,%ymm1,4),%ymm0
-  .byte  196,226,101,0,21,142,59,0,0         // vpshufb       0x3b8e(%rip),%ymm3,%ymm2        # 5860 <_sk_callback_hsw+0x644>
+  .byte  196,226,101,0,21,222,61,0,0         // vpshufb       0x3dde(%rip),%ymm3,%ymm2        # 5aa0 <_sk_callback_hsw+0x65c>
   .byte  196,65,53,118,201                   // vpcmpeqd      %ymm9,%ymm9,%ymm9
   .byte  196,194,53,146,12,146               // vgatherdps    %ymm9,(%r10,%ymm2,4),%ymm1
   .byte  72,139,64,24                        // mov           0x18(%rax),%rax
-  .byte  196,98,101,0,13,150,59,0,0          // vpshufb       0x3b96(%rip),%ymm3,%ymm9        # 5880 <_sk_callback_hsw+0x664>
+  .byte  196,98,101,0,13,230,61,0,0          // vpshufb       0x3de6(%rip),%ymm3,%ymm9        # 5ac0 <_sk_callback_hsw+0x67c>
   .byte  196,162,61,146,20,136               // vgatherdps    %ymm8,(%rax,%ymm9,4),%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,182,55,0,0          // vbroadcastss  0x37b6(%rip),%ymm8        # 54b8 <_sk_callback_hsw+0x29c>
+  .byte  196,98,125,24,5,238,57,0,0          // vbroadcastss  0x39ee(%rip),%ymm8        # 56e0 <_sk_callback_hsw+0x29c>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -12387,7 +12703,7 @@
   .byte  196,193,249,110,195                 // vmovq         %r11,%xmm0
   .byte  196,226,125,33,192                  // vpmovsxbd     %xmm0,%ymm0
   .byte  196,194,125,44,26                   // vmaskmovps    (%r10),%ymm0,%ymm3
-  .byte  233,115,255,255,255                 // jmpq          1caa <_sk_load_tables_hsw+0x1a>
+  .byte  233,115,255,255,255                 // jmpq          1c9a <_sk_load_tables_hsw+0x1a>
 
 HIDDEN _sk_load_tables_u16_be_hsw
 .globl _sk_load_tables_u16_be_hsw
@@ -12397,7 +12713,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,201,0,0,0                    // jne           1e16 <_sk_load_tables_u16_be_hsw+0xdf>
+  .byte  15,133,201,0,0,0                    // jne           1e06 <_sk_load_tables_u16_be_hsw+0xdf>
   .byte  196,1,121,16,4,81                   // vmovupd       (%r9,%r10,2),%xmm8
   .byte  196,129,121,16,84,81,16             // vmovupd       0x10(%r9,%r10,2),%xmm2
   .byte  196,129,121,16,92,81,32             // vmovupd       0x20(%r9,%r10,2),%xmm3
@@ -12413,7 +12729,7 @@
   .byte  197,185,108,200                     // vpunpcklqdq   %xmm0,%xmm8,%xmm1
   .byte  197,185,109,208                     // vpunpckhqdq   %xmm0,%xmm8,%xmm2
   .byte  197,49,108,195                      // vpunpcklqdq   %xmm3,%xmm9,%xmm8
-  .byte  197,121,111,21,162,60,0,0           // vmovdqa       0x3ca2(%rip),%xmm10        # 5a40 <_sk_callback_hsw+0x824>
+  .byte  197,121,111,21,18,64,0,0            // vmovdqa       0x4012(%rip),%xmm10        # 5da0 <_sk_callback_hsw+0x95c>
   .byte  196,193,113,219,194                 // vpand         %xmm10,%xmm1,%xmm0
   .byte  196,226,125,51,200                  // vpmovzxwd     %xmm0,%ymm1
   .byte  196,65,37,118,219                   // vpcmpeqd      %ymm11,%ymm11,%ymm11
@@ -12435,36 +12751,36 @@
   .byte  197,185,235,219                     // vpor          %xmm3,%xmm8,%xmm3
   .byte  196,226,125,51,219                  // vpmovzxwd     %xmm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,175,54,0,0          // vbroadcastss  0x36af(%rip),%ymm8        # 54bc <_sk_callback_hsw+0x2a0>
+  .byte  196,98,125,24,5,231,56,0,0          // vbroadcastss  0x38e7(%rip),%ymm8        # 56e4 <_sk_callback_hsw+0x2a0>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,1,123,16,4,81                   // vmovsd        (%r9,%r10,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,85                              // je            1e7c <_sk_load_tables_u16_be_hsw+0x145>
+  .byte  116,85                              // je            1e6c <_sk_load_tables_u16_be_hsw+0x145>
   .byte  196,1,57,22,68,81,8                 // vmovhpd       0x8(%r9,%r10,2),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,72                              // jb            1e7c <_sk_load_tables_u16_be_hsw+0x145>
+  .byte  114,72                              // jb            1e6c <_sk_load_tables_u16_be_hsw+0x145>
   .byte  196,129,123,16,84,81,16             // vmovsd        0x10(%r9,%r10,2),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,72                              // je            1e89 <_sk_load_tables_u16_be_hsw+0x152>
+  .byte  116,72                              // je            1e79 <_sk_load_tables_u16_be_hsw+0x152>
   .byte  196,129,105,22,84,81,24             // vmovhpd       0x18(%r9,%r10,2),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,59                              // jb            1e89 <_sk_load_tables_u16_be_hsw+0x152>
+  .byte  114,59                              // jb            1e79 <_sk_load_tables_u16_be_hsw+0x152>
   .byte  196,129,123,16,92,81,32             // vmovsd        0x20(%r9,%r10,2),%xmm3
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,9,255,255,255                // je            1d68 <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  15,132,9,255,255,255                // je            1d58 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  196,129,97,22,92,81,40              // vmovhpd       0x28(%r9,%r10,2),%xmm3,%xmm3
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,248,254,255,255              // jb            1d68 <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  15,130,248,254,255,255              // jb            1d58 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  196,1,122,126,76,81,48              // vmovq         0x30(%r9,%r10,2),%xmm9
-  .byte  233,236,254,255,255                 // jmpq          1d68 <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  233,236,254,255,255                 // jmpq          1d58 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,223,254,255,255                 // jmpq          1d68 <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  233,223,254,255,255                 // jmpq          1d58 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,214,254,255,255                 // jmpq          1d68 <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  233,214,254,255,255                 // jmpq          1d58 <_sk_load_tables_u16_be_hsw+0x31>
 
 HIDDEN _sk_load_tables_rgb_u16_be_hsw
 .globl _sk_load_tables_rgb_u16_be_hsw
@@ -12474,7 +12790,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,82                        // lea           (%rdx,%rdx,2),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,193,0,0,0                    // jne           1f65 <_sk_load_tables_rgb_u16_be_hsw+0xd3>
+  .byte  15,133,193,0,0,0                    // jne           1f55 <_sk_load_tables_rgb_u16_be_hsw+0xd3>
   .byte  196,129,122,111,4,81                // vmovdqu       (%r9,%r10,2),%xmm0
   .byte  196,129,122,111,84,81,12            // vmovdqu       0xc(%r9,%r10,2),%xmm2
   .byte  196,129,122,111,76,81,24            // vmovdqu       0x18(%r9,%r10,2),%xmm1
@@ -12495,7 +12811,7 @@
   .byte  197,185,108,218                     // vpunpcklqdq   %xmm2,%xmm8,%xmm3
   .byte  197,185,109,210                     // vpunpckhqdq   %xmm2,%xmm8,%xmm2
   .byte  197,121,108,193                     // vpunpcklqdq   %xmm1,%xmm0,%xmm8
-  .byte  197,121,111,13,66,59,0,0            // vmovdqa       0x3b42(%rip),%xmm9        # 5a50 <_sk_callback_hsw+0x834>
+  .byte  197,121,111,13,178,62,0,0           // vmovdqa       0x3eb2(%rip),%xmm9        # 5db0 <_sk_callback_hsw+0x96c>
   .byte  196,193,97,219,193                  // vpand         %xmm9,%xmm3,%xmm0
   .byte  196,226,125,51,200                  // vpmovzxwd     %xmm0,%ymm1
   .byte  197,229,118,219                     // vpcmpeqd      %ymm3,%ymm3,%ymm3
@@ -12512,48 +12828,48 @@
   .byte  196,98,125,51,194                   // vpmovzxwd     %xmm2,%ymm8
   .byte  196,162,101,146,20,128              // vgatherdps    %ymm3,(%rax,%ymm8,4),%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,93,53,0,0         // vbroadcastss  0x355d(%rip),%ymm3        # 54c0 <_sk_callback_hsw+0x2a4>
+  .byte  196,226,125,24,29,149,55,0,0        // vbroadcastss  0x3795(%rip),%ymm3        # 56e8 <_sk_callback_hsw+0x2a4>
   .byte  255,224                             // jmpq          *%rax
   .byte  196,129,121,110,4,81                // vmovd         (%r9,%r10,2),%xmm0
   .byte  196,129,121,196,68,81,4,2           // vpinsrw       $0x2,0x4(%r9,%r10,2),%xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,5                               // jne           1f7e <_sk_load_tables_rgb_u16_be_hsw+0xec>
-  .byte  233,90,255,255,255                  // jmpq          1ed8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  117,5                               // jne           1f6e <_sk_load_tables_rgb_u16_be_hsw+0xec>
+  .byte  233,90,255,255,255                  // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   .byte  196,129,121,110,76,81,6             // vmovd         0x6(%r9,%r10,2),%xmm1
   .byte  196,1,113,196,68,81,10,2            // vpinsrw       $0x2,0xa(%r9,%r10,2),%xmm1,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,26                              // jb            1fad <_sk_load_tables_rgb_u16_be_hsw+0x11b>
+  .byte  114,26                              // jb            1f9d <_sk_load_tables_rgb_u16_be_hsw+0x11b>
   .byte  196,129,121,110,76,81,12            // vmovd         0xc(%r9,%r10,2),%xmm1
   .byte  196,129,113,196,84,81,16,2          // vpinsrw       $0x2,0x10(%r9,%r10,2),%xmm1,%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  117,10                              // jne           1fb2 <_sk_load_tables_rgb_u16_be_hsw+0x120>
-  .byte  233,43,255,255,255                  // jmpq          1ed8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  .byte  233,38,255,255,255                  // jmpq          1ed8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           1fa2 <_sk_load_tables_rgb_u16_be_hsw+0x120>
+  .byte  233,43,255,255,255                  // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,38,255,255,255                  // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   .byte  196,129,121,110,76,81,18            // vmovd         0x12(%r9,%r10,2),%xmm1
   .byte  196,1,113,196,76,81,22,2            // vpinsrw       $0x2,0x16(%r9,%r10,2),%xmm1,%xmm9
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,26                              // jb            1fe1 <_sk_load_tables_rgb_u16_be_hsw+0x14f>
+  .byte  114,26                              // jb            1fd1 <_sk_load_tables_rgb_u16_be_hsw+0x14f>
   .byte  196,129,121,110,76,81,24            // vmovd         0x18(%r9,%r10,2),%xmm1
   .byte  196,129,113,196,76,81,28,2          // vpinsrw       $0x2,0x1c(%r9,%r10,2),%xmm1,%xmm1
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  117,10                              // jne           1fe6 <_sk_load_tables_rgb_u16_be_hsw+0x154>
-  .byte  233,247,254,255,255                 // jmpq          1ed8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  .byte  233,242,254,255,255                 // jmpq          1ed8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           1fd6 <_sk_load_tables_rgb_u16_be_hsw+0x154>
+  .byte  233,247,254,255,255                 // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,242,254,255,255                 // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   .byte  196,129,121,110,92,81,30            // vmovd         0x1e(%r9,%r10,2),%xmm3
   .byte  196,1,97,196,92,81,34,2             // vpinsrw       $0x2,0x22(%r9,%r10,2),%xmm3,%xmm11
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,20                              // jb            200f <_sk_load_tables_rgb_u16_be_hsw+0x17d>
+  .byte  114,20                              // jb            1fff <_sk_load_tables_rgb_u16_be_hsw+0x17d>
   .byte  196,129,121,110,92,81,36            // vmovd         0x24(%r9,%r10,2),%xmm3
   .byte  196,129,97,196,92,81,40,2           // vpinsrw       $0x2,0x28(%r9,%r10,2),%xmm3,%xmm3
-  .byte  233,201,254,255,255                 // jmpq          1ed8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  .byte  233,196,254,255,255                 // jmpq          1ed8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,201,254,255,255                 // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,196,254,255,255                 // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
 
 HIDDEN _sk_byte_tables_hsw
 .globl _sk_byte_tables_hsw
 FUNCTION(_sk_byte_tables_hsw)
 _sk_byte_tables_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,165,52,0,0          // vbroadcastss  0x34a5(%rip),%ymm8        # 54c4 <_sk_callback_hsw+0x2a8>
+  .byte  196,98,125,24,5,221,54,0,0          // vbroadcastss  0x36dd(%rip),%ymm8        # 56ec <_sk_callback_hsw+0x2a8>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  197,125,91,200                      // vcvtps2dq     %ymm0,%ymm9
   .byte  196,65,249,126,201                  // vmovq         %xmm9,%r9
@@ -12675,7 +12991,7 @@
   .byte  67,15,182,4,26                      // movzbl        (%r10,%r11,1),%eax
   .byte  196,194,125,49,193                  // vpmovzxbd     %xmm9,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,74,50,0,0           // vbroadcastss  0x324a(%rip),%ymm8        # 54c8 <_sk_callback_hsw+0x2ac>
+  .byte  196,98,125,24,5,130,52,0,0          // vbroadcastss  0x3482(%rip),%ymm8        # 56f0 <_sk_callback_hsw+0x2ac>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  196,226,125,49,201                  // vpmovzxbd     %xmm1,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
@@ -12791,7 +13107,7 @@
   .byte  67,15,182,4,26                      // movzbl        (%r10,%r11,1),%eax
   .byte  196,194,125,49,193                  // vpmovzxbd     %xmm9,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,54,48,0,0           // vbroadcastss  0x3036(%rip),%ymm8        # 54cc <_sk_callback_hsw+0x2b0>
+  .byte  196,98,125,24,5,110,50,0,0          // vbroadcastss  0x326e(%rip),%ymm8        # 56f4 <_sk_callback_hsw+0x2b0>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  196,226,125,49,201                  // vpmovzxbd     %xmm1,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
@@ -12890,33 +13206,33 @@
   .byte  196,66,125,168,211                  // vfmadd213ps   %ymm11,%ymm0,%ymm10
   .byte  196,226,125,24,0                    // vbroadcastss  (%rax),%ymm0
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,16,47,0,0          // vbroadcastss  0x2f10(%rip),%ymm12        # 54d0 <_sk_callback_hsw+0x2b4>
-  .byte  196,98,125,24,45,11,47,0,0          // vbroadcastss  0x2f0b(%rip),%ymm13        # 54d4 <_sk_callback_hsw+0x2b8>
+  .byte  196,98,125,24,37,72,49,0,0          // vbroadcastss  0x3148(%rip),%ymm12        # 56f8 <_sk_callback_hsw+0x2b4>
+  .byte  196,98,125,24,45,67,49,0,0          // vbroadcastss  0x3143(%rip),%ymm13        # 56fc <_sk_callback_hsw+0x2b8>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,1,47,0,0           // vbroadcastss  0x2f01(%rip),%ymm13        # 54d8 <_sk_callback_hsw+0x2bc>
+  .byte  196,98,125,24,45,57,49,0,0          // vbroadcastss  0x3139(%rip),%ymm13        # 5700 <_sk_callback_hsw+0x2bc>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,247,46,0,0         // vbroadcastss  0x2ef7(%rip),%ymm13        # 54dc <_sk_callback_hsw+0x2c0>
+  .byte  196,98,125,24,45,47,49,0,0          // vbroadcastss  0x312f(%rip),%ymm13        # 5704 <_sk_callback_hsw+0x2c0>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,237,46,0,0         // vbroadcastss  0x2eed(%rip),%ymm11        # 54e0 <_sk_callback_hsw+0x2c4>
+  .byte  196,98,125,24,29,37,49,0,0          // vbroadcastss  0x3125(%rip),%ymm11        # 5708 <_sk_callback_hsw+0x2c4>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,227,46,0,0         // vbroadcastss  0x2ee3(%rip),%ymm12        # 54e4 <_sk_callback_hsw+0x2c8>
+  .byte  196,98,125,24,37,27,49,0,0          // vbroadcastss  0x311b(%rip),%ymm12        # 570c <_sk_callback_hsw+0x2c8>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,217,46,0,0         // vbroadcastss  0x2ed9(%rip),%ymm12        # 54e8 <_sk_callback_hsw+0x2cc>
+  .byte  196,98,125,24,37,17,49,0,0          // vbroadcastss  0x3111(%rip),%ymm12        # 5710 <_sk_callback_hsw+0x2cc>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  196,99,125,8,208,1                  // vroundps      $0x1,%ymm0,%ymm10
   .byte  196,65,124,92,210                   // vsubps        %ymm10,%ymm0,%ymm10
-  .byte  196,98,125,24,29,186,46,0,0         // vbroadcastss  0x2eba(%rip),%ymm11        # 54ec <_sk_callback_hsw+0x2d0>
+  .byte  196,98,125,24,29,242,48,0,0         // vbroadcastss  0x30f2(%rip),%ymm11        # 5714 <_sk_callback_hsw+0x2d0>
   .byte  196,193,124,88,195                  // vaddps        %ymm11,%ymm0,%ymm0
-  .byte  196,98,125,24,29,176,46,0,0         // vbroadcastss  0x2eb0(%rip),%ymm11        # 54f0 <_sk_callback_hsw+0x2d4>
+  .byte  196,98,125,24,29,232,48,0,0         // vbroadcastss  0x30e8(%rip),%ymm11        # 5718 <_sk_callback_hsw+0x2d4>
   .byte  196,98,45,172,216                   // vfnmadd213ps  %ymm0,%ymm10,%ymm11
-  .byte  196,226,125,24,5,166,46,0,0         // vbroadcastss  0x2ea6(%rip),%ymm0        # 54f4 <_sk_callback_hsw+0x2d8>
+  .byte  196,226,125,24,5,222,48,0,0         // vbroadcastss  0x30de(%rip),%ymm0        # 571c <_sk_callback_hsw+0x2d8>
   .byte  196,193,124,92,194                  // vsubps        %ymm10,%ymm0,%ymm0
-  .byte  196,98,125,24,21,156,46,0,0         // vbroadcastss  0x2e9c(%rip),%ymm10        # 54f8 <_sk_callback_hsw+0x2dc>
+  .byte  196,98,125,24,21,212,48,0,0         // vbroadcastss  0x30d4(%rip),%ymm10        # 5720 <_sk_callback_hsw+0x2dc>
   .byte  197,172,94,192                      // vdivps        %ymm0,%ymm10,%ymm0
   .byte  197,164,88,192                      // vaddps        %ymm0,%ymm11,%ymm0
-  .byte  196,98,125,24,21,143,46,0,0         // vbroadcastss  0x2e8f(%rip),%ymm10        # 54fc <_sk_callback_hsw+0x2e0>
+  .byte  196,98,125,24,21,199,48,0,0         // vbroadcastss  0x30c7(%rip),%ymm10        # 5724 <_sk_callback_hsw+0x2e0>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,253,91,192                      // vcvtps2dq     %ymm0,%ymm0
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -12924,7 +13240,7 @@
   .byte  196,195,125,74,193,128              // vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,102,46,0,0          // vbroadcastss  0x2e66(%rip),%ymm8        # 5500 <_sk_callback_hsw+0x2e4>
+  .byte  196,98,125,24,5,158,48,0,0          // vbroadcastss  0x309e(%rip),%ymm8        # 5728 <_sk_callback_hsw+0x2e4>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -12944,33 +13260,33 @@
   .byte  196,66,117,168,211                  // vfmadd213ps   %ymm11,%ymm1,%ymm10
   .byte  196,226,125,24,8                    // vbroadcastss  (%rax),%ymm1
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,30,46,0,0          // vbroadcastss  0x2e1e(%rip),%ymm12        # 5504 <_sk_callback_hsw+0x2e8>
-  .byte  196,98,125,24,45,25,46,0,0          // vbroadcastss  0x2e19(%rip),%ymm13        # 5508 <_sk_callback_hsw+0x2ec>
+  .byte  196,98,125,24,37,86,48,0,0          // vbroadcastss  0x3056(%rip),%ymm12        # 572c <_sk_callback_hsw+0x2e8>
+  .byte  196,98,125,24,45,81,48,0,0          // vbroadcastss  0x3051(%rip),%ymm13        # 5730 <_sk_callback_hsw+0x2ec>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,15,46,0,0          // vbroadcastss  0x2e0f(%rip),%ymm13        # 550c <_sk_callback_hsw+0x2f0>
+  .byte  196,98,125,24,45,71,48,0,0          // vbroadcastss  0x3047(%rip),%ymm13        # 5734 <_sk_callback_hsw+0x2f0>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,5,46,0,0           // vbroadcastss  0x2e05(%rip),%ymm13        # 5510 <_sk_callback_hsw+0x2f4>
+  .byte  196,98,125,24,45,61,48,0,0          // vbroadcastss  0x303d(%rip),%ymm13        # 5738 <_sk_callback_hsw+0x2f4>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,251,45,0,0         // vbroadcastss  0x2dfb(%rip),%ymm11        # 5514 <_sk_callback_hsw+0x2f8>
+  .byte  196,98,125,24,29,51,48,0,0          // vbroadcastss  0x3033(%rip),%ymm11        # 573c <_sk_callback_hsw+0x2f8>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,241,45,0,0         // vbroadcastss  0x2df1(%rip),%ymm12        # 5518 <_sk_callback_hsw+0x2fc>
+  .byte  196,98,125,24,37,41,48,0,0          // vbroadcastss  0x3029(%rip),%ymm12        # 5740 <_sk_callback_hsw+0x2fc>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,231,45,0,0         // vbroadcastss  0x2de7(%rip),%ymm12        # 551c <_sk_callback_hsw+0x300>
+  .byte  196,98,125,24,37,31,48,0,0          // vbroadcastss  0x301f(%rip),%ymm12        # 5744 <_sk_callback_hsw+0x300>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,116,89,202                  // vmulps        %ymm10,%ymm1,%ymm1
   .byte  196,99,125,8,209,1                  // vroundps      $0x1,%ymm1,%ymm10
   .byte  196,65,116,92,210                   // vsubps        %ymm10,%ymm1,%ymm10
-  .byte  196,98,125,24,29,200,45,0,0         // vbroadcastss  0x2dc8(%rip),%ymm11        # 5520 <_sk_callback_hsw+0x304>
+  .byte  196,98,125,24,29,0,48,0,0           // vbroadcastss  0x3000(%rip),%ymm11        # 5748 <_sk_callback_hsw+0x304>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,190,45,0,0         // vbroadcastss  0x2dbe(%rip),%ymm11        # 5524 <_sk_callback_hsw+0x308>
+  .byte  196,98,125,24,29,246,47,0,0         // vbroadcastss  0x2ff6(%rip),%ymm11        # 574c <_sk_callback_hsw+0x308>
   .byte  196,98,45,172,217                   // vfnmadd213ps  %ymm1,%ymm10,%ymm11
-  .byte  196,226,125,24,13,180,45,0,0        // vbroadcastss  0x2db4(%rip),%ymm1        # 5528 <_sk_callback_hsw+0x30c>
+  .byte  196,226,125,24,13,236,47,0,0        // vbroadcastss  0x2fec(%rip),%ymm1        # 5750 <_sk_callback_hsw+0x30c>
   .byte  196,193,116,92,202                  // vsubps        %ymm10,%ymm1,%ymm1
-  .byte  196,98,125,24,21,170,45,0,0         // vbroadcastss  0x2daa(%rip),%ymm10        # 552c <_sk_callback_hsw+0x310>
+  .byte  196,98,125,24,21,226,47,0,0         // vbroadcastss  0x2fe2(%rip),%ymm10        # 5754 <_sk_callback_hsw+0x310>
   .byte  197,172,94,201                      // vdivps        %ymm1,%ymm10,%ymm1
   .byte  197,164,88,201                      // vaddps        %ymm1,%ymm11,%ymm1
-  .byte  196,98,125,24,21,157,45,0,0         // vbroadcastss  0x2d9d(%rip),%ymm10        # 5530 <_sk_callback_hsw+0x314>
+  .byte  196,98,125,24,21,213,47,0,0         // vbroadcastss  0x2fd5(%rip),%ymm10        # 5758 <_sk_callback_hsw+0x314>
   .byte  196,193,116,89,202                  // vmulps        %ymm10,%ymm1,%ymm1
   .byte  197,253,91,201                      // vcvtps2dq     %ymm1,%ymm1
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -12978,7 +13294,7 @@
   .byte  196,195,117,74,201,128              // vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,116,95,200                  // vmaxps        %ymm8,%ymm1,%ymm1
-  .byte  196,98,125,24,5,116,45,0,0          // vbroadcastss  0x2d74(%rip),%ymm8        # 5534 <_sk_callback_hsw+0x318>
+  .byte  196,98,125,24,5,172,47,0,0          // vbroadcastss  0x2fac(%rip),%ymm8        # 575c <_sk_callback_hsw+0x318>
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -12998,33 +13314,33 @@
   .byte  196,66,109,168,211                  // vfmadd213ps   %ymm11,%ymm2,%ymm10
   .byte  196,226,125,24,16                   // vbroadcastss  (%rax),%ymm2
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,44,45,0,0          // vbroadcastss  0x2d2c(%rip),%ymm12        # 5538 <_sk_callback_hsw+0x31c>
-  .byte  196,98,125,24,45,39,45,0,0          // vbroadcastss  0x2d27(%rip),%ymm13        # 553c <_sk_callback_hsw+0x320>
+  .byte  196,98,125,24,37,100,47,0,0         // vbroadcastss  0x2f64(%rip),%ymm12        # 5760 <_sk_callback_hsw+0x31c>
+  .byte  196,98,125,24,45,95,47,0,0          // vbroadcastss  0x2f5f(%rip),%ymm13        # 5764 <_sk_callback_hsw+0x320>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,29,45,0,0          // vbroadcastss  0x2d1d(%rip),%ymm13        # 5540 <_sk_callback_hsw+0x324>
+  .byte  196,98,125,24,45,85,47,0,0          // vbroadcastss  0x2f55(%rip),%ymm13        # 5768 <_sk_callback_hsw+0x324>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,19,45,0,0          // vbroadcastss  0x2d13(%rip),%ymm13        # 5544 <_sk_callback_hsw+0x328>
+  .byte  196,98,125,24,45,75,47,0,0          // vbroadcastss  0x2f4b(%rip),%ymm13        # 576c <_sk_callback_hsw+0x328>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,9,45,0,0           // vbroadcastss  0x2d09(%rip),%ymm11        # 5548 <_sk_callback_hsw+0x32c>
+  .byte  196,98,125,24,29,65,47,0,0          // vbroadcastss  0x2f41(%rip),%ymm11        # 5770 <_sk_callback_hsw+0x32c>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,255,44,0,0         // vbroadcastss  0x2cff(%rip),%ymm12        # 554c <_sk_callback_hsw+0x330>
+  .byte  196,98,125,24,37,55,47,0,0          // vbroadcastss  0x2f37(%rip),%ymm12        # 5774 <_sk_callback_hsw+0x330>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,245,44,0,0         // vbroadcastss  0x2cf5(%rip),%ymm12        # 5550 <_sk_callback_hsw+0x334>
+  .byte  196,98,125,24,37,45,47,0,0          // vbroadcastss  0x2f2d(%rip),%ymm12        # 5778 <_sk_callback_hsw+0x334>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  196,99,125,8,210,1                  // vroundps      $0x1,%ymm2,%ymm10
   .byte  196,65,108,92,210                   // vsubps        %ymm10,%ymm2,%ymm10
-  .byte  196,98,125,24,29,214,44,0,0         // vbroadcastss  0x2cd6(%rip),%ymm11        # 5554 <_sk_callback_hsw+0x338>
+  .byte  196,98,125,24,29,14,47,0,0          // vbroadcastss  0x2f0e(%rip),%ymm11        # 577c <_sk_callback_hsw+0x338>
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
-  .byte  196,98,125,24,29,204,44,0,0         // vbroadcastss  0x2ccc(%rip),%ymm11        # 5558 <_sk_callback_hsw+0x33c>
+  .byte  196,98,125,24,29,4,47,0,0           // vbroadcastss  0x2f04(%rip),%ymm11        # 5780 <_sk_callback_hsw+0x33c>
   .byte  196,98,45,172,218                   // vfnmadd213ps  %ymm2,%ymm10,%ymm11
-  .byte  196,226,125,24,21,194,44,0,0        // vbroadcastss  0x2cc2(%rip),%ymm2        # 555c <_sk_callback_hsw+0x340>
+  .byte  196,226,125,24,21,250,46,0,0        // vbroadcastss  0x2efa(%rip),%ymm2        # 5784 <_sk_callback_hsw+0x340>
   .byte  196,193,108,92,210                  // vsubps        %ymm10,%ymm2,%ymm2
-  .byte  196,98,125,24,21,184,44,0,0         // vbroadcastss  0x2cb8(%rip),%ymm10        # 5560 <_sk_callback_hsw+0x344>
+  .byte  196,98,125,24,21,240,46,0,0         // vbroadcastss  0x2ef0(%rip),%ymm10        # 5788 <_sk_callback_hsw+0x344>
   .byte  197,172,94,210                      // vdivps        %ymm2,%ymm10,%ymm2
   .byte  197,164,88,210                      // vaddps        %ymm2,%ymm11,%ymm2
-  .byte  196,98,125,24,21,171,44,0,0         // vbroadcastss  0x2cab(%rip),%ymm10        # 5564 <_sk_callback_hsw+0x348>
+  .byte  196,98,125,24,21,227,46,0,0         // vbroadcastss  0x2ee3(%rip),%ymm10        # 578c <_sk_callback_hsw+0x348>
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  197,253,91,210                      // vcvtps2dq     %ymm2,%ymm2
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -13032,7 +13348,7 @@
   .byte  196,195,109,74,209,128              // vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,130,44,0,0          // vbroadcastss  0x2c82(%rip),%ymm8        # 5568 <_sk_callback_hsw+0x34c>
+  .byte  196,98,125,24,5,186,46,0,0          // vbroadcastss  0x2eba(%rip),%ymm8        # 5790 <_sk_callback_hsw+0x34c>
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13052,33 +13368,33 @@
   .byte  196,66,101,168,211                  // vfmadd213ps   %ymm11,%ymm3,%ymm10
   .byte  196,226,125,24,24                   // vbroadcastss  (%rax),%ymm3
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,58,44,0,0          // vbroadcastss  0x2c3a(%rip),%ymm12        # 556c <_sk_callback_hsw+0x350>
-  .byte  196,98,125,24,45,53,44,0,0          // vbroadcastss  0x2c35(%rip),%ymm13        # 5570 <_sk_callback_hsw+0x354>
+  .byte  196,98,125,24,37,114,46,0,0         // vbroadcastss  0x2e72(%rip),%ymm12        # 5794 <_sk_callback_hsw+0x350>
+  .byte  196,98,125,24,45,109,46,0,0         // vbroadcastss  0x2e6d(%rip),%ymm13        # 5798 <_sk_callback_hsw+0x354>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,43,44,0,0          // vbroadcastss  0x2c2b(%rip),%ymm13        # 5574 <_sk_callback_hsw+0x358>
+  .byte  196,98,125,24,45,99,46,0,0          // vbroadcastss  0x2e63(%rip),%ymm13        # 579c <_sk_callback_hsw+0x358>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,33,44,0,0          // vbroadcastss  0x2c21(%rip),%ymm13        # 5578 <_sk_callback_hsw+0x35c>
+  .byte  196,98,125,24,45,89,46,0,0          // vbroadcastss  0x2e59(%rip),%ymm13        # 57a0 <_sk_callback_hsw+0x35c>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,23,44,0,0          // vbroadcastss  0x2c17(%rip),%ymm11        # 557c <_sk_callback_hsw+0x360>
+  .byte  196,98,125,24,29,79,46,0,0          // vbroadcastss  0x2e4f(%rip),%ymm11        # 57a4 <_sk_callback_hsw+0x360>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,13,44,0,0          // vbroadcastss  0x2c0d(%rip),%ymm12        # 5580 <_sk_callback_hsw+0x364>
+  .byte  196,98,125,24,37,69,46,0,0          // vbroadcastss  0x2e45(%rip),%ymm12        # 57a8 <_sk_callback_hsw+0x364>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,3,44,0,0           // vbroadcastss  0x2c03(%rip),%ymm12        # 5584 <_sk_callback_hsw+0x368>
+  .byte  196,98,125,24,37,59,46,0,0          // vbroadcastss  0x2e3b(%rip),%ymm12        # 57ac <_sk_callback_hsw+0x368>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,100,89,218                  // vmulps        %ymm10,%ymm3,%ymm3
   .byte  196,99,125,8,211,1                  // vroundps      $0x1,%ymm3,%ymm10
   .byte  196,65,100,92,210                   // vsubps        %ymm10,%ymm3,%ymm10
-  .byte  196,98,125,24,29,228,43,0,0         // vbroadcastss  0x2be4(%rip),%ymm11        # 5588 <_sk_callback_hsw+0x36c>
+  .byte  196,98,125,24,29,28,46,0,0          // vbroadcastss  0x2e1c(%rip),%ymm11        # 57b0 <_sk_callback_hsw+0x36c>
   .byte  196,193,100,88,219                  // vaddps        %ymm11,%ymm3,%ymm3
-  .byte  196,98,125,24,29,218,43,0,0         // vbroadcastss  0x2bda(%rip),%ymm11        # 558c <_sk_callback_hsw+0x370>
+  .byte  196,98,125,24,29,18,46,0,0          // vbroadcastss  0x2e12(%rip),%ymm11        # 57b4 <_sk_callback_hsw+0x370>
   .byte  196,98,45,172,219                   // vfnmadd213ps  %ymm3,%ymm10,%ymm11
-  .byte  196,226,125,24,29,208,43,0,0        // vbroadcastss  0x2bd0(%rip),%ymm3        # 5590 <_sk_callback_hsw+0x374>
+  .byte  196,226,125,24,29,8,46,0,0          // vbroadcastss  0x2e08(%rip),%ymm3        # 57b8 <_sk_callback_hsw+0x374>
   .byte  196,193,100,92,218                  // vsubps        %ymm10,%ymm3,%ymm3
-  .byte  196,98,125,24,21,198,43,0,0         // vbroadcastss  0x2bc6(%rip),%ymm10        # 5594 <_sk_callback_hsw+0x378>
+  .byte  196,98,125,24,21,254,45,0,0         // vbroadcastss  0x2dfe(%rip),%ymm10        # 57bc <_sk_callback_hsw+0x378>
   .byte  197,172,94,219                      // vdivps        %ymm3,%ymm10,%ymm3
   .byte  197,164,88,219                      // vaddps        %ymm3,%ymm11,%ymm3
-  .byte  196,98,125,24,21,185,43,0,0         // vbroadcastss  0x2bb9(%rip),%ymm10        # 5598 <_sk_callback_hsw+0x37c>
+  .byte  196,98,125,24,21,241,45,0,0         // vbroadcastss  0x2df1(%rip),%ymm10        # 57c0 <_sk_callback_hsw+0x37c>
   .byte  196,193,100,89,218                  // vmulps        %ymm10,%ymm3,%ymm3
   .byte  197,253,91,219                      // vcvtps2dq     %ymm3,%ymm3
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -13086,7 +13402,7 @@
   .byte  196,195,101,74,217,128              // vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,100,95,216                  // vmaxps        %ymm8,%ymm3,%ymm3
-  .byte  196,98,125,24,5,144,43,0,0          // vbroadcastss  0x2b90(%rip),%ymm8        # 559c <_sk_callback_hsw+0x380>
+  .byte  196,98,125,24,5,200,45,0,0          // vbroadcastss  0x2dc8(%rip),%ymm8        # 57c4 <_sk_callback_hsw+0x380>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13095,26 +13411,26 @@
 .globl _sk_lab_to_xyz_hsw
 FUNCTION(_sk_lab_to_xyz_hsw)
 _sk_lab_to_xyz_hsw:
-  .byte  196,98,125,24,5,130,43,0,0          // vbroadcastss  0x2b82(%rip),%ymm8        # 55a0 <_sk_callback_hsw+0x384>
-  .byte  196,98,125,24,13,125,43,0,0         // vbroadcastss  0x2b7d(%rip),%ymm9        # 55a4 <_sk_callback_hsw+0x388>
-  .byte  196,98,125,24,21,120,43,0,0         // vbroadcastss  0x2b78(%rip),%ymm10        # 55a8 <_sk_callback_hsw+0x38c>
+  .byte  196,98,125,24,5,186,45,0,0          // vbroadcastss  0x2dba(%rip),%ymm8        # 57c8 <_sk_callback_hsw+0x384>
+  .byte  196,98,125,24,13,181,45,0,0         // vbroadcastss  0x2db5(%rip),%ymm9        # 57cc <_sk_callback_hsw+0x388>
+  .byte  196,98,125,24,21,176,45,0,0         // vbroadcastss  0x2db0(%rip),%ymm10        # 57d0 <_sk_callback_hsw+0x38c>
   .byte  196,194,53,168,202                  // vfmadd213ps   %ymm10,%ymm9,%ymm1
   .byte  196,194,53,168,210                  // vfmadd213ps   %ymm10,%ymm9,%ymm2
-  .byte  196,98,125,24,13,105,43,0,0         // vbroadcastss  0x2b69(%rip),%ymm9        # 55ac <_sk_callback_hsw+0x390>
+  .byte  196,98,125,24,13,161,45,0,0         // vbroadcastss  0x2da1(%rip),%ymm9        # 57d4 <_sk_callback_hsw+0x390>
   .byte  196,66,125,184,200                  // vfmadd231ps   %ymm8,%ymm0,%ymm9
-  .byte  196,226,125,24,5,95,43,0,0          // vbroadcastss  0x2b5f(%rip),%ymm0        # 55b0 <_sk_callback_hsw+0x394>
+  .byte  196,226,125,24,5,151,45,0,0         // vbroadcastss  0x2d97(%rip),%ymm0        # 57d8 <_sk_callback_hsw+0x394>
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
-  .byte  196,98,125,24,5,86,43,0,0           // vbroadcastss  0x2b56(%rip),%ymm8        # 55b4 <_sk_callback_hsw+0x398>
+  .byte  196,98,125,24,5,142,45,0,0          // vbroadcastss  0x2d8e(%rip),%ymm8        # 57dc <_sk_callback_hsw+0x398>
   .byte  196,98,117,168,192                  // vfmadd213ps   %ymm0,%ymm1,%ymm8
-  .byte  196,98,125,24,13,76,43,0,0          // vbroadcastss  0x2b4c(%rip),%ymm9        # 55b8 <_sk_callback_hsw+0x39c>
+  .byte  196,98,125,24,13,132,45,0,0         // vbroadcastss  0x2d84(%rip),%ymm9        # 57e0 <_sk_callback_hsw+0x39c>
   .byte  196,98,109,172,200                  // vfnmadd213ps  %ymm0,%ymm2,%ymm9
   .byte  196,193,60,89,200                   // vmulps        %ymm8,%ymm8,%ymm1
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
-  .byte  196,226,125,24,21,57,43,0,0         // vbroadcastss  0x2b39(%rip),%ymm2        # 55bc <_sk_callback_hsw+0x3a0>
+  .byte  196,226,125,24,21,113,45,0,0        // vbroadcastss  0x2d71(%rip),%ymm2        # 57e4 <_sk_callback_hsw+0x3a0>
   .byte  197,108,194,209,1                   // vcmpltps      %ymm1,%ymm2,%ymm10
-  .byte  196,98,125,24,29,47,43,0,0          // vbroadcastss  0x2b2f(%rip),%ymm11        # 55c0 <_sk_callback_hsw+0x3a4>
+  .byte  196,98,125,24,29,103,45,0,0         // vbroadcastss  0x2d67(%rip),%ymm11        # 57e8 <_sk_callback_hsw+0x3a4>
   .byte  196,65,60,88,195                    // vaddps        %ymm11,%ymm8,%ymm8
-  .byte  196,98,125,24,37,37,43,0,0          // vbroadcastss  0x2b25(%rip),%ymm12        # 55c4 <_sk_callback_hsw+0x3a8>
+  .byte  196,98,125,24,37,93,45,0,0          // vbroadcastss  0x2d5d(%rip),%ymm12        # 57ec <_sk_callback_hsw+0x3a8>
   .byte  196,65,60,89,196                    // vmulps        %ymm12,%ymm8,%ymm8
   .byte  196,99,61,74,193,160                // vblendvps     %ymm10,%ymm1,%ymm8,%ymm8
   .byte  197,252,89,200                      // vmulps        %ymm0,%ymm0,%ymm1
@@ -13129,9 +13445,9 @@
   .byte  196,65,52,88,203                    // vaddps        %ymm11,%ymm9,%ymm9
   .byte  196,65,52,89,204                    // vmulps        %ymm12,%ymm9,%ymm9
   .byte  196,227,53,74,208,32                // vblendvps     %ymm2,%ymm0,%ymm9,%ymm2
-  .byte  196,226,125,24,5,218,42,0,0         // vbroadcastss  0x2ada(%rip),%ymm0        # 55c8 <_sk_callback_hsw+0x3ac>
+  .byte  196,226,125,24,5,18,45,0,0          // vbroadcastss  0x2d12(%rip),%ymm0        # 57f0 <_sk_callback_hsw+0x3ac>
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
-  .byte  196,98,125,24,5,209,42,0,0          // vbroadcastss  0x2ad1(%rip),%ymm8        # 55cc <_sk_callback_hsw+0x3b0>
+  .byte  196,98,125,24,5,9,45,0,0            // vbroadcastss  0x2d09(%rip),%ymm8        # 57f4 <_sk_callback_hsw+0x3b0>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13143,12 +13459,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,52                              // jne           2b42 <_sk_load_a8_hsw+0x3e>
+  .byte  117,52                              // jne           2b32 <_sk_load_a8_hsw+0x3e>
   .byte  196,194,121,48,4,19                 // vpmovzxbw     (%r11,%rdx,1),%xmm0
-  .byte  197,249,219,5,68,47,0,0             // vpand         0x2f44(%rip),%xmm0,%xmm0        # 5a60 <_sk_callback_hsw+0x844>
+  .byte  197,249,219,5,180,50,0,0            // vpand         0x32b4(%rip),%xmm0,%xmm0        # 5dc0 <_sk_callback_hsw+0x97c>
   .byte  196,226,125,51,192                  // vpmovzxwd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,162,42,0,0        // vbroadcastss  0x2aa2(%rip),%ymm1        # 55d0 <_sk_callback_hsw+0x3b4>
+  .byte  196,226,125,24,13,218,44,0,0        // vbroadcastss  0x2cda(%rip),%ymm1        # 57f8 <_sk_callback_hsw+0x3b4>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -13160,15 +13476,15 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,190                             // ja            2b14 <_sk_load_a8_hsw+0x10>
+  .byte  119,190                             // ja            2b04 <_sk_load_a8_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,119,0,0,0                 // lea           0x77(%rip),%r10        # 2bd8 <_sk_load_a8_hsw+0xd4>
+  .byte  76,141,21,119,0,0,0                 // lea           0x77(%rip),%r10        # 2bc8 <_sk_load_a8_hsw+0xd4>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,159                             // jmp           2b14 <_sk_load_a8_hsw+0x10>
+  .byte  235,159                             // jmp           2b04 <_sk_load_a8_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,2                   // vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -13176,7 +13492,7 @@
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,119,255,255,255                 // jmpq          2b14 <_sk_load_a8_hsw+0x10>
+  .byte  233,119,255,255,255                 // jmpq          2b04 <_sk_load_a8_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,6                   // vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -13187,7 +13503,7 @@
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,60,255,255,255                  // jmpq          2b14 <_sk_load_a8_hsw+0x10>
+  .byte  233,60,255,255,255                  // jmpq          2b04 <_sk_load_a8_hsw+0x10>
   .byte  146                                 // xchg          %eax,%edx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -13215,12 +13531,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,52                              // jne           2c32 <_sk_load_a8_dst_hsw+0x3e>
+  .byte  117,52                              // jne           2c22 <_sk_load_a8_dst_hsw+0x3e>
   .byte  196,194,121,48,36,19                // vpmovzxbw     (%r11,%rdx,1),%xmm4
-  .byte  197,217,219,37,100,46,0,0           // vpand         0x2e64(%rip),%xmm4,%xmm4        # 5a70 <_sk_callback_hsw+0x854>
+  .byte  197,217,219,37,212,49,0,0           // vpand         0x31d4(%rip),%xmm4,%xmm4        # 5dd0 <_sk_callback_hsw+0x98c>
   .byte  196,226,125,51,228                  // vpmovzxwd     %xmm4,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,182,41,0,0        // vbroadcastss  0x29b6(%rip),%ymm5        # 55d4 <_sk_callback_hsw+0x3b8>
+  .byte  196,226,125,24,45,238,43,0,0        // vbroadcastss  0x2bee(%rip),%ymm5        # 57fc <_sk_callback_hsw+0x3b8>
   .byte  197,220,89,253                      // vmulps        %ymm5,%ymm4,%ymm7
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,220,87,228                      // vxorps        %ymm4,%ymm4,%ymm4
@@ -13232,15 +13548,15 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,190                             // ja            2c04 <_sk_load_a8_dst_hsw+0x10>
+  .byte  119,190                             // ja            2bf4 <_sk_load_a8_dst_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,119,0,0,0                 // lea           0x77(%rip),%r10        # 2cc8 <_sk_load_a8_dst_hsw+0xd4>
+  .byte  76,141,21,119,0,0,0                 // lea           0x77(%rip),%r10        # 2cb8 <_sk_load_a8_dst_hsw+0xd4>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,159                             // jmp           2c04 <_sk_load_a8_dst_hsw+0x10>
+  .byte  235,159                             // jmp           2bf4 <_sk_load_a8_dst_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,2                   // vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -13248,7 +13564,7 @@
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,119,255,255,255                 // jmpq          2c04 <_sk_load_a8_dst_hsw+0x10>
+  .byte  233,119,255,255,255                 // jmpq          2bf4 <_sk_load_a8_dst_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,6                   // vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -13259,7 +13575,7 @@
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,60,255,255,255                  // jmpq          2c04 <_sk_load_a8_dst_hsw+0x10>
+  .byte  233,60,255,255,255                  // jmpq          2bf4 <_sk_load_a8_dst_hsw+0x10>
   .byte  146                                 // xchg          %eax,%edx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -13320,7 +13636,7 @@
   .byte  196,227,121,32,192,7                // vpinsrb       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,49,192                  // vpmovzxbd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,62,40,0,0         // vbroadcastss  0x283e(%rip),%ymm1        # 55d8 <_sk_callback_hsw+0x3bc>
+  .byte  196,226,125,24,13,118,42,0,0        // vbroadcastss  0x2a76(%rip),%ymm1        # 5800 <_sk_callback_hsw+0x3bc>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -13334,14 +13650,14 @@
 _sk_store_a8_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,32,40,0,0           // vbroadcastss  0x2820(%rip),%ymm8        # 55dc <_sk_callback_hsw+0x3c0>
+  .byte  196,98,125,24,5,88,42,0,0           // vbroadcastss  0x2a58(%rip),%ymm8        # 5804 <_sk_callback_hsw+0x3c0>
   .byte  196,65,100,89,192                   // vmulps        %ymm8,%ymm3,%ymm8
   .byte  196,65,125,91,192                   // vcvtps2dq     %ymm8,%ymm8
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  196,65,57,103,192                   // vpackuswb     %xmm8,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           2de5 <_sk_store_a8_hsw+0x37>
+  .byte  117,10                              // jne           2dd5 <_sk_store_a8_hsw+0x37>
   .byte  196,65,123,17,4,19                  // vmovsd        %xmm8,(%r11,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13349,25 +13665,25 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            2de1 <_sk_store_a8_hsw+0x33>
+  .byte  119,236                             // ja            2dd1 <_sk_store_a8_hsw+0x33>
   .byte  196,66,121,48,192                   // vpmovzxbw     %xmm8,%xmm8
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,87,0,0,0                  // lea           0x57(%rip),%r10        # 2e5c <_sk_store_a8_hsw+0xae>
+  .byte  76,141,21,87,0,0,0                  // lea           0x57(%rip),%r10        # 2e4c <_sk_store_a8_hsw+0xae>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,20,4,19,0                // vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,202                             // jmp           2de1 <_sk_store_a8_hsw+0x33>
+  .byte  235,202                             // jmp           2dd1 <_sk_store_a8_hsw+0x33>
   .byte  196,67,121,20,68,19,2,4             // vpextrb       $0x4,%xmm8,0x2(%r11,%rdx,1)
-  .byte  196,98,57,0,5,88,44,0,0             // vpshufb       0x2c58(%rip),%xmm8,%xmm8        # 5a80 <_sk_callback_hsw+0x864>
+  .byte  196,98,57,0,5,200,47,0,0            // vpshufb       0x2fc8(%rip),%xmm8,%xmm8        # 5de0 <_sk_callback_hsw+0x99c>
   .byte  196,67,121,21,4,19,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,176                             // jmp           2de1 <_sk_store_a8_hsw+0x33>
+  .byte  235,176                             // jmp           2dd1 <_sk_store_a8_hsw+0x33>
   .byte  196,67,121,20,68,19,6,12            // vpextrb       $0xc,%xmm8,0x6(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,5,10            // vpextrb       $0xa,%xmm8,0x5(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,4,8             // vpextrb       $0x8,%xmm8,0x4(%r11,%rdx,1)
-  .byte  196,98,57,0,5,62,44,0,0             // vpshufb       0x2c3e(%rip),%xmm8,%xmm8        # 5a90 <_sk_callback_hsw+0x874>
+  .byte  196,98,57,0,5,174,47,0,0            // vpshufb       0x2fae(%rip),%xmm8,%xmm8        # 5df0 <_sk_callback_hsw+0x9ac>
   .byte  196,65,121,126,4,19                 // vmovd         %xmm8,(%r11,%rdx,1)
-  .byte  235,135                             // jmp           2de1 <_sk_store_a8_hsw+0x33>
+  .byte  235,135                             // jmp           2dd1 <_sk_store_a8_hsw+0x33>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  178,255                             // mov           $0xff,%dl
   .byte  255                                 // (bad)
@@ -13396,15 +13712,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,57                              // jne           2ebb <_sk_load_g8_hsw+0x43>
+  .byte  117,57                              // jne           2eab <_sk_load_g8_hsw+0x43>
   .byte  196,194,121,48,4,19                 // vpmovzxbw     (%r11,%rdx,1),%xmm0
-  .byte  197,249,219,5,16,44,0,0             // vpand         0x2c10(%rip),%xmm0,%xmm0        # 5aa0 <_sk_callback_hsw+0x884>
+  .byte  197,249,219,5,128,47,0,0            // vpand         0x2f80(%rip),%xmm0,%xmm0        # 5e00 <_sk_callback_hsw+0x9bc>
   .byte  196,226,125,51,192                  // vpmovzxwd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,62,39,0,0         // vbroadcastss  0x273e(%rip),%ymm1        # 55e0 <_sk_callback_hsw+0x3c4>
+  .byte  196,226,125,24,13,118,41,0,0        // vbroadcastss  0x2976(%rip),%ymm1        # 5808 <_sk_callback_hsw+0x3c4>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,51,39,0,0         // vbroadcastss  0x2733(%rip),%ymm3        # 55e4 <_sk_callback_hsw+0x3c8>
+  .byte  196,226,125,24,29,107,41,0,0        // vbroadcastss  0x296b(%rip),%ymm3        # 580c <_sk_callback_hsw+0x3c8>
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  255,224                             // jmpq          *%rax
@@ -13413,15 +13729,15 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,185                             // ja            2e88 <_sk_load_g8_hsw+0x10>
+  .byte  119,185                             // ja            2e78 <_sk_load_g8_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 2f54 <_sk_load_g8_hsw+0xdc>
+  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 2f44 <_sk_load_g8_hsw+0xdc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,154                             // jmp           2e88 <_sk_load_g8_hsw+0x10>
+  .byte  235,154                             // jmp           2e78 <_sk_load_g8_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,2                   // vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -13429,7 +13745,7 @@
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,114,255,255,255                 // jmpq          2e88 <_sk_load_g8_hsw+0x10>
+  .byte  233,114,255,255,255                 // jmpq          2e78 <_sk_load_g8_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,6                   // vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -13440,7 +13756,7 @@
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,55,255,255,255                  // jmpq          2e88 <_sk_load_g8_hsw+0x10>
+  .byte  233,55,255,255,255                  // jmpq          2e78 <_sk_load_g8_hsw+0x10>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  143                                 // (bad)
   .byte  255                                 // (bad)
@@ -13469,15 +13785,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,57                              // jne           2fb3 <_sk_load_g8_dst_hsw+0x43>
+  .byte  117,57                              // jne           2fa3 <_sk_load_g8_dst_hsw+0x43>
   .byte  196,194,121,48,36,19                // vpmovzxbw     (%r11,%rdx,1),%xmm4
-  .byte  197,217,219,37,40,43,0,0            // vpand         0x2b28(%rip),%xmm4,%xmm4        # 5ab0 <_sk_callback_hsw+0x894>
+  .byte  197,217,219,37,152,46,0,0           // vpand         0x2e98(%rip),%xmm4,%xmm4        # 5e10 <_sk_callback_hsw+0x9cc>
   .byte  196,226,125,51,228                  // vpmovzxwd     %xmm4,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,78,38,0,0         // vbroadcastss  0x264e(%rip),%ymm5        # 55e8 <_sk_callback_hsw+0x3cc>
+  .byte  196,226,125,24,45,134,40,0,0        // vbroadcastss  0x2886(%rip),%ymm5        # 5810 <_sk_callback_hsw+0x3cc>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,61,67,38,0,0         // vbroadcastss  0x2643(%rip),%ymm7        # 55ec <_sk_callback_hsw+0x3d0>
+  .byte  196,226,125,24,61,123,40,0,0        // vbroadcastss  0x287b(%rip),%ymm7        # 5814 <_sk_callback_hsw+0x3d0>
   .byte  197,252,40,236                      // vmovaps       %ymm4,%ymm5
   .byte  197,252,40,244                      // vmovaps       %ymm4,%ymm6
   .byte  255,224                             // jmpq          *%rax
@@ -13486,15 +13802,15 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,185                             // ja            2f80 <_sk_load_g8_dst_hsw+0x10>
+  .byte  119,185                             // ja            2f70 <_sk_load_g8_dst_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 304c <_sk_load_g8_dst_hsw+0xdc>
+  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 303c <_sk_load_g8_dst_hsw+0xdc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,154                             // jmp           2f80 <_sk_load_g8_dst_hsw+0x10>
+  .byte  235,154                             // jmp           2f70 <_sk_load_g8_dst_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,2                   // vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -13502,7 +13818,7 @@
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,114,255,255,255                 // jmpq          2f80 <_sk_load_g8_dst_hsw+0x10>
+  .byte  233,114,255,255,255                 // jmpq          2f70 <_sk_load_g8_dst_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,6                   // vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -13513,7 +13829,7 @@
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,55,255,255,255                  // jmpq          2f80 <_sk_load_g8_dst_hsw+0x10>
+  .byte  233,55,255,255,255                  // jmpq          2f70 <_sk_load_g8_dst_hsw+0x10>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  143                                 // (bad)
   .byte  255                                 // (bad)
@@ -13575,10 +13891,10 @@
   .byte  196,227,121,32,192,7                // vpinsrb       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,49,192                  // vpmovzxbd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,210,36,0,0        // vbroadcastss  0x24d2(%rip),%ymm1        # 55f0 <_sk_callback_hsw+0x3d4>
+  .byte  196,226,125,24,13,10,39,0,0         // vbroadcastss  0x270a(%rip),%ymm1        # 5818 <_sk_callback_hsw+0x3d4>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,199,36,0,0        // vbroadcastss  0x24c7(%rip),%ymm3        # 55f4 <_sk_callback_hsw+0x3d8>
+  .byte  196,226,125,24,29,255,38,0,0        // vbroadcastss  0x26ff(%rip),%ymm3        # 581c <_sk_callback_hsw+0x3d8>
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  255,224                             // jmpq          *%rax
@@ -13590,9 +13906,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,193                          // mov           %rax,%r9
   .byte  77,133,201                          // test          %r9,%r9
-  .byte  116,5                               // je            3146 <_sk_gather_i8_hsw+0xf>
+  .byte  116,5                               // je            3136 <_sk_gather_i8_hsw+0xf>
   .byte  76,137,200                          // mov           %r9,%rax
-  .byte  235,2                               // jmp           3148 <_sk_gather_i8_hsw+0x11>
+  .byte  235,2                               // jmp           3138 <_sk_gather_i8_hsw+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  83                                  // push          %rbx
   .byte  76,139,16                           // mov           (%rax),%r10
@@ -13626,14 +13942,14 @@
   .byte  73,139,65,8                         // mov           0x8(%r9),%rax
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,226,117,144,28,128              // vpgatherdd    %ymm1,(%rax,%ymm0,4),%ymm3
-  .byte  197,229,219,5,179,38,0,0            // vpand         0x26b3(%rip),%ymm3,%ymm0        # 58a0 <_sk_callback_hsw+0x684>
+  .byte  197,229,219,5,3,41,0,0              // vpand         0x2903(%rip),%ymm3,%ymm0        # 5ae0 <_sk_callback_hsw+0x69c>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,254,35,0,0          // vbroadcastss  0x23fe(%rip),%ymm8        # 55f8 <_sk_callback_hsw+0x3dc>
+  .byte  196,98,125,24,5,54,38,0,0           // vbroadcastss  0x2636(%rip),%ymm8        # 5820 <_sk_callback_hsw+0x3dc>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,226,101,0,13,184,38,0,0         // vpshufb       0x26b8(%rip),%ymm3,%ymm1        # 58c0 <_sk_callback_hsw+0x6a4>
+  .byte  196,226,101,0,13,8,41,0,0           // vpshufb       0x2908(%rip),%ymm3,%ymm1        # 5b00 <_sk_callback_hsw+0x6bc>
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,226,101,0,21,198,38,0,0         // vpshufb       0x26c6(%rip),%ymm3,%ymm2        # 58e0 <_sk_callback_hsw+0x6c4>
+  .byte  196,226,101,0,21,22,41,0,0          // vpshufb       0x2916(%rip),%ymm3,%ymm2        # 5b20 <_sk_callback_hsw+0x6dc>
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -13650,53 +13966,53 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,114                             // jne           32b2 <_sk_load_565_hsw+0x7c>
+  .byte  117,114                             // jne           32a2 <_sk_load_565_hsw+0x7c>
   .byte  196,193,122,111,4,83                // vmovdqu       (%r11,%rdx,2),%xmm0
   .byte  196,226,125,51,208                  // vpmovzxwd     %xmm0,%ymm2
-  .byte  196,226,125,88,5,168,35,0,0         // vpbroadcastd  0x23a8(%rip),%ymm0        # 55fc <_sk_callback_hsw+0x3e0>
+  .byte  196,226,125,88,5,224,37,0,0         // vpbroadcastd  0x25e0(%rip),%ymm0        # 5824 <_sk_callback_hsw+0x3e0>
   .byte  197,237,219,192                     // vpand         %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,155,35,0,0        // vbroadcastss  0x239b(%rip),%ymm1        # 5600 <_sk_callback_hsw+0x3e4>
+  .byte  196,226,125,24,13,211,37,0,0        // vbroadcastss  0x25d3(%rip),%ymm1        # 5828 <_sk_callback_hsw+0x3e4>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,146,35,0,0        // vpbroadcastd  0x2392(%rip),%ymm1        # 5604 <_sk_callback_hsw+0x3e8>
+  .byte  196,226,125,88,13,202,37,0,0        // vpbroadcastd  0x25ca(%rip),%ymm1        # 582c <_sk_callback_hsw+0x3e8>
   .byte  197,237,219,201                     // vpand         %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,133,35,0,0        // vbroadcastss  0x2385(%rip),%ymm3        # 5608 <_sk_callback_hsw+0x3ec>
+  .byte  196,226,125,24,29,189,37,0,0        // vbroadcastss  0x25bd(%rip),%ymm3        # 5830 <_sk_callback_hsw+0x3ec>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,88,29,124,35,0,0        // vpbroadcastd  0x237c(%rip),%ymm3        # 560c <_sk_callback_hsw+0x3f0>
+  .byte  196,226,125,88,29,180,37,0,0        // vpbroadcastd  0x25b4(%rip),%ymm3        # 5834 <_sk_callback_hsw+0x3f0>
   .byte  197,237,219,211                     // vpand         %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,111,35,0,0        // vbroadcastss  0x236f(%rip),%ymm3        # 5610 <_sk_callback_hsw+0x3f4>
+  .byte  196,226,125,24,29,167,37,0,0        // vbroadcastss  0x25a7(%rip),%ymm3        # 5838 <_sk_callback_hsw+0x3f4>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,100,35,0,0        // vbroadcastss  0x2364(%rip),%ymm3        # 5614 <_sk_callback_hsw+0x3f8>
+  .byte  196,226,125,24,29,156,37,0,0        // vbroadcastss  0x259c(%rip),%ymm3        # 583c <_sk_callback_hsw+0x3f8>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,128                             // ja            3246 <_sk_load_565_hsw+0x10>
+  .byte  119,128                             // ja            3236 <_sk_load_565_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 3334 <_sk_load_565_hsw+0xfe>
+  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 3324 <_sk_load_565_hsw+0xfe>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  233,94,255,255,255                  // jmpq          3246 <_sk_load_565_hsw+0x10>
+  .byte  233,94,255,255,255                  // jmpq          3236 <_sk_load_565_hsw+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,110,12,83               // vmovd         (%r11,%rdx,2),%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,65,255,255,255                  // jmpq          3246 <_sk_load_565_hsw+0x10>
+  .byte  233,65,255,255,255                  // jmpq          3236 <_sk_load_565_hsw+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,122,126,12,83               // vmovq         (%r11,%rdx,2),%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,20,255,255,255                  // jmpq          3246 <_sk_load_565_hsw+0x10>
+  .byte  233,20,255,255,255                  // jmpq          3236 <_sk_load_565_hsw+0x10>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  166                                 // cmpsb         %es:(%rdi),%ds:(%rsi)
   .byte  255                                 // (bad)
@@ -13724,53 +14040,53 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,114                             // jne           33cc <_sk_load_565_dst_hsw+0x7c>
+  .byte  117,114                             // jne           33bc <_sk_load_565_dst_hsw+0x7c>
   .byte  196,193,122,111,36,83               // vmovdqu       (%r11,%rdx,2),%xmm4
   .byte  196,226,125,51,244                  // vpmovzxwd     %xmm4,%ymm6
-  .byte  196,226,125,88,37,170,34,0,0        // vpbroadcastd  0x22aa(%rip),%ymm4        # 5618 <_sk_callback_hsw+0x3fc>
+  .byte  196,226,125,88,37,226,36,0,0        // vpbroadcastd  0x24e2(%rip),%ymm4        # 5840 <_sk_callback_hsw+0x3fc>
   .byte  197,205,219,228                     // vpand         %ymm4,%ymm6,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,157,34,0,0        // vbroadcastss  0x229d(%rip),%ymm5        # 561c <_sk_callback_hsw+0x400>
+  .byte  196,226,125,24,45,213,36,0,0        // vbroadcastss  0x24d5(%rip),%ymm5        # 5844 <_sk_callback_hsw+0x400>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
-  .byte  196,226,125,88,45,148,34,0,0        // vpbroadcastd  0x2294(%rip),%ymm5        # 5620 <_sk_callback_hsw+0x404>
+  .byte  196,226,125,88,45,204,36,0,0        // vpbroadcastd  0x24cc(%rip),%ymm5        # 5848 <_sk_callback_hsw+0x404>
   .byte  197,205,219,237                     // vpand         %ymm5,%ymm6,%ymm5
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,226,125,24,61,135,34,0,0        // vbroadcastss  0x2287(%rip),%ymm7        # 5624 <_sk_callback_hsw+0x408>
+  .byte  196,226,125,24,61,191,36,0,0        // vbroadcastss  0x24bf(%rip),%ymm7        # 584c <_sk_callback_hsw+0x408>
   .byte  197,212,89,239                      // vmulps        %ymm7,%ymm5,%ymm5
-  .byte  196,226,125,88,61,126,34,0,0        // vpbroadcastd  0x227e(%rip),%ymm7        # 5628 <_sk_callback_hsw+0x40c>
+  .byte  196,226,125,88,61,182,36,0,0        // vpbroadcastd  0x24b6(%rip),%ymm7        # 5850 <_sk_callback_hsw+0x40c>
   .byte  197,205,219,247                     // vpand         %ymm7,%ymm6,%ymm6
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
-  .byte  196,226,125,24,61,113,34,0,0        // vbroadcastss  0x2271(%rip),%ymm7        # 562c <_sk_callback_hsw+0x410>
+  .byte  196,226,125,24,61,169,36,0,0        // vbroadcastss  0x24a9(%rip),%ymm7        # 5854 <_sk_callback_hsw+0x410>
   .byte  197,204,89,247                      // vmulps        %ymm7,%ymm6,%ymm6
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,61,102,34,0,0        // vbroadcastss  0x2266(%rip),%ymm7        # 5630 <_sk_callback_hsw+0x414>
+  .byte  196,226,125,24,61,158,36,0,0        // vbroadcastss  0x249e(%rip),%ymm7        # 5858 <_sk_callback_hsw+0x414>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,128                             // ja            3360 <_sk_load_565_dst_hsw+0x10>
+  .byte  119,128                             // ja            3350 <_sk_load_565_dst_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 344c <_sk_load_565_dst_hsw+0xfc>
+  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 343c <_sk_load_565_dst_hsw+0xfc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  233,94,255,255,255                  // jmpq          3360 <_sk_load_565_dst_hsw+0x10>
+  .byte  233,94,255,255,255                  // jmpq          3350 <_sk_load_565_dst_hsw+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,121,110,44,83               // vmovd         (%r11,%rdx,2),%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,65,255,255,255                  // jmpq          3360 <_sk_load_565_dst_hsw+0x10>
+  .byte  233,65,255,255,255                  // jmpq          3350 <_sk_load_565_dst_hsw+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,122,126,44,83               // vmovq         (%r11,%rdx,2),%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,20,255,255,255                  // jmpq          3360 <_sk_load_565_dst_hsw+0x10>
+  .byte  233,20,255,255,255                  // jmpq          3350 <_sk_load_565_dst_hsw+0x10>
   .byte  168,255                             // test          $0xff,%al
   .byte  255                                 // (bad)
   .byte  255,194                             // inc           %edx
@@ -13831,23 +14147,23 @@
   .byte  67,15,183,4,89                      // movzwl        (%r9,%r11,2),%eax
   .byte  197,249,196,192,7                   // vpinsrw       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,51,208                  // vpmovzxwd     %xmm0,%ymm2
-  .byte  196,226,125,88,5,27,33,0,0          // vpbroadcastd  0x211b(%rip),%ymm0        # 5634 <_sk_callback_hsw+0x418>
+  .byte  196,226,125,88,5,83,35,0,0          // vpbroadcastd  0x2353(%rip),%ymm0        # 585c <_sk_callback_hsw+0x418>
   .byte  197,237,219,192                     // vpand         %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,14,33,0,0         // vbroadcastss  0x210e(%rip),%ymm1        # 5638 <_sk_callback_hsw+0x41c>
+  .byte  196,226,125,24,13,70,35,0,0         // vbroadcastss  0x2346(%rip),%ymm1        # 5860 <_sk_callback_hsw+0x41c>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,5,33,0,0          // vpbroadcastd  0x2105(%rip),%ymm1        # 563c <_sk_callback_hsw+0x420>
+  .byte  196,226,125,88,13,61,35,0,0         // vpbroadcastd  0x233d(%rip),%ymm1        # 5864 <_sk_callback_hsw+0x420>
   .byte  197,237,219,201                     // vpand         %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,248,32,0,0        // vbroadcastss  0x20f8(%rip),%ymm3        # 5640 <_sk_callback_hsw+0x424>
+  .byte  196,226,125,24,29,48,35,0,0         // vbroadcastss  0x2330(%rip),%ymm3        # 5868 <_sk_callback_hsw+0x424>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,88,29,239,32,0,0        // vpbroadcastd  0x20ef(%rip),%ymm3        # 5644 <_sk_callback_hsw+0x428>
+  .byte  196,226,125,88,29,39,35,0,0         // vpbroadcastd  0x2327(%rip),%ymm3        # 586c <_sk_callback_hsw+0x428>
   .byte  197,237,219,211                     // vpand         %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,226,32,0,0        // vbroadcastss  0x20e2(%rip),%ymm3        # 5648 <_sk_callback_hsw+0x42c>
+  .byte  196,226,125,24,29,26,35,0,0         // vbroadcastss  0x231a(%rip),%ymm3        # 5870 <_sk_callback_hsw+0x42c>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,215,32,0,0        // vbroadcastss  0x20d7(%rip),%ymm3        # 564c <_sk_callback_hsw+0x430>
+  .byte  196,226,125,24,29,15,35,0,0         // vbroadcastss  0x230f(%rip),%ymm3        # 5874 <_sk_callback_hsw+0x430>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_store_565_hsw
@@ -13856,11 +14172,11 @@
 _sk_store_565_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,203,32,0,0          // vbroadcastss  0x20cb(%rip),%ymm8        # 5650 <_sk_callback_hsw+0x434>
+  .byte  196,98,125,24,5,3,35,0,0            // vbroadcastss  0x2303(%rip),%ymm8        # 5878 <_sk_callback_hsw+0x434>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,53,114,241,11               // vpslld        $0xb,%ymm9,%ymm9
-  .byte  196,98,125,24,21,182,32,0,0         // vbroadcastss  0x20b6(%rip),%ymm10        # 5654 <_sk_callback_hsw+0x438>
+  .byte  196,98,125,24,21,238,34,0,0         // vbroadcastss  0x22ee(%rip),%ymm10        # 587c <_sk_callback_hsw+0x438>
   .byte  196,65,116,89,210                   // vmulps        %ymm10,%ymm1,%ymm10
   .byte  196,65,125,91,210                   // vcvtps2dq     %ymm10,%ymm10
   .byte  196,193,45,114,242,5                // vpslld        $0x5,%ymm10,%ymm10
@@ -13871,7 +14187,7 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           35dc <_sk_store_565_hsw+0x65>
+  .byte  117,10                              // jne           35cc <_sk_store_565_hsw+0x65>
   .byte  196,65,122,127,4,83                 // vmovdqu       %xmm8,(%r11,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13879,22 +14195,22 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            35d8 <_sk_store_565_hsw+0x61>
+  .byte  119,236                             // ja            35c8 <_sk_store_565_hsw+0x61>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,69,0,0,0                  // lea           0x45(%rip),%r10        # 363c <_sk_store_565_hsw+0xc5>
+  .byte  76,141,21,69,0,0,0                  // lea           0x45(%rip),%r10        # 362c <_sk_store_565_hsw+0xc5>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,21,4,83,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  .byte  235,207                             // jmp           35d8 <_sk_store_565_hsw+0x61>
+  .byte  235,207                             // jmp           35c8 <_sk_store_565_hsw+0x61>
   .byte  196,67,121,21,68,83,4,2             // vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   .byte  196,65,121,126,4,83                 // vmovd         %xmm8,(%r11,%rdx,2)
-  .byte  235,191                             // jmp           35d8 <_sk_store_565_hsw+0x61>
+  .byte  235,191                             // jmp           35c8 <_sk_store_565_hsw+0x61>
   .byte  196,67,121,21,68,83,12,6            // vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,10,5            // vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,8,4             // vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   .byte  196,65,121,214,4,83                 // vmovq         %xmm8,(%r11,%rdx,2)
-  .byte  235,159                             // jmp           35d8 <_sk_store_565_hsw+0x61>
+  .byte  235,159                             // jmp           35c8 <_sk_store_565_hsw+0x61>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  196                                 // (bad)
   .byte  255                                 // (bad)
@@ -13927,28 +14243,28 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,138,0,0,0                    // jne           36f0 <_sk_load_4444_hsw+0x98>
+  .byte  15,133,138,0,0,0                    // jne           36e0 <_sk_load_4444_hsw+0x98>
   .byte  196,193,122,111,4,83                // vmovdqu       (%r11,%rdx,2),%xmm0
   .byte  196,226,125,51,216                  // vpmovzxwd     %xmm0,%ymm3
-  .byte  196,226,125,88,5,222,31,0,0         // vpbroadcastd  0x1fde(%rip),%ymm0        # 5658 <_sk_callback_hsw+0x43c>
+  .byte  196,226,125,88,5,22,34,0,0          // vpbroadcastd  0x2216(%rip),%ymm0        # 5880 <_sk_callback_hsw+0x43c>
   .byte  197,229,219,192                     // vpand         %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,209,31,0,0        // vbroadcastss  0x1fd1(%rip),%ymm1        # 565c <_sk_callback_hsw+0x440>
+  .byte  196,226,125,24,13,9,34,0,0          // vbroadcastss  0x2209(%rip),%ymm1        # 5884 <_sk_callback_hsw+0x440>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,200,31,0,0        // vpbroadcastd  0x1fc8(%rip),%ymm1        # 5660 <_sk_callback_hsw+0x444>
+  .byte  196,226,125,88,13,0,34,0,0          // vpbroadcastd  0x2200(%rip),%ymm1        # 5888 <_sk_callback_hsw+0x444>
   .byte  197,229,219,201                     // vpand         %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,187,31,0,0        // vbroadcastss  0x1fbb(%rip),%ymm2        # 5664 <_sk_callback_hsw+0x448>
+  .byte  196,226,125,24,21,243,33,0,0        // vbroadcastss  0x21f3(%rip),%ymm2        # 588c <_sk_callback_hsw+0x448>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,88,21,178,31,0,0        // vpbroadcastd  0x1fb2(%rip),%ymm2        # 5668 <_sk_callback_hsw+0x44c>
+  .byte  196,226,125,88,21,234,33,0,0        // vpbroadcastd  0x21ea(%rip),%ymm2        # 5890 <_sk_callback_hsw+0x44c>
   .byte  197,229,219,210                     // vpand         %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,165,31,0,0          // vbroadcastss  0x1fa5(%rip),%ymm8        # 566c <_sk_callback_hsw+0x450>
+  .byte  196,98,125,24,5,221,33,0,0          // vbroadcastss  0x21dd(%rip),%ymm8        # 5894 <_sk_callback_hsw+0x450>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,88,5,155,31,0,0          // vpbroadcastd  0x1f9b(%rip),%ymm8        # 5670 <_sk_callback_hsw+0x454>
+  .byte  196,98,125,88,5,211,33,0,0          // vpbroadcastd  0x21d3(%rip),%ymm8        # 5898 <_sk_callback_hsw+0x454>
   .byte  196,193,101,219,216                 // vpand         %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,141,31,0,0          // vbroadcastss  0x1f8d(%rip),%ymm8        # 5674 <_sk_callback_hsw+0x458>
+  .byte  196,98,125,24,5,197,33,0,0          // vbroadcastss  0x21c5(%rip),%ymm8        # 589c <_sk_callback_hsw+0x458>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13957,27 +14273,27 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,100,255,255,255              // ja            366c <_sk_load_4444_hsw+0x14>
+  .byte  15,135,100,255,255,255              // ja            365c <_sk_load_4444_hsw+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 3774 <_sk_load_4444_hsw+0x11c>
+  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 3764 <_sk_load_4444_hsw+0x11c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  233,66,255,255,255                  // jmpq          366c <_sk_load_4444_hsw+0x14>
+  .byte  233,66,255,255,255                  // jmpq          365c <_sk_load_4444_hsw+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,110,12,83               // vmovd         (%r11,%rdx,2),%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,37,255,255,255                  // jmpq          366c <_sk_load_4444_hsw+0x14>
+  .byte  233,37,255,255,255                  // jmpq          365c <_sk_load_4444_hsw+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,122,126,12,83               // vmovq         (%r11,%rdx,2),%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,248,254,255,255                 // jmpq          366c <_sk_load_4444_hsw+0x14>
+  .byte  233,248,254,255,255                 // jmpq          365c <_sk_load_4444_hsw+0x14>
   .byte  168,255                             // test          $0xff,%al
   .byte  255                                 // (bad)
   .byte  255,194                             // inc           %edx
@@ -14004,28 +14320,28 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,138,0,0,0                    // jne           3828 <_sk_load_4444_dst_hsw+0x98>
+  .byte  15,133,138,0,0,0                    // jne           3818 <_sk_load_4444_dst_hsw+0x98>
   .byte  196,193,122,111,36,83               // vmovdqu       (%r11,%rdx,2),%xmm4
   .byte  196,226,125,51,252                  // vpmovzxwd     %xmm4,%ymm7
-  .byte  196,226,125,88,37,198,30,0,0        // vpbroadcastd  0x1ec6(%rip),%ymm4        # 5678 <_sk_callback_hsw+0x45c>
+  .byte  196,226,125,88,37,254,32,0,0        // vpbroadcastd  0x20fe(%rip),%ymm4        # 58a0 <_sk_callback_hsw+0x45c>
   .byte  197,197,219,228                     // vpand         %ymm4,%ymm7,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,185,30,0,0        // vbroadcastss  0x1eb9(%rip),%ymm5        # 567c <_sk_callback_hsw+0x460>
+  .byte  196,226,125,24,45,241,32,0,0        // vbroadcastss  0x20f1(%rip),%ymm5        # 58a4 <_sk_callback_hsw+0x460>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
-  .byte  196,226,125,88,45,176,30,0,0        // vpbroadcastd  0x1eb0(%rip),%ymm5        # 5680 <_sk_callback_hsw+0x464>
+  .byte  196,226,125,88,45,232,32,0,0        // vpbroadcastd  0x20e8(%rip),%ymm5        # 58a8 <_sk_callback_hsw+0x464>
   .byte  197,197,219,237                     // vpand         %ymm5,%ymm7,%ymm5
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,226,125,24,53,163,30,0,0        // vbroadcastss  0x1ea3(%rip),%ymm6        # 5684 <_sk_callback_hsw+0x468>
+  .byte  196,226,125,24,53,219,32,0,0        // vbroadcastss  0x20db(%rip),%ymm6        # 58ac <_sk_callback_hsw+0x468>
   .byte  197,212,89,238                      // vmulps        %ymm6,%ymm5,%ymm5
-  .byte  196,226,125,88,53,154,30,0,0        // vpbroadcastd  0x1e9a(%rip),%ymm6        # 5688 <_sk_callback_hsw+0x46c>
+  .byte  196,226,125,88,53,210,32,0,0        // vpbroadcastd  0x20d2(%rip),%ymm6        # 58b0 <_sk_callback_hsw+0x46c>
   .byte  197,197,219,246                     // vpand         %ymm6,%ymm7,%ymm6
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
-  .byte  196,98,125,24,5,141,30,0,0          // vbroadcastss  0x1e8d(%rip),%ymm8        # 568c <_sk_callback_hsw+0x470>
+  .byte  196,98,125,24,5,197,32,0,0          // vbroadcastss  0x20c5(%rip),%ymm8        # 58b4 <_sk_callback_hsw+0x470>
   .byte  196,193,76,89,240                   // vmulps        %ymm8,%ymm6,%ymm6
-  .byte  196,98,125,88,5,131,30,0,0          // vpbroadcastd  0x1e83(%rip),%ymm8        # 5690 <_sk_callback_hsw+0x474>
+  .byte  196,98,125,88,5,187,32,0,0          // vpbroadcastd  0x20bb(%rip),%ymm8        # 58b8 <_sk_callback_hsw+0x474>
   .byte  196,193,69,219,248                  // vpand         %ymm8,%ymm7,%ymm7
   .byte  197,252,91,255                      // vcvtdq2ps     %ymm7,%ymm7
-  .byte  196,98,125,24,5,117,30,0,0          // vbroadcastss  0x1e75(%rip),%ymm8        # 5694 <_sk_callback_hsw+0x478>
+  .byte  196,98,125,24,5,173,32,0,0          // vbroadcastss  0x20ad(%rip),%ymm8        # 58bc <_sk_callback_hsw+0x478>
   .byte  196,193,68,89,248                   // vmulps        %ymm8,%ymm7,%ymm7
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14034,27 +14350,27 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,100,255,255,255              // ja            37a4 <_sk_load_4444_dst_hsw+0x14>
+  .byte  15,135,100,255,255,255              // ja            3794 <_sk_load_4444_dst_hsw+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 38ac <_sk_load_4444_dst_hsw+0x11c>
+  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 389c <_sk_load_4444_dst_hsw+0x11c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  233,66,255,255,255                  // jmpq          37a4 <_sk_load_4444_dst_hsw+0x14>
+  .byte  233,66,255,255,255                  // jmpq          3794 <_sk_load_4444_dst_hsw+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,121,110,44,83               // vmovd         (%r11,%rdx,2),%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,37,255,255,255                  // jmpq          37a4 <_sk_load_4444_dst_hsw+0x14>
+  .byte  233,37,255,255,255                  // jmpq          3794 <_sk_load_4444_dst_hsw+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,122,126,44,83               // vmovq         (%r11,%rdx,2),%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,248,254,255,255                 // jmpq          37a4 <_sk_load_4444_dst_hsw+0x14>
+  .byte  233,248,254,255,255                 // jmpq          3794 <_sk_load_4444_dst_hsw+0x14>
   .byte  168,255                             // test          $0xff,%al
   .byte  255                                 // (bad)
   .byte  255,194                             // inc           %edx
@@ -14115,25 +14431,25 @@
   .byte  67,15,183,4,89                      // movzwl        (%r9,%r11,2),%eax
   .byte  197,249,196,192,7                   // vpinsrw       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,51,216                  // vpmovzxwd     %xmm0,%ymm3
-  .byte  196,226,125,88,5,31,29,0,0          // vpbroadcastd  0x1d1f(%rip),%ymm0        # 5698 <_sk_callback_hsw+0x47c>
+  .byte  196,226,125,88,5,87,31,0,0          // vpbroadcastd  0x1f57(%rip),%ymm0        # 58c0 <_sk_callback_hsw+0x47c>
   .byte  197,229,219,192                     // vpand         %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,18,29,0,0         // vbroadcastss  0x1d12(%rip),%ymm1        # 569c <_sk_callback_hsw+0x480>
+  .byte  196,226,125,24,13,74,31,0,0         // vbroadcastss  0x1f4a(%rip),%ymm1        # 58c4 <_sk_callback_hsw+0x480>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,9,29,0,0          // vpbroadcastd  0x1d09(%rip),%ymm1        # 56a0 <_sk_callback_hsw+0x484>
+  .byte  196,226,125,88,13,65,31,0,0         // vpbroadcastd  0x1f41(%rip),%ymm1        # 58c8 <_sk_callback_hsw+0x484>
   .byte  197,229,219,201                     // vpand         %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,252,28,0,0        // vbroadcastss  0x1cfc(%rip),%ymm2        # 56a4 <_sk_callback_hsw+0x488>
+  .byte  196,226,125,24,21,52,31,0,0         // vbroadcastss  0x1f34(%rip),%ymm2        # 58cc <_sk_callback_hsw+0x488>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,88,21,243,28,0,0        // vpbroadcastd  0x1cf3(%rip),%ymm2        # 56a8 <_sk_callback_hsw+0x48c>
+  .byte  196,226,125,88,21,43,31,0,0         // vpbroadcastd  0x1f2b(%rip),%ymm2        # 58d0 <_sk_callback_hsw+0x48c>
   .byte  197,229,219,210                     // vpand         %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,230,28,0,0          // vbroadcastss  0x1ce6(%rip),%ymm8        # 56ac <_sk_callback_hsw+0x490>
+  .byte  196,98,125,24,5,30,31,0,0           // vbroadcastss  0x1f1e(%rip),%ymm8        # 58d4 <_sk_callback_hsw+0x490>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,88,5,220,28,0,0          // vpbroadcastd  0x1cdc(%rip),%ymm8        # 56b0 <_sk_callback_hsw+0x494>
+  .byte  196,98,125,88,5,20,31,0,0           // vpbroadcastd  0x1f14(%rip),%ymm8        # 58d8 <_sk_callback_hsw+0x494>
   .byte  196,193,101,219,216                 // vpand         %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,206,28,0,0          // vbroadcastss  0x1cce(%rip),%ymm8        # 56b4 <_sk_callback_hsw+0x498>
+  .byte  196,98,125,24,5,6,31,0,0            // vbroadcastss  0x1f06(%rip),%ymm8        # 58dc <_sk_callback_hsw+0x498>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14144,7 +14460,7 @@
 _sk_store_4444_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,187,28,0,0          // vbroadcastss  0x1cbb(%rip),%ymm8        # 56b8 <_sk_callback_hsw+0x49c>
+  .byte  196,98,125,24,5,243,30,0,0          // vbroadcastss  0x1ef3(%rip),%ymm8        # 58e0 <_sk_callback_hsw+0x49c>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,53,114,241,12               // vpslld        $0xc,%ymm9,%ymm9
@@ -14162,7 +14478,7 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           3a60 <_sk_store_4444_hsw+0x71>
+  .byte  117,10                              // jne           3a50 <_sk_store_4444_hsw+0x71>
   .byte  196,65,122,127,4,83                 // vmovdqu       %xmm8,(%r11,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14170,22 +14486,22 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            3a5c <_sk_store_4444_hsw+0x6d>
+  .byte  119,236                             // ja            3a4c <_sk_store_4444_hsw+0x6d>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,69,0,0,0                  // lea           0x45(%rip),%r10        # 3ac0 <_sk_store_4444_hsw+0xd1>
+  .byte  76,141,21,69,0,0,0                  // lea           0x45(%rip),%r10        # 3ab0 <_sk_store_4444_hsw+0xd1>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,21,4,83,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  .byte  235,207                             // jmp           3a5c <_sk_store_4444_hsw+0x6d>
+  .byte  235,207                             // jmp           3a4c <_sk_store_4444_hsw+0x6d>
   .byte  196,67,121,21,68,83,4,2             // vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   .byte  196,65,121,126,4,83                 // vmovd         %xmm8,(%r11,%rdx,2)
-  .byte  235,191                             // jmp           3a5c <_sk_store_4444_hsw+0x6d>
+  .byte  235,191                             // jmp           3a4c <_sk_store_4444_hsw+0x6d>
   .byte  196,67,121,21,68,83,12,6            // vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,10,5            // vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,8,4             // vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   .byte  196,65,121,214,4,83                 // vmovq         %xmm8,(%r11,%rdx,2)
-  .byte  235,159                             // jmp           3a5c <_sk_store_4444_hsw+0x6d>
+  .byte  235,159                             // jmp           3a4c <_sk_store_4444_hsw+0x6d>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  196                                 // (bad)
   .byte  255                                 // (bad)
@@ -14220,16 +14536,16 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3b49 <_sk_load_8888_hsw+0x6d>
+  .byte  117,88                              // jne           3b39 <_sk_load_8888_hsw+0x6d>
   .byte  196,193,124,16,26                   // vmovups       (%r10),%ymm3
-  .byte  197,228,84,5,2,30,0,0               // vandps        0x1e02(%rip),%ymm3,%ymm0        # 5900 <_sk_callback_hsw+0x6e4>
+  .byte  197,228,84,5,82,32,0,0              // vandps        0x2052(%rip),%ymm3,%ymm0        # 5b40 <_sk_callback_hsw+0x6fc>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,177,27,0,0          // vbroadcastss  0x1bb1(%rip),%ymm8        # 56bc <_sk_callback_hsw+0x4a0>
+  .byte  196,98,125,24,5,233,29,0,0          // vbroadcastss  0x1de9(%rip),%ymm8        # 58e4 <_sk_callback_hsw+0x4a0>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,226,101,0,13,7,30,0,0           // vpshufb       0x1e07(%rip),%ymm3,%ymm1        # 5920 <_sk_callback_hsw+0x704>
+  .byte  196,226,101,0,13,87,32,0,0          // vpshufb       0x2057(%rip),%ymm3,%ymm1        # 5b60 <_sk_callback_hsw+0x71c>
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,226,101,0,21,21,30,0,0          // vpshufb       0x1e15(%rip),%ymm3,%ymm2        # 5940 <_sk_callback_hsw+0x724>
+  .byte  196,226,101,0,21,101,32,0,0         // vpshufb       0x2065(%rip),%ymm3,%ymm2        # 5b80 <_sk_callback_hsw+0x73c>
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -14246,7 +14562,7 @@
   .byte  196,225,249,110,192                 // vmovq         %rax,%xmm0
   .byte  196,226,125,33,192                  // vpmovsxbd     %xmm0,%ymm0
   .byte  196,194,125,44,26                   // vmaskmovps    (%r10),%ymm0,%ymm3
-  .byte  235,135                             // jmp           3af6 <_sk_load_8888_hsw+0x1a>
+  .byte  235,135                             // jmp           3ae6 <_sk_load_8888_hsw+0x1a>
 
 HIDDEN _sk_load_8888_dst_hsw
 .globl _sk_load_8888_dst_hsw
@@ -14257,16 +14573,16 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3bdc <_sk_load_8888_dst_hsw+0x6d>
+  .byte  117,88                              // jne           3bcc <_sk_load_8888_dst_hsw+0x6d>
   .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
-  .byte  197,196,84,37,207,29,0,0            // vandps        0x1dcf(%rip),%ymm7,%ymm4        # 5960 <_sk_callback_hsw+0x744>
+  .byte  197,196,84,37,31,32,0,0             // vandps        0x201f(%rip),%ymm7,%ymm4        # 5ba0 <_sk_callback_hsw+0x75c>
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,98,125,24,5,34,27,0,0           // vbroadcastss  0x1b22(%rip),%ymm8        # 56c0 <_sk_callback_hsw+0x4a4>
+  .byte  196,98,125,24,5,90,29,0,0           // vbroadcastss  0x1d5a(%rip),%ymm8        # 58e8 <_sk_callback_hsw+0x4a4>
   .byte  196,193,92,89,224                   // vmulps        %ymm8,%ymm4,%ymm4
-  .byte  196,226,69,0,45,212,29,0,0          // vpshufb       0x1dd4(%rip),%ymm7,%ymm5        # 5980 <_sk_callback_hsw+0x764>
+  .byte  196,226,69,0,45,36,32,0,0           // vpshufb       0x2024(%rip),%ymm7,%ymm5        # 5bc0 <_sk_callback_hsw+0x77c>
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
   .byte  196,193,84,89,232                   // vmulps        %ymm8,%ymm5,%ymm5
-  .byte  196,226,69,0,53,226,29,0,0          // vpshufb       0x1de2(%rip),%ymm7,%ymm6        # 59a0 <_sk_callback_hsw+0x784>
+  .byte  196,226,69,0,53,50,32,0,0           // vpshufb       0x2032(%rip),%ymm7,%ymm6        # 5be0 <_sk_callback_hsw+0x79c>
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
   .byte  196,193,76,89,240                   // vmulps        %ymm8,%ymm6,%ymm6
   .byte  197,197,114,215,24                  // vpsrld        $0x18,%ymm7,%ymm7
@@ -14283,7 +14599,7 @@
   .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
   .byte  196,226,125,33,228                  // vpmovsxbd     %xmm4,%ymm4
   .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
-  .byte  235,135                             // jmp           3b89 <_sk_load_8888_dst_hsw+0x1a>
+  .byte  235,135                             // jmp           3b79 <_sk_load_8888_dst_hsw+0x1a>
 
 HIDDEN _sk_gather_8888_hsw
 .globl _sk_gather_8888_hsw
@@ -14298,14 +14614,14 @@
   .byte  197,245,254,192                     // vpaddd        %ymm0,%ymm1,%ymm0
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,194,117,144,28,129              // vpgatherdd    %ymm1,(%r9,%ymm0,4),%ymm3
-  .byte  197,229,219,5,144,29,0,0            // vpand         0x1d90(%rip),%ymm3,%ymm0        # 59c0 <_sk_callback_hsw+0x7a4>
+  .byte  197,229,219,5,224,31,0,0            // vpand         0x1fe0(%rip),%ymm3,%ymm0        # 5c00 <_sk_callback_hsw+0x7bc>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,135,26,0,0          // vbroadcastss  0x1a87(%rip),%ymm8        # 56c4 <_sk_callback_hsw+0x4a8>
+  .byte  196,98,125,24,5,191,28,0,0          // vbroadcastss  0x1cbf(%rip),%ymm8        # 58ec <_sk_callback_hsw+0x4a8>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,226,101,0,13,149,29,0,0         // vpshufb       0x1d95(%rip),%ymm3,%ymm1        # 59e0 <_sk_callback_hsw+0x7c4>
+  .byte  196,226,101,0,13,229,31,0,0         // vpshufb       0x1fe5(%rip),%ymm3,%ymm1        # 5c20 <_sk_callback_hsw+0x7dc>
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,226,101,0,21,163,29,0,0         // vpshufb       0x1da3(%rip),%ymm3,%ymm2        # 5a00 <_sk_callback_hsw+0x7e4>
+  .byte  196,226,101,0,21,243,31,0,0         // vpshufb       0x1ff3(%rip),%ymm3,%ymm2        # 5c40 <_sk_callback_hsw+0x7fc>
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -14322,7 +14638,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
-  .byte  196,98,125,24,5,55,26,0,0           // vbroadcastss  0x1a37(%rip),%ymm8        # 56c8 <_sk_callback_hsw+0x4ac>
+  .byte  196,98,125,24,5,111,28,0,0          // vbroadcastss  0x1c6f(%rip),%ymm8        # 58f0 <_sk_callback_hsw+0x4ac>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,65,116,89,208                   // vmulps        %ymm8,%ymm1,%ymm10
@@ -14338,7 +14654,7 @@
   .byte  196,65,45,235,192                   // vpor          %ymm8,%ymm10,%ymm8
   .byte  196,65,53,235,192                   // vpor          %ymm8,%ymm9,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,12                              // jne           3ceb <_sk_store_8888_hsw+0x73>
+  .byte  117,12                              // jne           3cdb <_sk_store_8888_hsw+0x73>
   .byte  196,65,124,17,2                     // vmovups       %ymm8,(%r10)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -14351,7 +14667,149 @@
   .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
   .byte  196,66,125,33,201                   // vpmovsxbd     %xmm9,%ymm9
   .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
-  .byte  235,211                             // jmp           3ce4 <_sk_store_8888_hsw+0x6c>
+  .byte  235,211                             // jmp           3cd4 <_sk_store_8888_hsw+0x6c>
+
+HIDDEN _sk_load_bgra_hsw
+.globl _sk_load_bgra_hsw
+FUNCTION(_sk_load_bgra_hsw)
+_sk_load_bgra_hsw:
+  .byte  73,137,201                          // mov           %rcx,%r9
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
+  .byte  76,3,16                             // add           (%rax),%r10
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,88                              // jne           3d6e <_sk_load_bgra_hsw+0x6d>
+  .byte  196,193,124,16,26                   // vmovups       (%r10),%ymm3
+  .byte  197,228,84,5,61,31,0,0              // vandps        0x1f3d(%rip),%ymm3,%ymm0        # 5c60 <_sk_callback_hsw+0x81c>
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,98,125,24,5,196,27,0,0          // vbroadcastss  0x1bc4(%rip),%ymm8        # 58f4 <_sk_callback_hsw+0x4b0>
+  .byte  196,193,124,89,208                  // vmulps        %ymm8,%ymm0,%ymm2
+  .byte  196,226,101,0,5,66,31,0,0           // vpshufb       0x1f42(%rip),%ymm3,%ymm0        # 5c80 <_sk_callback_hsw+0x83c>
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,193,124,89,200                  // vmulps        %ymm8,%ymm0,%ymm1
+  .byte  196,226,101,0,5,80,31,0,0           // vpshufb       0x1f50(%rip),%ymm3,%ymm0        # 5ca0 <_sk_callback_hsw+0x85c>
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
+  .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
+  .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
+  .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,137,201                          // mov           %r9,%rcx
+  .byte  255,224                             // jmpq          *%rax
+  .byte  185,8,0,0,0                         // mov           $0x8,%ecx
+  .byte  68,41,193                           // sub           %r8d,%ecx
+  .byte  192,225,3                           // shl           $0x3,%cl
+  .byte  72,199,192,255,255,255,255          // mov           $0xffffffffffffffff,%rax
+  .byte  72,211,232                          // shr           %cl,%rax
+  .byte  196,225,249,110,192                 // vmovq         %rax,%xmm0
+  .byte  196,226,125,33,192                  // vpmovsxbd     %xmm0,%ymm0
+  .byte  196,194,125,44,26                   // vmaskmovps    (%r10),%ymm0,%ymm3
+  .byte  235,135                             // jmp           3d1b <_sk_load_bgra_hsw+0x1a>
+
+HIDDEN _sk_load_bgra_dst_hsw
+.globl _sk_load_bgra_dst_hsw
+FUNCTION(_sk_load_bgra_dst_hsw)
+_sk_load_bgra_dst_hsw:
+  .byte  73,137,201                          // mov           %rcx,%r9
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
+  .byte  76,3,16                             // add           (%rax),%r10
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,88                              // jne           3e01 <_sk_load_bgra_dst_hsw+0x6d>
+  .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
+  .byte  197,196,84,37,10,31,0,0             // vandps        0x1f0a(%rip),%ymm7,%ymm4        # 5cc0 <_sk_callback_hsw+0x87c>
+  .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
+  .byte  196,98,125,24,5,53,27,0,0           // vbroadcastss  0x1b35(%rip),%ymm8        # 58f8 <_sk_callback_hsw+0x4b4>
+  .byte  196,193,92,89,240                   // vmulps        %ymm8,%ymm4,%ymm6
+  .byte  196,226,69,0,37,15,31,0,0           // vpshufb       0x1f0f(%rip),%ymm7,%ymm4        # 5ce0 <_sk_callback_hsw+0x89c>
+  .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
+  .byte  196,193,92,89,232                   // vmulps        %ymm8,%ymm4,%ymm5
+  .byte  196,226,69,0,37,29,31,0,0           // vpshufb       0x1f1d(%rip),%ymm7,%ymm4        # 5d00 <_sk_callback_hsw+0x8bc>
+  .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
+  .byte  196,193,92,89,224                   // vmulps        %ymm8,%ymm4,%ymm4
+  .byte  197,197,114,215,24                  // vpsrld        $0x18,%ymm7,%ymm7
+  .byte  197,252,91,255                      // vcvtdq2ps     %ymm7,%ymm7
+  .byte  196,193,68,89,248                   // vmulps        %ymm8,%ymm7,%ymm7
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,137,201                          // mov           %r9,%rcx
+  .byte  255,224                             // jmpq          *%rax
+  .byte  185,8,0,0,0                         // mov           $0x8,%ecx
+  .byte  68,41,193                           // sub           %r8d,%ecx
+  .byte  192,225,3                           // shl           $0x3,%cl
+  .byte  72,199,192,255,255,255,255          // mov           $0xffffffffffffffff,%rax
+  .byte  72,211,232                          // shr           %cl,%rax
+  .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
+  .byte  196,226,125,33,228                  // vpmovsxbd     %xmm4,%ymm4
+  .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
+  .byte  235,135                             // jmp           3dae <_sk_load_bgra_dst_hsw+0x1a>
+
+HIDDEN _sk_gather_bgra_hsw
+.globl _sk_gather_bgra_hsw
+FUNCTION(_sk_gather_bgra_hsw)
+_sk_gather_bgra_hsw:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,139,8                            // mov           (%rax),%r9
+  .byte  197,254,91,201                      // vcvttps2dq    %ymm1,%ymm1
+  .byte  196,226,125,88,80,16                // vpbroadcastd  0x10(%rax),%ymm2
+  .byte  196,226,109,64,201                  // vpmulld       %ymm1,%ymm2,%ymm1
+  .byte  197,254,91,192                      // vcvttps2dq    %ymm0,%ymm0
+  .byte  197,245,254,192                     // vpaddd        %ymm0,%ymm1,%ymm0
+  .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
+  .byte  196,194,117,144,28,129              // vpgatherdd    %ymm1,(%r9,%ymm0,4),%ymm3
+  .byte  197,229,219,5,203,30,0,0            // vpand         0x1ecb(%rip),%ymm3,%ymm0        # 5d20 <_sk_callback_hsw+0x8dc>
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,98,125,24,5,154,26,0,0          // vbroadcastss  0x1a9a(%rip),%ymm8        # 58fc <_sk_callback_hsw+0x4b8>
+  .byte  196,193,124,89,208                  // vmulps        %ymm8,%ymm0,%ymm2
+  .byte  196,226,101,0,5,208,30,0,0          // vpshufb       0x1ed0(%rip),%ymm3,%ymm0        # 5d40 <_sk_callback_hsw+0x8fc>
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,193,124,89,200                  // vmulps        %ymm8,%ymm0,%ymm1
+  .byte  196,226,101,0,5,222,30,0,0          // vpshufb       0x1ede(%rip),%ymm3,%ymm0        # 5d60 <_sk_callback_hsw+0x91c>
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
+  .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
+  .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
+  .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+
+HIDDEN _sk_store_bgra_hsw
+.globl _sk_store_bgra_hsw
+FUNCTION(_sk_store_bgra_hsw)
+_sk_store_bgra_hsw:
+  .byte  73,137,201                          // mov           %rcx,%r9
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
+  .byte  76,3,16                             // add           (%rax),%r10
+  .byte  196,98,125,24,5,74,26,0,0           // vbroadcastss  0x1a4a(%rip),%ymm8        # 5900 <_sk_callback_hsw+0x4bc>
+  .byte  196,65,108,89,200                   // vmulps        %ymm8,%ymm2,%ymm9
+  .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
+  .byte  196,65,116,89,208                   // vmulps        %ymm8,%ymm1,%ymm10
+  .byte  196,65,125,91,210                   // vcvtps2dq     %ymm10,%ymm10
+  .byte  196,193,45,114,242,8                // vpslld        $0x8,%ymm10,%ymm10
+  .byte  196,65,45,235,201                   // vpor          %ymm9,%ymm10,%ymm9
+  .byte  196,65,124,89,208                   // vmulps        %ymm8,%ymm0,%ymm10
+  .byte  196,65,125,91,210                   // vcvtps2dq     %ymm10,%ymm10
+  .byte  196,193,45,114,242,16               // vpslld        $0x10,%ymm10,%ymm10
+  .byte  196,65,100,89,192                   // vmulps        %ymm8,%ymm3,%ymm8
+  .byte  196,65,125,91,192                   // vcvtps2dq     %ymm8,%ymm8
+  .byte  196,193,61,114,240,24               // vpslld        $0x18,%ymm8,%ymm8
+  .byte  196,65,45,235,192                   // vpor          %ymm8,%ymm10,%ymm8
+  .byte  196,65,53,235,192                   // vpor          %ymm8,%ymm9,%ymm8
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,12                              // jne           3f10 <_sk_store_bgra_hsw+0x73>
+  .byte  196,65,124,17,2                     // vmovups       %ymm8,(%r10)
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,137,201                          // mov           %r9,%rcx
+  .byte  255,224                             // jmpq          *%rax
+  .byte  185,8,0,0,0                         // mov           $0x8,%ecx
+  .byte  68,41,193                           // sub           %r8d,%ecx
+  .byte  192,225,3                           // shl           $0x3,%cl
+  .byte  72,199,192,255,255,255,255          // mov           $0xffffffffffffffff,%rax
+  .byte  72,211,232                          // shr           %cl,%rax
+  .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
+  .byte  196,66,125,33,201                   // vpmovsxbd     %xmm9,%ymm9
+  .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
+  .byte  235,211                             // jmp           3f09 <_sk_store_bgra_hsw+0x6c>
 
 HIDDEN _sk_load_f16_hsw
 .globl _sk_load_f16_hsw
@@ -14360,7 +14818,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,97                              // jne           3d7c <_sk_load_f16_hsw+0x6b>
+  .byte  117,97                              // jne           3fa1 <_sk_load_f16_hsw+0x6b>
   .byte  197,121,16,4,208                    // vmovupd       (%rax,%rdx,8),%xmm8
   .byte  197,249,16,84,208,16                // vmovupd       0x10(%rax,%rdx,8),%xmm2
   .byte  197,249,16,92,208,32                // vmovupd       0x20(%rax,%rdx,8),%xmm3
@@ -14386,29 +14844,29 @@
   .byte  197,123,16,4,208                    // vmovsd        (%rax,%rdx,8),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,79                              // je            3ddb <_sk_load_f16_hsw+0xca>
+  .byte  116,79                              // je            4000 <_sk_load_f16_hsw+0xca>
   .byte  197,57,22,68,208,8                  // vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,67                              // jb            3ddb <_sk_load_f16_hsw+0xca>
+  .byte  114,67                              // jb            4000 <_sk_load_f16_hsw+0xca>
   .byte  197,251,16,84,208,16                // vmovsd        0x10(%rax,%rdx,8),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,68                              // je            3de8 <_sk_load_f16_hsw+0xd7>
+  .byte  116,68                              // je            400d <_sk_load_f16_hsw+0xd7>
   .byte  197,233,22,84,208,24                // vmovhpd       0x18(%rax,%rdx,8),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,56                              // jb            3de8 <_sk_load_f16_hsw+0xd7>
+  .byte  114,56                              // jb            400d <_sk_load_f16_hsw+0xd7>
   .byte  197,251,16,92,208,32                // vmovsd        0x20(%rax,%rdx,8),%xmm3
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,114,255,255,255              // je            3d32 <_sk_load_f16_hsw+0x21>
+  .byte  15,132,114,255,255,255              // je            3f57 <_sk_load_f16_hsw+0x21>
   .byte  197,225,22,92,208,40                // vmovhpd       0x28(%rax,%rdx,8),%xmm3,%xmm3
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,98,255,255,255               // jb            3d32 <_sk_load_f16_hsw+0x21>
+  .byte  15,130,98,255,255,255               // jb            3f57 <_sk_load_f16_hsw+0x21>
   .byte  197,122,126,76,208,48               // vmovq         0x30(%rax,%rdx,8),%xmm9
-  .byte  233,87,255,255,255                  // jmpq          3d32 <_sk_load_f16_hsw+0x21>
+  .byte  233,87,255,255,255                  // jmpq          3f57 <_sk_load_f16_hsw+0x21>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,74,255,255,255                  // jmpq          3d32 <_sk_load_f16_hsw+0x21>
+  .byte  233,74,255,255,255                  // jmpq          3f57 <_sk_load_f16_hsw+0x21>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,65,255,255,255                  // jmpq          3d32 <_sk_load_f16_hsw+0x21>
+  .byte  233,65,255,255,255                  // jmpq          3f57 <_sk_load_f16_hsw+0x21>
 
 HIDDEN _sk_load_f16_dst_hsw
 .globl _sk_load_f16_dst_hsw
@@ -14417,7 +14875,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,97                              // jne           3e5c <_sk_load_f16_dst_hsw+0x6b>
+  .byte  117,97                              // jne           4081 <_sk_load_f16_dst_hsw+0x6b>
   .byte  197,121,16,4,208                    // vmovupd       (%rax,%rdx,8),%xmm8
   .byte  197,249,16,116,208,16               // vmovupd       0x10(%rax,%rdx,8),%xmm6
   .byte  197,249,16,124,208,32               // vmovupd       0x20(%rax,%rdx,8),%xmm7
@@ -14443,29 +14901,29 @@
   .byte  197,123,16,4,208                    // vmovsd        (%rax,%rdx,8),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,79                              // je            3ebb <_sk_load_f16_dst_hsw+0xca>
+  .byte  116,79                              // je            40e0 <_sk_load_f16_dst_hsw+0xca>
   .byte  197,57,22,68,208,8                  // vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,67                              // jb            3ebb <_sk_load_f16_dst_hsw+0xca>
+  .byte  114,67                              // jb            40e0 <_sk_load_f16_dst_hsw+0xca>
   .byte  197,251,16,116,208,16               // vmovsd        0x10(%rax,%rdx,8),%xmm6
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,68                              // je            3ec8 <_sk_load_f16_dst_hsw+0xd7>
+  .byte  116,68                              // je            40ed <_sk_load_f16_dst_hsw+0xd7>
   .byte  197,201,22,116,208,24               // vmovhpd       0x18(%rax,%rdx,8),%xmm6,%xmm6
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,56                              // jb            3ec8 <_sk_load_f16_dst_hsw+0xd7>
+  .byte  114,56                              // jb            40ed <_sk_load_f16_dst_hsw+0xd7>
   .byte  197,251,16,124,208,32               // vmovsd        0x20(%rax,%rdx,8),%xmm7
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,114,255,255,255              // je            3e12 <_sk_load_f16_dst_hsw+0x21>
+  .byte  15,132,114,255,255,255              // je            4037 <_sk_load_f16_dst_hsw+0x21>
   .byte  197,193,22,124,208,40               // vmovhpd       0x28(%rax,%rdx,8),%xmm7,%xmm7
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,98,255,255,255               // jb            3e12 <_sk_load_f16_dst_hsw+0x21>
+  .byte  15,130,98,255,255,255               // jb            4037 <_sk_load_f16_dst_hsw+0x21>
   .byte  197,122,126,76,208,48               // vmovq         0x30(%rax,%rdx,8),%xmm9
-  .byte  233,87,255,255,255                  // jmpq          3e12 <_sk_load_f16_dst_hsw+0x21>
+  .byte  233,87,255,255,255                  // jmpq          4037 <_sk_load_f16_dst_hsw+0x21>
   .byte  197,193,87,255                      // vxorpd        %xmm7,%xmm7,%xmm7
   .byte  197,201,87,246                      // vxorpd        %xmm6,%xmm6,%xmm6
-  .byte  233,74,255,255,255                  // jmpq          3e12 <_sk_load_f16_dst_hsw+0x21>
+  .byte  233,74,255,255,255                  // jmpq          4037 <_sk_load_f16_dst_hsw+0x21>
   .byte  197,193,87,255                      // vxorpd        %xmm7,%xmm7,%xmm7
-  .byte  233,65,255,255,255                  // jmpq          3e12 <_sk_load_f16_dst_hsw+0x21>
+  .byte  233,65,255,255,255                  // jmpq          4037 <_sk_load_f16_dst_hsw+0x21>
 
 HIDDEN _sk_gather_f16_hsw
 .globl _sk_gather_f16_hsw
@@ -14523,7 +14981,7 @@
   .byte  196,65,57,98,205                    // vpunpckldq    %xmm13,%xmm8,%xmm9
   .byte  196,65,57,106,197                   // vpunpckhdq    %xmm13,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,27                              // jne           3fc0 <_sk_store_f16_hsw+0x65>
+  .byte  117,27                              // jne           41e5 <_sk_store_f16_hsw+0x65>
   .byte  197,120,17,28,208                   // vmovups       %xmm11,(%rax,%rdx,8)
   .byte  197,120,17,84,208,16                // vmovups       %xmm10,0x10(%rax,%rdx,8)
   .byte  197,120,17,76,208,32                // vmovups       %xmm9,0x20(%rax,%rdx,8)
@@ -14532,22 +14990,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  197,121,214,28,208                  // vmovq         %xmm11,(%rax,%rdx,8)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,241                             // je            3fbc <_sk_store_f16_hsw+0x61>
+  .byte  116,241                             // je            41e1 <_sk_store_f16_hsw+0x61>
   .byte  197,121,23,92,208,8                 // vmovhpd       %xmm11,0x8(%rax,%rdx,8)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,229                             // jb            3fbc <_sk_store_f16_hsw+0x61>
+  .byte  114,229                             // jb            41e1 <_sk_store_f16_hsw+0x61>
   .byte  197,121,214,84,208,16               // vmovq         %xmm10,0x10(%rax,%rdx,8)
-  .byte  116,221                             // je            3fbc <_sk_store_f16_hsw+0x61>
+  .byte  116,221                             // je            41e1 <_sk_store_f16_hsw+0x61>
   .byte  197,121,23,84,208,24                // vmovhpd       %xmm10,0x18(%rax,%rdx,8)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,209                             // jb            3fbc <_sk_store_f16_hsw+0x61>
+  .byte  114,209                             // jb            41e1 <_sk_store_f16_hsw+0x61>
   .byte  197,121,214,76,208,32               // vmovq         %xmm9,0x20(%rax,%rdx,8)
-  .byte  116,201                             // je            3fbc <_sk_store_f16_hsw+0x61>
+  .byte  116,201                             // je            41e1 <_sk_store_f16_hsw+0x61>
   .byte  197,121,23,76,208,40                // vmovhpd       %xmm9,0x28(%rax,%rdx,8)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,189                             // jb            3fbc <_sk_store_f16_hsw+0x61>
+  .byte  114,189                             // jb            41e1 <_sk_store_f16_hsw+0x61>
   .byte  197,121,214,68,208,48               // vmovq         %xmm8,0x30(%rax,%rdx,8)
-  .byte  235,181                             // jmp           3fbc <_sk_store_f16_hsw+0x61>
+  .byte  235,181                             // jmp           41e1 <_sk_store_f16_hsw+0x61>
 
 HIDDEN _sk_load_u16_be_hsw
 .globl _sk_load_u16_be_hsw
@@ -14557,7 +15015,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,204,0,0,0                    // jne           40e9 <_sk_load_u16_be_hsw+0xe2>
+  .byte  15,133,204,0,0,0                    // jne           430e <_sk_load_u16_be_hsw+0xe2>
   .byte  196,65,121,16,4,65                  // vmovupd       (%r9,%rax,2),%xmm8
   .byte  196,193,121,16,84,65,16             // vmovupd       0x10(%r9,%rax,2),%xmm2
   .byte  196,193,121,16,92,65,32             // vmovupd       0x20(%r9,%rax,2),%xmm3
@@ -14576,7 +15034,7 @@
   .byte  197,241,235,192                     // vpor          %xmm0,%xmm1,%xmm0
   .byte  196,226,125,51,192                  // vpmovzxwd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,21,78,22,0,0          // vbroadcastss  0x164e(%rip),%ymm10        # 56cc <_sk_callback_hsw+0x4b0>
+  .byte  196,98,125,24,21,97,22,0,0          // vbroadcastss  0x1661(%rip),%ymm10        # 5904 <_sk_callback_hsw+0x4c0>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,185,109,202                     // vpunpckhqdq   %xmm2,%xmm8,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -14604,29 +15062,29 @@
   .byte  196,65,123,16,4,65                  // vmovsd        (%r9,%rax,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,85                              // je            414f <_sk_load_u16_be_hsw+0x148>
+  .byte  116,85                              // je            4374 <_sk_load_u16_be_hsw+0x148>
   .byte  196,65,57,22,68,65,8                // vmovhpd       0x8(%r9,%rax,2),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,72                              // jb            414f <_sk_load_u16_be_hsw+0x148>
+  .byte  114,72                              // jb            4374 <_sk_load_u16_be_hsw+0x148>
   .byte  196,193,123,16,84,65,16             // vmovsd        0x10(%r9,%rax,2),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,72                              // je            415c <_sk_load_u16_be_hsw+0x155>
+  .byte  116,72                              // je            4381 <_sk_load_u16_be_hsw+0x155>
   .byte  196,193,105,22,84,65,24             // vmovhpd       0x18(%r9,%rax,2),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,59                              // jb            415c <_sk_load_u16_be_hsw+0x155>
+  .byte  114,59                              // jb            4381 <_sk_load_u16_be_hsw+0x155>
   .byte  196,193,123,16,92,65,32             // vmovsd        0x20(%r9,%rax,2),%xmm3
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,6,255,255,255                // je            4038 <_sk_load_u16_be_hsw+0x31>
+  .byte  15,132,6,255,255,255                // je            425d <_sk_load_u16_be_hsw+0x31>
   .byte  196,193,97,22,92,65,40              // vmovhpd       0x28(%r9,%rax,2),%xmm3,%xmm3
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,245,254,255,255              // jb            4038 <_sk_load_u16_be_hsw+0x31>
+  .byte  15,130,245,254,255,255              // jb            425d <_sk_load_u16_be_hsw+0x31>
   .byte  196,65,122,126,76,65,48             // vmovq         0x30(%r9,%rax,2),%xmm9
-  .byte  233,233,254,255,255                 // jmpq          4038 <_sk_load_u16_be_hsw+0x31>
+  .byte  233,233,254,255,255                 // jmpq          425d <_sk_load_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,220,254,255,255                 // jmpq          4038 <_sk_load_u16_be_hsw+0x31>
+  .byte  233,220,254,255,255                 // jmpq          425d <_sk_load_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,211,254,255,255                 // jmpq          4038 <_sk_load_u16_be_hsw+0x31>
+  .byte  233,211,254,255,255                 // jmpq          425d <_sk_load_u16_be_hsw+0x31>
 
 HIDDEN _sk_load_rgb_u16_be_hsw
 .globl _sk_load_rgb_u16_be_hsw
@@ -14636,7 +15094,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,82                         // lea           (%rdx,%rdx,2),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,204,0,0,0                    // jne           4243 <_sk_load_rgb_u16_be_hsw+0xde>
+  .byte  15,133,204,0,0,0                    // jne           4468 <_sk_load_rgb_u16_be_hsw+0xde>
   .byte  196,193,122,111,4,65                // vmovdqu       (%r9,%rax,2),%xmm0
   .byte  196,193,122,111,84,65,12            // vmovdqu       0xc(%r9,%rax,2),%xmm2
   .byte  196,193,122,111,76,65,24            // vmovdqu       0x18(%r9,%rax,2),%xmm1
@@ -14660,7 +15118,7 @@
   .byte  197,241,235,192                     // vpor          %xmm0,%xmm1,%xmm0
   .byte  196,226,125,51,192                  // vpmovzxwd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,21,223,20,0,0         // vbroadcastss  0x14df(%rip),%ymm10        # 56d0 <_sk_callback_hsw+0x4b4>
+  .byte  196,98,125,24,21,242,20,0,0         // vbroadcastss  0x14f2(%rip),%ymm10        # 5908 <_sk_callback_hsw+0x4c4>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,185,109,202                     // vpunpckhqdq   %xmm2,%xmm8,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -14677,41 +15135,41 @@
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,147,20,0,0        // vbroadcastss  0x1493(%rip),%ymm3        # 56d4 <_sk_callback_hsw+0x4b8>
+  .byte  196,226,125,24,29,166,20,0,0        // vbroadcastss  0x14a6(%rip),%ymm3        # 590c <_sk_callback_hsw+0x4c8>
   .byte  255,224                             // jmpq          *%rax
   .byte  196,193,121,110,4,65                // vmovd         (%r9,%rax,2),%xmm0
   .byte  196,193,121,196,68,65,4,2           // vpinsrw       $0x2,0x4(%r9,%rax,2),%xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,5                               // jne           425c <_sk_load_rgb_u16_be_hsw+0xf7>
-  .byte  233,79,255,255,255                  // jmpq          41ab <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  117,5                               // jne           4481 <_sk_load_rgb_u16_be_hsw+0xf7>
+  .byte  233,79,255,255,255                  // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
   .byte  196,193,121,110,76,65,6             // vmovd         0x6(%r9,%rax,2),%xmm1
   .byte  196,65,113,196,68,65,10,2           // vpinsrw       $0x2,0xa(%r9,%rax,2),%xmm1,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,26                              // jb            428b <_sk_load_rgb_u16_be_hsw+0x126>
+  .byte  114,26                              // jb            44b0 <_sk_load_rgb_u16_be_hsw+0x126>
   .byte  196,193,121,110,76,65,12            // vmovd         0xc(%r9,%rax,2),%xmm1
   .byte  196,193,113,196,84,65,16,2          // vpinsrw       $0x2,0x10(%r9,%rax,2),%xmm1,%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  117,10                              // jne           4290 <_sk_load_rgb_u16_be_hsw+0x12b>
-  .byte  233,32,255,255,255                  // jmpq          41ab <_sk_load_rgb_u16_be_hsw+0x46>
-  .byte  233,27,255,255,255                  // jmpq          41ab <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           44b5 <_sk_load_rgb_u16_be_hsw+0x12b>
+  .byte  233,32,255,255,255                  // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,27,255,255,255                  // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
   .byte  196,193,121,110,76,65,18            // vmovd         0x12(%r9,%rax,2),%xmm1
   .byte  196,65,113,196,76,65,22,2           // vpinsrw       $0x2,0x16(%r9,%rax,2),%xmm1,%xmm9
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,26                              // jb            42bf <_sk_load_rgb_u16_be_hsw+0x15a>
+  .byte  114,26                              // jb            44e4 <_sk_load_rgb_u16_be_hsw+0x15a>
   .byte  196,193,121,110,76,65,24            // vmovd         0x18(%r9,%rax,2),%xmm1
   .byte  196,193,113,196,76,65,28,2          // vpinsrw       $0x2,0x1c(%r9,%rax,2),%xmm1,%xmm1
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  117,10                              // jne           42c4 <_sk_load_rgb_u16_be_hsw+0x15f>
-  .byte  233,236,254,255,255                 // jmpq          41ab <_sk_load_rgb_u16_be_hsw+0x46>
-  .byte  233,231,254,255,255                 // jmpq          41ab <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           44e9 <_sk_load_rgb_u16_be_hsw+0x15f>
+  .byte  233,236,254,255,255                 // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,231,254,255,255                 // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
   .byte  196,193,121,110,92,65,30            // vmovd         0x1e(%r9,%rax,2),%xmm3
   .byte  196,65,97,196,92,65,34,2            // vpinsrw       $0x2,0x22(%r9,%rax,2),%xmm3,%xmm11
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,20                              // jb            42ed <_sk_load_rgb_u16_be_hsw+0x188>
+  .byte  114,20                              // jb            4512 <_sk_load_rgb_u16_be_hsw+0x188>
   .byte  196,193,121,110,92,65,36            // vmovd         0x24(%r9,%rax,2),%xmm3
   .byte  196,193,97,196,92,65,40,2           // vpinsrw       $0x2,0x28(%r9,%rax,2),%xmm3,%xmm3
-  .byte  233,190,254,255,255                 // jmpq          41ab <_sk_load_rgb_u16_be_hsw+0x46>
-  .byte  233,185,254,255,255                 // jmpq          41ab <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,190,254,255,255                 // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,185,254,255,255                 // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
 
 HIDDEN _sk_store_u16_be_hsw
 .globl _sk_store_u16_be_hsw
@@ -14720,7 +15178,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
-  .byte  196,98,125,24,5,208,19,0,0          // vbroadcastss  0x13d0(%rip),%ymm8        # 56d8 <_sk_callback_hsw+0x4bc>
+  .byte  196,98,125,24,5,227,19,0,0          // vbroadcastss  0x13e3(%rip),%ymm8        # 5910 <_sk_callback_hsw+0x4cc>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,67,125,25,202,1                 // vextractf128  $0x1,%ymm9,%xmm10
@@ -14758,7 +15216,7 @@
   .byte  196,65,17,98,200                    // vpunpckldq    %xmm8,%xmm13,%xmm9
   .byte  196,65,17,106,192                   // vpunpckhdq    %xmm8,%xmm13,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,31                              // jne           43ec <_sk_store_u16_be_hsw+0xfa>
+  .byte  117,31                              // jne           4611 <_sk_store_u16_be_hsw+0xfa>
   .byte  196,65,120,17,28,65                 // vmovups       %xmm11,(%r9,%rax,2)
   .byte  196,65,120,17,84,65,16              // vmovups       %xmm10,0x10(%r9,%rax,2)
   .byte  196,65,120,17,76,65,32              // vmovups       %xmm9,0x20(%r9,%rax,2)
@@ -14767,22 +15225,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,214,28,65                // vmovq         %xmm11,(%r9,%rax,2)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            43e8 <_sk_store_u16_be_hsw+0xf6>
+  .byte  116,240                             // je            460d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,23,92,65,8               // vmovhpd       %xmm11,0x8(%r9,%rax,2)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            43e8 <_sk_store_u16_be_hsw+0xf6>
+  .byte  114,227                             // jb            460d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,214,84,65,16             // vmovq         %xmm10,0x10(%r9,%rax,2)
-  .byte  116,218                             // je            43e8 <_sk_store_u16_be_hsw+0xf6>
+  .byte  116,218                             // je            460d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,23,84,65,24              // vmovhpd       %xmm10,0x18(%r9,%rax,2)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,205                             // jb            43e8 <_sk_store_u16_be_hsw+0xf6>
+  .byte  114,205                             // jb            460d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,214,76,65,32             // vmovq         %xmm9,0x20(%r9,%rax,2)
-  .byte  116,196                             // je            43e8 <_sk_store_u16_be_hsw+0xf6>
+  .byte  116,196                             // je            460d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,23,76,65,40              // vmovhpd       %xmm9,0x28(%r9,%rax,2)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,183                             // jb            43e8 <_sk_store_u16_be_hsw+0xf6>
+  .byte  114,183                             // jb            460d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,214,68,65,48             // vmovq         %xmm8,0x30(%r9,%rax,2)
-  .byte  235,174                             // jmp           43e8 <_sk_store_u16_be_hsw+0xf6>
+  .byte  235,174                             // jmp           460d <_sk_store_u16_be_hsw+0xf6>
 
 HIDDEN _sk_load_f32_hsw
 .globl _sk_load_f32_hsw
@@ -14790,10 +15248,10 @@
 _sk_load_f32_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  119,110                             // ja            44b0 <_sk_load_f32_hsw+0x76>
+  .byte  119,110                             // ja            46d5 <_sk_load_f32_hsw+0x76>
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
-  .byte  76,141,29,132,0,0,0                 // lea           0x84(%rip),%r11        # 44d8 <_sk_load_f32_hsw+0x9e>
+  .byte  76,141,29,135,0,0,0                 // lea           0x87(%rip),%r11        # 4700 <_sk_load_f32_hsw+0xa1>
   .byte  75,99,4,131                         // movslq        (%r11,%r8,4),%rax
   .byte  76,1,216                            // add           %r11,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14819,19 +15277,21 @@
   .byte  196,193,101,21,216                  // vunpckhpd     %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
-  .byte  133,255                             // test          %edi,%edi
+  .byte  15,31,0                             // nopl          (%rax)
+  .byte  130                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,204                             // dec           %esp
+  .byte  255                                 // (bad)
+  .byte  255,201                             // dec           %ecx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  191,255,255,255,178                 // mov           $0xb2ffffff,%edi
+  .byte  188,255,255,255,175                 // mov           $0xafffffff,%esp
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,165,255,255,255,157             // jmpq          *-0x62000001(%rbp)
+  .byte  255,162,255,255,255,154             // jmpq          *-0x65000001(%rdx)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,149,255,255,255,141             // callq         *-0x72000001(%rbp)
+  .byte  255,146,255,255,255,138             // callq         *-0x75000001(%rdx)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
@@ -14842,10 +15302,10 @@
 _sk_load_f32_dst_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  119,110                             // ja            456e <_sk_load_f32_dst_hsw+0x76>
+  .byte  119,110                             // ja            4796 <_sk_load_f32_dst_hsw+0x76>
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
-  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 4598 <_sk_load_f32_dst_hsw+0xa0>
+  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 47c0 <_sk_load_f32_dst_hsw+0xa0>
   .byte  75,99,4,131                         // movslq        (%r11,%r8,4),%rax
   .byte  76,1,216                            // add           %r11,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14904,7 +15364,7 @@
   .byte  196,65,37,20,196                    // vunpcklpd     %ymm12,%ymm11,%ymm8
   .byte  196,65,37,21,220                    // vunpckhpd     %ymm12,%ymm11,%ymm11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,55                              // jne           4625 <_sk_store_f32_hsw+0x6d>
+  .byte  117,55                              // jne           484d <_sk_store_f32_hsw+0x6d>
   .byte  196,67,45,24,225,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   .byte  196,67,61,24,235,1                  // vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   .byte  196,67,45,6,201,49                  // vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -14917,22 +15377,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,17,20,129                // vmovupd       %xmm10,(%r9,%rax,4)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            4621 <_sk_store_f32_hsw+0x69>
+  .byte  116,240                             // je            4849 <_sk_store_f32_hsw+0x69>
   .byte  196,65,121,17,76,129,16             // vmovupd       %xmm9,0x10(%r9,%rax,4)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            4621 <_sk_store_f32_hsw+0x69>
+  .byte  114,227                             // jb            4849 <_sk_store_f32_hsw+0x69>
   .byte  196,65,121,17,68,129,32             // vmovupd       %xmm8,0x20(%r9,%rax,4)
-  .byte  116,218                             // je            4621 <_sk_store_f32_hsw+0x69>
+  .byte  116,218                             // je            4849 <_sk_store_f32_hsw+0x69>
   .byte  196,65,121,17,92,129,48             // vmovupd       %xmm11,0x30(%r9,%rax,4)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,205                             // jb            4621 <_sk_store_f32_hsw+0x69>
+  .byte  114,205                             // jb            4849 <_sk_store_f32_hsw+0x69>
   .byte  196,67,125,25,84,129,64,1           // vextractf128  $0x1,%ymm10,0x40(%r9,%rax,4)
-  .byte  116,195                             // je            4621 <_sk_store_f32_hsw+0x69>
+  .byte  116,195                             // je            4849 <_sk_store_f32_hsw+0x69>
   .byte  196,67,125,25,76,129,80,1           // vextractf128  $0x1,%ymm9,0x50(%r9,%rax,4)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,181                             // jb            4621 <_sk_store_f32_hsw+0x69>
+  .byte  114,181                             // jb            4849 <_sk_store_f32_hsw+0x69>
   .byte  196,67,125,25,68,129,96,1           // vextractf128  $0x1,%ymm8,0x60(%r9,%rax,4)
-  .byte  235,171                             // jmp           4621 <_sk_store_f32_hsw+0x69>
+  .byte  235,171                             // jmp           4849 <_sk_store_f32_hsw+0x69>
 
 HIDDEN _sk_clamp_x_hsw
 .globl _sk_clamp_x_hsw
@@ -15005,7 +15465,7 @@
   .byte  196,65,124,92,218                   // vsubps        %ymm10,%ymm0,%ymm11
   .byte  196,193,58,88,192                   // vaddss        %xmm8,%xmm8,%xmm0
   .byte  196,98,125,24,192                   // vbroadcastss  %xmm0,%ymm8
-  .byte  197,178,89,5,161,15,0,0             // vmulss        0xfa1(%rip),%xmm9,%xmm0        # 56dc <_sk_callback_hsw+0x4c0>
+  .byte  197,178,89,5,177,15,0,0             // vmulss        0xfb1(%rip),%xmm9,%xmm0        # 5914 <_sk_callback_hsw+0x4d0>
   .byte  196,226,125,24,192                  // vbroadcastss  %xmm0,%ymm0
   .byte  197,164,89,192                      // vmulps        %ymm0,%ymm11,%ymm0
   .byte  196,227,125,8,192,1                 // vroundps      $0x1,%ymm0,%ymm0
@@ -15031,7 +15491,7 @@
   .byte  196,65,116,92,218                   // vsubps        %ymm10,%ymm1,%ymm11
   .byte  196,193,58,88,200                   // vaddss        %xmm8,%xmm8,%xmm1
   .byte  196,98,125,24,193                   // vbroadcastss  %xmm1,%ymm8
-  .byte  197,178,89,13,69,15,0,0             // vmulss        0xf45(%rip),%xmm9,%xmm1        # 56e0 <_sk_callback_hsw+0x4c4>
+  .byte  197,178,89,13,85,15,0,0             // vmulss        0xf55(%rip),%xmm9,%xmm1        # 5918 <_sk_callback_hsw+0x4d4>
   .byte  196,226,125,24,201                  // vbroadcastss  %xmm1,%ymm1
   .byte  197,164,89,201                      // vmulps        %ymm1,%ymm11,%ymm1
   .byte  196,227,125,8,201,1                 // vroundps      $0x1,%ymm1,%ymm1
@@ -15052,7 +15512,7 @@
 _sk_clamp_x_1_hsw:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  197,188,95,192                      // vmaxps        %ymm0,%ymm8,%ymm0
-  .byte  196,98,125,24,5,254,14,0,0          // vbroadcastss  0xefe(%rip),%ymm8        # 56e4 <_sk_callback_hsw+0x4c8>
+  .byte  196,98,125,24,5,14,15,0,0           // vbroadcastss  0xf0e(%rip),%ymm8        # 591c <_sk_callback_hsw+0x4d8>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -15070,9 +15530,9 @@
 .globl _sk_mirror_x_1_hsw
 FUNCTION(_sk_mirror_x_1_hsw)
 _sk_mirror_x_1_hsw:
-  .byte  196,98,125,24,5,225,14,0,0          // vbroadcastss  0xee1(%rip),%ymm8        # 56e8 <_sk_callback_hsw+0x4cc>
+  .byte  196,98,125,24,5,241,14,0,0          // vbroadcastss  0xef1(%rip),%ymm8        # 5920 <_sk_callback_hsw+0x4dc>
   .byte  196,193,124,88,192                  // vaddps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,13,215,14,0,0         // vbroadcastss  0xed7(%rip),%ymm9        # 56ec <_sk_callback_hsw+0x4d0>
+  .byte  196,98,125,24,13,231,14,0,0         // vbroadcastss  0xee7(%rip),%ymm9        # 5924 <_sk_callback_hsw+0x4e0>
   .byte  196,65,124,89,201                   // vmulps        %ymm9,%ymm0,%ymm9
   .byte  196,67,125,8,201,1                  // vroundps      $0x1,%ymm9,%ymm9
   .byte  196,65,52,88,201                    // vaddps        %ymm9,%ymm9,%ymm9
@@ -15088,11 +15548,11 @@
 .globl _sk_luminance_to_alpha_hsw
 FUNCTION(_sk_luminance_to_alpha_hsw)
 _sk_luminance_to_alpha_hsw:
-  .byte  196,226,125,24,29,167,14,0,0        // vbroadcastss  0xea7(%rip),%ymm3        # 56f0 <_sk_callback_hsw+0x4d4>
-  .byte  196,98,125,24,5,162,14,0,0          // vbroadcastss  0xea2(%rip),%ymm8        # 56f4 <_sk_callback_hsw+0x4d8>
+  .byte  196,226,125,24,29,183,14,0,0        // vbroadcastss  0xeb7(%rip),%ymm3        # 5928 <_sk_callback_hsw+0x4e4>
+  .byte  196,98,125,24,5,178,14,0,0          // vbroadcastss  0xeb2(%rip),%ymm8        # 592c <_sk_callback_hsw+0x4e8>
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
   .byte  196,226,125,184,203                 // vfmadd231ps   %ymm3,%ymm0,%ymm1
-  .byte  196,226,125,24,29,147,14,0,0        // vbroadcastss  0xe93(%rip),%ymm3        # 56f8 <_sk_callback_hsw+0x4dc>
+  .byte  196,226,125,24,29,163,14,0,0        // vbroadcastss  0xea3(%rip),%ymm3        # 5930 <_sk_callback_hsw+0x4ec>
   .byte  196,226,109,168,217                 // vfmadd213ps   %ymm1,%ymm2,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -15266,9 +15726,9 @@
   .byte  76,139,72,8                         // mov           0x8(%rax),%r9
   .byte  77,137,211                          // mov           %r10,%r11
   .byte  73,255,203                          // dec           %r11
-  .byte  120,7                               // js            4b1e <_sk_evenly_spaced_gradient_hsw+0x19>
+  .byte  120,7                               // js            4d46 <_sk_evenly_spaced_gradient_hsw+0x19>
   .byte  196,193,242,42,203                  // vcvtsi2ss     %r11,%xmm1,%xmm1
-  .byte  235,22                              // jmp           4b34 <_sk_evenly_spaced_gradient_hsw+0x2f>
+  .byte  235,22                              // jmp           4d5c <_sk_evenly_spaced_gradient_hsw+0x2f>
   .byte  76,137,219                          // mov           %r11,%rbx
   .byte  72,209,235                          // shr           %rbx
   .byte  65,131,227,1                        // and           $0x1,%r11d
@@ -15279,7 +15739,7 @@
   .byte  197,244,89,200                      // vmulps        %ymm0,%ymm1,%ymm1
   .byte  197,126,91,217                      // vcvttps2dq    %ymm1,%ymm11
   .byte  73,131,250,8                        // cmp           $0x8,%r10
-  .byte  119,70                              // ja            4b8d <_sk_evenly_spaced_gradient_hsw+0x88>
+  .byte  119,70                              // ja            4db5 <_sk_evenly_spaced_gradient_hsw+0x88>
   .byte  196,66,37,22,1                      // vpermps       (%r9),%ymm11,%ymm8
   .byte  72,139,88,40                        // mov           0x28(%rax),%rbx
   .byte  196,98,37,22,11                     // vpermps       (%rbx),%ymm11,%ymm9
@@ -15295,7 +15755,7 @@
   .byte  196,226,37,22,27                    // vpermps       (%rbx),%ymm11,%ymm3
   .byte  72,139,64,64                        // mov           0x40(%rax),%rax
   .byte  196,98,37,22,40                     // vpermps       (%rax),%ymm11,%ymm13
-  .byte  235,110                             // jmp           4bfb <_sk_evenly_spaced_gradient_hsw+0xf6>
+  .byte  235,110                             // jmp           4e23 <_sk_evenly_spaced_gradient_hsw+0xf6>
   .byte  196,65,13,118,246                   // vpcmpeqd      %ymm14,%ymm14,%ymm14
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,2,117,146,4,153                 // vgatherdps    %ymm1,(%r9,%ymm11,4),%ymm8
@@ -15332,14 +15792,14 @@
 .globl _sk_gauss_a_to_rgba_hsw
 FUNCTION(_sk_gauss_a_to_rgba_hsw)
 _sk_gauss_a_to_rgba_hsw:
-  .byte  196,226,125,24,5,219,10,0,0         // vbroadcastss  0xadb(%rip),%ymm0        # 56fc <_sk_callback_hsw+0x4e0>
-  .byte  196,226,125,24,13,214,10,0,0        // vbroadcastss  0xad6(%rip),%ymm1        # 5700 <_sk_callback_hsw+0x4e4>
+  .byte  196,226,125,24,5,235,10,0,0         // vbroadcastss  0xaeb(%rip),%ymm0        # 5934 <_sk_callback_hsw+0x4f0>
+  .byte  196,226,125,24,13,230,10,0,0        // vbroadcastss  0xae6(%rip),%ymm1        # 5938 <_sk_callback_hsw+0x4f4>
   .byte  196,226,101,168,200                 // vfmadd213ps   %ymm0,%ymm3,%ymm1
-  .byte  196,226,125,24,5,204,10,0,0         // vbroadcastss  0xacc(%rip),%ymm0        # 5704 <_sk_callback_hsw+0x4e8>
+  .byte  196,226,125,24,5,220,10,0,0         // vbroadcastss  0xadc(%rip),%ymm0        # 593c <_sk_callback_hsw+0x4f8>
   .byte  196,226,101,184,193                 // vfmadd231ps   %ymm1,%ymm3,%ymm0
-  .byte  196,226,125,24,13,194,10,0,0        // vbroadcastss  0xac2(%rip),%ymm1        # 5708 <_sk_callback_hsw+0x4ec>
+  .byte  196,226,125,24,13,210,10,0,0        // vbroadcastss  0xad2(%rip),%ymm1        # 5940 <_sk_callback_hsw+0x4fc>
   .byte  196,226,101,184,200                 // vfmadd231ps   %ymm0,%ymm3,%ymm1
-  .byte  196,226,125,24,5,184,10,0,0         // vbroadcastss  0xab8(%rip),%ymm0        # 570c <_sk_callback_hsw+0x4f0>
+  .byte  196,226,125,24,5,200,10,0,0         // vbroadcastss  0xac8(%rip),%ymm0        # 5944 <_sk_callback_hsw+0x500>
   .byte  196,226,101,184,193                 // vfmadd231ps   %ymm1,%ymm3,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
@@ -15354,11 +15814,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  73,131,249,1                        // cmp           $0x1,%r9
-  .byte  15,134,180,0,0,0                    // jbe           4d2c <_sk_gradient_hsw+0xc3>
+  .byte  15,134,180,0,0,0                    // jbe           4f54 <_sk_gradient_hsw+0xc3>
   .byte  76,139,80,72                        // mov           0x48(%rax),%r10
   .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
   .byte  65,187,1,0,0,0                      // mov           $0x1,%r11d
-  .byte  196,226,125,24,21,129,10,0,0        // vbroadcastss  0xa81(%rip),%ymm2        # 5710 <_sk_callback_hsw+0x4f4>
+  .byte  196,226,125,24,21,145,10,0,0        // vbroadcastss  0xa91(%rip),%ymm2        # 5948 <_sk_callback_hsw+0x504>
   .byte  196,65,53,239,201                   // vpxor         %ymm9,%ymm9,%ymm9
   .byte  196,130,125,24,28,154               // vbroadcastss  (%r10,%r11,4),%ymm3
   .byte  197,228,194,216,2                   // vcmpleps      %ymm0,%ymm3,%ymm3
@@ -15366,10 +15826,10 @@
   .byte  196,65,101,254,201                  // vpaddd        %ymm9,%ymm3,%ymm9
   .byte  73,255,195                          // inc           %r11
   .byte  77,57,217                           // cmp           %r11,%r9
-  .byte  117,226                             // jne           4c94 <_sk_gradient_hsw+0x2b>
+  .byte  117,226                             // jne           4ebc <_sk_gradient_hsw+0x2b>
   .byte  76,139,80,8                         // mov           0x8(%rax),%r10
   .byte  73,131,249,8                        // cmp           $0x8,%r9
-  .byte  118,121                             // jbe           4d35 <_sk_gradient_hsw+0xcc>
+  .byte  118,121                             // jbe           4f5d <_sk_gradient_hsw+0xcc>
   .byte  196,65,13,118,246                   // vpcmpeqd      %ymm14,%ymm14,%ymm14
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,2,117,146,4,138                 // vgatherdps    %ymm1,(%r10,%ymm9,4),%ymm8
@@ -15393,7 +15853,7 @@
   .byte  196,130,21,146,28,137               // vgatherdps    %ymm13,(%r9,%ymm9,4),%ymm3
   .byte  72,139,64,64                        // mov           0x40(%rax),%rax
   .byte  196,34,13,146,44,136                // vgatherdps    %ymm14,(%rax,%ymm9,4),%ymm13
-  .byte  235,77                              // jmp           4d79 <_sk_gradient_hsw+0x110>
+  .byte  235,77                              // jmp           4fa1 <_sk_gradient_hsw+0x110>
   .byte  76,139,80,8                         // mov           0x8(%rax),%r10
   .byte  196,65,52,87,201                    // vxorps        %ymm9,%ymm9,%ymm9
   .byte  196,66,53,22,2                      // vpermps       (%r10),%ymm9,%ymm8
@@ -15453,24 +15913,24 @@
   .byte  196,65,52,95,226                    // vmaxps        %ymm10,%ymm9,%ymm12
   .byte  196,65,36,94,220                    // vdivps        %ymm12,%ymm11,%ymm11
   .byte  196,65,36,89,227                    // vmulps        %ymm11,%ymm11,%ymm12
-  .byte  196,98,125,24,45,0,9,0,0            // vbroadcastss  0x900(%rip),%ymm13        # 5714 <_sk_callback_hsw+0x4f8>
-  .byte  196,98,125,24,53,251,8,0,0          // vbroadcastss  0x8fb(%rip),%ymm14        # 5718 <_sk_callback_hsw+0x4fc>
+  .byte  196,98,125,24,45,16,9,0,0           // vbroadcastss  0x910(%rip),%ymm13        # 594c <_sk_callback_hsw+0x508>
+  .byte  196,98,125,24,53,11,9,0,0           // vbroadcastss  0x90b(%rip),%ymm14        # 5950 <_sk_callback_hsw+0x50c>
   .byte  196,66,29,184,245                   // vfmadd231ps   %ymm13,%ymm12,%ymm14
-  .byte  196,98,125,24,45,241,8,0,0          // vbroadcastss  0x8f1(%rip),%ymm13        # 571c <_sk_callback_hsw+0x500>
+  .byte  196,98,125,24,45,1,9,0,0            // vbroadcastss  0x901(%rip),%ymm13        # 5954 <_sk_callback_hsw+0x510>
   .byte  196,66,29,184,238                   // vfmadd231ps   %ymm14,%ymm12,%ymm13
-  .byte  196,98,125,24,53,231,8,0,0          // vbroadcastss  0x8e7(%rip),%ymm14        # 5720 <_sk_callback_hsw+0x504>
+  .byte  196,98,125,24,53,247,8,0,0          // vbroadcastss  0x8f7(%rip),%ymm14        # 5958 <_sk_callback_hsw+0x514>
   .byte  196,66,29,184,245                   // vfmadd231ps   %ymm13,%ymm12,%ymm14
   .byte  196,65,36,89,222                    // vmulps        %ymm14,%ymm11,%ymm11
   .byte  196,65,52,194,202,1                 // vcmpltps      %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,21,210,8,0,0          // vbroadcastss  0x8d2(%rip),%ymm10        # 5724 <_sk_callback_hsw+0x508>
+  .byte  196,98,125,24,21,226,8,0,0          // vbroadcastss  0x8e2(%rip),%ymm10        # 595c <_sk_callback_hsw+0x518>
   .byte  196,65,44,92,211                    // vsubps        %ymm11,%ymm10,%ymm10
   .byte  196,67,37,74,202,144                // vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   .byte  196,193,124,194,192,1               // vcmpltps      %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,21,188,8,0,0          // vbroadcastss  0x8bc(%rip),%ymm10        # 5728 <_sk_callback_hsw+0x50c>
+  .byte  196,98,125,24,21,204,8,0,0          // vbroadcastss  0x8cc(%rip),%ymm10        # 5960 <_sk_callback_hsw+0x51c>
   .byte  196,65,44,92,209                    // vsubps        %ymm9,%ymm10,%ymm10
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  196,65,116,194,200,1                // vcmpltps      %ymm8,%ymm1,%ymm9
-  .byte  196,98,125,24,21,166,8,0,0          // vbroadcastss  0x8a6(%rip),%ymm10        # 572c <_sk_callback_hsw+0x510>
+  .byte  196,98,125,24,21,182,8,0,0          // vbroadcastss  0x8b6(%rip),%ymm10        # 5964 <_sk_callback_hsw+0x520>
   .byte  197,44,92,208                       // vsubps        %ymm0,%ymm10,%ymm10
   .byte  196,195,125,74,194,144              // vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   .byte  196,65,124,194,200,3                // vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -15493,7 +15953,7 @@
 FUNCTION(_sk_save_xy_hsw)
 _sk_save_xy_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,115,8,0,0           // vbroadcastss  0x873(%rip),%ymm8        # 5730 <_sk_callback_hsw+0x514>
+  .byte  196,98,125,24,5,131,8,0,0           // vbroadcastss  0x883(%rip),%ymm8        # 5968 <_sk_callback_hsw+0x524>
   .byte  196,65,124,88,200                   // vaddps        %ymm8,%ymm0,%ymm9
   .byte  196,67,125,8,209,1                  // vroundps      $0x1,%ymm9,%ymm10
   .byte  196,65,52,92,202                    // vsubps        %ymm10,%ymm9,%ymm9
@@ -15527,9 +15987,9 @@
 FUNCTION(_sk_bilinear_nx_hsw)
 _sk_bilinear_nx_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,7,8,0,0            // vbroadcastss  0x807(%rip),%ymm0        # 5734 <_sk_callback_hsw+0x518>
+  .byte  196,226,125,24,5,23,8,0,0           // vbroadcastss  0x817(%rip),%ymm0        # 596c <_sk_callback_hsw+0x528>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,254,7,0,0           // vbroadcastss  0x7fe(%rip),%ymm8        # 5738 <_sk_callback_hsw+0x51c>
+  .byte  196,98,125,24,5,14,8,0,0            // vbroadcastss  0x80e(%rip),%ymm8        # 5970 <_sk_callback_hsw+0x52c>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -15540,7 +16000,7 @@
 FUNCTION(_sk_bilinear_px_hsw)
 _sk_bilinear_px_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,230,7,0,0          // vbroadcastss  0x7e6(%rip),%ymm0        # 573c <_sk_callback_hsw+0x520>
+  .byte  196,226,125,24,5,246,7,0,0          // vbroadcastss  0x7f6(%rip),%ymm0        # 5974 <_sk_callback_hsw+0x530>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -15552,9 +16012,9 @@
 FUNCTION(_sk_bilinear_ny_hsw)
 _sk_bilinear_ny_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,202,7,0,0         // vbroadcastss  0x7ca(%rip),%ymm1        # 5740 <_sk_callback_hsw+0x524>
+  .byte  196,226,125,24,13,218,7,0,0         // vbroadcastss  0x7da(%rip),%ymm1        # 5978 <_sk_callback_hsw+0x534>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,192,7,0,0           // vbroadcastss  0x7c0(%rip),%ymm8        # 5744 <_sk_callback_hsw+0x528>
+  .byte  196,98,125,24,5,208,7,0,0           // vbroadcastss  0x7d0(%rip),%ymm8        # 597c <_sk_callback_hsw+0x538>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -15565,7 +16025,7 @@
 FUNCTION(_sk_bilinear_py_hsw)
 _sk_bilinear_py_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,168,7,0,0         // vbroadcastss  0x7a8(%rip),%ymm1        # 5748 <_sk_callback_hsw+0x52c>
+  .byte  196,226,125,24,13,184,7,0,0         // vbroadcastss  0x7b8(%rip),%ymm1        # 5980 <_sk_callback_hsw+0x53c>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -15577,13 +16037,13 @@
 FUNCTION(_sk_bicubic_n3x_hsw)
 _sk_bicubic_n3x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,139,7,0,0          // vbroadcastss  0x78b(%rip),%ymm0        # 574c <_sk_callback_hsw+0x530>
+  .byte  196,226,125,24,5,155,7,0,0          // vbroadcastss  0x79b(%rip),%ymm0        # 5984 <_sk_callback_hsw+0x540>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,130,7,0,0           // vbroadcastss  0x782(%rip),%ymm8        # 5750 <_sk_callback_hsw+0x534>
+  .byte  196,98,125,24,5,146,7,0,0           // vbroadcastss  0x792(%rip),%ymm8        # 5988 <_sk_callback_hsw+0x544>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,115,7,0,0          // vbroadcastss  0x773(%rip),%ymm10        # 5754 <_sk_callback_hsw+0x538>
-  .byte  196,98,125,24,29,110,7,0,0          // vbroadcastss  0x76e(%rip),%ymm11        # 5758 <_sk_callback_hsw+0x53c>
+  .byte  196,98,125,24,21,131,7,0,0          // vbroadcastss  0x783(%rip),%ymm10        # 598c <_sk_callback_hsw+0x548>
+  .byte  196,98,125,24,29,126,7,0,0          // vbroadcastss  0x77e(%rip),%ymm11        # 5990 <_sk_callback_hsw+0x54c>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,36,89,193                    // vmulps        %ymm9,%ymm11,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -15595,16 +16055,16 @@
 FUNCTION(_sk_bicubic_n1x_hsw)
 _sk_bicubic_n1x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,81,7,0,0           // vbroadcastss  0x751(%rip),%ymm0        # 575c <_sk_callback_hsw+0x540>
+  .byte  196,226,125,24,5,97,7,0,0           // vbroadcastss  0x761(%rip),%ymm0        # 5994 <_sk_callback_hsw+0x550>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,72,7,0,0            // vbroadcastss  0x748(%rip),%ymm8        # 5760 <_sk_callback_hsw+0x544>
+  .byte  196,98,125,24,5,88,7,0,0            // vbroadcastss  0x758(%rip),%ymm8        # 5998 <_sk_callback_hsw+0x554>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,62,7,0,0           // vbroadcastss  0x73e(%rip),%ymm9        # 5764 <_sk_callback_hsw+0x548>
-  .byte  196,98,125,24,21,57,7,0,0           // vbroadcastss  0x739(%rip),%ymm10        # 5768 <_sk_callback_hsw+0x54c>
+  .byte  196,98,125,24,13,78,7,0,0           // vbroadcastss  0x74e(%rip),%ymm9        # 599c <_sk_callback_hsw+0x558>
+  .byte  196,98,125,24,21,73,7,0,0           // vbroadcastss  0x749(%rip),%ymm10        # 59a0 <_sk_callback_hsw+0x55c>
   .byte  196,66,61,168,209                   // vfmadd213ps   %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,13,47,7,0,0           // vbroadcastss  0x72f(%rip),%ymm9        # 576c <_sk_callback_hsw+0x550>
+  .byte  196,98,125,24,13,63,7,0,0           // vbroadcastss  0x73f(%rip),%ymm9        # 59a4 <_sk_callback_hsw+0x560>
   .byte  196,66,61,184,202                   // vfmadd231ps   %ymm10,%ymm8,%ymm9
-  .byte  196,98,125,24,21,37,7,0,0           // vbroadcastss  0x725(%rip),%ymm10        # 5770 <_sk_callback_hsw+0x554>
+  .byte  196,98,125,24,21,53,7,0,0           // vbroadcastss  0x735(%rip),%ymm10        # 59a8 <_sk_callback_hsw+0x564>
   .byte  196,66,61,184,209                   // vfmadd231ps   %ymm9,%ymm8,%ymm10
   .byte  197,124,17,144,128,0,0,0            // vmovups       %ymm10,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -15615,14 +16075,14 @@
 FUNCTION(_sk_bicubic_p1x_hsw)
 _sk_bicubic_p1x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,13,7,0,0            // vbroadcastss  0x70d(%rip),%ymm8        # 5774 <_sk_callback_hsw+0x558>
+  .byte  196,98,125,24,5,29,7,0,0            // vbroadcastss  0x71d(%rip),%ymm8        # 59ac <_sk_callback_hsw+0x568>
   .byte  197,188,88,0                        // vaddps        (%rax),%ymm8,%ymm0
   .byte  197,124,16,72,64                    // vmovups       0x40(%rax),%ymm9
-  .byte  196,98,125,24,21,255,6,0,0          // vbroadcastss  0x6ff(%rip),%ymm10        # 5778 <_sk_callback_hsw+0x55c>
-  .byte  196,98,125,24,29,250,6,0,0          // vbroadcastss  0x6fa(%rip),%ymm11        # 577c <_sk_callback_hsw+0x560>
+  .byte  196,98,125,24,21,15,7,0,0           // vbroadcastss  0x70f(%rip),%ymm10        # 59b0 <_sk_callback_hsw+0x56c>
+  .byte  196,98,125,24,29,10,7,0,0           // vbroadcastss  0x70a(%rip),%ymm11        # 59b4 <_sk_callback_hsw+0x570>
   .byte  196,66,53,168,218                   // vfmadd213ps   %ymm10,%ymm9,%ymm11
   .byte  196,66,53,168,216                   // vfmadd213ps   %ymm8,%ymm9,%ymm11
-  .byte  196,98,125,24,5,235,6,0,0           // vbroadcastss  0x6eb(%rip),%ymm8        # 5780 <_sk_callback_hsw+0x564>
+  .byte  196,98,125,24,5,251,6,0,0           // vbroadcastss  0x6fb(%rip),%ymm8        # 59b8 <_sk_callback_hsw+0x574>
   .byte  196,66,53,184,195                   // vfmadd231ps   %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -15633,12 +16093,12 @@
 FUNCTION(_sk_bicubic_p3x_hsw)
 _sk_bicubic_p3x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,211,6,0,0          // vbroadcastss  0x6d3(%rip),%ymm0        # 5784 <_sk_callback_hsw+0x568>
+  .byte  196,226,125,24,5,227,6,0,0          // vbroadcastss  0x6e3(%rip),%ymm0        # 59bc <_sk_callback_hsw+0x578>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,192,6,0,0          // vbroadcastss  0x6c0(%rip),%ymm10        # 5788 <_sk_callback_hsw+0x56c>
-  .byte  196,98,125,24,29,187,6,0,0          // vbroadcastss  0x6bb(%rip),%ymm11        # 578c <_sk_callback_hsw+0x570>
+  .byte  196,98,125,24,21,208,6,0,0          // vbroadcastss  0x6d0(%rip),%ymm10        # 59c0 <_sk_callback_hsw+0x57c>
+  .byte  196,98,125,24,29,203,6,0,0          // vbroadcastss  0x6cb(%rip),%ymm11        # 59c4 <_sk_callback_hsw+0x580>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,52,89,195                    // vmulps        %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -15650,13 +16110,13 @@
 FUNCTION(_sk_bicubic_n3y_hsw)
 _sk_bicubic_n3y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,158,6,0,0         // vbroadcastss  0x69e(%rip),%ymm1        # 5790 <_sk_callback_hsw+0x574>
+  .byte  196,226,125,24,13,174,6,0,0         // vbroadcastss  0x6ae(%rip),%ymm1        # 59c8 <_sk_callback_hsw+0x584>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,148,6,0,0           // vbroadcastss  0x694(%rip),%ymm8        # 5794 <_sk_callback_hsw+0x578>
+  .byte  196,98,125,24,5,164,6,0,0           // vbroadcastss  0x6a4(%rip),%ymm8        # 59cc <_sk_callback_hsw+0x588>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,133,6,0,0          // vbroadcastss  0x685(%rip),%ymm10        # 5798 <_sk_callback_hsw+0x57c>
-  .byte  196,98,125,24,29,128,6,0,0          // vbroadcastss  0x680(%rip),%ymm11        # 579c <_sk_callback_hsw+0x580>
+  .byte  196,98,125,24,21,149,6,0,0          // vbroadcastss  0x695(%rip),%ymm10        # 59d0 <_sk_callback_hsw+0x58c>
+  .byte  196,98,125,24,29,144,6,0,0          // vbroadcastss  0x690(%rip),%ymm11        # 59d4 <_sk_callback_hsw+0x590>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,36,89,193                    // vmulps        %ymm9,%ymm11,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -15668,16 +16128,16 @@
 FUNCTION(_sk_bicubic_n1y_hsw)
 _sk_bicubic_n1y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,99,6,0,0          // vbroadcastss  0x663(%rip),%ymm1        # 57a0 <_sk_callback_hsw+0x584>
+  .byte  196,226,125,24,13,115,6,0,0         // vbroadcastss  0x673(%rip),%ymm1        # 59d8 <_sk_callback_hsw+0x594>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,89,6,0,0            // vbroadcastss  0x659(%rip),%ymm8        # 57a4 <_sk_callback_hsw+0x588>
+  .byte  196,98,125,24,5,105,6,0,0           // vbroadcastss  0x669(%rip),%ymm8        # 59dc <_sk_callback_hsw+0x598>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,79,6,0,0           // vbroadcastss  0x64f(%rip),%ymm9        # 57a8 <_sk_callback_hsw+0x58c>
-  .byte  196,98,125,24,21,74,6,0,0           // vbroadcastss  0x64a(%rip),%ymm10        # 57ac <_sk_callback_hsw+0x590>
+  .byte  196,98,125,24,13,95,6,0,0           // vbroadcastss  0x65f(%rip),%ymm9        # 59e0 <_sk_callback_hsw+0x59c>
+  .byte  196,98,125,24,21,90,6,0,0           // vbroadcastss  0x65a(%rip),%ymm10        # 59e4 <_sk_callback_hsw+0x5a0>
   .byte  196,66,61,168,209                   // vfmadd213ps   %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,13,64,6,0,0           // vbroadcastss  0x640(%rip),%ymm9        # 57b0 <_sk_callback_hsw+0x594>
+  .byte  196,98,125,24,13,80,6,0,0           // vbroadcastss  0x650(%rip),%ymm9        # 59e8 <_sk_callback_hsw+0x5a4>
   .byte  196,66,61,184,202                   // vfmadd231ps   %ymm10,%ymm8,%ymm9
-  .byte  196,98,125,24,21,54,6,0,0           // vbroadcastss  0x636(%rip),%ymm10        # 57b4 <_sk_callback_hsw+0x598>
+  .byte  196,98,125,24,21,70,6,0,0           // vbroadcastss  0x646(%rip),%ymm10        # 59ec <_sk_callback_hsw+0x5a8>
   .byte  196,66,61,184,209                   // vfmadd231ps   %ymm9,%ymm8,%ymm10
   .byte  197,124,17,144,160,0,0,0            // vmovups       %ymm10,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -15688,14 +16148,14 @@
 FUNCTION(_sk_bicubic_p1y_hsw)
 _sk_bicubic_p1y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,30,6,0,0            // vbroadcastss  0x61e(%rip),%ymm8        # 57b8 <_sk_callback_hsw+0x59c>
+  .byte  196,98,125,24,5,46,6,0,0            // vbroadcastss  0x62e(%rip),%ymm8        # 59f0 <_sk_callback_hsw+0x5ac>
   .byte  197,188,88,72,32                    // vaddps        0x20(%rax),%ymm8,%ymm1
   .byte  197,124,16,72,96                    // vmovups       0x60(%rax),%ymm9
-  .byte  196,98,125,24,21,15,6,0,0           // vbroadcastss  0x60f(%rip),%ymm10        # 57bc <_sk_callback_hsw+0x5a0>
-  .byte  196,98,125,24,29,10,6,0,0           // vbroadcastss  0x60a(%rip),%ymm11        # 57c0 <_sk_callback_hsw+0x5a4>
+  .byte  196,98,125,24,21,31,6,0,0           // vbroadcastss  0x61f(%rip),%ymm10        # 59f4 <_sk_callback_hsw+0x5b0>
+  .byte  196,98,125,24,29,26,6,0,0           // vbroadcastss  0x61a(%rip),%ymm11        # 59f8 <_sk_callback_hsw+0x5b4>
   .byte  196,66,53,168,218                   // vfmadd213ps   %ymm10,%ymm9,%ymm11
   .byte  196,66,53,168,216                   // vfmadd213ps   %ymm8,%ymm9,%ymm11
-  .byte  196,98,125,24,5,251,5,0,0           // vbroadcastss  0x5fb(%rip),%ymm8        # 57c4 <_sk_callback_hsw+0x5a8>
+  .byte  196,98,125,24,5,11,6,0,0            // vbroadcastss  0x60b(%rip),%ymm8        # 59fc <_sk_callback_hsw+0x5b8>
   .byte  196,66,53,184,195                   // vfmadd231ps   %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -15706,12 +16166,12 @@
 FUNCTION(_sk_bicubic_p3y_hsw)
 _sk_bicubic_p3y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,227,5,0,0         // vbroadcastss  0x5e3(%rip),%ymm1        # 57c8 <_sk_callback_hsw+0x5ac>
+  .byte  196,226,125,24,13,243,5,0,0         // vbroadcastss  0x5f3(%rip),%ymm1        # 5a00 <_sk_callback_hsw+0x5bc>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,207,5,0,0          // vbroadcastss  0x5cf(%rip),%ymm10        # 57cc <_sk_callback_hsw+0x5b0>
-  .byte  196,98,125,24,29,202,5,0,0          // vbroadcastss  0x5ca(%rip),%ymm11        # 57d0 <_sk_callback_hsw+0x5b4>
+  .byte  196,98,125,24,21,223,5,0,0          // vbroadcastss  0x5df(%rip),%ymm10        # 5a04 <_sk_callback_hsw+0x5c0>
+  .byte  196,98,125,24,29,218,5,0,0          // vbroadcastss  0x5da(%rip),%ymm11        # 5a08 <_sk_callback_hsw+0x5c4>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,52,89,195                    // vmulps        %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -15841,25 +16301,25 @@
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 5411 <.literal4+0xb1>
+  .byte  71,225,61                           // rex.RXB       loope 5639 <.literal4+0xb1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 5421 <.literal4+0xc1>
+  .byte  71,225,61                           // rex.RXB       loope 5649 <.literal4+0xc1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 5431 <.literal4+0xd1>
+  .byte  71,225,61                           // rex.RXB       loope 5659 <.literal4+0xd1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 5441 <.literal4+0xe1>
+  .byte  71,225,61                           // rex.RXB       loope 5669 <.literal4+0xe1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,127                    // add           %al,0x7f00003f(%rax)
@@ -15921,7 +16381,7 @@
   .byte  190,129,128,128,59                  // mov           $0x3b808081,%esi
   .byte  129,128,128,59,0,248,0,0,8,33       // addl          $0x21080000,-0x7ffc480(%rax)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        54b1 <.literal4+0x151>
+  .byte  224,7                               // loopne        56d9 <.literal4+0x151>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -15937,10 +16397,10 @@
   .byte  129,128,128,59,129,128,128,59,0,0   // addl          $0x3b80,-0x7f7ec480(%rax)
   .byte  0,52,255                            // add           %dh,(%rdi,%rdi,8)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            54d8 <.literal4+0x178>
+  .byte  127,0                               // jg            5700 <.literal4+0x178>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            5551 <.literal4+0x1f1>
+  .byte  119,115                             // ja            5779 <.literal4+0x1f1>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -15954,10 +16414,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            550c <.literal4+0x1ac>
+  .byte  127,0                               // jg            5734 <.literal4+0x1ac>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            5585 <.literal4+0x225>
+  .byte  119,115                             // ja            57ad <.literal4+0x225>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -15971,10 +16431,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5540 <.literal4+0x1e0>
+  .byte  127,0                               // jg            5768 <.literal4+0x1e0>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            55b9 <.literal4+0x259>
+  .byte  119,115                             // ja            57e1 <.literal4+0x259>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -15988,10 +16448,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5574 <.literal4+0x214>
+  .byte  127,0                               // jg            579c <.literal4+0x214>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            55ed <.literal4+0x28d>
+  .byte  119,115                             // ja            5815 <.literal4+0x28d>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -16004,7 +16464,7 @@
   .byte  0,75,0                              // add           %cl,0x0(%rbx)
   .byte  0,128,63,0,0,200                    // add           %al,-0x37ffffc1(%rax)
   .byte  66,0,0                              // rex.X         add %al,(%rax)
-  .byte  127,67                              // jg            55eb <.literal4+0x28b>
+  .byte  127,67                              // jg            5813 <.literal4+0x28b>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%rax)
@@ -16016,7 +16476,7 @@
   .byte  190,80,128,3,62                     // mov           $0x3e038050,%esi
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           560b <.literal4+0x2ab>
+  .byte  118,63                              // jbe           5833 <.literal4+0x2ab>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
@@ -16031,7 +16491,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        560d <.literal4+0x2ad>
+  .byte  224,7                               // loopne        5835 <.literal4+0x2ad>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -16043,7 +16503,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        5629 <.literal4+0x2c9>
+  .byte  224,7                               // loopne        5851 <.literal4+0x2c9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -16055,7 +16515,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        5645 <.literal4+0x2e5>
+  .byte  224,7                               // loopne        586d <.literal4+0x2e5>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -16066,7 +16526,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  248                                 // clc
   .byte  65,0,0                              // add           %al,(%r8)
-  .byte  124,66                              // jl            569a <.literal4+0x33a>
+  .byte  124,66                              // jl            58c2 <.literal4+0x33a>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,55,0,15                 // mov           %ecx,0xf003788(%rax)
@@ -16092,7 +16552,10 @@
   .byte  137,136,136,59,15,0                 // mov           %ecx,0xf3b88(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,61,0,0                  // mov           %ecx,0x3d88(%rax)
-  .byte  112,65                              // jo            56fd <.literal4+0x39d>
+  .byte  112,65                              // jo            5925 <.literal4+0x39d>
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
+  .byte  128,59,0                            // cmpb          $0x0,(%rbx)
+  .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
@@ -16103,7 +16566,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  255                                 // (bad)
-  .byte  127,71                              // jg            5723 <.literal4+0x3c3>
+  .byte  127,71                              // jg            595b <.literal4+0x3d3>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -16215,16 +16678,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005808 <_sk_callback_hsw+0xa0005ec>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005a48 <_sk_callback_hsw+0xa000604>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005810 <_sk_callback_hsw+0x120005f4>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005a50 <_sk_callback_hsw+0x1200060c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005818 <_sk_callback_hsw+0x1a0005fc>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005a58 <_sk_callback_hsw+0x1a000614>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005820 <_sk_callback_hsw+0x3000604>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005a60 <_sk_callback_hsw+0x300061c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -16267,16 +16730,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005868 <_sk_callback_hsw+0xa00064c>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005aa8 <_sk_callback_hsw+0xa000664>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005870 <_sk_callback_hsw+0x12000654>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005ab0 <_sk_callback_hsw+0x1200066c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005878 <_sk_callback_hsw+0x1a00065c>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005ab8 <_sk_callback_hsw+0x1a000674>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005880 <_sk_callback_hsw+0x3000664>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005ac0 <_sk_callback_hsw+0x300067c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -16319,16 +16782,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a0058c8 <_sk_callback_hsw+0xa0006ac>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005b08 <_sk_callback_hsw+0xa0006c4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 120058d0 <_sk_callback_hsw+0x120006b4>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005b10 <_sk_callback_hsw+0x120006cc>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a0058d8 <_sk_callback_hsw+0x1a0006bc>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005b18 <_sk_callback_hsw+0x1a0006d4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 30058e0 <_sk_callback_hsw+0x30006c4>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005b20 <_sk_callback_hsw+0x30006dc>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -16371,16 +16834,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005928 <_sk_callback_hsw+0xa00070c>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005b68 <_sk_callback_hsw+0xa000724>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005930 <_sk_callback_hsw+0x12000714>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005b70 <_sk_callback_hsw+0x1200072c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005938 <_sk_callback_hsw+0x1a00071c>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005b78 <_sk_callback_hsw+0x1a000734>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005940 <_sk_callback_hsw+0x3000724>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005b80 <_sk_callback_hsw+0x300073c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -16423,16 +16886,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005988 <_sk_callback_hsw+0xa00076c>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005bc8 <_sk_callback_hsw+0xa000784>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005990 <_sk_callback_hsw+0x12000774>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005bd0 <_sk_callback_hsw+0x1200078c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005998 <_sk_callback_hsw+0x1a00077c>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005bd8 <_sk_callback_hsw+0x1a000794>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 30059a0 <_sk_callback_hsw+0x3000784>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005be0 <_sk_callback_hsw+0x300079c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -16475,16 +16938,172 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a0059e8 <_sk_callback_hsw+0xa0007cc>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005c28 <_sk_callback_hsw+0xa0007e4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 120059f0 <_sk_callback_hsw+0x120007d4>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005c30 <_sk_callback_hsw+0x120007ec>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a0059f8 <_sk_callback_hsw+0x1a0007dc>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005c38 <_sk_callback_hsw+0x1a0007f4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005a00 <_sk_callback_hsw+0x30007e4>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005c40 <_sk_callback_hsw+0x30007fc>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,6                               // incl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,10                              // decl          (%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,14                              // decl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,18                              // callq         *(%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,22                              // callq         *(%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,26                              // lcall         *(%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,30                              // lcall         *(%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  1,255                               // add           %edi,%edi
+  .byte  255                                 // (bad)
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005c88 <_sk_callback_hsw+0xa000844>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005c90 <_sk_callback_hsw+0x1200084c>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005c98 <_sk_callback_hsw+0x1a000854>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005ca0 <_sk_callback_hsw+0x300085c>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,6                               // incl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,10                              // decl          (%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,14                              // decl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,18                              // callq         *(%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,22                              // callq         *(%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,26                              // lcall         *(%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,30                              // lcall         *(%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  1,255                               // add           %edi,%edi
+  .byte  255                                 // (bad)
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005ce8 <_sk_callback_hsw+0xa0008a4>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005cf0 <_sk_callback_hsw+0x120008ac>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005cf8 <_sk_callback_hsw+0x1a0008b4>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005d00 <_sk_callback_hsw+0x30008bc>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,6                               // incl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,10                              // decl          (%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,14                              // decl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,18                              // callq         *(%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,22                              // callq         *(%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,26                              // lcall         *(%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,30                              // lcall         *(%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  1,255                               // add           %edi,%edi
+  .byte  255                                 // (bad)
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005d48 <_sk_callback_hsw+0xa000904>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005d50 <_sk_callback_hsw+0x1200090c>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005d58 <_sk_callback_hsw+0x1a000914>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005d60 <_sk_callback_hsw+0x300091c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -16661,7 +17280,7 @@
   .byte  197,249,112,192,0                   // vpshufd       $0x0,%xmm0,%xmm0
   .byte  196,227,125,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,223,113,0,0       // vbroadcastss  0x71df(%rip),%ymm1        # 727c <_sk_callback_avx+0x142>
+  .byte  196,226,125,24,13,183,117,0,0       // vbroadcastss  0x75b7(%rip),%ymm1        # 7654 <_sk_callback_avx+0x142>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,88,7                        // vaddps        (%rdi),%ymm0,%ymm0
   .byte  197,249,110,209                     // vmovd         %ecx,%xmm2
@@ -16670,7 +17289,7 @@
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  197,236,88,201                      // vaddps        %ymm1,%ymm2,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,21,185,113,0,0       // vbroadcastss  0x71b9(%rip),%ymm2        # 7280 <_sk_callback_avx+0x146>
+  .byte  196,226,125,24,21,145,117,0,0       // vbroadcastss  0x7591(%rip),%ymm2        # 7658 <_sk_callback_avx+0x146>
   .byte  197,228,87,219                      // vxorps        %ymm3,%ymm3,%ymm3
   .byte  197,220,87,228                      // vxorps        %ymm4,%ymm4,%ymm4
   .byte  197,212,87,237                      // vxorps        %ymm5,%ymm5,%ymm5
@@ -16694,7 +17313,7 @@
   .byte  196,65,121,112,201,0                // vpshufd       $0x0,%xmm9,%xmm9
   .byte  196,67,53,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm9,%ymm9
   .byte  196,65,52,87,208                    // vxorps        %ymm8,%ymm9,%ymm10
-  .byte  196,98,125,24,29,98,113,0,0         // vbroadcastss  0x7162(%rip),%ymm11        # 7284 <_sk_callback_avx+0x14a>
+  .byte  196,98,125,24,29,58,117,0,0         // vbroadcastss  0x753a(%rip),%ymm11        # 765c <_sk_callback_avx+0x14a>
   .byte  196,65,44,84,203                    // vandps        %ymm11,%ymm10,%ymm9
   .byte  196,193,25,114,241,5                // vpslld        $0x5,%xmm9,%xmm12
   .byte  196,67,125,25,201,1                 // vextractf128  $0x1,%ymm9,%xmm9
@@ -16705,8 +17324,8 @@
   .byte  196,67,125,25,219,1                 // vextractf128  $0x1,%ymm11,%xmm11
   .byte  196,193,33,114,243,4                // vpslld        $0x4,%xmm11,%xmm11
   .byte  196,67,29,24,219,1                  // vinsertf128   $0x1,%xmm11,%ymm12,%ymm11
-  .byte  196,98,125,24,37,35,113,0,0         // vbroadcastss  0x7123(%rip),%ymm12        # 7288 <_sk_callback_avx+0x14e>
-  .byte  196,98,125,24,45,30,113,0,0         // vbroadcastss  0x711e(%rip),%ymm13        # 728c <_sk_callback_avx+0x152>
+  .byte  196,98,125,24,37,251,116,0,0        // vbroadcastss  0x74fb(%rip),%ymm12        # 7660 <_sk_callback_avx+0x14e>
+  .byte  196,98,125,24,45,246,116,0,0        // vbroadcastss  0x74f6(%rip),%ymm13        # 7664 <_sk_callback_avx+0x152>
   .byte  196,65,44,84,245                    // vandps        %ymm13,%ymm10,%ymm14
   .byte  196,193,1,114,246,2                 // vpslld        $0x2,%xmm14,%xmm15
   .byte  196,67,125,25,246,1                 // vextractf128  $0x1,%ymm14,%xmm14
@@ -16733,9 +17352,9 @@
   .byte  196,65,60,86,193                    // vorps         %ymm9,%ymm8,%ymm8
   .byte  196,65,60,86,194                    // vorps         %ymm10,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,137,112,0,0        // vbroadcastss  0x7089(%rip),%ymm9        # 7290 <_sk_callback_avx+0x156>
+  .byte  196,98,125,24,13,97,116,0,0         // vbroadcastss  0x7461(%rip),%ymm9        # 7668 <_sk_callback_avx+0x156>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,127,112,0,0        // vbroadcastss  0x707f(%rip),%ymm9        # 7294 <_sk_callback_avx+0x15a>
+  .byte  196,98,125,24,13,87,116,0,0         // vbroadcastss  0x7457(%rip),%ymm9        # 766c <_sk_callback_avx+0x15a>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  196,98,125,24,8                     // vbroadcastss  (%rax),%ymm9
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
@@ -16804,7 +17423,7 @@
 FUNCTION(_sk_srcatop_avx)
 _sk_srcatop_avx:
   .byte  197,252,89,199                      // vmulps        %ymm7,%ymm0,%ymm0
-  .byte  196,98,125,24,5,215,111,0,0         // vbroadcastss  0x6fd7(%rip),%ymm8        # 7298 <_sk_callback_avx+0x15e>
+  .byte  196,98,125,24,5,175,115,0,0         // vbroadcastss  0x73af(%rip),%ymm8        # 7670 <_sk_callback_avx+0x15e>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,204                       // vmulps        %ymm4,%ymm8,%ymm9
   .byte  197,180,88,192                      // vaddps        %ymm0,%ymm9,%ymm0
@@ -16825,7 +17444,7 @@
 FUNCTION(_sk_dstatop_avx)
 _sk_dstatop_avx:
   .byte  197,100,89,196                      // vmulps        %ymm4,%ymm3,%ymm8
-  .byte  196,98,125,24,13,153,111,0,0        // vbroadcastss  0x6f99(%rip),%ymm9        # 729c <_sk_callback_avx+0x162>
+  .byte  196,98,125,24,13,113,115,0,0        // vbroadcastss  0x7371(%rip),%ymm9        # 7674 <_sk_callback_avx+0x162>
   .byte  197,52,92,207                       // vsubps        %ymm7,%ymm9,%ymm9
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
   .byte  197,188,88,192                      // vaddps        %ymm0,%ymm8,%ymm0
@@ -16867,7 +17486,7 @@
 .globl _sk_srcout_avx
 FUNCTION(_sk_srcout_avx)
 _sk_srcout_avx:
-  .byte  196,98,125,24,5,56,111,0,0          // vbroadcastss  0x6f38(%rip),%ymm8        # 72a0 <_sk_callback_avx+0x166>
+  .byte  196,98,125,24,5,16,115,0,0          // vbroadcastss  0x7310(%rip),%ymm8        # 7678 <_sk_callback_avx+0x166>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -16880,7 +17499,7 @@
 .globl _sk_dstout_avx
 FUNCTION(_sk_dstout_avx)
 _sk_dstout_avx:
-  .byte  196,226,125,24,5,27,111,0,0         // vbroadcastss  0x6f1b(%rip),%ymm0        # 72a4 <_sk_callback_avx+0x16a>
+  .byte  196,226,125,24,5,243,114,0,0        // vbroadcastss  0x72f3(%rip),%ymm0        # 767c <_sk_callback_avx+0x16a>
   .byte  197,252,92,219                      // vsubps        %ymm3,%ymm0,%ymm3
   .byte  197,228,89,196                      // vmulps        %ymm4,%ymm3,%ymm0
   .byte  197,228,89,205                      // vmulps        %ymm5,%ymm3,%ymm1
@@ -16893,7 +17512,7 @@
 .globl _sk_srcover_avx
 FUNCTION(_sk_srcover_avx)
 _sk_srcover_avx:
-  .byte  196,98,125,24,5,254,110,0,0         // vbroadcastss  0x6efe(%rip),%ymm8        # 72a8 <_sk_callback_avx+0x16e>
+  .byte  196,98,125,24,5,214,114,0,0         // vbroadcastss  0x72d6(%rip),%ymm8        # 7680 <_sk_callback_avx+0x16e>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,204                       // vmulps        %ymm4,%ymm8,%ymm9
   .byte  197,180,88,192                      // vaddps        %ymm0,%ymm9,%ymm0
@@ -16910,7 +17529,7 @@
 .globl _sk_dstover_avx
 FUNCTION(_sk_dstover_avx)
 _sk_dstover_avx:
-  .byte  196,98,125,24,5,209,110,0,0         // vbroadcastss  0x6ed1(%rip),%ymm8        # 72ac <_sk_callback_avx+0x172>
+  .byte  196,98,125,24,5,169,114,0,0         // vbroadcastss  0x72a9(%rip),%ymm8        # 7684 <_sk_callback_avx+0x172>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,252,88,196                      // vaddps        %ymm4,%ymm0,%ymm0
@@ -16938,7 +17557,7 @@
 .globl _sk_multiply_avx
 FUNCTION(_sk_multiply_avx)
 _sk_multiply_avx:
-  .byte  196,98,125,24,5,144,110,0,0         // vbroadcastss  0x6e90(%rip),%ymm8        # 72b0 <_sk_callback_avx+0x176>
+  .byte  196,98,125,24,5,104,114,0,0         // vbroadcastss  0x7268(%rip),%ymm8        # 7688 <_sk_callback_avx+0x176>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,208                       // vmulps        %ymm0,%ymm9,%ymm10
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -16998,7 +17617,7 @@
 .globl _sk_xor__avx
 FUNCTION(_sk_xor__avx)
 _sk_xor__avx:
-  .byte  196,98,125,24,5,223,109,0,0         // vbroadcastss  0x6ddf(%rip),%ymm8        # 72b4 <_sk_callback_avx+0x17a>
+  .byte  196,98,125,24,5,183,113,0,0         // vbroadcastss  0x71b7(%rip),%ymm8        # 768c <_sk_callback_avx+0x17a>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -17035,7 +17654,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,95,209                  // vmaxps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,95,109,0,0          // vbroadcastss  0x6d5f(%rip),%ymm8        # 72b8 <_sk_callback_avx+0x17e>
+  .byte  196,98,125,24,5,55,113,0,0          // vbroadcastss  0x7137(%rip),%ymm8        # 7690 <_sk_callback_avx+0x17e>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -17061,7 +17680,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,11,109,0,0          // vbroadcastss  0x6d0b(%rip),%ymm8        # 72bc <_sk_callback_avx+0x182>
+  .byte  196,98,125,24,5,227,112,0,0         // vbroadcastss  0x70e3(%rip),%ymm8        # 7694 <_sk_callback_avx+0x182>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -17090,7 +17709,7 @@
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,171,108,0,0         // vbroadcastss  0x6cab(%rip),%ymm8        # 72c0 <_sk_callback_avx+0x186>
+  .byte  196,98,125,24,5,131,112,0,0         // vbroadcastss  0x7083(%rip),%ymm8        # 7698 <_sk_callback_avx+0x186>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -17113,7 +17732,7 @@
   .byte  197,236,89,214                      // vmulps        %ymm6,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,102,108,0,0         // vbroadcastss  0x6c66(%rip),%ymm8        # 72c4 <_sk_callback_avx+0x18a>
+  .byte  196,98,125,24,5,62,112,0,0          // vbroadcastss  0x703e(%rip),%ymm8        # 769c <_sk_callback_avx+0x18a>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -17124,7 +17743,7 @@
 .globl _sk_colorburn_avx
 FUNCTION(_sk_colorburn_avx)
 _sk_colorburn_avx:
-  .byte  196,98,125,24,5,81,108,0,0          // vbroadcastss  0x6c51(%rip),%ymm8        # 72c8 <_sk_callback_avx+0x18e>
+  .byte  196,98,125,24,5,41,112,0,0          // vbroadcastss  0x7029(%rip),%ymm8        # 76a0 <_sk_callback_avx+0x18e>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,216                       // vmulps        %ymm0,%ymm9,%ymm11
   .byte  196,65,44,87,210                    // vxorps        %ymm10,%ymm10,%ymm10
@@ -17186,7 +17805,7 @@
 FUNCTION(_sk_colordodge_avx)
 _sk_colordodge_avx:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
-  .byte  196,98,125,24,13,77,107,0,0         // vbroadcastss  0x6b4d(%rip),%ymm9        # 72cc <_sk_callback_avx+0x192>
+  .byte  196,98,125,24,13,37,111,0,0         // vbroadcastss  0x6f25(%rip),%ymm9        # 76a4 <_sk_callback_avx+0x192>
   .byte  197,52,92,215                       // vsubps        %ymm7,%ymm9,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,52,92,203                       // vsubps        %ymm3,%ymm9,%ymm9
@@ -17243,7 +17862,7 @@
 .globl _sk_hardlight_avx
 FUNCTION(_sk_hardlight_avx)
 _sk_hardlight_avx:
-  .byte  196,98,125,24,5,95,106,0,0          // vbroadcastss  0x6a5f(%rip),%ymm8        # 72d0 <_sk_callback_avx+0x196>
+  .byte  196,98,125,24,5,55,110,0,0          // vbroadcastss  0x6e37(%rip),%ymm8        # 76a8 <_sk_callback_avx+0x196>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,200                       // vmulps        %ymm0,%ymm10,%ymm9
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -17298,7 +17917,7 @@
 .globl _sk_overlay_avx
 FUNCTION(_sk_overlay_avx)
 _sk_overlay_avx:
-  .byte  196,98,125,24,5,136,105,0,0         // vbroadcastss  0x6988(%rip),%ymm8        # 72d4 <_sk_callback_avx+0x19a>
+  .byte  196,98,125,24,5,96,109,0,0          // vbroadcastss  0x6d60(%rip),%ymm8        # 76ac <_sk_callback_avx+0x19a>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,200                       // vmulps        %ymm0,%ymm10,%ymm9
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -17364,10 +17983,10 @@
   .byte  196,65,60,88,192                    // vaddps        %ymm8,%ymm8,%ymm8
   .byte  196,65,60,89,216                    // vmulps        %ymm8,%ymm8,%ymm11
   .byte  196,65,60,88,195                    // vaddps        %ymm11,%ymm8,%ymm8
-  .byte  196,98,125,24,29,127,104,0,0        // vbroadcastss  0x687f(%rip),%ymm11        # 72dc <_sk_callback_avx+0x1a2>
+  .byte  196,98,125,24,29,87,108,0,0         // vbroadcastss  0x6c57(%rip),%ymm11        # 76b4 <_sk_callback_avx+0x1a2>
   .byte  196,65,28,88,235                    // vaddps        %ymm11,%ymm12,%ymm13
   .byte  196,65,20,89,192                    // vmulps        %ymm8,%ymm13,%ymm8
-  .byte  196,98,125,24,45,112,104,0,0        // vbroadcastss  0x6870(%rip),%ymm13        # 72e0 <_sk_callback_avx+0x1a6>
+  .byte  196,98,125,24,45,72,108,0,0         // vbroadcastss  0x6c48(%rip),%ymm13        # 76b8 <_sk_callback_avx+0x1a6>
   .byte  196,65,28,89,245                    // vmulps        %ymm13,%ymm12,%ymm14
   .byte  196,65,12,88,192                    // vaddps        %ymm8,%ymm14,%ymm8
   .byte  196,65,124,82,244                   // vrsqrtps      %ymm12,%ymm14
@@ -17378,7 +17997,7 @@
   .byte  197,4,194,255,2                     // vcmpleps      %ymm7,%ymm15,%ymm15
   .byte  196,67,13,74,240,240                // vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   .byte  197,116,88,249                      // vaddps        %ymm1,%ymm1,%ymm15
-  .byte  196,98,125,24,5,46,104,0,0          // vbroadcastss  0x682e(%rip),%ymm8        # 72d8 <_sk_callback_avx+0x19e>
+  .byte  196,98,125,24,5,6,108,0,0           // vbroadcastss  0x6c06(%rip),%ymm8        # 76b0 <_sk_callback_avx+0x19e>
   .byte  196,65,60,92,228                    // vsubps        %ymm12,%ymm8,%ymm12
   .byte  197,132,92,195                      // vsubps        %ymm3,%ymm15,%ymm0
   .byte  196,65,124,89,228                   // vmulps        %ymm12,%ymm0,%ymm12
@@ -17505,12 +18124,12 @@
   .byte  196,65,28,89,219                    // vmulps        %ymm11,%ymm12,%ymm11
   .byte  196,65,36,94,222                    // vdivps        %ymm14,%ymm11,%ymm11
   .byte  196,67,37,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  .byte  196,98,125,24,53,253,101,0,0        // vbroadcastss  0x65fd(%rip),%ymm14        # 72e4 <_sk_callback_avx+0x1aa>
+  .byte  196,98,125,24,53,213,105,0,0        // vbroadcastss  0x69d5(%rip),%ymm14        # 76bc <_sk_callback_avx+0x1aa>
   .byte  196,65,92,89,222                    // vmulps        %ymm14,%ymm4,%ymm11
-  .byte  196,98,125,24,61,243,101,0,0        // vbroadcastss  0x65f3(%rip),%ymm15        # 72e8 <_sk_callback_avx+0x1ae>
+  .byte  196,98,125,24,61,203,105,0,0        // vbroadcastss  0x69cb(%rip),%ymm15        # 76c0 <_sk_callback_avx+0x1ae>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
-  .byte  196,226,125,24,5,228,101,0,0        // vbroadcastss  0x65e4(%rip),%ymm0        # 72ec <_sk_callback_avx+0x1b2>
+  .byte  196,226,125,24,5,188,105,0,0        // vbroadcastss  0x69bc(%rip),%ymm0        # 76c4 <_sk_callback_avx+0x1b2>
   .byte  197,76,89,232                       // vmulps        %ymm0,%ymm6,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
   .byte  196,65,52,89,238                    // vmulps        %ymm14,%ymm9,%ymm13
@@ -17571,7 +18190,7 @@
   .byte  196,65,36,95,208                    // vmaxps        %ymm8,%ymm11,%ymm10
   .byte  196,195,109,74,209,240              // vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,189,100,0,0         // vbroadcastss  0x64bd(%rip),%ymm8        # 72f0 <_sk_callback_avx+0x1b6>
+  .byte  196,98,125,24,5,149,104,0,0         // vbroadcastss  0x6895(%rip),%ymm8        # 76c8 <_sk_callback_avx+0x1b6>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,201                      // vmulps        %ymm1,%ymm9,%ymm1
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -17628,12 +18247,12 @@
   .byte  196,65,28,89,219                    // vmulps        %ymm11,%ymm12,%ymm11
   .byte  196,65,36,94,222                    // vdivps        %ymm14,%ymm11,%ymm11
   .byte  196,67,37,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  .byte  196,98,125,24,53,203,99,0,0         // vbroadcastss  0x63cb(%rip),%ymm14        # 72f4 <_sk_callback_avx+0x1ba>
+  .byte  196,98,125,24,53,163,103,0,0        // vbroadcastss  0x67a3(%rip),%ymm14        # 76cc <_sk_callback_avx+0x1ba>
   .byte  196,65,92,89,222                    // vmulps        %ymm14,%ymm4,%ymm11
-  .byte  196,98,125,24,61,193,99,0,0         // vbroadcastss  0x63c1(%rip),%ymm15        # 72f8 <_sk_callback_avx+0x1be>
+  .byte  196,98,125,24,61,153,103,0,0        // vbroadcastss  0x6799(%rip),%ymm15        # 76d0 <_sk_callback_avx+0x1be>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
-  .byte  196,226,125,24,5,178,99,0,0         // vbroadcastss  0x63b2(%rip),%ymm0        # 72fc <_sk_callback_avx+0x1c2>
+  .byte  196,226,125,24,5,138,103,0,0        // vbroadcastss  0x678a(%rip),%ymm0        # 76d4 <_sk_callback_avx+0x1c2>
   .byte  197,76,89,232                       // vmulps        %ymm0,%ymm6,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
   .byte  196,65,52,89,238                    // vmulps        %ymm14,%ymm9,%ymm13
@@ -17694,7 +18313,7 @@
   .byte  196,65,36,95,208                    // vmaxps        %ymm8,%ymm11,%ymm10
   .byte  196,195,109,74,209,240              // vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,139,98,0,0          // vbroadcastss  0x628b(%rip),%ymm8        # 7300 <_sk_callback_avx+0x1c6>
+  .byte  196,98,125,24,5,99,102,0,0          // vbroadcastss  0x6663(%rip),%ymm8        # 76d8 <_sk_callback_avx+0x1c6>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,201                      // vmulps        %ymm1,%ymm9,%ymm1
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -17723,12 +18342,12 @@
   .byte  197,252,17,68,36,168                // vmovups       %ymm0,-0x58(%rsp)
   .byte  197,124,89,199                      // vmulps        %ymm7,%ymm0,%ymm8
   .byte  197,116,89,207                      // vmulps        %ymm7,%ymm1,%ymm9
-  .byte  196,98,125,24,45,33,98,0,0          // vbroadcastss  0x6221(%rip),%ymm13        # 7304 <_sk_callback_avx+0x1ca>
+  .byte  196,98,125,24,45,249,101,0,0        // vbroadcastss  0x65f9(%rip),%ymm13        # 76dc <_sk_callback_avx+0x1ca>
   .byte  196,65,92,89,213                    // vmulps        %ymm13,%ymm4,%ymm10
-  .byte  196,98,125,24,53,23,98,0,0          // vbroadcastss  0x6217(%rip),%ymm14        # 7308 <_sk_callback_avx+0x1ce>
+  .byte  196,98,125,24,53,239,101,0,0        // vbroadcastss  0x65ef(%rip),%ymm14        # 76e0 <_sk_callback_avx+0x1ce>
   .byte  196,65,84,89,222                    // vmulps        %ymm14,%ymm5,%ymm11
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,24,61,8,98,0,0           // vbroadcastss  0x6208(%rip),%ymm15        # 730c <_sk_callback_avx+0x1d2>
+  .byte  196,98,125,24,61,224,101,0,0        // vbroadcastss  0x65e0(%rip),%ymm15        # 76e4 <_sk_callback_avx+0x1d2>
   .byte  196,65,76,89,223                    // vmulps        %ymm15,%ymm6,%ymm11
   .byte  196,193,44,88,195                   // vaddps        %ymm11,%ymm10,%ymm0
   .byte  196,65,60,89,221                    // vmulps        %ymm13,%ymm8,%ymm11
@@ -17791,7 +18410,7 @@
   .byte  196,65,44,95,207                    // vmaxps        %ymm15,%ymm10,%ymm9
   .byte  196,195,37,74,192,0                 // vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   .byte  196,65,124,95,199                   // vmaxps        %ymm15,%ymm0,%ymm8
-  .byte  196,226,125,24,5,207,96,0,0         // vbroadcastss  0x60cf(%rip),%ymm0        # 7310 <_sk_callback_avx+0x1d6>
+  .byte  196,226,125,24,5,167,100,0,0        // vbroadcastss  0x64a7(%rip),%ymm0        # 76e8 <_sk_callback_avx+0x1d6>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,84,36,168                // vmulps        -0x58(%rsp),%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -17821,12 +18440,12 @@
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  197,100,89,196                      // vmulps        %ymm4,%ymm3,%ymm8
   .byte  197,100,89,205                      // vmulps        %ymm5,%ymm3,%ymm9
-  .byte  196,98,125,24,45,97,96,0,0          // vbroadcastss  0x6061(%rip),%ymm13        # 7314 <_sk_callback_avx+0x1da>
+  .byte  196,98,125,24,45,57,100,0,0         // vbroadcastss  0x6439(%rip),%ymm13        # 76ec <_sk_callback_avx+0x1da>
   .byte  196,65,108,89,213                   // vmulps        %ymm13,%ymm2,%ymm10
-  .byte  196,98,125,24,53,87,96,0,0          // vbroadcastss  0x6057(%rip),%ymm14        # 7318 <_sk_callback_avx+0x1de>
+  .byte  196,98,125,24,53,47,100,0,0         // vbroadcastss  0x642f(%rip),%ymm14        # 76f0 <_sk_callback_avx+0x1de>
   .byte  196,65,116,89,222                   // vmulps        %ymm14,%ymm1,%ymm11
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,24,61,72,96,0,0          // vbroadcastss  0x6048(%rip),%ymm15        # 731c <_sk_callback_avx+0x1e2>
+  .byte  196,98,125,24,61,32,100,0,0         // vbroadcastss  0x6420(%rip),%ymm15        # 76f4 <_sk_callback_avx+0x1e2>
   .byte  196,65,28,89,223                    // vmulps        %ymm15,%ymm12,%ymm11
   .byte  196,193,44,88,195                   // vaddps        %ymm11,%ymm10,%ymm0
   .byte  196,65,60,89,221                    // vmulps        %ymm13,%ymm8,%ymm11
@@ -17889,7 +18508,7 @@
   .byte  196,65,44,95,207                    // vmaxps        %ymm15,%ymm10,%ymm9
   .byte  196,195,37,74,192,0                 // vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   .byte  196,65,124,95,199                   // vmaxps        %ymm15,%ymm0,%ymm8
-  .byte  196,226,125,24,5,15,95,0,0          // vbroadcastss  0x5f0f(%rip),%ymm0        # 7320 <_sk_callback_avx+0x1e6>
+  .byte  196,226,125,24,5,231,98,0,0         // vbroadcastss  0x62e7(%rip),%ymm0        # 76f8 <_sk_callback_avx+0x1e6>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -17920,7 +18539,7 @@
   .byte  77,133,192                          // test          %r8,%r8
   .byte  15,133,43,1,0,0                     // jne           15a0 <_sk_srcover_rgba_8888_avx+0x144>
   .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
-  .byte  197,124,40,13,254,99,0,0            // vmovaps       0x63fe(%rip),%ymm9        # 7880 <_sk_callback_avx+0x746>
+  .byte  197,124,40,13,62,104,0,0            // vmovaps       0x683e(%rip),%ymm9        # 7cc0 <_sk_callback_avx+0x7ae>
   .byte  196,193,68,84,225                   // vandps        %ymm9,%ymm7,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
   .byte  197,209,114,215,8                   // vpsrld        $0x8,%xmm7,%xmm5
@@ -17938,9 +18557,9 @@
   .byte  196,193,65,114,208,24               // vpsrld        $0x18,%xmm8,%xmm7
   .byte  196,227,53,24,255,1                 // vinsertf128   $0x1,%xmm7,%ymm9,%ymm7
   .byte  197,252,91,255                      // vcvtdq2ps     %ymm7,%ymm7
-  .byte  196,98,125,24,5,65,94,0,0           // vbroadcastss  0x5e41(%rip),%ymm8        # 7324 <_sk_callback_avx+0x1ea>
+  .byte  196,98,125,24,5,25,98,0,0           // vbroadcastss  0x6219(%rip),%ymm8        # 76fc <_sk_callback_avx+0x1ea>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
-  .byte  196,98,125,24,13,56,94,0,0          // vbroadcastss  0x5e38(%rip),%ymm9        # 7328 <_sk_callback_avx+0x1ee>
+  .byte  196,98,125,24,13,16,98,0,0          // vbroadcastss  0x6210(%rip),%ymm9        # 7700 <_sk_callback_avx+0x1ee>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  197,60,89,212                       // vmulps        %ymm4,%ymm8,%ymm10
   .byte  196,193,124,88,194                  // vaddps        %ymm10,%ymm0,%ymm0
@@ -17985,9 +18604,9 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
   .byte  196,226,121,48,228                  // vpmovzxbw     %xmm4,%xmm4
-  .byte  196,226,89,0,45,104,97,0,0          // vpshufb       0x6168(%rip),%xmm4,%xmm5        # 7730 <_sk_callback_avx+0x5f6>
+  .byte  196,226,89,0,45,72,101,0,0          // vpshufb       0x6548(%rip),%xmm4,%xmm5        # 7b10 <_sk_callback_avx+0x5fe>
   .byte  196,226,121,33,237                  // vpmovsxbd     %xmm5,%xmm5
-  .byte  196,226,89,0,37,106,97,0,0          // vpshufb       0x616a(%rip),%xmm4,%xmm4        # 7740 <_sk_callback_avx+0x606>
+  .byte  196,226,89,0,37,74,101,0,0          // vpshufb       0x654a(%rip),%xmm4,%xmm4        # 7b20 <_sk_callback_avx+0x60e>
   .byte  196,226,121,33,228                  // vpmovsxbd     %xmm4,%xmm4
   .byte  196,227,85,24,228,1                 // vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
   .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
@@ -17999,9 +18618,9 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
-  .byte  196,98,49,0,21,29,97,0,0            // vpshufb       0x611d(%rip),%xmm9,%xmm10        # 7730 <_sk_callback_avx+0x5f6>
+  .byte  196,98,49,0,21,253,100,0,0          // vpshufb       0x64fd(%rip),%xmm9,%xmm10        # 7b10 <_sk_callback_avx+0x5fe>
   .byte  196,66,121,33,210                   // vpmovsxbd     %xmm10,%xmm10
-  .byte  196,98,49,0,13,31,97,0,0            // vpshufb       0x611f(%rip),%xmm9,%xmm9        # 7740 <_sk_callback_avx+0x606>
+  .byte  196,98,49,0,13,255,100,0,0          // vpshufb       0x64ff(%rip),%xmm9,%xmm9        # 7b20 <_sk_callback_avx+0x60e>
   .byte  196,66,121,33,201                   // vpmovsxbd     %xmm9,%xmm9
   .byte  196,67,45,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
   .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
@@ -18023,7 +18642,7 @@
 .globl _sk_clamp_1_avx
 FUNCTION(_sk_clamp_1_avx)
 _sk_clamp_1_avx:
-  .byte  196,98,125,24,5,208,92,0,0          // vbroadcastss  0x5cd0(%rip),%ymm8        # 732c <_sk_callback_avx+0x1f2>
+  .byte  196,98,125,24,5,168,96,0,0          // vbroadcastss  0x60a8(%rip),%ymm8        # 7704 <_sk_callback_avx+0x1f2>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
@@ -18035,7 +18654,7 @@
 .globl _sk_clamp_a_avx
 FUNCTION(_sk_clamp_a_avx)
 _sk_clamp_a_avx:
-  .byte  196,98,125,24,5,179,92,0,0          // vbroadcastss  0x5cb3(%rip),%ymm8        # 7330 <_sk_callback_avx+0x1f6>
+  .byte  196,98,125,24,5,139,96,0,0          // vbroadcastss  0x608b(%rip),%ymm8        # 7708 <_sk_callback_avx+0x1f6>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  197,252,93,195                      // vminps        %ymm3,%ymm0,%ymm0
   .byte  197,244,93,203                      // vminps        %ymm3,%ymm1,%ymm1
@@ -18047,7 +18666,7 @@
 .globl _sk_clamp_a_dst_avx
 FUNCTION(_sk_clamp_a_dst_avx)
 _sk_clamp_a_dst_avx:
-  .byte  196,98,125,24,5,153,92,0,0          // vbroadcastss  0x5c99(%rip),%ymm8        # 7334 <_sk_callback_avx+0x1fa>
+  .byte  196,98,125,24,5,113,96,0,0          // vbroadcastss  0x6071(%rip),%ymm8        # 770c <_sk_callback_avx+0x1fa>
   .byte  196,193,68,93,248                   // vminps        %ymm8,%ymm7,%ymm7
   .byte  197,220,93,231                      // vminps        %ymm7,%ymm4,%ymm4
   .byte  197,212,93,239                      // vminps        %ymm7,%ymm5,%ymm5
@@ -18076,16 +18695,6 @@
   .byte  197,124,41,194                      // vmovaps       %ymm8,%ymm2
   .byte  255,224                             // jmpq          *%rax
 
-HIDDEN _sk_swap_rb_dst_avx
-.globl _sk_swap_rb_dst_avx
-FUNCTION(_sk_swap_rb_dst_avx)
-_sk_swap_rb_dst_avx:
-  .byte  197,124,40,196                      // vmovaps       %ymm4,%ymm8
-  .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  197,252,40,230                      // vmovaps       %ymm6,%ymm4
-  .byte  197,124,41,198                      // vmovaps       %ymm8,%ymm6
-  .byte  255,224                             // jmpq          *%rax
-
 HIDDEN _sk_move_src_dst_avx
 .globl _sk_move_src_dst_avx
 FUNCTION(_sk_move_src_dst_avx)
@@ -18124,7 +18733,7 @@
 _sk_unpremul_avx:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,65,100,194,200,0                // vcmpeqps      %ymm8,%ymm3,%ymm9
-  .byte  196,98,125,24,21,5,92,0,0           // vbroadcastss  0x5c05(%rip),%ymm10        # 7338 <_sk_callback_avx+0x1fe>
+  .byte  196,98,125,24,21,237,95,0,0         // vbroadcastss  0x5fed(%rip),%ymm10        # 7710 <_sk_callback_avx+0x1fe>
   .byte  197,44,94,211                       // vdivps        %ymm3,%ymm10,%ymm10
   .byte  196,67,45,74,192,144                // vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
@@ -18137,17 +18746,17 @@
 .globl _sk_from_srgb_avx
 FUNCTION(_sk_from_srgb_avx)
 _sk_from_srgb_avx:
-  .byte  196,98,125,24,5,230,91,0,0          // vbroadcastss  0x5be6(%rip),%ymm8        # 733c <_sk_callback_avx+0x202>
+  .byte  196,98,125,24,5,206,95,0,0          // vbroadcastss  0x5fce(%rip),%ymm8        # 7714 <_sk_callback_avx+0x202>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  197,124,89,208                      // vmulps        %ymm0,%ymm0,%ymm10
-  .byte  196,98,125,24,29,216,91,0,0         // vbroadcastss  0x5bd8(%rip),%ymm11        # 7340 <_sk_callback_avx+0x206>
+  .byte  196,98,125,24,29,192,95,0,0         // vbroadcastss  0x5fc0(%rip),%ymm11        # 7718 <_sk_callback_avx+0x206>
   .byte  196,65,124,89,227                   // vmulps        %ymm11,%ymm0,%ymm12
-  .byte  196,98,125,24,45,206,91,0,0         // vbroadcastss  0x5bce(%rip),%ymm13        # 7344 <_sk_callback_avx+0x20a>
+  .byte  196,98,125,24,45,182,95,0,0         // vbroadcastss  0x5fb6(%rip),%ymm13        # 771c <_sk_callback_avx+0x20a>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,44,89,212                    // vmulps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,191,91,0,0         // vbroadcastss  0x5bbf(%rip),%ymm12        # 7348 <_sk_callback_avx+0x20e>
+  .byte  196,98,125,24,37,167,95,0,0         // vbroadcastss  0x5fa7(%rip),%ymm12        # 7720 <_sk_callback_avx+0x20e>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,53,181,91,0,0         // vbroadcastss  0x5bb5(%rip),%ymm14        # 734c <_sk_callback_avx+0x212>
+  .byte  196,98,125,24,53,157,95,0,0         // vbroadcastss  0x5f9d(%rip),%ymm14        # 7724 <_sk_callback_avx+0x212>
   .byte  196,193,124,194,198,1               // vcmpltps      %ymm14,%ymm0,%ymm0
   .byte  196,195,45,74,193,0                 // vblendvps     %ymm0,%ymm9,%ymm10,%ymm0
   .byte  196,65,116,89,200                   // vmulps        %ymm8,%ymm1,%ymm9
@@ -18173,17 +18782,17 @@
 .globl _sk_from_srgb_dst_avx
 FUNCTION(_sk_from_srgb_dst_avx)
 _sk_from_srgb_dst_avx:
-  .byte  196,98,125,24,5,78,91,0,0           // vbroadcastss  0x5b4e(%rip),%ymm8        # 7350 <_sk_callback_avx+0x216>
+  .byte  196,98,125,24,5,54,95,0,0           // vbroadcastss  0x5f36(%rip),%ymm8        # 7728 <_sk_callback_avx+0x216>
   .byte  196,65,92,89,200                    // vmulps        %ymm8,%ymm4,%ymm9
   .byte  197,92,89,212                       // vmulps        %ymm4,%ymm4,%ymm10
-  .byte  196,98,125,24,29,64,91,0,0          // vbroadcastss  0x5b40(%rip),%ymm11        # 7354 <_sk_callback_avx+0x21a>
+  .byte  196,98,125,24,29,40,95,0,0          // vbroadcastss  0x5f28(%rip),%ymm11        # 772c <_sk_callback_avx+0x21a>
   .byte  196,65,92,89,227                    // vmulps        %ymm11,%ymm4,%ymm12
-  .byte  196,98,125,24,45,54,91,0,0          // vbroadcastss  0x5b36(%rip),%ymm13        # 7358 <_sk_callback_avx+0x21e>
+  .byte  196,98,125,24,45,30,95,0,0          // vbroadcastss  0x5f1e(%rip),%ymm13        # 7730 <_sk_callback_avx+0x21e>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,44,89,212                    // vmulps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,39,91,0,0          // vbroadcastss  0x5b27(%rip),%ymm12        # 735c <_sk_callback_avx+0x222>
+  .byte  196,98,125,24,37,15,95,0,0          // vbroadcastss  0x5f0f(%rip),%ymm12        # 7734 <_sk_callback_avx+0x222>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,53,29,91,0,0          // vbroadcastss  0x5b1d(%rip),%ymm14        # 7360 <_sk_callback_avx+0x226>
+  .byte  196,98,125,24,53,5,95,0,0           // vbroadcastss  0x5f05(%rip),%ymm14        # 7738 <_sk_callback_avx+0x226>
   .byte  196,193,92,194,230,1                // vcmpltps      %ymm14,%ymm4,%ymm4
   .byte  196,195,45,74,225,64                // vblendvps     %ymm4,%ymm9,%ymm10,%ymm4
   .byte  196,65,84,89,200                    // vmulps        %ymm8,%ymm5,%ymm9
@@ -18210,20 +18819,20 @@
 FUNCTION(_sk_to_srgb_avx)
 _sk_to_srgb_avx:
   .byte  197,124,82,200                      // vrsqrtps      %ymm0,%ymm9
-  .byte  196,98,125,24,5,178,90,0,0          // vbroadcastss  0x5ab2(%rip),%ymm8        # 7364 <_sk_callback_avx+0x22a>
+  .byte  196,98,125,24,5,154,94,0,0          // vbroadcastss  0x5e9a(%rip),%ymm8        # 773c <_sk_callback_avx+0x22a>
   .byte  196,65,124,89,208                   // vmulps        %ymm8,%ymm0,%ymm10
-  .byte  196,98,125,24,29,168,90,0,0         // vbroadcastss  0x5aa8(%rip),%ymm11        # 7368 <_sk_callback_avx+0x22e>
+  .byte  196,98,125,24,29,144,94,0,0         // vbroadcastss  0x5e90(%rip),%ymm11        # 7740 <_sk_callback_avx+0x22e>
   .byte  196,65,52,89,227                    // vmulps        %ymm11,%ymm9,%ymm12
-  .byte  196,98,125,24,45,158,90,0,0         // vbroadcastss  0x5a9e(%rip),%ymm13        # 736c <_sk_callback_avx+0x232>
+  .byte  196,98,125,24,45,134,94,0,0         // vbroadcastss  0x5e86(%rip),%ymm13        # 7744 <_sk_callback_avx+0x232>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,52,89,228                    // vmulps        %ymm12,%ymm9,%ymm12
-  .byte  196,98,125,24,53,143,90,0,0         // vbroadcastss  0x5a8f(%rip),%ymm14        # 7370 <_sk_callback_avx+0x236>
+  .byte  196,98,125,24,53,119,94,0,0         // vbroadcastss  0x5e77(%rip),%ymm14        # 7748 <_sk_callback_avx+0x236>
   .byte  196,65,28,88,230                    // vaddps        %ymm14,%ymm12,%ymm12
-  .byte  196,98,125,24,61,133,90,0,0         // vbroadcastss  0x5a85(%rip),%ymm15        # 7374 <_sk_callback_avx+0x23a>
+  .byte  196,98,125,24,61,109,94,0,0         // vbroadcastss  0x5e6d(%rip),%ymm15        # 774c <_sk_callback_avx+0x23a>
   .byte  196,65,52,88,207                    // vaddps        %ymm15,%ymm9,%ymm9
   .byte  196,65,124,83,201                   // vrcpps        %ymm9,%ymm9
   .byte  196,65,52,89,204                    // vmulps        %ymm12,%ymm9,%ymm9
-  .byte  196,98,125,24,37,113,90,0,0         // vbroadcastss  0x5a71(%rip),%ymm12        # 7378 <_sk_callback_avx+0x23e>
+  .byte  196,98,125,24,37,89,94,0,0          // vbroadcastss  0x5e59(%rip),%ymm12        # 7750 <_sk_callback_avx+0x23e>
   .byte  196,193,124,194,196,1               // vcmpltps      %ymm12,%ymm0,%ymm0
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  197,124,82,201                      // vrsqrtps      %ymm1,%ymm9
@@ -18260,7 +18869,7 @@
   .byte  197,124,93,201                      // vminps        %ymm1,%ymm0,%ymm9
   .byte  197,52,93,202                       // vminps        %ymm2,%ymm9,%ymm9
   .byte  196,65,60,92,209                    // vsubps        %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,29,215,89,0,0         // vbroadcastss  0x59d7(%rip),%ymm11        # 737c <_sk_callback_avx+0x242>
+  .byte  196,98,125,24,29,191,93,0,0         // vbroadcastss  0x5dbf(%rip),%ymm11        # 7754 <_sk_callback_avx+0x242>
   .byte  196,65,36,94,218                    // vdivps        %ymm10,%ymm11,%ymm11
   .byte  197,116,92,226                      // vsubps        %ymm2,%ymm1,%ymm12
   .byte  196,65,28,89,227                    // vmulps        %ymm11,%ymm12,%ymm12
@@ -18270,19 +18879,19 @@
   .byte  196,193,108,89,211                  // vmulps        %ymm11,%ymm2,%ymm2
   .byte  197,252,92,201                      // vsubps        %ymm1,%ymm0,%ymm1
   .byte  196,193,116,89,203                  // vmulps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,176,89,0,0         // vbroadcastss  0x59b0(%rip),%ymm11        # 7388 <_sk_callback_avx+0x24e>
+  .byte  196,98,125,24,29,152,93,0,0         // vbroadcastss  0x5d98(%rip),%ymm11        # 7760 <_sk_callback_avx+0x24e>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,158,89,0,0         // vbroadcastss  0x599e(%rip),%ymm11        # 7384 <_sk_callback_avx+0x24a>
+  .byte  196,98,125,24,29,134,93,0,0         // vbroadcastss  0x5d86(%rip),%ymm11        # 775c <_sk_callback_avx+0x24a>
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
   .byte  196,227,117,74,202,224              // vblendvps     %ymm14,%ymm2,%ymm1,%ymm1
-  .byte  196,226,125,24,21,134,89,0,0        // vbroadcastss  0x5986(%rip),%ymm2        # 7380 <_sk_callback_avx+0x246>
+  .byte  196,226,125,24,21,110,93,0,0        // vbroadcastss  0x5d6e(%rip),%ymm2        # 7758 <_sk_callback_avx+0x246>
   .byte  196,65,12,87,246                    // vxorps        %ymm14,%ymm14,%ymm14
   .byte  196,227,13,74,210,208               // vblendvps     %ymm13,%ymm2,%ymm14,%ymm2
   .byte  197,188,194,192,0                   // vcmpeqps      %ymm0,%ymm8,%ymm0
   .byte  196,193,108,88,212                  // vaddps        %ymm12,%ymm2,%ymm2
   .byte  196,227,117,74,194,0                // vblendvps     %ymm0,%ymm2,%ymm1,%ymm0
   .byte  196,193,60,88,201                   // vaddps        %ymm9,%ymm8,%ymm1
-  .byte  196,98,125,24,37,109,89,0,0         // vbroadcastss  0x596d(%rip),%ymm12        # 7390 <_sk_callback_avx+0x256>
+  .byte  196,98,125,24,37,85,93,0,0          // vbroadcastss  0x5d55(%rip),%ymm12        # 7768 <_sk_callback_avx+0x256>
   .byte  196,193,116,89,212                  // vmulps        %ymm12,%ymm1,%ymm2
   .byte  197,28,194,226,1                    // vcmpltps      %ymm2,%ymm12,%ymm12
   .byte  196,65,36,92,216                    // vsubps        %ymm8,%ymm11,%ymm11
@@ -18292,7 +18901,7 @@
   .byte  197,172,94,201                      // vdivps        %ymm1,%ymm10,%ymm1
   .byte  196,195,125,74,198,128              // vblendvps     %ymm8,%ymm14,%ymm0,%ymm0
   .byte  196,195,117,74,206,128              // vblendvps     %ymm8,%ymm14,%ymm1,%ymm1
-  .byte  196,98,125,24,5,48,89,0,0           // vbroadcastss  0x5930(%rip),%ymm8        # 738c <_sk_callback_avx+0x252>
+  .byte  196,98,125,24,5,24,93,0,0           // vbroadcastss  0x5d18(%rip),%ymm8        # 7764 <_sk_callback_avx+0x252>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -18309,7 +18918,7 @@
   .byte  197,252,17,92,36,128                // vmovups       %ymm3,-0x80(%rsp)
   .byte  197,252,40,225                      // vmovaps       %ymm1,%ymm4
   .byte  197,252,40,216                      // vmovaps       %ymm0,%ymm3
-  .byte  196,98,125,24,5,253,88,0,0          // vbroadcastss  0x58fd(%rip),%ymm8        # 7394 <_sk_callback_avx+0x25a>
+  .byte  196,98,125,24,5,229,92,0,0          // vbroadcastss  0x5ce5(%rip),%ymm8        # 776c <_sk_callback_avx+0x25a>
   .byte  197,60,194,202,2                    // vcmpleps      %ymm2,%ymm8,%ymm9
   .byte  197,92,89,210                       // vmulps        %ymm2,%ymm4,%ymm10
   .byte  196,65,92,92,218                    // vsubps        %ymm10,%ymm4,%ymm11
@@ -18317,23 +18926,23 @@
   .byte  197,52,88,210                       // vaddps        %ymm2,%ymm9,%ymm10
   .byte  197,108,88,202                      // vaddps        %ymm2,%ymm2,%ymm9
   .byte  196,65,52,92,202                    // vsubps        %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,29,215,88,0,0         // vbroadcastss  0x58d7(%rip),%ymm11        # 7398 <_sk_callback_avx+0x25e>
+  .byte  196,98,125,24,29,191,92,0,0         // vbroadcastss  0x5cbf(%rip),%ymm11        # 7770 <_sk_callback_avx+0x25e>
   .byte  196,65,100,88,219                   // vaddps        %ymm11,%ymm3,%ymm11
   .byte  196,67,125,8,227,1                  // vroundps      $0x1,%ymm11,%ymm12
   .byte  196,65,36,92,252                    // vsubps        %ymm12,%ymm11,%ymm15
   .byte  196,65,44,92,217                    // vsubps        %ymm9,%ymm10,%ymm11
-  .byte  196,98,125,24,37,193,88,0,0         // vbroadcastss  0x58c1(%rip),%ymm12        # 73a0 <_sk_callback_avx+0x266>
+  .byte  196,98,125,24,37,169,92,0,0         // vbroadcastss  0x5ca9(%rip),%ymm12        # 7778 <_sk_callback_avx+0x266>
   .byte  196,193,4,89,196                    // vmulps        %ymm12,%ymm15,%ymm0
-  .byte  196,98,125,24,45,183,88,0,0         // vbroadcastss  0x58b7(%rip),%ymm13        # 73a4 <_sk_callback_avx+0x26a>
+  .byte  196,98,125,24,45,159,92,0,0         // vbroadcastss  0x5c9f(%rip),%ymm13        # 777c <_sk_callback_avx+0x26a>
   .byte  197,20,92,240                       // vsubps        %ymm0,%ymm13,%ymm14
   .byte  196,65,36,89,246                    // vmulps        %ymm14,%ymm11,%ymm14
   .byte  196,65,52,88,246                    // vaddps        %ymm14,%ymm9,%ymm14
-  .byte  196,226,125,24,13,152,88,0,0        // vbroadcastss  0x5898(%rip),%ymm1        # 739c <_sk_callback_avx+0x262>
+  .byte  196,226,125,24,13,128,92,0,0        // vbroadcastss  0x5c80(%rip),%ymm1        # 7774 <_sk_callback_avx+0x262>
   .byte  196,193,116,194,255,2               // vcmpleps      %ymm15,%ymm1,%ymm7
   .byte  196,195,13,74,249,112               // vblendvps     %ymm7,%ymm9,%ymm14,%ymm7
   .byte  196,65,60,194,247,2                 // vcmpleps      %ymm15,%ymm8,%ymm14
   .byte  196,227,45,74,255,224               // vblendvps     %ymm14,%ymm7,%ymm10,%ymm7
-  .byte  196,98,125,24,53,131,88,0,0         // vbroadcastss  0x5883(%rip),%ymm14        # 73a8 <_sk_callback_avx+0x26e>
+  .byte  196,98,125,24,53,107,92,0,0         // vbroadcastss  0x5c6b(%rip),%ymm14        # 7780 <_sk_callback_avx+0x26e>
   .byte  196,65,12,194,255,2                 // vcmpleps      %ymm15,%ymm14,%ymm15
   .byte  196,193,124,89,195                  // vmulps        %ymm11,%ymm0,%ymm0
   .byte  197,180,88,192                      // vaddps        %ymm0,%ymm9,%ymm0
@@ -18352,7 +18961,7 @@
   .byte  197,164,89,247                      // vmulps        %ymm7,%ymm11,%ymm6
   .byte  197,180,88,246                      // vaddps        %ymm6,%ymm9,%ymm6
   .byte  196,227,77,74,237,0                 // vblendvps     %ymm0,%ymm5,%ymm6,%ymm5
-  .byte  196,226,125,24,5,37,88,0,0          // vbroadcastss  0x5825(%rip),%ymm0        # 73ac <_sk_callback_avx+0x272>
+  .byte  196,226,125,24,5,13,92,0,0          // vbroadcastss  0x5c0d(%rip),%ymm0        # 7784 <_sk_callback_avx+0x272>
   .byte  197,228,88,192                      // vaddps        %ymm0,%ymm3,%ymm0
   .byte  196,227,125,8,216,1                 // vroundps      $0x1,%ymm0,%ymm3
   .byte  197,252,92,195                      // vsubps        %ymm3,%ymm0,%ymm0
@@ -18402,15 +19011,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,74                              // jne           1c7e <_sk_scale_u8_avx+0x54>
+  .byte  117,74                              // jne           1c6e <_sk_scale_u8_avx+0x54>
   .byte  196,66,121,48,4,19                  // vpmovzxbw     (%r11,%rdx,1),%xmm8
-  .byte  197,57,219,5,14,91,0,0              // vpand         0x5b0e(%rip),%xmm8,%xmm8        # 7750 <_sk_callback_avx+0x616>
+  .byte  197,57,219,5,254,94,0,0             // vpand         0x5efe(%rip),%xmm8,%xmm8        # 7b30 <_sk_callback_avx+0x61e>
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  196,65,57,105,201                   // vpunpckhwd    %xmm9,%xmm8,%xmm9
   .byte  196,66,121,51,192                   // vpmovzxwd     %xmm8,%xmm8
   .byte  196,67,61,24,193,1                  // vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,75,87,0,0          // vbroadcastss  0x574b(%rip),%ymm9        # 73b0 <_sk_callback_avx+0x276>
+  .byte  196,98,125,24,13,51,91,0,0          // vbroadcastss  0x5b33(%rip),%ymm9        # 7788 <_sk_callback_avx+0x276>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -18423,15 +19032,15 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,167                             // ja            1c3a <_sk_scale_u8_avx+0x10>
+  .byte  119,167                             // ja            1c2a <_sk_scale_u8_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 1d18 <_sk_scale_u8_avx+0xee>
+  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 1d08 <_sk_scale_u8_avx+0xee>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  235,136                             // jmp           1c3a <_sk_scale_u8_avx+0x10>
+  .byte  235,136                             // jmp           1c2a <_sk_scale_u8_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,2                    // vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -18439,7 +19048,7 @@
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,57,14,193,3                  // vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  .byte  233,95,255,255,255                  // jmpq          1c3a <_sk_scale_u8_avx+0x10>
+  .byte  233,95,255,255,255                  // jmpq          1c2a <_sk_scale_u8_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,6                    // vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -18450,7 +19059,7 @@
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,49,14,192,240                // vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  .byte  233,35,255,255,255                  // jmpq          1c3a <_sk_scale_u8_avx+0x10>
+  .byte  233,35,255,255,255                  // jmpq          1c2a <_sk_scale_u8_avx+0x10>
   .byte  144                                 // nop
   .byte  143                                 // (bad)
   .byte  255                                 // (bad)
@@ -18459,7 +19068,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  233,255,255,255,222                 // jmpq          ffffffffdf001d28 <_sk_callback_avx+0xffffffffdeffabee>
+  .byte  233,255,255,255,222                 // jmpq          ffffffffdf001d18 <_sk_callback_avx+0xffffffffdeffa806>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,211                             // callq         *%rbx
@@ -18498,15 +19107,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,110                             // jne           1deb <_sk_lerp_u8_avx+0x78>
+  .byte  117,110                             // jne           1ddb <_sk_lerp_u8_avx+0x78>
   .byte  196,66,121,48,4,19                  // vpmovzxbw     (%r11,%rdx,1),%xmm8
-  .byte  197,57,219,5,213,89,0,0             // vpand         0x59d5(%rip),%xmm8,%xmm8        # 7760 <_sk_callback_avx+0x626>
+  .byte  197,57,219,5,197,93,0,0             // vpand         0x5dc5(%rip),%xmm8,%xmm8        # 7b40 <_sk_callback_avx+0x62e>
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  196,65,57,105,201                   // vpunpckhwd    %xmm9,%xmm8,%xmm9
   .byte  196,66,121,51,192                   // vpmovzxwd     %xmm8,%xmm8
   .byte  196,67,61,24,193,1                  // vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,6,86,0,0           // vbroadcastss  0x5606(%rip),%ymm9        # 73b4 <_sk_callback_avx+0x27a>
+  .byte  196,98,125,24,13,238,89,0,0         // vbroadcastss  0x59ee(%rip),%ymm9        # 778c <_sk_callback_avx+0x27a>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
@@ -18527,15 +19136,15 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,131                             // ja            1d83 <_sk_lerp_u8_avx+0x10>
+  .byte  119,131                             // ja            1d73 <_sk_lerp_u8_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,125,0,0,0                 // lea           0x7d(%rip),%r10        # 1e88 <_sk_lerp_u8_avx+0x115>
+  .byte  76,141,21,125,0,0,0                 // lea           0x7d(%rip),%r10        # 1e78 <_sk_lerp_u8_avx+0x115>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  233,97,255,255,255                  // jmpq          1d83 <_sk_lerp_u8_avx+0x10>
+  .byte  233,97,255,255,255                  // jmpq          1d73 <_sk_lerp_u8_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,2                    // vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -18543,7 +19152,7 @@
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,57,14,193,3                  // vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  .byte  233,56,255,255,255                  // jmpq          1d83 <_sk_lerp_u8_avx+0x10>
+  .byte  233,56,255,255,255                  // jmpq          1d73 <_sk_lerp_u8_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,6                    // vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -18554,7 +19163,7 @@
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,49,14,192,240                // vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  .byte  233,252,254,255,255                 // jmpq          1d83 <_sk_lerp_u8_avx+0x10>
+  .byte  233,252,254,255,255                 // jmpq          1d73 <_sk_lerp_u8_avx+0x10>
   .byte  144                                 // nop
   .byte  140,255                             // mov           %?,%edi
   .byte  255                                 // (bad)
@@ -18562,7 +19171,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  233,255,255,255,222                 // jmpq          ffffffffdf001e98 <_sk_callback_avx+0xffffffffdeffad5e>
+  .byte  233,255,255,255,222                 // jmpq          ffffffffdf001e88 <_sk_callback_avx+0xffffffffdeffa976>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,211                             // callq         *%rbx
@@ -18580,26 +19189,26 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,208,0,0,0                    // jne           1f82 <_sk_lerp_565_avx+0xde>
+  .byte  15,133,208,0,0,0                    // jne           1f72 <_sk_lerp_565_avx+0xde>
   .byte  196,65,122,111,4,83                 // vmovdqu       (%r11,%rdx,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  196,65,57,105,201                   // vpunpckhwd    %xmm9,%xmm8,%xmm9
   .byte  196,66,121,51,192                   // vpmovzxwd     %xmm8,%xmm8
   .byte  196,67,61,24,193,1                  // vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,226,84,0,0         // vbroadcastss  0x54e2(%rip),%ymm9        # 73b8 <_sk_callback_avx+0x27e>
+  .byte  196,98,125,24,13,202,88,0,0         // vbroadcastss  0x58ca(%rip),%ymm9        # 7790 <_sk_callback_avx+0x27e>
   .byte  196,65,60,84,201                    // vandps        %ymm9,%ymm8,%ymm9
   .byte  196,65,124,91,201                   // vcvtdq2ps     %ymm9,%ymm9
-  .byte  196,98,125,24,21,211,84,0,0         // vbroadcastss  0x54d3(%rip),%ymm10        # 73bc <_sk_callback_avx+0x282>
+  .byte  196,98,125,24,21,187,88,0,0         // vbroadcastss  0x58bb(%rip),%ymm10        # 7794 <_sk_callback_avx+0x282>
   .byte  196,65,52,89,202                    // vmulps        %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,21,201,84,0,0         // vbroadcastss  0x54c9(%rip),%ymm10        # 73c0 <_sk_callback_avx+0x286>
+  .byte  196,98,125,24,21,177,88,0,0         // vbroadcastss  0x58b1(%rip),%ymm10        # 7798 <_sk_callback_avx+0x286>
   .byte  196,65,60,84,210                    // vandps        %ymm10,%ymm8,%ymm10
   .byte  196,65,124,91,210                   // vcvtdq2ps     %ymm10,%ymm10
-  .byte  196,98,125,24,29,186,84,0,0         // vbroadcastss  0x54ba(%rip),%ymm11        # 73c4 <_sk_callback_avx+0x28a>
+  .byte  196,98,125,24,29,162,88,0,0         // vbroadcastss  0x58a2(%rip),%ymm11        # 779c <_sk_callback_avx+0x28a>
   .byte  196,65,44,89,211                    // vmulps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,24,29,176,84,0,0         // vbroadcastss  0x54b0(%rip),%ymm11        # 73c8 <_sk_callback_avx+0x28e>
+  .byte  196,98,125,24,29,152,88,0,0         // vbroadcastss  0x5898(%rip),%ymm11        # 77a0 <_sk_callback_avx+0x28e>
   .byte  196,65,60,84,195                    // vandps        %ymm11,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,29,161,84,0,0         // vbroadcastss  0x54a1(%rip),%ymm11        # 73cc <_sk_callback_avx+0x292>
+  .byte  196,98,125,24,29,137,88,0,0         // vbroadcastss  0x5889(%rip),%ymm11        # 77a4 <_sk_callback_avx+0x292>
   .byte  196,65,60,89,195                    // vmulps        %ymm11,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
@@ -18626,27 +19235,27 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,29,255,255,255               // ja            1eb8 <_sk_lerp_565_avx+0x14>
+  .byte  15,135,29,255,255,255               // ja            1ea8 <_sk_lerp_565_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,102,0,0,0                 // lea           0x66(%rip),%r10        # 200c <_sk_lerp_565_avx+0x168>
+  .byte  76,141,21,102,0,0,0                 // lea           0x66(%rip),%r10        # 1ffc <_sk_lerp_565_avx+0x168>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  233,251,254,255,255                 // jmpq          1eb8 <_sk_lerp_565_avx+0x14>
+  .byte  233,251,254,255,255                 // jmpq          1ea8 <_sk_lerp_565_avx+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,65,57,196,68,83,4,2             // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,121,110,12,83                // vmovd         (%r11,%rdx,2),%xmm9
   .byte  196,67,57,14,193,3                  // vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  .byte  233,221,254,255,255                 // jmpq          1eb8 <_sk_lerp_565_avx+0x14>
+  .byte  233,221,254,255,255                 // jmpq          1ea8 <_sk_lerp_565_avx+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,65,57,196,68,83,12,6            // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,57,196,68,83,10,5            // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,57,196,68,83,8,4             // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,122,126,12,83                // vmovq         (%r11,%rdx,2),%xmm9
   .byte  196,67,49,14,192,240                // vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  .byte  233,175,254,255,255                 // jmpq          1eb8 <_sk_lerp_565_avx+0x14>
+  .byte  233,175,254,255,255                 // jmpq          1ea8 <_sk_lerp_565_avx+0x14>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  163,255,255,255,190,255,255,255,177 // movabs        %eax,0xb1ffffffbeffffff
   .byte  255                                 // (bad)
@@ -18677,9 +19286,9 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,248,1,0,0                    // jne           2240 <_sk_load_tables_avx+0x218>
+  .byte  15,133,248,1,0,0                    // jne           2230 <_sk_load_tables_avx+0x218>
   .byte  196,65,124,16,18                    // vmovups       (%r10),%ymm10
-  .byte  197,124,40,13,75,88,0,0             // vmovaps       0x584b(%rip),%ymm9        # 78a0 <_sk_callback_avx+0x766>
+  .byte  197,124,40,13,155,92,0,0            // vmovaps       0x5c9b(%rip),%ymm9        # 7ce0 <_sk_callback_avx+0x7ce>
   .byte  196,193,44,84,201                   // vandps        %ymm9,%ymm10,%ymm1
   .byte  196,227,125,25,200,1                // vextractf128  $0x1,%ymm1,%xmm0
   .byte  196,193,249,126,195                 // vmovq         %xmm0,%r11
@@ -18771,7 +19380,7 @@
   .byte  196,193,65,114,208,24               // vpsrld        $0x18,%xmm8,%xmm7
   .byte  196,227,101,24,223,1                // vinsertf128   $0x1,%xmm7,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,226,125,24,61,162,81,0,0        // vbroadcastss  0x51a2(%rip),%ymm7        # 73d0 <_sk_callback_avx+0x296>
+  .byte  196,226,125,24,61,138,85,0,0        // vbroadcastss  0x558a(%rip),%ymm7        # 77a8 <_sk_callback_avx+0x296>
   .byte  197,228,89,223                      // vmulps        %ymm7,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -18785,13 +19394,13 @@
   .byte  73,211,235                          // shr           %cl,%r11
   .byte  196,193,249,110,195                 // vmovq         %r11,%xmm0
   .byte  196,226,121,48,192                  // vpmovzxbw     %xmm0,%xmm0
-  .byte  196,226,121,0,13,8,85,0,0           // vpshufb       0x5508(%rip),%xmm0,%xmm1        # 7770 <_sk_callback_avx+0x636>
+  .byte  196,226,121,0,13,248,88,0,0         // vpshufb       0x58f8(%rip),%xmm0,%xmm1        # 7b50 <_sk_callback_avx+0x63e>
   .byte  196,226,121,33,201                  // vpmovsxbd     %xmm1,%xmm1
-  .byte  196,226,121,0,5,10,85,0,0           // vpshufb       0x550a(%rip),%xmm0,%xmm0        # 7780 <_sk_callback_avx+0x646>
+  .byte  196,226,121,0,5,250,88,0,0          // vpshufb       0x58fa(%rip),%xmm0,%xmm0        # 7b60 <_sk_callback_avx+0x64e>
   .byte  196,226,121,33,192                  // vpmovsxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  196,66,125,44,18                    // vmaskmovps    (%r10),%ymm0,%ymm10
-  .byte  233,194,253,255,255                 // jmpq          204d <_sk_load_tables_avx+0x25>
+  .byte  233,194,253,255,255                 // jmpq          203d <_sk_load_tables_avx+0x25>
 
 HIDDEN _sk_load_tables_u16_be_avx
 .globl _sk_load_tables_u16_be_avx
@@ -18802,7 +19411,7 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  77,133,192                          // test          %r8,%r8
   .byte  197,252,17,124,36,200               // vmovups       %ymm7,-0x38(%rsp)
-  .byte  15,133,84,2,0,0                     // jne           24fb <_sk_load_tables_u16_be_avx+0x270>
+  .byte  15,133,84,2,0,0                     // jne           24eb <_sk_load_tables_u16_be_avx+0x270>
   .byte  196,1,121,16,4,81                   // vmovupd       (%r9,%r10,2),%xmm8
   .byte  196,129,121,16,84,81,16             // vmovupd       0x10(%r9,%r10,2),%xmm2
   .byte  196,129,121,16,92,81,32             // vmovupd       0x20(%r9,%r10,2),%xmm3
@@ -18817,7 +19426,7 @@
   .byte  197,113,105,219                     // vpunpckhwd    %xmm3,%xmm1,%xmm11
   .byte  197,177,108,200                     // vpunpcklqdq   %xmm0,%xmm9,%xmm1
   .byte  197,49,109,224                      // vpunpckhqdq   %xmm0,%xmm9,%xmm12
-  .byte  197,121,111,21,156,84,0,0           // vmovdqa       0x549c(%rip),%xmm10        # 7790 <_sk_callback_avx+0x656>
+  .byte  197,121,111,21,140,88,0,0           // vmovdqa       0x588c(%rip),%xmm10        # 7b70 <_sk_callback_avx+0x65e>
   .byte  196,193,113,219,202                 // vpand         %xmm10,%xmm1,%xmm1
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  196,193,113,105,209                 // vpunpckhwd    %xmm9,%xmm1,%xmm2
@@ -18915,7 +19524,7 @@
   .byte  196,226,121,51,219                  // vpmovzxwd     %xmm3,%xmm3
   .byte  196,227,101,24,223,1                // vinsertf128   $0x1,%xmm7,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,226,125,24,61,231,78,0,0        // vbroadcastss  0x4ee7(%rip),%ymm7        # 73d4 <_sk_callback_avx+0x29a>
+  .byte  196,226,125,24,61,207,82,0,0        // vbroadcastss  0x52cf(%rip),%ymm7        # 77ac <_sk_callback_avx+0x29a>
   .byte  197,228,89,223                      // vmulps        %ymm7,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,16,124,36,200               // vmovups       -0x38(%rsp),%ymm7
@@ -18923,29 +19532,29 @@
   .byte  196,1,123,16,4,81                   // vmovsd        (%r9,%r10,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,85                              // je            2561 <_sk_load_tables_u16_be_avx+0x2d6>
+  .byte  116,85                              // je            2551 <_sk_load_tables_u16_be_avx+0x2d6>
   .byte  196,1,57,22,68,81,8                 // vmovhpd       0x8(%r9,%r10,2),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,72                              // jb            2561 <_sk_load_tables_u16_be_avx+0x2d6>
+  .byte  114,72                              // jb            2551 <_sk_load_tables_u16_be_avx+0x2d6>
   .byte  196,129,123,16,84,81,16             // vmovsd        0x10(%r9,%r10,2),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,72                              // je            256e <_sk_load_tables_u16_be_avx+0x2e3>
+  .byte  116,72                              // je            255e <_sk_load_tables_u16_be_avx+0x2e3>
   .byte  196,129,105,22,84,81,24             // vmovhpd       0x18(%r9,%r10,2),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,59                              // jb            256e <_sk_load_tables_u16_be_avx+0x2e3>
+  .byte  114,59                              // jb            255e <_sk_load_tables_u16_be_avx+0x2e3>
   .byte  196,129,123,16,92,81,32             // vmovsd        0x20(%r9,%r10,2),%xmm3
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,126,253,255,255              // je            22c2 <_sk_load_tables_u16_be_avx+0x37>
+  .byte  15,132,126,253,255,255              // je            22b2 <_sk_load_tables_u16_be_avx+0x37>
   .byte  196,129,97,22,92,81,40              // vmovhpd       0x28(%r9,%r10,2),%xmm3,%xmm3
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,109,253,255,255              // jb            22c2 <_sk_load_tables_u16_be_avx+0x37>
+  .byte  15,130,109,253,255,255              // jb            22b2 <_sk_load_tables_u16_be_avx+0x37>
   .byte  196,1,122,126,76,81,48              // vmovq         0x30(%r9,%r10,2),%xmm9
-  .byte  233,97,253,255,255                  // jmpq          22c2 <_sk_load_tables_u16_be_avx+0x37>
+  .byte  233,97,253,255,255                  // jmpq          22b2 <_sk_load_tables_u16_be_avx+0x37>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,84,253,255,255                  // jmpq          22c2 <_sk_load_tables_u16_be_avx+0x37>
+  .byte  233,84,253,255,255                  // jmpq          22b2 <_sk_load_tables_u16_be_avx+0x37>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,75,253,255,255                  // jmpq          22c2 <_sk_load_tables_u16_be_avx+0x37>
+  .byte  233,75,253,255,255                  // jmpq          22b2 <_sk_load_tables_u16_be_avx+0x37>
 
 HIDDEN _sk_load_tables_rgb_u16_be_avx
 .globl _sk_load_tables_rgb_u16_be_avx
@@ -18957,7 +19566,7 @@
   .byte  77,133,192                          // test          %r8,%r8
   .byte  197,252,17,124,36,200               // vmovups       %ymm7,-0x38(%rsp)
   .byte  197,252,17,116,36,168               // vmovups       %ymm6,-0x58(%rsp)
-  .byte  15,133,71,2,0,0                     // jne           27dc <_sk_load_tables_rgb_u16_be_avx+0x265>
+  .byte  15,133,71,2,0,0                     // jne           27cc <_sk_load_tables_rgb_u16_be_avx+0x265>
   .byte  196,129,122,111,4,81                // vmovdqu       (%r9,%r10,2),%xmm0
   .byte  196,129,122,111,84,81,12            // vmovdqu       0xc(%r9,%r10,2),%xmm2
   .byte  196,129,122,111,76,81,24            // vmovdqu       0x18(%r9,%r10,2),%xmm1
@@ -18978,7 +19587,7 @@
   .byte  197,185,108,218                     // vpunpcklqdq   %xmm2,%xmm8,%xmm3
   .byte  197,57,109,218                      // vpunpckhqdq   %xmm2,%xmm8,%xmm11
   .byte  197,121,108,193                     // vpunpcklqdq   %xmm1,%xmm0,%xmm8
-  .byte  197,121,111,13,161,81,0,0           // vmovdqa       0x51a1(%rip),%xmm9        # 77a0 <_sk_callback_avx+0x666>
+  .byte  197,121,111,13,145,85,0,0           // vmovdqa       0x5591(%rip),%xmm9        # 7b80 <_sk_callback_avx+0x66e>
   .byte  196,193,97,219,193                  // vpand         %xmm9,%xmm3,%xmm0
   .byte  196,65,41,239,210                   // vpxor         %xmm10,%xmm10,%xmm10
   .byte  196,193,121,105,202                 // vpunpckhwd    %xmm10,%xmm0,%xmm1
@@ -19068,50 +19677,50 @@
   .byte  196,195,105,33,211,48               // vinsertps     $0x30,%xmm11,%xmm2,%xmm2
   .byte  196,227,109,24,211,1                // vinsertf128   $0x1,%xmm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,10,76,0,0         // vbroadcastss  0x4c0a(%rip),%ymm3        # 73d8 <_sk_callback_avx+0x29e>
+  .byte  196,226,125,24,29,242,79,0,0        // vbroadcastss  0x4ff2(%rip),%ymm3        # 77b0 <_sk_callback_avx+0x29e>
   .byte  197,252,16,116,36,168               // vmovups       -0x58(%rsp),%ymm6
   .byte  197,252,16,124,36,200               // vmovups       -0x38(%rsp),%ymm7
   .byte  255,224                             // jmpq          *%rax
   .byte  196,129,121,110,4,81                // vmovd         (%r9,%r10,2),%xmm0
   .byte  196,129,121,196,68,81,4,2           // vpinsrw       $0x2,0x4(%r9,%r10,2),%xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,5                               // jne           27f5 <_sk_load_tables_rgb_u16_be_avx+0x27e>
-  .byte  233,212,253,255,255                 // jmpq          25c9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  117,5                               // jne           27e5 <_sk_load_tables_rgb_u16_be_avx+0x27e>
+  .byte  233,212,253,255,255                 // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
   .byte  196,129,121,110,76,81,6             // vmovd         0x6(%r9,%r10,2),%xmm1
   .byte  196,1,113,196,68,81,10,2            // vpinsrw       $0x2,0xa(%r9,%r10,2),%xmm1,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,26                              // jb            2824 <_sk_load_tables_rgb_u16_be_avx+0x2ad>
+  .byte  114,26                              // jb            2814 <_sk_load_tables_rgb_u16_be_avx+0x2ad>
   .byte  196,129,121,110,76,81,12            // vmovd         0xc(%r9,%r10,2),%xmm1
   .byte  196,129,113,196,84,81,16,2          // vpinsrw       $0x2,0x10(%r9,%r10,2),%xmm1,%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  117,10                              // jne           2829 <_sk_load_tables_rgb_u16_be_avx+0x2b2>
-  .byte  233,165,253,255,255                 // jmpq          25c9 <_sk_load_tables_rgb_u16_be_avx+0x52>
-  .byte  233,160,253,255,255                 // jmpq          25c9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  117,10                              // jne           2819 <_sk_load_tables_rgb_u16_be_avx+0x2b2>
+  .byte  233,165,253,255,255                 // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  233,160,253,255,255                 // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
   .byte  196,129,121,110,76,81,18            // vmovd         0x12(%r9,%r10,2),%xmm1
   .byte  196,1,113,196,76,81,22,2            // vpinsrw       $0x2,0x16(%r9,%r10,2),%xmm1,%xmm9
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,26                              // jb            2858 <_sk_load_tables_rgb_u16_be_avx+0x2e1>
+  .byte  114,26                              // jb            2848 <_sk_load_tables_rgb_u16_be_avx+0x2e1>
   .byte  196,129,121,110,76,81,24            // vmovd         0x18(%r9,%r10,2),%xmm1
   .byte  196,129,113,196,76,81,28,2          // vpinsrw       $0x2,0x1c(%r9,%r10,2),%xmm1,%xmm1
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  117,10                              // jne           285d <_sk_load_tables_rgb_u16_be_avx+0x2e6>
-  .byte  233,113,253,255,255                 // jmpq          25c9 <_sk_load_tables_rgb_u16_be_avx+0x52>
-  .byte  233,108,253,255,255                 // jmpq          25c9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  117,10                              // jne           284d <_sk_load_tables_rgb_u16_be_avx+0x2e6>
+  .byte  233,113,253,255,255                 // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  233,108,253,255,255                 // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
   .byte  196,129,121,110,92,81,30            // vmovd         0x1e(%r9,%r10,2),%xmm3
   .byte  196,1,97,196,92,81,34,2             // vpinsrw       $0x2,0x22(%r9,%r10,2),%xmm3,%xmm11
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,20                              // jb            2886 <_sk_load_tables_rgb_u16_be_avx+0x30f>
+  .byte  114,20                              // jb            2876 <_sk_load_tables_rgb_u16_be_avx+0x30f>
   .byte  196,129,121,110,92,81,36            // vmovd         0x24(%r9,%r10,2),%xmm3
   .byte  196,129,97,196,92,81,40,2           // vpinsrw       $0x2,0x28(%r9,%r10,2),%xmm3,%xmm3
-  .byte  233,67,253,255,255                  // jmpq          25c9 <_sk_load_tables_rgb_u16_be_avx+0x52>
-  .byte  233,62,253,255,255                  // jmpq          25c9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  233,67,253,255,255                  // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  233,62,253,255,255                  // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
 
 HIDDEN _sk_byte_tables_avx
 .globl _sk_byte_tables_avx
 FUNCTION(_sk_byte_tables_avx)
 _sk_byte_tables_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,70,75,0,0           // vbroadcastss  0x4b46(%rip),%ymm8        # 73dc <_sk_callback_avx+0x2a2>
+  .byte  196,98,125,24,5,46,79,0,0           // vbroadcastss  0x4f2e(%rip),%ymm8        # 77b4 <_sk_callback_avx+0x2a2>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  197,125,91,200                      // vcvtps2dq     %ymm0,%ymm9
   .byte  196,65,249,126,201                  // vmovq         %xmm9,%r9
@@ -19230,7 +19839,7 @@
   .byte  196,194,121,49,204                  // vpmovzxbd     %xmm12,%xmm1
   .byte  196,194,121,49,213                  // vpmovzxbd     %xmm13,%xmm2
   .byte  196,227,117,24,202,1                // vinsertf128   $0x1,%xmm2,%ymm1,%ymm1
-  .byte  196,98,125,24,13,240,72,0,0         // vbroadcastss  0x48f0(%rip),%ymm9        # 73e0 <_sk_callback_avx+0x2a6>
+  .byte  196,98,125,24,13,216,76,0,0         // vbroadcastss  0x4cd8(%rip),%ymm9        # 77b8 <_sk_callback_avx+0x2a6>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,201                  // vmulps        %ymm9,%ymm1,%ymm1
@@ -19346,7 +19955,7 @@
   .byte  196,194,121,49,203                  // vpmovzxbd     %xmm11,%xmm1
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,209,70,0,0         // vbroadcastss  0x46d1(%rip),%ymm9        # 73e4 <_sk_callback_avx+0x2aa>
+  .byte  196,98,125,24,13,185,74,0,0         // vbroadcastss  0x4ab9(%rip),%ymm9        # 77bc <_sk_callback_avx+0x2aa>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,194,121,49,202                  // vpmovzxbd     %xmm10,%xmm1
   .byte  196,194,121,49,212                  // vpmovzxbd     %xmm12,%xmm2
@@ -19551,36 +20160,36 @@
   .byte  196,193,124,88,195                  // vaddps        %ymm11,%ymm0,%ymm0
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,216                      // vcvtdq2ps     %ymm0,%ymm11
-  .byte  196,98,125,24,37,126,67,0,0         // vbroadcastss  0x437e(%rip),%ymm12        # 73e8 <_sk_callback_avx+0x2ae>
+  .byte  196,98,125,24,37,102,71,0,0         // vbroadcastss  0x4766(%rip),%ymm12        # 77c0 <_sk_callback_avx+0x2ae>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,116,67,0,0         // vbroadcastss  0x4374(%rip),%ymm12        # 73ec <_sk_callback_avx+0x2b2>
+  .byte  196,98,125,24,37,92,71,0,0          // vbroadcastss  0x475c(%rip),%ymm12        # 77c4 <_sk_callback_avx+0x2b2>
   .byte  196,193,124,84,196                  // vandps        %ymm12,%ymm0,%ymm0
-  .byte  196,98,125,24,37,106,67,0,0         // vbroadcastss  0x436a(%rip),%ymm12        # 73f0 <_sk_callback_avx+0x2b6>
+  .byte  196,98,125,24,37,82,71,0,0          // vbroadcastss  0x4752(%rip),%ymm12        # 77c8 <_sk_callback_avx+0x2b6>
   .byte  196,193,124,86,196                  // vorps         %ymm12,%ymm0,%ymm0
-  .byte  196,98,125,24,37,96,67,0,0          // vbroadcastss  0x4360(%rip),%ymm12        # 73f4 <_sk_callback_avx+0x2ba>
+  .byte  196,98,125,24,37,72,71,0,0          // vbroadcastss  0x4748(%rip),%ymm12        # 77cc <_sk_callback_avx+0x2ba>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,86,67,0,0          // vbroadcastss  0x4356(%rip),%ymm12        # 73f8 <_sk_callback_avx+0x2be>
+  .byte  196,98,125,24,37,62,71,0,0          // vbroadcastss  0x473e(%rip),%ymm12        # 77d0 <_sk_callback_avx+0x2be>
   .byte  196,65,124,89,228                   // vmulps        %ymm12,%ymm0,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,71,67,0,0          // vbroadcastss  0x4347(%rip),%ymm12        # 73fc <_sk_callback_avx+0x2c2>
+  .byte  196,98,125,24,37,47,71,0,0          // vbroadcastss  0x472f(%rip),%ymm12        # 77d4 <_sk_callback_avx+0x2c2>
   .byte  196,193,124,88,196                  // vaddps        %ymm12,%ymm0,%ymm0
-  .byte  196,98,125,24,37,61,67,0,0          // vbroadcastss  0x433d(%rip),%ymm12        # 7400 <_sk_callback_avx+0x2c6>
+  .byte  196,98,125,24,37,37,71,0,0          // vbroadcastss  0x4725(%rip),%ymm12        # 77d8 <_sk_callback_avx+0x2c6>
   .byte  197,156,94,192                      // vdivps        %ymm0,%ymm12,%ymm0
   .byte  197,164,92,192                      // vsubps        %ymm0,%ymm11,%ymm0
   .byte  197,172,89,192                      // vmulps        %ymm0,%ymm10,%ymm0
   .byte  196,99,125,8,208,1                  // vroundps      $0x1,%ymm0,%ymm10
   .byte  196,65,124,92,210                   // vsubps        %ymm10,%ymm0,%ymm10
-  .byte  196,98,125,24,29,33,67,0,0          // vbroadcastss  0x4321(%rip),%ymm11        # 7404 <_sk_callback_avx+0x2ca>
+  .byte  196,98,125,24,29,9,71,0,0           // vbroadcastss  0x4709(%rip),%ymm11        # 77dc <_sk_callback_avx+0x2ca>
   .byte  196,193,124,88,195                  // vaddps        %ymm11,%ymm0,%ymm0
-  .byte  196,98,125,24,29,23,67,0,0          // vbroadcastss  0x4317(%rip),%ymm11        # 7408 <_sk_callback_avx+0x2ce>
+  .byte  196,98,125,24,29,255,70,0,0         // vbroadcastss  0x46ff(%rip),%ymm11        # 77e0 <_sk_callback_avx+0x2ce>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,124,92,195                  // vsubps        %ymm11,%ymm0,%ymm0
-  .byte  196,98,125,24,29,8,67,0,0           // vbroadcastss  0x4308(%rip),%ymm11        # 740c <_sk_callback_avx+0x2d2>
+  .byte  196,98,125,24,29,240,70,0,0         // vbroadcastss  0x46f0(%rip),%ymm11        # 77e4 <_sk_callback_avx+0x2d2>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,254,66,0,0         // vbroadcastss  0x42fe(%rip),%ymm11        # 7410 <_sk_callback_avx+0x2d6>
+  .byte  196,98,125,24,29,230,70,0,0         // vbroadcastss  0x46e6(%rip),%ymm11        # 77e8 <_sk_callback_avx+0x2d6>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,124,88,194                  // vaddps        %ymm10,%ymm0,%ymm0
-  .byte  196,98,125,24,21,239,66,0,0         // vbroadcastss  0x42ef(%rip),%ymm10        # 7414 <_sk_callback_avx+0x2da>
+  .byte  196,98,125,24,21,215,70,0,0         // vbroadcastss  0x46d7(%rip),%ymm10        # 77ec <_sk_callback_avx+0x2da>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,253,91,192                      // vcvtps2dq     %ymm0,%ymm0
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -19588,7 +20197,7 @@
   .byte  196,195,125,74,193,128              // vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,198,66,0,0          // vbroadcastss  0x42c6(%rip),%ymm8        # 7418 <_sk_callback_avx+0x2de>
+  .byte  196,98,125,24,5,174,70,0,0          // vbroadcastss  0x46ae(%rip),%ymm8        # 77f0 <_sk_callback_avx+0x2de>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -19610,36 +20219,36 @@
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,217                      // vcvtdq2ps     %ymm1,%ymm11
-  .byte  196,98,125,24,37,119,66,0,0         // vbroadcastss  0x4277(%rip),%ymm12        # 741c <_sk_callback_avx+0x2e2>
+  .byte  196,98,125,24,37,95,70,0,0          // vbroadcastss  0x465f(%rip),%ymm12        # 77f4 <_sk_callback_avx+0x2e2>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,109,66,0,0         // vbroadcastss  0x426d(%rip),%ymm12        # 7420 <_sk_callback_avx+0x2e6>
+  .byte  196,98,125,24,37,85,70,0,0          // vbroadcastss  0x4655(%rip),%ymm12        # 77f8 <_sk_callback_avx+0x2e6>
   .byte  196,193,116,84,204                  // vandps        %ymm12,%ymm1,%ymm1
-  .byte  196,98,125,24,37,99,66,0,0          // vbroadcastss  0x4263(%rip),%ymm12        # 7424 <_sk_callback_avx+0x2ea>
+  .byte  196,98,125,24,37,75,70,0,0          // vbroadcastss  0x464b(%rip),%ymm12        # 77fc <_sk_callback_avx+0x2ea>
   .byte  196,193,116,86,204                  // vorps         %ymm12,%ymm1,%ymm1
-  .byte  196,98,125,24,37,89,66,0,0          // vbroadcastss  0x4259(%rip),%ymm12        # 7428 <_sk_callback_avx+0x2ee>
+  .byte  196,98,125,24,37,65,70,0,0          // vbroadcastss  0x4641(%rip),%ymm12        # 7800 <_sk_callback_avx+0x2ee>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,79,66,0,0          // vbroadcastss  0x424f(%rip),%ymm12        # 742c <_sk_callback_avx+0x2f2>
+  .byte  196,98,125,24,37,55,70,0,0          // vbroadcastss  0x4637(%rip),%ymm12        # 7804 <_sk_callback_avx+0x2f2>
   .byte  196,65,116,89,228                   // vmulps        %ymm12,%ymm1,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,64,66,0,0          // vbroadcastss  0x4240(%rip),%ymm12        # 7430 <_sk_callback_avx+0x2f6>
+  .byte  196,98,125,24,37,40,70,0,0          // vbroadcastss  0x4628(%rip),%ymm12        # 7808 <_sk_callback_avx+0x2f6>
   .byte  196,193,116,88,204                  // vaddps        %ymm12,%ymm1,%ymm1
-  .byte  196,98,125,24,37,54,66,0,0          // vbroadcastss  0x4236(%rip),%ymm12        # 7434 <_sk_callback_avx+0x2fa>
+  .byte  196,98,125,24,37,30,70,0,0          // vbroadcastss  0x461e(%rip),%ymm12        # 780c <_sk_callback_avx+0x2fa>
   .byte  197,156,94,201                      // vdivps        %ymm1,%ymm12,%ymm1
   .byte  197,164,92,201                      // vsubps        %ymm1,%ymm11,%ymm1
   .byte  197,172,89,201                      // vmulps        %ymm1,%ymm10,%ymm1
   .byte  196,99,125,8,209,1                  // vroundps      $0x1,%ymm1,%ymm10
   .byte  196,65,116,92,210                   // vsubps        %ymm10,%ymm1,%ymm10
-  .byte  196,98,125,24,29,26,66,0,0          // vbroadcastss  0x421a(%rip),%ymm11        # 7438 <_sk_callback_avx+0x2fe>
+  .byte  196,98,125,24,29,2,70,0,0           // vbroadcastss  0x4602(%rip),%ymm11        # 7810 <_sk_callback_avx+0x2fe>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,16,66,0,0          // vbroadcastss  0x4210(%rip),%ymm11        # 743c <_sk_callback_avx+0x302>
+  .byte  196,98,125,24,29,248,69,0,0         // vbroadcastss  0x45f8(%rip),%ymm11        # 7814 <_sk_callback_avx+0x302>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,116,92,203                  // vsubps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,1,66,0,0           // vbroadcastss  0x4201(%rip),%ymm11        # 7440 <_sk_callback_avx+0x306>
+  .byte  196,98,125,24,29,233,69,0,0         // vbroadcastss  0x45e9(%rip),%ymm11        # 7818 <_sk_callback_avx+0x306>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,247,65,0,0         // vbroadcastss  0x41f7(%rip),%ymm11        # 7444 <_sk_callback_avx+0x30a>
+  .byte  196,98,125,24,29,223,69,0,0         // vbroadcastss  0x45df(%rip),%ymm11        # 781c <_sk_callback_avx+0x30a>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,116,88,202                  // vaddps        %ymm10,%ymm1,%ymm1
-  .byte  196,98,125,24,21,232,65,0,0         // vbroadcastss  0x41e8(%rip),%ymm10        # 7448 <_sk_callback_avx+0x30e>
+  .byte  196,98,125,24,21,208,69,0,0         // vbroadcastss  0x45d0(%rip),%ymm10        # 7820 <_sk_callback_avx+0x30e>
   .byte  196,193,116,89,202                  // vmulps        %ymm10,%ymm1,%ymm1
   .byte  197,253,91,201                      // vcvtps2dq     %ymm1,%ymm1
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -19647,7 +20256,7 @@
   .byte  196,195,117,74,201,128              // vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,116,95,200                  // vmaxps        %ymm8,%ymm1,%ymm1
-  .byte  196,98,125,24,5,191,65,0,0          // vbroadcastss  0x41bf(%rip),%ymm8        # 744c <_sk_callback_avx+0x312>
+  .byte  196,98,125,24,5,167,69,0,0          // vbroadcastss  0x45a7(%rip),%ymm8        # 7824 <_sk_callback_avx+0x312>
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -19669,36 +20278,36 @@
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,218                      // vcvtdq2ps     %ymm2,%ymm11
-  .byte  196,98,125,24,37,112,65,0,0         // vbroadcastss  0x4170(%rip),%ymm12        # 7450 <_sk_callback_avx+0x316>
+  .byte  196,98,125,24,37,88,69,0,0          // vbroadcastss  0x4558(%rip),%ymm12        # 7828 <_sk_callback_avx+0x316>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,102,65,0,0         // vbroadcastss  0x4166(%rip),%ymm12        # 7454 <_sk_callback_avx+0x31a>
+  .byte  196,98,125,24,37,78,69,0,0          // vbroadcastss  0x454e(%rip),%ymm12        # 782c <_sk_callback_avx+0x31a>
   .byte  196,193,108,84,212                  // vandps        %ymm12,%ymm2,%ymm2
-  .byte  196,98,125,24,37,92,65,0,0          // vbroadcastss  0x415c(%rip),%ymm12        # 7458 <_sk_callback_avx+0x31e>
+  .byte  196,98,125,24,37,68,69,0,0          // vbroadcastss  0x4544(%rip),%ymm12        # 7830 <_sk_callback_avx+0x31e>
   .byte  196,193,108,86,212                  // vorps         %ymm12,%ymm2,%ymm2
-  .byte  196,98,125,24,37,82,65,0,0          // vbroadcastss  0x4152(%rip),%ymm12        # 745c <_sk_callback_avx+0x322>
+  .byte  196,98,125,24,37,58,69,0,0          // vbroadcastss  0x453a(%rip),%ymm12        # 7834 <_sk_callback_avx+0x322>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,72,65,0,0          // vbroadcastss  0x4148(%rip),%ymm12        # 7460 <_sk_callback_avx+0x326>
+  .byte  196,98,125,24,37,48,69,0,0          // vbroadcastss  0x4530(%rip),%ymm12        # 7838 <_sk_callback_avx+0x326>
   .byte  196,65,108,89,228                   // vmulps        %ymm12,%ymm2,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,57,65,0,0          // vbroadcastss  0x4139(%rip),%ymm12        # 7464 <_sk_callback_avx+0x32a>
+  .byte  196,98,125,24,37,33,69,0,0          // vbroadcastss  0x4521(%rip),%ymm12        # 783c <_sk_callback_avx+0x32a>
   .byte  196,193,108,88,212                  // vaddps        %ymm12,%ymm2,%ymm2
-  .byte  196,98,125,24,37,47,65,0,0          // vbroadcastss  0x412f(%rip),%ymm12        # 7468 <_sk_callback_avx+0x32e>
+  .byte  196,98,125,24,37,23,69,0,0          // vbroadcastss  0x4517(%rip),%ymm12        # 7840 <_sk_callback_avx+0x32e>
   .byte  197,156,94,210                      // vdivps        %ymm2,%ymm12,%ymm2
   .byte  197,164,92,210                      // vsubps        %ymm2,%ymm11,%ymm2
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  196,99,125,8,210,1                  // vroundps      $0x1,%ymm2,%ymm10
   .byte  196,65,108,92,210                   // vsubps        %ymm10,%ymm2,%ymm10
-  .byte  196,98,125,24,29,19,65,0,0          // vbroadcastss  0x4113(%rip),%ymm11        # 746c <_sk_callback_avx+0x332>
+  .byte  196,98,125,24,29,251,68,0,0         // vbroadcastss  0x44fb(%rip),%ymm11        # 7844 <_sk_callback_avx+0x332>
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
-  .byte  196,98,125,24,29,9,65,0,0           // vbroadcastss  0x4109(%rip),%ymm11        # 7470 <_sk_callback_avx+0x336>
+  .byte  196,98,125,24,29,241,68,0,0         // vbroadcastss  0x44f1(%rip),%ymm11        # 7848 <_sk_callback_avx+0x336>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,108,92,211                  // vsubps        %ymm11,%ymm2,%ymm2
-  .byte  196,98,125,24,29,250,64,0,0         // vbroadcastss  0x40fa(%rip),%ymm11        # 7474 <_sk_callback_avx+0x33a>
+  .byte  196,98,125,24,29,226,68,0,0         // vbroadcastss  0x44e2(%rip),%ymm11        # 784c <_sk_callback_avx+0x33a>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,240,64,0,0         // vbroadcastss  0x40f0(%rip),%ymm11        # 7478 <_sk_callback_avx+0x33e>
+  .byte  196,98,125,24,29,216,68,0,0         // vbroadcastss  0x44d8(%rip),%ymm11        # 7850 <_sk_callback_avx+0x33e>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,108,88,210                  // vaddps        %ymm10,%ymm2,%ymm2
-  .byte  196,98,125,24,21,225,64,0,0         // vbroadcastss  0x40e1(%rip),%ymm10        # 747c <_sk_callback_avx+0x342>
+  .byte  196,98,125,24,21,201,68,0,0         // vbroadcastss  0x44c9(%rip),%ymm10        # 7854 <_sk_callback_avx+0x342>
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  197,253,91,210                      // vcvtps2dq     %ymm2,%ymm2
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -19706,7 +20315,7 @@
   .byte  196,195,109,74,209,128              // vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,184,64,0,0          // vbroadcastss  0x40b8(%rip),%ymm8        # 7480 <_sk_callback_avx+0x346>
+  .byte  196,98,125,24,5,160,68,0,0          // vbroadcastss  0x44a0(%rip),%ymm8        # 7858 <_sk_callback_avx+0x346>
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -19728,36 +20337,36 @@
   .byte  196,193,100,88,219                  // vaddps        %ymm11,%ymm3,%ymm3
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,219                      // vcvtdq2ps     %ymm3,%ymm11
-  .byte  196,98,125,24,37,105,64,0,0         // vbroadcastss  0x4069(%rip),%ymm12        # 7484 <_sk_callback_avx+0x34a>
+  .byte  196,98,125,24,37,81,68,0,0          // vbroadcastss  0x4451(%rip),%ymm12        # 785c <_sk_callback_avx+0x34a>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,95,64,0,0          // vbroadcastss  0x405f(%rip),%ymm12        # 7488 <_sk_callback_avx+0x34e>
+  .byte  196,98,125,24,37,71,68,0,0          // vbroadcastss  0x4447(%rip),%ymm12        # 7860 <_sk_callback_avx+0x34e>
   .byte  196,193,100,84,220                  // vandps        %ymm12,%ymm3,%ymm3
-  .byte  196,98,125,24,37,85,64,0,0          // vbroadcastss  0x4055(%rip),%ymm12        # 748c <_sk_callback_avx+0x352>
+  .byte  196,98,125,24,37,61,68,0,0          // vbroadcastss  0x443d(%rip),%ymm12        # 7864 <_sk_callback_avx+0x352>
   .byte  196,193,100,86,220                  // vorps         %ymm12,%ymm3,%ymm3
-  .byte  196,98,125,24,37,75,64,0,0          // vbroadcastss  0x404b(%rip),%ymm12        # 7490 <_sk_callback_avx+0x356>
+  .byte  196,98,125,24,37,51,68,0,0          // vbroadcastss  0x4433(%rip),%ymm12        # 7868 <_sk_callback_avx+0x356>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,65,64,0,0          // vbroadcastss  0x4041(%rip),%ymm12        # 7494 <_sk_callback_avx+0x35a>
+  .byte  196,98,125,24,37,41,68,0,0          // vbroadcastss  0x4429(%rip),%ymm12        # 786c <_sk_callback_avx+0x35a>
   .byte  196,65,100,89,228                   // vmulps        %ymm12,%ymm3,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,50,64,0,0          // vbroadcastss  0x4032(%rip),%ymm12        # 7498 <_sk_callback_avx+0x35e>
+  .byte  196,98,125,24,37,26,68,0,0          // vbroadcastss  0x441a(%rip),%ymm12        # 7870 <_sk_callback_avx+0x35e>
   .byte  196,193,100,88,220                  // vaddps        %ymm12,%ymm3,%ymm3
-  .byte  196,98,125,24,37,40,64,0,0          // vbroadcastss  0x4028(%rip),%ymm12        # 749c <_sk_callback_avx+0x362>
+  .byte  196,98,125,24,37,16,68,0,0          // vbroadcastss  0x4410(%rip),%ymm12        # 7874 <_sk_callback_avx+0x362>
   .byte  197,156,94,219                      // vdivps        %ymm3,%ymm12,%ymm3
   .byte  197,164,92,219                      // vsubps        %ymm3,%ymm11,%ymm3
   .byte  197,172,89,219                      // vmulps        %ymm3,%ymm10,%ymm3
   .byte  196,99,125,8,211,1                  // vroundps      $0x1,%ymm3,%ymm10
   .byte  196,65,100,92,210                   // vsubps        %ymm10,%ymm3,%ymm10
-  .byte  196,98,125,24,29,12,64,0,0          // vbroadcastss  0x400c(%rip),%ymm11        # 74a0 <_sk_callback_avx+0x366>
+  .byte  196,98,125,24,29,244,67,0,0         // vbroadcastss  0x43f4(%rip),%ymm11        # 7878 <_sk_callback_avx+0x366>
   .byte  196,193,100,88,219                  // vaddps        %ymm11,%ymm3,%ymm3
-  .byte  196,98,125,24,29,2,64,0,0           // vbroadcastss  0x4002(%rip),%ymm11        # 74a4 <_sk_callback_avx+0x36a>
+  .byte  196,98,125,24,29,234,67,0,0         // vbroadcastss  0x43ea(%rip),%ymm11        # 787c <_sk_callback_avx+0x36a>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,100,92,219                  // vsubps        %ymm11,%ymm3,%ymm3
-  .byte  196,98,125,24,29,243,63,0,0         // vbroadcastss  0x3ff3(%rip),%ymm11        # 74a8 <_sk_callback_avx+0x36e>
+  .byte  196,98,125,24,29,219,67,0,0         // vbroadcastss  0x43db(%rip),%ymm11        # 7880 <_sk_callback_avx+0x36e>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,233,63,0,0         // vbroadcastss  0x3fe9(%rip),%ymm11        # 74ac <_sk_callback_avx+0x372>
+  .byte  196,98,125,24,29,209,67,0,0         // vbroadcastss  0x43d1(%rip),%ymm11        # 7884 <_sk_callback_avx+0x372>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,100,88,218                  // vaddps        %ymm10,%ymm3,%ymm3
-  .byte  196,98,125,24,21,218,63,0,0         // vbroadcastss  0x3fda(%rip),%ymm10        # 74b0 <_sk_callback_avx+0x376>
+  .byte  196,98,125,24,21,194,67,0,0         // vbroadcastss  0x43c2(%rip),%ymm10        # 7888 <_sk_callback_avx+0x376>
   .byte  196,193,100,89,218                  // vmulps        %ymm10,%ymm3,%ymm3
   .byte  197,253,91,219                      // vcvtps2dq     %ymm3,%ymm3
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -19765,7 +20374,7 @@
   .byte  196,195,101,74,217,128              // vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,100,95,216                  // vmaxps        %ymm8,%ymm3,%ymm3
-  .byte  196,98,125,24,5,177,63,0,0          // vbroadcastss  0x3fb1(%rip),%ymm8        # 74b4 <_sk_callback_avx+0x37a>
+  .byte  196,98,125,24,5,153,67,0,0          // vbroadcastss  0x4399(%rip),%ymm8        # 788c <_sk_callback_avx+0x37a>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -19774,31 +20383,31 @@
 .globl _sk_lab_to_xyz_avx
 FUNCTION(_sk_lab_to_xyz_avx)
 _sk_lab_to_xyz_avx:
-  .byte  196,98,125,24,5,163,63,0,0          // vbroadcastss  0x3fa3(%rip),%ymm8        # 74b8 <_sk_callback_avx+0x37e>
+  .byte  196,98,125,24,5,139,67,0,0          // vbroadcastss  0x438b(%rip),%ymm8        # 7890 <_sk_callback_avx+0x37e>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,153,63,0,0          // vbroadcastss  0x3f99(%rip),%ymm8        # 74bc <_sk_callback_avx+0x382>
+  .byte  196,98,125,24,5,129,67,0,0          // vbroadcastss  0x4381(%rip),%ymm8        # 7894 <_sk_callback_avx+0x382>
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,98,125,24,13,143,63,0,0         // vbroadcastss  0x3f8f(%rip),%ymm9        # 74c0 <_sk_callback_avx+0x386>
+  .byte  196,98,125,24,13,119,67,0,0         // vbroadcastss  0x4377(%rip),%ymm9        # 7898 <_sk_callback_avx+0x386>
   .byte  196,193,116,88,201                  // vaddps        %ymm9,%ymm1,%ymm1
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  196,193,108,88,209                  // vaddps        %ymm9,%ymm2,%ymm2
-  .byte  196,98,125,24,5,123,63,0,0          // vbroadcastss  0x3f7b(%rip),%ymm8        # 74c4 <_sk_callback_avx+0x38a>
+  .byte  196,98,125,24,5,99,67,0,0           // vbroadcastss  0x4363(%rip),%ymm8        # 789c <_sk_callback_avx+0x38a>
   .byte  196,193,124,88,192                  // vaddps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,113,63,0,0          // vbroadcastss  0x3f71(%rip),%ymm8        # 74c8 <_sk_callback_avx+0x38e>
+  .byte  196,98,125,24,5,89,67,0,0           // vbroadcastss  0x4359(%rip),%ymm8        # 78a0 <_sk_callback_avx+0x38e>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,103,63,0,0          // vbroadcastss  0x3f67(%rip),%ymm8        # 74cc <_sk_callback_avx+0x392>
+  .byte  196,98,125,24,5,79,67,0,0           // vbroadcastss  0x434f(%rip),%ymm8        # 78a4 <_sk_callback_avx+0x392>
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
   .byte  197,252,88,201                      // vaddps        %ymm1,%ymm0,%ymm1
-  .byte  196,98,125,24,5,89,63,0,0           // vbroadcastss  0x3f59(%rip),%ymm8        # 74d0 <_sk_callback_avx+0x396>
+  .byte  196,98,125,24,5,65,67,0,0           // vbroadcastss  0x4341(%rip),%ymm8        # 78a8 <_sk_callback_avx+0x396>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,252,92,210                      // vsubps        %ymm2,%ymm0,%ymm2
   .byte  197,116,89,193                      // vmulps        %ymm1,%ymm1,%ymm8
   .byte  196,65,116,89,192                   // vmulps        %ymm8,%ymm1,%ymm8
-  .byte  196,98,125,24,13,66,63,0,0          // vbroadcastss  0x3f42(%rip),%ymm9        # 74d4 <_sk_callback_avx+0x39a>
+  .byte  196,98,125,24,13,42,67,0,0          // vbroadcastss  0x432a(%rip),%ymm9        # 78ac <_sk_callback_avx+0x39a>
   .byte  196,65,52,194,208,1                 // vcmpltps      %ymm8,%ymm9,%ymm10
-  .byte  196,98,125,24,29,55,63,0,0          // vbroadcastss  0x3f37(%rip),%ymm11        # 74d8 <_sk_callback_avx+0x39e>
+  .byte  196,98,125,24,29,31,67,0,0          // vbroadcastss  0x431f(%rip),%ymm11        # 78b0 <_sk_callback_avx+0x39e>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,37,45,63,0,0          // vbroadcastss  0x3f2d(%rip),%ymm12        # 74dc <_sk_callback_avx+0x3a2>
+  .byte  196,98,125,24,37,21,67,0,0          // vbroadcastss  0x4315(%rip),%ymm12        # 78b4 <_sk_callback_avx+0x3a2>
   .byte  196,193,116,89,204                  // vmulps        %ymm12,%ymm1,%ymm1
   .byte  196,67,117,74,192,160               // vblendvps     %ymm10,%ymm8,%ymm1,%ymm8
   .byte  197,252,89,200                      // vmulps        %ymm0,%ymm0,%ymm1
@@ -19813,9 +20422,9 @@
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
   .byte  196,193,108,89,212                  // vmulps        %ymm12,%ymm2,%ymm2
   .byte  196,227,109,74,208,144              // vblendvps     %ymm9,%ymm0,%ymm2,%ymm2
-  .byte  196,226,125,24,5,227,62,0,0         // vbroadcastss  0x3ee3(%rip),%ymm0        # 74e0 <_sk_callback_avx+0x3a6>
+  .byte  196,226,125,24,5,203,66,0,0         // vbroadcastss  0x42cb(%rip),%ymm0        # 78b8 <_sk_callback_avx+0x3a6>
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
-  .byte  196,98,125,24,5,218,62,0,0          // vbroadcastss  0x3eda(%rip),%ymm8        # 74e4 <_sk_callback_avx+0x3aa>
+  .byte  196,98,125,24,5,194,66,0,0          // vbroadcastss  0x42c2(%rip),%ymm8        # 78bc <_sk_callback_avx+0x3aa>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -19827,15 +20436,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           365f <_sk_load_a8_avx+0x4c>
+  .byte  117,66                              // jne           364f <_sk_load_a8_avx+0x4c>
   .byte  196,194,121,48,4,19                 // vpmovzxbw     (%r11,%rdx,1),%xmm0
-  .byte  197,249,219,5,133,65,0,0            // vpand         0x4185(%rip),%xmm0,%xmm0        # 77b0 <_sk_callback_avx+0x676>
+  .byte  197,249,219,5,117,69,0,0            // vpand         0x4575(%rip),%xmm0,%xmm0        # 7b90 <_sk_callback_avx+0x67e>
   .byte  197,241,239,201                     // vpxor         %xmm1,%xmm1,%xmm1
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,157,62,0,0        // vbroadcastss  0x3e9d(%rip),%ymm1        # 74e8 <_sk_callback_avx+0x3ae>
+  .byte  196,226,125,24,13,133,66,0,0        // vbroadcastss  0x4285(%rip),%ymm1        # 78c0 <_sk_callback_avx+0x3ae>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -19847,15 +20456,15 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,176                             // ja            3623 <_sk_load_a8_avx+0x10>
+  .byte  119,176                             // ja            3613 <_sk_load_a8_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 36f8 <_sk_load_a8_avx+0xe5>
+  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 36e8 <_sk_load_a8_avx+0xe5>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,145                             // jmp           3623 <_sk_load_a8_avx+0x10>
+  .byte  235,145                             // jmp           3613 <_sk_load_a8_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,2                   // vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -19863,7 +20472,7 @@
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,121,14,193,3                // vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  .byte  233,105,255,255,255                 // jmpq          3623 <_sk_load_a8_avx+0x10>
+  .byte  233,105,255,255,255                 // jmpq          3613 <_sk_load_a8_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,6                   // vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -19874,7 +20483,7 @@
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,113,14,192,240              // vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  .byte  233,46,255,255,255                  // jmpq          3623 <_sk_load_a8_avx+0x10>
+  .byte  233,46,255,255,255                  // jmpq          3613 <_sk_load_a8_avx+0x10>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  143                                 // (bad)
   .byte  255                                 // (bad)
@@ -19903,15 +20512,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           3760 <_sk_load_a8_dst_avx+0x4c>
+  .byte  117,66                              // jne           3750 <_sk_load_a8_dst_avx+0x4c>
   .byte  196,194,121,48,36,19                // vpmovzxbw     (%r11,%rdx,1),%xmm4
-  .byte  197,217,219,37,148,64,0,0           // vpand         0x4094(%rip),%xmm4,%xmm4        # 77c0 <_sk_callback_avx+0x686>
+  .byte  197,217,219,37,132,68,0,0           // vpand         0x4484(%rip),%xmm4,%xmm4        # 7ba0 <_sk_callback_avx+0x68e>
   .byte  197,209,239,237                     // vpxor         %xmm5,%xmm5,%xmm5
   .byte  197,217,105,237                     // vpunpckhwd    %xmm5,%xmm4,%xmm5
   .byte  196,226,121,51,228                  // vpmovzxwd     %xmm4,%xmm4
   .byte  196,227,93,24,229,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,160,61,0,0        // vbroadcastss  0x3da0(%rip),%ymm5        # 74ec <_sk_callback_avx+0x3b2>
+  .byte  196,226,125,24,45,136,65,0,0        // vbroadcastss  0x4188(%rip),%ymm5        # 78c4 <_sk_callback_avx+0x3b2>
   .byte  197,220,89,253                      // vmulps        %ymm5,%ymm4,%ymm7
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,220,87,228                      // vxorps        %ymm4,%ymm4,%ymm4
@@ -19923,15 +20532,15 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,176                             // ja            3724 <_sk_load_a8_dst_avx+0x10>
+  .byte  119,176                             // ja            3714 <_sk_load_a8_dst_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,121,0,0,0                 // lea           0x79(%rip),%r10        # 37f8 <_sk_load_a8_dst_avx+0xe4>
+  .byte  76,141,21,121,0,0,0                 // lea           0x79(%rip),%r10        # 37e8 <_sk_load_a8_dst_avx+0xe4>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,145                             // jmp           3724 <_sk_load_a8_dst_avx+0x10>
+  .byte  235,145                             // jmp           3714 <_sk_load_a8_dst_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,2                   // vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -19939,7 +20548,7 @@
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,89,14,229,3                 // vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  .byte  233,105,255,255,255                 // jmpq          3724 <_sk_load_a8_dst_avx+0x10>
+  .byte  233,105,255,255,255                 // jmpq          3714 <_sk_load_a8_dst_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,6                   // vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -19950,7 +20559,7 @@
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,81,14,228,240               // vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  .byte  233,46,255,255,255                  // jmpq          3724 <_sk_load_a8_dst_avx+0x10>
+  .byte  233,46,255,255,255                  // jmpq          3714 <_sk_load_a8_dst_avx+0x10>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  144                                 // nop
   .byte  255                                 // (bad)
@@ -19959,7 +20568,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  232,255,255,255,221                 // callq         ffffffffde003808 <_sk_callback_avx+0xffffffffddffc6ce>
+  .byte  232,255,255,255,221                 // callq         ffffffffde0037f8 <_sk_callback_avx+0xffffffffddffc2e6>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,210                             // callq         *%rdx
@@ -20014,7 +20623,7 @@
   .byte  196,226,121,49,192                  // vpmovzxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,16,60,0,0         // vbroadcastss  0x3c10(%rip),%ymm1        # 74f0 <_sk_callback_avx+0x3b6>
+  .byte  196,226,125,24,13,248,63,0,0        // vbroadcastss  0x3ff8(%rip),%ymm1        # 78c8 <_sk_callback_avx+0x3b6>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -20028,14 +20637,14 @@
 _sk_store_a8_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,242,59,0,0          // vbroadcastss  0x3bf2(%rip),%ymm8        # 74f4 <_sk_callback_avx+0x3ba>
+  .byte  196,98,125,24,5,218,63,0,0          // vbroadcastss  0x3fda(%rip),%ymm8        # 78cc <_sk_callback_avx+0x3ba>
   .byte  196,65,100,89,192                   // vmulps        %ymm8,%ymm3,%ymm8
   .byte  196,65,125,91,192                   // vcvtps2dq     %ymm8,%ymm8
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  196,65,57,103,192                   // vpackuswb     %xmm8,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           392b <_sk_store_a8_avx+0x37>
+  .byte  117,10                              // jne           391b <_sk_store_a8_avx+0x37>
   .byte  196,65,123,17,4,19                  // vmovsd        %xmm8,(%r11,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20043,25 +20652,25 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            3927 <_sk_store_a8_avx+0x33>
+  .byte  119,236                             // ja            3917 <_sk_store_a8_avx+0x33>
   .byte  196,66,121,48,192                   // vpmovzxbw     %xmm8,%xmm8
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,85,0,0,0                  // lea           0x55(%rip),%r10        # 39a0 <_sk_store_a8_avx+0xac>
+  .byte  76,141,21,85,0,0,0                  // lea           0x55(%rip),%r10        # 3990 <_sk_store_a8_avx+0xac>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,20,4,19,0                // vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,202                             // jmp           3927 <_sk_store_a8_avx+0x33>
+  .byte  235,202                             // jmp           3917 <_sk_store_a8_avx+0x33>
   .byte  196,67,121,20,68,19,2,4             // vpextrb       $0x4,%xmm8,0x2(%r11,%rdx,1)
-  .byte  196,98,57,0,5,98,62,0,0             // vpshufb       0x3e62(%rip),%xmm8,%xmm8        # 77d0 <_sk_callback_avx+0x696>
+  .byte  196,98,57,0,5,82,66,0,0             // vpshufb       0x4252(%rip),%xmm8,%xmm8        # 7bb0 <_sk_callback_avx+0x69e>
   .byte  196,67,121,21,4,19,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,176                             // jmp           3927 <_sk_store_a8_avx+0x33>
+  .byte  235,176                             // jmp           3917 <_sk_store_a8_avx+0x33>
   .byte  196,67,121,20,68,19,6,12            // vpextrb       $0xc,%xmm8,0x6(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,5,10            // vpextrb       $0xa,%xmm8,0x5(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,4,8             // vpextrb       $0x8,%xmm8,0x4(%r11,%rdx,1)
-  .byte  196,98,57,0,5,72,62,0,0             // vpshufb       0x3e48(%rip),%xmm8,%xmm8        # 77e0 <_sk_callback_avx+0x6a6>
+  .byte  196,98,57,0,5,56,66,0,0             // vpshufb       0x4238(%rip),%xmm8,%xmm8        # 7bc0 <_sk_callback_avx+0x6ae>
   .byte  196,65,121,126,4,19                 // vmovd         %xmm8,(%r11,%rdx,1)
-  .byte  235,135                             // jmp           3927 <_sk_store_a8_avx+0x33>
+  .byte  235,135                             // jmp           3917 <_sk_store_a8_avx+0x33>
   .byte  180,255                             // mov           $0xff,%ah
   .byte  255                                 // (bad)
   .byte  255,197                             // inc           %ebp
@@ -20089,18 +20698,18 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,71                              // jne           3a0d <_sk_load_g8_avx+0x51>
+  .byte  117,71                              // jne           39fd <_sk_load_g8_avx+0x51>
   .byte  196,194,121,48,4,19                 // vpmovzxbw     (%r11,%rdx,1),%xmm0
-  .byte  197,249,219,5,28,62,0,0             // vpand         0x3e1c(%rip),%xmm0,%xmm0        # 77f0 <_sk_callback_avx+0x6b6>
+  .byte  197,249,219,5,12,66,0,0             // vpand         0x420c(%rip),%xmm0,%xmm0        # 7bd0 <_sk_callback_avx+0x6be>
   .byte  197,241,239,201                     // vpxor         %xmm1,%xmm1,%xmm1
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,4,59,0,0          // vbroadcastss  0x3b04(%rip),%ymm1        # 74f8 <_sk_callback_avx+0x3be>
+  .byte  196,226,125,24,13,236,62,0,0        // vbroadcastss  0x3eec(%rip),%ymm1        # 78d0 <_sk_callback_avx+0x3be>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,249,58,0,0        // vbroadcastss  0x3af9(%rip),%ymm3        # 74fc <_sk_callback_avx+0x3c2>
+  .byte  196,226,125,24,29,225,62,0,0        // vbroadcastss  0x3ee1(%rip),%ymm3        # 78d4 <_sk_callback_avx+0x3c2>
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  255,224                             // jmpq          *%rax
@@ -20109,15 +20718,15 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,171                             // ja            39cc <_sk_load_g8_avx+0x10>
+  .byte  119,171                             // ja            39bc <_sk_load_g8_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,120,0,0,0                 // lea           0x78(%rip),%r10        # 3aa4 <_sk_load_g8_avx+0xe8>
+  .byte  76,141,21,120,0,0,0                 // lea           0x78(%rip),%r10        # 3a94 <_sk_load_g8_avx+0xe8>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,140                             // jmp           39cc <_sk_load_g8_avx+0x10>
+  .byte  235,140                             // jmp           39bc <_sk_load_g8_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,2                   // vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -20125,7 +20734,7 @@
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,121,14,193,3                // vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  .byte  233,100,255,255,255                 // jmpq          39cc <_sk_load_g8_avx+0x10>
+  .byte  233,100,255,255,255                 // jmpq          39bc <_sk_load_g8_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,6                   // vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -20136,7 +20745,7 @@
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,113,14,192,240              // vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  .byte  233,41,255,255,255                  // jmpq          39cc <_sk_load_g8_avx+0x10>
+  .byte  233,41,255,255,255                  // jmpq          39bc <_sk_load_g8_avx+0x10>
   .byte  144                                 // nop
   .byte  145                                 // xchg          %eax,%ecx
   .byte  255                                 // (bad)
@@ -20145,7 +20754,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  233,255,255,255,222                 // jmpq          ffffffffdf003ab4 <_sk_callback_avx+0xffffffffdeffc97a>
+  .byte  233,255,255,255,222                 // jmpq          ffffffffdf003aa4 <_sk_callback_avx+0xffffffffdeffc592>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,211                             // callq         *%rbx
@@ -20163,18 +20772,18 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,71                              // jne           3b11 <_sk_load_g8_dst_avx+0x51>
+  .byte  117,71                              // jne           3b01 <_sk_load_g8_dst_avx+0x51>
   .byte  196,194,121,48,36,19                // vpmovzxbw     (%r11,%rdx,1),%xmm4
-  .byte  197,217,219,37,40,61,0,0            // vpand         0x3d28(%rip),%xmm4,%xmm4        # 7800 <_sk_callback_avx+0x6c6>
+  .byte  197,217,219,37,24,65,0,0            // vpand         0x4118(%rip),%xmm4,%xmm4        # 7be0 <_sk_callback_avx+0x6ce>
   .byte  197,209,239,237                     // vpxor         %xmm5,%xmm5,%xmm5
   .byte  197,217,105,237                     // vpunpckhwd    %xmm5,%xmm4,%xmm5
   .byte  196,226,121,51,228                  // vpmovzxwd     %xmm4,%xmm4
   .byte  196,227,93,24,229,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,8,58,0,0          // vbroadcastss  0x3a08(%rip),%ymm5        # 7500 <_sk_callback_avx+0x3c6>
+  .byte  196,226,125,24,45,240,61,0,0        // vbroadcastss  0x3df0(%rip),%ymm5        # 78d8 <_sk_callback_avx+0x3c6>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,61,253,57,0,0        // vbroadcastss  0x39fd(%rip),%ymm7        # 7504 <_sk_callback_avx+0x3ca>
+  .byte  196,226,125,24,61,229,61,0,0        // vbroadcastss  0x3de5(%rip),%ymm7        # 78dc <_sk_callback_avx+0x3ca>
   .byte  197,252,40,236                      // vmovaps       %ymm4,%ymm5
   .byte  197,252,40,244                      // vmovaps       %ymm4,%ymm6
   .byte  255,224                             // jmpq          *%rax
@@ -20183,15 +20792,15 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,171                             // ja            3ad0 <_sk_load_g8_dst_avx+0x10>
+  .byte  119,171                             // ja            3ac0 <_sk_load_g8_dst_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,120,0,0,0                 // lea           0x78(%rip),%r10        # 3ba8 <_sk_load_g8_dst_avx+0xe8>
+  .byte  76,141,21,120,0,0,0                 // lea           0x78(%rip),%r10        # 3b98 <_sk_load_g8_dst_avx+0xe8>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,140                             // jmp           3ad0 <_sk_load_g8_dst_avx+0x10>
+  .byte  235,140                             // jmp           3ac0 <_sk_load_g8_dst_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,2                   // vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -20199,7 +20808,7 @@
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,89,14,229,3                 // vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  .byte  233,100,255,255,255                 // jmpq          3ad0 <_sk_load_g8_dst_avx+0x10>
+  .byte  233,100,255,255,255                 // jmpq          3ac0 <_sk_load_g8_dst_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,6                   // vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -20210,7 +20819,7 @@
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,81,14,228,240               // vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  .byte  233,41,255,255,255                  // jmpq          3ad0 <_sk_load_g8_dst_avx+0x10>
+  .byte  233,41,255,255,255                  // jmpq          3ac0 <_sk_load_g8_dst_avx+0x10>
   .byte  144                                 // nop
   .byte  145                                 // xchg          %eax,%ecx
   .byte  255                                 // (bad)
@@ -20219,7 +20828,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  233,255,255,255,222                 // jmpq          ffffffffdf003bb8 <_sk_callback_avx+0xffffffffdeffca7e>
+  .byte  233,255,255,255,222                 // jmpq          ffffffffdf003ba8 <_sk_callback_avx+0xffffffffdeffc696>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,211                             // callq         *%rbx
@@ -20274,10 +20883,10 @@
   .byte  196,226,121,49,192                  // vpmovzxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,120,56,0,0        // vbroadcastss  0x3878(%rip),%ymm1        # 7508 <_sk_callback_avx+0x3ce>
+  .byte  196,226,125,24,13,96,60,0,0         // vbroadcastss  0x3c60(%rip),%ymm1        # 78e0 <_sk_callback_avx+0x3ce>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,109,56,0,0        // vbroadcastss  0x386d(%rip),%ymm3        # 750c <_sk_callback_avx+0x3d2>
+  .byte  196,226,125,24,29,85,60,0,0         // vbroadcastss  0x3c55(%rip),%ymm3        # 78e4 <_sk_callback_avx+0x3d2>
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  255,224                             // jmpq          *%rax
@@ -20289,9 +20898,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,193                          // mov           %rax,%r9
   .byte  77,133,201                          // test          %r9,%r9
-  .byte  116,5                               // je            3cb8 <_sk_gather_i8_avx+0xf>
+  .byte  116,5                               // je            3ca8 <_sk_gather_i8_avx+0xf>
   .byte  76,137,200                          // mov           %r9,%rax
-  .byte  235,2                               // jmp           3cba <_sk_gather_i8_avx+0x11>
+  .byte  235,2                               // jmp           3caa <_sk_gather_i8_avx+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  83                                  // push          %rbx
   .byte  76,139,16                           // mov           (%rax),%r10
@@ -20349,10 +20958,10 @@
   .byte  72,193,235,30                       // shr           $0x1e,%rbx
   .byte  196,195,121,34,28,27,3              // vpinsrd       $0x3,(%r11,%rbx,1),%xmm0,%xmm3
   .byte  196,227,61,24,195,1                 // vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  .byte  197,124,40,21,232,58,0,0            // vmovaps       0x3ae8(%rip),%ymm10        # 78c0 <_sk_callback_avx+0x786>
+  .byte  197,124,40,21,56,63,0,0             // vmovaps       0x3f38(%rip),%ymm10        # 7d00 <_sk_callback_avx+0x7ee>
   .byte  196,193,124,84,194                  // vandps        %ymm10,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,38,55,0,0          // vbroadcastss  0x3726(%rip),%ymm9        # 7510 <_sk_callback_avx+0x3d6>
+  .byte  196,98,125,24,13,14,59,0,0          // vbroadcastss  0x3b0e(%rip),%ymm9        # 78e8 <_sk_callback_avx+0x3d6>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,193,113,114,208,8               // vpsrld        $0x8,%xmm8,%xmm1
   .byte  197,233,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm2
@@ -20382,56 +20991,56 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,128,0,0,0                    // jne           3eda <_sk_load_565_avx+0x8e>
+  .byte  15,133,128,0,0,0                    // jne           3eca <_sk_load_565_avx+0x8e>
   .byte  196,193,122,111,4,83                // vmovdqu       (%r11,%rdx,2),%xmm0
   .byte  197,241,239,201                     // vpxor         %xmm1,%xmm1,%xmm1
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,209,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  .byte  196,226,125,24,5,152,54,0,0         // vbroadcastss  0x3698(%rip),%ymm0        # 7514 <_sk_callback_avx+0x3da>
+  .byte  196,226,125,24,5,128,58,0,0         // vbroadcastss  0x3a80(%rip),%ymm0        # 78ec <_sk_callback_avx+0x3da>
   .byte  197,236,84,192                      // vandps        %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,139,54,0,0        // vbroadcastss  0x368b(%rip),%ymm1        # 7518 <_sk_callback_avx+0x3de>
+  .byte  196,226,125,24,13,115,58,0,0        // vbroadcastss  0x3a73(%rip),%ymm1        # 78f0 <_sk_callback_avx+0x3de>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,130,54,0,0        // vbroadcastss  0x3682(%rip),%ymm1        # 751c <_sk_callback_avx+0x3e2>
+  .byte  196,226,125,24,13,106,58,0,0        // vbroadcastss  0x3a6a(%rip),%ymm1        # 78f4 <_sk_callback_avx+0x3e2>
   .byte  197,236,84,201                      // vandps        %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,117,54,0,0        // vbroadcastss  0x3675(%rip),%ymm3        # 7520 <_sk_callback_avx+0x3e6>
+  .byte  196,226,125,24,29,93,58,0,0         // vbroadcastss  0x3a5d(%rip),%ymm3        # 78f8 <_sk_callback_avx+0x3e6>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,24,29,108,54,0,0        // vbroadcastss  0x366c(%rip),%ymm3        # 7524 <_sk_callback_avx+0x3ea>
+  .byte  196,226,125,24,29,84,58,0,0         // vbroadcastss  0x3a54(%rip),%ymm3        # 78fc <_sk_callback_avx+0x3ea>
   .byte  197,236,84,211                      // vandps        %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,95,54,0,0         // vbroadcastss  0x365f(%rip),%ymm3        # 7528 <_sk_callback_avx+0x3ee>
+  .byte  196,226,125,24,29,71,58,0,0         // vbroadcastss  0x3a47(%rip),%ymm3        # 7900 <_sk_callback_avx+0x3ee>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,84,54,0,0         // vbroadcastss  0x3654(%rip),%ymm3        # 752c <_sk_callback_avx+0x3f2>
+  .byte  196,226,125,24,29,60,58,0,0         // vbroadcastss  0x3a3c(%rip),%ymm3        # 7904 <_sk_callback_avx+0x3f2>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,110,255,255,255              // ja            3e60 <_sk_load_565_avx+0x14>
+  .byte  15,135,110,255,255,255              // ja            3e50 <_sk_load_565_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 3f60 <_sk_load_565_avx+0x114>
+  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 3f50 <_sk_load_565_avx+0x114>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  233,76,255,255,255                  // jmpq          3e60 <_sk_load_565_avx+0x14>
+  .byte  233,76,255,255,255                  // jmpq          3e50 <_sk_load_565_avx+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,110,12,83               // vmovd         (%r11,%rdx,2),%xmm1
   .byte  196,227,121,14,193,3                // vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  .byte  233,47,255,255,255                  // jmpq          3e60 <_sk_load_565_avx+0x14>
+  .byte  233,47,255,255,255                  // jmpq          3e50 <_sk_load_565_avx+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,122,126,12,83               // vmovq         (%r11,%rdx,2),%xmm1
   .byte  196,227,113,14,192,240              // vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  .byte  233,2,255,255,255                   // jmpq          3e60 <_sk_load_565_avx+0x14>
+  .byte  233,2,255,255,255                   // jmpq          3e50 <_sk_load_565_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  166                                 // cmpsb         %es:(%rdi),%ds:(%rsi)
   .byte  255                                 // (bad)
@@ -20459,56 +21068,56 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,128,0,0,0                    // jne           400a <_sk_load_565_dst_avx+0x8e>
+  .byte  15,133,128,0,0,0                    // jne           3ffa <_sk_load_565_dst_avx+0x8e>
   .byte  196,193,122,111,36,83               // vmovdqu       (%r11,%rdx,2),%xmm4
   .byte  197,209,239,237                     // vpxor         %xmm5,%xmm5,%xmm5
   .byte  197,217,105,237                     // vpunpckhwd    %xmm5,%xmm4,%xmm5
   .byte  196,226,121,51,228                  // vpmovzxwd     %xmm4,%xmm4
   .byte  196,227,93,24,245,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm6
-  .byte  196,226,125,24,37,132,53,0,0        // vbroadcastss  0x3584(%rip),%ymm4        # 7530 <_sk_callback_avx+0x3f6>
+  .byte  196,226,125,24,37,108,57,0,0        // vbroadcastss  0x396c(%rip),%ymm4        # 7908 <_sk_callback_avx+0x3f6>
   .byte  197,204,84,228                      // vandps        %ymm4,%ymm6,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,119,53,0,0        // vbroadcastss  0x3577(%rip),%ymm5        # 7534 <_sk_callback_avx+0x3fa>
+  .byte  196,226,125,24,45,95,57,0,0         // vbroadcastss  0x395f(%rip),%ymm5        # 790c <_sk_callback_avx+0x3fa>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
-  .byte  196,226,125,24,45,110,53,0,0        // vbroadcastss  0x356e(%rip),%ymm5        # 7538 <_sk_callback_avx+0x3fe>
+  .byte  196,226,125,24,45,86,57,0,0         // vbroadcastss  0x3956(%rip),%ymm5        # 7910 <_sk_callback_avx+0x3fe>
   .byte  197,204,84,237                      // vandps        %ymm5,%ymm6,%ymm5
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,226,125,24,61,97,53,0,0         // vbroadcastss  0x3561(%rip),%ymm7        # 753c <_sk_callback_avx+0x402>
+  .byte  196,226,125,24,61,73,57,0,0         // vbroadcastss  0x3949(%rip),%ymm7        # 7914 <_sk_callback_avx+0x402>
   .byte  197,212,89,239                      // vmulps        %ymm7,%ymm5,%ymm5
-  .byte  196,226,125,24,61,88,53,0,0         // vbroadcastss  0x3558(%rip),%ymm7        # 7540 <_sk_callback_avx+0x406>
+  .byte  196,226,125,24,61,64,57,0,0         // vbroadcastss  0x3940(%rip),%ymm7        # 7918 <_sk_callback_avx+0x406>
   .byte  197,204,84,247                      // vandps        %ymm7,%ymm6,%ymm6
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
-  .byte  196,226,125,24,61,75,53,0,0         // vbroadcastss  0x354b(%rip),%ymm7        # 7544 <_sk_callback_avx+0x40a>
+  .byte  196,226,125,24,61,51,57,0,0         // vbroadcastss  0x3933(%rip),%ymm7        # 791c <_sk_callback_avx+0x40a>
   .byte  197,204,89,247                      // vmulps        %ymm7,%ymm6,%ymm6
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,61,64,53,0,0         // vbroadcastss  0x3540(%rip),%ymm7        # 7548 <_sk_callback_avx+0x40e>
+  .byte  196,226,125,24,61,40,57,0,0         // vbroadcastss  0x3928(%rip),%ymm7        # 7920 <_sk_callback_avx+0x40e>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,110,255,255,255              // ja            3f90 <_sk_load_565_dst_avx+0x14>
+  .byte  15,135,110,255,255,255              // ja            3f80 <_sk_load_565_dst_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 4090 <_sk_load_565_dst_avx+0x114>
+  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 4080 <_sk_load_565_dst_avx+0x114>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  233,76,255,255,255                  // jmpq          3f90 <_sk_load_565_dst_avx+0x14>
+  .byte  233,76,255,255,255                  // jmpq          3f80 <_sk_load_565_dst_avx+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,121,110,44,83               // vmovd         (%r11,%rdx,2),%xmm5
   .byte  196,227,89,14,229,3                 // vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  .byte  233,47,255,255,255                  // jmpq          3f90 <_sk_load_565_dst_avx+0x14>
+  .byte  233,47,255,255,255                  // jmpq          3f80 <_sk_load_565_dst_avx+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,122,126,44,83               // vmovq         (%r11,%rdx,2),%xmm5
   .byte  196,227,81,14,228,240               // vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  .byte  233,2,255,255,255                   // jmpq          3f90 <_sk_load_565_dst_avx+0x14>
+  .byte  233,2,255,255,255                   // jmpq          3f80 <_sk_load_565_dst_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  166                                 // cmpsb         %es:(%rdi),%ds:(%rsi)
   .byte  255                                 // (bad)
@@ -20577,23 +21186,23 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,209,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  .byte  196,226,125,24,5,206,51,0,0         // vbroadcastss  0x33ce(%rip),%ymm0        # 754c <_sk_callback_avx+0x412>
+  .byte  196,226,125,24,5,182,55,0,0         // vbroadcastss  0x37b6(%rip),%ymm0        # 7924 <_sk_callback_avx+0x412>
   .byte  197,236,84,192                      // vandps        %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,193,51,0,0        // vbroadcastss  0x33c1(%rip),%ymm1        # 7550 <_sk_callback_avx+0x416>
+  .byte  196,226,125,24,13,169,55,0,0        // vbroadcastss  0x37a9(%rip),%ymm1        # 7928 <_sk_callback_avx+0x416>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,184,51,0,0        // vbroadcastss  0x33b8(%rip),%ymm1        # 7554 <_sk_callback_avx+0x41a>
+  .byte  196,226,125,24,13,160,55,0,0        // vbroadcastss  0x37a0(%rip),%ymm1        # 792c <_sk_callback_avx+0x41a>
   .byte  197,236,84,201                      // vandps        %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,171,51,0,0        // vbroadcastss  0x33ab(%rip),%ymm3        # 7558 <_sk_callback_avx+0x41e>
+  .byte  196,226,125,24,29,147,55,0,0        // vbroadcastss  0x3793(%rip),%ymm3        # 7930 <_sk_callback_avx+0x41e>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,24,29,162,51,0,0        // vbroadcastss  0x33a2(%rip),%ymm3        # 755c <_sk_callback_avx+0x422>
+  .byte  196,226,125,24,29,138,55,0,0        // vbroadcastss  0x378a(%rip),%ymm3        # 7934 <_sk_callback_avx+0x422>
   .byte  197,236,84,211                      // vandps        %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,149,51,0,0        // vbroadcastss  0x3395(%rip),%ymm3        # 7560 <_sk_callback_avx+0x426>
+  .byte  196,226,125,24,29,125,55,0,0        // vbroadcastss  0x377d(%rip),%ymm3        # 7938 <_sk_callback_avx+0x426>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,138,51,0,0        // vbroadcastss  0x338a(%rip),%ymm3        # 7564 <_sk_callback_avx+0x42a>
+  .byte  196,226,125,24,29,114,55,0,0        // vbroadcastss  0x3772(%rip),%ymm3        # 793c <_sk_callback_avx+0x42a>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_store_565_avx
@@ -20602,14 +21211,14 @@
 _sk_store_565_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,126,51,0,0          // vbroadcastss  0x337e(%rip),%ymm8        # 7568 <_sk_callback_avx+0x42e>
+  .byte  196,98,125,24,5,102,55,0,0          // vbroadcastss  0x3766(%rip),%ymm8        # 7940 <_sk_callback_avx+0x42e>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,41,114,241,11               // vpslld        $0xb,%xmm9,%xmm10
   .byte  196,67,125,25,201,1                 // vextractf128  $0x1,%ymm9,%xmm9
   .byte  196,193,49,114,241,11               // vpslld        $0xb,%xmm9,%xmm9
   .byte  196,67,45,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
-  .byte  196,98,125,24,21,87,51,0,0          // vbroadcastss  0x3357(%rip),%ymm10        # 756c <_sk_callback_avx+0x432>
+  .byte  196,98,125,24,21,63,55,0,0          // vbroadcastss  0x373f(%rip),%ymm10        # 7944 <_sk_callback_avx+0x432>
   .byte  196,65,116,89,210                   // vmulps        %ymm10,%ymm1,%ymm10
   .byte  196,65,125,91,210                   // vcvtps2dq     %ymm10,%ymm10
   .byte  196,193,33,114,242,5                // vpslld        $0x5,%xmm10,%xmm11
@@ -20623,7 +21232,7 @@
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           4265 <_sk_store_565_avx+0x89>
+  .byte  117,10                              // jne           4255 <_sk_store_565_avx+0x89>
   .byte  196,65,122,127,4,83                 // vmovdqu       %xmm8,(%r11,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20631,22 +21240,22 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            4261 <_sk_store_565_avx+0x85>
+  .byte  119,236                             // ja            4251 <_sk_store_565_avx+0x85>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,68,0,0,0                  // lea           0x44(%rip),%r10        # 42c4 <_sk_store_565_avx+0xe8>
+  .byte  76,141,21,68,0,0,0                  // lea           0x44(%rip),%r10        # 42b4 <_sk_store_565_avx+0xe8>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,21,4,83,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  .byte  235,207                             // jmp           4261 <_sk_store_565_avx+0x85>
+  .byte  235,207                             // jmp           4251 <_sk_store_565_avx+0x85>
   .byte  196,67,121,21,68,83,4,2             // vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   .byte  196,65,121,126,4,83                 // vmovd         %xmm8,(%r11,%rdx,2)
-  .byte  235,191                             // jmp           4261 <_sk_store_565_avx+0x85>
+  .byte  235,191                             // jmp           4251 <_sk_store_565_avx+0x85>
   .byte  196,67,121,21,68,83,12,6            // vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,10,5            // vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,8,4             // vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   .byte  196,65,121,214,4,83                 // vmovq         %xmm8,(%r11,%rdx,2)
-  .byte  235,159                             // jmp           4261 <_sk_store_565_avx+0x85>
+  .byte  235,159                             // jmp           4251 <_sk_store_565_avx+0x85>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  197,255,255                         // (bad)
   .byte  255,214                             // callq         *%rsi
@@ -20677,31 +21286,31 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,152,0,0,0                    // jne           4386 <_sk_load_4444_avx+0xa6>
+  .byte  15,133,152,0,0,0                    // jne           4376 <_sk_load_4444_avx+0xa6>
   .byte  196,193,122,111,4,83                // vmovdqu       (%r11,%rdx,2),%xmm0
   .byte  197,241,239,201                     // vpxor         %xmm1,%xmm1,%xmm1
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,217,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  .byte  196,226,125,24,5,96,50,0,0          // vbroadcastss  0x3260(%rip),%ymm0        # 7570 <_sk_callback_avx+0x436>
+  .byte  196,226,125,24,5,72,54,0,0          // vbroadcastss  0x3648(%rip),%ymm0        # 7948 <_sk_callback_avx+0x436>
   .byte  197,228,84,192                      // vandps        %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,83,50,0,0         // vbroadcastss  0x3253(%rip),%ymm1        # 7574 <_sk_callback_avx+0x43a>
+  .byte  196,226,125,24,13,59,54,0,0         // vbroadcastss  0x363b(%rip),%ymm1        # 794c <_sk_callback_avx+0x43a>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,74,50,0,0         // vbroadcastss  0x324a(%rip),%ymm1        # 7578 <_sk_callback_avx+0x43e>
+  .byte  196,226,125,24,13,50,54,0,0         // vbroadcastss  0x3632(%rip),%ymm1        # 7950 <_sk_callback_avx+0x43e>
   .byte  197,228,84,201                      // vandps        %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,61,50,0,0         // vbroadcastss  0x323d(%rip),%ymm2        # 757c <_sk_callback_avx+0x442>
+  .byte  196,226,125,24,21,37,54,0,0         // vbroadcastss  0x3625(%rip),%ymm2        # 7954 <_sk_callback_avx+0x442>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,24,21,52,50,0,0         // vbroadcastss  0x3234(%rip),%ymm2        # 7580 <_sk_callback_avx+0x446>
+  .byte  196,226,125,24,21,28,54,0,0         // vbroadcastss  0x361c(%rip),%ymm2        # 7958 <_sk_callback_avx+0x446>
   .byte  197,228,84,210                      // vandps        %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,39,50,0,0           // vbroadcastss  0x3227(%rip),%ymm8        # 7584 <_sk_callback_avx+0x44a>
+  .byte  196,98,125,24,5,15,54,0,0           // vbroadcastss  0x360f(%rip),%ymm8        # 795c <_sk_callback_avx+0x44a>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,29,50,0,0           // vbroadcastss  0x321d(%rip),%ymm8        # 7588 <_sk_callback_avx+0x44e>
+  .byte  196,98,125,24,5,5,54,0,0            // vbroadcastss  0x3605(%rip),%ymm8        # 7960 <_sk_callback_avx+0x44e>
   .byte  196,193,100,84,216                  // vandps        %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,15,50,0,0           // vbroadcastss  0x320f(%rip),%ymm8        # 758c <_sk_callback_avx+0x452>
+  .byte  196,98,125,24,5,247,53,0,0          // vbroadcastss  0x35f7(%rip),%ymm8        # 7964 <_sk_callback_avx+0x452>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20710,27 +21319,27 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,86,255,255,255               // ja            42f4 <_sk_load_4444_avx+0x14>
+  .byte  15,135,86,255,255,255               // ja            42e4 <_sk_load_4444_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 440c <_sk_load_4444_avx+0x12c>
+  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 43fc <_sk_load_4444_avx+0x12c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  233,52,255,255,255                  // jmpq          42f4 <_sk_load_4444_avx+0x14>
+  .byte  233,52,255,255,255                  // jmpq          42e4 <_sk_load_4444_avx+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,110,12,83               // vmovd         (%r11,%rdx,2),%xmm1
   .byte  196,227,121,14,193,3                // vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  .byte  233,23,255,255,255                  // jmpq          42f4 <_sk_load_4444_avx+0x14>
+  .byte  233,23,255,255,255                  // jmpq          42e4 <_sk_load_4444_avx+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,122,126,12,83               // vmovq         (%r11,%rdx,2),%xmm1
   .byte  196,227,113,14,192,240              // vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  .byte  233,234,254,255,255                 // jmpq          42f4 <_sk_load_4444_avx+0x14>
+  .byte  233,234,254,255,255                 // jmpq          42e4 <_sk_load_4444_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  166                                 // cmpsb         %es:(%rdi),%ds:(%rsi)
   .byte  255                                 // (bad)
@@ -20758,31 +21367,31 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,152,0,0,0                    // jne           44ce <_sk_load_4444_dst_avx+0xa6>
+  .byte  15,133,152,0,0,0                    // jne           44be <_sk_load_4444_dst_avx+0xa6>
   .byte  196,193,122,111,36,83               // vmovdqu       (%r11,%rdx,2),%xmm4
   .byte  197,209,239,237                     // vpxor         %xmm5,%xmm5,%xmm5
   .byte  197,217,105,237                     // vpunpckhwd    %xmm5,%xmm4,%xmm5
   .byte  196,226,121,51,228                  // vpmovzxwd     %xmm4,%xmm4
   .byte  196,227,93,24,253,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm7
-  .byte  196,226,125,24,37,56,49,0,0         // vbroadcastss  0x3138(%rip),%ymm4        # 7590 <_sk_callback_avx+0x456>
+  .byte  196,226,125,24,37,32,53,0,0         // vbroadcastss  0x3520(%rip),%ymm4        # 7968 <_sk_callback_avx+0x456>
   .byte  197,196,84,228                      // vandps        %ymm4,%ymm7,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,43,49,0,0         // vbroadcastss  0x312b(%rip),%ymm5        # 7594 <_sk_callback_avx+0x45a>
+  .byte  196,226,125,24,45,19,53,0,0         // vbroadcastss  0x3513(%rip),%ymm5        # 796c <_sk_callback_avx+0x45a>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
-  .byte  196,226,125,24,45,34,49,0,0         // vbroadcastss  0x3122(%rip),%ymm5        # 7598 <_sk_callback_avx+0x45e>
+  .byte  196,226,125,24,45,10,53,0,0         // vbroadcastss  0x350a(%rip),%ymm5        # 7970 <_sk_callback_avx+0x45e>
   .byte  197,196,84,237                      // vandps        %ymm5,%ymm7,%ymm5
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,226,125,24,53,21,49,0,0         // vbroadcastss  0x3115(%rip),%ymm6        # 759c <_sk_callback_avx+0x462>
+  .byte  196,226,125,24,53,253,52,0,0        // vbroadcastss  0x34fd(%rip),%ymm6        # 7974 <_sk_callback_avx+0x462>
   .byte  197,212,89,238                      // vmulps        %ymm6,%ymm5,%ymm5
-  .byte  196,226,125,24,53,12,49,0,0         // vbroadcastss  0x310c(%rip),%ymm6        # 75a0 <_sk_callback_avx+0x466>
+  .byte  196,226,125,24,53,244,52,0,0        // vbroadcastss  0x34f4(%rip),%ymm6        # 7978 <_sk_callback_avx+0x466>
   .byte  197,196,84,246                      // vandps        %ymm6,%ymm7,%ymm6
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
-  .byte  196,98,125,24,5,255,48,0,0          // vbroadcastss  0x30ff(%rip),%ymm8        # 75a4 <_sk_callback_avx+0x46a>
+  .byte  196,98,125,24,5,231,52,0,0          // vbroadcastss  0x34e7(%rip),%ymm8        # 797c <_sk_callback_avx+0x46a>
   .byte  196,193,76,89,240                   // vmulps        %ymm8,%ymm6,%ymm6
-  .byte  196,98,125,24,5,245,48,0,0          // vbroadcastss  0x30f5(%rip),%ymm8        # 75a8 <_sk_callback_avx+0x46e>
+  .byte  196,98,125,24,5,221,52,0,0          // vbroadcastss  0x34dd(%rip),%ymm8        # 7980 <_sk_callback_avx+0x46e>
   .byte  196,193,68,84,248                   // vandps        %ymm8,%ymm7,%ymm7
   .byte  197,252,91,255                      // vcvtdq2ps     %ymm7,%ymm7
-  .byte  196,98,125,24,5,231,48,0,0          // vbroadcastss  0x30e7(%rip),%ymm8        # 75ac <_sk_callback_avx+0x472>
+  .byte  196,98,125,24,5,207,52,0,0          // vbroadcastss  0x34cf(%rip),%ymm8        # 7984 <_sk_callback_avx+0x472>
   .byte  196,193,68,89,248                   // vmulps        %ymm8,%ymm7,%ymm7
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20791,27 +21400,27 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,86,255,255,255               // ja            443c <_sk_load_4444_dst_avx+0x14>
+  .byte  15,135,86,255,255,255               // ja            442c <_sk_load_4444_dst_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 4554 <_sk_load_4444_dst_avx+0x12c>
+  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 4544 <_sk_load_4444_dst_avx+0x12c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  233,52,255,255,255                  // jmpq          443c <_sk_load_4444_dst_avx+0x14>
+  .byte  233,52,255,255,255                  // jmpq          442c <_sk_load_4444_dst_avx+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,121,110,44,83               // vmovd         (%r11,%rdx,2),%xmm5
   .byte  196,227,89,14,229,3                 // vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  .byte  233,23,255,255,255                  // jmpq          443c <_sk_load_4444_dst_avx+0x14>
+  .byte  233,23,255,255,255                  // jmpq          442c <_sk_load_4444_dst_avx+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,122,126,44,83               // vmovq         (%r11,%rdx,2),%xmm5
   .byte  196,227,81,14,228,240               // vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  .byte  233,234,254,255,255                 // jmpq          443c <_sk_load_4444_dst_avx+0x14>
+  .byte  233,234,254,255,255                 // jmpq          442c <_sk_load_4444_dst_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  166                                 // cmpsb         %es:(%rdi),%ds:(%rsi)
   .byte  255                                 // (bad)
@@ -20880,25 +21489,25 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,217,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  .byte  196,226,125,24,5,110,47,0,0         // vbroadcastss  0x2f6e(%rip),%ymm0        # 75b0 <_sk_callback_avx+0x476>
+  .byte  196,226,125,24,5,86,51,0,0          // vbroadcastss  0x3356(%rip),%ymm0        # 7988 <_sk_callback_avx+0x476>
   .byte  197,228,84,192                      // vandps        %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,97,47,0,0         // vbroadcastss  0x2f61(%rip),%ymm1        # 75b4 <_sk_callback_avx+0x47a>
+  .byte  196,226,125,24,13,73,51,0,0         // vbroadcastss  0x3349(%rip),%ymm1        # 798c <_sk_callback_avx+0x47a>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,88,47,0,0         // vbroadcastss  0x2f58(%rip),%ymm1        # 75b8 <_sk_callback_avx+0x47e>
+  .byte  196,226,125,24,13,64,51,0,0         // vbroadcastss  0x3340(%rip),%ymm1        # 7990 <_sk_callback_avx+0x47e>
   .byte  197,228,84,201                      // vandps        %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,75,47,0,0         // vbroadcastss  0x2f4b(%rip),%ymm2        # 75bc <_sk_callback_avx+0x482>
+  .byte  196,226,125,24,21,51,51,0,0         // vbroadcastss  0x3333(%rip),%ymm2        # 7994 <_sk_callback_avx+0x482>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,24,21,66,47,0,0         // vbroadcastss  0x2f42(%rip),%ymm2        # 75c0 <_sk_callback_avx+0x486>
+  .byte  196,226,125,24,21,42,51,0,0         // vbroadcastss  0x332a(%rip),%ymm2        # 7998 <_sk_callback_avx+0x486>
   .byte  197,228,84,210                      // vandps        %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,53,47,0,0           // vbroadcastss  0x2f35(%rip),%ymm8        # 75c4 <_sk_callback_avx+0x48a>
+  .byte  196,98,125,24,5,29,51,0,0           // vbroadcastss  0x331d(%rip),%ymm8        # 799c <_sk_callback_avx+0x48a>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,43,47,0,0           // vbroadcastss  0x2f2b(%rip),%ymm8        # 75c8 <_sk_callback_avx+0x48e>
+  .byte  196,98,125,24,5,19,51,0,0           // vbroadcastss  0x3313(%rip),%ymm8        # 79a0 <_sk_callback_avx+0x48e>
   .byte  196,193,100,84,216                  // vandps        %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,29,47,0,0           // vbroadcastss  0x2f1d(%rip),%ymm8        # 75cc <_sk_callback_avx+0x492>
+  .byte  196,98,125,24,5,5,51,0,0            // vbroadcastss  0x3305(%rip),%ymm8        # 79a4 <_sk_callback_avx+0x492>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20909,7 +21518,7 @@
 _sk_store_4444_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,10,47,0,0           // vbroadcastss  0x2f0a(%rip),%ymm8        # 75d0 <_sk_callback_avx+0x496>
+  .byte  196,98,125,24,5,242,50,0,0          // vbroadcastss  0x32f2(%rip),%ymm8        # 79a8 <_sk_callback_avx+0x496>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,41,114,241,12               // vpslld        $0xc,%xmm9,%xmm10
@@ -20936,7 +21545,7 @@
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           475f <_sk_store_4444_avx+0xa7>
+  .byte  117,10                              // jne           474f <_sk_store_4444_avx+0xa7>
   .byte  196,65,122,127,4,83                 // vmovdqu       %xmm8,(%r11,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20944,22 +21553,22 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            475b <_sk_store_4444_avx+0xa3>
+  .byte  119,236                             // ja            474b <_sk_store_4444_avx+0xa3>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,66,0,0,0                  // lea           0x42(%rip),%r10        # 47bc <_sk_store_4444_avx+0x104>
+  .byte  76,141,21,66,0,0,0                  // lea           0x42(%rip),%r10        # 47ac <_sk_store_4444_avx+0x104>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,21,4,83,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  .byte  235,207                             // jmp           475b <_sk_store_4444_avx+0xa3>
+  .byte  235,207                             // jmp           474b <_sk_store_4444_avx+0xa3>
   .byte  196,67,121,21,68,83,4,2             // vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   .byte  196,65,121,126,4,83                 // vmovd         %xmm8,(%r11,%rdx,2)
-  .byte  235,191                             // jmp           475b <_sk_store_4444_avx+0xa3>
+  .byte  235,191                             // jmp           474b <_sk_store_4444_avx+0xa3>
   .byte  196,67,121,21,68,83,12,6            // vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,10,5            // vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,8,4             // vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   .byte  196,65,121,214,4,83                 // vmovq         %xmm8,(%r11,%rdx,2)
-  .byte  235,159                             // jmp           475b <_sk_store_4444_avx+0xa3>
+  .byte  235,159                             // jmp           474b <_sk_store_4444_avx+0xa3>
   .byte  199                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -20977,7 +21586,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  232,255,255,255,224                 // callq         ffffffffe10047d4 <_sk_callback_avx+0xffffffffe0ffd69a>
+  .byte  232,255,255,255,224                 // callq         ffffffffe10047c4 <_sk_callback_avx+0xffffffffe0ffd2b2>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
@@ -20991,12 +21600,12 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,137,0,0,0                    // jne           487a <_sk_load_8888_avx+0xa2>
+  .byte  15,133,137,0,0,0                    // jne           486a <_sk_load_8888_avx+0xa2>
   .byte  196,193,124,16,26                   // vmovups       (%r10),%ymm3
-  .byte  197,124,40,21,226,48,0,0            // vmovaps       0x30e2(%rip),%ymm10        # 78e0 <_sk_callback_avx+0x7a6>
+  .byte  197,124,40,21,50,53,0,0             // vmovaps       0x3532(%rip),%ymm10        # 7d20 <_sk_callback_avx+0x80e>
   .byte  196,193,100,84,194                  // vandps        %ymm10,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,196,45,0,0          // vbroadcastss  0x2dc4(%rip),%ymm8        # 75d4 <_sk_callback_avx+0x49a>
+  .byte  196,98,125,24,5,172,49,0,0          // vbroadcastss  0x31ac(%rip),%ymm8        # 79ac <_sk_callback_avx+0x49a>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  197,241,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm1
   .byte  196,195,125,25,217,1                // vextractf128  $0x1,%ymm3,%xmm9
@@ -21026,13 +21635,13 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,225,249,110,192                 // vmovq         %rax,%xmm0
   .byte  196,226,121,48,192                  // vpmovzxbw     %xmm0,%xmm0
-  .byte  196,226,121,0,13,110,47,0,0         // vpshufb       0x2f6e(%rip),%xmm0,%xmm1        # 7810 <_sk_callback_avx+0x6d6>
+  .byte  196,226,121,0,13,94,51,0,0          // vpshufb       0x335e(%rip),%xmm0,%xmm1        # 7bf0 <_sk_callback_avx+0x6de>
   .byte  196,226,121,33,201                  // vpmovsxbd     %xmm1,%xmm1
-  .byte  196,226,121,0,5,112,47,0,0          // vpshufb       0x2f70(%rip),%xmm0,%xmm0        # 7820 <_sk_callback_avx+0x6e6>
+  .byte  196,226,121,0,5,96,51,0,0           // vpshufb       0x3360(%rip),%xmm0,%xmm0        # 7c00 <_sk_callback_avx+0x6ee>
   .byte  196,226,121,33,192                  // vpmovsxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  196,194,125,44,26                   // vmaskmovps    (%r10),%ymm0,%ymm3
-  .byte  233,49,255,255,255                  // jmpq          47f6 <_sk_load_8888_avx+0x1e>
+  .byte  233,49,255,255,255                  // jmpq          47e6 <_sk_load_8888_avx+0x1e>
 
 HIDDEN _sk_load_8888_dst_avx
 .globl _sk_load_8888_dst_avx
@@ -21043,12 +21652,12 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,137,0,0,0                    // jne           4967 <_sk_load_8888_dst_avx+0xa2>
+  .byte  15,133,137,0,0,0                    // jne           4957 <_sk_load_8888_dst_avx+0xa2>
   .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
-  .byte  197,124,40,21,21,48,0,0             // vmovaps       0x3015(%rip),%ymm10        # 7900 <_sk_callback_avx+0x7c6>
+  .byte  197,124,40,21,101,52,0,0            // vmovaps       0x3465(%rip),%ymm10        # 7d40 <_sk_callback_avx+0x82e>
   .byte  196,193,68,84,226                   // vandps        %ymm10,%ymm7,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,98,125,24,5,219,44,0,0          // vbroadcastss  0x2cdb(%rip),%ymm8        # 75d8 <_sk_callback_avx+0x49e>
+  .byte  196,98,125,24,5,195,48,0,0          // vbroadcastss  0x30c3(%rip),%ymm8        # 79b0 <_sk_callback_avx+0x49e>
   .byte  196,193,92,89,224                   // vmulps        %ymm8,%ymm4,%ymm4
   .byte  197,209,114,215,8                   // vpsrld        $0x8,%xmm7,%xmm5
   .byte  196,195,125,25,249,1                // vextractf128  $0x1,%ymm7,%xmm9
@@ -21078,13 +21687,13 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
   .byte  196,226,121,48,228                  // vpmovzxbw     %xmm4,%xmm4
-  .byte  196,226,89,0,45,161,46,0,0          // vpshufb       0x2ea1(%rip),%xmm4,%xmm5        # 7830 <_sk_callback_avx+0x6f6>
+  .byte  196,226,89,0,45,145,50,0,0          // vpshufb       0x3291(%rip),%xmm4,%xmm5        # 7c10 <_sk_callback_avx+0x6fe>
   .byte  196,226,121,33,237                  // vpmovsxbd     %xmm5,%xmm5
-  .byte  196,226,89,0,37,163,46,0,0          // vpshufb       0x2ea3(%rip),%xmm4,%xmm4        # 7840 <_sk_callback_avx+0x706>
+  .byte  196,226,89,0,37,147,50,0,0          // vpshufb       0x3293(%rip),%xmm4,%xmm4        # 7c20 <_sk_callback_avx+0x70e>
   .byte  196,226,121,33,228                  // vpmovsxbd     %xmm4,%xmm4
   .byte  196,227,85,24,228,1                 // vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
   .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
-  .byte  233,49,255,255,255                  // jmpq          48e3 <_sk_load_8888_dst_avx+0x1e>
+  .byte  233,49,255,255,255                  // jmpq          48d3 <_sk_load_8888_dst_avx+0x1e>
 
 HIDDEN _sk_gather_8888_avx
 .globl _sk_gather_8888_avx
@@ -21123,10 +21732,10 @@
   .byte  73,193,234,32                       // shr           $0x20,%r10
   .byte  196,131,121,34,28,145,3             // vpinsrd       $0x3,(%r9,%r10,4),%xmm0,%xmm3
   .byte  196,227,61,24,195,1                 // vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  .byte  197,124,40,21,195,46,0,0            // vmovaps       0x2ec3(%rip),%ymm10        # 7920 <_sk_callback_avx+0x7e6>
+  .byte  197,124,40,21,19,51,0,0             // vmovaps       0x3313(%rip),%ymm10        # 7d60 <_sk_callback_avx+0x84e>
   .byte  196,193,124,84,194                  // vandps        %ymm10,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,109,43,0,0         // vbroadcastss  0x2b6d(%rip),%ymm9        # 75dc <_sk_callback_avx+0x4a2>
+  .byte  196,98,125,24,13,85,47,0,0          // vbroadcastss  0x2f55(%rip),%ymm9        # 79b4 <_sk_callback_avx+0x4a2>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,193,113,114,208,8               // vpsrld        $0x8,%xmm8,%xmm1
   .byte  197,233,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm2
@@ -21156,7 +21765,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
-  .byte  196,98,125,24,5,247,42,0,0          // vbroadcastss  0x2af7(%rip),%ymm8        # 75e0 <_sk_callback_avx+0x4a6>
+  .byte  196,98,125,24,5,223,46,0,0          // vbroadcastss  0x2edf(%rip),%ymm8        # 79b8 <_sk_callback_avx+0x4a6>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,65,116,89,208                   // vmulps        %ymm8,%ymm1,%ymm10
@@ -21181,7 +21790,7 @@
   .byte  196,65,45,86,192                    // vorpd         %ymm8,%ymm10,%ymm8
   .byte  196,65,53,86,192                    // vorpd         %ymm8,%ymm9,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,12                              // jne           4b79 <_sk_store_8888_avx+0xa9>
+  .byte  117,12                              // jne           4b69 <_sk_store_8888_avx+0xa9>
   .byte  196,65,124,17,2                     // vmovups       %ymm8,(%r10)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -21193,13 +21802,232 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
-  .byte  196,98,49,0,21,175,44,0,0           // vpshufb       0x2caf(%rip),%xmm9,%xmm10        # 7850 <_sk_callback_avx+0x716>
+  .byte  196,98,49,0,21,159,48,0,0           // vpshufb       0x309f(%rip),%xmm9,%xmm10        # 7c30 <_sk_callback_avx+0x71e>
   .byte  196,66,121,33,210                   // vpmovsxbd     %xmm10,%xmm10
-  .byte  196,98,49,0,13,177,44,0,0           // vpshufb       0x2cb1(%rip),%xmm9,%xmm9        # 7860 <_sk_callback_avx+0x726>
+  .byte  196,98,49,0,13,161,48,0,0           // vpshufb       0x30a1(%rip),%xmm9,%xmm9        # 7c40 <_sk_callback_avx+0x72e>
   .byte  196,66,121,33,201                   // vpmovsxbd     %xmm9,%xmm9
   .byte  196,67,45,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
   .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
-  .byte  235,177                             // jmp           4b72 <_sk_store_8888_avx+0xa2>
+  .byte  235,177                             // jmp           4b62 <_sk_store_8888_avx+0xa2>
+
+HIDDEN _sk_load_bgra_avx
+.globl _sk_load_bgra_avx
+FUNCTION(_sk_load_bgra_avx)
+_sk_load_bgra_avx:
+  .byte  73,137,201                          // mov           %rcx,%r9
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
+  .byte  76,3,16                             // add           (%rax),%r10
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  15,133,137,0,0,0                    // jne           4c53 <_sk_load_bgra_avx+0xa2>
+  .byte  196,193,124,16,26                   // vmovups       (%r10),%ymm3
+  .byte  197,124,40,21,169,49,0,0            // vmovaps       0x31a9(%rip),%ymm10        # 7d80 <_sk_callback_avx+0x86e>
+  .byte  196,193,100,84,202                  // vandps        %ymm10,%ymm3,%ymm1
+  .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
+  .byte  196,98,125,24,5,211,45,0,0          // vbroadcastss  0x2dd3(%rip),%ymm8        # 79bc <_sk_callback_avx+0x4aa>
+  .byte  196,193,116,89,208                  // vmulps        %ymm8,%ymm1,%ymm2
+  .byte  197,241,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm1
+  .byte  196,195,125,25,217,1                // vextractf128  $0x1,%ymm3,%xmm9
+  .byte  196,193,121,114,209,8               // vpsrld        $0x8,%xmm9,%xmm0
+  .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
+  .byte  196,193,124,84,194                  // vandps        %ymm10,%ymm0,%ymm0
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,193,124,89,200                  // vmulps        %ymm8,%ymm0,%ymm1
+  .byte  197,161,114,211,16                  // vpsrld        $0x10,%xmm3,%xmm11
+  .byte  196,193,121,114,209,16              // vpsrld        $0x10,%xmm9,%xmm0
+  .byte  196,227,37,24,192,1                 // vinsertf128   $0x1,%xmm0,%ymm11,%ymm0
+  .byte  196,193,124,84,194                  // vandps        %ymm10,%ymm0,%ymm0
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
+  .byte  197,169,114,211,24                  // vpsrld        $0x18,%xmm3,%xmm10
+  .byte  196,193,97,114,209,24               // vpsrld        $0x18,%xmm9,%xmm3
+  .byte  196,227,45,24,219,1                 // vinsertf128   $0x1,%xmm3,%ymm10,%ymm3
+  .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
+  .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,137,201                          // mov           %r9,%rcx
+  .byte  255,224                             // jmpq          *%rax
+  .byte  185,8,0,0,0                         // mov           $0x8,%ecx
+  .byte  68,41,193                           // sub           %r8d,%ecx
+  .byte  192,225,3                           // shl           $0x3,%cl
+  .byte  72,199,192,255,255,255,255          // mov           $0xffffffffffffffff,%rax
+  .byte  72,211,232                          // shr           %cl,%rax
+  .byte  196,225,249,110,192                 // vmovq         %rax,%xmm0
+  .byte  196,226,121,48,192                  // vpmovzxbw     %xmm0,%xmm0
+  .byte  196,226,121,0,13,213,47,0,0         // vpshufb       0x2fd5(%rip),%xmm0,%xmm1        # 7c50 <_sk_callback_avx+0x73e>
+  .byte  196,226,121,33,201                  // vpmovsxbd     %xmm1,%xmm1
+  .byte  196,226,121,0,5,215,47,0,0          // vpshufb       0x2fd7(%rip),%xmm0,%xmm0        # 7c60 <_sk_callback_avx+0x74e>
+  .byte  196,226,121,33,192                  // vpmovsxbd     %xmm0,%xmm0
+  .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
+  .byte  196,194,125,44,26                   // vmaskmovps    (%r10),%ymm0,%ymm3
+  .byte  233,49,255,255,255                  // jmpq          4bcf <_sk_load_bgra_avx+0x1e>
+
+HIDDEN _sk_load_bgra_dst_avx
+.globl _sk_load_bgra_dst_avx
+FUNCTION(_sk_load_bgra_dst_avx)
+_sk_load_bgra_dst_avx:
+  .byte  73,137,201                          // mov           %rcx,%r9
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
+  .byte  76,3,16                             // add           (%rax),%r10
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  15,133,137,0,0,0                    // jne           4d40 <_sk_load_bgra_dst_avx+0xa2>
+  .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
+  .byte  197,124,40,21,220,48,0,0            // vmovaps       0x30dc(%rip),%ymm10        # 7da0 <_sk_callback_avx+0x88e>
+  .byte  196,193,68,84,234                   // vandps        %ymm10,%ymm7,%ymm5
+  .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
+  .byte  196,98,125,24,5,234,44,0,0          // vbroadcastss  0x2cea(%rip),%ymm8        # 79c0 <_sk_callback_avx+0x4ae>
+  .byte  196,193,84,89,240                   // vmulps        %ymm8,%ymm5,%ymm6
+  .byte  197,209,114,215,8                   // vpsrld        $0x8,%xmm7,%xmm5
+  .byte  196,195,125,25,249,1                // vextractf128  $0x1,%ymm7,%xmm9
+  .byte  196,193,89,114,209,8                // vpsrld        $0x8,%xmm9,%xmm4
+  .byte  196,227,85,24,228,1                 // vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
+  .byte  196,193,92,84,226                   // vandps        %ymm10,%ymm4,%ymm4
+  .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
+  .byte  196,193,92,89,232                   // vmulps        %ymm8,%ymm4,%ymm5
+  .byte  197,161,114,215,16                  // vpsrld        $0x10,%xmm7,%xmm11
+  .byte  196,193,89,114,209,16               // vpsrld        $0x10,%xmm9,%xmm4
+  .byte  196,227,37,24,228,1                 // vinsertf128   $0x1,%xmm4,%ymm11,%ymm4
+  .byte  196,193,92,84,226                   // vandps        %ymm10,%ymm4,%ymm4
+  .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
+  .byte  196,193,92,89,224                   // vmulps        %ymm8,%ymm4,%ymm4
+  .byte  197,169,114,215,24                  // vpsrld        $0x18,%xmm7,%xmm10
+  .byte  196,193,65,114,209,24               // vpsrld        $0x18,%xmm9,%xmm7
+  .byte  196,227,45,24,255,1                 // vinsertf128   $0x1,%xmm7,%ymm10,%ymm7
+  .byte  197,252,91,255                      // vcvtdq2ps     %ymm7,%ymm7
+  .byte  196,193,68,89,248                   // vmulps        %ymm8,%ymm7,%ymm7
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,137,201                          // mov           %r9,%rcx
+  .byte  255,224                             // jmpq          *%rax
+  .byte  185,8,0,0,0                         // mov           $0x8,%ecx
+  .byte  68,41,193                           // sub           %r8d,%ecx
+  .byte  192,225,3                           // shl           $0x3,%cl
+  .byte  72,199,192,255,255,255,255          // mov           $0xffffffffffffffff,%rax
+  .byte  72,211,232                          // shr           %cl,%rax
+  .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
+  .byte  196,226,121,48,228                  // vpmovzxbw     %xmm4,%xmm4
+  .byte  196,226,89,0,45,8,47,0,0            // vpshufb       0x2f08(%rip),%xmm4,%xmm5        # 7c70 <_sk_callback_avx+0x75e>
+  .byte  196,226,121,33,237                  // vpmovsxbd     %xmm5,%xmm5
+  .byte  196,226,89,0,37,10,47,0,0           // vpshufb       0x2f0a(%rip),%xmm4,%xmm4        # 7c80 <_sk_callback_avx+0x76e>
+  .byte  196,226,121,33,228                  // vpmovsxbd     %xmm4,%xmm4
+  .byte  196,227,85,24,228,1                 // vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
+  .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
+  .byte  233,49,255,255,255                  // jmpq          4cbc <_sk_load_bgra_dst_avx+0x1e>
+
+HIDDEN _sk_gather_bgra_avx
+.globl _sk_gather_bgra_avx
+FUNCTION(_sk_gather_bgra_avx)
+_sk_gather_bgra_avx:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,139,8                            // mov           (%rax),%r9
+  .byte  197,254,91,201                      // vcvttps2dq    %ymm1,%ymm1
+  .byte  197,249,110,80,16                   // vmovd         0x10(%rax),%xmm2
+  .byte  197,249,112,210,0                   // vpshufd       $0x0,%xmm2,%xmm2
+  .byte  196,226,105,64,217                  // vpmulld       %xmm1,%xmm2,%xmm3
+  .byte  196,227,125,25,201,1                // vextractf128  $0x1,%ymm1,%xmm1
+  .byte  196,226,105,64,201                  // vpmulld       %xmm1,%xmm2,%xmm1
+  .byte  197,254,91,208                      // vcvttps2dq    %ymm0,%ymm2
+  .byte  196,227,125,25,208,1                // vextractf128  $0x1,%ymm2,%xmm0
+  .byte  197,241,254,192                     // vpaddd        %xmm0,%xmm1,%xmm0
+  .byte  197,225,254,202                     // vpaddd        %xmm2,%xmm3,%xmm1
+  .byte  196,193,249,126,202                 // vmovq         %xmm1,%r10
+  .byte  68,137,208                          // mov           %r10d,%eax
+  .byte  196,193,121,110,20,129              // vmovd         (%r9,%rax,4),%xmm2
+  .byte  196,195,249,22,203,1                // vpextrq       $0x1,%xmm1,%r11
+  .byte  73,193,234,32                       // shr           $0x20,%r10
+  .byte  196,131,105,34,12,145,1             // vpinsrd       $0x1,(%r9,%r10,4),%xmm2,%xmm1
+  .byte  68,137,216                          // mov           %r11d,%eax
+  .byte  196,195,113,34,12,129,2             // vpinsrd       $0x2,(%r9,%rax,4),%xmm1,%xmm1
+  .byte  196,225,249,126,192                 // vmovq         %xmm0,%rax
+  .byte  73,193,235,32                       // shr           $0x20,%r11
+  .byte  196,3,113,34,4,153,3                // vpinsrd       $0x3,(%r9,%r11,4),%xmm1,%xmm8
+  .byte  65,137,194                          // mov           %eax,%r10d
+  .byte  72,193,232,32                       // shr           $0x20,%rax
+  .byte  196,129,121,110,12,145              // vmovd         (%r9,%r10,4),%xmm1
+  .byte  196,195,249,22,194,1                // vpextrq       $0x1,%xmm0,%r10
+  .byte  196,195,113,34,4,129,1              // vpinsrd       $0x1,(%r9,%rax,4),%xmm1,%xmm0
+  .byte  68,137,208                          // mov           %r10d,%eax
+  .byte  196,195,121,34,4,129,2              // vpinsrd       $0x2,(%r9,%rax,4),%xmm0,%xmm0
+  .byte  73,193,234,32                       // shr           $0x20,%r10
+  .byte  196,131,121,34,28,145,3             // vpinsrd       $0x3,(%r9,%r10,4),%xmm0,%xmm3
+  .byte  196,227,61,24,195,1                 // vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
+  .byte  197,124,40,13,138,47,0,0            // vmovaps       0x2f8a(%rip),%ymm9        # 7dc0 <_sk_callback_avx+0x8ae>
+  .byte  196,193,124,84,193                  // vandps        %ymm9,%ymm0,%ymm0
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,98,125,24,21,124,43,0,0         // vbroadcastss  0x2b7c(%rip),%ymm10        # 79c4 <_sk_callback_avx+0x4b2>
+  .byte  196,193,124,89,210                  // vmulps        %ymm10,%ymm0,%ymm2
+  .byte  196,193,121,114,208,8               // vpsrld        $0x8,%xmm8,%xmm0
+  .byte  197,241,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm1
+  .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
+  .byte  196,193,124,84,193                  // vandps        %ymm9,%ymm0,%ymm0
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,193,124,89,202                  // vmulps        %ymm10,%ymm0,%ymm1
+  .byte  196,193,33,114,208,16               // vpsrld        $0x10,%xmm8,%xmm11
+  .byte  197,249,114,211,16                  // vpsrld        $0x10,%xmm3,%xmm0
+  .byte  196,227,37,24,192,1                 // vinsertf128   $0x1,%xmm0,%ymm11,%ymm0
+  .byte  196,193,124,84,193                  // vandps        %ymm9,%ymm0,%ymm0
+  .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
+  .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
+  .byte  196,193,57,114,208,24               // vpsrld        $0x18,%xmm8,%xmm8
+  .byte  197,225,114,211,24                  // vpsrld        $0x18,%xmm3,%xmm3
+  .byte  196,227,61,24,219,1                 // vinsertf128   $0x1,%xmm3,%ymm8,%ymm3
+  .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
+  .byte  196,193,100,89,218                  // vmulps        %ymm10,%ymm3,%ymm3
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+
+HIDDEN _sk_store_bgra_avx
+.globl _sk_store_bgra_avx
+FUNCTION(_sk_store_bgra_avx)
+_sk_store_bgra_avx:
+  .byte  73,137,201                          // mov           %rcx,%r9
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
+  .byte  76,3,16                             // add           (%rax),%r10
+  .byte  196,98,125,24,5,6,43,0,0            // vbroadcastss  0x2b06(%rip),%ymm8        # 79c8 <_sk_callback_avx+0x4b6>
+  .byte  196,65,108,89,200                   // vmulps        %ymm8,%ymm2,%ymm9
+  .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
+  .byte  196,65,116,89,208                   // vmulps        %ymm8,%ymm1,%ymm10
+  .byte  196,65,125,91,210                   // vcvtps2dq     %ymm10,%ymm10
+  .byte  196,193,33,114,242,8                // vpslld        $0x8,%xmm10,%xmm11
+  .byte  196,67,125,25,210,1                 // vextractf128  $0x1,%ymm10,%xmm10
+  .byte  196,193,41,114,242,8                // vpslld        $0x8,%xmm10,%xmm10
+  .byte  196,67,37,24,210,1                  // vinsertf128   $0x1,%xmm10,%ymm11,%ymm10
+  .byte  196,65,45,86,201                    // vorpd         %ymm9,%ymm10,%ymm9
+  .byte  196,65,124,89,208                   // vmulps        %ymm8,%ymm0,%ymm10
+  .byte  196,65,125,91,210                   // vcvtps2dq     %ymm10,%ymm10
+  .byte  196,193,33,114,242,16               // vpslld        $0x10,%xmm10,%xmm11
+  .byte  196,67,125,25,210,1                 // vextractf128  $0x1,%ymm10,%xmm10
+  .byte  196,193,41,114,242,16               // vpslld        $0x10,%xmm10,%xmm10
+  .byte  196,67,37,24,210,1                  // vinsertf128   $0x1,%xmm10,%ymm11,%ymm10
+  .byte  196,65,100,89,192                   // vmulps        %ymm8,%ymm3,%ymm8
+  .byte  196,65,125,91,192                   // vcvtps2dq     %ymm8,%ymm8
+  .byte  196,193,33,114,240,24               // vpslld        $0x18,%xmm8,%xmm11
+  .byte  196,67,125,25,192,1                 // vextractf128  $0x1,%ymm8,%xmm8
+  .byte  196,193,57,114,240,24               // vpslld        $0x18,%xmm8,%xmm8
+  .byte  196,67,37,24,192,1                  // vinsertf128   $0x1,%xmm8,%ymm11,%ymm8
+  .byte  196,65,45,86,192                    // vorpd         %ymm8,%ymm10,%ymm8
+  .byte  196,65,53,86,192                    // vorpd         %ymm8,%ymm9,%ymm8
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,12                              // jne           4f52 <_sk_store_bgra_avx+0xa9>
+  .byte  196,65,124,17,2                     // vmovups       %ymm8,(%r10)
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,137,201                          // mov           %r9,%rcx
+  .byte  255,224                             // jmpq          *%rax
+  .byte  185,8,0,0,0                         // mov           $0x8,%ecx
+  .byte  68,41,193                           // sub           %r8d,%ecx
+  .byte  192,225,3                           // shl           $0x3,%cl
+  .byte  72,199,192,255,255,255,255          // mov           $0xffffffffffffffff,%rax
+  .byte  72,211,232                          // shr           %cl,%rax
+  .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
+  .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
+  .byte  196,98,49,0,21,22,45,0,0            // vpshufb       0x2d16(%rip),%xmm9,%xmm10        # 7c90 <_sk_callback_avx+0x77e>
+  .byte  196,66,121,33,210                   // vpmovsxbd     %xmm10,%xmm10
+  .byte  196,98,49,0,13,24,45,0,0            // vpshufb       0x2d18(%rip),%xmm9,%xmm9        # 7ca0 <_sk_callback_avx+0x78e>
+  .byte  196,66,121,33,201                   // vpmovsxbd     %xmm9,%xmm9
+  .byte  196,67,45,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
+  .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
+  .byte  235,177                             // jmp           4f4b <_sk_store_bgra_avx+0xa2>
 
 HIDDEN _sk_load_f16_avx
 .globl _sk_load_f16_avx
@@ -21213,7 +22041,7 @@
   .byte  197,252,17,116,36,192               // vmovups       %ymm6,-0x40(%rsp)
   .byte  197,252,17,108,36,160               // vmovups       %ymm5,-0x60(%rsp)
   .byte  197,254,127,100,36,128              // vmovdqu       %ymm4,-0x80(%rsp)
-  .byte  15,133,141,2,0,0                    // jne           4e78 <_sk_load_f16_avx+0x2b7>
+  .byte  15,133,141,2,0,0                    // jne           5251 <_sk_load_f16_avx+0x2b7>
   .byte  197,121,16,4,208                    // vmovupd       (%rax,%rdx,8),%xmm8
   .byte  197,249,16,84,208,16                // vmovupd       0x10(%rax,%rdx,8),%xmm2
   .byte  197,249,16,76,208,32                // vmovupd       0x20(%rax,%rdx,8),%xmm1
@@ -21231,13 +22059,13 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
-  .byte  196,98,125,24,37,160,41,0,0         // vbroadcastss  0x29a0(%rip),%ymm12        # 75e4 <_sk_callback_avx+0x4aa>
+  .byte  196,98,125,24,37,175,41,0,0         // vbroadcastss  0x29af(%rip),%ymm12        # 79cc <_sk_callback_avx+0x4ba>
   .byte  196,193,124,84,204                  // vandps        %ymm12,%ymm0,%ymm1
   .byte  197,252,87,193                      // vxorps        %ymm1,%ymm0,%ymm0
   .byte  196,195,125,25,198,1                // vextractf128  $0x1,%ymm0,%xmm14
-  .byte  196,98,121,24,29,140,41,0,0         // vbroadcastss  0x298c(%rip),%xmm11        # 75e8 <_sk_callback_avx+0x4ae>
+  .byte  196,98,121,24,29,155,41,0,0         // vbroadcastss  0x299b(%rip),%xmm11        # 79d0 <_sk_callback_avx+0x4be>
   .byte  196,193,8,87,219                    // vxorps        %xmm11,%xmm14,%xmm3
-  .byte  196,98,121,24,45,130,41,0,0         // vbroadcastss  0x2982(%rip),%xmm13        # 75ec <_sk_callback_avx+0x4b2>
+  .byte  196,98,121,24,45,145,41,0,0         // vbroadcastss  0x2991(%rip),%xmm13        # 79d4 <_sk_callback_avx+0x4c2>
   .byte  197,145,102,219                     // vpcmpgtd      %xmm3,%xmm13,%xmm3
   .byte  196,65,120,87,211                   // vxorps        %xmm11,%xmm0,%xmm10
   .byte  196,65,17,102,210                   // vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -21251,7 +22079,7 @@
   .byte  196,227,125,24,195,1                // vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   .byte  197,252,86,193                      // vorps         %ymm1,%ymm0,%ymm0
   .byte  196,227,125,25,193,1                // vextractf128  $0x1,%ymm0,%xmm1
-  .byte  196,226,121,24,29,56,41,0,0         // vbroadcastss  0x2938(%rip),%xmm3        # 75f0 <_sk_callback_avx+0x4b6>
+  .byte  196,226,121,24,29,71,41,0,0         // vbroadcastss  0x2947(%rip),%xmm3        # 79d8 <_sk_callback_avx+0x4c6>
   .byte  197,241,254,203                     // vpaddd        %xmm3,%xmm1,%xmm1
   .byte  197,249,254,195                     // vpaddd        %xmm3,%xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
@@ -21344,29 +22172,29 @@
   .byte  197,123,16,4,208                    // vmovsd        (%rax,%rdx,8),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,79                              // je            4ed7 <_sk_load_f16_avx+0x316>
+  .byte  116,79                              // je            52b0 <_sk_load_f16_avx+0x316>
   .byte  197,57,22,68,208,8                  // vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,67                              // jb            4ed7 <_sk_load_f16_avx+0x316>
+  .byte  114,67                              // jb            52b0 <_sk_load_f16_avx+0x316>
   .byte  197,251,16,84,208,16                // vmovsd        0x10(%rax,%rdx,8),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,68                              // je            4ee4 <_sk_load_f16_avx+0x323>
+  .byte  116,68                              // je            52bd <_sk_load_f16_avx+0x323>
   .byte  197,233,22,84,208,24                // vmovhpd       0x18(%rax,%rdx,8),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,56                              // jb            4ee4 <_sk_load_f16_avx+0x323>
+  .byte  114,56                              // jb            52bd <_sk_load_f16_avx+0x323>
   .byte  197,251,16,76,208,32                // vmovsd        0x20(%rax,%rdx,8),%xmm1
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,70,253,255,255               // je            4c02 <_sk_load_f16_avx+0x41>
+  .byte  15,132,70,253,255,255               // je            4fdb <_sk_load_f16_avx+0x41>
   .byte  197,241,22,76,208,40                // vmovhpd       0x28(%rax,%rdx,8),%xmm1,%xmm1
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,54,253,255,255               // jb            4c02 <_sk_load_f16_avx+0x41>
+  .byte  15,130,54,253,255,255               // jb            4fdb <_sk_load_f16_avx+0x41>
   .byte  197,122,126,76,208,48               // vmovq         0x30(%rax,%rdx,8),%xmm9
-  .byte  233,43,253,255,255                  // jmpq          4c02 <_sk_load_f16_avx+0x41>
+  .byte  233,43,253,255,255                  // jmpq          4fdb <_sk_load_f16_avx+0x41>
   .byte  197,241,87,201                      // vxorpd        %xmm1,%xmm1,%xmm1
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,30,253,255,255                  // jmpq          4c02 <_sk_load_f16_avx+0x41>
+  .byte  233,30,253,255,255                  // jmpq          4fdb <_sk_load_f16_avx+0x41>
   .byte  197,241,87,201                      // vxorpd        %xmm1,%xmm1,%xmm1
-  .byte  233,21,253,255,255                  // jmpq          4c02 <_sk_load_f16_avx+0x41>
+  .byte  233,21,253,255,255                  // jmpq          4fdb <_sk_load_f16_avx+0x41>
 
 HIDDEN _sk_load_f16_dst_avx
 .globl _sk_load_f16_dst_avx
@@ -21380,7 +22208,7 @@
   .byte  197,252,17,84,36,192                // vmovups       %ymm2,-0x40(%rsp)
   .byte  197,252,17,76,36,160                // vmovups       %ymm1,-0x60(%rsp)
   .byte  197,254,127,68,36,128               // vmovdqu       %ymm0,-0x80(%rsp)
-  .byte  15,133,141,2,0,0                    // jne           51a4 <_sk_load_f16_dst_avx+0x2b7>
+  .byte  15,133,141,2,0,0                    // jne           557d <_sk_load_f16_dst_avx+0x2b7>
   .byte  197,121,16,4,208                    // vmovupd       (%rax,%rdx,8),%xmm8
   .byte  197,249,16,116,208,16               // vmovupd       0x10(%rax,%rdx,8),%xmm6
   .byte  197,249,16,108,208,32               // vmovupd       0x20(%rax,%rdx,8),%xmm5
@@ -21398,13 +22226,13 @@
   .byte  197,217,105,232                     // vpunpckhwd    %xmm0,%xmm4,%xmm5
   .byte  196,226,121,51,228                  // vpmovzxwd     %xmm4,%xmm4
   .byte  196,227,93,24,229,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
-  .byte  196,98,125,24,37,132,38,0,0         // vbroadcastss  0x2684(%rip),%ymm12        # 75f4 <_sk_callback_avx+0x4ba>
+  .byte  196,98,125,24,37,147,38,0,0         // vbroadcastss  0x2693(%rip),%ymm12        # 79dc <_sk_callback_avx+0x4ca>
   .byte  196,193,92,84,236                   // vandps        %ymm12,%ymm4,%ymm5
   .byte  197,220,87,229                      // vxorps        %ymm5,%ymm4,%ymm4
   .byte  196,195,125,25,230,1                // vextractf128  $0x1,%ymm4,%xmm14
-  .byte  196,98,121,24,29,112,38,0,0         // vbroadcastss  0x2670(%rip),%xmm11        # 75f8 <_sk_callback_avx+0x4be>
+  .byte  196,98,121,24,29,127,38,0,0         // vbroadcastss  0x267f(%rip),%xmm11        # 79e0 <_sk_callback_avx+0x4ce>
   .byte  196,193,8,87,251                    // vxorps        %xmm11,%xmm14,%xmm7
-  .byte  196,98,121,24,45,102,38,0,0         // vbroadcastss  0x2666(%rip),%xmm13        # 75fc <_sk_callback_avx+0x4c2>
+  .byte  196,98,121,24,45,117,38,0,0         // vbroadcastss  0x2675(%rip),%xmm13        # 79e4 <_sk_callback_avx+0x4d2>
   .byte  197,145,102,255                     // vpcmpgtd      %xmm7,%xmm13,%xmm7
   .byte  196,65,88,87,211                    // vxorps        %xmm11,%xmm4,%xmm10
   .byte  196,65,17,102,210                   // vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -21418,7 +22246,7 @@
   .byte  196,227,93,24,231,1                 // vinsertf128   $0x1,%xmm7,%ymm4,%ymm4
   .byte  197,220,86,229                      // vorps         %ymm5,%ymm4,%ymm4
   .byte  196,227,125,25,229,1                // vextractf128  $0x1,%ymm4,%xmm5
-  .byte  196,226,121,24,61,28,38,0,0         // vbroadcastss  0x261c(%rip),%xmm7        # 7600 <_sk_callback_avx+0x4c6>
+  .byte  196,226,121,24,61,43,38,0,0         // vbroadcastss  0x262b(%rip),%xmm7        # 79e8 <_sk_callback_avx+0x4d6>
   .byte  197,209,254,239                     // vpaddd        %xmm7,%xmm5,%xmm5
   .byte  197,217,254,231                     // vpaddd        %xmm7,%xmm4,%xmm4
   .byte  196,227,93,24,229,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
@@ -21511,29 +22339,29 @@
   .byte  197,123,16,4,208                    // vmovsd        (%rax,%rdx,8),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,79                              // je            5203 <_sk_load_f16_dst_avx+0x316>
+  .byte  116,79                              // je            55dc <_sk_load_f16_dst_avx+0x316>
   .byte  197,57,22,68,208,8                  // vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,67                              // jb            5203 <_sk_load_f16_dst_avx+0x316>
+  .byte  114,67                              // jb            55dc <_sk_load_f16_dst_avx+0x316>
   .byte  197,251,16,116,208,16               // vmovsd        0x10(%rax,%rdx,8),%xmm6
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,68                              // je            5210 <_sk_load_f16_dst_avx+0x323>
+  .byte  116,68                              // je            55e9 <_sk_load_f16_dst_avx+0x323>
   .byte  197,201,22,116,208,24               // vmovhpd       0x18(%rax,%rdx,8),%xmm6,%xmm6
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,56                              // jb            5210 <_sk_load_f16_dst_avx+0x323>
+  .byte  114,56                              // jb            55e9 <_sk_load_f16_dst_avx+0x323>
   .byte  197,251,16,108,208,32               // vmovsd        0x20(%rax,%rdx,8),%xmm5
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,70,253,255,255               // je            4f2e <_sk_load_f16_dst_avx+0x41>
+  .byte  15,132,70,253,255,255               // je            5307 <_sk_load_f16_dst_avx+0x41>
   .byte  197,209,22,108,208,40               // vmovhpd       0x28(%rax,%rdx,8),%xmm5,%xmm5
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,54,253,255,255               // jb            4f2e <_sk_load_f16_dst_avx+0x41>
+  .byte  15,130,54,253,255,255               // jb            5307 <_sk_load_f16_dst_avx+0x41>
   .byte  197,122,126,76,208,48               // vmovq         0x30(%rax,%rdx,8),%xmm9
-  .byte  233,43,253,255,255                  // jmpq          4f2e <_sk_load_f16_dst_avx+0x41>
+  .byte  233,43,253,255,255                  // jmpq          5307 <_sk_load_f16_dst_avx+0x41>
   .byte  197,209,87,237                      // vxorpd        %xmm5,%xmm5,%xmm5
   .byte  197,201,87,246                      // vxorpd        %xmm6,%xmm6,%xmm6
-  .byte  233,30,253,255,255                  // jmpq          4f2e <_sk_load_f16_dst_avx+0x41>
+  .byte  233,30,253,255,255                  // jmpq          5307 <_sk_load_f16_dst_avx+0x41>
   .byte  197,209,87,237                      // vxorpd        %xmm5,%xmm5,%xmm5
-  .byte  233,21,253,255,255                  // jmpq          4f2e <_sk_load_f16_dst_avx+0x41>
+  .byte  233,21,253,255,255                  // jmpq          5307 <_sk_load_f16_dst_avx+0x41>
 
 HIDDEN _sk_gather_f16_avx
 .globl _sk_gather_f16_avx
@@ -21594,13 +22422,13 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
-  .byte  196,98,125,24,37,225,34,0,0         // vbroadcastss  0x22e1(%rip),%ymm12        # 7604 <_sk_callback_avx+0x4ca>
+  .byte  196,98,125,24,37,240,34,0,0         // vbroadcastss  0x22f0(%rip),%ymm12        # 79ec <_sk_callback_avx+0x4da>
   .byte  196,193,124,84,204                  // vandps        %ymm12,%ymm0,%ymm1
   .byte  197,252,87,193                      // vxorps        %ymm1,%ymm0,%ymm0
   .byte  196,195,125,25,198,1                // vextractf128  $0x1,%ymm0,%xmm14
-  .byte  196,98,121,24,29,205,34,0,0         // vbroadcastss  0x22cd(%rip),%xmm11        # 7608 <_sk_callback_avx+0x4ce>
+  .byte  196,98,121,24,29,220,34,0,0         // vbroadcastss  0x22dc(%rip),%xmm11        # 79f0 <_sk_callback_avx+0x4de>
   .byte  196,193,8,87,219                    // vxorps        %xmm11,%xmm14,%xmm3
-  .byte  196,98,121,24,45,195,34,0,0         // vbroadcastss  0x22c3(%rip),%xmm13        # 760c <_sk_callback_avx+0x4d2>
+  .byte  196,98,121,24,45,210,34,0,0         // vbroadcastss  0x22d2(%rip),%xmm13        # 79f4 <_sk_callback_avx+0x4e2>
   .byte  197,145,102,219                     // vpcmpgtd      %xmm3,%xmm13,%xmm3
   .byte  196,65,120,87,211                   // vxorps        %xmm11,%xmm0,%xmm10
   .byte  196,65,17,102,210                   // vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -21614,7 +22442,7 @@
   .byte  196,227,125,24,195,1                // vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   .byte  197,252,86,193                      // vorps         %ymm1,%ymm0,%ymm0
   .byte  196,227,125,25,193,1                // vextractf128  $0x1,%ymm0,%xmm1
-  .byte  196,226,121,24,29,121,34,0,0        // vbroadcastss  0x2279(%rip),%xmm3        # 7610 <_sk_callback_avx+0x4d6>
+  .byte  196,226,121,24,29,136,34,0,0        // vbroadcastss  0x2288(%rip),%xmm3        # 79f8 <_sk_callback_avx+0x4e6>
   .byte  197,241,254,203                     // vpaddd        %xmm3,%xmm1,%xmm1
   .byte  197,249,254,195                     // vpaddd        %xmm3,%xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
@@ -21714,12 +22542,12 @@
   .byte  197,252,17,52,36                    // vmovups       %ymm6,(%rsp)
   .byte  197,252,17,108,36,224               // vmovups       %ymm5,-0x20(%rsp)
   .byte  197,252,17,100,36,192               // vmovups       %ymm4,-0x40(%rsp)
-  .byte  196,98,125,24,13,153,32,0,0         // vbroadcastss  0x2099(%rip),%ymm9        # 7614 <_sk_callback_avx+0x4da>
+  .byte  196,98,125,24,13,168,32,0,0         // vbroadcastss  0x20a8(%rip),%ymm9        # 79fc <_sk_callback_avx+0x4ea>
   .byte  196,65,124,84,209                   // vandps        %ymm9,%ymm0,%ymm10
   .byte  197,252,17,68,36,128                // vmovups       %ymm0,-0x80(%rsp)
   .byte  196,65,124,87,218                   // vxorps        %ymm10,%ymm0,%ymm11
   .byte  196,67,125,25,220,1                 // vextractf128  $0x1,%ymm11,%xmm12
-  .byte  196,98,121,24,5,126,32,0,0          // vbroadcastss  0x207e(%rip),%xmm8        # 7618 <_sk_callback_avx+0x4de>
+  .byte  196,98,121,24,5,141,32,0,0          // vbroadcastss  0x208d(%rip),%xmm8        # 7a00 <_sk_callback_avx+0x4ee>
   .byte  196,65,57,102,236                   // vpcmpgtd      %xmm12,%xmm8,%xmm13
   .byte  196,65,57,102,243                   // vpcmpgtd      %xmm11,%xmm8,%xmm14
   .byte  196,67,13,24,237,1                  // vinsertf128   $0x1,%xmm13,%ymm14,%ymm13
@@ -21729,7 +22557,7 @@
   .byte  196,67,13,24,242,1                  // vinsertf128   $0x1,%xmm10,%ymm14,%ymm14
   .byte  196,193,33,114,211,13               // vpsrld        $0xd,%xmm11,%xmm11
   .byte  196,193,25,114,212,13               // vpsrld        $0xd,%xmm12,%xmm12
-  .byte  196,98,125,24,21,69,32,0,0          // vbroadcastss  0x2045(%rip),%ymm10        # 761c <_sk_callback_avx+0x4e2>
+  .byte  196,98,125,24,21,84,32,0,0          // vbroadcastss  0x2054(%rip),%ymm10        # 7a04 <_sk_callback_avx+0x4f2>
   .byte  196,65,12,86,242                    // vorps         %ymm10,%ymm14,%ymm14
   .byte  196,67,125,25,247,1                 // vextractf128  $0x1,%ymm14,%xmm15
   .byte  196,65,1,254,228                    // vpaddd        %xmm12,%xmm15,%xmm12
@@ -21811,7 +22639,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           57b5 <_sk_store_f16_avx+0x25e>
+  .byte  117,66                              // jne           5b8e <_sk_store_f16_avx+0x25e>
   .byte  197,120,17,28,208                   // vmovups       %xmm11,(%rax,%rdx,8)
   .byte  197,120,17,84,208,16                // vmovups       %xmm10,0x10(%rax,%rdx,8)
   .byte  197,120,17,76,208,32                // vmovups       %xmm9,0x20(%rax,%rdx,8)
@@ -21827,22 +22655,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  197,121,214,28,208                  // vmovq         %xmm11,(%rax,%rdx,8)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,202                             // je            578a <_sk_store_f16_avx+0x233>
+  .byte  116,202                             // je            5b63 <_sk_store_f16_avx+0x233>
   .byte  197,121,23,92,208,8                 // vmovhpd       %xmm11,0x8(%rax,%rdx,8)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,190                             // jb            578a <_sk_store_f16_avx+0x233>
+  .byte  114,190                             // jb            5b63 <_sk_store_f16_avx+0x233>
   .byte  197,121,214,84,208,16               // vmovq         %xmm10,0x10(%rax,%rdx,8)
-  .byte  116,182                             // je            578a <_sk_store_f16_avx+0x233>
+  .byte  116,182                             // je            5b63 <_sk_store_f16_avx+0x233>
   .byte  197,121,23,84,208,24                // vmovhpd       %xmm10,0x18(%rax,%rdx,8)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,170                             // jb            578a <_sk_store_f16_avx+0x233>
+  .byte  114,170                             // jb            5b63 <_sk_store_f16_avx+0x233>
   .byte  197,121,214,76,208,32               // vmovq         %xmm9,0x20(%rax,%rdx,8)
-  .byte  116,162                             // je            578a <_sk_store_f16_avx+0x233>
+  .byte  116,162                             // je            5b63 <_sk_store_f16_avx+0x233>
   .byte  197,121,23,76,208,40                // vmovhpd       %xmm9,0x28(%rax,%rdx,8)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,150                             // jb            578a <_sk_store_f16_avx+0x233>
+  .byte  114,150                             // jb            5b63 <_sk_store_f16_avx+0x233>
   .byte  197,121,214,68,208,48               // vmovq         %xmm8,0x30(%rax,%rdx,8)
-  .byte  235,142                             // jmp           578a <_sk_store_f16_avx+0x233>
+  .byte  235,142                             // jmp           5b63 <_sk_store_f16_avx+0x233>
 
 HIDDEN _sk_load_u16_be_avx
 .globl _sk_load_u16_be_avx
@@ -21852,7 +22680,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,253,0,0,0                    // jne           590f <_sk_load_u16_be_avx+0x113>
+  .byte  15,133,253,0,0,0                    // jne           5ce8 <_sk_load_u16_be_avx+0x113>
   .byte  196,65,121,16,4,65                  // vmovupd       (%r9,%rax,2),%xmm8
   .byte  196,193,121,16,84,65,16             // vmovupd       0x10(%r9,%rax,2),%xmm2
   .byte  196,193,121,16,92,65,32             // vmovupd       0x20(%r9,%rax,2),%xmm3
@@ -21874,7 +22702,7 @@
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,29,157,29,0,0         // vbroadcastss  0x1d9d(%rip),%ymm11        # 7620 <_sk_callback_avx+0x4e6>
+  .byte  196,98,125,24,29,172,29,0,0         // vbroadcastss  0x1dac(%rip),%ymm11        # 7a08 <_sk_callback_avx+0x4f6>
   .byte  196,193,124,89,195                  // vmulps        %ymm11,%ymm0,%ymm0
   .byte  197,177,109,202                     // vpunpckhqdq   %xmm2,%xmm9,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -21908,29 +22736,29 @@
   .byte  196,65,123,16,4,65                  // vmovsd        (%r9,%rax,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,85                              // je            5975 <_sk_load_u16_be_avx+0x179>
+  .byte  116,85                              // je            5d4e <_sk_load_u16_be_avx+0x179>
   .byte  196,65,57,22,68,65,8                // vmovhpd       0x8(%r9,%rax,2),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,72                              // jb            5975 <_sk_load_u16_be_avx+0x179>
+  .byte  114,72                              // jb            5d4e <_sk_load_u16_be_avx+0x179>
   .byte  196,193,123,16,84,65,16             // vmovsd        0x10(%r9,%rax,2),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,72                              // je            5982 <_sk_load_u16_be_avx+0x186>
+  .byte  116,72                              // je            5d5b <_sk_load_u16_be_avx+0x186>
   .byte  196,193,105,22,84,65,24             // vmovhpd       0x18(%r9,%rax,2),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,59                              // jb            5982 <_sk_load_u16_be_avx+0x186>
+  .byte  114,59                              // jb            5d5b <_sk_load_u16_be_avx+0x186>
   .byte  196,193,123,16,92,65,32             // vmovsd        0x20(%r9,%rax,2),%xmm3
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,213,254,255,255              // je            582d <_sk_load_u16_be_avx+0x31>
+  .byte  15,132,213,254,255,255              // je            5c06 <_sk_load_u16_be_avx+0x31>
   .byte  196,193,97,22,92,65,40              // vmovhpd       0x28(%r9,%rax,2),%xmm3,%xmm3
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,196,254,255,255              // jb            582d <_sk_load_u16_be_avx+0x31>
+  .byte  15,130,196,254,255,255              // jb            5c06 <_sk_load_u16_be_avx+0x31>
   .byte  196,65,122,126,76,65,48             // vmovq         0x30(%r9,%rax,2),%xmm9
-  .byte  233,184,254,255,255                 // jmpq          582d <_sk_load_u16_be_avx+0x31>
+  .byte  233,184,254,255,255                 // jmpq          5c06 <_sk_load_u16_be_avx+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,171,254,255,255                 // jmpq          582d <_sk_load_u16_be_avx+0x31>
+  .byte  233,171,254,255,255                 // jmpq          5c06 <_sk_load_u16_be_avx+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,162,254,255,255                 // jmpq          582d <_sk_load_u16_be_avx+0x31>
+  .byte  233,162,254,255,255                 // jmpq          5c06 <_sk_load_u16_be_avx+0x31>
 
 HIDDEN _sk_load_rgb_u16_be_avx
 .globl _sk_load_rgb_u16_be_avx
@@ -21940,7 +22768,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,82                         // lea           (%rdx,%rdx,2),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,243,0,0,0                    // jne           5a90 <_sk_load_rgb_u16_be_avx+0x105>
+  .byte  15,133,243,0,0,0                    // jne           5e69 <_sk_load_rgb_u16_be_avx+0x105>
   .byte  196,193,122,111,4,65                // vmovdqu       (%r9,%rax,2),%xmm0
   .byte  196,193,122,111,84,65,12            // vmovdqu       0xc(%r9,%rax,2),%xmm2
   .byte  196,193,122,111,76,65,24            // vmovdqu       0x18(%r9,%rax,2),%xmm1
@@ -21967,7 +22795,7 @@
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,29,253,27,0,0         // vbroadcastss  0x1bfd(%rip),%ymm11        # 7624 <_sk_callback_avx+0x4ea>
+  .byte  196,98,125,24,29,12,28,0,0          // vbroadcastss  0x1c0c(%rip),%ymm11        # 7a0c <_sk_callback_avx+0x4fa>
   .byte  196,193,124,89,195                  // vmulps        %ymm11,%ymm0,%ymm0
   .byte  197,185,109,202                     // vpunpckhqdq   %xmm2,%xmm8,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -21988,41 +22816,41 @@
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,211                  // vmulps        %ymm11,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,154,27,0,0        // vbroadcastss  0x1b9a(%rip),%ymm3        # 7628 <_sk_callback_avx+0x4ee>
+  .byte  196,226,125,24,29,169,27,0,0        // vbroadcastss  0x1ba9(%rip),%ymm3        # 7a10 <_sk_callback_avx+0x4fe>
   .byte  255,224                             // jmpq          *%rax
   .byte  196,193,121,110,4,65                // vmovd         (%r9,%rax,2),%xmm0
   .byte  196,193,121,196,68,65,4,2           // vpinsrw       $0x2,0x4(%r9,%rax,2),%xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,5                               // jne           5aa9 <_sk_load_rgb_u16_be_avx+0x11e>
-  .byte  233,40,255,255,255                  // jmpq          59d1 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  117,5                               // jne           5e82 <_sk_load_rgb_u16_be_avx+0x11e>
+  .byte  233,40,255,255,255                  // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
   .byte  196,193,121,110,76,65,6             // vmovd         0x6(%r9,%rax,2),%xmm1
   .byte  196,65,113,196,68,65,10,2           // vpinsrw       $0x2,0xa(%r9,%rax,2),%xmm1,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,26                              // jb            5ad8 <_sk_load_rgb_u16_be_avx+0x14d>
+  .byte  114,26                              // jb            5eb1 <_sk_load_rgb_u16_be_avx+0x14d>
   .byte  196,193,121,110,76,65,12            // vmovd         0xc(%r9,%rax,2),%xmm1
   .byte  196,193,113,196,84,65,16,2          // vpinsrw       $0x2,0x10(%r9,%rax,2),%xmm1,%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  117,10                              // jne           5add <_sk_load_rgb_u16_be_avx+0x152>
-  .byte  233,249,254,255,255                 // jmpq          59d1 <_sk_load_rgb_u16_be_avx+0x46>
-  .byte  233,244,254,255,255                 // jmpq          59d1 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  117,10                              // jne           5eb6 <_sk_load_rgb_u16_be_avx+0x152>
+  .byte  233,249,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,244,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
   .byte  196,193,121,110,76,65,18            // vmovd         0x12(%r9,%rax,2),%xmm1
   .byte  196,65,113,196,76,65,22,2           // vpinsrw       $0x2,0x16(%r9,%rax,2),%xmm1,%xmm9
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,26                              // jb            5b0c <_sk_load_rgb_u16_be_avx+0x181>
+  .byte  114,26                              // jb            5ee5 <_sk_load_rgb_u16_be_avx+0x181>
   .byte  196,193,121,110,76,65,24            // vmovd         0x18(%r9,%rax,2),%xmm1
   .byte  196,193,113,196,76,65,28,2          // vpinsrw       $0x2,0x1c(%r9,%rax,2),%xmm1,%xmm1
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  117,10                              // jne           5b11 <_sk_load_rgb_u16_be_avx+0x186>
-  .byte  233,197,254,255,255                 // jmpq          59d1 <_sk_load_rgb_u16_be_avx+0x46>
-  .byte  233,192,254,255,255                 // jmpq          59d1 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  117,10                              // jne           5eea <_sk_load_rgb_u16_be_avx+0x186>
+  .byte  233,197,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,192,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
   .byte  196,193,121,110,92,65,30            // vmovd         0x1e(%r9,%rax,2),%xmm3
   .byte  196,65,97,196,92,65,34,2            // vpinsrw       $0x2,0x22(%r9,%rax,2),%xmm3,%xmm11
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,20                              // jb            5b3a <_sk_load_rgb_u16_be_avx+0x1af>
+  .byte  114,20                              // jb            5f13 <_sk_load_rgb_u16_be_avx+0x1af>
   .byte  196,193,121,110,92,65,36            // vmovd         0x24(%r9,%rax,2),%xmm3
   .byte  196,193,97,196,92,65,40,2           // vpinsrw       $0x2,0x28(%r9,%rax,2),%xmm3,%xmm3
-  .byte  233,151,254,255,255                 // jmpq          59d1 <_sk_load_rgb_u16_be_avx+0x46>
-  .byte  233,146,254,255,255                 // jmpq          59d1 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,151,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,146,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
 
 HIDDEN _sk_store_u16_be_avx
 .globl _sk_store_u16_be_avx
@@ -22031,7 +22859,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
-  .byte  196,98,125,24,5,215,26,0,0          // vbroadcastss  0x1ad7(%rip),%ymm8        # 762c <_sk_callback_avx+0x4f2>
+  .byte  196,98,125,24,5,230,26,0,0          // vbroadcastss  0x1ae6(%rip),%ymm8        # 7a14 <_sk_callback_avx+0x502>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,67,125,25,202,1                 // vextractf128  $0x1,%ymm9,%xmm10
@@ -22069,7 +22897,7 @@
   .byte  196,65,17,98,200                    // vpunpckldq    %xmm8,%xmm13,%xmm9
   .byte  196,65,17,106,192                   // vpunpckhdq    %xmm8,%xmm13,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,31                              // jne           5c39 <_sk_store_u16_be_avx+0xfa>
+  .byte  117,31                              // jne           6012 <_sk_store_u16_be_avx+0xfa>
   .byte  196,65,120,17,28,65                 // vmovups       %xmm11,(%r9,%rax,2)
   .byte  196,65,120,17,84,65,16              // vmovups       %xmm10,0x10(%r9,%rax,2)
   .byte  196,65,120,17,76,65,32              // vmovups       %xmm9,0x20(%r9,%rax,2)
@@ -22078,22 +22906,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,214,28,65                // vmovq         %xmm11,(%r9,%rax,2)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            5c35 <_sk_store_u16_be_avx+0xf6>
+  .byte  116,240                             // je            600e <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,23,92,65,8               // vmovhpd       %xmm11,0x8(%r9,%rax,2)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            5c35 <_sk_store_u16_be_avx+0xf6>
+  .byte  114,227                             // jb            600e <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,214,84,65,16             // vmovq         %xmm10,0x10(%r9,%rax,2)
-  .byte  116,218                             // je            5c35 <_sk_store_u16_be_avx+0xf6>
+  .byte  116,218                             // je            600e <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,23,84,65,24              // vmovhpd       %xmm10,0x18(%r9,%rax,2)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,205                             // jb            5c35 <_sk_store_u16_be_avx+0xf6>
+  .byte  114,205                             // jb            600e <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,214,76,65,32             // vmovq         %xmm9,0x20(%r9,%rax,2)
-  .byte  116,196                             // je            5c35 <_sk_store_u16_be_avx+0xf6>
+  .byte  116,196                             // je            600e <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,23,76,65,40              // vmovhpd       %xmm9,0x28(%r9,%rax,2)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,183                             // jb            5c35 <_sk_store_u16_be_avx+0xf6>
+  .byte  114,183                             // jb            600e <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,214,68,65,48             // vmovq         %xmm8,0x30(%r9,%rax,2)
-  .byte  235,174                             // jmp           5c35 <_sk_store_u16_be_avx+0xf6>
+  .byte  235,174                             // jmp           600e <_sk_store_u16_be_avx+0xf6>
 
 HIDDEN _sk_load_f32_avx
 .globl _sk_load_f32_avx
@@ -22101,10 +22929,10 @@
 _sk_load_f32_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  119,110                             // ja            5cfd <_sk_load_f32_avx+0x76>
+  .byte  119,110                             // ja            60d6 <_sk_load_f32_avx+0x76>
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
-  .byte  76,141,29,135,0,0,0                 // lea           0x87(%rip),%r11        # 5d28 <_sk_load_f32_avx+0xa1>
+  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 6100 <_sk_load_f32_avx+0xa0>
   .byte  75,99,4,131                         // movslq        (%r11,%r8,4),%rax
   .byte  76,1,216                            // add           %r11,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -22130,21 +22958,19 @@
   .byte  196,193,101,21,216                  // vunpckhpd     %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
-  .byte  15,31,0                             // nopl          (%rax)
-  .byte  130                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  255,201                             // dec           %ecx
+  .byte  102,144                             // xchg          %ax,%ax
+  .byte  131,255,255                         // cmp           $0xffffffff,%edi
+  .byte  255,202                             // dec           %edx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  188,255,255,255,175                 // mov           $0xafffffff,%esp
+  .byte  189,255,255,255,176                 // mov           $0xb0ffffff,%ebp
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,162,255,255,255,154             // jmpq          *-0x65000001(%rdx)
+  .byte  255,163,255,255,255,155             // jmpq          *-0x64000001(%rbx)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,146,255,255,255,138             // callq         *-0x75000001(%rdx)
+  .byte  255,147,255,255,255,139             // callq         *-0x74000001(%rbx)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
@@ -22155,10 +22981,10 @@
 _sk_load_f32_dst_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  119,110                             // ja            5dbe <_sk_load_f32_dst_avx+0x76>
+  .byte  119,110                             // ja            6196 <_sk_load_f32_dst_avx+0x76>
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
-  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 5de8 <_sk_load_f32_dst_avx+0xa0>
+  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 61c0 <_sk_load_f32_dst_avx+0xa0>
   .byte  75,99,4,131                         // movslq        (%r11,%r8,4),%rax
   .byte  76,1,216                            // add           %r11,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -22217,7 +23043,7 @@
   .byte  196,65,37,20,196                    // vunpcklpd     %ymm12,%ymm11,%ymm8
   .byte  196,65,37,21,220                    // vunpckhpd     %ymm12,%ymm11,%ymm11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,55                              // jne           5e75 <_sk_store_f32_avx+0x6d>
+  .byte  117,55                              // jne           624d <_sk_store_f32_avx+0x6d>
   .byte  196,67,45,24,225,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   .byte  196,67,61,24,235,1                  // vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   .byte  196,67,45,6,201,49                  // vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -22230,22 +23056,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,17,20,129                // vmovupd       %xmm10,(%r9,%rax,4)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            5e71 <_sk_store_f32_avx+0x69>
+  .byte  116,240                             // je            6249 <_sk_store_f32_avx+0x69>
   .byte  196,65,121,17,76,129,16             // vmovupd       %xmm9,0x10(%r9,%rax,4)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            5e71 <_sk_store_f32_avx+0x69>
+  .byte  114,227                             // jb            6249 <_sk_store_f32_avx+0x69>
   .byte  196,65,121,17,68,129,32             // vmovupd       %xmm8,0x20(%r9,%rax,4)
-  .byte  116,218                             // je            5e71 <_sk_store_f32_avx+0x69>
+  .byte  116,218                             // je            6249 <_sk_store_f32_avx+0x69>
   .byte  196,65,121,17,92,129,48             // vmovupd       %xmm11,0x30(%r9,%rax,4)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,205                             // jb            5e71 <_sk_store_f32_avx+0x69>
+  .byte  114,205                             // jb            6249 <_sk_store_f32_avx+0x69>
   .byte  196,67,125,25,84,129,64,1           // vextractf128  $0x1,%ymm10,0x40(%r9,%rax,4)
-  .byte  116,195                             // je            5e71 <_sk_store_f32_avx+0x69>
+  .byte  116,195                             // je            6249 <_sk_store_f32_avx+0x69>
   .byte  196,67,125,25,76,129,80,1           // vextractf128  $0x1,%ymm9,0x50(%r9,%rax,4)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,181                             // jb            5e71 <_sk_store_f32_avx+0x69>
+  .byte  114,181                             // jb            6249 <_sk_store_f32_avx+0x69>
   .byte  196,67,125,25,68,129,96,1           // vextractf128  $0x1,%ymm8,0x60(%r9,%rax,4)
-  .byte  235,171                             // jmp           5e71 <_sk_store_f32_avx+0x69>
+  .byte  235,171                             // jmp           6249 <_sk_store_f32_avx+0x69>
 
 HIDDEN _sk_clamp_x_avx
 .globl _sk_clamp_x_avx
@@ -22334,7 +23160,7 @@
   .byte  196,193,58,88,192                   // vaddss        %xmm8,%xmm8,%xmm0
   .byte  196,227,121,4,192,0                 // vpermilps     $0x0,%xmm0,%xmm0
   .byte  196,99,125,24,192,1                 // vinsertf128   $0x1,%xmm0,%ymm0,%ymm8
-  .byte  197,178,89,5,71,22,0,0              // vmulss        0x1647(%rip),%xmm9,%xmm0        # 7630 <_sk_callback_avx+0x4f6>
+  .byte  197,178,89,5,87,22,0,0              // vmulss        0x1657(%rip),%xmm9,%xmm0        # 7a18 <_sk_callback_avx+0x506>
   .byte  196,227,121,4,192,0                 // vpermilps     $0x0,%xmm0,%xmm0
   .byte  196,227,125,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   .byte  197,164,89,192                      // vmulps        %ymm0,%ymm11,%ymm0
@@ -22367,7 +23193,7 @@
   .byte  196,193,58,88,200                   // vaddss        %xmm8,%xmm8,%xmm1
   .byte  196,227,121,4,201,0                 // vpermilps     $0x0,%xmm1,%xmm1
   .byte  196,99,117,24,193,1                 // vinsertf128   $0x1,%xmm1,%ymm1,%ymm8
-  .byte  197,178,89,13,194,21,0,0            // vmulss        0x15c2(%rip),%xmm9,%xmm1        # 7634 <_sk_callback_avx+0x4fa>
+  .byte  197,178,89,13,210,21,0,0            // vmulss        0x15d2(%rip),%xmm9,%xmm1        # 7a1c <_sk_callback_avx+0x50a>
   .byte  196,227,121,4,201,0                 // vpermilps     $0x0,%xmm1,%xmm1
   .byte  196,227,117,24,201,1                // vinsertf128   $0x1,%xmm1,%ymm1,%ymm1
   .byte  197,164,89,201                      // vmulps        %ymm1,%ymm11,%ymm1
@@ -22393,7 +23219,7 @@
 _sk_clamp_x_1_avx:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  197,188,95,192                      // vmaxps        %ymm0,%ymm8,%ymm0
-  .byte  196,98,125,24,5,96,21,0,0           // vbroadcastss  0x1560(%rip),%ymm8        # 7638 <_sk_callback_avx+0x4fe>
+  .byte  196,98,125,24,5,112,21,0,0          // vbroadcastss  0x1570(%rip),%ymm8        # 7a20 <_sk_callback_avx+0x50e>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -22411,9 +23237,9 @@
 .globl _sk_mirror_x_1_avx
 FUNCTION(_sk_mirror_x_1_avx)
 _sk_mirror_x_1_avx:
-  .byte  196,98,125,24,5,67,21,0,0           // vbroadcastss  0x1543(%rip),%ymm8        # 763c <_sk_callback_avx+0x502>
+  .byte  196,98,125,24,5,83,21,0,0           // vbroadcastss  0x1553(%rip),%ymm8        # 7a24 <_sk_callback_avx+0x512>
   .byte  196,193,124,88,192                  // vaddps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,13,57,21,0,0          // vbroadcastss  0x1539(%rip),%ymm9        # 7640 <_sk_callback_avx+0x506>
+  .byte  196,98,125,24,13,73,21,0,0          // vbroadcastss  0x1549(%rip),%ymm9        # 7a28 <_sk_callback_avx+0x516>
   .byte  196,65,124,89,201                   // vmulps        %ymm9,%ymm0,%ymm9
   .byte  196,67,125,8,201,1                  // vroundps      $0x1,%ymm9,%ymm9
   .byte  196,65,52,88,201                    // vaddps        %ymm9,%ymm9,%ymm9
@@ -22429,12 +23255,12 @@
 .globl _sk_luminance_to_alpha_avx
 FUNCTION(_sk_luminance_to_alpha_avx)
 _sk_luminance_to_alpha_avx:
-  .byte  196,226,125,24,29,9,21,0,0          // vbroadcastss  0x1509(%rip),%ymm3        # 7644 <_sk_callback_avx+0x50a>
+  .byte  196,226,125,24,29,25,21,0,0         // vbroadcastss  0x1519(%rip),%ymm3        # 7a2c <_sk_callback_avx+0x51a>
   .byte  197,252,89,195                      // vmulps        %ymm3,%ymm0,%ymm0
-  .byte  196,226,125,24,29,0,21,0,0          // vbroadcastss  0x1500(%rip),%ymm3        # 7648 <_sk_callback_avx+0x50e>
+  .byte  196,226,125,24,29,16,21,0,0         // vbroadcastss  0x1510(%rip),%ymm3        # 7a30 <_sk_callback_avx+0x51e>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,243,20,0,0        // vbroadcastss  0x14f3(%rip),%ymm1        # 764c <_sk_callback_avx+0x512>
+  .byte  196,226,125,24,13,3,21,0,0          // vbroadcastss  0x1503(%rip),%ymm1        # 7a34 <_sk_callback_avx+0x522>
   .byte  197,236,89,201                      // vmulps        %ymm1,%ymm2,%ymm1
   .byte  197,252,88,217                      // vaddps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -22654,9 +23480,9 @@
   .byte  72,139,24                           // mov           (%rax),%rbx
   .byte  72,139,104,8                        // mov           0x8(%rax),%rbp
   .byte  72,255,203                          // dec           %rbx
-  .byte  120,7                               // js            64b5 <_sk_evenly_spaced_gradient_avx+0x25>
+  .byte  120,7                               // js            688d <_sk_evenly_spaced_gradient_avx+0x25>
   .byte  196,225,242,42,203                  // vcvtsi2ss     %rbx,%xmm1,%xmm1
-  .byte  235,21                              // jmp           64ca <_sk_evenly_spaced_gradient_avx+0x3a>
+  .byte  235,21                              // jmp           68a2 <_sk_evenly_spaced_gradient_avx+0x3a>
   .byte  73,137,217                          // mov           %rbx,%r9
   .byte  73,209,233                          // shr           %r9
   .byte  131,227,1                           // and           $0x1,%ebx
@@ -22814,18 +23640,18 @@
 .globl _sk_gauss_a_to_rgba_avx
 FUNCTION(_sk_gauss_a_to_rgba_avx)
 _sk_gauss_a_to_rgba_avx:
-  .byte  196,226,125,24,5,34,14,0,0          // vbroadcastss  0xe22(%rip),%ymm0        # 7650 <_sk_callback_avx+0x516>
+  .byte  196,226,125,24,5,50,14,0,0          // vbroadcastss  0xe32(%rip),%ymm0        # 7a38 <_sk_callback_avx+0x526>
   .byte  197,228,89,192                      // vmulps        %ymm0,%ymm3,%ymm0
-  .byte  196,226,125,24,13,25,14,0,0         // vbroadcastss  0xe19(%rip),%ymm1        # 7654 <_sk_callback_avx+0x51a>
+  .byte  196,226,125,24,13,41,14,0,0         // vbroadcastss  0xe29(%rip),%ymm1        # 7a3c <_sk_callback_avx+0x52a>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,89,195                      // vmulps        %ymm3,%ymm0,%ymm0
-  .byte  196,226,125,24,13,12,14,0,0         // vbroadcastss  0xe0c(%rip),%ymm1        # 7658 <_sk_callback_avx+0x51e>
+  .byte  196,226,125,24,13,28,14,0,0         // vbroadcastss  0xe1c(%rip),%ymm1        # 7a40 <_sk_callback_avx+0x52e>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,89,195                      // vmulps        %ymm3,%ymm0,%ymm0
-  .byte  196,226,125,24,13,255,13,0,0        // vbroadcastss  0xdff(%rip),%ymm1        # 765c <_sk_callback_avx+0x522>
+  .byte  196,226,125,24,13,15,14,0,0         // vbroadcastss  0xe0f(%rip),%ymm1        # 7a44 <_sk_callback_avx+0x532>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,89,195                      // vmulps        %ymm3,%ymm0,%ymm0
-  .byte  196,226,125,24,13,242,13,0,0        // vbroadcastss  0xdf2(%rip),%ymm1        # 7660 <_sk_callback_avx+0x526>
+  .byte  196,226,125,24,13,2,14,0,0          // vbroadcastss  0xe02(%rip),%ymm1        # 7a48 <_sk_callback_avx+0x536>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
@@ -22848,12 +23674,12 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
   .byte  73,131,249,2                        // cmp           $0x2,%r9
-  .byte  114,80                              // jb            68f1 <_sk_gradient_avx+0x6f>
+  .byte  114,80                              // jb            6cc9 <_sk_gradient_avx+0x6f>
   .byte  72,139,88,72                        // mov           0x48(%rax),%rbx
   .byte  73,255,201                          // dec           %r9
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  196,65,52,87,201                    // vxorps        %ymm9,%ymm9,%ymm9
-  .byte  196,98,125,24,21,170,13,0,0         // vbroadcastss  0xdaa(%rip),%ymm10        # 7664 <_sk_callback_avx+0x52a>
+  .byte  196,98,125,24,21,186,13,0,0         // vbroadcastss  0xdba(%rip),%ymm10        # 7a4c <_sk_callback_avx+0x53a>
   .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
   .byte  196,98,125,24,3                     // vbroadcastss  (%rbx),%ymm8
   .byte  197,60,194,192,2                    // vcmpleps      %ymm0,%ymm8,%ymm8
@@ -22865,7 +23691,7 @@
   .byte  196,227,117,24,202,1                // vinsertf128   $0x1,%xmm2,%ymm1,%ymm1
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  73,255,201                          // dec           %r9
-  .byte  117,205                             // jne           68be <_sk_gradient_avx+0x3c>
+  .byte  117,205                             // jne           6c96 <_sk_gradient_avx+0x3c>
   .byte  196,195,249,22,201,1                // vpextrq       $0x1,%xmm1,%r9
   .byte  69,137,202                          // mov           %r9d,%r10d
   .byte  73,193,233,32                       // shr           $0x20,%r9
@@ -23048,27 +23874,27 @@
   .byte  196,65,52,95,226                    // vmaxps        %ymm10,%ymm9,%ymm12
   .byte  196,65,36,94,220                    // vdivps        %ymm12,%ymm11,%ymm11
   .byte  196,65,36,89,227                    // vmulps        %ymm11,%ymm11,%ymm12
-  .byte  196,98,125,24,45,160,9,0,0          // vbroadcastss  0x9a0(%rip),%ymm13        # 7668 <_sk_callback_avx+0x52e>
+  .byte  196,98,125,24,45,176,9,0,0          // vbroadcastss  0x9b0(%rip),%ymm13        # 7a50 <_sk_callback_avx+0x53e>
   .byte  196,65,28,89,237                    // vmulps        %ymm13,%ymm12,%ymm13
-  .byte  196,98,125,24,53,150,9,0,0          // vbroadcastss  0x996(%rip),%ymm14        # 766c <_sk_callback_avx+0x532>
+  .byte  196,98,125,24,53,166,9,0,0          // vbroadcastss  0x9a6(%rip),%ymm14        # 7a54 <_sk_callback_avx+0x542>
   .byte  196,65,20,88,238                    // vaddps        %ymm14,%ymm13,%ymm13
   .byte  196,65,28,89,237                    // vmulps        %ymm13,%ymm12,%ymm13
-  .byte  196,98,125,24,53,135,9,0,0          // vbroadcastss  0x987(%rip),%ymm14        # 7670 <_sk_callback_avx+0x536>
+  .byte  196,98,125,24,53,151,9,0,0          // vbroadcastss  0x997(%rip),%ymm14        # 7a58 <_sk_callback_avx+0x546>
   .byte  196,65,20,88,238                    // vaddps        %ymm14,%ymm13,%ymm13
   .byte  196,65,28,89,229                    // vmulps        %ymm13,%ymm12,%ymm12
-  .byte  196,98,125,24,45,120,9,0,0          // vbroadcastss  0x978(%rip),%ymm13        # 7674 <_sk_callback_avx+0x53a>
+  .byte  196,98,125,24,45,136,9,0,0          // vbroadcastss  0x988(%rip),%ymm13        # 7a5c <_sk_callback_avx+0x54a>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
   .byte  196,65,52,194,202,1                 // vcmpltps      %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,21,99,9,0,0           // vbroadcastss  0x963(%rip),%ymm10        # 7678 <_sk_callback_avx+0x53e>
+  .byte  196,98,125,24,21,115,9,0,0          // vbroadcastss  0x973(%rip),%ymm10        # 7a60 <_sk_callback_avx+0x54e>
   .byte  196,65,44,92,211                    // vsubps        %ymm11,%ymm10,%ymm10
   .byte  196,67,37,74,202,144                // vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   .byte  196,193,124,194,192,1               // vcmpltps      %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,21,77,9,0,0           // vbroadcastss  0x94d(%rip),%ymm10        # 767c <_sk_callback_avx+0x542>
+  .byte  196,98,125,24,21,93,9,0,0           // vbroadcastss  0x95d(%rip),%ymm10        # 7a64 <_sk_callback_avx+0x552>
   .byte  196,65,44,92,209                    // vsubps        %ymm9,%ymm10,%ymm10
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  196,65,116,194,200,1                // vcmpltps      %ymm8,%ymm1,%ymm9
-  .byte  196,98,125,24,21,55,9,0,0           // vbroadcastss  0x937(%rip),%ymm10        # 7680 <_sk_callback_avx+0x546>
+  .byte  196,98,125,24,21,71,9,0,0           // vbroadcastss  0x947(%rip),%ymm10        # 7a68 <_sk_callback_avx+0x556>
   .byte  197,44,92,208                       // vsubps        %ymm0,%ymm10,%ymm10
   .byte  196,195,125,74,194,144              // vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   .byte  196,65,124,194,200,3                // vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -23092,7 +23918,7 @@
 FUNCTION(_sk_save_xy_avx)
 _sk_save_xy_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,1,9,0,0             // vbroadcastss  0x901(%rip),%ymm8        # 7684 <_sk_callback_avx+0x54a>
+  .byte  196,98,125,24,5,17,9,0,0            // vbroadcastss  0x911(%rip),%ymm8        # 7a6c <_sk_callback_avx+0x55a>
   .byte  196,65,124,88,200                   // vaddps        %ymm8,%ymm0,%ymm9
   .byte  196,67,125,8,209,1                  // vroundps      $0x1,%ymm9,%ymm10
   .byte  196,65,52,92,202                    // vsubps        %ymm10,%ymm9,%ymm9
@@ -23129,9 +23955,9 @@
 FUNCTION(_sk_bilinear_nx_avx)
 _sk_bilinear_nx_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,141,8,0,0          // vbroadcastss  0x88d(%rip),%ymm0        # 7688 <_sk_callback_avx+0x54e>
+  .byte  196,226,125,24,5,157,8,0,0          // vbroadcastss  0x89d(%rip),%ymm0        # 7a70 <_sk_callback_avx+0x55e>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,132,8,0,0           // vbroadcastss  0x884(%rip),%ymm8        # 768c <_sk_callback_avx+0x552>
+  .byte  196,98,125,24,5,148,8,0,0           // vbroadcastss  0x894(%rip),%ymm8        # 7a74 <_sk_callback_avx+0x562>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -23142,7 +23968,7 @@
 FUNCTION(_sk_bilinear_px_avx)
 _sk_bilinear_px_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,108,8,0,0          // vbroadcastss  0x86c(%rip),%ymm0        # 7690 <_sk_callback_avx+0x556>
+  .byte  196,226,125,24,5,124,8,0,0          // vbroadcastss  0x87c(%rip),%ymm0        # 7a78 <_sk_callback_avx+0x566>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -23154,9 +23980,9 @@
 FUNCTION(_sk_bilinear_ny_avx)
 _sk_bilinear_ny_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,80,8,0,0          // vbroadcastss  0x850(%rip),%ymm1        # 7694 <_sk_callback_avx+0x55a>
+  .byte  196,226,125,24,13,96,8,0,0          // vbroadcastss  0x860(%rip),%ymm1        # 7a7c <_sk_callback_avx+0x56a>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,70,8,0,0            // vbroadcastss  0x846(%rip),%ymm8        # 7698 <_sk_callback_avx+0x55e>
+  .byte  196,98,125,24,5,86,8,0,0            // vbroadcastss  0x856(%rip),%ymm8        # 7a80 <_sk_callback_avx+0x56e>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -23167,7 +23993,7 @@
 FUNCTION(_sk_bilinear_py_avx)
 _sk_bilinear_py_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,46,8,0,0          // vbroadcastss  0x82e(%rip),%ymm1        # 769c <_sk_callback_avx+0x562>
+  .byte  196,226,125,24,13,62,8,0,0          // vbroadcastss  0x83e(%rip),%ymm1        # 7a84 <_sk_callback_avx+0x572>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -23179,14 +24005,14 @@
 FUNCTION(_sk_bicubic_n3x_avx)
 _sk_bicubic_n3x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,17,8,0,0           // vbroadcastss  0x811(%rip),%ymm0        # 76a0 <_sk_callback_avx+0x566>
+  .byte  196,226,125,24,5,33,8,0,0           // vbroadcastss  0x821(%rip),%ymm0        # 7a88 <_sk_callback_avx+0x576>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,8,8,0,0             // vbroadcastss  0x808(%rip),%ymm8        # 76a4 <_sk_callback_avx+0x56a>
+  .byte  196,98,125,24,5,24,8,0,0            // vbroadcastss  0x818(%rip),%ymm8        # 7a8c <_sk_callback_avx+0x57a>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,249,7,0,0          // vbroadcastss  0x7f9(%rip),%ymm10        # 76a8 <_sk_callback_avx+0x56e>
+  .byte  196,98,125,24,21,9,8,0,0            // vbroadcastss  0x809(%rip),%ymm10        # 7a90 <_sk_callback_avx+0x57e>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,239,7,0,0          // vbroadcastss  0x7ef(%rip),%ymm10        # 76ac <_sk_callback_avx+0x572>
+  .byte  196,98,125,24,21,255,7,0,0          // vbroadcastss  0x7ff(%rip),%ymm10        # 7a94 <_sk_callback_avx+0x582>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -23198,19 +24024,19 @@
 FUNCTION(_sk_bicubic_n1x_avx)
 _sk_bicubic_n1x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,210,7,0,0          // vbroadcastss  0x7d2(%rip),%ymm0        # 76b0 <_sk_callback_avx+0x576>
+  .byte  196,226,125,24,5,226,7,0,0          // vbroadcastss  0x7e2(%rip),%ymm0        # 7a98 <_sk_callback_avx+0x586>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,201,7,0,0           // vbroadcastss  0x7c9(%rip),%ymm8        # 76b4 <_sk_callback_avx+0x57a>
+  .byte  196,98,125,24,5,217,7,0,0           // vbroadcastss  0x7d9(%rip),%ymm8        # 7a9c <_sk_callback_avx+0x58a>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,191,7,0,0          // vbroadcastss  0x7bf(%rip),%ymm9        # 76b8 <_sk_callback_avx+0x57e>
+  .byte  196,98,125,24,13,207,7,0,0          // vbroadcastss  0x7cf(%rip),%ymm9        # 7aa0 <_sk_callback_avx+0x58e>
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,181,7,0,0          // vbroadcastss  0x7b5(%rip),%ymm10        # 76bc <_sk_callback_avx+0x582>
+  .byte  196,98,125,24,21,197,7,0,0          // vbroadcastss  0x7c5(%rip),%ymm10        # 7aa4 <_sk_callback_avx+0x592>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,166,7,0,0          // vbroadcastss  0x7a6(%rip),%ymm10        # 76c0 <_sk_callback_avx+0x586>
+  .byte  196,98,125,24,21,182,7,0,0          // vbroadcastss  0x7b6(%rip),%ymm10        # 7aa8 <_sk_callback_avx+0x596>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,151,7,0,0          // vbroadcastss  0x797(%rip),%ymm9        # 76c4 <_sk_callback_avx+0x58a>
+  .byte  196,98,125,24,13,167,7,0,0          // vbroadcastss  0x7a7(%rip),%ymm9        # 7aac <_sk_callback_avx+0x59a>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -23221,17 +24047,17 @@
 FUNCTION(_sk_bicubic_p1x_avx)
 _sk_bicubic_p1x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,127,7,0,0           // vbroadcastss  0x77f(%rip),%ymm8        # 76c8 <_sk_callback_avx+0x58e>
+  .byte  196,98,125,24,5,143,7,0,0           // vbroadcastss  0x78f(%rip),%ymm8        # 7ab0 <_sk_callback_avx+0x59e>
   .byte  197,188,88,0                        // vaddps        (%rax),%ymm8,%ymm0
   .byte  197,124,16,72,64                    // vmovups       0x40(%rax),%ymm9
-  .byte  196,98,125,24,21,113,7,0,0          // vbroadcastss  0x771(%rip),%ymm10        # 76cc <_sk_callback_avx+0x592>
+  .byte  196,98,125,24,21,129,7,0,0          // vbroadcastss  0x781(%rip),%ymm10        # 7ab4 <_sk_callback_avx+0x5a2>
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
-  .byte  196,98,125,24,29,103,7,0,0          // vbroadcastss  0x767(%rip),%ymm11        # 76d0 <_sk_callback_avx+0x596>
+  .byte  196,98,125,24,29,119,7,0,0          // vbroadcastss  0x777(%rip),%ymm11        # 7ab8 <_sk_callback_avx+0x5a6>
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
   .byte  196,65,44,88,192                    // vaddps        %ymm8,%ymm10,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
-  .byte  196,98,125,24,13,78,7,0,0           // vbroadcastss  0x74e(%rip),%ymm9        # 76d4 <_sk_callback_avx+0x59a>
+  .byte  196,98,125,24,13,94,7,0,0           // vbroadcastss  0x75e(%rip),%ymm9        # 7abc <_sk_callback_avx+0x5aa>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -23242,13 +24068,13 @@
 FUNCTION(_sk_bicubic_p3x_avx)
 _sk_bicubic_p3x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,54,7,0,0           // vbroadcastss  0x736(%rip),%ymm0        # 76d8 <_sk_callback_avx+0x59e>
+  .byte  196,226,125,24,5,70,7,0,0           // vbroadcastss  0x746(%rip),%ymm0        # 7ac0 <_sk_callback_avx+0x5ae>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,35,7,0,0           // vbroadcastss  0x723(%rip),%ymm10        # 76dc <_sk_callback_avx+0x5a2>
+  .byte  196,98,125,24,21,51,7,0,0           // vbroadcastss  0x733(%rip),%ymm10        # 7ac4 <_sk_callback_avx+0x5b2>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,25,7,0,0           // vbroadcastss  0x719(%rip),%ymm10        # 76e0 <_sk_callback_avx+0x5a6>
+  .byte  196,98,125,24,21,41,7,0,0           // vbroadcastss  0x729(%rip),%ymm10        # 7ac8 <_sk_callback_avx+0x5b6>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -23260,14 +24086,14 @@
 FUNCTION(_sk_bicubic_n3y_avx)
 _sk_bicubic_n3y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,252,6,0,0         // vbroadcastss  0x6fc(%rip),%ymm1        # 76e4 <_sk_callback_avx+0x5aa>
+  .byte  196,226,125,24,13,12,7,0,0          // vbroadcastss  0x70c(%rip),%ymm1        # 7acc <_sk_callback_avx+0x5ba>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,242,6,0,0           // vbroadcastss  0x6f2(%rip),%ymm8        # 76e8 <_sk_callback_avx+0x5ae>
+  .byte  196,98,125,24,5,2,7,0,0             // vbroadcastss  0x702(%rip),%ymm8        # 7ad0 <_sk_callback_avx+0x5be>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,227,6,0,0          // vbroadcastss  0x6e3(%rip),%ymm10        # 76ec <_sk_callback_avx+0x5b2>
+  .byte  196,98,125,24,21,243,6,0,0          // vbroadcastss  0x6f3(%rip),%ymm10        # 7ad4 <_sk_callback_avx+0x5c2>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,217,6,0,0          // vbroadcastss  0x6d9(%rip),%ymm10        # 76f0 <_sk_callback_avx+0x5b6>
+  .byte  196,98,125,24,21,233,6,0,0          // vbroadcastss  0x6e9(%rip),%ymm10        # 7ad8 <_sk_callback_avx+0x5c6>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -23279,19 +24105,19 @@
 FUNCTION(_sk_bicubic_n1y_avx)
 _sk_bicubic_n1y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,188,6,0,0         // vbroadcastss  0x6bc(%rip),%ymm1        # 76f4 <_sk_callback_avx+0x5ba>
+  .byte  196,226,125,24,13,204,6,0,0         // vbroadcastss  0x6cc(%rip),%ymm1        # 7adc <_sk_callback_avx+0x5ca>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,178,6,0,0           // vbroadcastss  0x6b2(%rip),%ymm8        # 76f8 <_sk_callback_avx+0x5be>
+  .byte  196,98,125,24,5,194,6,0,0           // vbroadcastss  0x6c2(%rip),%ymm8        # 7ae0 <_sk_callback_avx+0x5ce>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,168,6,0,0          // vbroadcastss  0x6a8(%rip),%ymm9        # 76fc <_sk_callback_avx+0x5c2>
+  .byte  196,98,125,24,13,184,6,0,0          // vbroadcastss  0x6b8(%rip),%ymm9        # 7ae4 <_sk_callback_avx+0x5d2>
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,158,6,0,0          // vbroadcastss  0x69e(%rip),%ymm10        # 7700 <_sk_callback_avx+0x5c6>
+  .byte  196,98,125,24,21,174,6,0,0          // vbroadcastss  0x6ae(%rip),%ymm10        # 7ae8 <_sk_callback_avx+0x5d6>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,143,6,0,0          // vbroadcastss  0x68f(%rip),%ymm10        # 7704 <_sk_callback_avx+0x5ca>
+  .byte  196,98,125,24,21,159,6,0,0          // vbroadcastss  0x69f(%rip),%ymm10        # 7aec <_sk_callback_avx+0x5da>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,128,6,0,0          // vbroadcastss  0x680(%rip),%ymm9        # 7708 <_sk_callback_avx+0x5ce>
+  .byte  196,98,125,24,13,144,6,0,0          // vbroadcastss  0x690(%rip),%ymm9        # 7af0 <_sk_callback_avx+0x5de>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -23302,17 +24128,17 @@
 FUNCTION(_sk_bicubic_p1y_avx)
 _sk_bicubic_p1y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,104,6,0,0           // vbroadcastss  0x668(%rip),%ymm8        # 770c <_sk_callback_avx+0x5d2>
+  .byte  196,98,125,24,5,120,6,0,0           // vbroadcastss  0x678(%rip),%ymm8        # 7af4 <_sk_callback_avx+0x5e2>
   .byte  197,188,88,72,32                    // vaddps        0x20(%rax),%ymm8,%ymm1
   .byte  197,124,16,72,96                    // vmovups       0x60(%rax),%ymm9
-  .byte  196,98,125,24,21,89,6,0,0           // vbroadcastss  0x659(%rip),%ymm10        # 7710 <_sk_callback_avx+0x5d6>
+  .byte  196,98,125,24,21,105,6,0,0          // vbroadcastss  0x669(%rip),%ymm10        # 7af8 <_sk_callback_avx+0x5e6>
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
-  .byte  196,98,125,24,29,79,6,0,0           // vbroadcastss  0x64f(%rip),%ymm11        # 7714 <_sk_callback_avx+0x5da>
+  .byte  196,98,125,24,29,95,6,0,0           // vbroadcastss  0x65f(%rip),%ymm11        # 7afc <_sk_callback_avx+0x5ea>
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
   .byte  196,65,44,88,192                    // vaddps        %ymm8,%ymm10,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
-  .byte  196,98,125,24,13,54,6,0,0           // vbroadcastss  0x636(%rip),%ymm9        # 7718 <_sk_callback_avx+0x5de>
+  .byte  196,98,125,24,13,70,6,0,0           // vbroadcastss  0x646(%rip),%ymm9        # 7b00 <_sk_callback_avx+0x5ee>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -23323,13 +24149,13 @@
 FUNCTION(_sk_bicubic_p3y_avx)
 _sk_bicubic_p3y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,30,6,0,0          // vbroadcastss  0x61e(%rip),%ymm1        # 771c <_sk_callback_avx+0x5e2>
+  .byte  196,226,125,24,13,46,6,0,0          // vbroadcastss  0x62e(%rip),%ymm1        # 7b04 <_sk_callback_avx+0x5f2>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,10,6,0,0           // vbroadcastss  0x60a(%rip),%ymm10        # 7720 <_sk_callback_avx+0x5e6>
+  .byte  196,98,125,24,21,26,6,0,0           // vbroadcastss  0x61a(%rip),%ymm10        # 7b08 <_sk_callback_avx+0x5f6>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,0,6,0,0            // vbroadcastss  0x600(%rip),%ymm10        # 7724 <_sk_callback_avx+0x5ea>
+  .byte  196,98,125,24,21,16,6,0,0           // vbroadcastss  0x610(%rip),%ymm10        # 7b0c <_sk_callback_avx+0x5fa>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -23459,25 +24285,25 @@
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 732d <.literal4+0xb1>
+  .byte  71,225,61                           // rex.RXB       loope 7705 <.literal4+0xb1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 733d <.literal4+0xc1>
+  .byte  71,225,61                           // rex.RXB       loope 7715 <.literal4+0xc1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 734d <.literal4+0xd1>
+  .byte  71,225,61                           // rex.RXB       loope 7725 <.literal4+0xd1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 735d <.literal4+0xe1>
+  .byte  71,225,61                           // rex.RXB       loope 7735 <.literal4+0xe1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,127                    // add           %al,0x7f00003f(%rax)
@@ -23541,7 +24367,7 @@
   .byte  190,129,128,128,59                  // mov           $0x3b808081,%esi
   .byte  129,128,128,59,0,248,0,0,8,33       // addl          $0x21080000,-0x7ffc480(%rax)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        73c9 <.literal4+0x14d>
+  .byte  224,7                               // loopne        77a1 <.literal4+0x14d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -23557,10 +24383,10 @@
   .byte  129,128,128,59,129,128,128,59,0,0   // addl          $0x3b80,-0x7f7ec480(%rax)
   .byte  0,52,255                            // add           %dh,(%rdi,%rdi,8)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            73f0 <.literal4+0x174>
+  .byte  127,0                               // jg            77c8 <.literal4+0x174>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            7469 <.literal4+0x1ed>
+  .byte  119,115                             // ja            7841 <.literal4+0x1ed>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -23574,10 +24400,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            7424 <.literal4+0x1a8>
+  .byte  127,0                               // jg            77fc <.literal4+0x1a8>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            749d <.literal4+0x221>
+  .byte  119,115                             // ja            7875 <.literal4+0x221>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -23591,10 +24417,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            7458 <.literal4+0x1dc>
+  .byte  127,0                               // jg            7830 <.literal4+0x1dc>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            74d1 <.literal4+0x255>
+  .byte  119,115                             // ja            78a9 <.literal4+0x255>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -23608,10 +24434,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            748c <.literal4+0x210>
+  .byte  127,0                               // jg            7864 <.literal4+0x210>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            7505 <.literal4+0x289>
+  .byte  119,115                             // ja            78dd <.literal4+0x289>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -23624,7 +24450,7 @@
   .byte  0,75,0                              // add           %cl,0x0(%rbx)
   .byte  0,128,63,0,0,200                    // add           %al,-0x37ffffc1(%rax)
   .byte  66,0,0                              // rex.X         add %al,(%rax)
-  .byte  127,67                              // jg            7503 <.literal4+0x287>
+  .byte  127,67                              // jg            78db <.literal4+0x287>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%rax)
@@ -23636,7 +24462,7 @@
   .byte  190,80,128,3,62                     // mov           $0x3e038050,%esi
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           7523 <.literal4+0x2a7>
+  .byte  118,63                              // jbe           78fb <.literal4+0x2a7>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
@@ -23651,7 +24477,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        7525 <.literal4+0x2a9>
+  .byte  224,7                               // loopne        78fd <.literal4+0x2a9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -23663,7 +24489,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        7541 <.literal4+0x2c5>
+  .byte  224,7                               // loopne        7919 <.literal4+0x2c5>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -23675,7 +24501,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        755d <.literal4+0x2e1>
+  .byte  224,7                               // loopne        7935 <.literal4+0x2e1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -23686,7 +24512,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  248                                 // clc
   .byte  65,0,0                              // add           %al,(%r8)
-  .byte  124,66                              // jl            75b2 <.literal4+0x336>
+  .byte  124,66                              // jl            798a <.literal4+0x336>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,55,0,15                 // mov           %ecx,0xf003788(%rax)
@@ -23712,7 +24538,10 @@
   .byte  137,136,136,59,15,0                 // mov           %ecx,0xf3b88(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,61,0,0                  // mov           %ecx,0x3d88(%rax)
-  .byte  112,65                              // jo            7615 <.literal4+0x399>
+  .byte  112,65                              // jo            79ed <.literal4+0x399>
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
+  .byte  128,59,0                            // cmpb          $0x0,(%rbx)
+  .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
@@ -23735,7 +24564,7 @@
   .byte  0,128,55,0,0,128                    // add           %al,-0x7fffffc9(%rax)
   .byte  63                                  // (bad)
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            7677 <.literal4+0x3fb>
+  .byte  127,71                              // jg            7a5f <.literal4+0x40b>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -23996,6 +24825,54 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,2                                 // add           %al,(%rdx)
+  .byte  4,6                                 // add           $0x6,%al
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  8,10                                // or            %cl,(%rdx)
+  .byte  12,14                               // or            $0xe,%al
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,2                                 // add           %al,(%rdx)
+  .byte  4,6                                 // add           $0x6,%al
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  8,10                                // or            %cl,(%rdx)
+  .byte  12,14                               // or            $0xe,%al
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,2                                 // add           %al,(%rdx)
+  .byte  4,6                                 // add           $0x6,%al
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  8,10                                // or            %cl,(%rdx)
+  .byte  12,14                               // or            $0xe,%al
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
 
 BALIGN32
   .byte  255,0                               // incl          (%rax)
@@ -24094,6 +24971,54 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  255,0                               // incl          (%rax)
   .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
 BALIGN32
 
 HIDDEN _sk_start_pipeline_sse41
@@ -24170,7 +25095,7 @@
   .byte  102,15,110,194                      // movd          %edx,%xmm0
   .byte  102,15,112,192,0                    // pshufd        $0x0,%xmm0,%xmm0
   .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
-  .byte  15,40,21,175,86,0,0                 // movaps        0x56af(%rip),%xmm2        # 5750 <_sk_callback_sse41+0xf4>
+  .byte  15,40,21,63,89,0,0                  // movaps        0x593f(%rip),%xmm2        # 59e0 <_sk_callback_sse41+0xff>
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,16,7                             // movups        (%rdi),%xmm0
   .byte  15,88,193                           // addps         %xmm1,%xmm0
@@ -24179,7 +25104,7 @@
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,21,158,86,0,0                 // movaps        0x569e(%rip),%xmm2        # 5760 <_sk_callback_sse41+0x104>
+  .byte  15,40,21,46,89,0,0                  // movaps        0x592e(%rip),%xmm2        # 59f0 <_sk_callback_sse41+0x10f>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  15,87,237                           // xorps         %xmm5,%xmm5
@@ -24199,14 +25124,14 @@
   .byte  102,68,15,110,193                   // movd          %ecx,%xmm8
   .byte  102,69,15,112,192,0                 // pshufd        $0x0,%xmm8,%xmm8
   .byte  102,69,15,239,193                   // pxor          %xmm9,%xmm8
-  .byte  102,68,15,111,21,108,86,0,0         // movdqa        0x566c(%rip),%xmm10        # 5770 <_sk_callback_sse41+0x114>
+  .byte  102,68,15,111,21,252,88,0,0         // movdqa        0x58fc(%rip),%xmm10        # 5a00 <_sk_callback_sse41+0x11f>
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
   .byte  102,69,15,219,218                   // pand          %xmm10,%xmm11
   .byte  102,65,15,114,243,5                 // pslld         $0x5,%xmm11
   .byte  102,69,15,219,209                   // pand          %xmm9,%xmm10
   .byte  102,65,15,114,242,4                 // pslld         $0x4,%xmm10
-  .byte  102,68,15,111,37,88,86,0,0          // movdqa        0x5658(%rip),%xmm12        # 5780 <_sk_callback_sse41+0x124>
-  .byte  102,68,15,111,45,95,86,0,0          // movdqa        0x565f(%rip),%xmm13        # 5790 <_sk_callback_sse41+0x134>
+  .byte  102,68,15,111,37,232,88,0,0         // movdqa        0x58e8(%rip),%xmm12        # 5a10 <_sk_callback_sse41+0x12f>
+  .byte  102,68,15,111,45,239,88,0,0         // movdqa        0x58ef(%rip),%xmm13        # 5a20 <_sk_callback_sse41+0x13f>
   .byte  102,69,15,111,240                   // movdqa        %xmm8,%xmm14
   .byte  102,69,15,219,245                   // pand          %xmm13,%xmm14
   .byte  102,65,15,114,246,2                 // pslld         $0x2,%xmm14
@@ -24222,8 +25147,8 @@
   .byte  102,69,15,235,245                   // por           %xmm13,%xmm14
   .byte  102,69,15,235,240                   // por           %xmm8,%xmm14
   .byte  69,15,91,198                        // cvtdq2ps      %xmm14,%xmm8
-  .byte  68,15,89,5,26,86,0,0                // mulps         0x561a(%rip),%xmm8        # 57a0 <_sk_callback_sse41+0x144>
-  .byte  68,15,88,5,34,86,0,0                // addps         0x5622(%rip),%xmm8        # 57b0 <_sk_callback_sse41+0x154>
+  .byte  68,15,89,5,170,88,0,0               // mulps         0x58aa(%rip),%xmm8        # 5a30 <_sk_callback_sse41+0x14f>
+  .byte  68,15,88,5,178,88,0,0               // addps         0x58b2(%rip),%xmm8        # 5a40 <_sk_callback_sse41+0x15f>
   .byte  243,68,15,16,16                     // movss         (%rax),%xmm10
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
@@ -24300,7 +25225,7 @@
 FUNCTION(_sk_srcatop_sse41)
 _sk_srcatop_sse41:
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
-  .byte  68,15,40,5,124,85,0,0               // movaps        0x557c(%rip),%xmm8        # 57c0 <_sk_callback_sse41+0x164>
+  .byte  68,15,40,5,12,88,0,0                // movaps        0x580c(%rip),%xmm8        # 5a50 <_sk_callback_sse41+0x16f>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -24325,7 +25250,7 @@
 _sk_dstatop_sse41:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
   .byte  68,15,89,196                        // mulps         %xmm4,%xmm8
-  .byte  68,15,40,13,63,85,0,0               // movaps        0x553f(%rip),%xmm9        # 57d0 <_sk_callback_sse41+0x174>
+  .byte  68,15,40,13,207,87,0,0              // movaps        0x57cf(%rip),%xmm9        # 5a60 <_sk_callback_sse41+0x17f>
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
@@ -24372,7 +25297,7 @@
 .globl _sk_srcout_sse41
 FUNCTION(_sk_srcout_sse41)
 _sk_srcout_sse41:
-  .byte  68,15,40,5,227,84,0,0               // movaps        0x54e3(%rip),%xmm8        # 57e0 <_sk_callback_sse41+0x184>
+  .byte  68,15,40,5,115,87,0,0               // movaps        0x5773(%rip),%xmm8        # 5a70 <_sk_callback_sse41+0x18f>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
@@ -24385,7 +25310,7 @@
 .globl _sk_dstout_sse41
 FUNCTION(_sk_dstout_sse41)
 _sk_dstout_sse41:
-  .byte  68,15,40,5,211,84,0,0               // movaps        0x54d3(%rip),%xmm8        # 57f0 <_sk_callback_sse41+0x194>
+  .byte  68,15,40,5,99,87,0,0                // movaps        0x5763(%rip),%xmm8        # 5a80 <_sk_callback_sse41+0x19f>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
@@ -24402,7 +25327,7 @@
 .globl _sk_srcover_sse41
 FUNCTION(_sk_srcover_sse41)
 _sk_srcover_sse41:
-  .byte  68,15,40,5,182,84,0,0               // movaps        0x54b6(%rip),%xmm8        # 5800 <_sk_callback_sse41+0x1a4>
+  .byte  68,15,40,5,70,87,0,0                // movaps        0x5746(%rip),%xmm8        # 5a90 <_sk_callback_sse41+0x1af>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -24422,7 +25347,7 @@
 .globl _sk_dstover_sse41
 FUNCTION(_sk_dstover_sse41)
 _sk_dstover_sse41:
-  .byte  68,15,40,5,138,84,0,0               // movaps        0x548a(%rip),%xmm8        # 5810 <_sk_callback_sse41+0x1b4>
+  .byte  68,15,40,5,26,87,0,0                // movaps        0x571a(%rip),%xmm8        # 5aa0 <_sk_callback_sse41+0x1bf>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -24450,7 +25375,7 @@
 .globl _sk_multiply_sse41
 FUNCTION(_sk_multiply_sse41)
 _sk_multiply_sse41:
-  .byte  68,15,40,5,94,84,0,0                // movaps        0x545e(%rip),%xmm8        # 5820 <_sk_callback_sse41+0x1c4>
+  .byte  68,15,40,5,238,86,0,0               // movaps        0x56ee(%rip),%xmm8        # 5ab0 <_sk_callback_sse41+0x1cf>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
@@ -24525,7 +25450,7 @@
 FUNCTION(_sk_xor__sse41)
 _sk_xor__sse41:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
-  .byte  15,40,29,147,83,0,0                 // movaps        0x5393(%rip),%xmm3        # 5830 <_sk_callback_sse41+0x1d4>
+  .byte  15,40,29,35,86,0,0                  // movaps        0x5623(%rip),%xmm3        # 5ac0 <_sk_callback_sse41+0x1df>
   .byte  68,15,40,203                        // movaps        %xmm3,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
@@ -24573,7 +25498,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,95,209                        // maxps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,254,82,0,0                 // movaps        0x52fe(%rip),%xmm2        # 5840 <_sk_callback_sse41+0x1e4>
+  .byte  15,40,21,142,85,0,0                 // movaps        0x558e(%rip),%xmm2        # 5ad0 <_sk_callback_sse41+0x1ef>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -24607,7 +25532,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,163,82,0,0                 // movaps        0x52a3(%rip),%xmm2        # 5850 <_sk_callback_sse41+0x1f4>
+  .byte  15,40,21,51,85,0,0                  // movaps        0x5533(%rip),%xmm2        # 5ae0 <_sk_callback_sse41+0x1ff>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -24644,7 +25569,7 @@
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,61,82,0,0                  // movaps        0x523d(%rip),%xmm2        # 5860 <_sk_callback_sse41+0x204>
+  .byte  15,40,21,205,84,0,0                 // movaps        0x54cd(%rip),%xmm2        # 5af0 <_sk_callback_sse41+0x20f>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -24672,7 +25597,7 @@
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,253,81,0,0                 // movaps        0x51fd(%rip),%xmm2        # 5870 <_sk_callback_sse41+0x214>
+  .byte  15,40,21,141,84,0,0                 // movaps        0x548d(%rip),%xmm2        # 5b00 <_sk_callback_sse41+0x21f>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -24685,7 +25610,7 @@
 FUNCTION(_sk_colorburn_sse41)
 _sk_colorburn_sse41:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,21,240,81,0,0              // movaps        0x51f0(%rip),%xmm10        # 5880 <_sk_callback_sse41+0x224>
+  .byte  68,15,40,21,128,84,0,0              // movaps        0x5480(%rip),%xmm10        # 5b10 <_sk_callback_sse41+0x22f>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  69,15,40,203                        // movaps        %xmm11,%xmm9
@@ -24767,7 +25692,7 @@
 FUNCTION(_sk_colordodge_sse41)
 _sk_colordodge_sse41:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,21,206,80,0,0              // movaps        0x50ce(%rip),%xmm10        # 5890 <_sk_callback_sse41+0x234>
+  .byte  68,15,40,21,94,83,0,0               // movaps        0x535e(%rip),%xmm10        # 5b20 <_sk_callback_sse41+0x23f>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  69,15,40,227                        // movaps        %xmm11,%xmm12
@@ -24849,7 +25774,7 @@
   .byte  15,40,244                           // movaps        %xmm4,%xmm6
   .byte  15,40,227                           // movaps        %xmm3,%xmm4
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
-  .byte  68,15,40,21,167,79,0,0              // movaps        0x4fa7(%rip),%xmm10        # 58a0 <_sk_callback_sse41+0x244>
+  .byte  68,15,40,21,55,82,0,0               // movaps        0x5237(%rip),%xmm10        # 5b30 <_sk_callback_sse41+0x24f>
   .byte  65,15,40,234                        // movaps        %xmm10,%xmm5
   .byte  15,92,239                           // subps         %xmm7,%xmm5
   .byte  15,40,197                           // movaps        %xmm5,%xmm0
@@ -24932,7 +25857,7 @@
 _sk_overlay_sse41:
   .byte  68,15,40,201                        // movaps        %xmm1,%xmm9
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
-  .byte  68,15,40,21,140,78,0,0              // movaps        0x4e8c(%rip),%xmm10        # 58b0 <_sk_callback_sse41+0x254>
+  .byte  68,15,40,21,28,81,0,0               // movaps        0x511c(%rip),%xmm10        # 5b40 <_sk_callback_sse41+0x25f>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
@@ -25017,7 +25942,7 @@
   .byte  15,40,198                           // movaps        %xmm6,%xmm0
   .byte  15,94,199                           // divps         %xmm7,%xmm0
   .byte  65,15,84,193                        // andps         %xmm9,%xmm0
-  .byte  15,40,13,99,77,0,0                  // movaps        0x4d63(%rip),%xmm1        # 58c0 <_sk_callback_sse41+0x264>
+  .byte  15,40,13,243,79,0,0                 // movaps        0x4ff3(%rip),%xmm1        # 5b50 <_sk_callback_sse41+0x26f>
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
   .byte  68,15,92,208                        // subps         %xmm0,%xmm10
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
@@ -25030,10 +25955,10 @@
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  15,89,210                           // mulps         %xmm2,%xmm2
   .byte  15,88,208                           // addps         %xmm0,%xmm2
-  .byte  68,15,40,45,65,77,0,0               // movaps        0x4d41(%rip),%xmm13        # 58d0 <_sk_callback_sse41+0x274>
+  .byte  68,15,40,45,209,79,0,0              // movaps        0x4fd1(%rip),%xmm13        # 5b60 <_sk_callback_sse41+0x27f>
   .byte  69,15,88,245                        // addps         %xmm13,%xmm14
   .byte  68,15,89,242                        // mulps         %xmm2,%xmm14
-  .byte  68,15,40,37,65,77,0,0               // movaps        0x4d41(%rip),%xmm12        # 58e0 <_sk_callback_sse41+0x284>
+  .byte  68,15,40,37,209,79,0,0              // movaps        0x4fd1(%rip),%xmm12        # 5b70 <_sk_callback_sse41+0x28f>
   .byte  69,15,89,252                        // mulps         %xmm12,%xmm15
   .byte  69,15,88,254                        // addps         %xmm14,%xmm15
   .byte  15,40,198                           // movaps        %xmm6,%xmm0
@@ -25219,12 +26144,12 @@
   .byte  68,15,84,208                        // andps         %xmm0,%xmm10
   .byte  15,84,200                           // andps         %xmm0,%xmm1
   .byte  68,15,84,232                        // andps         %xmm0,%xmm13
-  .byte  15,40,5,172,74,0,0                  // movaps        0x4aac(%rip),%xmm0        # 58f0 <_sk_callback_sse41+0x294>
+  .byte  15,40,5,60,77,0,0                   // movaps        0x4d3c(%rip),%xmm0        # 5b80 <_sk_callback_sse41+0x29f>
   .byte  68,15,89,224                        // mulps         %xmm0,%xmm12
-  .byte  15,40,21,177,74,0,0                 // movaps        0x4ab1(%rip),%xmm2        # 5900 <_sk_callback_sse41+0x2a4>
+  .byte  15,40,21,65,77,0,0                  // movaps        0x4d41(%rip),%xmm2        # 5b90 <_sk_callback_sse41+0x2af>
   .byte  15,89,250                           // mulps         %xmm2,%xmm7
   .byte  65,15,88,252                        // addps         %xmm12,%xmm7
-  .byte  68,15,40,53,178,74,0,0              // movaps        0x4ab2(%rip),%xmm14        # 5910 <_sk_callback_sse41+0x2b4>
+  .byte  68,15,40,53,66,77,0,0               // movaps        0x4d42(%rip),%xmm14        # 5ba0 <_sk_callback_sse41+0x2bf>
   .byte  68,15,40,252                        // movaps        %xmm4,%xmm15
   .byte  69,15,89,254                        // mulps         %xmm14,%xmm15
   .byte  68,15,88,255                        // addps         %xmm7,%xmm15
@@ -25307,7 +26232,7 @@
   .byte  65,15,88,214                        // addps         %xmm14,%xmm2
   .byte  15,40,196                           // movaps        %xmm4,%xmm0
   .byte  102,15,56,20,202                    // blendvps      %xmm0,%xmm2,%xmm1
-  .byte  68,15,40,13,118,73,0,0              // movaps        0x4976(%rip),%xmm9        # 5920 <_sk_callback_sse41+0x2c4>
+  .byte  68,15,40,13,6,76,0,0                // movaps        0x4c06(%rip),%xmm9        # 5bb0 <_sk_callback_sse41+0x2cf>
   .byte  65,15,40,225                        // movaps        %xmm9,%xmm4
   .byte  15,92,229                           // subps         %xmm5,%xmm4
   .byte  15,40,68,36,200                     // movaps        -0x38(%rsp),%xmm0
@@ -25401,14 +26326,14 @@
   .byte  68,15,84,215                        // andps         %xmm7,%xmm10
   .byte  68,15,84,223                        // andps         %xmm7,%xmm11
   .byte  68,15,84,199                        // andps         %xmm7,%xmm8
-  .byte  15,40,21,48,72,0,0                  // movaps        0x4830(%rip),%xmm2        # 5930 <_sk_callback_sse41+0x2d4>
+  .byte  15,40,21,192,74,0,0                 // movaps        0x4ac0(%rip),%xmm2        # 5bc0 <_sk_callback_sse41+0x2df>
   .byte  15,40,221                           // movaps        %xmm5,%xmm3
   .byte  15,89,218                           // mulps         %xmm2,%xmm3
-  .byte  15,40,13,51,72,0,0                  // movaps        0x4833(%rip),%xmm1        # 5940 <_sk_callback_sse41+0x2e4>
+  .byte  15,40,13,195,74,0,0                 // movaps        0x4ac3(%rip),%xmm1        # 5bd0 <_sk_callback_sse41+0x2ef>
   .byte  15,40,254                           // movaps        %xmm6,%xmm7
   .byte  15,89,249                           // mulps         %xmm1,%xmm7
   .byte  15,88,251                           // addps         %xmm3,%xmm7
-  .byte  68,15,40,45,50,72,0,0               // movaps        0x4832(%rip),%xmm13        # 5950 <_sk_callback_sse41+0x2f4>
+  .byte  68,15,40,45,194,74,0,0              // movaps        0x4ac2(%rip),%xmm13        # 5be0 <_sk_callback_sse41+0x2ff>
   .byte  69,15,89,245                        // mulps         %xmm13,%xmm14
   .byte  68,15,88,247                        // addps         %xmm7,%xmm14
   .byte  65,15,40,218                        // movaps        %xmm10,%xmm3
@@ -25489,7 +26414,7 @@
   .byte  65,15,88,253                        // addps         %xmm13,%xmm7
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  102,68,15,56,20,223                 // blendvps      %xmm0,%xmm7,%xmm11
-  .byte  68,15,40,13,248,70,0,0              // movaps        0x46f8(%rip),%xmm9        # 5960 <_sk_callback_sse41+0x304>
+  .byte  68,15,40,13,136,73,0,0              // movaps        0x4988(%rip),%xmm9        # 5bf0 <_sk_callback_sse41+0x30f>
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  68,15,92,204                        // subps         %xmm4,%xmm9
   .byte  15,40,124,36,168                    // movaps        -0x58(%rsp),%xmm7
@@ -25544,14 +26469,14 @@
   .byte  15,40,231                           // movaps        %xmm7,%xmm4
   .byte  68,15,89,244                        // mulps         %xmm4,%xmm14
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
-  .byte  68,15,40,13,67,70,0,0               // movaps        0x4643(%rip),%xmm9        # 5970 <_sk_callback_sse41+0x314>
+  .byte  68,15,40,13,211,72,0,0              // movaps        0x48d3(%rip),%xmm9        # 5c00 <_sk_callback_sse41+0x31f>
   .byte  65,15,40,250                        // movaps        %xmm10,%xmm7
   .byte  65,15,89,249                        // mulps         %xmm9,%xmm7
-  .byte  68,15,40,21,67,70,0,0               // movaps        0x4643(%rip),%xmm10        # 5980 <_sk_callback_sse41+0x324>
+  .byte  68,15,40,21,211,72,0,0              // movaps        0x48d3(%rip),%xmm10        # 5c10 <_sk_callback_sse41+0x32f>
   .byte  65,15,40,219                        // movaps        %xmm11,%xmm3
   .byte  65,15,89,218                        // mulps         %xmm10,%xmm3
   .byte  15,88,223                           // addps         %xmm7,%xmm3
-  .byte  68,15,40,29,64,70,0,0               // movaps        0x4640(%rip),%xmm11        # 5990 <_sk_callback_sse41+0x334>
+  .byte  68,15,40,29,208,72,0,0              // movaps        0x48d0(%rip),%xmm11        # 5c20 <_sk_callback_sse41+0x33f>
   .byte  69,15,40,236                        // movaps        %xmm12,%xmm13
   .byte  69,15,89,235                        // mulps         %xmm11,%xmm13
   .byte  68,15,88,235                        // addps         %xmm3,%xmm13
@@ -25636,7 +26561,7 @@
   .byte  65,15,88,251                        // addps         %xmm11,%xmm7
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  102,15,56,20,207                    // blendvps      %xmm0,%xmm7,%xmm1
-  .byte  68,15,40,13,252,68,0,0              // movaps        0x44fc(%rip),%xmm9        # 59a0 <_sk_callback_sse41+0x344>
+  .byte  68,15,40,13,140,71,0,0              // movaps        0x478c(%rip),%xmm9        # 5c30 <_sk_callback_sse41+0x34f>
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  68,15,89,192                        // mulps         %xmm0,%xmm8
@@ -25688,13 +26613,13 @@
   .byte  69,15,89,216                        // mulps         %xmm8,%xmm11
   .byte  68,15,40,203                        // movaps        %xmm3,%xmm9
   .byte  68,15,89,205                        // mulps         %xmm5,%xmm9
-  .byte  68,15,40,5,84,68,0,0                // movaps        0x4454(%rip),%xmm8        # 59b0 <_sk_callback_sse41+0x354>
+  .byte  68,15,40,5,228,70,0,0               // movaps        0x46e4(%rip),%xmm8        # 5c40 <_sk_callback_sse41+0x35f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
-  .byte  68,15,40,21,88,68,0,0               // movaps        0x4458(%rip),%xmm10        # 59c0 <_sk_callback_sse41+0x364>
+  .byte  68,15,40,21,232,70,0,0              // movaps        0x46e8(%rip),%xmm10        # 5c50 <_sk_callback_sse41+0x36f>
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
   .byte  65,15,89,234                        // mulps         %xmm10,%xmm5
   .byte  15,88,232                           // addps         %xmm0,%xmm5
-  .byte  68,15,40,37,86,68,0,0               // movaps        0x4456(%rip),%xmm12        # 59d0 <_sk_callback_sse41+0x374>
+  .byte  68,15,40,37,230,70,0,0              // movaps        0x46e6(%rip),%xmm12        # 5c60 <_sk_callback_sse41+0x37f>
   .byte  68,15,40,242                        // movaps        %xmm2,%xmm14
   .byte  69,15,89,244                        // mulps         %xmm12,%xmm14
   .byte  68,15,88,245                        // addps         %xmm5,%xmm14
@@ -25779,7 +26704,7 @@
   .byte  65,15,88,244                        // addps         %xmm12,%xmm6
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  102,68,15,56,20,206                 // blendvps      %xmm0,%xmm6,%xmm9
-  .byte  15,40,5,12,67,0,0                   // movaps        0x430c(%rip),%xmm0        # 59e0 <_sk_callback_sse41+0x384>
+  .byte  15,40,5,156,69,0,0                  // movaps        0x459c(%rip),%xmm0        # 5c70 <_sk_callback_sse41+0x38f>
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  15,92,215                           // subps         %xmm7,%xmm2
   .byte  15,89,226                           // mulps         %xmm2,%xmm4
@@ -25822,20 +26747,20 @@
   .byte  15,133,217,0,0,0                    // jne           1828 <_sk_srcover_rgba_8888_sse41+0xe7>
   .byte  243,15,111,60,144                   // movdqu        (%rax,%rdx,4),%xmm7
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  102,15,111,37,145,66,0,0            // movdqa        0x4291(%rip),%xmm4        # 59f0 <_sk_callback_sse41+0x394>
+  .byte  102,15,111,37,33,69,0,0             // movdqa        0x4521(%rip),%xmm4        # 5c80 <_sk_callback_sse41+0x39f>
   .byte  102,15,219,231                      // pand          %xmm7,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
   .byte  102,15,111,239                      // movdqa        %xmm7,%xmm5
-  .byte  102,15,56,0,45,141,66,0,0           // pshufb        0x428d(%rip),%xmm5        # 5a00 <_sk_callback_sse41+0x3a4>
+  .byte  102,15,56,0,45,29,69,0,0            // pshufb        0x451d(%rip),%xmm5        # 5c90 <_sk_callback_sse41+0x3af>
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
   .byte  102,15,111,247                      // movdqa        %xmm7,%xmm6
-  .byte  102,15,56,0,53,141,66,0,0           // pshufb        0x428d(%rip),%xmm6        # 5a10 <_sk_callback_sse41+0x3b4>
+  .byte  102,15,56,0,53,29,69,0,0            // pshufb        0x451d(%rip),%xmm6        # 5ca0 <_sk_callback_sse41+0x3bf>
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  102,15,114,215,24                   // psrld         $0x18,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
-  .byte  68,15,40,5,138,66,0,0               // movaps        0x428a(%rip),%xmm8        # 5a20 <_sk_callback_sse41+0x3c4>
+  .byte  68,15,40,5,26,69,0,0                // movaps        0x451a(%rip),%xmm8        # 5cb0 <_sk_callback_sse41+0x3cf>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
-  .byte  68,15,40,37,142,66,0,0              // movaps        0x428e(%rip),%xmm12        # 5a30 <_sk_callback_sse41+0x3d4>
+  .byte  68,15,40,37,30,69,0,0               // movaps        0x451e(%rip),%xmm12        # 5cc0 <_sk_callback_sse41+0x3df>
   .byte  65,15,89,196                        // mulps         %xmm12,%xmm0
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -25915,7 +26840,7 @@
 .globl _sk_clamp_1_sse41
 FUNCTION(_sk_clamp_1_sse41)
 _sk_clamp_1_sse41:
-  .byte  68,15,40,5,128,65,0,0               // movaps        0x4180(%rip),%xmm8        # 5a40 <_sk_callback_sse41+0x3e4>
+  .byte  68,15,40,5,16,68,0,0                // movaps        0x4410(%rip),%xmm8        # 5cd0 <_sk_callback_sse41+0x3ef>
   .byte  65,15,93,192                        // minps         %xmm8,%xmm0
   .byte  65,15,93,200                        // minps         %xmm8,%xmm1
   .byte  65,15,93,208                        // minps         %xmm8,%xmm2
@@ -25927,7 +26852,7 @@
 .globl _sk_clamp_a_sse41
 FUNCTION(_sk_clamp_a_sse41)
 _sk_clamp_a_sse41:
-  .byte  15,93,29,117,65,0,0                 // minps         0x4175(%rip),%xmm3        # 5a50 <_sk_callback_sse41+0x3f4>
+  .byte  15,93,29,5,68,0,0                   // minps         0x4405(%rip),%xmm3        # 5ce0 <_sk_callback_sse41+0x3ff>
   .byte  15,93,195                           // minps         %xmm3,%xmm0
   .byte  15,93,203                           // minps         %xmm3,%xmm1
   .byte  15,93,211                           // minps         %xmm3,%xmm2
@@ -25938,7 +26863,7 @@
 .globl _sk_clamp_a_dst_sse41
 FUNCTION(_sk_clamp_a_dst_sse41)
 _sk_clamp_a_dst_sse41:
-  .byte  15,93,61,113,65,0,0                 // minps         0x4171(%rip),%xmm7        # 5a60 <_sk_callback_sse41+0x404>
+  .byte  15,93,61,1,68,0,0                   // minps         0x4401(%rip),%xmm7        # 5cf0 <_sk_callback_sse41+0x40f>
   .byte  15,93,231                           // minps         %xmm7,%xmm4
   .byte  15,93,239                           // minps         %xmm7,%xmm5
   .byte  15,93,247                           // minps         %xmm7,%xmm6
@@ -25969,16 +26894,6 @@
   .byte  65,15,40,208                        // movaps        %xmm8,%xmm2
   .byte  255,224                             // jmpq          *%rax
 
-HIDDEN _sk_swap_rb_dst_sse41
-.globl _sk_swap_rb_dst_sse41
-FUNCTION(_sk_swap_rb_dst_sse41)
-_sk_swap_rb_dst_sse41:
-  .byte  68,15,40,196                        // movaps        %xmm4,%xmm8
-  .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,230                           // movaps        %xmm6,%xmm4
-  .byte  65,15,40,240                        // movaps        %xmm8,%xmm6
-  .byte  255,224                             // jmpq          *%rax
-
 HIDDEN _sk_move_src_dst_sse41
 .globl _sk_move_src_dst_sse41
 FUNCTION(_sk_move_src_dst_sse41)
@@ -26016,7 +26931,7 @@
 FUNCTION(_sk_unpremul_sse41)
 _sk_unpremul_sse41:
   .byte  69,15,87,192                        // xorps         %xmm8,%xmm8
-  .byte  68,15,40,13,253,64,0,0              // movaps        0x40fd(%rip),%xmm9        # 5a70 <_sk_callback_sse41+0x414>
+  .byte  68,15,40,13,156,67,0,0              // movaps        0x439c(%rip),%xmm9        # 5d00 <_sk_callback_sse41+0x41f>
   .byte  68,15,94,203                        // divps         %xmm3,%xmm9
   .byte  68,15,194,195,4                     // cmpneqps      %xmm3,%xmm8
   .byte  69,15,84,193                        // andps         %xmm9,%xmm8
@@ -26030,20 +26945,20 @@
 .globl _sk_from_srgb_sse41
 FUNCTION(_sk_from_srgb_sse41)
 _sk_from_srgb_sse41:
-  .byte  68,15,40,29,232,64,0,0              // movaps        0x40e8(%rip),%xmm11        # 5a80 <_sk_callback_sse41+0x424>
+  .byte  68,15,40,29,135,67,0,0              // movaps        0x4387(%rip),%xmm11        # 5d10 <_sk_callback_sse41+0x42f>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
   .byte  68,15,40,208                        // movaps        %xmm0,%xmm10
   .byte  69,15,89,210                        // mulps         %xmm10,%xmm10
-  .byte  68,15,40,37,224,64,0,0              // movaps        0x40e0(%rip),%xmm12        # 5a90 <_sk_callback_sse41+0x434>
+  .byte  68,15,40,37,127,67,0,0              // movaps        0x437f(%rip),%xmm12        # 5d20 <_sk_callback_sse41+0x43f>
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  69,15,89,196                        // mulps         %xmm12,%xmm8
-  .byte  68,15,40,45,224,64,0,0              // movaps        0x40e0(%rip),%xmm13        # 5aa0 <_sk_callback_sse41+0x444>
+  .byte  68,15,40,45,127,67,0,0              // movaps        0x437f(%rip),%xmm13        # 5d30 <_sk_callback_sse41+0x44f>
   .byte  69,15,88,197                        // addps         %xmm13,%xmm8
   .byte  69,15,89,194                        // mulps         %xmm10,%xmm8
-  .byte  68,15,40,53,224,64,0,0              // movaps        0x40e0(%rip),%xmm14        # 5ab0 <_sk_callback_sse41+0x454>
+  .byte  68,15,40,53,127,67,0,0              // movaps        0x437f(%rip),%xmm14        # 5d40 <_sk_callback_sse41+0x45f>
   .byte  69,15,88,198                        // addps         %xmm14,%xmm8
-  .byte  68,15,40,61,228,64,0,0              // movaps        0x40e4(%rip),%xmm15        # 5ac0 <_sk_callback_sse41+0x464>
+  .byte  68,15,40,61,131,67,0,0              // movaps        0x4383(%rip),%xmm15        # 5d50 <_sk_callback_sse41+0x46f>
   .byte  65,15,194,199,1                     // cmpltps       %xmm15,%xmm0
   .byte  102,69,15,56,20,193                 // blendvps      %xmm0,%xmm9,%xmm8
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
@@ -26080,19 +26995,19 @@
 _sk_from_srgb_dst_sse41:
   .byte  68,15,40,204                        // movaps        %xmm4,%xmm9
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,29,111,64,0,0              // movaps        0x406f(%rip),%xmm11        # 5ad0 <_sk_callback_sse41+0x474>
+  .byte  68,15,40,29,14,67,0,0               // movaps        0x430e(%rip),%xmm11        # 5d60 <_sk_callback_sse41+0x47f>
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
   .byte  69,15,89,211                        // mulps         %xmm11,%xmm10
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
-  .byte  68,15,40,37,104,64,0,0              // movaps        0x4068(%rip),%xmm12        # 5ae0 <_sk_callback_sse41+0x484>
+  .byte  68,15,40,37,7,67,0,0                // movaps        0x4307(%rip),%xmm12        # 5d70 <_sk_callback_sse41+0x48f>
   .byte  65,15,89,228                        // mulps         %xmm12,%xmm4
-  .byte  68,15,40,45,108,64,0,0              // movaps        0x406c(%rip),%xmm13        # 5af0 <_sk_callback_sse41+0x494>
+  .byte  68,15,40,45,11,67,0,0               // movaps        0x430b(%rip),%xmm13        # 5d80 <_sk_callback_sse41+0x49f>
   .byte  65,15,88,229                        // addps         %xmm13,%xmm4
   .byte  15,89,224                           // mulps         %xmm0,%xmm4
-  .byte  68,15,40,53,109,64,0,0              // movaps        0x406d(%rip),%xmm14        # 5b00 <_sk_callback_sse41+0x4a4>
+  .byte  68,15,40,53,12,67,0,0               // movaps        0x430c(%rip),%xmm14        # 5d90 <_sk_callback_sse41+0x4af>
   .byte  65,15,88,230                        // addps         %xmm14,%xmm4
-  .byte  68,15,40,61,113,64,0,0              // movaps        0x4071(%rip),%xmm15        # 5b10 <_sk_callback_sse41+0x4b4>
+  .byte  68,15,40,61,16,67,0,0               // movaps        0x4310(%rip),%xmm15        # 5da0 <_sk_callback_sse41+0x4bf>
   .byte  69,15,194,207,1                     // cmpltps       %xmm15,%xmm9
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  102,65,15,56,20,226                 // blendvps      %xmm0,%xmm10,%xmm4
@@ -26136,22 +27051,22 @@
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  68,15,82,192                        // rsqrtps       %xmm0,%xmm8
-  .byte  68,15,40,29,229,63,0,0              // movaps        0x3fe5(%rip),%xmm11        # 5b20 <_sk_callback_sse41+0x4c4>
+  .byte  68,15,40,29,132,66,0,0              // movaps        0x4284(%rip),%xmm11        # 5db0 <_sk_callback_sse41+0x4cf>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
-  .byte  68,15,40,37,229,63,0,0              // movaps        0x3fe5(%rip),%xmm12        # 5b30 <_sk_callback_sse41+0x4d4>
+  .byte  68,15,40,37,132,66,0,0              // movaps        0x4284(%rip),%xmm12        # 5dc0 <_sk_callback_sse41+0x4df>
   .byte  69,15,40,248                        // movaps        %xmm8,%xmm15
   .byte  69,15,89,252                        // mulps         %xmm12,%xmm15
-  .byte  68,15,40,21,229,63,0,0              // movaps        0x3fe5(%rip),%xmm10        # 5b40 <_sk_callback_sse41+0x4e4>
+  .byte  68,15,40,21,132,66,0,0              // movaps        0x4284(%rip),%xmm10        # 5dd0 <_sk_callback_sse41+0x4ef>
   .byte  69,15,88,250                        // addps         %xmm10,%xmm15
   .byte  69,15,89,248                        // mulps         %xmm8,%xmm15
-  .byte  68,15,40,45,229,63,0,0              // movaps        0x3fe5(%rip),%xmm13        # 5b50 <_sk_callback_sse41+0x4f4>
+  .byte  68,15,40,45,132,66,0,0              // movaps        0x4284(%rip),%xmm13        # 5de0 <_sk_callback_sse41+0x4ff>
   .byte  69,15,88,253                        // addps         %xmm13,%xmm15
-  .byte  68,15,40,53,233,63,0,0              // movaps        0x3fe9(%rip),%xmm14        # 5b60 <_sk_callback_sse41+0x504>
+  .byte  68,15,40,53,136,66,0,0              // movaps        0x4288(%rip),%xmm14        # 5df0 <_sk_callback_sse41+0x50f>
   .byte  69,15,88,198                        // addps         %xmm14,%xmm8
   .byte  69,15,83,192                        // rcpps         %xmm8,%xmm8
   .byte  69,15,89,199                        // mulps         %xmm15,%xmm8
-  .byte  68,15,40,61,229,63,0,0              // movaps        0x3fe5(%rip),%xmm15        # 5b70 <_sk_callback_sse41+0x514>
+  .byte  68,15,40,61,132,66,0,0              // movaps        0x4284(%rip),%xmm15        # 5e00 <_sk_callback_sse41+0x51f>
   .byte  65,15,194,199,1                     // cmpltps       %xmm15,%xmm0
   .byte  102,69,15,56,20,193                 // blendvps      %xmm0,%xmm9,%xmm8
   .byte  68,15,82,202                        // rsqrtps       %xmm2,%xmm9
@@ -26204,7 +27119,7 @@
   .byte  68,15,93,226                        // minps         %xmm2,%xmm12
   .byte  65,15,40,203                        // movaps        %xmm11,%xmm1
   .byte  65,15,92,204                        // subps         %xmm12,%xmm1
-  .byte  68,15,40,53,50,63,0,0               // movaps        0x3f32(%rip),%xmm14        # 5b80 <_sk_callback_sse41+0x524>
+  .byte  68,15,40,53,209,65,0,0              // movaps        0x41d1(%rip),%xmm14        # 5e10 <_sk_callback_sse41+0x52f>
   .byte  68,15,94,241                        // divps         %xmm1,%xmm14
   .byte  69,15,40,211                        // movaps        %xmm11,%xmm10
   .byte  69,15,194,208,0                     // cmpeqps       %xmm8,%xmm10
@@ -26213,27 +27128,27 @@
   .byte  65,15,89,198                        // mulps         %xmm14,%xmm0
   .byte  69,15,40,249                        // movaps        %xmm9,%xmm15
   .byte  68,15,194,250,1                     // cmpltps       %xmm2,%xmm15
-  .byte  68,15,84,61,25,63,0,0               // andps         0x3f19(%rip),%xmm15        # 5b90 <_sk_callback_sse41+0x534>
+  .byte  68,15,84,61,184,65,0,0              // andps         0x41b8(%rip),%xmm15        # 5e20 <_sk_callback_sse41+0x53f>
   .byte  68,15,88,248                        // addps         %xmm0,%xmm15
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  65,15,194,193,0                     // cmpeqps       %xmm9,%xmm0
   .byte  65,15,92,208                        // subps         %xmm8,%xmm2
   .byte  65,15,89,214                        // mulps         %xmm14,%xmm2
-  .byte  68,15,40,45,12,63,0,0               // movaps        0x3f0c(%rip),%xmm13        # 5ba0 <_sk_callback_sse41+0x544>
+  .byte  68,15,40,45,171,65,0,0              // movaps        0x41ab(%rip),%xmm13        # 5e30 <_sk_callback_sse41+0x54f>
   .byte  65,15,88,213                        // addps         %xmm13,%xmm2
   .byte  69,15,92,193                        // subps         %xmm9,%xmm8
   .byte  69,15,89,198                        // mulps         %xmm14,%xmm8
-  .byte  68,15,88,5,8,63,0,0                 // addps         0x3f08(%rip),%xmm8        # 5bb0 <_sk_callback_sse41+0x554>
+  .byte  68,15,88,5,167,65,0,0               // addps         0x41a7(%rip),%xmm8        # 5e40 <_sk_callback_sse41+0x55f>
   .byte  102,68,15,56,20,194                 // blendvps      %xmm0,%xmm2,%xmm8
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  102,69,15,56,20,199                 // blendvps      %xmm0,%xmm15,%xmm8
-  .byte  68,15,89,5,0,63,0,0                 // mulps         0x3f00(%rip),%xmm8        # 5bc0 <_sk_callback_sse41+0x564>
+  .byte  68,15,89,5,159,65,0,0               // mulps         0x419f(%rip),%xmm8        # 5e50 <_sk_callback_sse41+0x56f>
   .byte  69,15,40,203                        // movaps        %xmm11,%xmm9
   .byte  69,15,194,204,4                     // cmpneqps      %xmm12,%xmm9
   .byte  69,15,84,193                        // andps         %xmm9,%xmm8
   .byte  69,15,92,235                        // subps         %xmm11,%xmm13
   .byte  69,15,88,220                        // addps         %xmm12,%xmm11
-  .byte  15,40,5,244,62,0,0                  // movaps        0x3ef4(%rip),%xmm0        # 5bd0 <_sk_callback_sse41+0x574>
+  .byte  15,40,5,147,65,0,0                  // movaps        0x4193(%rip),%xmm0        # 5e60 <_sk_callback_sse41+0x57f>
   .byte  65,15,40,211                        // movaps        %xmm11,%xmm2
   .byte  15,89,208                           // mulps         %xmm0,%xmm2
   .byte  15,194,194,1                        // cmpltps       %xmm2,%xmm0
@@ -26255,7 +27170,7 @@
   .byte  15,41,100,36,184                    // movaps        %xmm4,-0x48(%rsp)
   .byte  15,41,92,36,168                     // movaps        %xmm3,-0x58(%rsp)
   .byte  68,15,40,208                        // movaps        %xmm0,%xmm10
-  .byte  68,15,40,13,186,62,0,0              // movaps        0x3eba(%rip),%xmm9        # 5be0 <_sk_callback_sse41+0x584>
+  .byte  68,15,40,13,89,65,0,0               // movaps        0x4159(%rip),%xmm9        # 5e70 <_sk_callback_sse41+0x58f>
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,194,194,2                        // cmpleps       %xmm2,%xmm0
   .byte  15,40,217                           // movaps        %xmm1,%xmm3
@@ -26268,19 +27183,19 @@
   .byte  15,41,84,36,152                     // movaps        %xmm2,-0x68(%rsp)
   .byte  69,15,88,192                        // addps         %xmm8,%xmm8
   .byte  68,15,92,197                        // subps         %xmm5,%xmm8
-  .byte  68,15,40,53,149,62,0,0              // movaps        0x3e95(%rip),%xmm14        # 5bf0 <_sk_callback_sse41+0x594>
+  .byte  68,15,40,53,52,65,0,0               // movaps        0x4134(%rip),%xmm14        # 5e80 <_sk_callback_sse41+0x59f>
   .byte  69,15,88,242                        // addps         %xmm10,%xmm14
   .byte  102,65,15,58,8,198,1                // roundps       $0x1,%xmm14,%xmm0
   .byte  68,15,92,240                        // subps         %xmm0,%xmm14
-  .byte  68,15,40,29,142,62,0,0              // movaps        0x3e8e(%rip),%xmm11        # 5c00 <_sk_callback_sse41+0x5a4>
+  .byte  68,15,40,29,45,65,0,0               // movaps        0x412d(%rip),%xmm11        # 5e90 <_sk_callback_sse41+0x5af>
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  65,15,194,198,2                     // cmpleps       %xmm14,%xmm0
   .byte  15,40,245                           // movaps        %xmm5,%xmm6
   .byte  65,15,92,240                        // subps         %xmm8,%xmm6
-  .byte  15,40,61,135,62,0,0                 // movaps        0x3e87(%rip),%xmm7        # 5c10 <_sk_callback_sse41+0x5b4>
+  .byte  15,40,61,38,65,0,0                  // movaps        0x4126(%rip),%xmm7        # 5ea0 <_sk_callback_sse41+0x5bf>
   .byte  69,15,40,238                        // movaps        %xmm14,%xmm13
   .byte  68,15,89,239                        // mulps         %xmm7,%xmm13
-  .byte  15,40,29,136,62,0,0                 // movaps        0x3e88(%rip),%xmm3        # 5c20 <_sk_callback_sse41+0x5c4>
+  .byte  15,40,29,39,65,0,0                  // movaps        0x4127(%rip),%xmm3        # 5eb0 <_sk_callback_sse41+0x5cf>
   .byte  68,15,40,227                        // movaps        %xmm3,%xmm12
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  68,15,89,230                        // mulps         %xmm6,%xmm12
@@ -26290,7 +27205,7 @@
   .byte  65,15,194,198,2                     // cmpleps       %xmm14,%xmm0
   .byte  68,15,40,253                        // movaps        %xmm5,%xmm15
   .byte  102,69,15,56,20,252                 // blendvps      %xmm0,%xmm12,%xmm15
-  .byte  68,15,40,37,103,62,0,0              // movaps        0x3e67(%rip),%xmm12        # 5c30 <_sk_callback_sse41+0x5d4>
+  .byte  68,15,40,37,6,65,0,0                // movaps        0x4106(%rip),%xmm12        # 5ec0 <_sk_callback_sse41+0x5df>
   .byte  65,15,40,196                        // movaps        %xmm12,%xmm0
   .byte  65,15,194,198,2                     // cmpleps       %xmm14,%xmm0
   .byte  68,15,89,238                        // mulps         %xmm6,%xmm13
@@ -26324,7 +27239,7 @@
   .byte  65,15,40,198                        // movaps        %xmm14,%xmm0
   .byte  15,40,84,36,152                     // movaps        -0x68(%rsp),%xmm2
   .byte  102,15,56,20,202                    // blendvps      %xmm0,%xmm2,%xmm1
-  .byte  68,15,88,21,223,61,0,0              // addps         0x3ddf(%rip),%xmm10        # 5c40 <_sk_callback_sse41+0x5e4>
+  .byte  68,15,88,21,126,64,0,0              // addps         0x407e(%rip),%xmm10        # 5ed0 <_sk_callback_sse41+0x5ef>
   .byte  102,65,15,58,8,194,1                // roundps       $0x1,%xmm10,%xmm0
   .byte  68,15,92,208                        // subps         %xmm0,%xmm10
   .byte  69,15,194,218,2                     // cmpleps       %xmm10,%xmm11
@@ -26375,11 +27290,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,52                              // jne           1f3a <_sk_scale_u8_sse41+0x3e>
+  .byte  117,52                              // jne           1f2b <_sk_scale_u8_sse41+0x3e>
   .byte  102,69,15,56,49,4,18                // pmovzxbd      (%r10,%rdx,1),%xmm8
-  .byte  102,68,15,219,5,58,61,0,0           // pand          0x3d3a(%rip),%xmm8        # 5c50 <_sk_callback_sse41+0x5f4>
+  .byte  102,68,15,219,5,217,63,0,0          // pand          0x3fd9(%rip),%xmm8        # 5ee0 <_sk_callback_sse41+0x5ff>
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,62,61,0,0                // mulps         0x3d3e(%rip),%xmm8        # 5c60 <_sk_callback_sse41+0x604>
+  .byte  68,15,89,5,221,63,0,0               // mulps         0x3fdd(%rip),%xmm8        # 5ef0 <_sk_callback_sse41+0x60f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
@@ -26390,12 +27305,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,59                              // je            1f82 <_sk_scale_u8_sse41+0x86>
+  .byte  116,59                              // je            1f73 <_sk_scale_u8_sse41+0x86>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,23                              // je            1f69 <_sk_scale_u8_sse41+0x6d>
+  .byte  116,23                              // je            1f5a <_sk_scale_u8_sse41+0x6d>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,181                             // jne           1f0d <_sk_scale_u8_sse41+0x11>
+  .byte  117,181                             // jne           1efe <_sk_scale_u8_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,192,69                // pshufd        $0x45,%xmm8,%xmm8
@@ -26403,10 +27318,10 @@
   .byte  102,68,15,110,200                   // movd          %eax,%xmm9
   .byte  102,69,15,56,49,201                 // pmovzxbd      %xmm9,%xmm9
   .byte  102,69,15,58,14,193,15              // pblendw       $0xf,%xmm9,%xmm8
-  .byte  235,139                             // jmp           1f0d <_sk_scale_u8_sse41+0x11>
+  .byte  235,139                             // jmp           1efe <_sk_scale_u8_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  233,124,255,255,255                 // jmpq          1f0d <_sk_scale_u8_sse41+0x11>
+  .byte  233,124,255,255,255                 // jmpq          1efe <_sk_scale_u8_sse41+0x11>
 
 HIDDEN _sk_lerp_1_float_sse41
 .globl _sk_lerp_1_float_sse41
@@ -26437,11 +27352,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,72                              // jne           201b <_sk_lerp_u8_sse41+0x52>
+  .byte  117,72                              // jne           200c <_sk_lerp_u8_sse41+0x52>
   .byte  102,69,15,56,49,4,18                // pmovzxbd      (%r10,%rdx,1),%xmm8
-  .byte  102,68,15,219,5,141,60,0,0          // pand          0x3c8d(%rip),%xmm8        # 5c70 <_sk_callback_sse41+0x614>
+  .byte  102,68,15,219,5,44,63,0,0           // pand          0x3f2c(%rip),%xmm8        # 5f00 <_sk_callback_sse41+0x61f>
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,145,60,0,0               // mulps         0x3c91(%rip),%xmm8        # 5c80 <_sk_callback_sse41+0x624>
+  .byte  68,15,89,5,48,63,0,0                // mulps         0x3f30(%rip),%xmm8        # 5f10 <_sk_callback_sse41+0x62f>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -26459,12 +27374,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,62                              // je            2066 <_sk_lerp_u8_sse41+0x9d>
+  .byte  116,62                              // je            2057 <_sk_lerp_u8_sse41+0x9d>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,23                              // je            204a <_sk_lerp_u8_sse41+0x81>
+  .byte  116,23                              // je            203b <_sk_lerp_u8_sse41+0x81>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,161                             // jne           1fda <_sk_lerp_u8_sse41+0x11>
+  .byte  117,161                             // jne           1fcb <_sk_lerp_u8_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,192,69                // pshufd        $0x45,%xmm8,%xmm8
@@ -26472,10 +27387,10 @@
   .byte  102,68,15,110,200                   // movd          %eax,%xmm9
   .byte  102,69,15,56,49,201                 // pmovzxbd      %xmm9,%xmm9
   .byte  102,69,15,58,14,193,15              // pblendw       $0xf,%xmm9,%xmm8
-  .byte  233,116,255,255,255                 // jmpq          1fda <_sk_lerp_u8_sse41+0x11>
+  .byte  233,116,255,255,255                 // jmpq          1fcb <_sk_lerp_u8_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  233,101,255,255,255                 // jmpq          1fda <_sk_lerp_u8_sse41+0x11>
+  .byte  233,101,255,255,255                 // jmpq          1fcb <_sk_lerp_u8_sse41+0x11>
 
 HIDDEN _sk_lerp_565_sse41
 .globl _sk_lerp_565_sse41
@@ -26484,19 +27399,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,152,0,0,0                    // jne           211b <_sk_lerp_565_sse41+0xa6>
+  .byte  15,133,152,0,0,0                    // jne           210c <_sk_lerp_565_sse41+0xa6>
   .byte  102,69,15,56,51,20,82               // pmovzxwd      (%r10,%rdx,2),%xmm10
-  .byte  102,68,15,111,5,253,59,0,0          // movdqa        0x3bfd(%rip),%xmm8        # 5c90 <_sk_callback_sse41+0x634>
+  .byte  102,68,15,111,5,156,62,0,0          // movdqa        0x3e9c(%rip),%xmm8        # 5f20 <_sk_callback_sse41+0x63f>
   .byte  102,69,15,219,194                   // pand          %xmm10,%xmm8
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,252,59,0,0               // mulps         0x3bfc(%rip),%xmm8        # 5ca0 <_sk_callback_sse41+0x644>
-  .byte  102,68,15,111,13,3,60,0,0           // movdqa        0x3c03(%rip),%xmm9        # 5cb0 <_sk_callback_sse41+0x654>
+  .byte  68,15,89,5,155,62,0,0               // mulps         0x3e9b(%rip),%xmm8        # 5f30 <_sk_callback_sse41+0x64f>
+  .byte  102,68,15,111,13,162,62,0,0         // movdqa        0x3ea2(%rip),%xmm9        # 5f40 <_sk_callback_sse41+0x65f>
   .byte  102,69,15,219,202                   // pand          %xmm10,%xmm9
   .byte  69,15,91,201                        // cvtdq2ps      %xmm9,%xmm9
-  .byte  68,15,89,13,2,60,0,0                // mulps         0x3c02(%rip),%xmm9        # 5cc0 <_sk_callback_sse41+0x664>
-  .byte  102,68,15,219,21,9,60,0,0           // pand          0x3c09(%rip),%xmm10        # 5cd0 <_sk_callback_sse41+0x674>
+  .byte  68,15,89,13,161,62,0,0              // mulps         0x3ea1(%rip),%xmm9        # 5f50 <_sk_callback_sse41+0x66f>
+  .byte  102,68,15,219,21,168,62,0,0         // pand          0x3ea8(%rip),%xmm10        # 5f60 <_sk_callback_sse41+0x67f>
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
-  .byte  68,15,89,21,13,60,0,0               // mulps         0x3c0d(%rip),%xmm10        # 5ce0 <_sk_callback_sse41+0x684>
+  .byte  68,15,89,21,172,62,0,0              // mulps         0x3eac(%rip),%xmm10        # 5f70 <_sk_callback_sse41+0x68f>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -26521,22 +27436,22 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,62                              // je            2166 <_sk_lerp_565_sse41+0xf1>
+  .byte  116,62                              // je            2157 <_sk_lerp_565_sse41+0xf1>
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,27                              // je            214e <_sk_lerp_565_sse41+0xd9>
+  .byte  116,27                              // je            213f <_sk_lerp_565_sse41+0xd9>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  15,133,77,255,255,255               // jne           208a <_sk_lerp_565_sse41+0x15>
+  .byte  15,133,77,255,255,255               // jne           207b <_sk_lerp_565_sse41+0x15>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,208,69                // pshufd        $0x45,%xmm8,%xmm10
   .byte  102,69,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm8
   .byte  102,69,15,56,51,192                 // pmovzxwd      %xmm8,%xmm8
   .byte  102,69,15,58,14,208,15              // pblendw       $0xf,%xmm8,%xmm10
-  .byte  233,36,255,255,255                  // jmpq          208a <_sk_lerp_565_sse41+0x15>
+  .byte  233,36,255,255,255                  // jmpq          207b <_sk_lerp_565_sse41+0x15>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,68,15,110,208                   // movd          %eax,%xmm10
-  .byte  233,21,255,255,255                  // jmpq          208a <_sk_lerp_565_sse41+0x15>
+  .byte  233,21,255,255,255                  // jmpq          207b <_sk_lerp_565_sse41+0x15>
 
 HIDDEN _sk_load_tables_sse41
 .globl _sk_load_tables_sse41
@@ -26545,12 +27460,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,24,1,0,0                     // jne           229b <_sk_load_tables_sse41+0x126>
+  .byte  15,133,24,1,0,0                     // jne           228c <_sk_load_tables_sse41+0x126>
   .byte  243,69,15,111,4,145                 // movdqu        (%r9,%rdx,4),%xmm8
   .byte  65,87                               // push          %r15
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
-  .byte  102,15,111,5,90,59,0,0              // movdqa        0x3b5a(%rip),%xmm0        # 5cf0 <_sk_callback_sse41+0x694>
+  .byte  102,15,111,5,249,61,0,0             // movdqa        0x3df9(%rip),%xmm0        # 5f80 <_sk_callback_sse41+0x69f>
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,73,15,58,22,193,1               // pextrq        $0x1,%xmm0,%r9
   .byte  102,73,15,126,194                   // movq          %xmm0,%r10
@@ -26565,7 +27480,7 @@
   .byte  102,66,15,58,33,4,179,32            // insertps      $0x20,(%rbx,%r14,4),%xmm0
   .byte  102,66,15,58,33,4,11,48             // insertps      $0x30,(%rbx,%r9,1),%xmm0
   .byte  102,65,15,111,200                   // movdqa        %xmm8,%xmm1
-  .byte  102,15,56,0,13,21,59,0,0            // pshufb        0x3b15(%rip),%xmm1        # 5d00 <_sk_callback_sse41+0x6a4>
+  .byte  102,15,56,0,13,180,61,0,0           // pshufb        0x3db4(%rip),%xmm1        # 5f90 <_sk_callback_sse41+0x6af>
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  102,72,15,126,203                   // movq          %xmm1,%rbx
   .byte  68,15,182,211                       // movzbl        %bl,%r10d
@@ -26580,7 +27495,7 @@
   .byte  102,15,58,33,202,48                 // insertps      $0x30,%xmm2,%xmm1
   .byte  76,139,72,24                        // mov           0x18(%rax),%r9
   .byte  102,65,15,111,208                   // movdqa        %xmm8,%xmm2
-  .byte  102,15,56,0,21,209,58,0,0           // pshufb        0x3ad1(%rip),%xmm2        # 5d10 <_sk_callback_sse41+0x6b4>
+  .byte  102,15,56,0,21,112,61,0,0           // pshufb        0x3d70(%rip),%xmm2        # 5fa0 <_sk_callback_sse41+0x6bf>
   .byte  102,72,15,58,22,211,1               // pextrq        $0x1,%xmm2,%rbx
   .byte  102,72,15,126,208                   // movq          %xmm2,%rax
   .byte  68,15,182,208                       // movzbl        %al,%r10d
@@ -26595,7 +27510,7 @@
   .byte  102,15,58,33,211,48                 // insertps      $0x30,%xmm3,%xmm2
   .byte  102,65,15,114,208,24                // psrld         $0x18,%xmm8
   .byte  65,15,91,216                        // cvtdq2ps      %xmm8,%xmm3
-  .byte  15,89,29,142,58,0,0                 // mulps         0x3a8e(%rip),%xmm3        # 5d20 <_sk_callback_sse41+0x6c4>
+  .byte  15,89,29,45,61,0,0                  // mulps         0x3d2d(%rip),%xmm3        # 5fb0 <_sk_callback_sse41+0x6cf>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
@@ -26604,19 +27519,19 @@
   .byte  69,137,194                          // mov           %r8d,%r10d
   .byte  65,128,226,3                        // and           $0x3,%r10b
   .byte  65,128,250,1                        // cmp           $0x1,%r10b
-  .byte  116,52                              // je            22dc <_sk_load_tables_sse41+0x167>
+  .byte  116,52                              // je            22cd <_sk_load_tables_sse41+0x167>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,250,2                        // cmp           $0x2,%r10b
-  .byte  116,23                              // je            22ca <_sk_load_tables_sse41+0x155>
+  .byte  116,23                              // je            22bb <_sk_load_tables_sse41+0x155>
   .byte  65,128,250,3                        // cmp           $0x3,%r10b
-  .byte  15,133,204,254,255,255              // jne           2189 <_sk_load_tables_sse41+0x14>
+  .byte  15,133,204,254,255,255              // jne           217a <_sk_load_tables_sse41+0x14>
   .byte  102,65,15,110,68,145,8              // movd          0x8(%r9,%rdx,4),%xmm0
   .byte  102,68,15,112,192,69                // pshufd        $0x45,%xmm0,%xmm8
   .byte  243,65,15,126,4,145                 // movq          (%r9,%rdx,4),%xmm0
   .byte  102,68,15,58,14,192,15              // pblendw       $0xf,%xmm0,%xmm8
-  .byte  233,173,254,255,255                 // jmpq          2189 <_sk_load_tables_sse41+0x14>
+  .byte  233,173,254,255,255                 // jmpq          217a <_sk_load_tables_sse41+0x14>
   .byte  102,69,15,110,4,145                 // movd          (%r9,%rdx,4),%xmm8
-  .byte  233,162,254,255,255                 // jmpq          2189 <_sk_load_tables_sse41+0x14>
+  .byte  233,162,254,255,255                 // jmpq          217a <_sk_load_tables_sse41+0x14>
 
 HIDDEN _sk_load_tables_u16_be_sse41
 .globl _sk_load_tables_u16_be_sse41
@@ -26626,7 +27541,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,99,1,0,0                     // jne           2460 <_sk_load_tables_u16_be_sse41+0x179>
+  .byte  15,133,99,1,0,0                     // jne           2451 <_sk_load_tables_u16_be_sse41+0x179>
   .byte  102,67,15,16,4,81                   // movupd        (%r9,%r10,2),%xmm0
   .byte  243,67,15,111,76,81,16              // movdqu        0x10(%r9,%r10,2),%xmm1
   .byte  65,87                               // push          %r15
@@ -26638,7 +27553,7 @@
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,97,200                       // punpcklwd     %xmm0,%xmm1
   .byte  102,68,15,105,200                   // punpckhwd     %xmm0,%xmm9
-  .byte  102,68,15,111,5,252,57,0,0          // movdqa        0x39fc(%rip),%xmm8        # 5d30 <_sk_callback_sse41+0x6d4>
+  .byte  102,68,15,111,5,155,60,0,0          // movdqa        0x3c9b(%rip),%xmm8        # 5fc0 <_sk_callback_sse41+0x6df>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
@@ -26656,7 +27571,7 @@
   .byte  102,15,58,33,194,32                 // insertps      $0x20,%xmm2,%xmm0
   .byte  243,66,15,16,20,11                  // movss         (%rbx,%r9,1),%xmm2
   .byte  102,15,58,33,194,48                 // insertps      $0x30,%xmm2,%xmm0
-  .byte  102,15,56,0,13,171,57,0,0           // pshufb        0x39ab(%rip),%xmm1        # 5d40 <_sk_callback_sse41+0x6e4>
+  .byte  102,15,56,0,13,74,60,0,0            // pshufb        0x3c4a(%rip),%xmm1        # 5fd0 <_sk_callback_sse41+0x6ef>
   .byte  102,15,56,51,201                    // pmovzxwd      %xmm1,%xmm1
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  102,72,15,126,203                   // movq          %xmm1,%rbx
@@ -26692,7 +27607,7 @@
   .byte  102,65,15,235,216                   // por           %xmm8,%xmm3
   .byte  102,15,56,51,219                    // pmovzxwd      %xmm3,%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,249,56,0,0                 // mulps         0x38f9(%rip),%xmm3        # 5d50 <_sk_callback_sse41+0x6f4>
+  .byte  15,89,29,152,59,0,0                 // mulps         0x3b98(%rip),%xmm3        # 5fe0 <_sk_callback_sse41+0x6ff>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
@@ -26700,16 +27615,16 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,67,15,16,4,81                   // movsd         (%r9,%r10,2),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           2479 <_sk_load_tables_u16_be_sse41+0x192>
+  .byte  117,13                              // jne           246a <_sk_load_tables_u16_be_sse41+0x192>
   .byte  243,15,126,192                      // movq          %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,145,254,255,255                 // jmpq          230a <_sk_load_tables_u16_be_sse41+0x23>
+  .byte  233,145,254,255,255                 // jmpq          22fb <_sk_load_tables_u16_be_sse41+0x23>
   .byte  102,67,15,22,68,81,8                // movhpd        0x8(%r9,%r10,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,124,254,255,255              // jb            230a <_sk_load_tables_u16_be_sse41+0x23>
+  .byte  15,130,124,254,255,255              // jb            22fb <_sk_load_tables_u16_be_sse41+0x23>
   .byte  243,67,15,126,76,81,16              // movq          0x10(%r9,%r10,2),%xmm1
-  .byte  233,112,254,255,255                 // jmpq          230a <_sk_load_tables_u16_be_sse41+0x23>
+  .byte  233,112,254,255,255                 // jmpq          22fb <_sk_load_tables_u16_be_sse41+0x23>
 
 HIDDEN _sk_load_tables_rgb_u16_be_sse41
 .globl _sk_load_tables_rgb_u16_be_sse41
@@ -26719,7 +27634,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,82                        // lea           (%rdx,%rdx,2),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,83,1,0,0                     // jne           25ff <_sk_load_tables_rgb_u16_be_sse41+0x165>
+  .byte  15,133,83,1,0,0                     // jne           25f0 <_sk_load_tables_rgb_u16_be_sse41+0x165>
   .byte  243,67,15,111,20,81                 // movdqu        (%r9,%r10,2),%xmm2
   .byte  243,67,15,111,76,81,8               // movdqu        0x8(%r9,%r10,2),%xmm1
   .byte  102,15,115,217,4                    // psrldq        $0x4,%xmm1
@@ -26734,7 +27649,7 @@
   .byte  102,68,15,97,200                    // punpcklwd     %xmm0,%xmm9
   .byte  102,15,111,202                      // movdqa        %xmm2,%xmm1
   .byte  102,65,15,97,201                    // punpcklwd     %xmm9,%xmm1
-  .byte  102,68,15,111,5,110,56,0,0          // movdqa        0x386e(%rip),%xmm8        # 5d60 <_sk_callback_sse41+0x704>
+  .byte  102,68,15,111,5,13,59,0,0           // movdqa        0x3b0d(%rip),%xmm8        # 5ff0 <_sk_callback_sse41+0x70f>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
@@ -26752,7 +27667,7 @@
   .byte  102,15,58,33,195,32                 // insertps      $0x20,%xmm3,%xmm0
   .byte  243,66,15,16,28,11                  // movss         (%rbx,%r9,1),%xmm3
   .byte  102,15,58,33,195,48                 // insertps      $0x30,%xmm3,%xmm0
-  .byte  102,15,56,0,13,29,56,0,0            // pshufb        0x381d(%rip),%xmm1        # 5d70 <_sk_callback_sse41+0x714>
+  .byte  102,15,56,0,13,188,58,0,0           // pshufb        0x3abc(%rip),%xmm1        # 6000 <_sk_callback_sse41+0x71f>
   .byte  102,15,56,51,201                    // pmovzxwd      %xmm1,%xmm1
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  102,72,15,126,203                   // movq          %xmm1,%rbx
@@ -26783,7 +27698,7 @@
   .byte  243,65,15,16,28,25                  // movss         (%r9,%rbx,1),%xmm3
   .byte  102,15,58,33,211,48                 // insertps      $0x30,%xmm3,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,136,55,0,0                 // movaps        0x3788(%rip),%xmm3        # 5d80 <_sk_callback_sse41+0x724>
+  .byte  15,40,29,39,58,0,0                  // movaps        0x3a27(%rip),%xmm3        # 6010 <_sk_callback_sse41+0x72f>
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
   .byte  65,95                               // pop           %r15
@@ -26792,21 +27707,21 @@
   .byte  102,67,15,196,84,81,4,2             // pinsrw        $0x2,0x4(%r9,%r10,2),%xmm2
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,14                              // jne           2625 <_sk_load_tables_rgb_u16_be_sse41+0x18b>
+  .byte  117,14                              // jne           2616 <_sk_load_tables_rgb_u16_be_sse41+0x18b>
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
-  .byte  233,173,254,255,255                 // jmpq          24d2 <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  .byte  233,173,254,255,255                 // jmpq          24c3 <_sk_load_tables_rgb_u16_be_sse41+0x38>
   .byte  102,71,15,110,76,81,6               // movd          0x6(%r9,%r10,2),%xmm9
   .byte  102,71,15,196,76,81,10,2            // pinsrw        $0x2,0xa(%r9,%r10,2),%xmm9
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,24                              // jb            2656 <_sk_load_tables_rgb_u16_be_sse41+0x1bc>
+  .byte  114,24                              // jb            2647 <_sk_load_tables_rgb_u16_be_sse41+0x1bc>
   .byte  102,67,15,110,76,81,12              // movd          0xc(%r9,%r10,2),%xmm1
   .byte  102,67,15,196,76,81,16,2            // pinsrw        $0x2,0x10(%r9,%r10,2),%xmm1
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,124,254,255,255                 // jmpq          24d2 <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  .byte  233,124,254,255,255                 // jmpq          24c3 <_sk_load_tables_rgb_u16_be_sse41+0x38>
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,115,254,255,255                 // jmpq          24d2 <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  .byte  233,115,254,255,255                 // jmpq          24c3 <_sk_load_tables_rgb_u16_be_sse41+0x38>
 
 HIDDEN _sk_byte_tables_sse41
 .globl _sk_byte_tables_sse41
@@ -26817,7 +27732,7 @@
   .byte  65,84                               // push          %r12
   .byte  83                                  // push          %rbx
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,32,55,0,0                // movaps        0x3720(%rip),%xmm8        # 5d90 <_sk_callback_sse41+0x734>
+  .byte  68,15,40,5,191,57,0,0               // movaps        0x39bf(%rip),%xmm8        # 6020 <_sk_callback_sse41+0x73f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,91,192                       // cvtps2dq      %xmm0,%xmm0
   .byte  102,73,15,58,22,193,1               // pextrq        $0x1,%xmm0,%r9
@@ -26836,7 +27751,7 @@
   .byte  102,15,58,32,195,3                  // pinsrb        $0x3,%ebx,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,13,209,54,0,0              // movaps        0x36d1(%rip),%xmm9        # 5da0 <_sk_callback_sse41+0x744>
+  .byte  68,15,40,13,112,57,0,0              // movaps        0x3970(%rip),%xmm9        # 6030 <_sk_callback_sse41+0x74f>
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -26932,7 +27847,7 @@
   .byte  102,15,58,32,195,3                  // pinsrb        $0x3,%ebx,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,13,73,53,0,0               // movaps        0x3549(%rip),%xmm9        # 5db0 <_sk_callback_sse41+0x754>
+  .byte  68,15,40,13,232,55,0,0              // movaps        0x37e8(%rip),%xmm9        # 6040 <_sk_callback_sse41+0x75f>
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -27119,31 +28034,31 @@
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,194                        // cvtdq2ps      %xmm10,%xmm8
-  .byte  68,15,89,5,145,50,0,0               // mulps         0x3291(%rip),%xmm8        # 5dc0 <_sk_callback_sse41+0x764>
-  .byte  68,15,84,21,153,50,0,0              // andps         0x3299(%rip),%xmm10        # 5dd0 <_sk_callback_sse41+0x774>
-  .byte  68,15,86,21,161,50,0,0              // orps          0x32a1(%rip),%xmm10        # 5de0 <_sk_callback_sse41+0x784>
-  .byte  68,15,88,5,169,50,0,0               // addps         0x32a9(%rip),%xmm8        # 5df0 <_sk_callback_sse41+0x794>
-  .byte  68,15,40,37,177,50,0,0              // movaps        0x32b1(%rip),%xmm12        # 5e00 <_sk_callback_sse41+0x7a4>
+  .byte  68,15,89,5,48,53,0,0                // mulps         0x3530(%rip),%xmm8        # 6050 <_sk_callback_sse41+0x76f>
+  .byte  68,15,84,21,56,53,0,0               // andps         0x3538(%rip),%xmm10        # 6060 <_sk_callback_sse41+0x77f>
+  .byte  68,15,86,21,64,53,0,0               // orps          0x3540(%rip),%xmm10        # 6070 <_sk_callback_sse41+0x78f>
+  .byte  68,15,88,5,72,53,0,0                // addps         0x3548(%rip),%xmm8        # 6080 <_sk_callback_sse41+0x79f>
+  .byte  68,15,40,37,80,53,0,0               // movaps        0x3550(%rip),%xmm12        # 6090 <_sk_callback_sse41+0x7af>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,196                        // subps         %xmm12,%xmm8
-  .byte  68,15,88,21,177,50,0,0              // addps         0x32b1(%rip),%xmm10        # 5e10 <_sk_callback_sse41+0x7b4>
-  .byte  68,15,40,37,185,50,0,0              // movaps        0x32b9(%rip),%xmm12        # 5e20 <_sk_callback_sse41+0x7c4>
+  .byte  68,15,88,21,80,53,0,0               // addps         0x3550(%rip),%xmm10        # 60a0 <_sk_callback_sse41+0x7bf>
+  .byte  68,15,40,37,88,53,0,0               // movaps        0x3558(%rip),%xmm12        # 60b0 <_sk_callback_sse41+0x7cf>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,196                        // subps         %xmm12,%xmm8
   .byte  69,15,89,195                        // mulps         %xmm11,%xmm8
   .byte  102,69,15,58,8,208,1                // roundps       $0x1,%xmm8,%xmm10
   .byte  69,15,40,216                        // movaps        %xmm8,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,5,166,50,0,0               // addps         0x32a6(%rip),%xmm8        # 5e30 <_sk_callback_sse41+0x7d4>
-  .byte  68,15,40,21,174,50,0,0              // movaps        0x32ae(%rip),%xmm10        # 5e40 <_sk_callback_sse41+0x7e4>
+  .byte  68,15,88,5,69,53,0,0                // addps         0x3545(%rip),%xmm8        # 60c0 <_sk_callback_sse41+0x7df>
+  .byte  68,15,40,21,77,53,0,0               // movaps        0x354d(%rip),%xmm10        # 60d0 <_sk_callback_sse41+0x7ef>
   .byte  69,15,89,211                        // mulps         %xmm11,%xmm10
   .byte  69,15,92,194                        // subps         %xmm10,%xmm8
-  .byte  68,15,40,21,174,50,0,0              // movaps        0x32ae(%rip),%xmm10        # 5e50 <_sk_callback_sse41+0x7f4>
+  .byte  68,15,40,21,77,53,0,0               // movaps        0x354d(%rip),%xmm10        # 60e0 <_sk_callback_sse41+0x7ff>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  68,15,40,29,178,50,0,0              // movaps        0x32b2(%rip),%xmm11        # 5e60 <_sk_callback_sse41+0x804>
+  .byte  68,15,40,29,81,53,0,0               // movaps        0x3551(%rip),%xmm11        # 60f0 <_sk_callback_sse41+0x80f>
   .byte  69,15,94,218                        // divps         %xmm10,%xmm11
   .byte  69,15,88,216                        // addps         %xmm8,%xmm11
-  .byte  68,15,89,29,178,50,0,0              // mulps         0x32b2(%rip),%xmm11        # 5e70 <_sk_callback_sse41+0x814>
+  .byte  68,15,89,29,81,53,0,0               // mulps         0x3551(%rip),%xmm11        # 6100 <_sk_callback_sse41+0x81f>
   .byte  102,69,15,91,211                    // cvtps2dq      %xmm11,%xmm10
   .byte  243,68,15,16,64,20                  // movss         0x14(%rax),%xmm8
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
@@ -27151,7 +28066,7 @@
   .byte  102,69,15,56,20,193                 // blendvps      %xmm0,%xmm9,%xmm8
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  68,15,95,192                        // maxps         %xmm0,%xmm8
-  .byte  68,15,93,5,153,50,0,0               // minps         0x3299(%rip),%xmm8        # 5e80 <_sk_callback_sse41+0x824>
+  .byte  68,15,93,5,56,53,0,0                // minps         0x3538(%rip),%xmm8        # 6110 <_sk_callback_sse41+0x82f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -27181,31 +28096,31 @@
   .byte  68,15,88,217                        // addps         %xmm1,%xmm11
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,91,227                        // cvtdq2ps      %xmm11,%xmm12
-  .byte  68,15,89,37,58,50,0,0               // mulps         0x323a(%rip),%xmm12        # 5e90 <_sk_callback_sse41+0x834>
-  .byte  68,15,84,29,66,50,0,0               // andps         0x3242(%rip),%xmm11        # 5ea0 <_sk_callback_sse41+0x844>
-  .byte  68,15,86,29,74,50,0,0               // orps          0x324a(%rip),%xmm11        # 5eb0 <_sk_callback_sse41+0x854>
-  .byte  68,15,88,37,82,50,0,0               // addps         0x3252(%rip),%xmm12        # 5ec0 <_sk_callback_sse41+0x864>
-  .byte  15,40,13,91,50,0,0                  // movaps        0x325b(%rip),%xmm1        # 5ed0 <_sk_callback_sse41+0x874>
+  .byte  68,15,89,37,217,52,0,0              // mulps         0x34d9(%rip),%xmm12        # 6120 <_sk_callback_sse41+0x83f>
+  .byte  68,15,84,29,225,52,0,0              // andps         0x34e1(%rip),%xmm11        # 6130 <_sk_callback_sse41+0x84f>
+  .byte  68,15,86,29,233,52,0,0              // orps          0x34e9(%rip),%xmm11        # 6140 <_sk_callback_sse41+0x85f>
+  .byte  68,15,88,37,241,52,0,0              // addps         0x34f1(%rip),%xmm12        # 6150 <_sk_callback_sse41+0x86f>
+  .byte  15,40,13,250,52,0,0                 // movaps        0x34fa(%rip),%xmm1        # 6160 <_sk_callback_sse41+0x87f>
   .byte  65,15,89,203                        // mulps         %xmm11,%xmm1
   .byte  68,15,92,225                        // subps         %xmm1,%xmm12
-  .byte  68,15,88,29,91,50,0,0               // addps         0x325b(%rip),%xmm11        # 5ee0 <_sk_callback_sse41+0x884>
-  .byte  15,40,13,100,50,0,0                 // movaps        0x3264(%rip),%xmm1        # 5ef0 <_sk_callback_sse41+0x894>
+  .byte  68,15,88,29,250,52,0,0              // addps         0x34fa(%rip),%xmm11        # 6170 <_sk_callback_sse41+0x88f>
+  .byte  15,40,13,3,53,0,0                   // movaps        0x3503(%rip),%xmm1        # 6180 <_sk_callback_sse41+0x89f>
   .byte  65,15,94,203                        // divps         %xmm11,%xmm1
   .byte  68,15,92,225                        // subps         %xmm1,%xmm12
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  102,69,15,58,8,212,1                // roundps       $0x1,%xmm12,%xmm10
   .byte  69,15,40,220                        // movaps        %xmm12,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,37,81,50,0,0               // addps         0x3251(%rip),%xmm12        # 5f00 <_sk_callback_sse41+0x8a4>
-  .byte  15,40,13,90,50,0,0                  // movaps        0x325a(%rip),%xmm1        # 5f10 <_sk_callback_sse41+0x8b4>
+  .byte  68,15,88,37,240,52,0,0              // addps         0x34f0(%rip),%xmm12        # 6190 <_sk_callback_sse41+0x8af>
+  .byte  15,40,13,249,52,0,0                 // movaps        0x34f9(%rip),%xmm1        # 61a0 <_sk_callback_sse41+0x8bf>
   .byte  65,15,89,203                        // mulps         %xmm11,%xmm1
   .byte  68,15,92,225                        // subps         %xmm1,%xmm12
-  .byte  68,15,40,21,90,50,0,0               // movaps        0x325a(%rip),%xmm10        # 5f20 <_sk_callback_sse41+0x8c4>
+  .byte  68,15,40,21,249,52,0,0              // movaps        0x34f9(%rip),%xmm10        # 61b0 <_sk_callback_sse41+0x8cf>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  15,40,13,95,50,0,0                  // movaps        0x325f(%rip),%xmm1        # 5f30 <_sk_callback_sse41+0x8d4>
+  .byte  15,40,13,254,52,0,0                 // movaps        0x34fe(%rip),%xmm1        # 61c0 <_sk_callback_sse41+0x8df>
   .byte  65,15,94,202                        // divps         %xmm10,%xmm1
   .byte  65,15,88,204                        // addps         %xmm12,%xmm1
-  .byte  15,89,13,96,50,0,0                  // mulps         0x3260(%rip),%xmm1        # 5f40 <_sk_callback_sse41+0x8e4>
+  .byte  15,89,13,255,52,0,0                 // mulps         0x34ff(%rip),%xmm1        # 61d0 <_sk_callback_sse41+0x8ef>
   .byte  102,68,15,91,209                    // cvtps2dq      %xmm1,%xmm10
   .byte  243,15,16,72,20                     // movss         0x14(%rax),%xmm1
   .byte  15,198,201,0                        // shufps        $0x0,%xmm1,%xmm1
@@ -27213,7 +28128,7 @@
   .byte  102,65,15,56,20,201                 // blendvps      %xmm0,%xmm9,%xmm1
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  15,95,200                           // maxps         %xmm0,%xmm1
-  .byte  15,93,13,75,50,0,0                  // minps         0x324b(%rip),%xmm1        # 5f50 <_sk_callback_sse41+0x8f4>
+  .byte  15,93,13,234,52,0,0                 // minps         0x34ea(%rip),%xmm1        # 61e0 <_sk_callback_sse41+0x8ff>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -27243,31 +28158,31 @@
   .byte  68,15,88,218                        // addps         %xmm2,%xmm11
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,91,227                        // cvtdq2ps      %xmm11,%xmm12
-  .byte  68,15,89,37,236,49,0,0              // mulps         0x31ec(%rip),%xmm12        # 5f60 <_sk_callback_sse41+0x904>
-  .byte  68,15,84,29,244,49,0,0              // andps         0x31f4(%rip),%xmm11        # 5f70 <_sk_callback_sse41+0x914>
-  .byte  68,15,86,29,252,49,0,0              // orps          0x31fc(%rip),%xmm11        # 5f80 <_sk_callback_sse41+0x924>
-  .byte  68,15,88,37,4,50,0,0                // addps         0x3204(%rip),%xmm12        # 5f90 <_sk_callback_sse41+0x934>
-  .byte  15,40,21,13,50,0,0                  // movaps        0x320d(%rip),%xmm2        # 5fa0 <_sk_callback_sse41+0x944>
+  .byte  68,15,89,37,139,52,0,0              // mulps         0x348b(%rip),%xmm12        # 61f0 <_sk_callback_sse41+0x90f>
+  .byte  68,15,84,29,147,52,0,0              // andps         0x3493(%rip),%xmm11        # 6200 <_sk_callback_sse41+0x91f>
+  .byte  68,15,86,29,155,52,0,0              // orps          0x349b(%rip),%xmm11        # 6210 <_sk_callback_sse41+0x92f>
+  .byte  68,15,88,37,163,52,0,0              // addps         0x34a3(%rip),%xmm12        # 6220 <_sk_callback_sse41+0x93f>
+  .byte  15,40,21,172,52,0,0                 // movaps        0x34ac(%rip),%xmm2        # 6230 <_sk_callback_sse41+0x94f>
   .byte  65,15,89,211                        // mulps         %xmm11,%xmm2
   .byte  68,15,92,226                        // subps         %xmm2,%xmm12
-  .byte  68,15,88,29,13,50,0,0               // addps         0x320d(%rip),%xmm11        # 5fb0 <_sk_callback_sse41+0x954>
-  .byte  15,40,21,22,50,0,0                  // movaps        0x3216(%rip),%xmm2        # 5fc0 <_sk_callback_sse41+0x964>
+  .byte  68,15,88,29,172,52,0,0              // addps         0x34ac(%rip),%xmm11        # 6240 <_sk_callback_sse41+0x95f>
+  .byte  15,40,21,181,52,0,0                 // movaps        0x34b5(%rip),%xmm2        # 6250 <_sk_callback_sse41+0x96f>
   .byte  65,15,94,211                        // divps         %xmm11,%xmm2
   .byte  68,15,92,226                        // subps         %xmm2,%xmm12
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  102,69,15,58,8,212,1                // roundps       $0x1,%xmm12,%xmm10
   .byte  69,15,40,220                        // movaps        %xmm12,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,37,3,50,0,0                // addps         0x3203(%rip),%xmm12        # 5fd0 <_sk_callback_sse41+0x974>
-  .byte  15,40,21,12,50,0,0                  // movaps        0x320c(%rip),%xmm2        # 5fe0 <_sk_callback_sse41+0x984>
+  .byte  68,15,88,37,162,52,0,0              // addps         0x34a2(%rip),%xmm12        # 6260 <_sk_callback_sse41+0x97f>
+  .byte  15,40,21,171,52,0,0                 // movaps        0x34ab(%rip),%xmm2        # 6270 <_sk_callback_sse41+0x98f>
   .byte  65,15,89,211                        // mulps         %xmm11,%xmm2
   .byte  68,15,92,226                        // subps         %xmm2,%xmm12
-  .byte  68,15,40,21,12,50,0,0               // movaps        0x320c(%rip),%xmm10        # 5ff0 <_sk_callback_sse41+0x994>
+  .byte  68,15,40,21,171,52,0,0              // movaps        0x34ab(%rip),%xmm10        # 6280 <_sk_callback_sse41+0x99f>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  15,40,21,17,50,0,0                  // movaps        0x3211(%rip),%xmm2        # 6000 <_sk_callback_sse41+0x9a4>
+  .byte  15,40,21,176,52,0,0                 // movaps        0x34b0(%rip),%xmm2        # 6290 <_sk_callback_sse41+0x9af>
   .byte  65,15,94,210                        // divps         %xmm10,%xmm2
   .byte  65,15,88,212                        // addps         %xmm12,%xmm2
-  .byte  15,89,21,18,50,0,0                  // mulps         0x3212(%rip),%xmm2        # 6010 <_sk_callback_sse41+0x9b4>
+  .byte  15,89,21,177,52,0,0                 // mulps         0x34b1(%rip),%xmm2        # 62a0 <_sk_callback_sse41+0x9bf>
   .byte  102,68,15,91,210                    // cvtps2dq      %xmm2,%xmm10
   .byte  243,15,16,80,20                     // movss         0x14(%rax),%xmm2
   .byte  15,198,210,0                        // shufps        $0x0,%xmm2,%xmm2
@@ -27275,7 +28190,7 @@
   .byte  102,65,15,56,20,209                 // blendvps      %xmm0,%xmm9,%xmm2
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  15,95,208                           // maxps         %xmm0,%xmm2
-  .byte  15,93,21,253,49,0,0                 // minps         0x31fd(%rip),%xmm2        # 6020 <_sk_callback_sse41+0x9c4>
+  .byte  15,93,21,156,52,0,0                 // minps         0x349c(%rip),%xmm2        # 62b0 <_sk_callback_sse41+0x9cf>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -27305,31 +28220,31 @@
   .byte  68,15,88,219                        // addps         %xmm3,%xmm11
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,91,227                        // cvtdq2ps      %xmm11,%xmm12
-  .byte  68,15,89,37,158,49,0,0              // mulps         0x319e(%rip),%xmm12        # 6030 <_sk_callback_sse41+0x9d4>
-  .byte  68,15,84,29,166,49,0,0              // andps         0x31a6(%rip),%xmm11        # 6040 <_sk_callback_sse41+0x9e4>
-  .byte  68,15,86,29,174,49,0,0              // orps          0x31ae(%rip),%xmm11        # 6050 <_sk_callback_sse41+0x9f4>
-  .byte  68,15,88,37,182,49,0,0              // addps         0x31b6(%rip),%xmm12        # 6060 <_sk_callback_sse41+0xa04>
-  .byte  15,40,29,191,49,0,0                 // movaps        0x31bf(%rip),%xmm3        # 6070 <_sk_callback_sse41+0xa14>
+  .byte  68,15,89,37,61,52,0,0               // mulps         0x343d(%rip),%xmm12        # 62c0 <_sk_callback_sse41+0x9df>
+  .byte  68,15,84,29,69,52,0,0               // andps         0x3445(%rip),%xmm11        # 62d0 <_sk_callback_sse41+0x9ef>
+  .byte  68,15,86,29,77,52,0,0               // orps          0x344d(%rip),%xmm11        # 62e0 <_sk_callback_sse41+0x9ff>
+  .byte  68,15,88,37,85,52,0,0               // addps         0x3455(%rip),%xmm12        # 62f0 <_sk_callback_sse41+0xa0f>
+  .byte  15,40,29,94,52,0,0                  // movaps        0x345e(%rip),%xmm3        # 6300 <_sk_callback_sse41+0xa1f>
   .byte  65,15,89,219                        // mulps         %xmm11,%xmm3
   .byte  68,15,92,227                        // subps         %xmm3,%xmm12
-  .byte  68,15,88,29,191,49,0,0              // addps         0x31bf(%rip),%xmm11        # 6080 <_sk_callback_sse41+0xa24>
-  .byte  15,40,29,200,49,0,0                 // movaps        0x31c8(%rip),%xmm3        # 6090 <_sk_callback_sse41+0xa34>
+  .byte  68,15,88,29,94,52,0,0               // addps         0x345e(%rip),%xmm11        # 6310 <_sk_callback_sse41+0xa2f>
+  .byte  15,40,29,103,52,0,0                 // movaps        0x3467(%rip),%xmm3        # 6320 <_sk_callback_sse41+0xa3f>
   .byte  65,15,94,219                        // divps         %xmm11,%xmm3
   .byte  68,15,92,227                        // subps         %xmm3,%xmm12
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  102,69,15,58,8,212,1                // roundps       $0x1,%xmm12,%xmm10
   .byte  69,15,40,220                        // movaps        %xmm12,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,37,181,49,0,0              // addps         0x31b5(%rip),%xmm12        # 60a0 <_sk_callback_sse41+0xa44>
-  .byte  15,40,29,190,49,0,0                 // movaps        0x31be(%rip),%xmm3        # 60b0 <_sk_callback_sse41+0xa54>
+  .byte  68,15,88,37,84,52,0,0               // addps         0x3454(%rip),%xmm12        # 6330 <_sk_callback_sse41+0xa4f>
+  .byte  15,40,29,93,52,0,0                  // movaps        0x345d(%rip),%xmm3        # 6340 <_sk_callback_sse41+0xa5f>
   .byte  65,15,89,219                        // mulps         %xmm11,%xmm3
   .byte  68,15,92,227                        // subps         %xmm3,%xmm12
-  .byte  68,15,40,21,190,49,0,0              // movaps        0x31be(%rip),%xmm10        # 60c0 <_sk_callback_sse41+0xa64>
+  .byte  68,15,40,21,93,52,0,0               // movaps        0x345d(%rip),%xmm10        # 6350 <_sk_callback_sse41+0xa6f>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  15,40,29,195,49,0,0                 // movaps        0x31c3(%rip),%xmm3        # 60d0 <_sk_callback_sse41+0xa74>
+  .byte  15,40,29,98,52,0,0                  // movaps        0x3462(%rip),%xmm3        # 6360 <_sk_callback_sse41+0xa7f>
   .byte  65,15,94,218                        // divps         %xmm10,%xmm3
   .byte  65,15,88,220                        // addps         %xmm12,%xmm3
-  .byte  15,89,29,196,49,0,0                 // mulps         0x31c4(%rip),%xmm3        # 60e0 <_sk_callback_sse41+0xa84>
+  .byte  15,89,29,99,52,0,0                  // mulps         0x3463(%rip),%xmm3        # 6370 <_sk_callback_sse41+0xa8f>
   .byte  102,68,15,91,211                    // cvtps2dq      %xmm3,%xmm10
   .byte  243,15,16,88,20                     // movss         0x14(%rax),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
@@ -27337,7 +28252,7 @@
   .byte  102,65,15,56,20,217                 // blendvps      %xmm0,%xmm9,%xmm3
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  15,95,216                           // maxps         %xmm0,%xmm3
-  .byte  15,93,29,175,49,0,0                 // minps         0x31af(%rip),%xmm3        # 60f0 <_sk_callback_sse41+0xa94>
+  .byte  15,93,29,78,52,0,0                  // minps         0x344e(%rip),%xmm3        # 6380 <_sk_callback_sse41+0xa9f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -27347,29 +28262,29 @@
 FUNCTION(_sk_lab_to_xyz_sse41)
 _sk_lab_to_xyz_sse41:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,89,5,171,49,0,0               // mulps         0x31ab(%rip),%xmm8        # 6100 <_sk_callback_sse41+0xaa4>
-  .byte  68,15,40,13,179,49,0,0              // movaps        0x31b3(%rip),%xmm9        # 6110 <_sk_callback_sse41+0xab4>
+  .byte  68,15,89,5,74,52,0,0                // mulps         0x344a(%rip),%xmm8        # 6390 <_sk_callback_sse41+0xaaf>
+  .byte  68,15,40,13,82,52,0,0               // movaps        0x3452(%rip),%xmm9        # 63a0 <_sk_callback_sse41+0xabf>
   .byte  65,15,89,201                        // mulps         %xmm9,%xmm1
-  .byte  15,40,5,184,49,0,0                  // movaps        0x31b8(%rip),%xmm0        # 6120 <_sk_callback_sse41+0xac4>
+  .byte  15,40,5,87,52,0,0                   // movaps        0x3457(%rip),%xmm0        # 63b0 <_sk_callback_sse41+0xacf>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
   .byte  65,15,89,209                        // mulps         %xmm9,%xmm2
   .byte  15,88,208                           // addps         %xmm0,%xmm2
-  .byte  68,15,88,5,182,49,0,0               // addps         0x31b6(%rip),%xmm8        # 6130 <_sk_callback_sse41+0xad4>
-  .byte  68,15,89,5,190,49,0,0               // mulps         0x31be(%rip),%xmm8        # 6140 <_sk_callback_sse41+0xae4>
-  .byte  15,89,13,199,49,0,0                 // mulps         0x31c7(%rip),%xmm1        # 6150 <_sk_callback_sse41+0xaf4>
+  .byte  68,15,88,5,85,52,0,0                // addps         0x3455(%rip),%xmm8        # 63c0 <_sk_callback_sse41+0xadf>
+  .byte  68,15,89,5,93,52,0,0                // mulps         0x345d(%rip),%xmm8        # 63d0 <_sk_callback_sse41+0xaef>
+  .byte  15,89,13,102,52,0,0                 // mulps         0x3466(%rip),%xmm1        # 63e0 <_sk_callback_sse41+0xaff>
   .byte  65,15,88,200                        // addps         %xmm8,%xmm1
-  .byte  15,89,21,204,49,0,0                 // mulps         0x31cc(%rip),%xmm2        # 6160 <_sk_callback_sse41+0xb04>
+  .byte  15,89,21,107,52,0,0                 // mulps         0x346b(%rip),%xmm2        # 63f0 <_sk_callback_sse41+0xb0f>
   .byte  69,15,40,208                        // movaps        %xmm8,%xmm10
   .byte  68,15,92,210                        // subps         %xmm2,%xmm10
   .byte  68,15,40,217                        // movaps        %xmm1,%xmm11
   .byte  69,15,89,219                        // mulps         %xmm11,%xmm11
   .byte  68,15,89,217                        // mulps         %xmm1,%xmm11
-  .byte  68,15,40,13,192,49,0,0              // movaps        0x31c0(%rip),%xmm9        # 6170 <_sk_callback_sse41+0xb14>
+  .byte  68,15,40,13,95,52,0,0               // movaps        0x345f(%rip),%xmm9        # 6400 <_sk_callback_sse41+0xb1f>
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  65,15,194,195,1                     // cmpltps       %xmm11,%xmm0
-  .byte  15,40,21,192,49,0,0                 // movaps        0x31c0(%rip),%xmm2        # 6180 <_sk_callback_sse41+0xb24>
+  .byte  15,40,21,95,52,0,0                  // movaps        0x345f(%rip),%xmm2        # 6410 <_sk_callback_sse41+0xb2f>
   .byte  15,88,202                           // addps         %xmm2,%xmm1
-  .byte  68,15,40,37,197,49,0,0              // movaps        0x31c5(%rip),%xmm12        # 6190 <_sk_callback_sse41+0xb34>
+  .byte  68,15,40,37,100,52,0,0              // movaps        0x3464(%rip),%xmm12        # 6420 <_sk_callback_sse41+0xb3f>
   .byte  65,15,89,204                        // mulps         %xmm12,%xmm1
   .byte  102,65,15,56,20,203                 // blendvps      %xmm0,%xmm11,%xmm1
   .byte  69,15,40,216                        // movaps        %xmm8,%xmm11
@@ -27388,8 +28303,8 @@
   .byte  65,15,89,212                        // mulps         %xmm12,%xmm2
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  102,65,15,56,20,211                 // blendvps      %xmm0,%xmm11,%xmm2
-  .byte  15,89,13,126,49,0,0                 // mulps         0x317e(%rip),%xmm1        # 61a0 <_sk_callback_sse41+0xb44>
-  .byte  15,89,21,135,49,0,0                 // mulps         0x3187(%rip),%xmm2        # 61b0 <_sk_callback_sse41+0xb54>
+  .byte  15,89,13,29,52,0,0                  // mulps         0x341d(%rip),%xmm1        # 6430 <_sk_callback_sse41+0xb4f>
+  .byte  15,89,21,38,52,0,0                  // mulps         0x3426(%rip),%xmm2        # 6440 <_sk_callback_sse41+0xb5f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  65,15,40,200                        // movaps        %xmm8,%xmm1
@@ -27402,11 +28317,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,39                              // jne           3065 <_sk_load_a8_sse41+0x31>
+  .byte  117,39                              // jne           3056 <_sk_load_a8_sse41+0x31>
   .byte  102,65,15,56,49,4,18                // pmovzxbd      (%r10,%rdx,1),%xmm0
-  .byte  102,15,219,5,115,49,0,0             // pand          0x3173(%rip),%xmm0        # 61c0 <_sk_callback_sse41+0xb64>
+  .byte  102,15,219,5,18,52,0,0              // pand          0x3412(%rip),%xmm0        # 6450 <_sk_callback_sse41+0xb6f>
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,121,49,0,0                 // mulps         0x3179(%rip),%xmm3        # 61d0 <_sk_callback_sse41+0xb74>
+  .byte  15,89,29,24,52,0,0                  // mulps         0x3418(%rip),%xmm3        # 6460 <_sk_callback_sse41+0xb7f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
@@ -27415,12 +28330,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            30a7 <_sk_load_a8_sse41+0x73>
+  .byte  116,53                              // je            3098 <_sk_load_a8_sse41+0x73>
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3091 <_sk_load_a8_sse41+0x5d>
+  .byte  116,21                              // je            3082 <_sk_load_a8_sse41+0x5d>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,195                             // jne           3045 <_sk_load_a8_sse41+0x11>
+  .byte  117,195                             // jne           3036 <_sk_load_a8_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,192,69                   // pshufd        $0x45,%xmm0,%xmm0
@@ -27428,10 +28343,10 @@
   .byte  102,15,110,200                      // movd          %eax,%xmm1
   .byte  102,15,56,49,201                    // pmovzxbd      %xmm1,%xmm1
   .byte  102,15,58,14,193,15                 // pblendw       $0xf,%xmm1,%xmm0
-  .byte  235,158                             // jmp           3045 <_sk_load_a8_sse41+0x11>
+  .byte  235,158                             // jmp           3036 <_sk_load_a8_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
-  .byte  235,147                             // jmp           3045 <_sk_load_a8_sse41+0x11>
+  .byte  235,147                             // jmp           3036 <_sk_load_a8_sse41+0x11>
 
 HIDDEN _sk_load_a8_dst_sse41
 .globl _sk_load_a8_dst_sse41
@@ -27440,11 +28355,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,39                              // jne           30e3 <_sk_load_a8_dst_sse41+0x31>
+  .byte  117,39                              // jne           30d4 <_sk_load_a8_dst_sse41+0x31>
   .byte  102,65,15,56,49,36,18               // pmovzxbd      (%r10,%rdx,1),%xmm4
-  .byte  102,15,219,37,21,49,0,0             // pand          0x3115(%rip),%xmm4        # 61e0 <_sk_callback_sse41+0xb84>
+  .byte  102,15,219,37,180,51,0,0            // pand          0x33b4(%rip),%xmm4        # 6470 <_sk_callback_sse41+0xb8f>
   .byte  15,91,252                           // cvtdq2ps      %xmm4,%xmm7
-  .byte  15,89,61,27,49,0,0                  // mulps         0x311b(%rip),%xmm7        # 61f0 <_sk_callback_sse41+0xb94>
+  .byte  15,89,61,186,51,0,0                 // mulps         0x33ba(%rip),%xmm7        # 6480 <_sk_callback_sse41+0xb9f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  102,15,239,237                      // pxor          %xmm5,%xmm5
@@ -27453,12 +28368,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            3125 <_sk_load_a8_dst_sse41+0x73>
+  .byte  116,53                              // je            3116 <_sk_load_a8_dst_sse41+0x73>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            310f <_sk_load_a8_dst_sse41+0x5d>
+  .byte  116,21                              // je            3100 <_sk_load_a8_dst_sse41+0x5d>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,195                             // jne           30c3 <_sk_load_a8_dst_sse41+0x11>
+  .byte  117,195                             // jne           30b4 <_sk_load_a8_dst_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,228,69                   // pshufd        $0x45,%xmm4,%xmm4
@@ -27466,10 +28381,10 @@
   .byte  102,15,110,232                      // movd          %eax,%xmm5
   .byte  102,15,56,49,237                    // pmovzxbd      %xmm5,%xmm5
   .byte  102,15,58,14,229,15                 // pblendw       $0xf,%xmm5,%xmm4
-  .byte  235,158                             // jmp           30c3 <_sk_load_a8_dst_sse41+0x11>
+  .byte  235,158                             // jmp           30b4 <_sk_load_a8_dst_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
-  .byte  235,147                             // jmp           30c3 <_sk_load_a8_dst_sse41+0x11>
+  .byte  235,147                             // jmp           30b4 <_sk_load_a8_dst_sse41+0x11>
 
 HIDDEN _sk_gather_a8_sse41
 .globl _sk_gather_a8_sse41
@@ -27498,7 +28413,7 @@
   .byte  102,15,58,32,192,3                  // pinsrb        $0x3,%eax,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,96,48,0,0                  // mulps         0x3060(%rip),%xmm3        # 6200 <_sk_callback_sse41+0xba4>
+  .byte  15,89,29,255,50,0,0                 // mulps         0x32ff(%rip),%xmm3        # 6490 <_sk_callback_sse41+0xbaf>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
@@ -27512,13 +28427,13 @@
 _sk_store_a8_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  68,15,40,5,83,48,0,0                // movaps        0x3053(%rip),%xmm8        # 6210 <_sk_callback_sse41+0xbb4>
+  .byte  68,15,40,5,242,50,0,0               // movaps        0x32f2(%rip),%xmm8        # 64a0 <_sk_callback_sse41+0xbbf>
   .byte  68,15,89,195                        // mulps         %xmm3,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
   .byte  102,69,15,56,43,192                 // packusdw      %xmm8,%xmm8
   .byte  102,69,15,103,192                   // packuswb      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,13                              // jne           31e3 <_sk_store_a8_sse41+0x33>
+  .byte  117,13                              // jne           31d4 <_sk_store_a8_sse41+0x33>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  65,137,4,18                         // mov           %eax,(%r10,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -27527,17 +28442,17 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,41                              // je            321f <_sk_store_a8_sse41+0x6f>
+  .byte  116,41                              // je            3210 <_sk_store_a8_sse41+0x6f>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,15                              // je            320b <_sk_store_a8_sse41+0x5b>
+  .byte  116,15                              // je            31fc <_sk_store_a8_sse41+0x5b>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,221                             // jne           31df <_sk_store_a8_sse41+0x2f>
+  .byte  117,221                             // jne           31d0 <_sk_store_a8_sse41+0x2f>
   .byte  102,69,15,58,20,68,18,2,8           // pextrb        $0x8,%xmm8,0x2(%r10,%rdx,1)
-  .byte  102,68,15,56,0,5,11,48,0,0          // pshufb        0x300b(%rip),%xmm8        # 6220 <_sk_callback_sse41+0xbc4>
+  .byte  102,68,15,56,0,5,170,50,0,0         // pshufb        0x32aa(%rip),%xmm8        # 64b0 <_sk_callback_sse41+0xbcf>
   .byte  102,69,15,58,21,4,18,0              // pextrw        $0x0,%xmm8,(%r10,%rdx,1)
-  .byte  235,192                             // jmp           31df <_sk_store_a8_sse41+0x2f>
+  .byte  235,192                             // jmp           31d0 <_sk_store_a8_sse41+0x2f>
   .byte  102,69,15,58,20,4,18,0              // pextrb        $0x0,%xmm8,(%r10,%rdx,1)
-  .byte  235,182                             // jmp           31df <_sk_store_a8_sse41+0x2f>
+  .byte  235,182                             // jmp           31d0 <_sk_store_a8_sse41+0x2f>
 
 HIDDEN _sk_load_g8_sse41
 .globl _sk_load_g8_sse41
@@ -27546,25 +28461,25 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,42                              // jne           325d <_sk_load_g8_sse41+0x34>
+  .byte  117,42                              // jne           324e <_sk_load_g8_sse41+0x34>
   .byte  102,65,15,56,49,4,18                // pmovzxbd      (%r10,%rdx,1),%xmm0
-  .byte  102,15,219,5,238,47,0,0             // pand          0x2fee(%rip),%xmm0        # 6230 <_sk_callback_sse41+0xbd4>
+  .byte  102,15,219,5,141,50,0,0             // pand          0x328d(%rip),%xmm0        # 64c0 <_sk_callback_sse41+0xbdf>
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,244,47,0,0                  // mulps         0x2ff4(%rip),%xmm0        # 6240 <_sk_callback_sse41+0xbe4>
+  .byte  15,89,5,147,50,0,0                  // mulps         0x3293(%rip),%xmm0        # 64d0 <_sk_callback_sse41+0xbef>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,251,47,0,0                 // movaps        0x2ffb(%rip),%xmm3        # 6250 <_sk_callback_sse41+0xbf4>
+  .byte  15,40,29,154,50,0,0                 // movaps        0x329a(%rip),%xmm3        # 64e0 <_sk_callback_sse41+0xbff>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            329f <_sk_load_g8_sse41+0x76>
+  .byte  116,53                              // je            3290 <_sk_load_g8_sse41+0x76>
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3289 <_sk_load_g8_sse41+0x60>
+  .byte  116,21                              // je            327a <_sk_load_g8_sse41+0x60>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,192                             // jne           323a <_sk_load_g8_sse41+0x11>
+  .byte  117,192                             // jne           322b <_sk_load_g8_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,192,69                   // pshufd        $0x45,%xmm0,%xmm0
@@ -27572,10 +28487,10 @@
   .byte  102,15,110,200                      // movd          %eax,%xmm1
   .byte  102,15,56,49,201                    // pmovzxbd      %xmm1,%xmm1
   .byte  102,15,58,14,193,15                 // pblendw       $0xf,%xmm1,%xmm0
-  .byte  235,155                             // jmp           323a <_sk_load_g8_sse41+0x11>
+  .byte  235,155                             // jmp           322b <_sk_load_g8_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
-  .byte  235,144                             // jmp           323a <_sk_load_g8_sse41+0x11>
+  .byte  235,144                             // jmp           322b <_sk_load_g8_sse41+0x11>
 
 HIDDEN _sk_load_g8_dst_sse41
 .globl _sk_load_g8_dst_sse41
@@ -27584,25 +28499,25 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,42                              // jne           32de <_sk_load_g8_dst_sse41+0x34>
+  .byte  117,42                              // jne           32cf <_sk_load_g8_dst_sse41+0x34>
   .byte  102,65,15,56,49,36,18               // pmovzxbd      (%r10,%rdx,1),%xmm4
-  .byte  102,15,219,37,157,47,0,0            // pand          0x2f9d(%rip),%xmm4        # 6260 <_sk_callback_sse41+0xc04>
+  .byte  102,15,219,37,60,50,0,0             // pand          0x323c(%rip),%xmm4        # 64f0 <_sk_callback_sse41+0xc0f>
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,163,47,0,0                 // mulps         0x2fa3(%rip),%xmm4        # 6270 <_sk_callback_sse41+0xc14>
+  .byte  15,89,37,66,50,0,0                  // mulps         0x3242(%rip),%xmm4        # 6500 <_sk_callback_sse41+0xc1f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,61,170,47,0,0                 // movaps        0x2faa(%rip),%xmm7        # 6280 <_sk_callback_sse41+0xc24>
+  .byte  15,40,61,73,50,0,0                  // movaps        0x3249(%rip),%xmm7        # 6510 <_sk_callback_sse41+0xc2f>
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
   .byte  15,40,244                           // movaps        %xmm4,%xmm6
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            3320 <_sk_load_g8_dst_sse41+0x76>
+  .byte  116,53                              // je            3311 <_sk_load_g8_dst_sse41+0x76>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            330a <_sk_load_g8_dst_sse41+0x60>
+  .byte  116,21                              // je            32fb <_sk_load_g8_dst_sse41+0x60>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,192                             // jne           32bb <_sk_load_g8_dst_sse41+0x11>
+  .byte  117,192                             // jne           32ac <_sk_load_g8_dst_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,228,69                   // pshufd        $0x45,%xmm4,%xmm4
@@ -27610,10 +28525,10 @@
   .byte  102,15,110,232                      // movd          %eax,%xmm5
   .byte  102,15,56,49,237                    // pmovzxbd      %xmm5,%xmm5
   .byte  102,15,58,14,229,15                 // pblendw       $0xf,%xmm5,%xmm4
-  .byte  235,155                             // jmp           32bb <_sk_load_g8_dst_sse41+0x11>
+  .byte  235,155                             // jmp           32ac <_sk_load_g8_dst_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
-  .byte  235,144                             // jmp           32bb <_sk_load_g8_dst_sse41+0x11>
+  .byte  235,144                             // jmp           32ac <_sk_load_g8_dst_sse41+0x11>
 
 HIDDEN _sk_gather_g8_sse41
 .globl _sk_gather_g8_sse41
@@ -27642,9 +28557,9 @@
   .byte  102,15,58,32,192,3                  // pinsrb        $0x3,%eax,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,245,46,0,0                  // mulps         0x2ef5(%rip),%xmm0        # 6290 <_sk_callback_sse41+0xc34>
+  .byte  15,89,5,148,49,0,0                  // mulps         0x3194(%rip),%xmm0        # 6520 <_sk_callback_sse41+0xc3f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,252,46,0,0                 // movaps        0x2efc(%rip),%xmm3        # 62a0 <_sk_callback_sse41+0xc44>
+  .byte  15,40,29,155,49,0,0                 // movaps        0x319b(%rip),%xmm3        # 6530 <_sk_callback_sse41+0xc4f>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  91                                  // pop           %rbx
@@ -27657,9 +28572,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,193                          // mov           %rax,%r9
   .byte  77,133,201                          // test          %r9,%r9
-  .byte  116,5                               // je            33bc <_sk_gather_i8_sse41+0xf>
+  .byte  116,5                               // je            33ad <_sk_gather_i8_sse41+0xf>
   .byte  76,137,200                          // mov           %r9,%rax
-  .byte  235,2                               // jmp           33be <_sk_gather_i8_sse41+0x11>
+  .byte  235,2                               // jmp           33af <_sk_gather_i8_sse41+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
@@ -27692,17 +28607,17 @@
   .byte  102,15,58,34,28,24,1                // pinsrd        $0x1,(%rax,%rbx,1),%xmm3
   .byte  102,66,15,58,34,28,152,2            // pinsrd        $0x2,(%rax,%r11,4),%xmm3
   .byte  102,66,15,58,34,28,16,3             // pinsrd        $0x3,(%rax,%r10,1),%xmm3
-  .byte  102,15,111,5,79,46,0,0              // movdqa        0x2e4f(%rip),%xmm0        # 62b0 <_sk_callback_sse41+0xc54>
+  .byte  102,15,111,5,238,48,0,0             // movdqa        0x30ee(%rip),%xmm0        # 6540 <_sk_callback_sse41+0xc5f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,80,46,0,0                // movaps        0x2e50(%rip),%xmm8        # 62c0 <_sk_callback_sse41+0xc64>
+  .byte  68,15,40,5,239,48,0,0               // movaps        0x30ef(%rip),%xmm8        # 6550 <_sk_callback_sse41+0xc6f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
-  .byte  102,15,56,0,13,79,46,0,0            // pshufb        0x2e4f(%rip),%xmm1        # 62d0 <_sk_callback_sse41+0xc74>
+  .byte  102,15,56,0,13,238,48,0,0           // pshufb        0x30ee(%rip),%xmm1        # 6560 <_sk_callback_sse41+0xc7f>
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,111,211                      // movdqa        %xmm3,%xmm2
-  .byte  102,15,56,0,21,75,46,0,0            // pshufb        0x2e4b(%rip),%xmm2        # 62e0 <_sk_callback_sse41+0xc84>
+  .byte  102,15,56,0,21,234,48,0,0           // pshufb        0x30ea(%rip),%xmm2        # 6570 <_sk_callback_sse41+0xc8f>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -27720,41 +28635,41 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,80                              // jne           3509 <_sk_load_565_sse41+0x5a>
+  .byte  117,80                              // jne           34fa <_sk_load_565_sse41+0x5a>
   .byte  102,65,15,56,51,20,82               // pmovzxwd      (%r10,%rdx,2),%xmm2
-  .byte  102,15,111,5,40,46,0,0              // movdqa        0x2e28(%rip),%xmm0        # 62f0 <_sk_callback_sse41+0xc94>
+  .byte  102,15,111,5,199,48,0,0             // movdqa        0x30c7(%rip),%xmm0        # 6580 <_sk_callback_sse41+0xc9f>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,42,46,0,0                   // mulps         0x2e2a(%rip),%xmm0        # 6300 <_sk_callback_sse41+0xca4>
-  .byte  102,15,111,13,50,46,0,0             // movdqa        0x2e32(%rip),%xmm1        # 6310 <_sk_callback_sse41+0xcb4>
+  .byte  15,89,5,201,48,0,0                  // mulps         0x30c9(%rip),%xmm0        # 6590 <_sk_callback_sse41+0xcaf>
+  .byte  102,15,111,13,209,48,0,0            // movdqa        0x30d1(%rip),%xmm1        # 65a0 <_sk_callback_sse41+0xcbf>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,52,46,0,0                  // mulps         0x2e34(%rip),%xmm1        # 6320 <_sk_callback_sse41+0xcc4>
-  .byte  102,15,219,21,60,46,0,0             // pand          0x2e3c(%rip),%xmm2        # 6330 <_sk_callback_sse41+0xcd4>
+  .byte  15,89,13,211,48,0,0                 // mulps         0x30d3(%rip),%xmm1        # 65b0 <_sk_callback_sse41+0xccf>
+  .byte  102,15,219,21,219,48,0,0            // pand          0x30db(%rip),%xmm2        # 65c0 <_sk_callback_sse41+0xcdf>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,66,46,0,0                  // mulps         0x2e42(%rip),%xmm2        # 6340 <_sk_callback_sse41+0xce4>
+  .byte  15,89,21,225,48,0,0                 // mulps         0x30e1(%rip),%xmm2        # 65d0 <_sk_callback_sse41+0xcef>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,73,46,0,0                  // movaps        0x2e49(%rip),%xmm3        # 6350 <_sk_callback_sse41+0xcf4>
+  .byte  15,40,29,232,48,0,0                 // movaps        0x30e8(%rip),%xmm3        # 65e0 <_sk_callback_sse41+0xcff>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            354b <_sk_load_565_sse41+0x9c>
+  .byte  116,53                              // je            353c <_sk_load_565_sse41+0x9c>
   .byte  102,15,239,210                      // pxor          %xmm2,%xmm2
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3535 <_sk_load_565_sse41+0x86>
+  .byte  116,21                              // je            3526 <_sk_load_565_sse41+0x86>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,154                             // jne           34c0 <_sk_load_565_sse41+0x11>
+  .byte  117,154                             // jne           34b1 <_sk_load_565_sse41+0x11>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,208,69                   // pshufd        $0x45,%xmm0,%xmm2
   .byte  102,65,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
   .byte  102,15,58,14,208,15                 // pblendw       $0xf,%xmm0,%xmm2
-  .byte  233,117,255,255,255                 // jmpq          34c0 <_sk_load_565_sse41+0x11>
+  .byte  233,117,255,255,255                 // jmpq          34b1 <_sk_load_565_sse41+0x11>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,208                      // movd          %eax,%xmm2
-  .byte  233,103,255,255,255                 // jmpq          34c0 <_sk_load_565_sse41+0x11>
+  .byte  233,103,255,255,255                 // jmpq          34b1 <_sk_load_565_sse41+0x11>
 
 HIDDEN _sk_load_565_dst_sse41
 .globl _sk_load_565_dst_sse41
@@ -27763,41 +28678,41 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,80                              // jne           35b3 <_sk_load_565_dst_sse41+0x5a>
+  .byte  117,80                              // jne           35a4 <_sk_load_565_dst_sse41+0x5a>
   .byte  102,65,15,56,51,52,82               // pmovzxwd      (%r10,%rdx,2),%xmm6
-  .byte  102,15,111,37,238,45,0,0            // movdqa        0x2dee(%rip),%xmm4        # 6360 <_sk_callback_sse41+0xd04>
+  .byte  102,15,111,37,141,48,0,0            // movdqa        0x308d(%rip),%xmm4        # 65f0 <_sk_callback_sse41+0xd0f>
   .byte  102,15,219,230                      // pand          %xmm6,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,240,45,0,0                 // mulps         0x2df0(%rip),%xmm4        # 6370 <_sk_callback_sse41+0xd14>
-  .byte  102,15,111,45,248,45,0,0            // movdqa        0x2df8(%rip),%xmm5        # 6380 <_sk_callback_sse41+0xd24>
+  .byte  15,89,37,143,48,0,0                 // mulps         0x308f(%rip),%xmm4        # 6600 <_sk_callback_sse41+0xd1f>
+  .byte  102,15,111,45,151,48,0,0            // movdqa        0x3097(%rip),%xmm5        # 6610 <_sk_callback_sse41+0xd2f>
   .byte  102,15,219,238                      // pand          %xmm6,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,45,250,45,0,0                 // mulps         0x2dfa(%rip),%xmm5        # 6390 <_sk_callback_sse41+0xd34>
-  .byte  102,15,219,53,2,46,0,0              // pand          0x2e02(%rip),%xmm6        # 63a0 <_sk_callback_sse41+0xd44>
+  .byte  15,89,45,153,48,0,0                 // mulps         0x3099(%rip),%xmm5        # 6620 <_sk_callback_sse41+0xd3f>
+  .byte  102,15,219,53,161,48,0,0            // pand          0x30a1(%rip),%xmm6        # 6630 <_sk_callback_sse41+0xd4f>
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,53,8,46,0,0                   // mulps         0x2e08(%rip),%xmm6        # 63b0 <_sk_callback_sse41+0xd54>
+  .byte  15,89,53,167,48,0,0                 // mulps         0x30a7(%rip),%xmm6        # 6640 <_sk_callback_sse41+0xd5f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,61,15,46,0,0                  // movaps        0x2e0f(%rip),%xmm7        # 63c0 <_sk_callback_sse41+0xd64>
+  .byte  15,40,61,174,48,0,0                 // movaps        0x30ae(%rip),%xmm7        # 6650 <_sk_callback_sse41+0xd6f>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            35f5 <_sk_load_565_dst_sse41+0x9c>
+  .byte  116,53                              // je            35e6 <_sk_load_565_dst_sse41+0x9c>
   .byte  102,15,239,246                      // pxor          %xmm6,%xmm6
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            35df <_sk_load_565_dst_sse41+0x86>
+  .byte  116,21                              // je            35d0 <_sk_load_565_dst_sse41+0x86>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,154                             // jne           356a <_sk_load_565_dst_sse41+0x11>
+  .byte  117,154                             // jne           355b <_sk_load_565_dst_sse41+0x11>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,244,69                   // pshufd        $0x45,%xmm4,%xmm6
   .byte  102,65,15,110,36,82                 // movd          (%r10,%rdx,2),%xmm4
   .byte  102,15,56,51,228                    // pmovzxwd      %xmm4,%xmm4
   .byte  102,15,58,14,244,15                 // pblendw       $0xf,%xmm4,%xmm6
-  .byte  233,117,255,255,255                 // jmpq          356a <_sk_load_565_dst_sse41+0x11>
+  .byte  233,117,255,255,255                 // jmpq          355b <_sk_load_565_dst_sse41+0x11>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,240                      // movd          %eax,%xmm6
-  .byte  233,103,255,255,255                 // jmpq          356a <_sk_load_565_dst_sse41+0x11>
+  .byte  233,103,255,255,255                 // jmpq          355b <_sk_load_565_dst_sse41+0x11>
 
 HIDDEN _sk_gather_565_sse41
 .globl _sk_gather_565_sse41
@@ -27825,19 +28740,19 @@
   .byte  65,15,183,4,65                      // movzwl        (%r9,%rax,2),%eax
   .byte  102,15,196,192,3                    // pinsrw        $0x3,%eax,%xmm0
   .byte  102,15,56,51,208                    // pmovzxwd      %xmm0,%xmm2
-  .byte  102,15,111,5,99,45,0,0              // movdqa        0x2d63(%rip),%xmm0        # 63d0 <_sk_callback_sse41+0xd74>
+  .byte  102,15,111,5,2,48,0,0               // movdqa        0x3002(%rip),%xmm0        # 6660 <_sk_callback_sse41+0xd7f>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,101,45,0,0                  // mulps         0x2d65(%rip),%xmm0        # 63e0 <_sk_callback_sse41+0xd84>
-  .byte  102,15,111,13,109,45,0,0            // movdqa        0x2d6d(%rip),%xmm1        # 63f0 <_sk_callback_sse41+0xd94>
+  .byte  15,89,5,4,48,0,0                    // mulps         0x3004(%rip),%xmm0        # 6670 <_sk_callback_sse41+0xd8f>
+  .byte  102,15,111,13,12,48,0,0             // movdqa        0x300c(%rip),%xmm1        # 6680 <_sk_callback_sse41+0xd9f>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,111,45,0,0                 // mulps         0x2d6f(%rip),%xmm1        # 6400 <_sk_callback_sse41+0xda4>
-  .byte  102,15,219,21,119,45,0,0            // pand          0x2d77(%rip),%xmm2        # 6410 <_sk_callback_sse41+0xdb4>
+  .byte  15,89,13,14,48,0,0                  // mulps         0x300e(%rip),%xmm1        # 6690 <_sk_callback_sse41+0xdaf>
+  .byte  102,15,219,21,22,48,0,0             // pand          0x3016(%rip),%xmm2        # 66a0 <_sk_callback_sse41+0xdbf>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,125,45,0,0                 // mulps         0x2d7d(%rip),%xmm2        # 6420 <_sk_callback_sse41+0xdc4>
+  .byte  15,89,21,28,48,0,0                  // mulps         0x301c(%rip),%xmm2        # 66b0 <_sk_callback_sse41+0xdcf>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,132,45,0,0                 // movaps        0x2d84(%rip),%xmm3        # 6430 <_sk_callback_sse41+0xdd4>
+  .byte  15,40,29,35,48,0,0                  // movaps        0x3023(%rip),%xmm3        # 66c0 <_sk_callback_sse41+0xddf>
   .byte  91                                  // pop           %rbx
   .byte  255,224                             // jmpq          *%rax
 
@@ -27847,12 +28762,12 @@
 _sk_store_565_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,132,45,0,0               // movaps        0x2d84(%rip),%xmm8        # 6440 <_sk_callback_sse41+0xde4>
+  .byte  68,15,40,5,35,48,0,0                // movaps        0x3023(%rip),%xmm8        # 66d0 <_sk_callback_sse41+0xdef>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
   .byte  102,65,15,114,241,11                // pslld         $0xb,%xmm9
-  .byte  68,15,40,21,121,45,0,0              // movaps        0x2d79(%rip),%xmm10        # 6450 <_sk_callback_sse41+0xdf4>
+  .byte  68,15,40,21,24,48,0,0               // movaps        0x3018(%rip),%xmm10        # 66e0 <_sk_callback_sse41+0xdff>
   .byte  68,15,89,209                        // mulps         %xmm1,%xmm10
   .byte  102,69,15,91,210                    // cvtps2dq      %xmm10,%xmm10
   .byte  102,65,15,114,242,5                 // pslld         $0x5,%xmm10
@@ -27862,7 +28777,7 @@
   .byte  102,69,15,86,194                    // orpd          %xmm10,%xmm8
   .byte  102,69,15,56,43,192                 // packusdw      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           370e <_sk_store_565_sse41+0x5f>
+  .byte  117,10                              // jne           36ff <_sk_store_565_sse41+0x5f>
   .byte  242,68,15,17,4,80                   // movsd         %xmm8,(%rax,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -27870,17 +28785,17 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,35                              // je            3744 <_sk_store_565_sse41+0x95>
+  .byte  116,35                              // je            3735 <_sk_store_565_sse41+0x95>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,15                              // je            3736 <_sk_store_565_sse41+0x87>
+  .byte  116,15                              // je            3727 <_sk_store_565_sse41+0x87>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,221                             // jne           370a <_sk_store_565_sse41+0x5b>
+  .byte  117,221                             // jne           36fb <_sk_store_565_sse41+0x5b>
   .byte  102,68,15,58,21,68,80,4,4           // pextrw        $0x4,%xmm8,0x4(%rax,%rdx,2)
   .byte  242,69,15,112,192,232               // pshuflw       $0xe8,%xmm8,%xmm8
   .byte  102,68,15,126,4,80                  // movd          %xmm8,(%rax,%rdx,2)
-  .byte  235,198                             // jmp           370a <_sk_store_565_sse41+0x5b>
+  .byte  235,198                             // jmp           36fb <_sk_store_565_sse41+0x5b>
   .byte  102,68,15,58,21,4,80,0              // pextrw        $0x0,%xmm8,(%rax,%rdx,2)
-  .byte  235,188                             // jmp           370a <_sk_store_565_sse41+0x5b>
+  .byte  235,188                             // jmp           36fb <_sk_store_565_sse41+0x5b>
 
 HIDDEN _sk_load_4444_sse41
 .globl _sk_load_4444_sse41
@@ -27889,44 +28804,44 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,95                              // jne           37b7 <_sk_load_4444_sse41+0x69>
+  .byte  117,95                              // jne           37a8 <_sk_load_4444_sse41+0x69>
   .byte  102,65,15,56,51,28,82               // pmovzxwd      (%r10,%rdx,2),%xmm3
-  .byte  102,15,111,5,249,44,0,0             // movdqa        0x2cf9(%rip),%xmm0        # 6460 <_sk_callback_sse41+0xe04>
+  .byte  102,15,111,5,152,47,0,0             // movdqa        0x2f98(%rip),%xmm0        # 66f0 <_sk_callback_sse41+0xe0f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,251,44,0,0                  // mulps         0x2cfb(%rip),%xmm0        # 6470 <_sk_callback_sse41+0xe14>
-  .byte  102,15,111,13,3,45,0,0              // movdqa        0x2d03(%rip),%xmm1        # 6480 <_sk_callback_sse41+0xe24>
+  .byte  15,89,5,154,47,0,0                  // mulps         0x2f9a(%rip),%xmm0        # 6700 <_sk_callback_sse41+0xe1f>
+  .byte  102,15,111,13,162,47,0,0            // movdqa        0x2fa2(%rip),%xmm1        # 6710 <_sk_callback_sse41+0xe2f>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,5,45,0,0                   // mulps         0x2d05(%rip),%xmm1        # 6490 <_sk_callback_sse41+0xe34>
-  .byte  102,15,111,21,13,45,0,0             // movdqa        0x2d0d(%rip),%xmm2        # 64a0 <_sk_callback_sse41+0xe44>
+  .byte  15,89,13,164,47,0,0                 // mulps         0x2fa4(%rip),%xmm1        # 6720 <_sk_callback_sse41+0xe3f>
+  .byte  102,15,111,21,172,47,0,0            // movdqa        0x2fac(%rip),%xmm2        # 6730 <_sk_callback_sse41+0xe4f>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,15,45,0,0                  // mulps         0x2d0f(%rip),%xmm2        # 64b0 <_sk_callback_sse41+0xe54>
-  .byte  102,15,219,29,23,45,0,0             // pand          0x2d17(%rip),%xmm3        # 64c0 <_sk_callback_sse41+0xe64>
+  .byte  15,89,21,174,47,0,0                 // mulps         0x2fae(%rip),%xmm2        # 6740 <_sk_callback_sse41+0xe5f>
+  .byte  102,15,219,29,182,47,0,0            // pand          0x2fb6(%rip),%xmm3        # 6750 <_sk_callback_sse41+0xe6f>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,29,45,0,0                  // mulps         0x2d1d(%rip),%xmm3        # 64d0 <_sk_callback_sse41+0xe74>
+  .byte  15,89,29,188,47,0,0                 // mulps         0x2fbc(%rip),%xmm3        # 6760 <_sk_callback_sse41+0xe7f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            37f9 <_sk_load_4444_sse41+0xab>
+  .byte  116,53                              // je            37ea <_sk_load_4444_sse41+0xab>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            37e3 <_sk_load_4444_sse41+0x95>
+  .byte  116,21                              // je            37d4 <_sk_load_4444_sse41+0x95>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,139                             // jne           375f <_sk_load_4444_sse41+0x11>
+  .byte  117,139                             // jne           3750 <_sk_load_4444_sse41+0x11>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  102,65,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
   .byte  102,15,58,14,216,15                 // pblendw       $0xf,%xmm0,%xmm3
-  .byte  233,102,255,255,255                 // jmpq          375f <_sk_load_4444_sse41+0x11>
+  .byte  233,102,255,255,255                 // jmpq          3750 <_sk_load_4444_sse41+0x11>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,216                      // movd          %eax,%xmm3
-  .byte  233,88,255,255,255                  // jmpq          375f <_sk_load_4444_sse41+0x11>
+  .byte  233,88,255,255,255                  // jmpq          3750 <_sk_load_4444_sse41+0x11>
 
 HIDDEN _sk_load_4444_dst_sse41
 .globl _sk_load_4444_dst_sse41
@@ -27935,44 +28850,44 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,95                              // jne           3870 <_sk_load_4444_dst_sse41+0x69>
+  .byte  117,95                              // jne           3861 <_sk_load_4444_dst_sse41+0x69>
   .byte  102,65,15,56,51,60,82               // pmovzxwd      (%r10,%rdx,2),%xmm7
-  .byte  102,15,111,37,192,44,0,0            // movdqa        0x2cc0(%rip),%xmm4        # 64e0 <_sk_callback_sse41+0xe84>
+  .byte  102,15,111,37,95,47,0,0             // movdqa        0x2f5f(%rip),%xmm4        # 6770 <_sk_callback_sse41+0xe8f>
   .byte  102,15,219,231                      // pand          %xmm7,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,194,44,0,0                 // mulps         0x2cc2(%rip),%xmm4        # 64f0 <_sk_callback_sse41+0xe94>
-  .byte  102,15,111,45,202,44,0,0            // movdqa        0x2cca(%rip),%xmm5        # 6500 <_sk_callback_sse41+0xea4>
+  .byte  15,89,37,97,47,0,0                  // mulps         0x2f61(%rip),%xmm4        # 6780 <_sk_callback_sse41+0xe9f>
+  .byte  102,15,111,45,105,47,0,0            // movdqa        0x2f69(%rip),%xmm5        # 6790 <_sk_callback_sse41+0xeaf>
   .byte  102,15,219,239                      // pand          %xmm7,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,45,204,44,0,0                 // mulps         0x2ccc(%rip),%xmm5        # 6510 <_sk_callback_sse41+0xeb4>
-  .byte  102,15,111,53,212,44,0,0            // movdqa        0x2cd4(%rip),%xmm6        # 6520 <_sk_callback_sse41+0xec4>
+  .byte  15,89,45,107,47,0,0                 // mulps         0x2f6b(%rip),%xmm5        # 67a0 <_sk_callback_sse41+0xebf>
+  .byte  102,15,111,53,115,47,0,0            // movdqa        0x2f73(%rip),%xmm6        # 67b0 <_sk_callback_sse41+0xecf>
   .byte  102,15,219,247                      // pand          %xmm7,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,53,214,44,0,0                 // mulps         0x2cd6(%rip),%xmm6        # 6530 <_sk_callback_sse41+0xed4>
-  .byte  102,15,219,61,222,44,0,0            // pand          0x2cde(%rip),%xmm7        # 6540 <_sk_callback_sse41+0xee4>
+  .byte  15,89,53,117,47,0,0                 // mulps         0x2f75(%rip),%xmm6        # 67c0 <_sk_callback_sse41+0xedf>
+  .byte  102,15,219,61,125,47,0,0            // pand          0x2f7d(%rip),%xmm7        # 67d0 <_sk_callback_sse41+0xeef>
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
-  .byte  15,89,61,228,44,0,0                 // mulps         0x2ce4(%rip),%xmm7        # 6550 <_sk_callback_sse41+0xef4>
+  .byte  15,89,61,131,47,0,0                 // mulps         0x2f83(%rip),%xmm7        # 67e0 <_sk_callback_sse41+0xeff>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            38b2 <_sk_load_4444_dst_sse41+0xab>
+  .byte  116,53                              // je            38a3 <_sk_load_4444_dst_sse41+0xab>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            389c <_sk_load_4444_dst_sse41+0x95>
+  .byte  116,21                              // je            388d <_sk_load_4444_dst_sse41+0x95>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,139                             // jne           3818 <_sk_load_4444_dst_sse41+0x11>
+  .byte  117,139                             // jne           3809 <_sk_load_4444_dst_sse41+0x11>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  102,65,15,110,36,82                 // movd          (%r10,%rdx,2),%xmm4
   .byte  102,15,56,51,228                    // pmovzxwd      %xmm4,%xmm4
   .byte  102,15,58,14,252,15                 // pblendw       $0xf,%xmm4,%xmm7
-  .byte  233,102,255,255,255                 // jmpq          3818 <_sk_load_4444_dst_sse41+0x11>
+  .byte  233,102,255,255,255                 // jmpq          3809 <_sk_load_4444_dst_sse41+0x11>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,248                      // movd          %eax,%xmm7
-  .byte  233,88,255,255,255                  // jmpq          3818 <_sk_load_4444_dst_sse41+0x11>
+  .byte  233,88,255,255,255                  // jmpq          3809 <_sk_load_4444_dst_sse41+0x11>
 
 HIDDEN _sk_gather_4444_sse41
 .globl _sk_gather_4444_sse41
@@ -28000,21 +28915,21 @@
   .byte  65,15,183,4,65                      // movzwl        (%r9,%rax,2),%eax
   .byte  102,15,196,192,3                    // pinsrw        $0x3,%eax,%xmm0
   .byte  102,15,56,51,216                    // pmovzxwd      %xmm0,%xmm3
-  .byte  102,15,111,5,54,44,0,0              // movdqa        0x2c36(%rip),%xmm0        # 6560 <_sk_callback_sse41+0xf04>
+  .byte  102,15,111,5,213,46,0,0             // movdqa        0x2ed5(%rip),%xmm0        # 67f0 <_sk_callback_sse41+0xf0f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,56,44,0,0                   // mulps         0x2c38(%rip),%xmm0        # 6570 <_sk_callback_sse41+0xf14>
-  .byte  102,15,111,13,64,44,0,0             // movdqa        0x2c40(%rip),%xmm1        # 6580 <_sk_callback_sse41+0xf24>
+  .byte  15,89,5,215,46,0,0                  // mulps         0x2ed7(%rip),%xmm0        # 6800 <_sk_callback_sse41+0xf1f>
+  .byte  102,15,111,13,223,46,0,0            // movdqa        0x2edf(%rip),%xmm1        # 6810 <_sk_callback_sse41+0xf2f>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,66,44,0,0                  // mulps         0x2c42(%rip),%xmm1        # 6590 <_sk_callback_sse41+0xf34>
-  .byte  102,15,111,21,74,44,0,0             // movdqa        0x2c4a(%rip),%xmm2        # 65a0 <_sk_callback_sse41+0xf44>
+  .byte  15,89,13,225,46,0,0                 // mulps         0x2ee1(%rip),%xmm1        # 6820 <_sk_callback_sse41+0xf3f>
+  .byte  102,15,111,21,233,46,0,0            // movdqa        0x2ee9(%rip),%xmm2        # 6830 <_sk_callback_sse41+0xf4f>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,76,44,0,0                  // mulps         0x2c4c(%rip),%xmm2        # 65b0 <_sk_callback_sse41+0xf54>
-  .byte  102,15,219,29,84,44,0,0             // pand          0x2c54(%rip),%xmm3        # 65c0 <_sk_callback_sse41+0xf64>
+  .byte  15,89,21,235,46,0,0                 // mulps         0x2eeb(%rip),%xmm2        # 6840 <_sk_callback_sse41+0xf5f>
+  .byte  102,15,219,29,243,46,0,0            // pand          0x2ef3(%rip),%xmm3        # 6850 <_sk_callback_sse41+0xf6f>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,90,44,0,0                  // mulps         0x2c5a(%rip),%xmm3        # 65d0 <_sk_callback_sse41+0xf74>
+  .byte  15,89,29,249,46,0,0                 // mulps         0x2ef9(%rip),%xmm3        # 6860 <_sk_callback_sse41+0xf7f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  255,224                             // jmpq          *%rax
@@ -28025,7 +28940,7 @@
 _sk_store_4444_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,88,44,0,0                // movaps        0x2c58(%rip),%xmm8        # 65e0 <_sk_callback_sse41+0xf84>
+  .byte  68,15,40,5,247,46,0,0               // movaps        0x2ef7(%rip),%xmm8        # 6870 <_sk_callback_sse41+0xf8f>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -28045,7 +28960,7 @@
   .byte  102,69,15,86,194                    // orpd          %xmm10,%xmm8
   .byte  102,69,15,56,43,192                 // packusdw      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           39ee <_sk_store_4444_sse41+0x73>
+  .byte  117,10                              // jne           39df <_sk_store_4444_sse41+0x73>
   .byte  242,68,15,17,4,80                   // movsd         %xmm8,(%rax,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -28053,17 +28968,17 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,35                              // je            3a24 <_sk_store_4444_sse41+0xa9>
+  .byte  116,35                              // je            3a15 <_sk_store_4444_sse41+0xa9>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,15                              // je            3a16 <_sk_store_4444_sse41+0x9b>
+  .byte  116,15                              // je            3a07 <_sk_store_4444_sse41+0x9b>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,221                             // jne           39ea <_sk_store_4444_sse41+0x6f>
+  .byte  117,221                             // jne           39db <_sk_store_4444_sse41+0x6f>
   .byte  102,68,15,58,21,68,80,4,4           // pextrw        $0x4,%xmm8,0x4(%rax,%rdx,2)
   .byte  242,69,15,112,192,232               // pshuflw       $0xe8,%xmm8,%xmm8
   .byte  102,68,15,126,4,80                  // movd          %xmm8,(%rax,%rdx,2)
-  .byte  235,198                             // jmp           39ea <_sk_store_4444_sse41+0x6f>
+  .byte  235,198                             // jmp           39db <_sk_store_4444_sse41+0x6f>
   .byte  102,68,15,58,21,4,80,0              // pextrw        $0x0,%xmm8,(%rax,%rdx,2)
-  .byte  235,188                             // jmp           39ea <_sk_store_4444_sse41+0x6f>
+  .byte  235,188                             // jmp           39db <_sk_store_4444_sse41+0x6f>
 
 HIDDEN _sk_load_8888_sse41
 .globl _sk_load_8888_sse41
@@ -28072,19 +28987,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3a90 <_sk_load_8888_sse41+0x62>
+  .byte  117,88                              // jne           3a81 <_sk_load_8888_sse41+0x62>
   .byte  243,15,111,28,144                   // movdqu        (%rax,%rdx,4),%xmm3
-  .byte  102,15,111,5,171,43,0,0             // movdqa        0x2bab(%rip),%xmm0        # 65f0 <_sk_callback_sse41+0xf94>
+  .byte  102,15,111,5,74,46,0,0              // movdqa        0x2e4a(%rip),%xmm0        # 6880 <_sk_callback_sse41+0xf9f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,172,43,0,0               // movaps        0x2bac(%rip),%xmm8        # 6600 <_sk_callback_sse41+0xfa4>
+  .byte  68,15,40,5,75,46,0,0                // movaps        0x2e4b(%rip),%xmm8        # 6890 <_sk_callback_sse41+0xfaf>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
-  .byte  102,15,56,0,13,171,43,0,0           // pshufb        0x2bab(%rip),%xmm1        # 6610 <_sk_callback_sse41+0xfb4>
+  .byte  102,15,56,0,13,74,46,0,0            // pshufb        0x2e4a(%rip),%xmm1        # 68a0 <_sk_callback_sse41+0xfbf>
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,111,211                      // movdqa        %xmm3,%xmm2
-  .byte  102,15,56,0,21,167,43,0,0           // pshufb        0x2ba7(%rip),%xmm2        # 6620 <_sk_callback_sse41+0xfc4>
+  .byte  102,15,56,0,21,70,46,0,0            // pshufb        0x2e46(%rip),%xmm2        # 68b0 <_sk_callback_sse41+0xfcf>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -28095,19 +29010,19 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,43                              // je            3ac8 <_sk_load_8888_sse41+0x9a>
+  .byte  116,43                              // je            3ab9 <_sk_load_8888_sse41+0x9a>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,17                              // je            3ab8 <_sk_load_8888_sse41+0x8a>
+  .byte  116,17                              // je            3aa9 <_sk_load_8888_sse41+0x8a>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,144                             // jne           3a3d <_sk_load_8888_sse41+0xf>
+  .byte  117,144                             // jne           3a2e <_sk_load_8888_sse41+0xf>
   .byte  102,15,110,68,144,8                 // movd          0x8(%rax,%rdx,4),%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  243,15,126,4,144                    // movq          (%rax,%rdx,4),%xmm0
   .byte  102,15,58,14,216,15                 // pblendw       $0xf,%xmm0,%xmm3
-  .byte  233,117,255,255,255                 // jmpq          3a3d <_sk_load_8888_sse41+0xf>
+  .byte  233,117,255,255,255                 // jmpq          3a2e <_sk_load_8888_sse41+0xf>
   .byte  102,15,110,28,144                   // movd          (%rax,%rdx,4),%xmm3
-  .byte  233,107,255,255,255                 // jmpq          3a3d <_sk_load_8888_sse41+0xf>
+  .byte  233,107,255,255,255                 // jmpq          3a2e <_sk_load_8888_sse41+0xf>
 
 HIDDEN _sk_load_8888_dst_sse41
 .globl _sk_load_8888_dst_sse41
@@ -28116,19 +29031,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3b34 <_sk_load_8888_dst_sse41+0x62>
+  .byte  117,88                              // jne           3b25 <_sk_load_8888_dst_sse41+0x62>
   .byte  243,15,111,60,144                   // movdqu        (%rax,%rdx,4),%xmm7
-  .byte  102,15,111,37,71,43,0,0             // movdqa        0x2b47(%rip),%xmm4        # 6630 <_sk_callback_sse41+0xfd4>
+  .byte  102,15,111,37,230,45,0,0            // movdqa        0x2de6(%rip),%xmm4        # 68c0 <_sk_callback_sse41+0xfdf>
   .byte  102,15,219,231                      // pand          %xmm7,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  68,15,40,5,72,43,0,0                // movaps        0x2b48(%rip),%xmm8        # 6640 <_sk_callback_sse41+0xfe4>
+  .byte  68,15,40,5,231,45,0,0               // movaps        0x2de7(%rip),%xmm8        # 68d0 <_sk_callback_sse41+0xfef>
   .byte  65,15,89,224                        // mulps         %xmm8,%xmm4
   .byte  102,15,111,239                      // movdqa        %xmm7,%xmm5
-  .byte  102,15,56,0,45,71,43,0,0            // pshufb        0x2b47(%rip),%xmm5        # 6650 <_sk_callback_sse41+0xff4>
+  .byte  102,15,56,0,45,230,45,0,0           // pshufb        0x2de6(%rip),%xmm5        # 68e0 <_sk_callback_sse41+0xfff>
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
   .byte  65,15,89,232                        // mulps         %xmm8,%xmm5
   .byte  102,15,111,247                      // movdqa        %xmm7,%xmm6
-  .byte  102,15,56,0,53,67,43,0,0            // pshufb        0x2b43(%rip),%xmm6        # 6660 <_sk_callback_sse41+0x1004>
+  .byte  102,15,56,0,53,226,45,0,0           // pshufb        0x2de2(%rip),%xmm6        # 68f0 <_sk_callback_sse41+0x100f>
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  65,15,89,240                        // mulps         %xmm8,%xmm6
   .byte  102,15,114,215,24                   // psrld         $0x18,%xmm7
@@ -28139,19 +29054,19 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,43                              // je            3b6c <_sk_load_8888_dst_sse41+0x9a>
+  .byte  116,43                              // je            3b5d <_sk_load_8888_dst_sse41+0x9a>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,17                              // je            3b5c <_sk_load_8888_dst_sse41+0x8a>
+  .byte  116,17                              // je            3b4d <_sk_load_8888_dst_sse41+0x8a>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,144                             // jne           3ae1 <_sk_load_8888_dst_sse41+0xf>
+  .byte  117,144                             // jne           3ad2 <_sk_load_8888_dst_sse41+0xf>
   .byte  102,15,110,100,144,8                // movd          0x8(%rax,%rdx,4),%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  243,15,126,36,144                   // movq          (%rax,%rdx,4),%xmm4
   .byte  102,15,58,14,252,15                 // pblendw       $0xf,%xmm4,%xmm7
-  .byte  233,117,255,255,255                 // jmpq          3ae1 <_sk_load_8888_dst_sse41+0xf>
+  .byte  233,117,255,255,255                 // jmpq          3ad2 <_sk_load_8888_dst_sse41+0xf>
   .byte  102,15,110,60,144                   // movd          (%rax,%rdx,4),%xmm7
-  .byte  233,107,255,255,255                 // jmpq          3ae1 <_sk_load_8888_dst_sse41+0xf>
+  .byte  233,107,255,255,255                 // jmpq          3ad2 <_sk_load_8888_dst_sse41+0xf>
 
 HIDDEN _sk_gather_8888_sse41
 .globl _sk_gather_8888_sse41
@@ -28176,17 +29091,17 @@
   .byte  102,65,15,58,34,28,129,1            // pinsrd        $0x1,(%r9,%rax,4),%xmm3
   .byte  102,65,15,58,34,28,153,2            // pinsrd        $0x2,(%r9,%rbx,4),%xmm3
   .byte  102,67,15,58,34,28,153,3            // pinsrd        $0x3,(%r9,%r11,4),%xmm3
-  .byte  102,15,111,5,153,42,0,0             // movdqa        0x2a99(%rip),%xmm0        # 6670 <_sk_callback_sse41+0x1014>
+  .byte  102,15,111,5,56,45,0,0              // movdqa        0x2d38(%rip),%xmm0        # 6900 <_sk_callback_sse41+0x101f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,154,42,0,0               // movaps        0x2a9a(%rip),%xmm8        # 6680 <_sk_callback_sse41+0x1024>
+  .byte  68,15,40,5,57,45,0,0                // movaps        0x2d39(%rip),%xmm8        # 6910 <_sk_callback_sse41+0x102f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
-  .byte  102,15,56,0,13,153,42,0,0           // pshufb        0x2a99(%rip),%xmm1        # 6690 <_sk_callback_sse41+0x1034>
+  .byte  102,15,56,0,13,56,45,0,0            // pshufb        0x2d38(%rip),%xmm1        # 6920 <_sk_callback_sse41+0x103f>
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,111,211                      // movdqa        %xmm3,%xmm2
-  .byte  102,15,56,0,21,149,42,0,0           // pshufb        0x2a95(%rip),%xmm2        # 66a0 <_sk_callback_sse41+0x1044>
+  .byte  102,15,56,0,21,52,45,0,0            // pshufb        0x2d34(%rip),%xmm2        # 6930 <_sk_callback_sse41+0x104f>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -28202,7 +29117,7 @@
 _sk_store_8888_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,128,42,0,0               // movaps        0x2a80(%rip),%xmm8        # 66b0 <_sk_callback_sse41+0x1054>
+  .byte  68,15,40,5,31,45,0,0                // movaps        0x2d1f(%rip),%xmm8        # 6940 <_sk_callback_sse41+0x105f>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -28221,23 +29136,197 @@
   .byte  102,69,15,235,193                   // por           %xmm9,%xmm8
   .byte  102,69,15,235,194                   // por           %xmm10,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           3c90 <_sk_store_8888_sse41+0x6d>
+  .byte  117,10                              // jne           3c81 <_sk_store_8888_sse41+0x6d>
   .byte  243,68,15,127,4,144                 // movdqu        %xmm8,(%rax,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,29                              // je            3cba <_sk_store_8888_sse41+0x97>
+  .byte  116,29                              // je            3cab <_sk_store_8888_sse41+0x97>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,15                              // je            3cb2 <_sk_store_8888_sse41+0x8f>
+  .byte  116,15                              // je            3ca3 <_sk_store_8888_sse41+0x8f>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,227                             // jne           3c8c <_sk_store_8888_sse41+0x69>
+  .byte  117,227                             // jne           3c7d <_sk_store_8888_sse41+0x69>
   .byte  102,68,15,58,22,68,144,8,2          // pextrd        $0x2,%xmm8,0x8(%rax,%rdx,4)
   .byte  102,68,15,214,4,144                 // movq          %xmm8,(%rax,%rdx,4)
-  .byte  235,210                             // jmp           3c8c <_sk_store_8888_sse41+0x69>
+  .byte  235,210                             // jmp           3c7d <_sk_store_8888_sse41+0x69>
   .byte  102,68,15,126,4,144                 // movd          %xmm8,(%rax,%rdx,4)
-  .byte  235,202                             // jmp           3c8c <_sk_store_8888_sse41+0x69>
+  .byte  235,202                             // jmp           3c7d <_sk_store_8888_sse41+0x69>
+
+HIDDEN _sk_load_bgra_sse41
+.globl _sk_load_bgra_sse41
+FUNCTION(_sk_load_bgra_sse41)
+_sk_load_bgra_sse41:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  72,139,0                            // mov           (%rax),%rax
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,88                              // jne           3d15 <_sk_load_bgra_sse41+0x62>
+  .byte  243,15,111,28,144                   // movdqu        (%rax,%rdx,4),%xmm3
+  .byte  102,15,111,5,134,44,0,0             // movdqa        0x2c86(%rip),%xmm0        # 6950 <_sk_callback_sse41+0x106f>
+  .byte  102,15,219,195                      // pand          %xmm3,%xmm0
+  .byte  15,91,208                           // cvtdq2ps      %xmm0,%xmm2
+  .byte  68,15,40,5,135,44,0,0               // movaps        0x2c87(%rip),%xmm8        # 6960 <_sk_callback_sse41+0x107f>
+  .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
+  .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
+  .byte  102,15,56,0,5,134,44,0,0            // pshufb        0x2c86(%rip),%xmm0        # 6970 <_sk_callback_sse41+0x108f>
+  .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
+  .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
+  .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
+  .byte  102,15,56,0,5,130,44,0,0            // pshufb        0x2c82(%rip),%xmm0        # 6980 <_sk_callback_sse41+0x109f>
+  .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
+  .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
+  .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
+  .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
+  .byte  65,15,89,216                        // mulps         %xmm8,%xmm3
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,3                        // and           $0x3,%r9b
+  .byte  65,128,249,1                        // cmp           $0x1,%r9b
+  .byte  116,43                              // je            3d4d <_sk_load_bgra_sse41+0x9a>
+  .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
+  .byte  65,128,249,2                        // cmp           $0x2,%r9b
+  .byte  116,17                              // je            3d3d <_sk_load_bgra_sse41+0x8a>
+  .byte  65,128,249,3                        // cmp           $0x3,%r9b
+  .byte  117,144                             // jne           3cc2 <_sk_load_bgra_sse41+0xf>
+  .byte  102,15,110,68,144,8                 // movd          0x8(%rax,%rdx,4),%xmm0
+  .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
+  .byte  243,15,126,4,144                    // movq          (%rax,%rdx,4),%xmm0
+  .byte  102,15,58,14,216,15                 // pblendw       $0xf,%xmm0,%xmm3
+  .byte  233,117,255,255,255                 // jmpq          3cc2 <_sk_load_bgra_sse41+0xf>
+  .byte  102,15,110,28,144                   // movd          (%rax,%rdx,4),%xmm3
+  .byte  233,107,255,255,255                 // jmpq          3cc2 <_sk_load_bgra_sse41+0xf>
+
+HIDDEN _sk_load_bgra_dst_sse41
+.globl _sk_load_bgra_dst_sse41
+FUNCTION(_sk_load_bgra_dst_sse41)
+_sk_load_bgra_dst_sse41:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  72,139,0                            // mov           (%rax),%rax
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,88                              // jne           3db9 <_sk_load_bgra_dst_sse41+0x62>
+  .byte  243,15,111,60,144                   // movdqu        (%rax,%rdx,4),%xmm7
+  .byte  102,15,111,37,34,44,0,0             // movdqa        0x2c22(%rip),%xmm4        # 6990 <_sk_callback_sse41+0x10af>
+  .byte  102,15,219,231                      // pand          %xmm7,%xmm4
+  .byte  15,91,244                           // cvtdq2ps      %xmm4,%xmm6
+  .byte  68,15,40,5,35,44,0,0                // movaps        0x2c23(%rip),%xmm8        # 69a0 <_sk_callback_sse41+0x10bf>
+  .byte  65,15,89,240                        // mulps         %xmm8,%xmm6
+  .byte  102,15,111,231                      // movdqa        %xmm7,%xmm4
+  .byte  102,15,56,0,37,34,44,0,0            // pshufb        0x2c22(%rip),%xmm4        # 69b0 <_sk_callback_sse41+0x10cf>
+  .byte  15,91,236                           // cvtdq2ps      %xmm4,%xmm5
+  .byte  65,15,89,232                        // mulps         %xmm8,%xmm5
+  .byte  102,15,111,231                      // movdqa        %xmm7,%xmm4
+  .byte  102,15,56,0,37,30,44,0,0            // pshufb        0x2c1e(%rip),%xmm4        # 69c0 <_sk_callback_sse41+0x10df>
+  .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
+  .byte  65,15,89,224                        // mulps         %xmm8,%xmm4
+  .byte  102,15,114,215,24                   // psrld         $0x18,%xmm7
+  .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
+  .byte  65,15,89,248                        // mulps         %xmm8,%xmm7
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,3                        // and           $0x3,%r9b
+  .byte  65,128,249,1                        // cmp           $0x1,%r9b
+  .byte  116,43                              // je            3df1 <_sk_load_bgra_dst_sse41+0x9a>
+  .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
+  .byte  65,128,249,2                        // cmp           $0x2,%r9b
+  .byte  116,17                              // je            3de1 <_sk_load_bgra_dst_sse41+0x8a>
+  .byte  65,128,249,3                        // cmp           $0x3,%r9b
+  .byte  117,144                             // jne           3d66 <_sk_load_bgra_dst_sse41+0xf>
+  .byte  102,15,110,100,144,8                // movd          0x8(%rax,%rdx,4),%xmm4
+  .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
+  .byte  243,15,126,36,144                   // movq          (%rax,%rdx,4),%xmm4
+  .byte  102,15,58,14,252,15                 // pblendw       $0xf,%xmm4,%xmm7
+  .byte  233,117,255,255,255                 // jmpq          3d66 <_sk_load_bgra_dst_sse41+0xf>
+  .byte  102,15,110,60,144                   // movd          (%rax,%rdx,4),%xmm7
+  .byte  233,107,255,255,255                 // jmpq          3d66 <_sk_load_bgra_dst_sse41+0xf>
+
+HIDDEN _sk_gather_bgra_sse41
+.globl _sk_gather_bgra_sse41
+FUNCTION(_sk_gather_bgra_sse41)
+_sk_gather_bgra_sse41:
+  .byte  83                                  // push          %rbx
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,139,8                            // mov           (%rax),%r9
+  .byte  243,15,91,201                       // cvttps2dq     %xmm1,%xmm1
+  .byte  102,15,110,80,16                    // movd          0x10(%rax),%xmm2
+  .byte  102,15,112,210,0                    // pshufd        $0x0,%xmm2,%xmm2
+  .byte  102,15,56,64,209                    // pmulld        %xmm1,%xmm2
+  .byte  243,15,91,192                       // cvttps2dq     %xmm0,%xmm0
+  .byte  102,15,254,194                      // paddd         %xmm2,%xmm0
+  .byte  102,72,15,126,192                   // movq          %xmm0,%rax
+  .byte  65,137,194                          // mov           %eax,%r10d
+  .byte  72,193,232,32                       // shr           $0x20,%rax
+  .byte  102,73,15,58,22,195,1               // pextrq        $0x1,%xmm0,%r11
+  .byte  68,137,219                          // mov           %r11d,%ebx
+  .byte  73,193,235,32                       // shr           $0x20,%r11
+  .byte  102,67,15,110,28,145                // movd          (%r9,%r10,4),%xmm3
+  .byte  102,65,15,58,34,28,129,1            // pinsrd        $0x1,(%r9,%rax,4),%xmm3
+  .byte  102,65,15,58,34,28,153,2            // pinsrd        $0x2,(%r9,%rbx,4),%xmm3
+  .byte  102,67,15,58,34,28,153,3            // pinsrd        $0x3,(%r9,%r11,4),%xmm3
+  .byte  102,15,111,5,116,43,0,0             // movdqa        0x2b74(%rip),%xmm0        # 69d0 <_sk_callback_sse41+0x10ef>
+  .byte  102,15,219,195                      // pand          %xmm3,%xmm0
+  .byte  15,91,208                           // cvtdq2ps      %xmm0,%xmm2
+  .byte  68,15,40,5,117,43,0,0               // movaps        0x2b75(%rip),%xmm8        # 69e0 <_sk_callback_sse41+0x10ff>
+  .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
+  .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
+  .byte  102,15,56,0,5,116,43,0,0            // pshufb        0x2b74(%rip),%xmm0        # 69f0 <_sk_callback_sse41+0x110f>
+  .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
+  .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
+  .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
+  .byte  102,15,56,0,5,112,43,0,0            // pshufb        0x2b70(%rip),%xmm0        # 6a00 <_sk_callback_sse41+0x111f>
+  .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
+  .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
+  .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
+  .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
+  .byte  65,15,89,216                        // mulps         %xmm8,%xmm3
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  91                                  // pop           %rbx
+  .byte  255,224                             // jmpq          *%rax
+
+HIDDEN _sk_store_bgra_sse41
+.globl _sk_store_bgra_sse41
+FUNCTION(_sk_store_bgra_sse41)
+_sk_store_bgra_sse41:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  72,139,0                            // mov           (%rax),%rax
+  .byte  68,15,40,5,91,43,0,0                // movaps        0x2b5b(%rip),%xmm8        # 6a10 <_sk_callback_sse41+0x112f>
+  .byte  68,15,40,202                        // movaps        %xmm2,%xmm9
+  .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
+  .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
+  .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
+  .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
+  .byte  102,69,15,91,210                    // cvtps2dq      %xmm10,%xmm10
+  .byte  102,65,15,114,242,8                 // pslld         $0x8,%xmm10
+  .byte  102,69,15,235,209                   // por           %xmm9,%xmm10
+  .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
+  .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
+  .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
+  .byte  102,65,15,114,241,16                // pslld         $0x10,%xmm9
+  .byte  68,15,89,195                        // mulps         %xmm3,%xmm8
+  .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
+  .byte  102,65,15,114,240,24                // pslld         $0x18,%xmm8
+  .byte  102,69,15,235,193                   // por           %xmm9,%xmm8
+  .byte  102,69,15,235,194                   // por           %xmm10,%xmm8
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,10                              // jne           3f15 <_sk_store_bgra_sse41+0x6d>
+  .byte  243,68,15,127,4,144                 // movdqu        %xmm8,(%rax,%rdx,4)
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,3                        // and           $0x3,%r9b
+  .byte  65,128,249,1                        // cmp           $0x1,%r9b
+  .byte  116,29                              // je            3f3f <_sk_store_bgra_sse41+0x97>
+  .byte  65,128,249,2                        // cmp           $0x2,%r9b
+  .byte  116,15                              // je            3f37 <_sk_store_bgra_sse41+0x8f>
+  .byte  65,128,249,3                        // cmp           $0x3,%r9b
+  .byte  117,227                             // jne           3f11 <_sk_store_bgra_sse41+0x69>
+  .byte  102,68,15,58,22,68,144,8,2          // pextrd        $0x2,%xmm8,0x8(%rax,%rdx,4)
+  .byte  102,68,15,214,4,144                 // movq          %xmm8,(%rax,%rdx,4)
+  .byte  235,210                             // jmp           3f11 <_sk_store_bgra_sse41+0x69>
+  .byte  102,68,15,126,4,144                 // movd          %xmm8,(%rax,%rdx,4)
+  .byte  235,202                             // jmp           3f11 <_sk_store_bgra_sse41+0x69>
 
 HIDDEN _sk_load_f16_sse41
 .globl _sk_load_f16_sse41
@@ -28246,7 +29335,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,60,1,0,0                     // jne           3e0c <_sk_load_f16_sse41+0x14a>
+  .byte  15,133,60,1,0,0                     // jne           4091 <_sk_load_f16_sse41+0x14a>
   .byte  102,15,16,4,208                     // movupd        (%rax,%rdx,8),%xmm0
   .byte  243,15,111,76,208,16                // movdqu        0x10(%rax,%rdx,8),%xmm1
   .byte  102,68,15,40,200                    // movapd        %xmm0,%xmm9
@@ -28256,18 +29345,18 @@
   .byte  102,68,15,97,216                    // punpcklwd     %xmm0,%xmm11
   .byte  102,68,15,105,200                   // punpckhwd     %xmm0,%xmm9
   .byte  102,65,15,56,51,203                 // pmovzxwd      %xmm11,%xmm1
-  .byte  102,68,15,111,5,185,41,0,0          // movdqa        0x29b9(%rip),%xmm8        # 66c0 <_sk_callback_sse41+0x1064>
+  .byte  102,68,15,111,5,148,42,0,0          // movdqa        0x2a94(%rip),%xmm8        # 6a20 <_sk_callback_sse41+0x113f>
   .byte  102,15,111,209                      // movdqa        %xmm1,%xmm2
   .byte  102,65,15,219,208                   // pand          %xmm8,%xmm2
   .byte  102,15,239,202                      // pxor          %xmm2,%xmm1
-  .byte  102,15,111,29,180,41,0,0            // movdqa        0x29b4(%rip),%xmm3        # 66d0 <_sk_callback_sse41+0x1074>
+  .byte  102,15,111,29,143,42,0,0            // movdqa        0x2a8f(%rip),%xmm3        # 6a30 <_sk_callback_sse41+0x114f>
   .byte  102,15,114,242,16                   // pslld         $0x10,%xmm2
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,15,56,63,195                    // pmaxud        %xmm3,%xmm0
   .byte  102,15,118,193                      // pcmpeqd       %xmm1,%xmm0
   .byte  102,15,114,241,13                   // pslld         $0xd,%xmm1
   .byte  102,15,235,202                      // por           %xmm2,%xmm1
-  .byte  102,68,15,111,21,160,41,0,0         // movdqa        0x29a0(%rip),%xmm10        # 66e0 <_sk_callback_sse41+0x1084>
+  .byte  102,68,15,111,21,123,42,0,0         // movdqa        0x2a7b(%rip),%xmm10        # 6a40 <_sk_callback_sse41+0x115f>
   .byte  102,65,15,254,202                   // paddd         %xmm10,%xmm1
   .byte  102,15,219,193                      // pand          %xmm1,%xmm0
   .byte  102,65,15,115,219,8                 // psrldq        $0x8,%xmm11
@@ -28310,16 +29399,16 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,15,16,4,208                     // movsd         (%rax,%rdx,8),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           3e24 <_sk_load_f16_sse41+0x162>
+  .byte  117,13                              // jne           40a9 <_sk_load_f16_sse41+0x162>
   .byte  243,15,126,192                      // movq          %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,183,254,255,255                 // jmpq          3cdb <_sk_load_f16_sse41+0x19>
+  .byte  233,183,254,255,255                 // jmpq          3f60 <_sk_load_f16_sse41+0x19>
   .byte  102,15,22,68,208,8                  // movhpd        0x8(%rax,%rdx,8),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,163,254,255,255              // jb            3cdb <_sk_load_f16_sse41+0x19>
+  .byte  15,130,163,254,255,255              // jb            3f60 <_sk_load_f16_sse41+0x19>
   .byte  243,15,126,76,208,16                // movq          0x10(%rax,%rdx,8),%xmm1
-  .byte  233,152,254,255,255                 // jmpq          3cdb <_sk_load_f16_sse41+0x19>
+  .byte  233,152,254,255,255                 // jmpq          3f60 <_sk_load_f16_sse41+0x19>
 
 HIDDEN _sk_load_f16_dst_sse41
 .globl _sk_load_f16_dst_sse41
@@ -28328,7 +29417,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,60,1,0,0                     // jne           3f8d <_sk_load_f16_dst_sse41+0x14a>
+  .byte  15,133,60,1,0,0                     // jne           4212 <_sk_load_f16_dst_sse41+0x14a>
   .byte  102,15,16,36,208                    // movupd        (%rax,%rdx,8),%xmm4
   .byte  243,15,111,108,208,16               // movdqu        0x10(%rax,%rdx,8),%xmm5
   .byte  102,68,15,40,204                    // movapd        %xmm4,%xmm9
@@ -28338,18 +29427,18 @@
   .byte  102,68,15,97,220                    // punpcklwd     %xmm4,%xmm11
   .byte  102,68,15,105,204                   // punpckhwd     %xmm4,%xmm9
   .byte  102,65,15,56,51,235                 // pmovzxwd      %xmm11,%xmm5
-  .byte  102,68,15,111,5,104,40,0,0          // movdqa        0x2868(%rip),%xmm8        # 66f0 <_sk_callback_sse41+0x1094>
+  .byte  102,68,15,111,5,67,41,0,0           // movdqa        0x2943(%rip),%xmm8        # 6a50 <_sk_callback_sse41+0x116f>
   .byte  102,15,111,245                      // movdqa        %xmm5,%xmm6
   .byte  102,65,15,219,240                   // pand          %xmm8,%xmm6
   .byte  102,15,239,238                      // pxor          %xmm6,%xmm5
-  .byte  102,15,111,61,99,40,0,0             // movdqa        0x2863(%rip),%xmm7        # 6700 <_sk_callback_sse41+0x10a4>
+  .byte  102,15,111,61,62,41,0,0             // movdqa        0x293e(%rip),%xmm7        # 6a60 <_sk_callback_sse41+0x117f>
   .byte  102,15,114,246,16                   // pslld         $0x10,%xmm6
   .byte  102,15,111,229                      // movdqa        %xmm5,%xmm4
   .byte  102,15,56,63,231                    // pmaxud        %xmm7,%xmm4
   .byte  102,15,118,229                      // pcmpeqd       %xmm5,%xmm4
   .byte  102,15,114,245,13                   // pslld         $0xd,%xmm5
   .byte  102,15,235,238                      // por           %xmm6,%xmm5
-  .byte  102,68,15,111,21,79,40,0,0          // movdqa        0x284f(%rip),%xmm10        # 6710 <_sk_callback_sse41+0x10b4>
+  .byte  102,68,15,111,21,42,41,0,0          // movdqa        0x292a(%rip),%xmm10        # 6a70 <_sk_callback_sse41+0x118f>
   .byte  102,65,15,254,234                   // paddd         %xmm10,%xmm5
   .byte  102,15,219,229                      // pand          %xmm5,%xmm4
   .byte  102,65,15,115,219,8                 // psrldq        $0x8,%xmm11
@@ -28392,16 +29481,16 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,15,16,36,208                    // movsd         (%rax,%rdx,8),%xmm4
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           3fa5 <_sk_load_f16_dst_sse41+0x162>
+  .byte  117,13                              // jne           422a <_sk_load_f16_dst_sse41+0x162>
   .byte  243,15,126,228                      // movq          %xmm4,%xmm4
   .byte  102,15,239,237                      // pxor          %xmm5,%xmm5
-  .byte  233,183,254,255,255                 // jmpq          3e5c <_sk_load_f16_dst_sse41+0x19>
+  .byte  233,183,254,255,255                 // jmpq          40e1 <_sk_load_f16_dst_sse41+0x19>
   .byte  102,15,22,100,208,8                 // movhpd        0x8(%rax,%rdx,8),%xmm4
   .byte  102,15,239,237                      // pxor          %xmm5,%xmm5
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,163,254,255,255              // jb            3e5c <_sk_load_f16_dst_sse41+0x19>
+  .byte  15,130,163,254,255,255              // jb            40e1 <_sk_load_f16_dst_sse41+0x19>
   .byte  243,15,126,108,208,16               // movq          0x10(%rax,%rdx,8),%xmm5
-  .byte  233,152,254,255,255                 // jmpq          3e5c <_sk_load_f16_dst_sse41+0x19>
+  .byte  233,152,254,255,255                 // jmpq          40e1 <_sk_load_f16_dst_sse41+0x19>
 
 HIDDEN _sk_gather_f16_sse41
 .globl _sk_gather_f16_sse41
@@ -28435,18 +29524,18 @@
   .byte  102,68,15,97,218                    // punpcklwd     %xmm2,%xmm11
   .byte  102,68,15,105,202                   // punpckhwd     %xmm2,%xmm9
   .byte  102,65,15,56,51,203                 // pmovzxwd      %xmm11,%xmm1
-  .byte  102,68,15,111,5,213,38,0,0          // movdqa        0x26d5(%rip),%xmm8        # 6720 <_sk_callback_sse41+0x10c4>
+  .byte  102,68,15,111,5,176,39,0,0          // movdqa        0x27b0(%rip),%xmm8        # 6a80 <_sk_callback_sse41+0x119f>
   .byte  102,15,111,209                      // movdqa        %xmm1,%xmm2
   .byte  102,65,15,219,208                   // pand          %xmm8,%xmm2
   .byte  102,15,239,202                      // pxor          %xmm2,%xmm1
-  .byte  102,15,111,29,208,38,0,0            // movdqa        0x26d0(%rip),%xmm3        # 6730 <_sk_callback_sse41+0x10d4>
+  .byte  102,15,111,29,171,39,0,0            // movdqa        0x27ab(%rip),%xmm3        # 6a90 <_sk_callback_sse41+0x11af>
   .byte  102,15,114,242,16                   // pslld         $0x10,%xmm2
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,15,56,63,195                    // pmaxud        %xmm3,%xmm0
   .byte  102,15,118,193                      // pcmpeqd       %xmm1,%xmm0
   .byte  102,15,114,241,13                   // pslld         $0xd,%xmm1
   .byte  102,15,235,202                      // por           %xmm2,%xmm1
-  .byte  102,68,15,111,21,188,38,0,0         // movdqa        0x26bc(%rip),%xmm10        # 6740 <_sk_callback_sse41+0x10e4>
+  .byte  102,68,15,111,21,151,39,0,0         // movdqa        0x2797(%rip),%xmm10        # 6aa0 <_sk_callback_sse41+0x11bf>
   .byte  102,65,15,254,202                   // paddd         %xmm10,%xmm1
   .byte  102,15,219,193                      // pand          %xmm1,%xmm0
   .byte  102,65,15,115,219,8                 // psrldq        $0x8,%xmm11
@@ -28495,17 +29584,17 @@
 _sk_store_f16_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  102,68,15,111,21,241,37,0,0         // movdqa        0x25f1(%rip),%xmm10        # 6750 <_sk_callback_sse41+0x10f4>
+  .byte  102,68,15,111,21,204,38,0,0         // movdqa        0x26cc(%rip),%xmm10        # 6ab0 <_sk_callback_sse41+0x11cf>
   .byte  102,68,15,111,216                   // movdqa        %xmm0,%xmm11
   .byte  102,69,15,219,218                   // pand          %xmm10,%xmm11
   .byte  102,68,15,111,232                   // movdqa        %xmm0,%xmm13
   .byte  102,69,15,239,235                   // pxor          %xmm11,%xmm13
-  .byte  102,68,15,111,13,228,37,0,0         // movdqa        0x25e4(%rip),%xmm9        # 6760 <_sk_callback_sse41+0x1104>
+  .byte  102,68,15,111,13,191,38,0,0         // movdqa        0x26bf(%rip),%xmm9        # 6ac0 <_sk_callback_sse41+0x11df>
   .byte  102,65,15,114,211,16                // psrld         $0x10,%xmm11
   .byte  102,69,15,111,193                   // movdqa        %xmm9,%xmm8
   .byte  102,69,15,102,197                   // pcmpgtd       %xmm13,%xmm8
   .byte  102,65,15,114,213,13                // psrld         $0xd,%xmm13
-  .byte  102,68,15,111,37,213,37,0,0         // movdqa        0x25d5(%rip),%xmm12        # 6770 <_sk_callback_sse41+0x1114>
+  .byte  102,68,15,111,37,176,38,0,0         // movdqa        0x26b0(%rip),%xmm12        # 6ad0 <_sk_callback_sse41+0x11ef>
   .byte  102,69,15,235,220                   // por           %xmm12,%xmm11
   .byte  102,69,15,254,221                   // paddd         %xmm13,%xmm11
   .byte  102,69,15,223,195                   // pandn         %xmm11,%xmm8
@@ -28549,7 +29638,7 @@
   .byte  102,69,15,111,200                   // movdqa        %xmm8,%xmm9
   .byte  102,69,15,98,203                    // punpckldq     %xmm11,%xmm9
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,21                              // jne           4291 <_sk_store_f16_sse41+0x140>
+  .byte  117,21                              // jne           4516 <_sk_store_f16_sse41+0x140>
   .byte  68,15,17,12,208                     // movups        %xmm9,(%rax,%rdx,8)
   .byte  102,69,15,106,195                   // punpckhdq     %xmm11,%xmm8
   .byte  243,68,15,127,68,208,16             // movdqu        %xmm8,0x10(%rax,%rdx,8)
@@ -28557,13 +29646,13 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  102,68,15,214,12,208                // movq          %xmm9,(%rax,%rdx,8)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            428d <_sk_store_f16_sse41+0x13c>
+  .byte  116,240                             // je            4512 <_sk_store_f16_sse41+0x13c>
   .byte  102,68,15,23,76,208,8               // movhpd        %xmm9,0x8(%rax,%rdx,8)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            428d <_sk_store_f16_sse41+0x13c>
+  .byte  114,227                             // jb            4512 <_sk_store_f16_sse41+0x13c>
   .byte  102,69,15,106,195                   // punpckhdq     %xmm11,%xmm8
   .byte  102,68,15,214,68,208,16             // movq          %xmm8,0x10(%rax,%rdx,8)
-  .byte  235,213                             // jmp           428d <_sk_store_f16_sse41+0x13c>
+  .byte  235,213                             // jmp           4512 <_sk_store_f16_sse41+0x13c>
 
 HIDDEN _sk_load_u16_be_sse41
 .globl _sk_load_u16_be_sse41
@@ -28573,7 +29662,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,185,0,0,0                    // jne           4387 <_sk_load_u16_be_sse41+0xcf>
+  .byte  15,133,185,0,0,0                    // jne           460c <_sk_load_u16_be_sse41+0xcf>
   .byte  102,65,15,16,4,65                   // movupd        (%r9,%rax,2),%xmm0
   .byte  243,65,15,111,76,65,16              // movdqu        0x10(%r9,%rax,2),%xmm1
   .byte  102,15,40,208                       // movapd        %xmm0,%xmm2
@@ -28589,7 +29678,7 @@
   .byte  102,15,235,200                      // por           %xmm0,%xmm1
   .byte  102,15,56,51,193                    // pmovzxwd      %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,102,36,0,0               // movaps        0x2466(%rip),%xmm8        # 6780 <_sk_callback_sse41+0x1124>
+  .byte  68,15,40,5,65,37,0,0                // movaps        0x2541(%rip),%xmm8        # 6ae0 <_sk_callback_sse41+0x11ff>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -28617,16 +29706,16 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,65,15,16,4,65                   // movsd         (%r9,%rax,2),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           43a0 <_sk_load_u16_be_sse41+0xe8>
+  .byte  117,13                              // jne           4625 <_sk_load_u16_be_sse41+0xe8>
   .byte  243,15,126,192                      // movq          %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,59,255,255,255                  // jmpq          42db <_sk_load_u16_be_sse41+0x23>
+  .byte  233,59,255,255,255                  // jmpq          4560 <_sk_load_u16_be_sse41+0x23>
   .byte  102,65,15,22,68,65,8                // movhpd        0x8(%r9,%rax,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,38,255,255,255               // jb            42db <_sk_load_u16_be_sse41+0x23>
+  .byte  15,130,38,255,255,255               // jb            4560 <_sk_load_u16_be_sse41+0x23>
   .byte  243,65,15,126,76,65,16              // movq          0x10(%r9,%rax,2),%xmm1
-  .byte  233,26,255,255,255                  // jmpq          42db <_sk_load_u16_be_sse41+0x23>
+  .byte  233,26,255,255,255                  // jmpq          4560 <_sk_load_u16_be_sse41+0x23>
 
 HIDDEN _sk_load_rgb_u16_be_sse41
 .globl _sk_load_rgb_u16_be_sse41
@@ -28636,7 +29725,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,82                         // lea           (%rdx,%rdx,2),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,170,0,0,0                    // jne           447d <_sk_load_rgb_u16_be_sse41+0xbc>
+  .byte  15,133,170,0,0,0                    // jne           4702 <_sk_load_rgb_u16_be_sse41+0xbc>
   .byte  243,65,15,111,20,65                 // movdqu        (%r9,%rax,2),%xmm2
   .byte  243,65,15,111,92,65,8               // movdqu        0x8(%r9,%rax,2),%xmm3
   .byte  102,15,115,219,4                    // psrldq        $0x4,%xmm3
@@ -28656,7 +29745,7 @@
   .byte  102,15,235,200                      // por           %xmm0,%xmm1
   .byte  102,15,56,51,193                    // pmovzxwd      %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,94,35,0,0                // movaps        0x235e(%rip),%xmm8        # 6790 <_sk_callback_sse41+0x1134>
+  .byte  68,15,40,5,57,36,0,0                // movaps        0x2439(%rip),%xmm8        # 6af0 <_sk_callback_sse41+0x120f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -28673,27 +29762,27 @@
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,37,35,0,0                  // movaps        0x2325(%rip),%xmm3        # 67a0 <_sk_callback_sse41+0x1144>
+  .byte  15,40,29,0,36,0,0                   // movaps        0x2400(%rip),%xmm3        # 6b00 <_sk_callback_sse41+0x121f>
   .byte  255,224                             // jmpq          *%rax
   .byte  102,65,15,110,20,65                 // movd          (%r9,%rax,2),%xmm2
   .byte  102,65,15,196,84,65,4,2             // pinsrw        $0x2,0x4(%r9,%rax,2),%xmm2
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           44a2 <_sk_load_rgb_u16_be_sse41+0xe1>
+  .byte  117,13                              // jne           4727 <_sk_load_rgb_u16_be_sse41+0xe1>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,85,255,255,255                  // jmpq          43f7 <_sk_load_rgb_u16_be_sse41+0x36>
+  .byte  233,85,255,255,255                  // jmpq          467c <_sk_load_rgb_u16_be_sse41+0x36>
   .byte  102,65,15,110,68,65,6               // movd          0x6(%r9,%rax,2),%xmm0
   .byte  102,65,15,196,68,65,10,2            // pinsrw        $0x2,0xa(%r9,%rax,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,24                              // jb            44d3 <_sk_load_rgb_u16_be_sse41+0x112>
+  .byte  114,24                              // jb            4758 <_sk_load_rgb_u16_be_sse41+0x112>
   .byte  102,65,15,110,92,65,12              // movd          0xc(%r9,%rax,2),%xmm3
   .byte  102,65,15,196,92,65,16,2            // pinsrw        $0x2,0x10(%r9,%rax,2),%xmm3
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,36,255,255,255                  // jmpq          43f7 <_sk_load_rgb_u16_be_sse41+0x36>
+  .byte  233,36,255,255,255                  // jmpq          467c <_sk_load_rgb_u16_be_sse41+0x36>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
-  .byte  233,27,255,255,255                  // jmpq          43f7 <_sk_load_rgb_u16_be_sse41+0x36>
+  .byte  233,27,255,255,255                  // jmpq          467c <_sk_load_rgb_u16_be_sse41+0x36>
 
 HIDDEN _sk_store_u16_be_sse41
 .globl _sk_store_u16_be_sse41
@@ -28702,7 +29791,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
-  .byte  68,15,40,21,191,34,0,0              // movaps        0x22bf(%rip),%xmm10        # 67b0 <_sk_callback_sse41+0x1154>
+  .byte  68,15,40,21,154,35,0,0              // movaps        0x239a(%rip),%xmm10        # 6b10 <_sk_callback_sse41+0x122f>
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  69,15,89,194                        // mulps         %xmm10,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
@@ -28739,7 +29828,7 @@
   .byte  102,69,15,111,208                   // movdqa        %xmm8,%xmm10
   .byte  102,69,15,98,209                    // punpckldq     %xmm9,%xmm10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,21                              // jne           45bf <_sk_store_u16_be_sse41+0xe3>
+  .byte  117,21                              // jne           4844 <_sk_store_u16_be_sse41+0xe3>
   .byte  69,15,17,20,65                      // movups        %xmm10,(%r9,%rax,2)
   .byte  102,69,15,106,193                   // punpckhdq     %xmm9,%xmm8
   .byte  243,69,15,127,68,65,16              // movdqu        %xmm8,0x10(%r9,%rax,2)
@@ -28747,13 +29836,13 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  102,69,15,214,20,65                 // movq          %xmm10,(%r9,%rax,2)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            45bb <_sk_store_u16_be_sse41+0xdf>
+  .byte  116,240                             // je            4840 <_sk_store_u16_be_sse41+0xdf>
   .byte  102,69,15,23,84,65,8                // movhpd        %xmm10,0x8(%r9,%rax,2)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            45bb <_sk_store_u16_be_sse41+0xdf>
+  .byte  114,227                             // jb            4840 <_sk_store_u16_be_sse41+0xdf>
   .byte  102,69,15,106,193                   // punpckhdq     %xmm9,%xmm8
   .byte  102,69,15,214,68,65,16              // movq          %xmm8,0x10(%r9,%rax,2)
-  .byte  235,213                             // jmp           45bb <_sk_store_u16_be_sse41+0xdf>
+  .byte  235,213                             // jmp           4840 <_sk_store_u16_be_sse41+0xdf>
 
 HIDDEN _sk_load_f32_sse41
 .globl _sk_load_f32_sse41
@@ -28766,7 +29855,7 @@
   .byte  72,193,224,4                        // shl           $0x4,%rax
   .byte  69,15,16,4,2                        // movups        (%r10,%rax,1),%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           4646 <_sk_load_f32_sse41+0x60>
+  .byte  117,66                              // jne           48cb <_sk_load_f32_sse41+0x60>
   .byte  67,15,16,68,138,16                  // movups        0x10(%r10,%r9,4),%xmm0
   .byte  67,15,16,92,138,32                  // movups        0x20(%r10,%r9,4),%xmm3
   .byte  71,15,16,76,138,48                  // movups        0x30(%r10,%r9,4),%xmm9
@@ -28786,17 +29875,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  69,15,87,201                        // xorps         %xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,8                               // jne           4658 <_sk_load_f32_sse41+0x72>
+  .byte  117,8                               // jne           48dd <_sk_load_f32_sse41+0x72>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
-  .byte  235,190                             // jmp           4616 <_sk_load_f32_sse41+0x30>
+  .byte  235,190                             // jmp           489b <_sk_load_f32_sse41+0x30>
   .byte  67,15,16,68,138,16                  // movups        0x10(%r10,%r9,4),%xmm0
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,8                               // jb            466c <_sk_load_f32_sse41+0x86>
+  .byte  114,8                               // jb            48f1 <_sk_load_f32_sse41+0x86>
   .byte  67,15,16,92,138,32                  // movups        0x20(%r10,%r9,4),%xmm3
-  .byte  235,170                             // jmp           4616 <_sk_load_f32_sse41+0x30>
+  .byte  235,170                             // jmp           489b <_sk_load_f32_sse41+0x30>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
-  .byte  235,165                             // jmp           4616 <_sk_load_f32_sse41+0x30>
+  .byte  235,165                             // jmp           489b <_sk_load_f32_sse41+0x30>
 
 HIDDEN _sk_load_f32_dst_sse41
 .globl _sk_load_f32_dst_sse41
@@ -28809,7 +29898,7 @@
   .byte  72,193,224,4                        // shl           $0x4,%rax
   .byte  69,15,16,4,2                        // movups        (%r10,%rax,1),%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           46d1 <_sk_load_f32_dst_sse41+0x60>
+  .byte  117,66                              // jne           4956 <_sk_load_f32_dst_sse41+0x60>
   .byte  67,15,16,100,138,16                 // movups        0x10(%r10,%r9,4),%xmm4
   .byte  67,15,16,124,138,32                 // movups        0x20(%r10,%r9,4),%xmm7
   .byte  71,15,16,76,138,48                  // movups        0x30(%r10,%r9,4),%xmm9
@@ -28829,17 +29918,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  69,15,87,201                        // xorps         %xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,8                               // jne           46e3 <_sk_load_f32_dst_sse41+0x72>
+  .byte  117,8                               // jne           4968 <_sk_load_f32_dst_sse41+0x72>
   .byte  15,87,255                           // xorps         %xmm7,%xmm7
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
-  .byte  235,190                             // jmp           46a1 <_sk_load_f32_dst_sse41+0x30>
+  .byte  235,190                             // jmp           4926 <_sk_load_f32_dst_sse41+0x30>
   .byte  67,15,16,100,138,16                 // movups        0x10(%r10,%r9,4),%xmm4
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,8                               // jb            46f7 <_sk_load_f32_dst_sse41+0x86>
+  .byte  114,8                               // jb            497c <_sk_load_f32_dst_sse41+0x86>
   .byte  67,15,16,124,138,32                 // movups        0x20(%r10,%r9,4),%xmm7
-  .byte  235,170                             // jmp           46a1 <_sk_load_f32_dst_sse41+0x30>
+  .byte  235,170                             // jmp           4926 <_sk_load_f32_dst_sse41+0x30>
   .byte  15,87,255                           // xorps         %xmm7,%xmm7
-  .byte  235,165                             // jmp           46a1 <_sk_load_f32_dst_sse41+0x30>
+  .byte  235,165                             // jmp           4926 <_sk_load_f32_dst_sse41+0x30>
 
 HIDDEN _sk_store_f32_sse41
 .globl _sk_store_f32_sse41
@@ -28865,7 +29954,7 @@
   .byte  102,69,15,20,203                    // unpcklpd      %xmm11,%xmm9
   .byte  102,69,15,17,36,2                   // movupd        %xmm12,(%r10,%rax,1)
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,29                              // jne           476e <_sk_store_f32_sse41+0x72>
+  .byte  117,29                              // jne           49f3 <_sk_store_f32_sse41+0x72>
   .byte  102,69,15,21,211                    // unpckhpd      %xmm11,%xmm10
   .byte  71,15,17,68,138,16                  // movups        %xmm8,0x10(%r10,%r9,4)
   .byte  102,71,15,17,76,138,32              // movupd        %xmm9,0x20(%r10,%r9,4)
@@ -28873,12 +29962,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,246                             // je            476a <_sk_store_f32_sse41+0x6e>
+  .byte  116,246                             // je            49ef <_sk_store_f32_sse41+0x6e>
   .byte  71,15,17,68,138,16                  // movups        %xmm8,0x10(%r10,%r9,4)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,234                             // jb            476a <_sk_store_f32_sse41+0x6e>
+  .byte  114,234                             // jb            49ef <_sk_store_f32_sse41+0x6e>
   .byte  102,71,15,17,76,138,32              // movupd        %xmm9,0x20(%r10,%r9,4)
-  .byte  235,225                             // jmp           476a <_sk_store_f32_sse41+0x6e>
+  .byte  235,225                             // jmp           49ef <_sk_store_f32_sse41+0x6e>
 
 HIDDEN _sk_clamp_x_sse41
 .globl _sk_clamp_x_sse41
@@ -28962,7 +30051,7 @@
   .byte  65,15,92,194                        // subps         %xmm10,%xmm0
   .byte  243,69,15,88,192                    // addss         %xmm8,%xmm8
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
-  .byte  243,68,15,89,13,0,35,0,0            // mulss         0x2300(%rip),%xmm9        # 6b80 <_sk_callback_sse41+0x1524>
+  .byte  243,68,15,89,13,219,35,0,0          // mulss         0x23db(%rip),%xmm9        # 6ee0 <_sk_callback_sse41+0x15ff>
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
   .byte  68,15,89,200                        // mulps         %xmm0,%xmm9
   .byte  102,69,15,58,8,201,1                // roundps       $0x1,%xmm9,%xmm9
@@ -28990,7 +30079,7 @@
   .byte  65,15,92,202                        // subps         %xmm10,%xmm1
   .byte  243,69,15,88,192                    // addss         %xmm8,%xmm8
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
-  .byte  243,68,15,89,13,157,34,0,0          // mulss         0x229d(%rip),%xmm9        # 6b84 <_sk_callback_sse41+0x1528>
+  .byte  243,68,15,89,13,120,35,0,0          // mulss         0x2378(%rip),%xmm9        # 6ee4 <_sk_callback_sse41+0x1603>
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
   .byte  68,15,89,201                        // mulps         %xmm1,%xmm9
   .byte  102,69,15,58,8,201,1                // roundps       $0x1,%xmm9,%xmm9
@@ -29012,7 +30101,7 @@
 _sk_clamp_x_1_sse41:
   .byte  69,15,87,192                        // xorps         %xmm8,%xmm8
   .byte  68,15,95,192                        // maxps         %xmm0,%xmm8
-  .byte  68,15,93,5,143,30,0,0               // minps         0x1e8f(%rip),%xmm8        # 67c0 <_sk_callback_sse41+0x1164>
+  .byte  68,15,93,5,106,31,0,0               // minps         0x1f6a(%rip),%xmm8        # 6b20 <_sk_callback_sse41+0x123f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -29030,9 +30119,9 @@
 .globl _sk_mirror_x_1_sse41
 FUNCTION(_sk_mirror_x_1_sse41)
 _sk_mirror_x_1_sse41:
-  .byte  68,15,40,5,128,30,0,0               // movaps        0x1e80(%rip),%xmm8        # 67d0 <_sk_callback_sse41+0x1174>
+  .byte  68,15,40,5,91,31,0,0                // movaps        0x1f5b(%rip),%xmm8        # 6b30 <_sk_callback_sse41+0x124f>
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,13,132,30,0,0              // movaps        0x1e84(%rip),%xmm9        # 67e0 <_sk_callback_sse41+0x1184>
+  .byte  68,15,40,13,95,31,0,0               // movaps        0x1f5f(%rip),%xmm9        # 6b40 <_sk_callback_sse41+0x125f>
   .byte  68,15,89,200                        // mulps         %xmm0,%xmm9
   .byte  102,69,15,58,8,201,1                // roundps       $0x1,%xmm9,%xmm9
   .byte  69,15,88,201                        // addps         %xmm9,%xmm9
@@ -29049,10 +30138,10 @@
 FUNCTION(_sk_luminance_to_alpha_sse41)
 _sk_luminance_to_alpha_sse41:
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
-  .byte  15,89,5,99,30,0,0                   // mulps         0x1e63(%rip),%xmm0        # 67f0 <_sk_callback_sse41+0x1194>
-  .byte  15,89,13,108,30,0,0                 // mulps         0x1e6c(%rip),%xmm1        # 6800 <_sk_callback_sse41+0x11a4>
+  .byte  15,89,5,62,31,0,0                   // mulps         0x1f3e(%rip),%xmm0        # 6b50 <_sk_callback_sse41+0x126f>
+  .byte  15,89,13,71,31,0,0                  // mulps         0x1f47(%rip),%xmm1        # 6b60 <_sk_callback_sse41+0x127f>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
-  .byte  15,89,29,114,30,0,0                 // mulps         0x1e72(%rip),%xmm3        # 6810 <_sk_callback_sse41+0x11b4>
+  .byte  15,89,29,77,31,0,0                  // mulps         0x1f4d(%rip),%xmm3        # 6b70 <_sk_callback_sse41+0x128f>
   .byte  15,88,217                           // addps         %xmm1,%xmm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
@@ -29331,9 +30420,9 @@
   .byte  72,139,24                           // mov           (%rax),%rbx
   .byte  76,139,112,8                        // mov           0x8(%rax),%r14
   .byte  72,255,203                          // dec           %rbx
-  .byte  120,7                               // js            4ddc <_sk_evenly_spaced_gradient_sse41+0x1a>
+  .byte  120,7                               // js            5061 <_sk_evenly_spaced_gradient_sse41+0x1a>
   .byte  243,72,15,42,203                    // cvtsi2ss      %rbx,%xmm1
-  .byte  235,21                              // jmp           4df1 <_sk_evenly_spaced_gradient_sse41+0x2f>
+  .byte  235,21                              // jmp           5076 <_sk_evenly_spaced_gradient_sse41+0x2f>
   .byte  73,137,217                          // mov           %rbx,%r9
   .byte  73,209,233                          // shr           %r9
   .byte  131,227,1                           // and           $0x1,%ebx
@@ -29423,15 +30512,15 @@
 .globl _sk_gauss_a_to_rgba_sse41
 FUNCTION(_sk_gauss_a_to_rgba_sse41)
 _sk_gauss_a_to_rgba_sse41:
-  .byte  15,40,5,129,24,0,0                  // movaps        0x1881(%rip),%xmm0        # 6820 <_sk_callback_sse41+0x11c4>
+  .byte  15,40,5,92,25,0,0                   // movaps        0x195c(%rip),%xmm0        # 6b80 <_sk_callback_sse41+0x129f>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,135,24,0,0                  // addps         0x1887(%rip),%xmm0        # 6830 <_sk_callback_sse41+0x11d4>
+  .byte  15,88,5,98,25,0,0                   // addps         0x1962(%rip),%xmm0        # 6b90 <_sk_callback_sse41+0x12af>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,141,24,0,0                  // addps         0x188d(%rip),%xmm0        # 6840 <_sk_callback_sse41+0x11e4>
+  .byte  15,88,5,104,25,0,0                  // addps         0x1968(%rip),%xmm0        # 6ba0 <_sk_callback_sse41+0x12bf>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,147,24,0,0                  // addps         0x1893(%rip),%xmm0        # 6850 <_sk_callback_sse41+0x11f4>
+  .byte  15,88,5,110,25,0,0                  // addps         0x196e(%rip),%xmm0        # 6bb0 <_sk_callback_sse41+0x12cf>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,153,24,0,0                  // addps         0x1899(%rip),%xmm0        # 6860 <_sk_callback_sse41+0x1204>
+  .byte  15,88,5,116,25,0,0                  // addps         0x1974(%rip),%xmm0        # 6bc0 <_sk_callback_sse41+0x12df>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
@@ -29449,12 +30538,12 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,249,2                        // cmp           $0x2,%r9
-  .byte  114,50                              // jb            501a <_sk_gradient_sse41+0x46>
+  .byte  114,50                              // jb            529f <_sk_gradient_sse41+0x46>
   .byte  72,139,88,72                        // mov           0x48(%rax),%rbx
   .byte  73,255,201                          // dec           %r9
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  15,40,21,114,24,0,0                 // movaps        0x1872(%rip),%xmm2        # 6870 <_sk_callback_sse41+0x1214>
+  .byte  15,40,21,77,25,0,0                  // movaps        0x194d(%rip),%xmm2        # 6bd0 <_sk_callback_sse41+0x12ef>
   .byte  243,15,16,27                        // movss         (%rbx),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
@@ -29462,7 +30551,7 @@
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  73,255,201                          // dec           %r9
-  .byte  117,228                             // jne           4ffe <_sk_gradient_sse41+0x2a>
+  .byte  117,228                             // jne           5283 <_sk_gradient_sse41+0x2a>
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  69,137,202                          // mov           %r9d,%r10d
   .byte  73,193,233,32                       // shr           $0x20,%r9
@@ -29592,26 +30681,26 @@
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,40,236                        // movaps        %xmm12,%xmm13
   .byte  69,15,89,237                        // mulps         %xmm13,%xmm13
-  .byte  68,15,40,21,19,22,0,0               // movaps        0x1613(%rip),%xmm10        # 6880 <_sk_callback_sse41+0x1224>
+  .byte  68,15,40,21,238,22,0,0              // movaps        0x16ee(%rip),%xmm10        # 6be0 <_sk_callback_sse41+0x12ff>
   .byte  69,15,89,213                        // mulps         %xmm13,%xmm10
-  .byte  68,15,88,21,23,22,0,0               // addps         0x1617(%rip),%xmm10        # 6890 <_sk_callback_sse41+0x1234>
+  .byte  68,15,88,21,242,22,0,0              // addps         0x16f2(%rip),%xmm10        # 6bf0 <_sk_callback_sse41+0x130f>
   .byte  69,15,89,213                        // mulps         %xmm13,%xmm10
-  .byte  68,15,88,21,27,22,0,0               // addps         0x161b(%rip),%xmm10        # 68a0 <_sk_callback_sse41+0x1244>
+  .byte  68,15,88,21,246,22,0,0              // addps         0x16f6(%rip),%xmm10        # 6c00 <_sk_callback_sse41+0x131f>
   .byte  69,15,89,213                        // mulps         %xmm13,%xmm10
-  .byte  68,15,88,21,31,22,0,0               // addps         0x161f(%rip),%xmm10        # 68b0 <_sk_callback_sse41+0x1254>
+  .byte  68,15,88,21,250,22,0,0              // addps         0x16fa(%rip),%xmm10        # 6c10 <_sk_callback_sse41+0x132f>
   .byte  69,15,89,212                        // mulps         %xmm12,%xmm10
   .byte  65,15,194,195,1                     // cmpltps       %xmm11,%xmm0
-  .byte  68,15,40,29,30,22,0,0               // movaps        0x161e(%rip),%xmm11        # 68c0 <_sk_callback_sse41+0x1264>
+  .byte  68,15,40,29,249,22,0,0              // movaps        0x16f9(%rip),%xmm11        # 6c20 <_sk_callback_sse41+0x133f>
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  102,69,15,56,20,211                 // blendvps      %xmm0,%xmm11,%xmm10
   .byte  69,15,194,200,1                     // cmpltps       %xmm8,%xmm9
-  .byte  68,15,40,29,23,22,0,0               // movaps        0x1617(%rip),%xmm11        # 68d0 <_sk_callback_sse41+0x1274>
+  .byte  68,15,40,29,242,22,0,0              // movaps        0x16f2(%rip),%xmm11        # 6c30 <_sk_callback_sse41+0x134f>
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  102,69,15,56,20,211                 // blendvps      %xmm0,%xmm11,%xmm10
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  65,15,194,192,1                     // cmpltps       %xmm8,%xmm0
-  .byte  68,15,40,13,9,22,0,0                // movaps        0x1609(%rip),%xmm9        # 68e0 <_sk_callback_sse41+0x1284>
+  .byte  68,15,40,13,228,22,0,0              // movaps        0x16e4(%rip),%xmm9        # 6c40 <_sk_callback_sse41+0x135f>
   .byte  69,15,92,202                        // subps         %xmm10,%xmm9
   .byte  102,69,15,56,20,209                 // blendvps      %xmm0,%xmm9,%xmm10
   .byte  69,15,194,194,7                     // cmpordps      %xmm10,%xmm8
@@ -29637,7 +30726,7 @@
 FUNCTION(_sk_save_xy_sse41)
 _sk_save_xy_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,221,21,0,0               // movaps        0x15dd(%rip),%xmm8        # 68f0 <_sk_callback_sse41+0x1294>
+  .byte  68,15,40,5,184,22,0,0               // movaps        0x16b8(%rip),%xmm8        # 6c50 <_sk_callback_sse41+0x136f>
   .byte  15,17,0                             // movups        %xmm0,(%rax)
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,88,200                        // addps         %xmm8,%xmm9
@@ -29681,8 +30770,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,95,21,0,0                   // addps         0x155f(%rip),%xmm0        # 6900 <_sk_callback_sse41+0x12a4>
-  .byte  68,15,40,13,103,21,0,0              // movaps        0x1567(%rip),%xmm9        # 6910 <_sk_callback_sse41+0x12b4>
+  .byte  15,88,5,58,22,0,0                   // addps         0x163a(%rip),%xmm0        # 6c60 <_sk_callback_sse41+0x137f>
+  .byte  68,15,40,13,66,22,0,0               // movaps        0x1642(%rip),%xmm9        # 6c70 <_sk_callback_sse41+0x138f>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -29695,7 +30784,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,86,21,0,0                   // addps         0x1556(%rip),%xmm0        # 6920 <_sk_callback_sse41+0x12c4>
+  .byte  15,88,5,49,22,0,0                   // addps         0x1631(%rip),%xmm0        # 6c80 <_sk_callback_sse41+0x139f>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -29707,8 +30796,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,72,21,0,0                  // addps         0x1548(%rip),%xmm1        # 6930 <_sk_callback_sse41+0x12d4>
-  .byte  68,15,40,13,80,21,0,0               // movaps        0x1550(%rip),%xmm9        # 6940 <_sk_callback_sse41+0x12e4>
+  .byte  15,88,13,35,22,0,0                  // addps         0x1623(%rip),%xmm1        # 6c90 <_sk_callback_sse41+0x13af>
+  .byte  68,15,40,13,43,22,0,0               // movaps        0x162b(%rip),%xmm9        # 6ca0 <_sk_callback_sse41+0x13bf>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -29721,7 +30810,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,62,21,0,0                  // addps         0x153e(%rip),%xmm1        # 6950 <_sk_callback_sse41+0x12f4>
+  .byte  15,88,13,25,22,0,0                  // addps         0x1619(%rip),%xmm1        # 6cb0 <_sk_callback_sse41+0x13cf>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -29733,13 +30822,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,49,21,0,0                   // addps         0x1531(%rip),%xmm0        # 6960 <_sk_callback_sse41+0x1304>
-  .byte  68,15,40,13,57,21,0,0               // movaps        0x1539(%rip),%xmm9        # 6970 <_sk_callback_sse41+0x1314>
+  .byte  15,88,5,12,22,0,0                   // addps         0x160c(%rip),%xmm0        # 6cc0 <_sk_callback_sse41+0x13df>
+  .byte  68,15,40,13,20,22,0,0               // movaps        0x1614(%rip),%xmm9        # 6cd0 <_sk_callback_sse41+0x13ef>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,53,21,0,0               // mulps         0x1535(%rip),%xmm9        # 6980 <_sk_callback_sse41+0x1324>
-  .byte  68,15,88,13,61,21,0,0               // addps         0x153d(%rip),%xmm9        # 6990 <_sk_callback_sse41+0x1334>
+  .byte  68,15,89,13,16,22,0,0               // mulps         0x1610(%rip),%xmm9        # 6ce0 <_sk_callback_sse41+0x13ff>
+  .byte  68,15,88,13,24,22,0,0               // addps         0x1618(%rip),%xmm9        # 6cf0 <_sk_callback_sse41+0x140f>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -29752,16 +30841,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,44,21,0,0                   // addps         0x152c(%rip),%xmm0        # 69a0 <_sk_callback_sse41+0x1344>
-  .byte  68,15,40,13,52,21,0,0               // movaps        0x1534(%rip),%xmm9        # 69b0 <_sk_callback_sse41+0x1354>
+  .byte  15,88,5,7,22,0,0                    // addps         0x1607(%rip),%xmm0        # 6d00 <_sk_callback_sse41+0x141f>
+  .byte  68,15,40,13,15,22,0,0               // movaps        0x160f(%rip),%xmm9        # 6d10 <_sk_callback_sse41+0x142f>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,56,21,0,0                // movaps        0x1538(%rip),%xmm8        # 69c0 <_sk_callback_sse41+0x1364>
+  .byte  68,15,40,5,19,22,0,0                // movaps        0x1613(%rip),%xmm8        # 6d20 <_sk_callback_sse41+0x143f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,60,21,0,0                // addps         0x153c(%rip),%xmm8        # 69d0 <_sk_callback_sse41+0x1374>
+  .byte  68,15,88,5,23,22,0,0                // addps         0x1617(%rip),%xmm8        # 6d30 <_sk_callback_sse41+0x144f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,64,21,0,0                // addps         0x1540(%rip),%xmm8        # 69e0 <_sk_callback_sse41+0x1384>
+  .byte  68,15,88,5,27,22,0,0                // addps         0x161b(%rip),%xmm8        # 6d40 <_sk_callback_sse41+0x145f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,68,21,0,0                // addps         0x1544(%rip),%xmm8        # 69f0 <_sk_callback_sse41+0x1394>
+  .byte  68,15,88,5,31,22,0,0                // addps         0x161f(%rip),%xmm8        # 6d50 <_sk_callback_sse41+0x146f>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -29771,17 +30860,17 @@
 FUNCTION(_sk_bicubic_p1x_sse41)
 _sk_bicubic_p1x_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,62,21,0,0                // movaps        0x153e(%rip),%xmm8        # 6a00 <_sk_callback_sse41+0x13a4>
+  .byte  68,15,40,5,25,22,0,0                // movaps        0x1619(%rip),%xmm8        # 6d60 <_sk_callback_sse41+0x147f>
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,72,64                      // movups        0x40(%rax),%xmm9
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,21,58,21,0,0               // movaps        0x153a(%rip),%xmm10        # 6a10 <_sk_callback_sse41+0x13b4>
+  .byte  68,15,40,21,21,22,0,0               // movaps        0x1615(%rip),%xmm10        # 6d70 <_sk_callback_sse41+0x148f>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,62,21,0,0               // addps         0x153e(%rip),%xmm10        # 6a20 <_sk_callback_sse41+0x13c4>
+  .byte  68,15,88,21,25,22,0,0               // addps         0x1619(%rip),%xmm10        # 6d80 <_sk_callback_sse41+0x149f>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,58,21,0,0               // addps         0x153a(%rip),%xmm10        # 6a30 <_sk_callback_sse41+0x13d4>
+  .byte  68,15,88,21,21,22,0,0               // addps         0x1615(%rip),%xmm10        # 6d90 <_sk_callback_sse41+0x14af>
   .byte  68,15,17,144,128,0,0,0              // movups        %xmm10,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -29793,11 +30882,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,45,21,0,0                   // addps         0x152d(%rip),%xmm0        # 6a40 <_sk_callback_sse41+0x13e4>
+  .byte  15,88,5,8,22,0,0                    // addps         0x1608(%rip),%xmm0        # 6da0 <_sk_callback_sse41+0x14bf>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,45,21,0,0                // mulps         0x152d(%rip),%xmm8        # 6a50 <_sk_callback_sse41+0x13f4>
-  .byte  68,15,88,5,53,21,0,0                // addps         0x1535(%rip),%xmm8        # 6a60 <_sk_callback_sse41+0x1404>
+  .byte  68,15,89,5,8,22,0,0                 // mulps         0x1608(%rip),%xmm8        # 6db0 <_sk_callback_sse41+0x14cf>
+  .byte  68,15,88,5,16,22,0,0                // addps         0x1610(%rip),%xmm8        # 6dc0 <_sk_callback_sse41+0x14df>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -29810,13 +30899,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,35,21,0,0                  // addps         0x1523(%rip),%xmm1        # 6a70 <_sk_callback_sse41+0x1414>
-  .byte  68,15,40,13,43,21,0,0               // movaps        0x152b(%rip),%xmm9        # 6a80 <_sk_callback_sse41+0x1424>
+  .byte  15,88,13,254,21,0,0                 // addps         0x15fe(%rip),%xmm1        # 6dd0 <_sk_callback_sse41+0x14ef>
+  .byte  68,15,40,13,6,22,0,0                // movaps        0x1606(%rip),%xmm9        # 6de0 <_sk_callback_sse41+0x14ff>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,39,21,0,0               // mulps         0x1527(%rip),%xmm9        # 6a90 <_sk_callback_sse41+0x1434>
-  .byte  68,15,88,13,47,21,0,0               // addps         0x152f(%rip),%xmm9        # 6aa0 <_sk_callback_sse41+0x1444>
+  .byte  68,15,89,13,2,22,0,0                // mulps         0x1602(%rip),%xmm9        # 6df0 <_sk_callback_sse41+0x150f>
+  .byte  68,15,88,13,10,22,0,0               // addps         0x160a(%rip),%xmm9        # 6e00 <_sk_callback_sse41+0x151f>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -29829,16 +30918,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,29,21,0,0                  // addps         0x151d(%rip),%xmm1        # 6ab0 <_sk_callback_sse41+0x1454>
-  .byte  68,15,40,13,37,21,0,0               // movaps        0x1525(%rip),%xmm9        # 6ac0 <_sk_callback_sse41+0x1464>
+  .byte  15,88,13,248,21,0,0                 // addps         0x15f8(%rip),%xmm1        # 6e10 <_sk_callback_sse41+0x152f>
+  .byte  68,15,40,13,0,22,0,0                // movaps        0x1600(%rip),%xmm9        # 6e20 <_sk_callback_sse41+0x153f>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,41,21,0,0                // movaps        0x1529(%rip),%xmm8        # 6ad0 <_sk_callback_sse41+0x1474>
+  .byte  68,15,40,5,4,22,0,0                 // movaps        0x1604(%rip),%xmm8        # 6e30 <_sk_callback_sse41+0x154f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,45,21,0,0                // addps         0x152d(%rip),%xmm8        # 6ae0 <_sk_callback_sse41+0x1484>
+  .byte  68,15,88,5,8,22,0,0                 // addps         0x1608(%rip),%xmm8        # 6e40 <_sk_callback_sse41+0x155f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,49,21,0,0                // addps         0x1531(%rip),%xmm8        # 6af0 <_sk_callback_sse41+0x1494>
+  .byte  68,15,88,5,12,22,0,0                // addps         0x160c(%rip),%xmm8        # 6e50 <_sk_callback_sse41+0x156f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,53,21,0,0                // addps         0x1535(%rip),%xmm8        # 6b00 <_sk_callback_sse41+0x14a4>
+  .byte  68,15,88,5,16,22,0,0                // addps         0x1610(%rip),%xmm8        # 6e60 <_sk_callback_sse41+0x157f>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -29848,17 +30937,17 @@
 FUNCTION(_sk_bicubic_p1y_sse41)
 _sk_bicubic_p1y_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,47,21,0,0                // movaps        0x152f(%rip),%xmm8        # 6b10 <_sk_callback_sse41+0x14b4>
+  .byte  68,15,40,5,10,22,0,0                // movaps        0x160a(%rip),%xmm8        # 6e70 <_sk_callback_sse41+0x158f>
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,72,96                      // movups        0x60(%rax),%xmm9
   .byte  65,15,88,200                        // addps         %xmm8,%xmm1
-  .byte  68,15,40,21,42,21,0,0               // movaps        0x152a(%rip),%xmm10        # 6b20 <_sk_callback_sse41+0x14c4>
+  .byte  68,15,40,21,5,22,0,0                // movaps        0x1605(%rip),%xmm10        # 6e80 <_sk_callback_sse41+0x159f>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,46,21,0,0               // addps         0x152e(%rip),%xmm10        # 6b30 <_sk_callback_sse41+0x14d4>
+  .byte  68,15,88,21,9,22,0,0                // addps         0x1609(%rip),%xmm10        # 6e90 <_sk_callback_sse41+0x15af>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,42,21,0,0               // addps         0x152a(%rip),%xmm10        # 6b40 <_sk_callback_sse41+0x14e4>
+  .byte  68,15,88,21,5,22,0,0                // addps         0x1605(%rip),%xmm10        # 6ea0 <_sk_callback_sse41+0x15bf>
   .byte  68,15,17,144,160,0,0,0              // movups        %xmm10,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -29870,11 +30959,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,28,21,0,0                  // addps         0x151c(%rip),%xmm1        # 6b50 <_sk_callback_sse41+0x14f4>
+  .byte  15,88,13,247,21,0,0                 // addps         0x15f7(%rip),%xmm1        # 6eb0 <_sk_callback_sse41+0x15cf>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,28,21,0,0                // mulps         0x151c(%rip),%xmm8        # 6b60 <_sk_callback_sse41+0x1504>
-  .byte  68,15,88,5,36,21,0,0                // addps         0x1524(%rip),%xmm8        # 6b70 <_sk_callback_sse41+0x1514>
+  .byte  68,15,89,5,247,21,0,0               // mulps         0x15f7(%rip),%xmm8        # 6ec0 <_sk_callback_sse41+0x15df>
+  .byte  68,15,88,5,255,21,0,0               // addps         0x15ff(%rip),%xmm8        # 6ed0 <_sk_callback_sse41+0x15ef>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -30104,11 +31193,11 @@
   .byte  128,191,0,0,128,191,0               // cmpb          $0x0,-0x40800000(%rdi)
   .byte  0,224                               // add           %ah,%al
   .byte  64,0,0                              // add           %al,(%rax)
-  .byte  224,64                              // loopne        5928 <.literal16+0x1d8>
+  .byte  224,64                              // loopne        5bb8 <.literal16+0x1d8>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,64                              // loopne        592c <.literal16+0x1dc>
+  .byte  224,64                              // loopne        5bbc <.literal16+0x1dc>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,64                              // loopne        5930 <.literal16+0x1e0>
+  .byte  224,64                              // loopne        5bc0 <.literal16+0x1e0>
   .byte  154                                 // (bad)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
@@ -30128,13 +31217,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5951 <.literal16+0x201>
+  .byte  71,225,61                           // rex.RXB       loope 5be1 <.literal16+0x201>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5955 <.literal16+0x205>
+  .byte  71,225,61                           // rex.RXB       loope 5be5 <.literal16+0x205>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5959 <.literal16+0x209>
+  .byte  71,225,61                           // rex.RXB       loope 5be9 <.literal16+0x209>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 595d <.literal16+0x20d>
+  .byte  71,225,61                           // rex.RXB       loope 5bed <.literal16+0x20d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -30159,13 +31248,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5991 <.literal16+0x241>
+  .byte  71,225,61                           // rex.RXB       loope 5c21 <.literal16+0x241>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5995 <.literal16+0x245>
+  .byte  71,225,61                           // rex.RXB       loope 5c25 <.literal16+0x245>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5999 <.literal16+0x249>
+  .byte  71,225,61                           // rex.RXB       loope 5c29 <.literal16+0x249>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 599d <.literal16+0x24d>
+  .byte  71,225,61                           // rex.RXB       loope 5c2d <.literal16+0x24d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -30190,13 +31279,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 59d1 <.literal16+0x281>
+  .byte  71,225,61                           // rex.RXB       loope 5c61 <.literal16+0x281>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 59d5 <.literal16+0x285>
+  .byte  71,225,61                           // rex.RXB       loope 5c65 <.literal16+0x285>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 59d9 <.literal16+0x289>
+  .byte  71,225,61                           // rex.RXB       loope 5c69 <.literal16+0x289>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 59dd <.literal16+0x28d>
+  .byte  71,225,61                           // rex.RXB       loope 5c6d <.literal16+0x28d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -30221,13 +31310,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5a11 <.literal16+0x2c1>
+  .byte  71,225,61                           // rex.RXB       loope 5ca1 <.literal16+0x2c1>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5a15 <.literal16+0x2c5>
+  .byte  71,225,61                           // rex.RXB       loope 5ca5 <.literal16+0x2c5>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5a19 <.literal16+0x2c9>
+  .byte  71,225,61                           // rex.RXB       loope 5ca9 <.literal16+0x2c9>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5a1d <.literal16+0x2cd>
+  .byte  71,225,61                           // rex.RXB       loope 5cad <.literal16+0x2cd>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -30244,10 +31333,10 @@
   .byte  0,1                                 // add           %al,(%rcx)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005a08 <_sk_callback_sse41+0xa0003ac>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005c98 <_sk_callback_sse41+0xa0003b7>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3005a10 <_sk_callback_sse41+0x30003b4>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3005ca0 <_sk_callback_sse41+0x30003bf>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -30266,11 +31355,11 @@
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,127                    // add           %al,0x7f00003f(%rax)
   .byte  67,0,0                              // rex.XB        add %al,(%r8)
-  .byte  127,67                              // jg            5a7b <.literal16+0x32b>
+  .byte  127,67                              // jg            5d0b <.literal16+0x32b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            5a7f <.literal16+0x32f>
+  .byte  127,67                              // jg            5d0f <.literal16+0x32f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            5a83 <.literal16+0x333>
+  .byte  127,67                              // jg            5d13 <.literal16+0x333>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -30552,13 +31641,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        5cb9 <.literal16+0x569>
+  .byte  224,7                               // loopne        5f49 <.literal16+0x569>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        5cbd <.literal16+0x56d>
+  .byte  224,7                               // loopne        5f4d <.literal16+0x56d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        5cc1 <.literal16+0x571>
+  .byte  224,7                               // loopne        5f51 <.literal16+0x571>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        5cc5 <.literal16+0x575>
+  .byte  224,7                               // loopne        5f55 <.literal16+0x575>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -30592,10 +31681,10 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005d08 <_sk_callback_sse41+0xa0006ac>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005f98 <_sk_callback_sse41+0xa0006b7>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3005d10 <_sk_callback_sse41+0x30006b4>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3005fa0 <_sk_callback_sse41+0x30006bf>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -30650,11 +31739,11 @@
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            5ddb <.literal16+0x68b>
+  .byte  127,67                              // jg            606b <.literal16+0x68b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            5ddf <.literal16+0x68f>
+  .byte  127,67                              // jg            606f <.literal16+0x68f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            5de3 <.literal16+0x693>
+  .byte  127,67                              // jg            6073 <.literal16+0x693>
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,129                          // cmpb          $0x81,(%rbx)
   .byte  128,128,59,129,128,128,59           // addb          $0x3b,-0x7f7f7ec5(%rax)
@@ -30669,16 +31758,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5dd4 <.literal16+0x684>
+  .byte  127,0                               // jg            6064 <.literal16+0x684>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5dd8 <.literal16+0x688>
+  .byte  127,0                               // jg            6068 <.literal16+0x688>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5ddc <.literal16+0x68c>
+  .byte  127,0                               // jg            606c <.literal16+0x68c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5de0 <.literal16+0x690>
+  .byte  127,0                               // jg            6070 <.literal16+0x690>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -30687,7 +31776,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            5e65 <.literal16+0x715>
+  .byte  119,115                             // ja            60f5 <.literal16+0x715>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -30698,7 +31787,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           5dc9 <.literal16+0x679>
+  .byte  117,191                             // jne           6059 <.literal16+0x679>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -30710,7 +31799,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a39e0a <_sk_callback_sse41+0xffffffffe9a347ae>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a09a <_sk_callback_sse41+0xffffffffe9a347b9>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -30765,16 +31854,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5ea4 <.literal16+0x754>
+  .byte  127,0                               // jg            6134 <.literal16+0x754>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5ea8 <.literal16+0x758>
+  .byte  127,0                               // jg            6138 <.literal16+0x758>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5eac <.literal16+0x75c>
+  .byte  127,0                               // jg            613c <.literal16+0x75c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5eb0 <.literal16+0x760>
+  .byte  127,0                               // jg            6140 <.literal16+0x760>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -30783,7 +31872,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            5f35 <.literal16+0x7e5>
+  .byte  119,115                             // ja            61c5 <.literal16+0x7e5>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -30794,7 +31883,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           5e99 <.literal16+0x749>
+  .byte  117,191                             // jne           6129 <.literal16+0x749>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -30806,7 +31895,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a39eda <_sk_callback_sse41+0xffffffffe9a3487e>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a16a <_sk_callback_sse41+0xffffffffe9a34889>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -30861,16 +31950,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5f74 <.literal16+0x824>
+  .byte  127,0                               // jg            6204 <.literal16+0x824>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5f78 <.literal16+0x828>
+  .byte  127,0                               // jg            6208 <.literal16+0x828>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5f7c <.literal16+0x82c>
+  .byte  127,0                               // jg            620c <.literal16+0x82c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5f80 <.literal16+0x830>
+  .byte  127,0                               // jg            6210 <.literal16+0x830>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -30879,7 +31968,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            6005 <.literal16+0x8b5>
+  .byte  119,115                             // ja            6295 <.literal16+0x8b5>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -30890,7 +31979,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           5f69 <.literal16+0x819>
+  .byte  117,191                             // jne           61f9 <.literal16+0x819>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -30902,7 +31991,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a39faa <_sk_callback_sse41+0xffffffffe9a3494e>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a23a <_sk_callback_sse41+0xffffffffe9a34959>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -30957,16 +32046,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6044 <.literal16+0x8f4>
+  .byte  127,0                               // jg            62d4 <.literal16+0x8f4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6048 <.literal16+0x8f8>
+  .byte  127,0                               // jg            62d8 <.literal16+0x8f8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            604c <.literal16+0x8fc>
+  .byte  127,0                               // jg            62dc <.literal16+0x8fc>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6050 <.literal16+0x900>
+  .byte  127,0                               // jg            62e0 <.literal16+0x900>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -30975,7 +32064,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            60d5 <.literal16+0x985>
+  .byte  119,115                             // ja            6365 <.literal16+0x985>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -30986,7 +32075,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6039 <.literal16+0x8e9>
+  .byte  117,191                             // jne           62c9 <.literal16+0x8e9>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -30998,7 +32087,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a07a <_sk_callback_sse41+0xffffffffe9a34a1e>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a30a <_sk_callback_sse41+0xffffffffe9a34a29>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -31049,13 +32138,13 @@
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
-  .byte  127,67                              // jg            6157 <.literal16+0xa07>
+  .byte  127,67                              // jg            63e7 <.literal16+0xa07>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            615b <.literal16+0xa0b>
+  .byte  127,67                              // jg            63eb <.literal16+0xa0b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            615f <.literal16+0xa0f>
+  .byte  127,67                              // jg            63ef <.literal16+0xa0f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6163 <.literal16+0xa13>
+  .byte  127,67                              // jg            63f3 <.literal16+0xa13>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%rax)
@@ -31102,16 +32191,16 @@
   .byte  128,3,62                            // addb          $0x3e,(%rbx)
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           61e3 <.literal16+0xa93>
+  .byte  118,63                              // jbe           6473 <.literal16+0xa93>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           61e7 <.literal16+0xa97>
+  .byte  118,63                              // jbe           6477 <.literal16+0xa97>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           61eb <.literal16+0xa9b>
+  .byte  118,63                              // jbe           647b <.literal16+0xa9b>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           61ef <.literal16+0xa9f>
+  .byte  118,63                              // jbe           647f <.literal16+0xa9f>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
@@ -31140,11 +32229,11 @@
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            625b <.literal16+0xb0b>
+  .byte  127,67                              // jg            64eb <.literal16+0xb0b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            625f <.literal16+0xb0f>
+  .byte  127,67                              // jg            64ef <.literal16+0xb0f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6263 <.literal16+0xb13>
+  .byte  127,67                              // jg            64f3 <.literal16+0xb13>
   .byte  0,4,0                               // add           %al,(%rax,%rax,1)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,0                                 // add           %al,(%rax)
@@ -31202,7 +32291,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 30062e0 <_sk_callback_sse41+0x3000c84>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006570 <_sk_callback_sse41+0x3000c8f>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -31231,13 +32320,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6319 <.literal16+0xbc9>
+  .byte  224,7                               // loopne        65a9 <.literal16+0xbc9>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        631d <.literal16+0xbcd>
+  .byte  224,7                               // loopne        65ad <.literal16+0xbcd>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6321 <.literal16+0xbd1>
+  .byte  224,7                               // loopne        65b1 <.literal16+0xbd1>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6325 <.literal16+0xbd5>
+  .byte  224,7                               // loopne        65b5 <.literal16+0xbd5>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -31283,13 +32372,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6389 <.literal16+0xc39>
+  .byte  224,7                               // loopne        6619 <.literal16+0xc39>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        638d <.literal16+0xc3d>
+  .byte  224,7                               // loopne        661d <.literal16+0xc3d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6391 <.literal16+0xc41>
+  .byte  224,7                               // loopne        6621 <.literal16+0xc41>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6395 <.literal16+0xc45>
+  .byte  224,7                               // loopne        6625 <.literal16+0xc45>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -31335,13 +32424,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        63f9 <.literal16+0xca9>
+  .byte  224,7                               // loopne        6689 <.literal16+0xca9>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        63fd <.literal16+0xcad>
+  .byte  224,7                               // loopne        668d <.literal16+0xcad>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6401 <.literal16+0xcb1>
+  .byte  224,7                               // loopne        6691 <.literal16+0xcb1>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6405 <.literal16+0xcb5>
+  .byte  224,7                               // loopne        6695 <.literal16+0xcb5>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -31379,13 +32468,13 @@
   .byte  65,0,0                              // add           %al,(%r8)
   .byte  248                                 // clc
   .byte  65,0,0                              // add           %al,(%r8)
-  .byte  124,66                              // jl            6496 <.literal16+0xd46>
+  .byte  124,66                              // jl            6726 <.literal16+0xd46>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            649a <.literal16+0xd4a>
+  .byte  124,66                              // jl            672a <.literal16+0xd4a>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            649e <.literal16+0xd4e>
+  .byte  124,66                              // jl            672e <.literal16+0xd4e>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            64a2 <.literal16+0xd52>
+  .byte  124,66                              // jl            6732 <.literal16+0xd52>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,240                               // add           %dh,%al
@@ -31519,13 +32608,13 @@
   .byte  136,136,61,137,136,136              // mov           %cl,-0x777776c3(%rax)
   .byte  61,137,136,136,61                   // cmp           $0x3d888889,%eax
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6625 <.literal16+0xed5>
+  .byte  112,65                              // jo            68b5 <.literal16+0xed5>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6629 <.literal16+0xed9>
+  .byte  112,65                              // jo            68b9 <.literal16+0xed9>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            662d <.literal16+0xedd>
+  .byte  112,65                              // jo            68bd <.literal16+0xedd>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6631 <.literal16+0xee1>
+  .byte  112,65                              // jo            68c1 <.literal16+0xee1>
   .byte  255,0                               // incl          (%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  255,0                               // incl          (%rax)
@@ -31540,7 +32629,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006620 <_sk_callback_sse41+0x3000fc4>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 30068b0 <_sk_callback_sse41+0x3000fcf>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -31567,7 +32656,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006660 <_sk_callback_sse41+0x3001004>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 30068f0 <_sk_callback_sse41+0x300100f>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -31594,7 +32683,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 30066a0 <_sk_callback_sse41+0x3001044>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006930 <_sk_callback_sse41+0x300104f>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -31609,11 +32698,99 @@
   .byte  255,0                               // incl          (%rax)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            66fb <.literal16+0xfab>
+  .byte  127,67                              // jg            698b <.literal16+0xfab>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            66ff <.literal16+0xfaf>
+  .byte  127,67                              // jg            698f <.literal16+0xfaf>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6703 <.literal16+0xfb3>
+  .byte  127,67                              // jg            6993 <.literal16+0xfb3>
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
+  .byte  128,59,129                          // cmpb          $0x81,(%rbx)
+  .byte  128,128,59,1,255,255,255            // addb          $0xff,-0xfec5(%rax)
+  .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006980 <_sk_callback_sse41+0x300109f>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,6                               // incl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,10                              // decl          (%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,14                              // decl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
+  .byte  128,59,129                          // cmpb          $0x81,(%rbx)
+  .byte  128,128,59,1,255,255,255            // addb          $0xff,-0xfec5(%rax)
+  .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 30069c0 <_sk_callback_sse41+0x30010df>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,6                               // incl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,10                              // decl          (%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,14                              // decl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
+  .byte  128,59,129                          // cmpb          $0x81,(%rbx)
+  .byte  128,128,59,1,255,255,255            // addb          $0xff,-0xfec5(%rax)
+  .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006a00 <_sk_callback_sse41+0x300111f>
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,6                               // incl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,10                              // decl          (%rdx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,14                              // decl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,127,67                            // add           %bh,0x43(%rdi)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  127,67                              // jg            6a5b <.literal16+0x107b>
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  127,67                              // jg            6a5f <.literal16+0x107f>
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  127,67                              // jg            6a63 <.literal16+0x1083>
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%rax)
@@ -31708,13 +32885,13 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  255                                 // (bad)
-  .byte  127,71                              // jg            67fb <.literal16+0x10ab>
+  .byte  127,71                              // jg            6b5b <.literal16+0x117b>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            67ff <.literal16+0x10af>
+  .byte  127,71                              // jg            6b5f <.literal16+0x117f>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            6803 <.literal16+0x10b3>
+  .byte  127,71                              // jg            6b63 <.literal16+0x1183>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            6807 <.literal16+0x10b7>
+  .byte  127,71                              // jg            6b67 <.literal16+0x1187>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -31760,10 +32937,10 @@
   .byte  61,152,221,147,61                   // cmp           $0x3d93dd98,%eax
   .byte  152                                 // cwtl
   .byte  221,147,61,45,16,17                 // fstl          0x11102d3d(%rbx)
-  .byte  192,45,16,17,192,45,16              // shrb          $0x10,0x2dc01110(%rip)        # 2dc0793a <_sk_callback_sse41+0x2dc022de>
+  .byte  192,45,16,17,192,45,16              // shrb          $0x10,0x2dc01110(%rip)        # 2dc07c9a <_sk_callback_sse41+0x2dc023b9>
   .byte  17,192                              // adc           %eax,%eax
   .byte  45,16,17,192,18                     // sub           $0x12c01110,%eax
-  .byte  120,57                              // js            686c <.literal16+0x111c>
+  .byte  120,57                              // js            6bcc <.literal16+0x11ec>
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
@@ -31885,11 +33062,11 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,114                          // cmpb          $0x72,(%rdi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         69a2 <.literal16+0x1252>
+  .byte  62,114,28                           // jb,pt         6d02 <.literal16+0x1322>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         69a6 <.literal16+0x1256>
+  .byte  62,114,28                           // jb,pt         6d06 <.literal16+0x1326>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         69aa <.literal16+0x125a>
+  .byte  62,114,28                           // jb,pt         6d0a <.literal16+0x132a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -31933,7 +33110,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63f835 <_sk_callback_sse41+0x3d63a1d9>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63fb95 <_sk_callback_sse41+0x3d63a2b4>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -31959,7 +33136,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63f875 <_sk_callback_sse41+0x3d63a219>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63fbd5 <_sk_callback_sse41+0x3d63a2f4>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -31968,13 +33145,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
-  .byte  114,28                              // jb            6a6e <.literal16+0x131e>
+  .byte  114,28                              // jb            6dce <.literal16+0x13ee>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6a72 <.literal16+0x1322>
+  .byte  62,114,28                           // jb,pt         6dd2 <.literal16+0x13f2>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6a76 <.literal16+0x1326>
+  .byte  62,114,28                           // jb,pt         6dd6 <.literal16+0x13f6>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6a7a <.literal16+0x132a>
+  .byte  62,114,28                           // jb,pt         6dda <.literal16+0x13fa>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -31995,11 +33172,11 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,114                          // cmpb          $0x72,(%rdi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         6ab2 <.literal16+0x1362>
+  .byte  62,114,28                           // jb,pt         6e12 <.literal16+0x1432>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6ab6 <.literal16+0x1366>
+  .byte  62,114,28                           // jb,pt         6e16 <.literal16+0x1436>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6aba <.literal16+0x136a>
+  .byte  62,114,28                           // jb,pt         6e1a <.literal16+0x143a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -32043,7 +33220,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63f945 <_sk_callback_sse41+0x3d63a2e9>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63fca5 <_sk_callback_sse41+0x3d63a3c4>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -32069,7 +33246,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63f985 <_sk_callback_sse41+0x3d63a329>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63fce5 <_sk_callback_sse41+0x3d63a404>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -32078,13 +33255,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
-  .byte  114,28                              // jb            6b7e <.literal16+0x142e>
+  .byte  114,28                              // jb            6ede <.literal16+0x14fe>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6b82 <_sk_callback_sse41+0x1526>
+  .byte  62,114,28                           // jb,pt         6ee2 <_sk_callback_sse41+0x1601>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6b86 <_sk_callback_sse41+0x152a>
+  .byte  62,114,28                           // jb,pt         6ee6 <_sk_callback_sse41+0x1605>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6b8a <_sk_callback_sse41+0x152e>
+  .byte  62,114,28                           // jb,pt         6eea <_sk_callback_sse41+0x1609>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -32176,7 +33353,7 @@
   .byte  102,15,110,194                      // movd          %edx,%xmm0
   .byte  102,15,112,192,0                    // pshufd        $0x0,%xmm0,%xmm0
   .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
-  .byte  15,40,21,159,91,0,0                 // movaps        0x5b9f(%rip),%xmm2        # 5c40 <_sk_callback_sse2+0xf5>
+  .byte  15,40,21,95,94,0,0                  // movaps        0x5e5f(%rip),%xmm2        # 5f00 <_sk_callback_sse2+0xf2>
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,16,7                             // movups        (%rdi),%xmm0
   .byte  15,88,193                           // addps         %xmm1,%xmm0
@@ -32185,7 +33362,7 @@
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,21,142,91,0,0                 // movaps        0x5b8e(%rip),%xmm2        # 5c50 <_sk_callback_sse2+0x105>
+  .byte  15,40,21,78,94,0,0                  // movaps        0x5e4e(%rip),%xmm2        # 5f10 <_sk_callback_sse2+0x102>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  15,87,237                           // xorps         %xmm5,%xmm5
@@ -32205,14 +33382,14 @@
   .byte  102,68,15,110,193                   // movd          %ecx,%xmm8
   .byte  102,69,15,112,192,0                 // pshufd        $0x0,%xmm8,%xmm8
   .byte  102,69,15,239,193                   // pxor          %xmm9,%xmm8
-  .byte  102,68,15,111,21,92,91,0,0          // movdqa        0x5b5c(%rip),%xmm10        # 5c60 <_sk_callback_sse2+0x115>
+  .byte  102,68,15,111,21,28,94,0,0          // movdqa        0x5e1c(%rip),%xmm10        # 5f20 <_sk_callback_sse2+0x112>
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
   .byte  102,69,15,219,218                   // pand          %xmm10,%xmm11
   .byte  102,65,15,114,243,5                 // pslld         $0x5,%xmm11
   .byte  102,69,15,219,209                   // pand          %xmm9,%xmm10
   .byte  102,65,15,114,242,4                 // pslld         $0x4,%xmm10
-  .byte  102,68,15,111,37,72,91,0,0          // movdqa        0x5b48(%rip),%xmm12        # 5c70 <_sk_callback_sse2+0x125>
-  .byte  102,68,15,111,45,79,91,0,0          // movdqa        0x5b4f(%rip),%xmm13        # 5c80 <_sk_callback_sse2+0x135>
+  .byte  102,68,15,111,37,8,94,0,0           // movdqa        0x5e08(%rip),%xmm12        # 5f30 <_sk_callback_sse2+0x122>
+  .byte  102,68,15,111,45,15,94,0,0          // movdqa        0x5e0f(%rip),%xmm13        # 5f40 <_sk_callback_sse2+0x132>
   .byte  102,69,15,111,240                   // movdqa        %xmm8,%xmm14
   .byte  102,69,15,219,245                   // pand          %xmm13,%xmm14
   .byte  102,65,15,114,246,2                 // pslld         $0x2,%xmm14
@@ -32228,8 +33405,8 @@
   .byte  102,69,15,235,245                   // por           %xmm13,%xmm14
   .byte  102,69,15,235,240                   // por           %xmm8,%xmm14
   .byte  69,15,91,198                        // cvtdq2ps      %xmm14,%xmm8
-  .byte  68,15,89,5,10,91,0,0                // mulps         0x5b0a(%rip),%xmm8        # 5c90 <_sk_callback_sse2+0x145>
-  .byte  68,15,88,5,18,91,0,0                // addps         0x5b12(%rip),%xmm8        # 5ca0 <_sk_callback_sse2+0x155>
+  .byte  68,15,89,5,202,93,0,0               // mulps         0x5dca(%rip),%xmm8        # 5f50 <_sk_callback_sse2+0x142>
+  .byte  68,15,88,5,210,93,0,0               // addps         0x5dd2(%rip),%xmm8        # 5f60 <_sk_callback_sse2+0x152>
   .byte  243,68,15,16,16                     // movss         (%rax),%xmm10
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
@@ -32306,7 +33483,7 @@
 FUNCTION(_sk_srcatop_sse2)
 _sk_srcatop_sse2:
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
-  .byte  68,15,40,5,108,90,0,0               // movaps        0x5a6c(%rip),%xmm8        # 5cb0 <_sk_callback_sse2+0x165>
+  .byte  68,15,40,5,44,93,0,0                // movaps        0x5d2c(%rip),%xmm8        # 5f70 <_sk_callback_sse2+0x162>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -32331,7 +33508,7 @@
 _sk_dstatop_sse2:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
   .byte  68,15,89,196                        // mulps         %xmm4,%xmm8
-  .byte  68,15,40,13,47,90,0,0               // movaps        0x5a2f(%rip),%xmm9        # 5cc0 <_sk_callback_sse2+0x175>
+  .byte  68,15,40,13,239,92,0,0              // movaps        0x5cef(%rip),%xmm9        # 5f80 <_sk_callback_sse2+0x172>
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
@@ -32378,7 +33555,7 @@
 .globl _sk_srcout_sse2
 FUNCTION(_sk_srcout_sse2)
 _sk_srcout_sse2:
-  .byte  68,15,40,5,211,89,0,0               // movaps        0x59d3(%rip),%xmm8        # 5cd0 <_sk_callback_sse2+0x185>
+  .byte  68,15,40,5,147,92,0,0               // movaps        0x5c93(%rip),%xmm8        # 5f90 <_sk_callback_sse2+0x182>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
@@ -32391,7 +33568,7 @@
 .globl _sk_dstout_sse2
 FUNCTION(_sk_dstout_sse2)
 _sk_dstout_sse2:
-  .byte  68,15,40,5,195,89,0,0               // movaps        0x59c3(%rip),%xmm8        # 5ce0 <_sk_callback_sse2+0x195>
+  .byte  68,15,40,5,131,92,0,0               // movaps        0x5c83(%rip),%xmm8        # 5fa0 <_sk_callback_sse2+0x192>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
@@ -32408,7 +33585,7 @@
 .globl _sk_srcover_sse2
 FUNCTION(_sk_srcover_sse2)
 _sk_srcover_sse2:
-  .byte  68,15,40,5,166,89,0,0               // movaps        0x59a6(%rip),%xmm8        # 5cf0 <_sk_callback_sse2+0x1a5>
+  .byte  68,15,40,5,102,92,0,0               // movaps        0x5c66(%rip),%xmm8        # 5fb0 <_sk_callback_sse2+0x1a2>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -32428,7 +33605,7 @@
 .globl _sk_dstover_sse2
 FUNCTION(_sk_dstover_sse2)
 _sk_dstover_sse2:
-  .byte  68,15,40,5,122,89,0,0               // movaps        0x597a(%rip),%xmm8        # 5d00 <_sk_callback_sse2+0x1b5>
+  .byte  68,15,40,5,58,92,0,0                // movaps        0x5c3a(%rip),%xmm8        # 5fc0 <_sk_callback_sse2+0x1b2>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -32456,7 +33633,7 @@
 .globl _sk_multiply_sse2
 FUNCTION(_sk_multiply_sse2)
 _sk_multiply_sse2:
-  .byte  68,15,40,5,78,89,0,0                // movaps        0x594e(%rip),%xmm8        # 5d10 <_sk_callback_sse2+0x1c5>
+  .byte  68,15,40,5,14,92,0,0                // movaps        0x5c0e(%rip),%xmm8        # 5fd0 <_sk_callback_sse2+0x1c2>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
@@ -32531,7 +33708,7 @@
 FUNCTION(_sk_xor__sse2)
 _sk_xor__sse2:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
-  .byte  15,40,29,131,88,0,0                 // movaps        0x5883(%rip),%xmm3        # 5d20 <_sk_callback_sse2+0x1d5>
+  .byte  15,40,29,67,91,0,0                  // movaps        0x5b43(%rip),%xmm3        # 5fe0 <_sk_callback_sse2+0x1d2>
   .byte  68,15,40,203                        // movaps        %xmm3,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
@@ -32579,7 +33756,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,95,209                        // maxps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,238,87,0,0                 // movaps        0x57ee(%rip),%xmm2        # 5d30 <_sk_callback_sse2+0x1e5>
+  .byte  15,40,21,174,90,0,0                 // movaps        0x5aae(%rip),%xmm2        # 5ff0 <_sk_callback_sse2+0x1e2>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -32613,7 +33790,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,147,87,0,0                 // movaps        0x5793(%rip),%xmm2        # 5d40 <_sk_callback_sse2+0x1f5>
+  .byte  15,40,21,83,90,0,0                  // movaps        0x5a53(%rip),%xmm2        # 6000 <_sk_callback_sse2+0x1f2>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -32650,7 +33827,7 @@
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,45,87,0,0                  // movaps        0x572d(%rip),%xmm2        # 5d50 <_sk_callback_sse2+0x205>
+  .byte  15,40,21,237,89,0,0                 // movaps        0x59ed(%rip),%xmm2        # 6010 <_sk_callback_sse2+0x202>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -32678,7 +33855,7 @@
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,237,86,0,0                 // movaps        0x56ed(%rip),%xmm2        # 5d60 <_sk_callback_sse2+0x215>
+  .byte  15,40,21,173,89,0,0                 // movaps        0x59ad(%rip),%xmm2        # 6020 <_sk_callback_sse2+0x212>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -32691,7 +33868,7 @@
 FUNCTION(_sk_colorburn_sse2)
 _sk_colorburn_sse2:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,21,224,86,0,0              // movaps        0x56e0(%rip),%xmm10        # 5d70 <_sk_callback_sse2+0x225>
+  .byte  68,15,40,21,160,89,0,0              // movaps        0x59a0(%rip),%xmm10        # 6030 <_sk_callback_sse2+0x222>
   .byte  69,15,40,202                        // movaps        %xmm10,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  69,15,40,217                        // movaps        %xmm9,%xmm11
@@ -32785,7 +33962,7 @@
 FUNCTION(_sk_colordodge_sse2)
 _sk_colordodge_sse2:
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
-  .byte  68,15,40,21,150,85,0,0              // movaps        0x5596(%rip),%xmm10        # 5d80 <_sk_callback_sse2+0x235>
+  .byte  68,15,40,21,86,88,0,0               // movaps        0x5856(%rip),%xmm10        # 6040 <_sk_callback_sse2+0x232>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  69,15,40,227                        // movaps        %xmm11,%xmm12
@@ -32879,7 +34056,7 @@
   .byte  15,41,116,36,232                    // movaps        %xmm6,-0x18(%rsp)
   .byte  15,40,245                           // movaps        %xmm5,%xmm6
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
-  .byte  68,15,40,29,75,84,0,0               // movaps        0x544b(%rip),%xmm11        # 5d90 <_sk_callback_sse2+0x245>
+  .byte  68,15,40,29,11,87,0,0               // movaps        0x570b(%rip),%xmm11        # 6050 <_sk_callback_sse2+0x242>
   .byte  69,15,40,211                        // movaps        %xmm11,%xmm10
   .byte  68,15,92,215                        // subps         %xmm7,%xmm10
   .byte  69,15,40,194                        // movaps        %xmm10,%xmm8
@@ -32967,7 +34144,7 @@
 _sk_overlay_sse2:
   .byte  68,15,40,193                        // movaps        %xmm1,%xmm8
   .byte  68,15,40,232                        // movaps        %xmm0,%xmm13
-  .byte  68,15,40,13,25,83,0,0               // movaps        0x5319(%rip),%xmm9        # 5da0 <_sk_callback_sse2+0x255>
+  .byte  68,15,40,13,217,85,0,0              // movaps        0x55d9(%rip),%xmm9        # 6060 <_sk_callback_sse2+0x252>
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
   .byte  68,15,92,215                        // subps         %xmm7,%xmm10
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
@@ -33058,7 +34235,7 @@
   .byte  68,15,40,213                        // movaps        %xmm5,%xmm10
   .byte  68,15,94,215                        // divps         %xmm7,%xmm10
   .byte  69,15,84,212                        // andps         %xmm12,%xmm10
-  .byte  68,15,40,13,214,81,0,0              // movaps        0x51d6(%rip),%xmm9        # 5db0 <_sk_callback_sse2+0x265>
+  .byte  68,15,40,13,150,84,0,0              // movaps        0x5496(%rip),%xmm9        # 6070 <_sk_callback_sse2+0x262>
   .byte  69,15,40,249                        // movaps        %xmm9,%xmm15
   .byte  69,15,92,250                        // subps         %xmm10,%xmm15
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
@@ -33071,10 +34248,10 @@
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  65,15,88,194                        // addps         %xmm10,%xmm0
-  .byte  68,15,40,53,176,81,0,0              // movaps        0x51b0(%rip),%xmm14        # 5dc0 <_sk_callback_sse2+0x275>
+  .byte  68,15,40,53,112,84,0,0              // movaps        0x5470(%rip),%xmm14        # 6080 <_sk_callback_sse2+0x272>
   .byte  69,15,88,222                        // addps         %xmm14,%xmm11
   .byte  68,15,89,216                        // mulps         %xmm0,%xmm11
-  .byte  68,15,40,21,176,81,0,0              // movaps        0x51b0(%rip),%xmm10        # 5dd0 <_sk_callback_sse2+0x285>
+  .byte  68,15,40,21,112,84,0,0              // movaps        0x5470(%rip),%xmm10        # 6090 <_sk_callback_sse2+0x282>
   .byte  69,15,89,234                        // mulps         %xmm10,%xmm13
   .byte  69,15,88,235                        // addps         %xmm11,%xmm13
   .byte  15,88,228                           // addps         %xmm4,%xmm4
@@ -33219,7 +34396,7 @@
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
   .byte  68,15,40,225                        // movaps        %xmm1,%xmm12
   .byte  68,15,89,211                        // mulps         %xmm3,%xmm10
-  .byte  68,15,40,5,243,79,0,0               // movaps        0x4ff3(%rip),%xmm8        # 5e10 <_sk_callback_sse2+0x2c5>
+  .byte  68,15,40,5,179,82,0,0               // movaps        0x52b3(%rip),%xmm8        # 60d0 <_sk_callback_sse2+0x2c2>
   .byte  69,15,40,216                        // movaps        %xmm8,%xmm11
   .byte  15,40,207                           // movaps        %xmm7,%xmm1
   .byte  68,15,92,217                        // subps         %xmm1,%xmm11
@@ -33267,12 +34444,12 @@
   .byte  69,15,84,206                        // andps         %xmm14,%xmm9
   .byte  69,15,84,214                        // andps         %xmm14,%xmm10
   .byte  65,15,84,214                        // andps         %xmm14,%xmm2
-  .byte  68,15,40,61,0,79,0,0                // movaps        0x4f00(%rip),%xmm15        # 5de0 <_sk_callback_sse2+0x295>
+  .byte  68,15,40,61,192,81,0,0              // movaps        0x51c0(%rip),%xmm15        # 60a0 <_sk_callback_sse2+0x292>
   .byte  65,15,89,231                        // mulps         %xmm15,%xmm4
-  .byte  15,40,5,5,79,0,0                    // movaps        0x4f05(%rip),%xmm0        # 5df0 <_sk_callback_sse2+0x2a5>
+  .byte  15,40,5,197,81,0,0                  // movaps        0x51c5(%rip),%xmm0        # 60b0 <_sk_callback_sse2+0x2a2>
   .byte  15,89,240                           // mulps         %xmm0,%xmm6
   .byte  15,88,244                           // addps         %xmm4,%xmm6
-  .byte  68,15,40,53,7,79,0,0                // movaps        0x4f07(%rip),%xmm14        # 5e00 <_sk_callback_sse2+0x2b5>
+  .byte  68,15,40,53,199,81,0,0              // movaps        0x51c7(%rip),%xmm14        # 60c0 <_sk_callback_sse2+0x2b2>
   .byte  68,15,40,239                        // movaps        %xmm7,%xmm13
   .byte  69,15,89,238                        // mulps         %xmm14,%xmm13
   .byte  68,15,88,238                        // addps         %xmm6,%xmm13
@@ -33450,14 +34627,14 @@
   .byte  68,15,84,211                        // andps         %xmm3,%xmm10
   .byte  68,15,84,203                        // andps         %xmm3,%xmm9
   .byte  15,84,195                           // andps         %xmm3,%xmm0
-  .byte  68,15,40,5,153,76,0,0               // movaps        0x4c99(%rip),%xmm8        # 5e20 <_sk_callback_sse2+0x2d5>
+  .byte  68,15,40,5,89,79,0,0                // movaps        0x4f59(%rip),%xmm8        # 60e0 <_sk_callback_sse2+0x2d2>
   .byte  15,40,214                           // movaps        %xmm6,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
-  .byte  15,40,13,155,76,0,0                 // movaps        0x4c9b(%rip),%xmm1        # 5e30 <_sk_callback_sse2+0x2e5>
+  .byte  15,40,13,91,79,0,0                  // movaps        0x4f5b(%rip),%xmm1        # 60f0 <_sk_callback_sse2+0x2e2>
   .byte  15,40,221                           // movaps        %xmm5,%xmm3
   .byte  15,89,217                           // mulps         %xmm1,%xmm3
   .byte  15,88,218                           // addps         %xmm2,%xmm3
-  .byte  68,15,40,37,154,76,0,0              // movaps        0x4c9a(%rip),%xmm12        # 5e40 <_sk_callback_sse2+0x2f5>
+  .byte  68,15,40,37,90,79,0,0               // movaps        0x4f5a(%rip),%xmm12        # 6100 <_sk_callback_sse2+0x2f2>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
   .byte  68,15,88,235                        // addps         %xmm3,%xmm13
   .byte  65,15,40,210                        // movaps        %xmm10,%xmm2
@@ -33502,7 +34679,7 @@
   .byte  15,40,223                           // movaps        %xmm7,%xmm3
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
   .byte  15,89,221                           // mulps         %xmm5,%xmm3
-  .byte  68,15,40,5,255,75,0,0               // movaps        0x4bff(%rip),%xmm8        # 5e50 <_sk_callback_sse2+0x305>
+  .byte  68,15,40,5,191,78,0,0               // movaps        0x4ebf(%rip),%xmm8        # 6110 <_sk_callback_sse2+0x302>
   .byte  65,15,40,224                        // movaps        %xmm8,%xmm4
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  15,88,253                           // addps         %xmm5,%xmm7
@@ -33603,14 +34780,14 @@
   .byte  68,15,40,213                        // movaps        %xmm5,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
   .byte  65,15,40,208                        // movaps        %xmm8,%xmm2
-  .byte  68,15,40,45,157,74,0,0              // movaps        0x4a9d(%rip),%xmm13        # 5e60 <_sk_callback_sse2+0x315>
+  .byte  68,15,40,45,93,77,0,0               // movaps        0x4d5d(%rip),%xmm13        # 6120 <_sk_callback_sse2+0x312>
   .byte  68,15,40,198                        // movaps        %xmm6,%xmm8
   .byte  69,15,89,197                        // mulps         %xmm13,%xmm8
-  .byte  68,15,40,53,157,74,0,0              // movaps        0x4a9d(%rip),%xmm14        # 5e70 <_sk_callback_sse2+0x325>
+  .byte  68,15,40,53,93,77,0,0               // movaps        0x4d5d(%rip),%xmm14        # 6130 <_sk_callback_sse2+0x322>
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  65,15,89,198                        // mulps         %xmm14,%xmm0
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,29,153,74,0,0              // movaps        0x4a99(%rip),%xmm11        # 5e80 <_sk_callback_sse2+0x335>
+  .byte  68,15,40,29,89,77,0,0               // movaps        0x4d59(%rip),%xmm11        # 6140 <_sk_callback_sse2+0x332>
   .byte  69,15,89,227                        // mulps         %xmm11,%xmm12
   .byte  68,15,88,224                        // addps         %xmm0,%xmm12
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
@@ -33618,7 +34795,7 @@
   .byte  69,15,40,250                        // movaps        %xmm10,%xmm15
   .byte  69,15,89,254                        // mulps         %xmm14,%xmm15
   .byte  68,15,88,248                        // addps         %xmm0,%xmm15
-  .byte  68,15,40,5,133,74,0,0               // movaps        0x4a85(%rip),%xmm8        # 5e90 <_sk_callback_sse2+0x345>
+  .byte  68,15,40,5,69,77,0,0                // movaps        0x4d45(%rip),%xmm8        # 6150 <_sk_callback_sse2+0x342>
   .byte  65,15,40,224                        // movaps        %xmm8,%xmm4
   .byte  15,92,226                           // subps         %xmm2,%xmm4
   .byte  15,89,252                           // mulps         %xmm4,%xmm7
@@ -33754,15 +34931,15 @@
   .byte  68,15,40,205                        // movaps        %xmm5,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
   .byte  15,89,222                           // mulps         %xmm6,%xmm3
-  .byte  68,15,40,37,156,72,0,0              // movaps        0x489c(%rip),%xmm12        # 5ea0 <_sk_callback_sse2+0x355>
+  .byte  68,15,40,37,92,75,0,0               // movaps        0x4b5c(%rip),%xmm12        # 6160 <_sk_callback_sse2+0x352>
   .byte  68,15,40,199                        // movaps        %xmm7,%xmm8
   .byte  69,15,89,196                        // mulps         %xmm12,%xmm8
-  .byte  68,15,40,45,156,72,0,0              // movaps        0x489c(%rip),%xmm13        # 5eb0 <_sk_callback_sse2+0x365>
+  .byte  68,15,40,45,92,75,0,0               // movaps        0x4b5c(%rip),%xmm13        # 6170 <_sk_callback_sse2+0x362>
   .byte  68,15,40,241                        // movaps        %xmm1,%xmm14
   .byte  69,15,89,245                        // mulps         %xmm13,%xmm14
   .byte  69,15,88,240                        // addps         %xmm8,%xmm14
-  .byte  68,15,40,29,152,72,0,0              // movaps        0x4898(%rip),%xmm11        # 5ec0 <_sk_callback_sse2+0x375>
-  .byte  68,15,40,5,160,72,0,0               // movaps        0x48a0(%rip),%xmm8        # 5ed0 <_sk_callback_sse2+0x385>
+  .byte  68,15,40,29,88,75,0,0               // movaps        0x4b58(%rip),%xmm11        # 6180 <_sk_callback_sse2+0x372>
+  .byte  68,15,40,5,96,75,0,0                // movaps        0x4b60(%rip),%xmm8        # 6190 <_sk_callback_sse2+0x382>
   .byte  69,15,40,248                        // movaps        %xmm8,%xmm15
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  68,15,92,248                        // subps         %xmm0,%xmm15
@@ -33901,7 +35078,7 @@
   .byte  15,133,227,0,0,0                    // jne           1908 <_sk_srcover_rgba_8888_sse2+0xf1>
   .byte  243,68,15,111,4,144                 // movdqu        (%rax,%rdx,4),%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  102,15,111,53,170,70,0,0            // movdqa        0x46aa(%rip),%xmm6        # 5ee0 <_sk_callback_sse2+0x395>
+  .byte  102,15,111,53,106,73,0,0            // movdqa        0x496a(%rip),%xmm6        # 61a0 <_sk_callback_sse2+0x392>
   .byte  102,65,15,111,224                   // movdqa        %xmm8,%xmm4
   .byte  102,15,219,230                      // pand          %xmm6,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
@@ -33915,9 +35092,9 @@
   .byte  15,91,247                           // cvtdq2ps      %xmm7,%xmm6
   .byte  102,65,15,114,208,24                // psrld         $0x18,%xmm8
   .byte  65,15,91,248                        // cvtdq2ps      %xmm8,%xmm7
-  .byte  68,15,40,5,122,70,0,0               // movaps        0x467a(%rip),%xmm8        # 5ef0 <_sk_callback_sse2+0x3a5>
+  .byte  68,15,40,5,58,73,0,0                // movaps        0x493a(%rip),%xmm8        # 61b0 <_sk_callback_sse2+0x3a2>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
-  .byte  68,15,40,37,126,70,0,0              // movaps        0x467e(%rip),%xmm12        # 5f00 <_sk_callback_sse2+0x3b5>
+  .byte  68,15,40,37,62,73,0,0               // movaps        0x493e(%rip),%xmm12        # 61c0 <_sk_callback_sse2+0x3b2>
   .byte  65,15,89,196                        // mulps         %xmm12,%xmm0
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -33997,7 +35174,7 @@
 .globl _sk_clamp_1_sse2
 FUNCTION(_sk_clamp_1_sse2)
 _sk_clamp_1_sse2:
-  .byte  68,15,40,5,111,69,0,0               // movaps        0x456f(%rip),%xmm8        # 5f10 <_sk_callback_sse2+0x3c5>
+  .byte  68,15,40,5,47,72,0,0                // movaps        0x482f(%rip),%xmm8        # 61d0 <_sk_callback_sse2+0x3c2>
   .byte  65,15,93,192                        // minps         %xmm8,%xmm0
   .byte  65,15,93,200                        // minps         %xmm8,%xmm1
   .byte  65,15,93,208                        // minps         %xmm8,%xmm2
@@ -34009,7 +35186,7 @@
 .globl _sk_clamp_a_sse2
 FUNCTION(_sk_clamp_a_sse2)
 _sk_clamp_a_sse2:
-  .byte  15,93,29,100,69,0,0                 // minps         0x4564(%rip),%xmm3        # 5f20 <_sk_callback_sse2+0x3d5>
+  .byte  15,93,29,36,72,0,0                  // minps         0x4824(%rip),%xmm3        # 61e0 <_sk_callback_sse2+0x3d2>
   .byte  15,93,195                           // minps         %xmm3,%xmm0
   .byte  15,93,203                           // minps         %xmm3,%xmm1
   .byte  15,93,211                           // minps         %xmm3,%xmm2
@@ -34020,7 +35197,7 @@
 .globl _sk_clamp_a_dst_sse2
 FUNCTION(_sk_clamp_a_dst_sse2)
 _sk_clamp_a_dst_sse2:
-  .byte  15,93,61,96,69,0,0                  // minps         0x4560(%rip),%xmm7        # 5f30 <_sk_callback_sse2+0x3e5>
+  .byte  15,93,61,32,72,0,0                  // minps         0x4820(%rip),%xmm7        # 61f0 <_sk_callback_sse2+0x3e2>
   .byte  15,93,231                           // minps         %xmm7,%xmm4
   .byte  15,93,239                           // minps         %xmm7,%xmm5
   .byte  15,93,247                           // minps         %xmm7,%xmm6
@@ -34051,16 +35228,6 @@
   .byte  65,15,40,208                        // movaps        %xmm8,%xmm2
   .byte  255,224                             // jmpq          *%rax
 
-HIDDEN _sk_swap_rb_dst_sse2
-.globl _sk_swap_rb_dst_sse2
-FUNCTION(_sk_swap_rb_dst_sse2)
-_sk_swap_rb_dst_sse2:
-  .byte  68,15,40,196                        // movaps        %xmm4,%xmm8
-  .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,230                           // movaps        %xmm6,%xmm4
-  .byte  65,15,40,240                        // movaps        %xmm8,%xmm6
-  .byte  255,224                             // jmpq          *%rax
-
 HIDDEN _sk_move_src_dst_sse2
 .globl _sk_move_src_dst_sse2
 FUNCTION(_sk_move_src_dst_sse2)
@@ -34098,7 +35265,7 @@
 FUNCTION(_sk_unpremul_sse2)
 _sk_unpremul_sse2:
   .byte  69,15,87,192                        // xorps         %xmm8,%xmm8
-  .byte  68,15,40,13,236,68,0,0              // movaps        0x44ec(%rip),%xmm9        # 5f40 <_sk_callback_sse2+0x3f5>
+  .byte  68,15,40,13,187,71,0,0              // movaps        0x47bb(%rip),%xmm9        # 6200 <_sk_callback_sse2+0x3f2>
   .byte  68,15,94,203                        // divps         %xmm3,%xmm9
   .byte  68,15,194,195,4                     // cmpneqps      %xmm3,%xmm8
   .byte  69,15,84,193                        // andps         %xmm9,%xmm8
@@ -34112,20 +35279,20 @@
 .globl _sk_from_srgb_sse2
 FUNCTION(_sk_from_srgb_sse2)
 _sk_from_srgb_sse2:
-  .byte  68,15,40,5,215,68,0,0               // movaps        0x44d7(%rip),%xmm8        # 5f50 <_sk_callback_sse2+0x405>
+  .byte  68,15,40,5,166,71,0,0               // movaps        0x47a6(%rip),%xmm8        # 6210 <_sk_callback_sse2+0x402>
   .byte  68,15,40,232                        // movaps        %xmm0,%xmm13
   .byte  69,15,89,232                        // mulps         %xmm8,%xmm13
   .byte  68,15,40,216                        // movaps        %xmm0,%xmm11
   .byte  69,15,89,219                        // mulps         %xmm11,%xmm11
-  .byte  68,15,40,13,207,68,0,0              // movaps        0x44cf(%rip),%xmm9        # 5f60 <_sk_callback_sse2+0x415>
+  .byte  68,15,40,13,158,71,0,0              // movaps        0x479e(%rip),%xmm9        # 6220 <_sk_callback_sse2+0x412>
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
   .byte  69,15,89,241                        // mulps         %xmm9,%xmm14
-  .byte  68,15,40,21,207,68,0,0              // movaps        0x44cf(%rip),%xmm10        # 5f70 <_sk_callback_sse2+0x425>
+  .byte  68,15,40,21,158,71,0,0              // movaps        0x479e(%rip),%xmm10        # 6230 <_sk_callback_sse2+0x422>
   .byte  69,15,88,242                        // addps         %xmm10,%xmm14
   .byte  69,15,89,243                        // mulps         %xmm11,%xmm14
-  .byte  68,15,40,29,207,68,0,0              // movaps        0x44cf(%rip),%xmm11        # 5f80 <_sk_callback_sse2+0x435>
+  .byte  68,15,40,29,158,71,0,0              // movaps        0x479e(%rip),%xmm11        # 6240 <_sk_callback_sse2+0x432>
   .byte  69,15,88,243                        // addps         %xmm11,%xmm14
-  .byte  68,15,40,37,211,68,0,0              // movaps        0x44d3(%rip),%xmm12        # 5f90 <_sk_callback_sse2+0x445>
+  .byte  68,15,40,37,162,71,0,0              // movaps        0x47a2(%rip),%xmm12        # 6250 <_sk_callback_sse2+0x442>
   .byte  65,15,194,196,1                     // cmpltps       %xmm12,%xmm0
   .byte  68,15,84,232                        // andps         %xmm0,%xmm13
   .byte  65,15,85,198                        // andnps        %xmm14,%xmm0
@@ -34161,20 +35328,20 @@
 .globl _sk_from_srgb_dst_sse2
 FUNCTION(_sk_from_srgb_dst_sse2)
 _sk_from_srgb_dst_sse2:
-  .byte  68,15,40,5,100,68,0,0               // movaps        0x4464(%rip),%xmm8        # 5fa0 <_sk_callback_sse2+0x455>
+  .byte  68,15,40,5,51,71,0,0                // movaps        0x4733(%rip),%xmm8        # 6260 <_sk_callback_sse2+0x452>
   .byte  68,15,40,236                        // movaps        %xmm4,%xmm13
   .byte  69,15,89,232                        // mulps         %xmm8,%xmm13
   .byte  68,15,40,220                        // movaps        %xmm4,%xmm11
   .byte  69,15,89,219                        // mulps         %xmm11,%xmm11
-  .byte  68,15,40,13,92,68,0,0               // movaps        0x445c(%rip),%xmm9        # 5fb0 <_sk_callback_sse2+0x465>
+  .byte  68,15,40,13,43,71,0,0               // movaps        0x472b(%rip),%xmm9        # 6270 <_sk_callback_sse2+0x462>
   .byte  68,15,40,244                        // movaps        %xmm4,%xmm14
   .byte  69,15,89,241                        // mulps         %xmm9,%xmm14
-  .byte  68,15,40,21,92,68,0,0               // movaps        0x445c(%rip),%xmm10        # 5fc0 <_sk_callback_sse2+0x475>
+  .byte  68,15,40,21,43,71,0,0               // movaps        0x472b(%rip),%xmm10        # 6280 <_sk_callback_sse2+0x472>
   .byte  69,15,88,242                        // addps         %xmm10,%xmm14
   .byte  69,15,89,243                        // mulps         %xmm11,%xmm14
-  .byte  68,15,40,29,92,68,0,0               // movaps        0x445c(%rip),%xmm11        # 5fd0 <_sk_callback_sse2+0x485>
+  .byte  68,15,40,29,43,71,0,0               // movaps        0x472b(%rip),%xmm11        # 6290 <_sk_callback_sse2+0x482>
   .byte  69,15,88,243                        // addps         %xmm11,%xmm14
-  .byte  68,15,40,37,96,68,0,0               // movaps        0x4460(%rip),%xmm12        # 5fe0 <_sk_callback_sse2+0x495>
+  .byte  68,15,40,37,47,71,0,0               // movaps        0x472f(%rip),%xmm12        # 62a0 <_sk_callback_sse2+0x492>
   .byte  65,15,194,228,1                     // cmpltps       %xmm12,%xmm4
   .byte  68,15,84,236                        // andps         %xmm4,%xmm13
   .byte  65,15,85,230                        // andnps        %xmm14,%xmm4
@@ -34211,22 +35378,22 @@
 FUNCTION(_sk_to_srgb_sse2)
 _sk_to_srgb_sse2:
   .byte  68,15,82,232                        // rsqrtps       %xmm0,%xmm13
-  .byte  68,15,40,5,237,67,0,0               // movaps        0x43ed(%rip),%xmm8        # 5ff0 <_sk_callback_sse2+0x4a5>
+  .byte  68,15,40,5,188,70,0,0               // movaps        0x46bc(%rip),%xmm8        # 62b0 <_sk_callback_sse2+0x4a2>
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
   .byte  69,15,89,240                        // mulps         %xmm8,%xmm14
-  .byte  68,15,40,13,237,67,0,0              // movaps        0x43ed(%rip),%xmm9        # 6000 <_sk_callback_sse2+0x4b5>
+  .byte  68,15,40,13,188,70,0,0              // movaps        0x46bc(%rip),%xmm9        # 62c0 <_sk_callback_sse2+0x4b2>
   .byte  69,15,40,253                        // movaps        %xmm13,%xmm15
   .byte  69,15,89,249                        // mulps         %xmm9,%xmm15
-  .byte  68,15,40,21,237,67,0,0              // movaps        0x43ed(%rip),%xmm10        # 6010 <_sk_callback_sse2+0x4c5>
+  .byte  68,15,40,21,188,70,0,0              // movaps        0x46bc(%rip),%xmm10        # 62d0 <_sk_callback_sse2+0x4c2>
   .byte  69,15,88,250                        // addps         %xmm10,%xmm15
   .byte  69,15,89,253                        // mulps         %xmm13,%xmm15
-  .byte  68,15,40,29,237,67,0,0              // movaps        0x43ed(%rip),%xmm11        # 6020 <_sk_callback_sse2+0x4d5>
+  .byte  68,15,40,29,188,70,0,0              // movaps        0x46bc(%rip),%xmm11        # 62e0 <_sk_callback_sse2+0x4d2>
   .byte  69,15,88,251                        // addps         %xmm11,%xmm15
-  .byte  68,15,40,37,241,67,0,0              // movaps        0x43f1(%rip),%xmm12        # 6030 <_sk_callback_sse2+0x4e5>
+  .byte  68,15,40,37,192,70,0,0              // movaps        0x46c0(%rip),%xmm12        # 62f0 <_sk_callback_sse2+0x4e2>
   .byte  69,15,88,236                        // addps         %xmm12,%xmm13
   .byte  69,15,83,237                        // rcpps         %xmm13,%xmm13
   .byte  69,15,89,239                        // mulps         %xmm15,%xmm13
-  .byte  68,15,40,61,237,67,0,0              // movaps        0x43ed(%rip),%xmm15        # 6040 <_sk_callback_sse2+0x4f5>
+  .byte  68,15,40,61,188,70,0,0              // movaps        0x46bc(%rip),%xmm15        # 6300 <_sk_callback_sse2+0x4f2>
   .byte  65,15,194,199,1                     // cmpltps       %xmm15,%xmm0
   .byte  68,15,84,240                        // andps         %xmm0,%xmm14
   .byte  65,15,85,197                        // andnps        %xmm13,%xmm0
@@ -34276,7 +35443,7 @@
   .byte  68,15,93,218                        // minps         %xmm2,%xmm11
   .byte  65,15,40,202                        // movaps        %xmm10,%xmm1
   .byte  65,15,92,203                        // subps         %xmm11,%xmm1
-  .byte  68,15,40,45,70,67,0,0               // movaps        0x4346(%rip),%xmm13        # 6050 <_sk_callback_sse2+0x505>
+  .byte  68,15,40,45,21,70,0,0               // movaps        0x4615(%rip),%xmm13        # 6310 <_sk_callback_sse2+0x502>
   .byte  68,15,94,233                        // divps         %xmm1,%xmm13
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  65,15,194,192,0                     // cmpeqps       %xmm8,%xmm0
@@ -34285,30 +35452,30 @@
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,40,241                        // movaps        %xmm9,%xmm14
   .byte  68,15,194,242,1                     // cmpltps       %xmm2,%xmm14
-  .byte  68,15,84,53,44,67,0,0               // andps         0x432c(%rip),%xmm14        # 6060 <_sk_callback_sse2+0x515>
+  .byte  68,15,84,53,251,69,0,0              // andps         0x45fb(%rip),%xmm14        # 6320 <_sk_callback_sse2+0x512>
   .byte  69,15,88,244                        // addps         %xmm12,%xmm14
   .byte  69,15,40,250                        // movaps        %xmm10,%xmm15
   .byte  69,15,194,249,0                     // cmpeqps       %xmm9,%xmm15
   .byte  65,15,92,208                        // subps         %xmm8,%xmm2
   .byte  65,15,89,213                        // mulps         %xmm13,%xmm2
-  .byte  68,15,40,37,31,67,0,0               // movaps        0x431f(%rip),%xmm12        # 6070 <_sk_callback_sse2+0x525>
+  .byte  68,15,40,37,238,69,0,0              // movaps        0x45ee(%rip),%xmm12        # 6330 <_sk_callback_sse2+0x522>
   .byte  65,15,88,212                        // addps         %xmm12,%xmm2
   .byte  69,15,92,193                        // subps         %xmm9,%xmm8
   .byte  69,15,89,197                        // mulps         %xmm13,%xmm8
-  .byte  68,15,88,5,27,67,0,0                // addps         0x431b(%rip),%xmm8        # 6080 <_sk_callback_sse2+0x535>
+  .byte  68,15,88,5,234,69,0,0               // addps         0x45ea(%rip),%xmm8        # 6340 <_sk_callback_sse2+0x532>
   .byte  65,15,84,215                        // andps         %xmm15,%xmm2
   .byte  69,15,85,248                        // andnps        %xmm8,%xmm15
   .byte  68,15,86,250                        // orps          %xmm2,%xmm15
   .byte  68,15,84,240                        // andps         %xmm0,%xmm14
   .byte  65,15,85,199                        // andnps        %xmm15,%xmm0
   .byte  65,15,86,198                        // orps          %xmm14,%xmm0
-  .byte  15,89,5,12,67,0,0                   // mulps         0x430c(%rip),%xmm0        # 6090 <_sk_callback_sse2+0x545>
+  .byte  15,89,5,219,69,0,0                  // mulps         0x45db(%rip),%xmm0        # 6350 <_sk_callback_sse2+0x542>
   .byte  69,15,40,194                        // movaps        %xmm10,%xmm8
   .byte  69,15,194,195,4                     // cmpneqps      %xmm11,%xmm8
   .byte  65,15,84,192                        // andps         %xmm8,%xmm0
   .byte  69,15,92,226                        // subps         %xmm10,%xmm12
   .byte  69,15,88,211                        // addps         %xmm11,%xmm10
-  .byte  68,15,40,13,255,66,0,0              // movaps        0x42ff(%rip),%xmm9        # 60a0 <_sk_callback_sse2+0x555>
+  .byte  68,15,40,13,206,69,0,0              // movaps        0x45ce(%rip),%xmm9        # 6360 <_sk_callback_sse2+0x552>
   .byte  65,15,40,210                        // movaps        %xmm10,%xmm2
   .byte  65,15,89,209                        // mulps         %xmm9,%xmm2
   .byte  68,15,194,202,1                     // cmpltps       %xmm2,%xmm9
@@ -34332,7 +35499,7 @@
   .byte  15,41,92,36,168                     // movaps        %xmm3,-0x58(%rsp)
   .byte  68,15,40,218                        // movaps        %xmm2,%xmm11
   .byte  15,40,240                           // movaps        %xmm0,%xmm6
-  .byte  68,15,40,13,190,66,0,0              // movaps        0x42be(%rip),%xmm9        # 60b0 <_sk_callback_sse2+0x565>
+  .byte  68,15,40,13,141,69,0,0              // movaps        0x458d(%rip),%xmm9        # 6370 <_sk_callback_sse2+0x562>
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
   .byte  69,15,194,211,2                     // cmpleps       %xmm11,%xmm10
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
@@ -34349,28 +35516,28 @@
   .byte  69,15,88,211                        // addps         %xmm11,%xmm10
   .byte  69,15,88,219                        // addps         %xmm11,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  15,40,5,135,66,0,0                  // movaps        0x4287(%rip),%xmm0        # 60c0 <_sk_callback_sse2+0x575>
+  .byte  15,40,5,86,69,0,0                   // movaps        0x4556(%rip),%xmm0        # 6380 <_sk_callback_sse2+0x572>
   .byte  15,88,198                           // addps         %xmm6,%xmm0
   .byte  243,15,91,200                       // cvttps2dq     %xmm0,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  15,40,216                           // movaps        %xmm0,%xmm3
   .byte  15,194,217,1                        // cmpltps       %xmm1,%xmm3
-  .byte  15,84,29,127,66,0,0                 // andps         0x427f(%rip),%xmm3        # 60d0 <_sk_callback_sse2+0x585>
+  .byte  15,84,29,78,69,0,0                  // andps         0x454e(%rip),%xmm3        # 6390 <_sk_callback_sse2+0x582>
   .byte  15,92,203                           // subps         %xmm3,%xmm1
   .byte  15,92,193                           // subps         %xmm1,%xmm0
-  .byte  68,15,40,45,129,66,0,0              // movaps        0x4281(%rip),%xmm13        # 60e0 <_sk_callback_sse2+0x595>
+  .byte  68,15,40,45,80,69,0,0               // movaps        0x4550(%rip),%xmm13        # 63a0 <_sk_callback_sse2+0x592>
   .byte  69,15,40,197                        // movaps        %xmm13,%xmm8
   .byte  68,15,194,192,2                     // cmpleps       %xmm0,%xmm8
   .byte  69,15,40,242                        // movaps        %xmm10,%xmm14
   .byte  69,15,92,243                        // subps         %xmm11,%xmm14
   .byte  65,15,40,217                        // movaps        %xmm9,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
-  .byte  15,40,21,145,66,0,0                 // movaps        0x4291(%rip),%xmm2        # 6110 <_sk_callback_sse2+0x5c5>
+  .byte  15,40,21,96,69,0,0                  // movaps        0x4560(%rip),%xmm2        # 63d0 <_sk_callback_sse2+0x5c2>
   .byte  68,15,40,250                        // movaps        %xmm2,%xmm15
   .byte  68,15,194,248,2                     // cmpleps       %xmm0,%xmm15
-  .byte  15,40,13,97,66,0,0                  // movaps        0x4261(%rip),%xmm1        # 60f0 <_sk_callback_sse2+0x5a5>
+  .byte  15,40,13,48,69,0,0                  // movaps        0x4530(%rip),%xmm1        # 63b0 <_sk_callback_sse2+0x5a2>
   .byte  15,89,193                           // mulps         %xmm1,%xmm0
-  .byte  15,40,45,103,66,0,0                 // movaps        0x4267(%rip),%xmm5        # 6100 <_sk_callback_sse2+0x5b5>
+  .byte  15,40,45,54,69,0,0                  // movaps        0x4536(%rip),%xmm5        # 63c0 <_sk_callback_sse2+0x5b2>
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
   .byte  15,92,224                           // subps         %xmm0,%xmm4
   .byte  65,15,89,230                        // mulps         %xmm14,%xmm4
@@ -34393,7 +35560,7 @@
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,222                           // movaps        %xmm6,%xmm3
   .byte  15,194,216,1                        // cmpltps       %xmm0,%xmm3
-  .byte  15,84,29,220,65,0,0                 // andps         0x41dc(%rip),%xmm3        # 60d0 <_sk_callback_sse2+0x585>
+  .byte  15,84,29,171,68,0,0                 // andps         0x44ab(%rip),%xmm3        # 6390 <_sk_callback_sse2+0x582>
   .byte  15,92,195                           // subps         %xmm3,%xmm0
   .byte  68,15,40,230                        // movaps        %xmm6,%xmm12
   .byte  68,15,92,224                        // subps         %xmm0,%xmm12
@@ -34423,12 +35590,12 @@
   .byte  15,40,124,36,136                    // movaps        -0x78(%rsp),%xmm7
   .byte  15,40,231                           // movaps        %xmm7,%xmm4
   .byte  15,85,227                           // andnps        %xmm3,%xmm4
-  .byte  15,88,53,180,65,0,0                 // addps         0x41b4(%rip),%xmm6        # 6120 <_sk_callback_sse2+0x5d5>
+  .byte  15,88,53,131,68,0,0                 // addps         0x4483(%rip),%xmm6        # 63e0 <_sk_callback_sse2+0x5d2>
   .byte  243,15,91,198                       // cvttps2dq     %xmm6,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,222                           // movaps        %xmm6,%xmm3
   .byte  15,194,216,1                        // cmpltps       %xmm0,%xmm3
-  .byte  15,84,29,79,65,0,0                  // andps         0x414f(%rip),%xmm3        # 60d0 <_sk_callback_sse2+0x585>
+  .byte  15,84,29,30,68,0,0                  // andps         0x441e(%rip),%xmm3        # 6390 <_sk_callback_sse2+0x582>
   .byte  15,92,195                           // subps         %xmm3,%xmm0
   .byte  15,92,240                           // subps         %xmm0,%xmm6
   .byte  15,89,206                           // mulps         %xmm6,%xmm1
@@ -34488,13 +35655,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,61                              // jne           2074 <_sk_scale_u8_sse2+0x47>
+  .byte  117,61                              // jne           2065 <_sk_scale_u8_sse2+0x47>
   .byte  102,69,15,110,4,18                  // movd          (%r10,%rdx,1),%xmm8
   .byte  102,68,15,96,192                    // punpcklbw     %xmm0,%xmm8
   .byte  102,68,15,97,192                    // punpcklwd     %xmm0,%xmm8
-  .byte  102,68,15,219,5,224,64,0,0          // pand          0x40e0(%rip),%xmm8        # 6130 <_sk_callback_sse2+0x5e5>
+  .byte  102,68,15,219,5,175,67,0,0          // pand          0x43af(%rip),%xmm8        # 63f0 <_sk_callback_sse2+0x5e2>
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,228,64,0,0               // mulps         0x40e4(%rip),%xmm8        # 6140 <_sk_callback_sse2+0x5f5>
+  .byte  68,15,89,5,179,67,0,0               // mulps         0x43b3(%rip),%xmm8        # 6400 <_sk_callback_sse2+0x5f2>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
@@ -34505,12 +35672,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,61                              // je            20be <_sk_scale_u8_sse2+0x91>
+  .byte  116,61                              // je            20af <_sk_scale_u8_sse2+0x91>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,23                              // je            20a3 <_sk_scale_u8_sse2+0x76>
+  .byte  116,23                              // je            2094 <_sk_scale_u8_sse2+0x76>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,181                             // jne           2047 <_sk_scale_u8_sse2+0x1a>
+  .byte  117,181                             // jne           2038 <_sk_scale_u8_sse2+0x1a>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,192,69                // pshufd        $0x45,%xmm8,%xmm8
@@ -34519,10 +35686,10 @@
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  102,68,15,97,200                    // punpcklwd     %xmm0,%xmm9
   .byte  242,69,15,16,193                    // movsd         %xmm9,%xmm8
-  .byte  235,137                             // jmp           2047 <_sk_scale_u8_sse2+0x1a>
+  .byte  235,137                             // jmp           2038 <_sk_scale_u8_sse2+0x1a>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  233,122,255,255,255                 // jmpq          2047 <_sk_scale_u8_sse2+0x1a>
+  .byte  233,122,255,255,255                 // jmpq          2038 <_sk_scale_u8_sse2+0x1a>
 
 HIDDEN _sk_lerp_1_float_sse2
 .globl _sk_lerp_1_float_sse2
@@ -34553,13 +35720,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,81                              // jne           2160 <_sk_lerp_u8_sse2+0x5b>
+  .byte  117,81                              // jne           2151 <_sk_lerp_u8_sse2+0x5b>
   .byte  102,69,15,110,4,18                  // movd          (%r10,%rdx,1),%xmm8
   .byte  102,68,15,96,192                    // punpcklbw     %xmm0,%xmm8
   .byte  102,68,15,97,192                    // punpcklwd     %xmm0,%xmm8
-  .byte  102,68,15,219,5,40,64,0,0           // pand          0x4028(%rip),%xmm8        # 6150 <_sk_callback_sse2+0x605>
+  .byte  102,68,15,219,5,247,66,0,0          // pand          0x42f7(%rip),%xmm8        # 6410 <_sk_callback_sse2+0x602>
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,44,64,0,0                // mulps         0x402c(%rip),%xmm8        # 6160 <_sk_callback_sse2+0x615>
+  .byte  68,15,89,5,251,66,0,0               // mulps         0x42fb(%rip),%xmm8        # 6420 <_sk_callback_sse2+0x612>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -34577,12 +35744,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,64                              // je            21ad <_sk_lerp_u8_sse2+0xa8>
+  .byte  116,64                              // je            219e <_sk_lerp_u8_sse2+0xa8>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,23                              // je            218f <_sk_lerp_u8_sse2+0x8a>
+  .byte  116,23                              // je            2180 <_sk_lerp_u8_sse2+0x8a>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,161                             // jne           211f <_sk_lerp_u8_sse2+0x1a>
+  .byte  117,161                             // jne           2110 <_sk_lerp_u8_sse2+0x1a>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,192,69                // pshufd        $0x45,%xmm8,%xmm8
@@ -34591,10 +35758,10 @@
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  102,68,15,97,200                    // punpcklwd     %xmm0,%xmm9
   .byte  242,69,15,16,193                    // movsd         %xmm9,%xmm8
-  .byte  233,114,255,255,255                 // jmpq          211f <_sk_lerp_u8_sse2+0x1a>
+  .byte  233,114,255,255,255                 // jmpq          2110 <_sk_lerp_u8_sse2+0x1a>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  233,99,255,255,255                  // jmpq          211f <_sk_lerp_u8_sse2+0x1a>
+  .byte  233,99,255,255,255                  // jmpq          2110 <_sk_lerp_u8_sse2+0x1a>
 
 HIDDEN _sk_lerp_565_sse2
 .globl _sk_lerp_565_sse2
@@ -34603,20 +35770,20 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,156,0,0,0                    // jne           2266 <_sk_lerp_565_sse2+0xaa>
+  .byte  15,133,156,0,0,0                    // jne           2257 <_sk_lerp_565_sse2+0xaa>
   .byte  243,69,15,126,12,82                 // movq          (%r10,%rdx,2),%xmm9
   .byte  102,68,15,97,200                    // punpcklwd     %xmm0,%xmm9
-  .byte  102,68,15,111,5,146,63,0,0          // movdqa        0x3f92(%rip),%xmm8        # 6170 <_sk_callback_sse2+0x625>
+  .byte  102,68,15,111,5,97,66,0,0           // movdqa        0x4261(%rip),%xmm8        # 6430 <_sk_callback_sse2+0x622>
   .byte  102,69,15,219,193                   // pand          %xmm9,%xmm8
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,145,63,0,0               // mulps         0x3f91(%rip),%xmm8        # 6180 <_sk_callback_sse2+0x635>
-  .byte  102,68,15,111,21,152,63,0,0         // movdqa        0x3f98(%rip),%xmm10        # 6190 <_sk_callback_sse2+0x645>
+  .byte  68,15,89,5,96,66,0,0                // mulps         0x4260(%rip),%xmm8        # 6440 <_sk_callback_sse2+0x632>
+  .byte  102,68,15,111,21,103,66,0,0         // movdqa        0x4267(%rip),%xmm10        # 6450 <_sk_callback_sse2+0x642>
   .byte  102,69,15,219,209                   // pand          %xmm9,%xmm10
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
-  .byte  68,15,89,21,151,63,0,0              // mulps         0x3f97(%rip),%xmm10        # 61a0 <_sk_callback_sse2+0x655>
-  .byte  102,68,15,219,13,158,63,0,0         // pand          0x3f9e(%rip),%xmm9        # 61b0 <_sk_callback_sse2+0x665>
+  .byte  68,15,89,21,102,66,0,0              // mulps         0x4266(%rip),%xmm10        # 6460 <_sk_callback_sse2+0x652>
+  .byte  102,68,15,219,13,109,66,0,0         // pand          0x426d(%rip),%xmm9        # 6470 <_sk_callback_sse2+0x662>
   .byte  69,15,91,201                        // cvtdq2ps      %xmm9,%xmm9
-  .byte  68,15,89,13,162,63,0,0              // mulps         0x3fa2(%rip),%xmm9        # 61c0 <_sk_callback_sse2+0x675>
+  .byte  68,15,89,13,113,66,0,0              // mulps         0x4271(%rip),%xmm9        # 6480 <_sk_callback_sse2+0x672>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -34641,22 +35808,22 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,59                              // je            22ae <_sk_lerp_565_sse2+0xf2>
+  .byte  116,59                              // je            229f <_sk_lerp_565_sse2+0xf2>
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,27                              // je            2299 <_sk_lerp_565_sse2+0xdd>
+  .byte  116,27                              // je            228a <_sk_lerp_565_sse2+0xdd>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  15,133,77,255,255,255               // jne           21d5 <_sk_lerp_565_sse2+0x19>
+  .byte  15,133,77,255,255,255               // jne           21c6 <_sk_lerp_565_sse2+0x19>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,200,69                // pshufd        $0x45,%xmm8,%xmm9
   .byte  102,69,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm8
   .byte  102,68,15,97,192                    // punpcklwd     %xmm0,%xmm8
   .byte  242,69,15,16,200                    // movsd         %xmm8,%xmm9
-  .byte  233,39,255,255,255                  // jmpq          21d5 <_sk_lerp_565_sse2+0x19>
+  .byte  233,39,255,255,255                  // jmpq          21c6 <_sk_lerp_565_sse2+0x19>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,68,15,110,200                   // movd          %eax,%xmm9
-  .byte  233,24,255,255,255                  // jmpq          21d5 <_sk_lerp_565_sse2+0x19>
+  .byte  233,24,255,255,255                  // jmpq          21c6 <_sk_lerp_565_sse2+0x19>
 
 HIDDEN _sk_load_tables_sse2
 .globl _sk_load_tables_sse2
@@ -34665,12 +35832,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,36,1,0,0                     // jne           23ef <_sk_load_tables_sse2+0x132>
+  .byte  15,133,36,1,0,0                     // jne           23e0 <_sk_load_tables_sse2+0x132>
   .byte  243,69,15,111,12,145                // movdqu        (%r9,%rdx,4),%xmm9
   .byte  65,87                               // push          %r15
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
-  .byte  102,68,15,111,5,241,62,0,0          // movdqa        0x3ef1(%rip),%xmm8        # 61d0 <_sk_callback_sse2+0x685>
+  .byte  102,68,15,111,5,192,65,0,0          // movdqa        0x41c0(%rip),%xmm8        # 6490 <_sk_callback_sse2+0x682>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,15,112,200,78                   // pshufd        $0x4e,%xmm0,%xmm1
@@ -34726,7 +35893,7 @@
   .byte  65,15,20,208                        // unpcklps      %xmm8,%xmm2
   .byte  102,65,15,114,209,24                // psrld         $0x18,%xmm9
   .byte  65,15,91,217                        // cvtdq2ps      %xmm9,%xmm3
-  .byte  15,89,29,250,61,0,0                 // mulps         0x3dfa(%rip),%xmm3        # 61e0 <_sk_callback_sse2+0x695>
+  .byte  15,89,29,201,64,0,0                 // mulps         0x40c9(%rip),%xmm3        # 64a0 <_sk_callback_sse2+0x692>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
@@ -34735,18 +35902,18 @@
   .byte  69,137,194                          // mov           %r8d,%r10d
   .byte  65,128,226,3                        // and           $0x3,%r10b
   .byte  65,128,250,1                        // cmp           $0x1,%r10b
-  .byte  116,45                              // je            2429 <_sk_load_tables_sse2+0x16c>
+  .byte  116,45                              // je            241a <_sk_load_tables_sse2+0x16c>
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  65,128,250,2                        // cmp           $0x2,%r10b
-  .byte  116,23                              // je            241e <_sk_load_tables_sse2+0x161>
+  .byte  116,23                              // je            240f <_sk_load_tables_sse2+0x161>
   .byte  65,128,250,3                        // cmp           $0x3,%r10b
-  .byte  15,133,192,254,255,255              // jne           22d1 <_sk_load_tables_sse2+0x14>
+  .byte  15,133,192,254,255,255              // jne           22c2 <_sk_load_tables_sse2+0x14>
   .byte  102,65,15,110,68,145,8              // movd          0x8(%r9,%rdx,4),%xmm0
   .byte  102,68,15,112,200,69                // pshufd        $0x45,%xmm0,%xmm9
   .byte  102,69,15,18,12,145                 // movlpd        (%r9,%rdx,4),%xmm9
-  .byte  233,168,254,255,255                 // jmpq          22d1 <_sk_load_tables_sse2+0x14>
+  .byte  233,168,254,255,255                 // jmpq          22c2 <_sk_load_tables_sse2+0x14>
   .byte  102,69,15,110,12,145                // movd          (%r9,%rdx,4),%xmm9
-  .byte  233,157,254,255,255                 // jmpq          22d1 <_sk_load_tables_sse2+0x14>
+  .byte  233,157,254,255,255                 // jmpq          22c2 <_sk_load_tables_sse2+0x14>
 
 HIDDEN _sk_load_tables_u16_be_sse2
 .globl _sk_load_tables_u16_be_sse2
@@ -34756,7 +35923,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,101,1,0,0                    // jne           25af <_sk_load_tables_u16_be_sse2+0x17b>
+  .byte  15,133,101,1,0,0                    // jne           25a0 <_sk_load_tables_u16_be_sse2+0x17b>
   .byte  102,67,15,16,4,81                   // movupd        (%r9,%r10,2),%xmm0
   .byte  102,67,15,16,76,81,16               // movupd        0x10(%r9,%r10,2),%xmm1
   .byte  65,87                               // push          %r15
@@ -34768,7 +35935,7 @@
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,97,200                       // punpcklwd     %xmm0,%xmm1
   .byte  102,68,15,105,200                   // punpckhwd     %xmm0,%xmm9
-  .byte  102,68,15,111,21,111,61,0,0         // movdqa        0x3d6f(%rip),%xmm10        # 61f0 <_sk_callback_sse2+0x6a5>
+  .byte  102,68,15,111,21,62,64,0,0          // movdqa        0x403e(%rip),%xmm10        # 64b0 <_sk_callback_sse2+0x6a2>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,194                   // pand          %xmm10,%xmm0
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
@@ -34830,7 +35997,7 @@
   .byte  102,65,15,235,217                   // por           %xmm9,%xmm3
   .byte  102,65,15,97,216                    // punpcklwd     %xmm8,%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,90,60,0,0                  // mulps         0x3c5a(%rip),%xmm3        # 6200 <_sk_callback_sse2+0x6b5>
+  .byte  15,89,29,41,63,0,0                  // mulps         0x3f29(%rip),%xmm3        # 64c0 <_sk_callback_sse2+0x6b2>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
@@ -34838,17 +36005,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,67,15,16,4,81                   // movsd         (%r9,%r10,2),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,17                              // jne           25cc <_sk_load_tables_u16_be_sse2+0x198>
+  .byte  117,17                              // jne           25bd <_sk_load_tables_u16_be_sse2+0x198>
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  102,15,20,193                       // unpcklpd      %xmm1,%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
-  .byte  233,139,254,255,255                 // jmpq          2457 <_sk_load_tables_u16_be_sse2+0x23>
+  .byte  233,139,254,255,255                 // jmpq          2448 <_sk_load_tables_u16_be_sse2+0x23>
   .byte  102,67,15,22,68,81,8                // movhpd        0x8(%r9,%r10,2),%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,118,254,255,255              // jb            2457 <_sk_load_tables_u16_be_sse2+0x23>
+  .byte  15,130,118,254,255,255              // jb            2448 <_sk_load_tables_u16_be_sse2+0x23>
   .byte  242,67,15,16,76,81,16               // movsd         0x10(%r9,%r10,2),%xmm1
-  .byte  233,106,254,255,255                 // jmpq          2457 <_sk_load_tables_u16_be_sse2+0x23>
+  .byte  233,106,254,255,255                 // jmpq          2448 <_sk_load_tables_u16_be_sse2+0x23>
 
 HIDDEN _sk_load_tables_rgb_u16_be_sse2
 .globl _sk_load_tables_rgb_u16_be_sse2
@@ -34858,7 +36025,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,82                        // lea           (%rdx,%rdx,2),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,84,1,0,0                     // jne           2753 <_sk_load_tables_rgb_u16_be_sse2+0x166>
+  .byte  15,133,84,1,0,0                     // jne           2744 <_sk_load_tables_rgb_u16_be_sse2+0x166>
   .byte  243,71,15,111,28,81                 // movdqu        (%r9,%r10,2),%xmm11
   .byte  243,67,15,111,76,81,8               // movdqu        0x8(%r9,%r10,2),%xmm1
   .byte  102,15,115,217,4                    // psrldq        $0x4,%xmm1
@@ -34873,7 +36040,7 @@
   .byte  102,68,15,97,208                    // punpcklwd     %xmm0,%xmm10
   .byte  102,65,15,111,195                   // movdqa        %xmm11,%xmm0
   .byte  102,65,15,97,194                    // punpcklwd     %xmm10,%xmm0
-  .byte  102,68,15,111,5,201,59,0,0          // movdqa        0x3bc9(%rip),%xmm8        # 6210 <_sk_callback_sse2+0x6c5>
+  .byte  102,68,15,111,5,152,62,0,0          // movdqa        0x3e98(%rip),%xmm8        # 64d0 <_sk_callback_sse2+0x6c2>
   .byte  102,15,112,200,78                   // pshufd        $0x4e,%xmm0,%xmm1
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
@@ -34929,7 +36096,7 @@
   .byte  15,20,211                           // unpcklps      %xmm3,%xmm2
   .byte  65,15,20,208                        // unpcklps      %xmm8,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,212,58,0,0                 // movaps        0x3ad4(%rip),%xmm3        # 6220 <_sk_callback_sse2+0x6d5>
+  .byte  15,40,29,163,61,0,0                 // movaps        0x3da3(%rip),%xmm3        # 64e0 <_sk_callback_sse2+0x6d2>
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
   .byte  65,95                               // pop           %r15
@@ -34938,21 +36105,21 @@
   .byte  102,71,15,196,92,81,4,2             // pinsrw        $0x2,0x4(%r9,%r10,2),%xmm11
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,14                              // jne           2779 <_sk_load_tables_rgb_u16_be_sse2+0x18c>
+  .byte  117,14                              // jne           276a <_sk_load_tables_rgb_u16_be_sse2+0x18c>
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
-  .byte  233,172,254,255,255                 // jmpq          2625 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  .byte  233,172,254,255,255                 // jmpq          2616 <_sk_load_tables_rgb_u16_be_sse2+0x38>
   .byte  102,71,15,110,84,81,6               // movd          0x6(%r9,%r10,2),%xmm10
   .byte  102,71,15,196,84,81,10,2            // pinsrw        $0x2,0xa(%r9,%r10,2),%xmm10
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,24                              // jb            27aa <_sk_load_tables_rgb_u16_be_sse2+0x1bd>
+  .byte  114,24                              // jb            279b <_sk_load_tables_rgb_u16_be_sse2+0x1bd>
   .byte  102,67,15,110,76,81,12              // movd          0xc(%r9,%r10,2),%xmm1
   .byte  102,67,15,196,76,81,16,2            // pinsrw        $0x2,0x10(%r9,%r10,2),%xmm1
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,123,254,255,255                 // jmpq          2625 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  .byte  233,123,254,255,255                 // jmpq          2616 <_sk_load_tables_rgb_u16_be_sse2+0x38>
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,114,254,255,255                 // jmpq          2625 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  .byte  233,114,254,255,255                 // jmpq          2616 <_sk_load_tables_rgb_u16_be_sse2+0x38>
 
 HIDDEN _sk_byte_tables_sse2
 .globl _sk_byte_tables_sse2
@@ -34963,7 +36130,7 @@
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,109,58,0,0               // movaps        0x3a6d(%rip),%xmm8        # 6230 <_sk_callback_sse2+0x6e5>
+  .byte  68,15,40,5,60,61,0,0                // movaps        0x3d3c(%rip),%xmm8        # 64f0 <_sk_callback_sse2+0x6e2>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,91,192                       // cvtps2dq      %xmm0,%xmm0
   .byte  102,73,15,126,193                   // movq          %xmm0,%r9
@@ -34991,7 +36158,7 @@
   .byte  102,65,15,96,193                    // punpcklbw     %xmm9,%xmm0
   .byte  102,65,15,97,193                    // punpcklwd     %xmm9,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,21,7,58,0,0                // movaps        0x3a07(%rip),%xmm10        # 6240 <_sk_callback_sse2+0x6f5>
+  .byte  68,15,40,21,214,60,0,0              // movaps        0x3cd6(%rip),%xmm10        # 6500 <_sk_callback_sse2+0x6f2>
   .byte  65,15,89,194                        // mulps         %xmm10,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -35112,7 +36279,7 @@
   .byte  102,65,15,96,193                    // punpcklbw     %xmm9,%xmm0
   .byte  102,65,15,97,193                    // punpcklwd     %xmm9,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,21,79,56,0,0               // movaps        0x384f(%rip),%xmm10        # 6250 <_sk_callback_sse2+0x705>
+  .byte  68,15,40,21,30,59,0,0               // movaps        0x3b1e(%rip),%xmm10        # 6510 <_sk_callback_sse2+0x702>
   .byte  65,15,89,194                        // mulps         %xmm10,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -35319,15 +36486,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,131,53,0,0              // mulps         0x3583(%rip),%xmm9        # 6260 <_sk_callback_sse2+0x715>
-  .byte  68,15,84,21,139,53,0,0              // andps         0x358b(%rip),%xmm10        # 6270 <_sk_callback_sse2+0x725>
-  .byte  68,15,86,21,147,53,0,0              // orps          0x3593(%rip),%xmm10        # 6280 <_sk_callback_sse2+0x735>
-  .byte  68,15,88,13,155,53,0,0              // addps         0x359b(%rip),%xmm9        # 6290 <_sk_callback_sse2+0x745>
-  .byte  68,15,40,37,163,53,0,0              // movaps        0x35a3(%rip),%xmm12        # 62a0 <_sk_callback_sse2+0x755>
+  .byte  68,15,89,13,82,56,0,0               // mulps         0x3852(%rip),%xmm9        # 6520 <_sk_callback_sse2+0x712>
+  .byte  68,15,84,21,90,56,0,0               // andps         0x385a(%rip),%xmm10        # 6530 <_sk_callback_sse2+0x722>
+  .byte  68,15,86,21,98,56,0,0               // orps          0x3862(%rip),%xmm10        # 6540 <_sk_callback_sse2+0x732>
+  .byte  68,15,88,13,106,56,0,0              // addps         0x386a(%rip),%xmm9        # 6550 <_sk_callback_sse2+0x742>
+  .byte  68,15,40,37,114,56,0,0              // movaps        0x3872(%rip),%xmm12        # 6560 <_sk_callback_sse2+0x752>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,163,53,0,0              // addps         0x35a3(%rip),%xmm10        # 62b0 <_sk_callback_sse2+0x765>
-  .byte  68,15,40,37,171,53,0,0              // movaps        0x35ab(%rip),%xmm12        # 62c0 <_sk_callback_sse2+0x775>
+  .byte  68,15,88,21,114,56,0,0              // addps         0x3872(%rip),%xmm10        # 6570 <_sk_callback_sse2+0x762>
+  .byte  68,15,40,37,122,56,0,0              // movaps        0x387a(%rip),%xmm12        # 6580 <_sk_callback_sse2+0x772>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -35335,22 +36502,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,149,53,0,0              // movaps        0x3595(%rip),%xmm10        # 62d0 <_sk_callback_sse2+0x785>
+  .byte  68,15,40,21,100,56,0,0              // movaps        0x3864(%rip),%xmm10        # 6590 <_sk_callback_sse2+0x782>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,137,53,0,0              // addps         0x3589(%rip),%xmm9        # 62e0 <_sk_callback_sse2+0x795>
-  .byte  68,15,40,37,145,53,0,0              // movaps        0x3591(%rip),%xmm12        # 62f0 <_sk_callback_sse2+0x7a5>
+  .byte  68,15,88,13,88,56,0,0               // addps         0x3858(%rip),%xmm9        # 65a0 <_sk_callback_sse2+0x792>
+  .byte  68,15,40,37,96,56,0,0               // movaps        0x3860(%rip),%xmm12        # 65b0 <_sk_callback_sse2+0x7a2>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,145,53,0,0              // movaps        0x3591(%rip),%xmm12        # 6300 <_sk_callback_sse2+0x7b5>
+  .byte  68,15,40,37,96,56,0,0               // movaps        0x3860(%rip),%xmm12        # 65c0 <_sk_callback_sse2+0x7b2>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,149,53,0,0              // movaps        0x3595(%rip),%xmm13        # 6310 <_sk_callback_sse2+0x7c5>
+  .byte  68,15,40,45,100,56,0,0              // movaps        0x3864(%rip),%xmm13        # 65d0 <_sk_callback_sse2+0x7c2>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,149,53,0,0              // mulps         0x3595(%rip),%xmm13        # 6320 <_sk_callback_sse2+0x7d5>
+  .byte  68,15,89,45,100,56,0,0              // mulps         0x3864(%rip),%xmm13        # 65e0 <_sk_callback_sse2+0x7d2>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -35386,15 +36553,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,21,53,0,0               // mulps         0x3515(%rip),%xmm9        # 6330 <_sk_callback_sse2+0x7e5>
-  .byte  68,15,84,21,29,53,0,0               // andps         0x351d(%rip),%xmm10        # 6340 <_sk_callback_sse2+0x7f5>
-  .byte  68,15,86,21,37,53,0,0               // orps          0x3525(%rip),%xmm10        # 6350 <_sk_callback_sse2+0x805>
-  .byte  68,15,88,13,45,53,0,0               // addps         0x352d(%rip),%xmm9        # 6360 <_sk_callback_sse2+0x815>
-  .byte  68,15,40,37,53,53,0,0               // movaps        0x3535(%rip),%xmm12        # 6370 <_sk_callback_sse2+0x825>
+  .byte  68,15,89,13,228,55,0,0              // mulps         0x37e4(%rip),%xmm9        # 65f0 <_sk_callback_sse2+0x7e2>
+  .byte  68,15,84,21,236,55,0,0              // andps         0x37ec(%rip),%xmm10        # 6600 <_sk_callback_sse2+0x7f2>
+  .byte  68,15,86,21,244,55,0,0              // orps          0x37f4(%rip),%xmm10        # 6610 <_sk_callback_sse2+0x802>
+  .byte  68,15,88,13,252,55,0,0              // addps         0x37fc(%rip),%xmm9        # 6620 <_sk_callback_sse2+0x812>
+  .byte  68,15,40,37,4,56,0,0                // movaps        0x3804(%rip),%xmm12        # 6630 <_sk_callback_sse2+0x822>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,53,53,0,0               // addps         0x3535(%rip),%xmm10        # 6380 <_sk_callback_sse2+0x835>
-  .byte  68,15,40,37,61,53,0,0               // movaps        0x353d(%rip),%xmm12        # 6390 <_sk_callback_sse2+0x845>
+  .byte  68,15,88,21,4,56,0,0                // addps         0x3804(%rip),%xmm10        # 6640 <_sk_callback_sse2+0x832>
+  .byte  68,15,40,37,12,56,0,0               // movaps        0x380c(%rip),%xmm12        # 6650 <_sk_callback_sse2+0x842>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -35402,22 +36569,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,39,53,0,0               // movaps        0x3527(%rip),%xmm10        # 63a0 <_sk_callback_sse2+0x855>
+  .byte  68,15,40,21,246,55,0,0              // movaps        0x37f6(%rip),%xmm10        # 6660 <_sk_callback_sse2+0x852>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,27,53,0,0               // addps         0x351b(%rip),%xmm9        # 63b0 <_sk_callback_sse2+0x865>
-  .byte  68,15,40,37,35,53,0,0               // movaps        0x3523(%rip),%xmm12        # 63c0 <_sk_callback_sse2+0x875>
+  .byte  68,15,88,13,234,55,0,0              // addps         0x37ea(%rip),%xmm9        # 6670 <_sk_callback_sse2+0x862>
+  .byte  68,15,40,37,242,55,0,0              // movaps        0x37f2(%rip),%xmm12        # 6680 <_sk_callback_sse2+0x872>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,35,53,0,0               // movaps        0x3523(%rip),%xmm12        # 63d0 <_sk_callback_sse2+0x885>
+  .byte  68,15,40,37,242,55,0,0              // movaps        0x37f2(%rip),%xmm12        # 6690 <_sk_callback_sse2+0x882>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,39,53,0,0               // movaps        0x3527(%rip),%xmm13        # 63e0 <_sk_callback_sse2+0x895>
+  .byte  68,15,40,45,246,55,0,0              // movaps        0x37f6(%rip),%xmm13        # 66a0 <_sk_callback_sse2+0x892>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,39,53,0,0               // mulps         0x3527(%rip),%xmm13        # 63f0 <_sk_callback_sse2+0x8a5>
+  .byte  68,15,89,45,246,55,0,0              // mulps         0x37f6(%rip),%xmm13        # 66b0 <_sk_callback_sse2+0x8a2>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -35453,15 +36620,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,167,52,0,0              // mulps         0x34a7(%rip),%xmm9        # 6400 <_sk_callback_sse2+0x8b5>
-  .byte  68,15,84,21,175,52,0,0              // andps         0x34af(%rip),%xmm10        # 6410 <_sk_callback_sse2+0x8c5>
-  .byte  68,15,86,21,183,52,0,0              // orps          0x34b7(%rip),%xmm10        # 6420 <_sk_callback_sse2+0x8d5>
-  .byte  68,15,88,13,191,52,0,0              // addps         0x34bf(%rip),%xmm9        # 6430 <_sk_callback_sse2+0x8e5>
-  .byte  68,15,40,37,199,52,0,0              // movaps        0x34c7(%rip),%xmm12        # 6440 <_sk_callback_sse2+0x8f5>
+  .byte  68,15,89,13,118,55,0,0              // mulps         0x3776(%rip),%xmm9        # 66c0 <_sk_callback_sse2+0x8b2>
+  .byte  68,15,84,21,126,55,0,0              // andps         0x377e(%rip),%xmm10        # 66d0 <_sk_callback_sse2+0x8c2>
+  .byte  68,15,86,21,134,55,0,0              // orps          0x3786(%rip),%xmm10        # 66e0 <_sk_callback_sse2+0x8d2>
+  .byte  68,15,88,13,142,55,0,0              // addps         0x378e(%rip),%xmm9        # 66f0 <_sk_callback_sse2+0x8e2>
+  .byte  68,15,40,37,150,55,0,0              // movaps        0x3796(%rip),%xmm12        # 6700 <_sk_callback_sse2+0x8f2>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,199,52,0,0              // addps         0x34c7(%rip),%xmm10        # 6450 <_sk_callback_sse2+0x905>
-  .byte  68,15,40,37,207,52,0,0              // movaps        0x34cf(%rip),%xmm12        # 6460 <_sk_callback_sse2+0x915>
+  .byte  68,15,88,21,150,55,0,0              // addps         0x3796(%rip),%xmm10        # 6710 <_sk_callback_sse2+0x902>
+  .byte  68,15,40,37,158,55,0,0              // movaps        0x379e(%rip),%xmm12        # 6720 <_sk_callback_sse2+0x912>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -35469,22 +36636,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,185,52,0,0              // movaps        0x34b9(%rip),%xmm10        # 6470 <_sk_callback_sse2+0x925>
+  .byte  68,15,40,21,136,55,0,0              // movaps        0x3788(%rip),%xmm10        # 6730 <_sk_callback_sse2+0x922>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,173,52,0,0              // addps         0x34ad(%rip),%xmm9        # 6480 <_sk_callback_sse2+0x935>
-  .byte  68,15,40,37,181,52,0,0              // movaps        0x34b5(%rip),%xmm12        # 6490 <_sk_callback_sse2+0x945>
+  .byte  68,15,88,13,124,55,0,0              // addps         0x377c(%rip),%xmm9        # 6740 <_sk_callback_sse2+0x932>
+  .byte  68,15,40,37,132,55,0,0              // movaps        0x3784(%rip),%xmm12        # 6750 <_sk_callback_sse2+0x942>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,181,52,0,0              // movaps        0x34b5(%rip),%xmm12        # 64a0 <_sk_callback_sse2+0x955>
+  .byte  68,15,40,37,132,55,0,0              // movaps        0x3784(%rip),%xmm12        # 6760 <_sk_callback_sse2+0x952>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,185,52,0,0              // movaps        0x34b9(%rip),%xmm13        # 64b0 <_sk_callback_sse2+0x965>
+  .byte  68,15,40,45,136,55,0,0              // movaps        0x3788(%rip),%xmm13        # 6770 <_sk_callback_sse2+0x962>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,185,52,0,0              // mulps         0x34b9(%rip),%xmm13        # 64c0 <_sk_callback_sse2+0x975>
+  .byte  68,15,89,45,136,55,0,0              // mulps         0x3788(%rip),%xmm13        # 6780 <_sk_callback_sse2+0x972>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -35520,15 +36687,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,57,52,0,0               // mulps         0x3439(%rip),%xmm9        # 64d0 <_sk_callback_sse2+0x985>
-  .byte  68,15,84,21,65,52,0,0               // andps         0x3441(%rip),%xmm10        # 64e0 <_sk_callback_sse2+0x995>
-  .byte  68,15,86,21,73,52,0,0               // orps          0x3449(%rip),%xmm10        # 64f0 <_sk_callback_sse2+0x9a5>
-  .byte  68,15,88,13,81,52,0,0               // addps         0x3451(%rip),%xmm9        # 6500 <_sk_callback_sse2+0x9b5>
-  .byte  68,15,40,37,89,52,0,0               // movaps        0x3459(%rip),%xmm12        # 6510 <_sk_callback_sse2+0x9c5>
+  .byte  68,15,89,13,8,55,0,0                // mulps         0x3708(%rip),%xmm9        # 6790 <_sk_callback_sse2+0x982>
+  .byte  68,15,84,21,16,55,0,0               // andps         0x3710(%rip),%xmm10        # 67a0 <_sk_callback_sse2+0x992>
+  .byte  68,15,86,21,24,55,0,0               // orps          0x3718(%rip),%xmm10        # 67b0 <_sk_callback_sse2+0x9a2>
+  .byte  68,15,88,13,32,55,0,0               // addps         0x3720(%rip),%xmm9        # 67c0 <_sk_callback_sse2+0x9b2>
+  .byte  68,15,40,37,40,55,0,0               // movaps        0x3728(%rip),%xmm12        # 67d0 <_sk_callback_sse2+0x9c2>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,89,52,0,0               // addps         0x3459(%rip),%xmm10        # 6520 <_sk_callback_sse2+0x9d5>
-  .byte  68,15,40,37,97,52,0,0               // movaps        0x3461(%rip),%xmm12        # 6530 <_sk_callback_sse2+0x9e5>
+  .byte  68,15,88,21,40,55,0,0               // addps         0x3728(%rip),%xmm10        # 67e0 <_sk_callback_sse2+0x9d2>
+  .byte  68,15,40,37,48,55,0,0               // movaps        0x3730(%rip),%xmm12        # 67f0 <_sk_callback_sse2+0x9e2>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -35536,22 +36703,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,75,52,0,0               // movaps        0x344b(%rip),%xmm10        # 6540 <_sk_callback_sse2+0x9f5>
+  .byte  68,15,40,21,26,55,0,0               // movaps        0x371a(%rip),%xmm10        # 6800 <_sk_callback_sse2+0x9f2>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,63,52,0,0               // addps         0x343f(%rip),%xmm9        # 6550 <_sk_callback_sse2+0xa05>
-  .byte  68,15,40,37,71,52,0,0               // movaps        0x3447(%rip),%xmm12        # 6560 <_sk_callback_sse2+0xa15>
+  .byte  68,15,88,13,14,55,0,0               // addps         0x370e(%rip),%xmm9        # 6810 <_sk_callback_sse2+0xa02>
+  .byte  68,15,40,37,22,55,0,0               // movaps        0x3716(%rip),%xmm12        # 6820 <_sk_callback_sse2+0xa12>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,71,52,0,0               // movaps        0x3447(%rip),%xmm12        # 6570 <_sk_callback_sse2+0xa25>
+  .byte  68,15,40,37,22,55,0,0               // movaps        0x3716(%rip),%xmm12        # 6830 <_sk_callback_sse2+0xa22>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,75,52,0,0               // movaps        0x344b(%rip),%xmm13        # 6580 <_sk_callback_sse2+0xa35>
+  .byte  68,15,40,45,26,55,0,0               // movaps        0x371a(%rip),%xmm13        # 6840 <_sk_callback_sse2+0xa32>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,75,52,0,0               // mulps         0x344b(%rip),%xmm13        # 6590 <_sk_callback_sse2+0xa45>
+  .byte  68,15,89,45,26,55,0,0               // mulps         0x371a(%rip),%xmm13        # 6850 <_sk_callback_sse2+0xa42>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -35568,29 +36735,29 @@
 .globl _sk_lab_to_xyz_sse2
 FUNCTION(_sk_lab_to_xyz_sse2)
 _sk_lab_to_xyz_sse2:
-  .byte  15,89,5,40,52,0,0                   // mulps         0x3428(%rip),%xmm0        # 65a0 <_sk_callback_sse2+0xa55>
-  .byte  68,15,40,5,48,52,0,0                // movaps        0x3430(%rip),%xmm8        # 65b0 <_sk_callback_sse2+0xa65>
+  .byte  15,89,5,247,54,0,0                  // mulps         0x36f7(%rip),%xmm0        # 6860 <_sk_callback_sse2+0xa52>
+  .byte  68,15,40,5,255,54,0,0               // movaps        0x36ff(%rip),%xmm8        # 6870 <_sk_callback_sse2+0xa62>
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
-  .byte  68,15,40,13,52,52,0,0               // movaps        0x3434(%rip),%xmm9        # 65c0 <_sk_callback_sse2+0xa75>
+  .byte  68,15,40,13,3,55,0,0                // movaps        0x3703(%rip),%xmm9        # 6880 <_sk_callback_sse2+0xa72>
   .byte  65,15,88,201                        // addps         %xmm9,%xmm1
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  65,15,88,209                        // addps         %xmm9,%xmm2
-  .byte  15,88,5,49,52,0,0                   // addps         0x3431(%rip),%xmm0        # 65d0 <_sk_callback_sse2+0xa85>
-  .byte  15,89,5,58,52,0,0                   // mulps         0x343a(%rip),%xmm0        # 65e0 <_sk_callback_sse2+0xa95>
-  .byte  15,89,13,67,52,0,0                  // mulps         0x3443(%rip),%xmm1        # 65f0 <_sk_callback_sse2+0xaa5>
+  .byte  15,88,5,0,55,0,0                    // addps         0x3700(%rip),%xmm0        # 6890 <_sk_callback_sse2+0xa82>
+  .byte  15,89,5,9,55,0,0                    // mulps         0x3709(%rip),%xmm0        # 68a0 <_sk_callback_sse2+0xa92>
+  .byte  15,89,13,18,55,0,0                  // mulps         0x3712(%rip),%xmm1        # 68b0 <_sk_callback_sse2+0xaa2>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
-  .byte  15,89,21,73,52,0,0                  // mulps         0x3449(%rip),%xmm2        # 6600 <_sk_callback_sse2+0xab5>
+  .byte  15,89,21,24,55,0,0                  // mulps         0x3718(%rip),%xmm2        # 68c0 <_sk_callback_sse2+0xab2>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  68,15,92,202                        // subps         %xmm2,%xmm9
   .byte  68,15,40,225                        // movaps        %xmm1,%xmm12
   .byte  69,15,89,228                        // mulps         %xmm12,%xmm12
   .byte  68,15,89,225                        // mulps         %xmm1,%xmm12
-  .byte  15,40,21,62,52,0,0                  // movaps        0x343e(%rip),%xmm2        # 6610 <_sk_callback_sse2+0xac5>
+  .byte  15,40,21,13,55,0,0                  // movaps        0x370d(%rip),%xmm2        # 68d0 <_sk_callback_sse2+0xac2>
   .byte  68,15,40,194                        // movaps        %xmm2,%xmm8
   .byte  69,15,194,196,1                     // cmpltps       %xmm12,%xmm8
-  .byte  68,15,40,21,61,52,0,0               // movaps        0x343d(%rip),%xmm10        # 6620 <_sk_callback_sse2+0xad5>
+  .byte  68,15,40,21,12,55,0,0               // movaps        0x370c(%rip),%xmm10        # 68e0 <_sk_callback_sse2+0xad2>
   .byte  65,15,88,202                        // addps         %xmm10,%xmm1
-  .byte  68,15,40,29,65,52,0,0               // movaps        0x3441(%rip),%xmm11        # 6630 <_sk_callback_sse2+0xae5>
+  .byte  68,15,40,29,16,55,0,0               // movaps        0x3710(%rip),%xmm11        # 68f0 <_sk_callback_sse2+0xae2>
   .byte  65,15,89,203                        // mulps         %xmm11,%xmm1
   .byte  69,15,84,224                        // andps         %xmm8,%xmm12
   .byte  68,15,85,193                        // andnps        %xmm1,%xmm8
@@ -35614,8 +36781,8 @@
   .byte  15,84,194                           // andps         %xmm2,%xmm0
   .byte  65,15,85,209                        // andnps        %xmm9,%xmm2
   .byte  15,86,208                           // orps          %xmm0,%xmm2
-  .byte  68,15,89,5,241,51,0,0               // mulps         0x33f1(%rip),%xmm8        # 6640 <_sk_callback_sse2+0xaf5>
-  .byte  15,89,21,250,51,0,0                 // mulps         0x33fa(%rip),%xmm2        # 6650 <_sk_callback_sse2+0xb05>
+  .byte  68,15,89,5,192,54,0,0               // mulps         0x36c0(%rip),%xmm8        # 6900 <_sk_callback_sse2+0xaf2>
+  .byte  15,89,21,201,54,0,0                 // mulps         0x36c9(%rip),%xmm2        # 6910 <_sk_callback_sse2+0xb02>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -35627,13 +36794,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,46                              // jne           3296 <_sk_load_a8_sse2+0x38>
+  .byte  117,46                              // jne           3287 <_sk_load_a8_sse2+0x38>
   .byte  102,65,15,110,4,18                  // movd          (%r10,%rdx,1),%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
-  .byte  102,15,219,5,226,51,0,0             // pand          0x33e2(%rip),%xmm0        # 6660 <_sk_callback_sse2+0xb15>
+  .byte  102,15,219,5,177,54,0,0             // pand          0x36b1(%rip),%xmm0        # 6920 <_sk_callback_sse2+0xb12>
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,232,51,0,0                 // mulps         0x33e8(%rip),%xmm3        # 6670 <_sk_callback_sse2+0xb25>
+  .byte  15,89,29,183,54,0,0                 // mulps         0x36b7(%rip),%xmm3        # 6930 <_sk_callback_sse2+0xb22>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
@@ -35642,12 +36809,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,54                              // je            32d9 <_sk_load_a8_sse2+0x7b>
+  .byte  116,54                              // je            32ca <_sk_load_a8_sse2+0x7b>
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            32c2 <_sk_load_a8_sse2+0x64>
+  .byte  116,21                              // je            32b3 <_sk_load_a8_sse2+0x64>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,195                             // jne           3276 <_sk_load_a8_sse2+0x18>
+  .byte  117,195                             // jne           3267 <_sk_load_a8_sse2+0x18>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,192,69                   // pshufd        $0x45,%xmm0,%xmm0
@@ -35656,10 +36823,10 @@
   .byte  102,15,96,200                       // punpcklbw     %xmm0,%xmm1
   .byte  102,15,97,200                       // punpcklwd     %xmm0,%xmm1
   .byte  242,15,16,193                       // movsd         %xmm1,%xmm0
-  .byte  235,157                             // jmp           3276 <_sk_load_a8_sse2+0x18>
+  .byte  235,157                             // jmp           3267 <_sk_load_a8_sse2+0x18>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
-  .byte  235,146                             // jmp           3276 <_sk_load_a8_sse2+0x18>
+  .byte  235,146                             // jmp           3267 <_sk_load_a8_sse2+0x18>
 
 HIDDEN _sk_load_a8_dst_sse2
 .globl _sk_load_a8_dst_sse2
@@ -35668,13 +36835,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,46                              // jne           331c <_sk_load_a8_dst_sse2+0x38>
+  .byte  117,46                              // jne           330d <_sk_load_a8_dst_sse2+0x38>
   .byte  102,65,15,110,36,18                 // movd          (%r10,%rdx,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,37,124,51,0,0            // pand          0x337c(%rip),%xmm4        # 6680 <_sk_callback_sse2+0xb35>
+  .byte  102,15,219,37,75,54,0,0             // pand          0x364b(%rip),%xmm4        # 6940 <_sk_callback_sse2+0xb32>
   .byte  15,91,252                           // cvtdq2ps      %xmm4,%xmm7
-  .byte  15,89,61,130,51,0,0                 // mulps         0x3382(%rip),%xmm7        # 6690 <_sk_callback_sse2+0xb45>
+  .byte  15,89,61,81,54,0,0                  // mulps         0x3651(%rip),%xmm7        # 6950 <_sk_callback_sse2+0xb42>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  102,15,87,237                       // xorpd         %xmm5,%xmm5
@@ -35683,12 +36850,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,54                              // je            335f <_sk_load_a8_dst_sse2+0x7b>
+  .byte  116,54                              // je            3350 <_sk_load_a8_dst_sse2+0x7b>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3348 <_sk_load_a8_dst_sse2+0x64>
+  .byte  116,21                              // je            3339 <_sk_load_a8_dst_sse2+0x64>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,195                             // jne           32fc <_sk_load_a8_dst_sse2+0x18>
+  .byte  117,195                             // jne           32ed <_sk_load_a8_dst_sse2+0x18>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,228,69                   // pshufd        $0x45,%xmm4,%xmm4
@@ -35697,10 +36864,10 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  235,157                             // jmp           32fc <_sk_load_a8_dst_sse2+0x18>
+  .byte  235,157                             // jmp           32ed <_sk_load_a8_dst_sse2+0x18>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
-  .byte  235,146                             // jmp           32fc <_sk_load_a8_dst_sse2+0x18>
+  .byte  235,146                             // jmp           32ed <_sk_load_a8_dst_sse2+0x18>
 
 HIDDEN _sk_gather_a8_sse2
 .globl _sk_gather_a8_sse2
@@ -35742,7 +36909,7 @@
   .byte  102,15,96,193                       // punpcklbw     %xmm1,%xmm0
   .byte  102,15,97,193                       // punpcklwd     %xmm1,%xmm0
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,163,50,0,0                 // mulps         0x32a3(%rip),%xmm3        # 66a0 <_sk_callback_sse2+0xb55>
+  .byte  15,89,29,114,53,0,0                 // mulps         0x3572(%rip),%xmm3        # 6960 <_sk_callback_sse2+0xb52>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
@@ -35757,7 +36924,7 @@
 _sk_store_a8_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  68,15,40,5,149,50,0,0               // movaps        0x3295(%rip),%xmm8        # 66b0 <_sk_callback_sse2+0xb65>
+  .byte  68,15,40,5,100,53,0,0               // movaps        0x3564(%rip),%xmm8        # 6970 <_sk_callback_sse2+0xb62>
   .byte  68,15,89,195                        // mulps         %xmm3,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
   .byte  102,65,15,114,240,16                // pslld         $0x10,%xmm8
@@ -35765,7 +36932,7 @@
   .byte  102,69,15,107,192                   // packssdw      %xmm8,%xmm8
   .byte  102,69,15,103,192                   // packuswb      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,13                              // jne           344c <_sk_store_a8_sse2+0x3e>
+  .byte  117,13                              // jne           343d <_sk_store_a8_sse2+0x3e>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  65,137,4,18                         // mov           %eax,(%r10,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -35775,24 +36942,24 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,59                              // je            349e <_sk_store_a8_sse2+0x90>
+  .byte  116,59                              // je            348f <_sk_store_a8_sse2+0x90>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,22                              // je            347f <_sk_store_a8_sse2+0x71>
+  .byte  116,22                              // je            3470 <_sk_store_a8_sse2+0x71>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,217                             // jne           3448 <_sk_store_a8_sse2+0x3a>
+  .byte  117,217                             // jne           3439 <_sk_store_a8_sse2+0x3a>
   .byte  102,68,15,127,68,36,232             // movdqa        %xmm8,-0x18(%rsp)
   .byte  138,68,36,240                       // mov           -0x10(%rsp),%al
   .byte  65,136,68,18,2                      // mov           %al,0x2(%r10,%rdx,1)
-  .byte  102,68,15,219,5,56,50,0,0           // pand          0x3238(%rip),%xmm8        # 66c0 <_sk_callback_sse2+0xb75>
+  .byte  102,68,15,219,5,7,53,0,0            // pand          0x3507(%rip),%xmm8        # 6980 <_sk_callback_sse2+0xb72>
   .byte  102,69,15,103,192                   // packuswb      %xmm8,%xmm8
   .byte  102,69,15,103,192                   // packuswb      %xmm8,%xmm8
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,65,137,4,18                     // mov           %ax,(%r10,%rdx,1)
-  .byte  235,170                             // jmp           3448 <_sk_store_a8_sse2+0x3a>
+  .byte  235,170                             // jmp           3439 <_sk_store_a8_sse2+0x3a>
   .byte  102,68,15,127,68,36,216             // movdqa        %xmm8,-0x28(%rsp)
   .byte  138,68,36,216                       // mov           -0x28(%rsp),%al
   .byte  65,136,4,18                         // mov           %al,(%r10,%rdx,1)
-  .byte  235,153                             // jmp           3448 <_sk_store_a8_sse2+0x3a>
+  .byte  235,153                             // jmp           3439 <_sk_store_a8_sse2+0x3a>
 
 HIDDEN _sk_load_g8_sse2
 .globl _sk_load_g8_sse2
@@ -35801,27 +36968,27 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,49                              // jne           34ea <_sk_load_g8_sse2+0x3b>
+  .byte  117,49                              // jne           34db <_sk_load_g8_sse2+0x3b>
   .byte  102,65,15,110,4,18                  // movd          (%r10,%rdx,1),%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
-  .byte  102,15,219,5,1,50,0,0               // pand          0x3201(%rip),%xmm0        # 66d0 <_sk_callback_sse2+0xb85>
+  .byte  102,15,219,5,208,52,0,0             // pand          0x34d0(%rip),%xmm0        # 6990 <_sk_callback_sse2+0xb82>
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,7,50,0,0                    // mulps         0x3207(%rip),%xmm0        # 66e0 <_sk_callback_sse2+0xb95>
+  .byte  15,89,5,214,52,0,0                  // mulps         0x34d6(%rip),%xmm0        # 69a0 <_sk_callback_sse2+0xb92>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,14,50,0,0                  // movaps        0x320e(%rip),%xmm3        # 66f0 <_sk_callback_sse2+0xba5>
+  .byte  15,40,29,221,52,0,0                 // movaps        0x34dd(%rip),%xmm3        # 69b0 <_sk_callback_sse2+0xba2>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,54                              // je            352d <_sk_load_g8_sse2+0x7e>
+  .byte  116,54                              // je            351e <_sk_load_g8_sse2+0x7e>
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3516 <_sk_load_g8_sse2+0x67>
+  .byte  116,21                              // je            3507 <_sk_load_g8_sse2+0x67>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,192                             // jne           34c7 <_sk_load_g8_sse2+0x18>
+  .byte  117,192                             // jne           34b8 <_sk_load_g8_sse2+0x18>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,192,69                   // pshufd        $0x45,%xmm0,%xmm0
@@ -35830,10 +36997,10 @@
   .byte  102,15,96,200                       // punpcklbw     %xmm0,%xmm1
   .byte  102,15,97,200                       // punpcklwd     %xmm0,%xmm1
   .byte  242,15,16,193                       // movsd         %xmm1,%xmm0
-  .byte  235,154                             // jmp           34c7 <_sk_load_g8_sse2+0x18>
+  .byte  235,154                             // jmp           34b8 <_sk_load_g8_sse2+0x18>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
-  .byte  235,143                             // jmp           34c7 <_sk_load_g8_sse2+0x18>
+  .byte  235,143                             // jmp           34b8 <_sk_load_g8_sse2+0x18>
 
 HIDDEN _sk_load_g8_dst_sse2
 .globl _sk_load_g8_dst_sse2
@@ -35842,27 +37009,27 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,49                              // jne           3573 <_sk_load_g8_dst_sse2+0x3b>
+  .byte  117,49                              // jne           3564 <_sk_load_g8_dst_sse2+0x3b>
   .byte  102,65,15,110,36,18                 // movd          (%r10,%rdx,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,37,168,49,0,0            // pand          0x31a8(%rip),%xmm4        # 6700 <_sk_callback_sse2+0xbb5>
+  .byte  102,15,219,37,119,52,0,0            // pand          0x3477(%rip),%xmm4        # 69c0 <_sk_callback_sse2+0xbb2>
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,174,49,0,0                 // mulps         0x31ae(%rip),%xmm4        # 6710 <_sk_callback_sse2+0xbc5>
+  .byte  15,89,37,125,52,0,0                 // mulps         0x347d(%rip),%xmm4        # 69d0 <_sk_callback_sse2+0xbc2>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,61,181,49,0,0                 // movaps        0x31b5(%rip),%xmm7        # 6720 <_sk_callback_sse2+0xbd5>
+  .byte  15,40,61,132,52,0,0                 // movaps        0x3484(%rip),%xmm7        # 69e0 <_sk_callback_sse2+0xbd2>
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
   .byte  15,40,244                           // movaps        %xmm4,%xmm6
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,54                              // je            35b6 <_sk_load_g8_dst_sse2+0x7e>
+  .byte  116,54                              // je            35a7 <_sk_load_g8_dst_sse2+0x7e>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            359f <_sk_load_g8_dst_sse2+0x67>
+  .byte  116,21                              // je            3590 <_sk_load_g8_dst_sse2+0x67>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,192                             // jne           3550 <_sk_load_g8_dst_sse2+0x18>
+  .byte  117,192                             // jne           3541 <_sk_load_g8_dst_sse2+0x18>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,228,69                   // pshufd        $0x45,%xmm4,%xmm4
@@ -35871,10 +37038,10 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  235,154                             // jmp           3550 <_sk_load_g8_dst_sse2+0x18>
+  .byte  235,154                             // jmp           3541 <_sk_load_g8_dst_sse2+0x18>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
-  .byte  235,143                             // jmp           3550 <_sk_load_g8_dst_sse2+0x18>
+  .byte  235,143                             // jmp           3541 <_sk_load_g8_dst_sse2+0x18>
 
 HIDDEN _sk_gather_g8_sse2
 .globl _sk_gather_g8_sse2
@@ -35916,9 +37083,9 @@
   .byte  102,15,96,193                       // punpcklbw     %xmm1,%xmm0
   .byte  102,15,97,193                       // punpcklwd     %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,220,48,0,0                  // mulps         0x30dc(%rip),%xmm0        # 6730 <_sk_callback_sse2+0xbe5>
+  .byte  15,89,5,171,51,0,0                  // mulps         0x33ab(%rip),%xmm0        # 69f0 <_sk_callback_sse2+0xbe2>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,227,48,0,0                 // movaps        0x30e3(%rip),%xmm3        # 6740 <_sk_callback_sse2+0xbf5>
+  .byte  15,40,29,178,51,0,0                 // movaps        0x33b2(%rip),%xmm3        # 6a00 <_sk_callback_sse2+0xbf2>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  91                                  // pop           %rbx
@@ -35932,9 +37099,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,193                          // mov           %rax,%r9
   .byte  77,133,201                          // test          %r9,%r9
-  .byte  116,5                               // je            3676 <_sk_gather_i8_sse2+0xf>
+  .byte  116,5                               // je            3667 <_sk_gather_i8_sse2+0xf>
   .byte  76,137,200                          // mov           %r9,%rax
-  .byte  235,2                               // jmp           3678 <_sk_gather_i8_sse2+0x11>
+  .byte  235,2                               // jmp           3669 <_sk_gather_i8_sse2+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  85                                  // push          %rbp
   .byte  65,86                               // push          %r14
@@ -35986,11 +37153,11 @@
   .byte  102,66,15,110,76,149,0              // movd          0x0(%rbp,%r10,4),%xmm1
   .byte  102,68,15,98,201                    // punpckldq     %xmm1,%xmm9
   .byte  102,68,15,98,200                    // punpckldq     %xmm0,%xmm9
-  .byte  102,15,111,21,252,47,0,0            // movdqa        0x2ffc(%rip),%xmm2        # 6750 <_sk_callback_sse2+0xc05>
+  .byte  102,15,111,21,203,50,0,0            // movdqa        0x32cb(%rip),%xmm2        # 6a10 <_sk_callback_sse2+0xc02>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,248,47,0,0               // movaps        0x2ff8(%rip),%xmm8        # 6760 <_sk_callback_sse2+0xc15>
+  .byte  68,15,40,5,199,50,0,0               // movaps        0x32c7(%rip),%xmm8        # 6a20 <_sk_callback_sse2+0xc12>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -36018,42 +37185,42 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,83                              // jne           3809 <_sk_load_565_sse2+0x5d>
+  .byte  117,83                              // jne           37fa <_sk_load_565_sse2+0x5d>
   .byte  243,65,15,126,20,82                 // movq          (%r10,%rdx,2),%xmm2
   .byte  102,15,97,208                       // punpcklwd     %xmm0,%xmm2
-  .byte  102,15,111,5,168,47,0,0             // movdqa        0x2fa8(%rip),%xmm0        # 6770 <_sk_callback_sse2+0xc25>
+  .byte  102,15,111,5,119,50,0,0             // movdqa        0x3277(%rip),%xmm0        # 6a30 <_sk_callback_sse2+0xc22>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,170,47,0,0                  // mulps         0x2faa(%rip),%xmm0        # 6780 <_sk_callback_sse2+0xc35>
-  .byte  102,15,111,13,178,47,0,0            // movdqa        0x2fb2(%rip),%xmm1        # 6790 <_sk_callback_sse2+0xc45>
+  .byte  15,89,5,121,50,0,0                  // mulps         0x3279(%rip),%xmm0        # 6a40 <_sk_callback_sse2+0xc32>
+  .byte  102,15,111,13,129,50,0,0            // movdqa        0x3281(%rip),%xmm1        # 6a50 <_sk_callback_sse2+0xc42>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,180,47,0,0                 // mulps         0x2fb4(%rip),%xmm1        # 67a0 <_sk_callback_sse2+0xc55>
-  .byte  102,15,219,21,188,47,0,0            // pand          0x2fbc(%rip),%xmm2        # 67b0 <_sk_callback_sse2+0xc65>
+  .byte  15,89,13,131,50,0,0                 // mulps         0x3283(%rip),%xmm1        # 6a60 <_sk_callback_sse2+0xc52>
+  .byte  102,15,219,21,139,50,0,0            // pand          0x328b(%rip),%xmm2        # 6a70 <_sk_callback_sse2+0xc62>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,194,47,0,0                 // mulps         0x2fc2(%rip),%xmm2        # 67c0 <_sk_callback_sse2+0xc75>
+  .byte  15,89,21,145,50,0,0                 // mulps         0x3291(%rip),%xmm2        # 6a80 <_sk_callback_sse2+0xc72>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,201,47,0,0                 // movaps        0x2fc9(%rip),%xmm3        # 67d0 <_sk_callback_sse2+0xc85>
+  .byte  15,40,29,152,50,0,0                 // movaps        0x3298(%rip),%xmm3        # 6a90 <_sk_callback_sse2+0xc82>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,50                              // je            3848 <_sk_load_565_sse2+0x9c>
+  .byte  116,50                              // je            3839 <_sk_load_565_sse2+0x9c>
   .byte  102,15,239,210                      // pxor          %xmm2,%xmm2
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3835 <_sk_load_565_sse2+0x89>
+  .byte  116,21                              // je            3826 <_sk_load_565_sse2+0x89>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,154                             // jne           37c0 <_sk_load_565_sse2+0x14>
+  .byte  117,154                             // jne           37b1 <_sk_load_565_sse2+0x14>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,208,69                   // pshufd        $0x45,%xmm0,%xmm2
   .byte  102,65,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
   .byte  242,15,16,208                       // movsd         %xmm0,%xmm2
-  .byte  233,120,255,255,255                 // jmpq          37c0 <_sk_load_565_sse2+0x14>
+  .byte  233,120,255,255,255                 // jmpq          37b1 <_sk_load_565_sse2+0x14>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,208                      // movd          %eax,%xmm2
-  .byte  233,106,255,255,255                 // jmpq          37c0 <_sk_load_565_sse2+0x14>
+  .byte  233,106,255,255,255                 // jmpq          37b1 <_sk_load_565_sse2+0x14>
 
 HIDDEN _sk_load_565_dst_sse2
 .globl _sk_load_565_dst_sse2
@@ -36062,42 +37229,42 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,83                              // jne           38b3 <_sk_load_565_dst_sse2+0x5d>
+  .byte  117,83                              // jne           38a4 <_sk_load_565_dst_sse2+0x5d>
   .byte  243,65,15,126,52,82                 // movq          (%r10,%rdx,2),%xmm6
   .byte  102,15,97,240                       // punpcklwd     %xmm0,%xmm6
-  .byte  102,15,111,37,110,47,0,0            // movdqa        0x2f6e(%rip),%xmm4        # 67e0 <_sk_callback_sse2+0xc95>
+  .byte  102,15,111,37,61,50,0,0             // movdqa        0x323d(%rip),%xmm4        # 6aa0 <_sk_callback_sse2+0xc92>
   .byte  102,15,219,230                      // pand          %xmm6,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,112,47,0,0                 // mulps         0x2f70(%rip),%xmm4        # 67f0 <_sk_callback_sse2+0xca5>
-  .byte  102,15,111,45,120,47,0,0            // movdqa        0x2f78(%rip),%xmm5        # 6800 <_sk_callback_sse2+0xcb5>
+  .byte  15,89,37,63,50,0,0                  // mulps         0x323f(%rip),%xmm4        # 6ab0 <_sk_callback_sse2+0xca2>
+  .byte  102,15,111,45,71,50,0,0             // movdqa        0x3247(%rip),%xmm5        # 6ac0 <_sk_callback_sse2+0xcb2>
   .byte  102,15,219,238                      // pand          %xmm6,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,45,122,47,0,0                 // mulps         0x2f7a(%rip),%xmm5        # 6810 <_sk_callback_sse2+0xcc5>
-  .byte  102,15,219,53,130,47,0,0            // pand          0x2f82(%rip),%xmm6        # 6820 <_sk_callback_sse2+0xcd5>
+  .byte  15,89,45,73,50,0,0                  // mulps         0x3249(%rip),%xmm5        # 6ad0 <_sk_callback_sse2+0xcc2>
+  .byte  102,15,219,53,81,50,0,0             // pand          0x3251(%rip),%xmm6        # 6ae0 <_sk_callback_sse2+0xcd2>
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,53,136,47,0,0                 // mulps         0x2f88(%rip),%xmm6        # 6830 <_sk_callback_sse2+0xce5>
+  .byte  15,89,53,87,50,0,0                  // mulps         0x3257(%rip),%xmm6        # 6af0 <_sk_callback_sse2+0xce2>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,61,143,47,0,0                 // movaps        0x2f8f(%rip),%xmm7        # 6840 <_sk_callback_sse2+0xcf5>
+  .byte  15,40,61,94,50,0,0                  // movaps        0x325e(%rip),%xmm7        # 6b00 <_sk_callback_sse2+0xcf2>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,50                              // je            38f2 <_sk_load_565_dst_sse2+0x9c>
+  .byte  116,50                              // je            38e3 <_sk_load_565_dst_sse2+0x9c>
   .byte  102,15,239,246                      // pxor          %xmm6,%xmm6
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            38df <_sk_load_565_dst_sse2+0x89>
+  .byte  116,21                              // je            38d0 <_sk_load_565_dst_sse2+0x89>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,154                             // jne           386a <_sk_load_565_dst_sse2+0x14>
+  .byte  117,154                             // jne           385b <_sk_load_565_dst_sse2+0x14>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,244,69                   // pshufd        $0x45,%xmm4,%xmm6
   .byte  102,65,15,110,36,82                 // movd          (%r10,%rdx,2),%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
   .byte  242,15,16,244                       // movsd         %xmm4,%xmm6
-  .byte  233,120,255,255,255                 // jmpq          386a <_sk_load_565_dst_sse2+0x14>
+  .byte  233,120,255,255,255                 // jmpq          385b <_sk_load_565_dst_sse2+0x14>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,240                      // movd          %eax,%xmm6
-  .byte  233,106,255,255,255                 // jmpq          386a <_sk_load_565_dst_sse2+0x14>
+  .byte  233,106,255,255,255                 // jmpq          385b <_sk_load_565_dst_sse2+0x14>
 
 HIDDEN _sk_gather_565_sse2
 .globl _sk_gather_565_sse2
@@ -36132,19 +37299,19 @@
   .byte  102,15,196,208,3                    // pinsrw        $0x3,%eax,%xmm2
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,208                       // punpcklwd     %xmm0,%xmm2
-  .byte  102,15,111,5,202,46,0,0             // movdqa        0x2eca(%rip),%xmm0        # 6850 <_sk_callback_sse2+0xd05>
+  .byte  102,15,111,5,153,49,0,0             // movdqa        0x3199(%rip),%xmm0        # 6b10 <_sk_callback_sse2+0xd02>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,204,46,0,0                  // mulps         0x2ecc(%rip),%xmm0        # 6860 <_sk_callback_sse2+0xd15>
-  .byte  102,15,111,13,212,46,0,0            // movdqa        0x2ed4(%rip),%xmm1        # 6870 <_sk_callback_sse2+0xd25>
+  .byte  15,89,5,155,49,0,0                  // mulps         0x319b(%rip),%xmm0        # 6b20 <_sk_callback_sse2+0xd12>
+  .byte  102,15,111,13,163,49,0,0            // movdqa        0x31a3(%rip),%xmm1        # 6b30 <_sk_callback_sse2+0xd22>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,214,46,0,0                 // mulps         0x2ed6(%rip),%xmm1        # 6880 <_sk_callback_sse2+0xd35>
-  .byte  102,15,219,21,222,46,0,0            // pand          0x2ede(%rip),%xmm2        # 6890 <_sk_callback_sse2+0xd45>
+  .byte  15,89,13,165,49,0,0                 // mulps         0x31a5(%rip),%xmm1        # 6b40 <_sk_callback_sse2+0xd32>
+  .byte  102,15,219,21,173,49,0,0            // pand          0x31ad(%rip),%xmm2        # 6b50 <_sk_callback_sse2+0xd42>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,228,46,0,0                 // mulps         0x2ee4(%rip),%xmm2        # 68a0 <_sk_callback_sse2+0xd55>
+  .byte  15,89,21,179,49,0,0                 // mulps         0x31b3(%rip),%xmm2        # 6b60 <_sk_callback_sse2+0xd52>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,235,46,0,0                 // movaps        0x2eeb(%rip),%xmm3        # 68b0 <_sk_callback_sse2+0xd65>
+  .byte  15,40,29,186,49,0,0                 // movaps        0x31ba(%rip),%xmm3        # 6b70 <_sk_callback_sse2+0xd62>
   .byte  91                                  // pop           %rbx
   .byte  255,224                             // jmpq          *%rax
 
@@ -36154,12 +37321,12 @@
 _sk_store_565_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  68,15,40,5,235,46,0,0               // movaps        0x2eeb(%rip),%xmm8        # 68c0 <_sk_callback_sse2+0xd75>
+  .byte  68,15,40,5,186,49,0,0               // movaps        0x31ba(%rip),%xmm8        # 6b80 <_sk_callback_sse2+0xd72>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
   .byte  102,65,15,114,241,11                // pslld         $0xb,%xmm9
-  .byte  68,15,40,21,224,46,0,0              // movaps        0x2ee0(%rip),%xmm10        # 68d0 <_sk_callback_sse2+0xd85>
+  .byte  68,15,40,21,175,49,0,0              // movaps        0x31af(%rip),%xmm10        # 6b90 <_sk_callback_sse2+0xd82>
   .byte  68,15,89,209                        // mulps         %xmm1,%xmm10
   .byte  102,69,15,91,210                    // cvtps2dq      %xmm10,%xmm10
   .byte  102,65,15,114,242,5                 // pslld         $0x5,%xmm10
@@ -36171,7 +37338,7 @@
   .byte  102,65,15,114,224,16                // psrad         $0x10,%xmm8
   .byte  102,69,15,107,192                   // packssdw      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           3a32 <_sk_store_565_sse2+0x6a>
+  .byte  117,10                              // jne           3a23 <_sk_store_565_sse2+0x6a>
   .byte  242,69,15,17,4,82                   // movsd         %xmm8,(%r10,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -36179,19 +37346,19 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,38                              // je            3a6a <_sk_store_565_sse2+0xa2>
+  .byte  116,38                              // je            3a5b <_sk_store_565_sse2+0xa2>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,18                              // je            3a5c <_sk_store_565_sse2+0x94>
+  .byte  116,18                              // je            3a4d <_sk_store_565_sse2+0x94>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,222                             // jne           3a2e <_sk_store_565_sse2+0x66>
+  .byte  117,222                             // jne           3a1f <_sk_store_565_sse2+0x66>
   .byte  102,65,15,197,192,4                 // pextrw        $0x4,%xmm8,%eax
   .byte  102,65,137,68,82,4                  // mov           %ax,0x4(%r10,%rdx,2)
   .byte  242,69,15,112,192,232               // pshuflw       $0xe8,%xmm8,%xmm8
   .byte  102,69,15,126,4,82                  // movd          %xmm8,(%r10,%rdx,2)
-  .byte  235,196                             // jmp           3a2e <_sk_store_565_sse2+0x66>
+  .byte  235,196                             // jmp           3a1f <_sk_store_565_sse2+0x66>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,65,137,4,82                     // mov           %ax,(%r10,%rdx,2)
-  .byte  235,184                             // jmp           3a2e <_sk_store_565_sse2+0x66>
+  .byte  235,184                             // jmp           3a1f <_sk_store_565_sse2+0x66>
 
 HIDDEN _sk_load_4444_sse2
 .globl _sk_load_4444_sse2
@@ -36200,45 +37367,45 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,98                              // jne           3ae2 <_sk_load_4444_sse2+0x6c>
+  .byte  117,98                              // jne           3ad3 <_sk_load_4444_sse2+0x6c>
   .byte  243,65,15,126,28,82                 // movq          (%r10,%rdx,2),%xmm3
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,111,5,78,46,0,0              // movdqa        0x2e4e(%rip),%xmm0        # 68e0 <_sk_callback_sse2+0xd95>
+  .byte  102,15,111,5,29,49,0,0              // movdqa        0x311d(%rip),%xmm0        # 6ba0 <_sk_callback_sse2+0xd92>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,80,46,0,0                   // mulps         0x2e50(%rip),%xmm0        # 68f0 <_sk_callback_sse2+0xda5>
-  .byte  102,15,111,13,88,46,0,0             // movdqa        0x2e58(%rip),%xmm1        # 6900 <_sk_callback_sse2+0xdb5>
+  .byte  15,89,5,31,49,0,0                   // mulps         0x311f(%rip),%xmm0        # 6bb0 <_sk_callback_sse2+0xda2>
+  .byte  102,15,111,13,39,49,0,0             // movdqa        0x3127(%rip),%xmm1        # 6bc0 <_sk_callback_sse2+0xdb2>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,90,46,0,0                  // mulps         0x2e5a(%rip),%xmm1        # 6910 <_sk_callback_sse2+0xdc5>
-  .byte  102,15,111,21,98,46,0,0             // movdqa        0x2e62(%rip),%xmm2        # 6920 <_sk_callback_sse2+0xdd5>
+  .byte  15,89,13,41,49,0,0                  // mulps         0x3129(%rip),%xmm1        # 6bd0 <_sk_callback_sse2+0xdc2>
+  .byte  102,15,111,21,49,49,0,0             // movdqa        0x3131(%rip),%xmm2        # 6be0 <_sk_callback_sse2+0xdd2>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,100,46,0,0                 // mulps         0x2e64(%rip),%xmm2        # 6930 <_sk_callback_sse2+0xde5>
-  .byte  102,15,219,29,108,46,0,0            // pand          0x2e6c(%rip),%xmm3        # 6940 <_sk_callback_sse2+0xdf5>
+  .byte  15,89,21,51,49,0,0                  // mulps         0x3133(%rip),%xmm2        # 6bf0 <_sk_callback_sse2+0xde2>
+  .byte  102,15,219,29,59,49,0,0             // pand          0x313b(%rip),%xmm3        # 6c00 <_sk_callback_sse2+0xdf2>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,114,46,0,0                 // mulps         0x2e72(%rip),%xmm3        # 6950 <_sk_callback_sse2+0xe05>
+  .byte  15,89,29,65,49,0,0                  // mulps         0x3141(%rip),%xmm3        # 6c10 <_sk_callback_sse2+0xe02>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,50                              // je            3b21 <_sk_load_4444_sse2+0xab>
+  .byte  116,50                              // je            3b12 <_sk_load_4444_sse2+0xab>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3b0e <_sk_load_4444_sse2+0x98>
+  .byte  116,21                              // je            3aff <_sk_load_4444_sse2+0x98>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,139                             // jne           3a8a <_sk_load_4444_sse2+0x14>
+  .byte  117,139                             // jne           3a7b <_sk_load_4444_sse2+0x14>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  102,65,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
   .byte  242,15,16,216                       // movsd         %xmm0,%xmm3
-  .byte  233,105,255,255,255                 // jmpq          3a8a <_sk_load_4444_sse2+0x14>
+  .byte  233,105,255,255,255                 // jmpq          3a7b <_sk_load_4444_sse2+0x14>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,216                      // movd          %eax,%xmm3
-  .byte  233,91,255,255,255                  // jmpq          3a8a <_sk_load_4444_sse2+0x14>
+  .byte  233,91,255,255,255                  // jmpq          3a7b <_sk_load_4444_sse2+0x14>
 
 HIDDEN _sk_load_4444_dst_sse2
 .globl _sk_load_4444_dst_sse2
@@ -36247,45 +37414,45 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,98                              // jne           3b9b <_sk_load_4444_dst_sse2+0x6c>
+  .byte  117,98                              // jne           3b8c <_sk_load_4444_dst_sse2+0x6c>
   .byte  243,65,15,126,60,82                 // movq          (%r10,%rdx,2),%xmm7
   .byte  102,15,97,248                       // punpcklwd     %xmm0,%xmm7
-  .byte  102,15,111,37,21,46,0,0             // movdqa        0x2e15(%rip),%xmm4        # 6960 <_sk_callback_sse2+0xe15>
+  .byte  102,15,111,37,228,48,0,0            // movdqa        0x30e4(%rip),%xmm4        # 6c20 <_sk_callback_sse2+0xe12>
   .byte  102,15,219,231                      // pand          %xmm7,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,23,46,0,0                  // mulps         0x2e17(%rip),%xmm4        # 6970 <_sk_callback_sse2+0xe25>
-  .byte  102,15,111,45,31,46,0,0             // movdqa        0x2e1f(%rip),%xmm5        # 6980 <_sk_callback_sse2+0xe35>
+  .byte  15,89,37,230,48,0,0                 // mulps         0x30e6(%rip),%xmm4        # 6c30 <_sk_callback_sse2+0xe22>
+  .byte  102,15,111,45,238,48,0,0            // movdqa        0x30ee(%rip),%xmm5        # 6c40 <_sk_callback_sse2+0xe32>
   .byte  102,15,219,239                      // pand          %xmm7,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,45,33,46,0,0                  // mulps         0x2e21(%rip),%xmm5        # 6990 <_sk_callback_sse2+0xe45>
-  .byte  102,15,111,53,41,46,0,0             // movdqa        0x2e29(%rip),%xmm6        # 69a0 <_sk_callback_sse2+0xe55>
+  .byte  15,89,45,240,48,0,0                 // mulps         0x30f0(%rip),%xmm5        # 6c50 <_sk_callback_sse2+0xe42>
+  .byte  102,15,111,53,248,48,0,0            // movdqa        0x30f8(%rip),%xmm6        # 6c60 <_sk_callback_sse2+0xe52>
   .byte  102,15,219,247                      // pand          %xmm7,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,53,43,46,0,0                  // mulps         0x2e2b(%rip),%xmm6        # 69b0 <_sk_callback_sse2+0xe65>
-  .byte  102,15,219,61,51,46,0,0             // pand          0x2e33(%rip),%xmm7        # 69c0 <_sk_callback_sse2+0xe75>
+  .byte  15,89,53,250,48,0,0                 // mulps         0x30fa(%rip),%xmm6        # 6c70 <_sk_callback_sse2+0xe62>
+  .byte  102,15,219,61,2,49,0,0              // pand          0x3102(%rip),%xmm7        # 6c80 <_sk_callback_sse2+0xe72>
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
-  .byte  15,89,61,57,46,0,0                  // mulps         0x2e39(%rip),%xmm7        # 69d0 <_sk_callback_sse2+0xe85>
+  .byte  15,89,61,8,49,0,0                   // mulps         0x3108(%rip),%xmm7        # 6c90 <_sk_callback_sse2+0xe82>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,50                              // je            3bda <_sk_load_4444_dst_sse2+0xab>
+  .byte  116,50                              // je            3bcb <_sk_load_4444_dst_sse2+0xab>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3bc7 <_sk_load_4444_dst_sse2+0x98>
+  .byte  116,21                              // je            3bb8 <_sk_load_4444_dst_sse2+0x98>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,139                             // jne           3b43 <_sk_load_4444_dst_sse2+0x14>
+  .byte  117,139                             // jne           3b34 <_sk_load_4444_dst_sse2+0x14>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  102,65,15,110,36,82                 // movd          (%r10,%rdx,2),%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
   .byte  242,15,16,252                       // movsd         %xmm4,%xmm7
-  .byte  233,105,255,255,255                 // jmpq          3b43 <_sk_load_4444_dst_sse2+0x14>
+  .byte  233,105,255,255,255                 // jmpq          3b34 <_sk_load_4444_dst_sse2+0x14>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,248                      // movd          %eax,%xmm7
-  .byte  233,91,255,255,255                  // jmpq          3b43 <_sk_load_4444_dst_sse2+0x14>
+  .byte  233,91,255,255,255                  // jmpq          3b34 <_sk_load_4444_dst_sse2+0x14>
 
 HIDDEN _sk_gather_4444_sse2
 .globl _sk_gather_4444_sse2
@@ -36320,21 +37487,21 @@
   .byte  102,15,196,216,3                    // pinsrw        $0x3,%eax,%xmm3
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,111,5,114,45,0,0             // movdqa        0x2d72(%rip),%xmm0        # 69e0 <_sk_callback_sse2+0xe95>
+  .byte  102,15,111,5,65,48,0,0              // movdqa        0x3041(%rip),%xmm0        # 6ca0 <_sk_callback_sse2+0xe92>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,116,45,0,0                  // mulps         0x2d74(%rip),%xmm0        # 69f0 <_sk_callback_sse2+0xea5>
-  .byte  102,15,111,13,124,45,0,0            // movdqa        0x2d7c(%rip),%xmm1        # 6a00 <_sk_callback_sse2+0xeb5>
+  .byte  15,89,5,67,48,0,0                   // mulps         0x3043(%rip),%xmm0        # 6cb0 <_sk_callback_sse2+0xea2>
+  .byte  102,15,111,13,75,48,0,0             // movdqa        0x304b(%rip),%xmm1        # 6cc0 <_sk_callback_sse2+0xeb2>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,126,45,0,0                 // mulps         0x2d7e(%rip),%xmm1        # 6a10 <_sk_callback_sse2+0xec5>
-  .byte  102,15,111,21,134,45,0,0            // movdqa        0x2d86(%rip),%xmm2        # 6a20 <_sk_callback_sse2+0xed5>
+  .byte  15,89,13,77,48,0,0                  // mulps         0x304d(%rip),%xmm1        # 6cd0 <_sk_callback_sse2+0xec2>
+  .byte  102,15,111,21,85,48,0,0             // movdqa        0x3055(%rip),%xmm2        # 6ce0 <_sk_callback_sse2+0xed2>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,136,45,0,0                 // mulps         0x2d88(%rip),%xmm2        # 6a30 <_sk_callback_sse2+0xee5>
-  .byte  102,15,219,29,144,45,0,0            // pand          0x2d90(%rip),%xmm3        # 6a40 <_sk_callback_sse2+0xef5>
+  .byte  15,89,21,87,48,0,0                  // mulps         0x3057(%rip),%xmm2        # 6cf0 <_sk_callback_sse2+0xee2>
+  .byte  102,15,219,29,95,48,0,0             // pand          0x305f(%rip),%xmm3        # 6d00 <_sk_callback_sse2+0xef2>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,150,45,0,0                 // mulps         0x2d96(%rip),%xmm3        # 6a50 <_sk_callback_sse2+0xf05>
+  .byte  15,89,29,101,48,0,0                 // mulps         0x3065(%rip),%xmm3        # 6d10 <_sk_callback_sse2+0xf02>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  255,224                             // jmpq          *%rax
@@ -36345,7 +37512,7 @@
 _sk_store_4444_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  68,15,40,5,148,45,0,0               // movaps        0x2d94(%rip),%xmm8        # 6a60 <_sk_callback_sse2+0xf15>
+  .byte  68,15,40,5,99,48,0,0                // movaps        0x3063(%rip),%xmm8        # 6d20 <_sk_callback_sse2+0xf12>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -36367,7 +37534,7 @@
   .byte  102,65,15,114,224,16                // psrad         $0x10,%xmm8
   .byte  102,69,15,107,192                   // packssdw      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           3d3d <_sk_store_4444_sse2+0x7e>
+  .byte  117,10                              // jne           3d2e <_sk_store_4444_sse2+0x7e>
   .byte  242,69,15,17,4,82                   // movsd         %xmm8,(%r10,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -36375,19 +37542,19 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,38                              // je            3d75 <_sk_store_4444_sse2+0xb6>
+  .byte  116,38                              // je            3d66 <_sk_store_4444_sse2+0xb6>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,18                              // je            3d67 <_sk_store_4444_sse2+0xa8>
+  .byte  116,18                              // je            3d58 <_sk_store_4444_sse2+0xa8>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,222                             // jne           3d39 <_sk_store_4444_sse2+0x7a>
+  .byte  117,222                             // jne           3d2a <_sk_store_4444_sse2+0x7a>
   .byte  102,65,15,197,192,4                 // pextrw        $0x4,%xmm8,%eax
   .byte  102,65,137,68,82,4                  // mov           %ax,0x4(%r10,%rdx,2)
   .byte  242,69,15,112,192,232               // pshuflw       $0xe8,%xmm8,%xmm8
   .byte  102,69,15,126,4,82                  // movd          %xmm8,(%r10,%rdx,2)
-  .byte  235,196                             // jmp           3d39 <_sk_store_4444_sse2+0x7a>
+  .byte  235,196                             // jmp           3d2a <_sk_store_4444_sse2+0x7a>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,65,137,4,82                     // mov           %ax,(%r10,%rdx,2)
-  .byte  235,184                             // jmp           3d39 <_sk_store_4444_sse2+0x7a>
+  .byte  235,184                             // jmp           3d2a <_sk_store_4444_sse2+0x7a>
 
 HIDDEN _sk_load_8888_sse2
 .globl _sk_load_8888_sse2
@@ -36396,13 +37563,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,98                              // jne           3ded <_sk_load_8888_sse2+0x6c>
+  .byte  117,98                              // jne           3dde <_sk_load_8888_sse2+0x6c>
   .byte  243,68,15,111,12,144                // movdqu        (%rax,%rdx,4),%xmm9
-  .byte  102,15,111,21,215,44,0,0            // movdqa        0x2cd7(%rip),%xmm2        # 6a70 <_sk_callback_sse2+0xf25>
+  .byte  102,15,111,21,166,47,0,0            // movdqa        0x2fa6(%rip),%xmm2        # 6d30 <_sk_callback_sse2+0xf22>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,211,44,0,0               // movaps        0x2cd3(%rip),%xmm8        # 6a80 <_sk_callback_sse2+0xf35>
+  .byte  68,15,40,5,162,47,0,0               // movaps        0x2fa2(%rip),%xmm8        # 6d40 <_sk_callback_sse2+0xf32>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -36422,18 +37589,18 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,40                              // je            3e22 <_sk_load_8888_sse2+0xa1>
+  .byte  116,40                              // je            3e13 <_sk_load_8888_sse2+0xa1>
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,18                              // je            3e17 <_sk_load_8888_sse2+0x96>
+  .byte  116,18                              // je            3e08 <_sk_load_8888_sse2+0x96>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,134                             // jne           3d91 <_sk_load_8888_sse2+0x10>
+  .byte  117,134                             // jne           3d82 <_sk_load_8888_sse2+0x10>
   .byte  102,15,110,68,144,8                 // movd          0x8(%rax,%rdx,4),%xmm0
   .byte  102,68,15,112,200,69                // pshufd        $0x45,%xmm0,%xmm9
   .byte  102,68,15,18,12,144                 // movlpd        (%rax,%rdx,4),%xmm9
-  .byte  233,111,255,255,255                 // jmpq          3d91 <_sk_load_8888_sse2+0x10>
+  .byte  233,111,255,255,255                 // jmpq          3d82 <_sk_load_8888_sse2+0x10>
   .byte  102,68,15,110,12,144                // movd          (%rax,%rdx,4),%xmm9
-  .byte  233,100,255,255,255                 // jmpq          3d91 <_sk_load_8888_sse2+0x10>
+  .byte  233,100,255,255,255                 // jmpq          3d82 <_sk_load_8888_sse2+0x10>
 
 HIDDEN _sk_load_8888_dst_sse2
 .globl _sk_load_8888_dst_sse2
@@ -36442,13 +37609,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,98                              // jne           3e99 <_sk_load_8888_dst_sse2+0x6c>
+  .byte  117,98                              // jne           3e8a <_sk_load_8888_dst_sse2+0x6c>
   .byte  243,68,15,111,12,144                // movdqu        (%rax,%rdx,4),%xmm9
-  .byte  102,15,111,53,75,44,0,0             // movdqa        0x2c4b(%rip),%xmm6        # 6a90 <_sk_callback_sse2+0xf45>
+  .byte  102,15,111,53,26,47,0,0             // movdqa        0x2f1a(%rip),%xmm6        # 6d50 <_sk_callback_sse2+0xf42>
   .byte  102,65,15,111,225                   // movdqa        %xmm9,%xmm4
   .byte  102,15,219,230                      // pand          %xmm6,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  68,15,40,5,71,44,0,0                // movaps        0x2c47(%rip),%xmm8        # 6aa0 <_sk_callback_sse2+0xf55>
+  .byte  68,15,40,5,22,47,0,0                // movaps        0x2f16(%rip),%xmm8        # 6d60 <_sk_callback_sse2+0xf52>
   .byte  65,15,89,224                        // mulps         %xmm8,%xmm4
   .byte  102,65,15,111,233                   // movdqa        %xmm9,%xmm5
   .byte  102,15,114,213,8                    // psrld         $0x8,%xmm5
@@ -36468,18 +37635,18 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,40                              // je            3ece <_sk_load_8888_dst_sse2+0xa1>
+  .byte  116,40                              // je            3ebf <_sk_load_8888_dst_sse2+0xa1>
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,18                              // je            3ec3 <_sk_load_8888_dst_sse2+0x96>
+  .byte  116,18                              // je            3eb4 <_sk_load_8888_dst_sse2+0x96>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,134                             // jne           3e3d <_sk_load_8888_dst_sse2+0x10>
+  .byte  117,134                             // jne           3e2e <_sk_load_8888_dst_sse2+0x10>
   .byte  102,15,110,100,144,8                // movd          0x8(%rax,%rdx,4),%xmm4
   .byte  102,68,15,112,204,69                // pshufd        $0x45,%xmm4,%xmm9
   .byte  102,68,15,18,12,144                 // movlpd        (%rax,%rdx,4),%xmm9
-  .byte  233,111,255,255,255                 // jmpq          3e3d <_sk_load_8888_dst_sse2+0x10>
+  .byte  233,111,255,255,255                 // jmpq          3e2e <_sk_load_8888_dst_sse2+0x10>
   .byte  102,68,15,110,12,144                // movd          (%rax,%rdx,4),%xmm9
-  .byte  233,100,255,255,255                 // jmpq          3e3d <_sk_load_8888_dst_sse2+0x10>
+  .byte  233,100,255,255,255                 // jmpq          3e2e <_sk_load_8888_dst_sse2+0x10>
 
 HIDDEN _sk_gather_8888_sse2
 .globl _sk_gather_8888_sse2
@@ -36513,11 +37680,11 @@
   .byte  102,67,15,110,12,145                // movd          (%r9,%r10,4),%xmm1
   .byte  102,68,15,98,201                    // punpckldq     %xmm1,%xmm9
   .byte  102,68,15,98,200                    // punpckldq     %xmm0,%xmm9
-  .byte  102,15,111,21,85,43,0,0             // movdqa        0x2b55(%rip),%xmm2        # 6ab0 <_sk_callback_sse2+0xf65>
+  .byte  102,15,111,21,36,46,0,0             // movdqa        0x2e24(%rip),%xmm2        # 6d70 <_sk_callback_sse2+0xf62>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,81,43,0,0                // movaps        0x2b51(%rip),%xmm8        # 6ac0 <_sk_callback_sse2+0xf75>
+  .byte  68,15,40,5,32,46,0,0                // movaps        0x2e20(%rip),%xmm8        # 6d80 <_sk_callback_sse2+0xf72>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -36542,7 +37709,7 @@
 _sk_store_8888_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,19,43,0,0                // movaps        0x2b13(%rip),%xmm8        # 6ad0 <_sk_callback_sse2+0xf85>
+  .byte  68,15,40,5,226,45,0,0               // movaps        0x2de2(%rip),%xmm8        # 6d90 <_sk_callback_sse2+0xf82>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -36561,24 +37728,215 @@
   .byte  102,69,15,235,193                   // por           %xmm9,%xmm8
   .byte  102,69,15,235,194                   // por           %xmm10,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           401d <_sk_store_8888_sse2+0x6d>
+  .byte  117,10                              // jne           400e <_sk_store_8888_sse2+0x6d>
   .byte  243,68,15,127,4,144                 // movdqu        %xmm8,(%rax,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,33                              // je            404b <_sk_store_8888_sse2+0x9b>
+  .byte  116,33                              // je            403c <_sk_store_8888_sse2+0x9b>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,19                              // je            4043 <_sk_store_8888_sse2+0x93>
+  .byte  116,19                              // je            4034 <_sk_store_8888_sse2+0x93>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,227                             // jne           4019 <_sk_store_8888_sse2+0x69>
+  .byte  117,227                             // jne           400a <_sk_store_8888_sse2+0x69>
   .byte  102,69,15,112,200,78                // pshufd        $0x4e,%xmm8,%xmm9
   .byte  102,68,15,126,76,144,8              // movd          %xmm9,0x8(%rax,%rdx,4)
   .byte  102,68,15,214,4,144                 // movq          %xmm8,(%rax,%rdx,4)
-  .byte  235,206                             // jmp           4019 <_sk_store_8888_sse2+0x69>
+  .byte  235,206                             // jmp           400a <_sk_store_8888_sse2+0x69>
   .byte  102,68,15,126,4,144                 // movd          %xmm8,(%rax,%rdx,4)
-  .byte  235,198                             // jmp           4019 <_sk_store_8888_sse2+0x69>
+  .byte  235,198                             // jmp           400a <_sk_store_8888_sse2+0x69>
+
+HIDDEN _sk_load_bgra_sse2
+.globl _sk_load_bgra_sse2
+FUNCTION(_sk_load_bgra_sse2)
+_sk_load_bgra_sse2:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  72,139,0                            // mov           (%rax),%rax
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,98                              // jne           40b0 <_sk_load_bgra_sse2+0x6c>
+  .byte  243,68,15,111,12,144                // movdqu        (%rax,%rdx,4),%xmm9
+  .byte  102,15,111,5,68,45,0,0              // movdqa        0x2d44(%rip),%xmm0        # 6da0 <_sk_callback_sse2+0xf92>
+  .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
+  .byte  102,15,219,200                      // pand          %xmm0,%xmm1
+  .byte  15,91,209                           // cvtdq2ps      %xmm1,%xmm2
+  .byte  68,15,40,5,64,45,0,0                // movaps        0x2d40(%rip),%xmm8        # 6db0 <_sk_callback_sse2+0xfa2>
+  .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
+  .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
+  .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
+  .byte  102,15,219,200                      // pand          %xmm0,%xmm1
+  .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
+  .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
+  .byte  102,65,15,111,217                   // movdqa        %xmm9,%xmm3
+  .byte  102,15,114,211,16                   // psrld         $0x10,%xmm3
+  .byte  102,15,219,216                      // pand          %xmm0,%xmm3
+  .byte  15,91,195                           // cvtdq2ps      %xmm3,%xmm0
+  .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
+  .byte  102,65,15,114,209,24                // psrld         $0x18,%xmm9
+  .byte  65,15,91,217                        // cvtdq2ps      %xmm9,%xmm3
+  .byte  65,15,89,216                        // mulps         %xmm8,%xmm3
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,3                        // and           $0x3,%r9b
+  .byte  65,128,249,1                        // cmp           $0x1,%r9b
+  .byte  116,40                              // je            40e5 <_sk_load_bgra_sse2+0xa1>
+  .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
+  .byte  65,128,249,2                        // cmp           $0x2,%r9b
+  .byte  116,18                              // je            40da <_sk_load_bgra_sse2+0x96>
+  .byte  65,128,249,3                        // cmp           $0x3,%r9b
+  .byte  117,134                             // jne           4054 <_sk_load_bgra_sse2+0x10>
+  .byte  102,15,110,68,144,8                 // movd          0x8(%rax,%rdx,4),%xmm0
+  .byte  102,68,15,112,200,69                // pshufd        $0x45,%xmm0,%xmm9
+  .byte  102,68,15,18,12,144                 // movlpd        (%rax,%rdx,4),%xmm9
+  .byte  233,111,255,255,255                 // jmpq          4054 <_sk_load_bgra_sse2+0x10>
+  .byte  102,68,15,110,12,144                // movd          (%rax,%rdx,4),%xmm9
+  .byte  233,100,255,255,255                 // jmpq          4054 <_sk_load_bgra_sse2+0x10>
+
+HIDDEN _sk_load_bgra_dst_sse2
+.globl _sk_load_bgra_dst_sse2
+FUNCTION(_sk_load_bgra_dst_sse2)
+_sk_load_bgra_dst_sse2:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  72,139,0                            // mov           (%rax),%rax
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,98                              // jne           415c <_sk_load_bgra_dst_sse2+0x6c>
+  .byte  243,68,15,111,12,144                // movdqu        (%rax,%rdx,4),%xmm9
+  .byte  102,15,111,37,184,44,0,0            // movdqa        0x2cb8(%rip),%xmm4        # 6dc0 <_sk_callback_sse2+0xfb2>
+  .byte  102,65,15,111,233                   // movdqa        %xmm9,%xmm5
+  .byte  102,15,219,236                      // pand          %xmm4,%xmm5
+  .byte  15,91,245                           // cvtdq2ps      %xmm5,%xmm6
+  .byte  68,15,40,5,180,44,0,0               // movaps        0x2cb4(%rip),%xmm8        # 6dd0 <_sk_callback_sse2+0xfc2>
+  .byte  65,15,89,240                        // mulps         %xmm8,%xmm6
+  .byte  102,65,15,111,233                   // movdqa        %xmm9,%xmm5
+  .byte  102,15,114,213,8                    // psrld         $0x8,%xmm5
+  .byte  102,15,219,236                      // pand          %xmm4,%xmm5
+  .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
+  .byte  65,15,89,232                        // mulps         %xmm8,%xmm5
+  .byte  102,65,15,111,249                   // movdqa        %xmm9,%xmm7
+  .byte  102,15,114,215,16                   // psrld         $0x10,%xmm7
+  .byte  102,15,219,252                      // pand          %xmm4,%xmm7
+  .byte  15,91,231                           // cvtdq2ps      %xmm7,%xmm4
+  .byte  65,15,89,224                        // mulps         %xmm8,%xmm4
+  .byte  102,65,15,114,209,24                // psrld         $0x18,%xmm9
+  .byte  65,15,91,249                        // cvtdq2ps      %xmm9,%xmm7
+  .byte  65,15,89,248                        // mulps         %xmm8,%xmm7
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,3                        // and           $0x3,%r9b
+  .byte  65,128,249,1                        // cmp           $0x1,%r9b
+  .byte  116,40                              // je            4191 <_sk_load_bgra_dst_sse2+0xa1>
+  .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
+  .byte  65,128,249,2                        // cmp           $0x2,%r9b
+  .byte  116,18                              // je            4186 <_sk_load_bgra_dst_sse2+0x96>
+  .byte  65,128,249,3                        // cmp           $0x3,%r9b
+  .byte  117,134                             // jne           4100 <_sk_load_bgra_dst_sse2+0x10>
+  .byte  102,15,110,100,144,8                // movd          0x8(%rax,%rdx,4),%xmm4
+  .byte  102,68,15,112,204,69                // pshufd        $0x45,%xmm4,%xmm9
+  .byte  102,68,15,18,12,144                 // movlpd        (%rax,%rdx,4),%xmm9
+  .byte  233,111,255,255,255                 // jmpq          4100 <_sk_load_bgra_dst_sse2+0x10>
+  .byte  102,68,15,110,12,144                // movd          (%rax,%rdx,4),%xmm9
+  .byte  233,100,255,255,255                 // jmpq          4100 <_sk_load_bgra_dst_sse2+0x10>
+
+HIDDEN _sk_gather_bgra_sse2
+.globl _sk_gather_bgra_sse2
+FUNCTION(_sk_gather_bgra_sse2)
+_sk_gather_bgra_sse2:
+  .byte  83                                  // push          %rbx
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,139,8                            // mov           (%rax),%r9
+  .byte  243,15,91,201                       // cvttps2dq     %xmm1,%xmm1
+  .byte  102,15,110,80,16                    // movd          0x10(%rax),%xmm2
+  .byte  102,15,112,210,0                    // pshufd        $0x0,%xmm2,%xmm2
+  .byte  102,15,112,217,245                  // pshufd        $0xf5,%xmm1,%xmm3
+  .byte  102,15,244,218                      // pmuludq       %xmm2,%xmm3
+  .byte  102,15,112,219,232                  // pshufd        $0xe8,%xmm3,%xmm3
+  .byte  102,15,244,209                      // pmuludq       %xmm1,%xmm2
+  .byte  102,15,112,202,232                  // pshufd        $0xe8,%xmm2,%xmm1
+  .byte  102,15,98,203                       // punpckldq     %xmm3,%xmm1
+  .byte  243,15,91,192                       // cvttps2dq     %xmm0,%xmm0
+  .byte  102,15,254,193                      // paddd         %xmm1,%xmm0
+  .byte  102,15,112,200,78                   // pshufd        $0x4e,%xmm0,%xmm1
+  .byte  102,72,15,126,200                   // movq          %xmm1,%rax
+  .byte  65,137,194                          // mov           %eax,%r10d
+  .byte  72,193,232,32                       // shr           $0x20,%rax
+  .byte  102,73,15,126,195                   // movq          %xmm0,%r11
+  .byte  68,137,219                          // mov           %r11d,%ebx
+  .byte  73,193,235,32                       // shr           $0x20,%r11
+  .byte  102,67,15,110,4,153                 // movd          (%r9,%r11,4),%xmm0
+  .byte  102,65,15,110,12,129                // movd          (%r9,%rax,4),%xmm1
+  .byte  102,15,98,193                       // punpckldq     %xmm1,%xmm0
+  .byte  102,69,15,110,12,153                // movd          (%r9,%rbx,4),%xmm9
+  .byte  102,67,15,110,12,145                // movd          (%r9,%r10,4),%xmm1
+  .byte  102,68,15,98,201                    // punpckldq     %xmm1,%xmm9
+  .byte  102,68,15,98,200                    // punpckldq     %xmm0,%xmm9
+  .byte  102,15,111,5,194,43,0,0             // movdqa        0x2bc2(%rip),%xmm0        # 6de0 <_sk_callback_sse2+0xfd2>
+  .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
+  .byte  102,15,219,200                      // pand          %xmm0,%xmm1
+  .byte  15,91,209                           // cvtdq2ps      %xmm1,%xmm2
+  .byte  68,15,40,5,190,43,0,0               // movaps        0x2bbe(%rip),%xmm8        # 6df0 <_sk_callback_sse2+0xfe2>
+  .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
+  .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
+  .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
+  .byte  102,15,219,200                      // pand          %xmm0,%xmm1
+  .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
+  .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
+  .byte  102,65,15,111,217                   // movdqa        %xmm9,%xmm3
+  .byte  102,15,114,211,16                   // psrld         $0x10,%xmm3
+  .byte  102,15,219,216                      // pand          %xmm0,%xmm3
+  .byte  15,91,195                           // cvtdq2ps      %xmm3,%xmm0
+  .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
+  .byte  102,65,15,114,209,24                // psrld         $0x18,%xmm9
+  .byte  65,15,91,217                        // cvtdq2ps      %xmm9,%xmm3
+  .byte  65,15,89,216                        // mulps         %xmm8,%xmm3
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  91                                  // pop           %rbx
+  .byte  255,224                             // jmpq          *%rax
+
+HIDDEN _sk_store_bgra_sse2
+.globl _sk_store_bgra_sse2
+FUNCTION(_sk_store_bgra_sse2)
+_sk_store_bgra_sse2:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  72,139,0                            // mov           (%rax),%rax
+  .byte  68,15,40,5,128,43,0,0               // movaps        0x2b80(%rip),%xmm8        # 6e00 <_sk_callback_sse2+0xff2>
+  .byte  68,15,40,202                        // movaps        %xmm2,%xmm9
+  .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
+  .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
+  .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
+  .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
+  .byte  102,69,15,91,210                    // cvtps2dq      %xmm10,%xmm10
+  .byte  102,65,15,114,242,8                 // pslld         $0x8,%xmm10
+  .byte  102,69,15,235,209                   // por           %xmm9,%xmm10
+  .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
+  .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
+  .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
+  .byte  102,65,15,114,241,16                // pslld         $0x10,%xmm9
+  .byte  68,15,89,195                        // mulps         %xmm3,%xmm8
+  .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
+  .byte  102,65,15,114,240,24                // pslld         $0x18,%xmm8
+  .byte  102,69,15,235,193                   // por           %xmm9,%xmm8
+  .byte  102,69,15,235,194                   // por           %xmm10,%xmm8
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,10                              // jne           42e0 <_sk_store_bgra_sse2+0x6d>
+  .byte  243,68,15,127,4,144                 // movdqu        %xmm8,(%rax,%rdx,4)
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,3                        // and           $0x3,%r9b
+  .byte  65,128,249,1                        // cmp           $0x1,%r9b
+  .byte  116,33                              // je            430e <_sk_store_bgra_sse2+0x9b>
+  .byte  65,128,249,2                        // cmp           $0x2,%r9b
+  .byte  116,19                              // je            4306 <_sk_store_bgra_sse2+0x93>
+  .byte  65,128,249,3                        // cmp           $0x3,%r9b
+  .byte  117,227                             // jne           42dc <_sk_store_bgra_sse2+0x69>
+  .byte  102,69,15,112,200,78                // pshufd        $0x4e,%xmm8,%xmm9
+  .byte  102,68,15,126,76,144,8              // movd          %xmm9,0x8(%rax,%rdx,4)
+  .byte  102,68,15,214,4,144                 // movq          %xmm8,(%rax,%rdx,4)
+  .byte  235,206                             // jmp           42dc <_sk_store_bgra_sse2+0x69>
+  .byte  102,68,15,126,4,144                 // movd          %xmm8,(%rax,%rdx,4)
+  .byte  235,198                             // jmp           42dc <_sk_store_bgra_sse2+0x69>
 
 HIDDEN _sk_load_f16_sse2
 .globl _sk_load_f16_sse2
@@ -36587,7 +37945,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,96,1,0,0                     // jne           41c1 <_sk_load_f16_sse2+0x16e>
+  .byte  15,133,96,1,0,0                     // jne           4484 <_sk_load_f16_sse2+0x16e>
   .byte  102,15,16,4,208                     // movupd        (%rax,%rdx,8),%xmm0
   .byte  102,15,16,76,208,16                 // movupd        0x10(%rax,%rdx,8),%xmm1
   .byte  102,68,15,40,192                    // movapd        %xmm0,%xmm8
@@ -36599,7 +37957,7 @@
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
   .byte  102,65,15,111,206                   // movdqa        %xmm14,%xmm1
   .byte  102,65,15,97,202                    // punpcklwd     %xmm10,%xmm1
-  .byte  102,68,15,111,13,63,42,0,0          // movdqa        0x2a3f(%rip),%xmm9        # 6ae0 <_sk_callback_sse2+0xf95>
+  .byte  102,68,15,111,13,172,42,0,0         // movdqa        0x2aac(%rip),%xmm9        # 6e10 <_sk_callback_sse2+0x1002>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,193                   // pand          %xmm9,%xmm0
   .byte  102,15,239,200                      // pxor          %xmm0,%xmm1
@@ -36607,11 +37965,11 @@
   .byte  102,68,15,111,233                   // movdqa        %xmm1,%xmm13
   .byte  102,65,15,114,245,13                // pslld         $0xd,%xmm13
   .byte  102,68,15,235,232                   // por           %xmm0,%xmm13
-  .byte  102,68,15,111,29,36,42,0,0          // movdqa        0x2a24(%rip),%xmm11        # 6af0 <_sk_callback_sse2+0xfa5>
+  .byte  102,68,15,111,29,145,42,0,0         // movdqa        0x2a91(%rip),%xmm11        # 6e20 <_sk_callback_sse2+0x1012>
   .byte  102,69,15,254,235                   // paddd         %xmm11,%xmm13
-  .byte  102,68,15,111,37,38,42,0,0          // movdqa        0x2a26(%rip),%xmm12        # 6b00 <_sk_callback_sse2+0xfb5>
+  .byte  102,68,15,111,37,147,42,0,0         // movdqa        0x2a93(%rip),%xmm12        # 6e30 <_sk_callback_sse2+0x1022>
   .byte  102,65,15,239,204                   // pxor          %xmm12,%xmm1
-  .byte  102,15,111,29,41,42,0,0             // movdqa        0x2a29(%rip),%xmm3        # 6b10 <_sk_callback_sse2+0xfc5>
+  .byte  102,15,111,29,150,42,0,0            // movdqa        0x2a96(%rip),%xmm3        # 6e40 <_sk_callback_sse2+0x1032>
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
   .byte  102,15,102,193                      // pcmpgtd       %xmm1,%xmm0
   .byte  102,65,15,223,197                   // pandn         %xmm13,%xmm0
@@ -36659,17 +38017,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,15,16,4,208                     // movsd         (%rax,%rdx,8),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,17                              // jne           41dd <_sk_load_f16_sse2+0x18a>
+  .byte  117,17                              // jne           44a0 <_sk_load_f16_sse2+0x18a>
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  102,15,20,193                       // unpcklpd      %xmm1,%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
-  .byte  233,143,254,255,255                 // jmpq          406c <_sk_load_f16_sse2+0x19>
+  .byte  233,143,254,255,255                 // jmpq          432f <_sk_load_f16_sse2+0x19>
   .byte  102,15,22,68,208,8                  // movhpd        0x8(%rax,%rdx,8),%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,123,254,255,255              // jb            406c <_sk_load_f16_sse2+0x19>
+  .byte  15,130,123,254,255,255              // jb            432f <_sk_load_f16_sse2+0x19>
   .byte  242,15,16,76,208,16                 // movsd         0x10(%rax,%rdx,8),%xmm1
-  .byte  233,112,254,255,255                 // jmpq          406c <_sk_load_f16_sse2+0x19>
+  .byte  233,112,254,255,255                 // jmpq          432f <_sk_load_f16_sse2+0x19>
 
 HIDDEN _sk_load_f16_dst_sse2
 .globl _sk_load_f16_dst_sse2
@@ -36678,7 +38036,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,96,1,0,0                     // jne           436a <_sk_load_f16_dst_sse2+0x16e>
+  .byte  15,133,96,1,0,0                     // jne           462d <_sk_load_f16_dst_sse2+0x16e>
   .byte  102,15,16,36,208                    // movupd        (%rax,%rdx,8),%xmm4
   .byte  102,15,16,108,208,16                // movupd        0x10(%rax,%rdx,8),%xmm5
   .byte  102,68,15,40,196                    // movapd        %xmm4,%xmm8
@@ -36690,7 +38048,7 @@
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
   .byte  102,65,15,111,238                   // movdqa        %xmm14,%xmm5
   .byte  102,65,15,97,234                    // punpcklwd     %xmm10,%xmm5
-  .byte  102,68,15,111,13,214,40,0,0         // movdqa        0x28d6(%rip),%xmm9        # 6b20 <_sk_callback_sse2+0xfd5>
+  .byte  102,68,15,111,13,67,41,0,0          // movdqa        0x2943(%rip),%xmm9        # 6e50 <_sk_callback_sse2+0x1042>
   .byte  102,15,111,229                      // movdqa        %xmm5,%xmm4
   .byte  102,65,15,219,225                   // pand          %xmm9,%xmm4
   .byte  102,15,239,236                      // pxor          %xmm4,%xmm5
@@ -36698,11 +38056,11 @@
   .byte  102,68,15,111,237                   // movdqa        %xmm5,%xmm13
   .byte  102,65,15,114,245,13                // pslld         $0xd,%xmm13
   .byte  102,68,15,235,236                   // por           %xmm4,%xmm13
-  .byte  102,68,15,111,29,187,40,0,0         // movdqa        0x28bb(%rip),%xmm11        # 6b30 <_sk_callback_sse2+0xfe5>
+  .byte  102,68,15,111,29,40,41,0,0          // movdqa        0x2928(%rip),%xmm11        # 6e60 <_sk_callback_sse2+0x1052>
   .byte  102,69,15,254,235                   // paddd         %xmm11,%xmm13
-  .byte  102,68,15,111,37,189,40,0,0         // movdqa        0x28bd(%rip),%xmm12        # 6b40 <_sk_callback_sse2+0xff5>
+  .byte  102,68,15,111,37,42,41,0,0          // movdqa        0x292a(%rip),%xmm12        # 6e70 <_sk_callback_sse2+0x1062>
   .byte  102,65,15,239,236                   // pxor          %xmm12,%xmm5
-  .byte  102,15,111,61,192,40,0,0            // movdqa        0x28c0(%rip),%xmm7        # 6b50 <_sk_callback_sse2+0x1005>
+  .byte  102,15,111,61,45,41,0,0             // movdqa        0x292d(%rip),%xmm7        # 6e80 <_sk_callback_sse2+0x1072>
   .byte  102,15,111,231                      // movdqa        %xmm7,%xmm4
   .byte  102,15,102,229                      // pcmpgtd       %xmm5,%xmm4
   .byte  102,65,15,223,229                   // pandn         %xmm13,%xmm4
@@ -36750,17 +38108,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,15,16,36,208                    // movsd         (%rax,%rdx,8),%xmm4
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,17                              // jne           4386 <_sk_load_f16_dst_sse2+0x18a>
+  .byte  117,17                              // jne           4649 <_sk_load_f16_dst_sse2+0x18a>
   .byte  102,15,87,237                       // xorpd         %xmm5,%xmm5
   .byte  102,15,20,229                       // unpcklpd      %xmm5,%xmm4
   .byte  102,15,87,237                       // xorpd         %xmm5,%xmm5
-  .byte  233,143,254,255,255                 // jmpq          4215 <_sk_load_f16_dst_sse2+0x19>
+  .byte  233,143,254,255,255                 // jmpq          44d8 <_sk_load_f16_dst_sse2+0x19>
   .byte  102,15,22,100,208,8                 // movhpd        0x8(%rax,%rdx,8),%xmm4
   .byte  102,15,87,237                       // xorpd         %xmm5,%xmm5
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,123,254,255,255              // jb            4215 <_sk_load_f16_dst_sse2+0x19>
+  .byte  15,130,123,254,255,255              // jb            44d8 <_sk_load_f16_dst_sse2+0x19>
   .byte  242,15,16,108,208,16                // movsd         0x10(%rax,%rdx,8),%xmm5
-  .byte  233,112,254,255,255                 // jmpq          4215 <_sk_load_f16_dst_sse2+0x19>
+  .byte  233,112,254,255,255                 // jmpq          44d8 <_sk_load_f16_dst_sse2+0x19>
 
 HIDDEN _sk_gather_f16_sse2
 .globl _sk_gather_f16_sse2
@@ -36802,7 +38160,7 @@
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
   .byte  102,65,15,111,206                   // movdqa        %xmm14,%xmm1
   .byte  102,65,15,97,202                    // punpcklwd     %xmm10,%xmm1
-  .byte  102,68,15,111,13,18,39,0,0          // movdqa        0x2712(%rip),%xmm9        # 6b60 <_sk_callback_sse2+0x1015>
+  .byte  102,68,15,111,13,127,39,0,0         // movdqa        0x277f(%rip),%xmm9        # 6e90 <_sk_callback_sse2+0x1082>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,193                   // pand          %xmm9,%xmm0
   .byte  102,15,239,200                      // pxor          %xmm0,%xmm1
@@ -36810,11 +38168,11 @@
   .byte  102,68,15,111,233                   // movdqa        %xmm1,%xmm13
   .byte  102,65,15,114,245,13                // pslld         $0xd,%xmm13
   .byte  102,68,15,235,232                   // por           %xmm0,%xmm13
-  .byte  102,68,15,111,29,247,38,0,0         // movdqa        0x26f7(%rip),%xmm11        # 6b70 <_sk_callback_sse2+0x1025>
+  .byte  102,68,15,111,29,100,39,0,0         // movdqa        0x2764(%rip),%xmm11        # 6ea0 <_sk_callback_sse2+0x1092>
   .byte  102,69,15,254,235                   // paddd         %xmm11,%xmm13
-  .byte  102,68,15,111,37,249,38,0,0         // movdqa        0x26f9(%rip),%xmm12        # 6b80 <_sk_callback_sse2+0x1035>
+  .byte  102,68,15,111,37,102,39,0,0         // movdqa        0x2766(%rip),%xmm12        # 6eb0 <_sk_callback_sse2+0x10a2>
   .byte  102,65,15,239,204                   // pxor          %xmm12,%xmm1
-  .byte  102,15,111,29,252,38,0,0            // movdqa        0x26fc(%rip),%xmm3        # 6b90 <_sk_callback_sse2+0x1045>
+  .byte  102,15,111,29,105,39,0,0            // movdqa        0x2769(%rip),%xmm3        # 6ec0 <_sk_callback_sse2+0x10b2>
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
   .byte  102,15,102,193                      // pcmpgtd       %xmm1,%xmm0
   .byte  102,65,15,223,197                   // pandn         %xmm13,%xmm0
@@ -36868,17 +38226,17 @@
 _sk_store_f16_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  102,68,15,111,21,35,38,0,0          // movdqa        0x2623(%rip),%xmm10        # 6ba0 <_sk_callback_sse2+0x1055>
+  .byte  102,68,15,111,21,144,38,0,0         // movdqa        0x2690(%rip),%xmm10        # 6ed0 <_sk_callback_sse2+0x10c2>
   .byte  102,68,15,111,224                   // movdqa        %xmm0,%xmm12
   .byte  102,69,15,219,226                   // pand          %xmm10,%xmm12
   .byte  102,68,15,111,232                   // movdqa        %xmm0,%xmm13
   .byte  102,69,15,239,236                   // pxor          %xmm12,%xmm13
-  .byte  102,68,15,111,13,22,38,0,0          // movdqa        0x2616(%rip),%xmm9        # 6bb0 <_sk_callback_sse2+0x1065>
+  .byte  102,68,15,111,13,131,38,0,0         // movdqa        0x2683(%rip),%xmm9        # 6ee0 <_sk_callback_sse2+0x10d2>
   .byte  102,65,15,114,212,16                // psrld         $0x10,%xmm12
   .byte  102,69,15,111,193                   // movdqa        %xmm9,%xmm8
   .byte  102,69,15,102,197                   // pcmpgtd       %xmm13,%xmm8
   .byte  102,65,15,114,213,13                // psrld         $0xd,%xmm13
-  .byte  102,68,15,111,29,7,38,0,0           // movdqa        0x2607(%rip),%xmm11        # 6bc0 <_sk_callback_sse2+0x1075>
+  .byte  102,68,15,111,29,116,38,0,0         // movdqa        0x2674(%rip),%xmm11        # 6ef0 <_sk_callback_sse2+0x10e2>
   .byte  102,69,15,235,227                   // por           %xmm11,%xmm12
   .byte  102,69,15,254,229                   // paddd         %xmm13,%xmm12
   .byte  102,65,15,114,244,16                // pslld         $0x10,%xmm12
@@ -36930,7 +38288,7 @@
   .byte  102,69,15,111,200                   // movdqa        %xmm8,%xmm9
   .byte  102,69,15,98,204                    // punpckldq     %xmm12,%xmm9
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,21                              // jne           46db <_sk_store_f16_sse2+0x16c>
+  .byte  117,21                              // jne           499e <_sk_store_f16_sse2+0x16c>
   .byte  68,15,17,12,208                     // movups        %xmm9,(%rax,%rdx,8)
   .byte  102,69,15,106,196                   // punpckhdq     %xmm12,%xmm8
   .byte  243,68,15,127,68,208,16             // movdqu        %xmm8,0x10(%rax,%rdx,8)
@@ -36938,13 +38296,13 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  102,68,15,214,12,208                // movq          %xmm9,(%rax,%rdx,8)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            46d7 <_sk_store_f16_sse2+0x168>
+  .byte  116,240                             // je            499a <_sk_store_f16_sse2+0x168>
   .byte  102,68,15,23,76,208,8               // movhpd        %xmm9,0x8(%rax,%rdx,8)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            46d7 <_sk_store_f16_sse2+0x168>
+  .byte  114,227                             // jb            499a <_sk_store_f16_sse2+0x168>
   .byte  102,69,15,106,196                   // punpckhdq     %xmm12,%xmm8
   .byte  102,68,15,214,68,208,16             // movq          %xmm8,0x10(%rax,%rdx,8)
-  .byte  235,213                             // jmp           46d7 <_sk_store_f16_sse2+0x168>
+  .byte  235,213                             // jmp           499a <_sk_store_f16_sse2+0x168>
 
 HIDDEN _sk_load_u16_be_sse2
 .globl _sk_load_u16_be_sse2
@@ -36954,7 +38312,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,190,0,0,0                    // jne           47d6 <_sk_load_u16_be_sse2+0xd4>
+  .byte  15,133,190,0,0,0                    // jne           4a99 <_sk_load_u16_be_sse2+0xd4>
   .byte  102,65,15,16,4,65                   // movupd        (%r9,%rax,2),%xmm0
   .byte  102,65,15,16,76,65,16               // movupd        0x10(%r9,%rax,2),%xmm1
   .byte  102,15,40,208                       // movapd        %xmm0,%xmm2
@@ -36971,7 +38329,7 @@
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  102,65,15,97,201                    // punpcklwd     %xmm9,%xmm1
   .byte  15,91,193                           // cvtdq2ps      %xmm1,%xmm0
-  .byte  68,15,40,5,103,36,0,0               // movaps        0x2467(%rip),%xmm8        # 6bd0 <_sk_callback_sse2+0x1085>
+  .byte  68,15,40,5,212,36,0,0               // movaps        0x24d4(%rip),%xmm8        # 6f00 <_sk_callback_sse2+0x10f2>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -36999,17 +38357,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,65,15,16,4,65                   // movsd         (%r9,%rax,2),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,17                              // jne           47f3 <_sk_load_u16_be_sse2+0xf1>
+  .byte  117,17                              // jne           4ab6 <_sk_load_u16_be_sse2+0xf1>
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  102,15,20,193                       // unpcklpd      %xmm1,%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
-  .byte  233,50,255,255,255                  // jmpq          4725 <_sk_load_u16_be_sse2+0x23>
+  .byte  233,50,255,255,255                  // jmpq          49e8 <_sk_load_u16_be_sse2+0x23>
   .byte  102,65,15,22,68,65,8                // movhpd        0x8(%r9,%rax,2),%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,29,255,255,255               // jb            4725 <_sk_load_u16_be_sse2+0x23>
+  .byte  15,130,29,255,255,255               // jb            49e8 <_sk_load_u16_be_sse2+0x23>
   .byte  242,65,15,16,76,65,16               // movsd         0x10(%r9,%rax,2),%xmm1
-  .byte  233,17,255,255,255                  // jmpq          4725 <_sk_load_u16_be_sse2+0x23>
+  .byte  233,17,255,255,255                  // jmpq          49e8 <_sk_load_u16_be_sse2+0x23>
 
 HIDDEN _sk_load_rgb_u16_be_sse2
 .globl _sk_load_rgb_u16_be_sse2
@@ -37019,7 +38377,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,82                         // lea           (%rdx,%rdx,2),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,175,0,0,0                    // jne           48d5 <_sk_load_rgb_u16_be_sse2+0xc1>
+  .byte  15,133,175,0,0,0                    // jne           4b98 <_sk_load_rgb_u16_be_sse2+0xc1>
   .byte  243,65,15,111,20,65                 // movdqu        (%r9,%rax,2),%xmm2
   .byte  243,65,15,111,92,65,8               // movdqu        0x8(%r9,%rax,2),%xmm3
   .byte  102,15,115,219,4                    // psrldq        $0x4,%xmm3
@@ -37040,7 +38398,7 @@
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,65,15,97,200                    // punpcklwd     %xmm8,%xmm1
   .byte  15,91,193                           // cvtdq2ps      %xmm1,%xmm0
-  .byte  68,15,40,13,86,35,0,0               // movaps        0x2356(%rip),%xmm9        # 6be0 <_sk_callback_sse2+0x1095>
+  .byte  68,15,40,13,195,35,0,0              // movaps        0x23c3(%rip),%xmm9        # 6f10 <_sk_callback_sse2+0x1102>
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -37057,27 +38415,27 @@
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,209                        // mulps         %xmm9,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,29,35,0,0                  // movaps        0x231d(%rip),%xmm3        # 6bf0 <_sk_callback_sse2+0x10a5>
+  .byte  15,40,29,138,35,0,0                 // movaps        0x238a(%rip),%xmm3        # 6f20 <_sk_callback_sse2+0x1112>
   .byte  255,224                             // jmpq          *%rax
   .byte  102,65,15,110,20,65                 // movd          (%r9,%rax,2),%xmm2
   .byte  102,65,15,196,84,65,4,2             // pinsrw        $0x2,0x4(%r9,%rax,2),%xmm2
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           48fa <_sk_load_rgb_u16_be_sse2+0xe6>
+  .byte  117,13                              // jne           4bbd <_sk_load_rgb_u16_be_sse2+0xe6>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,80,255,255,255                  // jmpq          484a <_sk_load_rgb_u16_be_sse2+0x36>
+  .byte  233,80,255,255,255                  // jmpq          4b0d <_sk_load_rgb_u16_be_sse2+0x36>
   .byte  102,65,15,110,68,65,6               // movd          0x6(%r9,%rax,2),%xmm0
   .byte  102,65,15,196,68,65,10,2            // pinsrw        $0x2,0xa(%r9,%rax,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,24                              // jb            492b <_sk_load_rgb_u16_be_sse2+0x117>
+  .byte  114,24                              // jb            4bee <_sk_load_rgb_u16_be_sse2+0x117>
   .byte  102,65,15,110,92,65,12              // movd          0xc(%r9,%rax,2),%xmm3
   .byte  102,65,15,196,92,65,16,2            // pinsrw        $0x2,0x10(%r9,%rax,2),%xmm3
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,31,255,255,255                  // jmpq          484a <_sk_load_rgb_u16_be_sse2+0x36>
+  .byte  233,31,255,255,255                  // jmpq          4b0d <_sk_load_rgb_u16_be_sse2+0x36>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
-  .byte  233,22,255,255,255                  // jmpq          484a <_sk_load_rgb_u16_be_sse2+0x36>
+  .byte  233,22,255,255,255                  // jmpq          4b0d <_sk_load_rgb_u16_be_sse2+0x36>
 
 HIDDEN _sk_store_u16_be_sse2
 .globl _sk_store_u16_be_sse2
@@ -37086,7 +38444,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
-  .byte  68,15,40,21,183,34,0,0              // movaps        0x22b7(%rip),%xmm10        # 6c00 <_sk_callback_sse2+0x10b5>
+  .byte  68,15,40,21,36,35,0,0               // movaps        0x2324(%rip),%xmm10        # 6f30 <_sk_callback_sse2+0x1122>
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  69,15,89,194                        // mulps         %xmm10,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
@@ -37131,7 +38489,7 @@
   .byte  102,69,15,111,208                   // movdqa        %xmm8,%xmm10
   .byte  102,69,15,98,209                    // punpckldq     %xmm9,%xmm10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,21                              // jne           4a43 <_sk_store_u16_be_sse2+0x10f>
+  .byte  117,21                              // jne           4d06 <_sk_store_u16_be_sse2+0x10f>
   .byte  69,15,17,20,65                      // movups        %xmm10,(%r9,%rax,2)
   .byte  102,69,15,106,193                   // punpckhdq     %xmm9,%xmm8
   .byte  243,69,15,127,68,65,16              // movdqu        %xmm8,0x10(%r9,%rax,2)
@@ -37139,13 +38497,13 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  102,69,15,214,20,65                 // movq          %xmm10,(%r9,%rax,2)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            4a3f <_sk_store_u16_be_sse2+0x10b>
+  .byte  116,240                             // je            4d02 <_sk_store_u16_be_sse2+0x10b>
   .byte  102,69,15,23,84,65,8                // movhpd        %xmm10,0x8(%r9,%rax,2)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            4a3f <_sk_store_u16_be_sse2+0x10b>
+  .byte  114,227                             // jb            4d02 <_sk_store_u16_be_sse2+0x10b>
   .byte  102,69,15,106,193                   // punpckhdq     %xmm9,%xmm8
   .byte  102,69,15,214,68,65,16              // movq          %xmm8,0x10(%r9,%rax,2)
-  .byte  235,213                             // jmp           4a3f <_sk_store_u16_be_sse2+0x10b>
+  .byte  235,213                             // jmp           4d02 <_sk_store_u16_be_sse2+0x10b>
 
 HIDDEN _sk_load_f32_sse2
 .globl _sk_load_f32_sse2
@@ -37158,7 +38516,7 @@
   .byte  72,193,224,4                        // shl           $0x4,%rax
   .byte  69,15,16,4,2                        // movups        (%r10,%rax,1),%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           4aca <_sk_load_f32_sse2+0x60>
+  .byte  117,66                              // jne           4d8d <_sk_load_f32_sse2+0x60>
   .byte  67,15,16,68,138,16                  // movups        0x10(%r10,%r9,4),%xmm0
   .byte  67,15,16,92,138,32                  // movups        0x20(%r10,%r9,4),%xmm3
   .byte  71,15,16,76,138,48                  // movups        0x30(%r10,%r9,4),%xmm9
@@ -37178,17 +38536,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  69,15,87,201                        // xorps         %xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,8                               // jne           4adc <_sk_load_f32_sse2+0x72>
+  .byte  117,8                               // jne           4d9f <_sk_load_f32_sse2+0x72>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
-  .byte  235,190                             // jmp           4a9a <_sk_load_f32_sse2+0x30>
+  .byte  235,190                             // jmp           4d5d <_sk_load_f32_sse2+0x30>
   .byte  67,15,16,68,138,16                  // movups        0x10(%r10,%r9,4),%xmm0
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,8                               // jb            4af0 <_sk_load_f32_sse2+0x86>
+  .byte  114,8                               // jb            4db3 <_sk_load_f32_sse2+0x86>
   .byte  67,15,16,92,138,32                  // movups        0x20(%r10,%r9,4),%xmm3
-  .byte  235,170                             // jmp           4a9a <_sk_load_f32_sse2+0x30>
+  .byte  235,170                             // jmp           4d5d <_sk_load_f32_sse2+0x30>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
-  .byte  235,165                             // jmp           4a9a <_sk_load_f32_sse2+0x30>
+  .byte  235,165                             // jmp           4d5d <_sk_load_f32_sse2+0x30>
 
 HIDDEN _sk_load_f32_dst_sse2
 .globl _sk_load_f32_dst_sse2
@@ -37201,7 +38559,7 @@
   .byte  72,193,224,4                        // shl           $0x4,%rax
   .byte  69,15,16,4,2                        // movups        (%r10,%rax,1),%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           4b55 <_sk_load_f32_dst_sse2+0x60>
+  .byte  117,66                              // jne           4e18 <_sk_load_f32_dst_sse2+0x60>
   .byte  67,15,16,100,138,16                 // movups        0x10(%r10,%r9,4),%xmm4
   .byte  67,15,16,124,138,32                 // movups        0x20(%r10,%r9,4),%xmm7
   .byte  71,15,16,76,138,48                  // movups        0x30(%r10,%r9,4),%xmm9
@@ -37221,17 +38579,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  69,15,87,201                        // xorps         %xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,8                               // jne           4b67 <_sk_load_f32_dst_sse2+0x72>
+  .byte  117,8                               // jne           4e2a <_sk_load_f32_dst_sse2+0x72>
   .byte  15,87,255                           // xorps         %xmm7,%xmm7
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
-  .byte  235,190                             // jmp           4b25 <_sk_load_f32_dst_sse2+0x30>
+  .byte  235,190                             // jmp           4de8 <_sk_load_f32_dst_sse2+0x30>
   .byte  67,15,16,100,138,16                 // movups        0x10(%r10,%r9,4),%xmm4
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,8                               // jb            4b7b <_sk_load_f32_dst_sse2+0x86>
+  .byte  114,8                               // jb            4e3e <_sk_load_f32_dst_sse2+0x86>
   .byte  67,15,16,124,138,32                 // movups        0x20(%r10,%r9,4),%xmm7
-  .byte  235,170                             // jmp           4b25 <_sk_load_f32_dst_sse2+0x30>
+  .byte  235,170                             // jmp           4de8 <_sk_load_f32_dst_sse2+0x30>
   .byte  15,87,255                           // xorps         %xmm7,%xmm7
-  .byte  235,165                             // jmp           4b25 <_sk_load_f32_dst_sse2+0x30>
+  .byte  235,165                             // jmp           4de8 <_sk_load_f32_dst_sse2+0x30>
 
 HIDDEN _sk_store_f32_sse2
 .globl _sk_store_f32_sse2
@@ -37257,7 +38615,7 @@
   .byte  102,69,15,20,203                    // unpcklpd      %xmm11,%xmm9
   .byte  102,69,15,17,36,2                   // movupd        %xmm12,(%r10,%rax,1)
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,29                              // jne           4bf2 <_sk_store_f32_sse2+0x72>
+  .byte  117,29                              // jne           4eb5 <_sk_store_f32_sse2+0x72>
   .byte  102,69,15,21,211                    // unpckhpd      %xmm11,%xmm10
   .byte  71,15,17,68,138,16                  // movups        %xmm8,0x10(%r10,%r9,4)
   .byte  102,71,15,17,76,138,32              // movupd        %xmm9,0x20(%r10,%r9,4)
@@ -37265,12 +38623,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,246                             // je            4bee <_sk_store_f32_sse2+0x6e>
+  .byte  116,246                             // je            4eb1 <_sk_store_f32_sse2+0x6e>
   .byte  71,15,17,68,138,16                  // movups        %xmm8,0x10(%r10,%r9,4)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,234                             // jb            4bee <_sk_store_f32_sse2+0x6e>
+  .byte  114,234                             // jb            4eb1 <_sk_store_f32_sse2+0x6e>
   .byte  102,71,15,17,76,138,32              // movupd        %xmm9,0x20(%r10,%r9,4)
-  .byte  235,225                             // jmp           4bee <_sk_store_f32_sse2+0x6e>
+  .byte  235,225                             // jmp           4eb1 <_sk_store_f32_sse2+0x6e>
 
 HIDDEN _sk_clamp_x_sse2
 .globl _sk_clamp_x_sse2
@@ -37316,7 +38674,7 @@
   .byte  243,69,15,91,209                    // cvttps2dq     %xmm9,%xmm10
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,84,13,133,31,0,0              // andps         0x1f85(%rip),%xmm9        # 6c10 <_sk_callback_sse2+0x10c5>
+  .byte  68,15,84,13,242,31,0,0              // andps         0x1ff2(%rip),%xmm9        # 6f40 <_sk_callback_sse2+0x1132>
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
@@ -37339,7 +38697,7 @@
   .byte  243,69,15,91,209                    // cvttps2dq     %xmm9,%xmm10
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,84,13,70,31,0,0               // andps         0x1f46(%rip),%xmm9        # 6c20 <_sk_callback_sse2+0x10d5>
+  .byte  68,15,84,13,179,31,0,0              // andps         0x1fb3(%rip),%xmm9        # 6f50 <_sk_callback_sse2+0x1142>
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
@@ -37362,13 +38720,13 @@
   .byte  65,15,92,192                        // subps         %xmm8,%xmm0
   .byte  243,69,15,88,201                    // addss         %xmm9,%xmm9
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
-  .byte  243,68,15,89,21,22,35,0,0           // mulss         0x2316(%rip),%xmm10        # 7040 <_sk_callback_sse2+0x14f5>
+  .byte  243,68,15,89,21,131,35,0,0          // mulss         0x2383(%rip),%xmm10        # 7370 <_sk_callback_sse2+0x1562>
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  68,15,89,208                        // mulps         %xmm0,%xmm10
   .byte  243,69,15,91,218                    // cvttps2dq     %xmm10,%xmm11
   .byte  69,15,91,219                        // cvtdq2ps      %xmm11,%xmm11
   .byte  69,15,194,211,1                     // cmpltps       %xmm11,%xmm10
-  .byte  68,15,84,21,231,30,0,0              // andps         0x1ee7(%rip),%xmm10        # 6c30 <_sk_callback_sse2+0x10e5>
+  .byte  68,15,84,21,84,31,0,0               // andps         0x1f54(%rip),%xmm10        # 6f60 <_sk_callback_sse2+0x1152>
   .byte  69,15,87,228                        // xorps         %xmm12,%xmm12
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  69,15,89,217                        // mulps         %xmm9,%xmm11
@@ -37394,13 +38752,13 @@
   .byte  65,15,92,200                        // subps         %xmm8,%xmm1
   .byte  243,69,15,88,201                    // addss         %xmm9,%xmm9
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
-  .byte  243,68,15,89,21,160,34,0,0          // mulss         0x22a0(%rip),%xmm10        # 7044 <_sk_callback_sse2+0x14f9>
+  .byte  243,68,15,89,21,13,35,0,0           // mulss         0x230d(%rip),%xmm10        # 7374 <_sk_callback_sse2+0x1566>
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  68,15,89,209                        // mulps         %xmm1,%xmm10
   .byte  243,69,15,91,218                    // cvttps2dq     %xmm10,%xmm11
   .byte  69,15,91,219                        // cvtdq2ps      %xmm11,%xmm11
   .byte  69,15,194,211,1                     // cmpltps       %xmm11,%xmm10
-  .byte  68,15,84,21,125,30,0,0              // andps         0x1e7d(%rip),%xmm10        # 6c40 <_sk_callback_sse2+0x10f5>
+  .byte  68,15,84,21,234,30,0,0              // andps         0x1eea(%rip),%xmm10        # 6f70 <_sk_callback_sse2+0x1162>
   .byte  69,15,87,228                        // xorps         %xmm12,%xmm12
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  69,15,89,217                        // mulps         %xmm9,%xmm11
@@ -37420,7 +38778,7 @@
 _sk_clamp_x_1_sse2:
   .byte  69,15,87,192                        // xorps         %xmm8,%xmm8
   .byte  68,15,95,192                        // maxps         %xmm0,%xmm8
-  .byte  68,15,93,5,79,30,0,0                // minps         0x1e4f(%rip),%xmm8        # 6c50 <_sk_callback_sse2+0x1105>
+  .byte  68,15,93,5,188,30,0,0               // minps         0x1ebc(%rip),%xmm8        # 6f80 <_sk_callback_sse2+0x1172>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -37433,7 +38791,7 @@
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,194,200,1                     // cmpltps       %xmm8,%xmm9
-  .byte  68,15,84,13,61,30,0,0               // andps         0x1e3d(%rip),%xmm9        # 6c60 <_sk_callback_sse2+0x1115>
+  .byte  68,15,84,13,170,30,0,0              // andps         0x1eaa(%rip),%xmm9        # 6f90 <_sk_callback_sse2+0x1182>
   .byte  69,15,92,193                        // subps         %xmm9,%xmm8
   .byte  65,15,92,192                        // subps         %xmm8,%xmm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -37443,14 +38801,14 @@
 .globl _sk_mirror_x_1_sse2
 FUNCTION(_sk_mirror_x_1_sse2)
 _sk_mirror_x_1_sse2:
-  .byte  68,15,40,5,57,30,0,0                // movaps        0x1e39(%rip),%xmm8        # 6c70 <_sk_callback_sse2+0x1125>
+  .byte  68,15,40,5,166,30,0,0               // movaps        0x1ea6(%rip),%xmm8        # 6fa0 <_sk_callback_sse2+0x1192>
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,13,61,30,0,0               // movaps        0x1e3d(%rip),%xmm9        # 6c80 <_sk_callback_sse2+0x1135>
+  .byte  68,15,40,13,170,30,0,0              // movaps        0x1eaa(%rip),%xmm9        # 6fb0 <_sk_callback_sse2+0x11a2>
   .byte  68,15,89,200                        // mulps         %xmm0,%xmm9
   .byte  243,69,15,91,209                    // cvttps2dq     %xmm9,%xmm10
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,84,13,51,30,0,0               // andps         0x1e33(%rip),%xmm9        # 6c90 <_sk_callback_sse2+0x1145>
+  .byte  68,15,84,13,160,30,0,0              // andps         0x1ea0(%rip),%xmm9        # 6fc0 <_sk_callback_sse2+0x11b2>
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,88,210                        // addps         %xmm10,%xmm10
@@ -37466,10 +38824,10 @@
 FUNCTION(_sk_luminance_to_alpha_sse2)
 _sk_luminance_to_alpha_sse2:
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
-  .byte  15,89,5,25,30,0,0                   // mulps         0x1e19(%rip),%xmm0        # 6ca0 <_sk_callback_sse2+0x1155>
-  .byte  15,89,13,34,30,0,0                  // mulps         0x1e22(%rip),%xmm1        # 6cb0 <_sk_callback_sse2+0x1165>
+  .byte  15,89,5,134,30,0,0                  // mulps         0x1e86(%rip),%xmm0        # 6fd0 <_sk_callback_sse2+0x11c2>
+  .byte  15,89,13,143,30,0,0                 // mulps         0x1e8f(%rip),%xmm1        # 6fe0 <_sk_callback_sse2+0x11d2>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
-  .byte  15,89,29,40,30,0,0                  // mulps         0x1e28(%rip),%xmm3        # 6cc0 <_sk_callback_sse2+0x1175>
+  .byte  15,89,29,149,30,0,0                 // mulps         0x1e95(%rip),%xmm3        # 6ff0 <_sk_callback_sse2+0x11e2>
   .byte  15,88,217                           // addps         %xmm1,%xmm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
@@ -37747,9 +39105,9 @@
   .byte  72,139,24                           // mov           (%rax),%rbx
   .byte  76,139,112,8                        // mov           0x8(%rax),%r14
   .byte  72,255,203                          // dec           %rbx
-  .byte  120,7                               // js            52d4 <_sk_evenly_spaced_gradient_sse2+0x18>
+  .byte  120,7                               // js            5597 <_sk_evenly_spaced_gradient_sse2+0x18>
   .byte  243,72,15,42,203                    // cvtsi2ss      %rbx,%xmm1
-  .byte  235,21                              // jmp           52e9 <_sk_evenly_spaced_gradient_sse2+0x2d>
+  .byte  235,21                              // jmp           55ac <_sk_evenly_spaced_gradient_sse2+0x2d>
   .byte  73,137,217                          // mov           %rbx,%r9
   .byte  73,209,233                          // shr           %r9
   .byte  131,227,1                           // and           $0x1,%ebx
@@ -37847,15 +39205,15 @@
 .globl _sk_gauss_a_to_rgba_sse2
 FUNCTION(_sk_gauss_a_to_rgba_sse2)
 _sk_gauss_a_to_rgba_sse2:
-  .byte  15,40,5,91,24,0,0                   // movaps        0x185b(%rip),%xmm0        # 6cd0 <_sk_callback_sse2+0x1185>
+  .byte  15,40,5,200,24,0,0                  // movaps        0x18c8(%rip),%xmm0        # 7000 <_sk_callback_sse2+0x11f2>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,97,24,0,0                   // addps         0x1861(%rip),%xmm0        # 6ce0 <_sk_callback_sse2+0x1195>
+  .byte  15,88,5,206,24,0,0                  // addps         0x18ce(%rip),%xmm0        # 7010 <_sk_callback_sse2+0x1202>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,103,24,0,0                  // addps         0x1867(%rip),%xmm0        # 6cf0 <_sk_callback_sse2+0x11a5>
+  .byte  15,88,5,212,24,0,0                  // addps         0x18d4(%rip),%xmm0        # 7020 <_sk_callback_sse2+0x1212>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,109,24,0,0                  // addps         0x186d(%rip),%xmm0        # 6d00 <_sk_callback_sse2+0x11b5>
+  .byte  15,88,5,218,24,0,0                  // addps         0x18da(%rip),%xmm0        # 7030 <_sk_callback_sse2+0x1222>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,115,24,0,0                  // addps         0x1873(%rip),%xmm0        # 6d10 <_sk_callback_sse2+0x11c5>
+  .byte  15,88,5,224,24,0,0                  // addps         0x18e0(%rip),%xmm0        # 7040 <_sk_callback_sse2+0x1232>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
@@ -37873,12 +39231,12 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,249,2                        // cmp           $0x2,%r9
-  .byte  114,50                              // jb            54f0 <_sk_gradient_sse2+0x46>
+  .byte  114,50                              // jb            57b3 <_sk_gradient_sse2+0x46>
   .byte  72,139,88,72                        // mov           0x48(%rax),%rbx
   .byte  73,255,201                          // dec           %r9
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  15,40,21,76,24,0,0                  // movaps        0x184c(%rip),%xmm2        # 6d20 <_sk_callback_sse2+0x11d5>
+  .byte  15,40,21,185,24,0,0                 // movaps        0x18b9(%rip),%xmm2        # 7050 <_sk_callback_sse2+0x1242>
   .byte  243,15,16,27                        // movss         (%rbx),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
@@ -37886,7 +39244,7 @@
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  73,255,201                          // dec           %r9
-  .byte  117,228                             // jne           54d4 <_sk_gradient_sse2+0x2a>
+  .byte  117,228                             // jne           5797 <_sk_gradient_sse2+0x2a>
   .byte  102,15,112,209,78                   // pshufd        $0x4e,%xmm1,%xmm2
   .byte  102,73,15,126,211                   // movq          %xmm2,%r11
   .byte  69,137,217                          // mov           %r11d,%r9d
@@ -38025,29 +39383,29 @@
   .byte  69,15,94,220                        // divps         %xmm12,%xmm11
   .byte  69,15,40,227                        // movaps        %xmm11,%xmm12
   .byte  69,15,89,228                        // mulps         %xmm12,%xmm12
-  .byte  68,15,40,45,13,22,0,0               // movaps        0x160d(%rip),%xmm13        # 6d30 <_sk_callback_sse2+0x11e5>
+  .byte  68,15,40,45,122,22,0,0              // movaps        0x167a(%rip),%xmm13        # 7060 <_sk_callback_sse2+0x1252>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
-  .byte  68,15,88,45,17,22,0,0               // addps         0x1611(%rip),%xmm13        # 6d40 <_sk_callback_sse2+0x11f5>
+  .byte  68,15,88,45,126,22,0,0              // addps         0x167e(%rip),%xmm13        # 7070 <_sk_callback_sse2+0x1262>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
-  .byte  68,15,88,45,21,22,0,0               // addps         0x1615(%rip),%xmm13        # 6d50 <_sk_callback_sse2+0x1205>
+  .byte  68,15,88,45,130,22,0,0              // addps         0x1682(%rip),%xmm13        # 7080 <_sk_callback_sse2+0x1272>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
-  .byte  68,15,88,45,25,22,0,0               // addps         0x1619(%rip),%xmm13        # 6d60 <_sk_callback_sse2+0x1215>
+  .byte  68,15,88,45,134,22,0,0              // addps         0x1686(%rip),%xmm13        # 7090 <_sk_callback_sse2+0x1282>
   .byte  69,15,89,235                        // mulps         %xmm11,%xmm13
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,40,21,24,22,0,0               // movaps        0x1618(%rip),%xmm10        # 6d70 <_sk_callback_sse2+0x1225>
+  .byte  68,15,40,21,133,22,0,0              // movaps        0x1685(%rip),%xmm10        # 70a0 <_sk_callback_sse2+0x1292>
   .byte  69,15,92,213                        // subps         %xmm13,%xmm10
   .byte  69,15,84,209                        // andps         %xmm9,%xmm10
   .byte  69,15,85,205                        // andnps        %xmm13,%xmm9
   .byte  69,15,86,202                        // orps          %xmm10,%xmm9
   .byte  68,15,194,192,1                     // cmpltps       %xmm0,%xmm8
-  .byte  68,15,40,21,11,22,0,0               // movaps        0x160b(%rip),%xmm10        # 6d80 <_sk_callback_sse2+0x1235>
+  .byte  68,15,40,21,120,22,0,0              // movaps        0x1678(%rip),%xmm10        # 70b0 <_sk_callback_sse2+0x12a2>
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,84,208                        // andps         %xmm8,%xmm10
   .byte  69,15,85,193                        // andnps        %xmm9,%xmm8
   .byte  69,15,86,194                        // orps          %xmm10,%xmm8
   .byte  68,15,40,201                        // movaps        %xmm1,%xmm9
   .byte  68,15,194,200,1                     // cmpltps       %xmm0,%xmm9
-  .byte  68,15,40,21,250,21,0,0              // movaps        0x15fa(%rip),%xmm10        # 6d90 <_sk_callback_sse2+0x1245>
+  .byte  68,15,40,21,103,22,0,0              // movaps        0x1667(%rip),%xmm10        # 70c0 <_sk_callback_sse2+0x12b2>
   .byte  69,15,92,208                        // subps         %xmm8,%xmm10
   .byte  69,15,84,209                        // andps         %xmm9,%xmm10
   .byte  69,15,85,200                        // andnps        %xmm8,%xmm9
@@ -38074,7 +39432,7 @@
 FUNCTION(_sk_save_xy_sse2)
 _sk_save_xy_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,204,21,0,0               // movaps        0x15cc(%rip),%xmm8        # 6da0 <_sk_callback_sse2+0x1255>
+  .byte  68,15,40,5,57,22,0,0                // movaps        0x1639(%rip),%xmm8        # 70d0 <_sk_callback_sse2+0x12c2>
   .byte  15,17,0                             // movups        %xmm0,(%rax)
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,88,200                        // addps         %xmm8,%xmm9
@@ -38082,7 +39440,7 @@
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,40,217                        // movaps        %xmm9,%xmm11
   .byte  69,15,194,218,1                     // cmpltps       %xmm10,%xmm11
-  .byte  68,15,40,37,183,21,0,0              // movaps        0x15b7(%rip),%xmm12        # 6db0 <_sk_callback_sse2+0x1265>
+  .byte  68,15,40,37,36,22,0,0               // movaps        0x1624(%rip),%xmm12        # 70e0 <_sk_callback_sse2+0x12d2>
   .byte  69,15,84,220                        // andps         %xmm12,%xmm11
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
   .byte  69,15,92,202                        // subps         %xmm10,%xmm9
@@ -38129,8 +39487,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,48,21,0,0                   // addps         0x1530(%rip),%xmm0        # 6dc0 <_sk_callback_sse2+0x1275>
-  .byte  68,15,40,13,56,21,0,0               // movaps        0x1538(%rip),%xmm9        # 6dd0 <_sk_callback_sse2+0x1285>
+  .byte  15,88,5,157,21,0,0                  // addps         0x159d(%rip),%xmm0        # 70f0 <_sk_callback_sse2+0x12e2>
+  .byte  68,15,40,13,165,21,0,0              // movaps        0x15a5(%rip),%xmm9        # 7100 <_sk_callback_sse2+0x12f2>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -38143,7 +39501,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,39,21,0,0                   // addps         0x1527(%rip),%xmm0        # 6de0 <_sk_callback_sse2+0x1295>
+  .byte  15,88,5,148,21,0,0                  // addps         0x1594(%rip),%xmm0        # 7110 <_sk_callback_sse2+0x1302>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -38155,8 +39513,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,25,21,0,0                  // addps         0x1519(%rip),%xmm1        # 6df0 <_sk_callback_sse2+0x12a5>
-  .byte  68,15,40,13,33,21,0,0               // movaps        0x1521(%rip),%xmm9        # 6e00 <_sk_callback_sse2+0x12b5>
+  .byte  15,88,13,134,21,0,0                 // addps         0x1586(%rip),%xmm1        # 7120 <_sk_callback_sse2+0x1312>
+  .byte  68,15,40,13,142,21,0,0              // movaps        0x158e(%rip),%xmm9        # 7130 <_sk_callback_sse2+0x1322>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -38169,7 +39527,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,15,21,0,0                  // addps         0x150f(%rip),%xmm1        # 6e10 <_sk_callback_sse2+0x12c5>
+  .byte  15,88,13,124,21,0,0                 // addps         0x157c(%rip),%xmm1        # 7140 <_sk_callback_sse2+0x1332>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -38181,13 +39539,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,2,21,0,0                    // addps         0x1502(%rip),%xmm0        # 6e20 <_sk_callback_sse2+0x12d5>
-  .byte  68,15,40,13,10,21,0,0               // movaps        0x150a(%rip),%xmm9        # 6e30 <_sk_callback_sse2+0x12e5>
+  .byte  15,88,5,111,21,0,0                  // addps         0x156f(%rip),%xmm0        # 7150 <_sk_callback_sse2+0x1342>
+  .byte  68,15,40,13,119,21,0,0              // movaps        0x1577(%rip),%xmm9        # 7160 <_sk_callback_sse2+0x1352>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,6,21,0,0                // mulps         0x1506(%rip),%xmm9        # 6e40 <_sk_callback_sse2+0x12f5>
-  .byte  68,15,88,13,14,21,0,0               // addps         0x150e(%rip),%xmm9        # 6e50 <_sk_callback_sse2+0x1305>
+  .byte  68,15,89,13,115,21,0,0              // mulps         0x1573(%rip),%xmm9        # 7170 <_sk_callback_sse2+0x1362>
+  .byte  68,15,88,13,123,21,0,0              // addps         0x157b(%rip),%xmm9        # 7180 <_sk_callback_sse2+0x1372>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -38200,16 +39558,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,253,20,0,0                  // addps         0x14fd(%rip),%xmm0        # 6e60 <_sk_callback_sse2+0x1315>
-  .byte  68,15,40,13,5,21,0,0                // movaps        0x1505(%rip),%xmm9        # 6e70 <_sk_callback_sse2+0x1325>
+  .byte  15,88,5,106,21,0,0                  // addps         0x156a(%rip),%xmm0        # 7190 <_sk_callback_sse2+0x1382>
+  .byte  68,15,40,13,114,21,0,0              // movaps        0x1572(%rip),%xmm9        # 71a0 <_sk_callback_sse2+0x1392>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,9,21,0,0                 // movaps        0x1509(%rip),%xmm8        # 6e80 <_sk_callback_sse2+0x1335>
+  .byte  68,15,40,5,118,21,0,0               // movaps        0x1576(%rip),%xmm8        # 71b0 <_sk_callback_sse2+0x13a2>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,13,21,0,0                // addps         0x150d(%rip),%xmm8        # 6e90 <_sk_callback_sse2+0x1345>
+  .byte  68,15,88,5,122,21,0,0               // addps         0x157a(%rip),%xmm8        # 71c0 <_sk_callback_sse2+0x13b2>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,17,21,0,0                // addps         0x1511(%rip),%xmm8        # 6ea0 <_sk_callback_sse2+0x1355>
+  .byte  68,15,88,5,126,21,0,0               // addps         0x157e(%rip),%xmm8        # 71d0 <_sk_callback_sse2+0x13c2>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,21,21,0,0                // addps         0x1515(%rip),%xmm8        # 6eb0 <_sk_callback_sse2+0x1365>
+  .byte  68,15,88,5,130,21,0,0               // addps         0x1582(%rip),%xmm8        # 71e0 <_sk_callback_sse2+0x13d2>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -38219,17 +39577,17 @@
 FUNCTION(_sk_bicubic_p1x_sse2)
 _sk_bicubic_p1x_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,15,21,0,0                // movaps        0x150f(%rip),%xmm8        # 6ec0 <_sk_callback_sse2+0x1375>
+  .byte  68,15,40,5,124,21,0,0               // movaps        0x157c(%rip),%xmm8        # 71f0 <_sk_callback_sse2+0x13e2>
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,72,64                      // movups        0x40(%rax),%xmm9
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,21,11,21,0,0               // movaps        0x150b(%rip),%xmm10        # 6ed0 <_sk_callback_sse2+0x1385>
+  .byte  68,15,40,21,120,21,0,0              // movaps        0x1578(%rip),%xmm10        # 7200 <_sk_callback_sse2+0x13f2>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,15,21,0,0               // addps         0x150f(%rip),%xmm10        # 6ee0 <_sk_callback_sse2+0x1395>
+  .byte  68,15,88,21,124,21,0,0              // addps         0x157c(%rip),%xmm10        # 7210 <_sk_callback_sse2+0x1402>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,11,21,0,0               // addps         0x150b(%rip),%xmm10        # 6ef0 <_sk_callback_sse2+0x13a5>
+  .byte  68,15,88,21,120,21,0,0              // addps         0x1578(%rip),%xmm10        # 7220 <_sk_callback_sse2+0x1412>
   .byte  68,15,17,144,128,0,0,0              // movups        %xmm10,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -38241,11 +39599,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,254,20,0,0                  // addps         0x14fe(%rip),%xmm0        # 6f00 <_sk_callback_sse2+0x13b5>
+  .byte  15,88,5,107,21,0,0                  // addps         0x156b(%rip),%xmm0        # 7230 <_sk_callback_sse2+0x1422>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,254,20,0,0               // mulps         0x14fe(%rip),%xmm8        # 6f10 <_sk_callback_sse2+0x13c5>
-  .byte  68,15,88,5,6,21,0,0                 // addps         0x1506(%rip),%xmm8        # 6f20 <_sk_callback_sse2+0x13d5>
+  .byte  68,15,89,5,107,21,0,0               // mulps         0x156b(%rip),%xmm8        # 7240 <_sk_callback_sse2+0x1432>
+  .byte  68,15,88,5,115,21,0,0               // addps         0x1573(%rip),%xmm8        # 7250 <_sk_callback_sse2+0x1442>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -38258,13 +39616,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,244,20,0,0                 // addps         0x14f4(%rip),%xmm1        # 6f30 <_sk_callback_sse2+0x13e5>
-  .byte  68,15,40,13,252,20,0,0              // movaps        0x14fc(%rip),%xmm9        # 6f40 <_sk_callback_sse2+0x13f5>
+  .byte  15,88,13,97,21,0,0                  // addps         0x1561(%rip),%xmm1        # 7260 <_sk_callback_sse2+0x1452>
+  .byte  68,15,40,13,105,21,0,0              // movaps        0x1569(%rip),%xmm9        # 7270 <_sk_callback_sse2+0x1462>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,248,20,0,0              // mulps         0x14f8(%rip),%xmm9        # 6f50 <_sk_callback_sse2+0x1405>
-  .byte  68,15,88,13,0,21,0,0                // addps         0x1500(%rip),%xmm9        # 6f60 <_sk_callback_sse2+0x1415>
+  .byte  68,15,89,13,101,21,0,0              // mulps         0x1565(%rip),%xmm9        # 7280 <_sk_callback_sse2+0x1472>
+  .byte  68,15,88,13,109,21,0,0              // addps         0x156d(%rip),%xmm9        # 7290 <_sk_callback_sse2+0x1482>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -38277,16 +39635,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,238,20,0,0                 // addps         0x14ee(%rip),%xmm1        # 6f70 <_sk_callback_sse2+0x1425>
-  .byte  68,15,40,13,246,20,0,0              // movaps        0x14f6(%rip),%xmm9        # 6f80 <_sk_callback_sse2+0x1435>
+  .byte  15,88,13,91,21,0,0                  // addps         0x155b(%rip),%xmm1        # 72a0 <_sk_callback_sse2+0x1492>
+  .byte  68,15,40,13,99,21,0,0               // movaps        0x1563(%rip),%xmm9        # 72b0 <_sk_callback_sse2+0x14a2>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,250,20,0,0               // movaps        0x14fa(%rip),%xmm8        # 6f90 <_sk_callback_sse2+0x1445>
+  .byte  68,15,40,5,103,21,0,0               // movaps        0x1567(%rip),%xmm8        # 72c0 <_sk_callback_sse2+0x14b2>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,254,20,0,0               // addps         0x14fe(%rip),%xmm8        # 6fa0 <_sk_callback_sse2+0x1455>
+  .byte  68,15,88,5,107,21,0,0               // addps         0x156b(%rip),%xmm8        # 72d0 <_sk_callback_sse2+0x14c2>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,2,21,0,0                 // addps         0x1502(%rip),%xmm8        # 6fb0 <_sk_callback_sse2+0x1465>
+  .byte  68,15,88,5,111,21,0,0               // addps         0x156f(%rip),%xmm8        # 72e0 <_sk_callback_sse2+0x14d2>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,6,21,0,0                 // addps         0x1506(%rip),%xmm8        # 6fc0 <_sk_callback_sse2+0x1475>
+  .byte  68,15,88,5,115,21,0,0               // addps         0x1573(%rip),%xmm8        # 72f0 <_sk_callback_sse2+0x14e2>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -38296,17 +39654,17 @@
 FUNCTION(_sk_bicubic_p1y_sse2)
 _sk_bicubic_p1y_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,0,21,0,0                 // movaps        0x1500(%rip),%xmm8        # 6fd0 <_sk_callback_sse2+0x1485>
+  .byte  68,15,40,5,109,21,0,0               // movaps        0x156d(%rip),%xmm8        # 7300 <_sk_callback_sse2+0x14f2>
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,72,96                      // movups        0x60(%rax),%xmm9
   .byte  65,15,88,200                        // addps         %xmm8,%xmm1
-  .byte  68,15,40,21,251,20,0,0              // movaps        0x14fb(%rip),%xmm10        # 6fe0 <_sk_callback_sse2+0x1495>
+  .byte  68,15,40,21,104,21,0,0              // movaps        0x1568(%rip),%xmm10        # 7310 <_sk_callback_sse2+0x1502>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,255,20,0,0              // addps         0x14ff(%rip),%xmm10        # 6ff0 <_sk_callback_sse2+0x14a5>
+  .byte  68,15,88,21,108,21,0,0              // addps         0x156c(%rip),%xmm10        # 7320 <_sk_callback_sse2+0x1512>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,251,20,0,0              // addps         0x14fb(%rip),%xmm10        # 7000 <_sk_callback_sse2+0x14b5>
+  .byte  68,15,88,21,104,21,0,0              // addps         0x1568(%rip),%xmm10        # 7330 <_sk_callback_sse2+0x1522>
   .byte  68,15,17,144,160,0,0,0              // movups        %xmm10,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -38318,11 +39676,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,237,20,0,0                 // addps         0x14ed(%rip),%xmm1        # 7010 <_sk_callback_sse2+0x14c5>
+  .byte  15,88,13,90,21,0,0                  // addps         0x155a(%rip),%xmm1        # 7340 <_sk_callback_sse2+0x1532>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,237,20,0,0               // mulps         0x14ed(%rip),%xmm8        # 7020 <_sk_callback_sse2+0x14d5>
-  .byte  68,15,88,5,245,20,0,0               // addps         0x14f5(%rip),%xmm8        # 7030 <_sk_callback_sse2+0x14e5>
+  .byte  68,15,89,5,90,21,0,0                // mulps         0x155a(%rip),%xmm8        # 7350 <_sk_callback_sse2+0x1542>
+  .byte  68,15,88,5,98,21,0,0                // addps         0x1562(%rip),%xmm8        # 7360 <_sk_callback_sse2+0x1552>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -38552,11 +39910,11 @@
   .byte  128,191,0,0,128,191,0               // cmpb          $0x0,-0x40800000(%rdi)
   .byte  0,224                               // add           %ah,%al
   .byte  64,0,0                              // add           %al,(%rax)
-  .byte  224,64                              // loopne        5e18 <.literal16+0x1d8>
+  .byte  224,64                              // loopne        60d8 <.literal16+0x1d8>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,64                              // loopne        5e1c <.literal16+0x1dc>
+  .byte  224,64                              // loopne        60dc <.literal16+0x1dc>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,64                              // loopne        5e20 <.literal16+0x1e0>
+  .byte  224,64                              // loopne        60e0 <.literal16+0x1e0>
   .byte  154                                 // (bad)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
@@ -38576,13 +39934,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e41 <.literal16+0x201>
+  .byte  71,225,61                           // rex.RXB       loope 6101 <.literal16+0x201>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e45 <.literal16+0x205>
+  .byte  71,225,61                           // rex.RXB       loope 6105 <.literal16+0x205>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e49 <.literal16+0x209>
+  .byte  71,225,61                           // rex.RXB       loope 6109 <.literal16+0x209>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e4d <.literal16+0x20d>
+  .byte  71,225,61                           // rex.RXB       loope 610d <.literal16+0x20d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -38607,13 +39965,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e81 <.literal16+0x241>
+  .byte  71,225,61                           // rex.RXB       loope 6141 <.literal16+0x241>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e85 <.literal16+0x245>
+  .byte  71,225,61                           // rex.RXB       loope 6145 <.literal16+0x245>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e89 <.literal16+0x249>
+  .byte  71,225,61                           // rex.RXB       loope 6149 <.literal16+0x249>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e8d <.literal16+0x24d>
+  .byte  71,225,61                           // rex.RXB       loope 614d <.literal16+0x24d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -38638,13 +39996,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ec1 <.literal16+0x281>
+  .byte  71,225,61                           // rex.RXB       loope 6181 <.literal16+0x281>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ec5 <.literal16+0x285>
+  .byte  71,225,61                           // rex.RXB       loope 6185 <.literal16+0x285>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ec9 <.literal16+0x289>
+  .byte  71,225,61                           // rex.RXB       loope 6189 <.literal16+0x289>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ecd <.literal16+0x28d>
+  .byte  71,225,61                           // rex.RXB       loope 618d <.literal16+0x28d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -38669,13 +40027,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5f01 <.literal16+0x2c1>
+  .byte  71,225,61                           // rex.RXB       loope 61c1 <.literal16+0x2c1>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5f05 <.literal16+0x2c5>
+  .byte  71,225,61                           // rex.RXB       loope 61c5 <.literal16+0x2c5>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5f09 <.literal16+0x2c9>
+  .byte  71,225,61                           // rex.RXB       loope 61c9 <.literal16+0x2c9>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5f0d <.literal16+0x2cd>
+  .byte  71,225,61                           // rex.RXB       loope 61cd <.literal16+0x2cd>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -38696,11 +40054,11 @@
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,127                    // add           %al,0x7f00003f(%rax)
   .byte  67,0,0                              // rex.XB        add %al,(%r8)
-  .byte  127,67                              // jg            5f4b <.literal16+0x30b>
+  .byte  127,67                              // jg            620b <.literal16+0x30b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            5f4f <.literal16+0x30f>
+  .byte  127,67                              // jg            620f <.literal16+0x30f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            5f53 <.literal16+0x313>
+  .byte  127,67                              // jg            6213 <.literal16+0x313>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -38987,13 +40345,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6199 <.literal16+0x559>
+  .byte  224,7                               // loopne        6459 <.literal16+0x559>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        619d <.literal16+0x55d>
+  .byte  224,7                               // loopne        645d <.literal16+0x55d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        61a1 <.literal16+0x561>
+  .byte  224,7                               // loopne        6461 <.literal16+0x561>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        61a5 <.literal16+0x565>
+  .byte  224,7                               // loopne        6465 <.literal16+0x565>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -39058,11 +40416,11 @@
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            627b <.literal16+0x63b>
+  .byte  127,67                              // jg            653b <.literal16+0x63b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            627f <.literal16+0x63f>
+  .byte  127,67                              // jg            653f <.literal16+0x63f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6283 <.literal16+0x643>
+  .byte  127,67                              // jg            6543 <.literal16+0x643>
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,129                          // cmpb          $0x81,(%rbx)
   .byte  128,128,59,129,128,128,59           // addb          $0x3b,-0x7f7f7ec5(%rax)
@@ -39077,16 +40435,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6274 <.literal16+0x634>
+  .byte  127,0                               // jg            6534 <.literal16+0x634>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6278 <.literal16+0x638>
+  .byte  127,0                               // jg            6538 <.literal16+0x638>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            627c <.literal16+0x63c>
+  .byte  127,0                               // jg            653c <.literal16+0x63c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6280 <.literal16+0x640>
+  .byte  127,0                               // jg            6540 <.literal16+0x640>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -39095,7 +40453,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            6305 <.literal16+0x6c5>
+  .byte  119,115                             // ja            65c5 <.literal16+0x6c5>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -39106,7 +40464,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6269 <.literal16+0x629>
+  .byte  117,191                             // jne           6529 <.literal16+0x629>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -39118,7 +40476,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a2aa <_sk_callback_sse2+0xffffffffe9a3475f>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a56a <_sk_callback_sse2+0xffffffffe9a3475c>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -39172,16 +40530,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6344 <.literal16+0x704>
+  .byte  127,0                               // jg            6604 <.literal16+0x704>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6348 <.literal16+0x708>
+  .byte  127,0                               // jg            6608 <.literal16+0x708>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            634c <.literal16+0x70c>
+  .byte  127,0                               // jg            660c <.literal16+0x70c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6350 <.literal16+0x710>
+  .byte  127,0                               // jg            6610 <.literal16+0x710>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -39190,7 +40548,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            63d5 <.literal16+0x795>
+  .byte  119,115                             // ja            6695 <.literal16+0x795>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -39201,7 +40559,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6339 <.literal16+0x6f9>
+  .byte  117,191                             // jne           65f9 <.literal16+0x6f9>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -39213,7 +40571,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a37a <_sk_callback_sse2+0xffffffffe9a3482f>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a63a <_sk_callback_sse2+0xffffffffe9a3482c>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -39267,16 +40625,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6414 <.literal16+0x7d4>
+  .byte  127,0                               // jg            66d4 <.literal16+0x7d4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6418 <.literal16+0x7d8>
+  .byte  127,0                               // jg            66d8 <.literal16+0x7d8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            641c <.literal16+0x7dc>
+  .byte  127,0                               // jg            66dc <.literal16+0x7dc>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6420 <.literal16+0x7e0>
+  .byte  127,0                               // jg            66e0 <.literal16+0x7e0>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -39285,7 +40643,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            64a5 <.literal16+0x865>
+  .byte  119,115                             // ja            6765 <.literal16+0x865>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -39296,7 +40654,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6409 <.literal16+0x7c9>
+  .byte  117,191                             // jne           66c9 <.literal16+0x7c9>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -39308,7 +40666,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a44a <_sk_callback_sse2+0xffffffffe9a348ff>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a70a <_sk_callback_sse2+0xffffffffe9a348fc>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -39362,16 +40720,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            64e4 <.literal16+0x8a4>
+  .byte  127,0                               // jg            67a4 <.literal16+0x8a4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            64e8 <.literal16+0x8a8>
+  .byte  127,0                               // jg            67a8 <.literal16+0x8a8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            64ec <.literal16+0x8ac>
+  .byte  127,0                               // jg            67ac <.literal16+0x8ac>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            64f0 <.literal16+0x8b0>
+  .byte  127,0                               // jg            67b0 <.literal16+0x8b0>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -39380,7 +40738,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            6575 <.literal16+0x935>
+  .byte  119,115                             // ja            6835 <.literal16+0x935>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -39391,7 +40749,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           64d9 <.literal16+0x899>
+  .byte  117,191                             // jne           6799 <.literal16+0x899>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -39403,7 +40761,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a51a <_sk_callback_sse2+0xffffffffe9a349cf>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a7da <_sk_callback_sse2+0xffffffffe9a349cc>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -39453,13 +40811,13 @@
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
-  .byte  127,67                              // jg            65f7 <.literal16+0x9b7>
+  .byte  127,67                              // jg            68b7 <.literal16+0x9b7>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            65fb <.literal16+0x9bb>
+  .byte  127,67                              // jg            68bb <.literal16+0x9bb>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            65ff <.literal16+0x9bf>
+  .byte  127,67                              // jg            68bf <.literal16+0x9bf>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6603 <.literal16+0x9c3>
+  .byte  127,67                              // jg            68c3 <.literal16+0x9c3>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%rax)
@@ -39506,16 +40864,16 @@
   .byte  128,3,62                            // addb          $0x3e,(%rbx)
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           6683 <.literal16+0xa43>
+  .byte  118,63                              // jbe           6943 <.literal16+0xa43>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           6687 <.literal16+0xa47>
+  .byte  118,63                              // jbe           6947 <.literal16+0xa47>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           668b <.literal16+0xa4b>
+  .byte  118,63                              // jbe           694b <.literal16+0xa4b>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           668f <.literal16+0xa4f>
+  .byte  118,63                              // jbe           694f <.literal16+0xa4f>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
@@ -39544,11 +40902,11 @@
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            66fb <.literal16+0xabb>
+  .byte  127,67                              // jg            69bb <.literal16+0xabb>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            66ff <.literal16+0xabf>
+  .byte  127,67                              // jg            69bf <.literal16+0xabf>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6703 <.literal16+0xac3>
+  .byte  127,67                              // jg            69c3 <.literal16+0xac3>
   .byte  255,0                               // incl          (%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  255,0                               // incl          (%rax)
@@ -39619,13 +40977,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6799 <.literal16+0xb59>
+  .byte  224,7                               // loopne        6a59 <.literal16+0xb59>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        679d <.literal16+0xb5d>
+  .byte  224,7                               // loopne        6a5d <.literal16+0xb5d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        67a1 <.literal16+0xb61>
+  .byte  224,7                               // loopne        6a61 <.literal16+0xb61>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        67a5 <.literal16+0xb65>
+  .byte  224,7                               // loopne        6a65 <.literal16+0xb65>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -39671,13 +41029,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6809 <.literal16+0xbc9>
+  .byte  224,7                               // loopne        6ac9 <.literal16+0xbc9>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        680d <.literal16+0xbcd>
+  .byte  224,7                               // loopne        6acd <.literal16+0xbcd>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6811 <.literal16+0xbd1>
+  .byte  224,7                               // loopne        6ad1 <.literal16+0xbd1>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6815 <.literal16+0xbd5>
+  .byte  224,7                               // loopne        6ad5 <.literal16+0xbd5>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -39723,13 +41081,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6879 <.literal16+0xc39>
+  .byte  224,7                               // loopne        6b39 <.literal16+0xc39>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        687d <.literal16+0xc3d>
+  .byte  224,7                               // loopne        6b3d <.literal16+0xc3d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6881 <.literal16+0xc41>
+  .byte  224,7                               // loopne        6b41 <.literal16+0xc41>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6885 <.literal16+0xc45>
+  .byte  224,7                               // loopne        6b45 <.literal16+0xc45>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -39767,13 +41125,13 @@
   .byte  65,0,0                              // add           %al,(%r8)
   .byte  248                                 // clc
   .byte  65,0,0                              // add           %al,(%r8)
-  .byte  124,66                              // jl            6916 <.literal16+0xcd6>
+  .byte  124,66                              // jl            6bd6 <.literal16+0xcd6>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            691a <.literal16+0xcda>
+  .byte  124,66                              // jl            6bda <.literal16+0xcda>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            691e <.literal16+0xcde>
+  .byte  124,66                              // jl            6bde <.literal16+0xcde>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            6922 <.literal16+0xce2>
+  .byte  124,66                              // jl            6be2 <.literal16+0xce2>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,240                               // add           %dh,%al
@@ -39907,13 +41265,13 @@
   .byte  136,136,61,137,136,136              // mov           %cl,-0x777776c3(%rax)
   .byte  61,137,136,136,61                   // cmp           $0x3d888889,%eax
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6aa5 <.literal16+0xe65>
+  .byte  112,65                              // jo            6d65 <.literal16+0xe65>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6aa9 <.literal16+0xe69>
+  .byte  112,65                              // jo            6d69 <.literal16+0xe69>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6aad <.literal16+0xe6d>
+  .byte  112,65                              // jo            6d6d <.literal16+0xe6d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6ab1 <.literal16+0xe71>
+  .byte  112,65                              // jo            6d71 <.literal16+0xe71>
   .byte  255,0                               // incl          (%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  255,0                               // incl          (%rax)
@@ -39944,11 +41302,46 @@
   .byte  128,59,129                          // cmpb          $0x81,(%rbx)
   .byte  128,128,59,0,0,127,67               // addb          $0x43,0x7f00003b(%rax)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6b1b <.literal16+0xedb>
+  .byte  127,67                              // jg            6ddb <.literal16+0xedb>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6b1f <.literal16+0xedf>
+  .byte  127,67                              // jg            6ddf <.literal16+0xedf>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6b23 <.literal16+0xee3>
+  .byte  127,67                              // jg            6de3 <.literal16+0xee3>
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
+  .byte  128,59,129                          // cmpb          $0x81,(%rbx)
+  .byte  128,128,59,255,0,0,0                // addb          $0x0,0xff3b(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
+  .byte  128,59,129                          // cmpb          $0x81,(%rbx)
+  .byte  128,128,59,255,0,0,0                // addb          $0x0,0xff3b(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
+  .byte  128,59,129                          // cmpb          $0x81,(%rbx)
+  .byte  128,128,59,0,0,127,67               // addb          $0x43,0x7f00003b(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  127,67                              // jg            6e4b <.literal16+0xf4b>
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  127,67                              // jg            6e4f <.literal16+0xf4f>
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  127,67                              // jg            6e53 <.literal16+0xf53>
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%rax)
@@ -40044,13 +41437,13 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  255                                 // (bad)
-  .byte  127,71                              // jg            6c4b <.literal16+0x100b>
+  .byte  127,71                              // jg            6f7b <.literal16+0x107b>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            6c4f <.literal16+0x100f>
+  .byte  127,71                              // jg            6f7f <.literal16+0x107f>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            6c53 <.literal16+0x1013>
+  .byte  127,71                              // jg            6f83 <.literal16+0x1083>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            6c57 <.literal16+0x1017>
+  .byte  127,71                              // jg            6f87 <.literal16+0x1087>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -40127,10 +41520,10 @@
   .byte  61,152,221,147,61                   // cmp           $0x3d93dd98,%eax
   .byte  152                                 // cwtl
   .byte  221,147,61,45,16,17                 // fstl          0x11102d3d(%rbx)
-  .byte  192,45,16,17,192,45,16              // shrb          $0x10,0x2dc01110(%rip)        # 2dc07dea <_sk_callback_sse2+0x2dc0229f>
+  .byte  192,45,16,17,192,45,16              // shrb          $0x10,0x2dc01110(%rip)        # 2dc0811a <_sk_callback_sse2+0x2dc0230c>
   .byte  17,192                              // adc           %eax,%eax
   .byte  45,16,17,192,18                     // sub           $0x12c01110,%eax
-  .byte  120,57                              // js            6d1c <.literal16+0x10dc>
+  .byte  120,57                              // js            704c <.literal16+0x114c>
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
@@ -40258,11 +41651,11 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,114                          // cmpb          $0x72,(%rdi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         6e62 <.literal16+0x1222>
+  .byte  62,114,28                           // jb,pt         7192 <.literal16+0x1292>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6e66 <.literal16+0x1226>
+  .byte  62,114,28                           // jb,pt         7196 <.literal16+0x1296>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6e6a <.literal16+0x122a>
+  .byte  62,114,28                           // jb,pt         719a <.literal16+0x129a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -40306,7 +41699,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63fcf5 <_sk_callback_sse2+0x3d63a1aa>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640025 <_sk_callback_sse2+0x3d63a217>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -40332,7 +41725,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63fd35 <_sk_callback_sse2+0x3d63a1ea>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640065 <_sk_callback_sse2+0x3d63a257>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -40341,13 +41734,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
-  .byte  114,28                              // jb            6f2e <.literal16+0x12ee>
+  .byte  114,28                              // jb            725e <.literal16+0x135e>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6f32 <.literal16+0x12f2>
+  .byte  62,114,28                           // jb,pt         7262 <.literal16+0x1362>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6f36 <.literal16+0x12f6>
+  .byte  62,114,28                           // jb,pt         7266 <.literal16+0x1366>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6f3a <.literal16+0x12fa>
+  .byte  62,114,28                           // jb,pt         726a <.literal16+0x136a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -40368,11 +41761,11 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,114                          // cmpb          $0x72,(%rdi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         6f72 <.literal16+0x1332>
+  .byte  62,114,28                           // jb,pt         72a2 <.literal16+0x13a2>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6f76 <.literal16+0x1336>
+  .byte  62,114,28                           // jb,pt         72a6 <.literal16+0x13a6>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6f7a <.literal16+0x133a>
+  .byte  62,114,28                           // jb,pt         72aa <.literal16+0x13aa>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -40416,7 +41809,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63fe05 <_sk_callback_sse2+0x3d63a2ba>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640135 <_sk_callback_sse2+0x3d63a327>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -40442,7 +41835,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63fe45 <_sk_callback_sse2+0x3d63a2fa>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640175 <_sk_callback_sse2+0x3d63a367>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -40451,13 +41844,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
-  .byte  114,28                              // jb            703e <.literal16+0x13fe>
+  .byte  114,28                              // jb            736e <.literal16+0x146e>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         7042 <_sk_callback_sse2+0x14f7>
+  .byte  62,114,28                           // jb,pt         7372 <_sk_callback_sse2+0x1564>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         7046 <_sk_callback_sse2+0x14fb>
+  .byte  62,114,28                           // jb,pt         7376 <_sk_callback_sse2+0x1568>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         704a <_sk_callback_sse2+0x14ff>
+  .byte  62,114,28                           // jb,pt         737a <_sk_callback_sse2+0x156c>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -40541,7 +41934,7 @@
 FUNCTION(_sk_constant_color_hsw_lowp)
 _sk_constant_color_hsw_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,121,24,5,105,26,0,0         // vbroadcastss  0x1a69(%rip),%xmm0        # 1af8 <_sk_xor__hsw_lowp+0x78>
+  .byte  196,226,121,24,5,237,32,0,0         // vbroadcastss  0x20ed(%rip),%xmm0        # 217c <_sk_xor__hsw_lowp+0x78>
   .byte  197,248,88,24                       // vaddps        (%rax),%xmm0,%xmm3
   .byte  196,226,125,121,195                 // vpbroadcastw  %xmm3,%ymm0
   .byte  197,251,112,203,234                 // vpshuflw      $0xea,%xmm3,%xmm1
@@ -40560,7 +41953,7 @@
 FUNCTION(_sk_set_rgb_hsw_lowp)
 _sk_set_rgb_hsw_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  197,250,16,21,44,26,0,0             // vmovss        0x1a2c(%rip),%xmm2        # 1afc <_sk_xor__hsw_lowp+0x7c>
+  .byte  197,250,16,21,176,32,0,0            // vmovss        0x20b0(%rip),%xmm2        # 2180 <_sk_xor__hsw_lowp+0x7c>
   .byte  197,234,88,0                        // vaddss        (%rax),%xmm2,%xmm0
   .byte  196,193,121,126,193                 // vmovd         %xmm0,%r9d
   .byte  196,193,121,110,193                 // vmovd         %r9d,%xmm0
@@ -40599,16 +41992,16 @@
   .byte  15,133,210,0,0,0                    // jne           20f <_sk_load_8888_hsw_lowp+0xe0>
   .byte  196,193,126,111,92,147,32           // vmovdqu       0x20(%r11,%rdx,4),%ymm3
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
-  .byte  197,253,111,5,206,25,0,0            // vmovdqa       0x19ce(%rip),%ymm0        # 1b20 <_sk_xor__hsw_lowp+0xa0>
+  .byte  197,253,111,5,78,32,0,0             // vmovdqa       0x204e(%rip),%ymm0        # 21a0 <_sk_xor__hsw_lowp+0x9c>
   .byte  196,226,61,0,200                    // vpshufb       %ymm0,%ymm8,%ymm1
   .byte  196,227,253,0,201,232               // vpermq        $0xe8,%ymm1,%ymm1
   .byte  196,226,101,0,192                   // vpshufb       %ymm0,%ymm3,%ymm0
   .byte  196,227,253,0,192,232               // vpermq        $0xe8,%ymm0,%ymm0
   .byte  196,227,117,56,192,1                // vinserti128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
-  .byte  196,98,125,121,13,196,25,0,0        // vpbroadcastw  0x19c4(%rip),%ymm9        # 1b40 <_sk_xor__hsw_lowp+0xc0>
+  .byte  196,98,125,121,13,68,32,0,0         // vpbroadcastw  0x2044(%rip),%ymm9        # 21c0 <_sk_xor__hsw_lowp+0xbc>
   .byte  196,193,125,228,193                 // vpmulhuw      %ymm9,%ymm0,%ymm0
-  .byte  197,253,111,13,215,25,0,0           // vmovdqa       0x19d7(%rip),%ymm1        # 1b60 <_sk_xor__hsw_lowp+0xe0>
+  .byte  197,253,111,13,87,32,0,0            // vmovdqa       0x2057(%rip),%ymm1        # 21e0 <_sk_xor__hsw_lowp+0xdc>
   .byte  196,226,61,0,209                    // vpshufb       %ymm1,%ymm8,%ymm2
   .byte  196,227,253,0,210,232               // vpermq        $0xe8,%ymm2,%ymm2
   .byte  196,226,101,0,201                   // vpshufb       %ymm1,%ymm3,%ymm1
@@ -40616,7 +42009,7 @@
   .byte  196,227,109,56,201,1                // vinserti128   $0x1,%xmm1,%ymm2,%ymm1
   .byte  197,245,113,241,8                   // vpsllw        $0x8,%ymm1,%ymm1
   .byte  196,193,117,228,201                 // vpmulhuw      %ymm9,%ymm1,%ymm1
-  .byte  197,253,111,21,201,25,0,0           // vmovdqa       0x19c9(%rip),%ymm2        # 1b80 <_sk_xor__hsw_lowp+0x100>
+  .byte  197,253,111,21,73,32,0,0            // vmovdqa       0x2049(%rip),%ymm2        # 2200 <_sk_xor__hsw_lowp+0xfc>
   .byte  196,98,61,0,210                     // vpshufb       %ymm2,%ymm8,%ymm10
   .byte  196,67,253,0,210,232                // vpermq        $0xe8,%ymm10,%ymm10
   .byte  196,226,101,0,210                   // vpshufb       %ymm2,%ymm3,%ymm2
@@ -40624,7 +42017,7 @@
   .byte  196,227,45,56,210,1                 // vinserti128   $0x1,%xmm2,%ymm10,%ymm2
   .byte  197,237,113,242,8                   // vpsllw        $0x8,%ymm2,%ymm2
   .byte  196,193,109,228,209                 // vpmulhuw      %ymm9,%ymm2,%ymm2
-  .byte  197,125,111,21,187,25,0,0           // vmovdqa       0x19bb(%rip),%ymm10        # 1ba0 <_sk_xor__hsw_lowp+0x120>
+  .byte  197,125,111,21,59,32,0,0            // vmovdqa       0x203b(%rip),%ymm10        # 2220 <_sk_xor__hsw_lowp+0x11c>
   .byte  196,66,61,0,194                     // vpshufb       %ymm10,%ymm8,%ymm8
   .byte  196,67,253,0,192,232                // vpermq        $0xe8,%ymm8,%ymm8
   .byte  196,194,101,0,218                   // vpshufb       %ymm10,%ymm3,%ymm3
@@ -40696,7 +42089,7 @@
   .byte  236                                 // in            (%dx),%al
   .byte  254                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,247              // decl          -0x8000001(%rip)        # fffffffff800035c <_sk_xor__hsw_lowp+0xfffffffff7ffe8dc>
+  .byte  255,13,255,255,255,247              // decl          -0x8000001(%rip)        # fffffffff800035c <_sk_xor__hsw_lowp+0xfffffffff7ffe258>
   .byte  254                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,97,255                          // jmpq          *-0x1(%rcx)
@@ -40739,16 +42132,16 @@
   .byte  15,133,210,0,0,0                    // jne           470 <_sk_load_8888_dst_hsw_lowp+0xe0>
   .byte  196,193,126,111,124,147,32          // vmovdqu       0x20(%r11,%rdx,4),%ymm7
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
-  .byte  197,253,111,37,13,24,0,0            // vmovdqa       0x180d(%rip),%ymm4        # 1bc0 <_sk_xor__hsw_lowp+0x140>
+  .byte  197,253,111,37,141,30,0,0           // vmovdqa       0x1e8d(%rip),%ymm4        # 2240 <_sk_xor__hsw_lowp+0x13c>
   .byte  196,226,61,0,236                    // vpshufb       %ymm4,%ymm8,%ymm5
   .byte  196,227,253,0,237,232               // vpermq        $0xe8,%ymm5,%ymm5
   .byte  196,226,69,0,228                    // vpshufb       %ymm4,%ymm7,%ymm4
   .byte  196,227,253,0,228,232               // vpermq        $0xe8,%ymm4,%ymm4
   .byte  196,227,85,56,228,1                 // vinserti128   $0x1,%xmm4,%ymm5,%ymm4
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
-  .byte  196,98,125,121,13,3,24,0,0          // vpbroadcastw  0x1803(%rip),%ymm9        # 1be0 <_sk_xor__hsw_lowp+0x160>
+  .byte  196,98,125,121,13,131,30,0,0        // vpbroadcastw  0x1e83(%rip),%ymm9        # 2260 <_sk_xor__hsw_lowp+0x15c>
   .byte  196,193,93,228,225                  // vpmulhuw      %ymm9,%ymm4,%ymm4
-  .byte  197,253,111,45,22,24,0,0            // vmovdqa       0x1816(%rip),%ymm5        # 1c00 <_sk_xor__hsw_lowp+0x180>
+  .byte  197,253,111,45,150,30,0,0           // vmovdqa       0x1e96(%rip),%ymm5        # 2280 <_sk_xor__hsw_lowp+0x17c>
   .byte  196,226,61,0,245                    // vpshufb       %ymm5,%ymm8,%ymm6
   .byte  196,227,253,0,246,232               // vpermq        $0xe8,%ymm6,%ymm6
   .byte  196,226,69,0,237                    // vpshufb       %ymm5,%ymm7,%ymm5
@@ -40756,7 +42149,7 @@
   .byte  196,227,77,56,237,1                 // vinserti128   $0x1,%xmm5,%ymm6,%ymm5
   .byte  197,213,113,245,8                   // vpsllw        $0x8,%ymm5,%ymm5
   .byte  196,193,85,228,233                  // vpmulhuw      %ymm9,%ymm5,%ymm5
-  .byte  197,253,111,53,8,24,0,0             // vmovdqa       0x1808(%rip),%ymm6        # 1c20 <_sk_xor__hsw_lowp+0x1a0>
+  .byte  197,253,111,53,136,30,0,0           // vmovdqa       0x1e88(%rip),%ymm6        # 22a0 <_sk_xor__hsw_lowp+0x19c>
   .byte  196,98,61,0,214                     // vpshufb       %ymm6,%ymm8,%ymm10
   .byte  196,67,253,0,210,232                // vpermq        $0xe8,%ymm10,%ymm10
   .byte  196,226,69,0,246                    // vpshufb       %ymm6,%ymm7,%ymm6
@@ -40764,7 +42157,7 @@
   .byte  196,227,45,56,246,1                 // vinserti128   $0x1,%xmm6,%ymm10,%ymm6
   .byte  197,205,113,246,8                   // vpsllw        $0x8,%ymm6,%ymm6
   .byte  196,193,77,228,241                  // vpmulhuw      %ymm9,%ymm6,%ymm6
-  .byte  197,125,111,21,250,23,0,0           // vmovdqa       0x17fa(%rip),%ymm10        # 1c40 <_sk_xor__hsw_lowp+0x1c0>
+  .byte  197,125,111,21,122,30,0,0           // vmovdqa       0x1e7a(%rip),%ymm10        # 22c0 <_sk_xor__hsw_lowp+0x1bc>
   .byte  196,66,61,0,194                     // vpshufb       %ymm10,%ymm8,%ymm8
   .byte  196,67,253,0,192,232                // vpermq        $0xe8,%ymm8,%ymm8
   .byte  196,194,69,0,250                    // vpshufb       %ymm10,%ymm7,%ymm7
@@ -40879,7 +42272,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  197,189,113,208,7                   // vpsrlw        $0x7,%ymm0,%ymm8
-  .byte  196,98,125,121,13,93,22,0,0         // vpbroadcastw  0x165d(%rip),%ymm9        # 1c60 <_sk_xor__hsw_lowp+0x1e0>
+  .byte  196,98,125,121,13,221,28,0,0        // vpbroadcastw  0x1cdd(%rip),%ymm9        # 22e0 <_sk_xor__hsw_lowp+0x1dc>
   .byte  196,65,61,234,193                   // vpminsw       %ymm9,%ymm8,%ymm8
   .byte  196,66,125,51,208                   // vpmovzxwd     %xmm8,%ymm10
   .byte  196,67,125,57,192,1                 // vextracti128  $0x1,%ymm8,%xmm8
@@ -40989,6 +42382,409 @@
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
 
+HIDDEN _sk_load_bgra_hsw_lowp
+.globl _sk_load_bgra_hsw_lowp
+FUNCTION(_sk_load_bgra_hsw_lowp)
+_sk_load_bgra_hsw_lowp:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,139,24                           // mov           (%rax),%r11
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  15,133,210,0,0,0                    // jne           8a4 <_sk_load_bgra_hsw_lowp+0xe0>
+  .byte  196,193,126,111,92,147,32           // vmovdqu       0x20(%r11,%rdx,4),%ymm3
+  .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
+  .byte  197,253,111,5,25,27,0,0             // vmovdqa       0x1b19(%rip),%ymm0        # 2300 <_sk_xor__hsw_lowp+0x1fc>
+  .byte  196,226,61,0,200                    // vpshufb       %ymm0,%ymm8,%ymm1
+  .byte  196,227,253,0,201,232               // vpermq        $0xe8,%ymm1,%ymm1
+  .byte  196,226,101,0,192                   // vpshufb       %ymm0,%ymm3,%ymm0
+  .byte  196,227,253,0,192,232               // vpermq        $0xe8,%ymm0,%ymm0
+  .byte  196,227,117,56,192,1                // vinserti128   $0x1,%xmm0,%ymm1,%ymm0
+  .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
+  .byte  196,98,125,121,13,15,27,0,0         // vpbroadcastw  0x1b0f(%rip),%ymm9        # 2320 <_sk_xor__hsw_lowp+0x21c>
+  .byte  196,193,125,228,209                 // vpmulhuw      %ymm9,%ymm0,%ymm2
+  .byte  197,253,111,5,34,27,0,0             // vmovdqa       0x1b22(%rip),%ymm0        # 2340 <_sk_xor__hsw_lowp+0x23c>
+  .byte  196,226,61,0,200                    // vpshufb       %ymm0,%ymm8,%ymm1
+  .byte  196,227,253,0,201,232               // vpermq        $0xe8,%ymm1,%ymm1
+  .byte  196,226,101,0,192                   // vpshufb       %ymm0,%ymm3,%ymm0
+  .byte  196,227,253,0,192,232               // vpermq        $0xe8,%ymm0,%ymm0
+  .byte  196,227,117,56,192,1                // vinserti128   $0x1,%xmm0,%ymm1,%ymm0
+  .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
+  .byte  196,193,125,228,201                 // vpmulhuw      %ymm9,%ymm0,%ymm1
+  .byte  197,253,111,5,20,27,0,0             // vmovdqa       0x1b14(%rip),%ymm0        # 2360 <_sk_xor__hsw_lowp+0x25c>
+  .byte  196,98,61,0,208                     // vpshufb       %ymm0,%ymm8,%ymm10
+  .byte  196,67,253,0,210,232                // vpermq        $0xe8,%ymm10,%ymm10
+  .byte  196,226,101,0,192                   // vpshufb       %ymm0,%ymm3,%ymm0
+  .byte  196,227,253,0,192,232               // vpermq        $0xe8,%ymm0,%ymm0
+  .byte  196,227,45,56,192,1                 // vinserti128   $0x1,%xmm0,%ymm10,%ymm0
+  .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
+  .byte  196,193,125,228,193                 // vpmulhuw      %ymm9,%ymm0,%ymm0
+  .byte  197,125,111,21,6,27,0,0             // vmovdqa       0x1b06(%rip),%ymm10        # 2380 <_sk_xor__hsw_lowp+0x27c>
+  .byte  196,66,61,0,194                     // vpshufb       %ymm10,%ymm8,%ymm8
+  .byte  196,67,253,0,192,232                // vpermq        $0xe8,%ymm8,%ymm8
+  .byte  196,194,101,0,218                   // vpshufb       %ymm10,%ymm3,%ymm3
+  .byte  196,227,253,0,219,232               // vpermq        $0xe8,%ymm3,%ymm3
+  .byte  196,227,61,56,219,1                 // vinserti128   $0x1,%xmm3,%ymm8,%ymm3
+  .byte  197,229,113,243,8                   // vpsllw        $0x8,%ymm3,%ymm3
+  .byte  196,193,101,228,217                 // vpmulhuw      %ymm9,%ymm3,%ymm3
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,15                       // and           $0xf,%r9b
+  .byte  197,229,239,219                     // vpxor         %ymm3,%ymm3,%ymm3
+  .byte  196,65,61,239,192                   // vpxor         %ymm8,%ymm8,%ymm8
+  .byte  65,254,201                          // dec           %r9b
+  .byte  65,128,249,14                       // cmp           $0xe,%r9b
+  .byte  15,135,30,255,255,255               // ja            7df <_sk_load_bgra_hsw_lowp+0x1b>
+  .byte  69,15,182,201                       // movzbl        %r9b,%r9d
+  .byte  76,141,21,28,1,0,0                  // lea           0x11c(%rip),%r10        # 9e8 <_sk_load_bgra_hsw_lowp+0x224>
+  .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
+  .byte  76,1,208                            // add           %r10,%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  196,65,121,110,4,147                // vmovd         (%r11,%rdx,4),%xmm8
+  .byte  233,255,254,255,255                 // jmpq          7df <_sk_load_bgra_hsw_lowp+0x1b>
+  .byte  196,193,121,110,68,147,8            // vmovd         0x8(%r11,%rdx,4),%xmm0
+  .byte  196,226,121,89,192                  // vpbroadcastq  %xmm0,%xmm0
+  .byte  197,229,239,219                     // vpxor         %ymm3,%ymm3,%ymm3
+  .byte  196,99,101,2,192,4                  // vpblendd      $0x4,%ymm0,%ymm3,%ymm8
+  .byte  196,194,121,53,4,147                // vpmovzxdq     (%r11,%rdx,4),%xmm0
+  .byte  197,249,112,192,232                 // vpshufd       $0xe8,%xmm0,%xmm0
+  .byte  196,99,61,2,192,3                   // vpblendd      $0x3,%ymm0,%ymm8,%ymm8
+  .byte  233,211,254,255,255                 // jmpq          7df <_sk_load_bgra_hsw_lowp+0x1b>
+  .byte  196,193,121,110,68,147,24           // vmovd         0x18(%r11,%rdx,4),%xmm0
+  .byte  196,226,125,89,192                  // vpbroadcastq  %xmm0,%ymm0
+  .byte  197,229,239,219                     // vpxor         %ymm3,%ymm3,%ymm3
+  .byte  196,99,101,2,192,64                 // vpblendd      $0x40,%ymm0,%ymm3,%ymm8
+  .byte  196,99,125,57,192,1                 // vextracti128  $0x1,%ymm8,%xmm0
+  .byte  196,195,121,34,68,147,20,1          // vpinsrd       $0x1,0x14(%r11,%rdx,4),%xmm0,%xmm0
+  .byte  196,99,61,56,192,1                  // vinserti128   $0x1,%xmm0,%ymm8,%ymm8
+  .byte  196,99,125,57,192,1                 // vextracti128  $0x1,%ymm8,%xmm0
+  .byte  196,195,121,34,68,147,16,0          // vpinsrd       $0x0,0x10(%r11,%rdx,4),%xmm0,%xmm0
+  .byte  196,99,61,56,192,1                  // vinserti128   $0x1,%xmm0,%ymm8,%ymm8
+  .byte  196,193,122,111,4,147               // vmovdqu       (%r11,%rdx,4),%xmm0
+  .byte  196,67,125,2,192,240                // vpblendd      $0xf0,%ymm8,%ymm0,%ymm8
+  .byte  233,132,254,255,255                 // jmpq          7df <_sk_load_bgra_hsw_lowp+0x1b>
+  .byte  196,193,121,110,68,147,40           // vmovd         0x28(%r11,%rdx,4),%xmm0
+  .byte  196,226,121,89,192                  // vpbroadcastq  %xmm0,%xmm0
+  .byte  197,245,239,201                     // vpxor         %ymm1,%ymm1,%ymm1
+  .byte  196,227,117,2,216,4                 // vpblendd      $0x4,%ymm0,%ymm1,%ymm3
+  .byte  196,195,97,34,68,147,36,1           // vpinsrd       $0x1,0x24(%r11,%rdx,4),%xmm3,%xmm0
+  .byte  196,227,101,2,216,15                // vpblendd      $0xf,%ymm0,%ymm3,%ymm3
+  .byte  196,193,121,110,68,147,32           // vmovd         0x20(%r11,%rdx,4),%xmm0
+  .byte  196,227,101,2,216,1                 // vpblendd      $0x1,%ymm0,%ymm3,%ymm3
+  .byte  233,72,254,255,255                  // jmpq          7d9 <_sk_load_bgra_hsw_lowp+0x15>
+  .byte  196,193,121,110,68,147,56           // vmovd         0x38(%r11,%rdx,4),%xmm0
+  .byte  196,226,125,89,192                  // vpbroadcastq  %xmm0,%ymm0
+  .byte  197,245,239,201                     // vpxor         %ymm1,%ymm1,%ymm1
+  .byte  196,227,117,2,216,64                // vpblendd      $0x40,%ymm0,%ymm1,%ymm3
+  .byte  196,227,125,57,216,1                // vextracti128  $0x1,%ymm3,%xmm0
+  .byte  196,195,121,34,68,147,52,1          // vpinsrd       $0x1,0x34(%r11,%rdx,4),%xmm0,%xmm0
+  .byte  196,227,101,56,216,1                // vinserti128   $0x1,%xmm0,%ymm3,%ymm3
+  .byte  196,227,125,57,216,1                // vextracti128  $0x1,%ymm3,%xmm0
+  .byte  196,195,121,34,68,147,48,0          // vpinsrd       $0x0,0x30(%r11,%rdx,4),%xmm0,%xmm0
+  .byte  196,227,101,56,216,1                // vinserti128   $0x1,%xmm0,%ymm3,%ymm3
+  .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
+  .byte  196,193,122,111,68,147,32           // vmovdqu       0x20(%r11,%rdx,4),%xmm0
+  .byte  196,227,125,2,219,240               // vpblendd      $0xf0,%ymm3,%ymm0,%ymm3
+  .byte  233,248,253,255,255                 // jmpq          7df <_sk_load_bgra_hsw_lowp+0x1b>
+  .byte  144                                 // nop
+  .byte  237                                 // in            (%dx),%eax
+  .byte  254                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,14                              // decl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  248                                 // clc
+  .byte  254                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,98,255                          // jmpq          *-0x1(%rdx)
+  .byte  255                                 // (bad)
+  .byte  255,78,255                          // decl          -0x1(%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  58,255                              // cmp           %bh,%bh
+  .byte  255                                 // (bad)
+  .byte  255,36,255                          // jmpq          *(%rdi,%rdi,8)
+  .byte  255                                 // (bad)
+  .byte  255,241                             // push          %rcx
+  .byte  253                                 // std
+  .byte  255                                 // (bad)
+  .byte  255,151,255,255,255,137             // callq         *-0x76000001(%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,115,255                         // pushq         -0x1(%rbx)
+  .byte  255                                 // (bad)
+  .byte  255,231                             // jmpq          *%rdi
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,211                             // callq         *%rbx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  191,255,255,255,169                 // mov           $0xa9ffffff,%edi
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // .byte         0xff
+
+HIDDEN _sk_load_bgra_dst_hsw_lowp
+.globl _sk_load_bgra_dst_hsw_lowp
+FUNCTION(_sk_load_bgra_dst_hsw_lowp)
+_sk_load_bgra_dst_hsw_lowp:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,139,24                           // mov           (%rax),%r11
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  15,133,210,0,0,0                    // jne           b04 <_sk_load_bgra_dst_hsw_lowp+0xe0>
+  .byte  196,193,126,111,124,147,32          // vmovdqu       0x20(%r11,%rdx,4),%ymm7
+  .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
+  .byte  197,253,111,37,89,25,0,0            // vmovdqa       0x1959(%rip),%ymm4        # 23a0 <_sk_xor__hsw_lowp+0x29c>
+  .byte  196,226,61,0,236                    // vpshufb       %ymm4,%ymm8,%ymm5
+  .byte  196,227,253,0,237,232               // vpermq        $0xe8,%ymm5,%ymm5
+  .byte  196,226,69,0,228                    // vpshufb       %ymm4,%ymm7,%ymm4
+  .byte  196,227,253,0,228,232               // vpermq        $0xe8,%ymm4,%ymm4
+  .byte  196,227,85,56,228,1                 // vinserti128   $0x1,%xmm4,%ymm5,%ymm4
+  .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
+  .byte  196,98,125,121,13,79,25,0,0         // vpbroadcastw  0x194f(%rip),%ymm9        # 23c0 <_sk_xor__hsw_lowp+0x2bc>
+  .byte  196,193,93,228,241                  // vpmulhuw      %ymm9,%ymm4,%ymm6
+  .byte  197,253,111,37,98,25,0,0            // vmovdqa       0x1962(%rip),%ymm4        # 23e0 <_sk_xor__hsw_lowp+0x2dc>
+  .byte  196,226,61,0,236                    // vpshufb       %ymm4,%ymm8,%ymm5
+  .byte  196,227,253,0,237,232               // vpermq        $0xe8,%ymm5,%ymm5
+  .byte  196,226,69,0,228                    // vpshufb       %ymm4,%ymm7,%ymm4
+  .byte  196,227,253,0,228,232               // vpermq        $0xe8,%ymm4,%ymm4
+  .byte  196,227,85,56,228,1                 // vinserti128   $0x1,%xmm4,%ymm5,%ymm4
+  .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
+  .byte  196,193,93,228,233                  // vpmulhuw      %ymm9,%ymm4,%ymm5
+  .byte  197,253,111,37,84,25,0,0            // vmovdqa       0x1954(%rip),%ymm4        # 2400 <_sk_xor__hsw_lowp+0x2fc>
+  .byte  196,98,61,0,212                     // vpshufb       %ymm4,%ymm8,%ymm10
+  .byte  196,67,253,0,210,232                // vpermq        $0xe8,%ymm10,%ymm10
+  .byte  196,226,69,0,228                    // vpshufb       %ymm4,%ymm7,%ymm4
+  .byte  196,227,253,0,228,232               // vpermq        $0xe8,%ymm4,%ymm4
+  .byte  196,227,45,56,228,1                 // vinserti128   $0x1,%xmm4,%ymm10,%ymm4
+  .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
+  .byte  196,193,93,228,225                  // vpmulhuw      %ymm9,%ymm4,%ymm4
+  .byte  197,125,111,21,70,25,0,0            // vmovdqa       0x1946(%rip),%ymm10        # 2420 <_sk_xor__hsw_lowp+0x31c>
+  .byte  196,66,61,0,194                     // vpshufb       %ymm10,%ymm8,%ymm8
+  .byte  196,67,253,0,192,232                // vpermq        $0xe8,%ymm8,%ymm8
+  .byte  196,194,69,0,250                    // vpshufb       %ymm10,%ymm7,%ymm7
+  .byte  196,227,253,0,255,232               // vpermq        $0xe8,%ymm7,%ymm7
+  .byte  196,227,61,56,255,1                 // vinserti128   $0x1,%xmm7,%ymm8,%ymm7
+  .byte  197,197,113,247,8                   // vpsllw        $0x8,%ymm7,%ymm7
+  .byte  196,193,69,228,249                  // vpmulhuw      %ymm9,%ymm7,%ymm7
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,15                       // and           $0xf,%r9b
+  .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
+  .byte  196,65,61,239,192                   // vpxor         %ymm8,%ymm8,%ymm8
+  .byte  65,254,201                          // dec           %r9b
+  .byte  65,128,249,14                       // cmp           $0xe,%r9b
+  .byte  15,135,30,255,255,255               // ja            a3f <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  .byte  69,15,182,201                       // movzbl        %r9b,%r9d
+  .byte  76,141,21,28,1,0,0                  // lea           0x11c(%rip),%r10        # c48 <_sk_load_bgra_dst_hsw_lowp+0x224>
+  .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
+  .byte  76,1,208                            // add           %r10,%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  196,65,121,110,4,147                // vmovd         (%r11,%rdx,4),%xmm8
+  .byte  233,255,254,255,255                 // jmpq          a3f <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  .byte  196,193,121,110,100,147,8           // vmovd         0x8(%r11,%rdx,4),%xmm4
+  .byte  196,226,121,89,228                  // vpbroadcastq  %xmm4,%xmm4
+  .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
+  .byte  196,99,69,2,196,4                   // vpblendd      $0x4,%ymm4,%ymm7,%ymm8
+  .byte  196,194,121,53,36,147               // vpmovzxdq     (%r11,%rdx,4),%xmm4
+  .byte  197,249,112,228,232                 // vpshufd       $0xe8,%xmm4,%xmm4
+  .byte  196,99,61,2,196,3                   // vpblendd      $0x3,%ymm4,%ymm8,%ymm8
+  .byte  233,211,254,255,255                 // jmpq          a3f <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  .byte  196,193,121,110,100,147,24          // vmovd         0x18(%r11,%rdx,4),%xmm4
+  .byte  196,226,125,89,228                  // vpbroadcastq  %xmm4,%ymm4
+  .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
+  .byte  196,99,69,2,196,64                  // vpblendd      $0x40,%ymm4,%ymm7,%ymm8
+  .byte  196,99,125,57,196,1                 // vextracti128  $0x1,%ymm8,%xmm4
+  .byte  196,195,89,34,100,147,20,1          // vpinsrd       $0x1,0x14(%r11,%rdx,4),%xmm4,%xmm4
+  .byte  196,99,61,56,196,1                  // vinserti128   $0x1,%xmm4,%ymm8,%ymm8
+  .byte  196,99,125,57,196,1                 // vextracti128  $0x1,%ymm8,%xmm4
+  .byte  196,195,89,34,100,147,16,0          // vpinsrd       $0x0,0x10(%r11,%rdx,4),%xmm4,%xmm4
+  .byte  196,99,61,56,196,1                  // vinserti128   $0x1,%xmm4,%ymm8,%ymm8
+  .byte  196,193,122,111,36,147              // vmovdqu       (%r11,%rdx,4),%xmm4
+  .byte  196,67,93,2,192,240                 // vpblendd      $0xf0,%ymm8,%ymm4,%ymm8
+  .byte  233,132,254,255,255                 // jmpq          a3f <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  .byte  196,193,121,110,100,147,40          // vmovd         0x28(%r11,%rdx,4),%xmm4
+  .byte  196,226,121,89,228                  // vpbroadcastq  %xmm4,%xmm4
+  .byte  197,213,239,237                     // vpxor         %ymm5,%ymm5,%ymm5
+  .byte  196,227,85,2,252,4                  // vpblendd      $0x4,%ymm4,%ymm5,%ymm7
+  .byte  196,195,65,34,100,147,36,1          // vpinsrd       $0x1,0x24(%r11,%rdx,4),%xmm7,%xmm4
+  .byte  196,227,69,2,252,15                 // vpblendd      $0xf,%ymm4,%ymm7,%ymm7
+  .byte  196,193,121,110,100,147,32          // vmovd         0x20(%r11,%rdx,4),%xmm4
+  .byte  196,227,69,2,252,1                  // vpblendd      $0x1,%ymm4,%ymm7,%ymm7
+  .byte  233,72,254,255,255                  // jmpq          a39 <_sk_load_bgra_dst_hsw_lowp+0x15>
+  .byte  196,193,121,110,100,147,56          // vmovd         0x38(%r11,%rdx,4),%xmm4
+  .byte  196,226,125,89,228                  // vpbroadcastq  %xmm4,%ymm4
+  .byte  197,213,239,237                     // vpxor         %ymm5,%ymm5,%ymm5
+  .byte  196,227,85,2,252,64                 // vpblendd      $0x40,%ymm4,%ymm5,%ymm7
+  .byte  196,227,125,57,252,1                // vextracti128  $0x1,%ymm7,%xmm4
+  .byte  196,195,89,34,100,147,52,1          // vpinsrd       $0x1,0x34(%r11,%rdx,4),%xmm4,%xmm4
+  .byte  196,227,69,56,252,1                 // vinserti128   $0x1,%xmm4,%ymm7,%ymm7
+  .byte  196,227,125,57,252,1                // vextracti128  $0x1,%ymm7,%xmm4
+  .byte  196,195,89,34,100,147,48,0          // vpinsrd       $0x0,0x30(%r11,%rdx,4),%xmm4,%xmm4
+  .byte  196,227,69,56,252,1                 // vinserti128   $0x1,%xmm4,%ymm7,%ymm7
+  .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
+  .byte  196,193,122,111,100,147,32          // vmovdqu       0x20(%r11,%rdx,4),%xmm4
+  .byte  196,227,93,2,255,240                // vpblendd      $0xf0,%ymm7,%ymm4,%ymm7
+  .byte  233,248,253,255,255                 // jmpq          a3f <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  .byte  144                                 // nop
+  .byte  237                                 // in            (%dx),%eax
+  .byte  254                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,14                              // decl          (%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  248                                 // clc
+  .byte  254                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,98,255                          // jmpq          *-0x1(%rdx)
+  .byte  255                                 // (bad)
+  .byte  255,78,255                          // decl          -0x1(%rsi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  58,255                              // cmp           %bh,%bh
+  .byte  255                                 // (bad)
+  .byte  255,36,255                          // jmpq          *(%rdi,%rdi,8)
+  .byte  255                                 // (bad)
+  .byte  255,241                             // push          %rcx
+  .byte  253                                 // std
+  .byte  255                                 // (bad)
+  .byte  255,151,255,255,255,137             // callq         *-0x76000001(%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,115,255                         // pushq         -0x1(%rbx)
+  .byte  255                                 // (bad)
+  .byte  255,231                             // jmpq          *%rdi
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,211                             // callq         *%rbx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  191,255,255,255,169                 // mov           $0xa9ffffff,%edi
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // .byte         0xff
+
+HIDDEN _sk_store_bgra_hsw_lowp
+.globl _sk_store_bgra_hsw_lowp
+FUNCTION(_sk_store_bgra_hsw_lowp)
+_sk_store_bgra_hsw_lowp:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,139,24                           // mov           (%rax),%r11
+  .byte  197,189,113,210,7                   // vpsrlw        $0x7,%ymm2,%ymm8
+  .byte  196,98,125,121,13,169,23,0,0        // vpbroadcastw  0x17a9(%rip),%ymm9        # 2440 <_sk_xor__hsw_lowp+0x33c>
+  .byte  196,65,61,234,193                   // vpminsw       %ymm9,%ymm8,%ymm8
+  .byte  196,66,125,51,208                   // vpmovzxwd     %xmm8,%ymm10
+  .byte  196,67,125,57,192,1                 // vextracti128  $0x1,%ymm8,%xmm8
+  .byte  196,66,125,51,192                   // vpmovzxwd     %xmm8,%ymm8
+  .byte  197,165,113,209,7                   // vpsrlw        $0x7,%ymm1,%ymm11
+  .byte  196,65,37,234,217                   // vpminsw       %ymm9,%ymm11,%ymm11
+  .byte  196,66,125,51,227                   // vpmovzxwd     %xmm11,%ymm12
+  .byte  196,67,125,57,219,1                 // vextracti128  $0x1,%ymm11,%xmm11
+  .byte  196,66,125,51,219                   // vpmovzxwd     %xmm11,%ymm11
+  .byte  196,193,37,114,243,8                // vpslld        $0x8,%ymm11,%ymm11
+  .byte  196,193,29,114,244,8                // vpslld        $0x8,%ymm12,%ymm12
+  .byte  197,149,113,208,7                   // vpsrlw        $0x7,%ymm0,%ymm13
+  .byte  196,65,21,234,233                   // vpminsw       %ymm9,%ymm13,%ymm13
+  .byte  196,67,125,57,238,1                 // vextracti128  $0x1,%ymm13,%xmm14
+  .byte  196,66,125,51,246                   // vpmovzxwd     %xmm14,%ymm14
+  .byte  196,66,125,51,237                   // vpmovzxwd     %xmm13,%ymm13
+  .byte  196,193,21,114,245,16               // vpslld        $0x10,%ymm13,%ymm13
+  .byte  196,193,13,114,246,16               // vpslld        $0x10,%ymm14,%ymm14
+  .byte  197,133,113,211,7                   // vpsrlw        $0x7,%ymm3,%ymm15
+  .byte  196,65,5,234,201                    // vpminsw       %ymm9,%ymm15,%ymm9
+  .byte  196,67,125,57,207,1                 // vextracti128  $0x1,%ymm9,%xmm15
+  .byte  196,66,125,51,255                   // vpmovzxwd     %xmm15,%ymm15
+  .byte  196,66,125,51,201                   // vpmovzxwd     %xmm9,%ymm9
+  .byte  196,193,53,114,241,24               // vpslld        $0x18,%ymm9,%ymm9
+  .byte  196,193,5,114,247,24                // vpslld        $0x18,%ymm15,%ymm15
+  .byte  196,65,61,235,198                   // vpor          %ymm14,%ymm8,%ymm8
+  .byte  196,65,45,235,237                   // vpor          %ymm13,%ymm10,%ymm13
+  .byte  196,65,37,235,215                   // vpor          %ymm15,%ymm11,%ymm10
+  .byte  196,65,61,235,210                   // vpor          %ymm10,%ymm8,%ymm10
+  .byte  196,65,29,235,193                   // vpor          %ymm9,%ymm12,%ymm8
+  .byte  196,65,21,235,192                   // vpor          %ymm8,%ymm13,%ymm8
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,17                              // jne           d52 <_sk_store_bgra_hsw_lowp+0xce>
+  .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
+  .byte  196,65,126,127,84,147,32            // vmovdqu       %ymm10,0x20(%r11,%rdx,4)
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,15                       // and           $0xf,%r9b
+  .byte  65,254,201                          // dec           %r9b
+  .byte  65,128,249,14                       // cmp           $0xe,%r9b
+  .byte  119,236                             // ja            d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  69,15,182,201                       // movzbl        %r9b,%r9d
+  .byte  76,141,21,175,0,0,0                 // lea           0xaf(%rip),%r10        # e1c <_sk_store_bgra_hsw_lowp+0x198>
+  .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
+  .byte  76,1,208                            // add           %r10,%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  196,65,121,126,4,147                // vmovd         %xmm8,(%r11,%rdx,4)
+  .byte  235,208                             // jmp           d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  196,67,121,22,68,147,8,2            // vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,4)
+  .byte  196,65,121,214,4,147                // vmovq         %xmm8,(%r11,%rdx,4)
+  .byte  235,192                             // jmp           d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
+  .byte  196,67,121,22,76,147,24,2           // vpextrd       $0x2,%xmm9,0x18(%r11,%rdx,4)
+  .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
+  .byte  196,67,121,22,76,147,20,1           // vpextrd       $0x1,%xmm9,0x14(%r11,%rdx,4)
+  .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
+  .byte  196,65,121,126,76,147,16            // vmovd         %xmm9,0x10(%r11,%rdx,4)
+  .byte  196,65,122,127,4,147                // vmovdqu       %xmm8,(%r11,%rdx,4)
+  .byte  235,143                             // jmp           d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  196,67,121,22,84,147,40,2           // vpextrd       $0x2,%xmm10,0x28(%r11,%rdx,4)
+  .byte  196,67,121,22,84,147,36,1           // vpextrd       $0x1,%xmm10,0x24(%r11,%rdx,4)
+  .byte  196,65,121,126,84,147,32            // vmovd         %xmm10,0x20(%r11,%rdx,4)
+  .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
+  .byte  233,109,255,255,255                 // jmpq          d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  196,67,125,57,209,1                 // vextracti128  $0x1,%ymm10,%xmm9
+  .byte  196,67,121,22,76,147,56,2           // vpextrd       $0x2,%xmm9,0x38(%r11,%rdx,4)
+  .byte  196,67,125,57,209,1                 // vextracti128  $0x1,%ymm10,%xmm9
+  .byte  196,67,121,22,76,147,52,1           // vpextrd       $0x1,%xmm9,0x34(%r11,%rdx,4)
+  .byte  196,67,125,57,209,1                 // vextracti128  $0x1,%ymm10,%xmm9
+  .byte  196,65,121,126,76,147,48            // vmovd         %xmm9,0x30(%r11,%rdx,4)
+  .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
+  .byte  196,65,122,127,84,147,32            // vmovdqu       %xmm10,0x20(%r11,%rdx,4)
+  .byte  233,50,255,255,255                  // jmpq          d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  90                                  // pop           %rdx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,106,255                         // ljmp          *-0x1(%rdx)
+  .byte  255                                 // (bad)
+  .byte  255,98,255                          // jmpq          *-0x1(%rdx)
+  .byte  255                                 // (bad)
+  .byte  255,155,255,255,255,142             // lcall         *-0x71000001(%rbx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,128,255,255,255,114             // incl          0x72ffffff(%rax)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  186,255,255,255,179                 // mov           $0xb3ffffff,%edx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,171,255,255,255,163             // ljmp          *-0x5c000001(%rbx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  238                                 // out           %al,(%dx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,225                             // jmpq          *%rcx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,211                             // callq         *%rbx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,197                             // inc           %ebp
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // .byte         0xff
+
 HIDDEN _sk_load_a8_hsw_lowp
 .globl _sk_load_a8_hsw_lowp
 FUNCTION(_sk_load_a8_hsw_lowp)
@@ -40996,11 +42792,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,45                              // jne           7fb <_sk_load_a8_hsw_lowp+0x37>
+  .byte  117,45                              // jne           e8f <_sk_load_a8_hsw_lowp+0x37>
   .byte  196,193,122,111,4,19                // vmovdqu       (%r11,%rdx,1),%xmm0
   .byte  196,226,125,48,192                  // vpmovzxbw     %xmm0,%ymm0
   .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
-  .byte  196,226,125,121,13,123,20,0,0       // vpbroadcastw  0x147b(%rip),%ymm1        # 1c62 <_sk_xor__hsw_lowp+0x1e2>
+  .byte  196,226,125,121,13,199,21,0,0       // vpbroadcastw  0x15c7(%rip),%ymm1        # 2442 <_sk_xor__hsw_lowp+0x33e>
   .byte  197,253,228,217                     // vpmulhuw      %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,253,239,192                     // vpxor         %ymm0,%ymm0,%ymm0
@@ -41012,35 +42808,35 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,197                             // ja            7d4 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  119,197                             // ja            e68 <_sk_load_a8_hsw_lowp+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,194,0,0,0                 // lea           0xc2(%rip),%r10        # 8dc <_sk_load_a8_hsw_lowp+0x118>
+  .byte  76,141,21,194,0,0,0                 // lea           0xc2(%rip),%r10        # f70 <_sk_load_a8_hsw_lowp+0x118>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,166                             // jmp           7d4 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  235,166                             // jmp           e68 <_sk_load_a8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,2,2            // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm0,%xmm0
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,227,121,14,193,1                // vpblendw      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  235,137                             // jmp           7d4 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  235,137                             // jmp           e68 <_sk_load_a8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,6,6            // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,5,5            // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,4,4            // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,92,255,255,255                  // jmpq          7d4 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  233,92,255,255,255                  // jmpq          e68 <_sk_load_a8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,10,10          // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,9,9            // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,8,8            // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,193,122,126,12,19               // vmovq         (%r11,%rdx,1),%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,47,255,255,255                  // jmpq          7d4 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  233,47,255,255,255                  // jmpq          e68 <_sk_load_a8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,14,14          // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,13,13          // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm0,%xmm0
@@ -41048,7 +42844,7 @@
   .byte  196,193,122,126,12,19               // vmovq         (%r11,%rdx,1),%xmm1
   .byte  196,195,113,34,76,19,8,2            // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm1,%xmm1
   .byte  196,227,113,2,192,8                 // vpblendd      $0x8,%xmm0,%xmm1,%xmm0
-  .byte  233,250,254,255,255                 // jmpq          7d4 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  233,250,254,255,255                 // jmpq          e68 <_sk_load_a8_hsw_lowp+0x10>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  71,255                              // rex.RXB       (bad)
   .byte  255                                 // (bad)
@@ -41060,7 +42856,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  123,255                             // jnp           8f1 <_sk_load_a8_hsw_lowp+0x12d>
+  .byte  123,255                             // jnp           f85 <_sk_load_a8_hsw_lowp+0x12d>
   .byte  255                                 // (bad)
   .byte  255,111,255                         // ljmp          *-0x1(%rdi)
   .byte  255                                 // (bad)
@@ -41092,11 +42888,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,45                              // jne           94f <_sk_load_a8_dst_hsw_lowp+0x37>
+  .byte  117,45                              // jne           fe3 <_sk_load_a8_dst_hsw_lowp+0x37>
   .byte  196,193,122,111,36,19               // vmovdqu       (%r11,%rdx,1),%xmm4
   .byte  196,226,125,48,228                  // vpmovzxbw     %xmm4,%ymm4
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
-  .byte  196,226,125,121,45,41,19,0,0        // vpbroadcastw  0x1329(%rip),%ymm5        # 1c64 <_sk_xor__hsw_lowp+0x1e4>
+  .byte  196,226,125,121,45,117,20,0,0       // vpbroadcastw  0x1475(%rip),%ymm5        # 2444 <_sk_xor__hsw_lowp+0x340>
   .byte  197,221,228,253                     // vpmulhuw      %ymm5,%ymm4,%ymm7
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,221,239,228                     // vpxor         %ymm4,%ymm4,%ymm4
@@ -41108,35 +42904,35 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,197                             // ja            928 <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  119,197                             // ja            fbc <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,194,0,0,0                 // lea           0xc2(%rip),%r10        # a30 <_sk_load_a8_dst_hsw_lowp+0x118>
+  .byte  76,141,21,194,0,0,0                 // lea           0xc2(%rip),%r10        # 10c4 <_sk_load_a8_dst_hsw_lowp+0x118>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,166                             // jmp           928 <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  235,166                             // jmp           fbc <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,2,2            // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm4,%xmm4
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,227,89,14,229,1                 // vpblendw      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  235,137                             // jmp           928 <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  235,137                             // jmp           fbc <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,6,6            // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,5,5            // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,4,4            // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,92,255,255,255                  // jmpq          928 <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  233,92,255,255,255                  // jmpq          fbc <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,10,10          // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,9,9            // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,8,8            // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,193,122,126,44,19               // vmovq         (%r11,%rdx,1),%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,47,255,255,255                  // jmpq          928 <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  233,47,255,255,255                  // jmpq          fbc <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,14,14          // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,13,13          // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm4,%xmm4
@@ -41144,7 +42940,7 @@
   .byte  196,193,122,126,44,19               // vmovq         (%r11,%rdx,1),%xmm5
   .byte  196,195,81,34,108,19,8,2            // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm5,%xmm5
   .byte  196,227,81,2,228,8                  // vpblendd      $0x8,%xmm4,%xmm5,%xmm4
-  .byte  233,250,254,255,255                 // jmpq          928 <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  233,250,254,255,255                 // jmpq          fbc <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  71,255                              // rex.RXB       (bad)
   .byte  255                                 // (bad)
@@ -41156,7 +42952,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  123,255                             // jnp           a45 <_sk_load_a8_dst_hsw_lowp+0x12d>
+  .byte  123,255                             // jnp           10d9 <_sk_load_a8_dst_hsw_lowp+0x12d>
   .byte  255                                 // (bad)
   .byte  255,111,255                         // ljmp          *-0x1(%rdi)
   .byte  255                                 // (bad)
@@ -41191,7 +42987,7 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,65,57,103,193                   // vpackuswb     %xmm9,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           a90 <_sk_store_a8_hsw_lowp+0x24>
+  .byte  117,10                              // jne           1124 <_sk_store_a8_hsw_lowp+0x24>
   .byte  196,65,122,127,4,19                 // vmovdqu       %xmm8,(%r11,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -41199,32 +42995,32 @@
   .byte  65,128,225,15                       // and           $0xf,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,236                             // ja            a8c <_sk_store_a8_hsw_lowp+0x20>
+  .byte  119,236                             // ja            1120 <_sk_store_a8_hsw_lowp+0x20>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,137,0,0,0                 // lea           0x89(%rip),%r10        # b34 <_sk_store_a8_hsw_lowp+0xc8>
+  .byte  76,141,21,137,0,0,0                 // lea           0x89(%rip),%r10        # 11c8 <_sk_store_a8_hsw_lowp+0xc8>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,20,4,19,0                // vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,207                             // jmp           a8c <_sk_store_a8_hsw_lowp+0x20>
+  .byte  235,207                             // jmp           1120 <_sk_store_a8_hsw_lowp+0x20>
   .byte  196,67,121,20,68,19,2,2             // vpextrb       $0x2,%xmm8,0x2(%r11,%rdx,1)
   .byte  196,67,121,21,4,19,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,190                             // jmp           a8c <_sk_store_a8_hsw_lowp+0x20>
+  .byte  235,190                             // jmp           1120 <_sk_store_a8_hsw_lowp+0x20>
   .byte  196,67,121,20,68,19,6,6             // vpextrb       $0x6,%xmm8,0x6(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,5,5             // vpextrb       $0x5,%xmm8,0x5(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,4,4             // vpextrb       $0x4,%xmm8,0x4(%r11,%rdx,1)
   .byte  196,65,121,126,4,19                 // vmovd         %xmm8,(%r11,%rdx,1)
-  .byte  235,158                             // jmp           a8c <_sk_store_a8_hsw_lowp+0x20>
+  .byte  235,158                             // jmp           1120 <_sk_store_a8_hsw_lowp+0x20>
   .byte  196,67,121,20,68,19,10,10           // vpextrb       $0xa,%xmm8,0xa(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,9,9             // vpextrb       $0x9,%xmm8,0x9(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,8,8             // vpextrb       $0x8,%xmm8,0x8(%r11,%rdx,1)
-  .byte  235,32                              // jmp           b28 <_sk_store_a8_hsw_lowp+0xbc>
+  .byte  235,32                              // jmp           11bc <_sk_store_a8_hsw_lowp+0xbc>
   .byte  196,67,121,20,68,19,14,14           // vpextrb       $0xe,%xmm8,0xe(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,13,13           // vpextrb       $0xd,%xmm8,0xd(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,12,12           // vpextrb       $0xc,%xmm8,0xc(%r11,%rdx,1)
   .byte  196,67,121,22,68,19,8,2             // vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,1)
   .byte  196,65,121,214,4,19                 // vmovq         %xmm8,(%r11,%rdx,1)
-  .byte  233,89,255,255,255                  // jmpq          a8c <_sk_store_a8_hsw_lowp+0x20>
+  .byte  233,89,255,255,255                  // jmpq          1120 <_sk_store_a8_hsw_lowp+0x20>
   .byte  144                                 // nop
   .byte  128,255,255                         // cmp           $0xff,%bh
   .byte  255,145,255,255,255,137             // callq         *-0x76000001(%rcx)
@@ -41267,14 +43063,14 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,50                              // jne           bac <_sk_load_g8_hsw_lowp+0x3c>
+  .byte  117,50                              // jne           1240 <_sk_load_g8_hsw_lowp+0x3c>
   .byte  196,193,122,111,4,19                // vmovdqu       (%r11,%rdx,1),%xmm0
   .byte  196,226,125,48,192                  // vpmovzxbw     %xmm0,%ymm0
   .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
-  .byte  196,226,125,121,13,211,16,0,0       // vpbroadcastw  0x10d3(%rip),%ymm1        # 1c66 <_sk_xor__hsw_lowp+0x1e6>
+  .byte  196,226,125,121,13,31,18,0,0        // vpbroadcastw  0x121f(%rip),%ymm1        # 2446 <_sk_xor__hsw_lowp+0x342>
   .byte  197,253,228,193                     // vpmulhuw      %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,121,29,198,16,0,0       // vpbroadcastw  0x10c6(%rip),%ymm3        # 1c68 <_sk_xor__hsw_lowp+0x1e8>
+  .byte  196,226,125,121,29,18,18,0,0        // vpbroadcastw  0x1212(%rip),%ymm3        # 2448 <_sk_xor__hsw_lowp+0x344>
   .byte  197,253,111,200                     // vmovdqa       %ymm0,%ymm1
   .byte  197,253,111,208                     // vmovdqa       %ymm0,%ymm2
   .byte  255,224                             // jmpq          *%rax
@@ -41283,35 +43079,35 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,192                             // ja            b80 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  119,192                             // ja            1214 <_sk_load_g8_hsw_lowp+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,193,0,0,0                 // lea           0xc1(%rip),%r10        # c8c <_sk_load_g8_hsw_lowp+0x11c>
+  .byte  76,141,21,193,0,0,0                 // lea           0xc1(%rip),%r10        # 1320 <_sk_load_g8_hsw_lowp+0x11c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,161                             // jmp           b80 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  235,161                             // jmp           1214 <_sk_load_g8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,2,2            // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm0,%xmm0
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,227,121,14,193,1                // vpblendw      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  235,132                             // jmp           b80 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  235,132                             // jmp           1214 <_sk_load_g8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,6,6            // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,5,5            // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,4,4            // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,87,255,255,255                  // jmpq          b80 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  233,87,255,255,255                  // jmpq          1214 <_sk_load_g8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,10,10          // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,9,9            // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,8,8            // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,193,122,126,12,19               // vmovq         (%r11,%rdx,1),%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,42,255,255,255                  // jmpq          b80 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  233,42,255,255,255                  // jmpq          1214 <_sk_load_g8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,14,14          // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,13,13          // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm0,%xmm0
@@ -41319,7 +43115,7 @@
   .byte  196,193,122,126,12,19               // vmovq         (%r11,%rdx,1),%xmm1
   .byte  196,195,113,34,76,19,8,2            // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm1,%xmm1
   .byte  196,227,113,2,192,8                 // vpblendd      $0x8,%xmm0,%xmm1,%xmm0
-  .byte  233,245,254,255,255                 // jmpq          b80 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  233,245,254,255,255                 // jmpq          1214 <_sk_load_g8_hsw_lowp+0x10>
   .byte  144                                 // nop
   .byte  72,255                              // rex.W         (bad)
   .byte  255                                 // (bad)
@@ -41330,7 +43126,7 @@
   .byte  255,140,255,255,255,132,255         // decl          -0x7b0001(%rdi,%rdi,8)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  124,255                             // jl            ca1 <_sk_load_g8_hsw_lowp+0x131>
+  .byte  124,255                             // jl            1335 <_sk_load_g8_hsw_lowp+0x131>
   .byte  255                                 // (bad)
   .byte  255,112,255                         // pushq         -0x1(%rax)
   .byte  255                                 // (bad)
@@ -41362,14 +43158,14 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,50                              // jne           d04 <_sk_load_g8_dst_hsw_lowp+0x3c>
+  .byte  117,50                              // jne           1398 <_sk_load_g8_dst_hsw_lowp+0x3c>
   .byte  196,193,122,111,36,19               // vmovdqu       (%r11,%rdx,1),%xmm4
   .byte  196,226,125,48,228                  // vpmovzxbw     %xmm4,%ymm4
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
-  .byte  196,226,125,121,45,127,15,0,0       // vpbroadcastw  0xf7f(%rip),%ymm5        # 1c6a <_sk_xor__hsw_lowp+0x1ea>
+  .byte  196,226,125,121,45,203,16,0,0       // vpbroadcastw  0x10cb(%rip),%ymm5        # 244a <_sk_xor__hsw_lowp+0x346>
   .byte  197,221,228,229                     // vpmulhuw      %ymm5,%ymm4,%ymm4
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,121,61,114,15,0,0       // vpbroadcastw  0xf72(%rip),%ymm7        # 1c6c <_sk_xor__hsw_lowp+0x1ec>
+  .byte  196,226,125,121,61,190,16,0,0       // vpbroadcastw  0x10be(%rip),%ymm7        # 244c <_sk_xor__hsw_lowp+0x348>
   .byte  197,253,111,236                     // vmovdqa       %ymm4,%ymm5
   .byte  197,253,111,244                     // vmovdqa       %ymm4,%ymm6
   .byte  255,224                             // jmpq          *%rax
@@ -41378,35 +43174,35 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,192                             // ja            cd8 <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  119,192                             // ja            136c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,193,0,0,0                 // lea           0xc1(%rip),%r10        # de4 <_sk_load_g8_dst_hsw_lowp+0x11c>
+  .byte  76,141,21,193,0,0,0                 // lea           0xc1(%rip),%r10        # 1478 <_sk_load_g8_dst_hsw_lowp+0x11c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,161                             // jmp           cd8 <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  235,161                             // jmp           136c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,2,2            // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm4,%xmm4
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,227,89,14,229,1                 // vpblendw      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  235,132                             // jmp           cd8 <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  235,132                             // jmp           136c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,6,6            // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,5,5            // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,4,4            // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,87,255,255,255                  // jmpq          cd8 <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  233,87,255,255,255                  // jmpq          136c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,10,10          // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,9,9            // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,8,8            // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,193,122,126,44,19               // vmovq         (%r11,%rdx,1),%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,42,255,255,255                  // jmpq          cd8 <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  233,42,255,255,255                  // jmpq          136c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,14,14          // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,13,13          // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm4,%xmm4
@@ -41414,7 +43210,7 @@
   .byte  196,193,122,126,44,19               // vmovq         (%r11,%rdx,1),%xmm5
   .byte  196,195,81,34,108,19,8,2            // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm5,%xmm5
   .byte  196,227,81,2,228,8                  // vpblendd      $0x8,%xmm4,%xmm5,%xmm4
-  .byte  233,245,254,255,255                 // jmpq          cd8 <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  233,245,254,255,255                 // jmpq          136c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  144                                 // nop
   .byte  72,255                              // rex.W         (bad)
   .byte  255                                 // (bad)
@@ -41425,7 +43221,7 @@
   .byte  255,140,255,255,255,132,255         // decl          -0x7b0001(%rdi,%rdi,8)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  124,255                             // jl            df9 <_sk_load_g8_dst_hsw_lowp+0x131>
+  .byte  124,255                             // jl            148d <_sk_load_g8_dst_hsw_lowp+0x131>
   .byte  255                                 // (bad)
   .byte  255,112,255                         // pushq         -0x1(%rax)
   .byte  255                                 // (bad)
@@ -41457,20 +43253,20 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,220,1,0,0                    // jne           100a <_sk_srcover_rgba_8888_hsw_lowp+0x1ea>
+  .byte  15,133,220,1,0,0                    // jne           169e <_sk_srcover_rgba_8888_hsw_lowp+0x1ea>
   .byte  196,193,126,111,124,147,32          // vmovdqu       0x20(%r11,%rdx,4),%ymm7
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
-  .byte  197,253,111,37,61,14,0,0            // vmovdqa       0xe3d(%rip),%ymm4        # 1c80 <_sk_xor__hsw_lowp+0x200>
+  .byte  197,253,111,37,137,15,0,0           // vmovdqa       0xf89(%rip),%ymm4        # 2460 <_sk_xor__hsw_lowp+0x35c>
   .byte  196,226,61,0,236                    // vpshufb       %ymm4,%ymm8,%ymm5
   .byte  196,227,253,0,237,232               // vpermq        $0xe8,%ymm5,%ymm5
   .byte  196,226,69,0,228                    // vpshufb       %ymm4,%ymm7,%ymm4
   .byte  196,227,253,0,228,232               // vpermq        $0xe8,%ymm4,%ymm4
   .byte  196,227,85,56,228,1                 // vinserti128   $0x1,%xmm4,%ymm5,%ymm4
-  .byte  196,98,125,121,13,56,14,0,0         // vpbroadcastw  0xe38(%rip),%ymm9        # 1ca0 <_sk_xor__hsw_lowp+0x220>
+  .byte  196,98,125,121,13,132,15,0,0        // vpbroadcastw  0xf84(%rip),%ymm9        # 2480 <_sk_xor__hsw_lowp+0x37c>
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
-  .byte  196,98,125,121,21,44,14,0,0         // vpbroadcastw  0xe2c(%rip),%ymm10        # 1ca2 <_sk_xor__hsw_lowp+0x222>
+  .byte  196,98,125,121,21,120,15,0,0        // vpbroadcastw  0xf78(%rip),%ymm10        # 2482 <_sk_xor__hsw_lowp+0x37e>
   .byte  196,193,93,228,226                  // vpmulhuw      %ymm10,%ymm4,%ymm4
-  .byte  197,253,111,45,61,14,0,0            // vmovdqa       0xe3d(%rip),%ymm5        # 1cc0 <_sk_xor__hsw_lowp+0x240>
+  .byte  197,253,111,45,137,15,0,0           // vmovdqa       0xf89(%rip),%ymm5        # 24a0 <_sk_xor__hsw_lowp+0x39c>
   .byte  196,226,61,0,245                    // vpshufb       %ymm5,%ymm8,%ymm6
   .byte  196,227,253,0,246,232               // vpermq        $0xe8,%ymm6,%ymm6
   .byte  196,226,69,0,237                    // vpshufb       %ymm5,%ymm7,%ymm5
@@ -41478,7 +43274,7 @@
   .byte  196,227,77,56,237,1                 // vinserti128   $0x1,%xmm5,%ymm6,%ymm5
   .byte  197,213,113,245,8                   // vpsllw        $0x8,%ymm5,%ymm5
   .byte  196,193,85,228,234                  // vpmulhuw      %ymm10,%ymm5,%ymm5
-  .byte  197,253,111,53,47,14,0,0            // vmovdqa       0xe2f(%rip),%ymm6        # 1ce0 <_sk_xor__hsw_lowp+0x260>
+  .byte  197,253,111,53,123,15,0,0           // vmovdqa       0xf7b(%rip),%ymm6        # 24c0 <_sk_xor__hsw_lowp+0x3bc>
   .byte  196,98,61,0,222                     // vpshufb       %ymm6,%ymm8,%ymm11
   .byte  196,67,253,0,219,232                // vpermq        $0xe8,%ymm11,%ymm11
   .byte  196,226,69,0,246                    // vpshufb       %ymm6,%ymm7,%ymm6
@@ -41486,7 +43282,7 @@
   .byte  196,227,37,56,246,1                 // vinserti128   $0x1,%xmm6,%ymm11,%ymm6
   .byte  197,205,113,246,8                   // vpsllw        $0x8,%ymm6,%ymm6
   .byte  196,193,77,228,242                  // vpmulhuw      %ymm10,%ymm6,%ymm6
-  .byte  197,125,111,29,33,14,0,0            // vmovdqa       0xe21(%rip),%ymm11        # 1d00 <_sk_xor__hsw_lowp+0x280>
+  .byte  197,125,111,29,109,15,0,0           // vmovdqa       0xf6d(%rip),%ymm11        # 24e0 <_sk_xor__hsw_lowp+0x3dc>
   .byte  196,66,61,0,195                     // vpshufb       %ymm11,%ymm8,%ymm8
   .byte  196,67,253,0,192,232                // vpermq        $0xe8,%ymm8,%ymm8
   .byte  196,194,69,0,251                    // vpshufb       %ymm11,%ymm7,%ymm7
@@ -41494,7 +43290,7 @@
   .byte  196,227,61,56,255,1                 // vinserti128   $0x1,%xmm7,%ymm8,%ymm7
   .byte  197,197,113,247,8                   // vpsllw        $0x8,%ymm7,%ymm7
   .byte  196,193,69,228,250                  // vpmulhuw      %ymm10,%ymm7,%ymm7
-  .byte  196,98,125,121,5,18,14,0,0          // vpbroadcastw  0xe12(%rip),%ymm8        # 1d20 <_sk_xor__hsw_lowp+0x2a0>
+  .byte  196,98,125,121,5,94,15,0,0          // vpbroadcastw  0xf5e(%rip),%ymm8        # 2500 <_sk_xor__hsw_lowp+0x3fc>
   .byte  197,61,249,195                      // vpsubw        %ymm3,%ymm8,%ymm8
   .byte  196,66,93,11,208                    // vpmulhrsw     %ymm8,%ymm4,%ymm10
   .byte  196,66,125,29,210                   // vpabsw        %ymm10,%ymm10
@@ -41541,7 +43337,7 @@
   .byte  196,65,13,235,193                   // vpor          %ymm9,%ymm14,%ymm8
   .byte  196,65,37,235,192                   // vpor          %ymm8,%ymm11,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,77                              // jne           1046 <_sk_srcover_rgba_8888_hsw_lowp+0x226>
+  .byte  117,77                              // jne           16da <_sk_srcover_rgba_8888_hsw_lowp+0x226>
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
   .byte  196,65,126,127,84,147,32            // vmovdqu       %ymm10,0x20(%r11,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -41552,26 +43348,26 @@
   .byte  196,65,61,239,192                   // vpxor         %ymm8,%ymm8,%ymm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  15,135,20,254,255,255               // ja            e3b <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  .byte  15,135,20,254,255,255               // ja            14cf <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,238,1,0,0                 // lea           0x1ee(%rip),%r10        # 1220 <_sk_srcover_rgba_8888_hsw_lowp+0x400>
+  .byte  76,141,21,238,1,0,0                 // lea           0x1ee(%rip),%r10        # 18b4 <_sk_srcover_rgba_8888_hsw_lowp+0x400>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,110,4,147                // vmovd         (%r11,%rdx,4),%xmm8
-  .byte  233,245,253,255,255                 // jmpq          e3b <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  .byte  233,245,253,255,255                 // jmpq          14cf <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,15                       // and           $0xf,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,176                             // ja            1006 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  119,176                             // ja            169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  65,15,182,193                       // movzbl        %r9b,%eax
-  .byte  76,141,13,251,1,0,0                 // lea           0x1fb(%rip),%r9        # 125c <_sk_srcover_rgba_8888_hsw_lowp+0x43c>
+  .byte  76,141,13,251,1,0,0                 // lea           0x1fb(%rip),%r9        # 18f0 <_sk_srcover_rgba_8888_hsw_lowp+0x43c>
   .byte  73,99,4,129                         // movslq        (%r9,%rax,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,126,4,147                // vmovd         %xmm8,(%r11,%rdx,4)
-  .byte  235,148                             // jmp           1006 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  235,148                             // jmp           169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  196,193,121,110,100,147,8           // vmovd         0x8(%r11,%rdx,4),%xmm4
   .byte  196,226,121,89,228                  // vpbroadcastq  %xmm4,%xmm4
   .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
@@ -41579,7 +43375,7 @@
   .byte  196,194,121,53,36,147               // vpmovzxdq     (%r11,%rdx,4),%xmm4
   .byte  197,249,112,228,232                 // vpshufd       $0xe8,%xmm4,%xmm4
   .byte  196,99,61,2,196,3                   // vpblendd      $0x3,%ymm4,%ymm8,%ymm8
-  .byte  233,157,253,255,255                 // jmpq          e3b <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  .byte  233,157,253,255,255                 // jmpq          14cf <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   .byte  196,193,121,110,100,147,24          // vmovd         0x18(%r11,%rdx,4),%xmm4
   .byte  196,226,125,89,228                  // vpbroadcastq  %xmm4,%ymm4
   .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
@@ -41592,7 +43388,7 @@
   .byte  196,99,61,56,196,1                  // vinserti128   $0x1,%xmm4,%ymm8,%ymm8
   .byte  196,193,122,111,36,147              // vmovdqu       (%r11,%rdx,4),%xmm4
   .byte  196,67,93,2,192,240                 // vpblendd      $0xf0,%ymm8,%ymm4,%ymm8
-  .byte  233,78,253,255,255                  // jmpq          e3b <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  .byte  233,78,253,255,255                  // jmpq          14cf <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   .byte  196,193,121,110,100,147,40          // vmovd         0x28(%r11,%rdx,4),%xmm4
   .byte  196,226,121,89,228                  // vpbroadcastq  %xmm4,%xmm4
   .byte  197,213,239,237                     // vpxor         %ymm5,%ymm5,%ymm5
@@ -41601,7 +43397,7 @@
   .byte  196,227,69,2,252,15                 // vpblendd      $0xf,%ymm4,%ymm7,%ymm7
   .byte  196,193,121,110,100,147,32          // vmovd         0x20(%r11,%rdx,4),%xmm4
   .byte  196,227,69,2,252,1                  // vpblendd      $0x1,%ymm4,%ymm7,%ymm7
-  .byte  233,18,253,255,255                  // jmpq          e35 <_sk_srcover_rgba_8888_hsw_lowp+0x15>
+  .byte  233,18,253,255,255                  // jmpq          14c9 <_sk_srcover_rgba_8888_hsw_lowp+0x15>
   .byte  196,193,121,110,100,147,56          // vmovd         0x38(%r11,%rdx,4),%xmm4
   .byte  196,226,125,89,228                  // vpbroadcastq  %xmm4,%ymm4
   .byte  197,213,239,237                     // vpxor         %ymm5,%ymm5,%ymm5
@@ -41615,10 +43411,10 @@
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
   .byte  196,193,122,111,100,147,32          // vmovdqu       0x20(%r11,%rdx,4),%xmm4
   .byte  196,227,93,2,255,240                // vpblendd      $0xf0,%ymm7,%ymm4,%ymm7
-  .byte  233,194,252,255,255                 // jmpq          e3b <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  .byte  233,194,252,255,255                 // jmpq          14cf <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   .byte  196,67,121,22,68,147,8,2            // vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,4)
   .byte  196,65,121,214,4,147                // vmovq         %xmm8,(%r11,%rdx,4)
-  .byte  233,122,254,255,255                 // jmpq          1006 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  233,122,254,255,255                 // jmpq          169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,67,121,22,76,147,24,2           // vpextrd       $0x2,%xmm9,0x18(%r11,%rdx,4)
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
@@ -41626,12 +43422,12 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,65,121,126,76,147,16            // vmovd         %xmm9,0x10(%r11,%rdx,4)
   .byte  196,65,122,127,4,147                // vmovdqu       %xmm8,(%r11,%rdx,4)
-  .byte  233,70,254,255,255                  // jmpq          1006 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  233,70,254,255,255                  // jmpq          169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  196,67,121,22,84,147,40,2           // vpextrd       $0x2,%xmm10,0x28(%r11,%rdx,4)
   .byte  196,67,121,22,84,147,36,1           // vpextrd       $0x1,%xmm10,0x24(%r11,%rdx,4)
   .byte  196,65,121,126,84,147,32            // vmovd         %xmm10,0x20(%r11,%rdx,4)
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
-  .byte  233,36,254,255,255                  // jmpq          1006 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  233,36,254,255,255                  // jmpq          169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  196,67,125,57,209,1                 // vextracti128  $0x1,%ymm10,%xmm9
   .byte  196,67,121,22,76,147,56,2           // vpextrd       $0x2,%xmm9,0x38(%r11,%rdx,4)
   .byte  196,67,125,57,209,1                 // vextracti128  $0x1,%ymm10,%xmm9
@@ -41640,7 +43436,7 @@
   .byte  196,65,121,126,76,147,48            // vmovd         %xmm9,0x30(%r11,%rdx,4)
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
   .byte  196,65,122,127,84,147,32            // vmovdqu       %xmm10,0x20(%r11,%rdx,4)
-  .byte  233,233,253,255,255                 // jmpq          1006 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  233,233,253,255,255                 // jmpq          169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  27,254                              // sbb           %esi,%edi
   .byte  255                                 // (bad)
@@ -41654,7 +43450,7 @@
   .byte  255                                 // (bad)
   .byte  255,148,254,255,255,126,254         // callq         *-0x1810001(%rsi,%rdi,8)
   .byte  255                                 // (bad)
-  .byte  255,21,252,255,255,241              // callq         *-0xe000004(%rip)        # fffffffff200123d <_sk_xor__hsw_lowp+0xfffffffff1fff7bd>
+  .byte  255,21,252,255,255,241              // callq         *-0xe000004(%rip)        # fffffffff20018d1 <_sk_xor__hsw_lowp+0xfffffffff1fff7cd>
   .byte  254                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,227                             // jmpq          *%rbx
@@ -41665,7 +43461,7 @@
   .byte  255                                 // (bad)
   .byte  255,65,255                          // incl          -0x1(%rcx)
   .byte  255                                 // (bad)
-  .byte  255,45,255,255,255,25               // ljmp          *0x19ffffff(%rip)        # 1a001254 <_sk_xor__hsw_lowp+0x19fff7d4>
+  .byte  255,45,255,255,255,25               // ljmp          *0x19ffffff(%rip)        # 1a0018e8 <_sk_xor__hsw_lowp+0x19fff7e4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,3                               // incl          (%rbx)
@@ -41674,7 +43470,7 @@
   .byte  255,14                              // decl          (%rsi)
   .byte  254                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,37,255,255,255,29               // jmpq          *0x1dffffff(%rip)        # 1e001264 <_sk_xor__hsw_lowp+0x1dfff7e4>
+  .byte  255,37,255,255,255,29               // jmpq          *0x1dffffff(%rip)        # 1e0018f8 <_sk_xor__hsw_lowp+0x1dfff7f4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,89,255                          // lcall         *-0x1(%rcx)
@@ -41687,7 +43483,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  123,255                             // jnp           1279 <_sk_srcover_rgba_8888_hsw_lowp+0x459>
+  .byte  123,255                             // jnp           190d <_sk_srcover_rgba_8888_hsw_lowp+0x459>
   .byte  255                                 // (bad)
   .byte  255,116,255,255                     // pushq         -0x1(%rdi,%rdi,8)
   .byte  255,108,255,255                     // ljmp          *-0x1(%rdi,%rdi,8)
@@ -41705,7 +43501,7 @@
 _sk_scale_1_float_hsw_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,122,16,0                        // vmovss        (%rax),%xmm8
-  .byte  197,58,88,5,90,8,0,0                // vaddss        0x85a(%rip),%xmm8,%xmm8        # 1b00 <_sk_xor__hsw_lowp+0x80>
+  .byte  197,58,88,5,74,8,0,0                // vaddss        0x84a(%rip),%xmm8,%xmm8        # 2184 <_sk_xor__hsw_lowp+0x80>
   .byte  197,121,126,192                     // vmovd         %xmm8,%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
   .byte  196,66,125,121,192                  // vpbroadcastw  %xmm8,%ymm8
@@ -41727,11 +43523,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,75                              // jne           1334 <_sk_scale_u8_hsw_lowp+0x55>
+  .byte  117,75                              // jne           19c8 <_sk_scale_u8_hsw_lowp+0x55>
   .byte  196,65,122,111,4,19                 // vmovdqu       (%r11,%rdx,1),%xmm8
   .byte  196,66,125,48,192                   // vpmovzxbw     %xmm8,%ymm8
   .byte  196,193,61,113,240,8                // vpsllw        $0x8,%ymm8,%ymm8
-  .byte  196,98,125,121,13,31,10,0,0         // vpbroadcastw  0xa1f(%rip),%ymm9        # 1d22 <_sk_xor__hsw_lowp+0x2a2>
+  .byte  196,98,125,121,13,107,11,0,0        // vpbroadcastw  0xb6b(%rip),%ymm9        # 2502 <_sk_xor__hsw_lowp+0x3fe>
   .byte  196,65,61,228,193                   // vpmulhuw      %ymm9,%ymm8,%ymm8
   .byte  196,194,125,11,192                  // vpmulhrsw     %ymm8,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -41748,35 +43544,35 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,166                             // ja            12ef <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  119,166                             // ja            1983 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,200,0,0,0                 // lea           0xc8(%rip),%r10        # 141c <_sk_scale_u8_hsw_lowp+0x13d>
+  .byte  76,141,21,200,0,0,0                 // lea           0xc8(%rip),%r10        # 1ab0 <_sk_scale_u8_hsw_lowp+0x13d>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  235,135                             // jmp           12ef <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  235,135                             // jmp           1983 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,2,2              // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm8,%xmm8
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,67,57,14,193,1                  // vpblendw      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,102,255,255,255                 // jmpq          12ef <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  233,102,255,255,255                 // jmpq          1983 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,6,6              // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,5,5              // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,4,4              // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,67,57,2,193,1                   // vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,56,255,255,255                  // jmpq          12ef <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  233,56,255,255,255                  // jmpq          1983 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,10,10            // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,9,9              // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,8,8              // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,65,122,126,12,19                // vmovq         (%r11,%rdx,1),%xmm9
   .byte  196,67,49,2,192,12                  // vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  .byte  233,10,255,255,255                  // jmpq          12ef <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  233,10,255,255,255                  // jmpq          1983 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,14,14            // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,13,13            // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm8,%xmm8
@@ -41784,7 +43580,7 @@
   .byte  196,65,122,126,12,19                // vmovq         (%r11,%rdx,1),%xmm9
   .byte  196,67,49,34,76,19,8,2              // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm9,%xmm9
   .byte  196,67,49,2,192,8                   // vpblendd      $0x8,%xmm8,%xmm9,%xmm8
-  .byte  233,212,254,255,255                 // jmpq          12ef <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  233,212,254,255,255                 // jmpq          1983 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  144                                 // nop
   .byte  65,255                              // rex.B         (bad)
   .byte  255                                 // (bad)
@@ -41795,7 +43591,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  122,255                             // jp            1431 <_sk_scale_u8_hsw_lowp+0x152>
+  .byte  122,255                             // jp            1ac5 <_sk_scale_u8_hsw_lowp+0x152>
   .byte  255                                 // (bad)
   .byte  255,109,255                         // ljmp          *-0x1(%rbp)
   .byte  255                                 // (bad)
@@ -41826,13 +43622,13 @@
 _sk_lerp_1_float_hsw_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,122,16,0                        // vmovss        (%rax),%xmm8
-  .byte  197,58,88,5,158,6,0,0               // vaddss        0x69e(%rip),%xmm8,%xmm8        # 1b04 <_sk_xor__hsw_lowp+0x84>
+  .byte  197,58,88,5,142,6,0,0               // vaddss        0x68e(%rip),%xmm8,%xmm8        # 2188 <_sk_xor__hsw_lowp+0x84>
   .byte  197,121,126,192                     // vmovd         %xmm8,%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
   .byte  196,66,125,121,192                  // vpbroadcastw  %xmm8,%ymm8
   .byte  196,194,125,11,192                  // vpmulhrsw     %ymm8,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
-  .byte  196,98,125,121,13,158,8,0,0         // vpbroadcastw  0x89e(%rip),%ymm9        # 1d24 <_sk_xor__hsw_lowp+0x2a4>
+  .byte  196,98,125,121,13,234,9,0,0         // vpbroadcastw  0x9ea(%rip),%ymm9        # 2504 <_sk_xor__hsw_lowp+0x400>
   .byte  196,65,53,249,200                   // vpsubw        %ymm8,%ymm9,%ymm9
   .byte  196,66,93,11,209                    // vpmulhrsw     %ymm9,%ymm4,%ymm10
   .byte  196,66,125,29,210                   // vpabsw        %ymm10,%ymm10
@@ -41862,15 +43658,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,145,0,0,0                    // jne           1584 <_sk_lerp_u8_hsw_lowp+0x9f>
+  .byte  15,133,145,0,0,0                    // jne           1c18 <_sk_lerp_u8_hsw_lowp+0x9f>
   .byte  196,65,122,111,4,19                 // vmovdqu       (%r11,%rdx,1),%xmm8
   .byte  196,66,125,48,192                   // vpmovzxbw     %xmm8,%ymm8
   .byte  196,193,61,113,240,8                // vpsllw        $0x8,%ymm8,%ymm8
-  .byte  196,98,125,121,13,25,8,0,0          // vpbroadcastw  0x819(%rip),%ymm9        # 1d26 <_sk_xor__hsw_lowp+0x2a6>
+  .byte  196,98,125,121,13,101,9,0,0         // vpbroadcastw  0x965(%rip),%ymm9        # 2506 <_sk_xor__hsw_lowp+0x402>
   .byte  196,65,61,228,193                   // vpmulhuw      %ymm9,%ymm8,%ymm8
   .byte  196,194,125,11,192                  // vpmulhrsw     %ymm8,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
-  .byte  196,98,125,121,13,3,8,0,0           // vpbroadcastw  0x803(%rip),%ymm9        # 1d28 <_sk_xor__hsw_lowp+0x2a8>
+  .byte  196,98,125,121,13,79,9,0,0          // vpbroadcastw  0x94f(%rip),%ymm9        # 2508 <_sk_xor__hsw_lowp+0x404>
   .byte  196,65,53,249,200                   // vpsubw        %ymm8,%ymm9,%ymm9
   .byte  196,66,93,11,209                    // vpmulhrsw     %ymm9,%ymm4,%ymm10
   .byte  196,66,125,29,210                   // vpabsw        %ymm10,%ymm10
@@ -41897,35 +43693,35 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  15,135,92,255,255,255               // ja            14f9 <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  15,135,92,255,255,255               // ja            1b8d <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,204,0,0,0                 // lea           0xcc(%rip),%r10        # 1674 <_sk_lerp_u8_hsw_lowp+0x18f>
+  .byte  76,141,21,204,0,0,0                 // lea           0xcc(%rip),%r10        # 1d08 <_sk_lerp_u8_hsw_lowp+0x18f>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  233,58,255,255,255                  // jmpq          14f9 <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  233,58,255,255,255                  // jmpq          1b8d <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,2,2              // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm8,%xmm8
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,67,57,14,193,1                  // vpblendw      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,25,255,255,255                  // jmpq          14f9 <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  233,25,255,255,255                  // jmpq          1b8d <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,6,6              // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,5,5              // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,4,4              // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,67,57,2,193,1                   // vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,235,254,255,255                 // jmpq          14f9 <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  233,235,254,255,255                 // jmpq          1b8d <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,10,10            // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,9,9              // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,8,8              // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,65,122,126,12,19                // vmovq         (%r11,%rdx,1),%xmm9
   .byte  196,67,49,2,192,12                  // vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  .byte  233,189,254,255,255                 // jmpq          14f9 <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  233,189,254,255,255                 // jmpq          1b8d <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,14,14            // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,13,13            // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm8,%xmm8
@@ -41933,7 +43729,7 @@
   .byte  196,65,122,126,12,19                // vmovq         (%r11,%rdx,1),%xmm9
   .byte  196,67,49,34,76,19,8,2              // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm9,%xmm9
   .byte  196,67,49,2,192,8                   // vpblendd      $0x8,%xmm8,%xmm9,%xmm8
-  .byte  233,135,254,255,255                 // jmpq          14f9 <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  233,135,254,255,255                 // jmpq          1b8d <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  61,255,255,255,88                   // cmp           $0x58ffffff,%eax
   .byte  255                                 // (bad)
@@ -41944,7 +43740,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  121,255                             // jns           1689 <_sk_lerp_u8_hsw_lowp+0x1a4>
+  .byte  121,255                             // jns           1d1d <_sk_lerp_u8_hsw_lowp+0x1a4>
   .byte  255                                 // (bad)
   .byte  255,108,255,255                     // ljmp          *-0x1(%rdi,%rdi,8)
   .byte  255,183,255,255,255,175             // pushq         -0x50000001(%rdi)
@@ -41977,16 +43773,6 @@
   .byte  197,124,41,194                      // vmovaps       %ymm8,%ymm2
   .byte  255,224                             // jmpq          *%rax
 
-HIDDEN _sk_swap_rb_dst_hsw_lowp
-.globl _sk_swap_rb_dst_hsw_lowp
-FUNCTION(_sk_swap_rb_dst_hsw_lowp)
-_sk_swap_rb_dst_hsw_lowp:
-  .byte  197,124,40,196                      // vmovaps       %ymm4,%ymm8
-  .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  197,252,40,230                      // vmovaps       %ymm6,%ymm4
-  .byte  197,124,41,198                      // vmovaps       %ymm8,%ymm6
-  .byte  255,224                             // jmpq          *%rax
-
 HIDDEN _sk_move_src_dst_hsw_lowp
 .globl _sk_move_src_dst_hsw_lowp
 FUNCTION(_sk_move_src_dst_hsw_lowp)
@@ -42026,7 +43812,7 @@
 _sk_srcatop_hsw_lowp:
   .byte  196,226,125,11,199                  // vpmulhrsw     %ymm7,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
-  .byte  196,98,125,121,5,11,6,0,0           // vpbroadcastw  0x60b(%rip),%ymm8        # 1d2a <_sk_xor__hsw_lowp+0x2aa>
+  .byte  196,98,125,121,5,103,7,0,0          // vpbroadcastw  0x767(%rip),%ymm8        # 250a <_sk_xor__hsw_lowp+0x406>
   .byte  197,61,249,195                      // vpsubw        %ymm3,%ymm8,%ymm8
   .byte  196,66,93,11,200                    // vpmulhrsw     %ymm8,%ymm4,%ymm9
   .byte  196,66,125,29,201                   // vpabsw        %ymm9,%ymm9
@@ -42055,7 +43841,7 @@
 _sk_dstatop_hsw_lowp:
   .byte  196,98,93,11,195                    // vpmulhrsw     %ymm3,%ymm4,%ymm8
   .byte  196,66,125,29,192                   // vpabsw        %ymm8,%ymm8
-  .byte  196,98,125,121,13,156,5,0,0         // vpbroadcastw  0x59c(%rip),%ymm9        # 1d2c <_sk_xor__hsw_lowp+0x2ac>
+  .byte  196,98,125,121,13,248,6,0,0         // vpbroadcastw  0x6f8(%rip),%ymm9        # 250c <_sk_xor__hsw_lowp+0x408>
   .byte  197,53,249,207                      // vpsubw        %ymm7,%ymm9,%ymm9
   .byte  196,194,125,11,193                  // vpmulhrsw     %ymm9,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -42112,7 +43898,7 @@
 .globl _sk_srcout_hsw_lowp
 FUNCTION(_sk_srcout_hsw_lowp)
 _sk_srcout_hsw_lowp:
-  .byte  196,98,125,121,5,219,4,0,0          // vpbroadcastw  0x4db(%rip),%ymm8        # 1d2e <_sk_xor__hsw_lowp+0x2ae>
+  .byte  196,98,125,121,5,55,6,0,0           // vpbroadcastw  0x637(%rip),%ymm8        # 250e <_sk_xor__hsw_lowp+0x40a>
   .byte  197,61,249,199                      // vpsubw        %ymm7,%ymm8,%ymm8
   .byte  196,194,125,11,192                  // vpmulhrsw     %ymm8,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -42129,7 +43915,7 @@
 .globl _sk_dstout_hsw_lowp
 FUNCTION(_sk_dstout_hsw_lowp)
 _sk_dstout_hsw_lowp:
-  .byte  196,226,125,121,5,164,4,0,0         // vpbroadcastw  0x4a4(%rip),%ymm0        # 1d30 <_sk_xor__hsw_lowp+0x2b0>
+  .byte  196,226,125,121,5,0,6,0,0           // vpbroadcastw  0x600(%rip),%ymm0        # 2510 <_sk_xor__hsw_lowp+0x40c>
   .byte  197,253,249,219                     // vpsubw        %ymm3,%ymm0,%ymm3
   .byte  196,226,93,11,195                   // vpmulhrsw     %ymm3,%ymm4,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -42146,7 +43932,7 @@
 .globl _sk_srcover_hsw_lowp
 FUNCTION(_sk_srcover_hsw_lowp)
 _sk_srcover_hsw_lowp:
-  .byte  196,98,125,121,5,109,4,0,0          // vpbroadcastw  0x46d(%rip),%ymm8        # 1d32 <_sk_xor__hsw_lowp+0x2b2>
+  .byte  196,98,125,121,5,201,5,0,0          // vpbroadcastw  0x5c9(%rip),%ymm8        # 2512 <_sk_xor__hsw_lowp+0x40e>
   .byte  197,61,249,195                      // vpsubw        %ymm3,%ymm8,%ymm8
   .byte  196,66,93,11,200                    // vpmulhrsw     %ymm8,%ymm4,%ymm9
   .byte  196,66,125,29,201                   // vpabsw        %ymm9,%ymm9
@@ -42167,7 +43953,7 @@
 .globl _sk_dstover_hsw_lowp
 FUNCTION(_sk_dstover_hsw_lowp)
 _sk_dstover_hsw_lowp:
-  .byte  196,98,125,121,5,38,4,0,0           // vpbroadcastw  0x426(%rip),%ymm8        # 1d34 <_sk_xor__hsw_lowp+0x2b4>
+  .byte  196,98,125,121,5,130,5,0,0          // vpbroadcastw  0x582(%rip),%ymm8        # 2514 <_sk_xor__hsw_lowp+0x410>
   .byte  197,61,249,199                      // vpsubw        %ymm7,%ymm8,%ymm8
   .byte  196,194,125,11,192                  // vpmulhrsw     %ymm8,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -42203,7 +43989,7 @@
 .globl _sk_multiply_hsw_lowp
 FUNCTION(_sk_multiply_hsw_lowp)
 _sk_multiply_hsw_lowp:
-  .byte  196,98,125,121,5,179,3,0,0          // vpbroadcastw  0x3b3(%rip),%ymm8        # 1d36 <_sk_xor__hsw_lowp+0x2b6>
+  .byte  196,98,125,121,5,15,5,0,0           // vpbroadcastw  0x50f(%rip),%ymm8        # 2516 <_sk_xor__hsw_lowp+0x412>
   .byte  197,61,249,207                      // vpsubw        %ymm7,%ymm8,%ymm9
   .byte  196,66,125,11,209                   // vpmulhrsw     %ymm9,%ymm0,%ymm10
   .byte  196,66,125,29,210                   // vpabsw        %ymm10,%ymm10
@@ -42245,7 +44031,7 @@
 .globl _sk_screen_hsw_lowp
 FUNCTION(_sk_screen_hsw_lowp)
 _sk_screen_hsw_lowp:
-  .byte  196,98,125,121,5,4,3,0,0            // vpbroadcastw  0x304(%rip),%ymm8        # 1d38 <_sk_xor__hsw_lowp+0x2b8>
+  .byte  196,98,125,121,5,96,4,0,0           // vpbroadcastw  0x460(%rip),%ymm8        # 2518 <_sk_xor__hsw_lowp+0x414>
   .byte  197,61,249,200                      // vpsubw        %ymm0,%ymm8,%ymm9
   .byte  196,98,53,11,204                    // vpmulhrsw     %ymm4,%ymm9,%ymm9
   .byte  196,66,125,29,201                   // vpabsw        %ymm9,%ymm9
@@ -42269,7 +44055,7 @@
 .globl _sk_xor__hsw_lowp
 FUNCTION(_sk_xor__hsw_lowp)
 _sk_xor__hsw_lowp:
-  .byte  196,98,125,121,5,177,2,0,0          // vpbroadcastw  0x2b1(%rip),%ymm8        # 1d3a <_sk_xor__hsw_lowp+0x2ba>
+  .byte  196,98,125,121,5,13,4,0,0           // vpbroadcastw  0x40d(%rip),%ymm8        # 251a <_sk_xor__hsw_lowp+0x416>
   .byte  197,61,249,207                      // vpsubw        %ymm7,%ymm8,%ymm9
   .byte  196,194,125,11,193                  // vpmulhrsw     %ymm9,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -42339,7 +44125,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,17                              // callq         *(%rcx)
-  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a348d <_sk_xor__hsw_lowp+0x1d1a1a0d>
+  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3b0d <_sk_xor__hsw_lowp+0x1d1a1a09>
   .byte  30                                  // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -42430,7 +44216,208 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,17                              // callq         *(%rcx)
-  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a352d <_sk_xor__hsw_lowp+0x1d1a1aad>
+  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3bad <_sk_xor__hsw_lowp+0x1d1a1aa9>
+  .byte  30                                  // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,2                               // incl          (%rdx)
+  .byte  3,6                                 // add           (%rsi),%eax
+  .byte  7                                   // (bad)
+  .byte  10,11                               // or            (%rbx),%cl
+  .byte  14                                  // (bad)
+  .byte  15,255                              // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,18                              // callq         *(%rdx)
+  .byte  19,22                               // adc           (%rsi),%edx
+  .byte  23                                  // (bad)
+  .byte  26,27                               // sbb           (%rbx),%bl
+  .byte  30                                  // (bad)
+  .byte  31                                  // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,3                               // incl          (%rbx)
+  .byte  255,7                               // incl          (%rdi)
+  .byte  255,11                              // decl          (%rbx)
+  .byte  255,15                              // decl          (%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,19                              // callq         *(%rbx)
+  .byte  255,23                              // callq         *(%rdi)
+  .byte  255,27                              // lcall         *(%rbx)
+  .byte  255,31                              // lcall         *(%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,1                                 // add           %al,(%rcx)
+  .byte  4,5                                 // add           $0x5,%al
+  .byte  8,9                                 // or            %cl,(%rcx)
+  .byte  12,13                               // or            $0xd,%al
+  .byte  128,128,128,128,128,128,128         // addb          $0x80,-0x7f7f7f80(%rax)
+  .byte  128,0,1                             // addb          $0x1,(%rax)
+  .byte  4,5                                 // add           $0x5,%al
+  .byte  8,9                                 // or            %cl,(%rcx)
+  .byte  12,13                               // or            $0xd,%al
+  .byte  128,128,128,128,128,128,128         // addb          $0x80,-0x7f7f7f80(%rax)
+  .byte  128,129,128,0,0,0,0                 // addb          $0x0,0x80(%rcx)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  1,2                                 // add           %eax,(%rdx)
+  .byte  5,6,9,10,13                         // add           $0xd0a0906,%eax
+  .byte  14                                  // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,17                              // callq         *(%rcx)
+  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3c6d <_sk_xor__hsw_lowp+0x1d1a1b69>
+  .byte  30                                  // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,2                               // incl          (%rdx)
+  .byte  3,6                                 // add           (%rsi),%eax
+  .byte  7                                   // (bad)
+  .byte  10,11                               // or            (%rbx),%cl
+  .byte  14                                  // (bad)
+  .byte  15,255                              // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,18                              // callq         *(%rdx)
+  .byte  19,22                               // adc           (%rsi),%edx
+  .byte  23                                  // (bad)
+  .byte  26,27                               // sbb           (%rbx),%bl
+  .byte  30                                  // (bad)
+  .byte  31                                  // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,3                               // incl          (%rbx)
+  .byte  255,7                               // incl          (%rdi)
+  .byte  255,11                              // decl          (%rbx)
+  .byte  255,15                              // decl          (%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,19                              // callq         *(%rbx)
+  .byte  255,23                              // callq         *(%rdi)
+  .byte  255,27                              // lcall         *(%rbx)
+  .byte  255,31                              // lcall         *(%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,0                               // incl          (%rax)
+  .byte  1,4,5,8,9,12,13                     // add           %eax,0xd0c0908(,%rax,1)
+  .byte  128,128,128,128,128,128,128         // addb          $0x80,-0x7f7f7f80(%rax)
+  .byte  128,0,1                             // addb          $0x1,(%rax)
+  .byte  4,5                                 // add           $0x5,%al
+  .byte  8,9                                 // or            %cl,(%rcx)
+  .byte  12,13                               // or            $0xd,%al
+  .byte  128,128,128,128,128,128,128         // addb          $0x80,-0x7f7f7f80(%rax)
+  .byte  128,129,128,0,0,0,0                 // addb          $0x0,0x80(%rcx)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  1,2                                 // add           %eax,(%rdx)
+  .byte  5,6,9,10,13                         // add           $0xd0a0906,%eax
+  .byte  14                                  // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,17                              // callq         *(%rcx)
+  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3d0d <_sk_xor__hsw_lowp+0x1d1a1c09>
   .byte  30                                  // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -42532,7 +44519,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,17                              // callq         *(%rcx)
-  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a35ed <_sk_xor__hsw_lowp+0x1d1a1b6d>
+  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3dcd <_sk_xor__hsw_lowp+0x1d1a1cc9>
   .byte  30                                  // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -42665,7 +44652,7 @@
 _sk_constant_color_ssse3_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,24                            // movups        (%rax),%xmm3
-  .byte  15,88,29,115,21,0,0                 // addps         0x1573(%rip),%xmm3        # 1600 <_sk_xor__ssse3_lowp+0xa8>
+  .byte  15,88,29,179,25,0,0                 // addps         0x19b3(%rip),%xmm3        # 1a40 <_sk_xor__ssse3_lowp+0x9f>
   .byte  242,15,112,195,0                    // pshuflw       $0x0,%xmm3,%xmm0
   .byte  102,15,112,192,80                   // pshufd        $0x50,%xmm0,%xmm0
   .byte  242,15,112,203,170                  // pshuflw       $0xaa,%xmm3,%xmm1
@@ -42682,7 +44669,7 @@
 FUNCTION(_sk_set_rgb_ssse3_lowp)
 _sk_set_rgb_ssse3_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  243,15,16,21,189,23,0,0             // movss         0x17bd(%rip),%xmm2        # 1880 <_sk_xor__ssse3_lowp+0x328>
+  .byte  243,15,16,21,173,28,0,0             // movss         0x1cad(%rip),%xmm2        # 1d70 <_sk_xor__ssse3_lowp+0x3cf>
   .byte  243,15,16,0                         // movss         (%rax),%xmm0
   .byte  243,15,88,194                       // addss         %xmm2,%xmm0
   .byte  102,65,15,126,193                   // movd          %xmm0,%r9d
@@ -42726,16 +44713,16 @@
   .byte  15,133,191,0,0,0                    // jne           206 <_sk_load_8888_ssse3_lowp+0xcd>
   .byte  69,15,16,68,147,16                  // movups        0x10(%r11,%rdx,4),%xmm8
   .byte  102,65,15,16,28,147                 // movupd        (%r11,%rdx,4),%xmm3
-  .byte  102,15,111,13,181,20,0,0            // movdqa        0x14b5(%rip),%xmm1        # 1610 <_sk_xor__ssse3_lowp+0xb8>
+  .byte  102,15,111,13,245,24,0,0            // movdqa        0x18f5(%rip),%xmm1        # 1a50 <_sk_xor__ssse3_lowp+0xaf>
   .byte  102,15,40,195                       // movapd        %xmm3,%xmm0
   .byte  102,15,56,0,193                     // pshufb        %xmm1,%xmm0
   .byte  102,65,15,111,208                   // movdqa        %xmm8,%xmm2
   .byte  102,15,56,0,209                     // pshufb        %xmm1,%xmm2
   .byte  102,15,108,194                      // punpcklqdq    %xmm2,%xmm0
   .byte  102,15,113,240,8                    // psllw         $0x8,%xmm0
-  .byte  102,68,15,111,13,160,20,0,0         // movdqa        0x14a0(%rip),%xmm9        # 1620 <_sk_xor__ssse3_lowp+0xc8>
+  .byte  102,68,15,111,13,224,24,0,0         // movdqa        0x18e0(%rip),%xmm9        # 1a60 <_sk_xor__ssse3_lowp+0xbf>
   .byte  102,65,15,228,193                   // pmulhuw       %xmm9,%xmm0
-  .byte  102,68,15,111,21,162,20,0,0         // movdqa        0x14a2(%rip),%xmm10        # 1630 <_sk_xor__ssse3_lowp+0xd8>
+  .byte  102,68,15,111,21,226,24,0,0         // movdqa        0x18e2(%rip),%xmm10        # 1a70 <_sk_xor__ssse3_lowp+0xcf>
   .byte  102,15,40,203                       // movapd        %xmm3,%xmm1
   .byte  102,65,15,56,0,202                  // pshufb        %xmm10,%xmm1
   .byte  102,65,15,111,208                   // movdqa        %xmm8,%xmm2
@@ -42743,7 +44730,7 @@
   .byte  102,15,108,202                      // punpcklqdq    %xmm2,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
   .byte  102,65,15,228,201                   // pmulhuw       %xmm9,%xmm1
-  .byte  102,68,15,111,21,134,20,0,0         // movdqa        0x1486(%rip),%xmm10        # 1640 <_sk_xor__ssse3_lowp+0xe8>
+  .byte  102,68,15,111,21,198,24,0,0         // movdqa        0x18c6(%rip),%xmm10        # 1a80 <_sk_xor__ssse3_lowp+0xdf>
   .byte  102,15,40,211                       // movapd        %xmm3,%xmm2
   .byte  102,65,15,56,0,210                  // pshufb        %xmm10,%xmm2
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
@@ -42751,7 +44738,7 @@
   .byte  102,65,15,108,211                   // punpcklqdq    %xmm11,%xmm2
   .byte  102,15,113,242,8                    // psllw         $0x8,%xmm2
   .byte  102,65,15,228,209                   // pmulhuw       %xmm9,%xmm2
-  .byte  102,68,15,111,21,105,20,0,0         // movdqa        0x1469(%rip),%xmm10        # 1650 <_sk_xor__ssse3_lowp+0xf8>
+  .byte  102,68,15,111,21,169,24,0,0         // movdqa        0x18a9(%rip),%xmm10        # 1a90 <_sk_xor__ssse3_lowp+0xef>
   .byte  102,65,15,56,0,218                  // pshufb        %xmm10,%xmm3
   .byte  102,69,15,56,0,194                  // pshufb        %xmm10,%xmm8
   .byte  102,65,15,108,216                   // punpcklqdq    %xmm8,%xmm3
@@ -42817,16 +44804,16 @@
   .byte  15,133,191,0,0,0                    // jne           375 <_sk_load_8888_dst_ssse3_lowp+0xcd>
   .byte  69,15,16,68,147,16                  // movups        0x10(%r11,%rdx,4),%xmm8
   .byte  102,65,15,16,60,147                 // movupd        (%r11,%rdx,4),%xmm7
-  .byte  102,15,111,45,150,19,0,0            // movdqa        0x1396(%rip),%xmm5        # 1660 <_sk_xor__ssse3_lowp+0x108>
+  .byte  102,15,111,45,214,23,0,0            // movdqa        0x17d6(%rip),%xmm5        # 1aa0 <_sk_xor__ssse3_lowp+0xff>
   .byte  102,15,40,231                       // movapd        %xmm7,%xmm4
   .byte  102,15,56,0,229                     // pshufb        %xmm5,%xmm4
   .byte  102,65,15,111,240                   // movdqa        %xmm8,%xmm6
   .byte  102,15,56,0,245                     // pshufb        %xmm5,%xmm6
   .byte  102,15,108,230                      // punpcklqdq    %xmm6,%xmm4
   .byte  102,15,113,244,8                    // psllw         $0x8,%xmm4
-  .byte  102,68,15,111,13,129,19,0,0         // movdqa        0x1381(%rip),%xmm9        # 1670 <_sk_xor__ssse3_lowp+0x118>
+  .byte  102,68,15,111,13,193,23,0,0         // movdqa        0x17c1(%rip),%xmm9        # 1ab0 <_sk_xor__ssse3_lowp+0x10f>
   .byte  102,65,15,228,225                   // pmulhuw       %xmm9,%xmm4
-  .byte  102,68,15,111,21,131,19,0,0         // movdqa        0x1383(%rip),%xmm10        # 1680 <_sk_xor__ssse3_lowp+0x128>
+  .byte  102,68,15,111,21,195,23,0,0         // movdqa        0x17c3(%rip),%xmm10        # 1ac0 <_sk_xor__ssse3_lowp+0x11f>
   .byte  102,15,40,239                       // movapd        %xmm7,%xmm5
   .byte  102,65,15,56,0,234                  // pshufb        %xmm10,%xmm5
   .byte  102,65,15,111,240                   // movdqa        %xmm8,%xmm6
@@ -42834,7 +44821,7 @@
   .byte  102,15,108,238                      // punpcklqdq    %xmm6,%xmm5
   .byte  102,15,113,245,8                    // psllw         $0x8,%xmm5
   .byte  102,65,15,228,233                   // pmulhuw       %xmm9,%xmm5
-  .byte  102,68,15,111,21,103,19,0,0         // movdqa        0x1367(%rip),%xmm10        # 1690 <_sk_xor__ssse3_lowp+0x138>
+  .byte  102,68,15,111,21,167,23,0,0         // movdqa        0x17a7(%rip),%xmm10        # 1ad0 <_sk_xor__ssse3_lowp+0x12f>
   .byte  102,15,40,247                       // movapd        %xmm7,%xmm6
   .byte  102,65,15,56,0,242                  // pshufb        %xmm10,%xmm6
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
@@ -42842,7 +44829,7 @@
   .byte  102,65,15,108,243                   // punpcklqdq    %xmm11,%xmm6
   .byte  102,15,113,246,8                    // psllw         $0x8,%xmm6
   .byte  102,65,15,228,241                   // pmulhuw       %xmm9,%xmm6
-  .byte  102,68,15,111,21,74,19,0,0          // movdqa        0x134a(%rip),%xmm10        # 16a0 <_sk_xor__ssse3_lowp+0x148>
+  .byte  102,68,15,111,21,138,23,0,0         // movdqa        0x178a(%rip),%xmm10        # 1ae0 <_sk_xor__ssse3_lowp+0x13f>
   .byte  102,65,15,56,0,250                  // pshufb        %xmm10,%xmm7
   .byte  102,69,15,56,0,194                  // pshufb        %xmm10,%xmm8
   .byte  102,65,15,108,248                   // punpcklqdq    %xmm8,%xmm7
@@ -42907,7 +44894,7 @@
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  102,68,15,111,192                   // movdqa        %xmm0,%xmm8
   .byte  102,65,15,113,208,7                 // psrlw         $0x7,%xmm8
-  .byte  102,68,15,111,21,127,18,0,0         // movdqa        0x127f(%rip),%xmm10        # 16b0 <_sk_xor__ssse3_lowp+0x158>
+  .byte  102,68,15,111,21,191,22,0,0         // movdqa        0x16bf(%rip),%xmm10        # 1af0 <_sk_xor__ssse3_lowp+0x14f>
   .byte  102,69,15,234,194                   // pminsw        %xmm10,%xmm8
   .byte  102,69,15,239,219                   // pxor          %xmm11,%xmm11
   .byte  102,69,15,111,232                   // movdqa        %xmm8,%xmm13
@@ -42994,6 +44981,286 @@
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
 
+HIDDEN _sk_load_bgra_ssse3_lowp
+.globl _sk_load_bgra_ssse3_lowp
+FUNCTION(_sk_load_bgra_ssse3_lowp)
+_sk_load_bgra_ssse3_lowp:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,139,24                           // mov           (%rax),%r11
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  15,133,191,0,0,0                    // jne           655 <_sk_load_bgra_ssse3_lowp+0xcd>
+  .byte  69,15,16,68,147,16                  // movups        0x10(%r11,%rdx,4),%xmm8
+  .byte  102,65,15,16,28,147                 // movupd        (%r11,%rdx,4),%xmm3
+  .byte  102,15,111,5,86,21,0,0              // movdqa        0x1556(%rip),%xmm0        # 1b00 <_sk_xor__ssse3_lowp+0x15f>
+  .byte  102,15,40,211                       // movapd        %xmm3,%xmm2
+  .byte  102,15,56,0,208                     // pshufb        %xmm0,%xmm2
+  .byte  102,65,15,111,200                   // movdqa        %xmm8,%xmm1
+  .byte  102,15,56,0,200                     // pshufb        %xmm0,%xmm1
+  .byte  102,15,108,209                      // punpcklqdq    %xmm1,%xmm2
+  .byte  102,15,113,242,8                    // psllw         $0x8,%xmm2
+  .byte  102,68,15,111,13,65,21,0,0          // movdqa        0x1541(%rip),%xmm9        # 1b10 <_sk_xor__ssse3_lowp+0x16f>
+  .byte  102,65,15,228,209                   // pmulhuw       %xmm9,%xmm2
+  .byte  102,68,15,111,21,67,21,0,0          // movdqa        0x1543(%rip),%xmm10        # 1b20 <_sk_xor__ssse3_lowp+0x17f>
+  .byte  102,15,40,203                       // movapd        %xmm3,%xmm1
+  .byte  102,65,15,56,0,202                  // pshufb        %xmm10,%xmm1
+  .byte  102,65,15,111,192                   // movdqa        %xmm8,%xmm0
+  .byte  102,65,15,56,0,194                  // pshufb        %xmm10,%xmm0
+  .byte  102,15,108,200                      // punpcklqdq    %xmm0,%xmm1
+  .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
+  .byte  102,65,15,228,201                   // pmulhuw       %xmm9,%xmm1
+  .byte  102,68,15,111,21,39,21,0,0          // movdqa        0x1527(%rip),%xmm10        # 1b30 <_sk_xor__ssse3_lowp+0x18f>
+  .byte  102,15,40,195                       // movapd        %xmm3,%xmm0
+  .byte  102,65,15,56,0,194                  // pshufb        %xmm10,%xmm0
+  .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
+  .byte  102,69,15,56,0,218                  // pshufb        %xmm10,%xmm11
+  .byte  102,65,15,108,195                   // punpcklqdq    %xmm11,%xmm0
+  .byte  102,15,113,240,8                    // psllw         $0x8,%xmm0
+  .byte  102,65,15,228,193                   // pmulhuw       %xmm9,%xmm0
+  .byte  102,68,15,111,21,10,21,0,0          // movdqa        0x150a(%rip),%xmm10        # 1b40 <_sk_xor__ssse3_lowp+0x19f>
+  .byte  102,65,15,56,0,218                  // pshufb        %xmm10,%xmm3
+  .byte  102,69,15,56,0,194                  // pshufb        %xmm10,%xmm8
+  .byte  102,65,15,108,216                   // punpcklqdq    %xmm8,%xmm3
+  .byte  102,15,113,243,8                    // psllw         $0x8,%xmm3
+  .byte  102,65,15,228,217                   // pmulhuw       %xmm9,%xmm3
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,7                        // and           $0x7,%r9b
+  .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
+  .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
+  .byte  65,254,201                          // dec           %r9b
+  .byte  65,128,249,6                        // cmp           $0x6,%r9b
+  .byte  15,135,48,255,255,255               // ja            5a2 <_sk_load_bgra_ssse3_lowp+0x1a>
+  .byte  69,15,182,201                       // movzbl        %r9b,%r9d
+  .byte  76,141,21,95,0,0,0                  // lea           0x5f(%rip),%r10        # 6dc <_sk_load_bgra_ssse3_lowp+0x154>
+  .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
+  .byte  76,1,208                            // add           %r10,%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  243,65,15,16,28,147                 // movss         (%r11,%rdx,4),%xmm3
+  .byte  233,17,255,255,255                  // jmpq          5a2 <_sk_load_bgra_ssse3_lowp+0x1a>
+  .byte  102,65,15,110,68,147,8              // movd          0x8(%r11,%rdx,4),%xmm0
+  .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
+  .byte  102,65,15,18,28,147                 // movlpd        (%r11,%rdx,4),%xmm3
+  .byte  233,250,254,255,255                 // jmpq          5a2 <_sk_load_bgra_ssse3_lowp+0x1a>
+  .byte  102,65,15,110,68,147,24             // movd          0x18(%r11,%rdx,4),%xmm0
+  .byte  102,68,15,112,192,69                // pshufd        $0x45,%xmm0,%xmm8
+  .byte  243,65,15,16,68,147,20              // movss         0x14(%r11,%rdx,4),%xmm0
+  .byte  65,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm0
+  .byte  65,15,198,192,226                   // shufps        $0xe2,%xmm8,%xmm0
+  .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
+  .byte  243,65,15,16,68,147,16              // movss         0x10(%r11,%rdx,4),%xmm0
+  .byte  243,68,15,16,192                    // movss         %xmm0,%xmm8
+  .byte  233,193,254,255,255                 // jmpq          59c <_sk_load_bgra_ssse3_lowp+0x14>
+  .byte  144                                 // nop
+  .byte  170                                 // stos          %al,%es:(%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,193                             // inc           %ecx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,181,255,255,255,192             // pushq         -0x3f000001(%rbp)
+  .byte  254                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  238                                 // out           %al,(%dx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  217,255                             // fcos
+  .byte  255                                 // (bad)
+  .byte  255,204                             // dec           %esp
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // .byte         0xff
+
+HIDDEN _sk_load_bgra_dst_ssse3_lowp
+.globl _sk_load_bgra_dst_ssse3_lowp
+FUNCTION(_sk_load_bgra_dst_ssse3_lowp)
+_sk_load_bgra_dst_ssse3_lowp:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,139,24                           // mov           (%rax),%r11
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  15,133,191,0,0,0                    // jne           7c5 <_sk_load_bgra_dst_ssse3_lowp+0xcd>
+  .byte  69,15,16,68,147,16                  // movups        0x10(%r11,%rdx,4),%xmm8
+  .byte  102,65,15,16,60,147                 // movupd        (%r11,%rdx,4),%xmm7
+  .byte  102,15,111,37,54,20,0,0             // movdqa        0x1436(%rip),%xmm4        # 1b50 <_sk_xor__ssse3_lowp+0x1af>
+  .byte  102,15,40,247                       // movapd        %xmm7,%xmm6
+  .byte  102,15,56,0,244                     // pshufb        %xmm4,%xmm6
+  .byte  102,65,15,111,232                   // movdqa        %xmm8,%xmm5
+  .byte  102,15,56,0,236                     // pshufb        %xmm4,%xmm5
+  .byte  102,15,108,245                      // punpcklqdq    %xmm5,%xmm6
+  .byte  102,15,113,246,8                    // psllw         $0x8,%xmm6
+  .byte  102,68,15,111,13,33,20,0,0          // movdqa        0x1421(%rip),%xmm9        # 1b60 <_sk_xor__ssse3_lowp+0x1bf>
+  .byte  102,65,15,228,241                   // pmulhuw       %xmm9,%xmm6
+  .byte  102,68,15,111,21,35,20,0,0          // movdqa        0x1423(%rip),%xmm10        # 1b70 <_sk_xor__ssse3_lowp+0x1cf>
+  .byte  102,15,40,239                       // movapd        %xmm7,%xmm5
+  .byte  102,65,15,56,0,234                  // pshufb        %xmm10,%xmm5
+  .byte  102,65,15,111,224                   // movdqa        %xmm8,%xmm4
+  .byte  102,65,15,56,0,226                  // pshufb        %xmm10,%xmm4
+  .byte  102,15,108,236                      // punpcklqdq    %xmm4,%xmm5
+  .byte  102,15,113,245,8                    // psllw         $0x8,%xmm5
+  .byte  102,65,15,228,233                   // pmulhuw       %xmm9,%xmm5
+  .byte  102,68,15,111,21,7,20,0,0           // movdqa        0x1407(%rip),%xmm10        # 1b80 <_sk_xor__ssse3_lowp+0x1df>
+  .byte  102,15,40,231                       // movapd        %xmm7,%xmm4
+  .byte  102,65,15,56,0,226                  // pshufb        %xmm10,%xmm4
+  .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
+  .byte  102,69,15,56,0,218                  // pshufb        %xmm10,%xmm11
+  .byte  102,65,15,108,227                   // punpcklqdq    %xmm11,%xmm4
+  .byte  102,15,113,244,8                    // psllw         $0x8,%xmm4
+  .byte  102,65,15,228,225                   // pmulhuw       %xmm9,%xmm4
+  .byte  102,68,15,111,21,234,19,0,0         // movdqa        0x13ea(%rip),%xmm10        # 1b90 <_sk_xor__ssse3_lowp+0x1ef>
+  .byte  102,65,15,56,0,250                  // pshufb        %xmm10,%xmm7
+  .byte  102,69,15,56,0,194                  // pshufb        %xmm10,%xmm8
+  .byte  102,65,15,108,248                   // punpcklqdq    %xmm8,%xmm7
+  .byte  102,15,113,247,8                    // psllw         $0x8,%xmm7
+  .byte  102,65,15,228,249                   // pmulhuw       %xmm9,%xmm7
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,7                        // and           $0x7,%r9b
+  .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
+  .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
+  .byte  65,254,201                          // dec           %r9b
+  .byte  65,128,249,6                        // cmp           $0x6,%r9b
+  .byte  15,135,48,255,255,255               // ja            712 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  .byte  69,15,182,201                       // movzbl        %r9b,%r9d
+  .byte  76,141,21,95,0,0,0                  // lea           0x5f(%rip),%r10        # 84c <_sk_load_bgra_dst_ssse3_lowp+0x154>
+  .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
+  .byte  76,1,208                            // add           %r10,%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  243,65,15,16,60,147                 // movss         (%r11,%rdx,4),%xmm7
+  .byte  233,17,255,255,255                  // jmpq          712 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  .byte  102,65,15,110,100,147,8             // movd          0x8(%r11,%rdx,4),%xmm4
+  .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
+  .byte  102,65,15,18,60,147                 // movlpd        (%r11,%rdx,4),%xmm7
+  .byte  233,250,254,255,255                 // jmpq          712 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  .byte  102,65,15,110,100,147,24            // movd          0x18(%r11,%rdx,4),%xmm4
+  .byte  102,68,15,112,196,69                // pshufd        $0x45,%xmm4,%xmm8
+  .byte  243,65,15,16,100,147,20             // movss         0x14(%r11,%rdx,4),%xmm4
+  .byte  65,15,198,224,0                     // shufps        $0x0,%xmm8,%xmm4
+  .byte  65,15,198,224,226                   // shufps        $0xe2,%xmm8,%xmm4
+  .byte  68,15,40,196                        // movaps        %xmm4,%xmm8
+  .byte  243,65,15,16,100,147,16             // movss         0x10(%r11,%rdx,4),%xmm4
+  .byte  243,68,15,16,196                    // movss         %xmm4,%xmm8
+  .byte  233,193,254,255,255                 // jmpq          70c <_sk_load_bgra_dst_ssse3_lowp+0x14>
+  .byte  144                                 // nop
+  .byte  170                                 // stos          %al,%es:(%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,193                             // inc           %ecx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,181,255,255,255,192             // pushq         -0x3f000001(%rbp)
+  .byte  254                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  238                                 // out           %al,(%dx)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  217,255                             // fcos
+  .byte  255                                 // (bad)
+  .byte  255,204                             // dec           %esp
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // .byte         0xff
+
+HIDDEN _sk_store_bgra_ssse3_lowp
+.globl _sk_store_bgra_ssse3_lowp
+FUNCTION(_sk_store_bgra_ssse3_lowp)
+_sk_store_bgra_ssse3_lowp:
+  .byte  15,41,124,36,232                    // movaps        %xmm7,-0x18(%rsp)
+  .byte  102,68,15,111,210                   // movdqa        %xmm2,%xmm10
+  .byte  102,65,15,113,210,7                 // psrlw         $0x7,%xmm10
+  .byte  102,68,15,111,13,31,19,0,0          // movdqa        0x131f(%rip),%xmm9        # 1ba0 <_sk_xor__ssse3_lowp+0x1ff>
+  .byte  102,69,15,234,209                   // pminsw        %xmm9,%xmm10
+  .byte  102,69,15,239,246                   // pxor          %xmm14,%xmm14
+  .byte  102,65,15,111,250                   // movdqa        %xmm10,%xmm7
+  .byte  102,65,15,97,254                    // punpcklwd     %xmm14,%xmm7
+  .byte  102,69,15,105,214                   // punpckhwd     %xmm14,%xmm10
+  .byte  102,68,15,111,225                   // movdqa        %xmm1,%xmm12
+  .byte  102,65,15,113,212,7                 // psrlw         $0x7,%xmm12
+  .byte  102,69,15,234,225                   // pminsw        %xmm9,%xmm12
+  .byte  102,69,15,111,236                   // movdqa        %xmm12,%xmm13
+  .byte  102,69,15,97,238                    // punpcklwd     %xmm14,%xmm13
+  .byte  102,69,15,105,230                   // punpckhwd     %xmm14,%xmm12
+  .byte  102,68,15,111,248                   // movdqa        %xmm0,%xmm15
+  .byte  102,65,15,113,215,7                 // psrlw         $0x7,%xmm15
+  .byte  102,69,15,234,249                   // pminsw        %xmm9,%xmm15
+  .byte  102,68,15,111,195                   // movdqa        %xmm3,%xmm8
+  .byte  102,65,15,113,208,7                 // psrlw         $0x7,%xmm8
+  .byte  102,69,15,234,193                   // pminsw        %xmm9,%xmm8
+  .byte  102,69,15,111,207                   // movdqa        %xmm15,%xmm9
+  .byte  102,69,15,105,206                   // punpckhwd     %xmm14,%xmm9
+  .byte  102,69,15,97,254                    // punpcklwd     %xmm14,%xmm15
+  .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
+  .byte  102,69,15,105,222                   // punpckhwd     %xmm14,%xmm11
+  .byte  102,69,15,97,198                    // punpcklwd     %xmm14,%xmm8
+  .byte  102,65,15,114,241,16                // pslld         $0x10,%xmm9
+  .byte  102,69,15,235,202                   // por           %xmm10,%xmm9
+  .byte  102,65,15,114,247,16                // pslld         $0x10,%xmm15
+  .byte  102,68,15,235,255                   // por           %xmm7,%xmm15
+  .byte  102,65,15,114,244,8                 // pslld         $0x8,%xmm12
+  .byte  102,65,15,114,243,24                // pslld         $0x18,%xmm11
+  .byte  102,69,15,235,220                   // por           %xmm12,%xmm11
+  .byte  102,69,15,235,217                   // por           %xmm9,%xmm11
+  .byte  102,65,15,114,245,8                 // pslld         $0x8,%xmm13
+  .byte  102,65,15,114,240,24                // pslld         $0x18,%xmm8
+  .byte  102,69,15,235,197                   // por           %xmm13,%xmm8
+  .byte  102,69,15,235,199                   // por           %xmm15,%xmm8
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  76,139,24                           // mov           (%rax),%r11
+  .byte  77,133,192                          // test          %r8,%r8
+  .byte  117,22                              // jne           959 <_sk_store_bgra_ssse3_lowp+0xf1>
+  .byte  243,69,15,127,4,147                 // movdqu        %xmm8,(%r11,%rdx,4)
+  .byte  243,69,15,127,92,147,16             // movdqu        %xmm11,0x10(%r11,%rdx,4)
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  15,40,124,36,232                    // movaps        -0x18(%rsp),%xmm7
+  .byte  255,224                             // jmpq          *%rax
+  .byte  69,137,193                          // mov           %r8d,%r9d
+  .byte  65,128,225,7                        // and           $0x7,%r9b
+  .byte  65,254,201                          // dec           %r9b
+  .byte  65,128,249,6                        // cmp           $0x6,%r9b
+  .byte  119,231                             // ja            950 <_sk_store_bgra_ssse3_lowp+0xe8>
+  .byte  69,15,182,201                       // movzbl        %r9b,%r9d
+  .byte  76,141,21,80,0,0,0                  // lea           0x50(%rip),%r10        # 9c4 <_sk_store_bgra_ssse3_lowp+0x15c>
+  .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
+  .byte  76,1,208                            // add           %r10,%rax
+  .byte  255,224                             // jmpq          *%rax
+  .byte  102,69,15,126,4,147                 // movd          %xmm8,(%r11,%rdx,4)
+  .byte  235,203                             // jmp           950 <_sk_store_bgra_ssse3_lowp+0xe8>
+  .byte  102,65,15,112,248,78                // pshufd        $0x4e,%xmm8,%xmm7
+  .byte  102,65,15,126,124,147,8             // movd          %xmm7,0x8(%r11,%rdx,4)
+  .byte  102,69,15,214,4,147                 // movq          %xmm8,(%r11,%rdx,4)
+  .byte  235,182                             // jmp           950 <_sk_store_bgra_ssse3_lowp+0xe8>
+  .byte  102,65,15,112,251,78                // pshufd        $0x4e,%xmm11,%xmm7
+  .byte  102,65,15,126,124,147,24            // movd          %xmm7,0x18(%r11,%rdx,4)
+  .byte  102,65,15,112,251,229               // pshufd        $0xe5,%xmm11,%xmm7
+  .byte  102,65,15,126,124,147,20            // movd          %xmm7,0x14(%r11,%rdx,4)
+  .byte  102,69,15,126,92,147,16             // movd          %xmm11,0x10(%r11,%rdx,4)
+  .byte  243,69,15,127,4,147                 // movdqu        %xmm8,(%r11,%rdx,4)
+  .byte  235,141                             // jmp           950 <_sk_store_bgra_ssse3_lowp+0xe8>
+  .byte  144                                 // nop
+  .byte  185,255,255,255,206                 // mov           $0xceffffff,%ecx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,193                             // inc           %ecx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,247                             // push          %rdi
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,240                             // push          %rax
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,227                             // jmpq          *%rbx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,214                             // callq         *%rsi
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // .byte         0xff
+
 HIDDEN _sk_load_a8_ssse3_lowp
 .globl _sk_load_a8_ssse3_lowp
 FUNCTION(_sk_load_a8_ssse3_lowp)
@@ -43001,11 +45268,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,37                              // jne           5b7 <_sk_load_a8_ssse3_lowp+0x2f>
+  .byte  117,37                              // jne           a0f <_sk_load_a8_ssse3_lowp+0x2f>
   .byte  243,65,15,126,28,19                 // movq          (%r11,%rdx,1),%xmm3
   .byte  102,15,96,216                       // punpcklbw     %xmm0,%xmm3
   .byte  102,15,113,243,8                    // psllw         $0x8,%xmm3
-  .byte  102,15,228,29,23,17,0,0             // pmulhuw       0x1117(%rip),%xmm3        # 16c0 <_sk_xor__ssse3_lowp+0x168>
+  .byte  102,15,228,29,175,17,0,0            // pmulhuw       0x11af(%rip),%xmm3        # 1bb0 <_sk_xor__ssse3_lowp+0x20f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  102,15,87,192                       // xorpd         %xmm0,%xmm0
   .byte  15,87,201                           // xorps         %xmm1,%xmm1
@@ -43016,15 +45283,15 @@
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,209                             // ja            59c <_sk_load_a8_ssse3_lowp+0x14>
+  .byte  119,209                             // ja            9f4 <_sk_load_a8_ssse3_lowp+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,110,0,0,0                 // lea           0x6e(%rip),%r10        # 644 <_sk_load_a8_ssse3_lowp+0xbc>
+  .byte  76,141,21,110,0,0,0                 // lea           0x6e(%rip),%r10        # a9c <_sk_load_a8_ssse3_lowp+0xbc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,15,110,216                      // movd          %eax,%xmm3
-  .byte  235,178                             // jmp           59c <_sk_load_a8_ssse3_lowp+0x14>
+  .byte  235,178                             // jmp           9f4 <_sk_load_a8_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,196,216,2                    // pinsrw        $0x2,%eax,%xmm3
@@ -43032,7 +45299,7 @@
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  243,15,16,216                       // movss         %xmm0,%xmm3
-  .byte  235,144                             // jmp           59c <_sk_load_a8_ssse3_lowp+0x14>
+  .byte  235,144                             // jmp           9f4 <_sk_load_a8_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,196,216,6                    // pinsrw        $0x6,%eax,%xmm3
@@ -43043,7 +45310,7 @@
   .byte  102,65,15,110,4,19                  // movd          (%r11,%rdx,1),%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  242,15,16,216                       // movsd         %xmm0,%xmm3
-  .byte  233,88,255,255,255                  // jmpq          59c <_sk_load_a8_ssse3_lowp+0x14>
+  .byte  233,88,255,255,255                  // jmpq          9f4 <_sk_load_a8_ssse3_lowp+0x14>
   .byte  155                                 // fwait
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -43072,11 +45339,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,37                              // jne           68f <_sk_load_a8_dst_ssse3_lowp+0x2f>
+  .byte  117,37                              // jne           ae7 <_sk_load_a8_dst_ssse3_lowp+0x2f>
   .byte  243,65,15,126,60,19                 // movq          (%r11,%rdx,1),%xmm7
   .byte  102,15,96,248                       // punpcklbw     %xmm0,%xmm7
   .byte  102,15,113,247,8                    // psllw         $0x8,%xmm7
-  .byte  102,15,228,61,79,16,0,0             // pmulhuw       0x104f(%rip),%xmm7        # 16d0 <_sk_xor__ssse3_lowp+0x178>
+  .byte  102,15,228,61,231,16,0,0            // pmulhuw       0x10e7(%rip),%xmm7        # 1bc0 <_sk_xor__ssse3_lowp+0x21f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  102,15,87,228                       // xorpd         %xmm4,%xmm4
   .byte  15,87,237                           // xorps         %xmm5,%xmm5
@@ -43087,15 +45354,15 @@
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,209                             // ja            674 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  .byte  119,209                             // ja            acc <_sk_load_a8_dst_ssse3_lowp+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,110,0,0,0                 // lea           0x6e(%rip),%r10        # 71c <_sk_load_a8_dst_ssse3_lowp+0xbc>
+  .byte  76,141,21,110,0,0,0                 // lea           0x6e(%rip),%r10        # b74 <_sk_load_a8_dst_ssse3_lowp+0xbc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,15,110,248                      // movd          %eax,%xmm7
-  .byte  235,178                             // jmp           674 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  .byte  235,178                             // jmp           acc <_sk_load_a8_dst_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  102,15,196,248,2                    // pinsrw        $0x2,%eax,%xmm7
@@ -43103,7 +45370,7 @@
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  243,15,16,252                       // movss         %xmm4,%xmm7
-  .byte  235,144                             // jmp           674 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  .byte  235,144                             // jmp           acc <_sk_load_a8_dst_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  102,15,196,248,6                    // pinsrw        $0x6,%eax,%xmm7
@@ -43114,7 +45381,7 @@
   .byte  102,65,15,110,36,19                 // movd          (%r11,%rdx,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  242,15,16,252                       // movsd         %xmm4,%xmm7
-  .byte  233,88,255,255,255                  // jmpq          674 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  .byte  233,88,255,255,255                  // jmpq          acc <_sk_load_a8_dst_ssse3_lowp+0x14>
   .byte  155                                 // fwait
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -43146,7 +45413,7 @@
   .byte  102,65,15,113,208,7                 // psrlw         $0x7,%xmm8
   .byte  102,69,15,103,192                   // packuswb      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           75c <_sk_store_a8_ssse3_lowp+0x24>
+  .byte  117,10                              // jne           bb4 <_sk_store_a8_ssse3_lowp+0x24>
   .byte  242,69,15,17,4,19                   // movsd         %xmm8,(%r11,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -43154,24 +45421,24 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            758 <_sk_store_a8_ssse3_lowp+0x20>
+  .byte  119,236                             // ja            bb0 <_sk_store_a8_ssse3_lowp+0x20>
   .byte  102,68,15,96,192                    // punpcklbw     %xmm0,%xmm8
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,136,0,0,0                 // lea           0x88(%rip),%r10        # 804 <_sk_store_a8_ssse3_lowp+0xcc>
+  .byte  76,141,21,136,0,0,0                 // lea           0x88(%rip),%r10        # c5c <_sk_store_a8_ssse3_lowp+0xcc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  102,68,15,127,68,36,168             // movdqa        %xmm8,-0x58(%rsp)
   .byte  138,68,36,168                       // mov           -0x58(%rsp),%al
   .byte  65,136,4,19                         // mov           %al,(%r11,%rdx,1)
-  .byte  235,194                             // jmp           758 <_sk_store_a8_ssse3_lowp+0x20>
+  .byte  235,194                             // jmp           bb0 <_sk_store_a8_ssse3_lowp+0x20>
   .byte  102,68,15,127,68,36,184             // movdqa        %xmm8,-0x48(%rsp)
   .byte  138,68,36,188                       // mov           -0x44(%rsp),%al
   .byte  65,136,68,19,2                      // mov           %al,0x2(%r11,%rdx,1)
-  .byte  102,68,15,56,0,5,64,15,0,0          // pshufb        0xf40(%rip),%xmm8        # 16f0 <_sk_xor__ssse3_lowp+0x198>
+  .byte  102,68,15,56,0,5,216,15,0,0         // pshufb        0xfd8(%rip),%xmm8        # 1be0 <_sk_xor__ssse3_lowp+0x23f>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,65,137,4,19                     // mov           %ax,(%r11,%rdx,1)
-  .byte  235,156                             // jmp           758 <_sk_store_a8_ssse3_lowp+0x20>
+  .byte  235,156                             // jmp           bb0 <_sk_store_a8_ssse3_lowp+0x20>
   .byte  102,68,15,127,68,36,232             // movdqa        %xmm8,-0x18(%rsp)
   .byte  138,68,36,244                       // mov           -0xc(%rsp),%al
   .byte  65,136,68,19,6                      // mov           %al,0x6(%r11,%rdx,1)
@@ -43181,9 +45448,9 @@
   .byte  102,68,15,127,68,36,200             // movdqa        %xmm8,-0x38(%rsp)
   .byte  138,68,36,208                       // mov           -0x30(%rsp),%al
   .byte  65,136,68,19,4                      // mov           %al,0x4(%r11,%rdx,1)
-  .byte  102,68,15,56,0,5,234,14,0,0         // pshufb        0xeea(%rip),%xmm8        # 16e0 <_sk_xor__ssse3_lowp+0x188>
+  .byte  102,68,15,56,0,5,130,15,0,0         // pshufb        0xf82(%rip),%xmm8        # 1bd0 <_sk_xor__ssse3_lowp+0x22f>
   .byte  102,69,15,126,4,19                  // movd          %xmm8,(%r11,%rdx,1)
-  .byte  233,87,255,255,255                  // jmpq          758 <_sk_store_a8_ssse3_lowp+0x20>
+  .byte  233,87,255,255,255                  // jmpq          bb0 <_sk_store_a8_ssse3_lowp+0x20>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  129,255,255,255,162,255             // cmp           $0xffa2ffff,%edi
   .byte  255                                 // (bad)
@@ -43209,13 +45476,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,42                              // jne           854 <_sk_load_g8_ssse3_lowp+0x34>
+  .byte  117,42                              // jne           cac <_sk_load_g8_ssse3_lowp+0x34>
   .byte  243,65,15,126,4,19                  // movq          (%r11,%rdx,1),%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  102,15,113,240,8                    // psllw         $0x8,%xmm0
-  .byte  102,15,228,5,191,14,0,0             // pmulhuw       0xebf(%rip),%xmm0        # 1700 <_sk_xor__ssse3_lowp+0x1a8>
+  .byte  102,15,228,5,87,15,0,0              // pmulhuw       0xf57(%rip),%xmm0        # 1bf0 <_sk_xor__ssse3_lowp+0x24f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,198,14,0,0                 // movaps        0xec6(%rip),%xmm3        # 1710 <_sk_xor__ssse3_lowp+0x1b8>
+  .byte  15,40,29,94,15,0,0                  // movaps        0xf5e(%rip),%xmm3        # 1c00 <_sk_xor__ssse3_lowp+0x25f>
   .byte  102,15,111,200                      // movdqa        %xmm0,%xmm1
   .byte  102,15,111,208                      // movdqa        %xmm0,%xmm2
   .byte  255,224                             // jmpq          *%rax
@@ -43224,15 +45491,15 @@
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,204                             // ja            834 <_sk_load_g8_ssse3_lowp+0x14>
+  .byte  119,204                             // ja            c8c <_sk_load_g8_ssse3_lowp+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,113,0,0,0                 // lea           0x71(%rip),%r10        # 8e4 <_sk_load_g8_ssse3_lowp+0xc4>
+  .byte  76,141,21,113,0,0,0                 // lea           0x71(%rip),%r10        # d3c <_sk_load_g8_ssse3_lowp+0xc4>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
-  .byte  235,173                             // jmp           834 <_sk_load_g8_ssse3_lowp+0x14>
+  .byte  235,173                             // jmp           c8c <_sk_load_g8_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,196,192,2                    // pinsrw        $0x2,%eax,%xmm0
@@ -43240,7 +45507,7 @@
   .byte  102,15,110,200                      // movd          %eax,%xmm1
   .byte  102,15,96,200                       // punpcklbw     %xmm0,%xmm1
   .byte  243,15,16,193                       // movss         %xmm1,%xmm0
-  .byte  235,139                             // jmp           834 <_sk_load_g8_ssse3_lowp+0x14>
+  .byte  235,139                             // jmp           c8c <_sk_load_g8_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,196,192,6                    // pinsrw        $0x6,%eax,%xmm0
@@ -43251,7 +45518,7 @@
   .byte  102,65,15,110,12,19                 // movd          (%r11,%rdx,1),%xmm1
   .byte  102,15,96,200                       // punpcklbw     %xmm0,%xmm1
   .byte  242,15,16,193                       // movsd         %xmm1,%xmm0
-  .byte  233,83,255,255,255                  // jmpq          834 <_sk_load_g8_ssse3_lowp+0x14>
+  .byte  233,83,255,255,255                  // jmpq          c8c <_sk_load_g8_ssse3_lowp+0x14>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  152                                 // cwtl
   .byte  255                                 // (bad)
@@ -43281,13 +45548,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,42                              // jne           934 <_sk_load_g8_dst_ssse3_lowp+0x34>
+  .byte  117,42                              // jne           d8c <_sk_load_g8_dst_ssse3_lowp+0x34>
   .byte  243,65,15,126,36,19                 // movq          (%r11,%rdx,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,113,244,8                    // psllw         $0x8,%xmm4
-  .byte  102,15,228,37,255,13,0,0            // pmulhuw       0xdff(%rip),%xmm4        # 1720 <_sk_xor__ssse3_lowp+0x1c8>
+  .byte  102,15,228,37,151,14,0,0            // pmulhuw       0xe97(%rip),%xmm4        # 1c10 <_sk_xor__ssse3_lowp+0x26f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,61,6,14,0,0                   // movaps        0xe06(%rip),%xmm7        # 1730 <_sk_xor__ssse3_lowp+0x1d8>
+  .byte  15,40,61,158,14,0,0                 // movaps        0xe9e(%rip),%xmm7        # 1c20 <_sk_xor__ssse3_lowp+0x27f>
   .byte  102,15,111,236                      // movdqa        %xmm4,%xmm5
   .byte  102,15,111,244                      // movdqa        %xmm4,%xmm6
   .byte  255,224                             // jmpq          *%rax
@@ -43296,15 +45563,15 @@
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,204                             // ja            914 <_sk_load_g8_dst_ssse3_lowp+0x14>
+  .byte  119,204                             // ja            d6c <_sk_load_g8_dst_ssse3_lowp+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,113,0,0,0                 // lea           0x71(%rip),%r10        # 9c4 <_sk_load_g8_dst_ssse3_lowp+0xc4>
+  .byte  76,141,21,113,0,0,0                 // lea           0x71(%rip),%r10        # e1c <_sk_load_g8_dst_ssse3_lowp+0xc4>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
-  .byte  235,173                             // jmp           914 <_sk_load_g8_dst_ssse3_lowp+0x14>
+  .byte  235,173                             // jmp           d6c <_sk_load_g8_dst_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  102,15,196,224,2                    // pinsrw        $0x2,%eax,%xmm4
@@ -43312,7 +45579,7 @@
   .byte  102,15,110,232                      // movd          %eax,%xmm5
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  243,15,16,229                       // movss         %xmm5,%xmm4
-  .byte  235,139                             // jmp           914 <_sk_load_g8_dst_ssse3_lowp+0x14>
+  .byte  235,139                             // jmp           d6c <_sk_load_g8_dst_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  102,15,196,224,6                    // pinsrw        $0x6,%eax,%xmm4
@@ -43323,7 +45590,7 @@
   .byte  102,65,15,110,44,19                 // movd          (%r11,%rdx,1),%xmm5
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  233,83,255,255,255                  // jmpq          914 <_sk_load_g8_dst_ssse3_lowp+0x14>
+  .byte  233,83,255,255,255                  // jmpq          d6c <_sk_load_g8_dst_ssse3_lowp+0x14>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  152                                 // cwtl
   .byte  255                                 // (bad)
@@ -43354,20 +45621,20 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,11,2,0,0                     // jne           bfe <_sk_srcover_rgba_8888_ssse3_lowp+0x21e>
+  .byte  15,133,11,2,0,0                     // jne           1056 <_sk_srcover_rgba_8888_ssse3_lowp+0x21e>
   .byte  69,15,16,68,147,16                  // movups        0x10(%r11,%rdx,4),%xmm8
   .byte  102,65,15,16,60,147                 // movupd        (%r11,%rdx,4),%xmm7
-  .byte  102,15,111,45,57,13,0,0             // movdqa        0xd39(%rip),%xmm5        # 1740 <_sk_xor__ssse3_lowp+0x1e8>
+  .byte  102,15,111,45,209,13,0,0            // movdqa        0xdd1(%rip),%xmm5        # 1c30 <_sk_xor__ssse3_lowp+0x28f>
   .byte  102,15,40,231                       // movapd        %xmm7,%xmm4
   .byte  102,15,56,0,229                     // pshufb        %xmm5,%xmm4
   .byte  102,65,15,111,240                   // movdqa        %xmm8,%xmm6
   .byte  102,15,56,0,245                     // pshufb        %xmm5,%xmm6
   .byte  102,15,108,230                      // punpcklqdq    %xmm6,%xmm4
-  .byte  102,15,111,13,42,13,0,0             // movdqa        0xd2a(%rip),%xmm1        # 1750 <_sk_xor__ssse3_lowp+0x1f8>
+  .byte  102,15,111,13,194,13,0,0            // movdqa        0xdc2(%rip),%xmm1        # 1c40 <_sk_xor__ssse3_lowp+0x29f>
   .byte  102,15,113,244,8                    // psllw         $0x8,%xmm4
-  .byte  102,68,15,111,13,44,13,0,0          // movdqa        0xd2c(%rip),%xmm9        # 1760 <_sk_xor__ssse3_lowp+0x208>
+  .byte  102,68,15,111,13,196,13,0,0         // movdqa        0xdc4(%rip),%xmm9        # 1c50 <_sk_xor__ssse3_lowp+0x2af>
   .byte  102,65,15,228,225                   // pmulhuw       %xmm9,%xmm4
-  .byte  102,68,15,111,21,46,13,0,0          // movdqa        0xd2e(%rip),%xmm10        # 1770 <_sk_xor__ssse3_lowp+0x218>
+  .byte  102,68,15,111,21,198,13,0,0         // movdqa        0xdc6(%rip),%xmm10        # 1c60 <_sk_xor__ssse3_lowp+0x2bf>
   .byte  102,15,40,239                       // movapd        %xmm7,%xmm5
   .byte  102,65,15,56,0,234                  // pshufb        %xmm10,%xmm5
   .byte  102,65,15,111,240                   // movdqa        %xmm8,%xmm6
@@ -43375,7 +45642,7 @@
   .byte  102,15,108,238                      // punpcklqdq    %xmm6,%xmm5
   .byte  102,15,113,245,8                    // psllw         $0x8,%xmm5
   .byte  102,65,15,228,233                   // pmulhuw       %xmm9,%xmm5
-  .byte  102,68,15,111,21,18,13,0,0          // movdqa        0xd12(%rip),%xmm10        # 1780 <_sk_xor__ssse3_lowp+0x228>
+  .byte  102,68,15,111,21,170,13,0,0         // movdqa        0xdaa(%rip),%xmm10        # 1c70 <_sk_xor__ssse3_lowp+0x2cf>
   .byte  102,15,40,247                       // movapd        %xmm7,%xmm6
   .byte  102,65,15,56,0,242                  // pshufb        %xmm10,%xmm6
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
@@ -43383,13 +45650,13 @@
   .byte  102,65,15,108,243                   // punpcklqdq    %xmm11,%xmm6
   .byte  102,15,113,246,8                    // psllw         $0x8,%xmm6
   .byte  102,65,15,228,241                   // pmulhuw       %xmm9,%xmm6
-  .byte  102,68,15,111,21,245,12,0,0         // movdqa        0xcf5(%rip),%xmm10        # 1790 <_sk_xor__ssse3_lowp+0x238>
+  .byte  102,68,15,111,21,141,13,0,0         // movdqa        0xd8d(%rip),%xmm10        # 1c80 <_sk_xor__ssse3_lowp+0x2df>
   .byte  102,65,15,56,0,250                  // pshufb        %xmm10,%xmm7
   .byte  102,69,15,56,0,194                  // pshufb        %xmm10,%xmm8
   .byte  102,65,15,108,248                   // punpcklqdq    %xmm8,%xmm7
   .byte  102,15,113,247,8                    // psllw         $0x8,%xmm7
   .byte  102,65,15,228,249                   // pmulhuw       %xmm9,%xmm7
-  .byte  102,68,15,111,29,225,12,0,0         // movdqa        0xce1(%rip),%xmm11        # 17a0 <_sk_xor__ssse3_lowp+0x248>
+  .byte  102,68,15,111,29,121,13,0,0         // movdqa        0xd79(%rip),%xmm11        # 1c90 <_sk_xor__ssse3_lowp+0x2ef>
   .byte  102,68,15,249,219                   // psubw         %xmm3,%xmm11
   .byte  102,68,15,111,196                   // movdqa        %xmm4,%xmm8
   .byte  102,69,15,56,11,195                 // pmulhrsw      %xmm11,%xmm8
@@ -43445,7 +45712,7 @@
   .byte  102,65,15,235,192                   // por           %xmm8,%xmm0
   .byte  102,15,235,194                      // por           %xmm2,%xmm0
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,97                              // jne           c3a <_sk_srcover_rgba_8888_ssse3_lowp+0x25a>
+  .byte  117,97                              // jne           1092 <_sk_srcover_rgba_8888_ssse3_lowp+0x25a>
   .byte  243,65,15,127,4,147                 // movdqu        %xmm0,(%r11,%rdx,4)
   .byte  243,65,15,127,76,147,16             // movdqu        %xmm1,0x10(%r11,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -43460,30 +45727,30 @@
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,228,253,255,255              // ja            9ff <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  .byte  15,135,228,253,255,255              // ja            e57 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,206,0,0,0                 // lea           0xce(%rip),%r10        # cf4 <_sk_srcover_rgba_8888_ssse3_lowp+0x314>
+  .byte  76,141,21,206,0,0,0                 // lea           0xce(%rip),%r10        # 114c <_sk_srcover_rgba_8888_ssse3_lowp+0x314>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  243,65,15,16,60,147                 // movss         (%r11,%rdx,4),%xmm7
-  .byte  233,197,253,255,255                 // jmpq          9ff <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  .byte  233,197,253,255,255                 // jmpq          e57 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,156                             // ja            be6 <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
+  .byte  119,156                             // ja            103e <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
   .byte  65,15,182,193                       // movzbl        %r9b,%eax
-  .byte  76,141,13,187,0,0,0                 // lea           0xbb(%rip),%r9        # d10 <_sk_srcover_rgba_8888_ssse3_lowp+0x330>
+  .byte  76,141,13,187,0,0,0                 // lea           0xbb(%rip),%r9        # 1168 <_sk_srcover_rgba_8888_ssse3_lowp+0x330>
   .byte  73,99,4,129                         // movslq        (%r9,%rax,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  102,65,15,126,4,147                 // movd          %xmm0,(%r11,%rdx,4)
-  .byte  235,128                             // jmp           be6 <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
+  .byte  235,128                             // jmp           103e <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
   .byte  102,65,15,110,100,147,8             // movd          0x8(%r11,%rdx,4),%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  102,65,15,18,60,147                 // movlpd        (%r11,%rdx,4),%xmm7
-  .byte  233,130,253,255,255                 // jmpq          9ff <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  .byte  233,130,253,255,255                 // jmpq          e57 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   .byte  102,65,15,110,100,147,24            // movd          0x18(%r11,%rdx,4),%xmm4
   .byte  102,68,15,112,196,69                // pshufd        $0x45,%xmm4,%xmm8
   .byte  243,65,15,16,100,147,20             // movss         0x14(%r11,%rdx,4),%xmm4
@@ -43492,27 +45759,27 @@
   .byte  68,15,40,196                        // movaps        %xmm4,%xmm8
   .byte  243,65,15,16,100,147,16             // movss         0x10(%r11,%rdx,4),%xmm4
   .byte  243,68,15,16,196                    // movss         %xmm4,%xmm8
-  .byte  233,73,253,255,255                  // jmpq          9f9 <_sk_srcover_rgba_8888_ssse3_lowp+0x19>
+  .byte  233,73,253,255,255                  // jmpq          e51 <_sk_srcover_rgba_8888_ssse3_lowp+0x19>
   .byte  102,15,112,200,78                   // pshufd        $0x4e,%xmm0,%xmm1
   .byte  102,65,15,126,76,147,8              // movd          %xmm1,0x8(%r11,%rdx,4)
   .byte  102,65,15,214,4,147                 // movq          %xmm0,(%r11,%rdx,4)
-  .byte  233,31,255,255,255                  // jmpq          be6 <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
+  .byte  233,31,255,255,255                  // jmpq          103e <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
   .byte  102,15,112,209,78                   // pshufd        $0x4e,%xmm1,%xmm2
   .byte  102,65,15,126,84,147,24             // movd          %xmm2,0x18(%r11,%rdx,4)
   .byte  102,15,112,209,229                  // pshufd        $0xe5,%xmm1,%xmm2
   .byte  102,65,15,126,84,147,20             // movd          %xmm2,0x14(%r11,%rdx,4)
   .byte  102,65,15,126,76,147,16             // movd          %xmm1,0x10(%r11,%rdx,4)
   .byte  243,65,15,127,4,147                 // movdqu        %xmm0,(%r11,%rdx,4)
-  .byte  233,245,254,255,255                 // jmpq          be6 <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
+  .byte  233,245,254,255,255                 // jmpq          103e <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  59,255                              // cmp           %edi,%edi
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  126,255                             // jle           cf9 <_sk_srcover_rgba_8888_ssse3_lowp+0x319>
+  .byte  126,255                             // jle           1151 <_sk_srcover_rgba_8888_ssse3_lowp+0x319>
   .byte  255                                 // (bad)
   .byte  255,114,255                         // pushq         -0x1(%rdx)
   .byte  255                                 // (bad)
-  .byte  255,5,253,255,255,171               // incl          -0x54000003(%rip)        # ffffffffac000d02 <_sk_xor__ssse3_lowp+0xffffffffabfff7aa>
+  .byte  255,5,253,255,255,171               // incl          -0x54000003(%rip)        # ffffffffac00115a <_sk_xor__ssse3_lowp+0xffffffffabfff7b9>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,150,255,255,255,137             // callq         *-0x76000001(%rsi)
@@ -43542,7 +45809,7 @@
 _sk_scale_1_float_ssse3_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  243,68,15,16,0                      // movss         (%rax),%xmm8
-  .byte  243,68,15,88,5,72,11,0,0            // addss         0xb48(%rip),%xmm8        # 1884 <_sk_xor__ssse3_lowp+0x32c>
+  .byte  243,68,15,88,5,224,11,0,0           // addss         0xbe0(%rip),%xmm8        # 1d74 <_sk_xor__ssse3_lowp+0x3d3>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  242,69,15,112,192,0                 // pshuflw       $0x0,%xmm8,%xmm8
@@ -43565,11 +45832,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,74                              // jne           dd6 <_sk_scale_u8_ssse3_lowp+0x54>
+  .byte  117,74                              // jne           122e <_sk_scale_u8_ssse3_lowp+0x54>
   .byte  243,69,15,126,4,19                  // movq          (%r11,%rdx,1),%xmm8
   .byte  102,68,15,96,192                    // punpcklbw     %xmm0,%xmm8
   .byte  102,65,15,113,240,8                 // psllw         $0x8,%xmm8
-  .byte  102,68,15,228,5,10,10,0,0           // pmulhuw       0xa0a(%rip),%xmm8        # 17b0 <_sk_xor__ssse3_lowp+0x258>
+  .byte  102,68,15,228,5,162,10,0,0          // pmulhuw       0xaa2(%rip),%xmm8        # 1ca0 <_sk_xor__ssse3_lowp+0x2ff>
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
   .byte  102,15,56,29,192                    // pabsw         %xmm0,%xmm0
   .byte  102,65,15,56,11,200                 // pmulhrsw      %xmm8,%xmm1
@@ -43585,15 +45852,15 @@
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,172                             // ja            d97 <_sk_scale_u8_ssse3_lowp+0x15>
+  .byte  119,172                             // ja            11ef <_sk_scale_u8_ssse3_lowp+0x15>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,126,0,0,0                 // lea           0x7e(%rip),%r10        # e74 <_sk_scale_u8_ssse3_lowp+0xf2>
+  .byte  76,141,21,126,0,0,0                 // lea           0x7e(%rip),%r10        # 12cc <_sk_scale_u8_ssse3_lowp+0xf2>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  235,140                             // jmp           d97 <_sk_scale_u8_ssse3_lowp+0x15>
+  .byte  235,140                             // jmp           11ef <_sk_scale_u8_ssse3_lowp+0x15>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,68,15,196,192,2                 // pinsrw        $0x2,%eax,%xmm8
@@ -43601,7 +45868,7 @@
   .byte  102,68,15,110,200                   // movd          %eax,%xmm9
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  243,69,15,16,193                    // movss         %xmm9,%xmm8
-  .byte  233,98,255,255,255                  // jmpq          d97 <_sk_scale_u8_ssse3_lowp+0x15>
+  .byte  233,98,255,255,255                  // jmpq          11ef <_sk_scale_u8_ssse3_lowp+0x15>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,68,15,196,192,6                 // pinsrw        $0x6,%eax,%xmm8
@@ -43612,7 +45879,7 @@
   .byte  102,69,15,110,12,19                 // movd          (%r11,%rdx,1),%xmm9
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  242,69,15,16,193                    // movsd         %xmm9,%xmm8
-  .byte  233,36,255,255,255                  // jmpq          d97 <_sk_scale_u8_ssse3_lowp+0x15>
+  .byte  233,36,255,255,255                  // jmpq          11ef <_sk_scale_u8_ssse3_lowp+0x15>
   .byte  144                                 // nop
   .byte  139,255                             // mov           %edi,%edi
   .byte  255                                 // (bad)
@@ -43640,14 +45907,14 @@
 _sk_lerp_1_float_ssse3_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  243,68,15,16,0                      // movss         (%rax),%xmm8
-  .byte  243,68,15,88,5,232,9,0,0            // addss         0x9e8(%rip),%xmm8        # 1888 <_sk_xor__ssse3_lowp+0x330>
+  .byte  243,68,15,88,5,128,10,0,0           // addss         0xa80(%rip),%xmm8        # 1d78 <_sk_xor__ssse3_lowp+0x3d7>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  242,69,15,112,192,0                 // pshuflw       $0x0,%xmm8,%xmm8
   .byte  102,69,15,112,192,80                // pshufd        $0x50,%xmm8,%xmm8
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
   .byte  102,68,15,56,29,200                 // pabsw         %xmm0,%xmm9
-  .byte  102,68,15,111,21,245,8,0,0          // movdqa        0x8f5(%rip),%xmm10        # 17c0 <_sk_xor__ssse3_lowp+0x268>
+  .byte  102,68,15,111,21,141,9,0,0          // movdqa        0x98d(%rip),%xmm10        # 1cb0 <_sk_xor__ssse3_lowp+0x30f>
   .byte  102,69,15,249,208                   // psubw         %xmm8,%xmm10
   .byte  102,15,111,196                      // movdqa        %xmm4,%xmm0
   .byte  102,65,15,56,11,194                 // pmulhrsw      %xmm10,%xmm0
@@ -43680,14 +45947,14 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,169,0,0,0                    // jne           ffc <_sk_lerp_u8_ssse3_lowp+0xb7>
+  .byte  15,133,169,0,0,0                    // jne           1454 <_sk_lerp_u8_ssse3_lowp+0xb7>
   .byte  243,69,15,126,4,19                  // movq          (%r11,%rdx,1),%xmm8
   .byte  102,68,15,96,192                    // punpcklbw     %xmm0,%xmm8
   .byte  102,65,15,113,240,8                 // psllw         $0x8,%xmm8
-  .byte  102,68,15,228,5,99,8,0,0            // pmulhuw       0x863(%rip),%xmm8        # 17d0 <_sk_xor__ssse3_lowp+0x278>
+  .byte  102,68,15,228,5,251,8,0,0           // pmulhuw       0x8fb(%rip),%xmm8        # 1cc0 <_sk_xor__ssse3_lowp+0x31f>
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
   .byte  102,68,15,56,29,200                 // pabsw         %xmm0,%xmm9
-  .byte  102,68,15,111,21,94,8,0,0           // movdqa        0x85e(%rip),%xmm10        # 17e0 <_sk_xor__ssse3_lowp+0x288>
+  .byte  102,68,15,111,21,246,8,0,0          // movdqa        0x8f6(%rip),%xmm10        # 1cd0 <_sk_xor__ssse3_lowp+0x32f>
   .byte  102,69,15,249,208                   // psubw         %xmm8,%xmm10
   .byte  102,15,111,196                      // movdqa        %xmm4,%xmm0
   .byte  102,65,15,56,11,194                 // pmulhrsw      %xmm10,%xmm0
@@ -43717,15 +45984,15 @@
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,73,255,255,255               // ja            f5e <_sk_lerp_u8_ssse3_lowp+0x19>
+  .byte  15,135,73,255,255,255               // ja            13b6 <_sk_lerp_u8_ssse3_lowp+0x19>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,128,0,0,0                 // lea           0x80(%rip),%r10        # 10a0 <_sk_lerp_u8_ssse3_lowp+0x15b>
+  .byte  76,141,21,128,0,0,0                 // lea           0x80(%rip),%r10        # 14f8 <_sk_lerp_u8_ssse3_lowp+0x15b>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  233,38,255,255,255                  // jmpq          f5e <_sk_lerp_u8_ssse3_lowp+0x19>
+  .byte  233,38,255,255,255                  // jmpq          13b6 <_sk_lerp_u8_ssse3_lowp+0x19>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,68,15,196,192,2                 // pinsrw        $0x2,%eax,%xmm8
@@ -43733,7 +46000,7 @@
   .byte  102,68,15,110,200                   // movd          %eax,%xmm9
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  243,69,15,16,193                    // movss         %xmm9,%xmm8
-  .byte  233,252,254,255,255                 // jmpq          f5e <_sk_lerp_u8_ssse3_lowp+0x19>
+  .byte  233,252,254,255,255                 // jmpq          13b6 <_sk_lerp_u8_ssse3_lowp+0x19>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,68,15,196,192,6                 // pinsrw        $0x6,%eax,%xmm8
@@ -43744,14 +46011,14 @@
   .byte  102,69,15,110,12,19                 // movd          (%r11,%rdx,1),%xmm9
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  242,69,15,16,193                    // movsd         %xmm9,%xmm8
-  .byte  233,190,254,255,255                 // jmpq          f5e <_sk_lerp_u8_ssse3_lowp+0x19>
+  .byte  233,190,254,255,255                 // jmpq          13b6 <_sk_lerp_u8_ssse3_lowp+0x19>
   .byte  137,255                             // mov           %edi,%edi
   .byte  255                                 // (bad)
   .byte  255,169,255,255,255,152             // ljmp          *-0x67000001(%rcx)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  235,255                             // jmp           10ad <_sk_lerp_u8_ssse3_lowp+0x168>
+  .byte  235,255                             // jmp           1505 <_sk_lerp_u8_ssse3_lowp+0x168>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  223,255                             // (bad)
@@ -43774,16 +46041,6 @@
   .byte  65,15,40,208                        // movaps        %xmm8,%xmm2
   .byte  255,224                             // jmpq          *%rax
 
-HIDDEN _sk_swap_rb_dst_ssse3_lowp
-.globl _sk_swap_rb_dst_ssse3_lowp
-FUNCTION(_sk_swap_rb_dst_ssse3_lowp)
-_sk_swap_rb_dst_ssse3_lowp:
-  .byte  68,15,40,196                        // movaps        %xmm4,%xmm8
-  .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,230                           // movaps        %xmm6,%xmm4
-  .byte  65,15,40,240                        // movaps        %xmm8,%xmm6
-  .byte  255,224                             // jmpq          *%rax
-
 HIDDEN _sk_move_src_dst_ssse3_lowp
 .globl _sk_move_src_dst_ssse3_lowp
 FUNCTION(_sk_move_src_dst_ssse3_lowp)
@@ -43823,7 +46080,7 @@
 _sk_srcatop_ssse3_lowp:
   .byte  102,15,56,11,199                    // pmulhrsw      %xmm7,%xmm0
   .byte  102,68,15,56,29,192                 // pabsw         %xmm0,%xmm8
-  .byte  102,68,15,111,13,210,6,0,0          // movdqa        0x6d2(%rip),%xmm9        # 17f0 <_sk_xor__ssse3_lowp+0x298>
+  .byte  102,68,15,111,13,121,7,0,0          // movdqa        0x779(%rip),%xmm9        # 1ce0 <_sk_xor__ssse3_lowp+0x33f>
   .byte  102,68,15,249,203                   // psubw         %xmm3,%xmm9
   .byte  102,15,111,196                      // movdqa        %xmm4,%xmm0
   .byte  102,65,15,56,11,193                 // pmulhrsw      %xmm9,%xmm0
@@ -43856,7 +46113,7 @@
   .byte  102,68,15,111,196                   // movdqa        %xmm4,%xmm8
   .byte  102,68,15,56,11,195                 // pmulhrsw      %xmm3,%xmm8
   .byte  102,69,15,56,29,192                 // pabsw         %xmm8,%xmm8
-  .byte  102,68,15,111,13,81,6,0,0           // movdqa        0x651(%rip),%xmm9        # 1800 <_sk_xor__ssse3_lowp+0x2a8>
+  .byte  102,68,15,111,13,248,6,0,0          // movdqa        0x6f8(%rip),%xmm9        # 1cf0 <_sk_xor__ssse3_lowp+0x34f>
   .byte  102,68,15,249,207                   // psubw         %xmm7,%xmm9
   .byte  102,65,15,56,11,193                 // pmulhrsw      %xmm9,%xmm0
   .byte  102,15,56,29,192                    // pabsw         %xmm0,%xmm0
@@ -43919,7 +46176,7 @@
 .globl _sk_srcout_ssse3_lowp
 FUNCTION(_sk_srcout_ssse3_lowp)
 _sk_srcout_ssse3_lowp:
-  .byte  102,68,15,111,5,119,5,0,0           // movdqa        0x577(%rip),%xmm8        # 1810 <_sk_xor__ssse3_lowp+0x2b8>
+  .byte  102,68,15,111,5,30,6,0,0            // movdqa        0x61e(%rip),%xmm8        # 1d00 <_sk_xor__ssse3_lowp+0x35f>
   .byte  102,68,15,249,199                   // psubw         %xmm7,%xmm8
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
   .byte  102,15,56,29,192                    // pabsw         %xmm0,%xmm0
@@ -43936,7 +46193,7 @@
 .globl _sk_dstout_ssse3_lowp
 FUNCTION(_sk_dstout_ssse3_lowp)
 _sk_dstout_ssse3_lowp:
-  .byte  102,68,15,111,5,72,5,0,0            // movdqa        0x548(%rip),%xmm8        # 1820 <_sk_xor__ssse3_lowp+0x2c8>
+  .byte  102,68,15,111,5,239,5,0,0           // movdqa        0x5ef(%rip),%xmm8        # 1d10 <_sk_xor__ssse3_lowp+0x36f>
   .byte  102,68,15,249,195                   // psubw         %xmm3,%xmm8
   .byte  102,15,111,196                      // movdqa        %xmm4,%xmm0
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
@@ -43956,7 +46213,7 @@
 .globl _sk_srcover_ssse3_lowp
 FUNCTION(_sk_srcover_ssse3_lowp)
 _sk_srcover_ssse3_lowp:
-  .byte  102,68,15,111,5,13,5,0,0            // movdqa        0x50d(%rip),%xmm8        # 1830 <_sk_xor__ssse3_lowp+0x2d8>
+  .byte  102,68,15,111,5,180,5,0,0           // movdqa        0x5b4(%rip),%xmm8        # 1d20 <_sk_xor__ssse3_lowp+0x37f>
   .byte  102,68,15,249,195                   // psubw         %xmm3,%xmm8
   .byte  102,68,15,111,204                   // movdqa        %xmm4,%xmm9
   .byte  102,69,15,56,11,200                 // pmulhrsw      %xmm8,%xmm9
@@ -43980,7 +46237,7 @@
 .globl _sk_dstover_ssse3_lowp
 FUNCTION(_sk_dstover_ssse3_lowp)
 _sk_dstover_ssse3_lowp:
-  .byte  102,68,15,111,5,184,4,0,0           // movdqa        0x4b8(%rip),%xmm8        # 1840 <_sk_xor__ssse3_lowp+0x2e8>
+  .byte  102,68,15,111,5,95,5,0,0            // movdqa        0x55f(%rip),%xmm8        # 1d30 <_sk_xor__ssse3_lowp+0x38f>
   .byte  102,68,15,249,199                   // psubw         %xmm7,%xmm8
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
   .byte  102,15,56,29,192                    // pabsw         %xmm0,%xmm0
@@ -44016,7 +46273,7 @@
 .globl _sk_multiply_ssse3_lowp
 FUNCTION(_sk_multiply_ssse3_lowp)
 _sk_multiply_ssse3_lowp:
-  .byte  102,68,15,111,5,77,4,0,0            // movdqa        0x44d(%rip),%xmm8        # 1850 <_sk_xor__ssse3_lowp+0x2f8>
+  .byte  102,68,15,111,5,244,4,0,0           // movdqa        0x4f4(%rip),%xmm8        # 1d40 <_sk_xor__ssse3_lowp+0x39f>
   .byte  102,69,15,111,200                   // movdqa        %xmm8,%xmm9
   .byte  102,68,15,249,207                   // psubw         %xmm7,%xmm9
   .byte  102,68,15,111,208                   // movdqa        %xmm0,%xmm10
@@ -44065,7 +46322,7 @@
 .globl _sk_screen_ssse3_lowp
 FUNCTION(_sk_screen_ssse3_lowp)
 _sk_screen_ssse3_lowp:
-  .byte  102,68,15,111,5,115,3,0,0           // movdqa        0x373(%rip),%xmm8        # 1860 <_sk_xor__ssse3_lowp+0x308>
+  .byte  102,68,15,111,5,26,4,0,0            // movdqa        0x41a(%rip),%xmm8        # 1d50 <_sk_xor__ssse3_lowp+0x3af>
   .byte  102,69,15,111,200                   // movdqa        %xmm8,%xmm9
   .byte  102,68,15,249,200                   // psubw         %xmm0,%xmm9
   .byte  102,68,15,56,11,204                 // pmulhrsw      %xmm4,%xmm9
@@ -44092,7 +46349,7 @@
 .globl _sk_xor__ssse3_lowp
 FUNCTION(_sk_xor__ssse3_lowp)
 _sk_xor__ssse3_lowp:
-  .byte  102,68,15,111,5,15,3,0,0            // movdqa        0x30f(%rip),%xmm8        # 1870 <_sk_xor__ssse3_lowp+0x318>
+  .byte  102,68,15,111,5,182,3,0,0           // movdqa        0x3b6(%rip),%xmm8        # 1d60 <_sk_xor__ssse3_lowp+0x3bf>
   .byte  102,69,15,111,200                   // movdqa        %xmm8,%xmm9
   .byte  102,68,15,249,207                   // psubw         %xmm7,%xmm9
   .byte  102,65,15,56,11,193                 // pmulhrsw      %xmm9,%xmm0
@@ -44135,7 +46392,7 @@
   .byte  12,13                               // or            $0xd,%al
   .byte  12,13                               // or            $0xd,%al
   .byte  14                                  // (bad)
-  .byte  15,129,128,129,128,129              // jno           ffffffff818097a5 <_sk_xor__ssse3_lowp+0xffffffff8180824d>
+  .byte  15,129,128,129,128,129              // jno           ffffffff81809be5 <_sk_xor__ssse3_lowp+0xffffffff81808244>
   .byte  128,129,128,129,128,129,128         // addb          $0x80,-0x7e7f7e80(%rcx)
   .byte  129,128,129,128,1,2,5,6,9,10        // addl          $0xa090605,0x2018081(%rax)
   .byte  13,14,9,10,13                       // or            $0xd0a090e,%eax
@@ -44164,7 +46421,76 @@
   .byte  12,13                               // or            $0xd,%al
   .byte  12,13                               // or            $0xd,%al
   .byte  14                                  // (bad)
-  .byte  15,129,128,129,128,129              // jno           ffffffff818097f5 <_sk_xor__ssse3_lowp+0xffffffff8180829d>
+  .byte  15,129,128,129,128,129              // jno           ffffffff81809c35 <_sk_xor__ssse3_lowp+0xffffffff81808294>
+  .byte  128,129,128,129,128,129,128         // addb          $0x80,-0x7e7f7e80(%rcx)
+  .byte  129,128,129,128,1,2,5,6,9,10        // addl          $0xa090605,0x2018081(%rax)
+  .byte  13,14,9,10,13                       // or            $0xd0a090e,%eax
+  .byte  14                                  // (bad)
+  .byte  13,14,15,255,2                      // or            $0x2ff0f0e,%eax
+  .byte  3,6                                 // add           (%rsi),%eax
+  .byte  7                                   // (bad)
+  .byte  10,11                               // or            (%rbx),%cl
+  .byte  14                                  // (bad)
+  .byte  15,10                               // (bad)
+  .byte  11,14                               // or            (%rsi),%ecx
+  .byte  15,14                               // femms
+  .byte  15,255                              // (bad)
+  .byte  255,3                               // incl          (%rbx)
+  .byte  255,7                               // incl          (%rdi)
+  .byte  255,11                              // decl          (%rbx)
+  .byte  255,15                              // decl          (%rdi)
+  .byte  255,11                              // decl          (%rbx)
+  .byte  255,15                              // decl          (%rdi)
+  .byte  255,15                              // decl          (%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,0                               // incl          (%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  255,0                               // incl          (%rax)
+  .byte  0,1                                 // add           %al,(%rcx)
+  .byte  4,5                                 // add           $0x5,%al
+  .byte  8,9                                 // or            %cl,(%rcx)
+  .byte  12,13                               // or            $0xd,%al
+  .byte  8,9                                 // or            %cl,(%rcx)
+  .byte  12,13                               // or            $0xd,%al
+  .byte  12,13                               // or            $0xd,%al
+  .byte  14                                  // (bad)
+  .byte  15,129,128,129,128,129              // jno           ffffffff81809c95 <_sk_xor__ssse3_lowp+0xffffffff818082f4>
+  .byte  128,129,128,129,128,129,128         // addb          $0x80,-0x7e7f7e80(%rcx)
+  .byte  129,128,129,128,1,2,5,6,9,10        // addl          $0xa090605,0x2018081(%rax)
+  .byte  13,14,9,10,13                       // or            $0xd0a090e,%eax
+  .byte  14                                  // (bad)
+  .byte  13,14,15,255,2                      // or            $0x2ff0f0e,%eax
+  .byte  3,6                                 // add           (%rsi),%eax
+  .byte  7                                   // (bad)
+  .byte  10,11                               // or            (%rbx),%cl
+  .byte  14                                  // (bad)
+  .byte  15,10                               // (bad)
+  .byte  11,14                               // or            (%rsi),%ecx
+  .byte  15,14                               // femms
+  .byte  15,255                              // (bad)
+  .byte  255,3                               // incl          (%rbx)
+  .byte  255,7                               // incl          (%rdi)
+  .byte  255,11                              // decl          (%rbx)
+  .byte  255,15                              // decl          (%rdi)
+  .byte  255,11                              // decl          (%rbx)
+  .byte  255,15                              // decl          (%rdi)
+  .byte  255,15                              // decl          (%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,0                               // incl          (%rax)
+  .byte  1,4,5,8,9,12,13                     // add           %eax,0xd0c0908(,%rax,1)
+  .byte  8,9                                 // or            %cl,(%rcx)
+  .byte  12,13                               // or            $0xd,%al
+  .byte  12,13                               // or            $0xd,%al
+  .byte  14                                  // (bad)
+  .byte  15,129,128,129,128,129              // jno           ffffffff81809ce5 <_sk_xor__ssse3_lowp+0xffffffff81808344>
   .byte  128,129,128,129,128,129,128         // addb          $0x80,-0x7e7f7e80(%rcx)
   .byte  129,128,129,128,1,2,5,6,9,10        // addl          $0xa090605,0x2018081(%rax)
   .byte  13,14,9,10,13                       // or            $0xd0a090e,%eax
@@ -44388,7 +46714,7 @@
   .byte  102,15,110,199                      // movd          %edi,%xmm0
   .byte  102,15,112,192,0                    // pshufd        $0x0,%xmm0,%xmm0
   .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
-  .byte  15,40,145,52,136,0,0                // movaps        0x8834(%ecx),%xmm2
+  .byte  15,40,145,4,140,0,0                 // movaps        0x8c04(%ecx),%xmm2
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,16,0                             // movups        (%eax),%xmm0
   .byte  15,88,193                           // addps         %xmm1,%xmm0
@@ -44410,7 +46736,7 @@
   .byte  137,68,36,4                         // mov           %eax,0x4(%esp)
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  137,4,36                            // mov           %eax,(%esp)
-  .byte  15,40,145,68,136,0,0                // movaps        0x8844(%ecx),%xmm2
+  .byte  15,40,145,20,140,0,0                // movaps        0x8c14(%ecx),%xmm2
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  255,19                              // call          *(%ebx)
   .byte  131,196,108                         // add           $0x6c,%esp
@@ -44446,15 +46772,15 @@
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  102,15,112,252,0                    // pshufd        $0x0,%xmm4,%xmm7
   .byte  102,15,239,253                      // pxor          %xmm5,%xmm7
-  .byte  102,15,111,182,181,135,0,0          // movdqa        0x87b5(%esi),%xmm6
+  .byte  102,15,111,182,133,139,0,0          // movdqa        0x8b85(%esi),%xmm6
   .byte  102,15,111,207                      // movdqa        %xmm7,%xmm1
   .byte  102,15,219,206                      // pand          %xmm6,%xmm1
   .byte  102,15,219,245                      // pand          %xmm5,%xmm6
-  .byte  102,15,111,134,213,135,0,0          // movdqa        0x87d5(%esi),%xmm0
+  .byte  102,15,111,134,165,139,0,0          // movdqa        0x8ba5(%esi),%xmm0
   .byte  102,15,111,231                      // movdqa        %xmm7,%xmm4
   .byte  102,15,219,224                      // pand          %xmm0,%xmm4
   .byte  102,15,219,197                      // pand          %xmm5,%xmm0
-  .byte  102,15,111,158,197,135,0,0          // movdqa        0x87c5(%esi),%xmm3
+  .byte  102,15,111,158,149,139,0,0          // movdqa        0x8b95(%esi),%xmm3
   .byte  102,15,219,251                      // pand          %xmm3,%xmm7
   .byte  102,15,219,235                      // pand          %xmm3,%xmm5
   .byte  102,15,114,246,4                    // pslld         $0x4,%xmm6
@@ -44470,8 +46796,8 @@
   .byte  102,15,235,224                      // por           %xmm0,%xmm4
   .byte  102,15,235,231                      // por           %xmm7,%xmm4
   .byte  15,91,196                           // cvtdq2ps      %xmm4,%xmm0
-  .byte  15,89,134,229,135,0,0               // mulps         0x87e5(%esi),%xmm0
-  .byte  15,88,134,245,135,0,0               // addps         0x87f5(%esi),%xmm0
+  .byte  15,89,134,181,139,0,0               // mulps         0x8bb5(%esi),%xmm0
+  .byte  15,88,134,197,139,0,0               // addps         0x8bc5(%esi),%xmm0
   .byte  139,55                              // mov           (%edi),%esi
   .byte  243,15,16,14                        // movss         (%esi),%xmm1
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
@@ -44704,7 +47030,7 @@
   .byte  88                                  // pop           %eax
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
   .byte  15,89,208                           // mulps         %xmm0,%xmm2
-  .byte  15,40,136,243,132,0,0               // movaps        0x84f3(%eax),%xmm1
+  .byte  15,40,136,195,136,0,0               // movaps        0x88c3(%eax),%xmm1
   .byte  15,92,203                           // subps         %xmm3,%xmm1
   .byte  15,40,249                           // movaps        %xmm1,%xmm7
   .byte  15,89,125,40                        // mulps         0x28(%ebp),%xmm7
@@ -44765,7 +47091,7 @@
   .byte  88                                  // pop           %eax
   .byte  15,40,245                           // movaps        %xmm5,%xmm6
   .byte  15,89,117,40                        // mulps         0x28(%ebp),%xmm6
-  .byte  15,40,184,89,132,0,0                // movaps        0x8459(%eax),%xmm7
+  .byte  15,40,184,41,136,0,0                // movaps        0x8829(%eax),%xmm7
   .byte  15,92,125,88                        // subps         0x58(%ebp),%xmm7
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
   .byte  15,88,198                           // addps         %xmm6,%xmm0
@@ -44911,7 +47237,7 @@
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
-  .byte  15,40,184,245,130,0,0               // movaps        0x82f5(%eax),%xmm7
+  .byte  15,40,184,197,134,0,0               // movaps        0x86c5(%eax),%xmm7
   .byte  15,92,254                           // subps         %xmm6,%xmm7
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
   .byte  15,89,207                           // mulps         %xmm7,%xmm1
@@ -44953,7 +47279,7 @@
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
-  .byte  15,40,160,141,130,0,0               // movaps        0x828d(%eax),%xmm4
+  .byte  15,40,160,93,134,0,0                // movaps        0x865d(%eax),%xmm4
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
@@ -45003,7 +47329,7 @@
   .byte  232,0,0,0,0                         // call          753 <_sk_srcover_sse2+0x17>
   .byte  88                                  // pop           %eax
   .byte  15,40,109,40                        // movaps        0x28(%ebp),%xmm5
-  .byte  15,40,128,13,130,0,0                // movaps        0x820d(%eax),%xmm0
+  .byte  15,40,128,221,133,0,0               // movaps        0x85dd(%eax),%xmm0
   .byte  15,92,195                           // subps         %xmm3,%xmm0
   .byte  15,40,248                           // movaps        %xmm0,%xmm7
   .byte  15,89,253                           // mulps         %xmm5,%xmm7
@@ -45061,7 +47387,7 @@
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
-  .byte  15,40,162,134,129,0,0               // movaps        0x8186(%edx),%xmm4
+  .byte  15,40,162,86,133,0,0                // movaps        0x8556(%edx),%xmm4
   .byte  139,85,12                           // mov           0xc(%ebp),%edx
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
@@ -45149,7 +47475,7 @@
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  232,0,0,0,0                         // call          8e0 <_sk_multiply_sse2+0x18>
   .byte  88                                  // pop           %eax
-  .byte  15,40,144,160,128,0,0               // movaps        0x80a0(%eax),%xmm2
+  .byte  15,40,144,112,132,0,0               // movaps        0x8470(%eax),%xmm2
   .byte  15,40,250                           // movaps        %xmm2,%xmm7
   .byte  15,92,125,88                        // subps         0x58(%ebp),%xmm7
   .byte  15,40,231                           // movaps        %xmm7,%xmm4
@@ -45325,7 +47651,7 @@
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
   .byte  232,0,0,0,0                         // call          ac7 <_sk_xor__sse2+0x12>
   .byte  88                                  // pop           %eax
-  .byte  15,40,176,201,126,0,0               // movaps        0x7ec9(%eax),%xmm6
+  .byte  15,40,176,153,130,0,0               // movaps        0x8299(%eax),%xmm6
   .byte  15,40,254                           // movaps        %xmm6,%xmm7
   .byte  15,92,125,88                        // subps         0x58(%ebp),%xmm7
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
@@ -45411,7 +47737,7 @@
   .byte  15,92,226                           // subps         %xmm2,%xmm4
   .byte  232,0,0,0,0                         // call          bc1 <_sk_darken_sse2+0x63>
   .byte  88                                  // pop           %eax
-  .byte  15,40,144,223,125,0,0               // movaps        0x7ddf(%eax),%xmm2
+  .byte  15,40,144,175,129,0,0               // movaps        0x81af(%eax),%xmm2
   .byte  15,92,214                           // subps         %xmm6,%xmm2
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
@@ -45481,7 +47807,7 @@
   .byte  15,92,226                           // subps         %xmm2,%xmm4
   .byte  232,0,0,0,0                         // call          c86 <_sk_lighten_sse2+0x63>
   .byte  88                                  // pop           %eax
-  .byte  15,40,144,42,125,0,0                // movaps        0x7d2a(%eax),%xmm2
+  .byte  15,40,144,250,128,0,0               // movaps        0x80fa(%eax),%xmm2
   .byte  15,92,214                           // subps         %xmm6,%xmm2
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
@@ -45554,7 +47880,7 @@
   .byte  15,92,226                           // subps         %xmm2,%xmm4
   .byte  232,0,0,0,0                         // call          d54 <_sk_difference_sse2+0x6c>
   .byte  88                                  // pop           %eax
-  .byte  15,40,144,108,124,0,0               // movaps        0x7c6c(%eax),%xmm2
+  .byte  15,40,144,60,128,0,0                // movaps        0x803c(%eax),%xmm2
   .byte  15,92,214                           // subps         %xmm6,%xmm2
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
@@ -45616,7 +47942,7 @@
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  15,92,226                           // subps         %xmm2,%xmm4
-  .byte  15,40,144,6,124,0,0                 // movaps        0x7c06(%eax),%xmm2
+  .byte  15,40,144,214,127,0,0               // movaps        0x7fd6(%eax),%xmm2
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
@@ -45672,7 +47998,7 @@
   .byte  15,40,196                           // movaps        %xmm4,%xmm0
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  15,92,238                           // subps         %xmm6,%xmm5
-  .byte  15,40,176,101,123,0,0               // movaps        0x7b65(%eax),%xmm6
+  .byte  15,40,176,53,127,0,0                // movaps        0x7f35(%eax),%xmm6
   .byte  15,40,230                           // movaps        %xmm6,%xmm4
   .byte  15,92,224                           // subps         %xmm0,%xmm4
   .byte  15,40,220                           // movaps        %xmm4,%xmm3
@@ -45815,7 +48141,7 @@
   .byte  15,94,212                           // divps         %xmm4,%xmm2
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
   .byte  15,93,226                           // minps         %xmm2,%xmm4
-  .byte  15,40,152,179,121,0,0               // movaps        0x79b3(%eax),%xmm3
+  .byte  15,40,152,131,125,0,0               // movaps        0x7d83(%eax),%xmm3
   .byte  15,40,211                           // movaps        %xmm3,%xmm2
   .byte  15,92,208                           // subps         %xmm0,%xmm2
   .byte  15,41,85,216                        // movaps        %xmm2,-0x28(%ebp)
@@ -45941,7 +48267,7 @@
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
   .byte  232,0,0,0,0                         // call          11df <_sk_hardlight_sse2+0x1a>
   .byte  88                                  // pop           %eax
-  .byte  15,40,176,33,120,0,0                // movaps        0x7821(%eax),%xmm6
+  .byte  15,40,176,241,123,0,0               // movaps        0x7bf1(%eax),%xmm6
   .byte  15,40,206                           // movaps        %xmm6,%xmm1
   .byte  15,92,77,88                         // subps         0x58(%ebp),%xmm1
   .byte  15,41,77,184                        // movaps        %xmm1,-0x48(%ebp)
@@ -46068,7 +48394,7 @@
   .byte  232,0,0,0,0                         // call          136a <_sk_overlay_sse2+0x18>
   .byte  88                                  // pop           %eax
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
-  .byte  15,40,144,166,118,0,0               // movaps        0x76a6(%eax),%xmm2
+  .byte  15,40,144,118,122,0,0               // movaps        0x7a76(%eax),%xmm2
   .byte  15,40,234                           // movaps        %xmm2,%xmm5
   .byte  15,92,232                           // subps         %xmm0,%xmm5
   .byte  15,40,248                           // movaps        %xmm0,%xmm7
@@ -46212,17 +48538,17 @@
   .byte  232,0,0,0,0                         // call          1539 <_sk_softlight_sse2+0x51>
   .byte  88                                  // pop           %eax
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
-  .byte  15,40,128,247,116,0,0               // movaps        0x74f7(%eax),%xmm0
+  .byte  15,40,128,199,120,0,0               // movaps        0x78c7(%eax),%xmm0
   .byte  15,41,133,120,255,255,255           // movaps        %xmm0,-0x88(%ebp)
   .byte  15,88,232                           // addps         %xmm0,%xmm5
   .byte  15,89,234                           // mulps         %xmm2,%xmm5
-  .byte  15,40,184,231,116,0,0               // movaps        0x74e7(%eax),%xmm7
+  .byte  15,40,184,183,120,0,0               // movaps        0x78b7(%eax),%xmm7
   .byte  15,41,125,216                       // movaps        %xmm7,-0x28(%ebp)
   .byte  15,92,249                           // subps         %xmm1,%xmm7
   .byte  15,82,209                           // rsqrtps       %xmm1,%xmm2
   .byte  15,83,242                           // rcpps         %xmm2,%xmm6
   .byte  15,92,241                           // subps         %xmm1,%xmm6
-  .byte  15,40,128,7,117,0,0                 // movaps        0x7507(%eax),%xmm0
+  .byte  15,40,128,215,120,0,0               // movaps        0x78d7(%eax),%xmm0
   .byte  15,41,69,168                        // movaps        %xmm0,-0x58(%ebp)
   .byte  15,89,200                           // mulps         %xmm0,%xmm1
   .byte  15,88,205                           // addps         %xmm5,%xmm1
@@ -46435,7 +48761,7 @@
   .byte  15,41,101,200                       // movaps        %xmm4,-0x38(%ebp)
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
   .byte  15,89,238                           // mulps         %xmm6,%xmm5
-  .byte  15,40,184,118,114,0,0               // movaps        0x7276(%eax),%xmm7
+  .byte  15,40,184,70,118,0,0                // movaps        0x7646(%eax),%xmm7
   .byte  15,41,125,168                       // movaps        %xmm7,-0x58(%ebp)
   .byte  15,92,125,88                        // subps         0x58(%ebp),%xmm7
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
@@ -46465,15 +48791,15 @@
   .byte  15,89,243                           // mulps         %xmm3,%xmm6
   .byte  15,89,235                           // mulps         %xmm3,%xmm5
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,40,152,70,114,0,0                // movaps        0x7246(%eax),%xmm3
+  .byte  15,40,152,22,118,0,0                // movaps        0x7616(%eax),%xmm3
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
   .byte  15,40,77,40                         // movaps        0x28(%ebp),%xmm1
   .byte  15,89,203                           // mulps         %xmm3,%xmm1
-  .byte  15,40,160,86,114,0,0                // movaps        0x7256(%eax),%xmm4
+  .byte  15,40,160,38,118,0,0                // movaps        0x7626(%eax),%xmm4
   .byte  15,40,125,56                        // movaps        0x38(%ebp),%xmm7
   .byte  15,89,252                           // mulps         %xmm4,%xmm7
   .byte  15,88,249                           // addps         %xmm1,%xmm7
-  .byte  15,40,152,102,114,0,0               // movaps        0x7266(%eax),%xmm3
+  .byte  15,40,152,54,118,0,0                // movaps        0x7636(%eax),%xmm3
   .byte  15,40,77,72                         // movaps        0x48(%ebp),%xmm1
   .byte  15,89,203                           // mulps         %xmm3,%xmm1
   .byte  15,88,207                           // addps         %xmm7,%xmm1
@@ -46688,15 +49014,15 @@
   .byte  15,89,254                           // mulps         %xmm6,%xmm7
   .byte  232,0,0,0,0                         // call          1b58 <_sk_saturation_sse2+0x8e>
   .byte  88                                  // pop           %eax
-  .byte  15,40,176,56,111,0,0                // movaps        0x6f38(%eax),%xmm6
+  .byte  15,40,176,8,115,0,0                 // movaps        0x7308(%eax),%xmm6
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
-  .byte  15,40,160,72,111,0,0                // movaps        0x6f48(%eax),%xmm4
+  .byte  15,40,160,24,115,0,0                // movaps        0x7318(%eax),%xmm4
   .byte  15,40,77,56                         // movaps        0x38(%ebp),%xmm1
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,40,85,72                         // movaps        0x48(%ebp),%xmm2
-  .byte  15,89,144,88,111,0,0                // mulps         0x6f58(%eax),%xmm2
+  .byte  15,89,144,40,115,0,0                // mulps         0x7328(%eax),%xmm2
   .byte  15,88,209                           // addps         %xmm1,%xmm2
   .byte  15,94,232                           // divps         %xmm0,%xmm5
   .byte  15,94,216                           // divps         %xmm0,%xmm3
@@ -46712,7 +49038,7 @@
   .byte  15,89,252                           // mulps         %xmm4,%xmm7
   .byte  15,88,249                           // addps         %xmm1,%xmm7
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
-  .byte  15,89,136,88,111,0,0                // mulps         0x6f58(%eax),%xmm1
+  .byte  15,89,136,40,115,0,0                // mulps         0x7328(%eax),%xmm1
   .byte  15,88,207                           // addps         %xmm7,%xmm1
   .byte  15,89,85,216                        // mulps         -0x28(%ebp),%xmm2
   .byte  15,92,209                           // subps         %xmm1,%xmm2
@@ -46732,7 +49058,7 @@
   .byte  15,89,245                           // mulps         %xmm5,%xmm6
   .byte  15,89,227                           // mulps         %xmm3,%xmm4
   .byte  15,88,230                           // addps         %xmm6,%xmm4
-  .byte  15,40,128,88,111,0,0                // movaps        0x6f58(%eax),%xmm0
+  .byte  15,40,128,40,115,0,0                // movaps        0x7328(%eax),%xmm0
   .byte  15,89,194                           // mulps         %xmm2,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
   .byte  15,41,69,136                        // movaps        %xmm0,-0x78(%ebp)
@@ -46755,7 +49081,7 @@
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
   .byte  15,89,200                           // mulps         %xmm0,%xmm1
-  .byte  15,40,144,104,111,0,0               // movaps        0x6f68(%eax),%xmm2
+  .byte  15,40,144,56,115,0,0                // movaps        0x7338(%eax),%xmm2
   .byte  15,41,85,152                        // movaps        %xmm2,-0x68(%ebp)
   .byte  15,92,212                           // subps         %xmm4,%xmm2
   .byte  15,41,85,168                        // movaps        %xmm2,-0x58(%ebp)
@@ -46885,15 +49211,15 @@
   .byte  88                                  // pop           %eax
   .byte  15,40,85,56                         // movaps        0x38(%ebp),%xmm2
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
-  .byte  15,40,152,241,108,0,0               // movaps        0x6cf1(%eax),%xmm3
+  .byte  15,40,152,193,112,0,0               // movaps        0x70c1(%eax),%xmm3
   .byte  15,89,227                           // mulps         %xmm3,%xmm4
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
-  .byte  15,40,176,1,109,0,0                 // movaps        0x6d01(%eax),%xmm6
+  .byte  15,40,176,209,112,0,0               // movaps        0x70d1(%eax),%xmm6
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
   .byte  15,41,117,184                       // movaps        %xmm6,-0x48(%ebp)
   .byte  15,88,212                           // addps         %xmm4,%xmm2
   .byte  15,40,101,72                        // movaps        0x48(%ebp),%xmm4
-  .byte  15,40,184,17,109,0,0                // movaps        0x6d11(%eax),%xmm7
+  .byte  15,40,184,225,112,0,0               // movaps        0x70e1(%eax),%xmm7
   .byte  15,41,189,56,255,255,255            // movaps        %xmm7,-0xc8(%ebp)
   .byte  15,89,231                           // mulps         %xmm7,%xmm4
   .byte  15,88,226                           // addps         %xmm2,%xmm4
@@ -46908,7 +49234,7 @@
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
   .byte  15,88,212                           // addps         %xmm4,%xmm2
-  .byte  15,40,136,33,109,0,0                // movaps        0x6d21(%eax),%xmm1
+  .byte  15,40,136,241,112,0,0               // movaps        0x70f1(%eax),%xmm1
   .byte  15,41,77,168                        // movaps        %xmm1,-0x58(%ebp)
   .byte  15,40,225                           // movaps        %xmm1,%xmm4
   .byte  15,40,93,88                         // movaps        0x58(%ebp),%xmm3
@@ -47089,17 +49415,17 @@
   .byte  15,40,216                           // movaps        %xmm0,%xmm3
   .byte  232,0,0,0,0                         // call          2092 <_sk_luminosity_sse2+0x1a>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,126,106,0,0               // movaps        0x6a7e(%eax),%xmm4
+  .byte  15,40,160,78,110,0,0                // movaps        0x6e4e(%eax),%xmm4
   .byte  15,41,101,216                       // movaps        %xmm4,-0x28(%ebp)
   .byte  15,40,211                           // movaps        %xmm3,%xmm2
   .byte  15,89,212                           // mulps         %xmm4,%xmm2
-  .byte  15,40,128,142,106,0,0               // movaps        0x6a8e(%eax),%xmm0
+  .byte  15,40,128,94,110,0,0                // movaps        0x6e5e(%eax),%xmm0
   .byte  15,41,69,200                        // movaps        %xmm0,-0x38(%ebp)
   .byte  15,40,225                           // movaps        %xmm1,%xmm4
   .byte  15,89,224                           // mulps         %xmm0,%xmm4
   .byte  15,88,226                           // addps         %xmm2,%xmm4
   .byte  15,40,85,88                         // movaps        0x58(%ebp),%xmm2
-  .byte  15,40,184,174,106,0,0               // movaps        0x6aae(%eax),%xmm7
+  .byte  15,40,184,126,110,0,0               // movaps        0x6e7e(%eax),%xmm7
   .byte  15,41,125,152                       // movaps        %xmm7,-0x68(%ebp)
   .byte  15,92,250                           // subps         %xmm2,%xmm7
   .byte  15,89,223                           // mulps         %xmm7,%xmm3
@@ -47109,7 +49435,7 @@
   .byte  15,89,253                           // mulps         %xmm5,%xmm7
   .byte  15,41,189,120,255,255,255           // movaps        %xmm7,-0x88(%ebp)
   .byte  15,40,205                           // movaps        %xmm5,%xmm1
-  .byte  15,40,128,158,106,0,0               // movaps        0x6a9e(%eax),%xmm0
+  .byte  15,40,128,110,110,0,0               // movaps        0x6e6e(%eax),%xmm0
   .byte  15,89,200                           // mulps         %xmm0,%xmm1
   .byte  15,88,204                           // addps         %xmm4,%xmm1
   .byte  15,40,238                           // movaps        %xmm6,%xmm5
@@ -47294,7 +49620,7 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  15,133,40,1,0,0                     // jne           2464 <_sk_srcover_rgba_8888_sse2+0x15d>
   .byte  243,15,111,12,142                   // movdqu        (%esi,%ecx,4),%xmm1
-  .byte  102,15,111,135,42,104,0,0           // movdqa        0x682a(%edi),%xmm0
+  .byte  102,15,111,135,250,107,0,0          // movdqa        0x6bfa(%edi),%xmm0
   .byte  102,15,111,225                      // movdqa        %xmm1,%xmm4
   .byte  102,15,219,224                      // pand          %xmm0,%xmm4
   .byte  102,15,111,249                      // movdqa        %xmm1,%xmm7
@@ -47304,9 +49630,9 @@
   .byte  102,15,114,213,16                   // psrld         $0x10,%xmm5
   .byte  102,15,219,232                      // pand          %xmm0,%xmm5
   .byte  15,91,244                           // cvtdq2ps      %xmm4,%xmm6
-  .byte  15,40,167,58,104,0,0                // movaps        0x683a(%edi),%xmm4
+  .byte  15,40,167,10,108,0,0                // movaps        0x6c0a(%edi),%xmm4
   .byte  15,92,227                           // subps         %xmm3,%xmm4
-  .byte  15,40,135,74,104,0,0                // movaps        0x684a(%edi),%xmm0
+  .byte  15,40,135,26,108,0,0                // movaps        0x6c1a(%edi),%xmm0
   .byte  15,41,69,216                        // movaps        %xmm0,-0x28(%ebp)
   .byte  15,40,85,200                        // movaps        -0x38(%ebp),%xmm2
   .byte  15,89,208                           // mulps         %xmm0,%xmm2
@@ -47465,7 +49791,7 @@
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
-  .byte  15,40,184,36,102,0,0                // movaps        0x6624(%eax),%xmm7
+  .byte  15,40,184,244,105,0,0               // movaps        0x69f4(%eax),%xmm7
   .byte  15,93,199                           // minps         %xmm7,%xmm0
   .byte  15,93,207                           // minps         %xmm7,%xmm1
   .byte  15,93,215                           // minps         %xmm7,%xmm2
@@ -47510,7 +49836,7 @@
   .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
-  .byte  15,93,152,191,101,0,0               // minps         0x65bf(%eax),%xmm3
+  .byte  15,93,152,143,105,0,0               // minps         0x698f(%eax),%xmm3
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  15,93,195                           // minps         %xmm3,%xmm0
   .byte  15,93,203                           // minps         %xmm3,%xmm1
@@ -47550,7 +49876,7 @@
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
-  .byte  15,93,160,93,101,0,0                // minps         0x655d(%eax),%xmm4
+  .byte  15,93,160,45,105,0,0                // minps         0x692d(%eax),%xmm4
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
@@ -47660,43 +49986,6 @@
   .byte  93                                  // pop           %ebp
   .byte  195                                 // ret
 
-HIDDEN _sk_swap_rb_dst_sse2
-.globl _sk_swap_rb_dst_sse2
-FUNCTION(_sk_swap_rb_dst_sse2)
-_sk_swap_rb_dst_sse2:
-  .byte  85                                  // push          %ebp
-  .byte  137,229                             // mov           %esp,%ebp
-  .byte  83                                  // push          %ebx
-  .byte  87                                  // push          %edi
-  .byte  86                                  // push          %esi
-  .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  139,69,8                            // mov           0x8(%ebp),%eax
-  .byte  139,77,16                           // mov           0x10(%ebp),%ecx
-  .byte  139,85,20                           // mov           0x14(%ebp),%edx
-  .byte  139,117,24                          // mov           0x18(%ebp),%esi
-  .byte  15,40,101,72                        // movaps        0x48(%ebp),%xmm4
-  .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
-  .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
-  .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
-  .byte  139,125,12                          // mov           0xc(%ebp),%edi
-  .byte  141,95,4                            // lea           0x4(%edi),%ebx
-  .byte  15,41,124,36,80                     // movaps        %xmm7,0x50(%esp)
-  .byte  15,41,116,36,64                     // movaps        %xmm6,0x40(%esp)
-  .byte  15,41,108,36,48                     // movaps        %xmm5,0x30(%esp)
-  .byte  15,41,100,36,32                     // movaps        %xmm4,0x20(%esp)
-  .byte  137,116,36,16                       // mov           %esi,0x10(%esp)
-  .byte  137,84,36,12                        // mov           %edx,0xc(%esp)
-  .byte  137,76,36,8                         // mov           %ecx,0x8(%esp)
-  .byte  137,92,36,4                         // mov           %ebx,0x4(%esp)
-  .byte  137,4,36                            // mov           %eax,(%esp)
-  .byte  255,23                              // call          *(%edi)
-  .byte  131,196,108                         // add           $0x6c,%esp
-  .byte  94                                  // pop           %esi
-  .byte  95                                  // pop           %edi
-  .byte  91                                  // pop           %ebx
-  .byte  93                                  // pop           %ebp
-  .byte  195                                 // ret
-
 HIDDEN _sk_move_src_dst_sse2
 .globl _sk_move_src_dst_sse2
 FUNCTION(_sk_move_src_dst_sse2)
@@ -47817,7 +50106,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          28fc <_sk_unpremul_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          28a0 <_sk_unpremul_sse2+0xe>
   .byte  89                                  // pop           %ecx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -47826,7 +50115,7 @@
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
   .byte  15,87,246                           // xorps         %xmm6,%xmm6
-  .byte  15,40,185,180,98,0,0                // movaps        0x62b4(%ecx),%xmm7
+  .byte  15,40,185,224,102,0,0               // movaps        0x66e0(%ecx),%xmm7
   .byte  15,94,251                           // divps         %xmm3,%xmm7
   .byte  15,194,243,4                        // cmpneqps      %xmm3,%xmm6
   .byte  15,84,247                           // andps         %xmm7,%xmm6
@@ -47868,23 +50157,23 @@
   .byte  15,40,242                           // movaps        %xmm2,%xmm6
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
-  .byte  232,0,0,0,0                         // call          298b <_sk_from_srgb_sse2+0x1e>
+  .byte  232,0,0,0,0                         // call          292f <_sk_from_srgb_sse2+0x1e>
   .byte  88                                  // pop           %eax
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,89,219                           // mulps         %xmm3,%xmm3
-  .byte  15,40,160,69,98,0,0                 // movaps        0x6245(%eax),%xmm4
+  .byte  15,40,160,113,102,0,0               // movaps        0x6671(%eax),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
-  .byte  15,40,136,85,98,0,0                 // movaps        0x6255(%eax),%xmm1
+  .byte  15,40,136,129,102,0,0               // movaps        0x6681(%eax),%xmm1
   .byte  15,41,77,200                        // movaps        %xmm1,-0x38(%ebp)
   .byte  15,88,193                           // addps         %xmm1,%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,40,152,53,98,0,0                 // movaps        0x6235(%eax),%xmm3
+  .byte  15,40,152,97,102,0,0                // movaps        0x6661(%eax),%xmm3
   .byte  15,40,202                           // movaps        %xmm2,%xmm1
   .byte  15,89,203                           // mulps         %xmm3,%xmm1
-  .byte  15,40,184,101,98,0,0                // movaps        0x6265(%eax),%xmm7
+  .byte  15,40,184,145,102,0,0               // movaps        0x6691(%eax),%xmm7
   .byte  15,41,125,216                       // movaps        %xmm7,-0x28(%ebp)
   .byte  15,88,199                           // addps         %xmm7,%xmm0
-  .byte  15,40,184,117,98,0,0                // movaps        0x6275(%eax),%xmm7
+  .byte  15,40,184,161,102,0,0               // movaps        0x66a1(%eax),%xmm7
   .byte  15,194,215,1                        // cmpltps       %xmm7,%xmm2
   .byte  15,84,202                           // andps         %xmm2,%xmm1
   .byte  15,85,208                           // andnps        %xmm0,%xmm2
@@ -47958,24 +50247,24 @@
   .byte  15,41,85,168                        // movaps        %xmm2,-0x58(%ebp)
   .byte  15,41,77,184                        // movaps        %xmm1,-0x48(%ebp)
   .byte  15,41,69,200                        // movaps        %xmm0,-0x38(%ebp)
-  .byte  232,0,0,0,0                         // call          2aae <_sk_from_srgb_dst_sse2+0x21>
+  .byte  232,0,0,0,0                         // call          2a52 <_sk_from_srgb_dst_sse2+0x21>
   .byte  88                                  // pop           %eax
   .byte  15,40,77,40                         // movaps        0x28(%ebp),%xmm1
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
-  .byte  15,40,168,114,97,0,0                // movaps        0x6172(%eax),%xmm5
+  .byte  15,40,168,158,101,0,0               // movaps        0x659e(%eax),%xmm5
   .byte  15,40,249                           // movaps        %xmm1,%xmm7
   .byte  15,89,253                           // mulps         %xmm5,%xmm7
-  .byte  15,40,144,130,97,0,0                // movaps        0x6182(%eax),%xmm2
+  .byte  15,40,144,174,101,0,0               // movaps        0x65ae(%eax),%xmm2
   .byte  15,41,85,216                        // movaps        %xmm2,-0x28(%ebp)
   .byte  15,88,250                           // addps         %xmm2,%xmm7
   .byte  15,89,248                           // mulps         %xmm0,%xmm7
-  .byte  15,40,176,98,97,0,0                 // movaps        0x6162(%eax),%xmm6
+  .byte  15,40,176,142,101,0,0               // movaps        0x658e(%eax),%xmm6
   .byte  15,40,225                           // movaps        %xmm1,%xmm4
   .byte  15,89,230                           // mulps         %xmm6,%xmm4
-  .byte  15,40,152,146,97,0,0                // movaps        0x6192(%eax),%xmm3
+  .byte  15,40,152,190,101,0,0               // movaps        0x65be(%eax),%xmm3
   .byte  15,88,251                           // addps         %xmm3,%xmm7
-  .byte  15,40,144,162,97,0,0                // movaps        0x61a2(%eax),%xmm2
+  .byte  15,40,144,206,101,0,0               // movaps        0x65ce(%eax),%xmm2
   .byte  15,194,202,1                        // cmpltps       %xmm2,%xmm1
   .byte  15,84,225                           // andps         %xmm1,%xmm4
   .byte  15,85,207                           // andnps        %xmm7,%xmm1
@@ -48048,28 +50337,28 @@
   .byte  15,40,250                           // movaps        %xmm2,%xmm7
   .byte  15,40,241                           // movaps        %xmm1,%xmm6
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
-  .byte  232,0,0,0,0                         // call          2bce <_sk_to_srgb_sse2+0x1e>
+  .byte  232,0,0,0,0                         // call          2b72 <_sk_to_srgb_sse2+0x1e>
   .byte  88                                  // pop           %eax
   .byte  15,82,218                           // rsqrtps       %xmm2,%xmm3
-  .byte  15,40,160,162,96,0,0                // movaps        0x60a2(%eax),%xmm4
+  .byte  15,40,160,206,100,0,0               // movaps        0x64ce(%eax),%xmm4
   .byte  15,40,235                           // movaps        %xmm3,%xmm5
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
-  .byte  15,40,128,178,96,0,0                // movaps        0x60b2(%eax),%xmm0
+  .byte  15,40,128,222,100,0,0               // movaps        0x64de(%eax),%xmm0
   .byte  15,41,69,216                        // movaps        %xmm0,-0x28(%ebp)
   .byte  15,88,232                           // addps         %xmm0,%xmm5
   .byte  15,89,235                           // mulps         %xmm3,%xmm5
-  .byte  15,40,128,194,96,0,0                // movaps        0x60c2(%eax),%xmm0
+  .byte  15,40,128,238,100,0,0               // movaps        0x64ee(%eax),%xmm0
   .byte  15,41,69,184                        // movaps        %xmm0,-0x48(%ebp)
   .byte  15,88,232                           // addps         %xmm0,%xmm5
-  .byte  15,40,128,210,96,0,0                // movaps        0x60d2(%eax),%xmm0
+  .byte  15,40,128,254,100,0,0               // movaps        0x64fe(%eax),%xmm0
   .byte  15,41,69,200                        // movaps        %xmm0,-0x38(%ebp)
   .byte  15,88,216                           // addps         %xmm0,%xmm3
   .byte  15,83,195                           // rcpps         %xmm3,%xmm0
   .byte  15,89,197                           // mulps         %xmm5,%xmm0
-  .byte  15,40,168,146,96,0,0                // movaps        0x6092(%eax),%xmm5
+  .byte  15,40,168,190,100,0,0               // movaps        0x64be(%eax),%xmm5
   .byte  15,40,202                           // movaps        %xmm2,%xmm1
   .byte  15,89,205                           // mulps         %xmm5,%xmm1
-  .byte  15,40,152,226,96,0,0                // movaps        0x60e2(%eax),%xmm3
+  .byte  15,40,152,14,101,0,0                // movaps        0x650e(%eax),%xmm3
   .byte  15,194,211,1                        // cmpltps       %xmm3,%xmm2
   .byte  15,84,202                           // andps         %xmm2,%xmm1
   .byte  15,85,208                           // andnps        %xmm0,%xmm2
@@ -48146,7 +50435,7 @@
   .byte  15,41,93,184                        // movaps        %xmm3,-0x48(%ebp)
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
-  .byte  232,0,0,0,0                         // call          2d0d <_sk_rgb_to_hsl_sse2+0x1b>
+  .byte  232,0,0,0,0                         // call          2cb1 <_sk_rgb_to_hsl_sse2+0x1b>
   .byte  88                                  // pop           %eax
   .byte  15,40,204                           // movaps        %xmm4,%xmm1
   .byte  15,95,205                           // maxps         %xmm5,%xmm1
@@ -48158,13 +50447,13 @@
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  15,92,199                           // subps         %xmm7,%xmm0
   .byte  15,41,69,200                        // movaps        %xmm0,-0x38(%ebp)
-  .byte  15,40,152,179,95,0,0                // movaps        0x5fb3(%eax),%xmm3
+  .byte  15,40,152,223,99,0,0                // movaps        0x63df(%eax),%xmm3
   .byte  15,94,216                           // divps         %xmm0,%xmm3
   .byte  15,40,197                           // movaps        %xmm5,%xmm0
   .byte  15,92,194                           // subps         %xmm2,%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
   .byte  15,194,234,1                        // cmpltps       %xmm2,%xmm5
-  .byte  15,84,168,195,95,0,0                // andps         0x5fc3(%eax),%xmm5
+  .byte  15,84,168,239,99,0,0                // andps         0x63ef(%eax),%xmm5
   .byte  15,88,232                           // addps         %xmm0,%xmm5
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  15,194,196,0                        // cmpeqps       %xmm4,%xmm0
@@ -48174,9 +50463,9 @@
   .byte  15,92,101,216                       // subps         -0x28(%ebp),%xmm4
   .byte  15,89,211                           // mulps         %xmm3,%xmm2
   .byte  15,89,227                           // mulps         %xmm3,%xmm4
-  .byte  15,40,152,211,95,0,0                // movaps        0x5fd3(%eax),%xmm3
+  .byte  15,40,152,255,99,0,0                // movaps        0x63ff(%eax),%xmm3
   .byte  15,88,211                           // addps         %xmm3,%xmm2
-  .byte  15,88,160,227,95,0,0                // addps         0x5fe3(%eax),%xmm4
+  .byte  15,88,160,15,100,0,0                // addps         0x640f(%eax),%xmm4
   .byte  15,84,214                           // andps         %xmm6,%xmm2
   .byte  15,85,244                           // andnps        %xmm4,%xmm6
   .byte  15,86,242                           // orps          %xmm2,%xmm6
@@ -48191,7 +50480,7 @@
   .byte  15,194,231,4                        // cmpneqps      %xmm7,%xmm4
   .byte  15,92,217                           // subps         %xmm1,%xmm3
   .byte  15,88,207                           // addps         %xmm7,%xmm1
-  .byte  15,40,168,3,96,0,0                  // movaps        0x6003(%eax),%xmm5
+  .byte  15,40,168,47,100,0,0                // movaps        0x642f(%eax),%xmm5
   .byte  15,92,223                           // subps         %xmm7,%xmm3
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
@@ -48204,7 +50493,7 @@
   .byte  15,40,77,200                        // movaps        -0x38(%ebp),%xmm1
   .byte  15,94,205                           // divps         %xmm5,%xmm1
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
-  .byte  15,89,128,243,95,0,0                // mulps         0x5ff3(%eax),%xmm0
+  .byte  15,89,128,31,100,0,0                // mulps         0x641f(%eax),%xmm0
   .byte  15,84,196                           // andps         %xmm4,%xmm0
   .byte  15,84,204                           // andps         %xmm4,%xmm1
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
@@ -48240,9 +50529,9 @@
   .byte  129,236,44,1,0,0                    // sub           $0x12c,%esp
   .byte  15,41,157,40,255,255,255            // movaps        %xmm3,-0xd8(%ebp)
   .byte  15,41,69,200                        // movaps        %xmm0,-0x38(%ebp)
-  .byte  232,0,0,0,0                         // call          2e42 <_sk_hsl_to_rgb_sse2+0x1c>
+  .byte  232,0,0,0,0                         // call          2de6 <_sk_hsl_to_rgb_sse2+0x1c>
   .byte  88                                  // pop           %eax
-  .byte  15,40,152,222,94,0,0                // movaps        0x5ede(%eax),%xmm3
+  .byte  15,40,152,10,99,0,0                 // movaps        0x630a(%eax),%xmm3
   .byte  15,40,227                           // movaps        %xmm3,%xmm4
   .byte  15,40,243                           // movaps        %xmm3,%xmm6
   .byte  15,41,181,72,255,255,255            // movaps        %xmm6,-0xb8(%ebp)
@@ -48256,13 +50545,13 @@
   .byte  15,84,236                           // andps         %xmm4,%xmm5
   .byte  15,85,225                           // andnps        %xmm1,%xmm4
   .byte  15,86,229                           // orps          %xmm5,%xmm4
-  .byte  15,40,136,238,94,0,0                // movaps        0x5eee(%eax),%xmm1
+  .byte  15,40,136,26,99,0,0                 // movaps        0x631a(%eax),%xmm1
   .byte  15,88,200                           // addps         %xmm0,%xmm1
   .byte  243,15,91,193                       // cvttps2dq     %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,217                           // movaps        %xmm1,%xmm3
   .byte  15,194,216,1                        // cmpltps       %xmm0,%xmm3
-  .byte  15,40,168,254,94,0,0                // movaps        0x5efe(%eax),%xmm5
+  .byte  15,40,168,42,99,0,0                 // movaps        0x632a(%eax),%xmm5
   .byte  15,41,173,104,255,255,255           // movaps        %xmm5,-0x98(%ebp)
   .byte  15,84,221                           // andps         %xmm5,%xmm3
   .byte  15,92,195                           // subps         %xmm3,%xmm0
@@ -48273,19 +50562,19 @@
   .byte  15,41,101,184                       // movaps        %xmm4,-0x48(%ebp)
   .byte  15,88,237                           // addps         %xmm5,%xmm5
   .byte  15,92,236                           // subps         %xmm4,%xmm5
-  .byte  15,40,144,14,95,0,0                 // movaps        0x5f0e(%eax),%xmm2
+  .byte  15,40,144,58,99,0,0                 // movaps        0x633a(%eax),%xmm2
   .byte  15,41,85,168                        // movaps        %xmm2,-0x58(%ebp)
   .byte  15,194,209,2                        // cmpleps       %xmm1,%xmm2
   .byte  15,92,229                           // subps         %xmm5,%xmm4
   .byte  15,40,198                           // movaps        %xmm6,%xmm0
   .byte  15,194,193,2                        // cmpleps       %xmm1,%xmm0
-  .byte  15,40,176,62,95,0,0                 // movaps        0x5f3e(%eax),%xmm6
+  .byte  15,40,176,106,99,0,0                // movaps        0x636a(%eax),%xmm6
   .byte  15,41,181,88,255,255,255            // movaps        %xmm6,-0xa8(%ebp)
   .byte  15,194,241,2                        // cmpleps       %xmm1,%xmm6
-  .byte  15,40,152,30,95,0,0                 // movaps        0x5f1e(%eax),%xmm3
+  .byte  15,40,152,74,99,0,0                 // movaps        0x634a(%eax),%xmm3
   .byte  15,41,93,152                        // movaps        %xmm3,-0x68(%ebp)
   .byte  15,89,203                           // mulps         %xmm3,%xmm1
-  .byte  15,40,184,46,95,0,0                 // movaps        0x5f2e(%eax),%xmm7
+  .byte  15,40,184,90,99,0,0                 // movaps        0x635a(%eax),%xmm7
   .byte  15,41,125,136                       // movaps        %xmm7,-0x78(%ebp)
   .byte  15,92,249                           // subps         %xmm1,%xmm7
   .byte  15,89,252                           // mulps         %xmm4,%xmm7
@@ -48310,18 +50599,18 @@
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,202                           // movaps        %xmm2,%xmm1
   .byte  15,194,200,1                        // cmpltps       %xmm0,%xmm1
-  .byte  15,84,136,254,94,0,0                // andps         0x5efe(%eax),%xmm1
+  .byte  15,84,136,42,99,0,0                 // andps         0x632a(%eax),%xmm1
   .byte  15,92,193                           // subps         %xmm1,%xmm0
   .byte  15,40,202                           // movaps        %xmm2,%xmm1
   .byte  15,92,200                           // subps         %xmm0,%xmm1
-  .byte  15,40,128,14,95,0,0                 // movaps        0x5f0e(%eax),%xmm0
+  .byte  15,40,128,58,99,0,0                 // movaps        0x633a(%eax),%xmm0
   .byte  15,194,193,2                        // cmpleps       %xmm1,%xmm0
-  .byte  15,40,144,222,94,0,0                // movaps        0x5ede(%eax),%xmm2
+  .byte  15,40,144,10,99,0,0                 // movaps        0x630a(%eax),%xmm2
   .byte  15,194,209,2                        // cmpleps       %xmm1,%xmm2
-  .byte  15,40,152,62,95,0,0                 // movaps        0x5f3e(%eax),%xmm3
+  .byte  15,40,152,106,99,0,0                // movaps        0x636a(%eax),%xmm3
   .byte  15,194,217,2                        // cmpleps       %xmm1,%xmm3
-  .byte  15,89,136,30,95,0,0                 // mulps         0x5f1e(%eax),%xmm1
-  .byte  15,40,176,46,95,0,0                 // movaps        0x5f2e(%eax),%xmm6
+  .byte  15,89,136,74,99,0,0                 // mulps         0x634a(%eax),%xmm1
+  .byte  15,40,176,90,99,0,0                 // movaps        0x635a(%eax),%xmm6
   .byte  15,92,241                           // subps         %xmm1,%xmm6
   .byte  15,89,244                           // mulps         %xmm4,%xmm6
   .byte  15,88,245                           // addps         %xmm5,%xmm6
@@ -48341,7 +50630,7 @@
   .byte  15,40,117,216                       // movaps        -0x28(%ebp),%xmm6
   .byte  15,85,243                           // andnps        %xmm3,%xmm6
   .byte  15,40,85,200                        // movaps        -0x38(%ebp),%xmm2
-  .byte  15,88,144,78,95,0,0                 // addps         0x5f4e(%eax),%xmm2
+  .byte  15,88,144,122,99,0,0                // addps         0x637a(%eax),%xmm2
   .byte  243,15,91,194                       // cvttps2dq     %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,202                           // movaps        %xmm2,%xmm1
@@ -48465,7 +50754,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          3148 <_sk_scale_u8_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          30ec <_sk_scale_u8_sse2+0xe>
   .byte  91                                  // pop           %ebx
   .byte  15,40,125,72                        // movaps        0x48(%ebp),%xmm7
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
@@ -48477,13 +50766,13 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  117,106                             // jne           31d3 <_sk_scale_u8_sse2+0x99>
+  .byte  117,106                             // jne           3177 <_sk_scale_u8_sse2+0x99>
   .byte  102,15,110,36,57                    // movd          (%ecx,%edi,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,163,88,92,0,0            // pand          0x5c58(%ebx),%xmm4
+  .byte  102,15,219,163,132,96,0,0           // pand          0x6084(%ebx),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,163,104,92,0,0                // mulps         0x5c68(%ebx),%xmm4
+  .byte  15,89,163,148,96,0,0                // mulps         0x6094(%ebx),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
   .byte  15,89,212                           // mulps         %xmm4,%xmm2
@@ -48511,13 +50800,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,65                              // je            3221 <_sk_scale_u8_sse2+0xe7>
+  .byte  116,65                              // je            31c5 <_sk_scale_u8_sse2+0xe7>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,23                              // je            3204 <_sk_scale_u8_sse2+0xca>
+  .byte  116,23                              // je            31a8 <_sk_scale_u8_sse2+0xca>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,131                             // jne           3176 <_sk_scale_u8_sse2+0x3c>
+  .byte  117,131                             // jne           311a <_sk_scale_u8_sse2+0x3c>
   .byte  15,182,116,57,2                     // movzbl        0x2(%ecx,%edi,1),%esi
   .byte  102,15,110,230                      // movd          %esi,%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -48528,11 +50817,11 @@
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
   .byte  15,40,109,40                        // movaps        0x28(%ebp),%xmm5
-  .byte  233,85,255,255,255                  // jmp           3176 <_sk_scale_u8_sse2+0x3c>
+  .byte  233,85,255,255,255                  // jmp           311a <_sk_scale_u8_sse2+0x3c>
   .byte  15,182,12,57                        // movzbl        (%ecx,%edi,1),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,69,255,255,255                  // jmp           3176 <_sk_scale_u8_sse2+0x3c>
+  .byte  233,69,255,255,255                  // jmp           311a <_sk_scale_u8_sse2+0x3c>
 
 HIDDEN _sk_lerp_1_float_sse2
 .globl _sk_lerp_1_float_sse2
@@ -48597,7 +50886,7 @@
   .byte  86                                  // push          %esi
   .byte  131,236,124                         // sub           $0x7c,%esp
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
-  .byte  232,0,0,0,0                         // call          32cf <_sk_lerp_u8_sse2+0x12>
+  .byte  232,0,0,0,0                         // call          3273 <_sk_lerp_u8_sse2+0x12>
   .byte  91                                  // pop           %ebx
   .byte  15,40,109,40                        // movaps        0x28(%ebp),%xmm5
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
@@ -48607,13 +50896,13 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  15,133,143,0,0,0                    // jne           337b <_sk_lerp_u8_sse2+0xbe>
+  .byte  15,133,143,0,0,0                    // jne           331f <_sk_lerp_u8_sse2+0xbe>
   .byte  102,15,110,36,57                    // movd          (%ecx,%edi,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,163,241,90,0,0           // pand          0x5af1(%ebx),%xmm4
+  .byte  102,15,219,163,29,95,0,0            // pand          0x5f1d(%ebx),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,163,1,91,0,0                  // mulps         0x5b01(%ebx),%xmm4
+  .byte  15,89,163,45,95,0,0                 // mulps         0x5f2d(%ebx),%xmm4
   .byte  15,92,197                           // subps         %xmm5,%xmm0
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
@@ -48652,13 +50941,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,69                              // je            33cd <_sk_lerp_u8_sse2+0x110>
+  .byte  116,69                              // je            3371 <_sk_lerp_u8_sse2+0x110>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,27                              // je            33b0 <_sk_lerp_u8_sse2+0xf3>
+  .byte  116,27                              // je            3354 <_sk_lerp_u8_sse2+0xf3>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,90,255,255,255               // jne           32f9 <_sk_lerp_u8_sse2+0x3c>
+  .byte  15,133,90,255,255,255               // jne           329d <_sk_lerp_u8_sse2+0x3c>
   .byte  15,182,116,57,2                     // movzbl        0x2(%ecx,%edi,1),%esi
   .byte  102,15,110,230                      // movd          %esi,%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -48669,11 +50958,11 @@
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
   .byte  15,40,109,40                        // movaps        0x28(%ebp),%xmm5
-  .byte  233,44,255,255,255                  // jmp           32f9 <_sk_lerp_u8_sse2+0x3c>
+  .byte  233,44,255,255,255                  // jmp           329d <_sk_lerp_u8_sse2+0x3c>
   .byte  15,182,12,57                        // movzbl        (%ecx,%edi,1),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,28,255,255,255                  // jmp           32f9 <_sk_lerp_u8_sse2+0x3c>
+  .byte  233,28,255,255,255                  // jmp           329d <_sk_lerp_u8_sse2+0x3c>
 
 HIDDEN _sk_lerp_565_sse2
 .globl _sk_lerp_565_sse2
@@ -48685,7 +50974,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          33eb <_sk_lerp_565_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          338f <_sk_lerp_565_sse2+0xe>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -48694,20 +50983,20 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  15,133,212,0,0,0                    // jne           34d8 <_sk_lerp_565_sse2+0xfb>
+  .byte  15,133,212,0,0,0                    // jne           347c <_sk_lerp_565_sse2+0xfb>
   .byte  243,15,126,52,121                   // movq          (%ecx,%edi,2),%xmm6
   .byte  102,15,97,240                       // punpcklwd     %xmm0,%xmm6
-  .byte  102,15,111,163,245,89,0,0           // movdqa        0x59f5(%ebx),%xmm4
+  .byte  102,15,111,163,33,94,0,0            // movdqa        0x5e21(%ebx),%xmm4
   .byte  102,15,219,230                      // pand          %xmm6,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,163,5,90,0,0                  // mulps         0x5a05(%ebx),%xmm4
-  .byte  102,15,111,187,21,90,0,0            // movdqa        0x5a15(%ebx),%xmm7
+  .byte  15,89,163,49,94,0,0                 // mulps         0x5e31(%ebx),%xmm4
+  .byte  102,15,111,187,65,94,0,0            // movdqa        0x5e41(%ebx),%xmm7
   .byte  102,15,219,254                      // pand          %xmm6,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
-  .byte  15,89,187,37,90,0,0                 // mulps         0x5a25(%ebx),%xmm7
-  .byte  102,15,219,179,53,90,0,0            // pand          0x5a35(%ebx),%xmm6
+  .byte  15,89,187,81,94,0,0                 // mulps         0x5e51(%ebx),%xmm7
+  .byte  102,15,219,179,97,94,0,0            // pand          0x5e61(%ebx),%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,179,69,90,0,0                 // mulps         0x5a45(%ebx),%xmm6
+  .byte  15,89,179,113,94,0,0                // mulps         0x5e71(%ebx),%xmm6
   .byte  15,40,109,40                        // movaps        0x28(%ebp),%xmm5
   .byte  15,92,197                           // subps         %xmm5,%xmm0
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
@@ -48755,13 +51044,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,58                              // je            351f <_sk_lerp_565_sse2+0x142>
+  .byte  116,58                              // je            34c3 <_sk_lerp_565_sse2+0x142>
   .byte  102,15,239,246                      // pxor          %xmm6,%xmm6
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,27                              // je            350d <_sk_lerp_565_sse2+0x130>
+  .byte  116,27                              // je            34b1 <_sk_lerp_565_sse2+0x130>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,17,255,255,255               // jne           340d <_sk_lerp_565_sse2+0x30>
+  .byte  15,133,17,255,255,255               // jne           33b1 <_sk_lerp_565_sse2+0x30>
   .byte  15,183,116,121,4                    // movzwl        0x4(%ecx,%edi,2),%esi
   .byte  102,15,110,230                      // movd          %esi,%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -48769,11 +51058,11 @@
   .byte  102,15,110,36,121                   // movd          (%ecx,%edi,2),%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
   .byte  242,15,16,244                       // movsd         %xmm4,%xmm6
-  .byte  233,238,254,255,255                 // jmp           340d <_sk_lerp_565_sse2+0x30>
+  .byte  233,238,254,255,255                 // jmp           33b1 <_sk_lerp_565_sse2+0x30>
   .byte  15,183,12,121                       // movzwl        (%ecx,%edi,2),%ecx
   .byte  102,15,110,241                      // movd          %ecx,%xmm6
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,222,254,255,255                 // jmp           340d <_sk_lerp_565_sse2+0x30>
+  .byte  233,222,254,255,255                 // jmp           33b1 <_sk_lerp_565_sse2+0x30>
 
 HIDDEN _sk_load_tables_sse2
 .globl _sk_load_tables_sse2
@@ -48785,7 +51074,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          353d <_sk_load_tables_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          34e1 <_sk_load_tables_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,24                           // mov           0x18(%ebp),%eax
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
@@ -48793,9 +51082,9 @@
   .byte  133,192                             // test          %eax,%eax
   .byte  139,17                              // mov           (%ecx),%edx
   .byte  139,58                              // mov           (%edx),%edi
-  .byte  15,133,75,1,0,0                     // jne           369e <_sk_load_tables_sse2+0x16f>
+  .byte  15,133,75,1,0,0                     // jne           3642 <_sk_load_tables_sse2+0x16f>
   .byte  243,15,111,28,159                   // movdqu        (%edi,%ebx,4),%xmm3
-  .byte  102,15,111,150,3,89,0,0             // movdqa        0x5903(%esi),%xmm2
+  .byte  102,15,111,150,47,93,0,0            // movdqa        0x5d2f(%esi),%xmm2
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  102,15,112,200,229                  // pshufd        $0xe5,%xmm0,%xmm1
@@ -48851,7 +51140,7 @@
   .byte  15,20,215                           // unpcklps      %xmm7,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,158,19,89,0,0                 // mulps         0x5913(%esi),%xmm3
+  .byte  15,89,158,63,93,0,0                 // mulps         0x5d3f(%esi),%xmm3
   .byte  139,77,12                           // mov           0xc(%ebp),%ecx
   .byte  137,206                             // mov           %ecx,%esi
   .byte  141,78,8                            // lea           0x8(%esi),%ecx
@@ -48880,18 +51169,18 @@
   .byte  137,193                             // mov           %eax,%ecx
   .byte  128,225,3                           // and           $0x3,%cl
   .byte  128,249,1                           // cmp           $0x1,%cl
-  .byte  116,39                              // je            36cf <_sk_load_tables_sse2+0x1a0>
+  .byte  116,39                              // je            3673 <_sk_load_tables_sse2+0x1a0>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  128,249,2                           // cmp           $0x2,%cl
-  .byte  116,20                              // je            36c5 <_sk_load_tables_sse2+0x196>
+  .byte  116,20                              // je            3669 <_sk_load_tables_sse2+0x196>
   .byte  128,249,3                           // cmp           $0x3,%cl
-  .byte  15,133,158,254,255,255              // jne           3558 <_sk_load_tables_sse2+0x29>
+  .byte  15,133,158,254,255,255              // jne           34fc <_sk_load_tables_sse2+0x29>
   .byte  102,15,110,68,159,8                 // movd          0x8(%edi,%ebx,4),%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  102,15,18,28,159                    // movlpd        (%edi,%ebx,4),%xmm3
-  .byte  233,137,254,255,255                 // jmp           3558 <_sk_load_tables_sse2+0x29>
+  .byte  233,137,254,255,255                 // jmp           34fc <_sk_load_tables_sse2+0x29>
   .byte  102,15,110,28,159                   // movd          (%edi,%ebx,4),%xmm3
-  .byte  233,127,254,255,255                 // jmp           3558 <_sk_load_tables_sse2+0x29>
+  .byte  233,127,254,255,255                 // jmp           34fc <_sk_load_tables_sse2+0x29>
 
 HIDDEN _sk_load_tables_u16_be_sse2
 .globl _sk_load_tables_u16_be_sse2
@@ -48903,7 +51192,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,140,0,0,0                   // sub           $0x8c,%esp
-  .byte  232,0,0,0,0                         // call          36ea <_sk_load_tables_u16_be_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          368e <_sk_load_tables_u16_be_sse2+0x11>
   .byte  95                                  // pop           %edi
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
@@ -48912,7 +51201,7 @@
   .byte  139,11                              // mov           (%ebx),%ecx
   .byte  141,52,149,0,0,0,0                  // lea           0x0(,%edx,4),%esi
   .byte  186,255,0,255,0                     // mov           $0xff00ff,%edx
-  .byte  15,133,229,1,0,0                    // jne           38f0 <_sk_load_tables_u16_be_sse2+0x217>
+  .byte  15,133,229,1,0,0                    // jne           3894 <_sk_load_tables_u16_be_sse2+0x217>
   .byte  102,15,16,4,113                     // movupd        (%ecx,%esi,2),%xmm0
   .byte  243,15,111,76,113,16                // movdqu        0x10(%ecx,%esi,2),%xmm1
   .byte  102,15,40,216                       // movapd        %xmm0,%xmm3
@@ -49009,7 +51298,7 @@
   .byte  243,15,126,93,208                   // movq          -0x30(%ebp),%xmm3
   .byte  102,15,97,223                       // punpcklwd     %xmm7,%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,159,118,87,0,0                // mulps         0x5776(%edi),%xmm3
+  .byte  15,89,159,162,91,0,0                // mulps         0x5ba2(%edi),%xmm3
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  137,193                             // mov           %eax,%ecx
   .byte  141,65,8                            // lea           0x8(%ecx),%eax
@@ -49041,12 +51330,12 @@
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  139,69,24                           // mov           0x18(%ebp),%eax
   .byte  131,248,1                           // cmp           $0x1,%eax
-  .byte  15,132,17,254,255,255               // je            3716 <_sk_load_tables_u16_be_sse2+0x3d>
+  .byte  15,132,17,254,255,255               // je            36ba <_sk_load_tables_u16_be_sse2+0x3d>
   .byte  102,15,22,68,113,8                  // movhpd        0x8(%ecx,%esi,2),%xmm0
   .byte  131,248,3                           // cmp           $0x3,%eax
-  .byte  15,130,2,254,255,255                // jb            3716 <_sk_load_tables_u16_be_sse2+0x3d>
+  .byte  15,130,2,254,255,255                // jb            36ba <_sk_load_tables_u16_be_sse2+0x3d>
   .byte  243,15,126,76,113,16                // movq          0x10(%ecx,%esi,2),%xmm1
-  .byte  233,247,253,255,255                 // jmp           3716 <_sk_load_tables_u16_be_sse2+0x3d>
+  .byte  233,247,253,255,255                 // jmp           36ba <_sk_load_tables_u16_be_sse2+0x3d>
 
 HIDDEN _sk_load_tables_rgb_u16_be_sse2
 .globl _sk_load_tables_rgb_u16_be_sse2
@@ -49058,7 +51347,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,124                         // sub           $0x7c,%esp
-  .byte  232,0,0,0,0                         // call          392d <_sk_load_tables_rgb_u16_be_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          38d1 <_sk_load_tables_rgb_u16_be_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  137,69,240                          // mov           %eax,-0x10(%ebp)
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -49068,7 +51357,7 @@
   .byte  139,19                              // mov           (%ebx),%edx
   .byte  141,60,73                           // lea           (%ecx,%ecx,2),%edi
   .byte  190,255,0,255,0                     // mov           $0xff00ff,%esi
-  .byte  15,133,198,1,0,0                    // jne           3b13 <_sk_load_tables_rgb_u16_be_sse2+0x1f4>
+  .byte  15,133,198,1,0,0                    // jne           3ab7 <_sk_load_tables_rgb_u16_be_sse2+0x1f4>
   .byte  243,15,111,12,122                   // movdqu        (%edx,%edi,2),%xmm1
   .byte  243,15,111,92,122,8                 // movdqu        0x8(%edx,%edi,2),%xmm3
   .byte  102,15,115,219,4                    // psrldq        $0x4,%xmm3
@@ -49178,7 +51467,7 @@
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  137,4,36                            // mov           %eax,(%esp)
   .byte  139,69,240                          // mov           -0x10(%ebp),%eax
-  .byte  15,40,152,67,85,0,0                 // movaps        0x5543(%eax),%xmm3
+  .byte  15,40,152,111,89,0,0                // movaps        0x596f(%eax),%xmm3
   .byte  15,40,197                           // movaps        %xmm5,%xmm0
   .byte  255,81,4                            // call          *0x4(%ecx)
   .byte  131,196,124                         // add           $0x7c,%esp
@@ -49192,20 +51481,20 @@
   .byte  102,15,239,210                      // pxor          %xmm2,%xmm2
   .byte  139,69,24                           // mov           0x18(%ebp),%eax
   .byte  131,248,1                           // cmp           $0x1,%eax
-  .byte  117,13                              // jne           3b38 <_sk_load_tables_rgb_u16_be_sse2+0x219>
+  .byte  117,13                              // jne           3adc <_sk_load_tables_rgb_u16_be_sse2+0x219>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,55,254,255,255                  // jmp           396f <_sk_load_tables_rgb_u16_be_sse2+0x50>
+  .byte  233,55,254,255,255                  // jmp           3913 <_sk_load_tables_rgb_u16_be_sse2+0x50>
   .byte  102,15,110,68,122,6                 // movd          0x6(%edx,%edi,2),%xmm0
   .byte  102,15,196,68,122,10,2              // pinsrw        $0x2,0xa(%edx,%edi,2),%xmm0
   .byte  102,15,239,210                      // pxor          %xmm2,%xmm2
   .byte  131,248,3                           // cmp           $0x3,%eax
-  .byte  114,18                              // jb            3b60 <_sk_load_tables_rgb_u16_be_sse2+0x241>
+  .byte  114,18                              // jb            3b04 <_sk_load_tables_rgb_u16_be_sse2+0x241>
   .byte  102,15,110,92,122,12                // movd          0xc(%edx,%edi,2),%xmm3
   .byte  102,15,196,92,122,16,2              // pinsrw        $0x2,0x10(%edx,%edi,2),%xmm3
-  .byte  233,15,254,255,255                  // jmp           396f <_sk_load_tables_rgb_u16_be_sse2+0x50>
+  .byte  233,15,254,255,255                  // jmp           3913 <_sk_load_tables_rgb_u16_be_sse2+0x50>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
-  .byte  233,6,254,255,255                   // jmp           396f <_sk_load_tables_rgb_u16_be_sse2+0x50>
+  .byte  233,6,254,255,255                   // jmp           3913 <_sk_load_tables_rgb_u16_be_sse2+0x50>
 
 HIDDEN _sk_byte_tables_sse2
 .globl _sk_byte_tables_sse2
@@ -49217,11 +51506,11 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          3b77 <_sk_byte_tables_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          3b1b <_sk_byte_tables_sse2+0xe>
   .byte  90                                  // pop           %edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  139,8                               // mov           (%eax),%ecx
-  .byte  15,40,170,9,83,0,0                  // movaps        0x5309(%edx),%xmm5
+  .byte  15,40,170,53,87,0,0                 // movaps        0x5735(%edx),%xmm5
   .byte  15,89,197                           // mulps         %xmm5,%xmm0
   .byte  102,15,91,192                       // cvtps2dq      %xmm0,%xmm0
   .byte  102,15,112,224,78                   // pshufd        $0x4e,%xmm0,%xmm4
@@ -49243,7 +51532,7 @@
   .byte  102,15,196,192,0                    // pinsrw        $0x0,%eax,%xmm0
   .byte  139,65,4                            // mov           0x4(%ecx),%eax
   .byte  102,15,196,195,1                    // pinsrw        $0x1,%ebx,%xmm0
-  .byte  15,40,162,25,83,0,0                 // movaps        0x5319(%edx),%xmm4
+  .byte  15,40,162,69,87,0,0                 // movaps        0x5745(%edx),%xmm4
   .byte  15,89,205                           // mulps         %xmm5,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
   .byte  102,15,112,241,78                   // pshufd        $0x4e,%xmm1,%xmm6
@@ -49382,12 +51671,12 @@
   .byte  15,182,60,31                        // movzbl        (%edi,%ebx,1),%edi
   .byte  193,231,8                           // shl           $0x8,%edi
   .byte  9,215                               // or            %edx,%edi
-  .byte  232,0,0,0,0                         // call          3db3 <_sk_byte_tables_rgb_sse2+0x65>
+  .byte  232,0,0,0,0                         // call          3d57 <_sk_byte_tables_rgb_sse2+0x65>
   .byte  90                                  // pop           %edx
   .byte  102,15,196,199,0                    // pinsrw        $0x0,%edi,%xmm0
   .byte  139,121,4                           // mov           0x4(%ecx),%edi
   .byte  102,15,196,198,1                    // pinsrw        $0x1,%esi,%xmm0
-  .byte  15,40,170,237,80,0,0                // movaps        0x50ed(%edx),%xmm5
+  .byte  15,40,170,25,85,0,0                 // movaps        0x5519(%edx),%xmm5
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
   .byte  102,15,112,241,78                   // pshufd        $0x4e,%xmm1,%xmm6
@@ -49716,7 +52005,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          41bc <_sk_parametric_r_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4160 <_sk_parametric_r_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -49731,15 +52020,15 @@
   .byte  15,88,244                           // addps         %xmm4,%xmm6
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
   .byte  15,91,230                           // cvtdq2ps      %xmm6,%xmm4
-  .byte  15,89,166,244,76,0,0                // mulps         0x4cf4(%esi),%xmm4
-  .byte  15,84,182,4,77,0,0                  // andps         0x4d04(%esi),%xmm6
-  .byte  15,86,182,20,77,0,0                 // orps          0x4d14(%esi),%xmm6
-  .byte  15,88,166,36,77,0,0                 // addps         0x4d24(%esi),%xmm4
-  .byte  15,40,190,52,77,0,0                 // movaps        0x4d34(%esi),%xmm7
+  .byte  15,89,166,32,81,0,0                 // mulps         0x5120(%esi),%xmm4
+  .byte  15,84,182,48,81,0,0                 // andps         0x5130(%esi),%xmm6
+  .byte  15,86,182,64,81,0,0                 // orps          0x5140(%esi),%xmm6
+  .byte  15,88,166,80,81,0,0                 // addps         0x5150(%esi),%xmm4
+  .byte  15,40,190,96,81,0,0                 // movaps        0x5160(%esi),%xmm7
   .byte  15,89,254                           // mulps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
-  .byte  15,88,182,68,77,0,0                 // addps         0x4d44(%esi),%xmm6
-  .byte  15,40,190,84,77,0,0                 // movaps        0x4d54(%esi),%xmm7
+  .byte  15,88,182,112,81,0,0                // addps         0x5170(%esi),%xmm6
+  .byte  15,40,190,128,81,0,0                // movaps        0x5180(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -49747,21 +52036,21 @@
   .byte  15,91,245                           // cvtdq2ps      %xmm5,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,40,174,100,77,0,0                // movaps        0x4d64(%esi),%xmm5
+  .byte  15,40,174,144,81,0,0                // movaps        0x5190(%esi),%xmm5
   .byte  15,84,253                           // andps         %xmm5,%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,92,254                           // subps         %xmm6,%xmm7
-  .byte  15,88,166,116,77,0,0                // addps         0x4d74(%esi),%xmm4
-  .byte  15,40,182,132,77,0,0                // movaps        0x4d84(%esi),%xmm6
+  .byte  15,88,166,160,81,0,0                // addps         0x51a0(%esi),%xmm4
+  .byte  15,40,182,176,81,0,0                // movaps        0x51b0(%esi),%xmm6
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  15,92,230                           // subps         %xmm6,%xmm4
-  .byte  15,40,182,148,77,0,0                // movaps        0x4d94(%esi),%xmm6
+  .byte  15,40,182,192,81,0,0                // movaps        0x51c0(%esi),%xmm6
   .byte  15,92,247                           // subps         %xmm7,%xmm6
-  .byte  15,40,190,164,77,0,0                // movaps        0x4da4(%esi),%xmm7
+  .byte  15,40,190,208,81,0,0                // movaps        0x51d0(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,88,252                           // addps         %xmm4,%xmm7
-  .byte  15,89,190,180,77,0,0                // mulps         0x4db4(%esi),%xmm7
+  .byte  15,89,190,224,81,0,0                // mulps         0x51e0(%esi),%xmm7
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  243,15,16,103,16                    // movss         0x10(%edi),%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
@@ -49815,7 +52104,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          431e <_sk_parametric_g_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          42c2 <_sk_parametric_g_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -49830,15 +52119,15 @@
   .byte  15,88,244                           // addps         %xmm4,%xmm6
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
   .byte  15,91,230                           // cvtdq2ps      %xmm6,%xmm4
-  .byte  15,89,166,98,76,0,0                 // mulps         0x4c62(%esi),%xmm4
-  .byte  15,84,182,114,76,0,0                // andps         0x4c72(%esi),%xmm6
-  .byte  15,86,182,130,76,0,0                // orps          0x4c82(%esi),%xmm6
-  .byte  15,88,166,146,76,0,0                // addps         0x4c92(%esi),%xmm4
-  .byte  15,40,190,162,76,0,0                // movaps        0x4ca2(%esi),%xmm7
+  .byte  15,89,166,142,80,0,0                // mulps         0x508e(%esi),%xmm4
+  .byte  15,84,182,158,80,0,0                // andps         0x509e(%esi),%xmm6
+  .byte  15,86,182,174,80,0,0                // orps          0x50ae(%esi),%xmm6
+  .byte  15,88,166,190,80,0,0                // addps         0x50be(%esi),%xmm4
+  .byte  15,40,190,206,80,0,0                // movaps        0x50ce(%esi),%xmm7
   .byte  15,89,254                           // mulps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
-  .byte  15,88,182,178,76,0,0                // addps         0x4cb2(%esi),%xmm6
-  .byte  15,40,190,194,76,0,0                // movaps        0x4cc2(%esi),%xmm7
+  .byte  15,88,182,222,80,0,0                // addps         0x50de(%esi),%xmm6
+  .byte  15,40,190,238,80,0,0                // movaps        0x50ee(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -49846,21 +52135,21 @@
   .byte  15,91,245                           // cvtdq2ps      %xmm5,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,40,174,210,76,0,0                // movaps        0x4cd2(%esi),%xmm5
+  .byte  15,40,174,254,80,0,0                // movaps        0x50fe(%esi),%xmm5
   .byte  15,84,253                           // andps         %xmm5,%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,92,254                           // subps         %xmm6,%xmm7
-  .byte  15,88,166,226,76,0,0                // addps         0x4ce2(%esi),%xmm4
-  .byte  15,40,182,242,76,0,0                // movaps        0x4cf2(%esi),%xmm6
+  .byte  15,88,166,14,81,0,0                 // addps         0x510e(%esi),%xmm4
+  .byte  15,40,182,30,81,0,0                 // movaps        0x511e(%esi),%xmm6
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  15,92,230                           // subps         %xmm6,%xmm4
-  .byte  15,40,182,2,77,0,0                  // movaps        0x4d02(%esi),%xmm6
+  .byte  15,40,182,46,81,0,0                 // movaps        0x512e(%esi),%xmm6
   .byte  15,92,247                           // subps         %xmm7,%xmm6
-  .byte  15,40,190,18,77,0,0                 // movaps        0x4d12(%esi),%xmm7
+  .byte  15,40,190,62,81,0,0                 // movaps        0x513e(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,88,252                           // addps         %xmm4,%xmm7
-  .byte  15,89,190,34,77,0,0                 // mulps         0x4d22(%esi),%xmm7
+  .byte  15,89,190,78,81,0,0                 // mulps         0x514e(%esi),%xmm7
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  243,15,16,103,16                    // movss         0x10(%edi),%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
@@ -49914,7 +52203,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4480 <_sk_parametric_b_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4424 <_sk_parametric_b_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -49929,15 +52218,15 @@
   .byte  15,88,244                           // addps         %xmm4,%xmm6
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
   .byte  15,91,230                           // cvtdq2ps      %xmm6,%xmm4
-  .byte  15,89,166,208,75,0,0                // mulps         0x4bd0(%esi),%xmm4
-  .byte  15,84,182,224,75,0,0                // andps         0x4be0(%esi),%xmm6
-  .byte  15,86,182,240,75,0,0                // orps          0x4bf0(%esi),%xmm6
-  .byte  15,88,166,0,76,0,0                  // addps         0x4c00(%esi),%xmm4
-  .byte  15,40,190,16,76,0,0                 // movaps        0x4c10(%esi),%xmm7
+  .byte  15,89,166,252,79,0,0                // mulps         0x4ffc(%esi),%xmm4
+  .byte  15,84,182,12,80,0,0                 // andps         0x500c(%esi),%xmm6
+  .byte  15,86,182,28,80,0,0                 // orps          0x501c(%esi),%xmm6
+  .byte  15,88,166,44,80,0,0                 // addps         0x502c(%esi),%xmm4
+  .byte  15,40,190,60,80,0,0                 // movaps        0x503c(%esi),%xmm7
   .byte  15,89,254                           // mulps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
-  .byte  15,88,182,32,76,0,0                 // addps         0x4c20(%esi),%xmm6
-  .byte  15,40,190,48,76,0,0                 // movaps        0x4c30(%esi),%xmm7
+  .byte  15,88,182,76,80,0,0                 // addps         0x504c(%esi),%xmm6
+  .byte  15,40,190,92,80,0,0                 // movaps        0x505c(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -49945,21 +52234,21 @@
   .byte  15,91,245                           // cvtdq2ps      %xmm5,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,40,174,64,76,0,0                 // movaps        0x4c40(%esi),%xmm5
+  .byte  15,40,174,108,80,0,0                // movaps        0x506c(%esi),%xmm5
   .byte  15,84,253                           // andps         %xmm5,%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,92,254                           // subps         %xmm6,%xmm7
-  .byte  15,88,166,80,76,0,0                 // addps         0x4c50(%esi),%xmm4
-  .byte  15,40,182,96,76,0,0                 // movaps        0x4c60(%esi),%xmm6
+  .byte  15,88,166,124,80,0,0                // addps         0x507c(%esi),%xmm4
+  .byte  15,40,182,140,80,0,0                // movaps        0x508c(%esi),%xmm6
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  15,92,230                           // subps         %xmm6,%xmm4
-  .byte  15,40,182,112,76,0,0                // movaps        0x4c70(%esi),%xmm6
+  .byte  15,40,182,156,80,0,0                // movaps        0x509c(%esi),%xmm6
   .byte  15,92,247                           // subps         %xmm7,%xmm6
-  .byte  15,40,190,128,76,0,0                // movaps        0x4c80(%esi),%xmm7
+  .byte  15,40,190,172,80,0,0                // movaps        0x50ac(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,88,252                           // addps         %xmm4,%xmm7
-  .byte  15,89,190,144,76,0,0                // mulps         0x4c90(%esi),%xmm7
+  .byte  15,89,190,188,80,0,0                // mulps         0x50bc(%esi),%xmm7
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  243,15,16,103,16                    // movss         0x10(%edi),%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
@@ -50013,7 +52302,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          45e2 <_sk_parametric_a_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4586 <_sk_parametric_a_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -50028,15 +52317,15 @@
   .byte  15,88,244                           // addps         %xmm4,%xmm6
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
   .byte  15,91,230                           // cvtdq2ps      %xmm6,%xmm4
-  .byte  15,89,166,62,75,0,0                 // mulps         0x4b3e(%esi),%xmm4
-  .byte  15,84,182,78,75,0,0                 // andps         0x4b4e(%esi),%xmm6
-  .byte  15,86,182,94,75,0,0                 // orps          0x4b5e(%esi),%xmm6
-  .byte  15,88,166,110,75,0,0                // addps         0x4b6e(%esi),%xmm4
-  .byte  15,40,190,126,75,0,0                // movaps        0x4b7e(%esi),%xmm7
+  .byte  15,89,166,106,79,0,0                // mulps         0x4f6a(%esi),%xmm4
+  .byte  15,84,182,122,79,0,0                // andps         0x4f7a(%esi),%xmm6
+  .byte  15,86,182,138,79,0,0                // orps          0x4f8a(%esi),%xmm6
+  .byte  15,88,166,154,79,0,0                // addps         0x4f9a(%esi),%xmm4
+  .byte  15,40,190,170,79,0,0                // movaps        0x4faa(%esi),%xmm7
   .byte  15,89,254                           // mulps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
-  .byte  15,88,182,142,75,0,0                // addps         0x4b8e(%esi),%xmm6
-  .byte  15,40,190,158,75,0,0                // movaps        0x4b9e(%esi),%xmm7
+  .byte  15,88,182,186,79,0,0                // addps         0x4fba(%esi),%xmm6
+  .byte  15,40,190,202,79,0,0                // movaps        0x4fca(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -50044,21 +52333,21 @@
   .byte  15,91,245                           // cvtdq2ps      %xmm5,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,40,174,174,75,0,0                // movaps        0x4bae(%esi),%xmm5
+  .byte  15,40,174,218,79,0,0                // movaps        0x4fda(%esi),%xmm5
   .byte  15,84,253                           // andps         %xmm5,%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,92,254                           // subps         %xmm6,%xmm7
-  .byte  15,88,166,190,75,0,0                // addps         0x4bbe(%esi),%xmm4
-  .byte  15,40,182,206,75,0,0                // movaps        0x4bce(%esi),%xmm6
+  .byte  15,88,166,234,79,0,0                // addps         0x4fea(%esi),%xmm4
+  .byte  15,40,182,250,79,0,0                // movaps        0x4ffa(%esi),%xmm6
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  15,92,230                           // subps         %xmm6,%xmm4
-  .byte  15,40,182,222,75,0,0                // movaps        0x4bde(%esi),%xmm6
+  .byte  15,40,182,10,80,0,0                 // movaps        0x500a(%esi),%xmm6
   .byte  15,92,247                           // subps         %xmm7,%xmm6
-  .byte  15,40,190,238,75,0,0                // movaps        0x4bee(%esi),%xmm7
+  .byte  15,40,190,26,80,0,0                 // movaps        0x501a(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,88,252                           // addps         %xmm4,%xmm7
-  .byte  15,89,190,254,75,0,0                // mulps         0x4bfe(%esi),%xmm7
+  .byte  15,89,190,42,80,0,0                 // mulps         0x502a(%esi),%xmm7
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  243,15,16,103,16                    // movss         0x10(%edi),%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
@@ -50115,31 +52404,31 @@
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
-  .byte  232,0,0,0,0                         // call          474e <_sk_lab_to_xyz_sse2+0x18>
+  .byte  232,0,0,0,0                         // call          46f2 <_sk_lab_to_xyz_sse2+0x18>
   .byte  88                                  // pop           %eax
-  .byte  15,89,144,162,74,0,0                // mulps         0x4aa2(%eax),%xmm2
-  .byte  15,40,160,178,74,0,0                // movaps        0x4ab2(%eax),%xmm4
+  .byte  15,89,144,206,78,0,0                // mulps         0x4ece(%eax),%xmm2
+  .byte  15,40,160,222,78,0,0                // movaps        0x4ede(%eax),%xmm4
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
-  .byte  15,40,168,194,74,0,0                // movaps        0x4ac2(%eax),%xmm5
+  .byte  15,40,168,238,78,0,0                // movaps        0x4eee(%eax),%xmm5
   .byte  15,88,205                           // addps         %xmm5,%xmm1
   .byte  15,89,220                           // mulps         %xmm4,%xmm3
   .byte  15,88,221                           // addps         %xmm5,%xmm3
-  .byte  15,88,144,210,74,0,0                // addps         0x4ad2(%eax),%xmm2
-  .byte  15,89,144,226,74,0,0                // mulps         0x4ae2(%eax),%xmm2
-  .byte  15,89,136,242,74,0,0                // mulps         0x4af2(%eax),%xmm1
+  .byte  15,88,144,254,78,0,0                // addps         0x4efe(%eax),%xmm2
+  .byte  15,89,144,14,79,0,0                 // mulps         0x4f0e(%eax),%xmm2
+  .byte  15,89,136,30,79,0,0                 // mulps         0x4f1e(%eax),%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
-  .byte  15,89,152,2,75,0,0                  // mulps         0x4b02(%eax),%xmm3
+  .byte  15,89,152,46,79,0,0                 // mulps         0x4f2e(%eax),%xmm3
   .byte  15,40,234                           // movaps        %xmm2,%xmm5
   .byte  15,92,235                           // subps         %xmm3,%xmm5
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  15,89,193                           // mulps         %xmm1,%xmm0
-  .byte  15,40,152,18,75,0,0                 // movaps        0x4b12(%eax),%xmm3
+  .byte  15,40,152,62,79,0,0                 // movaps        0x4f3e(%eax),%xmm3
   .byte  15,40,227                           // movaps        %xmm3,%xmm4
   .byte  15,194,224,1                        // cmpltps       %xmm0,%xmm4
-  .byte  15,40,176,34,75,0,0                 // movaps        0x4b22(%eax),%xmm6
+  .byte  15,40,176,78,79,0,0                 // movaps        0x4f4e(%eax),%xmm6
   .byte  15,88,206                           // addps         %xmm6,%xmm1
-  .byte  15,40,184,50,75,0,0                 // movaps        0x4b32(%eax),%xmm7
+  .byte  15,40,184,94,79,0,0                 // movaps        0x4f5e(%eax),%xmm7
   .byte  15,89,207                           // mulps         %xmm7,%xmm1
   .byte  15,84,196                           // andps         %xmm4,%xmm0
   .byte  15,85,225                           // andnps        %xmm1,%xmm4
@@ -50171,8 +52460,8 @@
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  15,86,216                           // orps          %xmm0,%xmm3
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
-  .byte  15,89,160,66,75,0,0                 // mulps         0x4b42(%eax),%xmm4
-  .byte  15,89,152,82,75,0,0                 // mulps         0x4b52(%eax),%xmm3
+  .byte  15,89,160,110,79,0,0                // mulps         0x4f6e(%eax),%xmm4
+  .byte  15,89,152,126,79,0,0                // mulps         0x4f7e(%eax),%xmm3
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  141,88,4                            // lea           0x4(%eax),%ebx
   .byte  15,41,68,36,80                      // movaps        %xmm0,0x50(%esp)
@@ -50205,7 +52494,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          487d <_sk_load_a8_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4821 <_sk_load_a8_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
   .byte  15,40,85,72                         // movaps        0x48(%ebp),%xmm2
@@ -50218,13 +52507,13 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
-  .byte  117,98                              // jne           4905 <_sk_load_a8_sse2+0x96>
+  .byte  117,98                              // jne           48a9 <_sk_load_a8_sse2+0x96>
   .byte  102,15,110,28,25                    // movd          (%ecx,%ebx,1),%xmm3
   .byte  102,15,96,216                       // punpcklbw     %xmm0,%xmm3
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,219,158,51,74,0,0            // pand          0x4a33(%esi),%xmm3
+  .byte  102,15,219,158,95,78,0,0            // pand          0x4e5f(%esi),%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,158,67,74,0,0                 // mulps         0x4a43(%esi),%xmm3
+  .byte  15,89,158,111,78,0,0                // mulps         0x4e6f(%esi),%xmm3
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
   .byte  15,41,100,36,80                     // movaps        %xmm4,0x50(%esp)
   .byte  15,41,84,36,64                      // movaps        %xmm2,0x40(%esp)
@@ -50249,13 +52538,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,61                              // je            494f <_sk_load_a8_sse2+0xe0>
+  .byte  116,61                              // je            48f3 <_sk_load_a8_sse2+0xe0>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,23                              // je            4936 <_sk_load_a8_sse2+0xc7>
+  .byte  116,23                              // je            48da <_sk_load_a8_sse2+0xc7>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,139                             // jne           48b0 <_sk_load_a8_sse2+0x41>
+  .byte  117,139                             // jne           4854 <_sk_load_a8_sse2+0x41>
   .byte  15,182,124,25,2                     // movzbl        0x2(%ecx,%ebx,1),%edi
   .byte  102,15,110,223                      // movd          %edi,%xmm3
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -50265,11 +52554,11 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,221                       // movsd         %xmm5,%xmm3
-  .byte  233,97,255,255,255                  // jmp           48b0 <_sk_load_a8_sse2+0x41>
+  .byte  233,97,255,255,255                  // jmp           4854 <_sk_load_a8_sse2+0x41>
   .byte  15,182,12,25                        // movzbl        (%ecx,%ebx,1),%ecx
   .byte  102,15,110,217                      // movd          %ecx,%xmm3
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,81,255,255,255                  // jmp           48b0 <_sk_load_a8_sse2+0x41>
+  .byte  233,81,255,255,255                  // jmp           4854 <_sk_load_a8_sse2+0x41>
 
 HIDDEN _sk_load_a8_dst_sse2
 .globl _sk_load_a8_dst_sse2
@@ -50281,7 +52570,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          496d <_sk_load_a8_dst_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4911 <_sk_load_a8_dst_sse2+0xe>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -50290,14 +52579,14 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  117,94                              // jne           49e0 <_sk_load_a8_dst_sse2+0x81>
+  .byte  117,94                              // jne           4984 <_sk_load_a8_dst_sse2+0x81>
   .byte  102,15,110,36,57                    // movd          (%ecx,%edi,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,163,99,73,0,0            // pand          0x4963(%ebx),%xmm4
+  .byte  102,15,219,163,143,77,0,0           // pand          0x4d8f(%ebx),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
   .byte  102,15,87,237                       // xorpd         %xmm5,%xmm5
-  .byte  15,89,163,115,73,0,0                // mulps         0x4973(%ebx),%xmm4
+  .byte  15,89,163,159,77,0,0                // mulps         0x4d9f(%ebx),%xmm4
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
   .byte  102,15,41,108,36,64                 // movapd        %xmm5,0x40(%esp)
   .byte  102,15,41,108,36,48                 // movapd        %xmm5,0x30(%esp)
@@ -50319,13 +52608,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,61                              // je            4a2a <_sk_load_a8_dst_sse2+0xcb>
+  .byte  116,61                              // je            49ce <_sk_load_a8_dst_sse2+0xcb>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,23                              // je            4a11 <_sk_load_a8_dst_sse2+0xb2>
+  .byte  116,23                              // je            49b5 <_sk_load_a8_dst_sse2+0xb2>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,143                             // jne           498f <_sk_load_a8_dst_sse2+0x30>
+  .byte  117,143                             // jne           4933 <_sk_load_a8_dst_sse2+0x30>
   .byte  15,182,116,57,2                     // movzbl        0x2(%ecx,%edi,1),%esi
   .byte  102,15,110,230                      // movd          %esi,%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -50335,11 +52624,11 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  233,101,255,255,255                 // jmp           498f <_sk_load_a8_dst_sse2+0x30>
+  .byte  233,101,255,255,255                 // jmp           4933 <_sk_load_a8_dst_sse2+0x30>
   .byte  15,182,12,57                        // movzbl        (%ecx,%edi,1),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,85,255,255,255                  // jmp           498f <_sk_load_a8_dst_sse2+0x30>
+  .byte  233,85,255,255,255                  // jmp           4933 <_sk_load_a8_dst_sse2+0x30>
 
 HIDDEN _sk_gather_a8_sse2
 .globl _sk_gather_a8_sse2
@@ -50378,7 +52667,7 @@
   .byte  102,15,126,206                      // movd          %xmm1,%esi
   .byte  15,182,12,10                        // movzbl        (%edx,%ecx,1),%ecx
   .byte  15,182,20,50                        // movzbl        (%edx,%esi,1),%edx
-  .byte  232,0,0,0,0                         // call          4ab4 <_sk_gather_a8_sse2+0x7a>
+  .byte  232,0,0,0,0                         // call          4a58 <_sk_gather_a8_sse2+0x7a>
   .byte  94                                  // pop           %esi
   .byte  193,226,8                           // shl           $0x8,%edx
   .byte  9,202                               // or            %ecx,%edx
@@ -50391,7 +52680,7 @@
   .byte  102,15,96,193                       // punpcklbw     %xmm1,%xmm0
   .byte  102,15,97,193                       // punpcklwd     %xmm1,%xmm0
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,158,60,72,0,0                 // mulps         0x483c(%esi),%xmm3
+  .byte  15,89,158,104,76,0,0                // mulps         0x4c68(%esi),%xmm3
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,69,40                         // movaps        0x28(%ebp),%xmm0
   .byte  15,40,77,56                         // movaps        0x38(%ebp),%xmm1
@@ -50428,7 +52717,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,156,0,0,0                   // sub           $0x9c,%esp
-  .byte  232,0,0,0,0                         // call          4b45 <_sk_store_a8_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          4ae9 <_sk_store_a8_sse2+0x11>
   .byte  89                                  // pop           %ecx
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
@@ -50437,7 +52726,7 @@
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  139,48                              // mov           (%eax),%esi
   .byte  139,30                              // mov           (%esi),%ebx
-  .byte  15,40,161,187,71,0,0                // movaps        0x47bb(%ecx),%xmm4
+  .byte  15,40,161,231,75,0,0                // movaps        0x4be7(%ecx),%xmm4
   .byte  15,89,227                           // mulps         %xmm3,%xmm4
   .byte  102,15,91,228                       // cvtps2dq      %xmm4,%xmm4
   .byte  102,15,114,244,16                   // pslld         $0x10,%xmm4
@@ -50448,7 +52737,7 @@
   .byte  133,255                             // test          %edi,%edi
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  15,40,125,40                        // movaps        0x28(%ebp),%xmm7
-  .byte  117,70                              // jne           4bce <_sk_store_a8_sse2+0x9a>
+  .byte  117,70                              // jne           4b72 <_sk_store_a8_sse2+0x9a>
   .byte  102,15,126,225                      // movd          %xmm4,%ecx
   .byte  137,12,59                           // mov           %ecx,(%ebx,%edi,1)
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
@@ -50475,30 +52764,30 @@
   .byte  137,240                             // mov           %esi,%eax
   .byte  36,3                                // and           $0x3,%al
   .byte  60,1                                // cmp           $0x1,%al
-  .byte  116,69                              // je            4c23 <_sk_store_a8_sse2+0xef>
+  .byte  116,69                              // je            4bc7 <_sk_store_a8_sse2+0xef>
   .byte  136,69,243                          // mov           %al,-0xd(%ebp)
   .byte  60,2                                // cmp           $0x2,%al
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
-  .byte  116,21                              // je            4bfd <_sk_store_a8_sse2+0xc9>
+  .byte  116,21                              // je            4ba1 <_sk_store_a8_sse2+0xc9>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,161                             // jne           4b8f <_sk_store_a8_sse2+0x5b>
+  .byte  117,161                             // jne           4b33 <_sk_store_a8_sse2+0x5b>
   .byte  102,15,127,101,200                  // movdqa        %xmm4,-0x38(%ebp)
   .byte  138,85,208                          // mov           -0x30(%ebp),%dl
   .byte  136,84,59,2                         // mov           %dl,0x2(%ebx,%edi,1)
   .byte  139,85,20                           // mov           0x14(%ebp),%edx
   .byte  102,15,112,228,212                  // pshufd        $0xd4,%xmm4,%xmm4
-  .byte  102,15,219,161,203,71,0,0           // pand          0x47cb(%ecx),%xmm4
+  .byte  102,15,219,161,247,75,0,0           // pand          0x4bf7(%ecx),%xmm4
   .byte  102,15,103,228                      // packuswb      %xmm4,%xmm4
   .byte  102,15,103,228                      // packuswb      %xmm4,%xmm4
   .byte  102,15,103,228                      // packuswb      %xmm4,%xmm4
   .byte  102,15,126,225                      // movd          %xmm4,%ecx
   .byte  102,137,12,59                       // mov           %cx,(%ebx,%edi,1)
-  .byte  233,108,255,255,255                 // jmp           4b8f <_sk_store_a8_sse2+0x5b>
+  .byte  233,108,255,255,255                 // jmp           4b33 <_sk_store_a8_sse2+0x5b>
   .byte  102,15,127,101,216                  // movdqa        %xmm4,-0x28(%ebp)
   .byte  138,77,216                          // mov           -0x28(%ebp),%cl
   .byte  136,12,59                           // mov           %cl,(%ebx,%edi,1)
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
-  .byte  233,89,255,255,255                  // jmp           4b8f <_sk_store_a8_sse2+0x5b>
+  .byte  233,89,255,255,255                  // jmp           4b33 <_sk_store_a8_sse2+0x5b>
 
 HIDDEN _sk_load_g8_sse2
 .globl _sk_load_g8_sse2
@@ -50510,7 +52799,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4c44 <_sk_load_g8_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4be8 <_sk_load_g8_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
   .byte  15,40,93,72                         // movaps        0x48(%ebp),%xmm3
@@ -50523,13 +52812,13 @@
   .byte  139,18                              // mov           (%edx),%edx
   .byte  133,219                             // test          %ebx,%ebx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  117,100                             // jne           4ccd <_sk_load_g8_sse2+0x97>
+  .byte  117,100                             // jne           4c71 <_sk_load_g8_sse2+0x97>
   .byte  102,15,110,4,58                     // movd          (%edx,%edi,1),%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
-  .byte  102,15,219,128,220,70,0,0           // pand          0x46dc(%eax),%xmm0
+  .byte  102,15,219,128,8,75,0,0             // pand          0x4b08(%eax),%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,128,236,70,0,0                // mulps         0x46ec(%eax),%xmm0
+  .byte  15,89,128,24,75,0,0                 // mulps         0x4b18(%eax),%xmm0
   .byte  141,81,8                            // lea           0x8(%ecx),%edx
   .byte  15,41,100,36,80                     // movaps        %xmm4,0x50(%esp)
   .byte  15,41,92,36,64                      // movaps        %xmm3,0x40(%esp)
@@ -50541,7 +52830,7 @@
   .byte  137,84,36,4                         // mov           %edx,0x4(%esp)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
   .byte  137,20,36                           // mov           %edx,(%esp)
-  .byte  15,40,152,252,70,0,0                // movaps        0x46fc(%eax),%xmm3
+  .byte  15,40,152,40,75,0,0                 // movaps        0x4b28(%eax),%xmm3
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,81,4                            // call          *0x4(%ecx)
@@ -50554,13 +52843,13 @@
   .byte  136,93,243                          // mov           %bl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,61                              // je            4d17 <_sk_load_g8_sse2+0xe1>
+  .byte  116,61                              // je            4cbb <_sk_load_g8_sse2+0xe1>
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
-  .byte  116,23                              // je            4cfe <_sk_load_g8_sse2+0xc8>
+  .byte  116,23                              // je            4ca2 <_sk_load_g8_sse2+0xc8>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,137                             // jne           4c76 <_sk_load_g8_sse2+0x40>
+  .byte  117,137                             // jne           4c1a <_sk_load_g8_sse2+0x40>
   .byte  15,182,116,58,2                     // movzbl        0x2(%edx,%edi,1),%esi
   .byte  102,15,110,198                      // movd          %esi,%xmm0
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -50570,11 +52859,11 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,197                       // movsd         %xmm5,%xmm0
-  .byte  233,95,255,255,255                  // jmp           4c76 <_sk_load_g8_sse2+0x40>
+  .byte  233,95,255,255,255                  // jmp           4c1a <_sk_load_g8_sse2+0x40>
   .byte  15,182,20,58                        // movzbl        (%edx,%edi,1),%edx
   .byte  102,15,110,194                      // movd          %edx,%xmm0
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
-  .byte  233,79,255,255,255                  // jmp           4c76 <_sk_load_g8_sse2+0x40>
+  .byte  233,79,255,255,255                  // jmp           4c1a <_sk_load_g8_sse2+0x40>
 
 HIDDEN _sk_load_g8_dst_sse2
 .globl _sk_load_g8_dst_sse2
@@ -50586,7 +52875,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4d35 <_sk_load_g8_dst_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4cd9 <_sk_load_g8_dst_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -50595,15 +52884,15 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
-  .byte  117,94                              // jne           4da8 <_sk_load_g8_dst_sse2+0x81>
+  .byte  117,94                              // jne           4d4c <_sk_load_g8_dst_sse2+0x81>
   .byte  102,15,110,36,25                    // movd          (%ecx,%ebx,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,166,27,70,0,0            // pand          0x461b(%esi),%xmm4
+  .byte  102,15,219,166,71,74,0,0            // pand          0x4a47(%esi),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,166,43,70,0,0                 // mulps         0x462b(%esi),%xmm4
+  .byte  15,89,166,87,74,0,0                 // mulps         0x4a57(%esi),%xmm4
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
-  .byte  15,40,174,59,70,0,0                 // movaps        0x463b(%esi),%xmm5
+  .byte  15,40,174,103,74,0,0                // movaps        0x4a67(%esi),%xmm5
   .byte  15,41,108,36,80                     // movaps        %xmm5,0x50(%esp)
   .byte  137,84,36,16                        // mov           %edx,0x10(%esp)
   .byte  137,124,36,12                       // mov           %edi,0xc(%esp)
@@ -50624,13 +52913,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,61                              // je            4df2 <_sk_load_g8_dst_sse2+0xcb>
+  .byte  116,61                              // je            4d96 <_sk_load_g8_dst_sse2+0xcb>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,23                              // je            4dd9 <_sk_load_g8_dst_sse2+0xb2>
+  .byte  116,23                              // je            4d7d <_sk_load_g8_dst_sse2+0xb2>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,143                             // jne           4d57 <_sk_load_g8_dst_sse2+0x30>
+  .byte  117,143                             // jne           4cfb <_sk_load_g8_dst_sse2+0x30>
   .byte  15,182,124,25,2                     // movzbl        0x2(%ecx,%ebx,1),%edi
   .byte  102,15,110,231                      // movd          %edi,%xmm4
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -50640,11 +52929,11 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  233,101,255,255,255                 // jmp           4d57 <_sk_load_g8_dst_sse2+0x30>
+  .byte  233,101,255,255,255                 // jmp           4cfb <_sk_load_g8_dst_sse2+0x30>
   .byte  15,182,12,25                        // movzbl        (%ecx,%ebx,1),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,85,255,255,255                  // jmp           4d57 <_sk_load_g8_dst_sse2+0x30>
+  .byte  233,85,255,255,255                  // jmp           4cfb <_sk_load_g8_dst_sse2+0x30>
 
 HIDDEN _sk_gather_g8_sse2
 .globl _sk_gather_g8_sse2
@@ -50683,7 +52972,7 @@
   .byte  102,15,126,206                      // movd          %xmm1,%esi
   .byte  15,182,12,10                        // movzbl        (%edx,%ecx,1),%ecx
   .byte  15,182,20,50                        // movzbl        (%edx,%esi,1),%edx
-  .byte  232,0,0,0,0                         // call          4e7c <_sk_gather_g8_sse2+0x7a>
+  .byte  232,0,0,0,0                         // call          4e20 <_sk_gather_g8_sse2+0x7a>
   .byte  94                                  // pop           %esi
   .byte  193,226,8                           // shl           $0x8,%edx
   .byte  9,202                               // or            %ecx,%edx
@@ -50699,7 +52988,7 @@
   .byte  102,15,96,197                       // punpcklbw     %xmm5,%xmm0
   .byte  102,15,97,197                       // punpcklwd     %xmm5,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,134,4,69,0,0                  // mulps         0x4504(%esi),%xmm0
+  .byte  15,89,134,48,73,0,0                 // mulps         0x4930(%esi),%xmm0
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
   .byte  137,193                             // mov           %eax,%ecx
   .byte  141,65,8                            // lea           0x8(%ecx),%eax
@@ -50713,7 +53002,7 @@
   .byte  137,68,36,4                         // mov           %eax,0x4(%esp)
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  137,4,36                            // mov           %eax,(%esp)
-  .byte  15,40,158,20,69,0,0                 // movaps        0x4514(%esi),%xmm3
+  .byte  15,40,158,64,73,0,0                 // movaps        0x4940(%esi),%xmm3
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,81,4                            // call          *0x4(%ecx)
@@ -50734,7 +53023,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4f10 <_sk_gather_i8_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4eb4 <_sk_gather_i8_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  137,69,240                          // mov           %eax,-0x10(%ebp)
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
@@ -50742,10 +53031,10 @@
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  139,16                              // mov           (%eax),%edx
   .byte  133,210                             // test          %edx,%edx
-  .byte  116,7                               // je            4f2c <_sk_gather_i8_sse2+0x2a>
+  .byte  116,7                               // je            4ed0 <_sk_gather_i8_sse2+0x2a>
   .byte  131,192,4                           // add           $0x4,%eax
   .byte  137,209                             // mov           %edx,%ecx
-  .byte  235,6                               // jmp           4f32 <_sk_gather_i8_sse2+0x30>
+  .byte  235,6                               // jmp           4ed6 <_sk_gather_i8_sse2+0x30>
   .byte  139,72,4                            // mov           0x4(%eax),%ecx
   .byte  131,192,8                           // add           $0x8,%eax
   .byte  139,49                              // mov           (%ecx),%esi
@@ -50796,11 +53085,11 @@
   .byte  102,15,98,232                       // punpckldq     %xmm0,%xmm5
   .byte  102,15,98,233                       // punpckldq     %xmm1,%xmm5
   .byte  139,77,240                          // mov           -0x10(%ebp),%ecx
-  .byte  102,15,111,145,144,68,0,0           // movdqa        0x4490(%ecx),%xmm2
+  .byte  102,15,111,145,188,72,0,0           // movdqa        0x48bc(%ecx),%xmm2
   .byte  102,15,111,197                      // movdqa        %xmm5,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,40,161,160,68,0,0                // movaps        0x44a0(%ecx),%xmm4
+  .byte  15,40,161,204,72,0,0                // movaps        0x48cc(%ecx),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  102,15,111,205                      // movdqa        %xmm5,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -50849,7 +53138,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          509d <_sk_load_565_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5041 <_sk_load_565_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
@@ -50862,20 +53151,20 @@
   .byte  139,18                              // mov           (%edx),%edx
   .byte  133,219                             // test          %ebx,%ebx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  15,133,134,0,0,0                    // jne           514c <_sk_load_565_sse2+0xbd>
+  .byte  15,133,134,0,0,0                    // jne           50f0 <_sk_load_565_sse2+0xbd>
   .byte  243,15,126,20,122                   // movq          (%edx,%edi,2),%xmm2
   .byte  102,15,97,208                       // punpcklwd     %xmm0,%xmm2
-  .byte  102,15,111,128,35,67,0,0            // movdqa        0x4323(%eax),%xmm0
+  .byte  102,15,111,128,79,71,0,0            // movdqa        0x474f(%eax),%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,128,51,67,0,0                 // mulps         0x4333(%eax),%xmm0
-  .byte  102,15,111,136,67,67,0,0            // movdqa        0x4343(%eax),%xmm1
+  .byte  15,89,128,95,71,0,0                 // mulps         0x475f(%eax),%xmm0
+  .byte  102,15,111,136,111,71,0,0           // movdqa        0x476f(%eax),%xmm1
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,136,83,67,0,0                 // mulps         0x4353(%eax),%xmm1
-  .byte  102,15,219,144,99,67,0,0            // pand          0x4363(%eax),%xmm2
+  .byte  15,89,136,127,71,0,0                // mulps         0x477f(%eax),%xmm1
+  .byte  102,15,219,144,143,71,0,0           // pand          0x478f(%eax),%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,144,115,67,0,0                // mulps         0x4373(%eax),%xmm2
+  .byte  15,89,144,159,71,0,0                // mulps         0x479f(%eax),%xmm2
   .byte  141,81,8                            // lea           0x8(%ecx),%edx
   .byte  15,41,116,36,80                     // movaps        %xmm6,0x50(%esp)
   .byte  15,41,108,36,64                     // movaps        %xmm5,0x40(%esp)
@@ -50887,7 +53176,7 @@
   .byte  137,84,36,4                         // mov           %edx,0x4(%esp)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
   .byte  137,20,36                           // mov           %edx,(%esp)
-  .byte  15,40,152,131,67,0,0                // movaps        0x4383(%eax),%xmm3
+  .byte  15,40,152,175,71,0,0                // movaps        0x47af(%eax),%xmm3
   .byte  255,81,4                            // call          *0x4(%ecx)
   .byte  131,196,108                         // add           $0x6c,%esp
   .byte  94                                  // pop           %esi
@@ -50898,13 +53187,13 @@
   .byte  136,93,243                          // mov           %bl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,58                              // je            5193 <_sk_load_565_sse2+0x104>
+  .byte  116,58                              // je            5137 <_sk_load_565_sse2+0x104>
   .byte  102,15,239,210                      // pxor          %xmm2,%xmm2
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
-  .byte  116,27                              // je            5181 <_sk_load_565_sse2+0xf2>
+  .byte  116,27                              // je            5125 <_sk_load_565_sse2+0xf2>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,95,255,255,255               // jne           50cf <_sk_load_565_sse2+0x40>
+  .byte  15,133,95,255,255,255               // jne           5073 <_sk_load_565_sse2+0x40>
   .byte  15,183,116,122,4                    // movzwl        0x4(%edx,%edi,2),%esi
   .byte  102,15,110,198                      // movd          %esi,%xmm0
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -50912,11 +53201,11 @@
   .byte  102,15,110,4,122                    // movd          (%edx,%edi,2),%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
   .byte  242,15,16,208                       // movsd         %xmm0,%xmm2
-  .byte  233,60,255,255,255                  // jmp           50cf <_sk_load_565_sse2+0x40>
+  .byte  233,60,255,255,255                  // jmp           5073 <_sk_load_565_sse2+0x40>
   .byte  15,183,20,122                       // movzwl        (%edx,%edi,2),%edx
   .byte  102,15,110,210                      // movd          %edx,%xmm2
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
-  .byte  233,44,255,255,255                  // jmp           50cf <_sk_load_565_sse2+0x40>
+  .byte  233,44,255,255,255                  // jmp           5073 <_sk_load_565_sse2+0x40>
 
 HIDDEN _sk_load_565_dst_sse2
 .globl _sk_load_565_dst_sse2
@@ -50928,7 +53217,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          51b1 <_sk_load_565_dst_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5155 <_sk_load_565_dst_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -50937,22 +53226,22 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
-  .byte  15,133,134,0,0,0                    // jne           5250 <_sk_load_565_dst_sse2+0xad>
+  .byte  15,133,134,0,0,0                    // jne           51f4 <_sk_load_565_dst_sse2+0xad>
   .byte  243,15,126,36,89                    // movq          (%ecx,%ebx,2),%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,111,174,127,66,0,0           // movdqa        0x427f(%esi),%xmm5
+  .byte  102,15,111,174,171,70,0,0           // movdqa        0x46ab(%esi),%xmm5
   .byte  102,15,219,236                      // pand          %xmm4,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,174,143,66,0,0                // mulps         0x428f(%esi),%xmm5
-  .byte  102,15,111,182,159,66,0,0           // movdqa        0x429f(%esi),%xmm6
+  .byte  15,89,174,187,70,0,0                // mulps         0x46bb(%esi),%xmm5
+  .byte  102,15,111,182,203,70,0,0           // movdqa        0x46cb(%esi),%xmm6
   .byte  102,15,219,244                      // pand          %xmm4,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,182,175,66,0,0                // mulps         0x42af(%esi),%xmm6
-  .byte  102,15,219,166,191,66,0,0           // pand          0x42bf(%esi),%xmm4
+  .byte  15,89,182,219,70,0,0                // mulps         0x46db(%esi),%xmm6
+  .byte  102,15,219,166,235,70,0,0           // pand          0x46eb(%esi),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,166,207,66,0,0                // mulps         0x42cf(%esi),%xmm4
+  .byte  15,89,166,251,70,0,0                // mulps         0x46fb(%esi),%xmm4
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
-  .byte  15,40,190,223,66,0,0                // movaps        0x42df(%esi),%xmm7
+  .byte  15,40,190,11,71,0,0                 // movaps        0x470b(%esi),%xmm7
   .byte  15,41,124,36,80                     // movaps        %xmm7,0x50(%esp)
   .byte  137,84,36,16                        // mov           %edx,0x10(%esp)
   .byte  137,124,36,12                       // mov           %edi,0xc(%esp)
@@ -50973,13 +53262,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,58                              // je            5297 <_sk_load_565_dst_sse2+0xf4>
+  .byte  116,58                              // je            523b <_sk_load_565_dst_sse2+0xf4>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,27                              // je            5285 <_sk_load_565_dst_sse2+0xe2>
+  .byte  116,27                              // je            5229 <_sk_load_565_dst_sse2+0xe2>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,95,255,255,255               // jne           51d3 <_sk_load_565_dst_sse2+0x30>
+  .byte  15,133,95,255,255,255               // jne           5177 <_sk_load_565_dst_sse2+0x30>
   .byte  15,183,124,89,4                     // movzwl        0x4(%ecx,%ebx,2),%edi
   .byte  102,15,110,231                      // movd          %edi,%xmm4
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -50987,11 +53276,11 @@
   .byte  102,15,110,44,89                    // movd          (%ecx,%ebx,2),%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  233,60,255,255,255                  // jmp           51d3 <_sk_load_565_dst_sse2+0x30>
+  .byte  233,60,255,255,255                  // jmp           5177 <_sk_load_565_dst_sse2+0x30>
   .byte  15,183,12,89                        // movzwl        (%ecx,%ebx,2),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,44,255,255,255                  // jmp           51d3 <_sk_load_565_dst_sse2+0x30>
+  .byte  233,44,255,255,255                  // jmp           5177 <_sk_load_565_dst_sse2+0x30>
 
 HIDDEN _sk_gather_565_sse2
 .globl _sk_gather_565_sse2
@@ -51003,7 +53292,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          52b5 <_sk_gather_565_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5259 <_sk_gather_565_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,85,12                           // mov           0xc(%ebp),%edx
   .byte  139,50                              // mov           (%edx),%esi
@@ -51040,17 +53329,17 @@
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,208                       // punpcklwd     %xmm0,%xmm2
-  .byte  102,15,111,128,235,65,0,0           // movdqa        0x41eb(%eax),%xmm0
+  .byte  102,15,111,128,23,70,0,0            // movdqa        0x4617(%eax),%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,128,251,65,0,0                // mulps         0x41fb(%eax),%xmm0
-  .byte  102,15,111,136,11,66,0,0            // movdqa        0x420b(%eax),%xmm1
+  .byte  15,89,128,39,70,0,0                 // mulps         0x4627(%eax),%xmm0
+  .byte  102,15,111,136,55,70,0,0            // movdqa        0x4637(%eax),%xmm1
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,136,27,66,0,0                 // mulps         0x421b(%eax),%xmm1
-  .byte  102,15,219,144,43,66,0,0            // pand          0x422b(%eax),%xmm2
+  .byte  15,89,136,71,70,0,0                 // mulps         0x4647(%eax),%xmm1
+  .byte  102,15,219,144,87,70,0,0            // pand          0x4657(%eax),%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,144,59,66,0,0                 // mulps         0x423b(%eax),%xmm2
+  .byte  15,89,144,103,70,0,0                // mulps         0x4667(%eax),%xmm2
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
   .byte  141,74,8                            // lea           0x8(%edx),%ecx
   .byte  15,41,116,36,80                     // movaps        %xmm6,0x50(%esp)
@@ -51063,7 +53352,7 @@
   .byte  137,76,36,4                         // mov           %ecx,0x4(%esp)
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  137,12,36                           // mov           %ecx,(%esp)
-  .byte  15,40,152,75,66,0,0                 // movaps        0x424b(%eax),%xmm3
+  .byte  15,40,152,119,70,0,0                // movaps        0x4677(%eax),%xmm3
   .byte  255,82,4                            // call          *0x4(%edx)
   .byte  131,196,108                         // add           $0x6c,%esp
   .byte  94                                  // pop           %esi
@@ -51082,14 +53371,14 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          53d7 <_sk_store_565_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          537b <_sk_store_565_sse2+0xe>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,57,65,0,0                 // movaps        0x4139(%eax),%xmm4
+  .byte  15,40,160,101,69,0,0                // movaps        0x4565(%eax),%xmm4
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
   .byte  102,15,91,237                       // cvtps2dq      %xmm5,%xmm5
   .byte  102,15,114,245,11                   // pslld         $0xb,%xmm5
-  .byte  15,40,176,73,65,0,0                 // movaps        0x4149(%eax),%xmm6
+  .byte  15,40,176,117,69,0,0                // movaps        0x4575(%eax),%xmm6
   .byte  15,89,241                           // mulps         %xmm1,%xmm6
   .byte  102,15,91,246                       // cvtps2dq      %xmm6,%xmm6
   .byte  102,15,114,246,5                    // pslld         $0x5,%xmm6
@@ -51111,7 +53400,7 @@
   .byte  133,219                             // test          %ebx,%ebx
   .byte  15,40,125,56                        // movaps        0x38(%ebp),%xmm7
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
-  .byte  117,82                              // jne           5498 <_sk_store_565_sse2+0xcf>
+  .byte  117,82                              // jne           543c <_sk_store_565_sse2+0xcf>
   .byte  102,15,126,226                      // movd          %xmm4,%edx
   .byte  102,15,126,238                      // movd          %xmm5,%esi
   .byte  137,20,79                           // mov           %edx,(%edi,%ecx,2)
@@ -51142,20 +53431,20 @@
   .byte  137,218                             // mov           %ebx,%edx
   .byte  128,226,3                           // and           $0x3,%dl
   .byte  128,250,1                           // cmp           $0x1,%dl
-  .byte  116,37                              // je            54d0 <_sk_store_565_sse2+0x107>
+  .byte  116,37                              // je            5474 <_sk_store_565_sse2+0x107>
   .byte  128,250,2                           // cmp           $0x2,%dl
-  .byte  116,15                              // je            54bf <_sk_store_565_sse2+0xf6>
+  .byte  116,15                              // je            5463 <_sk_store_565_sse2+0xf6>
   .byte  128,250,3                           // cmp           $0x3,%dl
-  .byte  117,160                             // jne           5455 <_sk_store_565_sse2+0x8c>
+  .byte  117,160                             // jne           53f9 <_sk_store_565_sse2+0x8c>
   .byte  102,15,197,212,4                    // pextrw        $0x4,%xmm4,%edx
   .byte  102,137,84,79,4                     // mov           %dx,0x4(%edi,%ecx,2)
   .byte  102,15,112,228,212                  // pshufd        $0xd4,%xmm4,%xmm4
   .byte  242,15,112,228,232                  // pshuflw       $0xe8,%xmm4,%xmm4
   .byte  102,15,126,36,79                    // movd          %xmm4,(%edi,%ecx,2)
-  .byte  235,133                             // jmp           5455 <_sk_store_565_sse2+0x8c>
+  .byte  235,133                             // jmp           53f9 <_sk_store_565_sse2+0x8c>
   .byte  102,15,126,226                      // movd          %xmm4,%edx
   .byte  102,137,20,79                       // mov           %dx,(%edi,%ecx,2)
-  .byte  233,120,255,255,255                 // jmp           5455 <_sk_store_565_sse2+0x8c>
+  .byte  233,120,255,255,255                 // jmp           53f9 <_sk_store_565_sse2+0x8c>
 
 HIDDEN _sk_load_4444_sse2
 .globl _sk_load_4444_sse2
@@ -51167,7 +53456,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          54eb <_sk_load_4444_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          548f <_sk_load_4444_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
@@ -51180,24 +53469,24 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
-  .byte  15,133,149,0,0,0                    // jne           55a9 <_sk_load_4444_sse2+0xcc>
+  .byte  15,133,149,0,0,0                    // jne           554d <_sk_load_4444_sse2+0xcc>
   .byte  243,15,126,28,89                    // movq          (%ecx,%ebx,2),%xmm3
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,111,134,69,64,0,0            // movdqa        0x4045(%esi),%xmm0
+  .byte  102,15,111,134,113,68,0,0           // movdqa        0x4471(%esi),%xmm0
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,134,85,64,0,0                 // mulps         0x4055(%esi),%xmm0
-  .byte  102,15,111,142,101,64,0,0           // movdqa        0x4065(%esi),%xmm1
+  .byte  15,89,134,129,68,0,0                // mulps         0x4481(%esi),%xmm0
+  .byte  102,15,111,142,145,68,0,0           // movdqa        0x4491(%esi),%xmm1
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,142,117,64,0,0                // mulps         0x4075(%esi),%xmm1
-  .byte  102,15,111,150,133,64,0,0           // movdqa        0x4085(%esi),%xmm2
+  .byte  15,89,142,161,68,0,0                // mulps         0x44a1(%esi),%xmm1
+  .byte  102,15,111,150,177,68,0,0           // movdqa        0x44b1(%esi),%xmm2
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,150,149,64,0,0                // mulps         0x4095(%esi),%xmm2
-  .byte  102,15,219,158,165,64,0,0           // pand          0x40a5(%esi),%xmm3
+  .byte  15,89,150,193,68,0,0                // mulps         0x44c1(%esi),%xmm2
+  .byte  102,15,219,158,209,68,0,0           // pand          0x44d1(%esi),%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,158,181,64,0,0                // mulps         0x40b5(%esi),%xmm3
+  .byte  15,89,158,225,68,0,0                // mulps         0x44e1(%esi),%xmm3
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
   .byte  15,41,124,36,80                     // movaps        %xmm7,0x50(%esp)
   .byte  15,41,116,36,64                     // movaps        %xmm6,0x40(%esp)
@@ -51219,13 +53508,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,58                              // je            55f0 <_sk_load_4444_sse2+0x113>
+  .byte  116,58                              // je            5594 <_sk_load_4444_sse2+0x113>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,27                              // je            55de <_sk_load_4444_sse2+0x101>
+  .byte  116,27                              // je            5582 <_sk_load_4444_sse2+0x101>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,80,255,255,255               // jne           551d <_sk_load_4444_sse2+0x40>
+  .byte  15,133,80,255,255,255               // jne           54c1 <_sk_load_4444_sse2+0x40>
   .byte  15,183,124,89,4                     // movzwl        0x4(%ecx,%ebx,2),%edi
   .byte  102,15,110,199                      // movd          %edi,%xmm0
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -51233,11 +53522,11 @@
   .byte  102,15,110,4,89                     // movd          (%ecx,%ebx,2),%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
   .byte  242,15,16,216                       // movsd         %xmm0,%xmm3
-  .byte  233,45,255,255,255                  // jmp           551d <_sk_load_4444_sse2+0x40>
+  .byte  233,45,255,255,255                  // jmp           54c1 <_sk_load_4444_sse2+0x40>
   .byte  15,183,12,89                        // movzwl        (%ecx,%ebx,2),%ecx
   .byte  102,15,110,217                      // movd          %ecx,%xmm3
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,29,255,255,255                  // jmp           551d <_sk_load_4444_sse2+0x40>
+  .byte  233,29,255,255,255                  // jmp           54c1 <_sk_load_4444_sse2+0x40>
 
 HIDDEN _sk_load_4444_dst_sse2
 .globl _sk_load_4444_dst_sse2
@@ -51249,7 +53538,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          560e <_sk_load_4444_dst_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          55b2 <_sk_load_4444_dst_sse2+0xe>
   .byte  95                                  // pop           %edi
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -51258,24 +53547,24 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
-  .byte  15,133,149,0,0,0                    // jne           56bc <_sk_load_4444_dst_sse2+0xbc>
+  .byte  15,133,149,0,0,0                    // jne           5660 <_sk_load_4444_dst_sse2+0xbc>
   .byte  243,15,126,36,89                    // movq          (%ecx,%ebx,2),%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,111,175,162,63,0,0           // movdqa        0x3fa2(%edi),%xmm5
+  .byte  102,15,111,175,206,67,0,0           // movdqa        0x43ce(%edi),%xmm5
   .byte  102,15,219,236                      // pand          %xmm4,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,175,178,63,0,0                // mulps         0x3fb2(%edi),%xmm5
-  .byte  102,15,111,183,194,63,0,0           // movdqa        0x3fc2(%edi),%xmm6
+  .byte  15,89,175,222,67,0,0                // mulps         0x43de(%edi),%xmm5
+  .byte  102,15,111,183,238,67,0,0           // movdqa        0x43ee(%edi),%xmm6
   .byte  102,15,219,244                      // pand          %xmm4,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,183,210,63,0,0                // mulps         0x3fd2(%edi),%xmm6
-  .byte  102,15,111,191,226,63,0,0           // movdqa        0x3fe2(%edi),%xmm7
+  .byte  15,89,183,254,67,0,0                // mulps         0x43fe(%edi),%xmm6
+  .byte  102,15,111,191,14,68,0,0            // movdqa        0x440e(%edi),%xmm7
   .byte  102,15,219,252                      // pand          %xmm4,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
-  .byte  15,89,191,242,63,0,0                // mulps         0x3ff2(%edi),%xmm7
-  .byte  102,15,219,167,2,64,0,0             // pand          0x4002(%edi),%xmm4
+  .byte  15,89,191,30,68,0,0                 // mulps         0x441e(%edi),%xmm7
+  .byte  102,15,219,167,46,68,0,0            // pand          0x442e(%edi),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,167,18,64,0,0                 // mulps         0x4012(%edi),%xmm4
+  .byte  15,89,167,62,68,0,0                 // mulps         0x443e(%edi),%xmm4
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
   .byte  137,84,36,16                        // mov           %edx,0x10(%esp)
   .byte  137,116,36,12                       // mov           %esi,0xc(%esp)
@@ -51297,13 +53586,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,58                              // je            5703 <_sk_load_4444_dst_sse2+0x103>
+  .byte  116,58                              // je            56a7 <_sk_load_4444_dst_sse2+0x103>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,27                              // je            56f1 <_sk_load_4444_dst_sse2+0xf1>
+  .byte  116,27                              // je            5695 <_sk_load_4444_dst_sse2+0xf1>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,80,255,255,255               // jne           5630 <_sk_load_4444_dst_sse2+0x30>
+  .byte  15,133,80,255,255,255               // jne           55d4 <_sk_load_4444_dst_sse2+0x30>
   .byte  15,183,116,89,4                     // movzwl        0x4(%ecx,%ebx,2),%esi
   .byte  102,15,110,230                      // movd          %esi,%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -51311,11 +53600,11 @@
   .byte  102,15,110,44,89                    // movd          (%ecx,%ebx,2),%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  233,45,255,255,255                  // jmp           5630 <_sk_load_4444_dst_sse2+0x30>
+  .byte  233,45,255,255,255                  // jmp           55d4 <_sk_load_4444_dst_sse2+0x30>
   .byte  15,183,12,89                        // movzwl        (%ecx,%ebx,2),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,29,255,255,255                  // jmp           5630 <_sk_load_4444_dst_sse2+0x30>
+  .byte  233,29,255,255,255                  // jmp           55d4 <_sk_load_4444_dst_sse2+0x30>
 
 HIDDEN _sk_gather_4444_sse2
 .globl _sk_gather_4444_sse2
@@ -51327,7 +53616,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5721 <_sk_gather_4444_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          56c5 <_sk_gather_4444_sse2+0xe>
   .byte  90                                  // pop           %edx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,12                           // mov           0xc(%ebp),%ecx
@@ -51361,21 +53650,21 @@
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,111,130,15,63,0,0            // movdqa        0x3f0f(%edx),%xmm0
+  .byte  102,15,111,130,59,67,0,0            // movdqa        0x433b(%edx),%xmm0
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,130,31,63,0,0                 // mulps         0x3f1f(%edx),%xmm0
-  .byte  102,15,111,138,47,63,0,0            // movdqa        0x3f2f(%edx),%xmm1
+  .byte  15,89,130,75,67,0,0                 // mulps         0x434b(%edx),%xmm0
+  .byte  102,15,111,138,91,67,0,0            // movdqa        0x435b(%edx),%xmm1
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,138,63,63,0,0                 // mulps         0x3f3f(%edx),%xmm1
-  .byte  102,15,111,146,79,63,0,0            // movdqa        0x3f4f(%edx),%xmm2
+  .byte  15,89,138,107,67,0,0                // mulps         0x436b(%edx),%xmm1
+  .byte  102,15,111,146,123,67,0,0           // movdqa        0x437b(%edx),%xmm2
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,146,95,63,0,0                 // mulps         0x3f5f(%edx),%xmm2
-  .byte  102,15,219,154,111,63,0,0           // pand          0x3f6f(%edx),%xmm3
+  .byte  15,89,146,139,67,0,0                // mulps         0x438b(%edx),%xmm2
+  .byte  102,15,219,154,155,67,0,0           // pand          0x439b(%edx),%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,154,127,63,0,0                // mulps         0x3f7f(%edx),%xmm3
+  .byte  15,89,154,171,67,0,0                // mulps         0x43ab(%edx),%xmm3
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
@@ -51409,9 +53698,9 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5852 <_sk_store_4444_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          57f6 <_sk_store_4444_sse2+0xe>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,94,62,0,0                 // movaps        0x3e5e(%eax),%xmm4
+  .byte  15,40,160,138,66,0,0                // movaps        0x428a(%eax),%xmm4
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
   .byte  102,15,91,237                       // cvtps2dq      %xmm5,%xmm5
@@ -51443,7 +53732,7 @@
   .byte  133,219                             // test          %ebx,%ebx
   .byte  15,40,125,56                        // movaps        0x38(%ebp),%xmm7
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
-  .byte  117,82                              // jne           5922 <_sk_store_4444_sse2+0xde>
+  .byte  117,82                              // jne           58c6 <_sk_store_4444_sse2+0xde>
   .byte  102,15,126,226                      // movd          %xmm4,%edx
   .byte  102,15,126,238                      // movd          %xmm5,%esi
   .byte  137,20,79                           // mov           %edx,(%edi,%ecx,2)
@@ -51474,20 +53763,20 @@
   .byte  137,218                             // mov           %ebx,%edx
   .byte  128,226,3                           // and           $0x3,%dl
   .byte  128,250,1                           // cmp           $0x1,%dl
-  .byte  116,37                              // je            595a <_sk_store_4444_sse2+0x116>
+  .byte  116,37                              // je            58fe <_sk_store_4444_sse2+0x116>
   .byte  128,250,2                           // cmp           $0x2,%dl
-  .byte  116,15                              // je            5949 <_sk_store_4444_sse2+0x105>
+  .byte  116,15                              // je            58ed <_sk_store_4444_sse2+0x105>
   .byte  128,250,3                           // cmp           $0x3,%dl
-  .byte  117,160                             // jne           58df <_sk_store_4444_sse2+0x9b>
+  .byte  117,160                             // jne           5883 <_sk_store_4444_sse2+0x9b>
   .byte  102,15,197,212,4                    // pextrw        $0x4,%xmm4,%edx
   .byte  102,137,84,79,4                     // mov           %dx,0x4(%edi,%ecx,2)
   .byte  102,15,112,228,212                  // pshufd        $0xd4,%xmm4,%xmm4
   .byte  242,15,112,228,232                  // pshuflw       $0xe8,%xmm4,%xmm4
   .byte  102,15,126,36,79                    // movd          %xmm4,(%edi,%ecx,2)
-  .byte  235,133                             // jmp           58df <_sk_store_4444_sse2+0x9b>
+  .byte  235,133                             // jmp           5883 <_sk_store_4444_sse2+0x9b>
   .byte  102,15,126,226                      // movd          %xmm4,%edx
   .byte  102,137,20,79                       // mov           %dx,(%edi,%ecx,2)
-  .byte  233,120,255,255,255                 // jmp           58df <_sk_store_4444_sse2+0x9b>
+  .byte  233,120,255,255,255                 // jmp           5883 <_sk_store_4444_sse2+0x9b>
 
 HIDDEN _sk_load_8888_sse2
 .globl _sk_load_8888_sse2
@@ -51499,7 +53788,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5975 <_sk_load_8888_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5919 <_sk_load_8888_sse2+0xe>
   .byte  91                                  // pop           %ebx
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
@@ -51510,13 +53799,13 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  139,117,8                           // mov           0x8(%ebp),%esi
-  .byte  15,133,147,0,0,0                    // jne           5a29 <_sk_load_8888_sse2+0xc2>
+  .byte  15,133,147,0,0,0                    // jne           59cd <_sk_load_8888_sse2+0xc2>
   .byte  243,15,111,44,185                   // movdqu        (%ecx,%edi,4),%xmm5
-  .byte  102,15,111,147,75,61,0,0            // movdqa        0x3d4b(%ebx),%xmm2
+  .byte  102,15,111,147,119,65,0,0           // movdqa        0x4177(%ebx),%xmm2
   .byte  102,15,111,197                      // movdqa        %xmm5,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,40,163,91,61,0,0                 // movaps        0x3d5b(%ebx),%xmm4
+  .byte  15,40,163,135,65,0,0                // movaps        0x4187(%ebx),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  102,15,111,205                      // movdqa        %xmm5,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -51554,20 +53843,20 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,44                              // je            5a62 <_sk_load_8888_sse2+0xfb>
+  .byte  116,44                              // je            5a06 <_sk_load_8888_sse2+0xfb>
   .byte  102,15,239,237                      // pxor          %xmm5,%xmm5
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,21                              // je            5a58 <_sk_load_8888_sse2+0xf1>
+  .byte  116,21                              // je            59fc <_sk_load_8888_sse2+0xf1>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,78,255,255,255               // jne           599b <_sk_load_8888_sse2+0x34>
+  .byte  15,133,78,255,255,255               // jne           593f <_sk_load_8888_sse2+0x34>
   .byte  102,15,110,68,185,8                 // movd          0x8(%ecx,%edi,4),%xmm0
   .byte  102,15,112,232,69                   // pshufd        $0x45,%xmm0,%xmm5
   .byte  102,15,18,44,185                    // movlpd        (%ecx,%edi,4),%xmm5
-  .byte  233,57,255,255,255                  // jmp           599b <_sk_load_8888_sse2+0x34>
+  .byte  233,57,255,255,255                  // jmp           593f <_sk_load_8888_sse2+0x34>
   .byte  102,15,110,44,185                   // movd          (%ecx,%edi,4),%xmm5
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,44,255,255,255                  // jmp           599b <_sk_load_8888_sse2+0x34>
+  .byte  233,44,255,255,255                  // jmp           593f <_sk_load_8888_sse2+0x34>
 
 HIDDEN _sk_load_8888_dst_sse2
 .globl _sk_load_8888_dst_sse2
@@ -51581,7 +53870,7 @@
   .byte  129,236,140,0,0,0                   // sub           $0x8c,%esp
   .byte  102,15,127,93,200                   // movdqa        %xmm3,-0x38(%ebp)
   .byte  15,41,85,216                        // movaps        %xmm2,-0x28(%ebp)
-  .byte  232,0,0,0,0                         // call          5a89 <_sk_load_8888_dst_sse2+0x1a>
+  .byte  232,0,0,0,0                         // call          5a2d <_sk_load_8888_dst_sse2+0x1a>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
@@ -51590,13 +53879,13 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  139,117,8                           // mov           0x8(%ebp),%esi
-  .byte  15,133,150,0,0,0                    // jne           5b38 <_sk_load_8888_dst_sse2+0xc9>
+  .byte  15,133,150,0,0,0                    // jne           5adc <_sk_load_8888_dst_sse2+0xc9>
   .byte  243,15,111,28,185                   // movdqu        (%ecx,%edi,4),%xmm3
-  .byte  102,15,111,147,87,60,0,0            // movdqa        0x3c57(%ebx),%xmm2
+  .byte  102,15,111,147,131,64,0,0           // movdqa        0x4083(%ebx),%xmm2
   .byte  102,15,111,243                      // movdqa        %xmm3,%xmm6
   .byte  102,15,219,242                      // pand          %xmm2,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,40,187,103,60,0,0                // movaps        0x3c67(%ebx),%xmm7
+  .byte  15,40,187,147,64,0,0                // movaps        0x4093(%ebx),%xmm7
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  102,15,111,227                      // movdqa        %xmm3,%xmm4
   .byte  102,15,114,212,8                    // psrld         $0x8,%xmm4
@@ -51634,20 +53923,20 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,44                              // je            5b71 <_sk_load_8888_dst_sse2+0x102>
+  .byte  116,44                              // je            5b15 <_sk_load_8888_dst_sse2+0x102>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,21                              // je            5b67 <_sk_load_8888_dst_sse2+0xf8>
+  .byte  116,21                              // je            5b0b <_sk_load_8888_dst_sse2+0xf8>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,75,255,255,255               // jne           5aa7 <_sk_load_8888_dst_sse2+0x38>
+  .byte  15,133,75,255,255,255               // jne           5a4b <_sk_load_8888_dst_sse2+0x38>
   .byte  102,15,110,100,185,8                // movd          0x8(%ecx,%edi,4),%xmm4
   .byte  102,15,112,220,69                   // pshufd        $0x45,%xmm4,%xmm3
   .byte  102,15,18,28,185                    // movlpd        (%ecx,%edi,4),%xmm3
-  .byte  233,54,255,255,255                  // jmp           5aa7 <_sk_load_8888_dst_sse2+0x38>
+  .byte  233,54,255,255,255                  // jmp           5a4b <_sk_load_8888_dst_sse2+0x38>
   .byte  102,15,110,28,185                   // movd          (%ecx,%edi,4),%xmm3
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,41,255,255,255                  // jmp           5aa7 <_sk_load_8888_dst_sse2+0x38>
+  .byte  233,41,255,255,255                  // jmp           5a4b <_sk_load_8888_dst_sse2+0x38>
 
 HIDDEN _sk_gather_8888_sse2
 .globl _sk_gather_8888_sse2
@@ -51659,7 +53948,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5b8c <_sk_gather_8888_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5b30 <_sk_gather_8888_sse2+0xe>
   .byte  90                                  // pop           %edx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,12                           // mov           0xc(%ebp),%ecx
@@ -51689,8 +53978,8 @@
   .byte  102,15,110,4,183                    // movd          (%edi,%esi,4),%xmm0
   .byte  139,117,16                          // mov           0x10(%ebp),%esi
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
-  .byte  102,15,111,162,116,59,0,0           // movdqa        0x3b74(%edx),%xmm4
-  .byte  15,40,170,132,59,0,0                // movaps        0x3b84(%edx),%xmm5
+  .byte  102,15,111,162,160,63,0,0           // movdqa        0x3fa0(%edx),%xmm4
+  .byte  15,40,170,176,63,0,0                // movaps        0x3fb0(%edx),%xmm5
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
   .byte  15,40,125,56                        // movaps        0x38(%ebp),%xmm7
@@ -51744,9 +54033,9 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5cb1 <_sk_store_8888_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5c55 <_sk_store_8888_sse2+0xe>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,111,58,0,0                // movaps        0x3a6f(%eax),%xmm4
+  .byte  15,40,160,155,62,0,0                // movaps        0x3e9b(%eax),%xmm4
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
   .byte  102,15,91,237                       // cvtps2dq      %xmm5,%xmm5
@@ -51775,7 +54064,7 @@
   .byte  133,219                             // test          %ebx,%ebx
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
   .byte  15,40,125,40                        // movaps        0x28(%ebp),%xmm7
-  .byte  117,62                              // jne           5d5a <_sk_store_8888_sse2+0xb7>
+  .byte  117,62                              // jne           5cfe <_sk_store_8888_sse2+0xb7>
   .byte  243,15,127,36,143                   // movdqu        %xmm4,(%edi,%ecx,4)
   .byte  141,120,8                           // lea           0x8(%eax),%edi
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
@@ -51799,20 +54088,345 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,37                              // je            5d8e <_sk_store_8888_sse2+0xeb>
+  .byte  116,37                              // je            5d32 <_sk_store_8888_sse2+0xeb>
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
-  .byte  116,21                              // je            5d87 <_sk_store_8888_sse2+0xe4>
+  .byte  116,21                              // je            5d2b <_sk_store_8888_sse2+0xe4>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,169                             // jne           5d21 <_sk_store_8888_sse2+0x7e>
+  .byte  117,169                             // jne           5cc5 <_sk_store_8888_sse2+0x7e>
   .byte  102,15,112,236,78                   // pshufd        $0x4e,%xmm4,%xmm5
   .byte  102,15,126,108,143,8                // movd          %xmm5,0x8(%edi,%ecx,4)
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  102,15,214,36,143                   // movq          %xmm4,(%edi,%ecx,4)
-  .byte  235,147                             // jmp           5d21 <_sk_store_8888_sse2+0x7e>
+  .byte  235,147                             // jmp           5cc5 <_sk_store_8888_sse2+0x7e>
   .byte  102,15,126,36,143                   // movd          %xmm4,(%edi,%ecx,4)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
-  .byte  235,137                             // jmp           5d21 <_sk_store_8888_sse2+0x7e>
+  .byte  235,137                             // jmp           5cc5 <_sk_store_8888_sse2+0x7e>
+
+HIDDEN _sk_load_bgra_sse2
+.globl _sk_load_bgra_sse2
+FUNCTION(_sk_load_bgra_sse2)
+_sk_load_bgra_sse2:
+  .byte  85                                  // push          %ebp
+  .byte  137,229                             // mov           %esp,%ebp
+  .byte  83                                  // push          %ebx
+  .byte  87                                  // push          %edi
+  .byte  86                                  // push          %esi
+  .byte  131,236,108                         // sub           $0x6c,%esp
+  .byte  232,0,0,0,0                         // call          5d4a <_sk_load_bgra_sse2+0xe>
+  .byte  91                                  // pop           %ebx
+  .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
+  .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
+  .byte  139,85,24                           // mov           0x18(%ebp),%edx
+  .byte  139,69,12                           // mov           0xc(%ebp),%eax
+  .byte  139,8                               // mov           (%eax),%ecx
+  .byte  139,9                               // mov           (%ecx),%ecx
+  .byte  133,210                             // test          %edx,%edx
+  .byte  139,125,16                          // mov           0x10(%ebp),%edi
+  .byte  139,117,8                           // mov           0x8(%ebp),%esi
+  .byte  15,133,147,0,0,0                    // jne           5dfe <_sk_load_bgra_sse2+0xc2>
+  .byte  243,15,111,44,185                   // movdqu        (%ecx,%edi,4),%xmm5
+  .byte  102,15,111,131,182,61,0,0           // movdqa        0x3db6(%ebx),%xmm0
+  .byte  102,15,111,205                      // movdqa        %xmm5,%xmm1
+  .byte  102,15,219,200                      // pand          %xmm0,%xmm1
+  .byte  15,91,209                           // cvtdq2ps      %xmm1,%xmm2
+  .byte  15,40,163,198,61,0,0                // movaps        0x3dc6(%ebx),%xmm4
+  .byte  15,89,212                           // mulps         %xmm4,%xmm2
+  .byte  102,15,111,205                      // movdqa        %xmm5,%xmm1
+  .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
+  .byte  102,15,219,200                      // pand          %xmm0,%xmm1
+  .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
+  .byte  15,89,204                           // mulps         %xmm4,%xmm1
+  .byte  102,15,111,221                      // movdqa        %xmm5,%xmm3
+  .byte  102,15,114,211,16                   // psrld         $0x10,%xmm3
+  .byte  102,15,219,216                      // pand          %xmm0,%xmm3
+  .byte  15,91,195                           // cvtdq2ps      %xmm3,%xmm0
+  .byte  15,89,196                           // mulps         %xmm4,%xmm0
+  .byte  102,15,114,213,24                   // psrld         $0x18,%xmm5
+  .byte  15,91,221                           // cvtdq2ps      %xmm5,%xmm3
+  .byte  15,89,220                           // mulps         %xmm4,%xmm3
+  .byte  141,72,8                            // lea           0x8(%eax),%ecx
+  .byte  15,41,124,36,80                     // movaps        %xmm7,0x50(%esp)
+  .byte  15,41,116,36,64                     // movaps        %xmm6,0x40(%esp)
+  .byte  15,40,101,56                        // movaps        0x38(%ebp),%xmm4
+  .byte  15,41,100,36,48                     // movaps        %xmm4,0x30(%esp)
+  .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
+  .byte  15,41,100,36,32                     // movaps        %xmm4,0x20(%esp)
+  .byte  137,84,36,16                        // mov           %edx,0x10(%esp)
+  .byte  139,85,20                           // mov           0x14(%ebp),%edx
+  .byte  137,84,36,12                        // mov           %edx,0xc(%esp)
+  .byte  137,124,36,8                        // mov           %edi,0x8(%esp)
+  .byte  137,76,36,4                         // mov           %ecx,0x4(%esp)
+  .byte  137,52,36                           // mov           %esi,(%esp)
+  .byte  255,80,4                            // call          *0x4(%eax)
+  .byte  131,196,108                         // add           $0x6c,%esp
+  .byte  94                                  // pop           %esi
+  .byte  95                                  // pop           %edi
+  .byte  91                                  // pop           %ebx
+  .byte  93                                  // pop           %ebp
+  .byte  195                                 // ret
+  .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
+  .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
+  .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
+  .byte  116,44                              // je            5e37 <_sk_load_bgra_sse2+0xfb>
+  .byte  102,15,239,237                      // pxor          %xmm5,%xmm5
+  .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
+  .byte  139,85,24                           // mov           0x18(%ebp),%edx
+  .byte  116,21                              // je            5e2d <_sk_load_bgra_sse2+0xf1>
+  .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
+  .byte  15,133,78,255,255,255               // jne           5d70 <_sk_load_bgra_sse2+0x34>
+  .byte  102,15,110,68,185,8                 // movd          0x8(%ecx,%edi,4),%xmm0
+  .byte  102,15,112,232,69                   // pshufd        $0x45,%xmm0,%xmm5
+  .byte  102,15,18,44,185                    // movlpd        (%ecx,%edi,4),%xmm5
+  .byte  233,57,255,255,255                  // jmp           5d70 <_sk_load_bgra_sse2+0x34>
+  .byte  102,15,110,44,185                   // movd          (%ecx,%edi,4),%xmm5
+  .byte  139,85,24                           // mov           0x18(%ebp),%edx
+  .byte  233,44,255,255,255                  // jmp           5d70 <_sk_load_bgra_sse2+0x34>
+
+HIDDEN _sk_load_bgra_dst_sse2
+.globl _sk_load_bgra_dst_sse2
+FUNCTION(_sk_load_bgra_dst_sse2)
+_sk_load_bgra_dst_sse2:
+  .byte  85                                  // push          %ebp
+  .byte  137,229                             // mov           %esp,%ebp
+  .byte  83                                  // push          %ebx
+  .byte  87                                  // push          %edi
+  .byte  86                                  // push          %esi
+  .byte  129,236,140,0,0,0                   // sub           $0x8c,%esp
+  .byte  102,15,127,93,200                   // movdqa        %xmm3,-0x38(%ebp)
+  .byte  15,41,85,216                        // movaps        %xmm2,-0x28(%ebp)
+  .byte  232,0,0,0,0                         // call          5e5e <_sk_load_bgra_dst_sse2+0x1a>
+  .byte  91                                  // pop           %ebx
+  .byte  139,85,24                           // mov           0x18(%ebp),%edx
+  .byte  139,69,12                           // mov           0xc(%ebp),%eax
+  .byte  139,8                               // mov           (%eax),%ecx
+  .byte  139,9                               // mov           (%ecx),%ecx
+  .byte  133,210                             // test          %edx,%edx
+  .byte  139,125,16                          // mov           0x10(%ebp),%edi
+  .byte  139,117,8                           // mov           0x8(%ebp),%esi
+  .byte  15,133,150,0,0,0                    // jne           5f0d <_sk_load_bgra_dst_sse2+0xc9>
+  .byte  243,15,111,28,185                   // movdqu        (%ecx,%edi,4),%xmm3
+  .byte  102,15,111,147,194,60,0,0           // movdqa        0x3cc2(%ebx),%xmm2
+  .byte  102,15,111,243                      // movdqa        %xmm3,%xmm6
+  .byte  102,15,219,242                      // pand          %xmm2,%xmm6
+  .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
+  .byte  15,40,187,210,60,0,0                // movaps        0x3cd2(%ebx),%xmm7
+  .byte  15,89,247                           // mulps         %xmm7,%xmm6
+  .byte  102,15,111,227                      // movdqa        %xmm3,%xmm4
+  .byte  102,15,114,212,8                    // psrld         $0x8,%xmm4
+  .byte  102,15,219,226                      // pand          %xmm2,%xmm4
+  .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
+  .byte  15,89,231                           // mulps         %xmm7,%xmm4
+  .byte  102,15,111,235                      // movdqa        %xmm3,%xmm5
+  .byte  102,15,114,213,16                   // psrld         $0x10,%xmm5
+  .byte  102,15,219,234                      // pand          %xmm2,%xmm5
+  .byte  15,91,213                           // cvtdq2ps      %xmm5,%xmm2
+  .byte  15,89,215                           // mulps         %xmm7,%xmm2
+  .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
+  .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
+  .byte  15,89,223                           // mulps         %xmm7,%xmm3
+  .byte  141,72,8                            // lea           0x8(%eax),%ecx
+  .byte  137,84,36,16                        // mov           %edx,0x10(%esp)
+  .byte  139,85,20                           // mov           0x14(%ebp),%edx
+  .byte  137,84,36,12                        // mov           %edx,0xc(%esp)
+  .byte  137,124,36,8                        // mov           %edi,0x8(%esp)
+  .byte  137,76,36,4                         // mov           %ecx,0x4(%esp)
+  .byte  137,52,36                           // mov           %esi,(%esp)
+  .byte  15,41,92,36,80                      // movaps        %xmm3,0x50(%esp)
+  .byte  15,41,116,36,64                     // movaps        %xmm6,0x40(%esp)
+  .byte  15,41,100,36,48                     // movaps        %xmm4,0x30(%esp)
+  .byte  15,41,84,36,32                      // movaps        %xmm2,0x20(%esp)
+  .byte  15,40,85,216                        // movaps        -0x28(%ebp),%xmm2
+  .byte  15,40,93,200                        // movaps        -0x38(%ebp),%xmm3
+  .byte  255,80,4                            // call          *0x4(%eax)
+  .byte  129,196,140,0,0,0                   // add           $0x8c,%esp
+  .byte  94                                  // pop           %esi
+  .byte  95                                  // pop           %edi
+  .byte  91                                  // pop           %ebx
+  .byte  93                                  // pop           %ebp
+  .byte  195                                 // ret
+  .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
+  .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
+  .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
+  .byte  116,44                              // je            5f46 <_sk_load_bgra_dst_sse2+0x102>
+  .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
+  .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
+  .byte  139,85,24                           // mov           0x18(%ebp),%edx
+  .byte  116,21                              // je            5f3c <_sk_load_bgra_dst_sse2+0xf8>
+  .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
+  .byte  15,133,75,255,255,255               // jne           5e7c <_sk_load_bgra_dst_sse2+0x38>
+  .byte  102,15,110,100,185,8                // movd          0x8(%ecx,%edi,4),%xmm4
+  .byte  102,15,112,220,69                   // pshufd        $0x45,%xmm4,%xmm3
+  .byte  102,15,18,28,185                    // movlpd        (%ecx,%edi,4),%xmm3
+  .byte  233,54,255,255,255                  // jmp           5e7c <_sk_load_bgra_dst_sse2+0x38>
+  .byte  102,15,110,28,185                   // movd          (%ecx,%edi,4),%xmm3
+  .byte  139,85,24                           // mov           0x18(%ebp),%edx
+  .byte  233,41,255,255,255                  // jmp           5e7c <_sk_load_bgra_dst_sse2+0x38>
+
+HIDDEN _sk_gather_bgra_sse2
+.globl _sk_gather_bgra_sse2
+FUNCTION(_sk_gather_bgra_sse2)
+_sk_gather_bgra_sse2:
+  .byte  85                                  // push          %ebp
+  .byte  137,229                             // mov           %esp,%ebp
+  .byte  83                                  // push          %ebx
+  .byte  87                                  // push          %edi
+  .byte  86                                  // push          %esi
+  .byte  131,236,108                         // sub           $0x6c,%esp
+  .byte  232,0,0,0,0                         // call          5f61 <_sk_gather_bgra_sse2+0xe>
+  .byte  90                                  // pop           %edx
+  .byte  139,69,8                            // mov           0x8(%ebp),%eax
+  .byte  139,77,12                           // mov           0xc(%ebp),%ecx
+  .byte  139,49                              // mov           (%ecx),%esi
+  .byte  139,62                              // mov           (%esi),%edi
+  .byte  243,15,91,201                       // cvttps2dq     %xmm1,%xmm1
+  .byte  102,15,110,86,8                     // movd          0x8(%esi),%xmm2
+  .byte  102,15,112,210,0                    // pshufd        $0x0,%xmm2,%xmm2
+  .byte  102,15,112,217,245                  // pshufd        $0xf5,%xmm1,%xmm3
+  .byte  102,15,244,218                      // pmuludq       %xmm2,%xmm3
+  .byte  102,15,112,219,232                  // pshufd        $0xe8,%xmm3,%xmm3
+  .byte  102,15,244,209                      // pmuludq       %xmm1,%xmm2
+  .byte  102,15,112,202,232                  // pshufd        $0xe8,%xmm2,%xmm1
+  .byte  102,15,98,203                       // punpckldq     %xmm3,%xmm1
+  .byte  243,15,91,192                       // cvttps2dq     %xmm0,%xmm0
+  .byte  102,15,254,193                      // paddd         %xmm1,%xmm0
+  .byte  102,15,112,200,229                  // pshufd        $0xe5,%xmm0,%xmm1
+  .byte  102,15,112,208,231                  // pshufd        $0xe7,%xmm0,%xmm2
+  .byte  102,15,126,214                      // movd          %xmm2,%esi
+  .byte  102,15,110,20,183                   // movd          (%edi,%esi,4),%xmm2
+  .byte  102,15,126,206                      // movd          %xmm1,%esi
+  .byte  102,15,110,12,183                   // movd          (%edi,%esi,4),%xmm1
+  .byte  102,15,126,198                      // movd          %xmm0,%esi
+  .byte  102,15,112,192,78                   // pshufd        $0x4e,%xmm0,%xmm0
+  .byte  102,15,110,28,183                   // movd          (%edi,%esi,4),%xmm3
+  .byte  102,15,126,198                      // movd          %xmm0,%esi
+  .byte  102,15,110,4,183                    // movd          (%edi,%esi,4),%xmm0
+  .byte  139,117,16                          // mov           0x10(%ebp),%esi
+  .byte  139,125,20                          // mov           0x14(%ebp),%edi
+  .byte  102,15,111,162,223,59,0,0           // movdqa        0x3bdf(%edx),%xmm4
+  .byte  15,40,170,239,59,0,0                // movaps        0x3bef(%edx),%xmm5
+  .byte  139,85,24                           // mov           0x18(%ebp),%edx
+  .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
+  .byte  15,40,125,56                        // movaps        0x38(%ebp),%xmm7
+  .byte  102,15,98,202                       // punpckldq     %xmm2,%xmm1
+  .byte  102,15,98,216                       // punpckldq     %xmm0,%xmm3
+  .byte  102,15,98,217                       // punpckldq     %xmm1,%xmm3
+  .byte  102,15,111,211                      // movdqa        %xmm3,%xmm2
+  .byte  102,15,219,212                      // pand          %xmm4,%xmm2
+  .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
+  .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
+  .byte  102,15,219,204                      // pand          %xmm4,%xmm1
+  .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
+  .byte  102,15,114,208,16                   // psrld         $0x10,%xmm0
+  .byte  102,15,219,196                      // pand          %xmm4,%xmm0
+  .byte  15,40,101,72                        // movaps        0x48(%ebp),%xmm4
+  .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
+  .byte  15,89,213                           // mulps         %xmm5,%xmm2
+  .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
+  .byte  15,89,205                           // mulps         %xmm5,%xmm1
+  .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
+  .byte  15,89,197                           // mulps         %xmm5,%xmm0
+  .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
+  .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
+  .byte  15,89,221                           // mulps         %xmm5,%xmm3
+  .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
+  .byte  141,89,8                            // lea           0x8(%ecx),%ebx
+  .byte  15,41,108,36,80                     // movaps        %xmm5,0x50(%esp)
+  .byte  15,41,100,36,64                     // movaps        %xmm4,0x40(%esp)
+  .byte  15,41,124,36,48                     // movaps        %xmm7,0x30(%esp)
+  .byte  15,41,116,36,32                     // movaps        %xmm6,0x20(%esp)
+  .byte  137,84,36,16                        // mov           %edx,0x10(%esp)
+  .byte  137,124,36,12                       // mov           %edi,0xc(%esp)
+  .byte  137,116,36,8                        // mov           %esi,0x8(%esp)
+  .byte  137,92,36,4                         // mov           %ebx,0x4(%esp)
+  .byte  137,4,36                            // mov           %eax,(%esp)
+  .byte  255,81,4                            // call          *0x4(%ecx)
+  .byte  131,196,108                         // add           $0x6c,%esp
+  .byte  94                                  // pop           %esi
+  .byte  95                                  // pop           %edi
+  .byte  91                                  // pop           %ebx
+  .byte  93                                  // pop           %ebp
+  .byte  195                                 // ret
+
+HIDDEN _sk_store_bgra_sse2
+.globl _sk_store_bgra_sse2
+FUNCTION(_sk_store_bgra_sse2)
+_sk_store_bgra_sse2:
+  .byte  85                                  // push          %ebp
+  .byte  137,229                             // mov           %esp,%ebp
+  .byte  83                                  // push          %ebx
+  .byte  87                                  // push          %edi
+  .byte  86                                  // push          %esi
+  .byte  131,236,108                         // sub           $0x6c,%esp
+  .byte  232,0,0,0,0                         // call          6086 <_sk_store_bgra_sse2+0xe>
+  .byte  88                                  // pop           %eax
+  .byte  15,40,160,218,58,0,0                // movaps        0x3ada(%eax),%xmm4
+  .byte  15,40,234                           // movaps        %xmm2,%xmm5
+  .byte  15,89,236                           // mulps         %xmm4,%xmm5
+  .byte  102,15,91,237                       // cvtps2dq      %xmm5,%xmm5
+  .byte  15,40,241                           // movaps        %xmm1,%xmm6
+  .byte  15,89,244                           // mulps         %xmm4,%xmm6
+  .byte  102,15,91,246                       // cvtps2dq      %xmm6,%xmm6
+  .byte  102,15,114,246,8                    // pslld         $0x8,%xmm6
+  .byte  102,15,235,245                      // por           %xmm5,%xmm6
+  .byte  15,40,232                           // movaps        %xmm0,%xmm5
+  .byte  15,89,236                           // mulps         %xmm4,%xmm5
+  .byte  102,15,91,237                       // cvtps2dq      %xmm5,%xmm5
+  .byte  102,15,114,245,16                   // pslld         $0x10,%xmm5
+  .byte  15,89,227                           // mulps         %xmm3,%xmm4
+  .byte  102,15,91,228                       // cvtps2dq      %xmm4,%xmm4
+  .byte  102,15,114,244,24                   // pslld         $0x18,%xmm4
+  .byte  102,15,235,229                      // por           %xmm5,%xmm4
+  .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
+  .byte  102,15,235,230                      // por           %xmm6,%xmm4
+  .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
+  .byte  139,93,24                           // mov           0x18(%ebp),%ebx
+  .byte  139,117,20                          // mov           0x14(%ebp),%esi
+  .byte  139,77,16                           // mov           0x10(%ebp),%ecx
+  .byte  139,69,12                           // mov           0xc(%ebp),%eax
+  .byte  139,16                              // mov           (%eax),%edx
+  .byte  139,58                              // mov           (%edx),%edi
+  .byte  133,219                             // test          %ebx,%ebx
+  .byte  139,85,8                            // mov           0x8(%ebp),%edx
+  .byte  15,40,125,40                        // movaps        0x28(%ebp),%xmm7
+  .byte  117,62                              // jne           612f <_sk_store_bgra_sse2+0xb7>
+  .byte  243,15,127,36,143                   // movdqu        %xmm4,(%edi,%ecx,4)
+  .byte  141,120,8                           // lea           0x8(%eax),%edi
+  .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
+  .byte  15,41,100,36,80                     // movaps        %xmm4,0x50(%esp)
+  .byte  15,41,108,36,64                     // movaps        %xmm5,0x40(%esp)
+  .byte  15,41,116,36,48                     // movaps        %xmm6,0x30(%esp)
+  .byte  15,41,124,36,32                     // movaps        %xmm7,0x20(%esp)
+  .byte  137,92,36,16                        // mov           %ebx,0x10(%esp)
+  .byte  137,116,36,12                       // mov           %esi,0xc(%esp)
+  .byte  137,76,36,8                         // mov           %ecx,0x8(%esp)
+  .byte  137,124,36,4                        // mov           %edi,0x4(%esp)
+  .byte  137,20,36                           // mov           %edx,(%esp)
+  .byte  255,80,4                            // call          *0x4(%eax)
+  .byte  131,196,108                         // add           $0x6c,%esp
+  .byte  94                                  // pop           %esi
+  .byte  95                                  // pop           %edi
+  .byte  91                                  // pop           %ebx
+  .byte  93                                  // pop           %ebp
+  .byte  195                                 // ret
+  .byte  137,218                             // mov           %ebx,%edx
+  .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
+  .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
+  .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
+  .byte  116,37                              // je            6163 <_sk_store_bgra_sse2+0xeb>
+  .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
+  .byte  139,85,8                            // mov           0x8(%ebp),%edx
+  .byte  116,21                              // je            615c <_sk_store_bgra_sse2+0xe4>
+  .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
+  .byte  117,169                             // jne           60f6 <_sk_store_bgra_sse2+0x7e>
+  .byte  102,15,112,236,78                   // pshufd        $0x4e,%xmm4,%xmm5
+  .byte  102,15,126,108,143,8                // movd          %xmm5,0x8(%edi,%ecx,4)
+  .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
+  .byte  102,15,214,36,143                   // movq          %xmm4,(%edi,%ecx,4)
+  .byte  235,147                             // jmp           60f6 <_sk_store_bgra_sse2+0x7e>
+  .byte  102,15,126,36,143                   // movd          %xmm4,(%edi,%ecx,4)
+  .byte  139,85,8                            // mov           0x8(%ebp),%edx
+  .byte  235,137                             // jmp           60f6 <_sk_store_bgra_sse2+0x7e>
 
 HIDDEN _sk_load_f16_sse2
 .globl _sk_load_f16_sse2
@@ -51824,7 +54438,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,188,0,0,0                   // sub           $0xbc,%esp
-  .byte  232,0,0,0,0                         // call          5da9 <_sk_load_f16_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          617e <_sk_load_f16_sse2+0x11>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
@@ -51833,7 +54447,7 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  139,117,8                           // mov           0x8(%ebp),%esi
-  .byte  15,133,220,1,0,0                    // jne           5f9e <_sk_load_f16_sse2+0x206>
+  .byte  15,133,220,1,0,0                    // jne           6373 <_sk_load_f16_sse2+0x206>
   .byte  102,15,16,4,249                     // movupd        (%ecx,%edi,8),%xmm0
   .byte  243,15,111,76,249,16                // movdqu        0x10(%ecx,%edi,8),%xmm1
   .byte  102,15,40,208                       // movapd        %xmm0,%xmm2
@@ -51861,7 +54475,7 @@
   .byte  102,15,126,69,232                   // movd          %xmm0,-0x18(%ebp)
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,97,243                       // punpcklwd     %xmm3,%xmm6
-  .byte  102,15,111,171,135,57,0,0           // movdqa        0x3987(%ebx),%xmm5
+  .byte  102,15,111,171,242,57,0,0           // movdqa        0x39f2(%ebx),%xmm5
   .byte  102,15,111,214                      // movdqa        %xmm6,%xmm2
   .byte  102,15,219,213                      // pand          %xmm5,%xmm2
   .byte  102,15,239,242                      // pxor          %xmm2,%xmm6
@@ -51895,15 +54509,15 @@
   .byte  102,15,111,199                      // movdqa        %xmm7,%xmm0
   .byte  102,15,114,240,13                   // pslld         $0xd,%xmm0
   .byte  102,15,235,197                      // por           %xmm5,%xmm0
-  .byte  102,15,111,155,151,57,0,0           // movdqa        0x3997(%ebx),%xmm3
+  .byte  102,15,111,155,2,58,0,0             // movdqa        0x3a02(%ebx),%xmm3
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
   .byte  102,15,254,211                      // paddd         %xmm3,%xmm2
   .byte  102,15,254,227                      // paddd         %xmm3,%xmm4
   .byte  102,15,254,195                      // paddd         %xmm3,%xmm0
-  .byte  102,15,111,155,167,57,0,0           // movdqa        0x39a7(%ebx),%xmm3
+  .byte  102,15,111,155,18,58,0,0            // movdqa        0x3a12(%ebx),%xmm3
   .byte  102,15,127,93,184                   // movdqa        %xmm3,-0x48(%ebp)
   .byte  102,15,239,243                      // pxor          %xmm3,%xmm6
-  .byte  102,15,111,155,183,57,0,0           // movdqa        0x39b7(%ebx),%xmm3
+  .byte  102,15,111,155,34,58,0,0            // movdqa        0x3a22(%ebx),%xmm3
   .byte  102,15,111,235                      // movdqa        %xmm3,%xmm5
   .byte  102,15,102,238                      // pcmpgtd       %xmm6,%xmm5
   .byte  102,15,223,233                      // pandn         %xmm1,%xmm5
@@ -51946,12 +54560,12 @@
   .byte  242,15,16,4,249                     // movsd         (%ecx,%edi,8),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  15,132,29,254,255,255               // je            5dcd <_sk_load_f16_sse2+0x35>
+  .byte  15,132,29,254,255,255               // je            61a2 <_sk_load_f16_sse2+0x35>
   .byte  102,15,22,68,249,8                  // movhpd        0x8(%ecx,%edi,8),%xmm0
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  15,130,14,254,255,255               // jb            5dcd <_sk_load_f16_sse2+0x35>
+  .byte  15,130,14,254,255,255               // jb            61a2 <_sk_load_f16_sse2+0x35>
   .byte  243,15,126,76,249,16                // movq          0x10(%ecx,%edi,8),%xmm1
-  .byte  233,3,254,255,255                   // jmp           5dcd <_sk_load_f16_sse2+0x35>
+  .byte  233,3,254,255,255                   // jmp           61a2 <_sk_load_f16_sse2+0x35>
 
 HIDDEN _sk_load_f16_dst_sse2
 .globl _sk_load_f16_dst_sse2
@@ -51967,7 +54581,7 @@
   .byte  102,15,127,149,104,255,255,255      // movdqa        %xmm2,-0x98(%ebp)
   .byte  15,41,141,120,255,255,255           // movaps        %xmm1,-0x88(%ebp)
   .byte  102,15,127,69,136                   // movdqa        %xmm0,-0x78(%ebp)
-  .byte  232,0,0,0,0                         // call          5ff6 <_sk_load_f16_dst_sse2+0x2c>
+  .byte  232,0,0,0,0                         // call          63cb <_sk_load_f16_dst_sse2+0x2c>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
@@ -51976,7 +54590,7 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  139,117,8                           // mov           0x8(%ebp),%esi
-  .byte  15,133,233,1,0,0                    // jne           61f8 <_sk_load_f16_dst_sse2+0x22e>
+  .byte  15,133,233,1,0,0                    // jne           65cd <_sk_load_f16_dst_sse2+0x22e>
   .byte  102,15,16,12,249                    // movupd        (%ecx,%edi,8),%xmm1
   .byte  243,15,111,68,249,16                // movdqu        0x10(%ecx,%edi,8),%xmm0
   .byte  102,15,40,217                       // movapd        %xmm1,%xmm3
@@ -52005,7 +54619,7 @@
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,240                       // punpcklwd     %xmm0,%xmm6
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
-  .byte  102,15,111,155,122,55,0,0           // movdqa        0x377a(%ebx),%xmm3
+  .byte  102,15,111,155,229,55,0,0           // movdqa        0x37e5(%ebx),%xmm3
   .byte  102,15,111,198                      // movdqa        %xmm6,%xmm0
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  102,15,239,240                      // pxor          %xmm0,%xmm6
@@ -52039,15 +54653,15 @@
   .byte  102,15,111,209                      // movdqa        %xmm1,%xmm2
   .byte  102,15,114,242,13                   // pslld         $0xd,%xmm2
   .byte  102,15,235,211                      // por           %xmm3,%xmm2
-  .byte  102,15,111,155,138,55,0,0           // movdqa        0x378a(%ebx),%xmm3
+  .byte  102,15,111,155,245,55,0,0           // movdqa        0x37f5(%ebx),%xmm3
   .byte  102,15,254,251                      // paddd         %xmm3,%xmm7
   .byte  102,15,254,235                      // paddd         %xmm3,%xmm5
   .byte  102,15,254,227                      // paddd         %xmm3,%xmm4
   .byte  102,15,254,211                      // paddd         %xmm3,%xmm2
-  .byte  102,15,111,131,154,55,0,0           // movdqa        0x379a(%ebx),%xmm0
+  .byte  102,15,111,131,5,56,0,0             // movdqa        0x3805(%ebx),%xmm0
   .byte  102,15,127,69,184                   // movdqa        %xmm0,-0x48(%ebp)
   .byte  102,15,239,240                      // pxor          %xmm0,%xmm6
-  .byte  102,15,111,131,170,55,0,0           // movdqa        0x37aa(%ebx),%xmm0
+  .byte  102,15,111,131,21,56,0,0            // movdqa        0x3815(%ebx),%xmm0
   .byte  102,15,111,216                      // movdqa        %xmm0,%xmm3
   .byte  102,15,102,222                      // pcmpgtd       %xmm6,%xmm3
   .byte  102,15,223,223                      // pandn         %xmm7,%xmm3
@@ -52089,12 +54703,12 @@
   .byte  242,15,16,12,249                    // movsd         (%ecx,%edi,8),%xmm1
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  15,132,16,254,255,255               // je            601a <_sk_load_f16_dst_sse2+0x50>
+  .byte  15,132,16,254,255,255               // je            63ef <_sk_load_f16_dst_sse2+0x50>
   .byte  102,15,22,76,249,8                  // movhpd        0x8(%ecx,%edi,8),%xmm1
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  15,130,1,254,255,255                // jb            601a <_sk_load_f16_dst_sse2+0x50>
+  .byte  15,130,1,254,255,255                // jb            63ef <_sk_load_f16_dst_sse2+0x50>
   .byte  243,15,126,68,249,16                // movq          0x10(%ecx,%edi,8),%xmm0
-  .byte  233,246,253,255,255                 // jmp           601a <_sk_load_f16_dst_sse2+0x50>
+  .byte  233,246,253,255,255                 // jmp           63ef <_sk_load_f16_dst_sse2+0x50>
 
 HIDDEN _sk_gather_f16_sse2
 .globl _sk_gather_f16_sse2
@@ -52106,7 +54720,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,204,0,0,0                   // sub           $0xcc,%esp
-  .byte  232,0,0,0,0                         // call          6235 <_sk_gather_f16_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          660a <_sk_gather_f16_sse2+0x11>
   .byte  89                                  // pop           %ecx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  139,48                              // mov           (%eax),%esi
@@ -52169,7 +54783,7 @@
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,111,236                      // movdqa        %xmm4,%xmm5
   .byte  102,15,97,235                       // punpcklwd     %xmm3,%xmm5
-  .byte  102,15,111,161,123,53,0,0           // movdqa        0x357b(%ecx),%xmm4
+  .byte  102,15,111,161,230,53,0,0           // movdqa        0x35e6(%ecx),%xmm4
   .byte  102,15,111,197                      // movdqa        %xmm5,%xmm0
   .byte  102,15,219,196                      // pand          %xmm4,%xmm0
   .byte  102,15,239,232                      // pxor          %xmm0,%xmm5
@@ -52203,16 +54817,16 @@
   .byte  102,15,111,200                      // movdqa        %xmm0,%xmm1
   .byte  102,15,114,241,13                   // pslld         $0xd,%xmm1
   .byte  102,15,235,204                      // por           %xmm4,%xmm1
-  .byte  102,15,111,153,139,53,0,0           // movdqa        0x358b(%ecx),%xmm3
+  .byte  102,15,111,153,246,53,0,0           // movdqa        0x35f6(%ecx),%xmm3
   .byte  102,15,254,235                      // paddd         %xmm3,%xmm5
   .byte  102,15,254,243                      // paddd         %xmm3,%xmm6
   .byte  102,15,254,251                      // paddd         %xmm3,%xmm7
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
-  .byte  102,15,111,153,155,53,0,0           // movdqa        0x359b(%ecx),%xmm3
+  .byte  102,15,111,153,6,54,0,0             // movdqa        0x3606(%ecx),%xmm3
   .byte  102,15,127,93,184                   // movdqa        %xmm3,-0x48(%ebp)
   .byte  102,15,111,85,136                   // movdqa        -0x78(%ebp),%xmm2
   .byte  102,15,239,211                      // pxor          %xmm3,%xmm2
-  .byte  102,15,111,153,171,53,0,0           // movdqa        0x35ab(%ecx),%xmm3
+  .byte  102,15,111,153,22,54,0,0            // movdqa        0x3616(%ecx),%xmm3
   .byte  102,15,111,227                      // movdqa        %xmm3,%xmm4
   .byte  102,15,102,226                      // pcmpgtd       %xmm2,%xmm4
   .byte  102,15,223,229                      // pandn         %xmm5,%xmm4
@@ -52269,20 +54883,20 @@
   .byte  129,236,188,0,0,0                   // sub           $0xbc,%esp
   .byte  15,41,93,200                        // movaps        %xmm3,-0x38(%ebp)
   .byte  102,15,111,250                      // movdqa        %xmm2,%xmm7
-  .byte  232,0,0,0,0                         // call          64d2 <_sk_store_f16_sse2+0x19>
+  .byte  232,0,0,0,0                         // call          68a7 <_sk_store_f16_sse2+0x19>
   .byte  88                                  // pop           %eax
-  .byte  102,15,111,176,30,51,0,0            // movdqa        0x331e(%eax),%xmm6
+  .byte  102,15,111,176,137,51,0,0           // movdqa        0x3389(%eax),%xmm6
   .byte  102,15,111,208                      // movdqa        %xmm0,%xmm2
   .byte  102,15,219,214                      // pand          %xmm6,%xmm2
   .byte  102,15,127,69,184                   // movdqa        %xmm0,-0x48(%ebp)
   .byte  102,15,111,232                      // movdqa        %xmm0,%xmm5
   .byte  102,15,239,234                      // pxor          %xmm2,%xmm5
-  .byte  102,15,111,160,46,51,0,0            // movdqa        0x332e(%eax),%xmm4
+  .byte  102,15,111,160,153,51,0,0           // movdqa        0x3399(%eax),%xmm4
   .byte  102,15,114,210,16                   // psrld         $0x10,%xmm2
   .byte  102,15,111,196                      // movdqa        %xmm4,%xmm0
   .byte  102,15,102,197                      // pcmpgtd       %xmm5,%xmm0
   .byte  102,15,114,213,13                   // psrld         $0xd,%xmm5
-  .byte  102,15,111,152,62,51,0,0            // movdqa        0x333e(%eax),%xmm3
+  .byte  102,15,111,152,169,51,0,0           // movdqa        0x33a9(%eax),%xmm3
   .byte  102,15,254,211                      // paddd         %xmm3,%xmm2
   .byte  102,15,254,213                      // paddd         %xmm5,%xmm2
   .byte  102,15,114,242,16                   // pslld         $0x10,%xmm2
@@ -52347,7 +54961,7 @@
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  102,15,111,200                      // movdqa        %xmm0,%xmm1
   .byte  102,15,98,205                       // punpckldq     %xmm5,%xmm1
-  .byte  117,82                              // jne           666e <_sk_store_f16_sse2+0x1b5>
+  .byte  117,82                              // jne           6a43 <_sk_store_f16_sse2+0x1b5>
   .byte  15,17,12,203                        // movups        %xmm1,(%ebx,%ecx,8)
   .byte  102,15,106,197                      // punpckhdq     %xmm5,%xmm0
   .byte  243,15,127,68,203,16                // movdqu        %xmm0,0x10(%ebx,%ecx,8)
@@ -52373,13 +54987,13 @@
   .byte  195                                 // ret
   .byte  102,15,214,12,203                   // movq          %xmm1,(%ebx,%ecx,8)
   .byte  131,255,1                           // cmp           $0x1,%edi
-  .byte  116,178                             // je            662a <_sk_store_f16_sse2+0x171>
+  .byte  116,178                             // je            69ff <_sk_store_f16_sse2+0x171>
   .byte  102,15,23,76,203,8                  // movhpd        %xmm1,0x8(%ebx,%ecx,8)
   .byte  131,255,3                           // cmp           $0x3,%edi
-  .byte  114,167                             // jb            662a <_sk_store_f16_sse2+0x171>
+  .byte  114,167                             // jb            69ff <_sk_store_f16_sse2+0x171>
   .byte  102,15,106,197                      // punpckhdq     %xmm5,%xmm0
   .byte  102,15,214,68,203,16                // movq          %xmm0,0x10(%ebx,%ecx,8)
-  .byte  235,155                             // jmp           662a <_sk_store_f16_sse2+0x171>
+  .byte  235,155                             // jmp           69ff <_sk_store_f16_sse2+0x171>
 
 HIDDEN _sk_load_u16_be_sse2
 .globl _sk_load_u16_be_sse2
@@ -52391,7 +55005,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,140,0,0,0                   // sub           $0x8c,%esp
-  .byte  232,0,0,0,0                         // call          66a0 <_sk_load_u16_be_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          6a75 <_sk_load_u16_be_sse2+0x11>
   .byte  91                                  // pop           %ebx
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
@@ -52401,7 +55015,7 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  141,52,189,0,0,0,0                  // lea           0x0(,%edi,4),%esi
-  .byte  15,133,66,1,0,0                     // jne           6803 <_sk_load_u16_be_sse2+0x174>
+  .byte  15,133,66,1,0,0                     // jne           6bd8 <_sk_load_u16_be_sse2+0x174>
   .byte  102,15,16,4,113                     // movupd        (%ecx,%esi,2),%xmm0
   .byte  243,15,111,76,113,16                // movdqu        0x10(%ecx,%esi,2),%xmm1
   .byte  102,15,40,208                       // movapd        %xmm0,%xmm2
@@ -52422,7 +55036,7 @@
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,97,195                       // punpcklwd     %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,40,163,128,49,0,0                // movaps        0x3180(%ebx),%xmm4
+  .byte  15,40,163,235,49,0,0                // movaps        0x31eb(%ebx),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  102,15,111,205                      // movdqa        %xmm5,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -52483,12 +55097,12 @@
   .byte  242,15,16,4,113                     // movsd         (%ecx,%esi,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  15,132,183,254,255,255              // je            66cc <_sk_load_u16_be_sse2+0x3d>
+  .byte  15,132,183,254,255,255              // je            6aa1 <_sk_load_u16_be_sse2+0x3d>
   .byte  102,15,22,68,113,8                  // movhpd        0x8(%ecx,%esi,2),%xmm0
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  15,130,168,254,255,255              // jb            66cc <_sk_load_u16_be_sse2+0x3d>
+  .byte  15,130,168,254,255,255              // jb            6aa1 <_sk_load_u16_be_sse2+0x3d>
   .byte  243,15,126,76,113,16                // movq          0x10(%ecx,%esi,2),%xmm1
-  .byte  233,157,254,255,255                 // jmp           66cc <_sk_load_u16_be_sse2+0x3d>
+  .byte  233,157,254,255,255                 // jmp           6aa1 <_sk_load_u16_be_sse2+0x3d>
 
 HIDDEN _sk_load_rgb_u16_be_sse2
 .globl _sk_load_rgb_u16_be_sse2
@@ -52500,7 +55114,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,124                         // sub           $0x7c,%esp
-  .byte  232,0,0,0,0                         // call          683d <_sk_load_rgb_u16_be_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          6c12 <_sk_load_rgb_u16_be_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
@@ -52511,7 +55125,7 @@
   .byte  133,246                             // test          %esi,%esi
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
   .byte  141,60,91                           // lea           (%ebx,%ebx,2),%edi
-  .byte  15,133,32,1,0,0                     // jne           697e <_sk_load_rgb_u16_be_sse2+0x14f>
+  .byte  15,133,32,1,0,0                     // jne           6d53 <_sk_load_rgb_u16_be_sse2+0x14f>
   .byte  243,15,111,20,122                   // movdqu        (%edx,%edi,2),%xmm2
   .byte  243,15,111,124,122,8                // movdqu        0x8(%edx,%edi,2),%xmm7
   .byte  102,15,115,223,4                    // psrldq        $0x4,%xmm7
@@ -52536,7 +55150,7 @@
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  102,15,97,199                       // punpcklwd     %xmm7,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,40,160,243,47,0,0                // movaps        0x2ff3(%eax),%xmm4
+  .byte  15,40,160,94,48,0,0                 // movaps        0x305e(%eax),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -52574,7 +55188,7 @@
   .byte  137,84,36,4                         // mov           %edx,0x4(%esp)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
   .byte  137,20,36                           // mov           %edx,(%esp)
-  .byte  15,40,152,3,48,0,0                  // movaps        0x3003(%eax),%xmm3
+  .byte  15,40,152,110,48,0,0                // movaps        0x306e(%eax),%xmm3
   .byte  255,81,4                            // call          *0x4(%ecx)
   .byte  131,196,124                         // add           $0x7c,%esp
   .byte  94                                  // pop           %esi
@@ -52586,20 +55200,20 @@
   .byte  102,15,196,84,122,4,2               // pinsrw        $0x2,0x4(%edx,%edi,2),%xmm2
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  131,254,1                           // cmp           $0x1,%esi
-  .byte  117,13                              // jne           69a0 <_sk_load_rgb_u16_be_sse2+0x171>
+  .byte  117,13                              // jne           6d75 <_sk_load_rgb_u16_be_sse2+0x171>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,224,254,255,255                 // jmp           6880 <_sk_load_rgb_u16_be_sse2+0x51>
+  .byte  233,224,254,255,255                 // jmp           6c55 <_sk_load_rgb_u16_be_sse2+0x51>
   .byte  102,15,110,68,122,6                 // movd          0x6(%edx,%edi,2),%xmm0
   .byte  102,15,196,68,122,10,2              // pinsrw        $0x2,0xa(%edx,%edi,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  131,254,3                           // cmp           $0x3,%esi
-  .byte  114,18                              // jb            69c8 <_sk_load_rgb_u16_be_sse2+0x199>
+  .byte  114,18                              // jb            6d9d <_sk_load_rgb_u16_be_sse2+0x199>
   .byte  102,15,110,124,122,12               // movd          0xc(%edx,%edi,2),%xmm7
   .byte  102,15,196,124,122,16,2             // pinsrw        $0x2,0x10(%edx,%edi,2),%xmm7
-  .byte  233,184,254,255,255                 // jmp           6880 <_sk_load_rgb_u16_be_sse2+0x51>
+  .byte  233,184,254,255,255                 // jmp           6c55 <_sk_load_rgb_u16_be_sse2+0x51>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
-  .byte  233,175,254,255,255                 // jmp           6880 <_sk_load_rgb_u16_be_sse2+0x51>
+  .byte  233,175,254,255,255                 // jmp           6c55 <_sk_load_rgb_u16_be_sse2+0x51>
 
 HIDDEN _sk_store_u16_be_sse2
 .globl _sk_store_u16_be_sse2
@@ -52612,9 +55226,9 @@
   .byte  86                                  // push          %esi
   .byte  131,236,124                         // sub           $0x7c,%esp
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
-  .byte  232,0,0,0,0                         // call          69e3 <_sk_store_u16_be_sse2+0x12>
+  .byte  232,0,0,0,0                         // call          6db8 <_sk_store_u16_be_sse2+0x12>
   .byte  88                                  // pop           %eax
-  .byte  15,40,176,109,46,0,0                // movaps        0x2e6d(%eax),%xmm6
+  .byte  15,40,176,216,46,0,0                // movaps        0x2ed8(%eax),%xmm6
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
   .byte  15,89,230                           // mulps         %xmm6,%xmm4
   .byte  102,15,91,228                       // cvtps2dq      %xmm4,%xmm4
@@ -52668,7 +55282,7 @@
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
   .byte  102,15,111,220                      // movdqa        %xmm4,%xmm3
   .byte  102,15,98,221                       // punpckldq     %xmm5,%xmm3
-  .byte  117,82                              // jne           6b16 <_sk_store_u16_be_sse2+0x145>
+  .byte  117,82                              // jne           6eeb <_sk_store_u16_be_sse2+0x145>
   .byte  15,17,28,83                         // movups        %xmm3,(%ebx,%edx,2)
   .byte  102,15,106,229                      // punpckhdq     %xmm5,%xmm4
   .byte  243,15,127,100,83,16                // movdqu        %xmm4,0x10(%ebx,%edx,2)
@@ -52695,13 +55309,13 @@
   .byte  195                                 // ret
   .byte  102,15,214,28,83                    // movq          %xmm3,(%ebx,%edx,2)
   .byte  131,255,1                           // cmp           $0x1,%edi
-  .byte  116,178                             // je            6ad2 <_sk_store_u16_be_sse2+0x101>
+  .byte  116,178                             // je            6ea7 <_sk_store_u16_be_sse2+0x101>
   .byte  102,15,23,92,83,8                   // movhpd        %xmm3,0x8(%ebx,%edx,2)
   .byte  131,255,3                           // cmp           $0x3,%edi
-  .byte  114,167                             // jb            6ad2 <_sk_store_u16_be_sse2+0x101>
+  .byte  114,167                             // jb            6ea7 <_sk_store_u16_be_sse2+0x101>
   .byte  102,15,106,229                      // punpckhdq     %xmm5,%xmm4
   .byte  102,15,214,100,83,16                // movq          %xmm4,0x10(%ebx,%edx,2)
-  .byte  235,155                             // jmp           6ad2 <_sk_store_u16_be_sse2+0x101>
+  .byte  235,155                             // jmp           6ea7 <_sk_store_u16_be_sse2+0x101>
 
 HIDDEN _sk_load_f32_sse2
 .globl _sk_load_f32_sse2
@@ -52726,7 +55340,7 @@
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
   .byte  133,210                             // test          %edx,%edx
   .byte  141,52,141,0,0,0,0                  // lea           0x0(,%ecx,4),%esi
-  .byte  117,117                             // jne           6be1 <_sk_load_f32_sse2+0xaa>
+  .byte  117,117                             // jne           6fb6 <_sk_load_f32_sse2+0xaa>
   .byte  15,16,84,179,16                     // movups        0x10(%ebx,%esi,4),%xmm2
   .byte  15,16,92,179,32                     // movups        0x20(%ebx,%esi,4),%xmm3
   .byte  15,16,68,179,48                     // movups        0x30(%ebx,%esi,4),%xmm0
@@ -52764,17 +55378,17 @@
   .byte  195                                 // ret
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  117,8                               // jne           6bf1 <_sk_load_f32_sse2+0xba>
+  .byte  117,8                               // jne           6fc6 <_sk_load_f32_sse2+0xba>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,210                           // xorps         %xmm2,%xmm2
-  .byte  235,138                             // jmp           6b7b <_sk_load_f32_sse2+0x44>
+  .byte  235,138                             // jmp           6f50 <_sk_load_f32_sse2+0x44>
   .byte  15,16,84,179,16                     // movups        0x10(%ebx,%esi,4),%xmm2
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  114,10                              // jb            6c05 <_sk_load_f32_sse2+0xce>
+  .byte  114,10                              // jb            6fda <_sk_load_f32_sse2+0xce>
   .byte  15,16,92,179,32                     // movups        0x20(%ebx,%esi,4),%xmm3
-  .byte  233,118,255,255,255                 // jmp           6b7b <_sk_load_f32_sse2+0x44>
+  .byte  233,118,255,255,255                 // jmp           6f50 <_sk_load_f32_sse2+0x44>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
-  .byte  233,110,255,255,255                 // jmp           6b7b <_sk_load_f32_sse2+0x44>
+  .byte  233,110,255,255,255                 // jmp           6f50 <_sk_load_f32_sse2+0x44>
 
 HIDDEN _sk_load_f32_dst_sse2
 .globl _sk_load_f32_dst_sse2
@@ -52799,7 +55413,7 @@
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
   .byte  133,210                             // test          %edx,%edx
   .byte  141,52,141,0,0,0,0                  // lea           0x0(,%ecx,4),%esi
-  .byte  117,122                             // jne           6cbf <_sk_load_f32_dst_sse2+0xb2>
+  .byte  117,122                             // jne           7094 <_sk_load_f32_dst_sse2+0xb2>
   .byte  15,16,124,179,16                    // movups        0x10(%ebx,%esi,4),%xmm7
   .byte  15,16,92,179,32                     // movups        0x20(%ebx,%esi,4),%xmm3
   .byte  15,16,84,179,48                     // movups        0x30(%ebx,%esi,4),%xmm2
@@ -52837,17 +55451,17 @@
   .byte  195                                 // ret
   .byte  15,87,210                           // xorps         %xmm2,%xmm2
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  117,8                               // jne           6ccf <_sk_load_f32_dst_sse2+0xc2>
+  .byte  117,8                               // jne           70a4 <_sk_load_f32_dst_sse2+0xc2>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,255                           // xorps         %xmm7,%xmm7
-  .byte  235,133                             // jmp           6c54 <_sk_load_f32_dst_sse2+0x47>
+  .byte  235,133                             // jmp           7029 <_sk_load_f32_dst_sse2+0x47>
   .byte  15,16,124,179,16                    // movups        0x10(%ebx,%esi,4),%xmm7
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  114,10                              // jb            6ce3 <_sk_load_f32_dst_sse2+0xd6>
+  .byte  114,10                              // jb            70b8 <_sk_load_f32_dst_sse2+0xd6>
   .byte  15,16,92,179,32                     // movups        0x20(%ebx,%esi,4),%xmm3
-  .byte  233,113,255,255,255                 // jmp           6c54 <_sk_load_f32_dst_sse2+0x47>
+  .byte  233,113,255,255,255                 // jmp           7029 <_sk_load_f32_dst_sse2+0x47>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
-  .byte  233,105,255,255,255                 // jmp           6c54 <_sk_load_f32_dst_sse2+0x47>
+  .byte  233,105,255,255,255                 // jmp           7029 <_sk_load_f32_dst_sse2+0x47>
 
 HIDDEN _sk_store_f32_sse2
 .globl _sk_store_f32_sse2
@@ -52884,7 +55498,7 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,8                            // mov           0x8(%ebp),%ebx
   .byte  141,60,141,0,0,0,0                  // lea           0x0(,%ecx,4),%edi
-  .byte  117,99                              // jne           6da8 <_sk_store_f32_sse2+0xbd>
+  .byte  117,99                              // jne           717d <_sk_store_f32_sse2+0xbd>
   .byte  102,15,21,194                       // unpckhpd      %xmm2,%xmm0
   .byte  15,17,100,190,16                    // movups        %xmm4,0x10(%esi,%edi,4)
   .byte  102,15,17,116,190,32                // movupd        %xmm6,0x20(%esi,%edi,4)
@@ -52914,12 +55528,12 @@
   .byte  93                                  // pop           %ebp
   .byte  195                                 // ret
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  116,173                             // je            6d5a <_sk_store_f32_sse2+0x6f>
+  .byte  116,173                             // je            712f <_sk_store_f32_sse2+0x6f>
   .byte  15,17,100,190,16                    // movups        %xmm4,0x10(%esi,%edi,4)
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  114,163                             // jb            6d5a <_sk_store_f32_sse2+0x6f>
+  .byte  114,163                             // jb            712f <_sk_store_f32_sse2+0x6f>
   .byte  102,15,17,116,190,32                // movupd        %xmm6,0x20(%esi,%edi,4)
-  .byte  235,155                             // jmp           6d5a <_sk_store_f32_sse2+0x6f>
+  .byte  235,155                             // jmp           712f <_sk_store_f32_sse2+0x6f>
 
 HIDDEN _sk_clamp_x_sse2
 .globl _sk_clamp_x_sse2
@@ -53023,7 +55637,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          6ec3 <_sk_repeat_x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          7298 <_sk_repeat_x_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -53037,7 +55651,7 @@
   .byte  243,15,91,245                       // cvttps2dq     %xmm5,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  15,194,238,1                        // cmpltps       %xmm6,%xmm5
-  .byte  15,84,174,157,41,0,0                // andps         0x299d(%esi),%xmm5
+  .byte  15,84,174,8,42,0,0                  // andps         0x2a08(%esi),%xmm5
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,125,40                        // movaps        0x28(%ebp),%xmm7
   .byte  15,92,245                           // subps         %xmm5,%xmm6
@@ -53078,7 +55692,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          6f62 <_sk_repeat_y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          7337 <_sk_repeat_y_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -53092,7 +55706,7 @@
   .byte  243,15,91,245                       // cvttps2dq     %xmm5,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  15,194,238,1                        // cmpltps       %xmm6,%xmm5
-  .byte  15,84,174,14,41,0,0                 // andps         0x290e(%esi),%xmm5
+  .byte  15,84,174,121,41,0,0                // andps         0x2979(%esi),%xmm5
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,125,40                        // movaps        0x28(%ebp),%xmm7
   .byte  15,92,245                           // subps         %xmm5,%xmm6
@@ -53133,7 +55747,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7001 <_sk_mirror_x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          73d6 <_sk_mirror_x_sse2+0xe>
   .byte  95                                  // pop           %edi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -53145,13 +55759,13 @@
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
   .byte  15,92,196                           // subps         %xmm4,%xmm0
-  .byte  243,15,89,183,207,44,0,0            // mulss         0x2ccf(%edi),%xmm6
+  .byte  243,15,89,183,58,45,0,0             // mulss         0x2d3a(%edi),%xmm6
   .byte  15,198,246,0                        // shufps        $0x0,%xmm6,%xmm6
   .byte  15,89,240                           // mulps         %xmm0,%xmm6
   .byte  243,15,91,254                       // cvttps2dq     %xmm6,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
   .byte  15,194,247,1                        // cmpltps       %xmm7,%xmm6
-  .byte  15,84,183,127,40,0,0                // andps         0x287f(%edi),%xmm6
+  .byte  15,84,183,234,40,0,0                // andps         0x28ea(%edi),%xmm6
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
   .byte  15,92,254                           // subps         %xmm6,%xmm7
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
@@ -53197,7 +55811,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          70c2 <_sk_mirror_y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          7497 <_sk_mirror_y_sse2+0xe>
   .byte  95                                  // pop           %edi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -53209,13 +55823,13 @@
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
   .byte  15,92,204                           // subps         %xmm4,%xmm1
-  .byte  243,15,89,183,18,44,0,0             // mulss         0x2c12(%edi),%xmm6
+  .byte  243,15,89,183,125,44,0,0            // mulss         0x2c7d(%edi),%xmm6
   .byte  15,198,246,0                        // shufps        $0x0,%xmm6,%xmm6
   .byte  15,89,241                           // mulps         %xmm1,%xmm6
   .byte  243,15,91,254                       // cvttps2dq     %xmm6,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
   .byte  15,194,247,1                        // cmpltps       %xmm7,%xmm6
-  .byte  15,84,183,206,39,0,0                // andps         0x27ce(%edi),%xmm6
+  .byte  15,84,183,57,40,0,0                 // andps         0x2839(%edi),%xmm6
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
   .byte  15,92,254                           // subps         %xmm6,%xmm7
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
@@ -53261,7 +55875,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7183 <_sk_clamp_x_1_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          7558 <_sk_clamp_x_1_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -53273,7 +55887,7 @@
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  15,95,224                           // maxps         %xmm0,%xmm4
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
-  .byte  15,93,160,29,39,0,0                 // minps         0x271d(%eax),%xmm4
+  .byte  15,93,160,136,39,0,0                // minps         0x2788(%eax),%xmm4
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  141,88,4                            // lea           0x4(%eax),%ebx
   .byte  15,41,68,36,80                      // movaps        %xmm0,0x50(%esp)
@@ -53304,7 +55918,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          71f5 <_sk_repeat_x_1_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          75ca <_sk_repeat_x_1_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -53316,7 +55930,7 @@
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  15,40,248                           // movaps        %xmm0,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,84,184,187,38,0,0                // andps         0x26bb(%eax),%xmm7
+  .byte  15,84,184,38,39,0,0                 // andps         0x2726(%eax),%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,40,125,72                        // movaps        0x48(%ebp),%xmm7
   .byte  15,92,198                           // subps         %xmm6,%xmm0
@@ -53350,21 +55964,21 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7272 <_sk_mirror_x_1_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          7647 <_sk_mirror_x_1_sse2+0xe>
   .byte  95                                  // pop           %edi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
   .byte  139,85,20                           // mov           0x14(%ebp),%edx
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
-  .byte  15,40,175,78,38,0,0                 // movaps        0x264e(%edi),%xmm5
+  .byte  15,40,175,185,38,0,0                // movaps        0x26b9(%edi),%xmm5
   .byte  15,88,197                           // addps         %xmm5,%xmm0
-  .byte  15,40,183,94,38,0,0                 // movaps        0x265e(%edi),%xmm6
+  .byte  15,40,183,201,38,0,0                // movaps        0x26c9(%edi),%xmm6
   .byte  15,89,240                           // mulps         %xmm0,%xmm6
   .byte  243,15,91,254                       // cvttps2dq     %xmm6,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
   .byte  15,194,247,1                        // cmpltps       %xmm7,%xmm6
-  .byte  15,84,183,110,38,0,0                // andps         0x266e(%edi),%xmm6
+  .byte  15,84,183,217,38,0,0                // andps         0x26d9(%edi),%xmm6
   .byte  15,92,254                           // subps         %xmm6,%xmm7
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
   .byte  15,88,255                           // addps         %xmm7,%xmm7
@@ -53405,7 +56019,7 @@
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
-  .byte  232,0,0,0,0                         // call          7312 <_sk_luminance_to_alpha_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          76e7 <_sk_luminance_to_alpha_sse2+0x11>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -53415,9 +56029,9 @@
   .byte  15,40,101,56                        // movaps        0x38(%ebp),%xmm4
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
-  .byte  15,89,128,222,37,0,0                // mulps         0x25de(%eax),%xmm0
-  .byte  15,89,136,238,37,0,0                // mulps         0x25ee(%eax),%xmm1
-  .byte  15,89,152,254,37,0,0                // mulps         0x25fe(%eax),%xmm3
+  .byte  15,89,128,73,38,0,0                 // mulps         0x2649(%eax),%xmm0
+  .byte  15,89,136,89,38,0,0                 // mulps         0x2659(%eax),%xmm1
+  .byte  15,89,152,105,38,0,0                // mulps         0x2669(%eax),%xmm3
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  15,88,200                           // addps         %xmm0,%xmm1
   .byte  15,88,217                           // addps         %xmm1,%xmm3
@@ -53867,7 +56481,7 @@
   .byte  86                                  // push          %esi
   .byte  129,236,156,0,0,0                   // sub           $0x9c,%esp
   .byte  15,41,69,184                        // movaps        %xmm0,-0x48(%ebp)
-  .byte  232,0,0,0,0                         // call          78c8 <_sk_evenly_spaced_gradient_sse2+0x15>
+  .byte  232,0,0,0,0                         // call          7c9d <_sk_evenly_spaced_gradient_sse2+0x15>
   .byte  90                                  // pop           %edx
   .byte  139,77,12                           // mov           0xc(%ebp),%ecx
   .byte  141,65,4                            // lea           0x4(%ecx),%eax
@@ -53878,12 +56492,12 @@
   .byte  78                                  // dec           %esi
   .byte  102,15,110,206                      // movd          %esi,%xmm1
   .byte  102,15,112,201,0                    // pshufd        $0x0,%xmm1,%xmm1
-  .byte  102,15,111,146,88,32,0,0            // movdqa        0x2058(%edx),%xmm2
+  .byte  102,15,111,146,195,32,0,0           // movdqa        0x20c3(%edx),%xmm2
   .byte  102,15,219,209                      // pand          %xmm1,%xmm2
-  .byte  102,15,235,146,104,32,0,0           // por           0x2068(%edx),%xmm2
+  .byte  102,15,235,146,211,32,0,0           // por           0x20d3(%edx),%xmm2
   .byte  102,15,114,209,16                   // psrld         $0x10,%xmm1
-  .byte  102,15,235,138,120,32,0,0           // por           0x2078(%edx),%xmm1
-  .byte  15,88,138,136,32,0,0                // addps         0x2088(%edx),%xmm1
+  .byte  102,15,235,138,227,32,0,0           // por           0x20e3(%edx),%xmm1
+  .byte  15,88,138,243,32,0,0                // addps         0x20f3(%edx),%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,89,200                           // mulps         %xmm0,%xmm1
   .byte  243,15,91,201                       // cvttps2dq     %xmm1,%xmm1
@@ -54006,7 +56620,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7abf <_sk_gauss_a_to_rgba_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          7e94 <_sk_gauss_a_to_rgba_sse2+0xe>
   .byte  90                                  // pop           %edx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -54016,15 +56630,15 @@
   .byte  15,40,85,56                         // movaps        0x38(%ebp),%xmm2
   .byte  15,40,101,72                        // movaps        0x48(%ebp),%xmm4
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
-  .byte  15,40,130,161,30,0,0                // movaps        0x1ea1(%edx),%xmm0
+  .byte  15,40,130,12,31,0,0                 // movaps        0x1f0c(%edx),%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,130,177,30,0,0                // addps         0x1eb1(%edx),%xmm0
+  .byte  15,88,130,28,31,0,0                 // addps         0x1f1c(%edx),%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,130,193,30,0,0                // addps         0x1ec1(%edx),%xmm0
+  .byte  15,88,130,44,31,0,0                 // addps         0x1f2c(%edx),%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,130,209,30,0,0                // addps         0x1ed1(%edx),%xmm0
+  .byte  15,88,130,60,31,0,0                 // addps         0x1f3c(%edx),%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,130,225,30,0,0                // addps         0x1ee1(%edx),%xmm0
+  .byte  15,88,130,76,31,0,0                 // addps         0x1f4c(%edx),%xmm0
   .byte  139,85,12                           // mov           0xc(%ebp),%edx
   .byte  141,90,4                            // lea           0x4(%edx),%ebx
   .byte  15,41,108,36,80                     // movaps        %xmm5,0x50(%esp)
@@ -54057,7 +56671,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,156,0,0,0                   // sub           $0x9c,%esp
-  .byte  232,0,0,0,0                         // call          7b5c <_sk_gradient_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          7f31 <_sk_gradient_sse2+0x11>
   .byte  90                                  // pop           %edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  141,72,4                            // lea           0x4(%eax),%ecx
@@ -54066,12 +56680,12 @@
   .byte  139,7                               // mov           (%edi),%eax
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  131,248,2                           // cmp           $0x2,%eax
-  .byte  114,43                              // jb            7b9e <_sk_gradient_sse2+0x53>
+  .byte  114,43                              // jb            7f73 <_sk_gradient_sse2+0x53>
   .byte  139,79,36                           // mov           0x24(%edi),%ecx
   .byte  72                                  // dec           %eax
   .byte  131,193,4                           // add           $0x4,%ecx
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  15,40,146,84,30,0,0                 // movaps        0x1e54(%edx),%xmm2
+  .byte  15,40,146,191,30,0,0                // movaps        0x1ebf(%edx),%xmm2
   .byte  243,15,16,25                        // movss         (%ecx),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
@@ -54079,7 +56693,7 @@
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
   .byte  131,193,4                           // add           $0x4,%ecx
   .byte  72                                  // dec           %eax
-  .byte  117,231                             // jne           7b85 <_sk_gradient_sse2+0x3a>
+  .byte  117,231                             // jne           7f5a <_sk_gradient_sse2+0x3a>
   .byte  102,15,126,203                      // movd          %xmm1,%ebx
   .byte  102,15,112,209,229                  // pshufd        $0xe5,%xmm1,%xmm2
   .byte  102,15,126,208                      // movd          %xmm2,%eax
@@ -54268,7 +56882,7 @@
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
-  .byte  232,0,0,0,0                         // call          7e1c <_sk_xy_to_unit_angle_sse2+0x1b>
+  .byte  232,0,0,0,0                         // call          81f1 <_sk_xy_to_unit_angle_sse2+0x1b>
   .byte  88                                  // pop           %eax
   .byte  15,87,237                           // xorps         %xmm5,%xmm5
   .byte  15,92,233                           // subps         %xmm1,%xmm5
@@ -54283,35 +56897,35 @@
   .byte  15,94,247                           // divps         %xmm7,%xmm6
   .byte  15,40,254                           // movaps        %xmm6,%xmm7
   .byte  15,89,255                           // mulps         %xmm7,%xmm7
-  .byte  15,40,128,164,27,0,0                // movaps        0x1ba4(%eax),%xmm0
+  .byte  15,40,128,15,28,0,0                 // movaps        0x1c0f(%eax),%xmm0
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
-  .byte  15,88,128,180,27,0,0                // addps         0x1bb4(%eax),%xmm0
+  .byte  15,88,128,31,28,0,0                 // addps         0x1c1f(%eax),%xmm0
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
-  .byte  15,88,128,196,27,0,0                // addps         0x1bc4(%eax),%xmm0
+  .byte  15,88,128,47,28,0,0                 // addps         0x1c2f(%eax),%xmm0
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
-  .byte  15,88,128,212,27,0,0                // addps         0x1bd4(%eax),%xmm0
+  .byte  15,88,128,63,28,0,0                 // addps         0x1c3f(%eax),%xmm0
   .byte  15,89,198                           // mulps         %xmm6,%xmm0
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
   .byte  15,194,236,1                        // cmpltps       %xmm4,%xmm5
-  .byte  15,40,184,228,27,0,0                // movaps        0x1be4(%eax),%xmm7
+  .byte  15,40,184,79,28,0,0                 // movaps        0x1c4f(%eax),%xmm7
   .byte  15,92,248                           // subps         %xmm0,%xmm7
   .byte  15,84,253                           // andps         %xmm5,%xmm7
   .byte  15,85,232                           // andnps        %xmm0,%xmm5
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  15,86,239                           // orps          %xmm7,%xmm5
   .byte  15,194,204,1                        // cmpltps       %xmm4,%xmm1
-  .byte  15,40,128,244,27,0,0                // movaps        0x1bf4(%eax),%xmm0
+  .byte  15,40,128,95,28,0,0                 // movaps        0x1c5f(%eax),%xmm0
   .byte  15,92,197                           // subps         %xmm5,%xmm0
   .byte  15,84,193                           // andps         %xmm1,%xmm0
   .byte  15,85,205                           // andnps        %xmm5,%xmm1
   .byte  15,86,200                           // orps          %xmm0,%xmm1
   .byte  15,40,194                           // movaps        %xmm2,%xmm0
   .byte  15,194,196,1                        // cmpltps       %xmm4,%xmm0
-  .byte  15,40,168,4,28,0,0                  // movaps        0x1c04(%eax),%xmm5
+  .byte  15,40,168,111,28,0,0                // movaps        0x1c6f(%eax),%xmm5
   .byte  15,92,233                           // subps         %xmm1,%xmm5
   .byte  15,84,232                           // andps         %xmm0,%xmm5
   .byte  15,85,193                           // andnps        %xmm1,%xmm0
@@ -54398,16 +57012,16 @@
   .byte  131,236,124                         // sub           $0x7c,%esp
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
-  .byte  232,0,0,0,0                         // call          7f9e <_sk_save_xy_sse2+0x15>
+  .byte  232,0,0,0,0                         // call          8373 <_sk_save_xy_sse2+0x15>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,146,26,0,0                // movaps        0x1a92(%eax),%xmm4
+  .byte  15,40,160,253,26,0,0                // movaps        0x1afd(%eax),%xmm4
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  15,88,236                           // addps         %xmm4,%xmm5
   .byte  243,15,91,245                       // cvttps2dq     %xmm5,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  15,40,253                           // movaps        %xmm5,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,40,144,162,26,0,0                // movaps        0x1aa2(%eax),%xmm2
+  .byte  15,40,144,13,27,0,0                 // movaps        0x1b0d(%eax),%xmm2
   .byte  15,84,250                           // andps         %xmm2,%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,92,238                           // subps         %xmm6,%xmm5
@@ -54511,15 +57125,15 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          80e3 <_sk_bilinear_nx_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          84b8 <_sk_bilinear_nx_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,12                          // mov           0xc(%ebp),%esi
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,7                             // movups        (%edi),%xmm0
-  .byte  15,88,128,109,25,0,0                // addps         0x196d(%eax),%xmm0
-  .byte  15,40,160,125,25,0,0                // movaps        0x197d(%eax),%xmm4
+  .byte  15,88,128,216,25,0,0                // addps         0x19d8(%eax),%xmm0
+  .byte  15,40,160,232,25,0,0                // movaps        0x19e8(%eax),%xmm4
   .byte  139,69,20                           // mov           0x14(%ebp),%eax
   .byte  15,16,111,64                        // movups        0x40(%edi),%xmm5
   .byte  15,92,229                           // subps         %xmm5,%xmm4
@@ -54557,14 +57171,14 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8167 <_sk_bilinear_px_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          853c <_sk_bilinear_px_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,12                          // mov           0xc(%ebp),%esi
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,7                             // movups        (%edi),%xmm0
-  .byte  15,88,128,9,25,0,0                  // addps         0x1909(%eax),%xmm0
+  .byte  15,88,128,116,25,0,0                // addps         0x1974(%eax),%xmm0
   .byte  139,69,20                           // mov           0x14(%ebp),%eax
   .byte  15,16,103,64                        // movups        0x40(%edi),%xmm4
   .byte  15,17,167,128,0,0,0                 // movups        %xmm4,0x80(%edi)
@@ -54601,15 +57215,15 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          81e1 <_sk_bilinear_ny_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          85b6 <_sk_bilinear_ny_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,12                          // mov           0xc(%ebp),%esi
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
-  .byte  15,88,136,159,24,0,0                // addps         0x189f(%eax),%xmm1
-  .byte  15,40,160,175,24,0,0                // movaps        0x18af(%eax),%xmm4
+  .byte  15,88,136,10,25,0,0                 // addps         0x190a(%eax),%xmm1
+  .byte  15,40,160,26,25,0,0                 // movaps        0x191a(%eax),%xmm4
   .byte  139,69,20                           // mov           0x14(%ebp),%eax
   .byte  15,16,111,96                        // movups        0x60(%edi),%xmm5
   .byte  15,92,229                           // subps         %xmm5,%xmm4
@@ -54647,14 +57261,14 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8266 <_sk_bilinear_py_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          863b <_sk_bilinear_py_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,12                          // mov           0xc(%ebp),%esi
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
-  .byte  15,88,136,58,24,0,0                 // addps         0x183a(%eax),%xmm1
+  .byte  15,88,136,165,24,0,0                // addps         0x18a5(%eax),%xmm1
   .byte  139,69,20                           // mov           0x14(%ebp),%eax
   .byte  15,16,103,96                        // movups        0x60(%edi),%xmm4
   .byte  15,17,167,160,0,0,0                 // movups        %xmm4,0xa0(%edi)
@@ -54691,7 +57305,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          82e1 <_sk_bicubic_n3x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          86b6 <_sk_bicubic_n3x_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -54699,12 +57313,12 @@
   .byte  139,58                              // mov           (%edx),%edi
   .byte  15,16,7                             // movups        (%edi),%xmm0
   .byte  15,16,103,64                        // movups        0x40(%edi),%xmm4
-  .byte  15,88,134,207,23,0,0                // addps         0x17cf(%esi),%xmm0
-  .byte  15,40,174,223,23,0,0                // movaps        0x17df(%esi),%xmm5
+  .byte  15,88,134,58,24,0,0                 // addps         0x183a(%esi),%xmm0
+  .byte  15,40,174,74,24,0,0                 // movaps        0x184a(%esi),%xmm5
   .byte  15,92,236                           // subps         %xmm4,%xmm5
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
-  .byte  15,89,174,239,23,0,0                // mulps         0x17ef(%esi),%xmm5
-  .byte  15,88,174,255,23,0,0                // addps         0x17ff(%esi),%xmm5
+  .byte  15,89,174,90,24,0,0                 // mulps         0x185a(%esi),%xmm5
+  .byte  15,88,174,106,24,0,0                // addps         0x186a(%esi),%xmm5
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,89,228                           // mulps         %xmm4,%xmm4
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
@@ -54742,7 +57356,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          837c <_sk_bicubic_n1x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8751 <_sk_bicubic_n1x_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -54750,16 +57364,16 @@
   .byte  139,58                              // mov           (%edx),%edi
   .byte  15,16,7                             // movups        (%edi),%xmm0
   .byte  15,16,103,64                        // movups        0x40(%edi),%xmm4
-  .byte  15,88,134,116,23,0,0                // addps         0x1774(%esi),%xmm0
-  .byte  15,40,174,132,23,0,0                // movaps        0x1784(%esi),%xmm5
+  .byte  15,88,134,223,23,0,0                // addps         0x17df(%esi),%xmm0
+  .byte  15,40,174,239,23,0,0                // movaps        0x17ef(%esi),%xmm5
   .byte  15,92,236                           // subps         %xmm4,%xmm5
-  .byte  15,40,166,148,23,0,0                // movaps        0x1794(%esi),%xmm4
+  .byte  15,40,166,255,23,0,0                // movaps        0x17ff(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,164,23,0,0                // addps         0x17a4(%esi),%xmm4
+  .byte  15,88,166,15,24,0,0                 // addps         0x180f(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,180,23,0,0                // addps         0x17b4(%esi),%xmm4
+  .byte  15,88,166,31,24,0,0                 // addps         0x181f(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,196,23,0,0                // addps         0x17c4(%esi),%xmm4
+  .byte  15,88,166,47,24,0,0                 // addps         0x182f(%esi),%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,17,167,128,0,0,0                 // movups        %xmm4,0x80(%edi)
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
@@ -54795,21 +57409,21 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8425 <_sk_bicubic_p1x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          87fa <_sk_bicubic_p1x_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
   .byte  139,85,12                           // mov           0xc(%ebp),%edx
   .byte  139,58                              // mov           (%edx),%edi
-  .byte  15,40,166,43,23,0,0                 // movaps        0x172b(%esi),%xmm4
+  .byte  15,40,166,150,23,0,0                // movaps        0x1796(%esi),%xmm4
   .byte  15,16,71,64                         // movups        0x40(%edi),%xmm0
-  .byte  15,40,174,59,23,0,0                 // movaps        0x173b(%esi),%xmm5
+  .byte  15,40,174,166,23,0,0                // movaps        0x17a6(%esi),%xmm5
   .byte  15,89,232                           // mulps         %xmm0,%xmm5
-  .byte  15,88,174,75,23,0,0                 // addps         0x174b(%esi),%xmm5
+  .byte  15,88,174,182,23,0,0                // addps         0x17b6(%esi),%xmm5
   .byte  15,89,232                           // mulps         %xmm0,%xmm5
   .byte  15,88,236                           // addps         %xmm4,%xmm5
   .byte  15,89,232                           // mulps         %xmm0,%xmm5
-  .byte  15,88,174,91,23,0,0                 // addps         0x175b(%esi),%xmm5
+  .byte  15,88,174,198,23,0,0                // addps         0x17c6(%esi),%xmm5
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,16,7                             // movups        (%edi),%xmm0
   .byte  15,17,175,128,0,0,0                 // movups        %xmm5,0x80(%edi)
@@ -54847,7 +57461,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          84c3 <_sk_bicubic_p3x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8898 <_sk_bicubic_p3x_sse2+0xe>
   .byte  89                                  // pop           %ecx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -54855,10 +57469,10 @@
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,7                             // movups        (%edi),%xmm0
   .byte  15,16,103,64                        // movups        0x40(%edi),%xmm4
-  .byte  15,88,129,205,22,0,0                // addps         0x16cd(%ecx),%xmm0
+  .byte  15,88,129,56,23,0,0                 // addps         0x1738(%ecx),%xmm0
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
-  .byte  15,89,161,221,22,0,0                // mulps         0x16dd(%ecx),%xmm4
-  .byte  15,88,161,237,22,0,0                // addps         0x16ed(%ecx),%xmm4
+  .byte  15,89,161,72,23,0,0                 // mulps         0x1748(%ecx),%xmm4
+  .byte  15,88,161,88,23,0,0                 // addps         0x1758(%ecx),%xmm4
   .byte  139,77,20                           // mov           0x14(%ebp),%ecx
   .byte  15,89,237                           // mulps         %xmm5,%xmm5
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -54896,7 +57510,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8554 <_sk_bicubic_n3y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8929 <_sk_bicubic_n3y_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -54904,12 +57518,12 @@
   .byte  139,58                              // mov           (%edx),%edi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
   .byte  15,16,103,96                        // movups        0x60(%edi),%xmm4
-  .byte  15,88,142,108,22,0,0                // addps         0x166c(%esi),%xmm1
-  .byte  15,40,174,124,22,0,0                // movaps        0x167c(%esi),%xmm5
+  .byte  15,88,142,215,22,0,0                // addps         0x16d7(%esi),%xmm1
+  .byte  15,40,174,231,22,0,0                // movaps        0x16e7(%esi),%xmm5
   .byte  15,92,236                           // subps         %xmm4,%xmm5
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
-  .byte  15,89,174,140,22,0,0                // mulps         0x168c(%esi),%xmm5
-  .byte  15,88,174,156,22,0,0                // addps         0x169c(%esi),%xmm5
+  .byte  15,89,174,247,22,0,0                // mulps         0x16f7(%esi),%xmm5
+  .byte  15,88,174,7,23,0,0                  // addps         0x1707(%esi),%xmm5
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,89,228                           // mulps         %xmm4,%xmm4
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
@@ -54947,7 +57561,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          85f0 <_sk_bicubic_n1y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          89c5 <_sk_bicubic_n1y_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -54955,16 +57569,16 @@
   .byte  139,58                              // mov           (%edx),%edi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
   .byte  15,16,103,96                        // movups        0x60(%edi),%xmm4
-  .byte  15,88,142,16,22,0,0                 // addps         0x1610(%esi),%xmm1
-  .byte  15,40,174,32,22,0,0                 // movaps        0x1620(%esi),%xmm5
+  .byte  15,88,142,123,22,0,0                // addps         0x167b(%esi),%xmm1
+  .byte  15,40,174,139,22,0,0                // movaps        0x168b(%esi),%xmm5
   .byte  15,92,236                           // subps         %xmm4,%xmm5
-  .byte  15,40,166,48,22,0,0                 // movaps        0x1630(%esi),%xmm4
+  .byte  15,40,166,155,22,0,0                // movaps        0x169b(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,64,22,0,0                 // addps         0x1640(%esi),%xmm4
+  .byte  15,88,166,171,22,0,0                // addps         0x16ab(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,80,22,0,0                 // addps         0x1650(%esi),%xmm4
+  .byte  15,88,166,187,22,0,0                // addps         0x16bb(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,96,22,0,0                 // addps         0x1660(%esi),%xmm4
+  .byte  15,88,166,203,22,0,0                // addps         0x16cb(%esi),%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,17,167,160,0,0,0                 // movups        %xmm4,0xa0(%edi)
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
@@ -55000,21 +57614,21 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          869a <_sk_bicubic_p1y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8a6f <_sk_bicubic_p1y_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
   .byte  139,85,12                           // mov           0xc(%ebp),%edx
   .byte  139,58                              // mov           (%edx),%edi
-  .byte  15,40,166,198,21,0,0                // movaps        0x15c6(%esi),%xmm4
+  .byte  15,40,166,49,22,0,0                 // movaps        0x1631(%esi),%xmm4
   .byte  15,16,79,96                         // movups        0x60(%edi),%xmm1
-  .byte  15,40,174,214,21,0,0                // movaps        0x15d6(%esi),%xmm5
+  .byte  15,40,174,65,22,0,0                 // movaps        0x1641(%esi),%xmm5
   .byte  15,89,233                           // mulps         %xmm1,%xmm5
-  .byte  15,88,174,230,21,0,0                // addps         0x15e6(%esi),%xmm5
+  .byte  15,88,174,81,22,0,0                 // addps         0x1651(%esi),%xmm5
   .byte  15,89,233                           // mulps         %xmm1,%xmm5
   .byte  15,88,236                           // addps         %xmm4,%xmm5
   .byte  15,89,233                           // mulps         %xmm1,%xmm5
-  .byte  15,88,174,246,21,0,0                // addps         0x15f6(%esi),%xmm5
+  .byte  15,88,174,97,22,0,0                 // addps         0x1661(%esi),%xmm5
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
   .byte  15,17,175,160,0,0,0                 // movups        %xmm5,0xa0(%edi)
@@ -55052,7 +57666,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8739 <_sk_bicubic_p3y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8b0e <_sk_bicubic_p3y_sse2+0xe>
   .byte  89                                  // pop           %ecx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -55060,10 +57674,10 @@
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
   .byte  15,16,103,96                        // movups        0x60(%edi),%xmm4
-  .byte  15,88,137,103,21,0,0                // addps         0x1567(%ecx),%xmm1
+  .byte  15,88,137,210,21,0,0                // addps         0x15d2(%ecx),%xmm1
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
-  .byte  15,89,161,119,21,0,0                // mulps         0x1577(%ecx),%xmm4
-  .byte  15,88,161,135,21,0,0                // addps         0x1587(%ecx),%xmm4
+  .byte  15,89,161,226,21,0,0                // mulps         0x15e2(%ecx),%xmm4
+  .byte  15,88,161,242,21,0,0                // addps         0x15f2(%ecx),%xmm4
   .byte  139,77,20                           // mov           0x14(%ebp),%ecx
   .byte  15,89,237                           // mulps         %xmm5,%xmm5
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -55313,11 +57927,11 @@
   .byte  0,224                               // add           %ah,%al
   .byte  64                                  // inc           %eax
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,64                              // loopne        8a88 <.literal16+0x1d8>
+  .byte  224,64                              // loopne        8e58 <.literal16+0x1d8>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,64                              // loopne        8a8c <.literal16+0x1dc>
+  .byte  224,64                              // loopne        8e5c <.literal16+0x1dc>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,64                              // loopne        8a90 <.literal16+0x1e0>
+  .byte  224,64                              // loopne        8e60 <.literal16+0x1e0>
   .byte  154,153,153,62,154,153,153          // lcall         $0x9999,$0x9a3e9999
   .byte  62,154,153,153,62,154,153,153       // ds            lcall $0x9999,$0x9a3e9999
   .byte  62,61,10,23,63,61                   // ds            cmp $0x3d3f170a,%eax
@@ -55328,16 +57942,16 @@
   .byte  63                                  // aas
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8ab1 <.literal16+0x201>
+  .byte  225,61                              // loope         8e81 <.literal16+0x201>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8ab5 <.literal16+0x205>
+  .byte  225,61                              // loope         8e85 <.literal16+0x205>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8ab9 <.literal16+0x209>
+  .byte  225,61                              // loope         8e89 <.literal16+0x209>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8abd <.literal16+0x20d>
+  .byte  225,61                              // loope         8e8d <.literal16+0x20d>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -55354,16 +57968,16 @@
   .byte  63                                  // aas
   .byte  61,10,23,63,174                     // cmp           $0xae3f170a,%eax
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8af1 <.literal16+0x241>
+  .byte  225,61                              // loope         8ec1 <.literal16+0x241>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8af5 <.literal16+0x245>
+  .byte  225,61                              // loope         8ec5 <.literal16+0x245>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8af9 <.literal16+0x249>
+  .byte  225,61                              // loope         8ec9 <.literal16+0x249>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8afd <.literal16+0x24d>
+  .byte  225,61                              // loope         8ecd <.literal16+0x24d>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -55380,16 +57994,16 @@
   .byte  63                                  // aas
   .byte  61,10,23,63,174                     // cmp           $0xae3f170a,%eax
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8b31 <.literal16+0x281>
+  .byte  225,61                              // loope         8f01 <.literal16+0x281>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8b35 <.literal16+0x285>
+  .byte  225,61                              // loope         8f05 <.literal16+0x285>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8b39 <.literal16+0x289>
+  .byte  225,61                              // loope         8f09 <.literal16+0x289>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8b3d <.literal16+0x28d>
+  .byte  225,61                              // loope         8f0d <.literal16+0x28d>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -55406,16 +58020,16 @@
   .byte  63                                  // aas
   .byte  61,10,23,63,174                     // cmp           $0xae3f170a,%eax
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8b71 <.literal16+0x2c1>
+  .byte  225,61                              // loope         8f41 <.literal16+0x2c1>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8b75 <.literal16+0x2c5>
+  .byte  225,61                              // loope         8f45 <.literal16+0x2c5>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8b79 <.literal16+0x2c9>
+  .byte  225,61                              // loope         8f49 <.literal16+0x2c9>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         8b7d <.literal16+0x2cd>
+  .byte  225,61                              // loope         8f4d <.literal16+0x2cd>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -55437,11 +58051,11 @@
   .byte  0,128,63,0,0,127                    // add           %al,0x7f00003f(%eax)
   .byte  67                                  // inc           %ebx
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            8bbb <.literal16+0x30b>
+  .byte  127,67                              // jg            8f8b <.literal16+0x30b>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            8bbf <.literal16+0x30f>
+  .byte  127,67                              // jg            8f8f <.literal16+0x30f>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            8bc3 <.literal16+0x313>
+  .byte  127,67                              // jg            8f93 <.literal16+0x313>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -55710,13 +58324,13 @@
   .byte  132,55                              // test          %dh,(%edi)
   .byte  8,33                                // or            %ah,(%ecx)
   .byte  132,55                              // test          %dh,(%edi)
-  .byte  224,7                               // loopne        8e09 <.literal16+0x559>
+  .byte  224,7                               // loopne        91d9 <.literal16+0x559>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        8e0d <.literal16+0x55d>
+  .byte  224,7                               // loopne        91dd <.literal16+0x55d>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        8e11 <.literal16+0x561>
+  .byte  224,7                               // loopne        91e1 <.literal16+0x561>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        8e15 <.literal16+0x565>
+  .byte  224,7                               // loopne        91e5 <.literal16+0x565>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  33,8                                // and           %ecx,(%eax)
   .byte  2,58                                // add           (%edx),%bh
@@ -55765,11 +58379,11 @@
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,127,67                            // add           %bh,0x43(%edi)
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            8ecb <.literal16+0x61b>
+  .byte  127,67                              // jg            929b <.literal16+0x61b>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            8ecf <.literal16+0x61f>
+  .byte  127,67                              // jg            929f <.literal16+0x61f>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            8ed3 <.literal16+0x623>
+  .byte  127,67                              // jg            92a3 <.literal16+0x623>
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%eax)
   .byte  128,59,129                          // cmpb          $0x81,(%ebx)
   .byte  128,128,59,129,128,128,59           // addb          $0x3b,-0x7f7f7ec5(%eax)
@@ -55784,16 +58398,16 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            8ec4 <.literal16+0x614>
+  .byte  127,0                               // jg            9294 <.literal16+0x614>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            8ec8 <.literal16+0x618>
+  .byte  127,0                               // jg            9298 <.literal16+0x618>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            8ecc <.literal16+0x61c>
+  .byte  127,0                               // jg            929c <.literal16+0x61c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            8ed0 <.literal16+0x620>
+  .byte  127,0                               // jg            92a0 <.literal16+0x620>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
@@ -55802,7 +58416,7 @@
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
-  .byte  119,115                             // ja            8f55 <.literal16+0x6a5>
+  .byte  119,115                             // ja            9325 <.literal16+0x6a5>
   .byte  248                                 // clc
   .byte  194,119,115                         // ret           $0x7377
   .byte  248                                 // clc
@@ -55813,7 +58427,7 @@
   .byte  194,117,191                         // ret           $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
-  .byte  117,191                             // jne           8eb9 <.literal16+0x609>
+  .byte  117,191                             // jne           9289 <.literal16+0x609>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
   .byte  249                                 // stc
@@ -55829,7 +58443,7 @@
   .byte  68                                  // inc           %esp
   .byte  180,62                              // mov           $0x3e,%ah
   .byte  163,233,220,63,163                  // mov           %eax,0xa33fdce9
-  .byte  233,220,63,163,233                  // jmp           e9a3cef6 <_sk_callback_sse2+0xe9a34739>
+  .byte  233,220,63,163,233                  // jmp           e9a3d2c6 <_sk_callback_sse2+0xe9a34734>
   .byte  220,63                              // fdivrl        (%edi)
   .byte  163,233,220,63,0                    // mov           %eax,0x3fdce9
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -55884,16 +58498,16 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            8f94 <.literal16+0x6e4>
+  .byte  127,0                               // jg            9364 <.literal16+0x6e4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            8f98 <.literal16+0x6e8>
+  .byte  127,0                               // jg            9368 <.literal16+0x6e8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            8f9c <.literal16+0x6ec>
+  .byte  127,0                               // jg            936c <.literal16+0x6ec>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            8fa0 <.literal16+0x6f0>
+  .byte  127,0                               // jg            9370 <.literal16+0x6f0>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
@@ -55902,7 +58516,7 @@
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
-  .byte  119,115                             // ja            9025 <.literal16+0x775>
+  .byte  119,115                             // ja            93f5 <.literal16+0x775>
   .byte  248                                 // clc
   .byte  194,119,115                         // ret           $0x7377
   .byte  248                                 // clc
@@ -55913,7 +58527,7 @@
   .byte  194,117,191                         // ret           $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
-  .byte  117,191                             // jne           8f89 <.literal16+0x6d9>
+  .byte  117,191                             // jne           9359 <.literal16+0x6d9>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
   .byte  249                                 // stc
@@ -55929,7 +58543,7 @@
   .byte  68                                  // inc           %esp
   .byte  180,62                              // mov           $0x3e,%ah
   .byte  163,233,220,63,163                  // mov           %eax,0xa33fdce9
-  .byte  233,220,63,163,233                  // jmp           e9a3cfc6 <_sk_callback_sse2+0xe9a34809>
+  .byte  233,220,63,163,233                  // jmp           e9a3d396 <_sk_callback_sse2+0xe9a34804>
   .byte  220,63                              // fdivrl        (%edi)
   .byte  163,233,220,63,0                    // mov           %eax,0x3fdce9
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -55984,16 +58598,16 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9064 <.literal16+0x7b4>
+  .byte  127,0                               // jg            9434 <.literal16+0x7b4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9068 <.literal16+0x7b8>
+  .byte  127,0                               // jg            9438 <.literal16+0x7b8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            906c <.literal16+0x7bc>
+  .byte  127,0                               // jg            943c <.literal16+0x7bc>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9070 <.literal16+0x7c0>
+  .byte  127,0                               // jg            9440 <.literal16+0x7c0>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
@@ -56002,7 +58616,7 @@
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
-  .byte  119,115                             // ja            90f5 <.literal16+0x845>
+  .byte  119,115                             // ja            94c5 <.literal16+0x845>
   .byte  248                                 // clc
   .byte  194,119,115                         // ret           $0x7377
   .byte  248                                 // clc
@@ -56013,7 +58627,7 @@
   .byte  194,117,191                         // ret           $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
-  .byte  117,191                             // jne           9059 <.literal16+0x7a9>
+  .byte  117,191                             // jne           9429 <.literal16+0x7a9>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
   .byte  249                                 // stc
@@ -56029,7 +58643,7 @@
   .byte  68                                  // inc           %esp
   .byte  180,62                              // mov           $0x3e,%ah
   .byte  163,233,220,63,163                  // mov           %eax,0xa33fdce9
-  .byte  233,220,63,163,233                  // jmp           e9a3d096 <_sk_callback_sse2+0xe9a348d9>
+  .byte  233,220,63,163,233                  // jmp           e9a3d466 <_sk_callback_sse2+0xe9a348d4>
   .byte  220,63                              // fdivrl        (%edi)
   .byte  163,233,220,63,0                    // mov           %eax,0x3fdce9
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -56084,16 +58698,16 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9134 <.literal16+0x884>
+  .byte  127,0                               // jg            9504 <.literal16+0x884>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9138 <.literal16+0x888>
+  .byte  127,0                               // jg            9508 <.literal16+0x888>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            913c <.literal16+0x88c>
+  .byte  127,0                               // jg            950c <.literal16+0x88c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9140 <.literal16+0x890>
+  .byte  127,0                               // jg            9510 <.literal16+0x890>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
@@ -56102,7 +58716,7 @@
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
-  .byte  119,115                             // ja            91c5 <.literal16+0x915>
+  .byte  119,115                             // ja            9595 <.literal16+0x915>
   .byte  248                                 // clc
   .byte  194,119,115                         // ret           $0x7377
   .byte  248                                 // clc
@@ -56113,7 +58727,7 @@
   .byte  194,117,191                         // ret           $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
-  .byte  117,191                             // jne           9129 <.literal16+0x879>
+  .byte  117,191                             // jne           94f9 <.literal16+0x879>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
   .byte  249                                 // stc
@@ -56129,7 +58743,7 @@
   .byte  68                                  // inc           %esp
   .byte  180,62                              // mov           $0x3e,%ah
   .byte  163,233,220,63,163                  // mov           %eax,0xa33fdce9
-  .byte  233,220,63,163,233                  // jmp           e9a3d166 <_sk_callback_sse2+0xe9a349a9>
+  .byte  233,220,63,163,233                  // jmp           e9a3d536 <_sk_callback_sse2+0xe9a349a4>
   .byte  220,63                              // fdivrl        (%edi)
   .byte  163,233,220,63,0                    // mov           %eax,0x3fdce9
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -56180,13 +58794,13 @@
   .byte  200,66,0,0                          // enter         $0x42,$0x0
   .byte  200,66,0,0                          // enter         $0x42,$0x0
   .byte  200,66,0,0                          // enter         $0x42,$0x0
-  .byte  127,67                              // jg            9247 <.literal16+0x997>
+  .byte  127,67                              // jg            9617 <.literal16+0x997>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            924b <.literal16+0x99b>
+  .byte  127,67                              // jg            961b <.literal16+0x99b>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            924f <.literal16+0x99f>
+  .byte  127,67                              // jg            961f <.literal16+0x99f>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9253 <.literal16+0x9a3>
+  .byte  127,67                              // jg            9623 <.literal16+0x9a3>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%eax)
@@ -56237,16 +58851,16 @@
   .byte  128,3,62                            // addb          $0x3e,(%ebx)
   .byte  31                                  // pop           %ds
   .byte  215                                 // xlat          %ds:(%ebx)
-  .byte  118,63                              // jbe           92d3 <.literal16+0xa23>
+  .byte  118,63                              // jbe           96a3 <.literal16+0xa23>
   .byte  31                                  // pop           %ds
   .byte  215                                 // xlat          %ds:(%ebx)
-  .byte  118,63                              // jbe           92d7 <.literal16+0xa27>
+  .byte  118,63                              // jbe           96a7 <.literal16+0xa27>
   .byte  31                                  // pop           %ds
   .byte  215                                 // xlat          %ds:(%ebx)
-  .byte  118,63                              // jbe           92db <.literal16+0xa2b>
+  .byte  118,63                              // jbe           96ab <.literal16+0xa2b>
   .byte  31                                  // pop           %ds
   .byte  215                                 // xlat          %ds:(%ebx)
-  .byte  118,63                              // jbe           92df <.literal16+0xa2f>
+  .byte  118,63                              // jbe           96af <.literal16+0xa2f>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%eax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%eax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%eax)
@@ -56275,11 +58889,11 @@
   .byte  128,59,0                            // cmpb          $0x0,(%ebx)
   .byte  0,127,67                            // add           %bh,0x43(%edi)
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            934b <.literal16+0xa9b>
+  .byte  127,67                              // jg            971b <.literal16+0xa9b>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            934f <.literal16+0xa9f>
+  .byte  127,67                              // jg            971f <.literal16+0xa9f>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9353 <.literal16+0xaa3>
+  .byte  127,67                              // jg            9723 <.literal16+0xaa3>
   .byte  255,0                               // incl          (%eax)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,0                                 // add           %al,(%eax)
@@ -56350,13 +58964,13 @@
   .byte  132,55                              // test          %dh,(%edi)
   .byte  8,33                                // or            %ah,(%ecx)
   .byte  132,55                              // test          %dh,(%edi)
-  .byte  224,7                               // loopne        93e9 <.literal16+0xb39>
+  .byte  224,7                               // loopne        97b9 <.literal16+0xb39>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        93ed <.literal16+0xb3d>
+  .byte  224,7                               // loopne        97bd <.literal16+0xb3d>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        93f1 <.literal16+0xb41>
+  .byte  224,7                               // loopne        97c1 <.literal16+0xb41>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        93f5 <.literal16+0xb45>
+  .byte  224,7                               // loopne        97c5 <.literal16+0xb45>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  33,8                                // and           %ecx,(%eax)
   .byte  2,58                                // add           (%edx),%bh
@@ -56402,13 +59016,13 @@
   .byte  132,55                              // test          %dh,(%edi)
   .byte  8,33                                // or            %ah,(%ecx)
   .byte  132,55                              // test          %dh,(%edi)
-  .byte  224,7                               // loopne        9459 <.literal16+0xba9>
+  .byte  224,7                               // loopne        9829 <.literal16+0xba9>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        945d <.literal16+0xbad>
+  .byte  224,7                               // loopne        982d <.literal16+0xbad>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9461 <.literal16+0xbb1>
+  .byte  224,7                               // loopne        9831 <.literal16+0xbb1>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9465 <.literal16+0xbb5>
+  .byte  224,7                               // loopne        9835 <.literal16+0xbb5>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  33,8                                // and           %ecx,(%eax)
   .byte  2,58                                // add           (%edx),%bh
@@ -56454,13 +59068,13 @@
   .byte  132,55                              // test          %dh,(%edi)
   .byte  8,33                                // or            %ah,(%ecx)
   .byte  132,55                              // test          %dh,(%edi)
-  .byte  224,7                               // loopne        94c9 <.literal16+0xc19>
+  .byte  224,7                               // loopne        9899 <.literal16+0xc19>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        94cd <.literal16+0xc1d>
+  .byte  224,7                               // loopne        989d <.literal16+0xc1d>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        94d1 <.literal16+0xc21>
+  .byte  224,7                               // loopne        98a1 <.literal16+0xc21>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        94d5 <.literal16+0xc25>
+  .byte  224,7                               // loopne        98a5 <.literal16+0xc25>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  33,8                                // and           %ecx,(%eax)
   .byte  2,58                                // add           (%edx),%bh
@@ -56502,13 +59116,13 @@
   .byte  248                                 // clc
   .byte  65                                  // inc           %ecx
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  124,66                              // jl            9566 <.literal16+0xcb6>
+  .byte  124,66                              // jl            9936 <.literal16+0xcb6>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  124,66                              // jl            956a <.literal16+0xcba>
+  .byte  124,66                              // jl            993a <.literal16+0xcba>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  124,66                              // jl            956e <.literal16+0xcbe>
+  .byte  124,66                              // jl            993e <.literal16+0xcbe>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  124,66                              // jl            9572 <.literal16+0xcc2>
+  .byte  124,66                              // jl            9942 <.literal16+0xcc2>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,240                               // add           %dh,%al
@@ -56642,13 +59256,13 @@
   .byte  136,136,61,137,136,136              // mov           %cl,-0x777776c3(%eax)
   .byte  61,137,136,136,61                   // cmp           $0x3d888889,%eax
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  112,65                              // jo            96f5 <.literal16+0xe45>
+  .byte  112,65                              // jo            9ac5 <.literal16+0xe45>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  112,65                              // jo            96f9 <.literal16+0xe49>
+  .byte  112,65                              // jo            9ac9 <.literal16+0xe49>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  112,65                              // jo            96fd <.literal16+0xe4d>
+  .byte  112,65                              // jo            9acd <.literal16+0xe4d>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  112,65                              // jo            9701 <.literal16+0xe51>
+  .byte  112,65                              // jo            9ad1 <.literal16+0xe51>
   .byte  255,0                               // incl          (%eax)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  255,0                               // incl          (%eax)
@@ -56679,11 +59293,46 @@
   .byte  128,59,129                          // cmpb          $0x81,(%ebx)
   .byte  128,128,59,0,0,127,67               // addb          $0x43,0x7f00003b(%eax)
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            976b <.literal16+0xebb>
+  .byte  127,67                              // jg            9b3b <.literal16+0xebb>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            976f <.literal16+0xebf>
+  .byte  127,67                              // jg            9b3f <.literal16+0xebf>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9773 <.literal16+0xec3>
+  .byte  127,67                              // jg            9b43 <.literal16+0xec3>
+  .byte  255,0                               // incl          (%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  255,0                               // incl          (%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  255,0                               // incl          (%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  255,0                               // incl          (%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%eax)
+  .byte  128,59,129                          // cmpb          $0x81,(%ebx)
+  .byte  128,128,59,255,0,0,0                // addb          $0x0,0xff3b(%eax)
+  .byte  255,0                               // incl          (%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  255,0                               // incl          (%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  255,0                               // incl          (%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%eax)
+  .byte  128,59,129                          // cmpb          $0x81,(%ebx)
+  .byte  128,128,59,255,0,0,0                // addb          $0x0,0xff3b(%eax)
+  .byte  255,0                               // incl          (%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  255,0                               // incl          (%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  255,0                               // incl          (%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%eax)
+  .byte  128,59,129                          // cmpb          $0x81,(%ebx)
+  .byte  128,128,59,0,0,127,67               // addb          $0x43,0x7f00003b(%eax)
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  127,67                              // jg            9bab <.literal16+0xf2b>
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  127,67                              // jg            9baf <.literal16+0xf2f>
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  127,67                              // jg            9bb3 <.literal16+0xf33>
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%eax)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%eax)
@@ -56782,13 +59431,13 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  255                                 // (bad)
-  .byte  127,71                              // jg            989b <.literal16+0xfeb>
+  .byte  127,71                              // jg            9cdb <.literal16+0x105b>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            989f <.literal16+0xfef>
+  .byte  127,71                              // jg            9cdf <.literal16+0x105f>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            98a3 <.literal16+0xff3>
+  .byte  127,71                              // jg            9ce3 <.literal16+0x1063>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            98a7 <.literal16+0xff7>
+  .byte  127,71                              // jg            9ce7 <.literal16+0x1067>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -56896,7 +59545,7 @@
   .byte  192,45,16,17,192,45,16              // shrb          $0x10,0x2dc01110
   .byte  17,192                              // adc           %eax,%eax
   .byte  45,16,17,192,18                     // sub           $0x12c01110,%eax
-  .byte  120,57                              // js            99ac <.literal16+0x10fc>
+  .byte  120,57                              // js            9dec <.literal16+0x116c>
   .byte  64                                  // inc           %eax
   .byte  18,120,57                           // adc           0x39(%eax),%bh
   .byte  64                                  // inc           %eax
@@ -57030,11 +59679,11 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,114                          // cmpb          $0x72,(%edi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         9af2 <.literal16+0x1242>
+  .byte  62,114,28                           // jb,pt         9f32 <.literal16+0x12b2>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         9af6 <.literal16+0x1246>
+  .byte  62,114,28                           // jb,pt         9f36 <.literal16+0x12b6>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         9afa <.literal16+0x124a>
+  .byte  62,114,28                           // jb,pt         9f3a <.literal16+0x12ba>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%edi)
   .byte  170                                 // stos          %al,%es:(%edi)
@@ -57113,13 +59762,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%edi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // aas
-  .byte  114,28                              // jb            9bbe <.literal16+0x130e>
+  .byte  114,28                              // jb            9ffe <.literal16+0x137e>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         9bc2 <.literal16+0x1312>
+  .byte  62,114,28                           // jb,pt         a002 <.literal16+0x1382>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         9bc6 <.literal16+0x1316>
+  .byte  62,114,28                           // jb,pt         a006 <.literal16+0x1386>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         9bca <.literal16+0x131a>
+  .byte  62,114,28                           // jb,pt         a00a <.literal16+0x138a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%edi)
   .byte  170                                 // stos          %al,%es:(%edi)
@@ -57140,11 +59789,11 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,114                          // cmpb          $0x72,(%edi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         9c02 <.literal16+0x1352>
+  .byte  62,114,28                           // jb,pt         a042 <.literal16+0x13c2>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         9c06 <.literal16+0x1356>
+  .byte  62,114,28                           // jb,pt         a046 <.literal16+0x13c6>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         9c0a <.literal16+0x135a>
+  .byte  62,114,28                           // jb,pt         a04a <.literal16+0x13ca>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%edi)
   .byte  170                                 // stos          %al,%es:(%edi)
@@ -57223,13 +59872,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%edi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // aas
-  .byte  114,28                              // jb            9cce <.literal16+0x141e>
+  .byte  114,28                              // jb            a10e <.literal16+0x148e>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         9cd2 <_sk_callback_sse2+0x1515>
+  .byte  62,114,28                           // jb,pt         a112 <_sk_callback_sse2+0x1580>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         9cd6 <_sk_callback_sse2+0x1519>
+  .byte  62,114,28                           // jb,pt         a116 <_sk_callback_sse2+0x1584>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         9cda <_sk_callback_sse2+0x151d>
+  .byte  62,114,28                           // jb,pt         a11a <_sk_callback_sse2+0x1588>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%edi)
   .byte  170                                 // stos          %al,%es:(%edi)
diff --git a/src/jumper/SkJumper_generated_win.S b/src/jumper/SkJumper_generated_win.S
index 4dfd52e..98d4e18 100644
--- a/src/jumper/SkJumper_generated_win.S
+++ b/src/jumper/SkJumper_generated_win.S
@@ -94,7 +94,7 @@
   DB  197,249,110,194                     ; vmovd         %edx,%xmm0
   DB  196,226,125,88,192                  ; vpbroadcastd  %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,218,82,0,0        ; vbroadcastss  0x52da(%rip),%ymm1        # 540c <_sk_callback_hsw+0x12c>
+  DB  196,226,125,24,13,2,85,0,0          ; vbroadcastss  0x5502(%rip),%ymm1        # 5634 <_sk_callback_hsw+0x12c>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,88,7                        ; vaddps        (%rdi),%ymm0,%ymm0
   DB  197,249,110,209                     ; vmovd         %ecx,%xmm2
@@ -102,7 +102,7 @@
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  197,236,88,201                      ; vaddps        %ymm1,%ymm2,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,21,186,82,0,0        ; vbroadcastss  0x52ba(%rip),%ymm2        # 5410 <_sk_callback_hsw+0x130>
+  DB  196,226,125,24,21,226,84,0,0        ; vbroadcastss  0x54e2(%rip),%ymm2        # 5638 <_sk_callback_hsw+0x130>
   DB  197,228,87,219                      ; vxorps        %ymm3,%ymm3,%ymm3
   DB  197,220,87,228                      ; vxorps        %ymm4,%ymm4,%ymm4
   DB  197,212,87,237                      ; vxorps        %ymm5,%ymm5,%ymm5
@@ -119,13 +119,13 @@
   DB  197,121,110,201                     ; vmovd         %ecx,%xmm9
   DB  196,66,125,88,201                   ; vpbroadcastd  %xmm9,%ymm9
   DB  196,65,53,239,200                   ; vpxor         %ymm8,%ymm9,%ymm9
-  DB  196,98,125,88,21,129,82,0,0         ; vpbroadcastd  0x5281(%rip),%ymm10        # 5414 <_sk_callback_hsw+0x134>
+  DB  196,98,125,88,21,169,84,0,0         ; vpbroadcastd  0x54a9(%rip),%ymm10        # 563c <_sk_callback_hsw+0x134>
   DB  196,65,53,219,218                   ; vpand         %ymm10,%ymm9,%ymm11
   DB  196,193,37,114,243,5                ; vpslld        $0x5,%ymm11,%ymm11
   DB  196,65,61,219,210                   ; vpand         %ymm10,%ymm8,%ymm10
   DB  196,193,45,114,242,4                ; vpslld        $0x4,%ymm10,%ymm10
-  DB  196,98,125,88,37,102,82,0,0         ; vpbroadcastd  0x5266(%rip),%ymm12        # 5418 <_sk_callback_hsw+0x138>
-  DB  196,98,125,88,45,97,82,0,0          ; vpbroadcastd  0x5261(%rip),%ymm13        # 541c <_sk_callback_hsw+0x13c>
+  DB  196,98,125,88,37,142,84,0,0         ; vpbroadcastd  0x548e(%rip),%ymm12        # 5640 <_sk_callback_hsw+0x138>
+  DB  196,98,125,88,45,137,84,0,0         ; vpbroadcastd  0x5489(%rip),%ymm13        # 5644 <_sk_callback_hsw+0x13c>
   DB  196,65,53,219,245                   ; vpand         %ymm13,%ymm9,%ymm14
   DB  196,193,13,114,246,2                ; vpslld        $0x2,%ymm14,%ymm14
   DB  196,65,61,219,237                   ; vpand         %ymm13,%ymm8,%ymm13
@@ -140,8 +140,8 @@
   DB  196,65,61,235,194                   ; vpor          %ymm10,%ymm8,%ymm8
   DB  196,65,61,235,193                   ; vpor          %ymm9,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,19,82,0,0          ; vbroadcastss  0x5213(%rip),%ymm9        # 5420 <_sk_callback_hsw+0x140>
-  DB  196,98,125,24,21,14,82,0,0          ; vbroadcastss  0x520e(%rip),%ymm10        # 5424 <_sk_callback_hsw+0x144>
+  DB  196,98,125,24,13,59,84,0,0          ; vbroadcastss  0x543b(%rip),%ymm9        # 5648 <_sk_callback_hsw+0x140>
+  DB  196,98,125,24,21,54,84,0,0          ; vbroadcastss  0x5436(%rip),%ymm10        # 564c <_sk_callback_hsw+0x144>
   DB  196,66,61,184,209                   ; vfmadd231ps   %ymm9,%ymm8,%ymm10
   DB  196,98,125,24,0                     ; vbroadcastss  (%rax),%ymm8
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
@@ -200,7 +200,7 @@
 PUBLIC _sk_srcatop_hsw
 _sk_srcatop_hsw LABEL PROC
   DB  197,252,89,199                      ; vmulps        %ymm7,%ymm0,%ymm0
-  DB  196,98,125,24,5,102,81,0,0          ; vbroadcastss  0x5166(%rip),%ymm8        # 5428 <_sk_callback_hsw+0x148>
+  DB  196,98,125,24,5,142,83,0,0          ; vbroadcastss  0x538e(%rip),%ymm8        # 5650 <_sk_callback_hsw+0x148>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,226,61,184,196                  ; vfmadd231ps   %ymm4,%ymm8,%ymm0
   DB  197,244,89,207                      ; vmulps        %ymm7,%ymm1,%ymm1
@@ -214,7 +214,7 @@
 
 PUBLIC _sk_dstatop_hsw
 _sk_dstatop_hsw LABEL PROC
-  DB  196,98,125,24,5,57,81,0,0           ; vbroadcastss  0x5139(%rip),%ymm8        # 542c <_sk_callback_hsw+0x14c>
+  DB  196,98,125,24,5,97,83,0,0           ; vbroadcastss  0x5361(%rip),%ymm8        # 5654 <_sk_callback_hsw+0x14c>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  196,226,101,184,196                 ; vfmadd231ps   %ymm4,%ymm3,%ymm0
@@ -247,7 +247,7 @@
 
 PUBLIC _sk_srcout_hsw
 _sk_srcout_hsw LABEL PROC
-  DB  196,98,125,24,5,224,80,0,0          ; vbroadcastss  0x50e0(%rip),%ymm8        # 5430 <_sk_callback_hsw+0x150>
+  DB  196,98,125,24,5,8,83,0,0            ; vbroadcastss  0x5308(%rip),%ymm8        # 5658 <_sk_callback_hsw+0x150>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -258,7 +258,7 @@
 
 PUBLIC _sk_dstout_hsw
 _sk_dstout_hsw LABEL PROC
-  DB  196,226,125,24,5,195,80,0,0         ; vbroadcastss  0x50c3(%rip),%ymm0        # 5434 <_sk_callback_hsw+0x154>
+  DB  196,226,125,24,5,235,82,0,0         ; vbroadcastss  0x52eb(%rip),%ymm0        # 565c <_sk_callback_hsw+0x154>
   DB  197,252,92,219                      ; vsubps        %ymm3,%ymm0,%ymm3
   DB  197,228,89,196                      ; vmulps        %ymm4,%ymm3,%ymm0
   DB  197,228,89,205                      ; vmulps        %ymm5,%ymm3,%ymm1
@@ -269,7 +269,7 @@
 
 PUBLIC _sk_srcover_hsw
 _sk_srcover_hsw LABEL PROC
-  DB  196,98,125,24,5,166,80,0,0          ; vbroadcastss  0x50a6(%rip),%ymm8        # 5438 <_sk_callback_hsw+0x158>
+  DB  196,98,125,24,5,206,82,0,0          ; vbroadcastss  0x52ce(%rip),%ymm8        # 5660 <_sk_callback_hsw+0x158>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,93,184,192                  ; vfmadd231ps   %ymm8,%ymm4,%ymm0
   DB  196,194,85,184,200                  ; vfmadd231ps   %ymm8,%ymm5,%ymm1
@@ -280,7 +280,7 @@
 
 PUBLIC _sk_dstover_hsw
 _sk_dstover_hsw LABEL PROC
-  DB  196,98,125,24,5,133,80,0,0          ; vbroadcastss  0x5085(%rip),%ymm8        # 543c <_sk_callback_hsw+0x15c>
+  DB  196,98,125,24,5,173,82,0,0          ; vbroadcastss  0x52ad(%rip),%ymm8        # 5664 <_sk_callback_hsw+0x15c>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  196,226,61,168,196                  ; vfmadd213ps   %ymm4,%ymm8,%ymm0
   DB  196,226,61,168,205                  ; vfmadd213ps   %ymm5,%ymm8,%ymm1
@@ -300,7 +300,7 @@
 
 PUBLIC _sk_multiply_hsw
 _sk_multiply_hsw LABEL PROC
-  DB  196,98,125,24,5,80,80,0,0           ; vbroadcastss  0x5050(%rip),%ymm8        # 5440 <_sk_callback_hsw+0x160>
+  DB  196,98,125,24,5,120,82,0,0          ; vbroadcastss  0x5278(%rip),%ymm8        # 5668 <_sk_callback_hsw+0x160>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,208                       ; vmulps        %ymm0,%ymm9,%ymm10
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -342,7 +342,7 @@
 
 PUBLIC _sk_xor__hsw
 _sk_xor__hsw LABEL PROC
-  DB  196,98,125,24,5,203,79,0,0          ; vbroadcastss  0x4fcb(%rip),%ymm8        # 5444 <_sk_callback_hsw+0x164>
+  DB  196,98,125,24,5,243,81,0,0          ; vbroadcastss  0x51f3(%rip),%ymm8        # 566c <_sk_callback_hsw+0x164>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -374,7 +374,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,95,209                  ; vmaxps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,83,79,0,0           ; vbroadcastss  0x4f53(%rip),%ymm8        # 5448 <_sk_callback_hsw+0x168>
+  DB  196,98,125,24,5,123,81,0,0          ; vbroadcastss  0x517b(%rip),%ymm8        # 5670 <_sk_callback_hsw+0x168>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -397,7 +397,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,2,79,0,0            ; vbroadcastss  0x4f02(%rip),%ymm8        # 544c <_sk_callback_hsw+0x16c>
+  DB  196,98,125,24,5,42,81,0,0           ; vbroadcastss  0x512a(%rip),%ymm8        # 5674 <_sk_callback_hsw+0x16c>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -423,7 +423,7 @@
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,165,78,0,0          ; vbroadcastss  0x4ea5(%rip),%ymm8        # 5450 <_sk_callback_hsw+0x170>
+  DB  196,98,125,24,5,205,80,0,0          ; vbroadcastss  0x50cd(%rip),%ymm8        # 5678 <_sk_callback_hsw+0x170>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -443,7 +443,7 @@
   DB  197,236,89,214                      ; vmulps        %ymm6,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,99,78,0,0           ; vbroadcastss  0x4e63(%rip),%ymm8        # 5454 <_sk_callback_hsw+0x174>
+  DB  196,98,125,24,5,139,80,0,0          ; vbroadcastss  0x508b(%rip),%ymm8        # 567c <_sk_callback_hsw+0x174>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -451,7 +451,7 @@
 
 PUBLIC _sk_colorburn_hsw
 _sk_colorburn_hsw LABEL PROC
-  DB  196,98,125,24,5,81,78,0,0           ; vbroadcastss  0x4e51(%rip),%ymm8        # 5458 <_sk_callback_hsw+0x178>
+  DB  196,98,125,24,5,121,80,0,0          ; vbroadcastss  0x5079(%rip),%ymm8        # 5680 <_sk_callback_hsw+0x178>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,216                       ; vmulps        %ymm0,%ymm9,%ymm11
   DB  196,65,44,87,210                    ; vxorps        %ymm10,%ymm10,%ymm10
@@ -507,7 +507,7 @@
 PUBLIC _sk_colordodge_hsw
 _sk_colordodge_hsw LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
-  DB  196,98,125,24,13,92,77,0,0          ; vbroadcastss  0x4d5c(%rip),%ymm9        # 545c <_sk_callback_hsw+0x17c>
+  DB  196,98,125,24,13,132,79,0,0         ; vbroadcastss  0x4f84(%rip),%ymm9        # 5684 <_sk_callback_hsw+0x17c>
   DB  197,52,92,215                       ; vsubps        %ymm7,%ymm9,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,52,92,203                       ; vsubps        %ymm3,%ymm9,%ymm9
@@ -558,7 +558,7 @@
 
 PUBLIC _sk_hardlight_hsw
 _sk_hardlight_hsw LABEL PROC
-  DB  196,98,125,24,5,125,76,0,0          ; vbroadcastss  0x4c7d(%rip),%ymm8        # 5460 <_sk_callback_hsw+0x180>
+  DB  196,98,125,24,5,165,78,0,0          ; vbroadcastss  0x4ea5(%rip),%ymm8        # 5688 <_sk_callback_hsw+0x180>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -607,7 +607,7 @@
 
 PUBLIC _sk_overlay_hsw
 _sk_overlay_hsw LABEL PROC
-  DB  196,98,125,24,5,181,75,0,0          ; vbroadcastss  0x4bb5(%rip),%ymm8        # 5464 <_sk_callback_hsw+0x184>
+  DB  196,98,125,24,5,221,77,0,0          ; vbroadcastss  0x4ddd(%rip),%ymm8        # 568c <_sk_callback_hsw+0x184>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -667,10 +667,10 @@
   DB  196,65,20,88,197                    ; vaddps        %ymm13,%ymm13,%ymm8
   DB  196,65,60,88,192                    ; vaddps        %ymm8,%ymm8,%ymm8
   DB  196,66,61,168,192                   ; vfmadd213ps   %ymm8,%ymm8,%ymm8
-  DB  196,98,125,24,29,188,74,0,0         ; vbroadcastss  0x4abc(%rip),%ymm11        # 546c <_sk_callback_hsw+0x18c>
+  DB  196,98,125,24,29,228,76,0,0         ; vbroadcastss  0x4ce4(%rip),%ymm11        # 5694 <_sk_callback_hsw+0x18c>
   DB  196,65,20,88,227                    ; vaddps        %ymm11,%ymm13,%ymm12
   DB  196,65,28,89,192                    ; vmulps        %ymm8,%ymm12,%ymm8
-  DB  196,98,125,24,37,173,74,0,0         ; vbroadcastss  0x4aad(%rip),%ymm12        # 5470 <_sk_callback_hsw+0x190>
+  DB  196,98,125,24,37,213,76,0,0         ; vbroadcastss  0x4cd5(%rip),%ymm12        # 5698 <_sk_callback_hsw+0x190>
   DB  196,66,21,184,196                   ; vfmadd231ps   %ymm12,%ymm13,%ymm8
   DB  196,65,124,82,245                   ; vrsqrtps      %ymm13,%ymm14
   DB  196,65,124,83,246                   ; vrcpps        %ymm14,%ymm14
@@ -680,7 +680,7 @@
   DB  197,4,194,255,2                     ; vcmpleps      %ymm7,%ymm15,%ymm15
   DB  196,67,13,74,240,240                ; vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   DB  197,116,88,249                      ; vaddps        %ymm1,%ymm1,%ymm15
-  DB  196,98,125,24,5,112,74,0,0          ; vbroadcastss  0x4a70(%rip),%ymm8        # 5468 <_sk_callback_hsw+0x188>
+  DB  196,98,125,24,5,152,76,0,0          ; vbroadcastss  0x4c98(%rip),%ymm8        # 5690 <_sk_callback_hsw+0x188>
   DB  196,65,60,92,237                    ; vsubps        %ymm13,%ymm8,%ymm13
   DB  197,132,92,195                      ; vsubps        %ymm3,%ymm15,%ymm0
   DB  196,98,125,168,235                  ; vfmadd213ps   %ymm3,%ymm0,%ymm13
@@ -793,11 +793,11 @@
   DB  196,65,28,89,210                    ; vmulps        %ymm10,%ymm12,%ymm10
   DB  196,65,44,94,214                    ; vdivps        %ymm14,%ymm10,%ymm10
   DB  196,67,45,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  DB  196,98,125,24,53,111,72,0,0         ; vbroadcastss  0x486f(%rip),%ymm14        # 5474 <_sk_callback_hsw+0x194>
-  DB  196,98,125,24,61,106,72,0,0         ; vbroadcastss  0x486a(%rip),%ymm15        # 5478 <_sk_callback_hsw+0x198>
+  DB  196,98,125,24,53,151,74,0,0         ; vbroadcastss  0x4a97(%rip),%ymm14        # 569c <_sk_callback_hsw+0x194>
+  DB  196,98,125,24,61,146,74,0,0         ; vbroadcastss  0x4a92(%rip),%ymm15        # 56a0 <_sk_callback_hsw+0x198>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,66,93,184,238                   ; vfmadd231ps   %ymm14,%ymm4,%ymm13
-  DB  196,226,125,24,5,91,72,0,0          ; vbroadcastss  0x485b(%rip),%ymm0        # 547c <_sk_callback_hsw+0x19c>
+  DB  196,226,125,24,5,131,74,0,0         ; vbroadcastss  0x4a83(%rip),%ymm0        # 56a4 <_sk_callback_hsw+0x19c>
   DB  196,98,77,184,232                   ; vfmadd231ps   %ymm0,%ymm6,%ymm13
   DB  196,65,116,89,215                   ; vmulps        %ymm15,%ymm1,%ymm10
   DB  196,66,53,184,214                   ; vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -852,7 +852,7 @@
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
   DB  196,65,36,95,200                    ; vmaxps        %ymm8,%ymm11,%ymm9
   DB  196,65,116,95,192                   ; vmaxps        %ymm8,%ymm1,%ymm8
-  DB  196,226,125,24,13,72,71,0,0         ; vbroadcastss  0x4748(%rip),%ymm1        # 5480 <_sk_callback_hsw+0x1a0>
+  DB  196,226,125,24,13,112,73,0,0        ; vbroadcastss  0x4970(%rip),%ymm1        # 56a8 <_sk_callback_hsw+0x1a0>
   DB  197,116,92,215                      ; vsubps        %ymm7,%ymm1,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,116,92,219                      ; vsubps        %ymm3,%ymm1,%ymm11
@@ -906,11 +906,11 @@
   DB  196,65,28,89,210                    ; vmulps        %ymm10,%ymm12,%ymm10
   DB  196,65,44,94,214                    ; vdivps        %ymm14,%ymm10,%ymm10
   DB  196,67,45,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  DB  196,98,125,24,53,89,70,0,0          ; vbroadcastss  0x4659(%rip),%ymm14        # 5484 <_sk_callback_hsw+0x1a4>
-  DB  196,98,125,24,61,84,70,0,0          ; vbroadcastss  0x4654(%rip),%ymm15        # 5488 <_sk_callback_hsw+0x1a8>
+  DB  196,98,125,24,53,129,72,0,0         ; vbroadcastss  0x4881(%rip),%ymm14        # 56ac <_sk_callback_hsw+0x1a4>
+  DB  196,98,125,24,61,124,72,0,0         ; vbroadcastss  0x487c(%rip),%ymm15        # 56b0 <_sk_callback_hsw+0x1a8>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,66,93,184,238                   ; vfmadd231ps   %ymm14,%ymm4,%ymm13
-  DB  196,226,125,24,5,69,70,0,0          ; vbroadcastss  0x4645(%rip),%ymm0        # 548c <_sk_callback_hsw+0x1ac>
+  DB  196,226,125,24,5,109,72,0,0         ; vbroadcastss  0x486d(%rip),%ymm0        # 56b4 <_sk_callback_hsw+0x1ac>
   DB  196,98,77,184,232                   ; vfmadd231ps   %ymm0,%ymm6,%ymm13
   DB  196,65,116,89,215                   ; vmulps        %ymm15,%ymm1,%ymm10
   DB  196,66,53,184,214                   ; vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -965,7 +965,7 @@
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
   DB  196,65,36,95,200                    ; vmaxps        %ymm8,%ymm11,%ymm9
   DB  196,65,116,95,192                   ; vmaxps        %ymm8,%ymm1,%ymm8
-  DB  196,226,125,24,13,50,69,0,0         ; vbroadcastss  0x4532(%rip),%ymm1        # 5490 <_sk_callback_hsw+0x1b0>
+  DB  196,226,125,24,13,90,71,0,0         ; vbroadcastss  0x475a(%rip),%ymm1        # 56b8 <_sk_callback_hsw+0x1b0>
   DB  197,116,92,215                      ; vsubps        %ymm7,%ymm1,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,116,92,219                      ; vsubps        %ymm3,%ymm1,%ymm11
@@ -993,11 +993,11 @@
   DB  197,108,89,199                      ; vmulps        %ymm7,%ymm2,%ymm8
   DB  197,116,89,215                      ; vmulps        %ymm7,%ymm1,%ymm10
   DB  197,52,89,223                       ; vmulps        %ymm7,%ymm9,%ymm11
-  DB  196,98,125,24,45,197,68,0,0         ; vbroadcastss  0x44c5(%rip),%ymm13        # 5494 <_sk_callback_hsw+0x1b4>
-  DB  196,98,125,24,53,192,68,0,0         ; vbroadcastss  0x44c0(%rip),%ymm14        # 5498 <_sk_callback_hsw+0x1b8>
+  DB  196,98,125,24,45,237,70,0,0         ; vbroadcastss  0x46ed(%rip),%ymm13        # 56bc <_sk_callback_hsw+0x1b4>
+  DB  196,98,125,24,53,232,70,0,0         ; vbroadcastss  0x46e8(%rip),%ymm14        # 56c0 <_sk_callback_hsw+0x1b8>
   DB  196,65,84,89,230                    ; vmulps        %ymm14,%ymm5,%ymm12
   DB  196,66,93,184,229                   ; vfmadd231ps   %ymm13,%ymm4,%ymm12
-  DB  196,98,125,24,61,177,68,0,0         ; vbroadcastss  0x44b1(%rip),%ymm15        # 549c <_sk_callback_hsw+0x1bc>
+  DB  196,98,125,24,61,217,70,0,0         ; vbroadcastss  0x46d9(%rip),%ymm15        # 56c4 <_sk_callback_hsw+0x1bc>
   DB  196,66,77,184,231                   ; vfmadd231ps   %ymm15,%ymm6,%ymm12
   DB  196,65,44,89,206                    ; vmulps        %ymm14,%ymm10,%ymm9
   DB  196,66,61,184,205                   ; vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -1053,7 +1053,7 @@
   DB  196,193,116,95,206                  ; vmaxps        %ymm14,%ymm1,%ymm1
   DB  196,65,44,95,198                    ; vmaxps        %ymm14,%ymm10,%ymm8
   DB  196,65,124,95,206                   ; vmaxps        %ymm14,%ymm0,%ymm9
-  DB  196,226,125,24,5,147,67,0,0         ; vbroadcastss  0x4393(%rip),%ymm0        # 54a0 <_sk_callback_hsw+0x1c0>
+  DB  196,226,125,24,5,187,69,0,0         ; vbroadcastss  0x45bb(%rip),%ymm0        # 56c8 <_sk_callback_hsw+0x1c0>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -1081,11 +1081,11 @@
   DB  197,100,89,196                      ; vmulps        %ymm4,%ymm3,%ymm8
   DB  197,100,89,213                      ; vmulps        %ymm5,%ymm3,%ymm10
   DB  197,100,89,222                      ; vmulps        %ymm6,%ymm3,%ymm11
-  DB  196,98,125,24,45,38,67,0,0          ; vbroadcastss  0x4326(%rip),%ymm13        # 54a4 <_sk_callback_hsw+0x1c4>
-  DB  196,98,125,24,53,33,67,0,0          ; vbroadcastss  0x4321(%rip),%ymm14        # 54a8 <_sk_callback_hsw+0x1c8>
+  DB  196,98,125,24,45,78,69,0,0          ; vbroadcastss  0x454e(%rip),%ymm13        # 56cc <_sk_callback_hsw+0x1c4>
+  DB  196,98,125,24,53,73,69,0,0          ; vbroadcastss  0x4549(%rip),%ymm14        # 56d0 <_sk_callback_hsw+0x1c8>
   DB  196,65,116,89,230                   ; vmulps        %ymm14,%ymm1,%ymm12
   DB  196,66,109,184,229                  ; vfmadd231ps   %ymm13,%ymm2,%ymm12
-  DB  196,98,125,24,61,18,67,0,0          ; vbroadcastss  0x4312(%rip),%ymm15        # 54ac <_sk_callback_hsw+0x1cc>
+  DB  196,98,125,24,61,58,69,0,0          ; vbroadcastss  0x453a(%rip),%ymm15        # 56d4 <_sk_callback_hsw+0x1cc>
   DB  196,66,53,184,231                   ; vfmadd231ps   %ymm15,%ymm9,%ymm12
   DB  196,65,44,89,206                    ; vmulps        %ymm14,%ymm10,%ymm9
   DB  196,66,61,184,205                   ; vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -1141,7 +1141,7 @@
   DB  196,193,116,95,206                  ; vmaxps        %ymm14,%ymm1,%ymm1
   DB  196,65,44,95,198                    ; vmaxps        %ymm14,%ymm10,%ymm8
   DB  196,65,124,95,206                   ; vmaxps        %ymm14,%ymm0,%ymm9
-  DB  196,226,125,24,5,244,65,0,0         ; vbroadcastss  0x41f4(%rip),%ymm0        # 54b0 <_sk_callback_hsw+0x1d0>
+  DB  196,226,125,24,5,28,68,0,0          ; vbroadcastss  0x441c(%rip),%ymm0        # 56d8 <_sk_callback_hsw+0x1d0>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -1168,17 +1168,17 @@
   DB  77,133,192                          ; test          %r8,%r8
   DB  15,133,180,0,0,0                    ; jne           13ce <_sk_srcover_rgba_8888_hsw+0xcd>
   DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
-  DB  197,196,84,37,89,69,0,0             ; vandps        0x4559(%rip),%ymm7,%ymm4        # 5880 <_sk_callback_hsw+0x5a0>
+  DB  197,196,84,37,153,71,0,0            ; vandps        0x4799(%rip),%ymm7,%ymm4        # 5ac0 <_sk_callback_hsw+0x5b8>
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,69,0,45,108,69,0,0          ; vpshufb       0x456c(%rip),%ymm7,%ymm5        # 58a0 <_sk_callback_hsw+0x5c0>
+  DB  196,226,69,0,45,172,71,0,0          ; vpshufb       0x47ac(%rip),%ymm7,%ymm5        # 5ae0 <_sk_callback_hsw+0x5d8>
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,226,69,0,53,127,69,0,0          ; vpshufb       0x457f(%rip),%ymm7,%ymm6        # 58c0 <_sk_callback_hsw+0x5e0>
+  DB  196,226,69,0,53,191,71,0,0          ; vpshufb       0x47bf(%rip),%ymm7,%ymm6        # 5b00 <_sk_callback_hsw+0x5f8>
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
   DB  197,197,114,215,24                  ; vpsrld        $0x18,%ymm7,%ymm7
   DB  197,252,91,255                      ; vcvtdq2ps     %ymm7,%ymm7
-  DB  196,98,125,24,5,93,65,0,0           ; vbroadcastss  0x415d(%rip),%ymm8        # 54b4 <_sk_callback_hsw+0x1d4>
+  DB  196,98,125,24,5,133,67,0,0          ; vbroadcastss  0x4385(%rip),%ymm8        # 56dc <_sk_callback_hsw+0x1d4>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
-  DB  196,98,125,24,13,84,65,0,0          ; vbroadcastss  0x4154(%rip),%ymm9        # 54b8 <_sk_callback_hsw+0x1d8>
+  DB  196,98,125,24,13,124,67,0,0         ; vbroadcastss  0x437c(%rip),%ymm9        # 56e0 <_sk_callback_hsw+0x1d8>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,194,93,184,192                  ; vfmadd231ps   %ymm8,%ymm4,%ymm0
   DB  196,193,116,89,201                  ; vmulps        %ymm9,%ymm1,%ymm1
@@ -1234,7 +1234,7 @@
 
 PUBLIC _sk_clamp_1_hsw
 _sk_clamp_1_hsw LABEL PROC
-  DB  196,98,125,24,5,121,64,0,0          ; vbroadcastss  0x4079(%rip),%ymm8        # 54bc <_sk_callback_hsw+0x1dc>
+  DB  196,98,125,24,5,161,66,0,0          ; vbroadcastss  0x42a1(%rip),%ymm8        # 56e4 <_sk_callback_hsw+0x1dc>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
@@ -1244,7 +1244,7 @@
 
 PUBLIC _sk_clamp_a_hsw
 _sk_clamp_a_hsw LABEL PROC
-  DB  196,98,125,24,5,92,64,0,0           ; vbroadcastss  0x405c(%rip),%ymm8        # 54c0 <_sk_callback_hsw+0x1e0>
+  DB  196,98,125,24,5,132,66,0,0          ; vbroadcastss  0x4284(%rip),%ymm8        # 56e8 <_sk_callback_hsw+0x1e0>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  197,252,93,195                      ; vminps        %ymm3,%ymm0,%ymm0
   DB  197,244,93,203                      ; vminps        %ymm3,%ymm1,%ymm1
@@ -1254,7 +1254,7 @@
 
 PUBLIC _sk_clamp_a_dst_hsw
 _sk_clamp_a_dst_hsw LABEL PROC
-  DB  196,98,125,24,5,66,64,0,0           ; vbroadcastss  0x4042(%rip),%ymm8        # 54c4 <_sk_callback_hsw+0x1e4>
+  DB  196,98,125,24,5,106,66,0,0          ; vbroadcastss  0x426a(%rip),%ymm8        # 56ec <_sk_callback_hsw+0x1e4>
   DB  196,193,68,93,248                   ; vminps        %ymm8,%ymm7,%ymm7
   DB  197,220,93,231                      ; vminps        %ymm7,%ymm4,%ymm4
   DB  197,212,93,239                      ; vminps        %ymm7,%ymm5,%ymm5
@@ -1279,14 +1279,6 @@
   DB  197,124,41,194                      ; vmovaps       %ymm8,%ymm2
   DB  255,224                             ; jmpq          *%rax
 
-PUBLIC _sk_swap_rb_dst_hsw
-_sk_swap_rb_dst_hsw LABEL PROC
-  DB  197,124,40,196                      ; vmovaps       %ymm4,%ymm8
-  DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  197,252,40,230                      ; vmovaps       %ymm6,%ymm4
-  DB  197,124,41,198                      ; vmovaps       %ymm8,%ymm6
-  DB  255,224                             ; jmpq          *%rax
-
 PUBLIC _sk_move_src_dst_hsw
 _sk_move_src_dst_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -1317,7 +1309,7 @@
 _sk_unpremul_hsw LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,65,100,194,200,0                ; vcmpeqps      %ymm8,%ymm3,%ymm9
-  DB  196,98,125,24,21,174,63,0,0         ; vbroadcastss  0x3fae(%rip),%ymm10        # 54c8 <_sk_callback_hsw+0x1e8>
+  DB  196,98,125,24,21,230,65,0,0         ; vbroadcastss  0x41e6(%rip),%ymm10        # 56f0 <_sk_callback_hsw+0x1e8>
   DB  197,44,94,211                       ; vdivps        %ymm3,%ymm10,%ymm10
   DB  196,67,45,74,192,144                ; vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
@@ -1328,16 +1320,16 @@
 
 PUBLIC _sk_from_srgb_hsw
 _sk_from_srgb_hsw LABEL PROC
-  DB  196,98,125,24,5,143,63,0,0          ; vbroadcastss  0x3f8f(%rip),%ymm8        # 54cc <_sk_callback_hsw+0x1ec>
+  DB  196,98,125,24,5,199,65,0,0          ; vbroadcastss  0x41c7(%rip),%ymm8        # 56f4 <_sk_callback_hsw+0x1ec>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  197,124,89,208                      ; vmulps        %ymm0,%ymm0,%ymm10
-  DB  196,98,125,24,29,129,63,0,0         ; vbroadcastss  0x3f81(%rip),%ymm11        # 54d0 <_sk_callback_hsw+0x1f0>
-  DB  196,98,125,24,37,124,63,0,0         ; vbroadcastss  0x3f7c(%rip),%ymm12        # 54d4 <_sk_callback_hsw+0x1f4>
+  DB  196,98,125,24,29,185,65,0,0         ; vbroadcastss  0x41b9(%rip),%ymm11        # 56f8 <_sk_callback_hsw+0x1f0>
+  DB  196,98,125,24,37,180,65,0,0         ; vbroadcastss  0x41b4(%rip),%ymm12        # 56fc <_sk_callback_hsw+0x1f4>
   DB  196,65,124,40,236                   ; vmovaps       %ymm12,%ymm13
   DB  196,66,125,168,235                  ; vfmadd213ps   %ymm11,%ymm0,%ymm13
-  DB  196,98,125,24,53,109,63,0,0         ; vbroadcastss  0x3f6d(%rip),%ymm14        # 54d8 <_sk_callback_hsw+0x1f8>
+  DB  196,98,125,24,53,165,65,0,0         ; vbroadcastss  0x41a5(%rip),%ymm14        # 5700 <_sk_callback_hsw+0x1f8>
   DB  196,66,45,168,238                   ; vfmadd213ps   %ymm14,%ymm10,%ymm13
-  DB  196,98,125,24,21,99,63,0,0          ; vbroadcastss  0x3f63(%rip),%ymm10        # 54dc <_sk_callback_hsw+0x1fc>
+  DB  196,98,125,24,21,155,65,0,0         ; vbroadcastss  0x419b(%rip),%ymm10        # 5704 <_sk_callback_hsw+0x1fc>
   DB  196,193,124,194,194,1               ; vcmpltps      %ymm10,%ymm0,%ymm0
   DB  196,195,21,74,193,0                 ; vblendvps     %ymm0,%ymm9,%ymm13,%ymm0
   DB  196,65,116,89,200                   ; vmulps        %ymm8,%ymm1,%ymm9
@@ -1358,16 +1350,16 @@
 
 PUBLIC _sk_from_srgb_dst_hsw
 _sk_from_srgb_dst_hsw LABEL PROC
-  DB  196,98,125,24,5,11,63,0,0           ; vbroadcastss  0x3f0b(%rip),%ymm8        # 54e0 <_sk_callback_hsw+0x200>
+  DB  196,98,125,24,5,67,65,0,0           ; vbroadcastss  0x4143(%rip),%ymm8        # 5708 <_sk_callback_hsw+0x200>
   DB  196,65,92,89,200                    ; vmulps        %ymm8,%ymm4,%ymm9
   DB  197,92,89,212                       ; vmulps        %ymm4,%ymm4,%ymm10
-  DB  196,98,125,24,29,253,62,0,0         ; vbroadcastss  0x3efd(%rip),%ymm11        # 54e4 <_sk_callback_hsw+0x204>
-  DB  196,98,125,24,37,248,62,0,0         ; vbroadcastss  0x3ef8(%rip),%ymm12        # 54e8 <_sk_callback_hsw+0x208>
+  DB  196,98,125,24,29,53,65,0,0          ; vbroadcastss  0x4135(%rip),%ymm11        # 570c <_sk_callback_hsw+0x204>
+  DB  196,98,125,24,37,48,65,0,0          ; vbroadcastss  0x4130(%rip),%ymm12        # 5710 <_sk_callback_hsw+0x208>
   DB  196,65,124,40,236                   ; vmovaps       %ymm12,%ymm13
   DB  196,66,93,168,235                   ; vfmadd213ps   %ymm11,%ymm4,%ymm13
-  DB  196,98,125,24,53,233,62,0,0         ; vbroadcastss  0x3ee9(%rip),%ymm14        # 54ec <_sk_callback_hsw+0x20c>
+  DB  196,98,125,24,53,33,65,0,0          ; vbroadcastss  0x4121(%rip),%ymm14        # 5714 <_sk_callback_hsw+0x20c>
   DB  196,66,45,168,238                   ; vfmadd213ps   %ymm14,%ymm10,%ymm13
-  DB  196,98,125,24,21,223,62,0,0         ; vbroadcastss  0x3edf(%rip),%ymm10        # 54f0 <_sk_callback_hsw+0x210>
+  DB  196,98,125,24,21,23,65,0,0          ; vbroadcastss  0x4117(%rip),%ymm10        # 5718 <_sk_callback_hsw+0x210>
   DB  196,193,92,194,226,1                ; vcmpltps      %ymm10,%ymm4,%ymm4
   DB  196,195,21,74,225,64                ; vblendvps     %ymm4,%ymm9,%ymm13,%ymm4
   DB  196,65,84,89,200                    ; vmulps        %ymm8,%ymm5,%ymm9
@@ -1389,19 +1381,19 @@
 PUBLIC _sk_to_srgb_hsw
 _sk_to_srgb_hsw LABEL PROC
   DB  197,124,82,200                      ; vrsqrtps      %ymm0,%ymm9
-  DB  196,98,125,24,5,131,62,0,0          ; vbroadcastss  0x3e83(%rip),%ymm8        # 54f4 <_sk_callback_hsw+0x214>
+  DB  196,98,125,24,5,187,64,0,0          ; vbroadcastss  0x40bb(%rip),%ymm8        # 571c <_sk_callback_hsw+0x214>
   DB  196,65,124,89,208                   ; vmulps        %ymm8,%ymm0,%ymm10
-  DB  196,98,125,24,29,121,62,0,0         ; vbroadcastss  0x3e79(%rip),%ymm11        # 54f8 <_sk_callback_hsw+0x218>
-  DB  196,98,125,24,37,116,62,0,0         ; vbroadcastss  0x3e74(%rip),%ymm12        # 54fc <_sk_callback_hsw+0x21c>
+  DB  196,98,125,24,29,177,64,0,0         ; vbroadcastss  0x40b1(%rip),%ymm11        # 5720 <_sk_callback_hsw+0x218>
+  DB  196,98,125,24,37,172,64,0,0         ; vbroadcastss  0x40ac(%rip),%ymm12        # 5724 <_sk_callback_hsw+0x21c>
   DB  196,65,124,40,236                   ; vmovaps       %ymm12,%ymm13
   DB  196,66,53,168,235                   ; vfmadd213ps   %ymm11,%ymm9,%ymm13
-  DB  196,98,125,24,53,101,62,0,0         ; vbroadcastss  0x3e65(%rip),%ymm14        # 5500 <_sk_callback_hsw+0x220>
+  DB  196,98,125,24,53,157,64,0,0         ; vbroadcastss  0x409d(%rip),%ymm14        # 5728 <_sk_callback_hsw+0x220>
   DB  196,66,53,168,238                   ; vfmadd213ps   %ymm14,%ymm9,%ymm13
-  DB  196,98,125,24,61,91,62,0,0          ; vbroadcastss  0x3e5b(%rip),%ymm15        # 5504 <_sk_callback_hsw+0x224>
+  DB  196,98,125,24,61,147,64,0,0         ; vbroadcastss  0x4093(%rip),%ymm15        # 572c <_sk_callback_hsw+0x224>
   DB  196,65,52,88,207                    ; vaddps        %ymm15,%ymm9,%ymm9
   DB  196,65,124,83,201                   ; vrcpps        %ymm9,%ymm9
   DB  196,65,20,89,201                    ; vmulps        %ymm9,%ymm13,%ymm9
-  DB  196,98,125,24,45,71,62,0,0          ; vbroadcastss  0x3e47(%rip),%ymm13        # 5508 <_sk_callback_hsw+0x228>
+  DB  196,98,125,24,45,127,64,0,0         ; vbroadcastss  0x407f(%rip),%ymm13        # 5730 <_sk_callback_hsw+0x228>
   DB  196,193,124,194,197,1               ; vcmpltps      %ymm13,%ymm0,%ymm0
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  197,124,82,201                      ; vrsqrtps      %ymm1,%ymm9
@@ -1433,26 +1425,26 @@
   DB  197,124,93,201                      ; vminps        %ymm1,%ymm0,%ymm9
   DB  197,52,93,202                       ; vminps        %ymm2,%ymm9,%ymm9
   DB  196,65,60,92,209                    ; vsubps        %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,29,188,61,0,0         ; vbroadcastss  0x3dbc(%rip),%ymm11        # 550c <_sk_callback_hsw+0x22c>
+  DB  196,98,125,24,29,244,63,0,0         ; vbroadcastss  0x3ff4(%rip),%ymm11        # 5734 <_sk_callback_hsw+0x22c>
   DB  196,65,36,94,218                    ; vdivps        %ymm10,%ymm11,%ymm11
   DB  197,116,92,226                      ; vsubps        %ymm2,%ymm1,%ymm12
   DB  197,116,194,234,1                   ; vcmpltps      %ymm2,%ymm1,%ymm13
-  DB  196,98,125,24,53,169,61,0,0         ; vbroadcastss  0x3da9(%rip),%ymm14        # 5510 <_sk_callback_hsw+0x230>
+  DB  196,98,125,24,53,225,63,0,0         ; vbroadcastss  0x3fe1(%rip),%ymm14        # 5738 <_sk_callback_hsw+0x230>
   DB  196,65,4,87,255                     ; vxorps        %ymm15,%ymm15,%ymm15
   DB  196,67,5,74,238,208                 ; vblendvps     %ymm13,%ymm14,%ymm15,%ymm13
   DB  196,66,37,168,229                   ; vfmadd213ps   %ymm13,%ymm11,%ymm12
   DB  197,236,92,208                      ; vsubps        %ymm0,%ymm2,%ymm2
   DB  197,124,92,233                      ; vsubps        %ymm1,%ymm0,%ymm13
-  DB  196,98,125,24,53,144,61,0,0         ; vbroadcastss  0x3d90(%rip),%ymm14        # 5518 <_sk_callback_hsw+0x238>
+  DB  196,98,125,24,53,200,63,0,0         ; vbroadcastss  0x3fc8(%rip),%ymm14        # 5740 <_sk_callback_hsw+0x238>
   DB  196,66,37,168,238                   ; vfmadd213ps   %ymm14,%ymm11,%ymm13
-  DB  196,98,125,24,53,126,61,0,0         ; vbroadcastss  0x3d7e(%rip),%ymm14        # 5514 <_sk_callback_hsw+0x234>
+  DB  196,98,125,24,53,182,63,0,0         ; vbroadcastss  0x3fb6(%rip),%ymm14        # 573c <_sk_callback_hsw+0x234>
   DB  196,194,37,168,214                  ; vfmadd213ps   %ymm14,%ymm11,%ymm2
   DB  197,188,194,201,0                   ; vcmpeqps      %ymm1,%ymm8,%ymm1
   DB  196,227,21,74,202,16                ; vblendvps     %ymm1,%ymm2,%ymm13,%ymm1
   DB  197,188,194,192,0                   ; vcmpeqps      %ymm0,%ymm8,%ymm0
   DB  196,195,117,74,196,0                ; vblendvps     %ymm0,%ymm12,%ymm1,%ymm0
   DB  196,193,60,88,201                   ; vaddps        %ymm9,%ymm8,%ymm1
-  DB  196,98,125,24,29,97,61,0,0          ; vbroadcastss  0x3d61(%rip),%ymm11        # 5520 <_sk_callback_hsw+0x240>
+  DB  196,98,125,24,29,153,63,0,0         ; vbroadcastss  0x3f99(%rip),%ymm11        # 5748 <_sk_callback_hsw+0x240>
   DB  196,193,116,89,211                  ; vmulps        %ymm11,%ymm1,%ymm2
   DB  197,36,194,218,1                    ; vcmpltps      %ymm2,%ymm11,%ymm11
   DB  196,65,12,92,224                    ; vsubps        %ymm8,%ymm14,%ymm12
@@ -1462,7 +1454,7 @@
   DB  197,172,94,201                      ; vdivps        %ymm1,%ymm10,%ymm1
   DB  196,195,125,74,199,128              ; vblendvps     %ymm8,%ymm15,%ymm0,%ymm0
   DB  196,195,117,74,207,128              ; vblendvps     %ymm8,%ymm15,%ymm1,%ymm1
-  DB  196,98,125,24,5,36,61,0,0           ; vbroadcastss  0x3d24(%rip),%ymm8        # 551c <_sk_callback_hsw+0x23c>
+  DB  196,98,125,24,5,92,63,0,0           ; vbroadcastss  0x3f5c(%rip),%ymm8        # 5744 <_sk_callback_hsw+0x23c>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -1477,30 +1469,30 @@
   DB  197,252,17,28,36                    ; vmovups       %ymm3,(%rsp)
   DB  197,252,40,233                      ; vmovaps       %ymm1,%ymm5
   DB  197,252,40,224                      ; vmovaps       %ymm0,%ymm4
-  DB  196,98,125,24,5,235,60,0,0          ; vbroadcastss  0x3ceb(%rip),%ymm8        # 5524 <_sk_callback_hsw+0x244>
+  DB  196,98,125,24,5,35,63,0,0           ; vbroadcastss  0x3f23(%rip),%ymm8        # 574c <_sk_callback_hsw+0x244>
   DB  197,60,194,202,2                    ; vcmpleps      %ymm2,%ymm8,%ymm9
   DB  197,84,89,210                       ; vmulps        %ymm2,%ymm5,%ymm10
   DB  196,65,84,92,218                    ; vsubps        %ymm10,%ymm5,%ymm11
   DB  196,67,45,74,203,144                ; vblendvps     %ymm9,%ymm11,%ymm10,%ymm9
   DB  197,52,88,210                       ; vaddps        %ymm2,%ymm9,%ymm10
-  DB  196,98,125,24,13,206,60,0,0         ; vbroadcastss  0x3cce(%rip),%ymm9        # 5528 <_sk_callback_hsw+0x248>
+  DB  196,98,125,24,13,6,63,0,0           ; vbroadcastss  0x3f06(%rip),%ymm9        # 5750 <_sk_callback_hsw+0x248>
   DB  196,66,109,170,202                  ; vfmsub213ps   %ymm10,%ymm2,%ymm9
-  DB  196,98,125,24,29,196,60,0,0         ; vbroadcastss  0x3cc4(%rip),%ymm11        # 552c <_sk_callback_hsw+0x24c>
+  DB  196,98,125,24,29,252,62,0,0         ; vbroadcastss  0x3efc(%rip),%ymm11        # 5754 <_sk_callback_hsw+0x24c>
   DB  196,65,92,88,219                    ; vaddps        %ymm11,%ymm4,%ymm11
   DB  196,67,125,8,227,1                  ; vroundps      $0x1,%ymm11,%ymm12
   DB  196,65,36,92,252                    ; vsubps        %ymm12,%ymm11,%ymm15
   DB  196,65,44,92,217                    ; vsubps        %ymm9,%ymm10,%ymm11
-  DB  196,98,125,24,45,174,60,0,0         ; vbroadcastss  0x3cae(%rip),%ymm13        # 5534 <_sk_callback_hsw+0x254>
+  DB  196,98,125,24,45,230,62,0,0         ; vbroadcastss  0x3ee6(%rip),%ymm13        # 575c <_sk_callback_hsw+0x254>
   DB  196,193,4,89,197                    ; vmulps        %ymm13,%ymm15,%ymm0
-  DB  196,98,125,24,53,164,60,0,0         ; vbroadcastss  0x3ca4(%rip),%ymm14        # 5538 <_sk_callback_hsw+0x258>
+  DB  196,98,125,24,53,220,62,0,0         ; vbroadcastss  0x3edc(%rip),%ymm14        # 5760 <_sk_callback_hsw+0x258>
   DB  197,12,92,224                       ; vsubps        %ymm0,%ymm14,%ymm12
   DB  196,66,37,168,225                   ; vfmadd213ps   %ymm9,%ymm11,%ymm12
-  DB  196,226,125,24,29,138,60,0,0        ; vbroadcastss  0x3c8a(%rip),%ymm3        # 5530 <_sk_callback_hsw+0x250>
+  DB  196,226,125,24,29,194,62,0,0        ; vbroadcastss  0x3ec2(%rip),%ymm3        # 5758 <_sk_callback_hsw+0x250>
   DB  196,193,100,194,255,2               ; vcmpleps      %ymm15,%ymm3,%ymm7
   DB  196,195,29,74,249,112               ; vblendvps     %ymm7,%ymm9,%ymm12,%ymm7
   DB  196,65,60,194,231,2                 ; vcmpleps      %ymm15,%ymm8,%ymm12
   DB  196,227,45,74,255,192               ; vblendvps     %ymm12,%ymm7,%ymm10,%ymm7
-  DB  196,98,125,24,37,117,60,0,0         ; vbroadcastss  0x3c75(%rip),%ymm12        # 553c <_sk_callback_hsw+0x25c>
+  DB  196,98,125,24,37,173,62,0,0         ; vbroadcastss  0x3ead(%rip),%ymm12        # 5764 <_sk_callback_hsw+0x25c>
   DB  196,65,28,194,255,2                 ; vcmpleps      %ymm15,%ymm12,%ymm15
   DB  196,194,37,168,193                  ; vfmadd213ps   %ymm9,%ymm11,%ymm0
   DB  196,99,125,74,255,240               ; vblendvps     %ymm15,%ymm7,%ymm0,%ymm15
@@ -1516,7 +1508,7 @@
   DB  197,156,194,192,2                   ; vcmpleps      %ymm0,%ymm12,%ymm0
   DB  196,194,37,168,249                  ; vfmadd213ps   %ymm9,%ymm11,%ymm7
   DB  196,227,69,74,201,0                 ; vblendvps     %ymm0,%ymm1,%ymm7,%ymm1
-  DB  196,226,125,24,5,33,60,0,0          ; vbroadcastss  0x3c21(%rip),%ymm0        # 5540 <_sk_callback_hsw+0x260>
+  DB  196,226,125,24,5,89,62,0,0          ; vbroadcastss  0x3e59(%rip),%ymm0        # 5768 <_sk_callback_hsw+0x260>
   DB  197,220,88,192                      ; vaddps        %ymm0,%ymm4,%ymm0
   DB  196,227,125,8,224,1                 ; vroundps      $0x1,%ymm0,%ymm4
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
@@ -1560,12 +1552,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,58                              ; jne           1a06 <_sk_scale_u8_hsw+0x44>
+  DB  117,58                              ; jne           19f6 <_sk_scale_u8_hsw+0x44>
   DB  196,66,121,48,4,19                  ; vpmovzxbw     (%r11,%rdx,1),%xmm8
-  DB  197,57,219,5,230,64,0,0             ; vpand         0x40e6(%rip),%xmm8,%xmm8        # 5ac0 <_sk_callback_hsw+0x7e0>
+  DB  197,57,219,5,86,68,0,0              ; vpand         0x4456(%rip),%xmm8,%xmm8        # 5e20 <_sk_callback_hsw+0x918>
   DB  196,66,125,51,192                   ; vpmovzxwd     %xmm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,87,59,0,0          ; vbroadcastss  0x3b57(%rip),%ymm9        # 5544 <_sk_callback_hsw+0x264>
+  DB  196,98,125,24,13,143,61,0,0         ; vbroadcastss  0x3d8f(%rip),%ymm9        # 576c <_sk_callback_hsw+0x264>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -1578,15 +1570,15 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,183                             ; ja            19d2 <_sk_scale_u8_hsw+0x10>
+  DB  119,183                             ; ja            19c2 <_sk_scale_u8_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 1aa0 <_sk_scale_u8_hsw+0xde>
+  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 1a90 <_sk_scale_u8_hsw+0xde>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  235,152                             ; jmp           19d2 <_sk_scale_u8_hsw+0x10>
+  DB  235,152                             ; jmp           19c2 <_sk_scale_u8_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,2                    ; vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -1594,7 +1586,7 @@
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,57,2,193,1                   ; vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,111,255,255,255                 ; jmpq          19d2 <_sk_scale_u8_hsw+0x10>
+  DB  233,111,255,255,255                 ; jmpq          19c2 <_sk_scale_u8_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,6                    ; vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -1605,7 +1597,7 @@
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,49,2,192,12                  ; vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  DB  233,51,255,255,255                  ; jmpq          19d2 <_sk_scale_u8_hsw+0x10>
+  DB  233,51,255,255,255                  ; jmpq          19c2 <_sk_scale_u8_hsw+0x10>
   DB  144                                 ; nop
   DB  143                                 ; (bad)
   DB  255                                 ; (bad)
@@ -1614,7 +1606,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,222                 ; jmpq          ffffffffdf001ab0 <_sk_callback_hsw+0xffffffffdeffc7d0>
+  DB  233,255,255,255,222                 ; jmpq          ffffffffdf001aa0 <_sk_callback_hsw+0xffffffffdeffc598>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,211                             ; callq         *%rbx
@@ -1645,12 +1637,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,78                              ; jne           1b43 <_sk_lerp_u8_hsw+0x58>
+  DB  117,78                              ; jne           1b33 <_sk_lerp_u8_hsw+0x58>
   DB  196,66,121,48,4,19                  ; vpmovzxbw     (%r11,%rdx,1),%xmm8
-  DB  197,57,219,5,205,63,0,0             ; vpand         0x3fcd(%rip),%xmm8,%xmm8        # 5ad0 <_sk_callback_hsw+0x7f0>
+  DB  197,57,219,5,61,67,0,0              ; vpand         0x433d(%rip),%xmm8,%xmm8        # 5e30 <_sk_callback_hsw+0x928>
   DB  196,66,125,51,192                   ; vpmovzxwd     %xmm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,50,58,0,0          ; vbroadcastss  0x3a32(%rip),%ymm9        # 5548 <_sk_callback_hsw+0x268>
+  DB  196,98,125,24,13,106,60,0,0         ; vbroadcastss  0x3c6a(%rip),%ymm9        # 5770 <_sk_callback_hsw+0x268>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,226,61,168,196                  ; vfmadd213ps   %ymm4,%ymm8,%ymm0
@@ -1667,15 +1659,15 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,163                             ; ja            1afb <_sk_lerp_u8_hsw+0x10>
+  DB  119,163                             ; ja            1aeb <_sk_lerp_u8_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 1bdc <_sk_lerp_u8_hsw+0xf1>
+  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 1bcc <_sk_lerp_u8_hsw+0xf1>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  235,132                             ; jmp           1afb <_sk_lerp_u8_hsw+0x10>
+  DB  235,132                             ; jmp           1aeb <_sk_lerp_u8_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,2                    ; vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -1683,7 +1675,7 @@
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,57,2,193,1                   ; vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,91,255,255,255                  ; jmpq          1afb <_sk_lerp_u8_hsw+0x10>
+  DB  233,91,255,255,255                  ; jmpq          1aeb <_sk_lerp_u8_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,6                    ; vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -1694,7 +1686,7 @@
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,49,2,192,12                  ; vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  DB  233,31,255,255,255                  ; jmpq          1afb <_sk_lerp_u8_hsw+0x10>
+  DB  233,31,255,255,255                  ; jmpq          1aeb <_sk_lerp_u8_hsw+0x10>
   DB  144                                 ; nop
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -1721,23 +1713,23 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,169,0,0,0                    ; jne           1caf <_sk_lerp_565_hsw+0xb7>
+  DB  15,133,169,0,0,0                    ; jne           1c9f <_sk_lerp_565_hsw+0xb7>
   DB  196,65,122,111,4,83                 ; vmovdqu       (%r11,%rdx,2),%xmm8
   DB  196,66,125,51,192                   ; vpmovzxwd     %xmm8,%ymm8
-  DB  196,98,125,88,13,50,57,0,0          ; vpbroadcastd  0x3932(%rip),%ymm9        # 554c <_sk_callback_hsw+0x26c>
+  DB  196,98,125,88,13,106,59,0,0         ; vpbroadcastd  0x3b6a(%rip),%ymm9        # 5774 <_sk_callback_hsw+0x26c>
   DB  196,65,61,219,201                   ; vpand         %ymm9,%ymm8,%ymm9
   DB  196,65,124,91,201                   ; vcvtdq2ps     %ymm9,%ymm9
-  DB  196,98,125,24,21,35,57,0,0          ; vbroadcastss  0x3923(%rip),%ymm10        # 5550 <_sk_callback_hsw+0x270>
+  DB  196,98,125,24,21,91,59,0,0          ; vbroadcastss  0x3b5b(%rip),%ymm10        # 5778 <_sk_callback_hsw+0x270>
   DB  196,65,52,89,202                    ; vmulps        %ymm10,%ymm9,%ymm9
-  DB  196,98,125,88,21,25,57,0,0          ; vpbroadcastd  0x3919(%rip),%ymm10        # 5554 <_sk_callback_hsw+0x274>
+  DB  196,98,125,88,21,81,59,0,0          ; vpbroadcastd  0x3b51(%rip),%ymm10        # 577c <_sk_callback_hsw+0x274>
   DB  196,65,61,219,210                   ; vpand         %ymm10,%ymm8,%ymm10
   DB  196,65,124,91,210                   ; vcvtdq2ps     %ymm10,%ymm10
-  DB  196,98,125,24,29,10,57,0,0          ; vbroadcastss  0x390a(%rip),%ymm11        # 5558 <_sk_callback_hsw+0x278>
+  DB  196,98,125,24,29,66,59,0,0          ; vbroadcastss  0x3b42(%rip),%ymm11        # 5780 <_sk_callback_hsw+0x278>
   DB  196,65,44,89,211                    ; vmulps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,88,29,0,57,0,0           ; vpbroadcastd  0x3900(%rip),%ymm11        # 555c <_sk_callback_hsw+0x27c>
+  DB  196,98,125,88,29,56,59,0,0          ; vpbroadcastd  0x3b38(%rip),%ymm11        # 5784 <_sk_callback_hsw+0x27c>
   DB  196,65,61,219,195                   ; vpand         %ymm11,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,29,241,56,0,0         ; vbroadcastss  0x38f1(%rip),%ymm11        # 5560 <_sk_callback_hsw+0x280>
+  DB  196,98,125,24,29,41,59,0,0          ; vbroadcastss  0x3b29(%rip),%ymm11        # 5788 <_sk_callback_hsw+0x280>
   DB  196,65,60,89,195                    ; vmulps        %ymm11,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,226,53,168,196                  ; vfmadd213ps   %ymm4,%ymm9,%ymm0
@@ -1758,27 +1750,27 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,68,255,255,255               ; ja            1c0c <_sk_lerp_565_hsw+0x14>
+  DB  15,135,68,255,255,255               ; ja            1bfc <_sk_lerp_565_hsw+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,101,0,0,0                 ; lea           0x65(%rip),%r10        # 1d38 <_sk_lerp_565_hsw+0x140>
+  DB  76,141,21,101,0,0,0                 ; lea           0x65(%rip),%r10        # 1d28 <_sk_lerp_565_hsw+0x140>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  233,34,255,255,255                  ; jmpq          1c0c <_sk_lerp_565_hsw+0x14>
+  DB  233,34,255,255,255                  ; jmpq          1bfc <_sk_lerp_565_hsw+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,65,57,196,68,83,4,2             ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,121,110,12,83                ; vmovd         (%r11,%rdx,2),%xmm9
   DB  196,67,57,2,193,1                   ; vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,4,255,255,255                   ; jmpq          1c0c <_sk_lerp_565_hsw+0x14>
+  DB  233,4,255,255,255                   ; jmpq          1bfc <_sk_lerp_565_hsw+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,65,57,196,68,83,12,6            ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,57,196,68,83,10,5            ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,57,196,68,83,8,4             ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,122,126,12,83                ; vmovq         (%r11,%rdx,2),%xmm9
   DB  196,67,49,2,192,12                  ; vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  DB  233,214,254,255,255                 ; jmpq          1c0c <_sk_lerp_565_hsw+0x14>
+  DB  233,214,254,255,255                 ; jmpq          1bfc <_sk_lerp_565_hsw+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  164                                 ; movsb         %ds:(%rsi),%es:(%rdi)
   DB  255                                 ; (bad)
@@ -1809,23 +1801,23 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,105                             ; jne           1dd2 <_sk_load_tables_hsw+0x7e>
+  DB  117,105                             ; jne           1dc2 <_sk_load_tables_hsw+0x7e>
   DB  196,193,124,16,26                   ; vmovups       (%r10),%ymm3
-  DB  197,228,84,13,106,59,0,0            ; vandps        0x3b6a(%rip),%ymm3,%ymm1        # 58e0 <_sk_callback_hsw+0x600>
+  DB  197,228,84,13,186,61,0,0            ; vandps        0x3dba(%rip),%ymm3,%ymm1        # 5b20 <_sk_callback_hsw+0x618>
   DB  196,65,61,118,192                   ; vpcmpeqd      %ymm8,%ymm8,%ymm8
   DB  72,139,72,8                         ; mov           0x8(%rax),%rcx
   DB  76,139,80,16                        ; mov           0x10(%rax),%r10
   DB  197,237,118,210                     ; vpcmpeqd      %ymm2,%ymm2,%ymm2
   DB  196,226,109,146,4,137               ; vgatherdps    %ymm2,(%rcx,%ymm1,4),%ymm0
-  DB  196,226,101,0,21,106,59,0,0         ; vpshufb       0x3b6a(%rip),%ymm3,%ymm2        # 5900 <_sk_callback_hsw+0x620>
+  DB  196,226,101,0,21,186,61,0,0         ; vpshufb       0x3dba(%rip),%ymm3,%ymm2        # 5b40 <_sk_callback_hsw+0x638>
   DB  196,65,53,118,201                   ; vpcmpeqd      %ymm9,%ymm9,%ymm9
   DB  196,194,53,146,12,146               ; vgatherdps    %ymm9,(%r10,%ymm2,4),%ymm1
   DB  72,139,64,24                        ; mov           0x18(%rax),%rax
-  DB  196,98,101,0,13,114,59,0,0          ; vpshufb       0x3b72(%rip),%ymm3,%ymm9        # 5920 <_sk_callback_hsw+0x640>
+  DB  196,98,101,0,13,194,61,0,0          ; vpshufb       0x3dc2(%rip),%ymm3,%ymm9        # 5b60 <_sk_callback_hsw+0x658>
   DB  196,162,61,146,20,136               ; vgatherdps    %ymm8,(%rax,%ymm9,4),%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,158,55,0,0          ; vbroadcastss  0x379e(%rip),%ymm8        # 5564 <_sk_callback_hsw+0x284>
+  DB  196,98,125,24,5,214,57,0,0          ; vbroadcastss  0x39d6(%rip),%ymm8        # 578c <_sk_callback_hsw+0x284>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -1838,7 +1830,7 @@
   DB  196,193,249,110,195                 ; vmovq         %r11,%xmm0
   DB  196,226,125,33,192                  ; vpmovsxbd     %xmm0,%ymm0
   DB  196,194,125,44,26                   ; vmaskmovps    (%r10),%ymm0,%ymm3
-  DB  233,115,255,255,255                 ; jmpq          1d6e <_sk_load_tables_hsw+0x1a>
+  DB  233,115,255,255,255                 ; jmpq          1d5e <_sk_load_tables_hsw+0x1a>
 
 PUBLIC _sk_load_tables_u16_be_hsw
 _sk_load_tables_u16_be_hsw LABEL PROC
@@ -1846,7 +1838,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,201,0,0,0                    ; jne           1eda <_sk_load_tables_u16_be_hsw+0xdf>
+  DB  15,133,201,0,0,0                    ; jne           1eca <_sk_load_tables_u16_be_hsw+0xdf>
   DB  196,1,121,16,4,81                   ; vmovupd       (%r9,%r10,2),%xmm8
   DB  196,129,121,16,84,81,16             ; vmovupd       0x10(%r9,%r10,2),%xmm2
   DB  196,129,121,16,92,81,32             ; vmovupd       0x20(%r9,%r10,2),%xmm3
@@ -1862,7 +1854,7 @@
   DB  197,185,108,200                     ; vpunpcklqdq   %xmm0,%xmm8,%xmm1
   DB  197,185,109,208                     ; vpunpckhqdq   %xmm0,%xmm8,%xmm2
   DB  197,49,108,195                      ; vpunpcklqdq   %xmm3,%xmm9,%xmm8
-  DB  197,121,111,21,126,60,0,0           ; vmovdqa       0x3c7e(%rip),%xmm10        # 5ae0 <_sk_callback_hsw+0x800>
+  DB  197,121,111,21,238,63,0,0           ; vmovdqa       0x3fee(%rip),%xmm10        # 5e40 <_sk_callback_hsw+0x938>
   DB  196,193,113,219,194                 ; vpand         %xmm10,%xmm1,%xmm0
   DB  196,226,125,51,200                  ; vpmovzxwd     %xmm0,%ymm1
   DB  196,65,37,118,219                   ; vpcmpeqd      %ymm11,%ymm11,%ymm11
@@ -1884,36 +1876,36 @@
   DB  197,185,235,219                     ; vpor          %xmm3,%xmm8,%xmm3
   DB  196,226,125,51,219                  ; vpmovzxwd     %xmm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,151,54,0,0          ; vbroadcastss  0x3697(%rip),%ymm8        # 5568 <_sk_callback_hsw+0x288>
+  DB  196,98,125,24,5,207,56,0,0          ; vbroadcastss  0x38cf(%rip),%ymm8        # 5790 <_sk_callback_hsw+0x288>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,1,123,16,4,81                   ; vmovsd        (%r9,%r10,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,85                              ; je            1f40 <_sk_load_tables_u16_be_hsw+0x145>
+  DB  116,85                              ; je            1f30 <_sk_load_tables_u16_be_hsw+0x145>
   DB  196,1,57,22,68,81,8                 ; vmovhpd       0x8(%r9,%r10,2),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,72                              ; jb            1f40 <_sk_load_tables_u16_be_hsw+0x145>
+  DB  114,72                              ; jb            1f30 <_sk_load_tables_u16_be_hsw+0x145>
   DB  196,129,123,16,84,81,16             ; vmovsd        0x10(%r9,%r10,2),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,72                              ; je            1f4d <_sk_load_tables_u16_be_hsw+0x152>
+  DB  116,72                              ; je            1f3d <_sk_load_tables_u16_be_hsw+0x152>
   DB  196,129,105,22,84,81,24             ; vmovhpd       0x18(%r9,%r10,2),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,59                              ; jb            1f4d <_sk_load_tables_u16_be_hsw+0x152>
+  DB  114,59                              ; jb            1f3d <_sk_load_tables_u16_be_hsw+0x152>
   DB  196,129,123,16,92,81,32             ; vmovsd        0x20(%r9,%r10,2),%xmm3
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,9,255,255,255                ; je            1e2c <_sk_load_tables_u16_be_hsw+0x31>
+  DB  15,132,9,255,255,255                ; je            1e1c <_sk_load_tables_u16_be_hsw+0x31>
   DB  196,129,97,22,92,81,40              ; vmovhpd       0x28(%r9,%r10,2),%xmm3,%xmm3
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,248,254,255,255              ; jb            1e2c <_sk_load_tables_u16_be_hsw+0x31>
+  DB  15,130,248,254,255,255              ; jb            1e1c <_sk_load_tables_u16_be_hsw+0x31>
   DB  196,1,122,126,76,81,48              ; vmovq         0x30(%r9,%r10,2),%xmm9
-  DB  233,236,254,255,255                 ; jmpq          1e2c <_sk_load_tables_u16_be_hsw+0x31>
+  DB  233,236,254,255,255                 ; jmpq          1e1c <_sk_load_tables_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,223,254,255,255                 ; jmpq          1e2c <_sk_load_tables_u16_be_hsw+0x31>
+  DB  233,223,254,255,255                 ; jmpq          1e1c <_sk_load_tables_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,214,254,255,255                 ; jmpq          1e2c <_sk_load_tables_u16_be_hsw+0x31>
+  DB  233,214,254,255,255                 ; jmpq          1e1c <_sk_load_tables_u16_be_hsw+0x31>
 
 PUBLIC _sk_load_tables_rgb_u16_be_hsw
 _sk_load_tables_rgb_u16_be_hsw LABEL PROC
@@ -1921,7 +1913,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,82                        ; lea           (%rdx,%rdx,2),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,193,0,0,0                    ; jne           2029 <_sk_load_tables_rgb_u16_be_hsw+0xd3>
+  DB  15,133,193,0,0,0                    ; jne           2019 <_sk_load_tables_rgb_u16_be_hsw+0xd3>
   DB  196,129,122,111,4,81                ; vmovdqu       (%r9,%r10,2),%xmm0
   DB  196,129,122,111,84,81,12            ; vmovdqu       0xc(%r9,%r10,2),%xmm2
   DB  196,129,122,111,76,81,24            ; vmovdqu       0x18(%r9,%r10,2),%xmm1
@@ -1942,7 +1934,7 @@
   DB  197,185,108,218                     ; vpunpcklqdq   %xmm2,%xmm8,%xmm3
   DB  197,185,109,210                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm2
   DB  197,121,108,193                     ; vpunpcklqdq   %xmm1,%xmm0,%xmm8
-  DB  197,121,111,13,30,59,0,0            ; vmovdqa       0x3b1e(%rip),%xmm9        # 5af0 <_sk_callback_hsw+0x810>
+  DB  197,121,111,13,142,62,0,0           ; vmovdqa       0x3e8e(%rip),%xmm9        # 5e50 <_sk_callback_hsw+0x948>
   DB  196,193,97,219,193                  ; vpand         %xmm9,%xmm3,%xmm0
   DB  196,226,125,51,200                  ; vpmovzxwd     %xmm0,%ymm1
   DB  197,229,118,219                     ; vpcmpeqd      %ymm3,%ymm3,%ymm3
@@ -1959,46 +1951,46 @@
   DB  196,98,125,51,194                   ; vpmovzxwd     %xmm2,%ymm8
   DB  196,162,101,146,20,128              ; vgatherdps    %ymm3,(%rax,%ymm8,4),%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,69,53,0,0         ; vbroadcastss  0x3545(%rip),%ymm3        # 556c <_sk_callback_hsw+0x28c>
+  DB  196,226,125,24,29,125,55,0,0        ; vbroadcastss  0x377d(%rip),%ymm3        # 5794 <_sk_callback_hsw+0x28c>
   DB  255,224                             ; jmpq          *%rax
   DB  196,129,121,110,4,81                ; vmovd         (%r9,%r10,2),%xmm0
   DB  196,129,121,196,68,81,4,2           ; vpinsrw       $0x2,0x4(%r9,%r10,2),%xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,5                               ; jne           2042 <_sk_load_tables_rgb_u16_be_hsw+0xec>
-  DB  233,90,255,255,255                  ; jmpq          1f9c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  117,5                               ; jne           2032 <_sk_load_tables_rgb_u16_be_hsw+0xec>
+  DB  233,90,255,255,255                  ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
   DB  196,129,121,110,76,81,6             ; vmovd         0x6(%r9,%r10,2),%xmm1
   DB  196,1,113,196,68,81,10,2            ; vpinsrw       $0x2,0xa(%r9,%r10,2),%xmm1,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,26                              ; jb            2071 <_sk_load_tables_rgb_u16_be_hsw+0x11b>
+  DB  114,26                              ; jb            2061 <_sk_load_tables_rgb_u16_be_hsw+0x11b>
   DB  196,129,121,110,76,81,12            ; vmovd         0xc(%r9,%r10,2),%xmm1
   DB  196,129,113,196,84,81,16,2          ; vpinsrw       $0x2,0x10(%r9,%r10,2),%xmm1,%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  117,10                              ; jne           2076 <_sk_load_tables_rgb_u16_be_hsw+0x120>
-  DB  233,43,255,255,255                  ; jmpq          1f9c <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  DB  233,38,255,255,255                  ; jmpq          1f9c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           2066 <_sk_load_tables_rgb_u16_be_hsw+0x120>
+  DB  233,43,255,255,255                  ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,38,255,255,255                  ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
   DB  196,129,121,110,76,81,18            ; vmovd         0x12(%r9,%r10,2),%xmm1
   DB  196,1,113,196,76,81,22,2            ; vpinsrw       $0x2,0x16(%r9,%r10,2),%xmm1,%xmm9
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,26                              ; jb            20a5 <_sk_load_tables_rgb_u16_be_hsw+0x14f>
+  DB  114,26                              ; jb            2095 <_sk_load_tables_rgb_u16_be_hsw+0x14f>
   DB  196,129,121,110,76,81,24            ; vmovd         0x18(%r9,%r10,2),%xmm1
   DB  196,129,113,196,76,81,28,2          ; vpinsrw       $0x2,0x1c(%r9,%r10,2),%xmm1,%xmm1
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  117,10                              ; jne           20aa <_sk_load_tables_rgb_u16_be_hsw+0x154>
-  DB  233,247,254,255,255                 ; jmpq          1f9c <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  DB  233,242,254,255,255                 ; jmpq          1f9c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           209a <_sk_load_tables_rgb_u16_be_hsw+0x154>
+  DB  233,247,254,255,255                 ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,242,254,255,255                 ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
   DB  196,129,121,110,92,81,30            ; vmovd         0x1e(%r9,%r10,2),%xmm3
   DB  196,1,97,196,92,81,34,2             ; vpinsrw       $0x2,0x22(%r9,%r10,2),%xmm3,%xmm11
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,20                              ; jb            20d3 <_sk_load_tables_rgb_u16_be_hsw+0x17d>
+  DB  114,20                              ; jb            20c3 <_sk_load_tables_rgb_u16_be_hsw+0x17d>
   DB  196,129,121,110,92,81,36            ; vmovd         0x24(%r9,%r10,2),%xmm3
   DB  196,129,97,196,92,81,40,2           ; vpinsrw       $0x2,0x28(%r9,%r10,2),%xmm3,%xmm3
-  DB  233,201,254,255,255                 ; jmpq          1f9c <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  DB  233,196,254,255,255                 ; jmpq          1f9c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,201,254,255,255                 ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,196,254,255,255                 ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
 
 PUBLIC _sk_byte_tables_hsw
 _sk_byte_tables_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,141,52,0,0          ; vbroadcastss  0x348d(%rip),%ymm8        # 5570 <_sk_callback_hsw+0x290>
+  DB  196,98,125,24,5,197,54,0,0          ; vbroadcastss  0x36c5(%rip),%ymm8        # 5798 <_sk_callback_hsw+0x290>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  197,125,91,200                      ; vcvtps2dq     %ymm0,%ymm9
   DB  196,65,249,126,201                  ; vmovq         %xmm9,%r9
@@ -2120,7 +2112,7 @@
   DB  67,15,182,4,26                      ; movzbl        (%r10,%r11,1),%eax
   DB  196,194,125,49,193                  ; vpmovzxbd     %xmm9,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,50,50,0,0           ; vbroadcastss  0x3232(%rip),%ymm8        # 5574 <_sk_callback_hsw+0x294>
+  DB  196,98,125,24,5,106,52,0,0          ; vbroadcastss  0x346a(%rip),%ymm8        # 579c <_sk_callback_hsw+0x294>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  196,226,125,49,201                  ; vpmovzxbd     %xmm1,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
@@ -2234,7 +2226,7 @@
   DB  67,15,182,4,26                      ; movzbl        (%r10,%r11,1),%eax
   DB  196,194,125,49,193                  ; vpmovzxbd     %xmm9,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,30,48,0,0           ; vbroadcastss  0x301e(%rip),%ymm8        # 5578 <_sk_callback_hsw+0x298>
+  DB  196,98,125,24,5,86,50,0,0           ; vbroadcastss  0x3256(%rip),%ymm8        # 57a0 <_sk_callback_hsw+0x298>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  196,226,125,49,201                  ; vpmovzxbd     %xmm1,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
@@ -2323,33 +2315,33 @@
   DB  196,66,125,168,211                  ; vfmadd213ps   %ymm11,%ymm0,%ymm10
   DB  196,226,125,24,0                    ; vbroadcastss  (%rax),%ymm0
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,248,46,0,0         ; vbroadcastss  0x2ef8(%rip),%ymm12        # 557c <_sk_callback_hsw+0x29c>
-  DB  196,98,125,24,45,243,46,0,0         ; vbroadcastss  0x2ef3(%rip),%ymm13        # 5580 <_sk_callback_hsw+0x2a0>
+  DB  196,98,125,24,37,48,49,0,0          ; vbroadcastss  0x3130(%rip),%ymm12        # 57a4 <_sk_callback_hsw+0x29c>
+  DB  196,98,125,24,45,43,49,0,0          ; vbroadcastss  0x312b(%rip),%ymm13        # 57a8 <_sk_callback_hsw+0x2a0>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,233,46,0,0         ; vbroadcastss  0x2ee9(%rip),%ymm13        # 5584 <_sk_callback_hsw+0x2a4>
+  DB  196,98,125,24,45,33,49,0,0          ; vbroadcastss  0x3121(%rip),%ymm13        # 57ac <_sk_callback_hsw+0x2a4>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,223,46,0,0         ; vbroadcastss  0x2edf(%rip),%ymm13        # 5588 <_sk_callback_hsw+0x2a8>
+  DB  196,98,125,24,45,23,49,0,0          ; vbroadcastss  0x3117(%rip),%ymm13        # 57b0 <_sk_callback_hsw+0x2a8>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,213,46,0,0         ; vbroadcastss  0x2ed5(%rip),%ymm11        # 558c <_sk_callback_hsw+0x2ac>
+  DB  196,98,125,24,29,13,49,0,0          ; vbroadcastss  0x310d(%rip),%ymm11        # 57b4 <_sk_callback_hsw+0x2ac>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,203,46,0,0         ; vbroadcastss  0x2ecb(%rip),%ymm12        # 5590 <_sk_callback_hsw+0x2b0>
+  DB  196,98,125,24,37,3,49,0,0           ; vbroadcastss  0x3103(%rip),%ymm12        # 57b8 <_sk_callback_hsw+0x2b0>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,193,46,0,0         ; vbroadcastss  0x2ec1(%rip),%ymm12        # 5594 <_sk_callback_hsw+0x2b4>
+  DB  196,98,125,24,37,249,48,0,0         ; vbroadcastss  0x30f9(%rip),%ymm12        # 57bc <_sk_callback_hsw+0x2b4>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  196,99,125,8,208,1                  ; vroundps      $0x1,%ymm0,%ymm10
   DB  196,65,124,92,210                   ; vsubps        %ymm10,%ymm0,%ymm10
-  DB  196,98,125,24,29,162,46,0,0         ; vbroadcastss  0x2ea2(%rip),%ymm11        # 5598 <_sk_callback_hsw+0x2b8>
+  DB  196,98,125,24,29,218,48,0,0         ; vbroadcastss  0x30da(%rip),%ymm11        # 57c0 <_sk_callback_hsw+0x2b8>
   DB  196,193,124,88,195                  ; vaddps        %ymm11,%ymm0,%ymm0
-  DB  196,98,125,24,29,152,46,0,0         ; vbroadcastss  0x2e98(%rip),%ymm11        # 559c <_sk_callback_hsw+0x2bc>
+  DB  196,98,125,24,29,208,48,0,0         ; vbroadcastss  0x30d0(%rip),%ymm11        # 57c4 <_sk_callback_hsw+0x2bc>
   DB  196,98,45,172,216                   ; vfnmadd213ps  %ymm0,%ymm10,%ymm11
-  DB  196,226,125,24,5,142,46,0,0         ; vbroadcastss  0x2e8e(%rip),%ymm0        # 55a0 <_sk_callback_hsw+0x2c0>
+  DB  196,226,125,24,5,198,48,0,0         ; vbroadcastss  0x30c6(%rip),%ymm0        # 57c8 <_sk_callback_hsw+0x2c0>
   DB  196,193,124,92,194                  ; vsubps        %ymm10,%ymm0,%ymm0
-  DB  196,98,125,24,21,132,46,0,0         ; vbroadcastss  0x2e84(%rip),%ymm10        # 55a4 <_sk_callback_hsw+0x2c4>
+  DB  196,98,125,24,21,188,48,0,0         ; vbroadcastss  0x30bc(%rip),%ymm10        # 57cc <_sk_callback_hsw+0x2c4>
   DB  197,172,94,192                      ; vdivps        %ymm0,%ymm10,%ymm0
   DB  197,164,88,192                      ; vaddps        %ymm0,%ymm11,%ymm0
-  DB  196,98,125,24,21,119,46,0,0         ; vbroadcastss  0x2e77(%rip),%ymm10        # 55a8 <_sk_callback_hsw+0x2c8>
+  DB  196,98,125,24,21,175,48,0,0         ; vbroadcastss  0x30af(%rip),%ymm10        # 57d0 <_sk_callback_hsw+0x2c8>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,253,91,192                      ; vcvtps2dq     %ymm0,%ymm0
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2357,7 +2349,7 @@
   DB  196,195,125,74,193,128              ; vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,78,46,0,0           ; vbroadcastss  0x2e4e(%rip),%ymm8        # 55ac <_sk_callback_hsw+0x2cc>
+  DB  196,98,125,24,5,134,48,0,0          ; vbroadcastss  0x3086(%rip),%ymm8        # 57d4 <_sk_callback_hsw+0x2cc>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2375,33 +2367,33 @@
   DB  196,66,117,168,211                  ; vfmadd213ps   %ymm11,%ymm1,%ymm10
   DB  196,226,125,24,8                    ; vbroadcastss  (%rax),%ymm1
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,6,46,0,0           ; vbroadcastss  0x2e06(%rip),%ymm12        # 55b0 <_sk_callback_hsw+0x2d0>
-  DB  196,98,125,24,45,1,46,0,0           ; vbroadcastss  0x2e01(%rip),%ymm13        # 55b4 <_sk_callback_hsw+0x2d4>
+  DB  196,98,125,24,37,62,48,0,0          ; vbroadcastss  0x303e(%rip),%ymm12        # 57d8 <_sk_callback_hsw+0x2d0>
+  DB  196,98,125,24,45,57,48,0,0          ; vbroadcastss  0x3039(%rip),%ymm13        # 57dc <_sk_callback_hsw+0x2d4>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,247,45,0,0         ; vbroadcastss  0x2df7(%rip),%ymm13        # 55b8 <_sk_callback_hsw+0x2d8>
+  DB  196,98,125,24,45,47,48,0,0          ; vbroadcastss  0x302f(%rip),%ymm13        # 57e0 <_sk_callback_hsw+0x2d8>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,237,45,0,0         ; vbroadcastss  0x2ded(%rip),%ymm13        # 55bc <_sk_callback_hsw+0x2dc>
+  DB  196,98,125,24,45,37,48,0,0          ; vbroadcastss  0x3025(%rip),%ymm13        # 57e4 <_sk_callback_hsw+0x2dc>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,227,45,0,0         ; vbroadcastss  0x2de3(%rip),%ymm11        # 55c0 <_sk_callback_hsw+0x2e0>
+  DB  196,98,125,24,29,27,48,0,0          ; vbroadcastss  0x301b(%rip),%ymm11        # 57e8 <_sk_callback_hsw+0x2e0>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,217,45,0,0         ; vbroadcastss  0x2dd9(%rip),%ymm12        # 55c4 <_sk_callback_hsw+0x2e4>
+  DB  196,98,125,24,37,17,48,0,0          ; vbroadcastss  0x3011(%rip),%ymm12        # 57ec <_sk_callback_hsw+0x2e4>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,207,45,0,0         ; vbroadcastss  0x2dcf(%rip),%ymm12        # 55c8 <_sk_callback_hsw+0x2e8>
+  DB  196,98,125,24,37,7,48,0,0           ; vbroadcastss  0x3007(%rip),%ymm12        # 57f0 <_sk_callback_hsw+0x2e8>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,116,89,202                  ; vmulps        %ymm10,%ymm1,%ymm1
   DB  196,99,125,8,209,1                  ; vroundps      $0x1,%ymm1,%ymm10
   DB  196,65,116,92,210                   ; vsubps        %ymm10,%ymm1,%ymm10
-  DB  196,98,125,24,29,176,45,0,0         ; vbroadcastss  0x2db0(%rip),%ymm11        # 55cc <_sk_callback_hsw+0x2ec>
+  DB  196,98,125,24,29,232,47,0,0         ; vbroadcastss  0x2fe8(%rip),%ymm11        # 57f4 <_sk_callback_hsw+0x2ec>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,166,45,0,0         ; vbroadcastss  0x2da6(%rip),%ymm11        # 55d0 <_sk_callback_hsw+0x2f0>
+  DB  196,98,125,24,29,222,47,0,0         ; vbroadcastss  0x2fde(%rip),%ymm11        # 57f8 <_sk_callback_hsw+0x2f0>
   DB  196,98,45,172,217                   ; vfnmadd213ps  %ymm1,%ymm10,%ymm11
-  DB  196,226,125,24,13,156,45,0,0        ; vbroadcastss  0x2d9c(%rip),%ymm1        # 55d4 <_sk_callback_hsw+0x2f4>
+  DB  196,226,125,24,13,212,47,0,0        ; vbroadcastss  0x2fd4(%rip),%ymm1        # 57fc <_sk_callback_hsw+0x2f4>
   DB  196,193,116,92,202                  ; vsubps        %ymm10,%ymm1,%ymm1
-  DB  196,98,125,24,21,146,45,0,0         ; vbroadcastss  0x2d92(%rip),%ymm10        # 55d8 <_sk_callback_hsw+0x2f8>
+  DB  196,98,125,24,21,202,47,0,0         ; vbroadcastss  0x2fca(%rip),%ymm10        # 5800 <_sk_callback_hsw+0x2f8>
   DB  197,172,94,201                      ; vdivps        %ymm1,%ymm10,%ymm1
   DB  197,164,88,201                      ; vaddps        %ymm1,%ymm11,%ymm1
-  DB  196,98,125,24,21,133,45,0,0         ; vbroadcastss  0x2d85(%rip),%ymm10        # 55dc <_sk_callback_hsw+0x2fc>
+  DB  196,98,125,24,21,189,47,0,0         ; vbroadcastss  0x2fbd(%rip),%ymm10        # 5804 <_sk_callback_hsw+0x2fc>
   DB  196,193,116,89,202                  ; vmulps        %ymm10,%ymm1,%ymm1
   DB  197,253,91,201                      ; vcvtps2dq     %ymm1,%ymm1
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2409,7 +2401,7 @@
   DB  196,195,117,74,201,128              ; vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,116,95,200                  ; vmaxps        %ymm8,%ymm1,%ymm1
-  DB  196,98,125,24,5,92,45,0,0           ; vbroadcastss  0x2d5c(%rip),%ymm8        # 55e0 <_sk_callback_hsw+0x300>
+  DB  196,98,125,24,5,148,47,0,0          ; vbroadcastss  0x2f94(%rip),%ymm8        # 5808 <_sk_callback_hsw+0x300>
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2427,33 +2419,33 @@
   DB  196,66,109,168,211                  ; vfmadd213ps   %ymm11,%ymm2,%ymm10
   DB  196,226,125,24,16                   ; vbroadcastss  (%rax),%ymm2
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,20,45,0,0          ; vbroadcastss  0x2d14(%rip),%ymm12        # 55e4 <_sk_callback_hsw+0x304>
-  DB  196,98,125,24,45,15,45,0,0          ; vbroadcastss  0x2d0f(%rip),%ymm13        # 55e8 <_sk_callback_hsw+0x308>
+  DB  196,98,125,24,37,76,47,0,0          ; vbroadcastss  0x2f4c(%rip),%ymm12        # 580c <_sk_callback_hsw+0x304>
+  DB  196,98,125,24,45,71,47,0,0          ; vbroadcastss  0x2f47(%rip),%ymm13        # 5810 <_sk_callback_hsw+0x308>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,5,45,0,0           ; vbroadcastss  0x2d05(%rip),%ymm13        # 55ec <_sk_callback_hsw+0x30c>
+  DB  196,98,125,24,45,61,47,0,0          ; vbroadcastss  0x2f3d(%rip),%ymm13        # 5814 <_sk_callback_hsw+0x30c>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,251,44,0,0         ; vbroadcastss  0x2cfb(%rip),%ymm13        # 55f0 <_sk_callback_hsw+0x310>
+  DB  196,98,125,24,45,51,47,0,0          ; vbroadcastss  0x2f33(%rip),%ymm13        # 5818 <_sk_callback_hsw+0x310>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,241,44,0,0         ; vbroadcastss  0x2cf1(%rip),%ymm11        # 55f4 <_sk_callback_hsw+0x314>
+  DB  196,98,125,24,29,41,47,0,0          ; vbroadcastss  0x2f29(%rip),%ymm11        # 581c <_sk_callback_hsw+0x314>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,231,44,0,0         ; vbroadcastss  0x2ce7(%rip),%ymm12        # 55f8 <_sk_callback_hsw+0x318>
+  DB  196,98,125,24,37,31,47,0,0          ; vbroadcastss  0x2f1f(%rip),%ymm12        # 5820 <_sk_callback_hsw+0x318>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,221,44,0,0         ; vbroadcastss  0x2cdd(%rip),%ymm12        # 55fc <_sk_callback_hsw+0x31c>
+  DB  196,98,125,24,37,21,47,0,0          ; vbroadcastss  0x2f15(%rip),%ymm12        # 5824 <_sk_callback_hsw+0x31c>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  196,99,125,8,210,1                  ; vroundps      $0x1,%ymm2,%ymm10
   DB  196,65,108,92,210                   ; vsubps        %ymm10,%ymm2,%ymm10
-  DB  196,98,125,24,29,190,44,0,0         ; vbroadcastss  0x2cbe(%rip),%ymm11        # 5600 <_sk_callback_hsw+0x320>
+  DB  196,98,125,24,29,246,46,0,0         ; vbroadcastss  0x2ef6(%rip),%ymm11        # 5828 <_sk_callback_hsw+0x320>
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
-  DB  196,98,125,24,29,180,44,0,0         ; vbroadcastss  0x2cb4(%rip),%ymm11        # 5604 <_sk_callback_hsw+0x324>
+  DB  196,98,125,24,29,236,46,0,0         ; vbroadcastss  0x2eec(%rip),%ymm11        # 582c <_sk_callback_hsw+0x324>
   DB  196,98,45,172,218                   ; vfnmadd213ps  %ymm2,%ymm10,%ymm11
-  DB  196,226,125,24,21,170,44,0,0        ; vbroadcastss  0x2caa(%rip),%ymm2        # 5608 <_sk_callback_hsw+0x328>
+  DB  196,226,125,24,21,226,46,0,0        ; vbroadcastss  0x2ee2(%rip),%ymm2        # 5830 <_sk_callback_hsw+0x328>
   DB  196,193,108,92,210                  ; vsubps        %ymm10,%ymm2,%ymm2
-  DB  196,98,125,24,21,160,44,0,0         ; vbroadcastss  0x2ca0(%rip),%ymm10        # 560c <_sk_callback_hsw+0x32c>
+  DB  196,98,125,24,21,216,46,0,0         ; vbroadcastss  0x2ed8(%rip),%ymm10        # 5834 <_sk_callback_hsw+0x32c>
   DB  197,172,94,210                      ; vdivps        %ymm2,%ymm10,%ymm2
   DB  197,164,88,210                      ; vaddps        %ymm2,%ymm11,%ymm2
-  DB  196,98,125,24,21,147,44,0,0         ; vbroadcastss  0x2c93(%rip),%ymm10        # 5610 <_sk_callback_hsw+0x330>
+  DB  196,98,125,24,21,203,46,0,0         ; vbroadcastss  0x2ecb(%rip),%ymm10        # 5838 <_sk_callback_hsw+0x330>
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  197,253,91,210                      ; vcvtps2dq     %ymm2,%ymm2
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2461,7 +2453,7 @@
   DB  196,195,109,74,209,128              ; vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,106,44,0,0          ; vbroadcastss  0x2c6a(%rip),%ymm8        # 5614 <_sk_callback_hsw+0x334>
+  DB  196,98,125,24,5,162,46,0,0          ; vbroadcastss  0x2ea2(%rip),%ymm8        # 583c <_sk_callback_hsw+0x334>
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2479,33 +2471,33 @@
   DB  196,66,101,168,211                  ; vfmadd213ps   %ymm11,%ymm3,%ymm10
   DB  196,226,125,24,24                   ; vbroadcastss  (%rax),%ymm3
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,34,44,0,0          ; vbroadcastss  0x2c22(%rip),%ymm12        # 5618 <_sk_callback_hsw+0x338>
-  DB  196,98,125,24,45,29,44,0,0          ; vbroadcastss  0x2c1d(%rip),%ymm13        # 561c <_sk_callback_hsw+0x33c>
+  DB  196,98,125,24,37,90,46,0,0          ; vbroadcastss  0x2e5a(%rip),%ymm12        # 5840 <_sk_callback_hsw+0x338>
+  DB  196,98,125,24,45,85,46,0,0          ; vbroadcastss  0x2e55(%rip),%ymm13        # 5844 <_sk_callback_hsw+0x33c>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,19,44,0,0          ; vbroadcastss  0x2c13(%rip),%ymm13        # 5620 <_sk_callback_hsw+0x340>
+  DB  196,98,125,24,45,75,46,0,0          ; vbroadcastss  0x2e4b(%rip),%ymm13        # 5848 <_sk_callback_hsw+0x340>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,9,44,0,0           ; vbroadcastss  0x2c09(%rip),%ymm13        # 5624 <_sk_callback_hsw+0x344>
+  DB  196,98,125,24,45,65,46,0,0          ; vbroadcastss  0x2e41(%rip),%ymm13        # 584c <_sk_callback_hsw+0x344>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,255,43,0,0         ; vbroadcastss  0x2bff(%rip),%ymm11        # 5628 <_sk_callback_hsw+0x348>
+  DB  196,98,125,24,29,55,46,0,0          ; vbroadcastss  0x2e37(%rip),%ymm11        # 5850 <_sk_callback_hsw+0x348>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,245,43,0,0         ; vbroadcastss  0x2bf5(%rip),%ymm12        # 562c <_sk_callback_hsw+0x34c>
+  DB  196,98,125,24,37,45,46,0,0          ; vbroadcastss  0x2e2d(%rip),%ymm12        # 5854 <_sk_callback_hsw+0x34c>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,235,43,0,0         ; vbroadcastss  0x2beb(%rip),%ymm12        # 5630 <_sk_callback_hsw+0x350>
+  DB  196,98,125,24,37,35,46,0,0          ; vbroadcastss  0x2e23(%rip),%ymm12        # 5858 <_sk_callback_hsw+0x350>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,100,89,218                  ; vmulps        %ymm10,%ymm3,%ymm3
   DB  196,99,125,8,211,1                  ; vroundps      $0x1,%ymm3,%ymm10
   DB  196,65,100,92,210                   ; vsubps        %ymm10,%ymm3,%ymm10
-  DB  196,98,125,24,29,204,43,0,0         ; vbroadcastss  0x2bcc(%rip),%ymm11        # 5634 <_sk_callback_hsw+0x354>
+  DB  196,98,125,24,29,4,46,0,0           ; vbroadcastss  0x2e04(%rip),%ymm11        # 585c <_sk_callback_hsw+0x354>
   DB  196,193,100,88,219                  ; vaddps        %ymm11,%ymm3,%ymm3
-  DB  196,98,125,24,29,194,43,0,0         ; vbroadcastss  0x2bc2(%rip),%ymm11        # 5638 <_sk_callback_hsw+0x358>
+  DB  196,98,125,24,29,250,45,0,0         ; vbroadcastss  0x2dfa(%rip),%ymm11        # 5860 <_sk_callback_hsw+0x358>
   DB  196,98,45,172,219                   ; vfnmadd213ps  %ymm3,%ymm10,%ymm11
-  DB  196,226,125,24,29,184,43,0,0        ; vbroadcastss  0x2bb8(%rip),%ymm3        # 563c <_sk_callback_hsw+0x35c>
+  DB  196,226,125,24,29,240,45,0,0        ; vbroadcastss  0x2df0(%rip),%ymm3        # 5864 <_sk_callback_hsw+0x35c>
   DB  196,193,100,92,218                  ; vsubps        %ymm10,%ymm3,%ymm3
-  DB  196,98,125,24,21,174,43,0,0         ; vbroadcastss  0x2bae(%rip),%ymm10        # 5640 <_sk_callback_hsw+0x360>
+  DB  196,98,125,24,21,230,45,0,0         ; vbroadcastss  0x2de6(%rip),%ymm10        # 5868 <_sk_callback_hsw+0x360>
   DB  197,172,94,219                      ; vdivps        %ymm3,%ymm10,%ymm3
   DB  197,164,88,219                      ; vaddps        %ymm3,%ymm11,%ymm3
-  DB  196,98,125,24,21,161,43,0,0         ; vbroadcastss  0x2ba1(%rip),%ymm10        # 5644 <_sk_callback_hsw+0x364>
+  DB  196,98,125,24,21,217,45,0,0         ; vbroadcastss  0x2dd9(%rip),%ymm10        # 586c <_sk_callback_hsw+0x364>
   DB  196,193,100,89,218                  ; vmulps        %ymm10,%ymm3,%ymm3
   DB  197,253,91,219                      ; vcvtps2dq     %ymm3,%ymm3
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2513,33 +2505,33 @@
   DB  196,195,101,74,217,128              ; vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,100,95,216                  ; vmaxps        %ymm8,%ymm3,%ymm3
-  DB  196,98,125,24,5,120,43,0,0          ; vbroadcastss  0x2b78(%rip),%ymm8        # 5648 <_sk_callback_hsw+0x368>
+  DB  196,98,125,24,5,176,45,0,0          ; vbroadcastss  0x2db0(%rip),%ymm8        # 5870 <_sk_callback_hsw+0x368>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_lab_to_xyz_hsw
 _sk_lab_to_xyz_hsw LABEL PROC
-  DB  196,98,125,24,5,106,43,0,0          ; vbroadcastss  0x2b6a(%rip),%ymm8        # 564c <_sk_callback_hsw+0x36c>
-  DB  196,98,125,24,13,101,43,0,0         ; vbroadcastss  0x2b65(%rip),%ymm9        # 5650 <_sk_callback_hsw+0x370>
-  DB  196,98,125,24,21,96,43,0,0          ; vbroadcastss  0x2b60(%rip),%ymm10        # 5654 <_sk_callback_hsw+0x374>
+  DB  196,98,125,24,5,162,45,0,0          ; vbroadcastss  0x2da2(%rip),%ymm8        # 5874 <_sk_callback_hsw+0x36c>
+  DB  196,98,125,24,13,157,45,0,0         ; vbroadcastss  0x2d9d(%rip),%ymm9        # 5878 <_sk_callback_hsw+0x370>
+  DB  196,98,125,24,21,152,45,0,0         ; vbroadcastss  0x2d98(%rip),%ymm10        # 587c <_sk_callback_hsw+0x374>
   DB  196,194,53,168,202                  ; vfmadd213ps   %ymm10,%ymm9,%ymm1
   DB  196,194,53,168,210                  ; vfmadd213ps   %ymm10,%ymm9,%ymm2
-  DB  196,98,125,24,13,81,43,0,0          ; vbroadcastss  0x2b51(%rip),%ymm9        # 5658 <_sk_callback_hsw+0x378>
+  DB  196,98,125,24,13,137,45,0,0         ; vbroadcastss  0x2d89(%rip),%ymm9        # 5880 <_sk_callback_hsw+0x378>
   DB  196,66,125,184,200                  ; vfmadd231ps   %ymm8,%ymm0,%ymm9
-  DB  196,226,125,24,5,71,43,0,0          ; vbroadcastss  0x2b47(%rip),%ymm0        # 565c <_sk_callback_hsw+0x37c>
+  DB  196,226,125,24,5,127,45,0,0         ; vbroadcastss  0x2d7f(%rip),%ymm0        # 5884 <_sk_callback_hsw+0x37c>
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
-  DB  196,98,125,24,5,62,43,0,0           ; vbroadcastss  0x2b3e(%rip),%ymm8        # 5660 <_sk_callback_hsw+0x380>
+  DB  196,98,125,24,5,118,45,0,0          ; vbroadcastss  0x2d76(%rip),%ymm8        # 5888 <_sk_callback_hsw+0x380>
   DB  196,98,117,168,192                  ; vfmadd213ps   %ymm0,%ymm1,%ymm8
-  DB  196,98,125,24,13,52,43,0,0          ; vbroadcastss  0x2b34(%rip),%ymm9        # 5664 <_sk_callback_hsw+0x384>
+  DB  196,98,125,24,13,108,45,0,0         ; vbroadcastss  0x2d6c(%rip),%ymm9        # 588c <_sk_callback_hsw+0x384>
   DB  196,98,109,172,200                  ; vfnmadd213ps  %ymm0,%ymm2,%ymm9
   DB  196,193,60,89,200                   ; vmulps        %ymm8,%ymm8,%ymm1
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
-  DB  196,226,125,24,21,33,43,0,0         ; vbroadcastss  0x2b21(%rip),%ymm2        # 5668 <_sk_callback_hsw+0x388>
+  DB  196,226,125,24,21,89,45,0,0         ; vbroadcastss  0x2d59(%rip),%ymm2        # 5890 <_sk_callback_hsw+0x388>
   DB  197,108,194,209,1                   ; vcmpltps      %ymm1,%ymm2,%ymm10
-  DB  196,98,125,24,29,23,43,0,0          ; vbroadcastss  0x2b17(%rip),%ymm11        # 566c <_sk_callback_hsw+0x38c>
+  DB  196,98,125,24,29,79,45,0,0          ; vbroadcastss  0x2d4f(%rip),%ymm11        # 5894 <_sk_callback_hsw+0x38c>
   DB  196,65,60,88,195                    ; vaddps        %ymm11,%ymm8,%ymm8
-  DB  196,98,125,24,37,13,43,0,0          ; vbroadcastss  0x2b0d(%rip),%ymm12        # 5670 <_sk_callback_hsw+0x390>
+  DB  196,98,125,24,37,69,45,0,0          ; vbroadcastss  0x2d45(%rip),%ymm12        # 5898 <_sk_callback_hsw+0x390>
   DB  196,65,60,89,196                    ; vmulps        %ymm12,%ymm8,%ymm8
   DB  196,99,61,74,193,160                ; vblendvps     %ymm10,%ymm1,%ymm8,%ymm8
   DB  197,252,89,200                      ; vmulps        %ymm0,%ymm0,%ymm1
@@ -2554,9 +2546,9 @@
   DB  196,65,52,88,203                    ; vaddps        %ymm11,%ymm9,%ymm9
   DB  196,65,52,89,204                    ; vmulps        %ymm12,%ymm9,%ymm9
   DB  196,227,53,74,208,32                ; vblendvps     %ymm2,%ymm0,%ymm9,%ymm2
-  DB  196,226,125,24,5,194,42,0,0         ; vbroadcastss  0x2ac2(%rip),%ymm0        # 5674 <_sk_callback_hsw+0x394>
+  DB  196,226,125,24,5,250,44,0,0         ; vbroadcastss  0x2cfa(%rip),%ymm0        # 589c <_sk_callback_hsw+0x394>
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
-  DB  196,98,125,24,5,185,42,0,0          ; vbroadcastss  0x2ab9(%rip),%ymm8        # 5678 <_sk_callback_hsw+0x398>
+  DB  196,98,125,24,5,241,44,0,0          ; vbroadcastss  0x2cf1(%rip),%ymm8        # 58a0 <_sk_callback_hsw+0x398>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2566,12 +2558,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,52                              ; jne           2c06 <_sk_load_a8_hsw+0x3e>
+  DB  117,52                              ; jne           2bf6 <_sk_load_a8_hsw+0x3e>
   DB  196,194,121,48,4,19                 ; vpmovzxbw     (%r11,%rdx,1),%xmm0
-  DB  197,249,219,5,32,47,0,0             ; vpand         0x2f20(%rip),%xmm0,%xmm0        # 5b00 <_sk_callback_hsw+0x820>
+  DB  197,249,219,5,144,50,0,0            ; vpand         0x3290(%rip),%xmm0,%xmm0        # 5e60 <_sk_callback_hsw+0x958>
   DB  196,226,125,51,192                  ; vpmovzxwd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,138,42,0,0        ; vbroadcastss  0x2a8a(%rip),%ymm1        # 567c <_sk_callback_hsw+0x39c>
+  DB  196,226,125,24,13,194,44,0,0        ; vbroadcastss  0x2cc2(%rip),%ymm1        # 58a4 <_sk_callback_hsw+0x39c>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -2583,15 +2575,15 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,190                             ; ja            2bd8 <_sk_load_a8_hsw+0x10>
+  DB  119,190                             ; ja            2bc8 <_sk_load_a8_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,119,0,0,0                 ; lea           0x77(%rip),%r10        # 2c9c <_sk_load_a8_hsw+0xd4>
+  DB  76,141,21,119,0,0,0                 ; lea           0x77(%rip),%r10        # 2c8c <_sk_load_a8_hsw+0xd4>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,159                             ; jmp           2bd8 <_sk_load_a8_hsw+0x10>
+  DB  235,159                             ; jmp           2bc8 <_sk_load_a8_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,2                   ; vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -2599,7 +2591,7 @@
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,119,255,255,255                 ; jmpq          2bd8 <_sk_load_a8_hsw+0x10>
+  DB  233,119,255,255,255                 ; jmpq          2bc8 <_sk_load_a8_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,6                   ; vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -2610,7 +2602,7 @@
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,60,255,255,255                  ; jmpq          2bd8 <_sk_load_a8_hsw+0x10>
+  DB  233,60,255,255,255                  ; jmpq          2bc8 <_sk_load_a8_hsw+0x10>
   DB  146                                 ; xchg          %eax,%edx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -2636,12 +2628,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,52                              ; jne           2cf6 <_sk_load_a8_dst_hsw+0x3e>
+  DB  117,52                              ; jne           2ce6 <_sk_load_a8_dst_hsw+0x3e>
   DB  196,194,121,48,36,19                ; vpmovzxbw     (%r11,%rdx,1),%xmm4
-  DB  197,217,219,37,64,46,0,0            ; vpand         0x2e40(%rip),%xmm4,%xmm4        # 5b10 <_sk_callback_hsw+0x830>
+  DB  197,217,219,37,176,49,0,0           ; vpand         0x31b0(%rip),%xmm4,%xmm4        # 5e70 <_sk_callback_hsw+0x968>
   DB  196,226,125,51,228                  ; vpmovzxwd     %xmm4,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,158,41,0,0        ; vbroadcastss  0x299e(%rip),%ymm5        # 5680 <_sk_callback_hsw+0x3a0>
+  DB  196,226,125,24,45,214,43,0,0        ; vbroadcastss  0x2bd6(%rip),%ymm5        # 58a8 <_sk_callback_hsw+0x3a0>
   DB  197,220,89,253                      ; vmulps        %ymm5,%ymm4,%ymm7
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,220,87,228                      ; vxorps        %ymm4,%ymm4,%ymm4
@@ -2653,15 +2645,15 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,190                             ; ja            2cc8 <_sk_load_a8_dst_hsw+0x10>
+  DB  119,190                             ; ja            2cb8 <_sk_load_a8_dst_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,119,0,0,0                 ; lea           0x77(%rip),%r10        # 2d8c <_sk_load_a8_dst_hsw+0xd4>
+  DB  76,141,21,119,0,0,0                 ; lea           0x77(%rip),%r10        # 2d7c <_sk_load_a8_dst_hsw+0xd4>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,159                             ; jmp           2cc8 <_sk_load_a8_dst_hsw+0x10>
+  DB  235,159                             ; jmp           2cb8 <_sk_load_a8_dst_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,2                   ; vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -2669,7 +2661,7 @@
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,119,255,255,255                 ; jmpq          2cc8 <_sk_load_a8_dst_hsw+0x10>
+  DB  233,119,255,255,255                 ; jmpq          2cb8 <_sk_load_a8_dst_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,6                   ; vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -2680,7 +2672,7 @@
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,60,255,255,255                  ; jmpq          2cc8 <_sk_load_a8_dst_hsw+0x10>
+  DB  233,60,255,255,255                  ; jmpq          2cb8 <_sk_load_a8_dst_hsw+0x10>
   DB  146                                 ; xchg          %eax,%edx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -2739,7 +2731,7 @@
   DB  196,227,121,32,192,7                ; vpinsrb       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,49,192                  ; vpmovzxbd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,38,40,0,0         ; vbroadcastss  0x2826(%rip),%ymm1        # 5684 <_sk_callback_hsw+0x3a4>
+  DB  196,226,125,24,13,94,42,0,0         ; vbroadcastss  0x2a5e(%rip),%ymm1        # 58ac <_sk_callback_hsw+0x3a4>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -2751,14 +2743,14 @@
 _sk_store_a8_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,8,40,0,0            ; vbroadcastss  0x2808(%rip),%ymm8        # 5688 <_sk_callback_hsw+0x3a8>
+  DB  196,98,125,24,5,64,42,0,0           ; vbroadcastss  0x2a40(%rip),%ymm8        # 58b0 <_sk_callback_hsw+0x3a8>
   DB  196,65,100,89,192                   ; vmulps        %ymm8,%ymm3,%ymm8
   DB  196,65,125,91,192                   ; vcvtps2dq     %ymm8,%ymm8
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  196,65,57,103,192                   ; vpackuswb     %xmm8,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           2ea9 <_sk_store_a8_hsw+0x37>
+  DB  117,10                              ; jne           2e99 <_sk_store_a8_hsw+0x37>
   DB  196,65,123,17,4,19                  ; vmovsd        %xmm8,(%r11,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2766,25 +2758,25 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            2ea5 <_sk_store_a8_hsw+0x33>
+  DB  119,236                             ; ja            2e95 <_sk_store_a8_hsw+0x33>
   DB  196,66,121,48,192                   ; vpmovzxbw     %xmm8,%xmm8
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,87,0,0,0                  ; lea           0x57(%rip),%r10        # 2f20 <_sk_store_a8_hsw+0xae>
+  DB  76,141,21,87,0,0,0                  ; lea           0x57(%rip),%r10        # 2f10 <_sk_store_a8_hsw+0xae>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,20,4,19,0                ; vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,202                             ; jmp           2ea5 <_sk_store_a8_hsw+0x33>
+  DB  235,202                             ; jmp           2e95 <_sk_store_a8_hsw+0x33>
   DB  196,67,121,20,68,19,2,4             ; vpextrb       $0x4,%xmm8,0x2(%r11,%rdx,1)
-  DB  196,98,57,0,5,52,44,0,0             ; vpshufb       0x2c34(%rip),%xmm8,%xmm8        # 5b20 <_sk_callback_hsw+0x840>
+  DB  196,98,57,0,5,164,47,0,0            ; vpshufb       0x2fa4(%rip),%xmm8,%xmm8        # 5e80 <_sk_callback_hsw+0x978>
   DB  196,67,121,21,4,19,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,176                             ; jmp           2ea5 <_sk_store_a8_hsw+0x33>
+  DB  235,176                             ; jmp           2e95 <_sk_store_a8_hsw+0x33>
   DB  196,67,121,20,68,19,6,12            ; vpextrb       $0xc,%xmm8,0x6(%r11,%rdx,1)
   DB  196,67,121,20,68,19,5,10            ; vpextrb       $0xa,%xmm8,0x5(%r11,%rdx,1)
   DB  196,67,121,20,68,19,4,8             ; vpextrb       $0x8,%xmm8,0x4(%r11,%rdx,1)
-  DB  196,98,57,0,5,26,44,0,0             ; vpshufb       0x2c1a(%rip),%xmm8,%xmm8        # 5b30 <_sk_callback_hsw+0x850>
+  DB  196,98,57,0,5,138,47,0,0            ; vpshufb       0x2f8a(%rip),%xmm8,%xmm8        # 5e90 <_sk_callback_hsw+0x988>
   DB  196,65,121,126,4,19                 ; vmovd         %xmm8,(%r11,%rdx,1)
-  DB  235,135                             ; jmp           2ea5 <_sk_store_a8_hsw+0x33>
+  DB  235,135                             ; jmp           2e95 <_sk_store_a8_hsw+0x33>
   DB  102,144                             ; xchg          %ax,%ax
   DB  178,255                             ; mov           $0xff,%dl
   DB  255                                 ; (bad)
@@ -2811,15 +2803,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,57                              ; jne           2f7f <_sk_load_g8_hsw+0x43>
+  DB  117,57                              ; jne           2f6f <_sk_load_g8_hsw+0x43>
   DB  196,194,121,48,4,19                 ; vpmovzxbw     (%r11,%rdx,1),%xmm0
-  DB  197,249,219,5,236,43,0,0            ; vpand         0x2bec(%rip),%xmm0,%xmm0        # 5b40 <_sk_callback_hsw+0x860>
+  DB  197,249,219,5,92,47,0,0             ; vpand         0x2f5c(%rip),%xmm0,%xmm0        # 5ea0 <_sk_callback_hsw+0x998>
   DB  196,226,125,51,192                  ; vpmovzxwd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,38,39,0,0         ; vbroadcastss  0x2726(%rip),%ymm1        # 568c <_sk_callback_hsw+0x3ac>
+  DB  196,226,125,24,13,94,41,0,0         ; vbroadcastss  0x295e(%rip),%ymm1        # 58b4 <_sk_callback_hsw+0x3ac>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,27,39,0,0         ; vbroadcastss  0x271b(%rip),%ymm3        # 5690 <_sk_callback_hsw+0x3b0>
+  DB  196,226,125,24,29,83,41,0,0         ; vbroadcastss  0x2953(%rip),%ymm3        # 58b8 <_sk_callback_hsw+0x3b0>
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  255,224                             ; jmpq          *%rax
@@ -2828,15 +2820,15 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,185                             ; ja            2f4c <_sk_load_g8_hsw+0x10>
+  DB  119,185                             ; ja            2f3c <_sk_load_g8_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 3018 <_sk_load_g8_hsw+0xdc>
+  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 3008 <_sk_load_g8_hsw+0xdc>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,154                             ; jmp           2f4c <_sk_load_g8_hsw+0x10>
+  DB  235,154                             ; jmp           2f3c <_sk_load_g8_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,2                   ; vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -2844,7 +2836,7 @@
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,114,255,255,255                 ; jmpq          2f4c <_sk_load_g8_hsw+0x10>
+  DB  233,114,255,255,255                 ; jmpq          2f3c <_sk_load_g8_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,6                   ; vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -2855,7 +2847,7 @@
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,55,255,255,255                  ; jmpq          2f4c <_sk_load_g8_hsw+0x10>
+  DB  233,55,255,255,255                  ; jmpq          2f3c <_sk_load_g8_hsw+0x10>
   DB  15,31,0                             ; nopl          (%rax)
   DB  143                                 ; (bad)
   DB  255                                 ; (bad)
@@ -2882,15 +2874,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,57                              ; jne           3077 <_sk_load_g8_dst_hsw+0x43>
+  DB  117,57                              ; jne           3067 <_sk_load_g8_dst_hsw+0x43>
   DB  196,194,121,48,36,19                ; vpmovzxbw     (%r11,%rdx,1),%xmm4
-  DB  197,217,219,37,4,43,0,0             ; vpand         0x2b04(%rip),%xmm4,%xmm4        # 5b50 <_sk_callback_hsw+0x870>
+  DB  197,217,219,37,116,46,0,0           ; vpand         0x2e74(%rip),%xmm4,%xmm4        # 5eb0 <_sk_callback_hsw+0x9a8>
   DB  196,226,125,51,228                  ; vpmovzxwd     %xmm4,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,54,38,0,0         ; vbroadcastss  0x2636(%rip),%ymm5        # 5694 <_sk_callback_hsw+0x3b4>
+  DB  196,226,125,24,45,110,40,0,0        ; vbroadcastss  0x286e(%rip),%ymm5        # 58bc <_sk_callback_hsw+0x3b4>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,61,43,38,0,0         ; vbroadcastss  0x262b(%rip),%ymm7        # 5698 <_sk_callback_hsw+0x3b8>
+  DB  196,226,125,24,61,99,40,0,0         ; vbroadcastss  0x2863(%rip),%ymm7        # 58c0 <_sk_callback_hsw+0x3b8>
   DB  197,252,40,236                      ; vmovaps       %ymm4,%ymm5
   DB  197,252,40,244                      ; vmovaps       %ymm4,%ymm6
   DB  255,224                             ; jmpq          *%rax
@@ -2899,15 +2891,15 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,185                             ; ja            3044 <_sk_load_g8_dst_hsw+0x10>
+  DB  119,185                             ; ja            3034 <_sk_load_g8_dst_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 3110 <_sk_load_g8_dst_hsw+0xdc>
+  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 3100 <_sk_load_g8_dst_hsw+0xdc>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,154                             ; jmp           3044 <_sk_load_g8_dst_hsw+0x10>
+  DB  235,154                             ; jmp           3034 <_sk_load_g8_dst_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,2                   ; vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -2915,7 +2907,7 @@
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,114,255,255,255                 ; jmpq          3044 <_sk_load_g8_dst_hsw+0x10>
+  DB  233,114,255,255,255                 ; jmpq          3034 <_sk_load_g8_dst_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,6                   ; vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -2926,7 +2918,7 @@
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,55,255,255,255                  ; jmpq          3044 <_sk_load_g8_dst_hsw+0x10>
+  DB  233,55,255,255,255                  ; jmpq          3034 <_sk_load_g8_dst_hsw+0x10>
   DB  15,31,0                             ; nopl          (%rax)
   DB  143                                 ; (bad)
   DB  255                                 ; (bad)
@@ -2986,10 +2978,10 @@
   DB  196,227,121,32,192,7                ; vpinsrb       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,49,192                  ; vpmovzxbd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,186,36,0,0        ; vbroadcastss  0x24ba(%rip),%ymm1        # 569c <_sk_callback_hsw+0x3bc>
+  DB  196,226,125,24,13,242,38,0,0        ; vbroadcastss  0x26f2(%rip),%ymm1        # 58c4 <_sk_callback_hsw+0x3bc>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,175,36,0,0        ; vbroadcastss  0x24af(%rip),%ymm3        # 56a0 <_sk_callback_hsw+0x3c0>
+  DB  196,226,125,24,29,231,38,0,0        ; vbroadcastss  0x26e7(%rip),%ymm3        # 58c8 <_sk_callback_hsw+0x3c0>
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  255,224                             ; jmpq          *%rax
@@ -2999,9 +2991,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,193                          ; mov           %rax,%r9
   DB  77,133,201                          ; test          %r9,%r9
-  DB  116,5                               ; je            320a <_sk_gather_i8_hsw+0xf>
+  DB  116,5                               ; je            31fa <_sk_gather_i8_hsw+0xf>
   DB  76,137,200                          ; mov           %r9,%rax
-  DB  235,2                               ; jmp           320c <_sk_gather_i8_hsw+0x11>
+  DB  235,2                               ; jmp           31fc <_sk_gather_i8_hsw+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  83                                  ; push          %rbx
   DB  76,139,16                           ; mov           (%rax),%r10
@@ -3035,14 +3027,14 @@
   DB  73,139,65,8                         ; mov           0x8(%r9),%rax
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,226,117,144,28,128              ; vpgatherdd    %ymm1,(%rax,%ymm0,4),%ymm3
-  DB  197,229,219,5,143,38,0,0            ; vpand         0x268f(%rip),%ymm3,%ymm0        # 5940 <_sk_callback_hsw+0x660>
+  DB  197,229,219,5,223,40,0,0            ; vpand         0x28df(%rip),%ymm3,%ymm0        # 5b80 <_sk_callback_hsw+0x678>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,230,35,0,0          ; vbroadcastss  0x23e6(%rip),%ymm8        # 56a4 <_sk_callback_hsw+0x3c4>
+  DB  196,98,125,24,5,30,38,0,0           ; vbroadcastss  0x261e(%rip),%ymm8        # 58cc <_sk_callback_hsw+0x3c4>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,226,101,0,13,148,38,0,0         ; vpshufb       0x2694(%rip),%ymm3,%ymm1        # 5960 <_sk_callback_hsw+0x680>
+  DB  196,226,101,0,13,228,40,0,0         ; vpshufb       0x28e4(%rip),%ymm3,%ymm1        # 5ba0 <_sk_callback_hsw+0x698>
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,226,101,0,21,162,38,0,0         ; vpshufb       0x26a2(%rip),%ymm3,%ymm2        # 5980 <_sk_callback_hsw+0x6a0>
+  DB  196,226,101,0,21,242,40,0,0         ; vpshufb       0x28f2(%rip),%ymm3,%ymm2        # 5bc0 <_sk_callback_hsw+0x6b8>
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -3057,53 +3049,53 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,114                             ; jne           3376 <_sk_load_565_hsw+0x7c>
+  DB  117,114                             ; jne           3366 <_sk_load_565_hsw+0x7c>
   DB  196,193,122,111,4,83                ; vmovdqu       (%r11,%rdx,2),%xmm0
   DB  196,226,125,51,208                  ; vpmovzxwd     %xmm0,%ymm2
-  DB  196,226,125,88,5,144,35,0,0         ; vpbroadcastd  0x2390(%rip),%ymm0        # 56a8 <_sk_callback_hsw+0x3c8>
+  DB  196,226,125,88,5,200,37,0,0         ; vpbroadcastd  0x25c8(%rip),%ymm0        # 58d0 <_sk_callback_hsw+0x3c8>
   DB  197,237,219,192                     ; vpand         %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,131,35,0,0        ; vbroadcastss  0x2383(%rip),%ymm1        # 56ac <_sk_callback_hsw+0x3cc>
+  DB  196,226,125,24,13,187,37,0,0        ; vbroadcastss  0x25bb(%rip),%ymm1        # 58d4 <_sk_callback_hsw+0x3cc>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,122,35,0,0        ; vpbroadcastd  0x237a(%rip),%ymm1        # 56b0 <_sk_callback_hsw+0x3d0>
+  DB  196,226,125,88,13,178,37,0,0        ; vpbroadcastd  0x25b2(%rip),%ymm1        # 58d8 <_sk_callback_hsw+0x3d0>
   DB  197,237,219,201                     ; vpand         %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,109,35,0,0        ; vbroadcastss  0x236d(%rip),%ymm3        # 56b4 <_sk_callback_hsw+0x3d4>
+  DB  196,226,125,24,29,165,37,0,0        ; vbroadcastss  0x25a5(%rip),%ymm3        # 58dc <_sk_callback_hsw+0x3d4>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,88,29,100,35,0,0        ; vpbroadcastd  0x2364(%rip),%ymm3        # 56b8 <_sk_callback_hsw+0x3d8>
+  DB  196,226,125,88,29,156,37,0,0        ; vpbroadcastd  0x259c(%rip),%ymm3        # 58e0 <_sk_callback_hsw+0x3d8>
   DB  197,237,219,211                     ; vpand         %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,87,35,0,0         ; vbroadcastss  0x2357(%rip),%ymm3        # 56bc <_sk_callback_hsw+0x3dc>
+  DB  196,226,125,24,29,143,37,0,0        ; vbroadcastss  0x258f(%rip),%ymm3        # 58e4 <_sk_callback_hsw+0x3dc>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,76,35,0,0         ; vbroadcastss  0x234c(%rip),%ymm3        # 56c0 <_sk_callback_hsw+0x3e0>
+  DB  196,226,125,24,29,132,37,0,0        ; vbroadcastss  0x2584(%rip),%ymm3        # 58e8 <_sk_callback_hsw+0x3e0>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,128                             ; ja            330a <_sk_load_565_hsw+0x10>
+  DB  119,128                             ; ja            32fa <_sk_load_565_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 33f8 <_sk_load_565_hsw+0xfe>
+  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 33e8 <_sk_load_565_hsw+0xfe>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  233,94,255,255,255                  ; jmpq          330a <_sk_load_565_hsw+0x10>
+  DB  233,94,255,255,255                  ; jmpq          32fa <_sk_load_565_hsw+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,110,12,83               ; vmovd         (%r11,%rdx,2),%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,65,255,255,255                  ; jmpq          330a <_sk_load_565_hsw+0x10>
+  DB  233,65,255,255,255                  ; jmpq          32fa <_sk_load_565_hsw+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,122,126,12,83               ; vmovq         (%r11,%rdx,2),%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,20,255,255,255                  ; jmpq          330a <_sk_load_565_hsw+0x10>
+  DB  233,20,255,255,255                  ; jmpq          32fa <_sk_load_565_hsw+0x10>
   DB  102,144                             ; xchg          %ax,%ax
   DB  166                                 ; cmpsb         %es:(%rdi),%ds:(%rsi)
   DB  255                                 ; (bad)
@@ -3129,53 +3121,53 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,114                             ; jne           3490 <_sk_load_565_dst_hsw+0x7c>
+  DB  117,114                             ; jne           3480 <_sk_load_565_dst_hsw+0x7c>
   DB  196,193,122,111,36,83               ; vmovdqu       (%r11,%rdx,2),%xmm4
   DB  196,226,125,51,244                  ; vpmovzxwd     %xmm4,%ymm6
-  DB  196,226,125,88,37,146,34,0,0        ; vpbroadcastd  0x2292(%rip),%ymm4        # 56c4 <_sk_callback_hsw+0x3e4>
+  DB  196,226,125,88,37,202,36,0,0        ; vpbroadcastd  0x24ca(%rip),%ymm4        # 58ec <_sk_callback_hsw+0x3e4>
   DB  197,205,219,228                     ; vpand         %ymm4,%ymm6,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,133,34,0,0        ; vbroadcastss  0x2285(%rip),%ymm5        # 56c8 <_sk_callback_hsw+0x3e8>
+  DB  196,226,125,24,45,189,36,0,0        ; vbroadcastss  0x24bd(%rip),%ymm5        # 58f0 <_sk_callback_hsw+0x3e8>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
-  DB  196,226,125,88,45,124,34,0,0        ; vpbroadcastd  0x227c(%rip),%ymm5        # 56cc <_sk_callback_hsw+0x3ec>
+  DB  196,226,125,88,45,180,36,0,0        ; vpbroadcastd  0x24b4(%rip),%ymm5        # 58f4 <_sk_callback_hsw+0x3ec>
   DB  197,205,219,237                     ; vpand         %ymm5,%ymm6,%ymm5
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,226,125,24,61,111,34,0,0        ; vbroadcastss  0x226f(%rip),%ymm7        # 56d0 <_sk_callback_hsw+0x3f0>
+  DB  196,226,125,24,61,167,36,0,0        ; vbroadcastss  0x24a7(%rip),%ymm7        # 58f8 <_sk_callback_hsw+0x3f0>
   DB  197,212,89,239                      ; vmulps        %ymm7,%ymm5,%ymm5
-  DB  196,226,125,88,61,102,34,0,0        ; vpbroadcastd  0x2266(%rip),%ymm7        # 56d4 <_sk_callback_hsw+0x3f4>
+  DB  196,226,125,88,61,158,36,0,0        ; vpbroadcastd  0x249e(%rip),%ymm7        # 58fc <_sk_callback_hsw+0x3f4>
   DB  197,205,219,247                     ; vpand         %ymm7,%ymm6,%ymm6
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
-  DB  196,226,125,24,61,89,34,0,0         ; vbroadcastss  0x2259(%rip),%ymm7        # 56d8 <_sk_callback_hsw+0x3f8>
+  DB  196,226,125,24,61,145,36,0,0        ; vbroadcastss  0x2491(%rip),%ymm7        # 5900 <_sk_callback_hsw+0x3f8>
   DB  197,204,89,247                      ; vmulps        %ymm7,%ymm6,%ymm6
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,61,78,34,0,0         ; vbroadcastss  0x224e(%rip),%ymm7        # 56dc <_sk_callback_hsw+0x3fc>
+  DB  196,226,125,24,61,134,36,0,0        ; vbroadcastss  0x2486(%rip),%ymm7        # 5904 <_sk_callback_hsw+0x3fc>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,128                             ; ja            3424 <_sk_load_565_dst_hsw+0x10>
+  DB  119,128                             ; ja            3414 <_sk_load_565_dst_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3510 <_sk_load_565_dst_hsw+0xfc>
+  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3500 <_sk_load_565_dst_hsw+0xfc>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  233,94,255,255,255                  ; jmpq          3424 <_sk_load_565_dst_hsw+0x10>
+  DB  233,94,255,255,255                  ; jmpq          3414 <_sk_load_565_dst_hsw+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,121,110,44,83               ; vmovd         (%r11,%rdx,2),%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,65,255,255,255                  ; jmpq          3424 <_sk_load_565_dst_hsw+0x10>
+  DB  233,65,255,255,255                  ; jmpq          3414 <_sk_load_565_dst_hsw+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,122,126,44,83               ; vmovq         (%r11,%rdx,2),%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,20,255,255,255                  ; jmpq          3424 <_sk_load_565_dst_hsw+0x10>
+  DB  233,20,255,255,255                  ; jmpq          3414 <_sk_load_565_dst_hsw+0x10>
   DB  168,255                             ; test          $0xff,%al
   DB  255                                 ; (bad)
   DB  255,194                             ; inc           %edx
@@ -3234,34 +3226,34 @@
   DB  67,15,183,4,89                      ; movzwl        (%r9,%r11,2),%eax
   DB  197,249,196,192,7                   ; vpinsrw       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,51,208                  ; vpmovzxwd     %xmm0,%ymm2
-  DB  196,226,125,88,5,3,33,0,0           ; vpbroadcastd  0x2103(%rip),%ymm0        # 56e0 <_sk_callback_hsw+0x400>
+  DB  196,226,125,88,5,59,35,0,0          ; vpbroadcastd  0x233b(%rip),%ymm0        # 5908 <_sk_callback_hsw+0x400>
   DB  197,237,219,192                     ; vpand         %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,246,32,0,0        ; vbroadcastss  0x20f6(%rip),%ymm1        # 56e4 <_sk_callback_hsw+0x404>
+  DB  196,226,125,24,13,46,35,0,0         ; vbroadcastss  0x232e(%rip),%ymm1        # 590c <_sk_callback_hsw+0x404>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,237,32,0,0        ; vpbroadcastd  0x20ed(%rip),%ymm1        # 56e8 <_sk_callback_hsw+0x408>
+  DB  196,226,125,88,13,37,35,0,0         ; vpbroadcastd  0x2325(%rip),%ymm1        # 5910 <_sk_callback_hsw+0x408>
   DB  197,237,219,201                     ; vpand         %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,224,32,0,0        ; vbroadcastss  0x20e0(%rip),%ymm3        # 56ec <_sk_callback_hsw+0x40c>
+  DB  196,226,125,24,29,24,35,0,0         ; vbroadcastss  0x2318(%rip),%ymm3        # 5914 <_sk_callback_hsw+0x40c>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,88,29,215,32,0,0        ; vpbroadcastd  0x20d7(%rip),%ymm3        # 56f0 <_sk_callback_hsw+0x410>
+  DB  196,226,125,88,29,15,35,0,0         ; vpbroadcastd  0x230f(%rip),%ymm3        # 5918 <_sk_callback_hsw+0x410>
   DB  197,237,219,211                     ; vpand         %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,202,32,0,0        ; vbroadcastss  0x20ca(%rip),%ymm3        # 56f4 <_sk_callback_hsw+0x414>
+  DB  196,226,125,24,29,2,35,0,0          ; vbroadcastss  0x2302(%rip),%ymm3        # 591c <_sk_callback_hsw+0x414>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,191,32,0,0        ; vbroadcastss  0x20bf(%rip),%ymm3        # 56f8 <_sk_callback_hsw+0x418>
+  DB  196,226,125,24,29,247,34,0,0        ; vbroadcastss  0x22f7(%rip),%ymm3        # 5920 <_sk_callback_hsw+0x418>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_store_565_hsw
 _sk_store_565_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,179,32,0,0          ; vbroadcastss  0x20b3(%rip),%ymm8        # 56fc <_sk_callback_hsw+0x41c>
+  DB  196,98,125,24,5,235,34,0,0          ; vbroadcastss  0x22eb(%rip),%ymm8        # 5924 <_sk_callback_hsw+0x41c>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,53,114,241,11               ; vpslld        $0xb,%ymm9,%ymm9
-  DB  196,98,125,24,21,158,32,0,0         ; vbroadcastss  0x209e(%rip),%ymm10        # 5700 <_sk_callback_hsw+0x420>
+  DB  196,98,125,24,21,214,34,0,0         ; vbroadcastss  0x22d6(%rip),%ymm10        # 5928 <_sk_callback_hsw+0x420>
   DB  196,65,116,89,210                   ; vmulps        %ymm10,%ymm1,%ymm10
   DB  196,65,125,91,210                   ; vcvtps2dq     %ymm10,%ymm10
   DB  196,193,45,114,242,5                ; vpslld        $0x5,%ymm10,%ymm10
@@ -3272,7 +3264,7 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           36a0 <_sk_store_565_hsw+0x65>
+  DB  117,10                              ; jne           3690 <_sk_store_565_hsw+0x65>
   DB  196,65,122,127,4,83                 ; vmovdqu       %xmm8,(%r11,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3280,22 +3272,22 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            369c <_sk_store_565_hsw+0x61>
+  DB  119,236                             ; ja            368c <_sk_store_565_hsw+0x61>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,69,0,0,0                  ; lea           0x45(%rip),%r10        # 3700 <_sk_store_565_hsw+0xc5>
+  DB  76,141,21,69,0,0,0                  ; lea           0x45(%rip),%r10        # 36f0 <_sk_store_565_hsw+0xc5>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,21,4,83,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  DB  235,207                             ; jmp           369c <_sk_store_565_hsw+0x61>
+  DB  235,207                             ; jmp           368c <_sk_store_565_hsw+0x61>
   DB  196,67,121,21,68,83,4,2             ; vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   DB  196,65,121,126,4,83                 ; vmovd         %xmm8,(%r11,%rdx,2)
-  DB  235,191                             ; jmp           369c <_sk_store_565_hsw+0x61>
+  DB  235,191                             ; jmp           368c <_sk_store_565_hsw+0x61>
   DB  196,67,121,21,68,83,12,6            ; vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   DB  196,67,121,21,68,83,10,5            ; vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   DB  196,67,121,21,68,83,8,4             ; vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   DB  196,65,121,214,4,83                 ; vmovq         %xmm8,(%r11,%rdx,2)
-  DB  235,159                             ; jmp           369c <_sk_store_565_hsw+0x61>
+  DB  235,159                             ; jmp           368c <_sk_store_565_hsw+0x61>
   DB  15,31,0                             ; nopl          (%rax)
   DB  196                                 ; (bad)
   DB  255                                 ; (bad)
@@ -3326,28 +3318,28 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,138,0,0,0                    ; jne           37b4 <_sk_load_4444_hsw+0x98>
+  DB  15,133,138,0,0,0                    ; jne           37a4 <_sk_load_4444_hsw+0x98>
   DB  196,193,122,111,4,83                ; vmovdqu       (%r11,%rdx,2),%xmm0
   DB  196,226,125,51,216                  ; vpmovzxwd     %xmm0,%ymm3
-  DB  196,226,125,88,5,198,31,0,0         ; vpbroadcastd  0x1fc6(%rip),%ymm0        # 5704 <_sk_callback_hsw+0x424>
+  DB  196,226,125,88,5,254,33,0,0         ; vpbroadcastd  0x21fe(%rip),%ymm0        # 592c <_sk_callback_hsw+0x424>
   DB  197,229,219,192                     ; vpand         %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,185,31,0,0        ; vbroadcastss  0x1fb9(%rip),%ymm1        # 5708 <_sk_callback_hsw+0x428>
+  DB  196,226,125,24,13,241,33,0,0        ; vbroadcastss  0x21f1(%rip),%ymm1        # 5930 <_sk_callback_hsw+0x428>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,176,31,0,0        ; vpbroadcastd  0x1fb0(%rip),%ymm1        # 570c <_sk_callback_hsw+0x42c>
+  DB  196,226,125,88,13,232,33,0,0        ; vpbroadcastd  0x21e8(%rip),%ymm1        # 5934 <_sk_callback_hsw+0x42c>
   DB  197,229,219,201                     ; vpand         %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,163,31,0,0        ; vbroadcastss  0x1fa3(%rip),%ymm2        # 5710 <_sk_callback_hsw+0x430>
+  DB  196,226,125,24,21,219,33,0,0        ; vbroadcastss  0x21db(%rip),%ymm2        # 5938 <_sk_callback_hsw+0x430>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,88,21,154,31,0,0        ; vpbroadcastd  0x1f9a(%rip),%ymm2        # 5714 <_sk_callback_hsw+0x434>
+  DB  196,226,125,88,21,210,33,0,0        ; vpbroadcastd  0x21d2(%rip),%ymm2        # 593c <_sk_callback_hsw+0x434>
   DB  197,229,219,210                     ; vpand         %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,141,31,0,0          ; vbroadcastss  0x1f8d(%rip),%ymm8        # 5718 <_sk_callback_hsw+0x438>
+  DB  196,98,125,24,5,197,33,0,0          ; vbroadcastss  0x21c5(%rip),%ymm8        # 5940 <_sk_callback_hsw+0x438>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,88,5,131,31,0,0          ; vpbroadcastd  0x1f83(%rip),%ymm8        # 571c <_sk_callback_hsw+0x43c>
+  DB  196,98,125,88,5,187,33,0,0          ; vpbroadcastd  0x21bb(%rip),%ymm8        # 5944 <_sk_callback_hsw+0x43c>
   DB  196,193,101,219,216                 ; vpand         %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,117,31,0,0          ; vbroadcastss  0x1f75(%rip),%ymm8        # 5720 <_sk_callback_hsw+0x440>
+  DB  196,98,125,24,5,173,33,0,0          ; vbroadcastss  0x21ad(%rip),%ymm8        # 5948 <_sk_callback_hsw+0x440>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3356,27 +3348,27 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,100,255,255,255              ; ja            3730 <_sk_load_4444_hsw+0x14>
+  DB  15,135,100,255,255,255              ; ja            3720 <_sk_load_4444_hsw+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3838 <_sk_load_4444_hsw+0x11c>
+  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3828 <_sk_load_4444_hsw+0x11c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  233,66,255,255,255                  ; jmpq          3730 <_sk_load_4444_hsw+0x14>
+  DB  233,66,255,255,255                  ; jmpq          3720 <_sk_load_4444_hsw+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,110,12,83               ; vmovd         (%r11,%rdx,2),%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,37,255,255,255                  ; jmpq          3730 <_sk_load_4444_hsw+0x14>
+  DB  233,37,255,255,255                  ; jmpq          3720 <_sk_load_4444_hsw+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,122,126,12,83               ; vmovq         (%r11,%rdx,2),%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,248,254,255,255                 ; jmpq          3730 <_sk_load_4444_hsw+0x14>
+  DB  233,248,254,255,255                 ; jmpq          3720 <_sk_load_4444_hsw+0x14>
   DB  168,255                             ; test          $0xff,%al
   DB  255                                 ; (bad)
   DB  255,194                             ; inc           %edx
@@ -3401,28 +3393,28 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,138,0,0,0                    ; jne           38ec <_sk_load_4444_dst_hsw+0x98>
+  DB  15,133,138,0,0,0                    ; jne           38dc <_sk_load_4444_dst_hsw+0x98>
   DB  196,193,122,111,36,83               ; vmovdqu       (%r11,%rdx,2),%xmm4
   DB  196,226,125,51,252                  ; vpmovzxwd     %xmm4,%ymm7
-  DB  196,226,125,88,37,174,30,0,0        ; vpbroadcastd  0x1eae(%rip),%ymm4        # 5724 <_sk_callback_hsw+0x444>
+  DB  196,226,125,88,37,230,32,0,0        ; vpbroadcastd  0x20e6(%rip),%ymm4        # 594c <_sk_callback_hsw+0x444>
   DB  197,197,219,228                     ; vpand         %ymm4,%ymm7,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,161,30,0,0        ; vbroadcastss  0x1ea1(%rip),%ymm5        # 5728 <_sk_callback_hsw+0x448>
+  DB  196,226,125,24,45,217,32,0,0        ; vbroadcastss  0x20d9(%rip),%ymm5        # 5950 <_sk_callback_hsw+0x448>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
-  DB  196,226,125,88,45,152,30,0,0        ; vpbroadcastd  0x1e98(%rip),%ymm5        # 572c <_sk_callback_hsw+0x44c>
+  DB  196,226,125,88,45,208,32,0,0        ; vpbroadcastd  0x20d0(%rip),%ymm5        # 5954 <_sk_callback_hsw+0x44c>
   DB  197,197,219,237                     ; vpand         %ymm5,%ymm7,%ymm5
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,226,125,24,53,139,30,0,0        ; vbroadcastss  0x1e8b(%rip),%ymm6        # 5730 <_sk_callback_hsw+0x450>
+  DB  196,226,125,24,53,195,32,0,0        ; vbroadcastss  0x20c3(%rip),%ymm6        # 5958 <_sk_callback_hsw+0x450>
   DB  197,212,89,238                      ; vmulps        %ymm6,%ymm5,%ymm5
-  DB  196,226,125,88,53,130,30,0,0        ; vpbroadcastd  0x1e82(%rip),%ymm6        # 5734 <_sk_callback_hsw+0x454>
+  DB  196,226,125,88,53,186,32,0,0        ; vpbroadcastd  0x20ba(%rip),%ymm6        # 595c <_sk_callback_hsw+0x454>
   DB  197,197,219,246                     ; vpand         %ymm6,%ymm7,%ymm6
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
-  DB  196,98,125,24,5,117,30,0,0          ; vbroadcastss  0x1e75(%rip),%ymm8        # 5738 <_sk_callback_hsw+0x458>
+  DB  196,98,125,24,5,173,32,0,0          ; vbroadcastss  0x20ad(%rip),%ymm8        # 5960 <_sk_callback_hsw+0x458>
   DB  196,193,76,89,240                   ; vmulps        %ymm8,%ymm6,%ymm6
-  DB  196,98,125,88,5,107,30,0,0          ; vpbroadcastd  0x1e6b(%rip),%ymm8        # 573c <_sk_callback_hsw+0x45c>
+  DB  196,98,125,88,5,163,32,0,0          ; vpbroadcastd  0x20a3(%rip),%ymm8        # 5964 <_sk_callback_hsw+0x45c>
   DB  196,193,69,219,248                  ; vpand         %ymm8,%ymm7,%ymm7
   DB  197,252,91,255                      ; vcvtdq2ps     %ymm7,%ymm7
-  DB  196,98,125,24,5,93,30,0,0           ; vbroadcastss  0x1e5d(%rip),%ymm8        # 5740 <_sk_callback_hsw+0x460>
+  DB  196,98,125,24,5,149,32,0,0          ; vbroadcastss  0x2095(%rip),%ymm8        # 5968 <_sk_callback_hsw+0x460>
   DB  196,193,68,89,248                   ; vmulps        %ymm8,%ymm7,%ymm7
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3431,27 +3423,27 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,100,255,255,255              ; ja            3868 <_sk_load_4444_dst_hsw+0x14>
+  DB  15,135,100,255,255,255              ; ja            3858 <_sk_load_4444_dst_hsw+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3970 <_sk_load_4444_dst_hsw+0x11c>
+  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3960 <_sk_load_4444_dst_hsw+0x11c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  233,66,255,255,255                  ; jmpq          3868 <_sk_load_4444_dst_hsw+0x14>
+  DB  233,66,255,255,255                  ; jmpq          3858 <_sk_load_4444_dst_hsw+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,121,110,44,83               ; vmovd         (%r11,%rdx,2),%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,37,255,255,255                  ; jmpq          3868 <_sk_load_4444_dst_hsw+0x14>
+  DB  233,37,255,255,255                  ; jmpq          3858 <_sk_load_4444_dst_hsw+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,122,126,44,83               ; vmovq         (%r11,%rdx,2),%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,248,254,255,255                 ; jmpq          3868 <_sk_load_4444_dst_hsw+0x14>
+  DB  233,248,254,255,255                 ; jmpq          3858 <_sk_load_4444_dst_hsw+0x14>
   DB  168,255                             ; test          $0xff,%al
   DB  255                                 ; (bad)
   DB  255,194                             ; inc           %edx
@@ -3510,25 +3502,25 @@
   DB  67,15,183,4,89                      ; movzwl        (%r9,%r11,2),%eax
   DB  197,249,196,192,7                   ; vpinsrw       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,51,216                  ; vpmovzxwd     %xmm0,%ymm3
-  DB  196,226,125,88,5,7,29,0,0           ; vpbroadcastd  0x1d07(%rip),%ymm0        # 5744 <_sk_callback_hsw+0x464>
+  DB  196,226,125,88,5,63,31,0,0          ; vpbroadcastd  0x1f3f(%rip),%ymm0        # 596c <_sk_callback_hsw+0x464>
   DB  197,229,219,192                     ; vpand         %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,250,28,0,0        ; vbroadcastss  0x1cfa(%rip),%ymm1        # 5748 <_sk_callback_hsw+0x468>
+  DB  196,226,125,24,13,50,31,0,0         ; vbroadcastss  0x1f32(%rip),%ymm1        # 5970 <_sk_callback_hsw+0x468>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,241,28,0,0        ; vpbroadcastd  0x1cf1(%rip),%ymm1        # 574c <_sk_callback_hsw+0x46c>
+  DB  196,226,125,88,13,41,31,0,0         ; vpbroadcastd  0x1f29(%rip),%ymm1        # 5974 <_sk_callback_hsw+0x46c>
   DB  197,229,219,201                     ; vpand         %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,228,28,0,0        ; vbroadcastss  0x1ce4(%rip),%ymm2        # 5750 <_sk_callback_hsw+0x470>
+  DB  196,226,125,24,21,28,31,0,0         ; vbroadcastss  0x1f1c(%rip),%ymm2        # 5978 <_sk_callback_hsw+0x470>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,88,21,219,28,0,0        ; vpbroadcastd  0x1cdb(%rip),%ymm2        # 5754 <_sk_callback_hsw+0x474>
+  DB  196,226,125,88,21,19,31,0,0         ; vpbroadcastd  0x1f13(%rip),%ymm2        # 597c <_sk_callback_hsw+0x474>
   DB  197,229,219,210                     ; vpand         %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,206,28,0,0          ; vbroadcastss  0x1cce(%rip),%ymm8        # 5758 <_sk_callback_hsw+0x478>
+  DB  196,98,125,24,5,6,31,0,0            ; vbroadcastss  0x1f06(%rip),%ymm8        # 5980 <_sk_callback_hsw+0x478>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,88,5,196,28,0,0          ; vpbroadcastd  0x1cc4(%rip),%ymm8        # 575c <_sk_callback_hsw+0x47c>
+  DB  196,98,125,88,5,252,30,0,0          ; vpbroadcastd  0x1efc(%rip),%ymm8        # 5984 <_sk_callback_hsw+0x47c>
   DB  196,193,101,219,216                 ; vpand         %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,182,28,0,0          ; vbroadcastss  0x1cb6(%rip),%ymm8        # 5760 <_sk_callback_hsw+0x480>
+  DB  196,98,125,24,5,238,30,0,0          ; vbroadcastss  0x1eee(%rip),%ymm8        # 5988 <_sk_callback_hsw+0x480>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3537,7 +3529,7 @@
 _sk_store_4444_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,163,28,0,0          ; vbroadcastss  0x1ca3(%rip),%ymm8        # 5764 <_sk_callback_hsw+0x484>
+  DB  196,98,125,24,5,219,30,0,0          ; vbroadcastss  0x1edb(%rip),%ymm8        # 598c <_sk_callback_hsw+0x484>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,53,114,241,12               ; vpslld        $0xc,%ymm9,%ymm9
@@ -3555,7 +3547,7 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3b24 <_sk_store_4444_hsw+0x71>
+  DB  117,10                              ; jne           3b14 <_sk_store_4444_hsw+0x71>
   DB  196,65,122,127,4,83                 ; vmovdqu       %xmm8,(%r11,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3563,22 +3555,22 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            3b20 <_sk_store_4444_hsw+0x6d>
+  DB  119,236                             ; ja            3b10 <_sk_store_4444_hsw+0x6d>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,69,0,0,0                  ; lea           0x45(%rip),%r10        # 3b84 <_sk_store_4444_hsw+0xd1>
+  DB  76,141,21,69,0,0,0                  ; lea           0x45(%rip),%r10        # 3b74 <_sk_store_4444_hsw+0xd1>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,21,4,83,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  DB  235,207                             ; jmp           3b20 <_sk_store_4444_hsw+0x6d>
+  DB  235,207                             ; jmp           3b10 <_sk_store_4444_hsw+0x6d>
   DB  196,67,121,21,68,83,4,2             ; vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   DB  196,65,121,126,4,83                 ; vmovd         %xmm8,(%r11,%rdx,2)
-  DB  235,191                             ; jmp           3b20 <_sk_store_4444_hsw+0x6d>
+  DB  235,191                             ; jmp           3b10 <_sk_store_4444_hsw+0x6d>
   DB  196,67,121,21,68,83,12,6            ; vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   DB  196,67,121,21,68,83,10,5            ; vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   DB  196,67,121,21,68,83,8,4             ; vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   DB  196,65,121,214,4,83                 ; vmovq         %xmm8,(%r11,%rdx,2)
-  DB  235,159                             ; jmp           3b20 <_sk_store_4444_hsw+0x6d>
+  DB  235,159                             ; jmp           3b10 <_sk_store_4444_hsw+0x6d>
   DB  15,31,0                             ; nopl          (%rax)
   DB  196                                 ; (bad)
   DB  255                                 ; (bad)
@@ -3611,16 +3603,16 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3c0d <_sk_load_8888_hsw+0x6d>
+  DB  117,88                              ; jne           3bfd <_sk_load_8888_hsw+0x6d>
   DB  196,193,124,16,26                   ; vmovups       (%r10),%ymm3
-  DB  197,228,84,5,222,29,0,0             ; vandps        0x1dde(%rip),%ymm3,%ymm0        # 59a0 <_sk_callback_hsw+0x6c0>
+  DB  197,228,84,5,46,32,0,0              ; vandps        0x202e(%rip),%ymm3,%ymm0        # 5be0 <_sk_callback_hsw+0x6d8>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,153,27,0,0          ; vbroadcastss  0x1b99(%rip),%ymm8        # 5768 <_sk_callback_hsw+0x488>
+  DB  196,98,125,24,5,209,29,0,0          ; vbroadcastss  0x1dd1(%rip),%ymm8        # 5990 <_sk_callback_hsw+0x488>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,226,101,0,13,227,29,0,0         ; vpshufb       0x1de3(%rip),%ymm3,%ymm1        # 59c0 <_sk_callback_hsw+0x6e0>
+  DB  196,226,101,0,13,51,32,0,0          ; vpshufb       0x2033(%rip),%ymm3,%ymm1        # 5c00 <_sk_callback_hsw+0x6f8>
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,226,101,0,21,241,29,0,0         ; vpshufb       0x1df1(%rip),%ymm3,%ymm2        # 59e0 <_sk_callback_hsw+0x700>
+  DB  196,226,101,0,21,65,32,0,0          ; vpshufb       0x2041(%rip),%ymm3,%ymm2        # 5c20 <_sk_callback_hsw+0x718>
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -3637,7 +3629,7 @@
   DB  196,225,249,110,192                 ; vmovq         %rax,%xmm0
   DB  196,226,125,33,192                  ; vpmovsxbd     %xmm0,%ymm0
   DB  196,194,125,44,26                   ; vmaskmovps    (%r10),%ymm0,%ymm3
-  DB  235,135                             ; jmp           3bba <_sk_load_8888_hsw+0x1a>
+  DB  235,135                             ; jmp           3baa <_sk_load_8888_hsw+0x1a>
 
 PUBLIC _sk_load_8888_dst_hsw
 _sk_load_8888_dst_hsw LABEL PROC
@@ -3646,16 +3638,16 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3ca0 <_sk_load_8888_dst_hsw+0x6d>
+  DB  117,88                              ; jne           3c90 <_sk_load_8888_dst_hsw+0x6d>
   DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
-  DB  197,196,84,37,171,29,0,0            ; vandps        0x1dab(%rip),%ymm7,%ymm4        # 5a00 <_sk_callback_hsw+0x720>
+  DB  197,196,84,37,251,31,0,0            ; vandps        0x1ffb(%rip),%ymm7,%ymm4        # 5c40 <_sk_callback_hsw+0x738>
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,98,125,24,5,10,27,0,0           ; vbroadcastss  0x1b0a(%rip),%ymm8        # 576c <_sk_callback_hsw+0x48c>
+  DB  196,98,125,24,5,66,29,0,0           ; vbroadcastss  0x1d42(%rip),%ymm8        # 5994 <_sk_callback_hsw+0x48c>
   DB  196,193,92,89,224                   ; vmulps        %ymm8,%ymm4,%ymm4
-  DB  196,226,69,0,45,176,29,0,0          ; vpshufb       0x1db0(%rip),%ymm7,%ymm5        # 5a20 <_sk_callback_hsw+0x740>
+  DB  196,226,69,0,45,0,32,0,0            ; vpshufb       0x2000(%rip),%ymm7,%ymm5        # 5c60 <_sk_callback_hsw+0x758>
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
   DB  196,193,84,89,232                   ; vmulps        %ymm8,%ymm5,%ymm5
-  DB  196,226,69,0,53,190,29,0,0          ; vpshufb       0x1dbe(%rip),%ymm7,%ymm6        # 5a40 <_sk_callback_hsw+0x760>
+  DB  196,226,69,0,53,14,32,0,0           ; vpshufb       0x200e(%rip),%ymm7,%ymm6        # 5c80 <_sk_callback_hsw+0x778>
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
   DB  196,193,76,89,240                   ; vmulps        %ymm8,%ymm6,%ymm6
   DB  197,197,114,215,24                  ; vpsrld        $0x18,%ymm7,%ymm7
@@ -3672,7 +3664,7 @@
   DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
   DB  196,226,125,33,228                  ; vpmovsxbd     %xmm4,%ymm4
   DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
-  DB  235,135                             ; jmp           3c4d <_sk_load_8888_dst_hsw+0x1a>
+  DB  235,135                             ; jmp           3c3d <_sk_load_8888_dst_hsw+0x1a>
 
 PUBLIC _sk_gather_8888_hsw
 _sk_gather_8888_hsw LABEL PROC
@@ -3685,14 +3677,14 @@
   DB  197,245,254,192                     ; vpaddd        %ymm0,%ymm1,%ymm0
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,194,117,144,28,129              ; vpgatherdd    %ymm1,(%r9,%ymm0,4),%ymm3
-  DB  197,229,219,5,108,29,0,0            ; vpand         0x1d6c(%rip),%ymm3,%ymm0        # 5a60 <_sk_callback_hsw+0x780>
+  DB  197,229,219,5,188,31,0,0            ; vpand         0x1fbc(%rip),%ymm3,%ymm0        # 5ca0 <_sk_callback_hsw+0x798>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,111,26,0,0          ; vbroadcastss  0x1a6f(%rip),%ymm8        # 5770 <_sk_callback_hsw+0x490>
+  DB  196,98,125,24,5,167,28,0,0          ; vbroadcastss  0x1ca7(%rip),%ymm8        # 5998 <_sk_callback_hsw+0x490>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,226,101,0,13,113,29,0,0         ; vpshufb       0x1d71(%rip),%ymm3,%ymm1        # 5a80 <_sk_callback_hsw+0x7a0>
+  DB  196,226,101,0,13,193,31,0,0         ; vpshufb       0x1fc1(%rip),%ymm3,%ymm1        # 5cc0 <_sk_callback_hsw+0x7b8>
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,226,101,0,21,127,29,0,0         ; vpshufb       0x1d7f(%rip),%ymm3,%ymm2        # 5aa0 <_sk_callback_hsw+0x7c0>
+  DB  196,226,101,0,21,207,31,0,0         ; vpshufb       0x1fcf(%rip),%ymm3,%ymm2        # 5ce0 <_sk_callback_hsw+0x7d8>
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -3707,7 +3699,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
-  DB  196,98,125,24,5,31,26,0,0           ; vbroadcastss  0x1a1f(%rip),%ymm8        # 5774 <_sk_callback_hsw+0x494>
+  DB  196,98,125,24,5,87,28,0,0           ; vbroadcastss  0x1c57(%rip),%ymm8        # 599c <_sk_callback_hsw+0x494>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,65,116,89,208                   ; vmulps        %ymm8,%ymm1,%ymm10
@@ -3723,7 +3715,7 @@
   DB  196,65,45,235,192                   ; vpor          %ymm8,%ymm10,%ymm8
   DB  196,65,53,235,192                   ; vpor          %ymm8,%ymm9,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,12                              ; jne           3daf <_sk_store_8888_hsw+0x73>
+  DB  117,12                              ; jne           3d9f <_sk_store_8888_hsw+0x73>
   DB  196,65,124,17,2                     ; vmovups       %ymm8,(%r10)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -3736,14 +3728,148 @@
   DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
   DB  196,66,125,33,201                   ; vpmovsxbd     %xmm9,%ymm9
   DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
-  DB  235,211                             ; jmp           3da8 <_sk_store_8888_hsw+0x6c>
+  DB  235,211                             ; jmp           3d98 <_sk_store_8888_hsw+0x6c>
+
+PUBLIC _sk_load_bgra_hsw
+_sk_load_bgra_hsw LABEL PROC
+  DB  73,137,201                          ; mov           %rcx,%r9
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
+  DB  76,3,16                             ; add           (%rax),%r10
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,88                              ; jne           3e32 <_sk_load_bgra_hsw+0x6d>
+  DB  196,193,124,16,26                   ; vmovups       (%r10),%ymm3
+  DB  197,228,84,5,25,31,0,0              ; vandps        0x1f19(%rip),%ymm3,%ymm0        # 5d00 <_sk_callback_hsw+0x7f8>
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,98,125,24,5,172,27,0,0          ; vbroadcastss  0x1bac(%rip),%ymm8        # 59a0 <_sk_callback_hsw+0x498>
+  DB  196,193,124,89,208                  ; vmulps        %ymm8,%ymm0,%ymm2
+  DB  196,226,101,0,5,30,31,0,0           ; vpshufb       0x1f1e(%rip),%ymm3,%ymm0        # 5d20 <_sk_callback_hsw+0x818>
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,193,124,89,200                  ; vmulps        %ymm8,%ymm0,%ymm1
+  DB  196,226,101,0,5,44,31,0,0           ; vpshufb       0x1f2c(%rip),%ymm3,%ymm0        # 5d40 <_sk_callback_hsw+0x838>
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
+  DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
+  DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
+  DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,137,201                          ; mov           %r9,%rcx
+  DB  255,224                             ; jmpq          *%rax
+  DB  185,8,0,0,0                         ; mov           $0x8,%ecx
+  DB  68,41,193                           ; sub           %r8d,%ecx
+  DB  192,225,3                           ; shl           $0x3,%cl
+  DB  72,199,192,255,255,255,255          ; mov           $0xffffffffffffffff,%rax
+  DB  72,211,232                          ; shr           %cl,%rax
+  DB  196,225,249,110,192                 ; vmovq         %rax,%xmm0
+  DB  196,226,125,33,192                  ; vpmovsxbd     %xmm0,%ymm0
+  DB  196,194,125,44,26                   ; vmaskmovps    (%r10),%ymm0,%ymm3
+  DB  235,135                             ; jmp           3ddf <_sk_load_bgra_hsw+0x1a>
+
+PUBLIC _sk_load_bgra_dst_hsw
+_sk_load_bgra_dst_hsw LABEL PROC
+  DB  73,137,201                          ; mov           %rcx,%r9
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
+  DB  76,3,16                             ; add           (%rax),%r10
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,88                              ; jne           3ec5 <_sk_load_bgra_dst_hsw+0x6d>
+  DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
+  DB  197,196,84,37,230,30,0,0            ; vandps        0x1ee6(%rip),%ymm7,%ymm4        # 5d60 <_sk_callback_hsw+0x858>
+  DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
+  DB  196,98,125,24,5,29,27,0,0           ; vbroadcastss  0x1b1d(%rip),%ymm8        # 59a4 <_sk_callback_hsw+0x49c>
+  DB  196,193,92,89,240                   ; vmulps        %ymm8,%ymm4,%ymm6
+  DB  196,226,69,0,37,235,30,0,0          ; vpshufb       0x1eeb(%rip),%ymm7,%ymm4        # 5d80 <_sk_callback_hsw+0x878>
+  DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
+  DB  196,193,92,89,232                   ; vmulps        %ymm8,%ymm4,%ymm5
+  DB  196,226,69,0,37,249,30,0,0          ; vpshufb       0x1ef9(%rip),%ymm7,%ymm4        # 5da0 <_sk_callback_hsw+0x898>
+  DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
+  DB  196,193,92,89,224                   ; vmulps        %ymm8,%ymm4,%ymm4
+  DB  197,197,114,215,24                  ; vpsrld        $0x18,%ymm7,%ymm7
+  DB  197,252,91,255                      ; vcvtdq2ps     %ymm7,%ymm7
+  DB  196,193,68,89,248                   ; vmulps        %ymm8,%ymm7,%ymm7
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,137,201                          ; mov           %r9,%rcx
+  DB  255,224                             ; jmpq          *%rax
+  DB  185,8,0,0,0                         ; mov           $0x8,%ecx
+  DB  68,41,193                           ; sub           %r8d,%ecx
+  DB  192,225,3                           ; shl           $0x3,%cl
+  DB  72,199,192,255,255,255,255          ; mov           $0xffffffffffffffff,%rax
+  DB  72,211,232                          ; shr           %cl,%rax
+  DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
+  DB  196,226,125,33,228                  ; vpmovsxbd     %xmm4,%ymm4
+  DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
+  DB  235,135                             ; jmp           3e72 <_sk_load_bgra_dst_hsw+0x1a>
+
+PUBLIC _sk_gather_bgra_hsw
+_sk_gather_bgra_hsw LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,139,8                            ; mov           (%rax),%r9
+  DB  197,254,91,201                      ; vcvttps2dq    %ymm1,%ymm1
+  DB  196,226,125,88,80,16                ; vpbroadcastd  0x10(%rax),%ymm2
+  DB  196,226,109,64,201                  ; vpmulld       %ymm1,%ymm2,%ymm1
+  DB  197,254,91,192                      ; vcvttps2dq    %ymm0,%ymm0
+  DB  197,245,254,192                     ; vpaddd        %ymm0,%ymm1,%ymm0
+  DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
+  DB  196,194,117,144,28,129              ; vpgatherdd    %ymm1,(%r9,%ymm0,4),%ymm3
+  DB  197,229,219,5,167,30,0,0            ; vpand         0x1ea7(%rip),%ymm3,%ymm0        # 5dc0 <_sk_callback_hsw+0x8b8>
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,98,125,24,5,130,26,0,0          ; vbroadcastss  0x1a82(%rip),%ymm8        # 59a8 <_sk_callback_hsw+0x4a0>
+  DB  196,193,124,89,208                  ; vmulps        %ymm8,%ymm0,%ymm2
+  DB  196,226,101,0,5,172,30,0,0          ; vpshufb       0x1eac(%rip),%ymm3,%ymm0        # 5de0 <_sk_callback_hsw+0x8d8>
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,193,124,89,200                  ; vmulps        %ymm8,%ymm0,%ymm1
+  DB  196,226,101,0,5,186,30,0,0          ; vpshufb       0x1eba(%rip),%ymm3,%ymm0        # 5e00 <_sk_callback_hsw+0x8f8>
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
+  DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
+  DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
+  DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+
+PUBLIC _sk_store_bgra_hsw
+_sk_store_bgra_hsw LABEL PROC
+  DB  73,137,201                          ; mov           %rcx,%r9
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
+  DB  76,3,16                             ; add           (%rax),%r10
+  DB  196,98,125,24,5,50,26,0,0           ; vbroadcastss  0x1a32(%rip),%ymm8        # 59ac <_sk_callback_hsw+0x4a4>
+  DB  196,65,108,89,200                   ; vmulps        %ymm8,%ymm2,%ymm9
+  DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
+  DB  196,65,116,89,208                   ; vmulps        %ymm8,%ymm1,%ymm10
+  DB  196,65,125,91,210                   ; vcvtps2dq     %ymm10,%ymm10
+  DB  196,193,45,114,242,8                ; vpslld        $0x8,%ymm10,%ymm10
+  DB  196,65,45,235,201                   ; vpor          %ymm9,%ymm10,%ymm9
+  DB  196,65,124,89,208                   ; vmulps        %ymm8,%ymm0,%ymm10
+  DB  196,65,125,91,210                   ; vcvtps2dq     %ymm10,%ymm10
+  DB  196,193,45,114,242,16               ; vpslld        $0x10,%ymm10,%ymm10
+  DB  196,65,100,89,192                   ; vmulps        %ymm8,%ymm3,%ymm8
+  DB  196,65,125,91,192                   ; vcvtps2dq     %ymm8,%ymm8
+  DB  196,193,61,114,240,24               ; vpslld        $0x18,%ymm8,%ymm8
+  DB  196,65,45,235,192                   ; vpor          %ymm8,%ymm10,%ymm8
+  DB  196,65,53,235,192                   ; vpor          %ymm8,%ymm9,%ymm8
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,12                              ; jne           3fd4 <_sk_store_bgra_hsw+0x73>
+  DB  196,65,124,17,2                     ; vmovups       %ymm8,(%r10)
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,137,201                          ; mov           %r9,%rcx
+  DB  255,224                             ; jmpq          *%rax
+  DB  185,8,0,0,0                         ; mov           $0x8,%ecx
+  DB  68,41,193                           ; sub           %r8d,%ecx
+  DB  192,225,3                           ; shl           $0x3,%cl
+  DB  72,199,192,255,255,255,255          ; mov           $0xffffffffffffffff,%rax
+  DB  72,211,232                          ; shr           %cl,%rax
+  DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
+  DB  196,66,125,33,201                   ; vpmovsxbd     %xmm9,%ymm9
+  DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
+  DB  235,211                             ; jmp           3fcd <_sk_store_bgra_hsw+0x6c>
 
 PUBLIC _sk_load_f16_hsw
 _sk_load_f16_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,97                              ; jne           3e40 <_sk_load_f16_hsw+0x6b>
+  DB  117,97                              ; jne           4065 <_sk_load_f16_hsw+0x6b>
   DB  197,121,16,4,208                    ; vmovupd       (%rax,%rdx,8),%xmm8
   DB  197,249,16,84,208,16                ; vmovupd       0x10(%rax,%rdx,8),%xmm2
   DB  197,249,16,92,208,32                ; vmovupd       0x20(%rax,%rdx,8),%xmm3
@@ -3769,36 +3895,36 @@
   DB  197,123,16,4,208                    ; vmovsd        (%rax,%rdx,8),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,79                              ; je            3e9f <_sk_load_f16_hsw+0xca>
+  DB  116,79                              ; je            40c4 <_sk_load_f16_hsw+0xca>
   DB  197,57,22,68,208,8                  ; vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,67                              ; jb            3e9f <_sk_load_f16_hsw+0xca>
+  DB  114,67                              ; jb            40c4 <_sk_load_f16_hsw+0xca>
   DB  197,251,16,84,208,16                ; vmovsd        0x10(%rax,%rdx,8),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,68                              ; je            3eac <_sk_load_f16_hsw+0xd7>
+  DB  116,68                              ; je            40d1 <_sk_load_f16_hsw+0xd7>
   DB  197,233,22,84,208,24                ; vmovhpd       0x18(%rax,%rdx,8),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,56                              ; jb            3eac <_sk_load_f16_hsw+0xd7>
+  DB  114,56                              ; jb            40d1 <_sk_load_f16_hsw+0xd7>
   DB  197,251,16,92,208,32                ; vmovsd        0x20(%rax,%rdx,8),%xmm3
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,114,255,255,255              ; je            3df6 <_sk_load_f16_hsw+0x21>
+  DB  15,132,114,255,255,255              ; je            401b <_sk_load_f16_hsw+0x21>
   DB  197,225,22,92,208,40                ; vmovhpd       0x28(%rax,%rdx,8),%xmm3,%xmm3
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,98,255,255,255               ; jb            3df6 <_sk_load_f16_hsw+0x21>
+  DB  15,130,98,255,255,255               ; jb            401b <_sk_load_f16_hsw+0x21>
   DB  197,122,126,76,208,48               ; vmovq         0x30(%rax,%rdx,8),%xmm9
-  DB  233,87,255,255,255                  ; jmpq          3df6 <_sk_load_f16_hsw+0x21>
+  DB  233,87,255,255,255                  ; jmpq          401b <_sk_load_f16_hsw+0x21>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,74,255,255,255                  ; jmpq          3df6 <_sk_load_f16_hsw+0x21>
+  DB  233,74,255,255,255                  ; jmpq          401b <_sk_load_f16_hsw+0x21>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,65,255,255,255                  ; jmpq          3df6 <_sk_load_f16_hsw+0x21>
+  DB  233,65,255,255,255                  ; jmpq          401b <_sk_load_f16_hsw+0x21>
 
 PUBLIC _sk_load_f16_dst_hsw
 _sk_load_f16_dst_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,97                              ; jne           3f20 <_sk_load_f16_dst_hsw+0x6b>
+  DB  117,97                              ; jne           4145 <_sk_load_f16_dst_hsw+0x6b>
   DB  197,121,16,4,208                    ; vmovupd       (%rax,%rdx,8),%xmm8
   DB  197,249,16,116,208,16               ; vmovupd       0x10(%rax,%rdx,8),%xmm6
   DB  197,249,16,124,208,32               ; vmovupd       0x20(%rax,%rdx,8),%xmm7
@@ -3824,29 +3950,29 @@
   DB  197,123,16,4,208                    ; vmovsd        (%rax,%rdx,8),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,79                              ; je            3f7f <_sk_load_f16_dst_hsw+0xca>
+  DB  116,79                              ; je            41a4 <_sk_load_f16_dst_hsw+0xca>
   DB  197,57,22,68,208,8                  ; vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,67                              ; jb            3f7f <_sk_load_f16_dst_hsw+0xca>
+  DB  114,67                              ; jb            41a4 <_sk_load_f16_dst_hsw+0xca>
   DB  197,251,16,116,208,16               ; vmovsd        0x10(%rax,%rdx,8),%xmm6
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,68                              ; je            3f8c <_sk_load_f16_dst_hsw+0xd7>
+  DB  116,68                              ; je            41b1 <_sk_load_f16_dst_hsw+0xd7>
   DB  197,201,22,116,208,24               ; vmovhpd       0x18(%rax,%rdx,8),%xmm6,%xmm6
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,56                              ; jb            3f8c <_sk_load_f16_dst_hsw+0xd7>
+  DB  114,56                              ; jb            41b1 <_sk_load_f16_dst_hsw+0xd7>
   DB  197,251,16,124,208,32               ; vmovsd        0x20(%rax,%rdx,8),%xmm7
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,114,255,255,255              ; je            3ed6 <_sk_load_f16_dst_hsw+0x21>
+  DB  15,132,114,255,255,255              ; je            40fb <_sk_load_f16_dst_hsw+0x21>
   DB  197,193,22,124,208,40               ; vmovhpd       0x28(%rax,%rdx,8),%xmm7,%xmm7
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,98,255,255,255               ; jb            3ed6 <_sk_load_f16_dst_hsw+0x21>
+  DB  15,130,98,255,255,255               ; jb            40fb <_sk_load_f16_dst_hsw+0x21>
   DB  197,122,126,76,208,48               ; vmovq         0x30(%rax,%rdx,8),%xmm9
-  DB  233,87,255,255,255                  ; jmpq          3ed6 <_sk_load_f16_dst_hsw+0x21>
+  DB  233,87,255,255,255                  ; jmpq          40fb <_sk_load_f16_dst_hsw+0x21>
   DB  197,193,87,255                      ; vxorpd        %xmm7,%xmm7,%xmm7
   DB  197,201,87,246                      ; vxorpd        %xmm6,%xmm6,%xmm6
-  DB  233,74,255,255,255                  ; jmpq          3ed6 <_sk_load_f16_dst_hsw+0x21>
+  DB  233,74,255,255,255                  ; jmpq          40fb <_sk_load_f16_dst_hsw+0x21>
   DB  197,193,87,255                      ; vxorpd        %xmm7,%xmm7,%xmm7
-  DB  233,65,255,255,255                  ; jmpq          3ed6 <_sk_load_f16_dst_hsw+0x21>
+  DB  233,65,255,255,255                  ; jmpq          40fb <_sk_load_f16_dst_hsw+0x21>
 
 PUBLIC _sk_gather_f16_hsw
 _sk_gather_f16_hsw LABEL PROC
@@ -3900,7 +4026,7 @@
   DB  196,65,57,98,205                    ; vpunpckldq    %xmm13,%xmm8,%xmm9
   DB  196,65,57,106,197                   ; vpunpckhdq    %xmm13,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,27                              ; jne           4084 <_sk_store_f16_hsw+0x65>
+  DB  117,27                              ; jne           42a9 <_sk_store_f16_hsw+0x65>
   DB  197,120,17,28,208                   ; vmovups       %xmm11,(%rax,%rdx,8)
   DB  197,120,17,84,208,16                ; vmovups       %xmm10,0x10(%rax,%rdx,8)
   DB  197,120,17,76,208,32                ; vmovups       %xmm9,0x20(%rax,%rdx,8)
@@ -3909,22 +4035,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  197,121,214,28,208                  ; vmovq         %xmm11,(%rax,%rdx,8)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,241                             ; je            4080 <_sk_store_f16_hsw+0x61>
+  DB  116,241                             ; je            42a5 <_sk_store_f16_hsw+0x61>
   DB  197,121,23,92,208,8                 ; vmovhpd       %xmm11,0x8(%rax,%rdx,8)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,229                             ; jb            4080 <_sk_store_f16_hsw+0x61>
+  DB  114,229                             ; jb            42a5 <_sk_store_f16_hsw+0x61>
   DB  197,121,214,84,208,16               ; vmovq         %xmm10,0x10(%rax,%rdx,8)
-  DB  116,221                             ; je            4080 <_sk_store_f16_hsw+0x61>
+  DB  116,221                             ; je            42a5 <_sk_store_f16_hsw+0x61>
   DB  197,121,23,84,208,24                ; vmovhpd       %xmm10,0x18(%rax,%rdx,8)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,209                             ; jb            4080 <_sk_store_f16_hsw+0x61>
+  DB  114,209                             ; jb            42a5 <_sk_store_f16_hsw+0x61>
   DB  197,121,214,76,208,32               ; vmovq         %xmm9,0x20(%rax,%rdx,8)
-  DB  116,201                             ; je            4080 <_sk_store_f16_hsw+0x61>
+  DB  116,201                             ; je            42a5 <_sk_store_f16_hsw+0x61>
   DB  197,121,23,76,208,40                ; vmovhpd       %xmm9,0x28(%rax,%rdx,8)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,189                             ; jb            4080 <_sk_store_f16_hsw+0x61>
+  DB  114,189                             ; jb            42a5 <_sk_store_f16_hsw+0x61>
   DB  197,121,214,68,208,48               ; vmovq         %xmm8,0x30(%rax,%rdx,8)
-  DB  235,181                             ; jmp           4080 <_sk_store_f16_hsw+0x61>
+  DB  235,181                             ; jmp           42a5 <_sk_store_f16_hsw+0x61>
 
 PUBLIC _sk_load_u16_be_hsw
 _sk_load_u16_be_hsw LABEL PROC
@@ -3932,7 +4058,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,204,0,0,0                    ; jne           41ad <_sk_load_u16_be_hsw+0xe2>
+  DB  15,133,204,0,0,0                    ; jne           43d2 <_sk_load_u16_be_hsw+0xe2>
   DB  196,65,121,16,4,65                  ; vmovupd       (%r9,%rax,2),%xmm8
   DB  196,193,121,16,84,65,16             ; vmovupd       0x10(%r9,%rax,2),%xmm2
   DB  196,193,121,16,92,65,32             ; vmovupd       0x20(%r9,%rax,2),%xmm3
@@ -3951,7 +4077,7 @@
   DB  197,241,235,192                     ; vpor          %xmm0,%xmm1,%xmm0
   DB  196,226,125,51,192                  ; vpmovzxwd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,21,54,22,0,0          ; vbroadcastss  0x1636(%rip),%ymm10        # 5778 <_sk_callback_hsw+0x498>
+  DB  196,98,125,24,21,73,22,0,0          ; vbroadcastss  0x1649(%rip),%ymm10        # 59b0 <_sk_callback_hsw+0x4a8>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,185,109,202                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -3979,29 +4105,29 @@
   DB  196,65,123,16,4,65                  ; vmovsd        (%r9,%rax,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,85                              ; je            4213 <_sk_load_u16_be_hsw+0x148>
+  DB  116,85                              ; je            4438 <_sk_load_u16_be_hsw+0x148>
   DB  196,65,57,22,68,65,8                ; vmovhpd       0x8(%r9,%rax,2),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,72                              ; jb            4213 <_sk_load_u16_be_hsw+0x148>
+  DB  114,72                              ; jb            4438 <_sk_load_u16_be_hsw+0x148>
   DB  196,193,123,16,84,65,16             ; vmovsd        0x10(%r9,%rax,2),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,72                              ; je            4220 <_sk_load_u16_be_hsw+0x155>
+  DB  116,72                              ; je            4445 <_sk_load_u16_be_hsw+0x155>
   DB  196,193,105,22,84,65,24             ; vmovhpd       0x18(%r9,%rax,2),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,59                              ; jb            4220 <_sk_load_u16_be_hsw+0x155>
+  DB  114,59                              ; jb            4445 <_sk_load_u16_be_hsw+0x155>
   DB  196,193,123,16,92,65,32             ; vmovsd        0x20(%r9,%rax,2),%xmm3
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,6,255,255,255                ; je            40fc <_sk_load_u16_be_hsw+0x31>
+  DB  15,132,6,255,255,255                ; je            4321 <_sk_load_u16_be_hsw+0x31>
   DB  196,193,97,22,92,65,40              ; vmovhpd       0x28(%r9,%rax,2),%xmm3,%xmm3
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,245,254,255,255              ; jb            40fc <_sk_load_u16_be_hsw+0x31>
+  DB  15,130,245,254,255,255              ; jb            4321 <_sk_load_u16_be_hsw+0x31>
   DB  196,65,122,126,76,65,48             ; vmovq         0x30(%r9,%rax,2),%xmm9
-  DB  233,233,254,255,255                 ; jmpq          40fc <_sk_load_u16_be_hsw+0x31>
+  DB  233,233,254,255,255                 ; jmpq          4321 <_sk_load_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,220,254,255,255                 ; jmpq          40fc <_sk_load_u16_be_hsw+0x31>
+  DB  233,220,254,255,255                 ; jmpq          4321 <_sk_load_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,211,254,255,255                 ; jmpq          40fc <_sk_load_u16_be_hsw+0x31>
+  DB  233,211,254,255,255                 ; jmpq          4321 <_sk_load_u16_be_hsw+0x31>
 
 PUBLIC _sk_load_rgb_u16_be_hsw
 _sk_load_rgb_u16_be_hsw LABEL PROC
@@ -4009,7 +4135,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,82                         ; lea           (%rdx,%rdx,2),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,204,0,0,0                    ; jne           4307 <_sk_load_rgb_u16_be_hsw+0xde>
+  DB  15,133,204,0,0,0                    ; jne           452c <_sk_load_rgb_u16_be_hsw+0xde>
   DB  196,193,122,111,4,65                ; vmovdqu       (%r9,%rax,2),%xmm0
   DB  196,193,122,111,84,65,12            ; vmovdqu       0xc(%r9,%rax,2),%xmm2
   DB  196,193,122,111,76,65,24            ; vmovdqu       0x18(%r9,%rax,2),%xmm1
@@ -4033,7 +4159,7 @@
   DB  197,241,235,192                     ; vpor          %xmm0,%xmm1,%xmm0
   DB  196,226,125,51,192                  ; vpmovzxwd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,21,199,20,0,0         ; vbroadcastss  0x14c7(%rip),%ymm10        # 577c <_sk_callback_hsw+0x49c>
+  DB  196,98,125,24,21,218,20,0,0         ; vbroadcastss  0x14da(%rip),%ymm10        # 59b4 <_sk_callback_hsw+0x4ac>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,185,109,202                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -4050,48 +4176,48 @@
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,123,20,0,0        ; vbroadcastss  0x147b(%rip),%ymm3        # 5780 <_sk_callback_hsw+0x4a0>
+  DB  196,226,125,24,29,142,20,0,0        ; vbroadcastss  0x148e(%rip),%ymm3        # 59b8 <_sk_callback_hsw+0x4b0>
   DB  255,224                             ; jmpq          *%rax
   DB  196,193,121,110,4,65                ; vmovd         (%r9,%rax,2),%xmm0
   DB  196,193,121,196,68,65,4,2           ; vpinsrw       $0x2,0x4(%r9,%rax,2),%xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,5                               ; jne           4320 <_sk_load_rgb_u16_be_hsw+0xf7>
-  DB  233,79,255,255,255                  ; jmpq          426f <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  117,5                               ; jne           4545 <_sk_load_rgb_u16_be_hsw+0xf7>
+  DB  233,79,255,255,255                  ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
   DB  196,193,121,110,76,65,6             ; vmovd         0x6(%r9,%rax,2),%xmm1
   DB  196,65,113,196,68,65,10,2           ; vpinsrw       $0x2,0xa(%r9,%rax,2),%xmm1,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,26                              ; jb            434f <_sk_load_rgb_u16_be_hsw+0x126>
+  DB  114,26                              ; jb            4574 <_sk_load_rgb_u16_be_hsw+0x126>
   DB  196,193,121,110,76,65,12            ; vmovd         0xc(%r9,%rax,2),%xmm1
   DB  196,193,113,196,84,65,16,2          ; vpinsrw       $0x2,0x10(%r9,%rax,2),%xmm1,%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  117,10                              ; jne           4354 <_sk_load_rgb_u16_be_hsw+0x12b>
-  DB  233,32,255,255,255                  ; jmpq          426f <_sk_load_rgb_u16_be_hsw+0x46>
-  DB  233,27,255,255,255                  ; jmpq          426f <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           4579 <_sk_load_rgb_u16_be_hsw+0x12b>
+  DB  233,32,255,255,255                  ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,27,255,255,255                  ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
   DB  196,193,121,110,76,65,18            ; vmovd         0x12(%r9,%rax,2),%xmm1
   DB  196,65,113,196,76,65,22,2           ; vpinsrw       $0x2,0x16(%r9,%rax,2),%xmm1,%xmm9
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,26                              ; jb            4383 <_sk_load_rgb_u16_be_hsw+0x15a>
+  DB  114,26                              ; jb            45a8 <_sk_load_rgb_u16_be_hsw+0x15a>
   DB  196,193,121,110,76,65,24            ; vmovd         0x18(%r9,%rax,2),%xmm1
   DB  196,193,113,196,76,65,28,2          ; vpinsrw       $0x2,0x1c(%r9,%rax,2),%xmm1,%xmm1
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  117,10                              ; jne           4388 <_sk_load_rgb_u16_be_hsw+0x15f>
-  DB  233,236,254,255,255                 ; jmpq          426f <_sk_load_rgb_u16_be_hsw+0x46>
-  DB  233,231,254,255,255                 ; jmpq          426f <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           45ad <_sk_load_rgb_u16_be_hsw+0x15f>
+  DB  233,236,254,255,255                 ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,231,254,255,255                 ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
   DB  196,193,121,110,92,65,30            ; vmovd         0x1e(%r9,%rax,2),%xmm3
   DB  196,65,97,196,92,65,34,2            ; vpinsrw       $0x2,0x22(%r9,%rax,2),%xmm3,%xmm11
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,20                              ; jb            43b1 <_sk_load_rgb_u16_be_hsw+0x188>
+  DB  114,20                              ; jb            45d6 <_sk_load_rgb_u16_be_hsw+0x188>
   DB  196,193,121,110,92,65,36            ; vmovd         0x24(%r9,%rax,2),%xmm3
   DB  196,193,97,196,92,65,40,2           ; vpinsrw       $0x2,0x28(%r9,%rax,2),%xmm3,%xmm3
-  DB  233,190,254,255,255                 ; jmpq          426f <_sk_load_rgb_u16_be_hsw+0x46>
-  DB  233,185,254,255,255                 ; jmpq          426f <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,190,254,255,255                 ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,185,254,255,255                 ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
 
 PUBLIC _sk_store_u16_be_hsw
 _sk_store_u16_be_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
-  DB  196,98,125,24,5,184,19,0,0          ; vbroadcastss  0x13b8(%rip),%ymm8        # 5784 <_sk_callback_hsw+0x4a4>
+  DB  196,98,125,24,5,203,19,0,0          ; vbroadcastss  0x13cb(%rip),%ymm8        # 59bc <_sk_callback_hsw+0x4b4>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,67,125,25,202,1                 ; vextractf128  $0x1,%ymm9,%xmm10
@@ -4129,7 +4255,7 @@
   DB  196,65,17,98,200                    ; vpunpckldq    %xmm8,%xmm13,%xmm9
   DB  196,65,17,106,192                   ; vpunpckhdq    %xmm8,%xmm13,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,31                              ; jne           44b0 <_sk_store_u16_be_hsw+0xfa>
+  DB  117,31                              ; jne           46d5 <_sk_store_u16_be_hsw+0xfa>
   DB  196,65,120,17,28,65                 ; vmovups       %xmm11,(%r9,%rax,2)
   DB  196,65,120,17,84,65,16              ; vmovups       %xmm10,0x10(%r9,%rax,2)
   DB  196,65,120,17,76,65,32              ; vmovups       %xmm9,0x20(%r9,%rax,2)
@@ -4138,31 +4264,31 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,214,28,65                ; vmovq         %xmm11,(%r9,%rax,2)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            44ac <_sk_store_u16_be_hsw+0xf6>
+  DB  116,240                             ; je            46d1 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,23,92,65,8               ; vmovhpd       %xmm11,0x8(%r9,%rax,2)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            44ac <_sk_store_u16_be_hsw+0xf6>
+  DB  114,227                             ; jb            46d1 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,214,84,65,16             ; vmovq         %xmm10,0x10(%r9,%rax,2)
-  DB  116,218                             ; je            44ac <_sk_store_u16_be_hsw+0xf6>
+  DB  116,218                             ; je            46d1 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,23,84,65,24              ; vmovhpd       %xmm10,0x18(%r9,%rax,2)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,205                             ; jb            44ac <_sk_store_u16_be_hsw+0xf6>
+  DB  114,205                             ; jb            46d1 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,214,76,65,32             ; vmovq         %xmm9,0x20(%r9,%rax,2)
-  DB  116,196                             ; je            44ac <_sk_store_u16_be_hsw+0xf6>
+  DB  116,196                             ; je            46d1 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,23,76,65,40              ; vmovhpd       %xmm9,0x28(%r9,%rax,2)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,183                             ; jb            44ac <_sk_store_u16_be_hsw+0xf6>
+  DB  114,183                             ; jb            46d1 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,214,68,65,48             ; vmovq         %xmm8,0x30(%r9,%rax,2)
-  DB  235,174                             ; jmp           44ac <_sk_store_u16_be_hsw+0xf6>
+  DB  235,174                             ; jmp           46d1 <_sk_store_u16_be_hsw+0xf6>
 
 PUBLIC _sk_load_f32_hsw
 _sk_load_f32_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  119,110                             ; ja            4574 <_sk_load_f32_hsw+0x76>
+  DB  119,110                             ; ja            4799 <_sk_load_f32_hsw+0x76>
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
-  DB  76,141,29,132,0,0,0                 ; lea           0x84(%rip),%r11        # 459c <_sk_load_f32_hsw+0x9e>
+  DB  76,141,29,135,0,0,0                 ; lea           0x87(%rip),%r11        # 47c4 <_sk_load_f32_hsw+0xa1>
   DB  75,99,4,131                         ; movslq        (%r11,%r8,4),%rax
   DB  76,1,216                            ; add           %r11,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -4188,19 +4314,21 @@
   DB  196,193,101,21,216                  ; vunpckhpd     %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
-  DB  133,255                             ; test          %edi,%edi
+  DB  15,31,0                             ; nopl          (%rax)
+  DB  130                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,204                             ; dec           %esp
+  DB  255                                 ; (bad)
+  DB  255,201                             ; dec           %ecx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  191,255,255,255,178                 ; mov           $0xb2ffffff,%edi
+  DB  188,255,255,255,175                 ; mov           $0xafffffff,%esp
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,165,255,255,255,157             ; jmpq          *-0x62000001(%rbp)
+  DB  255,162,255,255,255,154             ; jmpq          *-0x65000001(%rdx)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,149,255,255,255,141             ; callq         *-0x72000001(%rbp)
+  DB  255,146,255,255,255,138             ; callq         *-0x75000001(%rdx)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
@@ -4209,10 +4337,10 @@
 _sk_load_f32_dst_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  119,110                             ; ja            4632 <_sk_load_f32_dst_hsw+0x76>
+  DB  119,110                             ; ja            485a <_sk_load_f32_dst_hsw+0x76>
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
-  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 465c <_sk_load_f32_dst_hsw+0xa0>
+  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 4884 <_sk_load_f32_dst_hsw+0xa0>
   DB  75,99,4,131                         ; movslq        (%r11,%r8,4),%rax
   DB  76,1,216                            ; add           %r11,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -4269,7 +4397,7 @@
   DB  196,65,37,20,196                    ; vunpcklpd     %ymm12,%ymm11,%ymm8
   DB  196,65,37,21,220                    ; vunpckhpd     %ymm12,%ymm11,%ymm11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,55                              ; jne           46e9 <_sk_store_f32_hsw+0x6d>
+  DB  117,55                              ; jne           4911 <_sk_store_f32_hsw+0x6d>
   DB  196,67,45,24,225,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   DB  196,67,61,24,235,1                  ; vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   DB  196,67,45,6,201,49                  ; vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -4282,22 +4410,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,17,20,129                ; vmovupd       %xmm10,(%r9,%rax,4)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            46e5 <_sk_store_f32_hsw+0x69>
+  DB  116,240                             ; je            490d <_sk_store_f32_hsw+0x69>
   DB  196,65,121,17,76,129,16             ; vmovupd       %xmm9,0x10(%r9,%rax,4)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            46e5 <_sk_store_f32_hsw+0x69>
+  DB  114,227                             ; jb            490d <_sk_store_f32_hsw+0x69>
   DB  196,65,121,17,68,129,32             ; vmovupd       %xmm8,0x20(%r9,%rax,4)
-  DB  116,218                             ; je            46e5 <_sk_store_f32_hsw+0x69>
+  DB  116,218                             ; je            490d <_sk_store_f32_hsw+0x69>
   DB  196,65,121,17,92,129,48             ; vmovupd       %xmm11,0x30(%r9,%rax,4)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,205                             ; jb            46e5 <_sk_store_f32_hsw+0x69>
+  DB  114,205                             ; jb            490d <_sk_store_f32_hsw+0x69>
   DB  196,67,125,25,84,129,64,1           ; vextractf128  $0x1,%ymm10,0x40(%r9,%rax,4)
-  DB  116,195                             ; je            46e5 <_sk_store_f32_hsw+0x69>
+  DB  116,195                             ; je            490d <_sk_store_f32_hsw+0x69>
   DB  196,67,125,25,76,129,80,1           ; vextractf128  $0x1,%ymm9,0x50(%r9,%rax,4)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,181                             ; jb            46e5 <_sk_store_f32_hsw+0x69>
+  DB  114,181                             ; jb            490d <_sk_store_f32_hsw+0x69>
   DB  196,67,125,25,68,129,96,1           ; vextractf128  $0x1,%ymm8,0x60(%r9,%rax,4)
-  DB  235,171                             ; jmp           46e5 <_sk_store_f32_hsw+0x69>
+  DB  235,171                             ; jmp           490d <_sk_store_f32_hsw+0x69>
 
 PUBLIC _sk_clamp_x_hsw
 _sk_clamp_x_hsw LABEL PROC
@@ -4360,7 +4488,7 @@
   DB  196,65,124,92,218                   ; vsubps        %ymm10,%ymm0,%ymm11
   DB  196,193,58,88,192                   ; vaddss        %xmm8,%xmm8,%xmm0
   DB  196,98,125,24,192                   ; vbroadcastss  %xmm0,%ymm8
-  DB  197,178,89,5,137,15,0,0             ; vmulss        0xf89(%rip),%xmm9,%xmm0        # 5788 <_sk_callback_hsw+0x4a8>
+  DB  197,178,89,5,153,15,0,0             ; vmulss        0xf99(%rip),%xmm9,%xmm0        # 59c0 <_sk_callback_hsw+0x4b8>
   DB  196,226,125,24,192                  ; vbroadcastss  %xmm0,%ymm0
   DB  197,164,89,192                      ; vmulps        %ymm0,%ymm11,%ymm0
   DB  196,227,125,8,192,1                 ; vroundps      $0x1,%ymm0,%ymm0
@@ -4384,7 +4512,7 @@
   DB  196,65,116,92,218                   ; vsubps        %ymm10,%ymm1,%ymm11
   DB  196,193,58,88,200                   ; vaddss        %xmm8,%xmm8,%xmm1
   DB  196,98,125,24,193                   ; vbroadcastss  %xmm1,%ymm8
-  DB  197,178,89,13,45,15,0,0             ; vmulss        0xf2d(%rip),%xmm9,%xmm1        # 578c <_sk_callback_hsw+0x4ac>
+  DB  197,178,89,13,61,15,0,0             ; vmulss        0xf3d(%rip),%xmm9,%xmm1        # 59c4 <_sk_callback_hsw+0x4bc>
   DB  196,226,125,24,201                  ; vbroadcastss  %xmm1,%ymm1
   DB  197,164,89,201                      ; vmulps        %ymm1,%ymm11,%ymm1
   DB  196,227,125,8,201,1                 ; vroundps      $0x1,%ymm1,%ymm1
@@ -4403,7 +4531,7 @@
 _sk_clamp_x_1_hsw LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  197,188,95,192                      ; vmaxps        %ymm0,%ymm8,%ymm0
-  DB  196,98,125,24,5,230,14,0,0          ; vbroadcastss  0xee6(%rip),%ymm8        # 5790 <_sk_callback_hsw+0x4b0>
+  DB  196,98,125,24,5,246,14,0,0          ; vbroadcastss  0xef6(%rip),%ymm8        # 59c8 <_sk_callback_hsw+0x4c0>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -4417,9 +4545,9 @@
 
 PUBLIC _sk_mirror_x_1_hsw
 _sk_mirror_x_1_hsw LABEL PROC
-  DB  196,98,125,24,5,201,14,0,0          ; vbroadcastss  0xec9(%rip),%ymm8        # 5794 <_sk_callback_hsw+0x4b4>
+  DB  196,98,125,24,5,217,14,0,0          ; vbroadcastss  0xed9(%rip),%ymm8        # 59cc <_sk_callback_hsw+0x4c4>
   DB  196,193,124,88,192                  ; vaddps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,13,191,14,0,0         ; vbroadcastss  0xebf(%rip),%ymm9        # 5798 <_sk_callback_hsw+0x4b8>
+  DB  196,98,125,24,13,207,14,0,0         ; vbroadcastss  0xecf(%rip),%ymm9        # 59d0 <_sk_callback_hsw+0x4c8>
   DB  196,65,124,89,201                   ; vmulps        %ymm9,%ymm0,%ymm9
   DB  196,67,125,8,201,1                  ; vroundps      $0x1,%ymm9,%ymm9
   DB  196,65,52,88,201                    ; vaddps        %ymm9,%ymm9,%ymm9
@@ -4433,11 +4561,11 @@
 
 PUBLIC _sk_luminance_to_alpha_hsw
 _sk_luminance_to_alpha_hsw LABEL PROC
-  DB  196,226,125,24,29,143,14,0,0        ; vbroadcastss  0xe8f(%rip),%ymm3        # 579c <_sk_callback_hsw+0x4bc>
-  DB  196,98,125,24,5,138,14,0,0          ; vbroadcastss  0xe8a(%rip),%ymm8        # 57a0 <_sk_callback_hsw+0x4c0>
+  DB  196,226,125,24,29,159,14,0,0        ; vbroadcastss  0xe9f(%rip),%ymm3        # 59d4 <_sk_callback_hsw+0x4cc>
+  DB  196,98,125,24,5,154,14,0,0          ; vbroadcastss  0xe9a(%rip),%ymm8        # 59d8 <_sk_callback_hsw+0x4d0>
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
   DB  196,226,125,184,203                 ; vfmadd231ps   %ymm3,%ymm0,%ymm1
-  DB  196,226,125,24,29,123,14,0,0        ; vbroadcastss  0xe7b(%rip),%ymm3        # 57a4 <_sk_callback_hsw+0x4c4>
+  DB  196,226,125,24,29,139,14,0,0        ; vbroadcastss  0xe8b(%rip),%ymm3        # 59dc <_sk_callback_hsw+0x4d4>
   DB  196,226,109,168,217                 ; vfmadd213ps   %ymm1,%ymm2,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -4599,9 +4727,9 @@
   DB  76,139,72,8                         ; mov           0x8(%rax),%r9
   DB  77,137,211                          ; mov           %r10,%r11
   DB  73,255,203                          ; dec           %r11
-  DB  120,7                               ; js            4be2 <_sk_evenly_spaced_gradient_hsw+0x19>
+  DB  120,7                               ; js            4e0a <_sk_evenly_spaced_gradient_hsw+0x19>
   DB  196,193,242,42,203                  ; vcvtsi2ss     %r11,%xmm1,%xmm1
-  DB  235,22                              ; jmp           4bf8 <_sk_evenly_spaced_gradient_hsw+0x2f>
+  DB  235,22                              ; jmp           4e20 <_sk_evenly_spaced_gradient_hsw+0x2f>
   DB  76,137,219                          ; mov           %r11,%rbx
   DB  72,209,235                          ; shr           %rbx
   DB  65,131,227,1                        ; and           $0x1,%r11d
@@ -4612,7 +4740,7 @@
   DB  197,244,89,200                      ; vmulps        %ymm0,%ymm1,%ymm1
   DB  197,126,91,217                      ; vcvttps2dq    %ymm1,%ymm11
   DB  73,131,250,8                        ; cmp           $0x8,%r10
-  DB  119,70                              ; ja            4c51 <_sk_evenly_spaced_gradient_hsw+0x88>
+  DB  119,70                              ; ja            4e79 <_sk_evenly_spaced_gradient_hsw+0x88>
   DB  196,66,37,22,1                      ; vpermps       (%r9),%ymm11,%ymm8
   DB  72,139,88,40                        ; mov           0x28(%rax),%rbx
   DB  196,98,37,22,11                     ; vpermps       (%rbx),%ymm11,%ymm9
@@ -4628,7 +4756,7 @@
   DB  196,226,37,22,27                    ; vpermps       (%rbx),%ymm11,%ymm3
   DB  72,139,64,64                        ; mov           0x40(%rax),%rax
   DB  196,98,37,22,40                     ; vpermps       (%rax),%ymm11,%ymm13
-  DB  235,110                             ; jmp           4cbf <_sk_evenly_spaced_gradient_hsw+0xf6>
+  DB  235,110                             ; jmp           4ee7 <_sk_evenly_spaced_gradient_hsw+0xf6>
   DB  196,65,13,118,246                   ; vpcmpeqd      %ymm14,%ymm14,%ymm14
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,2,117,146,4,153                 ; vgatherdps    %ymm1,(%r9,%ymm11,4),%ymm8
@@ -4663,14 +4791,14 @@
 
 PUBLIC _sk_gauss_a_to_rgba_hsw
 _sk_gauss_a_to_rgba_hsw LABEL PROC
-  DB  196,226,125,24,5,195,10,0,0         ; vbroadcastss  0xac3(%rip),%ymm0        # 57a8 <_sk_callback_hsw+0x4c8>
-  DB  196,226,125,24,13,190,10,0,0        ; vbroadcastss  0xabe(%rip),%ymm1        # 57ac <_sk_callback_hsw+0x4cc>
+  DB  196,226,125,24,5,211,10,0,0         ; vbroadcastss  0xad3(%rip),%ymm0        # 59e0 <_sk_callback_hsw+0x4d8>
+  DB  196,226,125,24,13,206,10,0,0        ; vbroadcastss  0xace(%rip),%ymm1        # 59e4 <_sk_callback_hsw+0x4dc>
   DB  196,226,101,168,200                 ; vfmadd213ps   %ymm0,%ymm3,%ymm1
-  DB  196,226,125,24,5,180,10,0,0         ; vbroadcastss  0xab4(%rip),%ymm0        # 57b0 <_sk_callback_hsw+0x4d0>
+  DB  196,226,125,24,5,196,10,0,0         ; vbroadcastss  0xac4(%rip),%ymm0        # 59e8 <_sk_callback_hsw+0x4e0>
   DB  196,226,101,184,193                 ; vfmadd231ps   %ymm1,%ymm3,%ymm0
-  DB  196,226,125,24,13,170,10,0,0        ; vbroadcastss  0xaaa(%rip),%ymm1        # 57b4 <_sk_callback_hsw+0x4d4>
+  DB  196,226,125,24,13,186,10,0,0        ; vbroadcastss  0xaba(%rip),%ymm1        # 59ec <_sk_callback_hsw+0x4e4>
   DB  196,226,101,184,200                 ; vfmadd231ps   %ymm0,%ymm3,%ymm1
-  DB  196,226,125,24,5,160,10,0,0         ; vbroadcastss  0xaa0(%rip),%ymm0        # 57b8 <_sk_callback_hsw+0x4d8>
+  DB  196,226,125,24,5,176,10,0,0         ; vbroadcastss  0xab0(%rip),%ymm0        # 59f0 <_sk_callback_hsw+0x4e8>
   DB  196,226,101,184,193                 ; vfmadd231ps   %ymm1,%ymm3,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
@@ -4683,11 +4811,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  73,131,249,1                        ; cmp           $0x1,%r9
-  DB  15,134,180,0,0,0                    ; jbe           4df0 <_sk_gradient_hsw+0xc3>
+  DB  15,134,180,0,0,0                    ; jbe           5018 <_sk_gradient_hsw+0xc3>
   DB  76,139,80,72                        ; mov           0x48(%rax),%r10
   DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
   DB  65,187,1,0,0,0                      ; mov           $0x1,%r11d
-  DB  196,226,125,24,21,105,10,0,0        ; vbroadcastss  0xa69(%rip),%ymm2        # 57bc <_sk_callback_hsw+0x4dc>
+  DB  196,226,125,24,21,121,10,0,0        ; vbroadcastss  0xa79(%rip),%ymm2        # 59f4 <_sk_callback_hsw+0x4ec>
   DB  196,65,53,239,201                   ; vpxor         %ymm9,%ymm9,%ymm9
   DB  196,130,125,24,28,154               ; vbroadcastss  (%r10,%r11,4),%ymm3
   DB  197,228,194,216,2                   ; vcmpleps      %ymm0,%ymm3,%ymm3
@@ -4695,10 +4823,10 @@
   DB  196,65,101,254,201                  ; vpaddd        %ymm9,%ymm3,%ymm9
   DB  73,255,195                          ; inc           %r11
   DB  77,57,217                           ; cmp           %r11,%r9
-  DB  117,226                             ; jne           4d58 <_sk_gradient_hsw+0x2b>
+  DB  117,226                             ; jne           4f80 <_sk_gradient_hsw+0x2b>
   DB  76,139,80,8                         ; mov           0x8(%rax),%r10
   DB  73,131,249,8                        ; cmp           $0x8,%r9
-  DB  118,121                             ; jbe           4df9 <_sk_gradient_hsw+0xcc>
+  DB  118,121                             ; jbe           5021 <_sk_gradient_hsw+0xcc>
   DB  196,65,13,118,246                   ; vpcmpeqd      %ymm14,%ymm14,%ymm14
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,2,117,146,4,138                 ; vgatherdps    %ymm1,(%r10,%ymm9,4),%ymm8
@@ -4722,7 +4850,7 @@
   DB  196,130,21,146,28,137               ; vgatherdps    %ymm13,(%r9,%ymm9,4),%ymm3
   DB  72,139,64,64                        ; mov           0x40(%rax),%rax
   DB  196,34,13,146,44,136                ; vgatherdps    %ymm14,(%rax,%ymm9,4),%ymm13
-  DB  235,77                              ; jmp           4e3d <_sk_gradient_hsw+0x110>
+  DB  235,77                              ; jmp           5065 <_sk_gradient_hsw+0x110>
   DB  76,139,80,8                         ; mov           0x8(%rax),%r10
   DB  196,65,52,87,201                    ; vxorps        %ymm9,%ymm9,%ymm9
   DB  196,66,53,22,2                      ; vpermps       (%r10),%ymm9,%ymm8
@@ -4778,24 +4906,24 @@
   DB  196,65,52,95,226                    ; vmaxps        %ymm10,%ymm9,%ymm12
   DB  196,65,36,94,220                    ; vdivps        %ymm12,%ymm11,%ymm11
   DB  196,65,36,89,227                    ; vmulps        %ymm11,%ymm11,%ymm12
-  DB  196,98,125,24,45,232,8,0,0          ; vbroadcastss  0x8e8(%rip),%ymm13        # 57c0 <_sk_callback_hsw+0x4e0>
-  DB  196,98,125,24,53,227,8,0,0          ; vbroadcastss  0x8e3(%rip),%ymm14        # 57c4 <_sk_callback_hsw+0x4e4>
+  DB  196,98,125,24,45,248,8,0,0          ; vbroadcastss  0x8f8(%rip),%ymm13        # 59f8 <_sk_callback_hsw+0x4f0>
+  DB  196,98,125,24,53,243,8,0,0          ; vbroadcastss  0x8f3(%rip),%ymm14        # 59fc <_sk_callback_hsw+0x4f4>
   DB  196,66,29,184,245                   ; vfmadd231ps   %ymm13,%ymm12,%ymm14
-  DB  196,98,125,24,45,217,8,0,0          ; vbroadcastss  0x8d9(%rip),%ymm13        # 57c8 <_sk_callback_hsw+0x4e8>
+  DB  196,98,125,24,45,233,8,0,0          ; vbroadcastss  0x8e9(%rip),%ymm13        # 5a00 <_sk_callback_hsw+0x4f8>
   DB  196,66,29,184,238                   ; vfmadd231ps   %ymm14,%ymm12,%ymm13
-  DB  196,98,125,24,53,207,8,0,0          ; vbroadcastss  0x8cf(%rip),%ymm14        # 57cc <_sk_callback_hsw+0x4ec>
+  DB  196,98,125,24,53,223,8,0,0          ; vbroadcastss  0x8df(%rip),%ymm14        # 5a04 <_sk_callback_hsw+0x4fc>
   DB  196,66,29,184,245                   ; vfmadd231ps   %ymm13,%ymm12,%ymm14
   DB  196,65,36,89,222                    ; vmulps        %ymm14,%ymm11,%ymm11
   DB  196,65,52,194,202,1                 ; vcmpltps      %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,21,186,8,0,0          ; vbroadcastss  0x8ba(%rip),%ymm10        # 57d0 <_sk_callback_hsw+0x4f0>
+  DB  196,98,125,24,21,202,8,0,0          ; vbroadcastss  0x8ca(%rip),%ymm10        # 5a08 <_sk_callback_hsw+0x500>
   DB  196,65,44,92,211                    ; vsubps        %ymm11,%ymm10,%ymm10
   DB  196,67,37,74,202,144                ; vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   DB  196,193,124,194,192,1               ; vcmpltps      %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,21,164,8,0,0          ; vbroadcastss  0x8a4(%rip),%ymm10        # 57d4 <_sk_callback_hsw+0x4f4>
+  DB  196,98,125,24,21,180,8,0,0          ; vbroadcastss  0x8b4(%rip),%ymm10        # 5a0c <_sk_callback_hsw+0x504>
   DB  196,65,44,92,209                    ; vsubps        %ymm9,%ymm10,%ymm10
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  196,65,116,194,200,1                ; vcmpltps      %ymm8,%ymm1,%ymm9
-  DB  196,98,125,24,21,142,8,0,0          ; vbroadcastss  0x88e(%rip),%ymm10        # 57d8 <_sk_callback_hsw+0x4f8>
+  DB  196,98,125,24,21,158,8,0,0          ; vbroadcastss  0x89e(%rip),%ymm10        # 5a10 <_sk_callback_hsw+0x508>
   DB  197,44,92,208                       ; vsubps        %ymm0,%ymm10,%ymm10
   DB  196,195,125,74,194,144              ; vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   DB  196,65,124,194,200,3                ; vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -4814,7 +4942,7 @@
 PUBLIC _sk_save_xy_hsw
 _sk_save_xy_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,91,8,0,0            ; vbroadcastss  0x85b(%rip),%ymm8        # 57dc <_sk_callback_hsw+0x4fc>
+  DB  196,98,125,24,5,107,8,0,0           ; vbroadcastss  0x86b(%rip),%ymm8        # 5a14 <_sk_callback_hsw+0x50c>
   DB  196,65,124,88,200                   ; vaddps        %ymm8,%ymm0,%ymm9
   DB  196,67,125,8,209,1                  ; vroundps      $0x1,%ymm9,%ymm10
   DB  196,65,52,92,202                    ; vsubps        %ymm10,%ymm9,%ymm9
@@ -4844,9 +4972,9 @@
 PUBLIC _sk_bilinear_nx_hsw
 _sk_bilinear_nx_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,239,7,0,0          ; vbroadcastss  0x7ef(%rip),%ymm0        # 57e0 <_sk_callback_hsw+0x500>
+  DB  196,226,125,24,5,255,7,0,0          ; vbroadcastss  0x7ff(%rip),%ymm0        # 5a18 <_sk_callback_hsw+0x510>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,230,7,0,0           ; vbroadcastss  0x7e6(%rip),%ymm8        # 57e4 <_sk_callback_hsw+0x504>
+  DB  196,98,125,24,5,246,7,0,0           ; vbroadcastss  0x7f6(%rip),%ymm8        # 5a1c <_sk_callback_hsw+0x514>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4855,7 +4983,7 @@
 PUBLIC _sk_bilinear_px_hsw
 _sk_bilinear_px_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,206,7,0,0          ; vbroadcastss  0x7ce(%rip),%ymm0        # 57e8 <_sk_callback_hsw+0x508>
+  DB  196,226,125,24,5,222,7,0,0          ; vbroadcastss  0x7de(%rip),%ymm0        # 5a20 <_sk_callback_hsw+0x518>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -4865,9 +4993,9 @@
 PUBLIC _sk_bilinear_ny_hsw
 _sk_bilinear_ny_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,178,7,0,0         ; vbroadcastss  0x7b2(%rip),%ymm1        # 57ec <_sk_callback_hsw+0x50c>
+  DB  196,226,125,24,13,194,7,0,0         ; vbroadcastss  0x7c2(%rip),%ymm1        # 5a24 <_sk_callback_hsw+0x51c>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,168,7,0,0           ; vbroadcastss  0x7a8(%rip),%ymm8        # 57f0 <_sk_callback_hsw+0x510>
+  DB  196,98,125,24,5,184,7,0,0           ; vbroadcastss  0x7b8(%rip),%ymm8        # 5a28 <_sk_callback_hsw+0x520>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4876,7 +5004,7 @@
 PUBLIC _sk_bilinear_py_hsw
 _sk_bilinear_py_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,144,7,0,0         ; vbroadcastss  0x790(%rip),%ymm1        # 57f4 <_sk_callback_hsw+0x514>
+  DB  196,226,125,24,13,160,7,0,0         ; vbroadcastss  0x7a0(%rip),%ymm1        # 5a2c <_sk_callback_hsw+0x524>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -4886,13 +5014,13 @@
 PUBLIC _sk_bicubic_n3x_hsw
 _sk_bicubic_n3x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,115,7,0,0          ; vbroadcastss  0x773(%rip),%ymm0        # 57f8 <_sk_callback_hsw+0x518>
+  DB  196,226,125,24,5,131,7,0,0          ; vbroadcastss  0x783(%rip),%ymm0        # 5a30 <_sk_callback_hsw+0x528>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,106,7,0,0           ; vbroadcastss  0x76a(%rip),%ymm8        # 57fc <_sk_callback_hsw+0x51c>
+  DB  196,98,125,24,5,122,7,0,0           ; vbroadcastss  0x77a(%rip),%ymm8        # 5a34 <_sk_callback_hsw+0x52c>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,91,7,0,0           ; vbroadcastss  0x75b(%rip),%ymm10        # 5800 <_sk_callback_hsw+0x520>
-  DB  196,98,125,24,29,86,7,0,0           ; vbroadcastss  0x756(%rip),%ymm11        # 5804 <_sk_callback_hsw+0x524>
+  DB  196,98,125,24,21,107,7,0,0          ; vbroadcastss  0x76b(%rip),%ymm10        # 5a38 <_sk_callback_hsw+0x530>
+  DB  196,98,125,24,29,102,7,0,0          ; vbroadcastss  0x766(%rip),%ymm11        # 5a3c <_sk_callback_hsw+0x534>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,36,89,193                    ; vmulps        %ymm9,%ymm11,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -4902,16 +5030,16 @@
 PUBLIC _sk_bicubic_n1x_hsw
 _sk_bicubic_n1x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,57,7,0,0           ; vbroadcastss  0x739(%rip),%ymm0        # 5808 <_sk_callback_hsw+0x528>
+  DB  196,226,125,24,5,73,7,0,0           ; vbroadcastss  0x749(%rip),%ymm0        # 5a40 <_sk_callback_hsw+0x538>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,48,7,0,0            ; vbroadcastss  0x730(%rip),%ymm8        # 580c <_sk_callback_hsw+0x52c>
+  DB  196,98,125,24,5,64,7,0,0            ; vbroadcastss  0x740(%rip),%ymm8        # 5a44 <_sk_callback_hsw+0x53c>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,38,7,0,0           ; vbroadcastss  0x726(%rip),%ymm9        # 5810 <_sk_callback_hsw+0x530>
-  DB  196,98,125,24,21,33,7,0,0           ; vbroadcastss  0x721(%rip),%ymm10        # 5814 <_sk_callback_hsw+0x534>
+  DB  196,98,125,24,13,54,7,0,0           ; vbroadcastss  0x736(%rip),%ymm9        # 5a48 <_sk_callback_hsw+0x540>
+  DB  196,98,125,24,21,49,7,0,0           ; vbroadcastss  0x731(%rip),%ymm10        # 5a4c <_sk_callback_hsw+0x544>
   DB  196,66,61,168,209                   ; vfmadd213ps   %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,13,23,7,0,0           ; vbroadcastss  0x717(%rip),%ymm9        # 5818 <_sk_callback_hsw+0x538>
+  DB  196,98,125,24,13,39,7,0,0           ; vbroadcastss  0x727(%rip),%ymm9        # 5a50 <_sk_callback_hsw+0x548>
   DB  196,66,61,184,202                   ; vfmadd231ps   %ymm10,%ymm8,%ymm9
-  DB  196,98,125,24,21,13,7,0,0           ; vbroadcastss  0x70d(%rip),%ymm10        # 581c <_sk_callback_hsw+0x53c>
+  DB  196,98,125,24,21,29,7,0,0           ; vbroadcastss  0x71d(%rip),%ymm10        # 5a54 <_sk_callback_hsw+0x54c>
   DB  196,66,61,184,209                   ; vfmadd231ps   %ymm9,%ymm8,%ymm10
   DB  197,124,17,144,128,0,0,0            ; vmovups       %ymm10,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4920,14 +5048,14 @@
 PUBLIC _sk_bicubic_p1x_hsw
 _sk_bicubic_p1x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,245,6,0,0           ; vbroadcastss  0x6f5(%rip),%ymm8        # 5820 <_sk_callback_hsw+0x540>
+  DB  196,98,125,24,5,5,7,0,0             ; vbroadcastss  0x705(%rip),%ymm8        # 5a58 <_sk_callback_hsw+0x550>
   DB  197,188,88,0                        ; vaddps        (%rax),%ymm8,%ymm0
   DB  197,124,16,72,64                    ; vmovups       0x40(%rax),%ymm9
-  DB  196,98,125,24,21,231,6,0,0          ; vbroadcastss  0x6e7(%rip),%ymm10        # 5824 <_sk_callback_hsw+0x544>
-  DB  196,98,125,24,29,226,6,0,0          ; vbroadcastss  0x6e2(%rip),%ymm11        # 5828 <_sk_callback_hsw+0x548>
+  DB  196,98,125,24,21,247,6,0,0          ; vbroadcastss  0x6f7(%rip),%ymm10        # 5a5c <_sk_callback_hsw+0x554>
+  DB  196,98,125,24,29,242,6,0,0          ; vbroadcastss  0x6f2(%rip),%ymm11        # 5a60 <_sk_callback_hsw+0x558>
   DB  196,66,53,168,218                   ; vfmadd213ps   %ymm10,%ymm9,%ymm11
   DB  196,66,53,168,216                   ; vfmadd213ps   %ymm8,%ymm9,%ymm11
-  DB  196,98,125,24,5,211,6,0,0           ; vbroadcastss  0x6d3(%rip),%ymm8        # 582c <_sk_callback_hsw+0x54c>
+  DB  196,98,125,24,5,227,6,0,0           ; vbroadcastss  0x6e3(%rip),%ymm8        # 5a64 <_sk_callback_hsw+0x55c>
   DB  196,66,53,184,195                   ; vfmadd231ps   %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4936,12 +5064,12 @@
 PUBLIC _sk_bicubic_p3x_hsw
 _sk_bicubic_p3x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,187,6,0,0          ; vbroadcastss  0x6bb(%rip),%ymm0        # 5830 <_sk_callback_hsw+0x550>
+  DB  196,226,125,24,5,203,6,0,0          ; vbroadcastss  0x6cb(%rip),%ymm0        # 5a68 <_sk_callback_hsw+0x560>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,168,6,0,0          ; vbroadcastss  0x6a8(%rip),%ymm10        # 5834 <_sk_callback_hsw+0x554>
-  DB  196,98,125,24,29,163,6,0,0          ; vbroadcastss  0x6a3(%rip),%ymm11        # 5838 <_sk_callback_hsw+0x558>
+  DB  196,98,125,24,21,184,6,0,0          ; vbroadcastss  0x6b8(%rip),%ymm10        # 5a6c <_sk_callback_hsw+0x564>
+  DB  196,98,125,24,29,179,6,0,0          ; vbroadcastss  0x6b3(%rip),%ymm11        # 5a70 <_sk_callback_hsw+0x568>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,52,89,195                    ; vmulps        %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -4951,13 +5079,13 @@
 PUBLIC _sk_bicubic_n3y_hsw
 _sk_bicubic_n3y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,134,6,0,0         ; vbroadcastss  0x686(%rip),%ymm1        # 583c <_sk_callback_hsw+0x55c>
+  DB  196,226,125,24,13,150,6,0,0         ; vbroadcastss  0x696(%rip),%ymm1        # 5a74 <_sk_callback_hsw+0x56c>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,124,6,0,0           ; vbroadcastss  0x67c(%rip),%ymm8        # 5840 <_sk_callback_hsw+0x560>
+  DB  196,98,125,24,5,140,6,0,0           ; vbroadcastss  0x68c(%rip),%ymm8        # 5a78 <_sk_callback_hsw+0x570>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,109,6,0,0          ; vbroadcastss  0x66d(%rip),%ymm10        # 5844 <_sk_callback_hsw+0x564>
-  DB  196,98,125,24,29,104,6,0,0          ; vbroadcastss  0x668(%rip),%ymm11        # 5848 <_sk_callback_hsw+0x568>
+  DB  196,98,125,24,21,125,6,0,0          ; vbroadcastss  0x67d(%rip),%ymm10        # 5a7c <_sk_callback_hsw+0x574>
+  DB  196,98,125,24,29,120,6,0,0          ; vbroadcastss  0x678(%rip),%ymm11        # 5a80 <_sk_callback_hsw+0x578>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,36,89,193                    ; vmulps        %ymm9,%ymm11,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -4967,16 +5095,16 @@
 PUBLIC _sk_bicubic_n1y_hsw
 _sk_bicubic_n1y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,75,6,0,0          ; vbroadcastss  0x64b(%rip),%ymm1        # 584c <_sk_callback_hsw+0x56c>
+  DB  196,226,125,24,13,91,6,0,0          ; vbroadcastss  0x65b(%rip),%ymm1        # 5a84 <_sk_callback_hsw+0x57c>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,65,6,0,0            ; vbroadcastss  0x641(%rip),%ymm8        # 5850 <_sk_callback_hsw+0x570>
+  DB  196,98,125,24,5,81,6,0,0            ; vbroadcastss  0x651(%rip),%ymm8        # 5a88 <_sk_callback_hsw+0x580>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,55,6,0,0           ; vbroadcastss  0x637(%rip),%ymm9        # 5854 <_sk_callback_hsw+0x574>
-  DB  196,98,125,24,21,50,6,0,0           ; vbroadcastss  0x632(%rip),%ymm10        # 5858 <_sk_callback_hsw+0x578>
+  DB  196,98,125,24,13,71,6,0,0           ; vbroadcastss  0x647(%rip),%ymm9        # 5a8c <_sk_callback_hsw+0x584>
+  DB  196,98,125,24,21,66,6,0,0           ; vbroadcastss  0x642(%rip),%ymm10        # 5a90 <_sk_callback_hsw+0x588>
   DB  196,66,61,168,209                   ; vfmadd213ps   %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,13,40,6,0,0           ; vbroadcastss  0x628(%rip),%ymm9        # 585c <_sk_callback_hsw+0x57c>
+  DB  196,98,125,24,13,56,6,0,0           ; vbroadcastss  0x638(%rip),%ymm9        # 5a94 <_sk_callback_hsw+0x58c>
   DB  196,66,61,184,202                   ; vfmadd231ps   %ymm10,%ymm8,%ymm9
-  DB  196,98,125,24,21,30,6,0,0           ; vbroadcastss  0x61e(%rip),%ymm10        # 5860 <_sk_callback_hsw+0x580>
+  DB  196,98,125,24,21,46,6,0,0           ; vbroadcastss  0x62e(%rip),%ymm10        # 5a98 <_sk_callback_hsw+0x590>
   DB  196,66,61,184,209                   ; vfmadd231ps   %ymm9,%ymm8,%ymm10
   DB  197,124,17,144,160,0,0,0            ; vmovups       %ymm10,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4985,14 +5113,14 @@
 PUBLIC _sk_bicubic_p1y_hsw
 _sk_bicubic_p1y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,6,6,0,0             ; vbroadcastss  0x606(%rip),%ymm8        # 5864 <_sk_callback_hsw+0x584>
+  DB  196,98,125,24,5,22,6,0,0            ; vbroadcastss  0x616(%rip),%ymm8        # 5a9c <_sk_callback_hsw+0x594>
   DB  197,188,88,72,32                    ; vaddps        0x20(%rax),%ymm8,%ymm1
   DB  197,124,16,72,96                    ; vmovups       0x60(%rax),%ymm9
-  DB  196,98,125,24,21,247,5,0,0          ; vbroadcastss  0x5f7(%rip),%ymm10        # 5868 <_sk_callback_hsw+0x588>
-  DB  196,98,125,24,29,242,5,0,0          ; vbroadcastss  0x5f2(%rip),%ymm11        # 586c <_sk_callback_hsw+0x58c>
+  DB  196,98,125,24,21,7,6,0,0            ; vbroadcastss  0x607(%rip),%ymm10        # 5aa0 <_sk_callback_hsw+0x598>
+  DB  196,98,125,24,29,2,6,0,0            ; vbroadcastss  0x602(%rip),%ymm11        # 5aa4 <_sk_callback_hsw+0x59c>
   DB  196,66,53,168,218                   ; vfmadd213ps   %ymm10,%ymm9,%ymm11
   DB  196,66,53,168,216                   ; vfmadd213ps   %ymm8,%ymm9,%ymm11
-  DB  196,98,125,24,5,227,5,0,0           ; vbroadcastss  0x5e3(%rip),%ymm8        # 5870 <_sk_callback_hsw+0x590>
+  DB  196,98,125,24,5,243,5,0,0           ; vbroadcastss  0x5f3(%rip),%ymm8        # 5aa8 <_sk_callback_hsw+0x5a0>
   DB  196,66,53,184,195                   ; vfmadd231ps   %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -5001,12 +5129,12 @@
 PUBLIC _sk_bicubic_p3y_hsw
 _sk_bicubic_p3y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,203,5,0,0         ; vbroadcastss  0x5cb(%rip),%ymm1        # 5874 <_sk_callback_hsw+0x594>
+  DB  196,226,125,24,13,219,5,0,0         ; vbroadcastss  0x5db(%rip),%ymm1        # 5aac <_sk_callback_hsw+0x5a4>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,183,5,0,0          ; vbroadcastss  0x5b7(%rip),%ymm10        # 5878 <_sk_callback_hsw+0x598>
-  DB  196,98,125,24,29,178,5,0,0          ; vbroadcastss  0x5b2(%rip),%ymm11        # 587c <_sk_callback_hsw+0x59c>
+  DB  196,98,125,24,21,199,5,0,0          ; vbroadcastss  0x5c7(%rip),%ymm10        # 5ab0 <_sk_callback_hsw+0x5a8>
+  DB  196,98,125,24,29,194,5,0,0          ; vbroadcastss  0x5c2(%rip),%ymm11        # 5ab4 <_sk_callback_hsw+0x5ac>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,52,89,195                    ; vmulps        %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -5128,25 +5256,25 @@
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 54bd <.literal4+0xb1>
+  DB  71,225,61                           ; rex.RXB       loope 56e5 <.literal4+0xb1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 54cd <.literal4+0xc1>
+  DB  71,225,61                           ; rex.RXB       loope 56f5 <.literal4+0xc1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 54dd <.literal4+0xd1>
+  DB  71,225,61                           ; rex.RXB       loope 5705 <.literal4+0xd1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 54ed <.literal4+0xe1>
+  DB  71,225,61                           ; rex.RXB       loope 5715 <.literal4+0xe1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,127                    ; add           %al,0x7f00003f(%rax)
@@ -5208,7 +5336,7 @@
   DB  190,129,128,128,59                  ; mov           $0x3b808081,%esi
   DB  129,128,128,59,0,248,0,0,8,33       ; addl          $0x21080000,-0x7ffc480(%rax)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        555d <.literal4+0x151>
+  DB  224,7                               ; loopne        5785 <.literal4+0x151>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -5224,10 +5352,10 @@
   DB  129,128,128,59,129,128,128,59,0,0   ; addl          $0x3b80,-0x7f7ec480(%rax)
   DB  0,52,255                            ; add           %dh,(%rdi,%rdi,8)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5584 <.literal4+0x178>
+  DB  127,0                               ; jg            57ac <.literal4+0x178>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            55fd <.literal4+0x1f1>
+  DB  119,115                             ; ja            5825 <.literal4+0x1f1>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -5241,10 +5369,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            55b8 <.literal4+0x1ac>
+  DB  127,0                               ; jg            57e0 <.literal4+0x1ac>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5631 <.literal4+0x225>
+  DB  119,115                             ; ja            5859 <.literal4+0x225>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -5258,10 +5386,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            55ec <.literal4+0x1e0>
+  DB  127,0                               ; jg            5814 <.literal4+0x1e0>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5665 <.literal4+0x259>
+  DB  119,115                             ; ja            588d <.literal4+0x259>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -5275,10 +5403,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5620 <.literal4+0x214>
+  DB  127,0                               ; jg            5848 <.literal4+0x214>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5699 <.literal4+0x28d>
+  DB  119,115                             ; ja            58c1 <.literal4+0x28d>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -5291,7 +5419,7 @@
   DB  0,75,0                              ; add           %cl,0x0(%rbx)
   DB  0,128,63,0,0,200                    ; add           %al,-0x37ffffc1(%rax)
   DB  66,0,0                              ; rex.X         add %al,(%rax)
-  DB  127,67                              ; jg            5697 <.literal4+0x28b>
+  DB  127,67                              ; jg            58bf <.literal4+0x28b>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -5303,7 +5431,7 @@
   DB  190,80,128,3,62                     ; mov           $0x3e038050,%esi
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           56b7 <.literal4+0x2ab>
+  DB  118,63                              ; jbe           58df <.literal4+0x2ab>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
@@ -5318,7 +5446,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        56b9 <.literal4+0x2ad>
+  DB  224,7                               ; loopne        58e1 <.literal4+0x2ad>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -5330,7 +5458,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        56d5 <.literal4+0x2c9>
+  DB  224,7                               ; loopne        58fd <.literal4+0x2c9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -5342,7 +5470,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        56f1 <.literal4+0x2e5>
+  DB  224,7                               ; loopne        5919 <.literal4+0x2e5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -5353,7 +5481,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            5746 <.literal4+0x33a>
+  DB  124,66                              ; jl            596e <.literal4+0x33a>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,55,0,15                 ; mov           %ecx,0xf003788(%rax)
@@ -5379,7 +5507,10 @@
   DB  137,136,136,59,15,0                 ; mov           %ecx,0xf3b88(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,61,0,0                  ; mov           %ecx,0x3d88(%rax)
-  DB  112,65                              ; jo            57a9 <.literal4+0x39d>
+  DB  112,65                              ; jo            59d1 <.literal4+0x39d>
+  DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
+  DB  128,59,0                            ; cmpb          $0x0,(%rbx)
+  DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
@@ -5390,7 +5521,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  255                                 ; (bad)
-  DB  127,71                              ; jg            57cf <.literal4+0x3c3>
+  DB  127,71                              ; jg            5a07 <.literal4+0x3d3>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -5502,16 +5633,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a0058a8 <_sk_callback_hsw+0xa0005c8>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005ae8 <_sk_callback_hsw+0xa0005e0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 120058b0 <_sk_callback_hsw+0x120005d0>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005af0 <_sk_callback_hsw+0x120005e8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a0058b8 <_sk_callback_hsw+0x1a0005d8>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005af8 <_sk_callback_hsw+0x1a0005f0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 30058c0 <_sk_callback_hsw+0x30005e0>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005b00 <_sk_callback_hsw+0x30005f8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5554,16 +5685,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005908 <_sk_callback_hsw+0xa000628>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005b48 <_sk_callback_hsw+0xa000640>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005910 <_sk_callback_hsw+0x12000630>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005b50 <_sk_callback_hsw+0x12000648>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005918 <_sk_callback_hsw+0x1a000638>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005b58 <_sk_callback_hsw+0x1a000650>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005920 <_sk_callback_hsw+0x3000640>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005b60 <_sk_callback_hsw+0x3000658>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5606,16 +5737,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005968 <_sk_callback_hsw+0xa000688>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005ba8 <_sk_callback_hsw+0xa0006a0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005970 <_sk_callback_hsw+0x12000690>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005bb0 <_sk_callback_hsw+0x120006a8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005978 <_sk_callback_hsw+0x1a000698>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005bb8 <_sk_callback_hsw+0x1a0006b0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005980 <_sk_callback_hsw+0x30006a0>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005bc0 <_sk_callback_hsw+0x30006b8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5658,16 +5789,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a0059c8 <_sk_callback_hsw+0xa0006e8>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005c08 <_sk_callback_hsw+0xa000700>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 120059d0 <_sk_callback_hsw+0x120006f0>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005c10 <_sk_callback_hsw+0x12000708>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a0059d8 <_sk_callback_hsw+0x1a0006f8>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005c18 <_sk_callback_hsw+0x1a000710>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 30059e0 <_sk_callback_hsw+0x3000700>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005c20 <_sk_callback_hsw+0x3000718>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5710,16 +5841,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005a28 <_sk_callback_hsw+0xa000748>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005c68 <_sk_callback_hsw+0xa000760>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005a30 <_sk_callback_hsw+0x12000750>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005c70 <_sk_callback_hsw+0x12000768>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005a38 <_sk_callback_hsw+0x1a000758>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005c78 <_sk_callback_hsw+0x1a000770>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005a40 <_sk_callback_hsw+0x3000760>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005c80 <_sk_callback_hsw+0x3000778>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5762,16 +5893,172 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005a88 <_sk_callback_hsw+0xa0007a8>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005cc8 <_sk_callback_hsw+0xa0007c0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005a90 <_sk_callback_hsw+0x120007b0>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005cd0 <_sk_callback_hsw+0x120007c8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005a98 <_sk_callback_hsw+0x1a0007b8>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005cd8 <_sk_callback_hsw+0x1a0007d0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005aa0 <_sk_callback_hsw+0x30007c0>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005ce0 <_sk_callback_hsw+0x30007d8>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,6                               ; incl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,10                              ; decl          (%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,14                              ; decl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,18                              ; callq         *(%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,22                              ; callq         *(%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,26                              ; lcall         *(%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,30                              ; lcall         *(%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  1,255                               ; add           %edi,%edi
+  DB  255                                 ; (bad)
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005d28 <_sk_callback_hsw+0xa000820>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005d30 <_sk_callback_hsw+0x12000828>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005d38 <_sk_callback_hsw+0x1a000830>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005d40 <_sk_callback_hsw+0x3000838>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,6                               ; incl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,10                              ; decl          (%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,14                              ; decl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,18                              ; callq         *(%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,22                              ; callq         *(%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,26                              ; lcall         *(%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,30                              ; lcall         *(%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  1,255                               ; add           %edi,%edi
+  DB  255                                 ; (bad)
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005d88 <_sk_callback_hsw+0xa000880>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005d90 <_sk_callback_hsw+0x12000888>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005d98 <_sk_callback_hsw+0x1a000890>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005da0 <_sk_callback_hsw+0x3000898>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,6                               ; incl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,10                              ; decl          (%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,14                              ; decl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,18                              ; callq         *(%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,22                              ; callq         *(%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,26                              ; lcall         *(%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,30                              ; lcall         *(%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  1,255                               ; add           %edi,%edi
+  DB  255                                 ; (bad)
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005de8 <_sk_callback_hsw+0xa0008e0>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005df0 <_sk_callback_hsw+0x120008e8>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005df8 <_sk_callback_hsw+0x1a0008f0>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005e00 <_sk_callback_hsw+0x30008f8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5965,7 +6252,7 @@
   DB  197,249,112,192,0                   ; vpshufd       $0x0,%xmm0,%xmm0
   DB  196,227,125,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,56,114,0,0        ; vbroadcastss  0x7238(%rip),%ymm1        # 7370 <_sk_callback_avx+0x12a>
+  DB  196,226,125,24,13,28,118,0,0        ; vbroadcastss  0x761c(%rip),%ymm1        # 7754 <_sk_callback_avx+0x12a>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,88,7                        ; vaddps        (%rdi),%ymm0,%ymm0
   DB  197,249,110,209                     ; vmovd         %ecx,%xmm2
@@ -5974,7 +6261,7 @@
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  197,236,88,201                      ; vaddps        %ymm1,%ymm2,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,21,18,114,0,0        ; vbroadcastss  0x7212(%rip),%ymm2        # 7374 <_sk_callback_avx+0x12e>
+  DB  196,226,125,24,21,246,117,0,0       ; vbroadcastss  0x75f6(%rip),%ymm2        # 7758 <_sk_callback_avx+0x12e>
   DB  197,228,87,219                      ; vxorps        %ymm3,%ymm3,%ymm3
   DB  197,220,87,228                      ; vxorps        %ymm4,%ymm4,%ymm4
   DB  197,212,87,237                      ; vxorps        %ymm5,%ymm5,%ymm5
@@ -5996,7 +6283,7 @@
   DB  196,65,121,112,201,0                ; vpshufd       $0x0,%xmm9,%xmm9
   DB  196,67,53,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm9,%ymm9
   DB  196,65,52,87,208                    ; vxorps        %ymm8,%ymm9,%ymm10
-  DB  196,98,125,24,29,187,113,0,0        ; vbroadcastss  0x71bb(%rip),%ymm11        # 7378 <_sk_callback_avx+0x132>
+  DB  196,98,125,24,29,159,117,0,0        ; vbroadcastss  0x759f(%rip),%ymm11        # 775c <_sk_callback_avx+0x132>
   DB  196,65,44,84,203                    ; vandps        %ymm11,%ymm10,%ymm9
   DB  196,193,25,114,241,5                ; vpslld        $0x5,%xmm9,%xmm12
   DB  196,67,125,25,201,1                 ; vextractf128  $0x1,%ymm9,%xmm9
@@ -6007,8 +6294,8 @@
   DB  196,67,125,25,219,1                 ; vextractf128  $0x1,%ymm11,%xmm11
   DB  196,193,33,114,243,4                ; vpslld        $0x4,%xmm11,%xmm11
   DB  196,67,29,24,219,1                  ; vinsertf128   $0x1,%xmm11,%ymm12,%ymm11
-  DB  196,98,125,24,37,124,113,0,0        ; vbroadcastss  0x717c(%rip),%ymm12        # 737c <_sk_callback_avx+0x136>
-  DB  196,98,125,24,45,119,113,0,0        ; vbroadcastss  0x7177(%rip),%ymm13        # 7380 <_sk_callback_avx+0x13a>
+  DB  196,98,125,24,37,96,117,0,0         ; vbroadcastss  0x7560(%rip),%ymm12        # 7760 <_sk_callback_avx+0x136>
+  DB  196,98,125,24,45,91,117,0,0         ; vbroadcastss  0x755b(%rip),%ymm13        # 7764 <_sk_callback_avx+0x13a>
   DB  196,65,44,84,245                    ; vandps        %ymm13,%ymm10,%ymm14
   DB  196,193,1,114,246,2                 ; vpslld        $0x2,%xmm14,%xmm15
   DB  196,67,125,25,246,1                 ; vextractf128  $0x1,%ymm14,%xmm14
@@ -6035,9 +6322,9 @@
   DB  196,65,60,86,193                    ; vorps         %ymm9,%ymm8,%ymm8
   DB  196,65,60,86,194                    ; vorps         %ymm10,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,226,112,0,0        ; vbroadcastss  0x70e2(%rip),%ymm9        # 7384 <_sk_callback_avx+0x13e>
+  DB  196,98,125,24,13,198,116,0,0        ; vbroadcastss  0x74c6(%rip),%ymm9        # 7768 <_sk_callback_avx+0x13e>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,216,112,0,0        ; vbroadcastss  0x70d8(%rip),%ymm9        # 7388 <_sk_callback_avx+0x142>
+  DB  196,98,125,24,13,188,116,0,0        ; vbroadcastss  0x74bc(%rip),%ymm9        # 776c <_sk_callback_avx+0x142>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  196,98,125,24,8                     ; vbroadcastss  (%rax),%ymm9
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
@@ -6096,7 +6383,7 @@
 PUBLIC _sk_srcatop_avx
 _sk_srcatop_avx LABEL PROC
   DB  197,252,89,199                      ; vmulps        %ymm7,%ymm0,%ymm0
-  DB  196,98,125,24,5,48,112,0,0          ; vbroadcastss  0x7030(%rip),%ymm8        # 738c <_sk_callback_avx+0x146>
+  DB  196,98,125,24,5,20,116,0,0          ; vbroadcastss  0x7414(%rip),%ymm8        # 7770 <_sk_callback_avx+0x146>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,204                       ; vmulps        %ymm4,%ymm8,%ymm9
   DB  197,180,88,192                      ; vaddps        %ymm0,%ymm9,%ymm0
@@ -6115,7 +6402,7 @@
 PUBLIC _sk_dstatop_avx
 _sk_dstatop_avx LABEL PROC
   DB  197,100,89,196                      ; vmulps        %ymm4,%ymm3,%ymm8
-  DB  196,98,125,24,13,242,111,0,0        ; vbroadcastss  0x6ff2(%rip),%ymm9        # 7390 <_sk_callback_avx+0x14a>
+  DB  196,98,125,24,13,214,115,0,0        ; vbroadcastss  0x73d6(%rip),%ymm9        # 7774 <_sk_callback_avx+0x14a>
   DB  197,52,92,207                       ; vsubps        %ymm7,%ymm9,%ymm9
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
   DB  197,188,88,192                      ; vaddps        %ymm0,%ymm8,%ymm0
@@ -6151,7 +6438,7 @@
 
 PUBLIC _sk_srcout_avx
 _sk_srcout_avx LABEL PROC
-  DB  196,98,125,24,5,145,111,0,0         ; vbroadcastss  0x6f91(%rip),%ymm8        # 7394 <_sk_callback_avx+0x14e>
+  DB  196,98,125,24,5,117,115,0,0         ; vbroadcastss  0x7375(%rip),%ymm8        # 7778 <_sk_callback_avx+0x14e>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -6162,7 +6449,7 @@
 
 PUBLIC _sk_dstout_avx
 _sk_dstout_avx LABEL PROC
-  DB  196,226,125,24,5,116,111,0,0        ; vbroadcastss  0x6f74(%rip),%ymm0        # 7398 <_sk_callback_avx+0x152>
+  DB  196,226,125,24,5,88,115,0,0         ; vbroadcastss  0x7358(%rip),%ymm0        # 777c <_sk_callback_avx+0x152>
   DB  197,252,92,219                      ; vsubps        %ymm3,%ymm0,%ymm3
   DB  197,228,89,196                      ; vmulps        %ymm4,%ymm3,%ymm0
   DB  197,228,89,205                      ; vmulps        %ymm5,%ymm3,%ymm1
@@ -6173,7 +6460,7 @@
 
 PUBLIC _sk_srcover_avx
 _sk_srcover_avx LABEL PROC
-  DB  196,98,125,24,5,87,111,0,0          ; vbroadcastss  0x6f57(%rip),%ymm8        # 739c <_sk_callback_avx+0x156>
+  DB  196,98,125,24,5,59,115,0,0          ; vbroadcastss  0x733b(%rip),%ymm8        # 7780 <_sk_callback_avx+0x156>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,204                       ; vmulps        %ymm4,%ymm8,%ymm9
   DB  197,180,88,192                      ; vaddps        %ymm0,%ymm9,%ymm0
@@ -6188,7 +6475,7 @@
 
 PUBLIC _sk_dstover_avx
 _sk_dstover_avx LABEL PROC
-  DB  196,98,125,24,5,42,111,0,0          ; vbroadcastss  0x6f2a(%rip),%ymm8        # 73a0 <_sk_callback_avx+0x15a>
+  DB  196,98,125,24,5,14,115,0,0          ; vbroadcastss  0x730e(%rip),%ymm8        # 7784 <_sk_callback_avx+0x15a>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,252,88,196                      ; vaddps        %ymm4,%ymm0,%ymm0
@@ -6212,7 +6499,7 @@
 
 PUBLIC _sk_multiply_avx
 _sk_multiply_avx LABEL PROC
-  DB  196,98,125,24,5,233,110,0,0         ; vbroadcastss  0x6ee9(%rip),%ymm8        # 73a4 <_sk_callback_avx+0x15e>
+  DB  196,98,125,24,5,205,114,0,0         ; vbroadcastss  0x72cd(%rip),%ymm8        # 7788 <_sk_callback_avx+0x15e>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,208                       ; vmulps        %ymm0,%ymm9,%ymm10
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -6266,7 +6553,7 @@
 
 PUBLIC _sk_xor__avx
 _sk_xor__avx LABEL PROC
-  DB  196,98,125,24,5,56,110,0,0          ; vbroadcastss  0x6e38(%rip),%ymm8        # 73a8 <_sk_callback_avx+0x162>
+  DB  196,98,125,24,5,28,114,0,0          ; vbroadcastss  0x721c(%rip),%ymm8        # 778c <_sk_callback_avx+0x162>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -6301,7 +6588,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,95,209                  ; vmaxps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,184,109,0,0         ; vbroadcastss  0x6db8(%rip),%ymm8        # 73ac <_sk_callback_avx+0x166>
+  DB  196,98,125,24,5,156,113,0,0         ; vbroadcastss  0x719c(%rip),%ymm8        # 7790 <_sk_callback_avx+0x166>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -6325,7 +6612,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,100,109,0,0         ; vbroadcastss  0x6d64(%rip),%ymm8        # 73b0 <_sk_callback_avx+0x16a>
+  DB  196,98,125,24,5,72,113,0,0          ; vbroadcastss  0x7148(%rip),%ymm8        # 7794 <_sk_callback_avx+0x16a>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -6352,7 +6639,7 @@
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,4,109,0,0           ; vbroadcastss  0x6d04(%rip),%ymm8        # 73b4 <_sk_callback_avx+0x16e>
+  DB  196,98,125,24,5,232,112,0,0         ; vbroadcastss  0x70e8(%rip),%ymm8        # 7798 <_sk_callback_avx+0x16e>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -6373,7 +6660,7 @@
   DB  197,236,89,214                      ; vmulps        %ymm6,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,191,108,0,0         ; vbroadcastss  0x6cbf(%rip),%ymm8        # 73b8 <_sk_callback_avx+0x172>
+  DB  196,98,125,24,5,163,112,0,0         ; vbroadcastss  0x70a3(%rip),%ymm8        # 779c <_sk_callback_avx+0x172>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -6382,7 +6669,7 @@
 
 PUBLIC _sk_colorburn_avx
 _sk_colorburn_avx LABEL PROC
-  DB  196,98,125,24,5,170,108,0,0         ; vbroadcastss  0x6caa(%rip),%ymm8        # 73bc <_sk_callback_avx+0x176>
+  DB  196,98,125,24,5,142,112,0,0         ; vbroadcastss  0x708e(%rip),%ymm8        # 77a0 <_sk_callback_avx+0x176>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,216                       ; vmulps        %ymm0,%ymm9,%ymm11
   DB  196,65,44,87,210                    ; vxorps        %ymm10,%ymm10,%ymm10
@@ -6442,7 +6729,7 @@
 PUBLIC _sk_colordodge_avx
 _sk_colordodge_avx LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
-  DB  196,98,125,24,13,166,107,0,0        ; vbroadcastss  0x6ba6(%rip),%ymm9        # 73c0 <_sk_callback_avx+0x17a>
+  DB  196,98,125,24,13,138,111,0,0        ; vbroadcastss  0x6f8a(%rip),%ymm9        # 77a4 <_sk_callback_avx+0x17a>
   DB  197,52,92,215                       ; vsubps        %ymm7,%ymm9,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,52,92,203                       ; vsubps        %ymm3,%ymm9,%ymm9
@@ -6497,7 +6784,7 @@
 
 PUBLIC _sk_hardlight_avx
 _sk_hardlight_avx LABEL PROC
-  DB  196,98,125,24,5,184,106,0,0         ; vbroadcastss  0x6ab8(%rip),%ymm8        # 73c4 <_sk_callback_avx+0x17e>
+  DB  196,98,125,24,5,156,110,0,0         ; vbroadcastss  0x6e9c(%rip),%ymm8        # 77a8 <_sk_callback_avx+0x17e>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,200                       ; vmulps        %ymm0,%ymm10,%ymm9
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -6550,7 +6837,7 @@
 
 PUBLIC _sk_overlay_avx
 _sk_overlay_avx LABEL PROC
-  DB  196,98,125,24,5,225,105,0,0         ; vbroadcastss  0x69e1(%rip),%ymm8        # 73c8 <_sk_callback_avx+0x182>
+  DB  196,98,125,24,5,197,109,0,0         ; vbroadcastss  0x6dc5(%rip),%ymm8        # 77ac <_sk_callback_avx+0x182>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,200                       ; vmulps        %ymm0,%ymm10,%ymm9
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -6615,10 +6902,10 @@
   DB  196,65,60,88,192                    ; vaddps        %ymm8,%ymm8,%ymm8
   DB  196,65,60,89,216                    ; vmulps        %ymm8,%ymm8,%ymm11
   DB  196,65,60,88,195                    ; vaddps        %ymm11,%ymm8,%ymm8
-  DB  196,98,125,24,29,212,104,0,0        ; vbroadcastss  0x68d4(%rip),%ymm11        # 73d0 <_sk_callback_avx+0x18a>
+  DB  196,98,125,24,29,184,108,0,0        ; vbroadcastss  0x6cb8(%rip),%ymm11        # 77b4 <_sk_callback_avx+0x18a>
   DB  196,65,28,88,235                    ; vaddps        %ymm11,%ymm12,%ymm13
   DB  196,65,20,89,192                    ; vmulps        %ymm8,%ymm13,%ymm8
-  DB  196,98,125,24,45,197,104,0,0        ; vbroadcastss  0x68c5(%rip),%ymm13        # 73d4 <_sk_callback_avx+0x18e>
+  DB  196,98,125,24,45,169,108,0,0        ; vbroadcastss  0x6ca9(%rip),%ymm13        # 77b8 <_sk_callback_avx+0x18e>
   DB  196,65,28,89,245                    ; vmulps        %ymm13,%ymm12,%ymm14
   DB  196,65,12,88,192                    ; vaddps        %ymm8,%ymm14,%ymm8
   DB  196,65,124,82,244                   ; vrsqrtps      %ymm12,%ymm14
@@ -6629,7 +6916,7 @@
   DB  197,4,194,255,2                     ; vcmpleps      %ymm7,%ymm15,%ymm15
   DB  196,67,13,74,240,240                ; vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   DB  197,116,88,249                      ; vaddps        %ymm1,%ymm1,%ymm15
-  DB  196,98,125,24,5,131,104,0,0         ; vbroadcastss  0x6883(%rip),%ymm8        # 73cc <_sk_callback_avx+0x186>
+  DB  196,98,125,24,5,103,108,0,0         ; vbroadcastss  0x6c67(%rip),%ymm8        # 77b0 <_sk_callback_avx+0x186>
   DB  196,65,60,92,228                    ; vsubps        %ymm12,%ymm8,%ymm12
   DB  197,132,92,195                      ; vsubps        %ymm3,%ymm15,%ymm0
   DB  196,65,124,89,228                   ; vmulps        %ymm12,%ymm0,%ymm12
@@ -6756,12 +7043,12 @@
   DB  196,65,28,89,219                    ; vmulps        %ymm11,%ymm12,%ymm11
   DB  196,65,36,94,222                    ; vdivps        %ymm14,%ymm11,%ymm11
   DB  196,67,37,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  DB  196,98,125,24,53,77,102,0,0         ; vbroadcastss  0x664d(%rip),%ymm14        # 73d8 <_sk_callback_avx+0x192>
+  DB  196,98,125,24,53,49,106,0,0         ; vbroadcastss  0x6a31(%rip),%ymm14        # 77bc <_sk_callback_avx+0x192>
   DB  196,65,92,89,222                    ; vmulps        %ymm14,%ymm4,%ymm11
-  DB  196,98,125,24,61,67,102,0,0         ; vbroadcastss  0x6643(%rip),%ymm15        # 73dc <_sk_callback_avx+0x196>
+  DB  196,98,125,24,61,39,106,0,0         ; vbroadcastss  0x6a27(%rip),%ymm15        # 77c0 <_sk_callback_avx+0x196>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
-  DB  196,226,125,24,5,52,102,0,0         ; vbroadcastss  0x6634(%rip),%ymm0        # 73e0 <_sk_callback_avx+0x19a>
+  DB  196,226,125,24,5,24,106,0,0         ; vbroadcastss  0x6a18(%rip),%ymm0        # 77c4 <_sk_callback_avx+0x19a>
   DB  197,76,89,232                       ; vmulps        %ymm0,%ymm6,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
   DB  196,65,52,89,238                    ; vmulps        %ymm14,%ymm9,%ymm13
@@ -6822,7 +7109,7 @@
   DB  196,65,36,95,208                    ; vmaxps        %ymm8,%ymm11,%ymm10
   DB  196,195,109,74,209,240              ; vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,13,101,0,0          ; vbroadcastss  0x650d(%rip),%ymm8        # 73e4 <_sk_callback_avx+0x19e>
+  DB  196,98,125,24,5,241,104,0,0         ; vbroadcastss  0x68f1(%rip),%ymm8        # 77c8 <_sk_callback_avx+0x19e>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,201                      ; vmulps        %ymm1,%ymm9,%ymm1
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -6879,12 +7166,12 @@
   DB  196,65,28,89,219                    ; vmulps        %ymm11,%ymm12,%ymm11
   DB  196,65,36,94,222                    ; vdivps        %ymm14,%ymm11,%ymm11
   DB  196,67,37,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  DB  196,98,125,24,53,21,100,0,0         ; vbroadcastss  0x6415(%rip),%ymm14        # 73e8 <_sk_callback_avx+0x1a2>
+  DB  196,98,125,24,53,249,103,0,0        ; vbroadcastss  0x67f9(%rip),%ymm14        # 77cc <_sk_callback_avx+0x1a2>
   DB  196,65,92,89,222                    ; vmulps        %ymm14,%ymm4,%ymm11
-  DB  196,98,125,24,61,11,100,0,0         ; vbroadcastss  0x640b(%rip),%ymm15        # 73ec <_sk_callback_avx+0x1a6>
+  DB  196,98,125,24,61,239,103,0,0        ; vbroadcastss  0x67ef(%rip),%ymm15        # 77d0 <_sk_callback_avx+0x1a6>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
-  DB  196,226,125,24,5,252,99,0,0         ; vbroadcastss  0x63fc(%rip),%ymm0        # 73f0 <_sk_callback_avx+0x1aa>
+  DB  196,226,125,24,5,224,103,0,0        ; vbroadcastss  0x67e0(%rip),%ymm0        # 77d4 <_sk_callback_avx+0x1aa>
   DB  197,76,89,232                       ; vmulps        %ymm0,%ymm6,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
   DB  196,65,52,89,238                    ; vmulps        %ymm14,%ymm9,%ymm13
@@ -6945,7 +7232,7 @@
   DB  196,65,36,95,208                    ; vmaxps        %ymm8,%ymm11,%ymm10
   DB  196,195,109,74,209,240              ; vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,213,98,0,0          ; vbroadcastss  0x62d5(%rip),%ymm8        # 73f4 <_sk_callback_avx+0x1ae>
+  DB  196,98,125,24,5,185,102,0,0         ; vbroadcastss  0x66b9(%rip),%ymm8        # 77d8 <_sk_callback_avx+0x1ae>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,201                      ; vmulps        %ymm1,%ymm9,%ymm1
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -6974,12 +7261,12 @@
   DB  197,252,17,68,36,32                 ; vmovups       %ymm0,0x20(%rsp)
   DB  197,124,89,199                      ; vmulps        %ymm7,%ymm0,%ymm8
   DB  197,116,89,207                      ; vmulps        %ymm7,%ymm1,%ymm9
-  DB  196,98,125,24,45,101,98,0,0         ; vbroadcastss  0x6265(%rip),%ymm13        # 73f8 <_sk_callback_avx+0x1b2>
+  DB  196,98,125,24,45,73,102,0,0         ; vbroadcastss  0x6649(%rip),%ymm13        # 77dc <_sk_callback_avx+0x1b2>
   DB  196,65,92,89,213                    ; vmulps        %ymm13,%ymm4,%ymm10
-  DB  196,98,125,24,53,91,98,0,0          ; vbroadcastss  0x625b(%rip),%ymm14        # 73fc <_sk_callback_avx+0x1b6>
+  DB  196,98,125,24,53,63,102,0,0         ; vbroadcastss  0x663f(%rip),%ymm14        # 77e0 <_sk_callback_avx+0x1b6>
   DB  196,65,84,89,222                    ; vmulps        %ymm14,%ymm5,%ymm11
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,24,61,76,98,0,0          ; vbroadcastss  0x624c(%rip),%ymm15        # 7400 <_sk_callback_avx+0x1ba>
+  DB  196,98,125,24,61,48,102,0,0         ; vbroadcastss  0x6630(%rip),%ymm15        # 77e4 <_sk_callback_avx+0x1ba>
   DB  196,65,76,89,223                    ; vmulps        %ymm15,%ymm6,%ymm11
   DB  196,193,44,88,195                   ; vaddps        %ymm11,%ymm10,%ymm0
   DB  196,65,60,89,221                    ; vmulps        %ymm13,%ymm8,%ymm11
@@ -7042,7 +7329,7 @@
   DB  196,65,44,95,207                    ; vmaxps        %ymm15,%ymm10,%ymm9
   DB  196,195,37,74,192,0                 ; vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   DB  196,65,124,95,199                   ; vmaxps        %ymm15,%ymm0,%ymm8
-  DB  196,226,125,24,5,19,97,0,0          ; vbroadcastss  0x6113(%rip),%ymm0        # 7404 <_sk_callback_avx+0x1be>
+  DB  196,226,125,24,5,247,100,0,0        ; vbroadcastss  0x64f7(%rip),%ymm0        # 77e8 <_sk_callback_avx+0x1be>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,84,36,32                 ; vmulps        0x20(%rsp),%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -7072,12 +7359,12 @@
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  197,100,89,196                      ; vmulps        %ymm4,%ymm3,%ymm8
   DB  197,100,89,205                      ; vmulps        %ymm5,%ymm3,%ymm9
-  DB  196,98,125,24,45,159,96,0,0         ; vbroadcastss  0x609f(%rip),%ymm13        # 7408 <_sk_callback_avx+0x1c2>
+  DB  196,98,125,24,45,131,100,0,0        ; vbroadcastss  0x6483(%rip),%ymm13        # 77ec <_sk_callback_avx+0x1c2>
   DB  196,65,108,89,213                   ; vmulps        %ymm13,%ymm2,%ymm10
-  DB  196,98,125,24,53,149,96,0,0         ; vbroadcastss  0x6095(%rip),%ymm14        # 740c <_sk_callback_avx+0x1c6>
+  DB  196,98,125,24,53,121,100,0,0        ; vbroadcastss  0x6479(%rip),%ymm14        # 77f0 <_sk_callback_avx+0x1c6>
   DB  196,65,116,89,222                   ; vmulps        %ymm14,%ymm1,%ymm11
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,24,61,134,96,0,0         ; vbroadcastss  0x6086(%rip),%ymm15        # 7410 <_sk_callback_avx+0x1ca>
+  DB  196,98,125,24,61,106,100,0,0        ; vbroadcastss  0x646a(%rip),%ymm15        # 77f4 <_sk_callback_avx+0x1ca>
   DB  196,65,28,89,223                    ; vmulps        %ymm15,%ymm12,%ymm11
   DB  196,193,44,88,195                   ; vaddps        %ymm11,%ymm10,%ymm0
   DB  196,65,60,89,221                    ; vmulps        %ymm13,%ymm8,%ymm11
@@ -7140,7 +7427,7 @@
   DB  196,65,44,95,207                    ; vmaxps        %ymm15,%ymm10,%ymm9
   DB  196,195,37,74,192,0                 ; vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   DB  196,65,124,95,199                   ; vmaxps        %ymm15,%ymm0,%ymm8
-  DB  196,226,125,24,5,77,95,0,0          ; vbroadcastss  0x5f4d(%rip),%ymm0        # 7414 <_sk_callback_avx+0x1ce>
+  DB  196,226,125,24,5,49,99,0,0          ; vbroadcastss  0x6331(%rip),%ymm0        # 77f8 <_sk_callback_avx+0x1ce>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -7171,7 +7458,7 @@
   DB  77,133,192                          ; test          %r8,%r8
   DB  15,133,47,1,0,0                     ; jne           1661 <_sk_srcover_rgba_8888_avx+0x14c>
   DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
-  DB  197,124,40,13,33,100,0,0            ; vmovaps       0x6421(%rip),%ymm9        # 7960 <_sk_callback_avx+0x71a>
+  DB  197,124,40,13,129,104,0,0           ; vmovaps       0x6881(%rip),%ymm9        # 7dc0 <_sk_callback_avx+0x796>
   DB  196,193,68,84,225                   ; vandps        %ymm9,%ymm7,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
   DB  197,209,114,215,8                   ; vpsrld        $0x8,%xmm7,%xmm5
@@ -7189,9 +7476,9 @@
   DB  196,193,65,114,208,24               ; vpsrld        $0x18,%xmm8,%xmm7
   DB  196,227,53,24,255,1                 ; vinsertf128   $0x1,%xmm7,%ymm9,%ymm7
   DB  197,252,91,255                      ; vcvtdq2ps     %ymm7,%ymm7
-  DB  196,98,125,24,5,120,94,0,0          ; vbroadcastss  0x5e78(%rip),%ymm8        # 7418 <_sk_callback_avx+0x1d2>
+  DB  196,98,125,24,5,92,98,0,0           ; vbroadcastss  0x625c(%rip),%ymm8        # 77fc <_sk_callback_avx+0x1d2>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
-  DB  196,98,125,24,13,111,94,0,0         ; vbroadcastss  0x5e6f(%rip),%ymm9        # 741c <_sk_callback_avx+0x1d6>
+  DB  196,98,125,24,13,83,98,0,0          ; vbroadcastss  0x6253(%rip),%ymm9        # 7800 <_sk_callback_avx+0x1d6>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  197,60,89,212                       ; vmulps        %ymm4,%ymm8,%ymm10
   DB  196,193,124,88,194                  ; vaddps        %ymm10,%ymm0,%ymm0
@@ -7237,9 +7524,9 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
   DB  196,226,121,48,228                  ; vpmovzxbw     %xmm4,%xmm4
-  DB  196,226,89,0,45,151,97,0,0          ; vpshufb       0x6197(%rip),%xmm4,%xmm5        # 7820 <_sk_callback_avx+0x5da>
+  DB  196,226,89,0,45,135,101,0,0         ; vpshufb       0x6587(%rip),%xmm4,%xmm5        # 7c10 <_sk_callback_avx+0x5e6>
   DB  196,226,121,33,237                  ; vpmovsxbd     %xmm5,%xmm5
-  DB  196,226,89,0,37,153,97,0,0          ; vpshufb       0x6199(%rip),%xmm4,%xmm4        # 7830 <_sk_callback_avx+0x5ea>
+  DB  196,226,89,0,37,137,101,0,0         ; vpshufb       0x6589(%rip),%xmm4,%xmm4        # 7c20 <_sk_callback_avx+0x5f6>
   DB  196,226,121,33,228                  ; vpmovsxbd     %xmm4,%xmm4
   DB  196,227,85,24,228,1                 ; vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
   DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
@@ -7251,9 +7538,9 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
-  DB  196,98,49,0,21,76,97,0,0            ; vpshufb       0x614c(%rip),%xmm9,%xmm10        # 7820 <_sk_callback_avx+0x5da>
+  DB  196,98,49,0,21,60,101,0,0           ; vpshufb       0x653c(%rip),%xmm9,%xmm10        # 7c10 <_sk_callback_avx+0x5e6>
   DB  196,66,121,33,210                   ; vpmovsxbd     %xmm10,%xmm10
-  DB  196,98,49,0,13,78,97,0,0            ; vpshufb       0x614e(%rip),%xmm9,%xmm9        # 7830 <_sk_callback_avx+0x5ea>
+  DB  196,98,49,0,13,62,101,0,0           ; vpshufb       0x653e(%rip),%xmm9,%xmm9        # 7c20 <_sk_callback_avx+0x5f6>
   DB  196,66,121,33,201                   ; vpmovsxbd     %xmm9,%xmm9
   DB  196,67,45,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
   DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
@@ -7271,7 +7558,7 @@
 
 PUBLIC _sk_clamp_1_avx
 _sk_clamp_1_avx LABEL PROC
-  DB  196,98,125,24,5,3,93,0,0            ; vbroadcastss  0x5d03(%rip),%ymm8        # 7420 <_sk_callback_avx+0x1da>
+  DB  196,98,125,24,5,231,96,0,0          ; vbroadcastss  0x60e7(%rip),%ymm8        # 7804 <_sk_callback_avx+0x1da>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
@@ -7281,7 +7568,7 @@
 
 PUBLIC _sk_clamp_a_avx
 _sk_clamp_a_avx LABEL PROC
-  DB  196,98,125,24,5,230,92,0,0          ; vbroadcastss  0x5ce6(%rip),%ymm8        # 7424 <_sk_callback_avx+0x1de>
+  DB  196,98,125,24,5,202,96,0,0          ; vbroadcastss  0x60ca(%rip),%ymm8        # 7808 <_sk_callback_avx+0x1de>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  197,252,93,195                      ; vminps        %ymm3,%ymm0,%ymm0
   DB  197,244,93,203                      ; vminps        %ymm3,%ymm1,%ymm1
@@ -7291,7 +7578,7 @@
 
 PUBLIC _sk_clamp_a_dst_avx
 _sk_clamp_a_dst_avx LABEL PROC
-  DB  196,98,125,24,5,204,92,0,0          ; vbroadcastss  0x5ccc(%rip),%ymm8        # 7428 <_sk_callback_avx+0x1e2>
+  DB  196,98,125,24,5,176,96,0,0          ; vbroadcastss  0x60b0(%rip),%ymm8        # 780c <_sk_callback_avx+0x1e2>
   DB  196,193,68,93,248                   ; vminps        %ymm8,%ymm7,%ymm7
   DB  197,220,93,231                      ; vminps        %ymm7,%ymm4,%ymm4
   DB  197,212,93,239                      ; vminps        %ymm7,%ymm5,%ymm5
@@ -7316,14 +7603,6 @@
   DB  197,124,41,194                      ; vmovaps       %ymm8,%ymm2
   DB  255,224                             ; jmpq          *%rax
 
-PUBLIC _sk_swap_rb_dst_avx
-_sk_swap_rb_dst_avx LABEL PROC
-  DB  197,124,40,196                      ; vmovaps       %ymm4,%ymm8
-  DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  197,252,40,230                      ; vmovaps       %ymm6,%ymm4
-  DB  197,124,41,198                      ; vmovaps       %ymm8,%ymm6
-  DB  255,224                             ; jmpq          *%rax
-
 PUBLIC _sk_move_src_dst_avx
 _sk_move_src_dst_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -7354,7 +7633,7 @@
 _sk_unpremul_avx LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,65,100,194,200,0                ; vcmpeqps      %ymm8,%ymm3,%ymm9
-  DB  196,98,125,24,21,56,92,0,0          ; vbroadcastss  0x5c38(%rip),%ymm10        # 742c <_sk_callback_avx+0x1e6>
+  DB  196,98,125,24,21,44,96,0,0          ; vbroadcastss  0x602c(%rip),%ymm10        # 7810 <_sk_callback_avx+0x1e6>
   DB  197,44,94,211                       ; vdivps        %ymm3,%ymm10,%ymm10
   DB  196,67,45,74,192,144                ; vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
@@ -7365,17 +7644,17 @@
 
 PUBLIC _sk_from_srgb_avx
 _sk_from_srgb_avx LABEL PROC
-  DB  196,98,125,24,5,25,92,0,0           ; vbroadcastss  0x5c19(%rip),%ymm8        # 7430 <_sk_callback_avx+0x1ea>
+  DB  196,98,125,24,5,13,96,0,0           ; vbroadcastss  0x600d(%rip),%ymm8        # 7814 <_sk_callback_avx+0x1ea>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  197,124,89,208                      ; vmulps        %ymm0,%ymm0,%ymm10
-  DB  196,98,125,24,29,11,92,0,0          ; vbroadcastss  0x5c0b(%rip),%ymm11        # 7434 <_sk_callback_avx+0x1ee>
+  DB  196,98,125,24,29,255,95,0,0         ; vbroadcastss  0x5fff(%rip),%ymm11        # 7818 <_sk_callback_avx+0x1ee>
   DB  196,65,124,89,227                   ; vmulps        %ymm11,%ymm0,%ymm12
-  DB  196,98,125,24,45,1,92,0,0           ; vbroadcastss  0x5c01(%rip),%ymm13        # 7438 <_sk_callback_avx+0x1f2>
+  DB  196,98,125,24,45,245,95,0,0         ; vbroadcastss  0x5ff5(%rip),%ymm13        # 781c <_sk_callback_avx+0x1f2>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,44,89,212                    ; vmulps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,242,91,0,0         ; vbroadcastss  0x5bf2(%rip),%ymm12        # 743c <_sk_callback_avx+0x1f6>
+  DB  196,98,125,24,37,230,95,0,0         ; vbroadcastss  0x5fe6(%rip),%ymm12        # 7820 <_sk_callback_avx+0x1f6>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,53,232,91,0,0         ; vbroadcastss  0x5be8(%rip),%ymm14        # 7440 <_sk_callback_avx+0x1fa>
+  DB  196,98,125,24,53,220,95,0,0         ; vbroadcastss  0x5fdc(%rip),%ymm14        # 7824 <_sk_callback_avx+0x1fa>
   DB  196,193,124,194,198,1               ; vcmpltps      %ymm14,%ymm0,%ymm0
   DB  196,195,45,74,193,0                 ; vblendvps     %ymm0,%ymm9,%ymm10,%ymm0
   DB  196,65,116,89,200                   ; vmulps        %ymm8,%ymm1,%ymm9
@@ -7399,17 +7678,17 @@
 
 PUBLIC _sk_from_srgb_dst_avx
 _sk_from_srgb_dst_avx LABEL PROC
-  DB  196,98,125,24,5,129,91,0,0          ; vbroadcastss  0x5b81(%rip),%ymm8        # 7444 <_sk_callback_avx+0x1fe>
+  DB  196,98,125,24,5,117,95,0,0          ; vbroadcastss  0x5f75(%rip),%ymm8        # 7828 <_sk_callback_avx+0x1fe>
   DB  196,65,92,89,200                    ; vmulps        %ymm8,%ymm4,%ymm9
   DB  197,92,89,212                       ; vmulps        %ymm4,%ymm4,%ymm10
-  DB  196,98,125,24,29,115,91,0,0         ; vbroadcastss  0x5b73(%rip),%ymm11        # 7448 <_sk_callback_avx+0x202>
+  DB  196,98,125,24,29,103,95,0,0         ; vbroadcastss  0x5f67(%rip),%ymm11        # 782c <_sk_callback_avx+0x202>
   DB  196,65,92,89,227                    ; vmulps        %ymm11,%ymm4,%ymm12
-  DB  196,98,125,24,45,105,91,0,0         ; vbroadcastss  0x5b69(%rip),%ymm13        # 744c <_sk_callback_avx+0x206>
+  DB  196,98,125,24,45,93,95,0,0          ; vbroadcastss  0x5f5d(%rip),%ymm13        # 7830 <_sk_callback_avx+0x206>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,44,89,212                    ; vmulps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,90,91,0,0          ; vbroadcastss  0x5b5a(%rip),%ymm12        # 7450 <_sk_callback_avx+0x20a>
+  DB  196,98,125,24,37,78,95,0,0          ; vbroadcastss  0x5f4e(%rip),%ymm12        # 7834 <_sk_callback_avx+0x20a>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,53,80,91,0,0          ; vbroadcastss  0x5b50(%rip),%ymm14        # 7454 <_sk_callback_avx+0x20e>
+  DB  196,98,125,24,53,68,95,0,0          ; vbroadcastss  0x5f44(%rip),%ymm14        # 7838 <_sk_callback_avx+0x20e>
   DB  196,193,92,194,230,1                ; vcmpltps      %ymm14,%ymm4,%ymm4
   DB  196,195,45,74,225,64                ; vblendvps     %ymm4,%ymm9,%ymm10,%ymm4
   DB  196,65,84,89,200                    ; vmulps        %ymm8,%ymm5,%ymm9
@@ -7434,20 +7713,20 @@
 PUBLIC _sk_to_srgb_avx
 _sk_to_srgb_avx LABEL PROC
   DB  197,124,82,200                      ; vrsqrtps      %ymm0,%ymm9
-  DB  196,98,125,24,5,229,90,0,0          ; vbroadcastss  0x5ae5(%rip),%ymm8        # 7458 <_sk_callback_avx+0x212>
+  DB  196,98,125,24,5,217,94,0,0          ; vbroadcastss  0x5ed9(%rip),%ymm8        # 783c <_sk_callback_avx+0x212>
   DB  196,65,124,89,208                   ; vmulps        %ymm8,%ymm0,%ymm10
-  DB  196,98,125,24,29,219,90,0,0         ; vbroadcastss  0x5adb(%rip),%ymm11        # 745c <_sk_callback_avx+0x216>
+  DB  196,98,125,24,29,207,94,0,0         ; vbroadcastss  0x5ecf(%rip),%ymm11        # 7840 <_sk_callback_avx+0x216>
   DB  196,65,52,89,227                    ; vmulps        %ymm11,%ymm9,%ymm12
-  DB  196,98,125,24,45,209,90,0,0         ; vbroadcastss  0x5ad1(%rip),%ymm13        # 7460 <_sk_callback_avx+0x21a>
+  DB  196,98,125,24,45,197,94,0,0         ; vbroadcastss  0x5ec5(%rip),%ymm13        # 7844 <_sk_callback_avx+0x21a>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,52,89,228                    ; vmulps        %ymm12,%ymm9,%ymm12
-  DB  196,98,125,24,53,194,90,0,0         ; vbroadcastss  0x5ac2(%rip),%ymm14        # 7464 <_sk_callback_avx+0x21e>
+  DB  196,98,125,24,53,182,94,0,0         ; vbroadcastss  0x5eb6(%rip),%ymm14        # 7848 <_sk_callback_avx+0x21e>
   DB  196,65,28,88,230                    ; vaddps        %ymm14,%ymm12,%ymm12
-  DB  196,98,125,24,61,184,90,0,0         ; vbroadcastss  0x5ab8(%rip),%ymm15        # 7468 <_sk_callback_avx+0x222>
+  DB  196,98,125,24,61,172,94,0,0         ; vbroadcastss  0x5eac(%rip),%ymm15        # 784c <_sk_callback_avx+0x222>
   DB  196,65,52,88,207                    ; vaddps        %ymm15,%ymm9,%ymm9
   DB  196,65,124,83,201                   ; vrcpps        %ymm9,%ymm9
   DB  196,65,52,89,204                    ; vmulps        %ymm12,%ymm9,%ymm9
-  DB  196,98,125,24,37,164,90,0,0         ; vbroadcastss  0x5aa4(%rip),%ymm12        # 746c <_sk_callback_avx+0x226>
+  DB  196,98,125,24,37,152,94,0,0         ; vbroadcastss  0x5e98(%rip),%ymm12        # 7850 <_sk_callback_avx+0x226>
   DB  196,193,124,194,196,1               ; vcmpltps      %ymm12,%ymm0,%ymm0
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  197,124,82,201                      ; vrsqrtps      %ymm1,%ymm9
@@ -7482,7 +7761,7 @@
   DB  197,124,93,201                      ; vminps        %ymm1,%ymm0,%ymm9
   DB  197,52,93,202                       ; vminps        %ymm2,%ymm9,%ymm9
   DB  196,65,60,92,209                    ; vsubps        %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,29,10,90,0,0          ; vbroadcastss  0x5a0a(%rip),%ymm11        # 7470 <_sk_callback_avx+0x22a>
+  DB  196,98,125,24,29,254,93,0,0         ; vbroadcastss  0x5dfe(%rip),%ymm11        # 7854 <_sk_callback_avx+0x22a>
   DB  196,65,36,94,218                    ; vdivps        %ymm10,%ymm11,%ymm11
   DB  197,116,92,226                      ; vsubps        %ymm2,%ymm1,%ymm12
   DB  196,65,28,89,227                    ; vmulps        %ymm11,%ymm12,%ymm12
@@ -7492,19 +7771,19 @@
   DB  196,193,108,89,211                  ; vmulps        %ymm11,%ymm2,%ymm2
   DB  197,252,92,201                      ; vsubps        %ymm1,%ymm0,%ymm1
   DB  196,193,116,89,203                  ; vmulps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,227,89,0,0         ; vbroadcastss  0x59e3(%rip),%ymm11        # 747c <_sk_callback_avx+0x236>
+  DB  196,98,125,24,29,215,93,0,0         ; vbroadcastss  0x5dd7(%rip),%ymm11        # 7860 <_sk_callback_avx+0x236>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,209,89,0,0         ; vbroadcastss  0x59d1(%rip),%ymm11        # 7478 <_sk_callback_avx+0x232>
+  DB  196,98,125,24,29,197,93,0,0         ; vbroadcastss  0x5dc5(%rip),%ymm11        # 785c <_sk_callback_avx+0x232>
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
   DB  196,227,117,74,202,224              ; vblendvps     %ymm14,%ymm2,%ymm1,%ymm1
-  DB  196,226,125,24,21,185,89,0,0        ; vbroadcastss  0x59b9(%rip),%ymm2        # 7474 <_sk_callback_avx+0x22e>
+  DB  196,226,125,24,21,173,93,0,0        ; vbroadcastss  0x5dad(%rip),%ymm2        # 7858 <_sk_callback_avx+0x22e>
   DB  196,65,12,87,246                    ; vxorps        %ymm14,%ymm14,%ymm14
   DB  196,227,13,74,210,208               ; vblendvps     %ymm13,%ymm2,%ymm14,%ymm2
   DB  197,188,194,192,0                   ; vcmpeqps      %ymm0,%ymm8,%ymm0
   DB  196,193,108,88,212                  ; vaddps        %ymm12,%ymm2,%ymm2
   DB  196,227,117,74,194,0                ; vblendvps     %ymm0,%ymm2,%ymm1,%ymm0
   DB  196,193,60,88,201                   ; vaddps        %ymm9,%ymm8,%ymm1
-  DB  196,98,125,24,37,160,89,0,0         ; vbroadcastss  0x59a0(%rip),%ymm12        # 7484 <_sk_callback_avx+0x23e>
+  DB  196,98,125,24,37,148,93,0,0         ; vbroadcastss  0x5d94(%rip),%ymm12        # 7868 <_sk_callback_avx+0x23e>
   DB  196,193,116,89,212                  ; vmulps        %ymm12,%ymm1,%ymm2
   DB  197,28,194,226,1                    ; vcmpltps      %ymm2,%ymm12,%ymm12
   DB  196,65,36,92,216                    ; vsubps        %ymm8,%ymm11,%ymm11
@@ -7514,7 +7793,7 @@
   DB  197,172,94,201                      ; vdivps        %ymm1,%ymm10,%ymm1
   DB  196,195,125,74,198,128              ; vblendvps     %ymm8,%ymm14,%ymm0,%ymm0
   DB  196,195,117,74,206,128              ; vblendvps     %ymm8,%ymm14,%ymm1,%ymm1
-  DB  196,98,125,24,5,99,89,0,0           ; vbroadcastss  0x5963(%rip),%ymm8        # 7480 <_sk_callback_avx+0x23a>
+  DB  196,98,125,24,5,87,93,0,0           ; vbroadcastss  0x5d57(%rip),%ymm8        # 7864 <_sk_callback_avx+0x23a>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -7529,7 +7808,7 @@
   DB  197,252,17,28,36                    ; vmovups       %ymm3,(%rsp)
   DB  197,252,40,225                      ; vmovaps       %ymm1,%ymm4
   DB  197,252,40,216                      ; vmovaps       %ymm0,%ymm3
-  DB  196,98,125,24,5,42,89,0,0           ; vbroadcastss  0x592a(%rip),%ymm8        # 7488 <_sk_callback_avx+0x242>
+  DB  196,98,125,24,5,30,93,0,0           ; vbroadcastss  0x5d1e(%rip),%ymm8        # 786c <_sk_callback_avx+0x242>
   DB  197,60,194,202,2                    ; vcmpleps      %ymm2,%ymm8,%ymm9
   DB  197,92,89,210                       ; vmulps        %ymm2,%ymm4,%ymm10
   DB  196,65,92,92,218                    ; vsubps        %ymm10,%ymm4,%ymm11
@@ -7537,23 +7816,23 @@
   DB  197,52,88,210                       ; vaddps        %ymm2,%ymm9,%ymm10
   DB  197,108,88,202                      ; vaddps        %ymm2,%ymm2,%ymm9
   DB  196,65,52,92,202                    ; vsubps        %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,29,4,89,0,0           ; vbroadcastss  0x5904(%rip),%ymm11        # 748c <_sk_callback_avx+0x246>
+  DB  196,98,125,24,29,248,92,0,0         ; vbroadcastss  0x5cf8(%rip),%ymm11        # 7870 <_sk_callback_avx+0x246>
   DB  196,65,100,88,219                   ; vaddps        %ymm11,%ymm3,%ymm11
   DB  196,67,125,8,227,1                  ; vroundps      $0x1,%ymm11,%ymm12
   DB  196,65,36,92,252                    ; vsubps        %ymm12,%ymm11,%ymm15
   DB  196,65,44,92,217                    ; vsubps        %ymm9,%ymm10,%ymm11
-  DB  196,98,125,24,37,238,88,0,0         ; vbroadcastss  0x58ee(%rip),%ymm12        # 7494 <_sk_callback_avx+0x24e>
+  DB  196,98,125,24,37,226,92,0,0         ; vbroadcastss  0x5ce2(%rip),%ymm12        # 7878 <_sk_callback_avx+0x24e>
   DB  196,193,4,89,196                    ; vmulps        %ymm12,%ymm15,%ymm0
-  DB  196,98,125,24,45,228,88,0,0         ; vbroadcastss  0x58e4(%rip),%ymm13        # 7498 <_sk_callback_avx+0x252>
+  DB  196,98,125,24,45,216,92,0,0         ; vbroadcastss  0x5cd8(%rip),%ymm13        # 787c <_sk_callback_avx+0x252>
   DB  197,20,92,240                       ; vsubps        %ymm0,%ymm13,%ymm14
   DB  196,65,36,89,246                    ; vmulps        %ymm14,%ymm11,%ymm14
   DB  196,65,52,88,246                    ; vaddps        %ymm14,%ymm9,%ymm14
-  DB  196,226,125,24,13,197,88,0,0        ; vbroadcastss  0x58c5(%rip),%ymm1        # 7490 <_sk_callback_avx+0x24a>
+  DB  196,226,125,24,13,185,92,0,0        ; vbroadcastss  0x5cb9(%rip),%ymm1        # 7874 <_sk_callback_avx+0x24a>
   DB  196,193,116,194,255,2               ; vcmpleps      %ymm15,%ymm1,%ymm7
   DB  196,195,13,74,249,112               ; vblendvps     %ymm7,%ymm9,%ymm14,%ymm7
   DB  196,65,60,194,247,2                 ; vcmpleps      %ymm15,%ymm8,%ymm14
   DB  196,227,45,74,255,224               ; vblendvps     %ymm14,%ymm7,%ymm10,%ymm7
-  DB  196,98,125,24,53,176,88,0,0         ; vbroadcastss  0x58b0(%rip),%ymm14        # 749c <_sk_callback_avx+0x256>
+  DB  196,98,125,24,53,164,92,0,0         ; vbroadcastss  0x5ca4(%rip),%ymm14        # 7880 <_sk_callback_avx+0x256>
   DB  196,65,12,194,255,2                 ; vcmpleps      %ymm15,%ymm14,%ymm15
   DB  196,193,124,89,195                  ; vmulps        %ymm11,%ymm0,%ymm0
   DB  197,180,88,192                      ; vaddps        %ymm0,%ymm9,%ymm0
@@ -7572,7 +7851,7 @@
   DB  197,164,89,247                      ; vmulps        %ymm7,%ymm11,%ymm6
   DB  197,180,88,246                      ; vaddps        %ymm6,%ymm9,%ymm6
   DB  196,227,77,74,237,0                 ; vblendvps     %ymm0,%ymm5,%ymm6,%ymm5
-  DB  196,226,125,24,5,82,88,0,0          ; vbroadcastss  0x5852(%rip),%ymm0        # 74a0 <_sk_callback_avx+0x25a>
+  DB  196,226,125,24,5,70,92,0,0          ; vbroadcastss  0x5c46(%rip),%ymm0        # 7884 <_sk_callback_avx+0x25a>
   DB  197,228,88,192                      ; vaddps        %ymm0,%ymm3,%ymm0
   DB  196,227,125,8,216,1                 ; vroundps      $0x1,%ymm0,%ymm3
   DB  197,252,92,195                      ; vsubps        %ymm3,%ymm0,%ymm0
@@ -7618,15 +7897,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,74                              ; jne           1d4b <_sk_scale_u8_avx+0x54>
+  DB  117,74                              ; jne           1d3b <_sk_scale_u8_avx+0x54>
   DB  196,66,121,48,4,19                  ; vpmovzxbw     (%r11,%rdx,1),%xmm8
-  DB  197,57,219,5,49,91,0,0              ; vpand         0x5b31(%rip),%xmm8,%xmm8        # 7840 <_sk_callback_avx+0x5fa>
+  DB  197,57,219,5,49,95,0,0              ; vpand         0x5f31(%rip),%xmm8,%xmm8        # 7c30 <_sk_callback_avx+0x606>
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  196,65,57,105,201                   ; vpunpckhwd    %xmm9,%xmm8,%xmm9
   DB  196,66,121,51,192                   ; vpmovzxwd     %xmm8,%xmm8
   DB  196,67,61,24,193,1                  ; vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,114,87,0,0         ; vbroadcastss  0x5772(%rip),%ymm9        # 74a4 <_sk_callback_avx+0x25e>
+  DB  196,98,125,24,13,102,91,0,0         ; vbroadcastss  0x5b66(%rip),%ymm9        # 7888 <_sk_callback_avx+0x25e>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -7639,15 +7918,15 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,167                             ; ja            1d07 <_sk_scale_u8_avx+0x10>
+  DB  119,167                             ; ja            1cf7 <_sk_scale_u8_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 1de4 <_sk_scale_u8_avx+0xed>
+  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 1dd4 <_sk_scale_u8_avx+0xed>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  235,136                             ; jmp           1d07 <_sk_scale_u8_avx+0x10>
+  DB  235,136                             ; jmp           1cf7 <_sk_scale_u8_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,2                    ; vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -7655,7 +7934,7 @@
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,57,14,193,3                  ; vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  DB  233,95,255,255,255                  ; jmpq          1d07 <_sk_scale_u8_avx+0x10>
+  DB  233,95,255,255,255                  ; jmpq          1cf7 <_sk_scale_u8_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,6                    ; vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -7666,7 +7945,7 @@
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,49,14,192,240                ; vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  DB  233,35,255,255,255                  ; jmpq          1d07 <_sk_scale_u8_avx+0x10>
+  DB  233,35,255,255,255                  ; jmpq          1cf7 <_sk_scale_u8_avx+0x10>
   DB  144                                 ; nop
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -7712,15 +7991,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,110                             ; jne           1eb7 <_sk_lerp_u8_avx+0x78>
+  DB  117,110                             ; jne           1ea7 <_sk_lerp_u8_avx+0x78>
   DB  196,66,121,48,4,19                  ; vpmovzxbw     (%r11,%rdx,1),%xmm8
-  DB  197,57,219,5,249,89,0,0             ; vpand         0x59f9(%rip),%xmm8,%xmm8        # 7850 <_sk_callback_avx+0x60a>
+  DB  197,57,219,5,249,93,0,0             ; vpand         0x5df9(%rip),%xmm8,%xmm8        # 7c40 <_sk_callback_avx+0x616>
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  196,65,57,105,201                   ; vpunpckhwd    %xmm9,%xmm8,%xmm9
   DB  196,66,121,51,192                   ; vpmovzxwd     %xmm8,%xmm8
   DB  196,67,61,24,193,1                  ; vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,46,86,0,0          ; vbroadcastss  0x562e(%rip),%ymm9        # 74a8 <_sk_callback_avx+0x262>
+  DB  196,98,125,24,13,34,90,0,0          ; vbroadcastss  0x5a22(%rip),%ymm9        # 788c <_sk_callback_avx+0x262>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
@@ -7741,15 +8020,15 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,131                             ; ja            1e4f <_sk_lerp_u8_avx+0x10>
+  DB  119,131                             ; ja            1e3f <_sk_lerp_u8_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,125,0,0,0                 ; lea           0x7d(%rip),%r10        # 1f54 <_sk_lerp_u8_avx+0x115>
+  DB  76,141,21,125,0,0,0                 ; lea           0x7d(%rip),%r10        # 1f44 <_sk_lerp_u8_avx+0x115>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  233,97,255,255,255                  ; jmpq          1e4f <_sk_lerp_u8_avx+0x10>
+  DB  233,97,255,255,255                  ; jmpq          1e3f <_sk_lerp_u8_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,2                    ; vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -7757,7 +8036,7 @@
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,57,14,193,3                  ; vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  DB  233,56,255,255,255                  ; jmpq          1e4f <_sk_lerp_u8_avx+0x10>
+  DB  233,56,255,255,255                  ; jmpq          1e3f <_sk_lerp_u8_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,6                    ; vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -7768,7 +8047,7 @@
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,49,14,192,240                ; vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  DB  233,252,254,255,255                 ; jmpq          1e4f <_sk_lerp_u8_avx+0x10>
+  DB  233,252,254,255,255                 ; jmpq          1e3f <_sk_lerp_u8_avx+0x10>
   DB  144                                 ; nop
   DB  140,255                             ; mov           %?,%edi
   DB  255                                 ; (bad)
@@ -7776,7 +8055,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,222                 ; jmpq          ffffffffdf001f64 <_sk_callback_avx+0xffffffffdeffad1e>
+  DB  233,255,255,255,222                 ; jmpq          ffffffffdf001f54 <_sk_callback_avx+0xffffffffdeffa92a>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,211                             ; callq         *%rbx
@@ -7792,26 +8071,26 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,208,0,0,0                    ; jne           204e <_sk_lerp_565_avx+0xde>
+  DB  15,133,208,0,0,0                    ; jne           203e <_sk_lerp_565_avx+0xde>
   DB  196,65,122,111,4,83                 ; vmovdqu       (%r11,%rdx,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  196,65,57,105,201                   ; vpunpckhwd    %xmm9,%xmm8,%xmm9
   DB  196,66,121,51,192                   ; vpmovzxwd     %xmm8,%xmm8
   DB  196,67,61,24,193,1                  ; vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,10,85,0,0          ; vbroadcastss  0x550a(%rip),%ymm9        # 74ac <_sk_callback_avx+0x266>
+  DB  196,98,125,24,13,254,88,0,0         ; vbroadcastss  0x58fe(%rip),%ymm9        # 7890 <_sk_callback_avx+0x266>
   DB  196,65,60,84,201                    ; vandps        %ymm9,%ymm8,%ymm9
   DB  196,65,124,91,201                   ; vcvtdq2ps     %ymm9,%ymm9
-  DB  196,98,125,24,21,251,84,0,0         ; vbroadcastss  0x54fb(%rip),%ymm10        # 74b0 <_sk_callback_avx+0x26a>
+  DB  196,98,125,24,21,239,88,0,0         ; vbroadcastss  0x58ef(%rip),%ymm10        # 7894 <_sk_callback_avx+0x26a>
   DB  196,65,52,89,202                    ; vmulps        %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,21,241,84,0,0         ; vbroadcastss  0x54f1(%rip),%ymm10        # 74b4 <_sk_callback_avx+0x26e>
+  DB  196,98,125,24,21,229,88,0,0         ; vbroadcastss  0x58e5(%rip),%ymm10        # 7898 <_sk_callback_avx+0x26e>
   DB  196,65,60,84,210                    ; vandps        %ymm10,%ymm8,%ymm10
   DB  196,65,124,91,210                   ; vcvtdq2ps     %ymm10,%ymm10
-  DB  196,98,125,24,29,226,84,0,0         ; vbroadcastss  0x54e2(%rip),%ymm11        # 74b8 <_sk_callback_avx+0x272>
+  DB  196,98,125,24,29,214,88,0,0         ; vbroadcastss  0x58d6(%rip),%ymm11        # 789c <_sk_callback_avx+0x272>
   DB  196,65,44,89,211                    ; vmulps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,24,29,216,84,0,0         ; vbroadcastss  0x54d8(%rip),%ymm11        # 74bc <_sk_callback_avx+0x276>
+  DB  196,98,125,24,29,204,88,0,0         ; vbroadcastss  0x58cc(%rip),%ymm11        # 78a0 <_sk_callback_avx+0x276>
   DB  196,65,60,84,195                    ; vandps        %ymm11,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,29,201,84,0,0         ; vbroadcastss  0x54c9(%rip),%ymm11        # 74c0 <_sk_callback_avx+0x27a>
+  DB  196,98,125,24,29,189,88,0,0         ; vbroadcastss  0x58bd(%rip),%ymm11        # 78a4 <_sk_callback_avx+0x27a>
   DB  196,65,60,89,195                    ; vmulps        %ymm11,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
@@ -7838,27 +8117,27 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,29,255,255,255               ; ja            1f84 <_sk_lerp_565_avx+0x14>
+  DB  15,135,29,255,255,255               ; ja            1f74 <_sk_lerp_565_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,102,0,0,0                 ; lea           0x66(%rip),%r10        # 20d8 <_sk_lerp_565_avx+0x168>
+  DB  76,141,21,102,0,0,0                 ; lea           0x66(%rip),%r10        # 20c8 <_sk_lerp_565_avx+0x168>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  233,251,254,255,255                 ; jmpq          1f84 <_sk_lerp_565_avx+0x14>
+  DB  233,251,254,255,255                 ; jmpq          1f74 <_sk_lerp_565_avx+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,65,57,196,68,83,4,2             ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,121,110,12,83                ; vmovd         (%r11,%rdx,2),%xmm9
   DB  196,67,57,14,193,3                  ; vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  DB  233,221,254,255,255                 ; jmpq          1f84 <_sk_lerp_565_avx+0x14>
+  DB  233,221,254,255,255                 ; jmpq          1f74 <_sk_lerp_565_avx+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,65,57,196,68,83,12,6            ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,57,196,68,83,10,5            ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,57,196,68,83,8,4             ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,122,126,12,83                ; vmovq         (%r11,%rdx,2),%xmm9
   DB  196,67,49,14,192,240                ; vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  DB  233,175,254,255,255                 ; jmpq          1f84 <_sk_lerp_565_avx+0x14>
+  DB  233,175,254,255,255                 ; jmpq          1f74 <_sk_lerp_565_avx+0x14>
   DB  15,31,0                             ; nopl          (%rax)
   DB  163,255,255,255,190,255,255,255,177 ; movabs        %eax,0xb1ffffffbeffffff
   DB  255                                 ; (bad)
@@ -7888,9 +8167,9 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,251,1,0,0                    ; jne           2312 <_sk_load_tables_avx+0x21e>
+  DB  15,133,251,1,0,0                    ; jne           2302 <_sk_load_tables_avx+0x21e>
   DB  196,65,124,16,18                    ; vmovups       (%r10),%ymm10
-  DB  197,124,40,13,92,88,0,0             ; vmovaps       0x585c(%rip),%ymm9        # 7980 <_sk_callback_avx+0x73a>
+  DB  197,124,40,13,204,92,0,0            ; vmovaps       0x5ccc(%rip),%ymm9        # 7de0 <_sk_callback_avx+0x7b6>
   DB  196,193,44,84,201                   ; vandps        %ymm9,%ymm10,%ymm1
   DB  196,227,125,25,200,1                ; vextractf128  $0x1,%ymm1,%xmm0
   DB  196,193,249,126,195                 ; vmovq         %xmm0,%r11
@@ -7982,7 +8261,7 @@
   DB  196,193,65,114,208,24               ; vpsrld        $0x18,%xmm8,%xmm7
   DB  196,227,101,24,223,1                ; vinsertf128   $0x1,%xmm7,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,226,125,24,61,199,81,0,0        ; vbroadcastss  0x51c7(%rip),%ymm7        # 74c4 <_sk_callback_avx+0x27e>
+  DB  196,226,125,24,61,187,85,0,0        ; vbroadcastss  0x55bb(%rip),%ymm7        # 78a8 <_sk_callback_avx+0x27e>
   DB  197,228,89,223                      ; vmulps        %ymm7,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -7997,13 +8276,13 @@
   DB  73,211,235                          ; shr           %cl,%r11
   DB  196,193,249,110,195                 ; vmovq         %r11,%xmm0
   DB  196,226,121,48,192                  ; vpmovzxbw     %xmm0,%xmm0
-  DB  196,226,121,0,13,38,85,0,0          ; vpshufb       0x5526(%rip),%xmm0,%xmm1        # 7860 <_sk_callback_avx+0x61a>
+  DB  196,226,121,0,13,38,89,0,0          ; vpshufb       0x5926(%rip),%xmm0,%xmm1        # 7c50 <_sk_callback_avx+0x626>
   DB  196,226,121,33,201                  ; vpmovsxbd     %xmm1,%xmm1
-  DB  196,226,121,0,5,40,85,0,0           ; vpshufb       0x5528(%rip),%xmm0,%xmm0        # 7870 <_sk_callback_avx+0x62a>
+  DB  196,226,121,0,5,40,89,0,0           ; vpshufb       0x5928(%rip),%xmm0,%xmm0        # 7c60 <_sk_callback_avx+0x636>
   DB  196,226,121,33,192                  ; vpmovsxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  196,66,125,44,18                    ; vmaskmovps    (%r10),%ymm0,%ymm10
-  DB  233,191,253,255,255                 ; jmpq          211c <_sk_load_tables_avx+0x28>
+  DB  233,191,253,255,255                 ; jmpq          210c <_sk_load_tables_avx+0x28>
 
 PUBLIC _sk_load_tables_u16_be_avx
 _sk_load_tables_u16_be_avx LABEL PROC
@@ -8013,7 +8292,7 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  77,133,192                          ; test          %r8,%r8
   DB  197,252,17,60,36                    ; vmovups       %ymm7,(%rsp)
-  DB  15,133,87,2,0,0                     ; jne           25d3 <_sk_load_tables_u16_be_avx+0x276>
+  DB  15,133,87,2,0,0                     ; jne           25c3 <_sk_load_tables_u16_be_avx+0x276>
   DB  196,1,121,16,4,81                   ; vmovupd       (%r9,%r10,2),%xmm8
   DB  196,129,121,16,84,81,16             ; vmovupd       0x10(%r9,%r10,2),%xmm2
   DB  196,129,121,16,92,81,32             ; vmovupd       0x20(%r9,%r10,2),%xmm3
@@ -8028,7 +8307,7 @@
   DB  197,113,105,219                     ; vpunpckhwd    %xmm3,%xmm1,%xmm11
   DB  197,177,108,200                     ; vpunpcklqdq   %xmm0,%xmm9,%xmm1
   DB  197,49,109,224                      ; vpunpckhqdq   %xmm0,%xmm9,%xmm12
-  DB  197,121,111,21,183,84,0,0           ; vmovdqa       0x54b7(%rip),%xmm10        # 7880 <_sk_callback_avx+0x63a>
+  DB  197,121,111,21,183,88,0,0           ; vmovdqa       0x58b7(%rip),%xmm10        # 7c70 <_sk_callback_avx+0x646>
   DB  196,193,113,219,202                 ; vpand         %xmm10,%xmm1,%xmm1
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  196,193,113,105,209                 ; vpunpckhwd    %xmm9,%xmm1,%xmm2
@@ -8126,7 +8405,7 @@
   DB  196,226,121,51,219                  ; vpmovzxwd     %xmm3,%xmm3
   DB  196,227,101,24,223,1                ; vinsertf128   $0x1,%xmm7,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,226,125,24,61,6,79,0,0          ; vbroadcastss  0x4f06(%rip),%ymm7        # 74c8 <_sk_callback_avx+0x282>
+  DB  196,226,125,24,61,250,82,0,0        ; vbroadcastss  0x52fa(%rip),%ymm7        # 78ac <_sk_callback_avx+0x282>
   DB  197,228,89,223                      ; vmulps        %ymm7,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,16,60,36                    ; vmovups       (%rsp),%ymm7
@@ -8135,29 +8414,29 @@
   DB  196,1,123,16,4,81                   ; vmovsd        (%r9,%r10,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,85                              ; je            2639 <_sk_load_tables_u16_be_avx+0x2dc>
+  DB  116,85                              ; je            2629 <_sk_load_tables_u16_be_avx+0x2dc>
   DB  196,1,57,22,68,81,8                 ; vmovhpd       0x8(%r9,%r10,2),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,72                              ; jb            2639 <_sk_load_tables_u16_be_avx+0x2dc>
+  DB  114,72                              ; jb            2629 <_sk_load_tables_u16_be_avx+0x2dc>
   DB  196,129,123,16,84,81,16             ; vmovsd        0x10(%r9,%r10,2),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,72                              ; je            2646 <_sk_load_tables_u16_be_avx+0x2e9>
+  DB  116,72                              ; je            2636 <_sk_load_tables_u16_be_avx+0x2e9>
   DB  196,129,105,22,84,81,24             ; vmovhpd       0x18(%r9,%r10,2),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,59                              ; jb            2646 <_sk_load_tables_u16_be_avx+0x2e9>
+  DB  114,59                              ; jb            2636 <_sk_load_tables_u16_be_avx+0x2e9>
   DB  196,129,123,16,92,81,32             ; vmovsd        0x20(%r9,%r10,2),%xmm3
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,123,253,255,255              ; je            2397 <_sk_load_tables_u16_be_avx+0x3a>
+  DB  15,132,123,253,255,255              ; je            2387 <_sk_load_tables_u16_be_avx+0x3a>
   DB  196,129,97,22,92,81,40              ; vmovhpd       0x28(%r9,%r10,2),%xmm3,%xmm3
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,106,253,255,255              ; jb            2397 <_sk_load_tables_u16_be_avx+0x3a>
+  DB  15,130,106,253,255,255              ; jb            2387 <_sk_load_tables_u16_be_avx+0x3a>
   DB  196,1,122,126,76,81,48              ; vmovq         0x30(%r9,%r10,2),%xmm9
-  DB  233,94,253,255,255                  ; jmpq          2397 <_sk_load_tables_u16_be_avx+0x3a>
+  DB  233,94,253,255,255                  ; jmpq          2387 <_sk_load_tables_u16_be_avx+0x3a>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,81,253,255,255                  ; jmpq          2397 <_sk_load_tables_u16_be_avx+0x3a>
+  DB  233,81,253,255,255                  ; jmpq          2387 <_sk_load_tables_u16_be_avx+0x3a>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,72,253,255,255                  ; jmpq          2397 <_sk_load_tables_u16_be_avx+0x3a>
+  DB  233,72,253,255,255                  ; jmpq          2387 <_sk_load_tables_u16_be_avx+0x3a>
 
 PUBLIC _sk_load_tables_rgb_u16_be_avx
 _sk_load_tables_rgb_u16_be_avx LABEL PROC
@@ -8168,7 +8447,7 @@
   DB  77,133,192                          ; test          %r8,%r8
   DB  197,252,17,124,36,32                ; vmovups       %ymm7,0x20(%rsp)
   DB  197,252,17,52,36                    ; vmovups       %ymm6,(%rsp)
-  DB  15,133,74,2,0,0                     ; jne           28ba <_sk_load_tables_rgb_u16_be_avx+0x26b>
+  DB  15,133,74,2,0,0                     ; jne           28aa <_sk_load_tables_rgb_u16_be_avx+0x26b>
   DB  196,129,122,111,4,81                ; vmovdqu       (%r9,%r10,2),%xmm0
   DB  196,129,122,111,84,81,12            ; vmovdqu       0xc(%r9,%r10,2),%xmm2
   DB  196,129,122,111,76,81,24            ; vmovdqu       0x18(%r9,%r10,2),%xmm1
@@ -8189,7 +8468,7 @@
   DB  197,185,108,218                     ; vpunpcklqdq   %xmm2,%xmm8,%xmm3
   DB  197,57,109,218                      ; vpunpckhqdq   %xmm2,%xmm8,%xmm11
   DB  197,121,108,193                     ; vpunpcklqdq   %xmm1,%xmm0,%xmm8
-  DB  197,121,111,13,182,81,0,0           ; vmovdqa       0x51b6(%rip),%xmm9        # 7890 <_sk_callback_avx+0x64a>
+  DB  197,121,111,13,182,85,0,0           ; vmovdqa       0x55b6(%rip),%xmm9        # 7c80 <_sk_callback_avx+0x656>
   DB  196,193,97,219,193                  ; vpand         %xmm9,%xmm3,%xmm0
   DB  196,65,41,239,210                   ; vpxor         %xmm10,%xmm10,%xmm10
   DB  196,193,121,105,202                 ; vpunpckhwd    %xmm10,%xmm0,%xmm1
@@ -8279,7 +8558,7 @@
   DB  196,195,105,33,211,48               ; vinsertps     $0x30,%xmm11,%xmm2,%xmm2
   DB  196,227,109,24,211,1                ; vinsertf128   $0x1,%xmm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,35,76,0,0         ; vbroadcastss  0x4c23(%rip),%ymm3        # 74cc <_sk_callback_avx+0x286>
+  DB  196,226,125,24,29,23,80,0,0         ; vbroadcastss  0x5017(%rip),%ymm3        # 78b0 <_sk_callback_avx+0x286>
   DB  197,252,16,52,36                    ; vmovups       (%rsp),%ymm6
   DB  197,252,16,124,36,32                ; vmovups       0x20(%rsp),%ymm7
   DB  72,131,196,88                       ; add           $0x58,%rsp
@@ -8287,41 +8566,41 @@
   DB  196,129,121,110,4,81                ; vmovd         (%r9,%r10,2),%xmm0
   DB  196,129,121,196,68,81,4,2           ; vpinsrw       $0x2,0x4(%r9,%r10,2),%xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,5                               ; jne           28d3 <_sk_load_tables_rgb_u16_be_avx+0x284>
-  DB  233,209,253,255,255                 ; jmpq          26a4 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  117,5                               ; jne           28c3 <_sk_load_tables_rgb_u16_be_avx+0x284>
+  DB  233,209,253,255,255                 ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
   DB  196,129,121,110,76,81,6             ; vmovd         0x6(%r9,%r10,2),%xmm1
   DB  196,1,113,196,68,81,10,2            ; vpinsrw       $0x2,0xa(%r9,%r10,2),%xmm1,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,26                              ; jb            2902 <_sk_load_tables_rgb_u16_be_avx+0x2b3>
+  DB  114,26                              ; jb            28f2 <_sk_load_tables_rgb_u16_be_avx+0x2b3>
   DB  196,129,121,110,76,81,12            ; vmovd         0xc(%r9,%r10,2),%xmm1
   DB  196,129,113,196,84,81,16,2          ; vpinsrw       $0x2,0x10(%r9,%r10,2),%xmm1,%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  117,10                              ; jne           2907 <_sk_load_tables_rgb_u16_be_avx+0x2b8>
-  DB  233,162,253,255,255                 ; jmpq          26a4 <_sk_load_tables_rgb_u16_be_avx+0x55>
-  DB  233,157,253,255,255                 ; jmpq          26a4 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  117,10                              ; jne           28f7 <_sk_load_tables_rgb_u16_be_avx+0x2b8>
+  DB  233,162,253,255,255                 ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  233,157,253,255,255                 ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
   DB  196,129,121,110,76,81,18            ; vmovd         0x12(%r9,%r10,2),%xmm1
   DB  196,1,113,196,76,81,22,2            ; vpinsrw       $0x2,0x16(%r9,%r10,2),%xmm1,%xmm9
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,26                              ; jb            2936 <_sk_load_tables_rgb_u16_be_avx+0x2e7>
+  DB  114,26                              ; jb            2926 <_sk_load_tables_rgb_u16_be_avx+0x2e7>
   DB  196,129,121,110,76,81,24            ; vmovd         0x18(%r9,%r10,2),%xmm1
   DB  196,129,113,196,76,81,28,2          ; vpinsrw       $0x2,0x1c(%r9,%r10,2),%xmm1,%xmm1
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  117,10                              ; jne           293b <_sk_load_tables_rgb_u16_be_avx+0x2ec>
-  DB  233,110,253,255,255                 ; jmpq          26a4 <_sk_load_tables_rgb_u16_be_avx+0x55>
-  DB  233,105,253,255,255                 ; jmpq          26a4 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  117,10                              ; jne           292b <_sk_load_tables_rgb_u16_be_avx+0x2ec>
+  DB  233,110,253,255,255                 ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  233,105,253,255,255                 ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
   DB  196,129,121,110,92,81,30            ; vmovd         0x1e(%r9,%r10,2),%xmm3
   DB  196,1,97,196,92,81,34,2             ; vpinsrw       $0x2,0x22(%r9,%r10,2),%xmm3,%xmm11
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,20                              ; jb            2964 <_sk_load_tables_rgb_u16_be_avx+0x315>
+  DB  114,20                              ; jb            2954 <_sk_load_tables_rgb_u16_be_avx+0x315>
   DB  196,129,121,110,92,81,36            ; vmovd         0x24(%r9,%r10,2),%xmm3
   DB  196,129,97,196,92,81,40,2           ; vpinsrw       $0x2,0x28(%r9,%r10,2),%xmm3,%xmm3
-  DB  233,64,253,255,255                  ; jmpq          26a4 <_sk_load_tables_rgb_u16_be_avx+0x55>
-  DB  233,59,253,255,255                  ; jmpq          26a4 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  233,64,253,255,255                  ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  233,59,253,255,255                  ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
 
 PUBLIC _sk_byte_tables_avx
 _sk_byte_tables_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,92,75,0,0           ; vbroadcastss  0x4b5c(%rip),%ymm8        # 74d0 <_sk_callback_avx+0x28a>
+  DB  196,98,125,24,5,80,79,0,0           ; vbroadcastss  0x4f50(%rip),%ymm8        # 78b4 <_sk_callback_avx+0x28a>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  197,125,91,200                      ; vcvtps2dq     %ymm0,%ymm9
   DB  196,65,249,126,201                  ; vmovq         %xmm9,%r9
@@ -8440,7 +8719,7 @@
   DB  196,194,121,49,204                  ; vpmovzxbd     %xmm12,%xmm1
   DB  196,194,121,49,213                  ; vpmovzxbd     %xmm13,%xmm2
   DB  196,227,117,24,202,1                ; vinsertf128   $0x1,%xmm2,%ymm1,%ymm1
-  DB  196,98,125,24,13,6,73,0,0           ; vbroadcastss  0x4906(%rip),%ymm9        # 74d4 <_sk_callback_avx+0x28e>
+  DB  196,98,125,24,13,250,76,0,0         ; vbroadcastss  0x4cfa(%rip),%ymm9        # 78b8 <_sk_callback_avx+0x28e>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,201                  ; vmulps        %ymm9,%ymm1,%ymm1
@@ -8554,7 +8833,7 @@
   DB  196,194,121,49,203                  ; vpmovzxbd     %xmm11,%xmm1
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,231,70,0,0         ; vbroadcastss  0x46e7(%rip),%ymm9        # 74d8 <_sk_callback_avx+0x292>
+  DB  196,98,125,24,13,219,74,0,0         ; vbroadcastss  0x4adb(%rip),%ymm9        # 78bc <_sk_callback_avx+0x292>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,194,121,49,202                  ; vpmovzxbd     %xmm10,%xmm1
   DB  196,194,121,49,212                  ; vpmovzxbd     %xmm12,%xmm2
@@ -8749,36 +9028,36 @@
   DB  196,193,124,88,195                  ; vaddps        %ymm11,%ymm0,%ymm0
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,216                      ; vcvtdq2ps     %ymm0,%ymm11
-  DB  196,98,125,24,37,148,67,0,0         ; vbroadcastss  0x4394(%rip),%ymm12        # 74dc <_sk_callback_avx+0x296>
+  DB  196,98,125,24,37,136,71,0,0         ; vbroadcastss  0x4788(%rip),%ymm12        # 78c0 <_sk_callback_avx+0x296>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,138,67,0,0         ; vbroadcastss  0x438a(%rip),%ymm12        # 74e0 <_sk_callback_avx+0x29a>
+  DB  196,98,125,24,37,126,71,0,0         ; vbroadcastss  0x477e(%rip),%ymm12        # 78c4 <_sk_callback_avx+0x29a>
   DB  196,193,124,84,196                  ; vandps        %ymm12,%ymm0,%ymm0
-  DB  196,98,125,24,37,128,67,0,0         ; vbroadcastss  0x4380(%rip),%ymm12        # 74e4 <_sk_callback_avx+0x29e>
+  DB  196,98,125,24,37,116,71,0,0         ; vbroadcastss  0x4774(%rip),%ymm12        # 78c8 <_sk_callback_avx+0x29e>
   DB  196,193,124,86,196                  ; vorps         %ymm12,%ymm0,%ymm0
-  DB  196,98,125,24,37,118,67,0,0         ; vbroadcastss  0x4376(%rip),%ymm12        # 74e8 <_sk_callback_avx+0x2a2>
+  DB  196,98,125,24,37,106,71,0,0         ; vbroadcastss  0x476a(%rip),%ymm12        # 78cc <_sk_callback_avx+0x2a2>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,108,67,0,0         ; vbroadcastss  0x436c(%rip),%ymm12        # 74ec <_sk_callback_avx+0x2a6>
+  DB  196,98,125,24,37,96,71,0,0          ; vbroadcastss  0x4760(%rip),%ymm12        # 78d0 <_sk_callback_avx+0x2a6>
   DB  196,65,124,89,228                   ; vmulps        %ymm12,%ymm0,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,93,67,0,0          ; vbroadcastss  0x435d(%rip),%ymm12        # 74f0 <_sk_callback_avx+0x2aa>
+  DB  196,98,125,24,37,81,71,0,0          ; vbroadcastss  0x4751(%rip),%ymm12        # 78d4 <_sk_callback_avx+0x2aa>
   DB  196,193,124,88,196                  ; vaddps        %ymm12,%ymm0,%ymm0
-  DB  196,98,125,24,37,83,67,0,0          ; vbroadcastss  0x4353(%rip),%ymm12        # 74f4 <_sk_callback_avx+0x2ae>
+  DB  196,98,125,24,37,71,71,0,0          ; vbroadcastss  0x4747(%rip),%ymm12        # 78d8 <_sk_callback_avx+0x2ae>
   DB  197,156,94,192                      ; vdivps        %ymm0,%ymm12,%ymm0
   DB  197,164,92,192                      ; vsubps        %ymm0,%ymm11,%ymm0
   DB  197,172,89,192                      ; vmulps        %ymm0,%ymm10,%ymm0
   DB  196,99,125,8,208,1                  ; vroundps      $0x1,%ymm0,%ymm10
   DB  196,65,124,92,210                   ; vsubps        %ymm10,%ymm0,%ymm10
-  DB  196,98,125,24,29,55,67,0,0          ; vbroadcastss  0x4337(%rip),%ymm11        # 74f8 <_sk_callback_avx+0x2b2>
+  DB  196,98,125,24,29,43,71,0,0          ; vbroadcastss  0x472b(%rip),%ymm11        # 78dc <_sk_callback_avx+0x2b2>
   DB  196,193,124,88,195                  ; vaddps        %ymm11,%ymm0,%ymm0
-  DB  196,98,125,24,29,45,67,0,0          ; vbroadcastss  0x432d(%rip),%ymm11        # 74fc <_sk_callback_avx+0x2b6>
+  DB  196,98,125,24,29,33,71,0,0          ; vbroadcastss  0x4721(%rip),%ymm11        # 78e0 <_sk_callback_avx+0x2b6>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,124,92,195                  ; vsubps        %ymm11,%ymm0,%ymm0
-  DB  196,98,125,24,29,30,67,0,0          ; vbroadcastss  0x431e(%rip),%ymm11        # 7500 <_sk_callback_avx+0x2ba>
+  DB  196,98,125,24,29,18,71,0,0          ; vbroadcastss  0x4712(%rip),%ymm11        # 78e4 <_sk_callback_avx+0x2ba>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,20,67,0,0          ; vbroadcastss  0x4314(%rip),%ymm11        # 7504 <_sk_callback_avx+0x2be>
+  DB  196,98,125,24,29,8,71,0,0           ; vbroadcastss  0x4708(%rip),%ymm11        # 78e8 <_sk_callback_avx+0x2be>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,124,88,194                  ; vaddps        %ymm10,%ymm0,%ymm0
-  DB  196,98,125,24,21,5,67,0,0           ; vbroadcastss  0x4305(%rip),%ymm10        # 7508 <_sk_callback_avx+0x2c2>
+  DB  196,98,125,24,21,249,70,0,0         ; vbroadcastss  0x46f9(%rip),%ymm10        # 78ec <_sk_callback_avx+0x2c2>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,253,91,192                      ; vcvtps2dq     %ymm0,%ymm0
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -8786,7 +9065,7 @@
   DB  196,195,125,74,193,128              ; vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,220,66,0,0          ; vbroadcastss  0x42dc(%rip),%ymm8        # 750c <_sk_callback_avx+0x2c6>
+  DB  196,98,125,24,5,208,70,0,0          ; vbroadcastss  0x46d0(%rip),%ymm8        # 78f0 <_sk_callback_avx+0x2c6>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8806,36 +9085,36 @@
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,217                      ; vcvtdq2ps     %ymm1,%ymm11
-  DB  196,98,125,24,37,141,66,0,0         ; vbroadcastss  0x428d(%rip),%ymm12        # 7510 <_sk_callback_avx+0x2ca>
+  DB  196,98,125,24,37,129,70,0,0         ; vbroadcastss  0x4681(%rip),%ymm12        # 78f4 <_sk_callback_avx+0x2ca>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,131,66,0,0         ; vbroadcastss  0x4283(%rip),%ymm12        # 7514 <_sk_callback_avx+0x2ce>
+  DB  196,98,125,24,37,119,70,0,0         ; vbroadcastss  0x4677(%rip),%ymm12        # 78f8 <_sk_callback_avx+0x2ce>
   DB  196,193,116,84,204                  ; vandps        %ymm12,%ymm1,%ymm1
-  DB  196,98,125,24,37,121,66,0,0         ; vbroadcastss  0x4279(%rip),%ymm12        # 7518 <_sk_callback_avx+0x2d2>
+  DB  196,98,125,24,37,109,70,0,0         ; vbroadcastss  0x466d(%rip),%ymm12        # 78fc <_sk_callback_avx+0x2d2>
   DB  196,193,116,86,204                  ; vorps         %ymm12,%ymm1,%ymm1
-  DB  196,98,125,24,37,111,66,0,0         ; vbroadcastss  0x426f(%rip),%ymm12        # 751c <_sk_callback_avx+0x2d6>
+  DB  196,98,125,24,37,99,70,0,0          ; vbroadcastss  0x4663(%rip),%ymm12        # 7900 <_sk_callback_avx+0x2d6>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,101,66,0,0         ; vbroadcastss  0x4265(%rip),%ymm12        # 7520 <_sk_callback_avx+0x2da>
+  DB  196,98,125,24,37,89,70,0,0          ; vbroadcastss  0x4659(%rip),%ymm12        # 7904 <_sk_callback_avx+0x2da>
   DB  196,65,116,89,228                   ; vmulps        %ymm12,%ymm1,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,86,66,0,0          ; vbroadcastss  0x4256(%rip),%ymm12        # 7524 <_sk_callback_avx+0x2de>
+  DB  196,98,125,24,37,74,70,0,0          ; vbroadcastss  0x464a(%rip),%ymm12        # 7908 <_sk_callback_avx+0x2de>
   DB  196,193,116,88,204                  ; vaddps        %ymm12,%ymm1,%ymm1
-  DB  196,98,125,24,37,76,66,0,0          ; vbroadcastss  0x424c(%rip),%ymm12        # 7528 <_sk_callback_avx+0x2e2>
+  DB  196,98,125,24,37,64,70,0,0          ; vbroadcastss  0x4640(%rip),%ymm12        # 790c <_sk_callback_avx+0x2e2>
   DB  197,156,94,201                      ; vdivps        %ymm1,%ymm12,%ymm1
   DB  197,164,92,201                      ; vsubps        %ymm1,%ymm11,%ymm1
   DB  197,172,89,201                      ; vmulps        %ymm1,%ymm10,%ymm1
   DB  196,99,125,8,209,1                  ; vroundps      $0x1,%ymm1,%ymm10
   DB  196,65,116,92,210                   ; vsubps        %ymm10,%ymm1,%ymm10
-  DB  196,98,125,24,29,48,66,0,0          ; vbroadcastss  0x4230(%rip),%ymm11        # 752c <_sk_callback_avx+0x2e6>
+  DB  196,98,125,24,29,36,70,0,0          ; vbroadcastss  0x4624(%rip),%ymm11        # 7910 <_sk_callback_avx+0x2e6>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,38,66,0,0          ; vbroadcastss  0x4226(%rip),%ymm11        # 7530 <_sk_callback_avx+0x2ea>
+  DB  196,98,125,24,29,26,70,0,0          ; vbroadcastss  0x461a(%rip),%ymm11        # 7914 <_sk_callback_avx+0x2ea>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,116,92,203                  ; vsubps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,23,66,0,0          ; vbroadcastss  0x4217(%rip),%ymm11        # 7534 <_sk_callback_avx+0x2ee>
+  DB  196,98,125,24,29,11,70,0,0          ; vbroadcastss  0x460b(%rip),%ymm11        # 7918 <_sk_callback_avx+0x2ee>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,13,66,0,0          ; vbroadcastss  0x420d(%rip),%ymm11        # 7538 <_sk_callback_avx+0x2f2>
+  DB  196,98,125,24,29,1,70,0,0           ; vbroadcastss  0x4601(%rip),%ymm11        # 791c <_sk_callback_avx+0x2f2>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,116,88,202                  ; vaddps        %ymm10,%ymm1,%ymm1
-  DB  196,98,125,24,21,254,65,0,0         ; vbroadcastss  0x41fe(%rip),%ymm10        # 753c <_sk_callback_avx+0x2f6>
+  DB  196,98,125,24,21,242,69,0,0         ; vbroadcastss  0x45f2(%rip),%ymm10        # 7920 <_sk_callback_avx+0x2f6>
   DB  196,193,116,89,202                  ; vmulps        %ymm10,%ymm1,%ymm1
   DB  197,253,91,201                      ; vcvtps2dq     %ymm1,%ymm1
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -8843,7 +9122,7 @@
   DB  196,195,117,74,201,128              ; vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,116,95,200                  ; vmaxps        %ymm8,%ymm1,%ymm1
-  DB  196,98,125,24,5,213,65,0,0          ; vbroadcastss  0x41d5(%rip),%ymm8        # 7540 <_sk_callback_avx+0x2fa>
+  DB  196,98,125,24,5,201,69,0,0          ; vbroadcastss  0x45c9(%rip),%ymm8        # 7924 <_sk_callback_avx+0x2fa>
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8863,36 +9142,36 @@
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,218                      ; vcvtdq2ps     %ymm2,%ymm11
-  DB  196,98,125,24,37,134,65,0,0         ; vbroadcastss  0x4186(%rip),%ymm12        # 7544 <_sk_callback_avx+0x2fe>
+  DB  196,98,125,24,37,122,69,0,0         ; vbroadcastss  0x457a(%rip),%ymm12        # 7928 <_sk_callback_avx+0x2fe>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,124,65,0,0         ; vbroadcastss  0x417c(%rip),%ymm12        # 7548 <_sk_callback_avx+0x302>
+  DB  196,98,125,24,37,112,69,0,0         ; vbroadcastss  0x4570(%rip),%ymm12        # 792c <_sk_callback_avx+0x302>
   DB  196,193,108,84,212                  ; vandps        %ymm12,%ymm2,%ymm2
-  DB  196,98,125,24,37,114,65,0,0         ; vbroadcastss  0x4172(%rip),%ymm12        # 754c <_sk_callback_avx+0x306>
+  DB  196,98,125,24,37,102,69,0,0         ; vbroadcastss  0x4566(%rip),%ymm12        # 7930 <_sk_callback_avx+0x306>
   DB  196,193,108,86,212                  ; vorps         %ymm12,%ymm2,%ymm2
-  DB  196,98,125,24,37,104,65,0,0         ; vbroadcastss  0x4168(%rip),%ymm12        # 7550 <_sk_callback_avx+0x30a>
+  DB  196,98,125,24,37,92,69,0,0          ; vbroadcastss  0x455c(%rip),%ymm12        # 7934 <_sk_callback_avx+0x30a>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,94,65,0,0          ; vbroadcastss  0x415e(%rip),%ymm12        # 7554 <_sk_callback_avx+0x30e>
+  DB  196,98,125,24,37,82,69,0,0          ; vbroadcastss  0x4552(%rip),%ymm12        # 7938 <_sk_callback_avx+0x30e>
   DB  196,65,108,89,228                   ; vmulps        %ymm12,%ymm2,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,79,65,0,0          ; vbroadcastss  0x414f(%rip),%ymm12        # 7558 <_sk_callback_avx+0x312>
+  DB  196,98,125,24,37,67,69,0,0          ; vbroadcastss  0x4543(%rip),%ymm12        # 793c <_sk_callback_avx+0x312>
   DB  196,193,108,88,212                  ; vaddps        %ymm12,%ymm2,%ymm2
-  DB  196,98,125,24,37,69,65,0,0          ; vbroadcastss  0x4145(%rip),%ymm12        # 755c <_sk_callback_avx+0x316>
+  DB  196,98,125,24,37,57,69,0,0          ; vbroadcastss  0x4539(%rip),%ymm12        # 7940 <_sk_callback_avx+0x316>
   DB  197,156,94,210                      ; vdivps        %ymm2,%ymm12,%ymm2
   DB  197,164,92,210                      ; vsubps        %ymm2,%ymm11,%ymm2
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  196,99,125,8,210,1                  ; vroundps      $0x1,%ymm2,%ymm10
   DB  196,65,108,92,210                   ; vsubps        %ymm10,%ymm2,%ymm10
-  DB  196,98,125,24,29,41,65,0,0          ; vbroadcastss  0x4129(%rip),%ymm11        # 7560 <_sk_callback_avx+0x31a>
+  DB  196,98,125,24,29,29,69,0,0          ; vbroadcastss  0x451d(%rip),%ymm11        # 7944 <_sk_callback_avx+0x31a>
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
-  DB  196,98,125,24,29,31,65,0,0          ; vbroadcastss  0x411f(%rip),%ymm11        # 7564 <_sk_callback_avx+0x31e>
+  DB  196,98,125,24,29,19,69,0,0          ; vbroadcastss  0x4513(%rip),%ymm11        # 7948 <_sk_callback_avx+0x31e>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,108,92,211                  ; vsubps        %ymm11,%ymm2,%ymm2
-  DB  196,98,125,24,29,16,65,0,0          ; vbroadcastss  0x4110(%rip),%ymm11        # 7568 <_sk_callback_avx+0x322>
+  DB  196,98,125,24,29,4,69,0,0           ; vbroadcastss  0x4504(%rip),%ymm11        # 794c <_sk_callback_avx+0x322>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,6,65,0,0           ; vbroadcastss  0x4106(%rip),%ymm11        # 756c <_sk_callback_avx+0x326>
+  DB  196,98,125,24,29,250,68,0,0         ; vbroadcastss  0x44fa(%rip),%ymm11        # 7950 <_sk_callback_avx+0x326>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,108,88,210                  ; vaddps        %ymm10,%ymm2,%ymm2
-  DB  196,98,125,24,21,247,64,0,0         ; vbroadcastss  0x40f7(%rip),%ymm10        # 7570 <_sk_callback_avx+0x32a>
+  DB  196,98,125,24,21,235,68,0,0         ; vbroadcastss  0x44eb(%rip),%ymm10        # 7954 <_sk_callback_avx+0x32a>
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  197,253,91,210                      ; vcvtps2dq     %ymm2,%ymm2
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -8900,7 +9179,7 @@
   DB  196,195,109,74,209,128              ; vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,206,64,0,0          ; vbroadcastss  0x40ce(%rip),%ymm8        # 7574 <_sk_callback_avx+0x32e>
+  DB  196,98,125,24,5,194,68,0,0          ; vbroadcastss  0x44c2(%rip),%ymm8        # 7958 <_sk_callback_avx+0x32e>
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8920,36 +9199,36 @@
   DB  196,193,100,88,219                  ; vaddps        %ymm11,%ymm3,%ymm3
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,219                      ; vcvtdq2ps     %ymm3,%ymm11
-  DB  196,98,125,24,37,127,64,0,0         ; vbroadcastss  0x407f(%rip),%ymm12        # 7578 <_sk_callback_avx+0x332>
+  DB  196,98,125,24,37,115,68,0,0         ; vbroadcastss  0x4473(%rip),%ymm12        # 795c <_sk_callback_avx+0x332>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,117,64,0,0         ; vbroadcastss  0x4075(%rip),%ymm12        # 757c <_sk_callback_avx+0x336>
+  DB  196,98,125,24,37,105,68,0,0         ; vbroadcastss  0x4469(%rip),%ymm12        # 7960 <_sk_callback_avx+0x336>
   DB  196,193,100,84,220                  ; vandps        %ymm12,%ymm3,%ymm3
-  DB  196,98,125,24,37,107,64,0,0         ; vbroadcastss  0x406b(%rip),%ymm12        # 7580 <_sk_callback_avx+0x33a>
+  DB  196,98,125,24,37,95,68,0,0          ; vbroadcastss  0x445f(%rip),%ymm12        # 7964 <_sk_callback_avx+0x33a>
   DB  196,193,100,86,220                  ; vorps         %ymm12,%ymm3,%ymm3
-  DB  196,98,125,24,37,97,64,0,0          ; vbroadcastss  0x4061(%rip),%ymm12        # 7584 <_sk_callback_avx+0x33e>
+  DB  196,98,125,24,37,85,68,0,0          ; vbroadcastss  0x4455(%rip),%ymm12        # 7968 <_sk_callback_avx+0x33e>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,87,64,0,0          ; vbroadcastss  0x4057(%rip),%ymm12        # 7588 <_sk_callback_avx+0x342>
+  DB  196,98,125,24,37,75,68,0,0          ; vbroadcastss  0x444b(%rip),%ymm12        # 796c <_sk_callback_avx+0x342>
   DB  196,65,100,89,228                   ; vmulps        %ymm12,%ymm3,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,72,64,0,0          ; vbroadcastss  0x4048(%rip),%ymm12        # 758c <_sk_callback_avx+0x346>
+  DB  196,98,125,24,37,60,68,0,0          ; vbroadcastss  0x443c(%rip),%ymm12        # 7970 <_sk_callback_avx+0x346>
   DB  196,193,100,88,220                  ; vaddps        %ymm12,%ymm3,%ymm3
-  DB  196,98,125,24,37,62,64,0,0          ; vbroadcastss  0x403e(%rip),%ymm12        # 7590 <_sk_callback_avx+0x34a>
+  DB  196,98,125,24,37,50,68,0,0          ; vbroadcastss  0x4432(%rip),%ymm12        # 7974 <_sk_callback_avx+0x34a>
   DB  197,156,94,219                      ; vdivps        %ymm3,%ymm12,%ymm3
   DB  197,164,92,219                      ; vsubps        %ymm3,%ymm11,%ymm3
   DB  197,172,89,219                      ; vmulps        %ymm3,%ymm10,%ymm3
   DB  196,99,125,8,211,1                  ; vroundps      $0x1,%ymm3,%ymm10
   DB  196,65,100,92,210                   ; vsubps        %ymm10,%ymm3,%ymm10
-  DB  196,98,125,24,29,34,64,0,0          ; vbroadcastss  0x4022(%rip),%ymm11        # 7594 <_sk_callback_avx+0x34e>
+  DB  196,98,125,24,29,22,68,0,0          ; vbroadcastss  0x4416(%rip),%ymm11        # 7978 <_sk_callback_avx+0x34e>
   DB  196,193,100,88,219                  ; vaddps        %ymm11,%ymm3,%ymm3
-  DB  196,98,125,24,29,24,64,0,0          ; vbroadcastss  0x4018(%rip),%ymm11        # 7598 <_sk_callback_avx+0x352>
+  DB  196,98,125,24,29,12,68,0,0          ; vbroadcastss  0x440c(%rip),%ymm11        # 797c <_sk_callback_avx+0x352>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,100,92,219                  ; vsubps        %ymm11,%ymm3,%ymm3
-  DB  196,98,125,24,29,9,64,0,0           ; vbroadcastss  0x4009(%rip),%ymm11        # 759c <_sk_callback_avx+0x356>
+  DB  196,98,125,24,29,253,67,0,0         ; vbroadcastss  0x43fd(%rip),%ymm11        # 7980 <_sk_callback_avx+0x356>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,255,63,0,0         ; vbroadcastss  0x3fff(%rip),%ymm11        # 75a0 <_sk_callback_avx+0x35a>
+  DB  196,98,125,24,29,243,67,0,0         ; vbroadcastss  0x43f3(%rip),%ymm11        # 7984 <_sk_callback_avx+0x35a>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,100,88,218                  ; vaddps        %ymm10,%ymm3,%ymm3
-  DB  196,98,125,24,21,240,63,0,0         ; vbroadcastss  0x3ff0(%rip),%ymm10        # 75a4 <_sk_callback_avx+0x35e>
+  DB  196,98,125,24,21,228,67,0,0         ; vbroadcastss  0x43e4(%rip),%ymm10        # 7988 <_sk_callback_avx+0x35e>
   DB  196,193,100,89,218                  ; vmulps        %ymm10,%ymm3,%ymm3
   DB  197,253,91,219                      ; vcvtps2dq     %ymm3,%ymm3
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -8957,38 +9236,38 @@
   DB  196,195,101,74,217,128              ; vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,100,95,216                  ; vmaxps        %ymm8,%ymm3,%ymm3
-  DB  196,98,125,24,5,199,63,0,0          ; vbroadcastss  0x3fc7(%rip),%ymm8        # 75a8 <_sk_callback_avx+0x362>
+  DB  196,98,125,24,5,187,67,0,0          ; vbroadcastss  0x43bb(%rip),%ymm8        # 798c <_sk_callback_avx+0x362>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_lab_to_xyz_avx
 _sk_lab_to_xyz_avx LABEL PROC
-  DB  196,98,125,24,5,185,63,0,0          ; vbroadcastss  0x3fb9(%rip),%ymm8        # 75ac <_sk_callback_avx+0x366>
+  DB  196,98,125,24,5,173,67,0,0          ; vbroadcastss  0x43ad(%rip),%ymm8        # 7990 <_sk_callback_avx+0x366>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,175,63,0,0          ; vbroadcastss  0x3faf(%rip),%ymm8        # 75b0 <_sk_callback_avx+0x36a>
+  DB  196,98,125,24,5,163,67,0,0          ; vbroadcastss  0x43a3(%rip),%ymm8        # 7994 <_sk_callback_avx+0x36a>
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,98,125,24,13,165,63,0,0         ; vbroadcastss  0x3fa5(%rip),%ymm9        # 75b4 <_sk_callback_avx+0x36e>
+  DB  196,98,125,24,13,153,67,0,0         ; vbroadcastss  0x4399(%rip),%ymm9        # 7998 <_sk_callback_avx+0x36e>
   DB  196,193,116,88,201                  ; vaddps        %ymm9,%ymm1,%ymm1
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  196,193,108,88,209                  ; vaddps        %ymm9,%ymm2,%ymm2
-  DB  196,98,125,24,5,145,63,0,0          ; vbroadcastss  0x3f91(%rip),%ymm8        # 75b8 <_sk_callback_avx+0x372>
+  DB  196,98,125,24,5,133,67,0,0          ; vbroadcastss  0x4385(%rip),%ymm8        # 799c <_sk_callback_avx+0x372>
   DB  196,193,124,88,192                  ; vaddps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,135,63,0,0          ; vbroadcastss  0x3f87(%rip),%ymm8        # 75bc <_sk_callback_avx+0x376>
+  DB  196,98,125,24,5,123,67,0,0          ; vbroadcastss  0x437b(%rip),%ymm8        # 79a0 <_sk_callback_avx+0x376>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,125,63,0,0          ; vbroadcastss  0x3f7d(%rip),%ymm8        # 75c0 <_sk_callback_avx+0x37a>
+  DB  196,98,125,24,5,113,67,0,0          ; vbroadcastss  0x4371(%rip),%ymm8        # 79a4 <_sk_callback_avx+0x37a>
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
   DB  197,252,88,201                      ; vaddps        %ymm1,%ymm0,%ymm1
-  DB  196,98,125,24,5,111,63,0,0          ; vbroadcastss  0x3f6f(%rip),%ymm8        # 75c4 <_sk_callback_avx+0x37e>
+  DB  196,98,125,24,5,99,67,0,0           ; vbroadcastss  0x4363(%rip),%ymm8        # 79a8 <_sk_callback_avx+0x37e>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,252,92,210                      ; vsubps        %ymm2,%ymm0,%ymm2
   DB  197,116,89,193                      ; vmulps        %ymm1,%ymm1,%ymm8
   DB  196,65,116,89,192                   ; vmulps        %ymm8,%ymm1,%ymm8
-  DB  196,98,125,24,13,88,63,0,0          ; vbroadcastss  0x3f58(%rip),%ymm9        # 75c8 <_sk_callback_avx+0x382>
+  DB  196,98,125,24,13,76,67,0,0          ; vbroadcastss  0x434c(%rip),%ymm9        # 79ac <_sk_callback_avx+0x382>
   DB  196,65,52,194,208,1                 ; vcmpltps      %ymm8,%ymm9,%ymm10
-  DB  196,98,125,24,29,77,63,0,0          ; vbroadcastss  0x3f4d(%rip),%ymm11        # 75cc <_sk_callback_avx+0x386>
+  DB  196,98,125,24,29,65,67,0,0          ; vbroadcastss  0x4341(%rip),%ymm11        # 79b0 <_sk_callback_avx+0x386>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,37,67,63,0,0          ; vbroadcastss  0x3f43(%rip),%ymm12        # 75d0 <_sk_callback_avx+0x38a>
+  DB  196,98,125,24,37,55,67,0,0          ; vbroadcastss  0x4337(%rip),%ymm12        # 79b4 <_sk_callback_avx+0x38a>
   DB  196,193,116,89,204                  ; vmulps        %ymm12,%ymm1,%ymm1
   DB  196,67,117,74,192,160               ; vblendvps     %ymm10,%ymm8,%ymm1,%ymm8
   DB  197,252,89,200                      ; vmulps        %ymm0,%ymm0,%ymm1
@@ -9003,9 +9282,9 @@
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
   DB  196,193,108,89,212                  ; vmulps        %ymm12,%ymm2,%ymm2
   DB  196,227,109,74,208,144              ; vblendvps     %ymm9,%ymm0,%ymm2,%ymm2
-  DB  196,226,125,24,5,249,62,0,0         ; vbroadcastss  0x3ef9(%rip),%ymm0        # 75d4 <_sk_callback_avx+0x38e>
+  DB  196,226,125,24,5,237,66,0,0         ; vbroadcastss  0x42ed(%rip),%ymm0        # 79b8 <_sk_callback_avx+0x38e>
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
-  DB  196,98,125,24,5,240,62,0,0          ; vbroadcastss  0x3ef0(%rip),%ymm8        # 75d8 <_sk_callback_avx+0x392>
+  DB  196,98,125,24,5,228,66,0,0          ; vbroadcastss  0x42e4(%rip),%ymm8        # 79bc <_sk_callback_avx+0x392>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9015,15 +9294,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           373d <_sk_load_a8_avx+0x4c>
+  DB  117,66                              ; jne           372d <_sk_load_a8_avx+0x4c>
   DB  196,194,121,48,4,19                 ; vpmovzxbw     (%r11,%rdx,1),%xmm0
-  DB  197,249,219,5,151,65,0,0            ; vpand         0x4197(%rip),%xmm0,%xmm0        # 78a0 <_sk_callback_avx+0x65a>
+  DB  197,249,219,5,151,69,0,0            ; vpand         0x4597(%rip),%xmm0,%xmm0        # 7c90 <_sk_callback_avx+0x666>
   DB  197,241,239,201                     ; vpxor         %xmm1,%xmm1,%xmm1
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,179,62,0,0        ; vbroadcastss  0x3eb3(%rip),%ymm1        # 75dc <_sk_callback_avx+0x396>
+  DB  196,226,125,24,13,167,66,0,0        ; vbroadcastss  0x42a7(%rip),%ymm1        # 79c0 <_sk_callback_avx+0x396>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -9035,15 +9314,15 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,176                             ; ja            3701 <_sk_load_a8_avx+0x10>
+  DB  119,176                             ; ja            36f1 <_sk_load_a8_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 37d4 <_sk_load_a8_avx+0xe3>
+  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 37c4 <_sk_load_a8_avx+0xe3>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,145                             ; jmp           3701 <_sk_load_a8_avx+0x10>
+  DB  235,145                             ; jmp           36f1 <_sk_load_a8_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,2                   ; vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -9051,7 +9330,7 @@
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,121,14,193,3                ; vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  DB  233,105,255,255,255                 ; jmpq          3701 <_sk_load_a8_avx+0x10>
+  DB  233,105,255,255,255                 ; jmpq          36f1 <_sk_load_a8_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,6                   ; vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -9062,7 +9341,7 @@
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,113,14,192,240              ; vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  DB  233,46,255,255,255                  ; jmpq          3701 <_sk_load_a8_avx+0x10>
+  DB  233,46,255,255,255                  ; jmpq          36f1 <_sk_load_a8_avx+0x10>
   DB  144                                 ; nop
   DB  145                                 ; xchg          %eax,%ecx
   DB  255                                 ; (bad)
@@ -9071,7 +9350,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,222                 ; jmpq          ffffffffdf0037e4 <_sk_callback_avx+0xffffffffdeffc59e>
+  DB  233,255,255,255,222                 ; jmpq          ffffffffdf0037d4 <_sk_callback_avx+0xffffffffdeffc1aa>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,211                             ; callq         *%rbx
@@ -9087,15 +9366,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           383c <_sk_load_a8_dst_avx+0x4c>
+  DB  117,66                              ; jne           382c <_sk_load_a8_dst_avx+0x4c>
   DB  196,194,121,48,36,19                ; vpmovzxbw     (%r11,%rdx,1),%xmm4
-  DB  197,217,219,37,168,64,0,0           ; vpand         0x40a8(%rip),%xmm4,%xmm4        # 78b0 <_sk_callback_avx+0x66a>
+  DB  197,217,219,37,168,68,0,0           ; vpand         0x44a8(%rip),%xmm4,%xmm4        # 7ca0 <_sk_callback_avx+0x676>
   DB  197,209,239,237                     ; vpxor         %xmm5,%xmm5,%xmm5
   DB  197,217,105,237                     ; vpunpckhwd    %xmm5,%xmm4,%xmm5
   DB  196,226,121,51,228                  ; vpmovzxwd     %xmm4,%xmm4
   DB  196,227,93,24,229,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,184,61,0,0        ; vbroadcastss  0x3db8(%rip),%ymm5        # 75e0 <_sk_callback_avx+0x39a>
+  DB  196,226,125,24,45,172,65,0,0        ; vbroadcastss  0x41ac(%rip),%ymm5        # 79c4 <_sk_callback_avx+0x39a>
   DB  197,220,89,253                      ; vmulps        %ymm5,%ymm4,%ymm7
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,220,87,228                      ; vxorps        %ymm4,%ymm4,%ymm4
@@ -9107,15 +9386,15 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,176                             ; ja            3800 <_sk_load_a8_dst_avx+0x10>
+  DB  119,176                             ; ja            37f0 <_sk_load_a8_dst_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 38d4 <_sk_load_a8_dst_avx+0xe4>
+  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 38c4 <_sk_load_a8_dst_avx+0xe4>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,145                             ; jmp           3800 <_sk_load_a8_dst_avx+0x10>
+  DB  235,145                             ; jmp           37f0 <_sk_load_a8_dst_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,2                   ; vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -9123,7 +9402,7 @@
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,89,14,229,3                 ; vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  DB  233,105,255,255,255                 ; jmpq          3800 <_sk_load_a8_dst_avx+0x10>
+  DB  233,105,255,255,255                 ; jmpq          37f0 <_sk_load_a8_dst_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,6                   ; vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -9134,7 +9413,7 @@
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,81,14,228,240               ; vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  DB  233,46,255,255,255                  ; jmpq          3800 <_sk_load_a8_dst_avx+0x10>
+  DB  233,46,255,255,255                  ; jmpq          37f0 <_sk_load_a8_dst_avx+0x10>
   DB  102,144                             ; xchg          %ax,%ax
   DB  144                                 ; nop
   DB  255                                 ; (bad)
@@ -9143,7 +9422,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  232,255,255,255,221                 ; callq         ffffffffde0038e4 <_sk_callback_avx+0xffffffffddffc69e>
+  DB  232,255,255,255,221                 ; callq         ffffffffde0038d4 <_sk_callback_avx+0xffffffffddffc2aa>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,210                             ; callq         *%rdx
@@ -9196,7 +9475,7 @@
   DB  196,226,121,49,192                  ; vpmovzxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,40,60,0,0         ; vbroadcastss  0x3c28(%rip),%ymm1        # 75e4 <_sk_callback_avx+0x39e>
+  DB  196,226,125,24,13,28,64,0,0         ; vbroadcastss  0x401c(%rip),%ymm1        # 79c8 <_sk_callback_avx+0x39e>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -9208,14 +9487,14 @@
 _sk_store_a8_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,10,60,0,0           ; vbroadcastss  0x3c0a(%rip),%ymm8        # 75e8 <_sk_callback_avx+0x3a2>
+  DB  196,98,125,24,5,254,63,0,0          ; vbroadcastss  0x3ffe(%rip),%ymm8        # 79cc <_sk_callback_avx+0x3a2>
   DB  196,65,100,89,192                   ; vmulps        %ymm8,%ymm3,%ymm8
   DB  196,65,125,91,192                   ; vcvtps2dq     %ymm8,%ymm8
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  196,65,57,103,192                   ; vpackuswb     %xmm8,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3a07 <_sk_store_a8_avx+0x37>
+  DB  117,10                              ; jne           39f7 <_sk_store_a8_avx+0x37>
   DB  196,65,123,17,4,19                  ; vmovsd        %xmm8,(%r11,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9223,25 +9502,25 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            3a03 <_sk_store_a8_avx+0x33>
+  DB  119,236                             ; ja            39f3 <_sk_store_a8_avx+0x33>
   DB  196,66,121,48,192                   ; vpmovzxbw     %xmm8,%xmm8
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,85,0,0,0                  ; lea           0x55(%rip),%r10        # 3a7c <_sk_store_a8_avx+0xac>
+  DB  76,141,21,85,0,0,0                  ; lea           0x55(%rip),%r10        # 3a6c <_sk_store_a8_avx+0xac>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,20,4,19,0                ; vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,202                             ; jmp           3a03 <_sk_store_a8_avx+0x33>
+  DB  235,202                             ; jmp           39f3 <_sk_store_a8_avx+0x33>
   DB  196,67,121,20,68,19,2,4             ; vpextrb       $0x4,%xmm8,0x2(%r11,%rdx,1)
-  DB  196,98,57,0,5,118,62,0,0            ; vpshufb       0x3e76(%rip),%xmm8,%xmm8        # 78c0 <_sk_callback_avx+0x67a>
+  DB  196,98,57,0,5,118,66,0,0            ; vpshufb       0x4276(%rip),%xmm8,%xmm8        # 7cb0 <_sk_callback_avx+0x686>
   DB  196,67,121,21,4,19,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,176                             ; jmp           3a03 <_sk_store_a8_avx+0x33>
+  DB  235,176                             ; jmp           39f3 <_sk_store_a8_avx+0x33>
   DB  196,67,121,20,68,19,6,12            ; vpextrb       $0xc,%xmm8,0x6(%r11,%rdx,1)
   DB  196,67,121,20,68,19,5,10            ; vpextrb       $0xa,%xmm8,0x5(%r11,%rdx,1)
   DB  196,67,121,20,68,19,4,8             ; vpextrb       $0x8,%xmm8,0x4(%r11,%rdx,1)
-  DB  196,98,57,0,5,92,62,0,0             ; vpshufb       0x3e5c(%rip),%xmm8,%xmm8        # 78d0 <_sk_callback_avx+0x68a>
+  DB  196,98,57,0,5,92,66,0,0             ; vpshufb       0x425c(%rip),%xmm8,%xmm8        # 7cc0 <_sk_callback_avx+0x696>
   DB  196,65,121,126,4,19                 ; vmovd         %xmm8,(%r11,%rdx,1)
-  DB  235,135                             ; jmp           3a03 <_sk_store_a8_avx+0x33>
+  DB  235,135                             ; jmp           39f3 <_sk_store_a8_avx+0x33>
   DB  180,255                             ; mov           $0xff,%ah
   DB  255                                 ; (bad)
   DB  255,197                             ; inc           %ebp
@@ -9267,18 +9546,18 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,71                              ; jne           3ae9 <_sk_load_g8_avx+0x51>
+  DB  117,71                              ; jne           3ad9 <_sk_load_g8_avx+0x51>
   DB  196,194,121,48,4,19                 ; vpmovzxbw     (%r11,%rdx,1),%xmm0
-  DB  197,249,219,5,48,62,0,0             ; vpand         0x3e30(%rip),%xmm0,%xmm0        # 78e0 <_sk_callback_avx+0x69a>
+  DB  197,249,219,5,48,66,0,0             ; vpand         0x4230(%rip),%xmm0,%xmm0        # 7cd0 <_sk_callback_avx+0x6a6>
   DB  197,241,239,201                     ; vpxor         %xmm1,%xmm1,%xmm1
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,28,59,0,0         ; vbroadcastss  0x3b1c(%rip),%ymm1        # 75ec <_sk_callback_avx+0x3a6>
+  DB  196,226,125,24,13,16,63,0,0         ; vbroadcastss  0x3f10(%rip),%ymm1        # 79d0 <_sk_callback_avx+0x3a6>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,17,59,0,0         ; vbroadcastss  0x3b11(%rip),%ymm3        # 75f0 <_sk_callback_avx+0x3aa>
+  DB  196,226,125,24,29,5,63,0,0          ; vbroadcastss  0x3f05(%rip),%ymm3        # 79d4 <_sk_callback_avx+0x3aa>
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  255,224                             ; jmpq          *%rax
@@ -9287,15 +9566,15 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,171                             ; ja            3aa8 <_sk_load_g8_avx+0x10>
+  DB  119,171                             ; ja            3a98 <_sk_load_g8_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 3b80 <_sk_load_g8_avx+0xe8>
+  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 3b70 <_sk_load_g8_avx+0xe8>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,140                             ; jmp           3aa8 <_sk_load_g8_avx+0x10>
+  DB  235,140                             ; jmp           3a98 <_sk_load_g8_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,2                   ; vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -9303,7 +9582,7 @@
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,121,14,193,3                ; vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  DB  233,100,255,255,255                 ; jmpq          3aa8 <_sk_load_g8_avx+0x10>
+  DB  233,100,255,255,255                 ; jmpq          3a98 <_sk_load_g8_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,6                   ; vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -9314,7 +9593,7 @@
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,113,14,192,240              ; vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  DB  233,41,255,255,255                  ; jmpq          3aa8 <_sk_load_g8_avx+0x10>
+  DB  233,41,255,255,255                  ; jmpq          3a98 <_sk_load_g8_avx+0x10>
   DB  144                                 ; nop
   DB  145                                 ; xchg          %eax,%ecx
   DB  255                                 ; (bad)
@@ -9323,7 +9602,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,222                 ; jmpq          ffffffffdf003b90 <_sk_callback_avx+0xffffffffdeffc94a>
+  DB  233,255,255,255,222                 ; jmpq          ffffffffdf003b80 <_sk_callback_avx+0xffffffffdeffc556>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,211                             ; callq         *%rbx
@@ -9339,18 +9618,18 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,71                              ; jne           3bed <_sk_load_g8_dst_avx+0x51>
+  DB  117,71                              ; jne           3bdd <_sk_load_g8_dst_avx+0x51>
   DB  196,194,121,48,36,19                ; vpmovzxbw     (%r11,%rdx,1),%xmm4
-  DB  197,217,219,37,60,61,0,0            ; vpand         0x3d3c(%rip),%xmm4,%xmm4        # 78f0 <_sk_callback_avx+0x6aa>
+  DB  197,217,219,37,60,65,0,0            ; vpand         0x413c(%rip),%xmm4,%xmm4        # 7ce0 <_sk_callback_avx+0x6b6>
   DB  197,209,239,237                     ; vpxor         %xmm5,%xmm5,%xmm5
   DB  197,217,105,237                     ; vpunpckhwd    %xmm5,%xmm4,%xmm5
   DB  196,226,121,51,228                  ; vpmovzxwd     %xmm4,%xmm4
   DB  196,227,93,24,229,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,32,58,0,0         ; vbroadcastss  0x3a20(%rip),%ymm5        # 75f4 <_sk_callback_avx+0x3ae>
+  DB  196,226,125,24,45,20,62,0,0         ; vbroadcastss  0x3e14(%rip),%ymm5        # 79d8 <_sk_callback_avx+0x3ae>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,61,21,58,0,0         ; vbroadcastss  0x3a15(%rip),%ymm7        # 75f8 <_sk_callback_avx+0x3b2>
+  DB  196,226,125,24,61,9,62,0,0          ; vbroadcastss  0x3e09(%rip),%ymm7        # 79dc <_sk_callback_avx+0x3b2>
   DB  197,252,40,236                      ; vmovaps       %ymm4,%ymm5
   DB  197,252,40,244                      ; vmovaps       %ymm4,%ymm6
   DB  255,224                             ; jmpq          *%rax
@@ -9359,15 +9638,15 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,171                             ; ja            3bac <_sk_load_g8_dst_avx+0x10>
+  DB  119,171                             ; ja            3b9c <_sk_load_g8_dst_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 3c84 <_sk_load_g8_dst_avx+0xe8>
+  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 3c74 <_sk_load_g8_dst_avx+0xe8>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,140                             ; jmp           3bac <_sk_load_g8_dst_avx+0x10>
+  DB  235,140                             ; jmp           3b9c <_sk_load_g8_dst_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,2                   ; vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -9375,7 +9654,7 @@
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,89,14,229,3                 ; vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  DB  233,100,255,255,255                 ; jmpq          3bac <_sk_load_g8_dst_avx+0x10>
+  DB  233,100,255,255,255                 ; jmpq          3b9c <_sk_load_g8_dst_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,6                   ; vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -9386,7 +9665,7 @@
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,81,14,228,240               ; vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  DB  233,41,255,255,255                  ; jmpq          3bac <_sk_load_g8_dst_avx+0x10>
+  DB  233,41,255,255,255                  ; jmpq          3b9c <_sk_load_g8_dst_avx+0x10>
   DB  144                                 ; nop
   DB  145                                 ; xchg          %eax,%ecx
   DB  255                                 ; (bad)
@@ -9395,7 +9674,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,222                 ; jmpq          ffffffffdf003c94 <_sk_callback_avx+0xffffffffdeffca4e>
+  DB  233,255,255,255,222                 ; jmpq          ffffffffdf003c84 <_sk_callback_avx+0xffffffffdeffc65a>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,211                             ; callq         *%rbx
@@ -9448,10 +9727,10 @@
   DB  196,226,121,49,192                  ; vpmovzxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,144,56,0,0        ; vbroadcastss  0x3890(%rip),%ymm1        # 75fc <_sk_callback_avx+0x3b6>
+  DB  196,226,125,24,13,132,60,0,0        ; vbroadcastss  0x3c84(%rip),%ymm1        # 79e0 <_sk_callback_avx+0x3b6>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,133,56,0,0        ; vbroadcastss  0x3885(%rip),%ymm3        # 7600 <_sk_callback_avx+0x3ba>
+  DB  196,226,125,24,29,121,60,0,0        ; vbroadcastss  0x3c79(%rip),%ymm3        # 79e4 <_sk_callback_avx+0x3ba>
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  255,224                             ; jmpq          *%rax
@@ -9461,9 +9740,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,193                          ; mov           %rax,%r9
   DB  77,133,201                          ; test          %r9,%r9
-  DB  116,5                               ; je            3d94 <_sk_gather_i8_avx+0xf>
+  DB  116,5                               ; je            3d84 <_sk_gather_i8_avx+0xf>
   DB  76,137,200                          ; mov           %r9,%rax
-  DB  235,2                               ; jmp           3d96 <_sk_gather_i8_avx+0x11>
+  DB  235,2                               ; jmp           3d86 <_sk_gather_i8_avx+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  83                                  ; push          %rbx
   DB  76,139,16                           ; mov           (%rax),%r10
@@ -9521,10 +9800,10 @@
   DB  72,193,235,30                       ; shr           $0x1e,%rbx
   DB  196,195,121,34,28,27,3              ; vpinsrd       $0x3,(%r11,%rbx,1),%xmm0,%xmm3
   DB  196,227,61,24,195,1                 ; vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  DB  197,124,40,21,236,58,0,0            ; vmovaps       0x3aec(%rip),%ymm10        # 79a0 <_sk_callback_avx+0x75a>
+  DB  197,124,40,21,92,63,0,0             ; vmovaps       0x3f5c(%rip),%ymm10        # 7e00 <_sk_callback_avx+0x7d6>
   DB  196,193,124,84,194                  ; vandps        %ymm10,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,62,55,0,0          ; vbroadcastss  0x373e(%rip),%ymm9        # 7604 <_sk_callback_avx+0x3be>
+  DB  196,98,125,24,13,50,59,0,0          ; vbroadcastss  0x3b32(%rip),%ymm9        # 79e8 <_sk_callback_avx+0x3be>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,193,113,114,208,8               ; vpsrld        $0x8,%xmm8,%xmm1
   DB  197,233,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm2
@@ -9552,56 +9831,56 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,128,0,0,0                    ; jne           3fb6 <_sk_load_565_avx+0x8e>
+  DB  15,133,128,0,0,0                    ; jne           3fa6 <_sk_load_565_avx+0x8e>
   DB  196,193,122,111,4,83                ; vmovdqu       (%r11,%rdx,2),%xmm0
   DB  197,241,239,201                     ; vpxor         %xmm1,%xmm1,%xmm1
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,209,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  DB  196,226,125,24,5,176,54,0,0         ; vbroadcastss  0x36b0(%rip),%ymm0        # 7608 <_sk_callback_avx+0x3c2>
+  DB  196,226,125,24,5,164,58,0,0         ; vbroadcastss  0x3aa4(%rip),%ymm0        # 79ec <_sk_callback_avx+0x3c2>
   DB  197,236,84,192                      ; vandps        %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,163,54,0,0        ; vbroadcastss  0x36a3(%rip),%ymm1        # 760c <_sk_callback_avx+0x3c6>
+  DB  196,226,125,24,13,151,58,0,0        ; vbroadcastss  0x3a97(%rip),%ymm1        # 79f0 <_sk_callback_avx+0x3c6>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,154,54,0,0        ; vbroadcastss  0x369a(%rip),%ymm1        # 7610 <_sk_callback_avx+0x3ca>
+  DB  196,226,125,24,13,142,58,0,0        ; vbroadcastss  0x3a8e(%rip),%ymm1        # 79f4 <_sk_callback_avx+0x3ca>
   DB  197,236,84,201                      ; vandps        %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,141,54,0,0        ; vbroadcastss  0x368d(%rip),%ymm3        # 7614 <_sk_callback_avx+0x3ce>
+  DB  196,226,125,24,29,129,58,0,0        ; vbroadcastss  0x3a81(%rip),%ymm3        # 79f8 <_sk_callback_avx+0x3ce>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,24,29,132,54,0,0        ; vbroadcastss  0x3684(%rip),%ymm3        # 7618 <_sk_callback_avx+0x3d2>
+  DB  196,226,125,24,29,120,58,0,0        ; vbroadcastss  0x3a78(%rip),%ymm3        # 79fc <_sk_callback_avx+0x3d2>
   DB  197,236,84,211                      ; vandps        %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,119,54,0,0        ; vbroadcastss  0x3677(%rip),%ymm3        # 761c <_sk_callback_avx+0x3d6>
+  DB  196,226,125,24,29,107,58,0,0        ; vbroadcastss  0x3a6b(%rip),%ymm3        # 7a00 <_sk_callback_avx+0x3d6>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,108,54,0,0        ; vbroadcastss  0x366c(%rip),%ymm3        # 7620 <_sk_callback_avx+0x3da>
+  DB  196,226,125,24,29,96,58,0,0         ; vbroadcastss  0x3a60(%rip),%ymm3        # 7a04 <_sk_callback_avx+0x3da>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,110,255,255,255              ; ja            3f3c <_sk_load_565_avx+0x14>
+  DB  15,135,110,255,255,255              ; ja            3f2c <_sk_load_565_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 403c <_sk_load_565_avx+0x114>
+  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 402c <_sk_load_565_avx+0x114>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  233,76,255,255,255                  ; jmpq          3f3c <_sk_load_565_avx+0x14>
+  DB  233,76,255,255,255                  ; jmpq          3f2c <_sk_load_565_avx+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,110,12,83               ; vmovd         (%r11,%rdx,2),%xmm1
   DB  196,227,121,14,193,3                ; vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  DB  233,47,255,255,255                  ; jmpq          3f3c <_sk_load_565_avx+0x14>
+  DB  233,47,255,255,255                  ; jmpq          3f2c <_sk_load_565_avx+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,122,126,12,83               ; vmovq         (%r11,%rdx,2),%xmm1
   DB  196,227,113,14,192,240              ; vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  DB  233,2,255,255,255                   ; jmpq          3f3c <_sk_load_565_avx+0x14>
+  DB  233,2,255,255,255                   ; jmpq          3f2c <_sk_load_565_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  166                                 ; cmpsb         %es:(%rdi),%ds:(%rsi)
   DB  255                                 ; (bad)
@@ -9627,56 +9906,56 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,128,0,0,0                    ; jne           40e6 <_sk_load_565_dst_avx+0x8e>
+  DB  15,133,128,0,0,0                    ; jne           40d6 <_sk_load_565_dst_avx+0x8e>
   DB  196,193,122,111,36,83               ; vmovdqu       (%r11,%rdx,2),%xmm4
   DB  197,209,239,237                     ; vpxor         %xmm5,%xmm5,%xmm5
   DB  197,217,105,237                     ; vpunpckhwd    %xmm5,%xmm4,%xmm5
   DB  196,226,121,51,228                  ; vpmovzxwd     %xmm4,%xmm4
   DB  196,227,93,24,245,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm6
-  DB  196,226,125,24,37,156,53,0,0        ; vbroadcastss  0x359c(%rip),%ymm4        # 7624 <_sk_callback_avx+0x3de>
+  DB  196,226,125,24,37,144,57,0,0        ; vbroadcastss  0x3990(%rip),%ymm4        # 7a08 <_sk_callback_avx+0x3de>
   DB  197,204,84,228                      ; vandps        %ymm4,%ymm6,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,143,53,0,0        ; vbroadcastss  0x358f(%rip),%ymm5        # 7628 <_sk_callback_avx+0x3e2>
+  DB  196,226,125,24,45,131,57,0,0        ; vbroadcastss  0x3983(%rip),%ymm5        # 7a0c <_sk_callback_avx+0x3e2>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
-  DB  196,226,125,24,45,134,53,0,0        ; vbroadcastss  0x3586(%rip),%ymm5        # 762c <_sk_callback_avx+0x3e6>
+  DB  196,226,125,24,45,122,57,0,0        ; vbroadcastss  0x397a(%rip),%ymm5        # 7a10 <_sk_callback_avx+0x3e6>
   DB  197,204,84,237                      ; vandps        %ymm5,%ymm6,%ymm5
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,226,125,24,61,121,53,0,0        ; vbroadcastss  0x3579(%rip),%ymm7        # 7630 <_sk_callback_avx+0x3ea>
+  DB  196,226,125,24,61,109,57,0,0        ; vbroadcastss  0x396d(%rip),%ymm7        # 7a14 <_sk_callback_avx+0x3ea>
   DB  197,212,89,239                      ; vmulps        %ymm7,%ymm5,%ymm5
-  DB  196,226,125,24,61,112,53,0,0        ; vbroadcastss  0x3570(%rip),%ymm7        # 7634 <_sk_callback_avx+0x3ee>
+  DB  196,226,125,24,61,100,57,0,0        ; vbroadcastss  0x3964(%rip),%ymm7        # 7a18 <_sk_callback_avx+0x3ee>
   DB  197,204,84,247                      ; vandps        %ymm7,%ymm6,%ymm6
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
-  DB  196,226,125,24,61,99,53,0,0         ; vbroadcastss  0x3563(%rip),%ymm7        # 7638 <_sk_callback_avx+0x3f2>
+  DB  196,226,125,24,61,87,57,0,0         ; vbroadcastss  0x3957(%rip),%ymm7        # 7a1c <_sk_callback_avx+0x3f2>
   DB  197,204,89,247                      ; vmulps        %ymm7,%ymm6,%ymm6
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,61,88,53,0,0         ; vbroadcastss  0x3558(%rip),%ymm7        # 763c <_sk_callback_avx+0x3f6>
+  DB  196,226,125,24,61,76,57,0,0         ; vbroadcastss  0x394c(%rip),%ymm7        # 7a20 <_sk_callback_avx+0x3f6>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,110,255,255,255              ; ja            406c <_sk_load_565_dst_avx+0x14>
+  DB  15,135,110,255,255,255              ; ja            405c <_sk_load_565_dst_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 416c <_sk_load_565_dst_avx+0x114>
+  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 415c <_sk_load_565_dst_avx+0x114>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  233,76,255,255,255                  ; jmpq          406c <_sk_load_565_dst_avx+0x14>
+  DB  233,76,255,255,255                  ; jmpq          405c <_sk_load_565_dst_avx+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,121,110,44,83               ; vmovd         (%r11,%rdx,2),%xmm5
   DB  196,227,89,14,229,3                 ; vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  DB  233,47,255,255,255                  ; jmpq          406c <_sk_load_565_dst_avx+0x14>
+  DB  233,47,255,255,255                  ; jmpq          405c <_sk_load_565_dst_avx+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,122,126,44,83               ; vmovq         (%r11,%rdx,2),%xmm5
   DB  196,227,81,14,228,240               ; vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  DB  233,2,255,255,255                   ; jmpq          406c <_sk_load_565_dst_avx+0x14>
+  DB  233,2,255,255,255                   ; jmpq          405c <_sk_load_565_dst_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  166                                 ; cmpsb         %es:(%rdi),%ds:(%rsi)
   DB  255                                 ; (bad)
@@ -9743,37 +10022,37 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,209,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  DB  196,226,125,24,5,230,51,0,0         ; vbroadcastss  0x33e6(%rip),%ymm0        # 7640 <_sk_callback_avx+0x3fa>
+  DB  196,226,125,24,5,218,55,0,0         ; vbroadcastss  0x37da(%rip),%ymm0        # 7a24 <_sk_callback_avx+0x3fa>
   DB  197,236,84,192                      ; vandps        %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,217,51,0,0        ; vbroadcastss  0x33d9(%rip),%ymm1        # 7644 <_sk_callback_avx+0x3fe>
+  DB  196,226,125,24,13,205,55,0,0        ; vbroadcastss  0x37cd(%rip),%ymm1        # 7a28 <_sk_callback_avx+0x3fe>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,208,51,0,0        ; vbroadcastss  0x33d0(%rip),%ymm1        # 7648 <_sk_callback_avx+0x402>
+  DB  196,226,125,24,13,196,55,0,0        ; vbroadcastss  0x37c4(%rip),%ymm1        # 7a2c <_sk_callback_avx+0x402>
   DB  197,236,84,201                      ; vandps        %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,195,51,0,0        ; vbroadcastss  0x33c3(%rip),%ymm3        # 764c <_sk_callback_avx+0x406>
+  DB  196,226,125,24,29,183,55,0,0        ; vbroadcastss  0x37b7(%rip),%ymm3        # 7a30 <_sk_callback_avx+0x406>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,24,29,186,51,0,0        ; vbroadcastss  0x33ba(%rip),%ymm3        # 7650 <_sk_callback_avx+0x40a>
+  DB  196,226,125,24,29,174,55,0,0        ; vbroadcastss  0x37ae(%rip),%ymm3        # 7a34 <_sk_callback_avx+0x40a>
   DB  197,236,84,211                      ; vandps        %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,173,51,0,0        ; vbroadcastss  0x33ad(%rip),%ymm3        # 7654 <_sk_callback_avx+0x40e>
+  DB  196,226,125,24,29,161,55,0,0        ; vbroadcastss  0x37a1(%rip),%ymm3        # 7a38 <_sk_callback_avx+0x40e>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,162,51,0,0        ; vbroadcastss  0x33a2(%rip),%ymm3        # 7658 <_sk_callback_avx+0x412>
+  DB  196,226,125,24,29,150,55,0,0        ; vbroadcastss  0x3796(%rip),%ymm3        # 7a3c <_sk_callback_avx+0x412>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_store_565_avx
 _sk_store_565_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,150,51,0,0          ; vbroadcastss  0x3396(%rip),%ymm8        # 765c <_sk_callback_avx+0x416>
+  DB  196,98,125,24,5,138,55,0,0          ; vbroadcastss  0x378a(%rip),%ymm8        # 7a40 <_sk_callback_avx+0x416>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,41,114,241,11               ; vpslld        $0xb,%xmm9,%xmm10
   DB  196,67,125,25,201,1                 ; vextractf128  $0x1,%ymm9,%xmm9
   DB  196,193,49,114,241,11               ; vpslld        $0xb,%xmm9,%xmm9
   DB  196,67,45,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
-  DB  196,98,125,24,21,111,51,0,0         ; vbroadcastss  0x336f(%rip),%ymm10        # 7660 <_sk_callback_avx+0x41a>
+  DB  196,98,125,24,21,99,55,0,0          ; vbroadcastss  0x3763(%rip),%ymm10        # 7a44 <_sk_callback_avx+0x41a>
   DB  196,65,116,89,210                   ; vmulps        %ymm10,%ymm1,%ymm10
   DB  196,65,125,91,210                   ; vcvtps2dq     %ymm10,%ymm10
   DB  196,193,33,114,242,5                ; vpslld        $0x5,%xmm10,%xmm11
@@ -9787,7 +10066,7 @@
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           4341 <_sk_store_565_avx+0x89>
+  DB  117,10                              ; jne           4331 <_sk_store_565_avx+0x89>
   DB  196,65,122,127,4,83                 ; vmovdqu       %xmm8,(%r11,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9795,22 +10074,22 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            433d <_sk_store_565_avx+0x85>
+  DB  119,236                             ; ja            432d <_sk_store_565_avx+0x85>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,68,0,0,0                  ; lea           0x44(%rip),%r10        # 43a0 <_sk_store_565_avx+0xe8>
+  DB  76,141,21,68,0,0,0                  ; lea           0x44(%rip),%r10        # 4390 <_sk_store_565_avx+0xe8>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,21,4,83,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  DB  235,207                             ; jmp           433d <_sk_store_565_avx+0x85>
+  DB  235,207                             ; jmp           432d <_sk_store_565_avx+0x85>
   DB  196,67,121,21,68,83,4,2             ; vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   DB  196,65,121,126,4,83                 ; vmovd         %xmm8,(%r11,%rdx,2)
-  DB  235,191                             ; jmp           433d <_sk_store_565_avx+0x85>
+  DB  235,191                             ; jmp           432d <_sk_store_565_avx+0x85>
   DB  196,67,121,21,68,83,12,6            ; vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   DB  196,67,121,21,68,83,10,5            ; vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   DB  196,67,121,21,68,83,8,4             ; vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   DB  196,65,121,214,4,83                 ; vmovq         %xmm8,(%r11,%rdx,2)
-  DB  235,159                             ; jmp           433d <_sk_store_565_avx+0x85>
+  DB  235,159                             ; jmp           432d <_sk_store_565_avx+0x85>
   DB  102,144                             ; xchg          %ax,%ax
   DB  197,255,255                         ; (bad)
   DB  255,214                             ; callq         *%rsi
@@ -9839,31 +10118,31 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,152,0,0,0                    ; jne           4462 <_sk_load_4444_avx+0xa6>
+  DB  15,133,152,0,0,0                    ; jne           4452 <_sk_load_4444_avx+0xa6>
   DB  196,193,122,111,4,83                ; vmovdqu       (%r11,%rdx,2),%xmm0
   DB  197,241,239,201                     ; vpxor         %xmm1,%xmm1,%xmm1
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,217,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  DB  196,226,125,24,5,120,50,0,0         ; vbroadcastss  0x3278(%rip),%ymm0        # 7664 <_sk_callback_avx+0x41e>
+  DB  196,226,125,24,5,108,54,0,0         ; vbroadcastss  0x366c(%rip),%ymm0        # 7a48 <_sk_callback_avx+0x41e>
   DB  197,228,84,192                      ; vandps        %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,107,50,0,0        ; vbroadcastss  0x326b(%rip),%ymm1        # 7668 <_sk_callback_avx+0x422>
+  DB  196,226,125,24,13,95,54,0,0         ; vbroadcastss  0x365f(%rip),%ymm1        # 7a4c <_sk_callback_avx+0x422>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,98,50,0,0         ; vbroadcastss  0x3262(%rip),%ymm1        # 766c <_sk_callback_avx+0x426>
+  DB  196,226,125,24,13,86,54,0,0         ; vbroadcastss  0x3656(%rip),%ymm1        # 7a50 <_sk_callback_avx+0x426>
   DB  197,228,84,201                      ; vandps        %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,85,50,0,0         ; vbroadcastss  0x3255(%rip),%ymm2        # 7670 <_sk_callback_avx+0x42a>
+  DB  196,226,125,24,21,73,54,0,0         ; vbroadcastss  0x3649(%rip),%ymm2        # 7a54 <_sk_callback_avx+0x42a>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,24,21,76,50,0,0         ; vbroadcastss  0x324c(%rip),%ymm2        # 7674 <_sk_callback_avx+0x42e>
+  DB  196,226,125,24,21,64,54,0,0         ; vbroadcastss  0x3640(%rip),%ymm2        # 7a58 <_sk_callback_avx+0x42e>
   DB  197,228,84,210                      ; vandps        %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,63,50,0,0           ; vbroadcastss  0x323f(%rip),%ymm8        # 7678 <_sk_callback_avx+0x432>
+  DB  196,98,125,24,5,51,54,0,0           ; vbroadcastss  0x3633(%rip),%ymm8        # 7a5c <_sk_callback_avx+0x432>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,53,50,0,0           ; vbroadcastss  0x3235(%rip),%ymm8        # 767c <_sk_callback_avx+0x436>
+  DB  196,98,125,24,5,41,54,0,0           ; vbroadcastss  0x3629(%rip),%ymm8        # 7a60 <_sk_callback_avx+0x436>
   DB  196,193,100,84,216                  ; vandps        %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,39,50,0,0           ; vbroadcastss  0x3227(%rip),%ymm8        # 7680 <_sk_callback_avx+0x43a>
+  DB  196,98,125,24,5,27,54,0,0           ; vbroadcastss  0x361b(%rip),%ymm8        # 7a64 <_sk_callback_avx+0x43a>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9872,27 +10151,27 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,86,255,255,255               ; ja            43d0 <_sk_load_4444_avx+0x14>
+  DB  15,135,86,255,255,255               ; ja            43c0 <_sk_load_4444_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 44e8 <_sk_load_4444_avx+0x12c>
+  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 44d8 <_sk_load_4444_avx+0x12c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  233,52,255,255,255                  ; jmpq          43d0 <_sk_load_4444_avx+0x14>
+  DB  233,52,255,255,255                  ; jmpq          43c0 <_sk_load_4444_avx+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,110,12,83               ; vmovd         (%r11,%rdx,2),%xmm1
   DB  196,227,121,14,193,3                ; vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  DB  233,23,255,255,255                  ; jmpq          43d0 <_sk_load_4444_avx+0x14>
+  DB  233,23,255,255,255                  ; jmpq          43c0 <_sk_load_4444_avx+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,122,126,12,83               ; vmovq         (%r11,%rdx,2),%xmm1
   DB  196,227,113,14,192,240              ; vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  DB  233,234,254,255,255                 ; jmpq          43d0 <_sk_load_4444_avx+0x14>
+  DB  233,234,254,255,255                 ; jmpq          43c0 <_sk_load_4444_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  166                                 ; cmpsb         %es:(%rdi),%ds:(%rsi)
   DB  255                                 ; (bad)
@@ -9918,31 +10197,31 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,152,0,0,0                    ; jne           45aa <_sk_load_4444_dst_avx+0xa6>
+  DB  15,133,152,0,0,0                    ; jne           459a <_sk_load_4444_dst_avx+0xa6>
   DB  196,193,122,111,36,83               ; vmovdqu       (%r11,%rdx,2),%xmm4
   DB  197,209,239,237                     ; vpxor         %xmm5,%xmm5,%xmm5
   DB  197,217,105,237                     ; vpunpckhwd    %xmm5,%xmm4,%xmm5
   DB  196,226,121,51,228                  ; vpmovzxwd     %xmm4,%xmm4
   DB  196,227,93,24,253,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm7
-  DB  196,226,125,24,37,80,49,0,0         ; vbroadcastss  0x3150(%rip),%ymm4        # 7684 <_sk_callback_avx+0x43e>
+  DB  196,226,125,24,37,68,53,0,0         ; vbroadcastss  0x3544(%rip),%ymm4        # 7a68 <_sk_callback_avx+0x43e>
   DB  197,196,84,228                      ; vandps        %ymm4,%ymm7,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,67,49,0,0         ; vbroadcastss  0x3143(%rip),%ymm5        # 7688 <_sk_callback_avx+0x442>
+  DB  196,226,125,24,45,55,53,0,0         ; vbroadcastss  0x3537(%rip),%ymm5        # 7a6c <_sk_callback_avx+0x442>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
-  DB  196,226,125,24,45,58,49,0,0         ; vbroadcastss  0x313a(%rip),%ymm5        # 768c <_sk_callback_avx+0x446>
+  DB  196,226,125,24,45,46,53,0,0         ; vbroadcastss  0x352e(%rip),%ymm5        # 7a70 <_sk_callback_avx+0x446>
   DB  197,196,84,237                      ; vandps        %ymm5,%ymm7,%ymm5
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,226,125,24,53,45,49,0,0         ; vbroadcastss  0x312d(%rip),%ymm6        # 7690 <_sk_callback_avx+0x44a>
+  DB  196,226,125,24,53,33,53,0,0         ; vbroadcastss  0x3521(%rip),%ymm6        # 7a74 <_sk_callback_avx+0x44a>
   DB  197,212,89,238                      ; vmulps        %ymm6,%ymm5,%ymm5
-  DB  196,226,125,24,53,36,49,0,0         ; vbroadcastss  0x3124(%rip),%ymm6        # 7694 <_sk_callback_avx+0x44e>
+  DB  196,226,125,24,53,24,53,0,0         ; vbroadcastss  0x3518(%rip),%ymm6        # 7a78 <_sk_callback_avx+0x44e>
   DB  197,196,84,246                      ; vandps        %ymm6,%ymm7,%ymm6
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
-  DB  196,98,125,24,5,23,49,0,0           ; vbroadcastss  0x3117(%rip),%ymm8        # 7698 <_sk_callback_avx+0x452>
+  DB  196,98,125,24,5,11,53,0,0           ; vbroadcastss  0x350b(%rip),%ymm8        # 7a7c <_sk_callback_avx+0x452>
   DB  196,193,76,89,240                   ; vmulps        %ymm8,%ymm6,%ymm6
-  DB  196,98,125,24,5,13,49,0,0           ; vbroadcastss  0x310d(%rip),%ymm8        # 769c <_sk_callback_avx+0x456>
+  DB  196,98,125,24,5,1,53,0,0            ; vbroadcastss  0x3501(%rip),%ymm8        # 7a80 <_sk_callback_avx+0x456>
   DB  196,193,68,84,248                   ; vandps        %ymm8,%ymm7,%ymm7
   DB  197,252,91,255                      ; vcvtdq2ps     %ymm7,%ymm7
-  DB  196,98,125,24,5,255,48,0,0          ; vbroadcastss  0x30ff(%rip),%ymm8        # 76a0 <_sk_callback_avx+0x45a>
+  DB  196,98,125,24,5,243,52,0,0          ; vbroadcastss  0x34f3(%rip),%ymm8        # 7a84 <_sk_callback_avx+0x45a>
   DB  196,193,68,89,248                   ; vmulps        %ymm8,%ymm7,%ymm7
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9951,27 +10230,27 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,86,255,255,255               ; ja            4518 <_sk_load_4444_dst_avx+0x14>
+  DB  15,135,86,255,255,255               ; ja            4508 <_sk_load_4444_dst_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 4630 <_sk_load_4444_dst_avx+0x12c>
+  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 4620 <_sk_load_4444_dst_avx+0x12c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  233,52,255,255,255                  ; jmpq          4518 <_sk_load_4444_dst_avx+0x14>
+  DB  233,52,255,255,255                  ; jmpq          4508 <_sk_load_4444_dst_avx+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,121,110,44,83               ; vmovd         (%r11,%rdx,2),%xmm5
   DB  196,227,89,14,229,3                 ; vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  DB  233,23,255,255,255                  ; jmpq          4518 <_sk_load_4444_dst_avx+0x14>
+  DB  233,23,255,255,255                  ; jmpq          4508 <_sk_load_4444_dst_avx+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,122,126,44,83               ; vmovq         (%r11,%rdx,2),%xmm5
   DB  196,227,81,14,228,240               ; vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  DB  233,234,254,255,255                 ; jmpq          4518 <_sk_load_4444_dst_avx+0x14>
+  DB  233,234,254,255,255                 ; jmpq          4508 <_sk_load_4444_dst_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  166                                 ; cmpsb         %es:(%rdi),%ds:(%rsi)
   DB  255                                 ; (bad)
@@ -10038,25 +10317,25 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,217,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  DB  196,226,125,24,5,134,47,0,0         ; vbroadcastss  0x2f86(%rip),%ymm0        # 76a4 <_sk_callback_avx+0x45e>
+  DB  196,226,125,24,5,122,51,0,0         ; vbroadcastss  0x337a(%rip),%ymm0        # 7a88 <_sk_callback_avx+0x45e>
   DB  197,228,84,192                      ; vandps        %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,121,47,0,0        ; vbroadcastss  0x2f79(%rip),%ymm1        # 76a8 <_sk_callback_avx+0x462>
+  DB  196,226,125,24,13,109,51,0,0        ; vbroadcastss  0x336d(%rip),%ymm1        # 7a8c <_sk_callback_avx+0x462>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,112,47,0,0        ; vbroadcastss  0x2f70(%rip),%ymm1        # 76ac <_sk_callback_avx+0x466>
+  DB  196,226,125,24,13,100,51,0,0        ; vbroadcastss  0x3364(%rip),%ymm1        # 7a90 <_sk_callback_avx+0x466>
   DB  197,228,84,201                      ; vandps        %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,99,47,0,0         ; vbroadcastss  0x2f63(%rip),%ymm2        # 76b0 <_sk_callback_avx+0x46a>
+  DB  196,226,125,24,21,87,51,0,0         ; vbroadcastss  0x3357(%rip),%ymm2        # 7a94 <_sk_callback_avx+0x46a>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,24,21,90,47,0,0         ; vbroadcastss  0x2f5a(%rip),%ymm2        # 76b4 <_sk_callback_avx+0x46e>
+  DB  196,226,125,24,21,78,51,0,0         ; vbroadcastss  0x334e(%rip),%ymm2        # 7a98 <_sk_callback_avx+0x46e>
   DB  197,228,84,210                      ; vandps        %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,77,47,0,0           ; vbroadcastss  0x2f4d(%rip),%ymm8        # 76b8 <_sk_callback_avx+0x472>
+  DB  196,98,125,24,5,65,51,0,0           ; vbroadcastss  0x3341(%rip),%ymm8        # 7a9c <_sk_callback_avx+0x472>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,67,47,0,0           ; vbroadcastss  0x2f43(%rip),%ymm8        # 76bc <_sk_callback_avx+0x476>
+  DB  196,98,125,24,5,55,51,0,0           ; vbroadcastss  0x3337(%rip),%ymm8        # 7aa0 <_sk_callback_avx+0x476>
   DB  196,193,100,84,216                  ; vandps        %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,53,47,0,0           ; vbroadcastss  0x2f35(%rip),%ymm8        # 76c0 <_sk_callback_avx+0x47a>
+  DB  196,98,125,24,5,41,51,0,0           ; vbroadcastss  0x3329(%rip),%ymm8        # 7aa4 <_sk_callback_avx+0x47a>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -10065,7 +10344,7 @@
 _sk_store_4444_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,34,47,0,0           ; vbroadcastss  0x2f22(%rip),%ymm8        # 76c4 <_sk_callback_avx+0x47e>
+  DB  196,98,125,24,5,22,51,0,0           ; vbroadcastss  0x3316(%rip),%ymm8        # 7aa8 <_sk_callback_avx+0x47e>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,41,114,241,12               ; vpslld        $0xc,%xmm9,%xmm10
@@ -10092,7 +10371,7 @@
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           483b <_sk_store_4444_avx+0xa7>
+  DB  117,10                              ; jne           482b <_sk_store_4444_avx+0xa7>
   DB  196,65,122,127,4,83                 ; vmovdqu       %xmm8,(%r11,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -10100,22 +10379,22 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            4837 <_sk_store_4444_avx+0xa3>
+  DB  119,236                             ; ja            4827 <_sk_store_4444_avx+0xa3>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,66,0,0,0                  ; lea           0x42(%rip),%r10        # 4898 <_sk_store_4444_avx+0x104>
+  DB  76,141,21,66,0,0,0                  ; lea           0x42(%rip),%r10        # 4888 <_sk_store_4444_avx+0x104>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,21,4,83,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  DB  235,207                             ; jmp           4837 <_sk_store_4444_avx+0xa3>
+  DB  235,207                             ; jmp           4827 <_sk_store_4444_avx+0xa3>
   DB  196,67,121,21,68,83,4,2             ; vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   DB  196,65,121,126,4,83                 ; vmovd         %xmm8,(%r11,%rdx,2)
-  DB  235,191                             ; jmp           4837 <_sk_store_4444_avx+0xa3>
+  DB  235,191                             ; jmp           4827 <_sk_store_4444_avx+0xa3>
   DB  196,67,121,21,68,83,12,6            ; vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   DB  196,67,121,21,68,83,10,5            ; vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   DB  196,67,121,21,68,83,8,4             ; vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   DB  196,65,121,214,4,83                 ; vmovq         %xmm8,(%r11,%rdx,2)
-  DB  235,159                             ; jmp           4837 <_sk_store_4444_avx+0xa3>
+  DB  235,159                             ; jmp           4827 <_sk_store_4444_avx+0xa3>
   DB  199                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -10133,7 +10412,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  232,255,255,255,224                 ; callq         ffffffffe10048b0 <_sk_callback_avx+0xffffffffe0ffd66a>
+  DB  232,255,255,255,224                 ; callq         ffffffffe10048a0 <_sk_callback_avx+0xffffffffe0ffd276>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
@@ -10146,12 +10425,12 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,139,0,0,0                    ; jne           4959 <_sk_load_8888_avx+0xa5>
+  DB  15,133,139,0,0,0                    ; jne           4949 <_sk_load_8888_avx+0xa5>
   DB  196,193,124,16,26                   ; vmovups       (%r10),%ymm3
-  DB  197,124,40,21,229,48,0,0            ; vmovaps       0x30e5(%rip),%ymm10        # 79c0 <_sk_callback_avx+0x77a>
+  DB  197,124,40,21,85,53,0,0             ; vmovaps       0x3555(%rip),%ymm10        # 7e20 <_sk_callback_avx+0x7f6>
   DB  196,193,100,84,194                  ; vandps        %ymm10,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,219,45,0,0          ; vbroadcastss  0x2ddb(%rip),%ymm8        # 76c8 <_sk_callback_avx+0x482>
+  DB  196,98,125,24,5,207,49,0,0          ; vbroadcastss  0x31cf(%rip),%ymm8        # 7aac <_sk_callback_avx+0x482>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  197,241,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm1
   DB  196,195,125,25,217,1                ; vextractf128  $0x1,%ymm3,%xmm9
@@ -10182,13 +10461,13 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,225,249,110,192                 ; vmovq         %rax,%xmm0
   DB  196,226,121,48,192                  ; vpmovzxbw     %xmm0,%xmm0
-  DB  196,226,121,0,13,127,47,0,0         ; vpshufb       0x2f7f(%rip),%xmm0,%xmm1        # 7900 <_sk_callback_avx+0x6ba>
+  DB  196,226,121,0,13,127,51,0,0         ; vpshufb       0x337f(%rip),%xmm0,%xmm1        # 7cf0 <_sk_callback_avx+0x6c6>
   DB  196,226,121,33,201                  ; vpmovsxbd     %xmm1,%xmm1
-  DB  196,226,121,0,5,129,47,0,0          ; vpshufb       0x2f81(%rip),%xmm0,%xmm0        # 7910 <_sk_callback_avx+0x6ca>
+  DB  196,226,121,0,5,129,51,0,0          ; vpshufb       0x3381(%rip),%xmm0,%xmm0        # 7d00 <_sk_callback_avx+0x6d6>
   DB  196,226,121,33,192                  ; vpmovsxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  196,194,125,44,26                   ; vmaskmovps    (%r10),%ymm0,%ymm3
-  DB  233,47,255,255,255                  ; jmpq          48d3 <_sk_load_8888_avx+0x1f>
+  DB  233,47,255,255,255                  ; jmpq          48c3 <_sk_load_8888_avx+0x1f>
 
 PUBLIC _sk_load_8888_dst_avx
 _sk_load_8888_dst_avx LABEL PROC
@@ -10198,12 +10477,12 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,139,0,0,0                    ; jne           4a49 <_sk_load_8888_dst_avx+0xa5>
+  DB  15,133,139,0,0,0                    ; jne           4a39 <_sk_load_8888_dst_avx+0xa5>
   DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
-  DB  197,124,40,21,21,48,0,0             ; vmovaps       0x3015(%rip),%ymm10        # 79e0 <_sk_callback_avx+0x79a>
+  DB  197,124,40,21,133,52,0,0            ; vmovaps       0x3485(%rip),%ymm10        # 7e40 <_sk_callback_avx+0x816>
   DB  196,193,68,84,226                   ; vandps        %ymm10,%ymm7,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,98,125,24,5,239,44,0,0          ; vbroadcastss  0x2cef(%rip),%ymm8        # 76cc <_sk_callback_avx+0x486>
+  DB  196,98,125,24,5,227,48,0,0          ; vbroadcastss  0x30e3(%rip),%ymm8        # 7ab0 <_sk_callback_avx+0x486>
   DB  196,193,92,89,224                   ; vmulps        %ymm8,%ymm4,%ymm4
   DB  197,209,114,215,8                   ; vpsrld        $0x8,%xmm7,%xmm5
   DB  196,195,125,25,249,1                ; vextractf128  $0x1,%ymm7,%xmm9
@@ -10234,13 +10513,13 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
   DB  196,226,121,48,228                  ; vpmovzxbw     %xmm4,%xmm4
-  DB  196,226,89,0,45,175,46,0,0          ; vpshufb       0x2eaf(%rip),%xmm4,%xmm5        # 7920 <_sk_callback_avx+0x6da>
+  DB  196,226,89,0,45,175,50,0,0          ; vpshufb       0x32af(%rip),%xmm4,%xmm5        # 7d10 <_sk_callback_avx+0x6e6>
   DB  196,226,121,33,237                  ; vpmovsxbd     %xmm5,%xmm5
-  DB  196,226,89,0,37,177,46,0,0          ; vpshufb       0x2eb1(%rip),%xmm4,%xmm4        # 7930 <_sk_callback_avx+0x6ea>
+  DB  196,226,89,0,37,177,50,0,0          ; vpshufb       0x32b1(%rip),%xmm4,%xmm4        # 7d20 <_sk_callback_avx+0x6f6>
   DB  196,226,121,33,228                  ; vpmovsxbd     %xmm4,%xmm4
   DB  196,227,85,24,228,1                 ; vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
   DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
-  DB  233,47,255,255,255                  ; jmpq          49c3 <_sk_load_8888_dst_avx+0x1f>
+  DB  233,47,255,255,255                  ; jmpq          49b3 <_sk_load_8888_dst_avx+0x1f>
 
 PUBLIC _sk_gather_8888_avx
 _sk_gather_8888_avx LABEL PROC
@@ -10277,10 +10556,10 @@
   DB  73,193,234,32                       ; shr           $0x20,%r10
   DB  196,131,121,34,28,145,3             ; vpinsrd       $0x3,(%r9,%r10,4),%xmm0,%xmm3
   DB  196,227,61,24,195,1                 ; vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  DB  197,124,40,21,193,46,0,0            ; vmovaps       0x2ec1(%rip),%ymm10        # 7a00 <_sk_callback_avx+0x7ba>
+  DB  197,124,40,21,49,51,0,0             ; vmovaps       0x3331(%rip),%ymm10        # 7e60 <_sk_callback_avx+0x836>
   DB  196,193,124,84,194                  ; vandps        %ymm10,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,127,43,0,0         ; vbroadcastss  0x2b7f(%rip),%ymm9        # 76d0 <_sk_callback_avx+0x48a>
+  DB  196,98,125,24,13,115,47,0,0         ; vbroadcastss  0x2f73(%rip),%ymm9        # 7ab4 <_sk_callback_avx+0x48a>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,193,113,114,208,8               ; vpsrld        $0x8,%xmm8,%xmm1
   DB  197,233,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm2
@@ -10309,7 +10588,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
-  DB  196,98,125,24,5,8,43,0,0            ; vbroadcastss  0x2b08(%rip),%ymm8        # 76d4 <_sk_callback_avx+0x48e>
+  DB  196,98,125,24,5,252,46,0,0          ; vbroadcastss  0x2efc(%rip),%ymm8        # 7ab8 <_sk_callback_avx+0x48e>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,65,116,89,208                   ; vmulps        %ymm8,%ymm1,%ymm10
@@ -10334,7 +10613,7 @@
   DB  196,65,45,86,192                    ; vorpd         %ymm8,%ymm10,%ymm8
   DB  196,65,53,86,192                    ; vorpd         %ymm8,%ymm9,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,14                              ; jne           4c5e <_sk_store_8888_avx+0xac>
+  DB  117,14                              ; jne           4c4e <_sk_store_8888_avx+0xac>
   DB  196,65,124,17,2                     ; vmovups       %ymm8,(%r10)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -10347,13 +10626,230 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
-  DB  196,98,49,0,21,186,44,0,0           ; vpshufb       0x2cba(%rip),%xmm9,%xmm10        # 7940 <_sk_callback_avx+0x6fa>
+  DB  196,98,49,0,21,186,48,0,0           ; vpshufb       0x30ba(%rip),%xmm9,%xmm10        # 7d30 <_sk_callback_avx+0x706>
   DB  196,66,121,33,210                   ; vpmovsxbd     %xmm10,%xmm10
-  DB  196,98,49,0,13,188,44,0,0           ; vpshufb       0x2cbc(%rip),%xmm9,%xmm9        # 7950 <_sk_callback_avx+0x70a>
+  DB  196,98,49,0,13,188,48,0,0           ; vpshufb       0x30bc(%rip),%xmm9,%xmm9        # 7d40 <_sk_callback_avx+0x716>
   DB  196,66,121,33,201                   ; vpmovsxbd     %xmm9,%xmm9
   DB  196,67,45,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
   DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
-  DB  235,175                             ; jmp           4c55 <_sk_store_8888_avx+0xa3>
+  DB  235,175                             ; jmp           4c45 <_sk_store_8888_avx+0xa3>
+
+PUBLIC _sk_load_bgra_avx
+_sk_load_bgra_avx LABEL PROC
+  DB  80                                  ; push          %rax
+  DB  73,137,201                          ; mov           %rcx,%r9
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
+  DB  76,3,16                             ; add           (%rax),%r10
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  15,133,139,0,0,0                    ; jne           4d3b <_sk_load_bgra_avx+0xa5>
+  DB  196,193,124,16,26                   ; vmovups       (%r10),%ymm3
+  DB  197,124,40,21,195,49,0,0            ; vmovaps       0x31c3(%rip),%ymm10        # 7e80 <_sk_callback_avx+0x856>
+  DB  196,193,100,84,202                  ; vandps        %ymm10,%ymm3,%ymm1
+  DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
+  DB  196,98,125,24,5,237,45,0,0          ; vbroadcastss  0x2ded(%rip),%ymm8        # 7abc <_sk_callback_avx+0x492>
+  DB  196,193,116,89,208                  ; vmulps        %ymm8,%ymm1,%ymm2
+  DB  197,241,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm1
+  DB  196,195,125,25,217,1                ; vextractf128  $0x1,%ymm3,%xmm9
+  DB  196,193,121,114,209,8               ; vpsrld        $0x8,%xmm9,%xmm0
+  DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
+  DB  196,193,124,84,194                  ; vandps        %ymm10,%ymm0,%ymm0
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,193,124,89,200                  ; vmulps        %ymm8,%ymm0,%ymm1
+  DB  197,161,114,211,16                  ; vpsrld        $0x10,%xmm3,%xmm11
+  DB  196,193,121,114,209,16              ; vpsrld        $0x10,%xmm9,%xmm0
+  DB  196,227,37,24,192,1                 ; vinsertf128   $0x1,%xmm0,%ymm11,%ymm0
+  DB  196,193,124,84,194                  ; vandps        %ymm10,%ymm0,%ymm0
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
+  DB  197,169,114,211,24                  ; vpsrld        $0x18,%xmm3,%xmm10
+  DB  196,193,97,114,209,24               ; vpsrld        $0x18,%xmm9,%xmm3
+  DB  196,227,45,24,219,1                 ; vinsertf128   $0x1,%xmm3,%ymm10,%ymm3
+  DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
+  DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,137,201                          ; mov           %r9,%rcx
+  DB  65,89                               ; pop           %r9
+  DB  255,224                             ; jmpq          *%rax
+  DB  185,8,0,0,0                         ; mov           $0x8,%ecx
+  DB  68,41,193                           ; sub           %r8d,%ecx
+  DB  192,225,3                           ; shl           $0x3,%cl
+  DB  72,199,192,255,255,255,255          ; mov           $0xffffffffffffffff,%rax
+  DB  72,211,232                          ; shr           %cl,%rax
+  DB  196,225,249,110,192                 ; vmovq         %rax,%xmm0
+  DB  196,226,121,48,192                  ; vpmovzxbw     %xmm0,%xmm0
+  DB  196,226,121,0,13,237,47,0,0         ; vpshufb       0x2fed(%rip),%xmm0,%xmm1        # 7d50 <_sk_callback_avx+0x726>
+  DB  196,226,121,33,201                  ; vpmovsxbd     %xmm1,%xmm1
+  DB  196,226,121,0,5,239,47,0,0          ; vpshufb       0x2fef(%rip),%xmm0,%xmm0        # 7d60 <_sk_callback_avx+0x736>
+  DB  196,226,121,33,192                  ; vpmovsxbd     %xmm0,%xmm0
+  DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
+  DB  196,194,125,44,26                   ; vmaskmovps    (%r10),%ymm0,%ymm3
+  DB  233,47,255,255,255                  ; jmpq          4cb5 <_sk_load_bgra_avx+0x1f>
+
+PUBLIC _sk_load_bgra_dst_avx
+_sk_load_bgra_dst_avx LABEL PROC
+  DB  80                                  ; push          %rax
+  DB  73,137,201                          ; mov           %rcx,%r9
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
+  DB  76,3,16                             ; add           (%rax),%r10
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  15,133,139,0,0,0                    ; jne           4e2b <_sk_load_bgra_dst_avx+0xa5>
+  DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
+  DB  197,124,40,21,243,48,0,0            ; vmovaps       0x30f3(%rip),%ymm10        # 7ea0 <_sk_callback_avx+0x876>
+  DB  196,193,68,84,234                   ; vandps        %ymm10,%ymm7,%ymm5
+  DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
+  DB  196,98,125,24,5,1,45,0,0            ; vbroadcastss  0x2d01(%rip),%ymm8        # 7ac0 <_sk_callback_avx+0x496>
+  DB  196,193,84,89,240                   ; vmulps        %ymm8,%ymm5,%ymm6
+  DB  197,209,114,215,8                   ; vpsrld        $0x8,%xmm7,%xmm5
+  DB  196,195,125,25,249,1                ; vextractf128  $0x1,%ymm7,%xmm9
+  DB  196,193,89,114,209,8                ; vpsrld        $0x8,%xmm9,%xmm4
+  DB  196,227,85,24,228,1                 ; vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
+  DB  196,193,92,84,226                   ; vandps        %ymm10,%ymm4,%ymm4
+  DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
+  DB  196,193,92,89,232                   ; vmulps        %ymm8,%ymm4,%ymm5
+  DB  197,161,114,215,16                  ; vpsrld        $0x10,%xmm7,%xmm11
+  DB  196,193,89,114,209,16               ; vpsrld        $0x10,%xmm9,%xmm4
+  DB  196,227,37,24,228,1                 ; vinsertf128   $0x1,%xmm4,%ymm11,%ymm4
+  DB  196,193,92,84,226                   ; vandps        %ymm10,%ymm4,%ymm4
+  DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
+  DB  196,193,92,89,224                   ; vmulps        %ymm8,%ymm4,%ymm4
+  DB  197,169,114,215,24                  ; vpsrld        $0x18,%xmm7,%xmm10
+  DB  196,193,65,114,209,24               ; vpsrld        $0x18,%xmm9,%xmm7
+  DB  196,227,45,24,255,1                 ; vinsertf128   $0x1,%xmm7,%ymm10,%ymm7
+  DB  197,252,91,255                      ; vcvtdq2ps     %ymm7,%ymm7
+  DB  196,193,68,89,248                   ; vmulps        %ymm8,%ymm7,%ymm7
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,137,201                          ; mov           %r9,%rcx
+  DB  65,89                               ; pop           %r9
+  DB  255,224                             ; jmpq          *%rax
+  DB  185,8,0,0,0                         ; mov           $0x8,%ecx
+  DB  68,41,193                           ; sub           %r8d,%ecx
+  DB  192,225,3                           ; shl           $0x3,%cl
+  DB  72,199,192,255,255,255,255          ; mov           $0xffffffffffffffff,%rax
+  DB  72,211,232                          ; shr           %cl,%rax
+  DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
+  DB  196,226,121,48,228                  ; vpmovzxbw     %xmm4,%xmm4
+  DB  196,226,89,0,45,29,47,0,0           ; vpshufb       0x2f1d(%rip),%xmm4,%xmm5        # 7d70 <_sk_callback_avx+0x746>
+  DB  196,226,121,33,237                  ; vpmovsxbd     %xmm5,%xmm5
+  DB  196,226,89,0,37,31,47,0,0           ; vpshufb       0x2f1f(%rip),%xmm4,%xmm4        # 7d80 <_sk_callback_avx+0x756>
+  DB  196,226,121,33,228                  ; vpmovsxbd     %xmm4,%xmm4
+  DB  196,227,85,24,228,1                 ; vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
+  DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
+  DB  233,47,255,255,255                  ; jmpq          4da5 <_sk_load_bgra_dst_avx+0x1f>
+
+PUBLIC _sk_gather_bgra_avx
+_sk_gather_bgra_avx LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,139,8                            ; mov           (%rax),%r9
+  DB  197,254,91,201                      ; vcvttps2dq    %ymm1,%ymm1
+  DB  197,249,110,80,16                   ; vmovd         0x10(%rax),%xmm2
+  DB  197,249,112,210,0                   ; vpshufd       $0x0,%xmm2,%xmm2
+  DB  196,226,105,64,217                  ; vpmulld       %xmm1,%xmm2,%xmm3
+  DB  196,227,125,25,201,1                ; vextractf128  $0x1,%ymm1,%xmm1
+  DB  196,226,105,64,201                  ; vpmulld       %xmm1,%xmm2,%xmm1
+  DB  197,254,91,208                      ; vcvttps2dq    %ymm0,%ymm2
+  DB  196,227,125,25,208,1                ; vextractf128  $0x1,%ymm2,%xmm0
+  DB  197,241,254,192                     ; vpaddd        %xmm0,%xmm1,%xmm0
+  DB  197,225,254,202                     ; vpaddd        %xmm2,%xmm3,%xmm1
+  DB  196,193,249,126,202                 ; vmovq         %xmm1,%r10
+  DB  68,137,208                          ; mov           %r10d,%eax
+  DB  196,193,121,110,20,129              ; vmovd         (%r9,%rax,4),%xmm2
+  DB  196,195,249,22,203,1                ; vpextrq       $0x1,%xmm1,%r11
+  DB  73,193,234,32                       ; shr           $0x20,%r10
+  DB  196,131,105,34,12,145,1             ; vpinsrd       $0x1,(%r9,%r10,4),%xmm2,%xmm1
+  DB  68,137,216                          ; mov           %r11d,%eax
+  DB  196,195,113,34,12,129,2             ; vpinsrd       $0x2,(%r9,%rax,4),%xmm1,%xmm1
+  DB  196,225,249,126,192                 ; vmovq         %xmm0,%rax
+  DB  73,193,235,32                       ; shr           $0x20,%r11
+  DB  196,3,113,34,4,153,3                ; vpinsrd       $0x3,(%r9,%r11,4),%xmm1,%xmm8
+  DB  65,137,194                          ; mov           %eax,%r10d
+  DB  72,193,232,32                       ; shr           $0x20,%rax
+  DB  196,129,121,110,12,145              ; vmovd         (%r9,%r10,4),%xmm1
+  DB  196,195,249,22,194,1                ; vpextrq       $0x1,%xmm0,%r10
+  DB  196,195,113,34,4,129,1              ; vpinsrd       $0x1,(%r9,%rax,4),%xmm1,%xmm0
+  DB  68,137,208                          ; mov           %r10d,%eax
+  DB  196,195,121,34,4,129,2              ; vpinsrd       $0x2,(%r9,%rax,4),%xmm0,%xmm0
+  DB  73,193,234,32                       ; shr           $0x20,%r10
+  DB  196,131,121,34,28,145,3             ; vpinsrd       $0x3,(%r9,%r10,4),%xmm0,%xmm3
+  DB  196,227,61,24,195,1                 ; vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
+  DB  197,124,40,13,159,47,0,0            ; vmovaps       0x2f9f(%rip),%ymm9        # 7ec0 <_sk_callback_avx+0x896>
+  DB  196,193,124,84,193                  ; vandps        %ymm9,%ymm0,%ymm0
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,98,125,24,21,145,43,0,0         ; vbroadcastss  0x2b91(%rip),%ymm10        # 7ac4 <_sk_callback_avx+0x49a>
+  DB  196,193,124,89,210                  ; vmulps        %ymm10,%ymm0,%ymm2
+  DB  196,193,121,114,208,8               ; vpsrld        $0x8,%xmm8,%xmm0
+  DB  197,241,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm1
+  DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
+  DB  196,193,124,84,193                  ; vandps        %ymm9,%ymm0,%ymm0
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,193,124,89,202                  ; vmulps        %ymm10,%ymm0,%ymm1
+  DB  196,193,33,114,208,16               ; vpsrld        $0x10,%xmm8,%xmm11
+  DB  197,249,114,211,16                  ; vpsrld        $0x10,%xmm3,%xmm0
+  DB  196,227,37,24,192,1                 ; vinsertf128   $0x1,%xmm0,%ymm11,%ymm0
+  DB  196,193,124,84,193                  ; vandps        %ymm9,%ymm0,%ymm0
+  DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
+  DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
+  DB  196,193,57,114,208,24               ; vpsrld        $0x18,%xmm8,%xmm8
+  DB  197,225,114,211,24                  ; vpsrld        $0x18,%xmm3,%xmm3
+  DB  196,227,61,24,219,1                 ; vinsertf128   $0x1,%xmm3,%ymm8,%ymm3
+  DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
+  DB  196,193,100,89,218                  ; vmulps        %ymm10,%ymm3,%ymm3
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+
+PUBLIC _sk_store_bgra_avx
+_sk_store_bgra_avx LABEL PROC
+  DB  80                                  ; push          %rax
+  DB  73,137,201                          ; mov           %rcx,%r9
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
+  DB  76,3,16                             ; add           (%rax),%r10
+  DB  196,98,125,24,5,26,43,0,0           ; vbroadcastss  0x2b1a(%rip),%ymm8        # 7ac8 <_sk_callback_avx+0x49e>
+  DB  196,65,108,89,200                   ; vmulps        %ymm8,%ymm2,%ymm9
+  DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
+  DB  196,65,116,89,208                   ; vmulps        %ymm8,%ymm1,%ymm10
+  DB  196,65,125,91,210                   ; vcvtps2dq     %ymm10,%ymm10
+  DB  196,193,33,114,242,8                ; vpslld        $0x8,%xmm10,%xmm11
+  DB  196,67,125,25,210,1                 ; vextractf128  $0x1,%ymm10,%xmm10
+  DB  196,193,41,114,242,8                ; vpslld        $0x8,%xmm10,%xmm10
+  DB  196,67,37,24,210,1                  ; vinsertf128   $0x1,%xmm10,%ymm11,%ymm10
+  DB  196,65,45,86,201                    ; vorpd         %ymm9,%ymm10,%ymm9
+  DB  196,65,124,89,208                   ; vmulps        %ymm8,%ymm0,%ymm10
+  DB  196,65,125,91,210                   ; vcvtps2dq     %ymm10,%ymm10
+  DB  196,193,33,114,242,16               ; vpslld        $0x10,%xmm10,%xmm11
+  DB  196,67,125,25,210,1                 ; vextractf128  $0x1,%ymm10,%xmm10
+  DB  196,193,41,114,242,16               ; vpslld        $0x10,%xmm10,%xmm10
+  DB  196,67,37,24,210,1                  ; vinsertf128   $0x1,%xmm10,%ymm11,%ymm10
+  DB  196,65,100,89,192                   ; vmulps        %ymm8,%ymm3,%ymm8
+  DB  196,65,125,91,192                   ; vcvtps2dq     %ymm8,%ymm8
+  DB  196,193,33,114,240,24               ; vpslld        $0x18,%xmm8,%xmm11
+  DB  196,67,125,25,192,1                 ; vextractf128  $0x1,%ymm8,%xmm8
+  DB  196,193,57,114,240,24               ; vpslld        $0x18,%xmm8,%xmm8
+  DB  196,67,37,24,192,1                  ; vinsertf128   $0x1,%xmm8,%ymm11,%ymm8
+  DB  196,65,45,86,192                    ; vorpd         %ymm8,%ymm10,%ymm8
+  DB  196,65,53,86,192                    ; vorpd         %ymm8,%ymm9,%ymm8
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,14                              ; jne           5040 <_sk_store_bgra_avx+0xac>
+  DB  196,65,124,17,2                     ; vmovups       %ymm8,(%r10)
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,137,201                          ; mov           %r9,%rcx
+  DB  65,89                               ; pop           %r9
+  DB  255,224                             ; jmpq          *%rax
+  DB  185,8,0,0,0                         ; mov           $0x8,%ecx
+  DB  68,41,193                           ; sub           %r8d,%ecx
+  DB  192,225,3                           ; shl           $0x3,%cl
+  DB  72,199,192,255,255,255,255          ; mov           $0xffffffffffffffff,%rax
+  DB  72,211,232                          ; shr           %cl,%rax
+  DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
+  DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
+  DB  196,98,49,0,21,40,45,0,0            ; vpshufb       0x2d28(%rip),%xmm9,%xmm10        # 7d90 <_sk_callback_avx+0x766>
+  DB  196,66,121,33,210                   ; vpmovsxbd     %xmm10,%xmm10
+  DB  196,98,49,0,13,42,45,0,0            ; vpshufb       0x2d2a(%rip),%xmm9,%xmm9        # 7da0 <_sk_callback_avx+0x776>
+  DB  196,66,121,33,201                   ; vpmovsxbd     %xmm9,%xmm9
+  DB  196,67,45,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
+  DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
+  DB  235,175                             ; jmp           5037 <_sk_store_bgra_avx+0xa3>
 
 PUBLIC _sk_load_f16_avx
 _sk_load_f16_avx LABEL PROC
@@ -10365,7 +10861,7 @@
   DB  197,252,17,116,36,64                ; vmovups       %ymm6,0x40(%rsp)
   DB  197,252,17,108,36,32                ; vmovups       %ymm5,0x20(%rsp)
   DB  197,254,127,36,36                   ; vmovdqu       %ymm4,(%rsp)
-  DB  15,133,143,2,0,0                    ; jne           4f61 <_sk_load_f16_avx+0x2bb>
+  DB  15,133,143,2,0,0                    ; jne           5343 <_sk_load_f16_avx+0x2bb>
   DB  197,121,16,4,208                    ; vmovupd       (%rax,%rdx,8),%xmm8
   DB  197,249,16,84,208,16                ; vmovupd       0x10(%rax,%rdx,8),%xmm2
   DB  197,249,16,76,208,32                ; vmovupd       0x20(%rax,%rdx,8),%xmm1
@@ -10383,13 +10879,13 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
-  DB  196,98,125,24,37,173,41,0,0         ; vbroadcastss  0x29ad(%rip),%ymm12        # 76d8 <_sk_callback_avx+0x492>
+  DB  196,98,125,24,37,191,41,0,0         ; vbroadcastss  0x29bf(%rip),%ymm12        # 7acc <_sk_callback_avx+0x4a2>
   DB  196,193,124,84,204                  ; vandps        %ymm12,%ymm0,%ymm1
   DB  197,252,87,193                      ; vxorps        %ymm1,%ymm0,%ymm0
   DB  196,195,125,25,198,1                ; vextractf128  $0x1,%ymm0,%xmm14
-  DB  196,98,121,24,29,153,41,0,0         ; vbroadcastss  0x2999(%rip),%xmm11        # 76dc <_sk_callback_avx+0x496>
+  DB  196,98,121,24,29,171,41,0,0         ; vbroadcastss  0x29ab(%rip),%xmm11        # 7ad0 <_sk_callback_avx+0x4a6>
   DB  196,193,8,87,219                    ; vxorps        %xmm11,%xmm14,%xmm3
-  DB  196,98,121,24,45,143,41,0,0         ; vbroadcastss  0x298f(%rip),%xmm13        # 76e0 <_sk_callback_avx+0x49a>
+  DB  196,98,121,24,45,161,41,0,0         ; vbroadcastss  0x29a1(%rip),%xmm13        # 7ad4 <_sk_callback_avx+0x4aa>
   DB  197,145,102,219                     ; vpcmpgtd      %xmm3,%xmm13,%xmm3
   DB  196,65,120,87,211                   ; vxorps        %xmm11,%xmm0,%xmm10
   DB  196,65,17,102,210                   ; vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -10403,7 +10899,7 @@
   DB  196,227,125,24,195,1                ; vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   DB  197,252,86,193                      ; vorps         %ymm1,%ymm0,%ymm0
   DB  196,227,125,25,193,1                ; vextractf128  $0x1,%ymm0,%xmm1
-  DB  196,226,121,24,29,69,41,0,0         ; vbroadcastss  0x2945(%rip),%xmm3        # 76e4 <_sk_callback_avx+0x49e>
+  DB  196,226,121,24,29,87,41,0,0         ; vbroadcastss  0x2957(%rip),%xmm3        # 7ad8 <_sk_callback_avx+0x4ae>
   DB  197,241,254,203                     ; vpaddd        %xmm3,%xmm1,%xmm1
   DB  197,249,254,195                     ; vpaddd        %xmm3,%xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
@@ -10496,29 +10992,29 @@
   DB  197,123,16,4,208                    ; vmovsd        (%rax,%rdx,8),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,79                              ; je            4fc0 <_sk_load_f16_avx+0x31a>
+  DB  116,79                              ; je            53a2 <_sk_load_f16_avx+0x31a>
   DB  197,57,22,68,208,8                  ; vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,67                              ; jb            4fc0 <_sk_load_f16_avx+0x31a>
+  DB  114,67                              ; jb            53a2 <_sk_load_f16_avx+0x31a>
   DB  197,251,16,84,208,16                ; vmovsd        0x10(%rax,%rdx,8),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,68                              ; je            4fcd <_sk_load_f16_avx+0x327>
+  DB  116,68                              ; je            53af <_sk_load_f16_avx+0x327>
   DB  197,233,22,84,208,24                ; vmovhpd       0x18(%rax,%rdx,8),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,56                              ; jb            4fcd <_sk_load_f16_avx+0x327>
+  DB  114,56                              ; jb            53af <_sk_load_f16_avx+0x327>
   DB  197,251,16,76,208,32                ; vmovsd        0x20(%rax,%rdx,8),%xmm1
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,68,253,255,255               ; je            4ce9 <_sk_load_f16_avx+0x43>
+  DB  15,132,68,253,255,255               ; je            50cb <_sk_load_f16_avx+0x43>
   DB  197,241,22,76,208,40                ; vmovhpd       0x28(%rax,%rdx,8),%xmm1,%xmm1
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,52,253,255,255               ; jb            4ce9 <_sk_load_f16_avx+0x43>
+  DB  15,130,52,253,255,255               ; jb            50cb <_sk_load_f16_avx+0x43>
   DB  197,122,126,76,208,48               ; vmovq         0x30(%rax,%rdx,8),%xmm9
-  DB  233,41,253,255,255                  ; jmpq          4ce9 <_sk_load_f16_avx+0x43>
+  DB  233,41,253,255,255                  ; jmpq          50cb <_sk_load_f16_avx+0x43>
   DB  197,241,87,201                      ; vxorpd        %xmm1,%xmm1,%xmm1
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,28,253,255,255                  ; jmpq          4ce9 <_sk_load_f16_avx+0x43>
+  DB  233,28,253,255,255                  ; jmpq          50cb <_sk_load_f16_avx+0x43>
   DB  197,241,87,201                      ; vxorpd        %xmm1,%xmm1,%xmm1
-  DB  233,19,253,255,255                  ; jmpq          4ce9 <_sk_load_f16_avx+0x43>
+  DB  233,19,253,255,255                  ; jmpq          50cb <_sk_load_f16_avx+0x43>
 
 PUBLIC _sk_load_f16_dst_avx
 _sk_load_f16_dst_avx LABEL PROC
@@ -10530,7 +11026,7 @@
   DB  197,252,17,84,36,64                 ; vmovups       %ymm2,0x40(%rsp)
   DB  197,252,17,76,36,32                 ; vmovups       %ymm1,0x20(%rsp)
   DB  197,254,127,4,36                    ; vmovdqu       %ymm0,(%rsp)
-  DB  15,133,143,2,0,0                    ; jne           5291 <_sk_load_f16_dst_avx+0x2bb>
+  DB  15,133,143,2,0,0                    ; jne           5673 <_sk_load_f16_dst_avx+0x2bb>
   DB  197,121,16,4,208                    ; vmovupd       (%rax,%rdx,8),%xmm8
   DB  197,249,16,116,208,16               ; vmovupd       0x10(%rax,%rdx,8),%xmm6
   DB  197,249,16,108,208,32               ; vmovupd       0x20(%rax,%rdx,8),%xmm5
@@ -10548,13 +11044,13 @@
   DB  197,217,105,232                     ; vpunpckhwd    %xmm0,%xmm4,%xmm5
   DB  196,226,121,51,228                  ; vpmovzxwd     %xmm4,%xmm4
   DB  196,227,93,24,229,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
-  DB  196,98,125,24,37,141,38,0,0         ; vbroadcastss  0x268d(%rip),%ymm12        # 76e8 <_sk_callback_avx+0x4a2>
+  DB  196,98,125,24,37,159,38,0,0         ; vbroadcastss  0x269f(%rip),%ymm12        # 7adc <_sk_callback_avx+0x4b2>
   DB  196,193,92,84,236                   ; vandps        %ymm12,%ymm4,%ymm5
   DB  197,220,87,229                      ; vxorps        %ymm5,%ymm4,%ymm4
   DB  196,195,125,25,230,1                ; vextractf128  $0x1,%ymm4,%xmm14
-  DB  196,98,121,24,29,121,38,0,0         ; vbroadcastss  0x2679(%rip),%xmm11        # 76ec <_sk_callback_avx+0x4a6>
+  DB  196,98,121,24,29,139,38,0,0         ; vbroadcastss  0x268b(%rip),%xmm11        # 7ae0 <_sk_callback_avx+0x4b6>
   DB  196,193,8,87,251                    ; vxorps        %xmm11,%xmm14,%xmm7
-  DB  196,98,121,24,45,111,38,0,0         ; vbroadcastss  0x266f(%rip),%xmm13        # 76f0 <_sk_callback_avx+0x4aa>
+  DB  196,98,121,24,45,129,38,0,0         ; vbroadcastss  0x2681(%rip),%xmm13        # 7ae4 <_sk_callback_avx+0x4ba>
   DB  197,145,102,255                     ; vpcmpgtd      %xmm7,%xmm13,%xmm7
   DB  196,65,88,87,211                    ; vxorps        %xmm11,%xmm4,%xmm10
   DB  196,65,17,102,210                   ; vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -10568,7 +11064,7 @@
   DB  196,227,93,24,231,1                 ; vinsertf128   $0x1,%xmm7,%ymm4,%ymm4
   DB  197,220,86,229                      ; vorps         %ymm5,%ymm4,%ymm4
   DB  196,227,125,25,229,1                ; vextractf128  $0x1,%ymm4,%xmm5
-  DB  196,226,121,24,61,37,38,0,0         ; vbroadcastss  0x2625(%rip),%xmm7        # 76f4 <_sk_callback_avx+0x4ae>
+  DB  196,226,121,24,61,55,38,0,0         ; vbroadcastss  0x2637(%rip),%xmm7        # 7ae8 <_sk_callback_avx+0x4be>
   DB  197,209,254,239                     ; vpaddd        %xmm7,%xmm5,%xmm5
   DB  197,217,254,231                     ; vpaddd        %xmm7,%xmm4,%xmm4
   DB  196,227,93,24,229,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
@@ -10661,29 +11157,29 @@
   DB  197,123,16,4,208                    ; vmovsd        (%rax,%rdx,8),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,79                              ; je            52f0 <_sk_load_f16_dst_avx+0x31a>
+  DB  116,79                              ; je            56d2 <_sk_load_f16_dst_avx+0x31a>
   DB  197,57,22,68,208,8                  ; vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,67                              ; jb            52f0 <_sk_load_f16_dst_avx+0x31a>
+  DB  114,67                              ; jb            56d2 <_sk_load_f16_dst_avx+0x31a>
   DB  197,251,16,116,208,16               ; vmovsd        0x10(%rax,%rdx,8),%xmm6
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,68                              ; je            52fd <_sk_load_f16_dst_avx+0x327>
+  DB  116,68                              ; je            56df <_sk_load_f16_dst_avx+0x327>
   DB  197,201,22,116,208,24               ; vmovhpd       0x18(%rax,%rdx,8),%xmm6,%xmm6
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,56                              ; jb            52fd <_sk_load_f16_dst_avx+0x327>
+  DB  114,56                              ; jb            56df <_sk_load_f16_dst_avx+0x327>
   DB  197,251,16,108,208,32               ; vmovsd        0x20(%rax,%rdx,8),%xmm5
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,68,253,255,255               ; je            5019 <_sk_load_f16_dst_avx+0x43>
+  DB  15,132,68,253,255,255               ; je            53fb <_sk_load_f16_dst_avx+0x43>
   DB  197,209,22,108,208,40               ; vmovhpd       0x28(%rax,%rdx,8),%xmm5,%xmm5
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,52,253,255,255               ; jb            5019 <_sk_load_f16_dst_avx+0x43>
+  DB  15,130,52,253,255,255               ; jb            53fb <_sk_load_f16_dst_avx+0x43>
   DB  197,122,126,76,208,48               ; vmovq         0x30(%rax,%rdx,8),%xmm9
-  DB  233,41,253,255,255                  ; jmpq          5019 <_sk_load_f16_dst_avx+0x43>
+  DB  233,41,253,255,255                  ; jmpq          53fb <_sk_load_f16_dst_avx+0x43>
   DB  197,209,87,237                      ; vxorpd        %xmm5,%xmm5,%xmm5
   DB  197,201,87,246                      ; vxorpd        %xmm6,%xmm6,%xmm6
-  DB  233,28,253,255,255                  ; jmpq          5019 <_sk_load_f16_dst_avx+0x43>
+  DB  233,28,253,255,255                  ; jmpq          53fb <_sk_load_f16_dst_avx+0x43>
   DB  197,209,87,237                      ; vxorpd        %xmm5,%xmm5,%xmm5
-  DB  233,19,253,255,255                  ; jmpq          5019 <_sk_load_f16_dst_avx+0x43>
+  DB  233,19,253,255,255                  ; jmpq          53fb <_sk_load_f16_dst_avx+0x43>
 
 PUBLIC _sk_gather_f16_avx
 _sk_gather_f16_avx LABEL PROC
@@ -10742,13 +11238,13 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
-  DB  196,98,125,24,37,230,34,0,0         ; vbroadcastss  0x22e6(%rip),%ymm12        # 76f8 <_sk_callback_avx+0x4b2>
+  DB  196,98,125,24,37,248,34,0,0         ; vbroadcastss  0x22f8(%rip),%ymm12        # 7aec <_sk_callback_avx+0x4c2>
   DB  196,193,124,84,204                  ; vandps        %ymm12,%ymm0,%ymm1
   DB  197,252,87,193                      ; vxorps        %ymm1,%ymm0,%ymm0
   DB  196,195,125,25,198,1                ; vextractf128  $0x1,%ymm0,%xmm14
-  DB  196,98,121,24,29,210,34,0,0         ; vbroadcastss  0x22d2(%rip),%xmm11        # 76fc <_sk_callback_avx+0x4b6>
+  DB  196,98,121,24,29,228,34,0,0         ; vbroadcastss  0x22e4(%rip),%xmm11        # 7af0 <_sk_callback_avx+0x4c6>
   DB  196,193,8,87,219                    ; vxorps        %xmm11,%xmm14,%xmm3
-  DB  196,98,121,24,45,200,34,0,0         ; vbroadcastss  0x22c8(%rip),%xmm13        # 7700 <_sk_callback_avx+0x4ba>
+  DB  196,98,121,24,45,218,34,0,0         ; vbroadcastss  0x22da(%rip),%xmm13        # 7af4 <_sk_callback_avx+0x4ca>
   DB  197,145,102,219                     ; vpcmpgtd      %xmm3,%xmm13,%xmm3
   DB  196,65,120,87,211                   ; vxorps        %xmm11,%xmm0,%xmm10
   DB  196,65,17,102,210                   ; vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -10762,7 +11258,7 @@
   DB  196,227,125,24,195,1                ; vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   DB  197,252,86,193                      ; vorps         %ymm1,%ymm0,%ymm0
   DB  196,227,125,25,193,1                ; vextractf128  $0x1,%ymm0,%xmm1
-  DB  196,226,121,24,29,126,34,0,0        ; vbroadcastss  0x227e(%rip),%xmm3        # 7704 <_sk_callback_avx+0x4be>
+  DB  196,226,121,24,29,144,34,0,0        ; vbroadcastss  0x2290(%rip),%xmm3        # 7af8 <_sk_callback_avx+0x4ce>
   DB  197,241,254,203                     ; vpaddd        %xmm3,%xmm1,%xmm1
   DB  197,249,254,195                     ; vpaddd        %xmm3,%xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
@@ -10860,12 +11356,12 @@
   DB  197,252,17,180,36,128,0,0,0         ; vmovups       %ymm6,0x80(%rsp)
   DB  197,252,17,108,36,96                ; vmovups       %ymm5,0x60(%rsp)
   DB  197,252,17,100,36,64                ; vmovups       %ymm4,0x40(%rsp)
-  DB  196,98,125,24,13,146,32,0,0         ; vbroadcastss  0x2092(%rip),%ymm9        # 7708 <_sk_callback_avx+0x4c2>
+  DB  196,98,125,24,13,164,32,0,0         ; vbroadcastss  0x20a4(%rip),%ymm9        # 7afc <_sk_callback_avx+0x4d2>
   DB  196,65,124,84,209                   ; vandps        %ymm9,%ymm0,%ymm10
   DB  197,252,17,4,36                     ; vmovups       %ymm0,(%rsp)
   DB  196,65,124,87,218                   ; vxorps        %ymm10,%ymm0,%ymm11
   DB  196,67,125,25,220,1                 ; vextractf128  $0x1,%ymm11,%xmm12
-  DB  196,98,121,24,5,120,32,0,0          ; vbroadcastss  0x2078(%rip),%xmm8        # 770c <_sk_callback_avx+0x4c6>
+  DB  196,98,121,24,5,138,32,0,0          ; vbroadcastss  0x208a(%rip),%xmm8        # 7b00 <_sk_callback_avx+0x4d6>
   DB  196,65,57,102,236                   ; vpcmpgtd      %xmm12,%xmm8,%xmm13
   DB  196,65,57,102,243                   ; vpcmpgtd      %xmm11,%xmm8,%xmm14
   DB  196,67,13,24,237,1                  ; vinsertf128   $0x1,%xmm13,%ymm14,%ymm13
@@ -10875,7 +11371,7 @@
   DB  196,67,13,24,242,1                  ; vinsertf128   $0x1,%xmm10,%ymm14,%ymm14
   DB  196,193,33,114,211,13               ; vpsrld        $0xd,%xmm11,%xmm11
   DB  196,193,25,114,212,13               ; vpsrld        $0xd,%xmm12,%xmm12
-  DB  196,98,125,24,21,63,32,0,0          ; vbroadcastss  0x203f(%rip),%ymm10        # 7710 <_sk_callback_avx+0x4ca>
+  DB  196,98,125,24,21,81,32,0,0          ; vbroadcastss  0x2051(%rip),%ymm10        # 7b04 <_sk_callback_avx+0x4da>
   DB  196,65,12,86,242                    ; vorps         %ymm10,%ymm14,%ymm14
   DB  196,67,125,25,247,1                 ; vextractf128  $0x1,%ymm14,%xmm15
   DB  196,65,1,254,228                    ; vpaddd        %xmm12,%xmm15,%xmm12
@@ -10957,7 +11453,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,75                              ; jne           58b8 <_sk_store_f16_avx+0x270>
+  DB  117,75                              ; jne           5c9a <_sk_store_f16_avx+0x270>
   DB  197,120,17,28,208                   ; vmovups       %xmm11,(%rax,%rdx,8)
   DB  197,120,17,84,208,16                ; vmovups       %xmm10,0x10(%rax,%rdx,8)
   DB  197,120,17,76,208,32                ; vmovups       %xmm9,0x20(%rax,%rdx,8)
@@ -10973,22 +11469,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  197,121,214,28,208                  ; vmovq         %xmm11,(%rax,%rdx,8)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,193                             ; je            5884 <_sk_store_f16_avx+0x23c>
+  DB  116,193                             ; je            5c66 <_sk_store_f16_avx+0x23c>
   DB  197,121,23,92,208,8                 ; vmovhpd       %xmm11,0x8(%rax,%rdx,8)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,181                             ; jb            5884 <_sk_store_f16_avx+0x23c>
+  DB  114,181                             ; jb            5c66 <_sk_store_f16_avx+0x23c>
   DB  197,121,214,84,208,16               ; vmovq         %xmm10,0x10(%rax,%rdx,8)
-  DB  116,173                             ; je            5884 <_sk_store_f16_avx+0x23c>
+  DB  116,173                             ; je            5c66 <_sk_store_f16_avx+0x23c>
   DB  197,121,23,84,208,24                ; vmovhpd       %xmm10,0x18(%rax,%rdx,8)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,161                             ; jb            5884 <_sk_store_f16_avx+0x23c>
+  DB  114,161                             ; jb            5c66 <_sk_store_f16_avx+0x23c>
   DB  197,121,214,76,208,32               ; vmovq         %xmm9,0x20(%rax,%rdx,8)
-  DB  116,153                             ; je            5884 <_sk_store_f16_avx+0x23c>
+  DB  116,153                             ; je            5c66 <_sk_store_f16_avx+0x23c>
   DB  197,121,23,76,208,40                ; vmovhpd       %xmm9,0x28(%rax,%rdx,8)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,141                             ; jb            5884 <_sk_store_f16_avx+0x23c>
+  DB  114,141                             ; jb            5c66 <_sk_store_f16_avx+0x23c>
   DB  197,121,214,68,208,48               ; vmovq         %xmm8,0x30(%rax,%rdx,8)
-  DB  235,133                             ; jmp           5884 <_sk_store_f16_avx+0x23c>
+  DB  235,133                             ; jmp           5c66 <_sk_store_f16_avx+0x23c>
 
 PUBLIC _sk_load_u16_be_avx
 _sk_load_u16_be_avx LABEL PROC
@@ -10996,7 +11492,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,253,0,0,0                    ; jne           5a12 <_sk_load_u16_be_avx+0x113>
+  DB  15,133,253,0,0,0                    ; jne           5df4 <_sk_load_u16_be_avx+0x113>
   DB  196,65,121,16,4,65                  ; vmovupd       (%r9,%rax,2),%xmm8
   DB  196,193,121,16,84,65,16             ; vmovupd       0x10(%r9,%rax,2),%xmm2
   DB  196,193,121,16,92,65,32             ; vmovupd       0x20(%r9,%rax,2),%xmm3
@@ -11018,7 +11514,7 @@
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,29,142,29,0,0         ; vbroadcastss  0x1d8e(%rip),%ymm11        # 7714 <_sk_callback_avx+0x4ce>
+  DB  196,98,125,24,29,160,29,0,0         ; vbroadcastss  0x1da0(%rip),%ymm11        # 7b08 <_sk_callback_avx+0x4de>
   DB  196,193,124,89,195                  ; vmulps        %ymm11,%ymm0,%ymm0
   DB  197,177,109,202                     ; vpunpckhqdq   %xmm2,%xmm9,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -11052,29 +11548,29 @@
   DB  196,65,123,16,4,65                  ; vmovsd        (%r9,%rax,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,85                              ; je            5a78 <_sk_load_u16_be_avx+0x179>
+  DB  116,85                              ; je            5e5a <_sk_load_u16_be_avx+0x179>
   DB  196,65,57,22,68,65,8                ; vmovhpd       0x8(%r9,%rax,2),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,72                              ; jb            5a78 <_sk_load_u16_be_avx+0x179>
+  DB  114,72                              ; jb            5e5a <_sk_load_u16_be_avx+0x179>
   DB  196,193,123,16,84,65,16             ; vmovsd        0x10(%r9,%rax,2),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,72                              ; je            5a85 <_sk_load_u16_be_avx+0x186>
+  DB  116,72                              ; je            5e67 <_sk_load_u16_be_avx+0x186>
   DB  196,193,105,22,84,65,24             ; vmovhpd       0x18(%r9,%rax,2),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,59                              ; jb            5a85 <_sk_load_u16_be_avx+0x186>
+  DB  114,59                              ; jb            5e67 <_sk_load_u16_be_avx+0x186>
   DB  196,193,123,16,92,65,32             ; vmovsd        0x20(%r9,%rax,2),%xmm3
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,213,254,255,255              ; je            5930 <_sk_load_u16_be_avx+0x31>
+  DB  15,132,213,254,255,255              ; je            5d12 <_sk_load_u16_be_avx+0x31>
   DB  196,193,97,22,92,65,40              ; vmovhpd       0x28(%r9,%rax,2),%xmm3,%xmm3
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,196,254,255,255              ; jb            5930 <_sk_load_u16_be_avx+0x31>
+  DB  15,130,196,254,255,255              ; jb            5d12 <_sk_load_u16_be_avx+0x31>
   DB  196,65,122,126,76,65,48             ; vmovq         0x30(%r9,%rax,2),%xmm9
-  DB  233,184,254,255,255                 ; jmpq          5930 <_sk_load_u16_be_avx+0x31>
+  DB  233,184,254,255,255                 ; jmpq          5d12 <_sk_load_u16_be_avx+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,171,254,255,255                 ; jmpq          5930 <_sk_load_u16_be_avx+0x31>
+  DB  233,171,254,255,255                 ; jmpq          5d12 <_sk_load_u16_be_avx+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,162,254,255,255                 ; jmpq          5930 <_sk_load_u16_be_avx+0x31>
+  DB  233,162,254,255,255                 ; jmpq          5d12 <_sk_load_u16_be_avx+0x31>
 
 PUBLIC _sk_load_rgb_u16_be_avx
 _sk_load_rgb_u16_be_avx LABEL PROC
@@ -11082,7 +11578,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,82                         ; lea           (%rdx,%rdx,2),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,243,0,0,0                    ; jne           5b93 <_sk_load_rgb_u16_be_avx+0x105>
+  DB  15,133,243,0,0,0                    ; jne           5f75 <_sk_load_rgb_u16_be_avx+0x105>
   DB  196,193,122,111,4,65                ; vmovdqu       (%r9,%rax,2),%xmm0
   DB  196,193,122,111,84,65,12            ; vmovdqu       0xc(%r9,%rax,2),%xmm2
   DB  196,193,122,111,76,65,24            ; vmovdqu       0x18(%r9,%rax,2),%xmm1
@@ -11109,7 +11605,7 @@
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,29,238,27,0,0         ; vbroadcastss  0x1bee(%rip),%ymm11        # 7718 <_sk_callback_avx+0x4d2>
+  DB  196,98,125,24,29,0,28,0,0           ; vbroadcastss  0x1c00(%rip),%ymm11        # 7b0c <_sk_callback_avx+0x4e2>
   DB  196,193,124,89,195                  ; vmulps        %ymm11,%ymm0,%ymm0
   DB  197,185,109,202                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -11130,48 +11626,48 @@
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,211                  ; vmulps        %ymm11,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,139,27,0,0        ; vbroadcastss  0x1b8b(%rip),%ymm3        # 771c <_sk_callback_avx+0x4d6>
+  DB  196,226,125,24,29,157,27,0,0        ; vbroadcastss  0x1b9d(%rip),%ymm3        # 7b10 <_sk_callback_avx+0x4e6>
   DB  255,224                             ; jmpq          *%rax
   DB  196,193,121,110,4,65                ; vmovd         (%r9,%rax,2),%xmm0
   DB  196,193,121,196,68,65,4,2           ; vpinsrw       $0x2,0x4(%r9,%rax,2),%xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,5                               ; jne           5bac <_sk_load_rgb_u16_be_avx+0x11e>
-  DB  233,40,255,255,255                  ; jmpq          5ad4 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  117,5                               ; jne           5f8e <_sk_load_rgb_u16_be_avx+0x11e>
+  DB  233,40,255,255,255                  ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
   DB  196,193,121,110,76,65,6             ; vmovd         0x6(%r9,%rax,2),%xmm1
   DB  196,65,113,196,68,65,10,2           ; vpinsrw       $0x2,0xa(%r9,%rax,2),%xmm1,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,26                              ; jb            5bdb <_sk_load_rgb_u16_be_avx+0x14d>
+  DB  114,26                              ; jb            5fbd <_sk_load_rgb_u16_be_avx+0x14d>
   DB  196,193,121,110,76,65,12            ; vmovd         0xc(%r9,%rax,2),%xmm1
   DB  196,193,113,196,84,65,16,2          ; vpinsrw       $0x2,0x10(%r9,%rax,2),%xmm1,%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  117,10                              ; jne           5be0 <_sk_load_rgb_u16_be_avx+0x152>
-  DB  233,249,254,255,255                 ; jmpq          5ad4 <_sk_load_rgb_u16_be_avx+0x46>
-  DB  233,244,254,255,255                 ; jmpq          5ad4 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  117,10                              ; jne           5fc2 <_sk_load_rgb_u16_be_avx+0x152>
+  DB  233,249,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,244,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
   DB  196,193,121,110,76,65,18            ; vmovd         0x12(%r9,%rax,2),%xmm1
   DB  196,65,113,196,76,65,22,2           ; vpinsrw       $0x2,0x16(%r9,%rax,2),%xmm1,%xmm9
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,26                              ; jb            5c0f <_sk_load_rgb_u16_be_avx+0x181>
+  DB  114,26                              ; jb            5ff1 <_sk_load_rgb_u16_be_avx+0x181>
   DB  196,193,121,110,76,65,24            ; vmovd         0x18(%r9,%rax,2),%xmm1
   DB  196,193,113,196,76,65,28,2          ; vpinsrw       $0x2,0x1c(%r9,%rax,2),%xmm1,%xmm1
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  117,10                              ; jne           5c14 <_sk_load_rgb_u16_be_avx+0x186>
-  DB  233,197,254,255,255                 ; jmpq          5ad4 <_sk_load_rgb_u16_be_avx+0x46>
-  DB  233,192,254,255,255                 ; jmpq          5ad4 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  117,10                              ; jne           5ff6 <_sk_load_rgb_u16_be_avx+0x186>
+  DB  233,197,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,192,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
   DB  196,193,121,110,92,65,30            ; vmovd         0x1e(%r9,%rax,2),%xmm3
   DB  196,65,97,196,92,65,34,2            ; vpinsrw       $0x2,0x22(%r9,%rax,2),%xmm3,%xmm11
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,20                              ; jb            5c3d <_sk_load_rgb_u16_be_avx+0x1af>
+  DB  114,20                              ; jb            601f <_sk_load_rgb_u16_be_avx+0x1af>
   DB  196,193,121,110,92,65,36            ; vmovd         0x24(%r9,%rax,2),%xmm3
   DB  196,193,97,196,92,65,40,2           ; vpinsrw       $0x2,0x28(%r9,%rax,2),%xmm3,%xmm3
-  DB  233,151,254,255,255                 ; jmpq          5ad4 <_sk_load_rgb_u16_be_avx+0x46>
-  DB  233,146,254,255,255                 ; jmpq          5ad4 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,151,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,146,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
 
 PUBLIC _sk_store_u16_be_avx
 _sk_store_u16_be_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
-  DB  196,98,125,24,5,200,26,0,0          ; vbroadcastss  0x1ac8(%rip),%ymm8        # 7720 <_sk_callback_avx+0x4da>
+  DB  196,98,125,24,5,218,26,0,0          ; vbroadcastss  0x1ada(%rip),%ymm8        # 7b14 <_sk_callback_avx+0x4ea>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,67,125,25,202,1                 ; vextractf128  $0x1,%ymm9,%xmm10
@@ -11209,7 +11705,7 @@
   DB  196,65,17,98,200                    ; vpunpckldq    %xmm8,%xmm13,%xmm9
   DB  196,65,17,106,192                   ; vpunpckhdq    %xmm8,%xmm13,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,31                              ; jne           5d3c <_sk_store_u16_be_avx+0xfa>
+  DB  117,31                              ; jne           611e <_sk_store_u16_be_avx+0xfa>
   DB  196,65,120,17,28,65                 ; vmovups       %xmm11,(%r9,%rax,2)
   DB  196,65,120,17,84,65,16              ; vmovups       %xmm10,0x10(%r9,%rax,2)
   DB  196,65,120,17,76,65,32              ; vmovups       %xmm9,0x20(%r9,%rax,2)
@@ -11218,31 +11714,31 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,214,28,65                ; vmovq         %xmm11,(%r9,%rax,2)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            5d38 <_sk_store_u16_be_avx+0xf6>
+  DB  116,240                             ; je            611a <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,23,92,65,8               ; vmovhpd       %xmm11,0x8(%r9,%rax,2)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            5d38 <_sk_store_u16_be_avx+0xf6>
+  DB  114,227                             ; jb            611a <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,214,84,65,16             ; vmovq         %xmm10,0x10(%r9,%rax,2)
-  DB  116,218                             ; je            5d38 <_sk_store_u16_be_avx+0xf6>
+  DB  116,218                             ; je            611a <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,23,84,65,24              ; vmovhpd       %xmm10,0x18(%r9,%rax,2)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,205                             ; jb            5d38 <_sk_store_u16_be_avx+0xf6>
+  DB  114,205                             ; jb            611a <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,214,76,65,32             ; vmovq         %xmm9,0x20(%r9,%rax,2)
-  DB  116,196                             ; je            5d38 <_sk_store_u16_be_avx+0xf6>
+  DB  116,196                             ; je            611a <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,23,76,65,40              ; vmovhpd       %xmm9,0x28(%r9,%rax,2)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,183                             ; jb            5d38 <_sk_store_u16_be_avx+0xf6>
+  DB  114,183                             ; jb            611a <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,214,68,65,48             ; vmovq         %xmm8,0x30(%r9,%rax,2)
-  DB  235,174                             ; jmp           5d38 <_sk_store_u16_be_avx+0xf6>
+  DB  235,174                             ; jmp           611a <_sk_store_u16_be_avx+0xf6>
 
 PUBLIC _sk_load_f32_avx
 _sk_load_f32_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  119,110                             ; ja            5e00 <_sk_load_f32_avx+0x76>
+  DB  119,110                             ; ja            61e2 <_sk_load_f32_avx+0x76>
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
-  DB  76,141,29,132,0,0,0                 ; lea           0x84(%rip),%r11        # 5e28 <_sk_load_f32_avx+0x9e>
+  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 620c <_sk_load_f32_avx+0xa0>
   DB  75,99,4,131                         ; movslq        (%r11,%r8,4),%rax
   DB  76,1,216                            ; add           %r11,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -11268,19 +11764,19 @@
   DB  196,193,101,21,216                  ; vunpckhpd     %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
-  DB  133,255                             ; test          %edi,%edi
-  DB  255                                 ; (bad)
-  DB  255,204                             ; dec           %esp
+  DB  102,144                             ; xchg          %ax,%ax
+  DB  131,255,255                         ; cmp           $0xffffffff,%edi
+  DB  255,202                             ; dec           %edx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  191,255,255,255,178                 ; mov           $0xb2ffffff,%edi
+  DB  189,255,255,255,176                 ; mov           $0xb0ffffff,%ebp
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,165,255,255,255,157             ; jmpq          *-0x62000001(%rbp)
+  DB  255,163,255,255,255,155             ; jmpq          *-0x64000001(%rbx)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,149,255,255,255,141             ; callq         *-0x72000001(%rbp)
+  DB  255,147,255,255,255,139             ; callq         *-0x74000001(%rbx)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
@@ -11289,10 +11785,10 @@
 _sk_load_f32_dst_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  119,110                             ; ja            5ebe <_sk_load_f32_dst_avx+0x76>
+  DB  119,110                             ; ja            62a2 <_sk_load_f32_dst_avx+0x76>
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
-  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 5ee8 <_sk_load_f32_dst_avx+0xa0>
+  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 62cc <_sk_load_f32_dst_avx+0xa0>
   DB  75,99,4,131                         ; movslq        (%r11,%r8,4),%rax
   DB  76,1,216                            ; add           %r11,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -11349,7 +11845,7 @@
   DB  196,65,37,20,196                    ; vunpcklpd     %ymm12,%ymm11,%ymm8
   DB  196,65,37,21,220                    ; vunpckhpd     %ymm12,%ymm11,%ymm11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,55                              ; jne           5f75 <_sk_store_f32_avx+0x6d>
+  DB  117,55                              ; jne           6359 <_sk_store_f32_avx+0x6d>
   DB  196,67,45,24,225,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   DB  196,67,61,24,235,1                  ; vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   DB  196,67,45,6,201,49                  ; vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -11362,22 +11858,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,17,20,129                ; vmovupd       %xmm10,(%r9,%rax,4)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            5f71 <_sk_store_f32_avx+0x69>
+  DB  116,240                             ; je            6355 <_sk_store_f32_avx+0x69>
   DB  196,65,121,17,76,129,16             ; vmovupd       %xmm9,0x10(%r9,%rax,4)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            5f71 <_sk_store_f32_avx+0x69>
+  DB  114,227                             ; jb            6355 <_sk_store_f32_avx+0x69>
   DB  196,65,121,17,68,129,32             ; vmovupd       %xmm8,0x20(%r9,%rax,4)
-  DB  116,218                             ; je            5f71 <_sk_store_f32_avx+0x69>
+  DB  116,218                             ; je            6355 <_sk_store_f32_avx+0x69>
   DB  196,65,121,17,92,129,48             ; vmovupd       %xmm11,0x30(%r9,%rax,4)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,205                             ; jb            5f71 <_sk_store_f32_avx+0x69>
+  DB  114,205                             ; jb            6355 <_sk_store_f32_avx+0x69>
   DB  196,67,125,25,84,129,64,1           ; vextractf128  $0x1,%ymm10,0x40(%r9,%rax,4)
-  DB  116,195                             ; je            5f71 <_sk_store_f32_avx+0x69>
+  DB  116,195                             ; je            6355 <_sk_store_f32_avx+0x69>
   DB  196,67,125,25,76,129,80,1           ; vextractf128  $0x1,%ymm9,0x50(%r9,%rax,4)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,181                             ; jb            5f71 <_sk_store_f32_avx+0x69>
+  DB  114,181                             ; jb            6355 <_sk_store_f32_avx+0x69>
   DB  196,67,125,25,68,129,96,1           ; vextractf128  $0x1,%ymm8,0x60(%r9,%rax,4)
-  DB  235,171                             ; jmp           5f71 <_sk_store_f32_avx+0x69>
+  DB  235,171                             ; jmp           6355 <_sk_store_f32_avx+0x69>
 
 PUBLIC _sk_clamp_x_avx
 _sk_clamp_x_avx LABEL PROC
@@ -11456,7 +11952,7 @@
   DB  196,193,58,88,192                   ; vaddss        %xmm8,%xmm8,%xmm0
   DB  196,227,121,4,192,0                 ; vpermilps     $0x0,%xmm0,%xmm0
   DB  196,99,125,24,192,1                 ; vinsertf128   $0x1,%xmm0,%ymm0,%ymm8
-  DB  197,178,89,5,59,22,0,0              ; vmulss        0x163b(%rip),%xmm9,%xmm0        # 7724 <_sk_callback_avx+0x4de>
+  DB  197,178,89,5,75,22,0,0              ; vmulss        0x164b(%rip),%xmm9,%xmm0        # 7b18 <_sk_callback_avx+0x4ee>
   DB  196,227,121,4,192,0                 ; vpermilps     $0x0,%xmm0,%xmm0
   DB  196,227,125,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   DB  197,164,89,192                      ; vmulps        %ymm0,%ymm11,%ymm0
@@ -11487,7 +11983,7 @@
   DB  196,193,58,88,200                   ; vaddss        %xmm8,%xmm8,%xmm1
   DB  196,227,121,4,201,0                 ; vpermilps     $0x0,%xmm1,%xmm1
   DB  196,99,117,24,193,1                 ; vinsertf128   $0x1,%xmm1,%ymm1,%ymm8
-  DB  197,178,89,13,182,21,0,0            ; vmulss        0x15b6(%rip),%xmm9,%xmm1        # 7728 <_sk_callback_avx+0x4e2>
+  DB  197,178,89,13,198,21,0,0            ; vmulss        0x15c6(%rip),%xmm9,%xmm1        # 7b1c <_sk_callback_avx+0x4f2>
   DB  196,227,121,4,201,0                 ; vpermilps     $0x0,%xmm1,%xmm1
   DB  196,227,117,24,201,1                ; vinsertf128   $0x1,%xmm1,%ymm1,%ymm1
   DB  197,164,89,201                      ; vmulps        %ymm1,%ymm11,%ymm1
@@ -11511,7 +12007,7 @@
 _sk_clamp_x_1_avx LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  197,188,95,192                      ; vmaxps        %ymm0,%ymm8,%ymm0
-  DB  196,98,125,24,5,84,21,0,0           ; vbroadcastss  0x1554(%rip),%ymm8        # 772c <_sk_callback_avx+0x4e6>
+  DB  196,98,125,24,5,100,21,0,0          ; vbroadcastss  0x1564(%rip),%ymm8        # 7b20 <_sk_callback_avx+0x4f6>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -11525,9 +12021,9 @@
 
 PUBLIC _sk_mirror_x_1_avx
 _sk_mirror_x_1_avx LABEL PROC
-  DB  196,98,125,24,5,55,21,0,0           ; vbroadcastss  0x1537(%rip),%ymm8        # 7730 <_sk_callback_avx+0x4ea>
+  DB  196,98,125,24,5,71,21,0,0           ; vbroadcastss  0x1547(%rip),%ymm8        # 7b24 <_sk_callback_avx+0x4fa>
   DB  196,193,124,88,192                  ; vaddps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,13,45,21,0,0          ; vbroadcastss  0x152d(%rip),%ymm9        # 7734 <_sk_callback_avx+0x4ee>
+  DB  196,98,125,24,13,61,21,0,0          ; vbroadcastss  0x153d(%rip),%ymm9        # 7b28 <_sk_callback_avx+0x4fe>
   DB  196,65,124,89,201                   ; vmulps        %ymm9,%ymm0,%ymm9
   DB  196,67,125,8,201,1                  ; vroundps      $0x1,%ymm9,%ymm9
   DB  196,65,52,88,201                    ; vaddps        %ymm9,%ymm9,%ymm9
@@ -11541,12 +12037,12 @@
 
 PUBLIC _sk_luminance_to_alpha_avx
 _sk_luminance_to_alpha_avx LABEL PROC
-  DB  196,226,125,24,29,253,20,0,0        ; vbroadcastss  0x14fd(%rip),%ymm3        # 7738 <_sk_callback_avx+0x4f2>
+  DB  196,226,125,24,29,13,21,0,0         ; vbroadcastss  0x150d(%rip),%ymm3        # 7b2c <_sk_callback_avx+0x502>
   DB  197,252,89,195                      ; vmulps        %ymm3,%ymm0,%ymm0
-  DB  196,226,125,24,29,244,20,0,0        ; vbroadcastss  0x14f4(%rip),%ymm3        # 773c <_sk_callback_avx+0x4f6>
+  DB  196,226,125,24,29,4,21,0,0          ; vbroadcastss  0x1504(%rip),%ymm3        # 7b30 <_sk_callback_avx+0x506>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,231,20,0,0        ; vbroadcastss  0x14e7(%rip),%ymm1        # 7740 <_sk_callback_avx+0x4fa>
+  DB  196,226,125,24,13,247,20,0,0        ; vbroadcastss  0x14f7(%rip),%ymm1        # 7b34 <_sk_callback_avx+0x50a>
   DB  197,236,89,201                      ; vmulps        %ymm1,%ymm2,%ymm1
   DB  197,252,88,217                      ; vaddps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -11755,9 +12251,9 @@
   DB  72,139,24                           ; mov           (%rax),%rbx
   DB  72,139,104,8                        ; mov           0x8(%rax),%rbp
   DB  72,255,203                          ; dec           %rbx
-  DB  120,7                               ; js            65b8 <_sk_evenly_spaced_gradient_avx+0x28>
+  DB  120,7                               ; js            699c <_sk_evenly_spaced_gradient_avx+0x28>
   DB  196,225,242,42,203                  ; vcvtsi2ss     %rbx,%xmm1,%xmm1
-  DB  235,21                              ; jmp           65cd <_sk_evenly_spaced_gradient_avx+0x3d>
+  DB  235,21                              ; jmp           69b1 <_sk_evenly_spaced_gradient_avx+0x3d>
   DB  73,137,217                          ; mov           %rbx,%r9
   DB  73,209,233                          ; shr           %r9
   DB  131,227,1                           ; and           $0x1,%ebx
@@ -11914,18 +12410,18 @@
 
 PUBLIC _sk_gauss_a_to_rgba_avx
 _sk_gauss_a_to_rgba_avx LABEL PROC
-  DB  196,226,125,24,5,16,14,0,0          ; vbroadcastss  0xe10(%rip),%ymm0        # 7744 <_sk_callback_avx+0x4fe>
+  DB  196,226,125,24,5,32,14,0,0          ; vbroadcastss  0xe20(%rip),%ymm0        # 7b38 <_sk_callback_avx+0x50e>
   DB  197,228,89,192                      ; vmulps        %ymm0,%ymm3,%ymm0
-  DB  196,226,125,24,13,7,14,0,0          ; vbroadcastss  0xe07(%rip),%ymm1        # 7748 <_sk_callback_avx+0x502>
+  DB  196,226,125,24,13,23,14,0,0         ; vbroadcastss  0xe17(%rip),%ymm1        # 7b3c <_sk_callback_avx+0x512>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,89,195                      ; vmulps        %ymm3,%ymm0,%ymm0
-  DB  196,226,125,24,13,250,13,0,0        ; vbroadcastss  0xdfa(%rip),%ymm1        # 774c <_sk_callback_avx+0x506>
+  DB  196,226,125,24,13,10,14,0,0         ; vbroadcastss  0xe0a(%rip),%ymm1        # 7b40 <_sk_callback_avx+0x516>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,89,195                      ; vmulps        %ymm3,%ymm0,%ymm0
-  DB  196,226,125,24,13,237,13,0,0        ; vbroadcastss  0xded(%rip),%ymm1        # 7750 <_sk_callback_avx+0x50a>
+  DB  196,226,125,24,13,253,13,0,0        ; vbroadcastss  0xdfd(%rip),%ymm1        # 7b44 <_sk_callback_avx+0x51a>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,89,195                      ; vmulps        %ymm3,%ymm0,%ymm0
-  DB  196,226,125,24,13,224,13,0,0        ; vbroadcastss  0xde0(%rip),%ymm1        # 7754 <_sk_callback_avx+0x50e>
+  DB  196,226,125,24,13,240,13,0,0        ; vbroadcastss  0xdf0(%rip),%ymm1        # 7b48 <_sk_callback_avx+0x51e>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
@@ -11947,12 +12443,12 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
   DB  73,131,249,2                        ; cmp           $0x2,%r9
-  DB  114,80                              ; jb            69fa <_sk_gradient_avx+0x72>
+  DB  114,80                              ; jb            6dde <_sk_gradient_avx+0x72>
   DB  72,139,88,72                        ; mov           0x48(%rax),%rbx
   DB  73,255,201                          ; dec           %r9
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  196,65,52,87,201                    ; vxorps        %ymm9,%ymm9,%ymm9
-  DB  196,98,125,24,21,149,13,0,0         ; vbroadcastss  0xd95(%rip),%ymm10        # 7758 <_sk_callback_avx+0x512>
+  DB  196,98,125,24,21,165,13,0,0         ; vbroadcastss  0xda5(%rip),%ymm10        # 7b4c <_sk_callback_avx+0x522>
   DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
   DB  196,98,125,24,3                     ; vbroadcastss  (%rbx),%ymm8
   DB  197,60,194,192,2                    ; vcmpleps      %ymm0,%ymm8,%ymm8
@@ -11964,7 +12460,7 @@
   DB  196,227,117,24,202,1                ; vinsertf128   $0x1,%xmm2,%ymm1,%ymm1
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  73,255,201                          ; dec           %r9
-  DB  117,205                             ; jne           69c7 <_sk_gradient_avx+0x3f>
+  DB  117,205                             ; jne           6dab <_sk_gradient_avx+0x3f>
   DB  196,195,249,22,201,1                ; vpextrq       $0x1,%xmm1,%r9
   DB  69,137,202                          ; mov           %r9d,%r10d
   DB  73,193,233,32                       ; shr           $0x20,%r9
@@ -12144,27 +12640,27 @@
   DB  196,65,52,95,226                    ; vmaxps        %ymm10,%ymm9,%ymm12
   DB  196,65,36,94,220                    ; vdivps        %ymm12,%ymm11,%ymm11
   DB  196,65,36,89,227                    ; vmulps        %ymm11,%ymm11,%ymm12
-  DB  196,98,125,24,45,136,9,0,0          ; vbroadcastss  0x988(%rip),%ymm13        # 775c <_sk_callback_avx+0x516>
+  DB  196,98,125,24,45,152,9,0,0          ; vbroadcastss  0x998(%rip),%ymm13        # 7b50 <_sk_callback_avx+0x526>
   DB  196,65,28,89,237                    ; vmulps        %ymm13,%ymm12,%ymm13
-  DB  196,98,125,24,53,126,9,0,0          ; vbroadcastss  0x97e(%rip),%ymm14        # 7760 <_sk_callback_avx+0x51a>
+  DB  196,98,125,24,53,142,9,0,0          ; vbroadcastss  0x98e(%rip),%ymm14        # 7b54 <_sk_callback_avx+0x52a>
   DB  196,65,20,88,238                    ; vaddps        %ymm14,%ymm13,%ymm13
   DB  196,65,28,89,237                    ; vmulps        %ymm13,%ymm12,%ymm13
-  DB  196,98,125,24,53,111,9,0,0          ; vbroadcastss  0x96f(%rip),%ymm14        # 7764 <_sk_callback_avx+0x51e>
+  DB  196,98,125,24,53,127,9,0,0          ; vbroadcastss  0x97f(%rip),%ymm14        # 7b58 <_sk_callback_avx+0x52e>
   DB  196,65,20,88,238                    ; vaddps        %ymm14,%ymm13,%ymm13
   DB  196,65,28,89,229                    ; vmulps        %ymm13,%ymm12,%ymm12
-  DB  196,98,125,24,45,96,9,0,0           ; vbroadcastss  0x960(%rip),%ymm13        # 7768 <_sk_callback_avx+0x522>
+  DB  196,98,125,24,45,112,9,0,0          ; vbroadcastss  0x970(%rip),%ymm13        # 7b5c <_sk_callback_avx+0x532>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
   DB  196,65,52,194,202,1                 ; vcmpltps      %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,21,75,9,0,0           ; vbroadcastss  0x94b(%rip),%ymm10        # 776c <_sk_callback_avx+0x526>
+  DB  196,98,125,24,21,91,9,0,0           ; vbroadcastss  0x95b(%rip),%ymm10        # 7b60 <_sk_callback_avx+0x536>
   DB  196,65,44,92,211                    ; vsubps        %ymm11,%ymm10,%ymm10
   DB  196,67,37,74,202,144                ; vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   DB  196,193,124,194,192,1               ; vcmpltps      %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,21,53,9,0,0           ; vbroadcastss  0x935(%rip),%ymm10        # 7770 <_sk_callback_avx+0x52a>
+  DB  196,98,125,24,21,69,9,0,0           ; vbroadcastss  0x945(%rip),%ymm10        # 7b64 <_sk_callback_avx+0x53a>
   DB  196,65,44,92,209                    ; vsubps        %ymm9,%ymm10,%ymm10
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  196,65,116,194,200,1                ; vcmpltps      %ymm8,%ymm1,%ymm9
-  DB  196,98,125,24,21,31,9,0,0           ; vbroadcastss  0x91f(%rip),%ymm10        # 7774 <_sk_callback_avx+0x52e>
+  DB  196,98,125,24,21,47,9,0,0           ; vbroadcastss  0x92f(%rip),%ymm10        # 7b68 <_sk_callback_avx+0x53e>
   DB  197,44,92,208                       ; vsubps        %ymm0,%ymm10,%ymm10
   DB  196,195,125,74,194,144              ; vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   DB  196,65,124,194,200,3                ; vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -12184,7 +12680,7 @@
 PUBLIC _sk_save_xy_avx
 _sk_save_xy_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,233,8,0,0           ; vbroadcastss  0x8e9(%rip),%ymm8        # 7778 <_sk_callback_avx+0x532>
+  DB  196,98,125,24,5,249,8,0,0           ; vbroadcastss  0x8f9(%rip),%ymm8        # 7b6c <_sk_callback_avx+0x542>
   DB  196,65,124,88,200                   ; vaddps        %ymm8,%ymm0,%ymm9
   DB  196,67,125,8,209,1                  ; vroundps      $0x1,%ymm9,%ymm10
   DB  196,65,52,92,202                    ; vsubps        %ymm10,%ymm9,%ymm9
@@ -12217,9 +12713,9 @@
 PUBLIC _sk_bilinear_nx_avx
 _sk_bilinear_nx_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,117,8,0,0          ; vbroadcastss  0x875(%rip),%ymm0        # 777c <_sk_callback_avx+0x536>
+  DB  196,226,125,24,5,133,8,0,0          ; vbroadcastss  0x885(%rip),%ymm0        # 7b70 <_sk_callback_avx+0x546>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,108,8,0,0           ; vbroadcastss  0x86c(%rip),%ymm8        # 7780 <_sk_callback_avx+0x53a>
+  DB  196,98,125,24,5,124,8,0,0           ; vbroadcastss  0x87c(%rip),%ymm8        # 7b74 <_sk_callback_avx+0x54a>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -12228,7 +12724,7 @@
 PUBLIC _sk_bilinear_px_avx
 _sk_bilinear_px_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,84,8,0,0           ; vbroadcastss  0x854(%rip),%ymm0        # 7784 <_sk_callback_avx+0x53e>
+  DB  196,226,125,24,5,100,8,0,0          ; vbroadcastss  0x864(%rip),%ymm0        # 7b78 <_sk_callback_avx+0x54e>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -12238,9 +12734,9 @@
 PUBLIC _sk_bilinear_ny_avx
 _sk_bilinear_ny_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,56,8,0,0          ; vbroadcastss  0x838(%rip),%ymm1        # 7788 <_sk_callback_avx+0x542>
+  DB  196,226,125,24,13,72,8,0,0          ; vbroadcastss  0x848(%rip),%ymm1        # 7b7c <_sk_callback_avx+0x552>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,46,8,0,0            ; vbroadcastss  0x82e(%rip),%ymm8        # 778c <_sk_callback_avx+0x546>
+  DB  196,98,125,24,5,62,8,0,0            ; vbroadcastss  0x83e(%rip),%ymm8        # 7b80 <_sk_callback_avx+0x556>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -12249,7 +12745,7 @@
 PUBLIC _sk_bilinear_py_avx
 _sk_bilinear_py_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,22,8,0,0          ; vbroadcastss  0x816(%rip),%ymm1        # 7790 <_sk_callback_avx+0x54a>
+  DB  196,226,125,24,13,38,8,0,0          ; vbroadcastss  0x826(%rip),%ymm1        # 7b84 <_sk_callback_avx+0x55a>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -12259,14 +12755,14 @@
 PUBLIC _sk_bicubic_n3x_avx
 _sk_bicubic_n3x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,249,7,0,0          ; vbroadcastss  0x7f9(%rip),%ymm0        # 7794 <_sk_callback_avx+0x54e>
+  DB  196,226,125,24,5,9,8,0,0            ; vbroadcastss  0x809(%rip),%ymm0        # 7b88 <_sk_callback_avx+0x55e>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,240,7,0,0           ; vbroadcastss  0x7f0(%rip),%ymm8        # 7798 <_sk_callback_avx+0x552>
+  DB  196,98,125,24,5,0,8,0,0             ; vbroadcastss  0x800(%rip),%ymm8        # 7b8c <_sk_callback_avx+0x562>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,225,7,0,0          ; vbroadcastss  0x7e1(%rip),%ymm10        # 779c <_sk_callback_avx+0x556>
+  DB  196,98,125,24,21,241,7,0,0          ; vbroadcastss  0x7f1(%rip),%ymm10        # 7b90 <_sk_callback_avx+0x566>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,215,7,0,0          ; vbroadcastss  0x7d7(%rip),%ymm10        # 77a0 <_sk_callback_avx+0x55a>
+  DB  196,98,125,24,21,231,7,0,0          ; vbroadcastss  0x7e7(%rip),%ymm10        # 7b94 <_sk_callback_avx+0x56a>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -12276,19 +12772,19 @@
 PUBLIC _sk_bicubic_n1x_avx
 _sk_bicubic_n1x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,186,7,0,0          ; vbroadcastss  0x7ba(%rip),%ymm0        # 77a4 <_sk_callback_avx+0x55e>
+  DB  196,226,125,24,5,202,7,0,0          ; vbroadcastss  0x7ca(%rip),%ymm0        # 7b98 <_sk_callback_avx+0x56e>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,177,7,0,0           ; vbroadcastss  0x7b1(%rip),%ymm8        # 77a8 <_sk_callback_avx+0x562>
+  DB  196,98,125,24,5,193,7,0,0           ; vbroadcastss  0x7c1(%rip),%ymm8        # 7b9c <_sk_callback_avx+0x572>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,167,7,0,0          ; vbroadcastss  0x7a7(%rip),%ymm9        # 77ac <_sk_callback_avx+0x566>
+  DB  196,98,125,24,13,183,7,0,0          ; vbroadcastss  0x7b7(%rip),%ymm9        # 7ba0 <_sk_callback_avx+0x576>
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,157,7,0,0          ; vbroadcastss  0x79d(%rip),%ymm10        # 77b0 <_sk_callback_avx+0x56a>
+  DB  196,98,125,24,21,173,7,0,0          ; vbroadcastss  0x7ad(%rip),%ymm10        # 7ba4 <_sk_callback_avx+0x57a>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,142,7,0,0          ; vbroadcastss  0x78e(%rip),%ymm10        # 77b4 <_sk_callback_avx+0x56e>
+  DB  196,98,125,24,21,158,7,0,0          ; vbroadcastss  0x79e(%rip),%ymm10        # 7ba8 <_sk_callback_avx+0x57e>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,127,7,0,0          ; vbroadcastss  0x77f(%rip),%ymm9        # 77b8 <_sk_callback_avx+0x572>
+  DB  196,98,125,24,13,143,7,0,0          ; vbroadcastss  0x78f(%rip),%ymm9        # 7bac <_sk_callback_avx+0x582>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -12297,17 +12793,17 @@
 PUBLIC _sk_bicubic_p1x_avx
 _sk_bicubic_p1x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,103,7,0,0           ; vbroadcastss  0x767(%rip),%ymm8        # 77bc <_sk_callback_avx+0x576>
+  DB  196,98,125,24,5,119,7,0,0           ; vbroadcastss  0x777(%rip),%ymm8        # 7bb0 <_sk_callback_avx+0x586>
   DB  197,188,88,0                        ; vaddps        (%rax),%ymm8,%ymm0
   DB  197,124,16,72,64                    ; vmovups       0x40(%rax),%ymm9
-  DB  196,98,125,24,21,89,7,0,0           ; vbroadcastss  0x759(%rip),%ymm10        # 77c0 <_sk_callback_avx+0x57a>
+  DB  196,98,125,24,21,105,7,0,0          ; vbroadcastss  0x769(%rip),%ymm10        # 7bb4 <_sk_callback_avx+0x58a>
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
-  DB  196,98,125,24,29,79,7,0,0           ; vbroadcastss  0x74f(%rip),%ymm11        # 77c4 <_sk_callback_avx+0x57e>
+  DB  196,98,125,24,29,95,7,0,0           ; vbroadcastss  0x75f(%rip),%ymm11        # 7bb8 <_sk_callback_avx+0x58e>
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
   DB  196,65,44,88,192                    ; vaddps        %ymm8,%ymm10,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
-  DB  196,98,125,24,13,54,7,0,0           ; vbroadcastss  0x736(%rip),%ymm9        # 77c8 <_sk_callback_avx+0x582>
+  DB  196,98,125,24,13,70,7,0,0           ; vbroadcastss  0x746(%rip),%ymm9        # 7bbc <_sk_callback_avx+0x592>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -12316,13 +12812,13 @@
 PUBLIC _sk_bicubic_p3x_avx
 _sk_bicubic_p3x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,30,7,0,0           ; vbroadcastss  0x71e(%rip),%ymm0        # 77cc <_sk_callback_avx+0x586>
+  DB  196,226,125,24,5,46,7,0,0           ; vbroadcastss  0x72e(%rip),%ymm0        # 7bc0 <_sk_callback_avx+0x596>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,11,7,0,0           ; vbroadcastss  0x70b(%rip),%ymm10        # 77d0 <_sk_callback_avx+0x58a>
+  DB  196,98,125,24,21,27,7,0,0           ; vbroadcastss  0x71b(%rip),%ymm10        # 7bc4 <_sk_callback_avx+0x59a>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,1,7,0,0            ; vbroadcastss  0x701(%rip),%ymm10        # 77d4 <_sk_callback_avx+0x58e>
+  DB  196,98,125,24,21,17,7,0,0           ; vbroadcastss  0x711(%rip),%ymm10        # 7bc8 <_sk_callback_avx+0x59e>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -12332,14 +12828,14 @@
 PUBLIC _sk_bicubic_n3y_avx
 _sk_bicubic_n3y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,228,6,0,0         ; vbroadcastss  0x6e4(%rip),%ymm1        # 77d8 <_sk_callback_avx+0x592>
+  DB  196,226,125,24,13,244,6,0,0         ; vbroadcastss  0x6f4(%rip),%ymm1        # 7bcc <_sk_callback_avx+0x5a2>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,218,6,0,0           ; vbroadcastss  0x6da(%rip),%ymm8        # 77dc <_sk_callback_avx+0x596>
+  DB  196,98,125,24,5,234,6,0,0           ; vbroadcastss  0x6ea(%rip),%ymm8        # 7bd0 <_sk_callback_avx+0x5a6>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,203,6,0,0          ; vbroadcastss  0x6cb(%rip),%ymm10        # 77e0 <_sk_callback_avx+0x59a>
+  DB  196,98,125,24,21,219,6,0,0          ; vbroadcastss  0x6db(%rip),%ymm10        # 7bd4 <_sk_callback_avx+0x5aa>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,193,6,0,0          ; vbroadcastss  0x6c1(%rip),%ymm10        # 77e4 <_sk_callback_avx+0x59e>
+  DB  196,98,125,24,21,209,6,0,0          ; vbroadcastss  0x6d1(%rip),%ymm10        # 7bd8 <_sk_callback_avx+0x5ae>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -12349,19 +12845,19 @@
 PUBLIC _sk_bicubic_n1y_avx
 _sk_bicubic_n1y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,164,6,0,0         ; vbroadcastss  0x6a4(%rip),%ymm1        # 77e8 <_sk_callback_avx+0x5a2>
+  DB  196,226,125,24,13,180,6,0,0         ; vbroadcastss  0x6b4(%rip),%ymm1        # 7bdc <_sk_callback_avx+0x5b2>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,154,6,0,0           ; vbroadcastss  0x69a(%rip),%ymm8        # 77ec <_sk_callback_avx+0x5a6>
+  DB  196,98,125,24,5,170,6,0,0           ; vbroadcastss  0x6aa(%rip),%ymm8        # 7be0 <_sk_callback_avx+0x5b6>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,144,6,0,0          ; vbroadcastss  0x690(%rip),%ymm9        # 77f0 <_sk_callback_avx+0x5aa>
+  DB  196,98,125,24,13,160,6,0,0          ; vbroadcastss  0x6a0(%rip),%ymm9        # 7be4 <_sk_callback_avx+0x5ba>
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,134,6,0,0          ; vbroadcastss  0x686(%rip),%ymm10        # 77f4 <_sk_callback_avx+0x5ae>
+  DB  196,98,125,24,21,150,6,0,0          ; vbroadcastss  0x696(%rip),%ymm10        # 7be8 <_sk_callback_avx+0x5be>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,119,6,0,0          ; vbroadcastss  0x677(%rip),%ymm10        # 77f8 <_sk_callback_avx+0x5b2>
+  DB  196,98,125,24,21,135,6,0,0          ; vbroadcastss  0x687(%rip),%ymm10        # 7bec <_sk_callback_avx+0x5c2>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,104,6,0,0          ; vbroadcastss  0x668(%rip),%ymm9        # 77fc <_sk_callback_avx+0x5b6>
+  DB  196,98,125,24,13,120,6,0,0          ; vbroadcastss  0x678(%rip),%ymm9        # 7bf0 <_sk_callback_avx+0x5c6>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -12370,17 +12866,17 @@
 PUBLIC _sk_bicubic_p1y_avx
 _sk_bicubic_p1y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,80,6,0,0            ; vbroadcastss  0x650(%rip),%ymm8        # 7800 <_sk_callback_avx+0x5ba>
+  DB  196,98,125,24,5,96,6,0,0            ; vbroadcastss  0x660(%rip),%ymm8        # 7bf4 <_sk_callback_avx+0x5ca>
   DB  197,188,88,72,32                    ; vaddps        0x20(%rax),%ymm8,%ymm1
   DB  197,124,16,72,96                    ; vmovups       0x60(%rax),%ymm9
-  DB  196,98,125,24,21,65,6,0,0           ; vbroadcastss  0x641(%rip),%ymm10        # 7804 <_sk_callback_avx+0x5be>
+  DB  196,98,125,24,21,81,6,0,0           ; vbroadcastss  0x651(%rip),%ymm10        # 7bf8 <_sk_callback_avx+0x5ce>
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
-  DB  196,98,125,24,29,55,6,0,0           ; vbroadcastss  0x637(%rip),%ymm11        # 7808 <_sk_callback_avx+0x5c2>
+  DB  196,98,125,24,29,71,6,0,0           ; vbroadcastss  0x647(%rip),%ymm11        # 7bfc <_sk_callback_avx+0x5d2>
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
   DB  196,65,44,88,192                    ; vaddps        %ymm8,%ymm10,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
-  DB  196,98,125,24,13,30,6,0,0           ; vbroadcastss  0x61e(%rip),%ymm9        # 780c <_sk_callback_avx+0x5c6>
+  DB  196,98,125,24,13,46,6,0,0           ; vbroadcastss  0x62e(%rip),%ymm9        # 7c00 <_sk_callback_avx+0x5d6>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -12389,13 +12885,13 @@
 PUBLIC _sk_bicubic_p3y_avx
 _sk_bicubic_p3y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,6,6,0,0           ; vbroadcastss  0x606(%rip),%ymm1        # 7810 <_sk_callback_avx+0x5ca>
+  DB  196,226,125,24,13,22,6,0,0          ; vbroadcastss  0x616(%rip),%ymm1        # 7c04 <_sk_callback_avx+0x5da>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,242,5,0,0          ; vbroadcastss  0x5f2(%rip),%ymm10        # 7814 <_sk_callback_avx+0x5ce>
+  DB  196,98,125,24,21,2,6,0,0            ; vbroadcastss  0x602(%rip),%ymm10        # 7c08 <_sk_callback_avx+0x5de>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,232,5,0,0          ; vbroadcastss  0x5e8(%rip),%ymm10        # 7818 <_sk_callback_avx+0x5d2>
+  DB  196,98,125,24,21,248,5,0,0          ; vbroadcastss  0x5f8(%rip),%ymm10        # 7c0c <_sk_callback_avx+0x5e2>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -12517,25 +13013,25 @@
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 7421 <.literal4+0xb1>
+  DB  71,225,61                           ; rex.RXB       loope 7805 <.literal4+0xb1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 7431 <.literal4+0xc1>
+  DB  71,225,61                           ; rex.RXB       loope 7815 <.literal4+0xc1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 7441 <.literal4+0xd1>
+  DB  71,225,61                           ; rex.RXB       loope 7825 <.literal4+0xd1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 7451 <.literal4+0xe1>
+  DB  71,225,61                           ; rex.RXB       loope 7835 <.literal4+0xe1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,127                    ; add           %al,0x7f00003f(%rax)
@@ -12599,7 +13095,7 @@
   DB  190,129,128,128,59                  ; mov           $0x3b808081,%esi
   DB  129,128,128,59,0,248,0,0,8,33       ; addl          $0x21080000,-0x7ffc480(%rax)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        74bd <.literal4+0x14d>
+  DB  224,7                               ; loopne        78a1 <.literal4+0x14d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -12615,10 +13111,10 @@
   DB  129,128,128,59,129,128,128,59,0,0   ; addl          $0x3b80,-0x7f7ec480(%rax)
   DB  0,52,255                            ; add           %dh,(%rdi,%rdi,8)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            74e4 <.literal4+0x174>
+  DB  127,0                               ; jg            78c8 <.literal4+0x174>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            755d <.literal4+0x1ed>
+  DB  119,115                             ; ja            7941 <.literal4+0x1ed>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -12632,10 +13128,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            7518 <.literal4+0x1a8>
+  DB  127,0                               ; jg            78fc <.literal4+0x1a8>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            7591 <.literal4+0x221>
+  DB  119,115                             ; ja            7975 <.literal4+0x221>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -12649,10 +13145,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            754c <.literal4+0x1dc>
+  DB  127,0                               ; jg            7930 <.literal4+0x1dc>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            75c5 <.literal4+0x255>
+  DB  119,115                             ; ja            79a9 <.literal4+0x255>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -12666,10 +13162,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            7580 <.literal4+0x210>
+  DB  127,0                               ; jg            7964 <.literal4+0x210>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            75f9 <.literal4+0x289>
+  DB  119,115                             ; ja            79dd <.literal4+0x289>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -12682,7 +13178,7 @@
   DB  0,75,0                              ; add           %cl,0x0(%rbx)
   DB  0,128,63,0,0,200                    ; add           %al,-0x37ffffc1(%rax)
   DB  66,0,0                              ; rex.X         add %al,(%rax)
-  DB  127,67                              ; jg            75f7 <.literal4+0x287>
+  DB  127,67                              ; jg            79db <.literal4+0x287>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -12694,7 +13190,7 @@
   DB  190,80,128,3,62                     ; mov           $0x3e038050,%esi
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           7617 <.literal4+0x2a7>
+  DB  118,63                              ; jbe           79fb <.literal4+0x2a7>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
@@ -12709,7 +13205,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        7619 <.literal4+0x2a9>
+  DB  224,7                               ; loopne        79fd <.literal4+0x2a9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -12721,7 +13217,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        7635 <.literal4+0x2c5>
+  DB  224,7                               ; loopne        7a19 <.literal4+0x2c5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -12733,7 +13229,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        7651 <.literal4+0x2e1>
+  DB  224,7                               ; loopne        7a35 <.literal4+0x2e1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -12744,7 +13240,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            76a6 <.literal4+0x336>
+  DB  124,66                              ; jl            7a8a <.literal4+0x336>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,55,0,15                 ; mov           %ecx,0xf003788(%rax)
@@ -12770,7 +13266,10 @@
   DB  137,136,136,59,15,0                 ; mov           %ecx,0xf3b88(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,61,0,0                  ; mov           %ecx,0x3d88(%rax)
-  DB  112,65                              ; jo            7709 <.literal4+0x399>
+  DB  112,65                              ; jo            7aed <.literal4+0x399>
+  DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
+  DB  128,59,0                            ; cmpb          $0x0,(%rbx)
+  DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
@@ -12793,7 +13292,7 @@
   DB  0,128,55,0,0,128                    ; add           %al,-0x7fffffc9(%rax)
   DB  63                                  ; (bad)
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            776b <.literal4+0x3fb>
+  DB  127,71                              ; jg            7b5f <.literal4+0x40b>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -13054,6 +13553,54 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,0                                 ; add           %al,(%rax)
+  DB  0,2                                 ; add           %al,(%rdx)
+  DB  4,6                                 ; add           $0x6,%al
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  8,10                                ; or            %cl,(%rdx)
+  DB  12,14                               ; or            $0xe,%al
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,2                                 ; add           %al,(%rdx)
+  DB  4,6                                 ; add           $0x6,%al
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  8,10                                ; or            %cl,(%rdx)
+  DB  12,14                               ; or            $0xe,%al
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,2                                 ; add           %al,(%rdx)
+  DB  4,6                                 ; add           $0x6,%al
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  8,10                                ; or            %cl,(%rdx)
+  DB  12,14                               ; or            $0xe,%al
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
 
 ALIGN 32
   DB  255,0                               ; incl          (%rax)
@@ -13152,6 +13699,54 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  255,0                               ; incl          (%rax)
   DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
 ALIGN 32
 
 PUBLIC _sk_start_pipeline_sse41
@@ -13237,7 +13832,7 @@
   DB  102,15,110,194                      ; movd          %edx,%xmm0
   DB  102,15,112,192,0                    ; pshufd        $0x0,%xmm0,%xmm0
   DB  15,91,200                           ; cvtdq2ps      %xmm0,%xmm1
-  DB  15,40,21,200,86,0,0                 ; movaps        0x56c8(%rip),%xmm2        # 57f0 <_sk_callback_sse41+0xd5>
+  DB  15,40,21,72,89,0,0                  ; movaps        0x5948(%rip),%xmm2        # 5a70 <_sk_callback_sse41+0xd0>
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  15,16,7                             ; movups        (%rdi),%xmm0
   DB  15,88,193                           ; addps         %xmm1,%xmm0
@@ -13246,7 +13841,7 @@
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,21,183,86,0,0                 ; movaps        0x56b7(%rip),%xmm2        # 5800 <_sk_callback_sse41+0xe5>
+  DB  15,40,21,55,89,0,0                  ; movaps        0x5937(%rip),%xmm2        # 5a80 <_sk_callback_sse41+0xe0>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
   DB  15,87,237                           ; xorps         %xmm5,%xmm5
@@ -13264,14 +13859,14 @@
   DB  102,68,15,110,193                   ; movd          %ecx,%xmm8
   DB  102,69,15,112,192,0                 ; pshufd        $0x0,%xmm8,%xmm8
   DB  102,69,15,239,193                   ; pxor          %xmm9,%xmm8
-  DB  102,68,15,111,21,133,86,0,0         ; movdqa        0x5685(%rip),%xmm10        # 5810 <_sk_callback_sse41+0xf5>
+  DB  102,68,15,111,21,5,89,0,0           ; movdqa        0x5905(%rip),%xmm10        # 5a90 <_sk_callback_sse41+0xf0>
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
   DB  102,69,15,219,218                   ; pand          %xmm10,%xmm11
   DB  102,65,15,114,243,5                 ; pslld         $0x5,%xmm11
   DB  102,69,15,219,209                   ; pand          %xmm9,%xmm10
   DB  102,65,15,114,242,4                 ; pslld         $0x4,%xmm10
-  DB  102,68,15,111,37,113,86,0,0         ; movdqa        0x5671(%rip),%xmm12        # 5820 <_sk_callback_sse41+0x105>
-  DB  102,68,15,111,45,120,86,0,0         ; movdqa        0x5678(%rip),%xmm13        # 5830 <_sk_callback_sse41+0x115>
+  DB  102,68,15,111,37,241,88,0,0         ; movdqa        0x58f1(%rip),%xmm12        # 5aa0 <_sk_callback_sse41+0x100>
+  DB  102,68,15,111,45,248,88,0,0         ; movdqa        0x58f8(%rip),%xmm13        # 5ab0 <_sk_callback_sse41+0x110>
   DB  102,69,15,111,240                   ; movdqa        %xmm8,%xmm14
   DB  102,69,15,219,245                   ; pand          %xmm13,%xmm14
   DB  102,65,15,114,246,2                 ; pslld         $0x2,%xmm14
@@ -13287,8 +13882,8 @@
   DB  102,69,15,235,245                   ; por           %xmm13,%xmm14
   DB  102,69,15,235,240                   ; por           %xmm8,%xmm14
   DB  69,15,91,198                        ; cvtdq2ps      %xmm14,%xmm8
-  DB  68,15,89,5,51,86,0,0                ; mulps         0x5633(%rip),%xmm8        # 5840 <_sk_callback_sse41+0x125>
-  DB  68,15,88,5,59,86,0,0                ; addps         0x563b(%rip),%xmm8        # 5850 <_sk_callback_sse41+0x135>
+  DB  68,15,89,5,179,88,0,0               ; mulps         0x58b3(%rip),%xmm8        # 5ac0 <_sk_callback_sse41+0x120>
+  DB  68,15,88,5,187,88,0,0               ; addps         0x58bb(%rip),%xmm8        # 5ad0 <_sk_callback_sse41+0x130>
   DB  243,68,15,16,16                     ; movss         (%rax),%xmm10
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
@@ -13355,7 +13950,7 @@
 PUBLIC _sk_srcatop_sse41
 _sk_srcatop_sse41 LABEL PROC
   DB  15,89,199                           ; mulps         %xmm7,%xmm0
-  DB  68,15,40,5,149,85,0,0               ; movaps        0x5595(%rip),%xmm8        # 5860 <_sk_callback_sse41+0x145>
+  DB  68,15,40,5,21,88,0,0                ; movaps        0x5815(%rip),%xmm8        # 5ae0 <_sk_callback_sse41+0x140>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -13378,7 +13973,7 @@
 _sk_dstatop_sse41 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
   DB  68,15,89,196                        ; mulps         %xmm4,%xmm8
-  DB  68,15,40,13,88,85,0,0               ; movaps        0x5558(%rip),%xmm9        # 5870 <_sk_callback_sse41+0x155>
+  DB  68,15,40,13,216,87,0,0              ; movaps        0x57d8(%rip),%xmm9        # 5af0 <_sk_callback_sse41+0x150>
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
@@ -13419,7 +14014,7 @@
 
 PUBLIC _sk_srcout_sse41
 _sk_srcout_sse41 LABEL PROC
-  DB  68,15,40,5,252,84,0,0               ; movaps        0x54fc(%rip),%xmm8        # 5880 <_sk_callback_sse41+0x165>
+  DB  68,15,40,5,124,87,0,0               ; movaps        0x577c(%rip),%xmm8        # 5b00 <_sk_callback_sse41+0x160>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
@@ -13430,7 +14025,7 @@
 
 PUBLIC _sk_dstout_sse41
 _sk_dstout_sse41 LABEL PROC
-  DB  68,15,40,5,236,84,0,0               ; movaps        0x54ec(%rip),%xmm8        # 5890 <_sk_callback_sse41+0x175>
+  DB  68,15,40,5,108,87,0,0               ; movaps        0x576c(%rip),%xmm8        # 5b10 <_sk_callback_sse41+0x170>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  15,89,196                           ; mulps         %xmm4,%xmm0
@@ -13445,7 +14040,7 @@
 
 PUBLIC _sk_srcover_sse41
 _sk_srcover_sse41 LABEL PROC
-  DB  68,15,40,5,207,84,0,0               ; movaps        0x54cf(%rip),%xmm8        # 58a0 <_sk_callback_sse41+0x185>
+  DB  68,15,40,5,79,87,0,0                ; movaps        0x574f(%rip),%xmm8        # 5b20 <_sk_callback_sse41+0x180>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -13463,7 +14058,7 @@
 
 PUBLIC _sk_dstover_sse41
 _sk_dstover_sse41 LABEL PROC
-  DB  68,15,40,5,163,84,0,0               ; movaps        0x54a3(%rip),%xmm8        # 58b0 <_sk_callback_sse41+0x195>
+  DB  68,15,40,5,35,87,0,0                ; movaps        0x5723(%rip),%xmm8        # 5b30 <_sk_callback_sse41+0x190>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -13487,7 +14082,7 @@
 
 PUBLIC _sk_multiply_sse41
 _sk_multiply_sse41 LABEL PROC
-  DB  68,15,40,5,119,84,0,0               ; movaps        0x5477(%rip),%xmm8        # 58c0 <_sk_callback_sse41+0x1a5>
+  DB  68,15,40,5,247,86,0,0               ; movaps        0x56f7(%rip),%xmm8        # 5b40 <_sk_callback_sse41+0x1a0>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
@@ -13556,7 +14151,7 @@
 PUBLIC _sk_xor__sse41
 _sk_xor__sse41 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
-  DB  15,40,29,172,83,0,0                 ; movaps        0x53ac(%rip),%xmm3        # 58d0 <_sk_callback_sse41+0x1b5>
+  DB  15,40,29,44,86,0,0                  ; movaps        0x562c(%rip),%xmm3        # 5b50 <_sk_callback_sse41+0x1b0>
   DB  68,15,40,203                        ; movaps        %xmm3,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
@@ -13602,7 +14197,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,95,209                        ; maxps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,23,83,0,0                  ; movaps        0x5317(%rip),%xmm2        # 58e0 <_sk_callback_sse41+0x1c5>
+  DB  15,40,21,151,85,0,0                 ; movaps        0x5597(%rip),%xmm2        # 5b60 <_sk_callback_sse41+0x1c0>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -13634,7 +14229,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,188,82,0,0                 ; movaps        0x52bc(%rip),%xmm2        # 58f0 <_sk_callback_sse41+0x1d5>
+  DB  15,40,21,60,85,0,0                  ; movaps        0x553c(%rip),%xmm2        # 5b70 <_sk_callback_sse41+0x1d0>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -13669,7 +14264,7 @@
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,86,82,0,0                  ; movaps        0x5256(%rip),%xmm2        # 5900 <_sk_callback_sse41+0x1e5>
+  DB  15,40,21,214,84,0,0                 ; movaps        0x54d6(%rip),%xmm2        # 5b80 <_sk_callback_sse41+0x1e0>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -13695,7 +14290,7 @@
   DB  15,89,214                           ; mulps         %xmm6,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,22,82,0,0                  ; movaps        0x5216(%rip),%xmm2        # 5910 <_sk_callback_sse41+0x1f5>
+  DB  15,40,21,150,84,0,0                 ; movaps        0x5496(%rip),%xmm2        # 5b90 <_sk_callback_sse41+0x1f0>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -13706,7 +14301,7 @@
 PUBLIC _sk_colorburn_sse41
 _sk_colorburn_sse41 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,21,9,82,0,0                ; movaps        0x5209(%rip),%xmm10        # 5920 <_sk_callback_sse41+0x205>
+  DB  68,15,40,21,137,84,0,0              ; movaps        0x5489(%rip),%xmm10        # 5ba0 <_sk_callback_sse41+0x200>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  69,15,40,203                        ; movaps        %xmm11,%xmm9
@@ -13786,7 +14381,7 @@
 PUBLIC _sk_colordodge_sse41
 _sk_colordodge_sse41 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,21,231,80,0,0              ; movaps        0x50e7(%rip),%xmm10        # 5930 <_sk_callback_sse41+0x215>
+  DB  68,15,40,21,103,83,0,0              ; movaps        0x5367(%rip),%xmm10        # 5bb0 <_sk_callback_sse41+0x210>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  69,15,40,227                        ; movaps        %xmm11,%xmm12
@@ -13867,7 +14462,7 @@
   DB  15,40,244                           ; movaps        %xmm4,%xmm6
   DB  15,40,227                           ; movaps        %xmm3,%xmm4
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
-  DB  68,15,40,21,189,79,0,0              ; movaps        0x4fbd(%rip),%xmm10        # 5940 <_sk_callback_sse41+0x225>
+  DB  68,15,40,21,61,82,0,0               ; movaps        0x523d(%rip),%xmm10        # 5bc0 <_sk_callback_sse41+0x220>
   DB  65,15,40,234                        ; movaps        %xmm10,%xmm5
   DB  15,92,239                           ; subps         %xmm7,%xmm5
   DB  15,40,197                           ; movaps        %xmm5,%xmm0
@@ -13949,7 +14544,7 @@
 _sk_overlay_sse41 LABEL PROC
   DB  68,15,40,201                        ; movaps        %xmm1,%xmm9
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
-  DB  68,15,40,21,159,78,0,0              ; movaps        0x4e9f(%rip),%xmm10        # 5950 <_sk_callback_sse41+0x235>
+  DB  68,15,40,21,31,81,0,0               ; movaps        0x511f(%rip),%xmm10        # 5bd0 <_sk_callback_sse41+0x230>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
@@ -14033,7 +14628,7 @@
   DB  15,40,198                           ; movaps        %xmm6,%xmm0
   DB  15,94,199                           ; divps         %xmm7,%xmm0
   DB  65,15,84,193                        ; andps         %xmm9,%xmm0
-  DB  15,40,13,114,77,0,0                 ; movaps        0x4d72(%rip),%xmm1        # 5960 <_sk_callback_sse41+0x245>
+  DB  15,40,13,242,79,0,0                 ; movaps        0x4ff2(%rip),%xmm1        # 5be0 <_sk_callback_sse41+0x240>
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
   DB  68,15,92,208                        ; subps         %xmm0,%xmm10
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
@@ -14046,10 +14641,10 @@
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  15,89,210                           ; mulps         %xmm2,%xmm2
   DB  15,88,208                           ; addps         %xmm0,%xmm2
-  DB  68,15,40,45,80,77,0,0               ; movaps        0x4d50(%rip),%xmm13        # 5970 <_sk_callback_sse41+0x255>
+  DB  68,15,40,45,208,79,0,0              ; movaps        0x4fd0(%rip),%xmm13        # 5bf0 <_sk_callback_sse41+0x250>
   DB  69,15,88,245                        ; addps         %xmm13,%xmm14
   DB  68,15,89,242                        ; mulps         %xmm2,%xmm14
-  DB  68,15,40,37,80,77,0,0               ; movaps        0x4d50(%rip),%xmm12        # 5980 <_sk_callback_sse41+0x265>
+  DB  68,15,40,37,208,79,0,0              ; movaps        0x4fd0(%rip),%xmm12        # 5c00 <_sk_callback_sse41+0x260>
   DB  69,15,89,252                        ; mulps         %xmm12,%xmm15
   DB  69,15,88,254                        ; addps         %xmm14,%xmm15
   DB  15,40,198                           ; movaps        %xmm6,%xmm0
@@ -14235,12 +14830,12 @@
   DB  68,15,84,208                        ; andps         %xmm0,%xmm10
   DB  15,84,200                           ; andps         %xmm0,%xmm1
   DB  68,15,84,232                        ; andps         %xmm0,%xmm13
-  DB  15,40,5,182,74,0,0                  ; movaps        0x4ab6(%rip),%xmm0        # 5990 <_sk_callback_sse41+0x275>
+  DB  15,40,5,54,77,0,0                   ; movaps        0x4d36(%rip),%xmm0        # 5c10 <_sk_callback_sse41+0x270>
   DB  68,15,89,224                        ; mulps         %xmm0,%xmm12
-  DB  15,40,21,187,74,0,0                 ; movaps        0x4abb(%rip),%xmm2        # 59a0 <_sk_callback_sse41+0x285>
+  DB  15,40,21,59,77,0,0                  ; movaps        0x4d3b(%rip),%xmm2        # 5c20 <_sk_callback_sse41+0x280>
   DB  15,89,250                           ; mulps         %xmm2,%xmm7
   DB  65,15,88,252                        ; addps         %xmm12,%xmm7
-  DB  68,15,40,53,188,74,0,0              ; movaps        0x4abc(%rip),%xmm14        # 59b0 <_sk_callback_sse41+0x295>
+  DB  68,15,40,53,60,77,0,0               ; movaps        0x4d3c(%rip),%xmm14        # 5c30 <_sk_callback_sse41+0x290>
   DB  68,15,40,252                        ; movaps        %xmm4,%xmm15
   DB  69,15,89,254                        ; mulps         %xmm14,%xmm15
   DB  68,15,88,255                        ; addps         %xmm7,%xmm15
@@ -14323,7 +14918,7 @@
   DB  65,15,88,214                        ; addps         %xmm14,%xmm2
   DB  15,40,196                           ; movaps        %xmm4,%xmm0
   DB  102,15,56,20,202                    ; blendvps      %xmm0,%xmm2,%xmm1
-  DB  68,15,40,13,129,73,0,0              ; movaps        0x4981(%rip),%xmm9        # 59c0 <_sk_callback_sse41+0x2a5>
+  DB  68,15,40,13,1,76,0,0                ; movaps        0x4c01(%rip),%xmm9        # 5c40 <_sk_callback_sse41+0x2a0>
   DB  65,15,40,225                        ; movaps        %xmm9,%xmm4
   DB  15,92,229                           ; subps         %xmm5,%xmm4
   DB  15,40,68,36,48                      ; movaps        0x30(%rsp),%xmm0
@@ -14417,14 +15012,14 @@
   DB  68,15,84,215                        ; andps         %xmm7,%xmm10
   DB  68,15,84,223                        ; andps         %xmm7,%xmm11
   DB  68,15,84,199                        ; andps         %xmm7,%xmm8
-  DB  15,40,21,52,72,0,0                  ; movaps        0x4834(%rip),%xmm2        # 59d0 <_sk_callback_sse41+0x2b5>
+  DB  15,40,21,180,74,0,0                 ; movaps        0x4ab4(%rip),%xmm2        # 5c50 <_sk_callback_sse41+0x2b0>
   DB  15,40,221                           ; movaps        %xmm5,%xmm3
   DB  15,89,218                           ; mulps         %xmm2,%xmm3
-  DB  15,40,13,55,72,0,0                  ; movaps        0x4837(%rip),%xmm1        # 59e0 <_sk_callback_sse41+0x2c5>
+  DB  15,40,13,183,74,0,0                 ; movaps        0x4ab7(%rip),%xmm1        # 5c60 <_sk_callback_sse41+0x2c0>
   DB  15,40,254                           ; movaps        %xmm6,%xmm7
   DB  15,89,249                           ; mulps         %xmm1,%xmm7
   DB  15,88,251                           ; addps         %xmm3,%xmm7
-  DB  68,15,40,45,54,72,0,0               ; movaps        0x4836(%rip),%xmm13        # 59f0 <_sk_callback_sse41+0x2d5>
+  DB  68,15,40,45,182,74,0,0              ; movaps        0x4ab6(%rip),%xmm13        # 5c70 <_sk_callback_sse41+0x2d0>
   DB  69,15,89,245                        ; mulps         %xmm13,%xmm14
   DB  68,15,88,247                        ; addps         %xmm7,%xmm14
   DB  65,15,40,218                        ; movaps        %xmm10,%xmm3
@@ -14505,7 +15100,7 @@
   DB  65,15,88,253                        ; addps         %xmm13,%xmm7
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  102,68,15,56,20,223                 ; blendvps      %xmm0,%xmm7,%xmm11
-  DB  68,15,40,13,252,70,0,0              ; movaps        0x46fc(%rip),%xmm9        # 5a00 <_sk_callback_sse41+0x2e5>
+  DB  68,15,40,13,124,73,0,0              ; movaps        0x497c(%rip),%xmm9        # 5c80 <_sk_callback_sse41+0x2e0>
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  68,15,92,204                        ; subps         %xmm4,%xmm9
   DB  15,40,60,36                         ; movaps        (%rsp),%xmm7
@@ -14560,14 +15155,14 @@
   DB  15,40,231                           ; movaps        %xmm7,%xmm4
   DB  68,15,89,244                        ; mulps         %xmm4,%xmm14
   DB  15,89,204                           ; mulps         %xmm4,%xmm1
-  DB  68,15,40,13,65,70,0,0               ; movaps        0x4641(%rip),%xmm9        # 5a10 <_sk_callback_sse41+0x2f5>
+  DB  68,15,40,13,193,72,0,0              ; movaps        0x48c1(%rip),%xmm9        # 5c90 <_sk_callback_sse41+0x2f0>
   DB  65,15,40,250                        ; movaps        %xmm10,%xmm7
   DB  65,15,89,249                        ; mulps         %xmm9,%xmm7
-  DB  68,15,40,21,65,70,0,0               ; movaps        0x4641(%rip),%xmm10        # 5a20 <_sk_callback_sse41+0x305>
+  DB  68,15,40,21,193,72,0,0              ; movaps        0x48c1(%rip),%xmm10        # 5ca0 <_sk_callback_sse41+0x300>
   DB  65,15,40,219                        ; movaps        %xmm11,%xmm3
   DB  65,15,89,218                        ; mulps         %xmm10,%xmm3
   DB  15,88,223                           ; addps         %xmm7,%xmm3
-  DB  68,15,40,29,62,70,0,0               ; movaps        0x463e(%rip),%xmm11        # 5a30 <_sk_callback_sse41+0x315>
+  DB  68,15,40,29,190,72,0,0              ; movaps        0x48be(%rip),%xmm11        # 5cb0 <_sk_callback_sse41+0x310>
   DB  69,15,40,236                        ; movaps        %xmm12,%xmm13
   DB  69,15,89,235                        ; mulps         %xmm11,%xmm13
   DB  68,15,88,235                        ; addps         %xmm3,%xmm13
@@ -14652,7 +15247,7 @@
   DB  65,15,88,251                        ; addps         %xmm11,%xmm7
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  102,15,56,20,207                    ; blendvps      %xmm0,%xmm7,%xmm1
-  DB  68,15,40,13,250,68,0,0              ; movaps        0x44fa(%rip),%xmm9        # 5a40 <_sk_callback_sse41+0x325>
+  DB  68,15,40,13,122,71,0,0              ; movaps        0x477a(%rip),%xmm9        # 5cc0 <_sk_callback_sse41+0x320>
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  68,15,89,192                        ; mulps         %xmm0,%xmm8
@@ -14704,13 +15299,13 @@
   DB  69,15,89,216                        ; mulps         %xmm8,%xmm11
   DB  68,15,40,203                        ; movaps        %xmm3,%xmm9
   DB  68,15,89,205                        ; mulps         %xmm5,%xmm9
-  DB  68,15,40,5,76,68,0,0                ; movaps        0x444c(%rip),%xmm8        # 5a50 <_sk_callback_sse41+0x335>
+  DB  68,15,40,5,204,70,0,0               ; movaps        0x46cc(%rip),%xmm8        # 5cd0 <_sk_callback_sse41+0x330>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
-  DB  68,15,40,21,80,68,0,0               ; movaps        0x4450(%rip),%xmm10        # 5a60 <_sk_callback_sse41+0x345>
+  DB  68,15,40,21,208,70,0,0              ; movaps        0x46d0(%rip),%xmm10        # 5ce0 <_sk_callback_sse41+0x340>
   DB  15,40,233                           ; movaps        %xmm1,%xmm5
   DB  65,15,89,234                        ; mulps         %xmm10,%xmm5
   DB  15,88,232                           ; addps         %xmm0,%xmm5
-  DB  68,15,40,37,78,68,0,0               ; movaps        0x444e(%rip),%xmm12        # 5a70 <_sk_callback_sse41+0x355>
+  DB  68,15,40,37,206,70,0,0              ; movaps        0x46ce(%rip),%xmm12        # 5cf0 <_sk_callback_sse41+0x350>
   DB  68,15,40,242                        ; movaps        %xmm2,%xmm14
   DB  69,15,89,244                        ; mulps         %xmm12,%xmm14
   DB  68,15,88,245                        ; addps         %xmm5,%xmm14
@@ -14795,7 +15390,7 @@
   DB  65,15,88,244                        ; addps         %xmm12,%xmm6
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  102,68,15,56,20,206                 ; blendvps      %xmm0,%xmm6,%xmm9
-  DB  15,40,5,4,67,0,0                    ; movaps        0x4304(%rip),%xmm0        # 5a80 <_sk_callback_sse41+0x365>
+  DB  15,40,5,132,69,0,0                  ; movaps        0x4584(%rip),%xmm0        # 5d00 <_sk_callback_sse41+0x360>
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  15,92,215                           ; subps         %xmm7,%xmm2
   DB  15,89,226                           ; mulps         %xmm2,%xmm4
@@ -14837,20 +15432,20 @@
   DB  15,133,217,0,0,0                    ; jne           18d3 <_sk_srcover_rgba_8888_sse41+0xe7>
   DB  243,15,111,60,144                   ; movdqu        (%rax,%rdx,4),%xmm7
   DB  77,133,192                          ; test          %r8,%r8
-  DB  102,15,111,37,134,66,0,0            ; movdqa        0x4286(%rip),%xmm4        # 5a90 <_sk_callback_sse41+0x375>
+  DB  102,15,111,37,6,69,0,0              ; movdqa        0x4506(%rip),%xmm4        # 5d10 <_sk_callback_sse41+0x370>
   DB  102,15,219,231                      ; pand          %xmm7,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
   DB  102,15,111,239                      ; movdqa        %xmm7,%xmm5
-  DB  102,15,56,0,45,130,66,0,0           ; pshufb        0x4282(%rip),%xmm5        # 5aa0 <_sk_callback_sse41+0x385>
+  DB  102,15,56,0,45,2,69,0,0             ; pshufb        0x4502(%rip),%xmm5        # 5d20 <_sk_callback_sse41+0x380>
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
   DB  102,15,111,247                      ; movdqa        %xmm7,%xmm6
-  DB  102,15,56,0,53,130,66,0,0           ; pshufb        0x4282(%rip),%xmm6        # 5ab0 <_sk_callback_sse41+0x395>
+  DB  102,15,56,0,53,2,69,0,0             ; pshufb        0x4502(%rip),%xmm6        # 5d30 <_sk_callback_sse41+0x390>
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
   DB  102,15,114,215,24                   ; psrld         $0x18,%xmm7
   DB  15,91,255                           ; cvtdq2ps      %xmm7,%xmm7
-  DB  68,15,40,5,127,66,0,0               ; movaps        0x427f(%rip),%xmm8        # 5ac0 <_sk_callback_sse41+0x3a5>
+  DB  68,15,40,5,255,68,0,0               ; movaps        0x44ff(%rip),%xmm8        # 5d40 <_sk_callback_sse41+0x3a0>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
-  DB  68,15,40,37,131,66,0,0              ; movaps        0x4283(%rip),%xmm12        # 5ad0 <_sk_callback_sse41+0x3b5>
+  DB  68,15,40,37,3,69,0,0                ; movaps        0x4503(%rip),%xmm12        # 5d50 <_sk_callback_sse41+0x3b0>
   DB  65,15,89,196                        ; mulps         %xmm12,%xmm0
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -14926,7 +15521,7 @@
 
 PUBLIC _sk_clamp_1_sse41
 _sk_clamp_1_sse41 LABEL PROC
-  DB  68,15,40,5,117,65,0,0               ; movaps        0x4175(%rip),%xmm8        # 5ae0 <_sk_callback_sse41+0x3c5>
+  DB  68,15,40,5,245,67,0,0               ; movaps        0x43f5(%rip),%xmm8        # 5d60 <_sk_callback_sse41+0x3c0>
   DB  65,15,93,192                        ; minps         %xmm8,%xmm0
   DB  65,15,93,200                        ; minps         %xmm8,%xmm1
   DB  65,15,93,208                        ; minps         %xmm8,%xmm2
@@ -14936,7 +15531,7 @@
 
 PUBLIC _sk_clamp_a_sse41
 _sk_clamp_a_sse41 LABEL PROC
-  DB  15,93,29,106,65,0,0                 ; minps         0x416a(%rip),%xmm3        # 5af0 <_sk_callback_sse41+0x3d5>
+  DB  15,93,29,234,67,0,0                 ; minps         0x43ea(%rip),%xmm3        # 5d70 <_sk_callback_sse41+0x3d0>
   DB  15,93,195                           ; minps         %xmm3,%xmm0
   DB  15,93,203                           ; minps         %xmm3,%xmm1
   DB  15,93,211                           ; minps         %xmm3,%xmm2
@@ -14945,7 +15540,7 @@
 
 PUBLIC _sk_clamp_a_dst_sse41
 _sk_clamp_a_dst_sse41 LABEL PROC
-  DB  15,93,61,102,65,0,0                 ; minps         0x4166(%rip),%xmm7        # 5b00 <_sk_callback_sse41+0x3e5>
+  DB  15,93,61,230,67,0,0                 ; minps         0x43e6(%rip),%xmm7        # 5d80 <_sk_callback_sse41+0x3e0>
   DB  15,93,231                           ; minps         %xmm7,%xmm4
   DB  15,93,239                           ; minps         %xmm7,%xmm5
   DB  15,93,247                           ; minps         %xmm7,%xmm6
@@ -14972,14 +15567,6 @@
   DB  65,15,40,208                        ; movaps        %xmm8,%xmm2
   DB  255,224                             ; jmpq          *%rax
 
-PUBLIC _sk_swap_rb_dst_sse41
-_sk_swap_rb_dst_sse41 LABEL PROC
-  DB  68,15,40,196                        ; movaps        %xmm4,%xmm8
-  DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,230                           ; movaps        %xmm6,%xmm4
-  DB  65,15,40,240                        ; movaps        %xmm8,%xmm6
-  DB  255,224                             ; jmpq          *%rax
-
 PUBLIC _sk_move_src_dst_sse41
 _sk_move_src_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -15009,7 +15596,7 @@
 PUBLIC _sk_unpremul_sse41
 _sk_unpremul_sse41 LABEL PROC
   DB  69,15,87,192                        ; xorps         %xmm8,%xmm8
-  DB  68,15,40,13,242,64,0,0              ; movaps        0x40f2(%rip),%xmm9        # 5b10 <_sk_callback_sse41+0x3f5>
+  DB  68,15,40,13,129,67,0,0              ; movaps        0x4381(%rip),%xmm9        # 5d90 <_sk_callback_sse41+0x3f0>
   DB  68,15,94,203                        ; divps         %xmm3,%xmm9
   DB  68,15,194,195,4                     ; cmpneqps      %xmm3,%xmm8
   DB  69,15,84,193                        ; andps         %xmm9,%xmm8
@@ -15021,20 +15608,20 @@
 
 PUBLIC _sk_from_srgb_sse41
 _sk_from_srgb_sse41 LABEL PROC
-  DB  68,15,40,29,221,64,0,0              ; movaps        0x40dd(%rip),%xmm11        # 5b20 <_sk_callback_sse41+0x405>
+  DB  68,15,40,29,108,67,0,0              ; movaps        0x436c(%rip),%xmm11        # 5da0 <_sk_callback_sse41+0x400>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
   DB  68,15,40,208                        ; movaps        %xmm0,%xmm10
   DB  69,15,89,210                        ; mulps         %xmm10,%xmm10
-  DB  68,15,40,37,213,64,0,0              ; movaps        0x40d5(%rip),%xmm12        # 5b30 <_sk_callback_sse41+0x415>
+  DB  68,15,40,37,100,67,0,0              ; movaps        0x4364(%rip),%xmm12        # 5db0 <_sk_callback_sse41+0x410>
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  69,15,89,196                        ; mulps         %xmm12,%xmm8
-  DB  68,15,40,45,213,64,0,0              ; movaps        0x40d5(%rip),%xmm13        # 5b40 <_sk_callback_sse41+0x425>
+  DB  68,15,40,45,100,67,0,0              ; movaps        0x4364(%rip),%xmm13        # 5dc0 <_sk_callback_sse41+0x420>
   DB  69,15,88,197                        ; addps         %xmm13,%xmm8
   DB  69,15,89,194                        ; mulps         %xmm10,%xmm8
-  DB  68,15,40,53,213,64,0,0              ; movaps        0x40d5(%rip),%xmm14        # 5b50 <_sk_callback_sse41+0x435>
+  DB  68,15,40,53,100,67,0,0              ; movaps        0x4364(%rip),%xmm14        # 5dd0 <_sk_callback_sse41+0x430>
   DB  69,15,88,198                        ; addps         %xmm14,%xmm8
-  DB  68,15,40,61,217,64,0,0              ; movaps        0x40d9(%rip),%xmm15        # 5b60 <_sk_callback_sse41+0x445>
+  DB  68,15,40,61,104,67,0,0              ; movaps        0x4368(%rip),%xmm15        # 5de0 <_sk_callback_sse41+0x440>
   DB  65,15,194,199,1                     ; cmpltps       %xmm15,%xmm0
   DB  102,69,15,56,20,193                 ; blendvps      %xmm0,%xmm9,%xmm8
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
@@ -15069,19 +15656,19 @@
 _sk_from_srgb_dst_sse41 LABEL PROC
   DB  68,15,40,204                        ; movaps        %xmm4,%xmm9
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,29,100,64,0,0              ; movaps        0x4064(%rip),%xmm11        # 5b70 <_sk_callback_sse41+0x455>
+  DB  68,15,40,29,243,66,0,0              ; movaps        0x42f3(%rip),%xmm11        # 5df0 <_sk_callback_sse41+0x450>
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
   DB  69,15,89,211                        ; mulps         %xmm11,%xmm10
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
-  DB  68,15,40,37,93,64,0,0               ; movaps        0x405d(%rip),%xmm12        # 5b80 <_sk_callback_sse41+0x465>
+  DB  68,15,40,37,236,66,0,0              ; movaps        0x42ec(%rip),%xmm12        # 5e00 <_sk_callback_sse41+0x460>
   DB  65,15,89,228                        ; mulps         %xmm12,%xmm4
-  DB  68,15,40,45,97,64,0,0               ; movaps        0x4061(%rip),%xmm13        # 5b90 <_sk_callback_sse41+0x475>
+  DB  68,15,40,45,240,66,0,0              ; movaps        0x42f0(%rip),%xmm13        # 5e10 <_sk_callback_sse41+0x470>
   DB  65,15,88,229                        ; addps         %xmm13,%xmm4
   DB  15,89,224                           ; mulps         %xmm0,%xmm4
-  DB  68,15,40,53,98,64,0,0               ; movaps        0x4062(%rip),%xmm14        # 5ba0 <_sk_callback_sse41+0x485>
+  DB  68,15,40,53,241,66,0,0              ; movaps        0x42f1(%rip),%xmm14        # 5e20 <_sk_callback_sse41+0x480>
   DB  65,15,88,230                        ; addps         %xmm14,%xmm4
-  DB  68,15,40,61,102,64,0,0              ; movaps        0x4066(%rip),%xmm15        # 5bb0 <_sk_callback_sse41+0x495>
+  DB  68,15,40,61,245,66,0,0              ; movaps        0x42f5(%rip),%xmm15        # 5e30 <_sk_callback_sse41+0x490>
   DB  69,15,194,207,1                     ; cmpltps       %xmm15,%xmm9
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  102,65,15,56,20,226                 ; blendvps      %xmm0,%xmm10,%xmm4
@@ -15124,22 +15711,22 @@
   DB  15,40,218                           ; movaps        %xmm2,%xmm3
   DB  15,40,209                           ; movaps        %xmm1,%xmm2
   DB  68,15,82,192                        ; rsqrtps       %xmm0,%xmm8
-  DB  68,15,40,29,215,63,0,0              ; movaps        0x3fd7(%rip),%xmm11        # 5bc0 <_sk_callback_sse41+0x4a5>
+  DB  68,15,40,29,102,66,0,0              ; movaps        0x4266(%rip),%xmm11        # 5e40 <_sk_callback_sse41+0x4a0>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
-  DB  68,15,40,37,215,63,0,0              ; movaps        0x3fd7(%rip),%xmm12        # 5bd0 <_sk_callback_sse41+0x4b5>
+  DB  68,15,40,37,102,66,0,0              ; movaps        0x4266(%rip),%xmm12        # 5e50 <_sk_callback_sse41+0x4b0>
   DB  69,15,40,248                        ; movaps        %xmm8,%xmm15
   DB  69,15,89,252                        ; mulps         %xmm12,%xmm15
-  DB  68,15,40,21,215,63,0,0              ; movaps        0x3fd7(%rip),%xmm10        # 5be0 <_sk_callback_sse41+0x4c5>
+  DB  68,15,40,21,102,66,0,0              ; movaps        0x4266(%rip),%xmm10        # 5e60 <_sk_callback_sse41+0x4c0>
   DB  69,15,88,250                        ; addps         %xmm10,%xmm15
   DB  69,15,89,248                        ; mulps         %xmm8,%xmm15
-  DB  68,15,40,45,215,63,0,0              ; movaps        0x3fd7(%rip),%xmm13        # 5bf0 <_sk_callback_sse41+0x4d5>
+  DB  68,15,40,45,102,66,0,0              ; movaps        0x4266(%rip),%xmm13        # 5e70 <_sk_callback_sse41+0x4d0>
   DB  69,15,88,253                        ; addps         %xmm13,%xmm15
-  DB  68,15,40,53,219,63,0,0              ; movaps        0x3fdb(%rip),%xmm14        # 5c00 <_sk_callback_sse41+0x4e5>
+  DB  68,15,40,53,106,66,0,0              ; movaps        0x426a(%rip),%xmm14        # 5e80 <_sk_callback_sse41+0x4e0>
   DB  69,15,88,198                        ; addps         %xmm14,%xmm8
   DB  69,15,83,192                        ; rcpps         %xmm8,%xmm8
   DB  69,15,89,199                        ; mulps         %xmm15,%xmm8
-  DB  68,15,40,61,215,63,0,0              ; movaps        0x3fd7(%rip),%xmm15        # 5c10 <_sk_callback_sse41+0x4f5>
+  DB  68,15,40,61,102,66,0,0              ; movaps        0x4266(%rip),%xmm15        # 5e90 <_sk_callback_sse41+0x4f0>
   DB  65,15,194,199,1                     ; cmpltps       %xmm15,%xmm0
   DB  102,69,15,56,20,193                 ; blendvps      %xmm0,%xmm9,%xmm8
   DB  68,15,82,202                        ; rsqrtps       %xmm2,%xmm9
@@ -15191,7 +15778,7 @@
   DB  68,15,93,226                        ; minps         %xmm2,%xmm12
   DB  65,15,40,203                        ; movaps        %xmm11,%xmm1
   DB  65,15,92,204                        ; subps         %xmm12,%xmm1
-  DB  68,15,40,53,33,63,0,0               ; movaps        0x3f21(%rip),%xmm14        # 5c20 <_sk_callback_sse41+0x505>
+  DB  68,15,40,53,176,65,0,0              ; movaps        0x41b0(%rip),%xmm14        # 5ea0 <_sk_callback_sse41+0x500>
   DB  68,15,94,241                        ; divps         %xmm1,%xmm14
   DB  69,15,40,211                        ; movaps        %xmm11,%xmm10
   DB  69,15,194,208,0                     ; cmpeqps       %xmm8,%xmm10
@@ -15200,27 +15787,27 @@
   DB  65,15,89,198                        ; mulps         %xmm14,%xmm0
   DB  69,15,40,249                        ; movaps        %xmm9,%xmm15
   DB  68,15,194,250,1                     ; cmpltps       %xmm2,%xmm15
-  DB  68,15,84,61,8,63,0,0                ; andps         0x3f08(%rip),%xmm15        # 5c30 <_sk_callback_sse41+0x515>
+  DB  68,15,84,61,151,65,0,0              ; andps         0x4197(%rip),%xmm15        # 5eb0 <_sk_callback_sse41+0x510>
   DB  68,15,88,248                        ; addps         %xmm0,%xmm15
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  65,15,194,193,0                     ; cmpeqps       %xmm9,%xmm0
   DB  65,15,92,208                        ; subps         %xmm8,%xmm2
   DB  65,15,89,214                        ; mulps         %xmm14,%xmm2
-  DB  68,15,40,45,251,62,0,0              ; movaps        0x3efb(%rip),%xmm13        # 5c40 <_sk_callback_sse41+0x525>
+  DB  68,15,40,45,138,65,0,0              ; movaps        0x418a(%rip),%xmm13        # 5ec0 <_sk_callback_sse41+0x520>
   DB  65,15,88,213                        ; addps         %xmm13,%xmm2
   DB  69,15,92,193                        ; subps         %xmm9,%xmm8
   DB  69,15,89,198                        ; mulps         %xmm14,%xmm8
-  DB  68,15,88,5,247,62,0,0               ; addps         0x3ef7(%rip),%xmm8        # 5c50 <_sk_callback_sse41+0x535>
+  DB  68,15,88,5,134,65,0,0               ; addps         0x4186(%rip),%xmm8        # 5ed0 <_sk_callback_sse41+0x530>
   DB  102,68,15,56,20,194                 ; blendvps      %xmm0,%xmm2,%xmm8
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  102,69,15,56,20,199                 ; blendvps      %xmm0,%xmm15,%xmm8
-  DB  68,15,89,5,239,62,0,0               ; mulps         0x3eef(%rip),%xmm8        # 5c60 <_sk_callback_sse41+0x545>
+  DB  68,15,89,5,126,65,0,0               ; mulps         0x417e(%rip),%xmm8        # 5ee0 <_sk_callback_sse41+0x540>
   DB  69,15,40,203                        ; movaps        %xmm11,%xmm9
   DB  69,15,194,204,4                     ; cmpneqps      %xmm12,%xmm9
   DB  69,15,84,193                        ; andps         %xmm9,%xmm8
   DB  69,15,92,235                        ; subps         %xmm11,%xmm13
   DB  69,15,88,220                        ; addps         %xmm12,%xmm11
-  DB  15,40,5,227,62,0,0                  ; movaps        0x3ee3(%rip),%xmm0        # 5c70 <_sk_callback_sse41+0x555>
+  DB  15,40,5,114,65,0,0                  ; movaps        0x4172(%rip),%xmm0        # 5ef0 <_sk_callback_sse41+0x550>
   DB  65,15,40,211                        ; movaps        %xmm11,%xmm2
   DB  15,89,208                           ; mulps         %xmm0,%xmm2
   DB  15,194,194,1                        ; cmpltps       %xmm2,%xmm0
@@ -15241,7 +15828,7 @@
   DB  15,41,100,36,32                     ; movaps        %xmm4,0x20(%rsp)
   DB  15,41,92,36,16                      ; movaps        %xmm3,0x10(%rsp)
   DB  68,15,40,208                        ; movaps        %xmm0,%xmm10
-  DB  68,15,40,13,165,62,0,0              ; movaps        0x3ea5(%rip),%xmm9        # 5c80 <_sk_callback_sse41+0x565>
+  DB  68,15,40,13,52,65,0,0               ; movaps        0x4134(%rip),%xmm9        # 5f00 <_sk_callback_sse41+0x560>
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,194,194,2                        ; cmpleps       %xmm2,%xmm0
   DB  15,40,217                           ; movaps        %xmm1,%xmm3
@@ -15254,19 +15841,19 @@
   DB  15,41,20,36                         ; movaps        %xmm2,(%rsp)
   DB  69,15,88,192                        ; addps         %xmm8,%xmm8
   DB  68,15,92,197                        ; subps         %xmm5,%xmm8
-  DB  68,15,40,53,129,62,0,0              ; movaps        0x3e81(%rip),%xmm14        # 5c90 <_sk_callback_sse41+0x575>
+  DB  68,15,40,53,16,65,0,0               ; movaps        0x4110(%rip),%xmm14        # 5f10 <_sk_callback_sse41+0x570>
   DB  69,15,88,242                        ; addps         %xmm10,%xmm14
   DB  102,65,15,58,8,198,1                ; roundps       $0x1,%xmm14,%xmm0
   DB  68,15,92,240                        ; subps         %xmm0,%xmm14
-  DB  68,15,40,29,122,62,0,0              ; movaps        0x3e7a(%rip),%xmm11        # 5ca0 <_sk_callback_sse41+0x585>
+  DB  68,15,40,29,9,65,0,0                ; movaps        0x4109(%rip),%xmm11        # 5f20 <_sk_callback_sse41+0x580>
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  65,15,194,198,2                     ; cmpleps       %xmm14,%xmm0
   DB  15,40,245                           ; movaps        %xmm5,%xmm6
   DB  65,15,92,240                        ; subps         %xmm8,%xmm6
-  DB  15,40,61,115,62,0,0                 ; movaps        0x3e73(%rip),%xmm7        # 5cb0 <_sk_callback_sse41+0x595>
+  DB  15,40,61,2,65,0,0                   ; movaps        0x4102(%rip),%xmm7        # 5f30 <_sk_callback_sse41+0x590>
   DB  69,15,40,238                        ; movaps        %xmm14,%xmm13
   DB  68,15,89,239                        ; mulps         %xmm7,%xmm13
-  DB  15,40,29,116,62,0,0                 ; movaps        0x3e74(%rip),%xmm3        # 5cc0 <_sk_callback_sse41+0x5a5>
+  DB  15,40,29,3,65,0,0                   ; movaps        0x4103(%rip),%xmm3        # 5f40 <_sk_callback_sse41+0x5a0>
   DB  68,15,40,227                        ; movaps        %xmm3,%xmm12
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  68,15,89,230                        ; mulps         %xmm6,%xmm12
@@ -15276,7 +15863,7 @@
   DB  65,15,194,198,2                     ; cmpleps       %xmm14,%xmm0
   DB  68,15,40,253                        ; movaps        %xmm5,%xmm15
   DB  102,69,15,56,20,252                 ; blendvps      %xmm0,%xmm12,%xmm15
-  DB  68,15,40,37,83,62,0,0               ; movaps        0x3e53(%rip),%xmm12        # 5cd0 <_sk_callback_sse41+0x5b5>
+  DB  68,15,40,37,226,64,0,0              ; movaps        0x40e2(%rip),%xmm12        # 5f50 <_sk_callback_sse41+0x5b0>
   DB  65,15,40,196                        ; movaps        %xmm12,%xmm0
   DB  65,15,194,198,2                     ; cmpleps       %xmm14,%xmm0
   DB  68,15,89,238                        ; mulps         %xmm6,%xmm13
@@ -15310,7 +15897,7 @@
   DB  65,15,40,198                        ; movaps        %xmm14,%xmm0
   DB  15,40,20,36                         ; movaps        (%rsp),%xmm2
   DB  102,15,56,20,202                    ; blendvps      %xmm0,%xmm2,%xmm1
-  DB  68,15,88,21,204,61,0,0              ; addps         0x3dcc(%rip),%xmm10        # 5ce0 <_sk_callback_sse41+0x5c5>
+  DB  68,15,88,21,91,64,0,0               ; addps         0x405b(%rip),%xmm10        # 5f60 <_sk_callback_sse41+0x5c0>
   DB  102,65,15,58,8,194,1                ; roundps       $0x1,%xmm10,%xmm0
   DB  68,15,92,208                        ; subps         %xmm0,%xmm10
   DB  69,15,194,218,2                     ; cmpleps       %xmm10,%xmm11
@@ -15358,11 +15945,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,52                              ; jne           1ff1 <_sk_scale_u8_sse41+0x3e>
+  DB  117,52                              ; jne           1fe2 <_sk_scale_u8_sse41+0x3e>
   DB  102,69,15,56,49,4,18                ; pmovzxbd      (%r10,%rdx,1),%xmm8
-  DB  102,68,15,219,5,35,61,0,0           ; pand          0x3d23(%rip),%xmm8        # 5cf0 <_sk_callback_sse41+0x5d5>
+  DB  102,68,15,219,5,178,63,0,0          ; pand          0x3fb2(%rip),%xmm8        # 5f70 <_sk_callback_sse41+0x5d0>
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,39,61,0,0                ; mulps         0x3d27(%rip),%xmm8        # 5d00 <_sk_callback_sse41+0x5e5>
+  DB  68,15,89,5,182,63,0,0               ; mulps         0x3fb6(%rip),%xmm8        # 5f80 <_sk_callback_sse41+0x5e0>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
@@ -15373,12 +15960,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,59                              ; je            2039 <_sk_scale_u8_sse41+0x86>
+  DB  116,59                              ; je            202a <_sk_scale_u8_sse41+0x86>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,23                              ; je            2020 <_sk_scale_u8_sse41+0x6d>
+  DB  116,23                              ; je            2011 <_sk_scale_u8_sse41+0x6d>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,181                             ; jne           1fc4 <_sk_scale_u8_sse41+0x11>
+  DB  117,181                             ; jne           1fb5 <_sk_scale_u8_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,192,69                ; pshufd        $0x45,%xmm8,%xmm8
@@ -15386,10 +15973,10 @@
   DB  102,68,15,110,200                   ; movd          %eax,%xmm9
   DB  102,69,15,56,49,201                 ; pmovzxbd      %xmm9,%xmm9
   DB  102,69,15,58,14,193,15              ; pblendw       $0xf,%xmm9,%xmm8
-  DB  235,139                             ; jmp           1fc4 <_sk_scale_u8_sse41+0x11>
+  DB  235,139                             ; jmp           1fb5 <_sk_scale_u8_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  233,124,255,255,255                 ; jmpq          1fc4 <_sk_scale_u8_sse41+0x11>
+  DB  233,124,255,255,255                 ; jmpq          1fb5 <_sk_scale_u8_sse41+0x11>
 
 PUBLIC _sk_lerp_1_float_sse41
 _sk_lerp_1_float_sse41 LABEL PROC
@@ -15416,11 +16003,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,72                              ; jne           20d2 <_sk_lerp_u8_sse41+0x52>
+  DB  117,72                              ; jne           20c3 <_sk_lerp_u8_sse41+0x52>
   DB  102,69,15,56,49,4,18                ; pmovzxbd      (%r10,%rdx,1),%xmm8
-  DB  102,68,15,219,5,118,60,0,0          ; pand          0x3c76(%rip),%xmm8        # 5d10 <_sk_callback_sse41+0x5f5>
+  DB  102,68,15,219,5,5,63,0,0            ; pand          0x3f05(%rip),%xmm8        # 5f90 <_sk_callback_sse41+0x5f0>
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,122,60,0,0               ; mulps         0x3c7a(%rip),%xmm8        # 5d20 <_sk_callback_sse41+0x605>
+  DB  68,15,89,5,9,63,0,0                 ; mulps         0x3f09(%rip),%xmm8        # 5fa0 <_sk_callback_sse41+0x600>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -15438,12 +16025,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,62                              ; je            211d <_sk_lerp_u8_sse41+0x9d>
+  DB  116,62                              ; je            210e <_sk_lerp_u8_sse41+0x9d>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,23                              ; je            2101 <_sk_lerp_u8_sse41+0x81>
+  DB  116,23                              ; je            20f2 <_sk_lerp_u8_sse41+0x81>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,161                             ; jne           2091 <_sk_lerp_u8_sse41+0x11>
+  DB  117,161                             ; jne           2082 <_sk_lerp_u8_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,192,69                ; pshufd        $0x45,%xmm8,%xmm8
@@ -15451,29 +16038,29 @@
   DB  102,68,15,110,200                   ; movd          %eax,%xmm9
   DB  102,69,15,56,49,201                 ; pmovzxbd      %xmm9,%xmm9
   DB  102,69,15,58,14,193,15              ; pblendw       $0xf,%xmm9,%xmm8
-  DB  233,116,255,255,255                 ; jmpq          2091 <_sk_lerp_u8_sse41+0x11>
+  DB  233,116,255,255,255                 ; jmpq          2082 <_sk_lerp_u8_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  233,101,255,255,255                 ; jmpq          2091 <_sk_lerp_u8_sse41+0x11>
+  DB  233,101,255,255,255                 ; jmpq          2082 <_sk_lerp_u8_sse41+0x11>
 
 PUBLIC _sk_lerp_565_sse41
 _sk_lerp_565_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,152,0,0,0                    ; jne           21d2 <_sk_lerp_565_sse41+0xa6>
+  DB  15,133,152,0,0,0                    ; jne           21c3 <_sk_lerp_565_sse41+0xa6>
   DB  102,69,15,56,51,20,82               ; pmovzxwd      (%r10,%rdx,2),%xmm10
-  DB  102,68,15,111,5,230,59,0,0          ; movdqa        0x3be6(%rip),%xmm8        # 5d30 <_sk_callback_sse41+0x615>
+  DB  102,68,15,111,5,117,62,0,0          ; movdqa        0x3e75(%rip),%xmm8        # 5fb0 <_sk_callback_sse41+0x610>
   DB  102,69,15,219,194                   ; pand          %xmm10,%xmm8
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,229,59,0,0               ; mulps         0x3be5(%rip),%xmm8        # 5d40 <_sk_callback_sse41+0x625>
-  DB  102,68,15,111,13,236,59,0,0         ; movdqa        0x3bec(%rip),%xmm9        # 5d50 <_sk_callback_sse41+0x635>
+  DB  68,15,89,5,116,62,0,0               ; mulps         0x3e74(%rip),%xmm8        # 5fc0 <_sk_callback_sse41+0x620>
+  DB  102,68,15,111,13,123,62,0,0         ; movdqa        0x3e7b(%rip),%xmm9        # 5fd0 <_sk_callback_sse41+0x630>
   DB  102,69,15,219,202                   ; pand          %xmm10,%xmm9
   DB  69,15,91,201                        ; cvtdq2ps      %xmm9,%xmm9
-  DB  68,15,89,13,235,59,0,0              ; mulps         0x3beb(%rip),%xmm9        # 5d60 <_sk_callback_sse41+0x645>
-  DB  102,68,15,219,21,242,59,0,0         ; pand          0x3bf2(%rip),%xmm10        # 5d70 <_sk_callback_sse41+0x655>
+  DB  68,15,89,13,122,62,0,0              ; mulps         0x3e7a(%rip),%xmm9        # 5fe0 <_sk_callback_sse41+0x640>
+  DB  102,68,15,219,21,129,62,0,0         ; pand          0x3e81(%rip),%xmm10        # 5ff0 <_sk_callback_sse41+0x650>
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
-  DB  68,15,89,21,246,59,0,0              ; mulps         0x3bf6(%rip),%xmm10        # 5d80 <_sk_callback_sse41+0x665>
+  DB  68,15,89,21,133,62,0,0              ; mulps         0x3e85(%rip),%xmm10        # 6000 <_sk_callback_sse41+0x660>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -15498,34 +16085,34 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,62                              ; je            221d <_sk_lerp_565_sse41+0xf1>
+  DB  116,62                              ; je            220e <_sk_lerp_565_sse41+0xf1>
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,27                              ; je            2205 <_sk_lerp_565_sse41+0xd9>
+  DB  116,27                              ; je            21f6 <_sk_lerp_565_sse41+0xd9>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  15,133,77,255,255,255               ; jne           2141 <_sk_lerp_565_sse41+0x15>
+  DB  15,133,77,255,255,255               ; jne           2132 <_sk_lerp_565_sse41+0x15>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,208,69                ; pshufd        $0x45,%xmm8,%xmm10
   DB  102,69,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm8
   DB  102,69,15,56,51,192                 ; pmovzxwd      %xmm8,%xmm8
   DB  102,69,15,58,14,208,15              ; pblendw       $0xf,%xmm8,%xmm10
-  DB  233,36,255,255,255                  ; jmpq          2141 <_sk_lerp_565_sse41+0x15>
+  DB  233,36,255,255,255                  ; jmpq          2132 <_sk_lerp_565_sse41+0x15>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,68,15,110,208                   ; movd          %eax,%xmm10
-  DB  233,21,255,255,255                  ; jmpq          2141 <_sk_lerp_565_sse41+0x15>
+  DB  233,21,255,255,255                  ; jmpq          2132 <_sk_lerp_565_sse41+0x15>
 
 PUBLIC _sk_load_tables_sse41
 _sk_load_tables_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,24,1,0,0                     ; jne           2352 <_sk_load_tables_sse41+0x126>
+  DB  15,133,24,1,0,0                     ; jne           2343 <_sk_load_tables_sse41+0x126>
   DB  243,69,15,111,4,145                 ; movdqu        (%r9,%rdx,4),%xmm8
   DB  65,87                               ; push          %r15
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
-  DB  102,15,111,5,67,59,0,0              ; movdqa        0x3b43(%rip),%xmm0        # 5d90 <_sk_callback_sse41+0x675>
+  DB  102,15,111,5,210,61,0,0             ; movdqa        0x3dd2(%rip),%xmm0        # 6010 <_sk_callback_sse41+0x670>
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,73,15,58,22,193,1               ; pextrq        $0x1,%xmm0,%r9
   DB  102,73,15,126,194                   ; movq          %xmm0,%r10
@@ -15540,7 +16127,7 @@
   DB  102,66,15,58,33,4,179,32            ; insertps      $0x20,(%rbx,%r14,4),%xmm0
   DB  102,66,15,58,33,4,11,48             ; insertps      $0x30,(%rbx,%r9,1),%xmm0
   DB  102,65,15,111,200                   ; movdqa        %xmm8,%xmm1
-  DB  102,15,56,0,13,254,58,0,0           ; pshufb        0x3afe(%rip),%xmm1        # 5da0 <_sk_callback_sse41+0x685>
+  DB  102,15,56,0,13,141,61,0,0           ; pshufb        0x3d8d(%rip),%xmm1        # 6020 <_sk_callback_sse41+0x680>
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  102,72,15,126,203                   ; movq          %xmm1,%rbx
   DB  68,15,182,211                       ; movzbl        %bl,%r10d
@@ -15555,7 +16142,7 @@
   DB  102,15,58,33,202,48                 ; insertps      $0x30,%xmm2,%xmm1
   DB  76,139,72,24                        ; mov           0x18(%rax),%r9
   DB  102,65,15,111,208                   ; movdqa        %xmm8,%xmm2
-  DB  102,15,56,0,21,186,58,0,0           ; pshufb        0x3aba(%rip),%xmm2        # 5db0 <_sk_callback_sse41+0x695>
+  DB  102,15,56,0,21,73,61,0,0            ; pshufb        0x3d49(%rip),%xmm2        # 6030 <_sk_callback_sse41+0x690>
   DB  102,72,15,58,22,211,1               ; pextrq        $0x1,%xmm2,%rbx
   DB  102,72,15,126,208                   ; movq          %xmm2,%rax
   DB  68,15,182,208                       ; movzbl        %al,%r10d
@@ -15570,7 +16157,7 @@
   DB  102,15,58,33,211,48                 ; insertps      $0x30,%xmm3,%xmm2
   DB  102,65,15,114,208,24                ; psrld         $0x18,%xmm8
   DB  65,15,91,216                        ; cvtdq2ps      %xmm8,%xmm3
-  DB  15,89,29,119,58,0,0                 ; mulps         0x3a77(%rip),%xmm3        # 5dc0 <_sk_callback_sse41+0x6a5>
+  DB  15,89,29,6,61,0,0                   ; mulps         0x3d06(%rip),%xmm3        # 6040 <_sk_callback_sse41+0x6a0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
@@ -15579,19 +16166,19 @@
   DB  69,137,194                          ; mov           %r8d,%r10d
   DB  65,128,226,3                        ; and           $0x3,%r10b
   DB  65,128,250,1                        ; cmp           $0x1,%r10b
-  DB  116,52                              ; je            2393 <_sk_load_tables_sse41+0x167>
+  DB  116,52                              ; je            2384 <_sk_load_tables_sse41+0x167>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,250,2                        ; cmp           $0x2,%r10b
-  DB  116,23                              ; je            2381 <_sk_load_tables_sse41+0x155>
+  DB  116,23                              ; je            2372 <_sk_load_tables_sse41+0x155>
   DB  65,128,250,3                        ; cmp           $0x3,%r10b
-  DB  15,133,204,254,255,255              ; jne           2240 <_sk_load_tables_sse41+0x14>
+  DB  15,133,204,254,255,255              ; jne           2231 <_sk_load_tables_sse41+0x14>
   DB  102,65,15,110,68,145,8              ; movd          0x8(%r9,%rdx,4),%xmm0
   DB  102,68,15,112,192,69                ; pshufd        $0x45,%xmm0,%xmm8
   DB  243,65,15,126,4,145                 ; movq          (%r9,%rdx,4),%xmm0
   DB  102,68,15,58,14,192,15              ; pblendw       $0xf,%xmm0,%xmm8
-  DB  233,173,254,255,255                 ; jmpq          2240 <_sk_load_tables_sse41+0x14>
+  DB  233,173,254,255,255                 ; jmpq          2231 <_sk_load_tables_sse41+0x14>
   DB  102,69,15,110,4,145                 ; movd          (%r9,%rdx,4),%xmm8
-  DB  233,162,254,255,255                 ; jmpq          2240 <_sk_load_tables_sse41+0x14>
+  DB  233,162,254,255,255                 ; jmpq          2231 <_sk_load_tables_sse41+0x14>
 
 PUBLIC _sk_load_tables_u16_be_sse41
 _sk_load_tables_u16_be_sse41 LABEL PROC
@@ -15599,7 +16186,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,99,1,0,0                     ; jne           2517 <_sk_load_tables_u16_be_sse41+0x179>
+  DB  15,133,99,1,0,0                     ; jne           2508 <_sk_load_tables_u16_be_sse41+0x179>
   DB  102,67,15,16,4,81                   ; movupd        (%r9,%r10,2),%xmm0
   DB  243,67,15,111,76,81,16              ; movdqu        0x10(%r9,%r10,2),%xmm1
   DB  65,87                               ; push          %r15
@@ -15611,7 +16198,7 @@
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,97,200                       ; punpcklwd     %xmm0,%xmm1
   DB  102,68,15,105,200                   ; punpckhwd     %xmm0,%xmm9
-  DB  102,68,15,111,5,229,57,0,0          ; movdqa        0x39e5(%rip),%xmm8        # 5dd0 <_sk_callback_sse41+0x6b5>
+  DB  102,68,15,111,5,116,60,0,0          ; movdqa        0x3c74(%rip),%xmm8        # 6050 <_sk_callback_sse41+0x6b0>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
@@ -15629,7 +16216,7 @@
   DB  102,15,58,33,194,32                 ; insertps      $0x20,%xmm2,%xmm0
   DB  243,66,15,16,20,11                  ; movss         (%rbx,%r9,1),%xmm2
   DB  102,15,58,33,194,48                 ; insertps      $0x30,%xmm2,%xmm0
-  DB  102,15,56,0,13,148,57,0,0           ; pshufb        0x3994(%rip),%xmm1        # 5de0 <_sk_callback_sse41+0x6c5>
+  DB  102,15,56,0,13,35,60,0,0            ; pshufb        0x3c23(%rip),%xmm1        # 6060 <_sk_callback_sse41+0x6c0>
   DB  102,15,56,51,201                    ; pmovzxwd      %xmm1,%xmm1
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  102,72,15,126,203                   ; movq          %xmm1,%rbx
@@ -15665,7 +16252,7 @@
   DB  102,65,15,235,216                   ; por           %xmm8,%xmm3
   DB  102,15,56,51,219                    ; pmovzxwd      %xmm3,%xmm3
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,226,56,0,0                 ; mulps         0x38e2(%rip),%xmm3        # 5df0 <_sk_callback_sse41+0x6d5>
+  DB  15,89,29,113,59,0,0                 ; mulps         0x3b71(%rip),%xmm3        # 6070 <_sk_callback_sse41+0x6d0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
@@ -15673,16 +16260,16 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,67,15,16,4,81                   ; movsd         (%r9,%r10,2),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           2530 <_sk_load_tables_u16_be_sse41+0x192>
+  DB  117,13                              ; jne           2521 <_sk_load_tables_u16_be_sse41+0x192>
   DB  243,15,126,192                      ; movq          %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,145,254,255,255                 ; jmpq          23c1 <_sk_load_tables_u16_be_sse41+0x23>
+  DB  233,145,254,255,255                 ; jmpq          23b2 <_sk_load_tables_u16_be_sse41+0x23>
   DB  102,67,15,22,68,81,8                ; movhpd        0x8(%r9,%r10,2),%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,124,254,255,255              ; jb            23c1 <_sk_load_tables_u16_be_sse41+0x23>
+  DB  15,130,124,254,255,255              ; jb            23b2 <_sk_load_tables_u16_be_sse41+0x23>
   DB  243,67,15,126,76,81,16              ; movq          0x10(%r9,%r10,2),%xmm1
-  DB  233,112,254,255,255                 ; jmpq          23c1 <_sk_load_tables_u16_be_sse41+0x23>
+  DB  233,112,254,255,255                 ; jmpq          23b2 <_sk_load_tables_u16_be_sse41+0x23>
 
 PUBLIC _sk_load_tables_rgb_u16_be_sse41
 _sk_load_tables_rgb_u16_be_sse41 LABEL PROC
@@ -15690,7 +16277,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,82                        ; lea           (%rdx,%rdx,2),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,83,1,0,0                     ; jne           26b6 <_sk_load_tables_rgb_u16_be_sse41+0x165>
+  DB  15,133,83,1,0,0                     ; jne           26a7 <_sk_load_tables_rgb_u16_be_sse41+0x165>
   DB  243,67,15,111,20,81                 ; movdqu        (%r9,%r10,2),%xmm2
   DB  243,67,15,111,76,81,8               ; movdqu        0x8(%r9,%r10,2),%xmm1
   DB  102,15,115,217,4                    ; psrldq        $0x4,%xmm1
@@ -15705,7 +16292,7 @@
   DB  102,68,15,97,200                    ; punpcklwd     %xmm0,%xmm9
   DB  102,15,111,202                      ; movdqa        %xmm2,%xmm1
   DB  102,65,15,97,201                    ; punpcklwd     %xmm9,%xmm1
-  DB  102,68,15,111,5,87,56,0,0           ; movdqa        0x3857(%rip),%xmm8        # 5e00 <_sk_callback_sse41+0x6e5>
+  DB  102,68,15,111,5,230,58,0,0          ; movdqa        0x3ae6(%rip),%xmm8        # 6080 <_sk_callback_sse41+0x6e0>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
@@ -15723,7 +16310,7 @@
   DB  102,15,58,33,195,32                 ; insertps      $0x20,%xmm3,%xmm0
   DB  243,66,15,16,28,11                  ; movss         (%rbx,%r9,1),%xmm3
   DB  102,15,58,33,195,48                 ; insertps      $0x30,%xmm3,%xmm0
-  DB  102,15,56,0,13,6,56,0,0             ; pshufb        0x3806(%rip),%xmm1        # 5e10 <_sk_callback_sse41+0x6f5>
+  DB  102,15,56,0,13,149,58,0,0           ; pshufb        0x3a95(%rip),%xmm1        # 6090 <_sk_callback_sse41+0x6f0>
   DB  102,15,56,51,201                    ; pmovzxwd      %xmm1,%xmm1
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  102,72,15,126,203                   ; movq          %xmm1,%rbx
@@ -15754,7 +16341,7 @@
   DB  243,65,15,16,28,25                  ; movss         (%r9,%rbx,1),%xmm3
   DB  102,15,58,33,211,48                 ; insertps      $0x30,%xmm3,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,113,55,0,0                 ; movaps        0x3771(%rip),%xmm3        # 5e20 <_sk_callback_sse41+0x705>
+  DB  15,40,29,0,58,0,0                   ; movaps        0x3a00(%rip),%xmm3        # 60a0 <_sk_callback_sse41+0x700>
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
   DB  65,95                               ; pop           %r15
@@ -15763,21 +16350,21 @@
   DB  102,67,15,196,84,81,4,2             ; pinsrw        $0x2,0x4(%r9,%r10,2),%xmm2
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,14                              ; jne           26dc <_sk_load_tables_rgb_u16_be_sse41+0x18b>
+  DB  117,14                              ; jne           26cd <_sk_load_tables_rgb_u16_be_sse41+0x18b>
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
-  DB  233,173,254,255,255                 ; jmpq          2589 <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  DB  233,173,254,255,255                 ; jmpq          257a <_sk_load_tables_rgb_u16_be_sse41+0x38>
   DB  102,71,15,110,76,81,6               ; movd          0x6(%r9,%r10,2),%xmm9
   DB  102,71,15,196,76,81,10,2            ; pinsrw        $0x2,0xa(%r9,%r10,2),%xmm9
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,24                              ; jb            270d <_sk_load_tables_rgb_u16_be_sse41+0x1bc>
+  DB  114,24                              ; jb            26fe <_sk_load_tables_rgb_u16_be_sse41+0x1bc>
   DB  102,67,15,110,76,81,12              ; movd          0xc(%r9,%r10,2),%xmm1
   DB  102,67,15,196,76,81,16,2            ; pinsrw        $0x2,0x10(%r9,%r10,2),%xmm1
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
-  DB  233,124,254,255,255                 ; jmpq          2589 <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  DB  233,124,254,255,255                 ; jmpq          257a <_sk_load_tables_rgb_u16_be_sse41+0x38>
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,115,254,255,255                 ; jmpq          2589 <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  DB  233,115,254,255,255                 ; jmpq          257a <_sk_load_tables_rgb_u16_be_sse41+0x38>
 
 PUBLIC _sk_byte_tables_sse41
 _sk_byte_tables_sse41 LABEL PROC
@@ -15786,7 +16373,7 @@
   DB  65,84                               ; push          %r12
   DB  83                                  ; push          %rbx
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,9,55,0,0                 ; movaps        0x3709(%rip),%xmm8        # 5e30 <_sk_callback_sse41+0x715>
+  DB  68,15,40,5,152,57,0,0               ; movaps        0x3998(%rip),%xmm8        # 60b0 <_sk_callback_sse41+0x710>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,91,192                       ; cvtps2dq      %xmm0,%xmm0
   DB  102,73,15,58,22,193,1               ; pextrq        $0x1,%xmm0,%r9
@@ -15805,7 +16392,7 @@
   DB  102,15,58,32,195,3                  ; pinsrb        $0x3,%ebx,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,13,186,54,0,0              ; movaps        0x36ba(%rip),%xmm9        # 5e40 <_sk_callback_sse41+0x725>
+  DB  68,15,40,13,73,57,0,0               ; movaps        0x3949(%rip),%xmm9        # 60c0 <_sk_callback_sse41+0x720>
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -15899,7 +16486,7 @@
   DB  102,15,58,32,195,3                  ; pinsrb        $0x3,%ebx,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,13,50,53,0,0               ; movaps        0x3532(%rip),%xmm9        # 5e50 <_sk_callback_sse41+0x735>
+  DB  68,15,40,13,193,55,0,0              ; movaps        0x37c1(%rip),%xmm9        # 60d0 <_sk_callback_sse41+0x730>
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -16076,31 +16663,31 @@
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,194                        ; cvtdq2ps      %xmm10,%xmm8
-  DB  68,15,89,5,122,50,0,0               ; mulps         0x327a(%rip),%xmm8        # 5e60 <_sk_callback_sse41+0x745>
-  DB  68,15,84,21,130,50,0,0              ; andps         0x3282(%rip),%xmm10        # 5e70 <_sk_callback_sse41+0x755>
-  DB  68,15,86,21,138,50,0,0              ; orps          0x328a(%rip),%xmm10        # 5e80 <_sk_callback_sse41+0x765>
-  DB  68,15,88,5,146,50,0,0               ; addps         0x3292(%rip),%xmm8        # 5e90 <_sk_callback_sse41+0x775>
-  DB  68,15,40,37,154,50,0,0              ; movaps        0x329a(%rip),%xmm12        # 5ea0 <_sk_callback_sse41+0x785>
+  DB  68,15,89,5,9,53,0,0                 ; mulps         0x3509(%rip),%xmm8        # 60e0 <_sk_callback_sse41+0x740>
+  DB  68,15,84,21,17,53,0,0               ; andps         0x3511(%rip),%xmm10        # 60f0 <_sk_callback_sse41+0x750>
+  DB  68,15,86,21,25,53,0,0               ; orps          0x3519(%rip),%xmm10        # 6100 <_sk_callback_sse41+0x760>
+  DB  68,15,88,5,33,53,0,0                ; addps         0x3521(%rip),%xmm8        # 6110 <_sk_callback_sse41+0x770>
+  DB  68,15,40,37,41,53,0,0               ; movaps        0x3529(%rip),%xmm12        # 6120 <_sk_callback_sse41+0x780>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,196                        ; subps         %xmm12,%xmm8
-  DB  68,15,88,21,154,50,0,0              ; addps         0x329a(%rip),%xmm10        # 5eb0 <_sk_callback_sse41+0x795>
-  DB  68,15,40,37,162,50,0,0              ; movaps        0x32a2(%rip),%xmm12        # 5ec0 <_sk_callback_sse41+0x7a5>
+  DB  68,15,88,21,41,53,0,0               ; addps         0x3529(%rip),%xmm10        # 6130 <_sk_callback_sse41+0x790>
+  DB  68,15,40,37,49,53,0,0               ; movaps        0x3531(%rip),%xmm12        # 6140 <_sk_callback_sse41+0x7a0>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,196                        ; subps         %xmm12,%xmm8
   DB  69,15,89,195                        ; mulps         %xmm11,%xmm8
   DB  102,69,15,58,8,208,1                ; roundps       $0x1,%xmm8,%xmm10
   DB  69,15,40,216                        ; movaps        %xmm8,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,5,143,50,0,0               ; addps         0x328f(%rip),%xmm8        # 5ed0 <_sk_callback_sse41+0x7b5>
-  DB  68,15,40,21,151,50,0,0              ; movaps        0x3297(%rip),%xmm10        # 5ee0 <_sk_callback_sse41+0x7c5>
+  DB  68,15,88,5,30,53,0,0                ; addps         0x351e(%rip),%xmm8        # 6150 <_sk_callback_sse41+0x7b0>
+  DB  68,15,40,21,38,53,0,0               ; movaps        0x3526(%rip),%xmm10        # 6160 <_sk_callback_sse41+0x7c0>
   DB  69,15,89,211                        ; mulps         %xmm11,%xmm10
   DB  69,15,92,194                        ; subps         %xmm10,%xmm8
-  DB  68,15,40,21,151,50,0,0              ; movaps        0x3297(%rip),%xmm10        # 5ef0 <_sk_callback_sse41+0x7d5>
+  DB  68,15,40,21,38,53,0,0               ; movaps        0x3526(%rip),%xmm10        # 6170 <_sk_callback_sse41+0x7d0>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  68,15,40,29,155,50,0,0              ; movaps        0x329b(%rip),%xmm11        # 5f00 <_sk_callback_sse41+0x7e5>
+  DB  68,15,40,29,42,53,0,0               ; movaps        0x352a(%rip),%xmm11        # 6180 <_sk_callback_sse41+0x7e0>
   DB  69,15,94,218                        ; divps         %xmm10,%xmm11
   DB  69,15,88,216                        ; addps         %xmm8,%xmm11
-  DB  68,15,89,29,155,50,0,0              ; mulps         0x329b(%rip),%xmm11        # 5f10 <_sk_callback_sse41+0x7f5>
+  DB  68,15,89,29,42,53,0,0               ; mulps         0x352a(%rip),%xmm11        # 6190 <_sk_callback_sse41+0x7f0>
   DB  102,69,15,91,211                    ; cvtps2dq      %xmm11,%xmm10
   DB  243,68,15,16,64,20                  ; movss         0x14(%rax),%xmm8
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
@@ -16108,7 +16695,7 @@
   DB  102,69,15,56,20,193                 ; blendvps      %xmm0,%xmm9,%xmm8
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  68,15,95,192                        ; maxps         %xmm0,%xmm8
-  DB  68,15,93,5,130,50,0,0               ; minps         0x3282(%rip),%xmm8        # 5f20 <_sk_callback_sse41+0x805>
+  DB  68,15,93,5,17,53,0,0                ; minps         0x3511(%rip),%xmm8        # 61a0 <_sk_callback_sse41+0x800>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -16136,31 +16723,31 @@
   DB  68,15,88,217                        ; addps         %xmm1,%xmm11
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,91,227                        ; cvtdq2ps      %xmm11,%xmm12
-  DB  68,15,89,37,35,50,0,0               ; mulps         0x3223(%rip),%xmm12        # 5f30 <_sk_callback_sse41+0x815>
-  DB  68,15,84,29,43,50,0,0               ; andps         0x322b(%rip),%xmm11        # 5f40 <_sk_callback_sse41+0x825>
-  DB  68,15,86,29,51,50,0,0               ; orps          0x3233(%rip),%xmm11        # 5f50 <_sk_callback_sse41+0x835>
-  DB  68,15,88,37,59,50,0,0               ; addps         0x323b(%rip),%xmm12        # 5f60 <_sk_callback_sse41+0x845>
-  DB  15,40,13,68,50,0,0                  ; movaps        0x3244(%rip),%xmm1        # 5f70 <_sk_callback_sse41+0x855>
+  DB  68,15,89,37,178,52,0,0              ; mulps         0x34b2(%rip),%xmm12        # 61b0 <_sk_callback_sse41+0x810>
+  DB  68,15,84,29,186,52,0,0              ; andps         0x34ba(%rip),%xmm11        # 61c0 <_sk_callback_sse41+0x820>
+  DB  68,15,86,29,194,52,0,0              ; orps          0x34c2(%rip),%xmm11        # 61d0 <_sk_callback_sse41+0x830>
+  DB  68,15,88,37,202,52,0,0              ; addps         0x34ca(%rip),%xmm12        # 61e0 <_sk_callback_sse41+0x840>
+  DB  15,40,13,211,52,0,0                 ; movaps        0x34d3(%rip),%xmm1        # 61f0 <_sk_callback_sse41+0x850>
   DB  65,15,89,203                        ; mulps         %xmm11,%xmm1
   DB  68,15,92,225                        ; subps         %xmm1,%xmm12
-  DB  68,15,88,29,68,50,0,0               ; addps         0x3244(%rip),%xmm11        # 5f80 <_sk_callback_sse41+0x865>
-  DB  15,40,13,77,50,0,0                  ; movaps        0x324d(%rip),%xmm1        # 5f90 <_sk_callback_sse41+0x875>
+  DB  68,15,88,29,211,52,0,0              ; addps         0x34d3(%rip),%xmm11        # 6200 <_sk_callback_sse41+0x860>
+  DB  15,40,13,220,52,0,0                 ; movaps        0x34dc(%rip),%xmm1        # 6210 <_sk_callback_sse41+0x870>
   DB  65,15,94,203                        ; divps         %xmm11,%xmm1
   DB  68,15,92,225                        ; subps         %xmm1,%xmm12
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  102,69,15,58,8,212,1                ; roundps       $0x1,%xmm12,%xmm10
   DB  69,15,40,220                        ; movaps        %xmm12,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,37,58,50,0,0               ; addps         0x323a(%rip),%xmm12        # 5fa0 <_sk_callback_sse41+0x885>
-  DB  15,40,13,67,50,0,0                  ; movaps        0x3243(%rip),%xmm1        # 5fb0 <_sk_callback_sse41+0x895>
+  DB  68,15,88,37,201,52,0,0              ; addps         0x34c9(%rip),%xmm12        # 6220 <_sk_callback_sse41+0x880>
+  DB  15,40,13,210,52,0,0                 ; movaps        0x34d2(%rip),%xmm1        # 6230 <_sk_callback_sse41+0x890>
   DB  65,15,89,203                        ; mulps         %xmm11,%xmm1
   DB  68,15,92,225                        ; subps         %xmm1,%xmm12
-  DB  68,15,40,21,67,50,0,0               ; movaps        0x3243(%rip),%xmm10        # 5fc0 <_sk_callback_sse41+0x8a5>
+  DB  68,15,40,21,210,52,0,0              ; movaps        0x34d2(%rip),%xmm10        # 6240 <_sk_callback_sse41+0x8a0>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  15,40,13,72,50,0,0                  ; movaps        0x3248(%rip),%xmm1        # 5fd0 <_sk_callback_sse41+0x8b5>
+  DB  15,40,13,215,52,0,0                 ; movaps        0x34d7(%rip),%xmm1        # 6250 <_sk_callback_sse41+0x8b0>
   DB  65,15,94,202                        ; divps         %xmm10,%xmm1
   DB  65,15,88,204                        ; addps         %xmm12,%xmm1
-  DB  15,89,13,73,50,0,0                  ; mulps         0x3249(%rip),%xmm1        # 5fe0 <_sk_callback_sse41+0x8c5>
+  DB  15,89,13,216,52,0,0                 ; mulps         0x34d8(%rip),%xmm1        # 6260 <_sk_callback_sse41+0x8c0>
   DB  102,68,15,91,209                    ; cvtps2dq      %xmm1,%xmm10
   DB  243,15,16,72,20                     ; movss         0x14(%rax),%xmm1
   DB  15,198,201,0                        ; shufps        $0x0,%xmm1,%xmm1
@@ -16168,7 +16755,7 @@
   DB  102,65,15,56,20,201                 ; blendvps      %xmm0,%xmm9,%xmm1
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  15,95,200                           ; maxps         %xmm0,%xmm1
-  DB  15,93,13,52,50,0,0                  ; minps         0x3234(%rip),%xmm1        # 5ff0 <_sk_callback_sse41+0x8d5>
+  DB  15,93,13,195,52,0,0                 ; minps         0x34c3(%rip),%xmm1        # 6270 <_sk_callback_sse41+0x8d0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -16196,31 +16783,31 @@
   DB  68,15,88,218                        ; addps         %xmm2,%xmm11
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,91,227                        ; cvtdq2ps      %xmm11,%xmm12
-  DB  68,15,89,37,213,49,0,0              ; mulps         0x31d5(%rip),%xmm12        # 6000 <_sk_callback_sse41+0x8e5>
-  DB  68,15,84,29,221,49,0,0              ; andps         0x31dd(%rip),%xmm11        # 6010 <_sk_callback_sse41+0x8f5>
-  DB  68,15,86,29,229,49,0,0              ; orps          0x31e5(%rip),%xmm11        # 6020 <_sk_callback_sse41+0x905>
-  DB  68,15,88,37,237,49,0,0              ; addps         0x31ed(%rip),%xmm12        # 6030 <_sk_callback_sse41+0x915>
-  DB  15,40,21,246,49,0,0                 ; movaps        0x31f6(%rip),%xmm2        # 6040 <_sk_callback_sse41+0x925>
+  DB  68,15,89,37,100,52,0,0              ; mulps         0x3464(%rip),%xmm12        # 6280 <_sk_callback_sse41+0x8e0>
+  DB  68,15,84,29,108,52,0,0              ; andps         0x346c(%rip),%xmm11        # 6290 <_sk_callback_sse41+0x8f0>
+  DB  68,15,86,29,116,52,0,0              ; orps          0x3474(%rip),%xmm11        # 62a0 <_sk_callback_sse41+0x900>
+  DB  68,15,88,37,124,52,0,0              ; addps         0x347c(%rip),%xmm12        # 62b0 <_sk_callback_sse41+0x910>
+  DB  15,40,21,133,52,0,0                 ; movaps        0x3485(%rip),%xmm2        # 62c0 <_sk_callback_sse41+0x920>
   DB  65,15,89,211                        ; mulps         %xmm11,%xmm2
   DB  68,15,92,226                        ; subps         %xmm2,%xmm12
-  DB  68,15,88,29,246,49,0,0              ; addps         0x31f6(%rip),%xmm11        # 6050 <_sk_callback_sse41+0x935>
-  DB  15,40,21,255,49,0,0                 ; movaps        0x31ff(%rip),%xmm2        # 6060 <_sk_callback_sse41+0x945>
+  DB  68,15,88,29,133,52,0,0              ; addps         0x3485(%rip),%xmm11        # 62d0 <_sk_callback_sse41+0x930>
+  DB  15,40,21,142,52,0,0                 ; movaps        0x348e(%rip),%xmm2        # 62e0 <_sk_callback_sse41+0x940>
   DB  65,15,94,211                        ; divps         %xmm11,%xmm2
   DB  68,15,92,226                        ; subps         %xmm2,%xmm12
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  102,69,15,58,8,212,1                ; roundps       $0x1,%xmm12,%xmm10
   DB  69,15,40,220                        ; movaps        %xmm12,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,37,236,49,0,0              ; addps         0x31ec(%rip),%xmm12        # 6070 <_sk_callback_sse41+0x955>
-  DB  15,40,21,245,49,0,0                 ; movaps        0x31f5(%rip),%xmm2        # 6080 <_sk_callback_sse41+0x965>
+  DB  68,15,88,37,123,52,0,0              ; addps         0x347b(%rip),%xmm12        # 62f0 <_sk_callback_sse41+0x950>
+  DB  15,40,21,132,52,0,0                 ; movaps        0x3484(%rip),%xmm2        # 6300 <_sk_callback_sse41+0x960>
   DB  65,15,89,211                        ; mulps         %xmm11,%xmm2
   DB  68,15,92,226                        ; subps         %xmm2,%xmm12
-  DB  68,15,40,21,245,49,0,0              ; movaps        0x31f5(%rip),%xmm10        # 6090 <_sk_callback_sse41+0x975>
+  DB  68,15,40,21,132,52,0,0              ; movaps        0x3484(%rip),%xmm10        # 6310 <_sk_callback_sse41+0x970>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  15,40,21,250,49,0,0                 ; movaps        0x31fa(%rip),%xmm2        # 60a0 <_sk_callback_sse41+0x985>
+  DB  15,40,21,137,52,0,0                 ; movaps        0x3489(%rip),%xmm2        # 6320 <_sk_callback_sse41+0x980>
   DB  65,15,94,210                        ; divps         %xmm10,%xmm2
   DB  65,15,88,212                        ; addps         %xmm12,%xmm2
-  DB  15,89,21,251,49,0,0                 ; mulps         0x31fb(%rip),%xmm2        # 60b0 <_sk_callback_sse41+0x995>
+  DB  15,89,21,138,52,0,0                 ; mulps         0x348a(%rip),%xmm2        # 6330 <_sk_callback_sse41+0x990>
   DB  102,68,15,91,210                    ; cvtps2dq      %xmm2,%xmm10
   DB  243,15,16,80,20                     ; movss         0x14(%rax),%xmm2
   DB  15,198,210,0                        ; shufps        $0x0,%xmm2,%xmm2
@@ -16228,7 +16815,7 @@
   DB  102,65,15,56,20,209                 ; blendvps      %xmm0,%xmm9,%xmm2
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  15,95,208                           ; maxps         %xmm0,%xmm2
-  DB  15,93,21,230,49,0,0                 ; minps         0x31e6(%rip),%xmm2        # 60c0 <_sk_callback_sse41+0x9a5>
+  DB  15,93,21,117,52,0,0                 ; minps         0x3475(%rip),%xmm2        # 6340 <_sk_callback_sse41+0x9a0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -16256,31 +16843,31 @@
   DB  68,15,88,219                        ; addps         %xmm3,%xmm11
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,91,227                        ; cvtdq2ps      %xmm11,%xmm12
-  DB  68,15,89,37,135,49,0,0              ; mulps         0x3187(%rip),%xmm12        # 60d0 <_sk_callback_sse41+0x9b5>
-  DB  68,15,84,29,143,49,0,0              ; andps         0x318f(%rip),%xmm11        # 60e0 <_sk_callback_sse41+0x9c5>
-  DB  68,15,86,29,151,49,0,0              ; orps          0x3197(%rip),%xmm11        # 60f0 <_sk_callback_sse41+0x9d5>
-  DB  68,15,88,37,159,49,0,0              ; addps         0x319f(%rip),%xmm12        # 6100 <_sk_callback_sse41+0x9e5>
-  DB  15,40,29,168,49,0,0                 ; movaps        0x31a8(%rip),%xmm3        # 6110 <_sk_callback_sse41+0x9f5>
+  DB  68,15,89,37,22,52,0,0               ; mulps         0x3416(%rip),%xmm12        # 6350 <_sk_callback_sse41+0x9b0>
+  DB  68,15,84,29,30,52,0,0               ; andps         0x341e(%rip),%xmm11        # 6360 <_sk_callback_sse41+0x9c0>
+  DB  68,15,86,29,38,52,0,0               ; orps          0x3426(%rip),%xmm11        # 6370 <_sk_callback_sse41+0x9d0>
+  DB  68,15,88,37,46,52,0,0               ; addps         0x342e(%rip),%xmm12        # 6380 <_sk_callback_sse41+0x9e0>
+  DB  15,40,29,55,52,0,0                  ; movaps        0x3437(%rip),%xmm3        # 6390 <_sk_callback_sse41+0x9f0>
   DB  65,15,89,219                        ; mulps         %xmm11,%xmm3
   DB  68,15,92,227                        ; subps         %xmm3,%xmm12
-  DB  68,15,88,29,168,49,0,0              ; addps         0x31a8(%rip),%xmm11        # 6120 <_sk_callback_sse41+0xa05>
-  DB  15,40,29,177,49,0,0                 ; movaps        0x31b1(%rip),%xmm3        # 6130 <_sk_callback_sse41+0xa15>
+  DB  68,15,88,29,55,52,0,0               ; addps         0x3437(%rip),%xmm11        # 63a0 <_sk_callback_sse41+0xa00>
+  DB  15,40,29,64,52,0,0                  ; movaps        0x3440(%rip),%xmm3        # 63b0 <_sk_callback_sse41+0xa10>
   DB  65,15,94,219                        ; divps         %xmm11,%xmm3
   DB  68,15,92,227                        ; subps         %xmm3,%xmm12
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  102,69,15,58,8,212,1                ; roundps       $0x1,%xmm12,%xmm10
   DB  69,15,40,220                        ; movaps        %xmm12,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,37,158,49,0,0              ; addps         0x319e(%rip),%xmm12        # 6140 <_sk_callback_sse41+0xa25>
-  DB  15,40,29,167,49,0,0                 ; movaps        0x31a7(%rip),%xmm3        # 6150 <_sk_callback_sse41+0xa35>
+  DB  68,15,88,37,45,52,0,0               ; addps         0x342d(%rip),%xmm12        # 63c0 <_sk_callback_sse41+0xa20>
+  DB  15,40,29,54,52,0,0                  ; movaps        0x3436(%rip),%xmm3        # 63d0 <_sk_callback_sse41+0xa30>
   DB  65,15,89,219                        ; mulps         %xmm11,%xmm3
   DB  68,15,92,227                        ; subps         %xmm3,%xmm12
-  DB  68,15,40,21,167,49,0,0              ; movaps        0x31a7(%rip),%xmm10        # 6160 <_sk_callback_sse41+0xa45>
+  DB  68,15,40,21,54,52,0,0               ; movaps        0x3436(%rip),%xmm10        # 63e0 <_sk_callback_sse41+0xa40>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  15,40,29,172,49,0,0                 ; movaps        0x31ac(%rip),%xmm3        # 6170 <_sk_callback_sse41+0xa55>
+  DB  15,40,29,59,52,0,0                  ; movaps        0x343b(%rip),%xmm3        # 63f0 <_sk_callback_sse41+0xa50>
   DB  65,15,94,218                        ; divps         %xmm10,%xmm3
   DB  65,15,88,220                        ; addps         %xmm12,%xmm3
-  DB  15,89,29,173,49,0,0                 ; mulps         0x31ad(%rip),%xmm3        # 6180 <_sk_callback_sse41+0xa65>
+  DB  15,89,29,60,52,0,0                  ; mulps         0x343c(%rip),%xmm3        # 6400 <_sk_callback_sse41+0xa60>
   DB  102,68,15,91,211                    ; cvtps2dq      %xmm3,%xmm10
   DB  243,15,16,88,20                     ; movss         0x14(%rax),%xmm3
   DB  15,198,219,0                        ; shufps        $0x0,%xmm3,%xmm3
@@ -16288,7 +16875,7 @@
   DB  102,65,15,56,20,217                 ; blendvps      %xmm0,%xmm9,%xmm3
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  15,95,216                           ; maxps         %xmm0,%xmm3
-  DB  15,93,29,152,49,0,0                 ; minps         0x3198(%rip),%xmm3        # 6190 <_sk_callback_sse41+0xa75>
+  DB  15,93,29,39,52,0,0                  ; minps         0x3427(%rip),%xmm3        # 6410 <_sk_callback_sse41+0xa70>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -16296,29 +16883,29 @@
 PUBLIC _sk_lab_to_xyz_sse41
 _sk_lab_to_xyz_sse41 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,89,5,148,49,0,0               ; mulps         0x3194(%rip),%xmm8        # 61a0 <_sk_callback_sse41+0xa85>
-  DB  68,15,40,13,156,49,0,0              ; movaps        0x319c(%rip),%xmm9        # 61b0 <_sk_callback_sse41+0xa95>
+  DB  68,15,89,5,35,52,0,0                ; mulps         0x3423(%rip),%xmm8        # 6420 <_sk_callback_sse41+0xa80>
+  DB  68,15,40,13,43,52,0,0               ; movaps        0x342b(%rip),%xmm9        # 6430 <_sk_callback_sse41+0xa90>
   DB  65,15,89,201                        ; mulps         %xmm9,%xmm1
-  DB  15,40,5,161,49,0,0                  ; movaps        0x31a1(%rip),%xmm0        # 61c0 <_sk_callback_sse41+0xaa5>
+  DB  15,40,5,48,52,0,0                   ; movaps        0x3430(%rip),%xmm0        # 6440 <_sk_callback_sse41+0xaa0>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
   DB  65,15,89,209                        ; mulps         %xmm9,%xmm2
   DB  15,88,208                           ; addps         %xmm0,%xmm2
-  DB  68,15,88,5,159,49,0,0               ; addps         0x319f(%rip),%xmm8        # 61d0 <_sk_callback_sse41+0xab5>
-  DB  68,15,89,5,167,49,0,0               ; mulps         0x31a7(%rip),%xmm8        # 61e0 <_sk_callback_sse41+0xac5>
-  DB  15,89,13,176,49,0,0                 ; mulps         0x31b0(%rip),%xmm1        # 61f0 <_sk_callback_sse41+0xad5>
+  DB  68,15,88,5,46,52,0,0                ; addps         0x342e(%rip),%xmm8        # 6450 <_sk_callback_sse41+0xab0>
+  DB  68,15,89,5,54,52,0,0                ; mulps         0x3436(%rip),%xmm8        # 6460 <_sk_callback_sse41+0xac0>
+  DB  15,89,13,63,52,0,0                  ; mulps         0x343f(%rip),%xmm1        # 6470 <_sk_callback_sse41+0xad0>
   DB  65,15,88,200                        ; addps         %xmm8,%xmm1
-  DB  15,89,21,181,49,0,0                 ; mulps         0x31b5(%rip),%xmm2        # 6200 <_sk_callback_sse41+0xae5>
+  DB  15,89,21,68,52,0,0                  ; mulps         0x3444(%rip),%xmm2        # 6480 <_sk_callback_sse41+0xae0>
   DB  69,15,40,208                        ; movaps        %xmm8,%xmm10
   DB  68,15,92,210                        ; subps         %xmm2,%xmm10
   DB  68,15,40,217                        ; movaps        %xmm1,%xmm11
   DB  69,15,89,219                        ; mulps         %xmm11,%xmm11
   DB  68,15,89,217                        ; mulps         %xmm1,%xmm11
-  DB  68,15,40,13,169,49,0,0              ; movaps        0x31a9(%rip),%xmm9        # 6210 <_sk_callback_sse41+0xaf5>
+  DB  68,15,40,13,56,52,0,0               ; movaps        0x3438(%rip),%xmm9        # 6490 <_sk_callback_sse41+0xaf0>
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  65,15,194,195,1                     ; cmpltps       %xmm11,%xmm0
-  DB  15,40,21,169,49,0,0                 ; movaps        0x31a9(%rip),%xmm2        # 6220 <_sk_callback_sse41+0xb05>
+  DB  15,40,21,56,52,0,0                  ; movaps        0x3438(%rip),%xmm2        # 64a0 <_sk_callback_sse41+0xb00>
   DB  15,88,202                           ; addps         %xmm2,%xmm1
-  DB  68,15,40,37,174,49,0,0              ; movaps        0x31ae(%rip),%xmm12        # 6230 <_sk_callback_sse41+0xb15>
+  DB  68,15,40,37,61,52,0,0               ; movaps        0x343d(%rip),%xmm12        # 64b0 <_sk_callback_sse41+0xb10>
   DB  65,15,89,204                        ; mulps         %xmm12,%xmm1
   DB  102,65,15,56,20,203                 ; blendvps      %xmm0,%xmm11,%xmm1
   DB  69,15,40,216                        ; movaps        %xmm8,%xmm11
@@ -16337,8 +16924,8 @@
   DB  65,15,89,212                        ; mulps         %xmm12,%xmm2
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  102,65,15,56,20,211                 ; blendvps      %xmm0,%xmm11,%xmm2
-  DB  15,89,13,103,49,0,0                 ; mulps         0x3167(%rip),%xmm1        # 6240 <_sk_callback_sse41+0xb25>
-  DB  15,89,21,112,49,0,0                 ; mulps         0x3170(%rip),%xmm2        # 6250 <_sk_callback_sse41+0xb35>
+  DB  15,89,13,246,51,0,0                 ; mulps         0x33f6(%rip),%xmm1        # 64c0 <_sk_callback_sse41+0xb20>
+  DB  15,89,21,255,51,0,0                 ; mulps         0x33ff(%rip),%xmm2        # 64d0 <_sk_callback_sse41+0xb30>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,40,193                           ; movaps        %xmm1,%xmm0
   DB  65,15,40,200                        ; movaps        %xmm8,%xmm1
@@ -16349,11 +16936,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,39                              ; jne           311c <_sk_load_a8_sse41+0x31>
+  DB  117,39                              ; jne           310d <_sk_load_a8_sse41+0x31>
   DB  102,65,15,56,49,4,18                ; pmovzxbd      (%r10,%rdx,1),%xmm0
-  DB  102,15,219,5,92,49,0,0              ; pand          0x315c(%rip),%xmm0        # 6260 <_sk_callback_sse41+0xb45>
+  DB  102,15,219,5,235,51,0,0             ; pand          0x33eb(%rip),%xmm0        # 64e0 <_sk_callback_sse41+0xb40>
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,98,49,0,0                  ; mulps         0x3162(%rip),%xmm3        # 6270 <_sk_callback_sse41+0xb55>
+  DB  15,89,29,241,51,0,0                 ; mulps         0x33f1(%rip),%xmm3        # 64f0 <_sk_callback_sse41+0xb50>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
@@ -16362,12 +16949,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            315e <_sk_load_a8_sse41+0x73>
+  DB  116,53                              ; je            314f <_sk_load_a8_sse41+0x73>
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3148 <_sk_load_a8_sse41+0x5d>
+  DB  116,21                              ; je            3139 <_sk_load_a8_sse41+0x5d>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,195                             ; jne           30fc <_sk_load_a8_sse41+0x11>
+  DB  117,195                             ; jne           30ed <_sk_load_a8_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,192,69                   ; pshufd        $0x45,%xmm0,%xmm0
@@ -16375,21 +16962,21 @@
   DB  102,15,110,200                      ; movd          %eax,%xmm1
   DB  102,15,56,49,201                    ; pmovzxbd      %xmm1,%xmm1
   DB  102,15,58,14,193,15                 ; pblendw       $0xf,%xmm1,%xmm0
-  DB  235,158                             ; jmp           30fc <_sk_load_a8_sse41+0x11>
+  DB  235,158                             ; jmp           30ed <_sk_load_a8_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
-  DB  235,147                             ; jmp           30fc <_sk_load_a8_sse41+0x11>
+  DB  235,147                             ; jmp           30ed <_sk_load_a8_sse41+0x11>
 
 PUBLIC _sk_load_a8_dst_sse41
 _sk_load_a8_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,39                              ; jne           319a <_sk_load_a8_dst_sse41+0x31>
+  DB  117,39                              ; jne           318b <_sk_load_a8_dst_sse41+0x31>
   DB  102,65,15,56,49,36,18               ; pmovzxbd      (%r10,%rdx,1),%xmm4
-  DB  102,15,219,37,254,48,0,0            ; pand          0x30fe(%rip),%xmm4        # 6280 <_sk_callback_sse41+0xb65>
+  DB  102,15,219,37,141,51,0,0            ; pand          0x338d(%rip),%xmm4        # 6500 <_sk_callback_sse41+0xb60>
   DB  15,91,252                           ; cvtdq2ps      %xmm4,%xmm7
-  DB  15,89,61,4,49,0,0                   ; mulps         0x3104(%rip),%xmm7        # 6290 <_sk_callback_sse41+0xb75>
+  DB  15,89,61,147,51,0,0                 ; mulps         0x3393(%rip),%xmm7        # 6510 <_sk_callback_sse41+0xb70>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
   DB  102,15,239,237                      ; pxor          %xmm5,%xmm5
@@ -16398,12 +16985,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            31dc <_sk_load_a8_dst_sse41+0x73>
+  DB  116,53                              ; je            31cd <_sk_load_a8_dst_sse41+0x73>
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            31c6 <_sk_load_a8_dst_sse41+0x5d>
+  DB  116,21                              ; je            31b7 <_sk_load_a8_dst_sse41+0x5d>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,195                             ; jne           317a <_sk_load_a8_dst_sse41+0x11>
+  DB  117,195                             ; jne           316b <_sk_load_a8_dst_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,228,69                   ; pshufd        $0x45,%xmm4,%xmm4
@@ -16411,10 +16998,10 @@
   DB  102,15,110,232                      ; movd          %eax,%xmm5
   DB  102,15,56,49,237                    ; pmovzxbd      %xmm5,%xmm5
   DB  102,15,58,14,229,15                 ; pblendw       $0xf,%xmm5,%xmm4
-  DB  235,158                             ; jmp           317a <_sk_load_a8_dst_sse41+0x11>
+  DB  235,158                             ; jmp           316b <_sk_load_a8_dst_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
-  DB  235,147                             ; jmp           317a <_sk_load_a8_dst_sse41+0x11>
+  DB  235,147                             ; jmp           316b <_sk_load_a8_dst_sse41+0x11>
 
 PUBLIC _sk_gather_a8_sse41
 _sk_gather_a8_sse41 LABEL PROC
@@ -16441,7 +17028,7 @@
   DB  102,15,58,32,192,3                  ; pinsrb        $0x3,%eax,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,73,48,0,0                  ; mulps         0x3049(%rip),%xmm3        # 62a0 <_sk_callback_sse41+0xb85>
+  DB  15,89,29,216,50,0,0                 ; mulps         0x32d8(%rip),%xmm3        # 6520 <_sk_callback_sse41+0xb80>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
@@ -16454,13 +17041,13 @@
   DB  72,131,236,4                        ; sub           $0x4,%rsp
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  68,15,40,5,56,48,0,0                ; movaps        0x3038(%rip),%xmm8        # 62b0 <_sk_callback_sse41+0xb95>
+  DB  68,15,40,5,199,50,0,0               ; movaps        0x32c7(%rip),%xmm8        # 6530 <_sk_callback_sse41+0xb90>
   DB  68,15,89,195                        ; mulps         %xmm3,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
   DB  102,69,15,56,43,192                 ; packusdw      %xmm8,%xmm8
   DB  102,69,15,103,192                   ; packuswb      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,17                              ; jne           32a2 <_sk_store_a8_sse41+0x3b>
+  DB  117,17                              ; jne           3293 <_sk_store_a8_sse41+0x3b>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  65,137,4,18                         ; mov           %eax,(%r10,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -16470,42 +17057,42 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,41                              ; je            32de <_sk_store_a8_sse41+0x77>
+  DB  116,41                              ; je            32cf <_sk_store_a8_sse41+0x77>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,15                              ; je            32ca <_sk_store_a8_sse41+0x63>
+  DB  116,15                              ; je            32bb <_sk_store_a8_sse41+0x63>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,217                             ; jne           329a <_sk_store_a8_sse41+0x33>
+  DB  117,217                             ; jne           328b <_sk_store_a8_sse41+0x33>
   DB  102,69,15,58,20,68,18,2,8           ; pextrb        $0x8,%xmm8,0x2(%r10,%rdx,1)
-  DB  102,68,15,56,0,5,236,47,0,0         ; pshufb        0x2fec(%rip),%xmm8        # 62c0 <_sk_callback_sse41+0xba5>
+  DB  102,68,15,56,0,5,123,50,0,0         ; pshufb        0x327b(%rip),%xmm8        # 6540 <_sk_callback_sse41+0xba0>
   DB  102,69,15,58,21,4,18,0              ; pextrw        $0x0,%xmm8,(%r10,%rdx,1)
-  DB  235,188                             ; jmp           329a <_sk_store_a8_sse41+0x33>
+  DB  235,188                             ; jmp           328b <_sk_store_a8_sse41+0x33>
   DB  102,69,15,58,20,4,18,0              ; pextrb        $0x0,%xmm8,(%r10,%rdx,1)
-  DB  235,178                             ; jmp           329a <_sk_store_a8_sse41+0x33>
+  DB  235,178                             ; jmp           328b <_sk_store_a8_sse41+0x33>
 
 PUBLIC _sk_load_g8_sse41
 _sk_load_g8_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,42                              ; jne           331c <_sk_load_g8_sse41+0x34>
+  DB  117,42                              ; jne           330d <_sk_load_g8_sse41+0x34>
   DB  102,65,15,56,49,4,18                ; pmovzxbd      (%r10,%rdx,1),%xmm0
-  DB  102,15,219,5,207,47,0,0             ; pand          0x2fcf(%rip),%xmm0        # 62d0 <_sk_callback_sse41+0xbb5>
+  DB  102,15,219,5,94,50,0,0              ; pand          0x325e(%rip),%xmm0        # 6550 <_sk_callback_sse41+0xbb0>
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,213,47,0,0                  ; mulps         0x2fd5(%rip),%xmm0        # 62e0 <_sk_callback_sse41+0xbc5>
+  DB  15,89,5,100,50,0,0                  ; mulps         0x3264(%rip),%xmm0        # 6560 <_sk_callback_sse41+0xbc0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,220,47,0,0                 ; movaps        0x2fdc(%rip),%xmm3        # 62f0 <_sk_callback_sse41+0xbd5>
+  DB  15,40,29,107,50,0,0                 ; movaps        0x326b(%rip),%xmm3        # 6570 <_sk_callback_sse41+0xbd0>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            335e <_sk_load_g8_sse41+0x76>
+  DB  116,53                              ; je            334f <_sk_load_g8_sse41+0x76>
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3348 <_sk_load_g8_sse41+0x60>
+  DB  116,21                              ; je            3339 <_sk_load_g8_sse41+0x60>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,192                             ; jne           32f9 <_sk_load_g8_sse41+0x11>
+  DB  117,192                             ; jne           32ea <_sk_load_g8_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,192,69                   ; pshufd        $0x45,%xmm0,%xmm0
@@ -16513,35 +17100,35 @@
   DB  102,15,110,200                      ; movd          %eax,%xmm1
   DB  102,15,56,49,201                    ; pmovzxbd      %xmm1,%xmm1
   DB  102,15,58,14,193,15                 ; pblendw       $0xf,%xmm1,%xmm0
-  DB  235,155                             ; jmp           32f9 <_sk_load_g8_sse41+0x11>
+  DB  235,155                             ; jmp           32ea <_sk_load_g8_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
-  DB  235,144                             ; jmp           32f9 <_sk_load_g8_sse41+0x11>
+  DB  235,144                             ; jmp           32ea <_sk_load_g8_sse41+0x11>
 
 PUBLIC _sk_load_g8_dst_sse41
 _sk_load_g8_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,42                              ; jne           339d <_sk_load_g8_dst_sse41+0x34>
+  DB  117,42                              ; jne           338e <_sk_load_g8_dst_sse41+0x34>
   DB  102,65,15,56,49,36,18               ; pmovzxbd      (%r10,%rdx,1),%xmm4
-  DB  102,15,219,37,126,47,0,0            ; pand          0x2f7e(%rip),%xmm4        # 6300 <_sk_callback_sse41+0xbe5>
+  DB  102,15,219,37,13,50,0,0             ; pand          0x320d(%rip),%xmm4        # 6580 <_sk_callback_sse41+0xbe0>
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,132,47,0,0                 ; mulps         0x2f84(%rip),%xmm4        # 6310 <_sk_callback_sse41+0xbf5>
+  DB  15,89,37,19,50,0,0                  ; mulps         0x3213(%rip),%xmm4        # 6590 <_sk_callback_sse41+0xbf0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,61,139,47,0,0                 ; movaps        0x2f8b(%rip),%xmm7        # 6320 <_sk_callback_sse41+0xc05>
+  DB  15,40,61,26,50,0,0                  ; movaps        0x321a(%rip),%xmm7        # 65a0 <_sk_callback_sse41+0xc00>
   DB  15,40,236                           ; movaps        %xmm4,%xmm5
   DB  15,40,244                           ; movaps        %xmm4,%xmm6
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            33df <_sk_load_g8_dst_sse41+0x76>
+  DB  116,53                              ; je            33d0 <_sk_load_g8_dst_sse41+0x76>
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            33c9 <_sk_load_g8_dst_sse41+0x60>
+  DB  116,21                              ; je            33ba <_sk_load_g8_dst_sse41+0x60>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,192                             ; jne           337a <_sk_load_g8_dst_sse41+0x11>
+  DB  117,192                             ; jne           336b <_sk_load_g8_dst_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,228,69                   ; pshufd        $0x45,%xmm4,%xmm4
@@ -16549,10 +17136,10 @@
   DB  102,15,110,232                      ; movd          %eax,%xmm5
   DB  102,15,56,49,237                    ; pmovzxbd      %xmm5,%xmm5
   DB  102,15,58,14,229,15                 ; pblendw       $0xf,%xmm5,%xmm4
-  DB  235,155                             ; jmp           337a <_sk_load_g8_dst_sse41+0x11>
+  DB  235,155                             ; jmp           336b <_sk_load_g8_dst_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
-  DB  235,144                             ; jmp           337a <_sk_load_g8_dst_sse41+0x11>
+  DB  235,144                             ; jmp           336b <_sk_load_g8_dst_sse41+0x11>
 
 PUBLIC _sk_gather_g8_sse41
 _sk_gather_g8_sse41 LABEL PROC
@@ -16579,9 +17166,9 @@
   DB  102,15,58,32,192,3                  ; pinsrb        $0x3,%eax,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,214,46,0,0                  ; mulps         0x2ed6(%rip),%xmm0        # 6330 <_sk_callback_sse41+0xc15>
+  DB  15,89,5,101,49,0,0                  ; mulps         0x3165(%rip),%xmm0        # 65b0 <_sk_callback_sse41+0xc10>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,221,46,0,0                 ; movaps        0x2edd(%rip),%xmm3        # 6340 <_sk_callback_sse41+0xc25>
+  DB  15,40,29,108,49,0,0                 ; movaps        0x316c(%rip),%xmm3        # 65c0 <_sk_callback_sse41+0xc20>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  91                                  ; pop           %rbx
@@ -16592,9 +17179,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,193                          ; mov           %rax,%r9
   DB  77,133,201                          ; test          %r9,%r9
-  DB  116,5                               ; je            347b <_sk_gather_i8_sse41+0xf>
+  DB  116,5                               ; je            346c <_sk_gather_i8_sse41+0xf>
   DB  76,137,200                          ; mov           %r9,%rax
-  DB  235,2                               ; jmp           347d <_sk_gather_i8_sse41+0x11>
+  DB  235,2                               ; jmp           346e <_sk_gather_i8_sse41+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
@@ -16627,17 +17214,17 @@
   DB  102,15,58,34,28,24,1                ; pinsrd        $0x1,(%rax,%rbx,1),%xmm3
   DB  102,66,15,58,34,28,152,2            ; pinsrd        $0x2,(%rax,%r11,4),%xmm3
   DB  102,66,15,58,34,28,16,3             ; pinsrd        $0x3,(%rax,%r10,1),%xmm3
-  DB  102,15,111,5,48,46,0,0              ; movdqa        0x2e30(%rip),%xmm0        # 6350 <_sk_callback_sse41+0xc35>
+  DB  102,15,111,5,191,48,0,0             ; movdqa        0x30bf(%rip),%xmm0        # 65d0 <_sk_callback_sse41+0xc30>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,49,46,0,0                ; movaps        0x2e31(%rip),%xmm8        # 6360 <_sk_callback_sse41+0xc45>
+  DB  68,15,40,5,192,48,0,0               ; movaps        0x30c0(%rip),%xmm8        # 65e0 <_sk_callback_sse41+0xc40>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
-  DB  102,15,56,0,13,48,46,0,0            ; pshufb        0x2e30(%rip),%xmm1        # 6370 <_sk_callback_sse41+0xc55>
+  DB  102,15,56,0,13,191,48,0,0           ; pshufb        0x30bf(%rip),%xmm1        # 65f0 <_sk_callback_sse41+0xc50>
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,111,211                      ; movdqa        %xmm3,%xmm2
-  DB  102,15,56,0,21,44,46,0,0            ; pshufb        0x2e2c(%rip),%xmm2        # 6380 <_sk_callback_sse41+0xc65>
+  DB  102,15,56,0,21,187,48,0,0           ; pshufb        0x30bb(%rip),%xmm2        # 6600 <_sk_callback_sse41+0xc60>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -16653,82 +17240,82 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,80                              ; jne           35c8 <_sk_load_565_sse41+0x5a>
+  DB  117,80                              ; jne           35b9 <_sk_load_565_sse41+0x5a>
   DB  102,65,15,56,51,20,82               ; pmovzxwd      (%r10,%rdx,2),%xmm2
-  DB  102,15,111,5,9,46,0,0               ; movdqa        0x2e09(%rip),%xmm0        # 6390 <_sk_callback_sse41+0xc75>
+  DB  102,15,111,5,152,48,0,0             ; movdqa        0x3098(%rip),%xmm0        # 6610 <_sk_callback_sse41+0xc70>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,11,46,0,0                   ; mulps         0x2e0b(%rip),%xmm0        # 63a0 <_sk_callback_sse41+0xc85>
-  DB  102,15,111,13,19,46,0,0             ; movdqa        0x2e13(%rip),%xmm1        # 63b0 <_sk_callback_sse41+0xc95>
+  DB  15,89,5,154,48,0,0                  ; mulps         0x309a(%rip),%xmm0        # 6620 <_sk_callback_sse41+0xc80>
+  DB  102,15,111,13,162,48,0,0            ; movdqa        0x30a2(%rip),%xmm1        # 6630 <_sk_callback_sse41+0xc90>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,21,46,0,0                  ; mulps         0x2e15(%rip),%xmm1        # 63c0 <_sk_callback_sse41+0xca5>
-  DB  102,15,219,21,29,46,0,0             ; pand          0x2e1d(%rip),%xmm2        # 63d0 <_sk_callback_sse41+0xcb5>
+  DB  15,89,13,164,48,0,0                 ; mulps         0x30a4(%rip),%xmm1        # 6640 <_sk_callback_sse41+0xca0>
+  DB  102,15,219,21,172,48,0,0            ; pand          0x30ac(%rip),%xmm2        # 6650 <_sk_callback_sse41+0xcb0>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,35,46,0,0                  ; mulps         0x2e23(%rip),%xmm2        # 63e0 <_sk_callback_sse41+0xcc5>
+  DB  15,89,21,178,48,0,0                 ; mulps         0x30b2(%rip),%xmm2        # 6660 <_sk_callback_sse41+0xcc0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,42,46,0,0                  ; movaps        0x2e2a(%rip),%xmm3        # 63f0 <_sk_callback_sse41+0xcd5>
+  DB  15,40,29,185,48,0,0                 ; movaps        0x30b9(%rip),%xmm3        # 6670 <_sk_callback_sse41+0xcd0>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            360a <_sk_load_565_sse41+0x9c>
+  DB  116,53                              ; je            35fb <_sk_load_565_sse41+0x9c>
   DB  102,15,239,210                      ; pxor          %xmm2,%xmm2
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            35f4 <_sk_load_565_sse41+0x86>
+  DB  116,21                              ; je            35e5 <_sk_load_565_sse41+0x86>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,154                             ; jne           357f <_sk_load_565_sse41+0x11>
+  DB  117,154                             ; jne           3570 <_sk_load_565_sse41+0x11>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,208,69                   ; pshufd        $0x45,%xmm0,%xmm2
   DB  102,65,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
   DB  102,15,58,14,208,15                 ; pblendw       $0xf,%xmm0,%xmm2
-  DB  233,117,255,255,255                 ; jmpq          357f <_sk_load_565_sse41+0x11>
+  DB  233,117,255,255,255                 ; jmpq          3570 <_sk_load_565_sse41+0x11>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,208                      ; movd          %eax,%xmm2
-  DB  233,103,255,255,255                 ; jmpq          357f <_sk_load_565_sse41+0x11>
+  DB  233,103,255,255,255                 ; jmpq          3570 <_sk_load_565_sse41+0x11>
 
 PUBLIC _sk_load_565_dst_sse41
 _sk_load_565_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,80                              ; jne           3672 <_sk_load_565_dst_sse41+0x5a>
+  DB  117,80                              ; jne           3663 <_sk_load_565_dst_sse41+0x5a>
   DB  102,65,15,56,51,52,82               ; pmovzxwd      (%r10,%rdx,2),%xmm6
-  DB  102,15,111,37,207,45,0,0            ; movdqa        0x2dcf(%rip),%xmm4        # 6400 <_sk_callback_sse41+0xce5>
+  DB  102,15,111,37,94,48,0,0             ; movdqa        0x305e(%rip),%xmm4        # 6680 <_sk_callback_sse41+0xce0>
   DB  102,15,219,230                      ; pand          %xmm6,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,209,45,0,0                 ; mulps         0x2dd1(%rip),%xmm4        # 6410 <_sk_callback_sse41+0xcf5>
-  DB  102,15,111,45,217,45,0,0            ; movdqa        0x2dd9(%rip),%xmm5        # 6420 <_sk_callback_sse41+0xd05>
+  DB  15,89,37,96,48,0,0                  ; mulps         0x3060(%rip),%xmm4        # 6690 <_sk_callback_sse41+0xcf0>
+  DB  102,15,111,45,104,48,0,0            ; movdqa        0x3068(%rip),%xmm5        # 66a0 <_sk_callback_sse41+0xd00>
   DB  102,15,219,238                      ; pand          %xmm6,%xmm5
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
-  DB  15,89,45,219,45,0,0                 ; mulps         0x2ddb(%rip),%xmm5        # 6430 <_sk_callback_sse41+0xd15>
-  DB  102,15,219,53,227,45,0,0            ; pand          0x2de3(%rip),%xmm6        # 6440 <_sk_callback_sse41+0xd25>
+  DB  15,89,45,106,48,0,0                 ; mulps         0x306a(%rip),%xmm5        # 66b0 <_sk_callback_sse41+0xd10>
+  DB  102,15,219,53,114,48,0,0            ; pand          0x3072(%rip),%xmm6        # 66c0 <_sk_callback_sse41+0xd20>
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
-  DB  15,89,53,233,45,0,0                 ; mulps         0x2de9(%rip),%xmm6        # 6450 <_sk_callback_sse41+0xd35>
+  DB  15,89,53,120,48,0,0                 ; mulps         0x3078(%rip),%xmm6        # 66d0 <_sk_callback_sse41+0xd30>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,61,240,45,0,0                 ; movaps        0x2df0(%rip),%xmm7        # 6460 <_sk_callback_sse41+0xd45>
+  DB  15,40,61,127,48,0,0                 ; movaps        0x307f(%rip),%xmm7        # 66e0 <_sk_callback_sse41+0xd40>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            36b4 <_sk_load_565_dst_sse41+0x9c>
+  DB  116,53                              ; je            36a5 <_sk_load_565_dst_sse41+0x9c>
   DB  102,15,239,246                      ; pxor          %xmm6,%xmm6
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            369e <_sk_load_565_dst_sse41+0x86>
+  DB  116,21                              ; je            368f <_sk_load_565_dst_sse41+0x86>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,154                             ; jne           3629 <_sk_load_565_dst_sse41+0x11>
+  DB  117,154                             ; jne           361a <_sk_load_565_dst_sse41+0x11>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,244,69                   ; pshufd        $0x45,%xmm4,%xmm6
   DB  102,65,15,110,36,82                 ; movd          (%r10,%rdx,2),%xmm4
   DB  102,15,56,51,228                    ; pmovzxwd      %xmm4,%xmm4
   DB  102,15,58,14,244,15                 ; pblendw       $0xf,%xmm4,%xmm6
-  DB  233,117,255,255,255                 ; jmpq          3629 <_sk_load_565_dst_sse41+0x11>
+  DB  233,117,255,255,255                 ; jmpq          361a <_sk_load_565_dst_sse41+0x11>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,240                      ; movd          %eax,%xmm6
-  DB  233,103,255,255,255                 ; jmpq          3629 <_sk_load_565_dst_sse41+0x11>
+  DB  233,103,255,255,255                 ; jmpq          361a <_sk_load_565_dst_sse41+0x11>
 
 PUBLIC _sk_gather_565_sse41
 _sk_gather_565_sse41 LABEL PROC
@@ -16754,19 +17341,19 @@
   DB  65,15,183,4,65                      ; movzwl        (%r9,%rax,2),%eax
   DB  102,15,196,192,3                    ; pinsrw        $0x3,%eax,%xmm0
   DB  102,15,56,51,208                    ; pmovzxwd      %xmm0,%xmm2
-  DB  102,15,111,5,68,45,0,0              ; movdqa        0x2d44(%rip),%xmm0        # 6470 <_sk_callback_sse41+0xd55>
+  DB  102,15,111,5,211,47,0,0             ; movdqa        0x2fd3(%rip),%xmm0        # 66f0 <_sk_callback_sse41+0xd50>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,70,45,0,0                   ; mulps         0x2d46(%rip),%xmm0        # 6480 <_sk_callback_sse41+0xd65>
-  DB  102,15,111,13,78,45,0,0             ; movdqa        0x2d4e(%rip),%xmm1        # 6490 <_sk_callback_sse41+0xd75>
+  DB  15,89,5,213,47,0,0                  ; mulps         0x2fd5(%rip),%xmm0        # 6700 <_sk_callback_sse41+0xd60>
+  DB  102,15,111,13,221,47,0,0            ; movdqa        0x2fdd(%rip),%xmm1        # 6710 <_sk_callback_sse41+0xd70>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,80,45,0,0                  ; mulps         0x2d50(%rip),%xmm1        # 64a0 <_sk_callback_sse41+0xd85>
-  DB  102,15,219,21,88,45,0,0             ; pand          0x2d58(%rip),%xmm2        # 64b0 <_sk_callback_sse41+0xd95>
+  DB  15,89,13,223,47,0,0                 ; mulps         0x2fdf(%rip),%xmm1        # 6720 <_sk_callback_sse41+0xd80>
+  DB  102,15,219,21,231,47,0,0            ; pand          0x2fe7(%rip),%xmm2        # 6730 <_sk_callback_sse41+0xd90>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,94,45,0,0                  ; mulps         0x2d5e(%rip),%xmm2        # 64c0 <_sk_callback_sse41+0xda5>
+  DB  15,89,21,237,47,0,0                 ; mulps         0x2fed(%rip),%xmm2        # 6740 <_sk_callback_sse41+0xda0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,101,45,0,0                 ; movaps        0x2d65(%rip),%xmm3        # 64d0 <_sk_callback_sse41+0xdb5>
+  DB  15,40,29,244,47,0,0                 ; movaps        0x2ff4(%rip),%xmm3        # 6750 <_sk_callback_sse41+0xdb0>
   DB  91                                  ; pop           %rbx
   DB  255,224                             ; jmpq          *%rax
 
@@ -16774,12 +17361,12 @@
 _sk_store_565_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,101,45,0,0               ; movaps        0x2d65(%rip),%xmm8        # 64e0 <_sk_callback_sse41+0xdc5>
+  DB  68,15,40,5,244,47,0,0               ; movaps        0x2ff4(%rip),%xmm8        # 6760 <_sk_callback_sse41+0xdc0>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
   DB  102,65,15,114,241,11                ; pslld         $0xb,%xmm9
-  DB  68,15,40,21,90,45,0,0               ; movaps        0x2d5a(%rip),%xmm10        # 64f0 <_sk_callback_sse41+0xdd5>
+  DB  68,15,40,21,233,47,0,0              ; movaps        0x2fe9(%rip),%xmm10        # 6770 <_sk_callback_sse41+0xdd0>
   DB  68,15,89,209                        ; mulps         %xmm1,%xmm10
   DB  102,69,15,91,210                    ; cvtps2dq      %xmm10,%xmm10
   DB  102,65,15,114,242,5                 ; pslld         $0x5,%xmm10
@@ -16789,7 +17376,7 @@
   DB  102,69,15,86,194                    ; orpd          %xmm10,%xmm8
   DB  102,69,15,56,43,192                 ; packusdw      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           37cd <_sk_store_565_sse41+0x5f>
+  DB  117,10                              ; jne           37be <_sk_store_565_sse41+0x5f>
   DB  242,68,15,17,4,80                   ; movsd         %xmm8,(%rax,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -16797,105 +17384,105 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,35                              ; je            3803 <_sk_store_565_sse41+0x95>
+  DB  116,35                              ; je            37f4 <_sk_store_565_sse41+0x95>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,15                              ; je            37f5 <_sk_store_565_sse41+0x87>
+  DB  116,15                              ; je            37e6 <_sk_store_565_sse41+0x87>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,221                             ; jne           37c9 <_sk_store_565_sse41+0x5b>
+  DB  117,221                             ; jne           37ba <_sk_store_565_sse41+0x5b>
   DB  102,68,15,58,21,68,80,4,4           ; pextrw        $0x4,%xmm8,0x4(%rax,%rdx,2)
   DB  242,69,15,112,192,232               ; pshuflw       $0xe8,%xmm8,%xmm8
   DB  102,68,15,126,4,80                  ; movd          %xmm8,(%rax,%rdx,2)
-  DB  235,198                             ; jmp           37c9 <_sk_store_565_sse41+0x5b>
+  DB  235,198                             ; jmp           37ba <_sk_store_565_sse41+0x5b>
   DB  102,68,15,58,21,4,80,0              ; pextrw        $0x0,%xmm8,(%rax,%rdx,2)
-  DB  235,188                             ; jmp           37c9 <_sk_store_565_sse41+0x5b>
+  DB  235,188                             ; jmp           37ba <_sk_store_565_sse41+0x5b>
 
 PUBLIC _sk_load_4444_sse41
 _sk_load_4444_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,95                              ; jne           3876 <_sk_load_4444_sse41+0x69>
+  DB  117,95                              ; jne           3867 <_sk_load_4444_sse41+0x69>
   DB  102,65,15,56,51,28,82               ; pmovzxwd      (%r10,%rdx,2),%xmm3
-  DB  102,15,111,5,218,44,0,0             ; movdqa        0x2cda(%rip),%xmm0        # 6500 <_sk_callback_sse41+0xde5>
+  DB  102,15,111,5,105,47,0,0             ; movdqa        0x2f69(%rip),%xmm0        # 6780 <_sk_callback_sse41+0xde0>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,220,44,0,0                  ; mulps         0x2cdc(%rip),%xmm0        # 6510 <_sk_callback_sse41+0xdf5>
-  DB  102,15,111,13,228,44,0,0            ; movdqa        0x2ce4(%rip),%xmm1        # 6520 <_sk_callback_sse41+0xe05>
+  DB  15,89,5,107,47,0,0                  ; mulps         0x2f6b(%rip),%xmm0        # 6790 <_sk_callback_sse41+0xdf0>
+  DB  102,15,111,13,115,47,0,0            ; movdqa        0x2f73(%rip),%xmm1        # 67a0 <_sk_callback_sse41+0xe00>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,230,44,0,0                 ; mulps         0x2ce6(%rip),%xmm1        # 6530 <_sk_callback_sse41+0xe15>
-  DB  102,15,111,21,238,44,0,0            ; movdqa        0x2cee(%rip),%xmm2        # 6540 <_sk_callback_sse41+0xe25>
+  DB  15,89,13,117,47,0,0                 ; mulps         0x2f75(%rip),%xmm1        # 67b0 <_sk_callback_sse41+0xe10>
+  DB  102,15,111,21,125,47,0,0            ; movdqa        0x2f7d(%rip),%xmm2        # 67c0 <_sk_callback_sse41+0xe20>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,240,44,0,0                 ; mulps         0x2cf0(%rip),%xmm2        # 6550 <_sk_callback_sse41+0xe35>
-  DB  102,15,219,29,248,44,0,0            ; pand          0x2cf8(%rip),%xmm3        # 6560 <_sk_callback_sse41+0xe45>
+  DB  15,89,21,127,47,0,0                 ; mulps         0x2f7f(%rip),%xmm2        # 67d0 <_sk_callback_sse41+0xe30>
+  DB  102,15,219,29,135,47,0,0            ; pand          0x2f87(%rip),%xmm3        # 67e0 <_sk_callback_sse41+0xe40>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,254,44,0,0                 ; mulps         0x2cfe(%rip),%xmm3        # 6570 <_sk_callback_sse41+0xe55>
+  DB  15,89,29,141,47,0,0                 ; mulps         0x2f8d(%rip),%xmm3        # 67f0 <_sk_callback_sse41+0xe50>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            38b8 <_sk_load_4444_sse41+0xab>
+  DB  116,53                              ; je            38a9 <_sk_load_4444_sse41+0xab>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            38a2 <_sk_load_4444_sse41+0x95>
+  DB  116,21                              ; je            3893 <_sk_load_4444_sse41+0x95>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,139                             ; jne           381e <_sk_load_4444_sse41+0x11>
+  DB  117,139                             ; jne           380f <_sk_load_4444_sse41+0x11>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
   DB  102,65,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
   DB  102,15,58,14,216,15                 ; pblendw       $0xf,%xmm0,%xmm3
-  DB  233,102,255,255,255                 ; jmpq          381e <_sk_load_4444_sse41+0x11>
+  DB  233,102,255,255,255                 ; jmpq          380f <_sk_load_4444_sse41+0x11>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,216                      ; movd          %eax,%xmm3
-  DB  233,88,255,255,255                  ; jmpq          381e <_sk_load_4444_sse41+0x11>
+  DB  233,88,255,255,255                  ; jmpq          380f <_sk_load_4444_sse41+0x11>
 
 PUBLIC _sk_load_4444_dst_sse41
 _sk_load_4444_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,95                              ; jne           392f <_sk_load_4444_dst_sse41+0x69>
+  DB  117,95                              ; jne           3920 <_sk_load_4444_dst_sse41+0x69>
   DB  102,65,15,56,51,60,82               ; pmovzxwd      (%r10,%rdx,2),%xmm7
-  DB  102,15,111,37,161,44,0,0            ; movdqa        0x2ca1(%rip),%xmm4        # 6580 <_sk_callback_sse41+0xe65>
+  DB  102,15,111,37,48,47,0,0             ; movdqa        0x2f30(%rip),%xmm4        # 6800 <_sk_callback_sse41+0xe60>
   DB  102,15,219,231                      ; pand          %xmm7,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,163,44,0,0                 ; mulps         0x2ca3(%rip),%xmm4        # 6590 <_sk_callback_sse41+0xe75>
-  DB  102,15,111,45,171,44,0,0            ; movdqa        0x2cab(%rip),%xmm5        # 65a0 <_sk_callback_sse41+0xe85>
+  DB  15,89,37,50,47,0,0                  ; mulps         0x2f32(%rip),%xmm4        # 6810 <_sk_callback_sse41+0xe70>
+  DB  102,15,111,45,58,47,0,0             ; movdqa        0x2f3a(%rip),%xmm5        # 6820 <_sk_callback_sse41+0xe80>
   DB  102,15,219,239                      ; pand          %xmm7,%xmm5
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
-  DB  15,89,45,173,44,0,0                 ; mulps         0x2cad(%rip),%xmm5        # 65b0 <_sk_callback_sse41+0xe95>
-  DB  102,15,111,53,181,44,0,0            ; movdqa        0x2cb5(%rip),%xmm6        # 65c0 <_sk_callback_sse41+0xea5>
+  DB  15,89,45,60,47,0,0                  ; mulps         0x2f3c(%rip),%xmm5        # 6830 <_sk_callback_sse41+0xe90>
+  DB  102,15,111,53,68,47,0,0             ; movdqa        0x2f44(%rip),%xmm6        # 6840 <_sk_callback_sse41+0xea0>
   DB  102,15,219,247                      ; pand          %xmm7,%xmm6
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
-  DB  15,89,53,183,44,0,0                 ; mulps         0x2cb7(%rip),%xmm6        # 65d0 <_sk_callback_sse41+0xeb5>
-  DB  102,15,219,61,191,44,0,0            ; pand          0x2cbf(%rip),%xmm7        # 65e0 <_sk_callback_sse41+0xec5>
+  DB  15,89,53,70,47,0,0                  ; mulps         0x2f46(%rip),%xmm6        # 6850 <_sk_callback_sse41+0xeb0>
+  DB  102,15,219,61,78,47,0,0             ; pand          0x2f4e(%rip),%xmm7        # 6860 <_sk_callback_sse41+0xec0>
   DB  15,91,255                           ; cvtdq2ps      %xmm7,%xmm7
-  DB  15,89,61,197,44,0,0                 ; mulps         0x2cc5(%rip),%xmm7        # 65f0 <_sk_callback_sse41+0xed5>
+  DB  15,89,61,84,47,0,0                  ; mulps         0x2f54(%rip),%xmm7        # 6870 <_sk_callback_sse41+0xed0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            3971 <_sk_load_4444_dst_sse41+0xab>
+  DB  116,53                              ; je            3962 <_sk_load_4444_dst_sse41+0xab>
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            395b <_sk_load_4444_dst_sse41+0x95>
+  DB  116,21                              ; je            394c <_sk_load_4444_dst_sse41+0x95>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,139                             ; jne           38d7 <_sk_load_4444_dst_sse41+0x11>
+  DB  117,139                             ; jne           38c8 <_sk_load_4444_dst_sse41+0x11>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  102,65,15,110,36,82                 ; movd          (%r10,%rdx,2),%xmm4
   DB  102,15,56,51,228                    ; pmovzxwd      %xmm4,%xmm4
   DB  102,15,58,14,252,15                 ; pblendw       $0xf,%xmm4,%xmm7
-  DB  233,102,255,255,255                 ; jmpq          38d7 <_sk_load_4444_dst_sse41+0x11>
+  DB  233,102,255,255,255                 ; jmpq          38c8 <_sk_load_4444_dst_sse41+0x11>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,248                      ; movd          %eax,%xmm7
-  DB  233,88,255,255,255                  ; jmpq          38d7 <_sk_load_4444_dst_sse41+0x11>
+  DB  233,88,255,255,255                  ; jmpq          38c8 <_sk_load_4444_dst_sse41+0x11>
 
 PUBLIC _sk_gather_4444_sse41
 _sk_gather_4444_sse41 LABEL PROC
@@ -16921,21 +17508,21 @@
   DB  65,15,183,4,65                      ; movzwl        (%r9,%rax,2),%eax
   DB  102,15,196,192,3                    ; pinsrw        $0x3,%eax,%xmm0
   DB  102,15,56,51,216                    ; pmovzxwd      %xmm0,%xmm3
-  DB  102,15,111,5,23,44,0,0              ; movdqa        0x2c17(%rip),%xmm0        # 6600 <_sk_callback_sse41+0xee5>
+  DB  102,15,111,5,166,46,0,0             ; movdqa        0x2ea6(%rip),%xmm0        # 6880 <_sk_callback_sse41+0xee0>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,25,44,0,0                   ; mulps         0x2c19(%rip),%xmm0        # 6610 <_sk_callback_sse41+0xef5>
-  DB  102,15,111,13,33,44,0,0             ; movdqa        0x2c21(%rip),%xmm1        # 6620 <_sk_callback_sse41+0xf05>
+  DB  15,89,5,168,46,0,0                  ; mulps         0x2ea8(%rip),%xmm0        # 6890 <_sk_callback_sse41+0xef0>
+  DB  102,15,111,13,176,46,0,0            ; movdqa        0x2eb0(%rip),%xmm1        # 68a0 <_sk_callback_sse41+0xf00>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,35,44,0,0                  ; mulps         0x2c23(%rip),%xmm1        # 6630 <_sk_callback_sse41+0xf15>
-  DB  102,15,111,21,43,44,0,0             ; movdqa        0x2c2b(%rip),%xmm2        # 6640 <_sk_callback_sse41+0xf25>
+  DB  15,89,13,178,46,0,0                 ; mulps         0x2eb2(%rip),%xmm1        # 68b0 <_sk_callback_sse41+0xf10>
+  DB  102,15,111,21,186,46,0,0            ; movdqa        0x2eba(%rip),%xmm2        # 68c0 <_sk_callback_sse41+0xf20>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,45,44,0,0                  ; mulps         0x2c2d(%rip),%xmm2        # 6650 <_sk_callback_sse41+0xf35>
-  DB  102,15,219,29,53,44,0,0             ; pand          0x2c35(%rip),%xmm3        # 6660 <_sk_callback_sse41+0xf45>
+  DB  15,89,21,188,46,0,0                 ; mulps         0x2ebc(%rip),%xmm2        # 68d0 <_sk_callback_sse41+0xf30>
+  DB  102,15,219,29,196,46,0,0            ; pand          0x2ec4(%rip),%xmm3        # 68e0 <_sk_callback_sse41+0xf40>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,59,44,0,0                  ; mulps         0x2c3b(%rip),%xmm3        # 6670 <_sk_callback_sse41+0xf55>
+  DB  15,89,29,202,46,0,0                 ; mulps         0x2eca(%rip),%xmm3        # 68f0 <_sk_callback_sse41+0xf50>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  255,224                             ; jmpq          *%rax
@@ -16944,7 +17531,7 @@
 _sk_store_4444_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,57,44,0,0                ; movaps        0x2c39(%rip),%xmm8        # 6680 <_sk_callback_sse41+0xf65>
+  DB  68,15,40,5,200,46,0,0               ; movaps        0x2ec8(%rip),%xmm8        # 6900 <_sk_callback_sse41+0xf60>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -16964,7 +17551,7 @@
   DB  102,69,15,86,194                    ; orpd          %xmm10,%xmm8
   DB  102,69,15,56,43,192                 ; packusdw      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3aad <_sk_store_4444_sse41+0x73>
+  DB  117,10                              ; jne           3a9e <_sk_store_4444_sse41+0x73>
   DB  242,68,15,17,4,80                   ; movsd         %xmm8,(%rax,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -16972,36 +17559,36 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,35                              ; je            3ae3 <_sk_store_4444_sse41+0xa9>
+  DB  116,35                              ; je            3ad4 <_sk_store_4444_sse41+0xa9>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,15                              ; je            3ad5 <_sk_store_4444_sse41+0x9b>
+  DB  116,15                              ; je            3ac6 <_sk_store_4444_sse41+0x9b>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,221                             ; jne           3aa9 <_sk_store_4444_sse41+0x6f>
+  DB  117,221                             ; jne           3a9a <_sk_store_4444_sse41+0x6f>
   DB  102,68,15,58,21,68,80,4,4           ; pextrw        $0x4,%xmm8,0x4(%rax,%rdx,2)
   DB  242,69,15,112,192,232               ; pshuflw       $0xe8,%xmm8,%xmm8
   DB  102,68,15,126,4,80                  ; movd          %xmm8,(%rax,%rdx,2)
-  DB  235,198                             ; jmp           3aa9 <_sk_store_4444_sse41+0x6f>
+  DB  235,198                             ; jmp           3a9a <_sk_store_4444_sse41+0x6f>
   DB  102,68,15,58,21,4,80,0              ; pextrw        $0x0,%xmm8,(%rax,%rdx,2)
-  DB  235,188                             ; jmp           3aa9 <_sk_store_4444_sse41+0x6f>
+  DB  235,188                             ; jmp           3a9a <_sk_store_4444_sse41+0x6f>
 
 PUBLIC _sk_load_8888_sse41
 _sk_load_8888_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3b4f <_sk_load_8888_sse41+0x62>
+  DB  117,88                              ; jne           3b40 <_sk_load_8888_sse41+0x62>
   DB  243,15,111,28,144                   ; movdqu        (%rax,%rdx,4),%xmm3
-  DB  102,15,111,5,140,43,0,0             ; movdqa        0x2b8c(%rip),%xmm0        # 6690 <_sk_callback_sse41+0xf75>
+  DB  102,15,111,5,27,46,0,0              ; movdqa        0x2e1b(%rip),%xmm0        # 6910 <_sk_callback_sse41+0xf70>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,141,43,0,0               ; movaps        0x2b8d(%rip),%xmm8        # 66a0 <_sk_callback_sse41+0xf85>
+  DB  68,15,40,5,28,46,0,0                ; movaps        0x2e1c(%rip),%xmm8        # 6920 <_sk_callback_sse41+0xf80>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
-  DB  102,15,56,0,13,140,43,0,0           ; pshufb        0x2b8c(%rip),%xmm1        # 66b0 <_sk_callback_sse41+0xf95>
+  DB  102,15,56,0,13,27,46,0,0            ; pshufb        0x2e1b(%rip),%xmm1        # 6930 <_sk_callback_sse41+0xf90>
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,111,211                      ; movdqa        %xmm3,%xmm2
-  DB  102,15,56,0,21,136,43,0,0           ; pshufb        0x2b88(%rip),%xmm2        # 66c0 <_sk_callback_sse41+0xfa5>
+  DB  102,15,56,0,21,23,46,0,0            ; pshufb        0x2e17(%rip),%xmm2        # 6940 <_sk_callback_sse41+0xfa0>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -17012,38 +17599,38 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,43                              ; je            3b87 <_sk_load_8888_sse41+0x9a>
+  DB  116,43                              ; je            3b78 <_sk_load_8888_sse41+0x9a>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,17                              ; je            3b77 <_sk_load_8888_sse41+0x8a>
+  DB  116,17                              ; je            3b68 <_sk_load_8888_sse41+0x8a>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,144                             ; jne           3afc <_sk_load_8888_sse41+0xf>
+  DB  117,144                             ; jne           3aed <_sk_load_8888_sse41+0xf>
   DB  102,15,110,68,144,8                 ; movd          0x8(%rax,%rdx,4),%xmm0
   DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
   DB  243,15,126,4,144                    ; movq          (%rax,%rdx,4),%xmm0
   DB  102,15,58,14,216,15                 ; pblendw       $0xf,%xmm0,%xmm3
-  DB  233,117,255,255,255                 ; jmpq          3afc <_sk_load_8888_sse41+0xf>
+  DB  233,117,255,255,255                 ; jmpq          3aed <_sk_load_8888_sse41+0xf>
   DB  102,15,110,28,144                   ; movd          (%rax,%rdx,4),%xmm3
-  DB  233,107,255,255,255                 ; jmpq          3afc <_sk_load_8888_sse41+0xf>
+  DB  233,107,255,255,255                 ; jmpq          3aed <_sk_load_8888_sse41+0xf>
 
 PUBLIC _sk_load_8888_dst_sse41
 _sk_load_8888_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3bf3 <_sk_load_8888_dst_sse41+0x62>
+  DB  117,88                              ; jne           3be4 <_sk_load_8888_dst_sse41+0x62>
   DB  243,15,111,60,144                   ; movdqu        (%rax,%rdx,4),%xmm7
-  DB  102,15,111,37,40,43,0,0             ; movdqa        0x2b28(%rip),%xmm4        # 66d0 <_sk_callback_sse41+0xfb5>
+  DB  102,15,111,37,183,45,0,0            ; movdqa        0x2db7(%rip),%xmm4        # 6950 <_sk_callback_sse41+0xfb0>
   DB  102,15,219,231                      ; pand          %xmm7,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  68,15,40,5,41,43,0,0                ; movaps        0x2b29(%rip),%xmm8        # 66e0 <_sk_callback_sse41+0xfc5>
+  DB  68,15,40,5,184,45,0,0               ; movaps        0x2db8(%rip),%xmm8        # 6960 <_sk_callback_sse41+0xfc0>
   DB  65,15,89,224                        ; mulps         %xmm8,%xmm4
   DB  102,15,111,239                      ; movdqa        %xmm7,%xmm5
-  DB  102,15,56,0,45,40,43,0,0            ; pshufb        0x2b28(%rip),%xmm5        # 66f0 <_sk_callback_sse41+0xfd5>
+  DB  102,15,56,0,45,183,45,0,0           ; pshufb        0x2db7(%rip),%xmm5        # 6970 <_sk_callback_sse41+0xfd0>
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
   DB  65,15,89,232                        ; mulps         %xmm8,%xmm5
   DB  102,15,111,247                      ; movdqa        %xmm7,%xmm6
-  DB  102,15,56,0,53,36,43,0,0            ; pshufb        0x2b24(%rip),%xmm6        # 6700 <_sk_callback_sse41+0xfe5>
+  DB  102,15,56,0,53,179,45,0,0           ; pshufb        0x2db3(%rip),%xmm6        # 6980 <_sk_callback_sse41+0xfe0>
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
   DB  65,15,89,240                        ; mulps         %xmm8,%xmm6
   DB  102,15,114,215,24                   ; psrld         $0x18,%xmm7
@@ -17054,19 +17641,19 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,43                              ; je            3c2b <_sk_load_8888_dst_sse41+0x9a>
+  DB  116,43                              ; je            3c1c <_sk_load_8888_dst_sse41+0x9a>
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,17                              ; je            3c1b <_sk_load_8888_dst_sse41+0x8a>
+  DB  116,17                              ; je            3c0c <_sk_load_8888_dst_sse41+0x8a>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,144                             ; jne           3ba0 <_sk_load_8888_dst_sse41+0xf>
+  DB  117,144                             ; jne           3b91 <_sk_load_8888_dst_sse41+0xf>
   DB  102,15,110,100,144,8                ; movd          0x8(%rax,%rdx,4),%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  243,15,126,36,144                   ; movq          (%rax,%rdx,4),%xmm4
   DB  102,15,58,14,252,15                 ; pblendw       $0xf,%xmm4,%xmm7
-  DB  233,117,255,255,255                 ; jmpq          3ba0 <_sk_load_8888_dst_sse41+0xf>
+  DB  233,117,255,255,255                 ; jmpq          3b91 <_sk_load_8888_dst_sse41+0xf>
   DB  102,15,110,60,144                   ; movd          (%rax,%rdx,4),%xmm7
-  DB  233,107,255,255,255                 ; jmpq          3ba0 <_sk_load_8888_dst_sse41+0xf>
+  DB  233,107,255,255,255                 ; jmpq          3b91 <_sk_load_8888_dst_sse41+0xf>
 
 PUBLIC _sk_gather_8888_sse41
 _sk_gather_8888_sse41 LABEL PROC
@@ -17089,17 +17676,17 @@
   DB  102,65,15,58,34,28,129,1            ; pinsrd        $0x1,(%r9,%rax,4),%xmm3
   DB  102,65,15,58,34,28,153,2            ; pinsrd        $0x2,(%r9,%rbx,4),%xmm3
   DB  102,67,15,58,34,28,153,3            ; pinsrd        $0x3,(%r9,%r11,4),%xmm3
-  DB  102,15,111,5,122,42,0,0             ; movdqa        0x2a7a(%rip),%xmm0        # 6710 <_sk_callback_sse41+0xff5>
+  DB  102,15,111,5,9,45,0,0               ; movdqa        0x2d09(%rip),%xmm0        # 6990 <_sk_callback_sse41+0xff0>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,123,42,0,0               ; movaps        0x2a7b(%rip),%xmm8        # 6720 <_sk_callback_sse41+0x1005>
+  DB  68,15,40,5,10,45,0,0                ; movaps        0x2d0a(%rip),%xmm8        # 69a0 <_sk_callback_sse41+0x1000>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
-  DB  102,15,56,0,13,122,42,0,0           ; pshufb        0x2a7a(%rip),%xmm1        # 6730 <_sk_callback_sse41+0x1015>
+  DB  102,15,56,0,13,9,45,0,0             ; pshufb        0x2d09(%rip),%xmm1        # 69b0 <_sk_callback_sse41+0x1010>
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,111,211                      ; movdqa        %xmm3,%xmm2
-  DB  102,15,56,0,21,118,42,0,0           ; pshufb        0x2a76(%rip),%xmm2        # 6740 <_sk_callback_sse41+0x1025>
+  DB  102,15,56,0,21,5,45,0,0             ; pshufb        0x2d05(%rip),%xmm2        # 69c0 <_sk_callback_sse41+0x1020>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -17113,7 +17700,7 @@
 _sk_store_8888_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,97,42,0,0                ; movaps        0x2a61(%rip),%xmm8        # 6750 <_sk_callback_sse41+0x1035>
+  DB  68,15,40,5,240,44,0,0               ; movaps        0x2cf0(%rip),%xmm8        # 69d0 <_sk_callback_sse41+0x1030>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -17132,30 +17719,196 @@
   DB  102,69,15,235,193                   ; por           %xmm9,%xmm8
   DB  102,69,15,235,194                   ; por           %xmm10,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3d4f <_sk_store_8888_sse41+0x6d>
+  DB  117,10                              ; jne           3d40 <_sk_store_8888_sse41+0x6d>
   DB  243,68,15,127,4,144                 ; movdqu        %xmm8,(%rax,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,29                              ; je            3d79 <_sk_store_8888_sse41+0x97>
+  DB  116,29                              ; je            3d6a <_sk_store_8888_sse41+0x97>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,15                              ; je            3d71 <_sk_store_8888_sse41+0x8f>
+  DB  116,15                              ; je            3d62 <_sk_store_8888_sse41+0x8f>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,227                             ; jne           3d4b <_sk_store_8888_sse41+0x69>
+  DB  117,227                             ; jne           3d3c <_sk_store_8888_sse41+0x69>
   DB  102,68,15,58,22,68,144,8,2          ; pextrd        $0x2,%xmm8,0x8(%rax,%rdx,4)
   DB  102,68,15,214,4,144                 ; movq          %xmm8,(%rax,%rdx,4)
-  DB  235,210                             ; jmp           3d4b <_sk_store_8888_sse41+0x69>
+  DB  235,210                             ; jmp           3d3c <_sk_store_8888_sse41+0x69>
   DB  102,68,15,126,4,144                 ; movd          %xmm8,(%rax,%rdx,4)
-  DB  235,202                             ; jmp           3d4b <_sk_store_8888_sse41+0x69>
+  DB  235,202                             ; jmp           3d3c <_sk_store_8888_sse41+0x69>
+
+PUBLIC _sk_load_bgra_sse41
+_sk_load_bgra_sse41 LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  72,139,0                            ; mov           (%rax),%rax
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,88                              ; jne           3dd4 <_sk_load_bgra_sse41+0x62>
+  DB  243,15,111,28,144                   ; movdqu        (%rax,%rdx,4),%xmm3
+  DB  102,15,111,5,87,44,0,0              ; movdqa        0x2c57(%rip),%xmm0        # 69e0 <_sk_callback_sse41+0x1040>
+  DB  102,15,219,195                      ; pand          %xmm3,%xmm0
+  DB  15,91,208                           ; cvtdq2ps      %xmm0,%xmm2
+  DB  68,15,40,5,88,44,0,0                ; movaps        0x2c58(%rip),%xmm8        # 69f0 <_sk_callback_sse41+0x1050>
+  DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
+  DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
+  DB  102,15,56,0,5,87,44,0,0             ; pshufb        0x2c57(%rip),%xmm0        # 6a00 <_sk_callback_sse41+0x1060>
+  DB  15,91,200                           ; cvtdq2ps      %xmm0,%xmm1
+  DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
+  DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
+  DB  102,15,56,0,5,83,44,0,0             ; pshufb        0x2c53(%rip),%xmm0        # 6a10 <_sk_callback_sse41+0x1070>
+  DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
+  DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
+  DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
+  DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
+  DB  65,15,89,216                        ; mulps         %xmm8,%xmm3
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,3                        ; and           $0x3,%r9b
+  DB  65,128,249,1                        ; cmp           $0x1,%r9b
+  DB  116,43                              ; je            3e0c <_sk_load_bgra_sse41+0x9a>
+  DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
+  DB  65,128,249,2                        ; cmp           $0x2,%r9b
+  DB  116,17                              ; je            3dfc <_sk_load_bgra_sse41+0x8a>
+  DB  65,128,249,3                        ; cmp           $0x3,%r9b
+  DB  117,144                             ; jne           3d81 <_sk_load_bgra_sse41+0xf>
+  DB  102,15,110,68,144,8                 ; movd          0x8(%rax,%rdx,4),%xmm0
+  DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
+  DB  243,15,126,4,144                    ; movq          (%rax,%rdx,4),%xmm0
+  DB  102,15,58,14,216,15                 ; pblendw       $0xf,%xmm0,%xmm3
+  DB  233,117,255,255,255                 ; jmpq          3d81 <_sk_load_bgra_sse41+0xf>
+  DB  102,15,110,28,144                   ; movd          (%rax,%rdx,4),%xmm3
+  DB  233,107,255,255,255                 ; jmpq          3d81 <_sk_load_bgra_sse41+0xf>
+
+PUBLIC _sk_load_bgra_dst_sse41
+_sk_load_bgra_dst_sse41 LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  72,139,0                            ; mov           (%rax),%rax
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,88                              ; jne           3e78 <_sk_load_bgra_dst_sse41+0x62>
+  DB  243,15,111,60,144                   ; movdqu        (%rax,%rdx,4),%xmm7
+  DB  102,15,111,37,243,43,0,0            ; movdqa        0x2bf3(%rip),%xmm4        # 6a20 <_sk_callback_sse41+0x1080>
+  DB  102,15,219,231                      ; pand          %xmm7,%xmm4
+  DB  15,91,244                           ; cvtdq2ps      %xmm4,%xmm6
+  DB  68,15,40,5,244,43,0,0               ; movaps        0x2bf4(%rip),%xmm8        # 6a30 <_sk_callback_sse41+0x1090>
+  DB  65,15,89,240                        ; mulps         %xmm8,%xmm6
+  DB  102,15,111,231                      ; movdqa        %xmm7,%xmm4
+  DB  102,15,56,0,37,243,43,0,0           ; pshufb        0x2bf3(%rip),%xmm4        # 6a40 <_sk_callback_sse41+0x10a0>
+  DB  15,91,236                           ; cvtdq2ps      %xmm4,%xmm5
+  DB  65,15,89,232                        ; mulps         %xmm8,%xmm5
+  DB  102,15,111,231                      ; movdqa        %xmm7,%xmm4
+  DB  102,15,56,0,37,239,43,0,0           ; pshufb        0x2bef(%rip),%xmm4        # 6a50 <_sk_callback_sse41+0x10b0>
+  DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
+  DB  65,15,89,224                        ; mulps         %xmm8,%xmm4
+  DB  102,15,114,215,24                   ; psrld         $0x18,%xmm7
+  DB  15,91,255                           ; cvtdq2ps      %xmm7,%xmm7
+  DB  65,15,89,248                        ; mulps         %xmm8,%xmm7
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,3                        ; and           $0x3,%r9b
+  DB  65,128,249,1                        ; cmp           $0x1,%r9b
+  DB  116,43                              ; je            3eb0 <_sk_load_bgra_dst_sse41+0x9a>
+  DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
+  DB  65,128,249,2                        ; cmp           $0x2,%r9b
+  DB  116,17                              ; je            3ea0 <_sk_load_bgra_dst_sse41+0x8a>
+  DB  65,128,249,3                        ; cmp           $0x3,%r9b
+  DB  117,144                             ; jne           3e25 <_sk_load_bgra_dst_sse41+0xf>
+  DB  102,15,110,100,144,8                ; movd          0x8(%rax,%rdx,4),%xmm4
+  DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
+  DB  243,15,126,36,144                   ; movq          (%rax,%rdx,4),%xmm4
+  DB  102,15,58,14,252,15                 ; pblendw       $0xf,%xmm4,%xmm7
+  DB  233,117,255,255,255                 ; jmpq          3e25 <_sk_load_bgra_dst_sse41+0xf>
+  DB  102,15,110,60,144                   ; movd          (%rax,%rdx,4),%xmm7
+  DB  233,107,255,255,255                 ; jmpq          3e25 <_sk_load_bgra_dst_sse41+0xf>
+
+PUBLIC _sk_gather_bgra_sse41
+_sk_gather_bgra_sse41 LABEL PROC
+  DB  83                                  ; push          %rbx
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,139,8                            ; mov           (%rax),%r9
+  DB  243,15,91,201                       ; cvttps2dq     %xmm1,%xmm1
+  DB  102,15,110,80,16                    ; movd          0x10(%rax),%xmm2
+  DB  102,15,112,210,0                    ; pshufd        $0x0,%xmm2,%xmm2
+  DB  102,15,56,64,209                    ; pmulld        %xmm1,%xmm2
+  DB  243,15,91,192                       ; cvttps2dq     %xmm0,%xmm0
+  DB  102,15,254,194                      ; paddd         %xmm2,%xmm0
+  DB  102,72,15,126,192                   ; movq          %xmm0,%rax
+  DB  65,137,194                          ; mov           %eax,%r10d
+  DB  72,193,232,32                       ; shr           $0x20,%rax
+  DB  102,73,15,58,22,195,1               ; pextrq        $0x1,%xmm0,%r11
+  DB  68,137,219                          ; mov           %r11d,%ebx
+  DB  73,193,235,32                       ; shr           $0x20,%r11
+  DB  102,67,15,110,28,145                ; movd          (%r9,%r10,4),%xmm3
+  DB  102,65,15,58,34,28,129,1            ; pinsrd        $0x1,(%r9,%rax,4),%xmm3
+  DB  102,65,15,58,34,28,153,2            ; pinsrd        $0x2,(%r9,%rbx,4),%xmm3
+  DB  102,67,15,58,34,28,153,3            ; pinsrd        $0x3,(%r9,%r11,4),%xmm3
+  DB  102,15,111,5,69,43,0,0              ; movdqa        0x2b45(%rip),%xmm0        # 6a60 <_sk_callback_sse41+0x10c0>
+  DB  102,15,219,195                      ; pand          %xmm3,%xmm0
+  DB  15,91,208                           ; cvtdq2ps      %xmm0,%xmm2
+  DB  68,15,40,5,70,43,0,0                ; movaps        0x2b46(%rip),%xmm8        # 6a70 <_sk_callback_sse41+0x10d0>
+  DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
+  DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
+  DB  102,15,56,0,5,69,43,0,0             ; pshufb        0x2b45(%rip),%xmm0        # 6a80 <_sk_callback_sse41+0x10e0>
+  DB  15,91,200                           ; cvtdq2ps      %xmm0,%xmm1
+  DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
+  DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
+  DB  102,15,56,0,5,65,43,0,0             ; pshufb        0x2b41(%rip),%xmm0        # 6a90 <_sk_callback_sse41+0x10f0>
+  DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
+  DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
+  DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
+  DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
+  DB  65,15,89,216                        ; mulps         %xmm8,%xmm3
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  91                                  ; pop           %rbx
+  DB  255,224                             ; jmpq          *%rax
+
+PUBLIC _sk_store_bgra_sse41
+_sk_store_bgra_sse41 LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  72,139,0                            ; mov           (%rax),%rax
+  DB  68,15,40,5,44,43,0,0                ; movaps        0x2b2c(%rip),%xmm8        # 6aa0 <_sk_callback_sse41+0x1100>
+  DB  68,15,40,202                        ; movaps        %xmm2,%xmm9
+  DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
+  DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
+  DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
+  DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
+  DB  102,69,15,91,210                    ; cvtps2dq      %xmm10,%xmm10
+  DB  102,65,15,114,242,8                 ; pslld         $0x8,%xmm10
+  DB  102,69,15,235,209                   ; por           %xmm9,%xmm10
+  DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
+  DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
+  DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
+  DB  102,65,15,114,241,16                ; pslld         $0x10,%xmm9
+  DB  68,15,89,195                        ; mulps         %xmm3,%xmm8
+  DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
+  DB  102,65,15,114,240,24                ; pslld         $0x18,%xmm8
+  DB  102,69,15,235,193                   ; por           %xmm9,%xmm8
+  DB  102,69,15,235,194                   ; por           %xmm10,%xmm8
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,10                              ; jne           3fd4 <_sk_store_bgra_sse41+0x6d>
+  DB  243,68,15,127,4,144                 ; movdqu        %xmm8,(%rax,%rdx,4)
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,3                        ; and           $0x3,%r9b
+  DB  65,128,249,1                        ; cmp           $0x1,%r9b
+  DB  116,29                              ; je            3ffe <_sk_store_bgra_sse41+0x97>
+  DB  65,128,249,2                        ; cmp           $0x2,%r9b
+  DB  116,15                              ; je            3ff6 <_sk_store_bgra_sse41+0x8f>
+  DB  65,128,249,3                        ; cmp           $0x3,%r9b
+  DB  117,227                             ; jne           3fd0 <_sk_store_bgra_sse41+0x69>
+  DB  102,68,15,58,22,68,144,8,2          ; pextrd        $0x2,%xmm8,0x8(%rax,%rdx,4)
+  DB  102,68,15,214,4,144                 ; movq          %xmm8,(%rax,%rdx,4)
+  DB  235,210                             ; jmp           3fd0 <_sk_store_bgra_sse41+0x69>
+  DB  102,68,15,126,4,144                 ; movd          %xmm8,(%rax,%rdx,4)
+  DB  235,202                             ; jmp           3fd0 <_sk_store_bgra_sse41+0x69>
 
 PUBLIC _sk_load_f16_sse41
 _sk_load_f16_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,60,1,0,0                     ; jne           3ecb <_sk_load_f16_sse41+0x14a>
+  DB  15,133,60,1,0,0                     ; jne           4150 <_sk_load_f16_sse41+0x14a>
   DB  102,15,16,4,208                     ; movupd        (%rax,%rdx,8),%xmm0
   DB  243,15,111,76,208,16                ; movdqu        0x10(%rax,%rdx,8),%xmm1
   DB  102,68,15,40,200                    ; movapd        %xmm0,%xmm9
@@ -17165,18 +17918,18 @@
   DB  102,68,15,97,216                    ; punpcklwd     %xmm0,%xmm11
   DB  102,68,15,105,200                   ; punpckhwd     %xmm0,%xmm9
   DB  102,65,15,56,51,203                 ; pmovzxwd      %xmm11,%xmm1
-  DB  102,68,15,111,5,154,41,0,0          ; movdqa        0x299a(%rip),%xmm8        # 6760 <_sk_callback_sse41+0x1045>
+  DB  102,68,15,111,5,101,42,0,0          ; movdqa        0x2a65(%rip),%xmm8        # 6ab0 <_sk_callback_sse41+0x1110>
   DB  102,15,111,209                      ; movdqa        %xmm1,%xmm2
   DB  102,65,15,219,208                   ; pand          %xmm8,%xmm2
   DB  102,15,239,202                      ; pxor          %xmm2,%xmm1
-  DB  102,15,111,29,149,41,0,0            ; movdqa        0x2995(%rip),%xmm3        # 6770 <_sk_callback_sse41+0x1055>
+  DB  102,15,111,29,96,42,0,0             ; movdqa        0x2a60(%rip),%xmm3        # 6ac0 <_sk_callback_sse41+0x1120>
   DB  102,15,114,242,16                   ; pslld         $0x10,%xmm2
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,15,56,63,195                    ; pmaxud        %xmm3,%xmm0
   DB  102,15,118,193                      ; pcmpeqd       %xmm1,%xmm0
   DB  102,15,114,241,13                   ; pslld         $0xd,%xmm1
   DB  102,15,235,202                      ; por           %xmm2,%xmm1
-  DB  102,68,15,111,21,129,41,0,0         ; movdqa        0x2981(%rip),%xmm10        # 6780 <_sk_callback_sse41+0x1065>
+  DB  102,68,15,111,21,76,42,0,0          ; movdqa        0x2a4c(%rip),%xmm10        # 6ad0 <_sk_callback_sse41+0x1130>
   DB  102,65,15,254,202                   ; paddd         %xmm10,%xmm1
   DB  102,15,219,193                      ; pand          %xmm1,%xmm0
   DB  102,65,15,115,219,8                 ; psrldq        $0x8,%xmm11
@@ -17219,23 +17972,23 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,15,16,4,208                     ; movsd         (%rax,%rdx,8),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           3ee3 <_sk_load_f16_sse41+0x162>
+  DB  117,13                              ; jne           4168 <_sk_load_f16_sse41+0x162>
   DB  243,15,126,192                      ; movq          %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,183,254,255,255                 ; jmpq          3d9a <_sk_load_f16_sse41+0x19>
+  DB  233,183,254,255,255                 ; jmpq          401f <_sk_load_f16_sse41+0x19>
   DB  102,15,22,68,208,8                  ; movhpd        0x8(%rax,%rdx,8),%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,163,254,255,255              ; jb            3d9a <_sk_load_f16_sse41+0x19>
+  DB  15,130,163,254,255,255              ; jb            401f <_sk_load_f16_sse41+0x19>
   DB  243,15,126,76,208,16                ; movq          0x10(%rax,%rdx,8),%xmm1
-  DB  233,152,254,255,255                 ; jmpq          3d9a <_sk_load_f16_sse41+0x19>
+  DB  233,152,254,255,255                 ; jmpq          401f <_sk_load_f16_sse41+0x19>
 
 PUBLIC _sk_load_f16_dst_sse41
 _sk_load_f16_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,60,1,0,0                     ; jne           404c <_sk_load_f16_dst_sse41+0x14a>
+  DB  15,133,60,1,0,0                     ; jne           42d1 <_sk_load_f16_dst_sse41+0x14a>
   DB  102,15,16,36,208                    ; movupd        (%rax,%rdx,8),%xmm4
   DB  243,15,111,108,208,16               ; movdqu        0x10(%rax,%rdx,8),%xmm5
   DB  102,68,15,40,204                    ; movapd        %xmm4,%xmm9
@@ -17245,18 +17998,18 @@
   DB  102,68,15,97,220                    ; punpcklwd     %xmm4,%xmm11
   DB  102,68,15,105,204                   ; punpckhwd     %xmm4,%xmm9
   DB  102,65,15,56,51,235                 ; pmovzxwd      %xmm11,%xmm5
-  DB  102,68,15,111,5,73,40,0,0           ; movdqa        0x2849(%rip),%xmm8        # 6790 <_sk_callback_sse41+0x1075>
+  DB  102,68,15,111,5,20,41,0,0           ; movdqa        0x2914(%rip),%xmm8        # 6ae0 <_sk_callback_sse41+0x1140>
   DB  102,15,111,245                      ; movdqa        %xmm5,%xmm6
   DB  102,65,15,219,240                   ; pand          %xmm8,%xmm6
   DB  102,15,239,238                      ; pxor          %xmm6,%xmm5
-  DB  102,15,111,61,68,40,0,0             ; movdqa        0x2844(%rip),%xmm7        # 67a0 <_sk_callback_sse41+0x1085>
+  DB  102,15,111,61,15,41,0,0             ; movdqa        0x290f(%rip),%xmm7        # 6af0 <_sk_callback_sse41+0x1150>
   DB  102,15,114,246,16                   ; pslld         $0x10,%xmm6
   DB  102,15,111,229                      ; movdqa        %xmm5,%xmm4
   DB  102,15,56,63,231                    ; pmaxud        %xmm7,%xmm4
   DB  102,15,118,229                      ; pcmpeqd       %xmm5,%xmm4
   DB  102,15,114,245,13                   ; pslld         $0xd,%xmm5
   DB  102,15,235,238                      ; por           %xmm6,%xmm5
-  DB  102,68,15,111,21,48,40,0,0          ; movdqa        0x2830(%rip),%xmm10        # 67b0 <_sk_callback_sse41+0x1095>
+  DB  102,68,15,111,21,251,40,0,0         ; movdqa        0x28fb(%rip),%xmm10        # 6b00 <_sk_callback_sse41+0x1160>
   DB  102,65,15,254,234                   ; paddd         %xmm10,%xmm5
   DB  102,15,219,229                      ; pand          %xmm5,%xmm4
   DB  102,65,15,115,219,8                 ; psrldq        $0x8,%xmm11
@@ -17299,16 +18052,16 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,15,16,36,208                    ; movsd         (%rax,%rdx,8),%xmm4
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           4064 <_sk_load_f16_dst_sse41+0x162>
+  DB  117,13                              ; jne           42e9 <_sk_load_f16_dst_sse41+0x162>
   DB  243,15,126,228                      ; movq          %xmm4,%xmm4
   DB  102,15,239,237                      ; pxor          %xmm5,%xmm5
-  DB  233,183,254,255,255                 ; jmpq          3f1b <_sk_load_f16_dst_sse41+0x19>
+  DB  233,183,254,255,255                 ; jmpq          41a0 <_sk_load_f16_dst_sse41+0x19>
   DB  102,15,22,100,208,8                 ; movhpd        0x8(%rax,%rdx,8),%xmm4
   DB  102,15,239,237                      ; pxor          %xmm5,%xmm5
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,163,254,255,255              ; jb            3f1b <_sk_load_f16_dst_sse41+0x19>
+  DB  15,130,163,254,255,255              ; jb            41a0 <_sk_load_f16_dst_sse41+0x19>
   DB  243,15,126,108,208,16               ; movq          0x10(%rax,%rdx,8),%xmm5
-  DB  233,152,254,255,255                 ; jmpq          3f1b <_sk_load_f16_dst_sse41+0x19>
+  DB  233,152,254,255,255                 ; jmpq          41a0 <_sk_load_f16_dst_sse41+0x19>
 
 PUBLIC _sk_gather_f16_sse41
 _sk_gather_f16_sse41 LABEL PROC
@@ -17340,18 +18093,18 @@
   DB  102,68,15,97,218                    ; punpcklwd     %xmm2,%xmm11
   DB  102,68,15,105,202                   ; punpckhwd     %xmm2,%xmm9
   DB  102,65,15,56,51,203                 ; pmovzxwd      %xmm11,%xmm1
-  DB  102,68,15,111,5,182,38,0,0          ; movdqa        0x26b6(%rip),%xmm8        # 67c0 <_sk_callback_sse41+0x10a5>
+  DB  102,68,15,111,5,129,39,0,0          ; movdqa        0x2781(%rip),%xmm8        # 6b10 <_sk_callback_sse41+0x1170>
   DB  102,15,111,209                      ; movdqa        %xmm1,%xmm2
   DB  102,65,15,219,208                   ; pand          %xmm8,%xmm2
   DB  102,15,239,202                      ; pxor          %xmm2,%xmm1
-  DB  102,15,111,29,177,38,0,0            ; movdqa        0x26b1(%rip),%xmm3        # 67d0 <_sk_callback_sse41+0x10b5>
+  DB  102,15,111,29,124,39,0,0            ; movdqa        0x277c(%rip),%xmm3        # 6b20 <_sk_callback_sse41+0x1180>
   DB  102,15,114,242,16                   ; pslld         $0x10,%xmm2
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,15,56,63,195                    ; pmaxud        %xmm3,%xmm0
   DB  102,15,118,193                      ; pcmpeqd       %xmm1,%xmm0
   DB  102,15,114,241,13                   ; pslld         $0xd,%xmm1
   DB  102,15,235,202                      ; por           %xmm2,%xmm1
-  DB  102,68,15,111,21,157,38,0,0         ; movdqa        0x269d(%rip),%xmm10        # 67e0 <_sk_callback_sse41+0x10c5>
+  DB  102,68,15,111,21,104,39,0,0         ; movdqa        0x2768(%rip),%xmm10        # 6b30 <_sk_callback_sse41+0x1190>
   DB  102,65,15,254,202                   ; paddd         %xmm10,%xmm1
   DB  102,15,219,193                      ; pand          %xmm1,%xmm0
   DB  102,65,15,115,219,8                 ; psrldq        $0x8,%xmm11
@@ -17398,17 +18151,17 @@
 _sk_store_f16_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  102,68,15,111,21,210,37,0,0         ; movdqa        0x25d2(%rip),%xmm10        # 67f0 <_sk_callback_sse41+0x10d5>
+  DB  102,68,15,111,21,157,38,0,0         ; movdqa        0x269d(%rip),%xmm10        # 6b40 <_sk_callback_sse41+0x11a0>
   DB  102,68,15,111,216                   ; movdqa        %xmm0,%xmm11
   DB  102,69,15,219,218                   ; pand          %xmm10,%xmm11
   DB  102,68,15,111,232                   ; movdqa        %xmm0,%xmm13
   DB  102,69,15,239,235                   ; pxor          %xmm11,%xmm13
-  DB  102,68,15,111,13,197,37,0,0         ; movdqa        0x25c5(%rip),%xmm9        # 6800 <_sk_callback_sse41+0x10e5>
+  DB  102,68,15,111,13,144,38,0,0         ; movdqa        0x2690(%rip),%xmm9        # 6b50 <_sk_callback_sse41+0x11b0>
   DB  102,65,15,114,211,16                ; psrld         $0x10,%xmm11
   DB  102,69,15,111,193                   ; movdqa        %xmm9,%xmm8
   DB  102,69,15,102,197                   ; pcmpgtd       %xmm13,%xmm8
   DB  102,65,15,114,213,13                ; psrld         $0xd,%xmm13
-  DB  102,68,15,111,37,182,37,0,0         ; movdqa        0x25b6(%rip),%xmm12        # 6810 <_sk_callback_sse41+0x10f5>
+  DB  102,68,15,111,37,129,38,0,0         ; movdqa        0x2681(%rip),%xmm12        # 6b60 <_sk_callback_sse41+0x11c0>
   DB  102,69,15,235,220                   ; por           %xmm12,%xmm11
   DB  102,69,15,254,221                   ; paddd         %xmm13,%xmm11
   DB  102,69,15,223,195                   ; pandn         %xmm11,%xmm8
@@ -17452,7 +18205,7 @@
   DB  102,69,15,111,200                   ; movdqa        %xmm8,%xmm9
   DB  102,69,15,98,203                    ; punpckldq     %xmm11,%xmm9
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,21                              ; jne           4350 <_sk_store_f16_sse41+0x140>
+  DB  117,21                              ; jne           45d5 <_sk_store_f16_sse41+0x140>
   DB  68,15,17,12,208                     ; movups        %xmm9,(%rax,%rdx,8)
   DB  102,69,15,106,195                   ; punpckhdq     %xmm11,%xmm8
   DB  243,68,15,127,68,208,16             ; movdqu        %xmm8,0x10(%rax,%rdx,8)
@@ -17460,13 +18213,13 @@
   DB  255,224                             ; jmpq          *%rax
   DB  102,68,15,214,12,208                ; movq          %xmm9,(%rax,%rdx,8)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            434c <_sk_store_f16_sse41+0x13c>
+  DB  116,240                             ; je            45d1 <_sk_store_f16_sse41+0x13c>
   DB  102,68,15,23,76,208,8               ; movhpd        %xmm9,0x8(%rax,%rdx,8)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            434c <_sk_store_f16_sse41+0x13c>
+  DB  114,227                             ; jb            45d1 <_sk_store_f16_sse41+0x13c>
   DB  102,69,15,106,195                   ; punpckhdq     %xmm11,%xmm8
   DB  102,68,15,214,68,208,16             ; movq          %xmm8,0x10(%rax,%rdx,8)
-  DB  235,213                             ; jmp           434c <_sk_store_f16_sse41+0x13c>
+  DB  235,213                             ; jmp           45d1 <_sk_store_f16_sse41+0x13c>
 
 PUBLIC _sk_load_u16_be_sse41
 _sk_load_u16_be_sse41 LABEL PROC
@@ -17474,7 +18227,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,185,0,0,0                    ; jne           4446 <_sk_load_u16_be_sse41+0xcf>
+  DB  15,133,185,0,0,0                    ; jne           46cb <_sk_load_u16_be_sse41+0xcf>
   DB  102,65,15,16,4,65                   ; movupd        (%r9,%rax,2),%xmm0
   DB  243,65,15,111,76,65,16              ; movdqu        0x10(%r9,%rax,2),%xmm1
   DB  102,15,40,208                       ; movapd        %xmm0,%xmm2
@@ -17490,7 +18243,7 @@
   DB  102,15,235,200                      ; por           %xmm0,%xmm1
   DB  102,15,56,51,193                    ; pmovzxwd      %xmm1,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,71,36,0,0                ; movaps        0x2447(%rip),%xmm8        # 6820 <_sk_callback_sse41+0x1105>
+  DB  68,15,40,5,18,37,0,0                ; movaps        0x2512(%rip),%xmm8        # 6b70 <_sk_callback_sse41+0x11d0>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -17518,16 +18271,16 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,65,15,16,4,65                   ; movsd         (%r9,%rax,2),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           445f <_sk_load_u16_be_sse41+0xe8>
+  DB  117,13                              ; jne           46e4 <_sk_load_u16_be_sse41+0xe8>
   DB  243,15,126,192                      ; movq          %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,59,255,255,255                  ; jmpq          439a <_sk_load_u16_be_sse41+0x23>
+  DB  233,59,255,255,255                  ; jmpq          461f <_sk_load_u16_be_sse41+0x23>
   DB  102,65,15,22,68,65,8                ; movhpd        0x8(%r9,%rax,2),%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,38,255,255,255               ; jb            439a <_sk_load_u16_be_sse41+0x23>
+  DB  15,130,38,255,255,255               ; jb            461f <_sk_load_u16_be_sse41+0x23>
   DB  243,65,15,126,76,65,16              ; movq          0x10(%r9,%rax,2),%xmm1
-  DB  233,26,255,255,255                  ; jmpq          439a <_sk_load_u16_be_sse41+0x23>
+  DB  233,26,255,255,255                  ; jmpq          461f <_sk_load_u16_be_sse41+0x23>
 
 PUBLIC _sk_load_rgb_u16_be_sse41
 _sk_load_rgb_u16_be_sse41 LABEL PROC
@@ -17535,7 +18288,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,82                         ; lea           (%rdx,%rdx,2),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,170,0,0,0                    ; jne           453c <_sk_load_rgb_u16_be_sse41+0xbc>
+  DB  15,133,170,0,0,0                    ; jne           47c1 <_sk_load_rgb_u16_be_sse41+0xbc>
   DB  243,65,15,111,20,65                 ; movdqu        (%r9,%rax,2),%xmm2
   DB  243,65,15,111,92,65,8               ; movdqu        0x8(%r9,%rax,2),%xmm3
   DB  102,15,115,219,4                    ; psrldq        $0x4,%xmm3
@@ -17555,7 +18308,7 @@
   DB  102,15,235,200                      ; por           %xmm0,%xmm1
   DB  102,15,56,51,193                    ; pmovzxwd      %xmm1,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,63,35,0,0                ; movaps        0x233f(%rip),%xmm8        # 6830 <_sk_callback_sse41+0x1115>
+  DB  68,15,40,5,10,36,0,0                ; movaps        0x240a(%rip),%xmm8        # 6b80 <_sk_callback_sse41+0x11e0>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -17572,34 +18325,34 @@
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,6,35,0,0                   ; movaps        0x2306(%rip),%xmm3        # 6840 <_sk_callback_sse41+0x1125>
+  DB  15,40,29,209,35,0,0                 ; movaps        0x23d1(%rip),%xmm3        # 6b90 <_sk_callback_sse41+0x11f0>
   DB  255,224                             ; jmpq          *%rax
   DB  102,65,15,110,20,65                 ; movd          (%r9,%rax,2),%xmm2
   DB  102,65,15,196,84,65,4,2             ; pinsrw        $0x2,0x4(%r9,%rax,2),%xmm2
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           4561 <_sk_load_rgb_u16_be_sse41+0xe1>
+  DB  117,13                              ; jne           47e6 <_sk_load_rgb_u16_be_sse41+0xe1>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
-  DB  233,85,255,255,255                  ; jmpq          44b6 <_sk_load_rgb_u16_be_sse41+0x36>
+  DB  233,85,255,255,255                  ; jmpq          473b <_sk_load_rgb_u16_be_sse41+0x36>
   DB  102,65,15,110,68,65,6               ; movd          0x6(%r9,%rax,2),%xmm0
   DB  102,65,15,196,68,65,10,2            ; pinsrw        $0x2,0xa(%r9,%rax,2),%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,24                              ; jb            4592 <_sk_load_rgb_u16_be_sse41+0x112>
+  DB  114,24                              ; jb            4817 <_sk_load_rgb_u16_be_sse41+0x112>
   DB  102,65,15,110,92,65,12              ; movd          0xc(%r9,%rax,2),%xmm3
   DB  102,65,15,196,92,65,16,2            ; pinsrw        $0x2,0x10(%r9,%rax,2),%xmm3
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,36,255,255,255                  ; jmpq          44b6 <_sk_load_rgb_u16_be_sse41+0x36>
+  DB  233,36,255,255,255                  ; jmpq          473b <_sk_load_rgb_u16_be_sse41+0x36>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
-  DB  233,27,255,255,255                  ; jmpq          44b6 <_sk_load_rgb_u16_be_sse41+0x36>
+  DB  233,27,255,255,255                  ; jmpq          473b <_sk_load_rgb_u16_be_sse41+0x36>
 
 PUBLIC _sk_store_u16_be_sse41
 _sk_store_u16_be_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
-  DB  68,15,40,21,160,34,0,0              ; movaps        0x22a0(%rip),%xmm10        # 6850 <_sk_callback_sse41+0x1135>
+  DB  68,15,40,21,107,35,0,0              ; movaps        0x236b(%rip),%xmm10        # 6ba0 <_sk_callback_sse41+0x1200>
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  69,15,89,194                        ; mulps         %xmm10,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
@@ -17636,7 +18389,7 @@
   DB  102,69,15,111,208                   ; movdqa        %xmm8,%xmm10
   DB  102,69,15,98,209                    ; punpckldq     %xmm9,%xmm10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,21                              ; jne           467e <_sk_store_u16_be_sse41+0xe3>
+  DB  117,21                              ; jne           4903 <_sk_store_u16_be_sse41+0xe3>
   DB  69,15,17,20,65                      ; movups        %xmm10,(%r9,%rax,2)
   DB  102,69,15,106,193                   ; punpckhdq     %xmm9,%xmm8
   DB  243,69,15,127,68,65,16              ; movdqu        %xmm8,0x10(%r9,%rax,2)
@@ -17644,13 +18397,13 @@
   DB  255,224                             ; jmpq          *%rax
   DB  102,69,15,214,20,65                 ; movq          %xmm10,(%r9,%rax,2)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            467a <_sk_store_u16_be_sse41+0xdf>
+  DB  116,240                             ; je            48ff <_sk_store_u16_be_sse41+0xdf>
   DB  102,69,15,23,84,65,8                ; movhpd        %xmm10,0x8(%r9,%rax,2)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            467a <_sk_store_u16_be_sse41+0xdf>
+  DB  114,227                             ; jb            48ff <_sk_store_u16_be_sse41+0xdf>
   DB  102,69,15,106,193                   ; punpckhdq     %xmm9,%xmm8
   DB  102,69,15,214,68,65,16              ; movq          %xmm8,0x10(%r9,%rax,2)
-  DB  235,213                             ; jmp           467a <_sk_store_u16_be_sse41+0xdf>
+  DB  235,213                             ; jmp           48ff <_sk_store_u16_be_sse41+0xdf>
 
 PUBLIC _sk_load_f32_sse41
 _sk_load_f32_sse41 LABEL PROC
@@ -17661,7 +18414,7 @@
   DB  72,193,224,4                        ; shl           $0x4,%rax
   DB  69,15,16,4,2                        ; movups        (%r10,%rax,1),%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           4705 <_sk_load_f32_sse41+0x60>
+  DB  117,66                              ; jne           498a <_sk_load_f32_sse41+0x60>
   DB  67,15,16,68,138,16                  ; movups        0x10(%r10,%r9,4),%xmm0
   DB  67,15,16,92,138,32                  ; movups        0x20(%r10,%r9,4),%xmm3
   DB  71,15,16,76,138,48                  ; movups        0x30(%r10,%r9,4),%xmm9
@@ -17681,17 +18434,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  69,15,87,201                        ; xorps         %xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,8                               ; jne           4717 <_sk_load_f32_sse41+0x72>
+  DB  117,8                               ; jne           499c <_sk_load_f32_sse41+0x72>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
-  DB  235,190                             ; jmp           46d5 <_sk_load_f32_sse41+0x30>
+  DB  235,190                             ; jmp           495a <_sk_load_f32_sse41+0x30>
   DB  67,15,16,68,138,16                  ; movups        0x10(%r10,%r9,4),%xmm0
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,8                               ; jb            472b <_sk_load_f32_sse41+0x86>
+  DB  114,8                               ; jb            49b0 <_sk_load_f32_sse41+0x86>
   DB  67,15,16,92,138,32                  ; movups        0x20(%r10,%r9,4),%xmm3
-  DB  235,170                             ; jmp           46d5 <_sk_load_f32_sse41+0x30>
+  DB  235,170                             ; jmp           495a <_sk_load_f32_sse41+0x30>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
-  DB  235,165                             ; jmp           46d5 <_sk_load_f32_sse41+0x30>
+  DB  235,165                             ; jmp           495a <_sk_load_f32_sse41+0x30>
 
 PUBLIC _sk_load_f32_dst_sse41
 _sk_load_f32_dst_sse41 LABEL PROC
@@ -17702,7 +18455,7 @@
   DB  72,193,224,4                        ; shl           $0x4,%rax
   DB  69,15,16,4,2                        ; movups        (%r10,%rax,1),%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           4790 <_sk_load_f32_dst_sse41+0x60>
+  DB  117,66                              ; jne           4a15 <_sk_load_f32_dst_sse41+0x60>
   DB  67,15,16,100,138,16                 ; movups        0x10(%r10,%r9,4),%xmm4
   DB  67,15,16,124,138,32                 ; movups        0x20(%r10,%r9,4),%xmm7
   DB  71,15,16,76,138,48                  ; movups        0x30(%r10,%r9,4),%xmm9
@@ -17722,17 +18475,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  69,15,87,201                        ; xorps         %xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,8                               ; jne           47a2 <_sk_load_f32_dst_sse41+0x72>
+  DB  117,8                               ; jne           4a27 <_sk_load_f32_dst_sse41+0x72>
   DB  15,87,255                           ; xorps         %xmm7,%xmm7
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
-  DB  235,190                             ; jmp           4760 <_sk_load_f32_dst_sse41+0x30>
+  DB  235,190                             ; jmp           49e5 <_sk_load_f32_dst_sse41+0x30>
   DB  67,15,16,100,138,16                 ; movups        0x10(%r10,%r9,4),%xmm4
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,8                               ; jb            47b6 <_sk_load_f32_dst_sse41+0x86>
+  DB  114,8                               ; jb            4a3b <_sk_load_f32_dst_sse41+0x86>
   DB  67,15,16,124,138,32                 ; movups        0x20(%r10,%r9,4),%xmm7
-  DB  235,170                             ; jmp           4760 <_sk_load_f32_dst_sse41+0x30>
+  DB  235,170                             ; jmp           49e5 <_sk_load_f32_dst_sse41+0x30>
   DB  15,87,255                           ; xorps         %xmm7,%xmm7
-  DB  235,165                             ; jmp           4760 <_sk_load_f32_dst_sse41+0x30>
+  DB  235,165                             ; jmp           49e5 <_sk_load_f32_dst_sse41+0x30>
 
 PUBLIC _sk_store_f32_sse41
 _sk_store_f32_sse41 LABEL PROC
@@ -17756,7 +18509,7 @@
   DB  102,69,15,20,203                    ; unpcklpd      %xmm11,%xmm9
   DB  102,69,15,17,36,2                   ; movupd        %xmm12,(%r10,%rax,1)
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,29                              ; jne           482d <_sk_store_f32_sse41+0x72>
+  DB  117,29                              ; jne           4ab2 <_sk_store_f32_sse41+0x72>
   DB  102,69,15,21,211                    ; unpckhpd      %xmm11,%xmm10
   DB  71,15,17,68,138,16                  ; movups        %xmm8,0x10(%r10,%r9,4)
   DB  102,71,15,17,76,138,32              ; movupd        %xmm9,0x20(%r10,%r9,4)
@@ -17764,12 +18517,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,246                             ; je            4829 <_sk_store_f32_sse41+0x6e>
+  DB  116,246                             ; je            4aae <_sk_store_f32_sse41+0x6e>
   DB  71,15,17,68,138,16                  ; movups        %xmm8,0x10(%r10,%r9,4)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,234                             ; jb            4829 <_sk_store_f32_sse41+0x6e>
+  DB  114,234                             ; jb            4aae <_sk_store_f32_sse41+0x6e>
   DB  102,71,15,17,76,138,32              ; movupd        %xmm9,0x20(%r10,%r9,4)
-  DB  235,225                             ; jmp           4829 <_sk_store_f32_sse41+0x6e>
+  DB  235,225                             ; jmp           4aae <_sk_store_f32_sse41+0x6e>
 
 PUBLIC _sk_clamp_x_sse41
 _sk_clamp_x_sse41 LABEL PROC
@@ -17843,7 +18596,7 @@
   DB  65,15,92,194                        ; subps         %xmm10,%xmm0
   DB  243,69,15,88,192                    ; addss         %xmm8,%xmm8
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
-  DB  243,68,15,89,13,225,34,0,0          ; mulss         0x22e1(%rip),%xmm9        # 6c20 <_sk_callback_sse41+0x1505>
+  DB  243,68,15,89,13,172,35,0,0          ; mulss         0x23ac(%rip),%xmm9        # 6f70 <_sk_callback_sse41+0x15d0>
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
   DB  68,15,89,200                        ; mulps         %xmm0,%xmm9
   DB  102,69,15,58,8,201,1                ; roundps       $0x1,%xmm9,%xmm9
@@ -17869,7 +18622,7 @@
   DB  65,15,92,202                        ; subps         %xmm10,%xmm1
   DB  243,69,15,88,192                    ; addss         %xmm8,%xmm8
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
-  DB  243,68,15,89,13,126,34,0,0          ; mulss         0x227e(%rip),%xmm9        # 6c24 <_sk_callback_sse41+0x1509>
+  DB  243,68,15,89,13,73,35,0,0           ; mulss         0x2349(%rip),%xmm9        # 6f74 <_sk_callback_sse41+0x15d4>
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
   DB  68,15,89,201                        ; mulps         %xmm1,%xmm9
   DB  102,69,15,58,8,201,1                ; roundps       $0x1,%xmm9,%xmm9
@@ -17889,7 +18642,7 @@
 _sk_clamp_x_1_sse41 LABEL PROC
   DB  69,15,87,192                        ; xorps         %xmm8,%xmm8
   DB  68,15,95,192                        ; maxps         %xmm0,%xmm8
-  DB  68,15,93,5,112,30,0,0               ; minps         0x1e70(%rip),%xmm8        # 6860 <_sk_callback_sse41+0x1145>
+  DB  68,15,93,5,59,31,0,0                ; minps         0x1f3b(%rip),%xmm8        # 6bb0 <_sk_callback_sse41+0x1210>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -17903,9 +18656,9 @@
 
 PUBLIC _sk_mirror_x_1_sse41
 _sk_mirror_x_1_sse41 LABEL PROC
-  DB  68,15,40,5,97,30,0,0                ; movaps        0x1e61(%rip),%xmm8        # 6870 <_sk_callback_sse41+0x1155>
+  DB  68,15,40,5,44,31,0,0                ; movaps        0x1f2c(%rip),%xmm8        # 6bc0 <_sk_callback_sse41+0x1220>
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,13,101,30,0,0              ; movaps        0x1e65(%rip),%xmm9        # 6880 <_sk_callback_sse41+0x1165>
+  DB  68,15,40,13,48,31,0,0               ; movaps        0x1f30(%rip),%xmm9        # 6bd0 <_sk_callback_sse41+0x1230>
   DB  68,15,89,200                        ; mulps         %xmm0,%xmm9
   DB  102,69,15,58,8,201,1                ; roundps       $0x1,%xmm9,%xmm9
   DB  69,15,88,201                        ; addps         %xmm9,%xmm9
@@ -17920,10 +18673,10 @@
 PUBLIC _sk_luminance_to_alpha_sse41
 _sk_luminance_to_alpha_sse41 LABEL PROC
   DB  15,40,218                           ; movaps        %xmm2,%xmm3
-  DB  15,89,5,68,30,0,0                   ; mulps         0x1e44(%rip),%xmm0        # 6890 <_sk_callback_sse41+0x1175>
-  DB  15,89,13,77,30,0,0                  ; mulps         0x1e4d(%rip),%xmm1        # 68a0 <_sk_callback_sse41+0x1185>
+  DB  15,89,5,15,31,0,0                   ; mulps         0x1f0f(%rip),%xmm0        # 6be0 <_sk_callback_sse41+0x1240>
+  DB  15,89,13,24,31,0,0                  ; mulps         0x1f18(%rip),%xmm1        # 6bf0 <_sk_callback_sse41+0x1250>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
-  DB  15,89,29,83,30,0,0                  ; mulps         0x1e53(%rip),%xmm3        # 68b0 <_sk_callback_sse41+0x1195>
+  DB  15,89,29,30,31,0,0                  ; mulps         0x1f1e(%rip),%xmm3        # 6c00 <_sk_callback_sse41+0x1260>
   DB  15,88,217                           ; addps         %xmm1,%xmm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
@@ -18190,9 +18943,9 @@
   DB  72,139,24                           ; mov           (%rax),%rbx
   DB  76,139,112,8                        ; mov           0x8(%rax),%r14
   DB  72,255,203                          ; dec           %rbx
-  DB  120,7                               ; js            4e9b <_sk_evenly_spaced_gradient_sse41+0x1a>
+  DB  120,7                               ; js            5120 <_sk_evenly_spaced_gradient_sse41+0x1a>
   DB  243,72,15,42,203                    ; cvtsi2ss      %rbx,%xmm1
-  DB  235,21                              ; jmp           4eb0 <_sk_evenly_spaced_gradient_sse41+0x2f>
+  DB  235,21                              ; jmp           5135 <_sk_evenly_spaced_gradient_sse41+0x2f>
   DB  73,137,217                          ; mov           %rbx,%r9
   DB  73,209,233                          ; shr           %r9
   DB  131,227,1                           ; and           $0x1,%ebx
@@ -18280,15 +19033,15 @@
 
 PUBLIC _sk_gauss_a_to_rgba_sse41
 _sk_gauss_a_to_rgba_sse41 LABEL PROC
-  DB  15,40,5,98,24,0,0                   ; movaps        0x1862(%rip),%xmm0        # 68c0 <_sk_callback_sse41+0x11a5>
+  DB  15,40,5,45,25,0,0                   ; movaps        0x192d(%rip),%xmm0        # 6c10 <_sk_callback_sse41+0x1270>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,104,24,0,0                  ; addps         0x1868(%rip),%xmm0        # 68d0 <_sk_callback_sse41+0x11b5>
+  DB  15,88,5,51,25,0,0                   ; addps         0x1933(%rip),%xmm0        # 6c20 <_sk_callback_sse41+0x1280>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,110,24,0,0                  ; addps         0x186e(%rip),%xmm0        # 68e0 <_sk_callback_sse41+0x11c5>
+  DB  15,88,5,57,25,0,0                   ; addps         0x1939(%rip),%xmm0        # 6c30 <_sk_callback_sse41+0x1290>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,116,24,0,0                  ; addps         0x1874(%rip),%xmm0        # 68f0 <_sk_callback_sse41+0x11d5>
+  DB  15,88,5,63,25,0,0                   ; addps         0x193f(%rip),%xmm0        # 6c40 <_sk_callback_sse41+0x12a0>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,122,24,0,0                  ; addps         0x187a(%rip),%xmm0        # 6900 <_sk_callback_sse41+0x11e5>
+  DB  15,88,5,69,25,0,0                   ; addps         0x1945(%rip),%xmm0        # 6c50 <_sk_callback_sse41+0x12b0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
@@ -18304,12 +19057,12 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,249,2                        ; cmp           $0x2,%r9
-  DB  114,50                              ; jb            50d9 <_sk_gradient_sse41+0x46>
+  DB  114,50                              ; jb            535e <_sk_gradient_sse41+0x46>
   DB  72,139,88,72                        ; mov           0x48(%rax),%rbx
   DB  73,255,201                          ; dec           %r9
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  15,40,21,83,24,0,0                  ; movaps        0x1853(%rip),%xmm2        # 6910 <_sk_callback_sse41+0x11f5>
+  DB  15,40,21,30,25,0,0                  ; movaps        0x191e(%rip),%xmm2        # 6c60 <_sk_callback_sse41+0x12c0>
   DB  243,15,16,27                        ; movss         (%rbx),%xmm3
   DB  15,198,219,0                        ; shufps        $0x0,%xmm3,%xmm3
   DB  15,194,216,2                        ; cmpleps       %xmm0,%xmm3
@@ -18317,7 +19070,7 @@
   DB  102,15,254,203                      ; paddd         %xmm3,%xmm1
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  73,255,201                          ; dec           %r9
-  DB  117,228                             ; jne           50bd <_sk_gradient_sse41+0x2a>
+  DB  117,228                             ; jne           5342 <_sk_gradient_sse41+0x2a>
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  69,137,202                          ; mov           %r9d,%r10d
   DB  73,193,233,32                       ; shr           $0x20,%r9
@@ -18443,26 +19196,26 @@
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,40,236                        ; movaps        %xmm12,%xmm13
   DB  69,15,89,237                        ; mulps         %xmm13,%xmm13
-  DB  68,15,40,21,244,21,0,0              ; movaps        0x15f4(%rip),%xmm10        # 6920 <_sk_callback_sse41+0x1205>
+  DB  68,15,40,21,191,22,0,0              ; movaps        0x16bf(%rip),%xmm10        # 6c70 <_sk_callback_sse41+0x12d0>
   DB  69,15,89,213                        ; mulps         %xmm13,%xmm10
-  DB  68,15,88,21,248,21,0,0              ; addps         0x15f8(%rip),%xmm10        # 6930 <_sk_callback_sse41+0x1215>
+  DB  68,15,88,21,195,22,0,0              ; addps         0x16c3(%rip),%xmm10        # 6c80 <_sk_callback_sse41+0x12e0>
   DB  69,15,89,213                        ; mulps         %xmm13,%xmm10
-  DB  68,15,88,21,252,21,0,0              ; addps         0x15fc(%rip),%xmm10        # 6940 <_sk_callback_sse41+0x1225>
+  DB  68,15,88,21,199,22,0,0              ; addps         0x16c7(%rip),%xmm10        # 6c90 <_sk_callback_sse41+0x12f0>
   DB  69,15,89,213                        ; mulps         %xmm13,%xmm10
-  DB  68,15,88,21,0,22,0,0                ; addps         0x1600(%rip),%xmm10        # 6950 <_sk_callback_sse41+0x1235>
+  DB  68,15,88,21,203,22,0,0              ; addps         0x16cb(%rip),%xmm10        # 6ca0 <_sk_callback_sse41+0x1300>
   DB  69,15,89,212                        ; mulps         %xmm12,%xmm10
   DB  65,15,194,195,1                     ; cmpltps       %xmm11,%xmm0
-  DB  68,15,40,29,255,21,0,0              ; movaps        0x15ff(%rip),%xmm11        # 6960 <_sk_callback_sse41+0x1245>
+  DB  68,15,40,29,202,22,0,0              ; movaps        0x16ca(%rip),%xmm11        # 6cb0 <_sk_callback_sse41+0x1310>
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  102,69,15,56,20,211                 ; blendvps      %xmm0,%xmm11,%xmm10
   DB  69,15,194,200,1                     ; cmpltps       %xmm8,%xmm9
-  DB  68,15,40,29,248,21,0,0              ; movaps        0x15f8(%rip),%xmm11        # 6970 <_sk_callback_sse41+0x1255>
+  DB  68,15,40,29,195,22,0,0              ; movaps        0x16c3(%rip),%xmm11        # 6cc0 <_sk_callback_sse41+0x1320>
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  102,69,15,56,20,211                 ; blendvps      %xmm0,%xmm11,%xmm10
   DB  15,40,193                           ; movaps        %xmm1,%xmm0
   DB  65,15,194,192,1                     ; cmpltps       %xmm8,%xmm0
-  DB  68,15,40,13,234,21,0,0              ; movaps        0x15ea(%rip),%xmm9        # 6980 <_sk_callback_sse41+0x1265>
+  DB  68,15,40,13,181,22,0,0              ; movaps        0x16b5(%rip),%xmm9        # 6cd0 <_sk_callback_sse41+0x1330>
   DB  69,15,92,202                        ; subps         %xmm10,%xmm9
   DB  102,69,15,56,20,209                 ; blendvps      %xmm0,%xmm9,%xmm10
   DB  69,15,194,194,7                     ; cmpordps      %xmm10,%xmm8
@@ -18484,7 +19237,7 @@
 PUBLIC _sk_save_xy_sse41
 _sk_save_xy_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,190,21,0,0               ; movaps        0x15be(%rip),%xmm8        # 6990 <_sk_callback_sse41+0x1275>
+  DB  68,15,40,5,137,22,0,0               ; movaps        0x1689(%rip),%xmm8        # 6ce0 <_sk_callback_sse41+0x1340>
   DB  15,17,0                             ; movups        %xmm0,(%rax)
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,88,200                        ; addps         %xmm8,%xmm9
@@ -18524,8 +19277,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,64,21,0,0                   ; addps         0x1540(%rip),%xmm0        # 69a0 <_sk_callback_sse41+0x1285>
-  DB  68,15,40,13,72,21,0,0               ; movaps        0x1548(%rip),%xmm9        # 69b0 <_sk_callback_sse41+0x1295>
+  DB  15,88,5,11,22,0,0                   ; addps         0x160b(%rip),%xmm0        # 6cf0 <_sk_callback_sse41+0x1350>
+  DB  68,15,40,13,19,22,0,0               ; movaps        0x1613(%rip),%xmm9        # 6d00 <_sk_callback_sse41+0x1360>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -18536,7 +19289,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,55,21,0,0                   ; addps         0x1537(%rip),%xmm0        # 69c0 <_sk_callback_sse41+0x12a5>
+  DB  15,88,5,2,22,0,0                    ; addps         0x1602(%rip),%xmm0        # 6d10 <_sk_callback_sse41+0x1370>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -18546,8 +19299,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,41,21,0,0                  ; addps         0x1529(%rip),%xmm1        # 69d0 <_sk_callback_sse41+0x12b5>
-  DB  68,15,40,13,49,21,0,0               ; movaps        0x1531(%rip),%xmm9        # 69e0 <_sk_callback_sse41+0x12c5>
+  DB  15,88,13,244,21,0,0                 ; addps         0x15f4(%rip),%xmm1        # 6d20 <_sk_callback_sse41+0x1380>
+  DB  68,15,40,13,252,21,0,0              ; movaps        0x15fc(%rip),%xmm9        # 6d30 <_sk_callback_sse41+0x1390>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -18558,7 +19311,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,31,21,0,0                  ; addps         0x151f(%rip),%xmm1        # 69f0 <_sk_callback_sse41+0x12d5>
+  DB  15,88,13,234,21,0,0                 ; addps         0x15ea(%rip),%xmm1        # 6d40 <_sk_callback_sse41+0x13a0>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -18568,13 +19321,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,18,21,0,0                   ; addps         0x1512(%rip),%xmm0        # 6a00 <_sk_callback_sse41+0x12e5>
-  DB  68,15,40,13,26,21,0,0               ; movaps        0x151a(%rip),%xmm9        # 6a10 <_sk_callback_sse41+0x12f5>
+  DB  15,88,5,221,21,0,0                  ; addps         0x15dd(%rip),%xmm0        # 6d50 <_sk_callback_sse41+0x13b0>
+  DB  68,15,40,13,229,21,0,0              ; movaps        0x15e5(%rip),%xmm9        # 6d60 <_sk_callback_sse41+0x13c0>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,22,21,0,0               ; mulps         0x1516(%rip),%xmm9        # 6a20 <_sk_callback_sse41+0x1305>
-  DB  68,15,88,13,30,21,0,0               ; addps         0x151e(%rip),%xmm9        # 6a30 <_sk_callback_sse41+0x1315>
+  DB  68,15,89,13,225,21,0,0              ; mulps         0x15e1(%rip),%xmm9        # 6d70 <_sk_callback_sse41+0x13d0>
+  DB  68,15,88,13,233,21,0,0              ; addps         0x15e9(%rip),%xmm9        # 6d80 <_sk_callback_sse41+0x13e0>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -18585,16 +19338,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,13,21,0,0                   ; addps         0x150d(%rip),%xmm0        # 6a40 <_sk_callback_sse41+0x1325>
-  DB  68,15,40,13,21,21,0,0               ; movaps        0x1515(%rip),%xmm9        # 6a50 <_sk_callback_sse41+0x1335>
+  DB  15,88,5,216,21,0,0                  ; addps         0x15d8(%rip),%xmm0        # 6d90 <_sk_callback_sse41+0x13f0>
+  DB  68,15,40,13,224,21,0,0              ; movaps        0x15e0(%rip),%xmm9        # 6da0 <_sk_callback_sse41+0x1400>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,25,21,0,0                ; movaps        0x1519(%rip),%xmm8        # 6a60 <_sk_callback_sse41+0x1345>
+  DB  68,15,40,5,228,21,0,0               ; movaps        0x15e4(%rip),%xmm8        # 6db0 <_sk_callback_sse41+0x1410>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,29,21,0,0                ; addps         0x151d(%rip),%xmm8        # 6a70 <_sk_callback_sse41+0x1355>
+  DB  68,15,88,5,232,21,0,0               ; addps         0x15e8(%rip),%xmm8        # 6dc0 <_sk_callback_sse41+0x1420>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,33,21,0,0                ; addps         0x1521(%rip),%xmm8        # 6a80 <_sk_callback_sse41+0x1365>
+  DB  68,15,88,5,236,21,0,0               ; addps         0x15ec(%rip),%xmm8        # 6dd0 <_sk_callback_sse41+0x1430>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,37,21,0,0                ; addps         0x1525(%rip),%xmm8        # 6a90 <_sk_callback_sse41+0x1375>
+  DB  68,15,88,5,240,21,0,0               ; addps         0x15f0(%rip),%xmm8        # 6de0 <_sk_callback_sse41+0x1440>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -18602,17 +19355,17 @@
 PUBLIC _sk_bicubic_p1x_sse41
 _sk_bicubic_p1x_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,31,21,0,0                ; movaps        0x151f(%rip),%xmm8        # 6aa0 <_sk_callback_sse41+0x1385>
+  DB  68,15,40,5,234,21,0,0               ; movaps        0x15ea(%rip),%xmm8        # 6df0 <_sk_callback_sse41+0x1450>
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,72,64                      ; movups        0x40(%rax),%xmm9
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,21,27,21,0,0               ; movaps        0x151b(%rip),%xmm10        # 6ab0 <_sk_callback_sse41+0x1395>
+  DB  68,15,40,21,230,21,0,0              ; movaps        0x15e6(%rip),%xmm10        # 6e00 <_sk_callback_sse41+0x1460>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,31,21,0,0               ; addps         0x151f(%rip),%xmm10        # 6ac0 <_sk_callback_sse41+0x13a5>
+  DB  68,15,88,21,234,21,0,0              ; addps         0x15ea(%rip),%xmm10        # 6e10 <_sk_callback_sse41+0x1470>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,27,21,0,0               ; addps         0x151b(%rip),%xmm10        # 6ad0 <_sk_callback_sse41+0x13b5>
+  DB  68,15,88,21,230,21,0,0              ; addps         0x15e6(%rip),%xmm10        # 6e20 <_sk_callback_sse41+0x1480>
   DB  68,15,17,144,128,0,0,0              ; movups        %xmm10,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -18622,11 +19375,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,14,21,0,0                   ; addps         0x150e(%rip),%xmm0        # 6ae0 <_sk_callback_sse41+0x13c5>
+  DB  15,88,5,217,21,0,0                  ; addps         0x15d9(%rip),%xmm0        # 6e30 <_sk_callback_sse41+0x1490>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,14,21,0,0                ; mulps         0x150e(%rip),%xmm8        # 6af0 <_sk_callback_sse41+0x13d5>
-  DB  68,15,88,5,22,21,0,0                ; addps         0x1516(%rip),%xmm8        # 6b00 <_sk_callback_sse41+0x13e5>
+  DB  68,15,89,5,217,21,0,0               ; mulps         0x15d9(%rip),%xmm8        # 6e40 <_sk_callback_sse41+0x14a0>
+  DB  68,15,88,5,225,21,0,0               ; addps         0x15e1(%rip),%xmm8        # 6e50 <_sk_callback_sse41+0x14b0>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -18637,13 +19390,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,4,21,0,0                   ; addps         0x1504(%rip),%xmm1        # 6b10 <_sk_callback_sse41+0x13f5>
-  DB  68,15,40,13,12,21,0,0               ; movaps        0x150c(%rip),%xmm9        # 6b20 <_sk_callback_sse41+0x1405>
+  DB  15,88,13,207,21,0,0                 ; addps         0x15cf(%rip),%xmm1        # 6e60 <_sk_callback_sse41+0x14c0>
+  DB  68,15,40,13,215,21,0,0              ; movaps        0x15d7(%rip),%xmm9        # 6e70 <_sk_callback_sse41+0x14d0>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,8,21,0,0                ; mulps         0x1508(%rip),%xmm9        # 6b30 <_sk_callback_sse41+0x1415>
-  DB  68,15,88,13,16,21,0,0               ; addps         0x1510(%rip),%xmm9        # 6b40 <_sk_callback_sse41+0x1425>
+  DB  68,15,89,13,211,21,0,0              ; mulps         0x15d3(%rip),%xmm9        # 6e80 <_sk_callback_sse41+0x14e0>
+  DB  68,15,88,13,219,21,0,0              ; addps         0x15db(%rip),%xmm9        # 6e90 <_sk_callback_sse41+0x14f0>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -18654,16 +19407,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,254,20,0,0                 ; addps         0x14fe(%rip),%xmm1        # 6b50 <_sk_callback_sse41+0x1435>
-  DB  68,15,40,13,6,21,0,0                ; movaps        0x1506(%rip),%xmm9        # 6b60 <_sk_callback_sse41+0x1445>
+  DB  15,88,13,201,21,0,0                 ; addps         0x15c9(%rip),%xmm1        # 6ea0 <_sk_callback_sse41+0x1500>
+  DB  68,15,40,13,209,21,0,0              ; movaps        0x15d1(%rip),%xmm9        # 6eb0 <_sk_callback_sse41+0x1510>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,10,21,0,0                ; movaps        0x150a(%rip),%xmm8        # 6b70 <_sk_callback_sse41+0x1455>
+  DB  68,15,40,5,213,21,0,0               ; movaps        0x15d5(%rip),%xmm8        # 6ec0 <_sk_callback_sse41+0x1520>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,14,21,0,0                ; addps         0x150e(%rip),%xmm8        # 6b80 <_sk_callback_sse41+0x1465>
+  DB  68,15,88,5,217,21,0,0               ; addps         0x15d9(%rip),%xmm8        # 6ed0 <_sk_callback_sse41+0x1530>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,18,21,0,0                ; addps         0x1512(%rip),%xmm8        # 6b90 <_sk_callback_sse41+0x1475>
+  DB  68,15,88,5,221,21,0,0               ; addps         0x15dd(%rip),%xmm8        # 6ee0 <_sk_callback_sse41+0x1540>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,22,21,0,0                ; addps         0x1516(%rip),%xmm8        # 6ba0 <_sk_callback_sse41+0x1485>
+  DB  68,15,88,5,225,21,0,0               ; addps         0x15e1(%rip),%xmm8        # 6ef0 <_sk_callback_sse41+0x1550>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -18671,17 +19424,17 @@
 PUBLIC _sk_bicubic_p1y_sse41
 _sk_bicubic_p1y_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,16,21,0,0                ; movaps        0x1510(%rip),%xmm8        # 6bb0 <_sk_callback_sse41+0x1495>
+  DB  68,15,40,5,219,21,0,0               ; movaps        0x15db(%rip),%xmm8        # 6f00 <_sk_callback_sse41+0x1560>
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,72,96                      ; movups        0x60(%rax),%xmm9
   DB  65,15,88,200                        ; addps         %xmm8,%xmm1
-  DB  68,15,40,21,11,21,0,0               ; movaps        0x150b(%rip),%xmm10        # 6bc0 <_sk_callback_sse41+0x14a5>
+  DB  68,15,40,21,214,21,0,0              ; movaps        0x15d6(%rip),%xmm10        # 6f10 <_sk_callback_sse41+0x1570>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,15,21,0,0               ; addps         0x150f(%rip),%xmm10        # 6bd0 <_sk_callback_sse41+0x14b5>
+  DB  68,15,88,21,218,21,0,0              ; addps         0x15da(%rip),%xmm10        # 6f20 <_sk_callback_sse41+0x1580>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,11,21,0,0               ; addps         0x150b(%rip),%xmm10        # 6be0 <_sk_callback_sse41+0x14c5>
+  DB  68,15,88,21,214,21,0,0              ; addps         0x15d6(%rip),%xmm10        # 6f30 <_sk_callback_sse41+0x1590>
   DB  68,15,17,144,160,0,0,0              ; movups        %xmm10,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -18691,11 +19444,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,253,20,0,0                 ; addps         0x14fd(%rip),%xmm1        # 6bf0 <_sk_callback_sse41+0x14d5>
+  DB  15,88,13,200,21,0,0                 ; addps         0x15c8(%rip),%xmm1        # 6f40 <_sk_callback_sse41+0x15a0>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,253,20,0,0               ; mulps         0x14fd(%rip),%xmm8        # 6c00 <_sk_callback_sse41+0x14e5>
-  DB  68,15,88,5,5,21,0,0                 ; addps         0x1505(%rip),%xmm8        # 6c10 <_sk_callback_sse41+0x14f5>
+  DB  68,15,89,5,200,21,0,0               ; mulps         0x15c8(%rip),%xmm8        # 6f50 <_sk_callback_sse41+0x15b0>
+  DB  68,15,88,5,208,21,0,0               ; addps         0x15d0(%rip),%xmm8        # 6f60 <_sk_callback_sse41+0x15c0>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -18913,11 +19666,11 @@
   DB  128,191,0,0,128,191,0               ; cmpb          $0x0,-0x40800000(%rdi)
   DB  0,224                               ; add           %ah,%al
   DB  64,0,0                              ; add           %al,(%rax)
-  DB  224,64                              ; loopne        59c8 <.literal16+0x1d8>
+  DB  224,64                              ; loopne        5c48 <.literal16+0x1d8>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,64                              ; loopne        59cc <.literal16+0x1dc>
+  DB  224,64                              ; loopne        5c4c <.literal16+0x1dc>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,64                              ; loopne        59d0 <.literal16+0x1e0>
+  DB  224,64                              ; loopne        5c50 <.literal16+0x1e0>
   DB  154                                 ; (bad)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
@@ -18937,13 +19690,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 59f1 <.literal16+0x201>
+  DB  71,225,61                           ; rex.RXB       loope 5c71 <.literal16+0x201>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 59f5 <.literal16+0x205>
+  DB  71,225,61                           ; rex.RXB       loope 5c75 <.literal16+0x205>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 59f9 <.literal16+0x209>
+  DB  71,225,61                           ; rex.RXB       loope 5c79 <.literal16+0x209>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 59fd <.literal16+0x20d>
+  DB  71,225,61                           ; rex.RXB       loope 5c7d <.literal16+0x20d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -18968,13 +19721,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5a31 <.literal16+0x241>
+  DB  71,225,61                           ; rex.RXB       loope 5cb1 <.literal16+0x241>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5a35 <.literal16+0x245>
+  DB  71,225,61                           ; rex.RXB       loope 5cb5 <.literal16+0x245>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5a39 <.literal16+0x249>
+  DB  71,225,61                           ; rex.RXB       loope 5cb9 <.literal16+0x249>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5a3d <.literal16+0x24d>
+  DB  71,225,61                           ; rex.RXB       loope 5cbd <.literal16+0x24d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -18999,13 +19752,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5a71 <.literal16+0x281>
+  DB  71,225,61                           ; rex.RXB       loope 5cf1 <.literal16+0x281>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5a75 <.literal16+0x285>
+  DB  71,225,61                           ; rex.RXB       loope 5cf5 <.literal16+0x285>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5a79 <.literal16+0x289>
+  DB  71,225,61                           ; rex.RXB       loope 5cf9 <.literal16+0x289>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5a7d <.literal16+0x28d>
+  DB  71,225,61                           ; rex.RXB       loope 5cfd <.literal16+0x28d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -19030,13 +19783,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5ab1 <.literal16+0x2c1>
+  DB  71,225,61                           ; rex.RXB       loope 5d31 <.literal16+0x2c1>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5ab5 <.literal16+0x2c5>
+  DB  71,225,61                           ; rex.RXB       loope 5d35 <.literal16+0x2c5>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5ab9 <.literal16+0x2c9>
+  DB  71,225,61                           ; rex.RXB       loope 5d39 <.literal16+0x2c9>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5abd <.literal16+0x2cd>
+  DB  71,225,61                           ; rex.RXB       loope 5d3d <.literal16+0x2cd>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -19053,10 +19806,10 @@
   DB  0,1                                 ; add           %al,(%rcx)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005aa8 <_sk_callback_sse41+0xa00038d>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005d28 <_sk_callback_sse41+0xa000388>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3005ab0 <_sk_callback_sse41+0x3000395>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3005d30 <_sk_callback_sse41+0x3000390>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -19075,11 +19828,11 @@
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,127                    ; add           %al,0x7f00003f(%rax)
   DB  67,0,0                              ; rex.XB        add %al,(%r8)
-  DB  127,67                              ; jg            5b1b <.literal16+0x32b>
+  DB  127,67                              ; jg            5d9b <.literal16+0x32b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            5b1f <.literal16+0x32f>
+  DB  127,67                              ; jg            5d9f <.literal16+0x32f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            5b23 <.literal16+0x333>
+  DB  127,67                              ; jg            5da3 <.literal16+0x333>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -19361,13 +20114,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        5d59 <.literal16+0x569>
+  DB  224,7                               ; loopne        5fd9 <.literal16+0x569>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        5d5d <.literal16+0x56d>
+  DB  224,7                               ; loopne        5fdd <.literal16+0x56d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        5d61 <.literal16+0x571>
+  DB  224,7                               ; loopne        5fe1 <.literal16+0x571>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        5d65 <.literal16+0x575>
+  DB  224,7                               ; loopne        5fe5 <.literal16+0x575>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -19401,10 +20154,10 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005da8 <_sk_callback_sse41+0xa00068d>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a006028 <_sk_callback_sse41+0xa000688>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3005db0 <_sk_callback_sse41+0x3000695>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006030 <_sk_callback_sse41+0x3000690>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -19459,11 +20212,11 @@
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            5e7b <.literal16+0x68b>
+  DB  127,67                              ; jg            60fb <.literal16+0x68b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            5e7f <.literal16+0x68f>
+  DB  127,67                              ; jg            60ff <.literal16+0x68f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            5e83 <.literal16+0x693>
+  DB  127,67                              ; jg            6103 <.literal16+0x693>
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,129                          ; cmpb          $0x81,(%rbx)
   DB  128,128,59,129,128,128,59           ; addb          $0x3b,-0x7f7f7ec5(%rax)
@@ -19478,16 +20231,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5e74 <.literal16+0x684>
+  DB  127,0                               ; jg            60f4 <.literal16+0x684>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5e78 <.literal16+0x688>
+  DB  127,0                               ; jg            60f8 <.literal16+0x688>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5e7c <.literal16+0x68c>
+  DB  127,0                               ; jg            60fc <.literal16+0x68c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5e80 <.literal16+0x690>
+  DB  127,0                               ; jg            6100 <.literal16+0x690>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -19496,7 +20249,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5f05 <.literal16+0x715>
+  DB  119,115                             ; ja            6185 <.literal16+0x715>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -19507,7 +20260,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           5e69 <.literal16+0x679>
+  DB  117,191                             ; jne           60e9 <.literal16+0x679>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -19519,7 +20272,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a39eaa <_sk_callback_sse41+0xffffffffe9a3478f>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a12a <_sk_callback_sse41+0xffffffffe9a3478a>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -19574,16 +20327,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5f44 <.literal16+0x754>
+  DB  127,0                               ; jg            61c4 <.literal16+0x754>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5f48 <.literal16+0x758>
+  DB  127,0                               ; jg            61c8 <.literal16+0x758>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5f4c <.literal16+0x75c>
+  DB  127,0                               ; jg            61cc <.literal16+0x75c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5f50 <.literal16+0x760>
+  DB  127,0                               ; jg            61d0 <.literal16+0x760>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -19592,7 +20345,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5fd5 <.literal16+0x7e5>
+  DB  119,115                             ; ja            6255 <.literal16+0x7e5>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -19603,7 +20356,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           5f39 <.literal16+0x749>
+  DB  117,191                             ; jne           61b9 <.literal16+0x749>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -19615,7 +20368,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a39f7a <_sk_callback_sse41+0xffffffffe9a3485f>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a1fa <_sk_callback_sse41+0xffffffffe9a3485a>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -19670,16 +20423,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6014 <.literal16+0x824>
+  DB  127,0                               ; jg            6294 <.literal16+0x824>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6018 <.literal16+0x828>
+  DB  127,0                               ; jg            6298 <.literal16+0x828>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            601c <.literal16+0x82c>
+  DB  127,0                               ; jg            629c <.literal16+0x82c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6020 <.literal16+0x830>
+  DB  127,0                               ; jg            62a0 <.literal16+0x830>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -19688,7 +20441,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            60a5 <.literal16+0x8b5>
+  DB  119,115                             ; ja            6325 <.literal16+0x8b5>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -19699,7 +20452,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           6009 <.literal16+0x819>
+  DB  117,191                             ; jne           6289 <.literal16+0x819>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -19711,7 +20464,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a04a <_sk_callback_sse41+0xffffffffe9a3492f>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a2ca <_sk_callback_sse41+0xffffffffe9a3492a>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -19766,16 +20519,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            60e4 <.literal16+0x8f4>
+  DB  127,0                               ; jg            6364 <.literal16+0x8f4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            60e8 <.literal16+0x8f8>
+  DB  127,0                               ; jg            6368 <.literal16+0x8f8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            60ec <.literal16+0x8fc>
+  DB  127,0                               ; jg            636c <.literal16+0x8fc>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            60f0 <.literal16+0x900>
+  DB  127,0                               ; jg            6370 <.literal16+0x900>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -19784,7 +20537,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6175 <.literal16+0x985>
+  DB  119,115                             ; ja            63f5 <.literal16+0x985>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -19795,7 +20548,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           60d9 <.literal16+0x8e9>
+  DB  117,191                             ; jne           6359 <.literal16+0x8e9>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -19807,7 +20560,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a11a <_sk_callback_sse41+0xffffffffe9a349ff>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a39a <_sk_callback_sse41+0xffffffffe9a349fa>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -19858,13 +20611,13 @@
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
-  DB  127,67                              ; jg            61f7 <.literal16+0xa07>
+  DB  127,67                              ; jg            6477 <.literal16+0xa07>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            61fb <.literal16+0xa0b>
+  DB  127,67                              ; jg            647b <.literal16+0xa0b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            61ff <.literal16+0xa0f>
+  DB  127,67                              ; jg            647f <.literal16+0xa0f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6203 <.literal16+0xa13>
+  DB  127,67                              ; jg            6483 <.literal16+0xa13>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -19911,16 +20664,16 @@
   DB  128,3,62                            ; addb          $0x3e,(%rbx)
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6283 <.literal16+0xa93>
+  DB  118,63                              ; jbe           6503 <.literal16+0xa93>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6287 <.literal16+0xa97>
+  DB  118,63                              ; jbe           6507 <.literal16+0xa97>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           628b <.literal16+0xa9b>
+  DB  118,63                              ; jbe           650b <.literal16+0xa9b>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           628f <.literal16+0xa9f>
+  DB  118,63                              ; jbe           650f <.literal16+0xa9f>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
@@ -19949,11 +20702,11 @@
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            62fb <.literal16+0xb0b>
+  DB  127,67                              ; jg            657b <.literal16+0xb0b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            62ff <.literal16+0xb0f>
+  DB  127,67                              ; jg            657f <.literal16+0xb0f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6303 <.literal16+0xb13>
+  DB  127,67                              ; jg            6583 <.literal16+0xb13>
   DB  0,4,0                               ; add           %al,(%rax,%rax,1)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,0                                 ; add           %al,(%rax)
@@ -20011,7 +20764,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006380 <_sk_callback_sse41+0x3000c65>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006600 <_sk_callback_sse41+0x3000c60>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -20040,13 +20793,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        63b9 <.literal16+0xbc9>
+  DB  224,7                               ; loopne        6639 <.literal16+0xbc9>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        63bd <.literal16+0xbcd>
+  DB  224,7                               ; loopne        663d <.literal16+0xbcd>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        63c1 <.literal16+0xbd1>
+  DB  224,7                               ; loopne        6641 <.literal16+0xbd1>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        63c5 <.literal16+0xbd5>
+  DB  224,7                               ; loopne        6645 <.literal16+0xbd5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -20092,13 +20845,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6429 <.literal16+0xc39>
+  DB  224,7                               ; loopne        66a9 <.literal16+0xc39>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        642d <.literal16+0xc3d>
+  DB  224,7                               ; loopne        66ad <.literal16+0xc3d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6431 <.literal16+0xc41>
+  DB  224,7                               ; loopne        66b1 <.literal16+0xc41>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6435 <.literal16+0xc45>
+  DB  224,7                               ; loopne        66b5 <.literal16+0xc45>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -20144,13 +20897,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6499 <.literal16+0xca9>
+  DB  224,7                               ; loopne        6719 <.literal16+0xca9>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        649d <.literal16+0xcad>
+  DB  224,7                               ; loopne        671d <.literal16+0xcad>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        64a1 <.literal16+0xcb1>
+  DB  224,7                               ; loopne        6721 <.literal16+0xcb1>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        64a5 <.literal16+0xcb5>
+  DB  224,7                               ; loopne        6725 <.literal16+0xcb5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -20188,13 +20941,13 @@
   DB  65,0,0                              ; add           %al,(%r8)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            6536 <.literal16+0xd46>
+  DB  124,66                              ; jl            67b6 <.literal16+0xd46>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            653a <.literal16+0xd4a>
+  DB  124,66                              ; jl            67ba <.literal16+0xd4a>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            653e <.literal16+0xd4e>
+  DB  124,66                              ; jl            67be <.literal16+0xd4e>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            6542 <.literal16+0xd52>
+  DB  124,66                              ; jl            67c2 <.literal16+0xd52>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,240                               ; add           %dh,%al
@@ -20328,13 +21081,13 @@
   DB  136,136,61,137,136,136              ; mov           %cl,-0x777776c3(%rax)
   DB  61,137,136,136,61                   ; cmp           $0x3d888889,%eax
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            66c5 <.literal16+0xed5>
+  DB  112,65                              ; jo            6945 <.literal16+0xed5>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            66c9 <.literal16+0xed9>
+  DB  112,65                              ; jo            6949 <.literal16+0xed9>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            66cd <.literal16+0xedd>
+  DB  112,65                              ; jo            694d <.literal16+0xedd>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            66d1 <.literal16+0xee1>
+  DB  112,65                              ; jo            6951 <.literal16+0xee1>
   DB  255,0                               ; incl          (%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  255,0                               ; incl          (%rax)
@@ -20349,7 +21102,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 30066c0 <_sk_callback_sse41+0x3000fa5>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006940 <_sk_callback_sse41+0x3000fa0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -20376,7 +21129,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006700 <_sk_callback_sse41+0x3000fe5>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006980 <_sk_callback_sse41+0x3000fe0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -20403,7 +21156,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006740 <_sk_callback_sse41+0x3001025>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 30069c0 <_sk_callback_sse41+0x3001020>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -20418,11 +21171,99 @@
   DB  255,0                               ; incl          (%rax)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            679b <.literal16+0xfab>
+  DB  127,67                              ; jg            6a1b <.literal16+0xfab>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            679f <.literal16+0xfaf>
+  DB  127,67                              ; jg            6a1f <.literal16+0xfaf>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            67a3 <.literal16+0xfb3>
+  DB  127,67                              ; jg            6a23 <.literal16+0xfb3>
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
+  DB  128,59,129                          ; cmpb          $0x81,(%rbx)
+  DB  128,128,59,1,255,255,255            ; addb          $0xff,-0xfec5(%rax)
+  DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006a10 <_sk_callback_sse41+0x3001070>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,6                               ; incl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,10                              ; decl          (%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,14                              ; decl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
+  DB  128,59,129                          ; cmpb          $0x81,(%rbx)
+  DB  128,128,59,1,255,255,255            ; addb          $0xff,-0xfec5(%rax)
+  DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006a50 <_sk_callback_sse41+0x30010b0>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,6                               ; incl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,10                              ; decl          (%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,14                              ; decl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
+  DB  128,59,129                          ; cmpb          $0x81,(%rbx)
+  DB  128,128,59,1,255,255,255            ; addb          $0xff,-0xfec5(%rax)
+  DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006a90 <_sk_callback_sse41+0x30010f0>
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,6                               ; incl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,10                              ; decl          (%rdx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,14                              ; decl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,127,67                            ; add           %bh,0x43(%rdi)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  127,67                              ; jg            6aeb <.literal16+0x107b>
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  127,67                              ; jg            6aef <.literal16+0x107f>
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  127,67                              ; jg            6af3 <.literal16+0x1083>
   DB  0,128,0,0,0,128                     ; add           %al,-0x80000000(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,128,0,0,0,128                     ; add           %al,-0x80000000(%rax)
@@ -20517,13 +21358,13 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  255                                 ; (bad)
-  DB  127,71                              ; jg            689b <.literal16+0x10ab>
+  DB  127,71                              ; jg            6beb <.literal16+0x117b>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            689f <.literal16+0x10af>
+  DB  127,71                              ; jg            6bef <.literal16+0x117f>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            68a3 <.literal16+0x10b3>
+  DB  127,71                              ; jg            6bf3 <.literal16+0x1183>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            68a7 <.literal16+0x10b7>
+  DB  127,71                              ; jg            6bf7 <.literal16+0x1187>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -20569,10 +21410,10 @@
   DB  61,152,221,147,61                   ; cmp           $0x3d93dd98,%eax
   DB  152                                 ; cwtl
   DB  221,147,61,45,16,17                 ; fstl          0x11102d3d(%rbx)
-  DB  192,45,16,17,192,45,16              ; shrb          $0x10,0x2dc01110(%rip)        # 2dc079da <_sk_callback_sse41+0x2dc022bf>
+  DB  192,45,16,17,192,45,16              ; shrb          $0x10,0x2dc01110(%rip)        # 2dc07d2a <_sk_callback_sse41+0x2dc0238a>
   DB  17,192                              ; adc           %eax,%eax
   DB  45,16,17,192,18                     ; sub           $0x12c01110,%eax
-  DB  120,57                              ; js            690c <.literal16+0x111c>
+  DB  120,57                              ; js            6c5c <.literal16+0x11ec>
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
@@ -20694,11 +21535,11 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,114                          ; cmpb          $0x72,(%rdi)
   DB  28,199                              ; sbb           $0xc7,%al
-  DB  62,114,28                           ; jb,pt         6a42 <.literal16+0x1252>
+  DB  62,114,28                           ; jb,pt         6d92 <.literal16+0x1322>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6a46 <.literal16+0x1256>
+  DB  62,114,28                           ; jb,pt         6d96 <.literal16+0x1326>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6a4a <.literal16+0x125a>
+  DB  62,114,28                           ; jb,pt         6d9a <.literal16+0x132a>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -20742,7 +21583,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63f8d5 <_sk_callback_sse41+0x3d63a1ba>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63fc25 <_sk_callback_sse41+0x3d63a285>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -20768,7 +21609,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63f915 <_sk_callback_sse41+0x3d63a1fa>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63fc65 <_sk_callback_sse41+0x3d63a2c5>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -20777,13 +21618,13 @@
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
-  DB  114,28                              ; jb            6b0e <.literal16+0x131e>
+  DB  114,28                              ; jb            6e5e <.literal16+0x13ee>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6b12 <.literal16+0x1322>
+  DB  62,114,28                           ; jb,pt         6e62 <.literal16+0x13f2>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6b16 <.literal16+0x1326>
+  DB  62,114,28                           ; jb,pt         6e66 <.literal16+0x13f6>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6b1a <.literal16+0x132a>
+  DB  62,114,28                           ; jb,pt         6e6a <.literal16+0x13fa>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -20804,11 +21645,11 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,114                          ; cmpb          $0x72,(%rdi)
   DB  28,199                              ; sbb           $0xc7,%al
-  DB  62,114,28                           ; jb,pt         6b52 <.literal16+0x1362>
+  DB  62,114,28                           ; jb,pt         6ea2 <.literal16+0x1432>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6b56 <.literal16+0x1366>
+  DB  62,114,28                           ; jb,pt         6ea6 <.literal16+0x1436>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6b5a <.literal16+0x136a>
+  DB  62,114,28                           ; jb,pt         6eaa <.literal16+0x143a>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -20852,7 +21693,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63f9e5 <_sk_callback_sse41+0x3d63a2ca>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63fd35 <_sk_callback_sse41+0x3d63a395>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -20878,7 +21719,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63fa25 <_sk_callback_sse41+0x3d63a30a>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63fd75 <_sk_callback_sse41+0x3d63a3d5>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -20887,13 +21728,13 @@
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
-  DB  114,28                              ; jb            6c1e <.literal16+0x142e>
+  DB  114,28                              ; jb            6f6e <.literal16+0x14fe>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6c22 <_sk_callback_sse41+0x1507>
+  DB  62,114,28                           ; jb,pt         6f72 <_sk_callback_sse41+0x15d2>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6c26 <_sk_callback_sse41+0x150b>
+  DB  62,114,28                           ; jb,pt         6f76 <_sk_callback_sse41+0x15d6>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6c2a <_sk_callback_sse41+0x150f>
+  DB  62,114,28                           ; jb,pt         6f7a <_sk_callback_sse41+0x15da>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -20994,7 +21835,7 @@
   DB  102,15,110,194                      ; movd          %edx,%xmm0
   DB  102,15,112,192,0                    ; pshufd        $0x0,%xmm0,%xmm0
   DB  15,91,200                           ; cvtdq2ps      %xmm0,%xmm1
-  DB  15,40,21,168,91,0,0                 ; movaps        0x5ba8(%rip),%xmm2        # 5cd0 <_sk_callback_sse2+0xd0>
+  DB  15,40,21,104,94,0,0                 ; movaps        0x5e68(%rip),%xmm2        # 5f90 <_sk_callback_sse2+0xcd>
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  15,16,7                             ; movups        (%rdi),%xmm0
   DB  15,88,193                           ; addps         %xmm1,%xmm0
@@ -21003,7 +21844,7 @@
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,21,151,91,0,0                 ; movaps        0x5b97(%rip),%xmm2        # 5ce0 <_sk_callback_sse2+0xe0>
+  DB  15,40,21,87,94,0,0                  ; movaps        0x5e57(%rip),%xmm2        # 5fa0 <_sk_callback_sse2+0xdd>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
   DB  15,87,237                           ; xorps         %xmm5,%xmm5
@@ -21021,14 +21862,14 @@
   DB  102,68,15,110,193                   ; movd          %ecx,%xmm8
   DB  102,69,15,112,192,0                 ; pshufd        $0x0,%xmm8,%xmm8
   DB  102,69,15,239,193                   ; pxor          %xmm9,%xmm8
-  DB  102,68,15,111,21,101,91,0,0         ; movdqa        0x5b65(%rip),%xmm10        # 5cf0 <_sk_callback_sse2+0xf0>
+  DB  102,68,15,111,21,37,94,0,0          ; movdqa        0x5e25(%rip),%xmm10        # 5fb0 <_sk_callback_sse2+0xed>
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
   DB  102,69,15,219,218                   ; pand          %xmm10,%xmm11
   DB  102,65,15,114,243,5                 ; pslld         $0x5,%xmm11
   DB  102,69,15,219,209                   ; pand          %xmm9,%xmm10
   DB  102,65,15,114,242,4                 ; pslld         $0x4,%xmm10
-  DB  102,68,15,111,37,81,91,0,0          ; movdqa        0x5b51(%rip),%xmm12        # 5d00 <_sk_callback_sse2+0x100>
-  DB  102,68,15,111,45,88,91,0,0          ; movdqa        0x5b58(%rip),%xmm13        # 5d10 <_sk_callback_sse2+0x110>
+  DB  102,68,15,111,37,17,94,0,0          ; movdqa        0x5e11(%rip),%xmm12        # 5fc0 <_sk_callback_sse2+0xfd>
+  DB  102,68,15,111,45,24,94,0,0          ; movdqa        0x5e18(%rip),%xmm13        # 5fd0 <_sk_callback_sse2+0x10d>
   DB  102,69,15,111,240                   ; movdqa        %xmm8,%xmm14
   DB  102,69,15,219,245                   ; pand          %xmm13,%xmm14
   DB  102,65,15,114,246,2                 ; pslld         $0x2,%xmm14
@@ -21044,8 +21885,8 @@
   DB  102,69,15,235,245                   ; por           %xmm13,%xmm14
   DB  102,69,15,235,240                   ; por           %xmm8,%xmm14
   DB  69,15,91,198                        ; cvtdq2ps      %xmm14,%xmm8
-  DB  68,15,89,5,19,91,0,0                ; mulps         0x5b13(%rip),%xmm8        # 5d20 <_sk_callback_sse2+0x120>
-  DB  68,15,88,5,27,91,0,0                ; addps         0x5b1b(%rip),%xmm8        # 5d30 <_sk_callback_sse2+0x130>
+  DB  68,15,89,5,211,93,0,0               ; mulps         0x5dd3(%rip),%xmm8        # 5fe0 <_sk_callback_sse2+0x11d>
+  DB  68,15,88,5,219,93,0,0               ; addps         0x5ddb(%rip),%xmm8        # 5ff0 <_sk_callback_sse2+0x12d>
   DB  243,68,15,16,16                     ; movss         (%rax),%xmm10
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
@@ -21112,7 +21953,7 @@
 PUBLIC _sk_srcatop_sse2
 _sk_srcatop_sse2 LABEL PROC
   DB  15,89,199                           ; mulps         %xmm7,%xmm0
-  DB  68,15,40,5,117,90,0,0               ; movaps        0x5a75(%rip),%xmm8        # 5d40 <_sk_callback_sse2+0x140>
+  DB  68,15,40,5,53,93,0,0                ; movaps        0x5d35(%rip),%xmm8        # 6000 <_sk_callback_sse2+0x13d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -21135,7 +21976,7 @@
 _sk_dstatop_sse2 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
   DB  68,15,89,196                        ; mulps         %xmm4,%xmm8
-  DB  68,15,40,13,56,90,0,0               ; movaps        0x5a38(%rip),%xmm9        # 5d50 <_sk_callback_sse2+0x150>
+  DB  68,15,40,13,248,92,0,0              ; movaps        0x5cf8(%rip),%xmm9        # 6010 <_sk_callback_sse2+0x14d>
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
@@ -21176,7 +22017,7 @@
 
 PUBLIC _sk_srcout_sse2
 _sk_srcout_sse2 LABEL PROC
-  DB  68,15,40,5,220,89,0,0               ; movaps        0x59dc(%rip),%xmm8        # 5d60 <_sk_callback_sse2+0x160>
+  DB  68,15,40,5,156,92,0,0               ; movaps        0x5c9c(%rip),%xmm8        # 6020 <_sk_callback_sse2+0x15d>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
@@ -21187,7 +22028,7 @@
 
 PUBLIC _sk_dstout_sse2
 _sk_dstout_sse2 LABEL PROC
-  DB  68,15,40,5,204,89,0,0               ; movaps        0x59cc(%rip),%xmm8        # 5d70 <_sk_callback_sse2+0x170>
+  DB  68,15,40,5,140,92,0,0               ; movaps        0x5c8c(%rip),%xmm8        # 6030 <_sk_callback_sse2+0x16d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  15,89,196                           ; mulps         %xmm4,%xmm0
@@ -21202,7 +22043,7 @@
 
 PUBLIC _sk_srcover_sse2
 _sk_srcover_sse2 LABEL PROC
-  DB  68,15,40,5,175,89,0,0               ; movaps        0x59af(%rip),%xmm8        # 5d80 <_sk_callback_sse2+0x180>
+  DB  68,15,40,5,111,92,0,0               ; movaps        0x5c6f(%rip),%xmm8        # 6040 <_sk_callback_sse2+0x17d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -21220,7 +22061,7 @@
 
 PUBLIC _sk_dstover_sse2
 _sk_dstover_sse2 LABEL PROC
-  DB  68,15,40,5,131,89,0,0               ; movaps        0x5983(%rip),%xmm8        # 5d90 <_sk_callback_sse2+0x190>
+  DB  68,15,40,5,67,92,0,0                ; movaps        0x5c43(%rip),%xmm8        # 6050 <_sk_callback_sse2+0x18d>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -21244,7 +22085,7 @@
 
 PUBLIC _sk_multiply_sse2
 _sk_multiply_sse2 LABEL PROC
-  DB  68,15,40,5,87,89,0,0                ; movaps        0x5957(%rip),%xmm8        # 5da0 <_sk_callback_sse2+0x1a0>
+  DB  68,15,40,5,23,92,0,0                ; movaps        0x5c17(%rip),%xmm8        # 6060 <_sk_callback_sse2+0x19d>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
@@ -21313,7 +22154,7 @@
 PUBLIC _sk_xor__sse2
 _sk_xor__sse2 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
-  DB  15,40,29,140,88,0,0                 ; movaps        0x588c(%rip),%xmm3        # 5db0 <_sk_callback_sse2+0x1b0>
+  DB  15,40,29,76,91,0,0                  ; movaps        0x5b4c(%rip),%xmm3        # 6070 <_sk_callback_sse2+0x1ad>
   DB  68,15,40,203                        ; movaps        %xmm3,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
@@ -21359,7 +22200,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,95,209                        ; maxps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,247,87,0,0                 ; movaps        0x57f7(%rip),%xmm2        # 5dc0 <_sk_callback_sse2+0x1c0>
+  DB  15,40,21,183,90,0,0                 ; movaps        0x5ab7(%rip),%xmm2        # 6080 <_sk_callback_sse2+0x1bd>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -21391,7 +22232,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,156,87,0,0                 ; movaps        0x579c(%rip),%xmm2        # 5dd0 <_sk_callback_sse2+0x1d0>
+  DB  15,40,21,92,90,0,0                  ; movaps        0x5a5c(%rip),%xmm2        # 6090 <_sk_callback_sse2+0x1cd>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -21426,7 +22267,7 @@
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,54,87,0,0                  ; movaps        0x5736(%rip),%xmm2        # 5de0 <_sk_callback_sse2+0x1e0>
+  DB  15,40,21,246,89,0,0                 ; movaps        0x59f6(%rip),%xmm2        # 60a0 <_sk_callback_sse2+0x1dd>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -21452,7 +22293,7 @@
   DB  15,89,214                           ; mulps         %xmm6,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,246,86,0,0                 ; movaps        0x56f6(%rip),%xmm2        # 5df0 <_sk_callback_sse2+0x1f0>
+  DB  15,40,21,182,89,0,0                 ; movaps        0x59b6(%rip),%xmm2        # 60b0 <_sk_callback_sse2+0x1ed>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -21463,7 +22304,7 @@
 PUBLIC _sk_colorburn_sse2
 _sk_colorburn_sse2 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,21,233,86,0,0              ; movaps        0x56e9(%rip),%xmm10        # 5e00 <_sk_callback_sse2+0x200>
+  DB  68,15,40,21,169,89,0,0              ; movaps        0x59a9(%rip),%xmm10        # 60c0 <_sk_callback_sse2+0x1fd>
   DB  69,15,40,202                        ; movaps        %xmm10,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  69,15,40,217                        ; movaps        %xmm9,%xmm11
@@ -21555,7 +22396,7 @@
 PUBLIC _sk_colordodge_sse2
 _sk_colordodge_sse2 LABEL PROC
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
-  DB  68,15,40,21,159,85,0,0              ; movaps        0x559f(%rip),%xmm10        # 5e10 <_sk_callback_sse2+0x210>
+  DB  68,15,40,21,95,88,0,0               ; movaps        0x585f(%rip),%xmm10        # 60d0 <_sk_callback_sse2+0x20d>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  69,15,40,227                        ; movaps        %xmm11,%xmm12
@@ -21648,7 +22489,7 @@
   DB  15,41,52,36                         ; movaps        %xmm6,(%rsp)
   DB  15,40,245                           ; movaps        %xmm5,%xmm6
   DB  15,40,236                           ; movaps        %xmm4,%xmm5
-  DB  68,15,40,29,81,84,0,0               ; movaps        0x5451(%rip),%xmm11        # 5e20 <_sk_callback_sse2+0x220>
+  DB  68,15,40,29,17,87,0,0               ; movaps        0x5711(%rip),%xmm11        # 60e0 <_sk_callback_sse2+0x21d>
   DB  69,15,40,211                        ; movaps        %xmm11,%xmm10
   DB  68,15,92,215                        ; subps         %xmm7,%xmm10
   DB  69,15,40,194                        ; movaps        %xmm10,%xmm8
@@ -21735,7 +22576,7 @@
 _sk_overlay_sse2 LABEL PROC
   DB  68,15,40,193                        ; movaps        %xmm1,%xmm8
   DB  68,15,40,232                        ; movaps        %xmm0,%xmm13
-  DB  68,15,40,13,28,83,0,0               ; movaps        0x531c(%rip),%xmm9        # 5e30 <_sk_callback_sse2+0x230>
+  DB  68,15,40,13,220,85,0,0              ; movaps        0x55dc(%rip),%xmm9        # 60f0 <_sk_callback_sse2+0x22d>
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
   DB  68,15,92,215                        ; subps         %xmm7,%xmm10
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
@@ -21825,7 +22666,7 @@
   DB  68,15,40,213                        ; movaps        %xmm5,%xmm10
   DB  68,15,94,215                        ; divps         %xmm7,%xmm10
   DB  69,15,84,212                        ; andps         %xmm12,%xmm10
-  DB  68,15,40,13,214,81,0,0              ; movaps        0x51d6(%rip),%xmm9        # 5e40 <_sk_callback_sse2+0x240>
+  DB  68,15,40,13,150,84,0,0              ; movaps        0x5496(%rip),%xmm9        # 6100 <_sk_callback_sse2+0x23d>
   DB  69,15,40,249                        ; movaps        %xmm9,%xmm15
   DB  69,15,92,250                        ; subps         %xmm10,%xmm15
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
@@ -21838,10 +22679,10 @@
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
   DB  65,15,88,194                        ; addps         %xmm10,%xmm0
-  DB  68,15,40,53,176,81,0,0              ; movaps        0x51b0(%rip),%xmm14        # 5e50 <_sk_callback_sse2+0x250>
+  DB  68,15,40,53,112,84,0,0              ; movaps        0x5470(%rip),%xmm14        # 6110 <_sk_callback_sse2+0x24d>
   DB  69,15,88,222                        ; addps         %xmm14,%xmm11
   DB  68,15,89,216                        ; mulps         %xmm0,%xmm11
-  DB  68,15,40,21,176,81,0,0              ; movaps        0x51b0(%rip),%xmm10        # 5e60 <_sk_callback_sse2+0x260>
+  DB  68,15,40,21,112,84,0,0              ; movaps        0x5470(%rip),%xmm10        # 6120 <_sk_callback_sse2+0x25d>
   DB  69,15,89,234                        ; mulps         %xmm10,%xmm13
   DB  69,15,88,235                        ; addps         %xmm11,%xmm13
   DB  15,88,228                           ; addps         %xmm4,%xmm4
@@ -21986,7 +22827,7 @@
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
   DB  68,15,40,225                        ; movaps        %xmm1,%xmm12
   DB  68,15,89,211                        ; mulps         %xmm3,%xmm10
-  DB  68,15,40,5,236,79,0,0               ; movaps        0x4fec(%rip),%xmm8        # 5ea0 <_sk_callback_sse2+0x2a0>
+  DB  68,15,40,5,172,82,0,0               ; movaps        0x52ac(%rip),%xmm8        # 6160 <_sk_callback_sse2+0x29d>
   DB  69,15,40,216                        ; movaps        %xmm8,%xmm11
   DB  15,40,207                           ; movaps        %xmm7,%xmm1
   DB  68,15,92,217                        ; subps         %xmm1,%xmm11
@@ -22034,12 +22875,12 @@
   DB  69,15,84,206                        ; andps         %xmm14,%xmm9
   DB  69,15,84,214                        ; andps         %xmm14,%xmm10
   DB  65,15,84,214                        ; andps         %xmm14,%xmm2
-  DB  68,15,40,61,249,78,0,0              ; movaps        0x4ef9(%rip),%xmm15        # 5e70 <_sk_callback_sse2+0x270>
+  DB  68,15,40,61,185,81,0,0              ; movaps        0x51b9(%rip),%xmm15        # 6130 <_sk_callback_sse2+0x26d>
   DB  65,15,89,231                        ; mulps         %xmm15,%xmm4
-  DB  15,40,5,254,78,0,0                  ; movaps        0x4efe(%rip),%xmm0        # 5e80 <_sk_callback_sse2+0x280>
+  DB  15,40,5,190,81,0,0                  ; movaps        0x51be(%rip),%xmm0        # 6140 <_sk_callback_sse2+0x27d>
   DB  15,89,240                           ; mulps         %xmm0,%xmm6
   DB  15,88,244                           ; addps         %xmm4,%xmm6
-  DB  68,15,40,53,0,79,0,0                ; movaps        0x4f00(%rip),%xmm14        # 5e90 <_sk_callback_sse2+0x290>
+  DB  68,15,40,53,192,81,0,0              ; movaps        0x51c0(%rip),%xmm14        # 6150 <_sk_callback_sse2+0x28d>
   DB  68,15,40,239                        ; movaps        %xmm7,%xmm13
   DB  69,15,89,238                        ; mulps         %xmm14,%xmm13
   DB  68,15,88,238                        ; addps         %xmm6,%xmm13
@@ -22217,14 +23058,14 @@
   DB  68,15,84,211                        ; andps         %xmm3,%xmm10
   DB  68,15,84,203                        ; andps         %xmm3,%xmm9
   DB  15,84,195                           ; andps         %xmm3,%xmm0
-  DB  68,15,40,5,141,76,0,0               ; movaps        0x4c8d(%rip),%xmm8        # 5eb0 <_sk_callback_sse2+0x2b0>
+  DB  68,15,40,5,77,79,0,0                ; movaps        0x4f4d(%rip),%xmm8        # 6170 <_sk_callback_sse2+0x2ad>
   DB  15,40,214                           ; movaps        %xmm6,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
-  DB  15,40,13,143,76,0,0                 ; movaps        0x4c8f(%rip),%xmm1        # 5ec0 <_sk_callback_sse2+0x2c0>
+  DB  15,40,13,79,79,0,0                  ; movaps        0x4f4f(%rip),%xmm1        # 6180 <_sk_callback_sse2+0x2bd>
   DB  15,40,221                           ; movaps        %xmm5,%xmm3
   DB  15,89,217                           ; mulps         %xmm1,%xmm3
   DB  15,88,218                           ; addps         %xmm2,%xmm3
-  DB  68,15,40,37,142,76,0,0              ; movaps        0x4c8e(%rip),%xmm12        # 5ed0 <_sk_callback_sse2+0x2d0>
+  DB  68,15,40,37,78,79,0,0               ; movaps        0x4f4e(%rip),%xmm12        # 6190 <_sk_callback_sse2+0x2cd>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
   DB  68,15,88,235                        ; addps         %xmm3,%xmm13
   DB  65,15,40,210                        ; movaps        %xmm10,%xmm2
@@ -22269,7 +23110,7 @@
   DB  15,40,223                           ; movaps        %xmm7,%xmm3
   DB  15,40,236                           ; movaps        %xmm4,%xmm5
   DB  15,89,221                           ; mulps         %xmm5,%xmm3
-  DB  68,15,40,5,243,75,0,0               ; movaps        0x4bf3(%rip),%xmm8        # 5ee0 <_sk_callback_sse2+0x2e0>
+  DB  68,15,40,5,179,78,0,0               ; movaps        0x4eb3(%rip),%xmm8        # 61a0 <_sk_callback_sse2+0x2dd>
   DB  65,15,40,224                        ; movaps        %xmm8,%xmm4
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  15,88,253                           ; addps         %xmm5,%xmm7
@@ -22370,14 +23211,14 @@
   DB  68,15,40,213                        ; movaps        %xmm5,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
   DB  65,15,40,208                        ; movaps        %xmm8,%xmm2
-  DB  68,15,40,45,139,74,0,0              ; movaps        0x4a8b(%rip),%xmm13        # 5ef0 <_sk_callback_sse2+0x2f0>
+  DB  68,15,40,45,75,77,0,0               ; movaps        0x4d4b(%rip),%xmm13        # 61b0 <_sk_callback_sse2+0x2ed>
   DB  68,15,40,198                        ; movaps        %xmm6,%xmm8
   DB  69,15,89,197                        ; mulps         %xmm13,%xmm8
-  DB  68,15,40,53,139,74,0,0              ; movaps        0x4a8b(%rip),%xmm14        # 5f00 <_sk_callback_sse2+0x300>
+  DB  68,15,40,53,75,77,0,0               ; movaps        0x4d4b(%rip),%xmm14        # 61c0 <_sk_callback_sse2+0x2fd>
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  65,15,89,198                        ; mulps         %xmm14,%xmm0
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,29,135,74,0,0              ; movaps        0x4a87(%rip),%xmm11        # 5f10 <_sk_callback_sse2+0x310>
+  DB  68,15,40,29,71,77,0,0               ; movaps        0x4d47(%rip),%xmm11        # 61d0 <_sk_callback_sse2+0x30d>
   DB  69,15,89,227                        ; mulps         %xmm11,%xmm12
   DB  68,15,88,224                        ; addps         %xmm0,%xmm12
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
@@ -22385,7 +23226,7 @@
   DB  69,15,40,250                        ; movaps        %xmm10,%xmm15
   DB  69,15,89,254                        ; mulps         %xmm14,%xmm15
   DB  68,15,88,248                        ; addps         %xmm0,%xmm15
-  DB  68,15,40,5,115,74,0,0               ; movaps        0x4a73(%rip),%xmm8        # 5f20 <_sk_callback_sse2+0x320>
+  DB  68,15,40,5,51,77,0,0                ; movaps        0x4d33(%rip),%xmm8        # 61e0 <_sk_callback_sse2+0x31d>
   DB  65,15,40,224                        ; movaps        %xmm8,%xmm4
   DB  15,92,226                           ; subps         %xmm2,%xmm4
   DB  15,89,252                           ; mulps         %xmm4,%xmm7
@@ -22521,15 +23362,15 @@
   DB  68,15,40,205                        ; movaps        %xmm5,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
   DB  15,89,222                           ; mulps         %xmm6,%xmm3
-  DB  68,15,40,37,133,72,0,0              ; movaps        0x4885(%rip),%xmm12        # 5f30 <_sk_callback_sse2+0x330>
+  DB  68,15,40,37,69,75,0,0               ; movaps        0x4b45(%rip),%xmm12        # 61f0 <_sk_callback_sse2+0x32d>
   DB  68,15,40,199                        ; movaps        %xmm7,%xmm8
   DB  69,15,89,196                        ; mulps         %xmm12,%xmm8
-  DB  68,15,40,45,133,72,0,0              ; movaps        0x4885(%rip),%xmm13        # 5f40 <_sk_callback_sse2+0x340>
+  DB  68,15,40,45,69,75,0,0               ; movaps        0x4b45(%rip),%xmm13        # 6200 <_sk_callback_sse2+0x33d>
   DB  68,15,40,241                        ; movaps        %xmm1,%xmm14
   DB  69,15,89,245                        ; mulps         %xmm13,%xmm14
   DB  69,15,88,240                        ; addps         %xmm8,%xmm14
-  DB  68,15,40,29,129,72,0,0              ; movaps        0x4881(%rip),%xmm11        # 5f50 <_sk_callback_sse2+0x350>
-  DB  68,15,40,5,137,72,0,0               ; movaps        0x4889(%rip),%xmm8        # 5f60 <_sk_callback_sse2+0x360>
+  DB  68,15,40,29,65,75,0,0               ; movaps        0x4b41(%rip),%xmm11        # 6210 <_sk_callback_sse2+0x34d>
+  DB  68,15,40,5,73,75,0,0                ; movaps        0x4b49(%rip),%xmm8        # 6220 <_sk_callback_sse2+0x35d>
   DB  69,15,40,248                        ; movaps        %xmm8,%xmm15
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  68,15,92,248                        ; subps         %xmm0,%xmm15
@@ -22667,7 +23508,7 @@
   DB  15,133,227,0,0,0                    ; jne           19b1 <_sk_srcover_rgba_8888_sse2+0xf1>
   DB  243,68,15,111,4,144                 ; movdqu        (%rax,%rdx,4),%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  102,15,111,53,145,70,0,0            ; movdqa        0x4691(%rip),%xmm6        # 5f70 <_sk_callback_sse2+0x370>
+  DB  102,15,111,53,81,73,0,0             ; movdqa        0x4951(%rip),%xmm6        # 6230 <_sk_callback_sse2+0x36d>
   DB  102,65,15,111,224                   ; movdqa        %xmm8,%xmm4
   DB  102,15,219,230                      ; pand          %xmm6,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
@@ -22681,9 +23522,9 @@
   DB  15,91,247                           ; cvtdq2ps      %xmm7,%xmm6
   DB  102,65,15,114,208,24                ; psrld         $0x18,%xmm8
   DB  65,15,91,248                        ; cvtdq2ps      %xmm8,%xmm7
-  DB  68,15,40,5,97,70,0,0                ; movaps        0x4661(%rip),%xmm8        # 5f80 <_sk_callback_sse2+0x380>
+  DB  68,15,40,5,33,73,0,0                ; movaps        0x4921(%rip),%xmm8        # 6240 <_sk_callback_sse2+0x37d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
-  DB  68,15,40,37,101,70,0,0              ; movaps        0x4665(%rip),%xmm12        # 5f90 <_sk_callback_sse2+0x390>
+  DB  68,15,40,37,37,73,0,0               ; movaps        0x4925(%rip),%xmm12        # 6250 <_sk_callback_sse2+0x38d>
   DB  65,15,89,196                        ; mulps         %xmm12,%xmm0
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -22759,7 +23600,7 @@
 
 PUBLIC _sk_clamp_1_sse2
 _sk_clamp_1_sse2 LABEL PROC
-  DB  68,15,40,5,86,69,0,0                ; movaps        0x4556(%rip),%xmm8        # 5fa0 <_sk_callback_sse2+0x3a0>
+  DB  68,15,40,5,22,72,0,0                ; movaps        0x4816(%rip),%xmm8        # 6260 <_sk_callback_sse2+0x39d>
   DB  65,15,93,192                        ; minps         %xmm8,%xmm0
   DB  65,15,93,200                        ; minps         %xmm8,%xmm1
   DB  65,15,93,208                        ; minps         %xmm8,%xmm2
@@ -22769,7 +23610,7 @@
 
 PUBLIC _sk_clamp_a_sse2
 _sk_clamp_a_sse2 LABEL PROC
-  DB  15,93,29,75,69,0,0                  ; minps         0x454b(%rip),%xmm3        # 5fb0 <_sk_callback_sse2+0x3b0>
+  DB  15,93,29,11,72,0,0                  ; minps         0x480b(%rip),%xmm3        # 6270 <_sk_callback_sse2+0x3ad>
   DB  15,93,195                           ; minps         %xmm3,%xmm0
   DB  15,93,203                           ; minps         %xmm3,%xmm1
   DB  15,93,211                           ; minps         %xmm3,%xmm2
@@ -22778,7 +23619,7 @@
 
 PUBLIC _sk_clamp_a_dst_sse2
 _sk_clamp_a_dst_sse2 LABEL PROC
-  DB  15,93,61,71,69,0,0                  ; minps         0x4547(%rip),%xmm7        # 5fc0 <_sk_callback_sse2+0x3c0>
+  DB  15,93,61,7,72,0,0                   ; minps         0x4807(%rip),%xmm7        # 6280 <_sk_callback_sse2+0x3bd>
   DB  15,93,231                           ; minps         %xmm7,%xmm4
   DB  15,93,239                           ; minps         %xmm7,%xmm5
   DB  15,93,247                           ; minps         %xmm7,%xmm6
@@ -22805,14 +23646,6 @@
   DB  65,15,40,208                        ; movaps        %xmm8,%xmm2
   DB  255,224                             ; jmpq          *%rax
 
-PUBLIC _sk_swap_rb_dst_sse2
-_sk_swap_rb_dst_sse2 LABEL PROC
-  DB  68,15,40,196                        ; movaps        %xmm4,%xmm8
-  DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,230                           ; movaps        %xmm6,%xmm4
-  DB  65,15,40,240                        ; movaps        %xmm8,%xmm6
-  DB  255,224                             ; jmpq          *%rax
-
 PUBLIC _sk_move_src_dst_sse2
 _sk_move_src_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -22842,7 +23675,7 @@
 PUBLIC _sk_unpremul_sse2
 _sk_unpremul_sse2 LABEL PROC
   DB  69,15,87,192                        ; xorps         %xmm8,%xmm8
-  DB  68,15,40,13,211,68,0,0              ; movaps        0x44d3(%rip),%xmm9        # 5fd0 <_sk_callback_sse2+0x3d0>
+  DB  68,15,40,13,162,71,0,0              ; movaps        0x47a2(%rip),%xmm9        # 6290 <_sk_callback_sse2+0x3cd>
   DB  68,15,94,203                        ; divps         %xmm3,%xmm9
   DB  68,15,194,195,4                     ; cmpneqps      %xmm3,%xmm8
   DB  69,15,84,193                        ; andps         %xmm9,%xmm8
@@ -22854,20 +23687,20 @@
 
 PUBLIC _sk_from_srgb_sse2
 _sk_from_srgb_sse2 LABEL PROC
-  DB  68,15,40,5,190,68,0,0               ; movaps        0x44be(%rip),%xmm8        # 5fe0 <_sk_callback_sse2+0x3e0>
+  DB  68,15,40,5,141,71,0,0               ; movaps        0x478d(%rip),%xmm8        # 62a0 <_sk_callback_sse2+0x3dd>
   DB  68,15,40,232                        ; movaps        %xmm0,%xmm13
   DB  69,15,89,232                        ; mulps         %xmm8,%xmm13
   DB  68,15,40,216                        ; movaps        %xmm0,%xmm11
   DB  69,15,89,219                        ; mulps         %xmm11,%xmm11
-  DB  68,15,40,13,182,68,0,0              ; movaps        0x44b6(%rip),%xmm9        # 5ff0 <_sk_callback_sse2+0x3f0>
+  DB  68,15,40,13,133,71,0,0              ; movaps        0x4785(%rip),%xmm9        # 62b0 <_sk_callback_sse2+0x3ed>
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
   DB  69,15,89,241                        ; mulps         %xmm9,%xmm14
-  DB  68,15,40,21,182,68,0,0              ; movaps        0x44b6(%rip),%xmm10        # 6000 <_sk_callback_sse2+0x400>
+  DB  68,15,40,21,133,71,0,0              ; movaps        0x4785(%rip),%xmm10        # 62c0 <_sk_callback_sse2+0x3fd>
   DB  69,15,88,242                        ; addps         %xmm10,%xmm14
   DB  69,15,89,243                        ; mulps         %xmm11,%xmm14
-  DB  68,15,40,29,182,68,0,0              ; movaps        0x44b6(%rip),%xmm11        # 6010 <_sk_callback_sse2+0x410>
+  DB  68,15,40,29,133,71,0,0              ; movaps        0x4785(%rip),%xmm11        # 62d0 <_sk_callback_sse2+0x40d>
   DB  69,15,88,243                        ; addps         %xmm11,%xmm14
-  DB  68,15,40,37,186,68,0,0              ; movaps        0x44ba(%rip),%xmm12        # 6020 <_sk_callback_sse2+0x420>
+  DB  68,15,40,37,137,71,0,0              ; movaps        0x4789(%rip),%xmm12        # 62e0 <_sk_callback_sse2+0x41d>
   DB  65,15,194,196,1                     ; cmpltps       %xmm12,%xmm0
   DB  68,15,84,232                        ; andps         %xmm0,%xmm13
   DB  65,15,85,198                        ; andnps        %xmm14,%xmm0
@@ -22901,20 +23734,20 @@
 
 PUBLIC _sk_from_srgb_dst_sse2
 _sk_from_srgb_dst_sse2 LABEL PROC
-  DB  68,15,40,5,75,68,0,0                ; movaps        0x444b(%rip),%xmm8        # 6030 <_sk_callback_sse2+0x430>
+  DB  68,15,40,5,26,71,0,0                ; movaps        0x471a(%rip),%xmm8        # 62f0 <_sk_callback_sse2+0x42d>
   DB  68,15,40,236                        ; movaps        %xmm4,%xmm13
   DB  69,15,89,232                        ; mulps         %xmm8,%xmm13
   DB  68,15,40,220                        ; movaps        %xmm4,%xmm11
   DB  69,15,89,219                        ; mulps         %xmm11,%xmm11
-  DB  68,15,40,13,67,68,0,0               ; movaps        0x4443(%rip),%xmm9        # 6040 <_sk_callback_sse2+0x440>
+  DB  68,15,40,13,18,71,0,0               ; movaps        0x4712(%rip),%xmm9        # 6300 <_sk_callback_sse2+0x43d>
   DB  68,15,40,244                        ; movaps        %xmm4,%xmm14
   DB  69,15,89,241                        ; mulps         %xmm9,%xmm14
-  DB  68,15,40,21,67,68,0,0               ; movaps        0x4443(%rip),%xmm10        # 6050 <_sk_callback_sse2+0x450>
+  DB  68,15,40,21,18,71,0,0               ; movaps        0x4712(%rip),%xmm10        # 6310 <_sk_callback_sse2+0x44d>
   DB  69,15,88,242                        ; addps         %xmm10,%xmm14
   DB  69,15,89,243                        ; mulps         %xmm11,%xmm14
-  DB  68,15,40,29,67,68,0,0               ; movaps        0x4443(%rip),%xmm11        # 6060 <_sk_callback_sse2+0x460>
+  DB  68,15,40,29,18,71,0,0               ; movaps        0x4712(%rip),%xmm11        # 6320 <_sk_callback_sse2+0x45d>
   DB  69,15,88,243                        ; addps         %xmm11,%xmm14
-  DB  68,15,40,37,71,68,0,0               ; movaps        0x4447(%rip),%xmm12        # 6070 <_sk_callback_sse2+0x470>
+  DB  68,15,40,37,22,71,0,0               ; movaps        0x4716(%rip),%xmm12        # 6330 <_sk_callback_sse2+0x46d>
   DB  65,15,194,228,1                     ; cmpltps       %xmm12,%xmm4
   DB  68,15,84,236                        ; andps         %xmm4,%xmm13
   DB  65,15,85,230                        ; andnps        %xmm14,%xmm4
@@ -22949,22 +23782,22 @@
 PUBLIC _sk_to_srgb_sse2
 _sk_to_srgb_sse2 LABEL PROC
   DB  68,15,82,232                        ; rsqrtps       %xmm0,%xmm13
-  DB  68,15,40,5,212,67,0,0               ; movaps        0x43d4(%rip),%xmm8        # 6080 <_sk_callback_sse2+0x480>
+  DB  68,15,40,5,163,70,0,0               ; movaps        0x46a3(%rip),%xmm8        # 6340 <_sk_callback_sse2+0x47d>
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
   DB  69,15,89,240                        ; mulps         %xmm8,%xmm14
-  DB  68,15,40,13,212,67,0,0              ; movaps        0x43d4(%rip),%xmm9        # 6090 <_sk_callback_sse2+0x490>
+  DB  68,15,40,13,163,70,0,0              ; movaps        0x46a3(%rip),%xmm9        # 6350 <_sk_callback_sse2+0x48d>
   DB  69,15,40,253                        ; movaps        %xmm13,%xmm15
   DB  69,15,89,249                        ; mulps         %xmm9,%xmm15
-  DB  68,15,40,21,212,67,0,0              ; movaps        0x43d4(%rip),%xmm10        # 60a0 <_sk_callback_sse2+0x4a0>
+  DB  68,15,40,21,163,70,0,0              ; movaps        0x46a3(%rip),%xmm10        # 6360 <_sk_callback_sse2+0x49d>
   DB  69,15,88,250                        ; addps         %xmm10,%xmm15
   DB  69,15,89,253                        ; mulps         %xmm13,%xmm15
-  DB  68,15,40,29,212,67,0,0              ; movaps        0x43d4(%rip),%xmm11        # 60b0 <_sk_callback_sse2+0x4b0>
+  DB  68,15,40,29,163,70,0,0              ; movaps        0x46a3(%rip),%xmm11        # 6370 <_sk_callback_sse2+0x4ad>
   DB  69,15,88,251                        ; addps         %xmm11,%xmm15
-  DB  68,15,40,37,216,67,0,0              ; movaps        0x43d8(%rip),%xmm12        # 60c0 <_sk_callback_sse2+0x4c0>
+  DB  68,15,40,37,167,70,0,0              ; movaps        0x46a7(%rip),%xmm12        # 6380 <_sk_callback_sse2+0x4bd>
   DB  69,15,88,236                        ; addps         %xmm12,%xmm13
   DB  69,15,83,237                        ; rcpps         %xmm13,%xmm13
   DB  69,15,89,239                        ; mulps         %xmm15,%xmm13
-  DB  68,15,40,61,212,67,0,0              ; movaps        0x43d4(%rip),%xmm15        # 60d0 <_sk_callback_sse2+0x4d0>
+  DB  68,15,40,61,163,70,0,0              ; movaps        0x46a3(%rip),%xmm15        # 6390 <_sk_callback_sse2+0x4cd>
   DB  65,15,194,199,1                     ; cmpltps       %xmm15,%xmm0
   DB  68,15,84,240                        ; andps         %xmm0,%xmm14
   DB  65,15,85,197                        ; andnps        %xmm13,%xmm0
@@ -23012,7 +23845,7 @@
   DB  68,15,93,218                        ; minps         %xmm2,%xmm11
   DB  65,15,40,202                        ; movaps        %xmm10,%xmm1
   DB  65,15,92,203                        ; subps         %xmm11,%xmm1
-  DB  68,15,40,45,45,67,0,0               ; movaps        0x432d(%rip),%xmm13        # 60e0 <_sk_callback_sse2+0x4e0>
+  DB  68,15,40,45,252,69,0,0              ; movaps        0x45fc(%rip),%xmm13        # 63a0 <_sk_callback_sse2+0x4dd>
   DB  68,15,94,233                        ; divps         %xmm1,%xmm13
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  65,15,194,192,0                     ; cmpeqps       %xmm8,%xmm0
@@ -23021,30 +23854,30 @@
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,40,241                        ; movaps        %xmm9,%xmm14
   DB  68,15,194,242,1                     ; cmpltps       %xmm2,%xmm14
-  DB  68,15,84,53,19,67,0,0               ; andps         0x4313(%rip),%xmm14        # 60f0 <_sk_callback_sse2+0x4f0>
+  DB  68,15,84,53,226,69,0,0              ; andps         0x45e2(%rip),%xmm14        # 63b0 <_sk_callback_sse2+0x4ed>
   DB  69,15,88,244                        ; addps         %xmm12,%xmm14
   DB  69,15,40,250                        ; movaps        %xmm10,%xmm15
   DB  69,15,194,249,0                     ; cmpeqps       %xmm9,%xmm15
   DB  65,15,92,208                        ; subps         %xmm8,%xmm2
   DB  65,15,89,213                        ; mulps         %xmm13,%xmm2
-  DB  68,15,40,37,6,67,0,0                ; movaps        0x4306(%rip),%xmm12        # 6100 <_sk_callback_sse2+0x500>
+  DB  68,15,40,37,213,69,0,0              ; movaps        0x45d5(%rip),%xmm12        # 63c0 <_sk_callback_sse2+0x4fd>
   DB  65,15,88,212                        ; addps         %xmm12,%xmm2
   DB  69,15,92,193                        ; subps         %xmm9,%xmm8
   DB  69,15,89,197                        ; mulps         %xmm13,%xmm8
-  DB  68,15,88,5,2,67,0,0                 ; addps         0x4302(%rip),%xmm8        # 6110 <_sk_callback_sse2+0x510>
+  DB  68,15,88,5,209,69,0,0               ; addps         0x45d1(%rip),%xmm8        # 63d0 <_sk_callback_sse2+0x50d>
   DB  65,15,84,215                        ; andps         %xmm15,%xmm2
   DB  69,15,85,248                        ; andnps        %xmm8,%xmm15
   DB  68,15,86,250                        ; orps          %xmm2,%xmm15
   DB  68,15,84,240                        ; andps         %xmm0,%xmm14
   DB  65,15,85,199                        ; andnps        %xmm15,%xmm0
   DB  65,15,86,198                        ; orps          %xmm14,%xmm0
-  DB  15,89,5,243,66,0,0                  ; mulps         0x42f3(%rip),%xmm0        # 6120 <_sk_callback_sse2+0x520>
+  DB  15,89,5,194,69,0,0                  ; mulps         0x45c2(%rip),%xmm0        # 63e0 <_sk_callback_sse2+0x51d>
   DB  69,15,40,194                        ; movaps        %xmm10,%xmm8
   DB  69,15,194,195,4                     ; cmpneqps      %xmm11,%xmm8
   DB  65,15,84,192                        ; andps         %xmm8,%xmm0
   DB  69,15,92,226                        ; subps         %xmm10,%xmm12
   DB  69,15,88,211                        ; addps         %xmm11,%xmm10
-  DB  68,15,40,13,230,66,0,0              ; movaps        0x42e6(%rip),%xmm9        # 6130 <_sk_callback_sse2+0x530>
+  DB  68,15,40,13,181,69,0,0              ; movaps        0x45b5(%rip),%xmm9        # 63f0 <_sk_callback_sse2+0x52d>
   DB  65,15,40,210                        ; movaps        %xmm10,%xmm2
   DB  65,15,89,209                        ; mulps         %xmm9,%xmm2
   DB  68,15,194,202,1                     ; cmpltps       %xmm2,%xmm9
@@ -23067,7 +23900,7 @@
   DB  15,41,92,36,32                      ; movaps        %xmm3,0x20(%rsp)
   DB  68,15,40,218                        ; movaps        %xmm2,%xmm11
   DB  15,40,240                           ; movaps        %xmm0,%xmm6
-  DB  68,15,40,13,161,66,0,0              ; movaps        0x42a1(%rip),%xmm9        # 6140 <_sk_callback_sse2+0x540>
+  DB  68,15,40,13,112,69,0,0              ; movaps        0x4570(%rip),%xmm9        # 6400 <_sk_callback_sse2+0x53d>
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
   DB  69,15,194,211,2                     ; cmpleps       %xmm11,%xmm10
   DB  15,40,193                           ; movaps        %xmm1,%xmm0
@@ -23084,28 +23917,28 @@
   DB  69,15,88,211                        ; addps         %xmm11,%xmm10
   DB  69,15,88,219                        ; addps         %xmm11,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  15,40,5,107,66,0,0                  ; movaps        0x426b(%rip),%xmm0        # 6150 <_sk_callback_sse2+0x550>
+  DB  15,40,5,58,69,0,0                   ; movaps        0x453a(%rip),%xmm0        # 6410 <_sk_callback_sse2+0x54d>
   DB  15,88,198                           ; addps         %xmm6,%xmm0
   DB  243,15,91,200                       ; cvttps2dq     %xmm0,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  15,40,216                           ; movaps        %xmm0,%xmm3
   DB  15,194,217,1                        ; cmpltps       %xmm1,%xmm3
-  DB  15,84,29,99,66,0,0                  ; andps         0x4263(%rip),%xmm3        # 6160 <_sk_callback_sse2+0x560>
+  DB  15,84,29,50,69,0,0                  ; andps         0x4532(%rip),%xmm3        # 6420 <_sk_callback_sse2+0x55d>
   DB  15,92,203                           ; subps         %xmm3,%xmm1
   DB  15,92,193                           ; subps         %xmm1,%xmm0
-  DB  68,15,40,45,101,66,0,0              ; movaps        0x4265(%rip),%xmm13        # 6170 <_sk_callback_sse2+0x570>
+  DB  68,15,40,45,52,69,0,0               ; movaps        0x4534(%rip),%xmm13        # 6430 <_sk_callback_sse2+0x56d>
   DB  69,15,40,197                        ; movaps        %xmm13,%xmm8
   DB  68,15,194,192,2                     ; cmpleps       %xmm0,%xmm8
   DB  69,15,40,242                        ; movaps        %xmm10,%xmm14
   DB  69,15,92,243                        ; subps         %xmm11,%xmm14
   DB  65,15,40,217                        ; movaps        %xmm9,%xmm3
   DB  15,194,216,2                        ; cmpleps       %xmm0,%xmm3
-  DB  15,40,21,117,66,0,0                 ; movaps        0x4275(%rip),%xmm2        # 61a0 <_sk_callback_sse2+0x5a0>
+  DB  15,40,21,68,69,0,0                  ; movaps        0x4544(%rip),%xmm2        # 6460 <_sk_callback_sse2+0x59d>
   DB  68,15,40,250                        ; movaps        %xmm2,%xmm15
   DB  68,15,194,248,2                     ; cmpleps       %xmm0,%xmm15
-  DB  15,40,13,69,66,0,0                  ; movaps        0x4245(%rip),%xmm1        # 6180 <_sk_callback_sse2+0x580>
+  DB  15,40,13,20,69,0,0                  ; movaps        0x4514(%rip),%xmm1        # 6440 <_sk_callback_sse2+0x57d>
   DB  15,89,193                           ; mulps         %xmm1,%xmm0
-  DB  15,40,45,75,66,0,0                  ; movaps        0x424b(%rip),%xmm5        # 6190 <_sk_callback_sse2+0x590>
+  DB  15,40,45,26,69,0,0                  ; movaps        0x451a(%rip),%xmm5        # 6450 <_sk_callback_sse2+0x58d>
   DB  15,40,229                           ; movaps        %xmm5,%xmm4
   DB  15,92,224                           ; subps         %xmm0,%xmm4
   DB  65,15,89,230                        ; mulps         %xmm14,%xmm4
@@ -23128,7 +23961,7 @@
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
   DB  15,40,222                           ; movaps        %xmm6,%xmm3
   DB  15,194,216,1                        ; cmpltps       %xmm0,%xmm3
-  DB  15,84,29,192,65,0,0                 ; andps         0x41c0(%rip),%xmm3        # 6160 <_sk_callback_sse2+0x560>
+  DB  15,84,29,143,68,0,0                 ; andps         0x448f(%rip),%xmm3        # 6420 <_sk_callback_sse2+0x55d>
   DB  15,92,195                           ; subps         %xmm3,%xmm0
   DB  68,15,40,230                        ; movaps        %xmm6,%xmm12
   DB  68,15,92,224                        ; subps         %xmm0,%xmm12
@@ -23158,12 +23991,12 @@
   DB  15,40,60,36                         ; movaps        (%rsp),%xmm7
   DB  15,40,231                           ; movaps        %xmm7,%xmm4
   DB  15,85,227                           ; andnps        %xmm3,%xmm4
-  DB  15,88,53,153,65,0,0                 ; addps         0x4199(%rip),%xmm6        # 61b0 <_sk_callback_sse2+0x5b0>
+  DB  15,88,53,104,68,0,0                 ; addps         0x4468(%rip),%xmm6        # 6470 <_sk_callback_sse2+0x5ad>
   DB  243,15,91,198                       ; cvttps2dq     %xmm6,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
   DB  15,40,222                           ; movaps        %xmm6,%xmm3
   DB  15,194,216,1                        ; cmpltps       %xmm0,%xmm3
-  DB  15,84,29,52,65,0,0                  ; andps         0x4134(%rip),%xmm3        # 6160 <_sk_callback_sse2+0x560>
+  DB  15,84,29,3,68,0,0                   ; andps         0x4403(%rip),%xmm3        # 6420 <_sk_callback_sse2+0x55d>
   DB  15,92,195                           ; subps         %xmm3,%xmm0
   DB  15,92,240                           ; subps         %xmm0,%xmm6
   DB  15,89,206                           ; mulps         %xmm6,%xmm1
@@ -23220,13 +24053,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,61                              ; jne           2123 <_sk_scale_u8_sse2+0x47>
+  DB  117,61                              ; jne           2114 <_sk_scale_u8_sse2+0x47>
   DB  102,69,15,110,4,18                  ; movd          (%r10,%rdx,1),%xmm8
   DB  102,68,15,96,192                    ; punpcklbw     %xmm0,%xmm8
   DB  102,68,15,97,192                    ; punpcklwd     %xmm0,%xmm8
-  DB  102,68,15,219,5,193,64,0,0          ; pand          0x40c1(%rip),%xmm8        # 61c0 <_sk_callback_sse2+0x5c0>
+  DB  102,68,15,219,5,144,67,0,0          ; pand          0x4390(%rip),%xmm8        # 6480 <_sk_callback_sse2+0x5bd>
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,197,64,0,0               ; mulps         0x40c5(%rip),%xmm8        # 61d0 <_sk_callback_sse2+0x5d0>
+  DB  68,15,89,5,148,67,0,0               ; mulps         0x4394(%rip),%xmm8        # 6490 <_sk_callback_sse2+0x5cd>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
@@ -23237,12 +24070,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,61                              ; je            216d <_sk_scale_u8_sse2+0x91>
+  DB  116,61                              ; je            215e <_sk_scale_u8_sse2+0x91>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,23                              ; je            2152 <_sk_scale_u8_sse2+0x76>
+  DB  116,23                              ; je            2143 <_sk_scale_u8_sse2+0x76>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,181                             ; jne           20f6 <_sk_scale_u8_sse2+0x1a>
+  DB  117,181                             ; jne           20e7 <_sk_scale_u8_sse2+0x1a>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,192,69                ; pshufd        $0x45,%xmm8,%xmm8
@@ -23251,10 +24084,10 @@
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  102,68,15,97,200                    ; punpcklwd     %xmm0,%xmm9
   DB  242,69,15,16,193                    ; movsd         %xmm9,%xmm8
-  DB  235,137                             ; jmp           20f6 <_sk_scale_u8_sse2+0x1a>
+  DB  235,137                             ; jmp           20e7 <_sk_scale_u8_sse2+0x1a>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  233,122,255,255,255                 ; jmpq          20f6 <_sk_scale_u8_sse2+0x1a>
+  DB  233,122,255,255,255                 ; jmpq          20e7 <_sk_scale_u8_sse2+0x1a>
 
 PUBLIC _sk_lerp_1_float_sse2
 _sk_lerp_1_float_sse2 LABEL PROC
@@ -23281,13 +24114,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,81                              ; jne           220f <_sk_lerp_u8_sse2+0x5b>
+  DB  117,81                              ; jne           2200 <_sk_lerp_u8_sse2+0x5b>
   DB  102,69,15,110,4,18                  ; movd          (%r10,%rdx,1),%xmm8
   DB  102,68,15,96,192                    ; punpcklbw     %xmm0,%xmm8
   DB  102,68,15,97,192                    ; punpcklwd     %xmm0,%xmm8
-  DB  102,68,15,219,5,9,64,0,0            ; pand          0x4009(%rip),%xmm8        # 61e0 <_sk_callback_sse2+0x5e0>
+  DB  102,68,15,219,5,216,66,0,0          ; pand          0x42d8(%rip),%xmm8        # 64a0 <_sk_callback_sse2+0x5dd>
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,13,64,0,0                ; mulps         0x400d(%rip),%xmm8        # 61f0 <_sk_callback_sse2+0x5f0>
+  DB  68,15,89,5,220,66,0,0               ; mulps         0x42dc(%rip),%xmm8        # 64b0 <_sk_callback_sse2+0x5ed>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -23305,12 +24138,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,64                              ; je            225c <_sk_lerp_u8_sse2+0xa8>
+  DB  116,64                              ; je            224d <_sk_lerp_u8_sse2+0xa8>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,23                              ; je            223e <_sk_lerp_u8_sse2+0x8a>
+  DB  116,23                              ; je            222f <_sk_lerp_u8_sse2+0x8a>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,161                             ; jne           21ce <_sk_lerp_u8_sse2+0x1a>
+  DB  117,161                             ; jne           21bf <_sk_lerp_u8_sse2+0x1a>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,192,69                ; pshufd        $0x45,%xmm8,%xmm8
@@ -23319,30 +24152,30 @@
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  102,68,15,97,200                    ; punpcklwd     %xmm0,%xmm9
   DB  242,69,15,16,193                    ; movsd         %xmm9,%xmm8
-  DB  233,114,255,255,255                 ; jmpq          21ce <_sk_lerp_u8_sse2+0x1a>
+  DB  233,114,255,255,255                 ; jmpq          21bf <_sk_lerp_u8_sse2+0x1a>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  233,99,255,255,255                  ; jmpq          21ce <_sk_lerp_u8_sse2+0x1a>
+  DB  233,99,255,255,255                  ; jmpq          21bf <_sk_lerp_u8_sse2+0x1a>
 
 PUBLIC _sk_lerp_565_sse2
 _sk_lerp_565_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,156,0,0,0                    ; jne           2315 <_sk_lerp_565_sse2+0xaa>
+  DB  15,133,156,0,0,0                    ; jne           2306 <_sk_lerp_565_sse2+0xaa>
   DB  243,69,15,126,12,82                 ; movq          (%r10,%rdx,2),%xmm9
   DB  102,68,15,97,200                    ; punpcklwd     %xmm0,%xmm9
-  DB  102,68,15,111,5,115,63,0,0          ; movdqa        0x3f73(%rip),%xmm8        # 6200 <_sk_callback_sse2+0x600>
+  DB  102,68,15,111,5,66,66,0,0           ; movdqa        0x4242(%rip),%xmm8        # 64c0 <_sk_callback_sse2+0x5fd>
   DB  102,69,15,219,193                   ; pand          %xmm9,%xmm8
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,114,63,0,0               ; mulps         0x3f72(%rip),%xmm8        # 6210 <_sk_callback_sse2+0x610>
-  DB  102,68,15,111,21,121,63,0,0         ; movdqa        0x3f79(%rip),%xmm10        # 6220 <_sk_callback_sse2+0x620>
+  DB  68,15,89,5,65,66,0,0                ; mulps         0x4241(%rip),%xmm8        # 64d0 <_sk_callback_sse2+0x60d>
+  DB  102,68,15,111,21,72,66,0,0          ; movdqa        0x4248(%rip),%xmm10        # 64e0 <_sk_callback_sse2+0x61d>
   DB  102,69,15,219,209                   ; pand          %xmm9,%xmm10
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
-  DB  68,15,89,21,120,63,0,0              ; mulps         0x3f78(%rip),%xmm10        # 6230 <_sk_callback_sse2+0x630>
-  DB  102,68,15,219,13,127,63,0,0         ; pand          0x3f7f(%rip),%xmm9        # 6240 <_sk_callback_sse2+0x640>
+  DB  68,15,89,21,71,66,0,0               ; mulps         0x4247(%rip),%xmm10        # 64f0 <_sk_callback_sse2+0x62d>
+  DB  102,68,15,219,13,78,66,0,0          ; pand          0x424e(%rip),%xmm9        # 6500 <_sk_callback_sse2+0x63d>
   DB  69,15,91,201                        ; cvtdq2ps      %xmm9,%xmm9
-  DB  68,15,89,13,131,63,0,0              ; mulps         0x3f83(%rip),%xmm9        # 6250 <_sk_callback_sse2+0x650>
+  DB  68,15,89,13,82,66,0,0               ; mulps         0x4252(%rip),%xmm9        # 6510 <_sk_callback_sse2+0x64d>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -23367,34 +24200,34 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,59                              ; je            235d <_sk_lerp_565_sse2+0xf2>
+  DB  116,59                              ; je            234e <_sk_lerp_565_sse2+0xf2>
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,27                              ; je            2348 <_sk_lerp_565_sse2+0xdd>
+  DB  116,27                              ; je            2339 <_sk_lerp_565_sse2+0xdd>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  15,133,77,255,255,255               ; jne           2284 <_sk_lerp_565_sse2+0x19>
+  DB  15,133,77,255,255,255               ; jne           2275 <_sk_lerp_565_sse2+0x19>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,200,69                ; pshufd        $0x45,%xmm8,%xmm9
   DB  102,69,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm8
   DB  102,68,15,97,192                    ; punpcklwd     %xmm0,%xmm8
   DB  242,69,15,16,200                    ; movsd         %xmm8,%xmm9
-  DB  233,39,255,255,255                  ; jmpq          2284 <_sk_lerp_565_sse2+0x19>
+  DB  233,39,255,255,255                  ; jmpq          2275 <_sk_lerp_565_sse2+0x19>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,68,15,110,200                   ; movd          %eax,%xmm9
-  DB  233,24,255,255,255                  ; jmpq          2284 <_sk_lerp_565_sse2+0x19>
+  DB  233,24,255,255,255                  ; jmpq          2275 <_sk_lerp_565_sse2+0x19>
 
 PUBLIC _sk_load_tables_sse2
 _sk_load_tables_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,36,1,0,0                     ; jne           249e <_sk_load_tables_sse2+0x132>
+  DB  15,133,36,1,0,0                     ; jne           248f <_sk_load_tables_sse2+0x132>
   DB  243,69,15,111,12,145                ; movdqu        (%r9,%rdx,4),%xmm9
   DB  65,87                               ; push          %r15
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
-  DB  102,68,15,111,5,210,62,0,0          ; movdqa        0x3ed2(%rip),%xmm8        # 6260 <_sk_callback_sse2+0x660>
+  DB  102,68,15,111,5,161,65,0,0          ; movdqa        0x41a1(%rip),%xmm8        # 6520 <_sk_callback_sse2+0x65d>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,15,112,200,78                   ; pshufd        $0x4e,%xmm0,%xmm1
@@ -23450,7 +24283,7 @@
   DB  65,15,20,208                        ; unpcklps      %xmm8,%xmm2
   DB  102,65,15,114,209,24                ; psrld         $0x18,%xmm9
   DB  65,15,91,217                        ; cvtdq2ps      %xmm9,%xmm3
-  DB  15,89,29,219,61,0,0                 ; mulps         0x3ddb(%rip),%xmm3        # 6270 <_sk_callback_sse2+0x670>
+  DB  15,89,29,170,64,0,0                 ; mulps         0x40aa(%rip),%xmm3        # 6530 <_sk_callback_sse2+0x66d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
@@ -23459,18 +24292,18 @@
   DB  69,137,194                          ; mov           %r8d,%r10d
   DB  65,128,226,3                        ; and           $0x3,%r10b
   DB  65,128,250,1                        ; cmp           $0x1,%r10b
-  DB  116,45                              ; je            24d8 <_sk_load_tables_sse2+0x16c>
+  DB  116,45                              ; je            24c9 <_sk_load_tables_sse2+0x16c>
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  65,128,250,2                        ; cmp           $0x2,%r10b
-  DB  116,23                              ; je            24cd <_sk_load_tables_sse2+0x161>
+  DB  116,23                              ; je            24be <_sk_load_tables_sse2+0x161>
   DB  65,128,250,3                        ; cmp           $0x3,%r10b
-  DB  15,133,192,254,255,255              ; jne           2380 <_sk_load_tables_sse2+0x14>
+  DB  15,133,192,254,255,255              ; jne           2371 <_sk_load_tables_sse2+0x14>
   DB  102,65,15,110,68,145,8              ; movd          0x8(%r9,%rdx,4),%xmm0
   DB  102,68,15,112,200,69                ; pshufd        $0x45,%xmm0,%xmm9
   DB  102,69,15,18,12,145                 ; movlpd        (%r9,%rdx,4),%xmm9
-  DB  233,168,254,255,255                 ; jmpq          2380 <_sk_load_tables_sse2+0x14>
+  DB  233,168,254,255,255                 ; jmpq          2371 <_sk_load_tables_sse2+0x14>
   DB  102,69,15,110,12,145                ; movd          (%r9,%rdx,4),%xmm9
-  DB  233,157,254,255,255                 ; jmpq          2380 <_sk_load_tables_sse2+0x14>
+  DB  233,157,254,255,255                 ; jmpq          2371 <_sk_load_tables_sse2+0x14>
 
 PUBLIC _sk_load_tables_u16_be_sse2
 _sk_load_tables_u16_be_sse2 LABEL PROC
@@ -23478,7 +24311,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,101,1,0,0                    ; jne           265e <_sk_load_tables_u16_be_sse2+0x17b>
+  DB  15,133,101,1,0,0                    ; jne           264f <_sk_load_tables_u16_be_sse2+0x17b>
   DB  102,67,15,16,4,81                   ; movupd        (%r9,%r10,2),%xmm0
   DB  102,67,15,16,76,81,16               ; movupd        0x10(%r9,%r10,2),%xmm1
   DB  65,87                               ; push          %r15
@@ -23490,7 +24323,7 @@
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,97,200                       ; punpcklwd     %xmm0,%xmm1
   DB  102,68,15,105,200                   ; punpckhwd     %xmm0,%xmm9
-  DB  102,68,15,111,21,80,61,0,0          ; movdqa        0x3d50(%rip),%xmm10        # 6280 <_sk_callback_sse2+0x680>
+  DB  102,68,15,111,21,31,64,0,0          ; movdqa        0x401f(%rip),%xmm10        # 6540 <_sk_callback_sse2+0x67d>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,194                   ; pand          %xmm10,%xmm0
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
@@ -23552,7 +24385,7 @@
   DB  102,65,15,235,217                   ; por           %xmm9,%xmm3
   DB  102,65,15,97,216                    ; punpcklwd     %xmm8,%xmm3
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,59,60,0,0                  ; mulps         0x3c3b(%rip),%xmm3        # 6290 <_sk_callback_sse2+0x690>
+  DB  15,89,29,10,63,0,0                  ; mulps         0x3f0a(%rip),%xmm3        # 6550 <_sk_callback_sse2+0x68d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
@@ -23560,17 +24393,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,67,15,16,4,81                   ; movsd         (%r9,%r10,2),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,17                              ; jne           267b <_sk_load_tables_u16_be_sse2+0x198>
+  DB  117,17                              ; jne           266c <_sk_load_tables_u16_be_sse2+0x198>
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  102,15,20,193                       ; unpcklpd      %xmm1,%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
-  DB  233,139,254,255,255                 ; jmpq          2506 <_sk_load_tables_u16_be_sse2+0x23>
+  DB  233,139,254,255,255                 ; jmpq          24f7 <_sk_load_tables_u16_be_sse2+0x23>
   DB  102,67,15,22,68,81,8                ; movhpd        0x8(%r9,%r10,2),%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,118,254,255,255              ; jb            2506 <_sk_load_tables_u16_be_sse2+0x23>
+  DB  15,130,118,254,255,255              ; jb            24f7 <_sk_load_tables_u16_be_sse2+0x23>
   DB  242,67,15,16,76,81,16               ; movsd         0x10(%r9,%r10,2),%xmm1
-  DB  233,106,254,255,255                 ; jmpq          2506 <_sk_load_tables_u16_be_sse2+0x23>
+  DB  233,106,254,255,255                 ; jmpq          24f7 <_sk_load_tables_u16_be_sse2+0x23>
 
 PUBLIC _sk_load_tables_rgb_u16_be_sse2
 _sk_load_tables_rgb_u16_be_sse2 LABEL PROC
@@ -23578,7 +24411,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,82                        ; lea           (%rdx,%rdx,2),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,84,1,0,0                     ; jne           2802 <_sk_load_tables_rgb_u16_be_sse2+0x166>
+  DB  15,133,84,1,0,0                     ; jne           27f3 <_sk_load_tables_rgb_u16_be_sse2+0x166>
   DB  243,71,15,111,28,81                 ; movdqu        (%r9,%r10,2),%xmm11
   DB  243,67,15,111,76,81,8               ; movdqu        0x8(%r9,%r10,2),%xmm1
   DB  102,15,115,217,4                    ; psrldq        $0x4,%xmm1
@@ -23593,7 +24426,7 @@
   DB  102,68,15,97,208                    ; punpcklwd     %xmm0,%xmm10
   DB  102,65,15,111,195                   ; movdqa        %xmm11,%xmm0
   DB  102,65,15,97,194                    ; punpcklwd     %xmm10,%xmm0
-  DB  102,68,15,111,5,170,59,0,0          ; movdqa        0x3baa(%rip),%xmm8        # 62a0 <_sk_callback_sse2+0x6a0>
+  DB  102,68,15,111,5,121,62,0,0          ; movdqa        0x3e79(%rip),%xmm8        # 6560 <_sk_callback_sse2+0x69d>
   DB  102,15,112,200,78                   ; pshufd        $0x4e,%xmm0,%xmm1
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
@@ -23649,7 +24482,7 @@
   DB  15,20,211                           ; unpcklps      %xmm3,%xmm2
   DB  65,15,20,208                        ; unpcklps      %xmm8,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,181,58,0,0                 ; movaps        0x3ab5(%rip),%xmm3        # 62b0 <_sk_callback_sse2+0x6b0>
+  DB  15,40,29,132,61,0,0                 ; movaps        0x3d84(%rip),%xmm3        # 6570 <_sk_callback_sse2+0x6ad>
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
   DB  65,95                               ; pop           %r15
@@ -23658,21 +24491,21 @@
   DB  102,71,15,196,92,81,4,2             ; pinsrw        $0x2,0x4(%r9,%r10,2),%xmm11
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,14                              ; jne           2828 <_sk_load_tables_rgb_u16_be_sse2+0x18c>
+  DB  117,14                              ; jne           2819 <_sk_load_tables_rgb_u16_be_sse2+0x18c>
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
-  DB  233,172,254,255,255                 ; jmpq          26d4 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  DB  233,172,254,255,255                 ; jmpq          26c5 <_sk_load_tables_rgb_u16_be_sse2+0x38>
   DB  102,71,15,110,84,81,6               ; movd          0x6(%r9,%r10,2),%xmm10
   DB  102,71,15,196,84,81,10,2            ; pinsrw        $0x2,0xa(%r9,%r10,2),%xmm10
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,24                              ; jb            2859 <_sk_load_tables_rgb_u16_be_sse2+0x1bd>
+  DB  114,24                              ; jb            284a <_sk_load_tables_rgb_u16_be_sse2+0x1bd>
   DB  102,67,15,110,76,81,12              ; movd          0xc(%r9,%r10,2),%xmm1
   DB  102,67,15,196,76,81,16,2            ; pinsrw        $0x2,0x10(%r9,%r10,2),%xmm1
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
-  DB  233,123,254,255,255                 ; jmpq          26d4 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  DB  233,123,254,255,255                 ; jmpq          26c5 <_sk_load_tables_rgb_u16_be_sse2+0x38>
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,114,254,255,255                 ; jmpq          26d4 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  DB  233,114,254,255,255                 ; jmpq          26c5 <_sk_load_tables_rgb_u16_be_sse2+0x38>
 
 PUBLIC _sk_byte_tables_sse2
 _sk_byte_tables_sse2 LABEL PROC
@@ -23681,7 +24514,7 @@
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,78,58,0,0                ; movaps        0x3a4e(%rip),%xmm8        # 62c0 <_sk_callback_sse2+0x6c0>
+  DB  68,15,40,5,29,61,0,0                ; movaps        0x3d1d(%rip),%xmm8        # 6580 <_sk_callback_sse2+0x6bd>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,91,192                       ; cvtps2dq      %xmm0,%xmm0
   DB  102,73,15,126,193                   ; movq          %xmm0,%r9
@@ -23709,7 +24542,7 @@
   DB  102,65,15,96,193                    ; punpcklbw     %xmm9,%xmm0
   DB  102,65,15,97,193                    ; punpcklwd     %xmm9,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,21,232,57,0,0              ; movaps        0x39e8(%rip),%xmm10        # 62d0 <_sk_callback_sse2+0x6d0>
+  DB  68,15,40,21,183,60,0,0              ; movaps        0x3cb7(%rip),%xmm10        # 6590 <_sk_callback_sse2+0x6cd>
   DB  65,15,89,194                        ; mulps         %xmm10,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -23828,7 +24661,7 @@
   DB  102,65,15,96,193                    ; punpcklbw     %xmm9,%xmm0
   DB  102,65,15,97,193                    ; punpcklwd     %xmm9,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,21,48,56,0,0               ; movaps        0x3830(%rip),%xmm10        # 62e0 <_sk_callback_sse2+0x6e0>
+  DB  68,15,40,21,255,58,0,0              ; movaps        0x3aff(%rip),%xmm10        # 65a0 <_sk_callback_sse2+0x6dd>
   DB  65,15,89,194                        ; mulps         %xmm10,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -24025,15 +24858,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,100,53,0,0              ; mulps         0x3564(%rip),%xmm9        # 62f0 <_sk_callback_sse2+0x6f0>
-  DB  68,15,84,21,108,53,0,0              ; andps         0x356c(%rip),%xmm10        # 6300 <_sk_callback_sse2+0x700>
-  DB  68,15,86,21,116,53,0,0              ; orps          0x3574(%rip),%xmm10        # 6310 <_sk_callback_sse2+0x710>
-  DB  68,15,88,13,124,53,0,0              ; addps         0x357c(%rip),%xmm9        # 6320 <_sk_callback_sse2+0x720>
-  DB  68,15,40,37,132,53,0,0              ; movaps        0x3584(%rip),%xmm12        # 6330 <_sk_callback_sse2+0x730>
+  DB  68,15,89,13,51,56,0,0               ; mulps         0x3833(%rip),%xmm9        # 65b0 <_sk_callback_sse2+0x6ed>
+  DB  68,15,84,21,59,56,0,0               ; andps         0x383b(%rip),%xmm10        # 65c0 <_sk_callback_sse2+0x6fd>
+  DB  68,15,86,21,67,56,0,0               ; orps          0x3843(%rip),%xmm10        # 65d0 <_sk_callback_sse2+0x70d>
+  DB  68,15,88,13,75,56,0,0               ; addps         0x384b(%rip),%xmm9        # 65e0 <_sk_callback_sse2+0x71d>
+  DB  68,15,40,37,83,56,0,0               ; movaps        0x3853(%rip),%xmm12        # 65f0 <_sk_callback_sse2+0x72d>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,132,53,0,0              ; addps         0x3584(%rip),%xmm10        # 6340 <_sk_callback_sse2+0x740>
-  DB  68,15,40,37,140,53,0,0              ; movaps        0x358c(%rip),%xmm12        # 6350 <_sk_callback_sse2+0x750>
+  DB  68,15,88,21,83,56,0,0               ; addps         0x3853(%rip),%xmm10        # 6600 <_sk_callback_sse2+0x73d>
+  DB  68,15,40,37,91,56,0,0               ; movaps        0x385b(%rip),%xmm12        # 6610 <_sk_callback_sse2+0x74d>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -24041,22 +24874,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,118,53,0,0              ; movaps        0x3576(%rip),%xmm10        # 6360 <_sk_callback_sse2+0x760>
+  DB  68,15,40,21,69,56,0,0               ; movaps        0x3845(%rip),%xmm10        # 6620 <_sk_callback_sse2+0x75d>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,106,53,0,0              ; addps         0x356a(%rip),%xmm9        # 6370 <_sk_callback_sse2+0x770>
-  DB  68,15,40,37,114,53,0,0              ; movaps        0x3572(%rip),%xmm12        # 6380 <_sk_callback_sse2+0x780>
+  DB  68,15,88,13,57,56,0,0               ; addps         0x3839(%rip),%xmm9        # 6630 <_sk_callback_sse2+0x76d>
+  DB  68,15,40,37,65,56,0,0               ; movaps        0x3841(%rip),%xmm12        # 6640 <_sk_callback_sse2+0x77d>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,114,53,0,0              ; movaps        0x3572(%rip),%xmm12        # 6390 <_sk_callback_sse2+0x790>
+  DB  68,15,40,37,65,56,0,0               ; movaps        0x3841(%rip),%xmm12        # 6650 <_sk_callback_sse2+0x78d>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,118,53,0,0              ; movaps        0x3576(%rip),%xmm13        # 63a0 <_sk_callback_sse2+0x7a0>
+  DB  68,15,40,45,69,56,0,0               ; movaps        0x3845(%rip),%xmm13        # 6660 <_sk_callback_sse2+0x79d>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,118,53,0,0              ; mulps         0x3576(%rip),%xmm13        # 63b0 <_sk_callback_sse2+0x7b0>
+  DB  68,15,89,45,69,56,0,0               ; mulps         0x3845(%rip),%xmm13        # 6670 <_sk_callback_sse2+0x7ad>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -24090,15 +24923,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,246,52,0,0              ; mulps         0x34f6(%rip),%xmm9        # 63c0 <_sk_callback_sse2+0x7c0>
-  DB  68,15,84,21,254,52,0,0              ; andps         0x34fe(%rip),%xmm10        # 63d0 <_sk_callback_sse2+0x7d0>
-  DB  68,15,86,21,6,53,0,0                ; orps          0x3506(%rip),%xmm10        # 63e0 <_sk_callback_sse2+0x7e0>
-  DB  68,15,88,13,14,53,0,0               ; addps         0x350e(%rip),%xmm9        # 63f0 <_sk_callback_sse2+0x7f0>
-  DB  68,15,40,37,22,53,0,0               ; movaps        0x3516(%rip),%xmm12        # 6400 <_sk_callback_sse2+0x800>
+  DB  68,15,89,13,197,55,0,0              ; mulps         0x37c5(%rip),%xmm9        # 6680 <_sk_callback_sse2+0x7bd>
+  DB  68,15,84,21,205,55,0,0              ; andps         0x37cd(%rip),%xmm10        # 6690 <_sk_callback_sse2+0x7cd>
+  DB  68,15,86,21,213,55,0,0              ; orps          0x37d5(%rip),%xmm10        # 66a0 <_sk_callback_sse2+0x7dd>
+  DB  68,15,88,13,221,55,0,0              ; addps         0x37dd(%rip),%xmm9        # 66b0 <_sk_callback_sse2+0x7ed>
+  DB  68,15,40,37,229,55,0,0              ; movaps        0x37e5(%rip),%xmm12        # 66c0 <_sk_callback_sse2+0x7fd>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,22,53,0,0               ; addps         0x3516(%rip),%xmm10        # 6410 <_sk_callback_sse2+0x810>
-  DB  68,15,40,37,30,53,0,0               ; movaps        0x351e(%rip),%xmm12        # 6420 <_sk_callback_sse2+0x820>
+  DB  68,15,88,21,229,55,0,0              ; addps         0x37e5(%rip),%xmm10        # 66d0 <_sk_callback_sse2+0x80d>
+  DB  68,15,40,37,237,55,0,0              ; movaps        0x37ed(%rip),%xmm12        # 66e0 <_sk_callback_sse2+0x81d>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -24106,22 +24939,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,8,53,0,0                ; movaps        0x3508(%rip),%xmm10        # 6430 <_sk_callback_sse2+0x830>
+  DB  68,15,40,21,215,55,0,0              ; movaps        0x37d7(%rip),%xmm10        # 66f0 <_sk_callback_sse2+0x82d>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,252,52,0,0              ; addps         0x34fc(%rip),%xmm9        # 6440 <_sk_callback_sse2+0x840>
-  DB  68,15,40,37,4,53,0,0                ; movaps        0x3504(%rip),%xmm12        # 6450 <_sk_callback_sse2+0x850>
+  DB  68,15,88,13,203,55,0,0              ; addps         0x37cb(%rip),%xmm9        # 6700 <_sk_callback_sse2+0x83d>
+  DB  68,15,40,37,211,55,0,0              ; movaps        0x37d3(%rip),%xmm12        # 6710 <_sk_callback_sse2+0x84d>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,4,53,0,0                ; movaps        0x3504(%rip),%xmm12        # 6460 <_sk_callback_sse2+0x860>
+  DB  68,15,40,37,211,55,0,0              ; movaps        0x37d3(%rip),%xmm12        # 6720 <_sk_callback_sse2+0x85d>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,8,53,0,0                ; movaps        0x3508(%rip),%xmm13        # 6470 <_sk_callback_sse2+0x870>
+  DB  68,15,40,45,215,55,0,0              ; movaps        0x37d7(%rip),%xmm13        # 6730 <_sk_callback_sse2+0x86d>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,8,53,0,0                ; mulps         0x3508(%rip),%xmm13        # 6480 <_sk_callback_sse2+0x880>
+  DB  68,15,89,45,215,55,0,0              ; mulps         0x37d7(%rip),%xmm13        # 6740 <_sk_callback_sse2+0x87d>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -24155,15 +24988,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,136,52,0,0              ; mulps         0x3488(%rip),%xmm9        # 6490 <_sk_callback_sse2+0x890>
-  DB  68,15,84,21,144,52,0,0              ; andps         0x3490(%rip),%xmm10        # 64a0 <_sk_callback_sse2+0x8a0>
-  DB  68,15,86,21,152,52,0,0              ; orps          0x3498(%rip),%xmm10        # 64b0 <_sk_callback_sse2+0x8b0>
-  DB  68,15,88,13,160,52,0,0              ; addps         0x34a0(%rip),%xmm9        # 64c0 <_sk_callback_sse2+0x8c0>
-  DB  68,15,40,37,168,52,0,0              ; movaps        0x34a8(%rip),%xmm12        # 64d0 <_sk_callback_sse2+0x8d0>
+  DB  68,15,89,13,87,55,0,0               ; mulps         0x3757(%rip),%xmm9        # 6750 <_sk_callback_sse2+0x88d>
+  DB  68,15,84,21,95,55,0,0               ; andps         0x375f(%rip),%xmm10        # 6760 <_sk_callback_sse2+0x89d>
+  DB  68,15,86,21,103,55,0,0              ; orps          0x3767(%rip),%xmm10        # 6770 <_sk_callback_sse2+0x8ad>
+  DB  68,15,88,13,111,55,0,0              ; addps         0x376f(%rip),%xmm9        # 6780 <_sk_callback_sse2+0x8bd>
+  DB  68,15,40,37,119,55,0,0              ; movaps        0x3777(%rip),%xmm12        # 6790 <_sk_callback_sse2+0x8cd>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,168,52,0,0              ; addps         0x34a8(%rip),%xmm10        # 64e0 <_sk_callback_sse2+0x8e0>
-  DB  68,15,40,37,176,52,0,0              ; movaps        0x34b0(%rip),%xmm12        # 64f0 <_sk_callback_sse2+0x8f0>
+  DB  68,15,88,21,119,55,0,0              ; addps         0x3777(%rip),%xmm10        # 67a0 <_sk_callback_sse2+0x8dd>
+  DB  68,15,40,37,127,55,0,0              ; movaps        0x377f(%rip),%xmm12        # 67b0 <_sk_callback_sse2+0x8ed>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -24171,22 +25004,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,154,52,0,0              ; movaps        0x349a(%rip),%xmm10        # 6500 <_sk_callback_sse2+0x900>
+  DB  68,15,40,21,105,55,0,0              ; movaps        0x3769(%rip),%xmm10        # 67c0 <_sk_callback_sse2+0x8fd>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,142,52,0,0              ; addps         0x348e(%rip),%xmm9        # 6510 <_sk_callback_sse2+0x910>
-  DB  68,15,40,37,150,52,0,0              ; movaps        0x3496(%rip),%xmm12        # 6520 <_sk_callback_sse2+0x920>
+  DB  68,15,88,13,93,55,0,0               ; addps         0x375d(%rip),%xmm9        # 67d0 <_sk_callback_sse2+0x90d>
+  DB  68,15,40,37,101,55,0,0              ; movaps        0x3765(%rip),%xmm12        # 67e0 <_sk_callback_sse2+0x91d>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,150,52,0,0              ; movaps        0x3496(%rip),%xmm12        # 6530 <_sk_callback_sse2+0x930>
+  DB  68,15,40,37,101,55,0,0              ; movaps        0x3765(%rip),%xmm12        # 67f0 <_sk_callback_sse2+0x92d>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,154,52,0,0              ; movaps        0x349a(%rip),%xmm13        # 6540 <_sk_callback_sse2+0x940>
+  DB  68,15,40,45,105,55,0,0              ; movaps        0x3769(%rip),%xmm13        # 6800 <_sk_callback_sse2+0x93d>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,154,52,0,0              ; mulps         0x349a(%rip),%xmm13        # 6550 <_sk_callback_sse2+0x950>
+  DB  68,15,89,45,105,55,0,0              ; mulps         0x3769(%rip),%xmm13        # 6810 <_sk_callback_sse2+0x94d>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -24220,15 +25053,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,26,52,0,0               ; mulps         0x341a(%rip),%xmm9        # 6560 <_sk_callback_sse2+0x960>
-  DB  68,15,84,21,34,52,0,0               ; andps         0x3422(%rip),%xmm10        # 6570 <_sk_callback_sse2+0x970>
-  DB  68,15,86,21,42,52,0,0               ; orps          0x342a(%rip),%xmm10        # 6580 <_sk_callback_sse2+0x980>
-  DB  68,15,88,13,50,52,0,0               ; addps         0x3432(%rip),%xmm9        # 6590 <_sk_callback_sse2+0x990>
-  DB  68,15,40,37,58,52,0,0               ; movaps        0x343a(%rip),%xmm12        # 65a0 <_sk_callback_sse2+0x9a0>
+  DB  68,15,89,13,233,54,0,0              ; mulps         0x36e9(%rip),%xmm9        # 6820 <_sk_callback_sse2+0x95d>
+  DB  68,15,84,21,241,54,0,0              ; andps         0x36f1(%rip),%xmm10        # 6830 <_sk_callback_sse2+0x96d>
+  DB  68,15,86,21,249,54,0,0              ; orps          0x36f9(%rip),%xmm10        # 6840 <_sk_callback_sse2+0x97d>
+  DB  68,15,88,13,1,55,0,0                ; addps         0x3701(%rip),%xmm9        # 6850 <_sk_callback_sse2+0x98d>
+  DB  68,15,40,37,9,55,0,0                ; movaps        0x3709(%rip),%xmm12        # 6860 <_sk_callback_sse2+0x99d>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,58,52,0,0               ; addps         0x343a(%rip),%xmm10        # 65b0 <_sk_callback_sse2+0x9b0>
-  DB  68,15,40,37,66,52,0,0               ; movaps        0x3442(%rip),%xmm12        # 65c0 <_sk_callback_sse2+0x9c0>
+  DB  68,15,88,21,9,55,0,0                ; addps         0x3709(%rip),%xmm10        # 6870 <_sk_callback_sse2+0x9ad>
+  DB  68,15,40,37,17,55,0,0               ; movaps        0x3711(%rip),%xmm12        # 6880 <_sk_callback_sse2+0x9bd>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -24236,22 +25069,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,44,52,0,0               ; movaps        0x342c(%rip),%xmm10        # 65d0 <_sk_callback_sse2+0x9d0>
+  DB  68,15,40,21,251,54,0,0              ; movaps        0x36fb(%rip),%xmm10        # 6890 <_sk_callback_sse2+0x9cd>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,32,52,0,0               ; addps         0x3420(%rip),%xmm9        # 65e0 <_sk_callback_sse2+0x9e0>
-  DB  68,15,40,37,40,52,0,0               ; movaps        0x3428(%rip),%xmm12        # 65f0 <_sk_callback_sse2+0x9f0>
+  DB  68,15,88,13,239,54,0,0              ; addps         0x36ef(%rip),%xmm9        # 68a0 <_sk_callback_sse2+0x9dd>
+  DB  68,15,40,37,247,54,0,0              ; movaps        0x36f7(%rip),%xmm12        # 68b0 <_sk_callback_sse2+0x9ed>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,40,52,0,0               ; movaps        0x3428(%rip),%xmm12        # 6600 <_sk_callback_sse2+0xa00>
+  DB  68,15,40,37,247,54,0,0              ; movaps        0x36f7(%rip),%xmm12        # 68c0 <_sk_callback_sse2+0x9fd>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,44,52,0,0               ; movaps        0x342c(%rip),%xmm13        # 6610 <_sk_callback_sse2+0xa10>
+  DB  68,15,40,45,251,54,0,0              ; movaps        0x36fb(%rip),%xmm13        # 68d0 <_sk_callback_sse2+0xa0d>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,44,52,0,0               ; mulps         0x342c(%rip),%xmm13        # 6620 <_sk_callback_sse2+0xa20>
+  DB  68,15,89,45,251,54,0,0              ; mulps         0x36fb(%rip),%xmm13        # 68e0 <_sk_callback_sse2+0xa1d>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -24266,29 +25099,29 @@
 
 PUBLIC _sk_lab_to_xyz_sse2
 _sk_lab_to_xyz_sse2 LABEL PROC
-  DB  15,89,5,9,52,0,0                    ; mulps         0x3409(%rip),%xmm0        # 6630 <_sk_callback_sse2+0xa30>
-  DB  68,15,40,5,17,52,0,0                ; movaps        0x3411(%rip),%xmm8        # 6640 <_sk_callback_sse2+0xa40>
+  DB  15,89,5,216,54,0,0                  ; mulps         0x36d8(%rip),%xmm0        # 68f0 <_sk_callback_sse2+0xa2d>
+  DB  68,15,40,5,224,54,0,0               ; movaps        0x36e0(%rip),%xmm8        # 6900 <_sk_callback_sse2+0xa3d>
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
-  DB  68,15,40,13,21,52,0,0               ; movaps        0x3415(%rip),%xmm9        # 6650 <_sk_callback_sse2+0xa50>
+  DB  68,15,40,13,228,54,0,0              ; movaps        0x36e4(%rip),%xmm9        # 6910 <_sk_callback_sse2+0xa4d>
   DB  65,15,88,201                        ; addps         %xmm9,%xmm1
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  65,15,88,209                        ; addps         %xmm9,%xmm2
-  DB  15,88,5,18,52,0,0                   ; addps         0x3412(%rip),%xmm0        # 6660 <_sk_callback_sse2+0xa60>
-  DB  15,89,5,27,52,0,0                   ; mulps         0x341b(%rip),%xmm0        # 6670 <_sk_callback_sse2+0xa70>
-  DB  15,89,13,36,52,0,0                  ; mulps         0x3424(%rip),%xmm1        # 6680 <_sk_callback_sse2+0xa80>
+  DB  15,88,5,225,54,0,0                  ; addps         0x36e1(%rip),%xmm0        # 6920 <_sk_callback_sse2+0xa5d>
+  DB  15,89,5,234,54,0,0                  ; mulps         0x36ea(%rip),%xmm0        # 6930 <_sk_callback_sse2+0xa6d>
+  DB  15,89,13,243,54,0,0                 ; mulps         0x36f3(%rip),%xmm1        # 6940 <_sk_callback_sse2+0xa7d>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
-  DB  15,89,21,42,52,0,0                  ; mulps         0x342a(%rip),%xmm2        # 6690 <_sk_callback_sse2+0xa90>
+  DB  15,89,21,249,54,0,0                 ; mulps         0x36f9(%rip),%xmm2        # 6950 <_sk_callback_sse2+0xa8d>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  68,15,92,202                        ; subps         %xmm2,%xmm9
   DB  68,15,40,225                        ; movaps        %xmm1,%xmm12
   DB  69,15,89,228                        ; mulps         %xmm12,%xmm12
   DB  68,15,89,225                        ; mulps         %xmm1,%xmm12
-  DB  15,40,21,31,52,0,0                  ; movaps        0x341f(%rip),%xmm2        # 66a0 <_sk_callback_sse2+0xaa0>
+  DB  15,40,21,238,54,0,0                 ; movaps        0x36ee(%rip),%xmm2        # 6960 <_sk_callback_sse2+0xa9d>
   DB  68,15,40,194                        ; movaps        %xmm2,%xmm8
   DB  69,15,194,196,1                     ; cmpltps       %xmm12,%xmm8
-  DB  68,15,40,21,30,52,0,0               ; movaps        0x341e(%rip),%xmm10        # 66b0 <_sk_callback_sse2+0xab0>
+  DB  68,15,40,21,237,54,0,0              ; movaps        0x36ed(%rip),%xmm10        # 6970 <_sk_callback_sse2+0xaad>
   DB  65,15,88,202                        ; addps         %xmm10,%xmm1
-  DB  68,15,40,29,34,52,0,0               ; movaps        0x3422(%rip),%xmm11        # 66c0 <_sk_callback_sse2+0xac0>
+  DB  68,15,40,29,241,54,0,0              ; movaps        0x36f1(%rip),%xmm11        # 6980 <_sk_callback_sse2+0xabd>
   DB  65,15,89,203                        ; mulps         %xmm11,%xmm1
   DB  69,15,84,224                        ; andps         %xmm8,%xmm12
   DB  68,15,85,193                        ; andnps        %xmm1,%xmm8
@@ -24312,8 +25145,8 @@
   DB  15,84,194                           ; andps         %xmm2,%xmm0
   DB  65,15,85,209                        ; andnps        %xmm9,%xmm2
   DB  15,86,208                           ; orps          %xmm0,%xmm2
-  DB  68,15,89,5,210,51,0,0               ; mulps         0x33d2(%rip),%xmm8        # 66d0 <_sk_callback_sse2+0xad0>
-  DB  15,89,21,219,51,0,0                 ; mulps         0x33db(%rip),%xmm2        # 66e0 <_sk_callback_sse2+0xae0>
+  DB  68,15,89,5,161,54,0,0               ; mulps         0x36a1(%rip),%xmm8        # 6990 <_sk_callback_sse2+0xacd>
+  DB  15,89,21,170,54,0,0                 ; mulps         0x36aa(%rip),%xmm2        # 69a0 <_sk_callback_sse2+0xadd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -24323,13 +25156,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,46                              ; jne           3345 <_sk_load_a8_sse2+0x38>
+  DB  117,46                              ; jne           3336 <_sk_load_a8_sse2+0x38>
   DB  102,65,15,110,4,18                  ; movd          (%r10,%rdx,1),%xmm0
   DB  102,15,96,192                       ; punpcklbw     %xmm0,%xmm0
   DB  102,15,97,192                       ; punpcklwd     %xmm0,%xmm0
-  DB  102,15,219,5,195,51,0,0             ; pand          0x33c3(%rip),%xmm0        # 66f0 <_sk_callback_sse2+0xaf0>
+  DB  102,15,219,5,146,54,0,0             ; pand          0x3692(%rip),%xmm0        # 69b0 <_sk_callback_sse2+0xaed>
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,201,51,0,0                 ; mulps         0x33c9(%rip),%xmm3        # 6700 <_sk_callback_sse2+0xb00>
+  DB  15,89,29,152,54,0,0                 ; mulps         0x3698(%rip),%xmm3        # 69c0 <_sk_callback_sse2+0xafd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
@@ -24338,12 +25171,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,54                              ; je            3388 <_sk_load_a8_sse2+0x7b>
+  DB  116,54                              ; je            3379 <_sk_load_a8_sse2+0x7b>
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3371 <_sk_load_a8_sse2+0x64>
+  DB  116,21                              ; je            3362 <_sk_load_a8_sse2+0x64>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,195                             ; jne           3325 <_sk_load_a8_sse2+0x18>
+  DB  117,195                             ; jne           3316 <_sk_load_a8_sse2+0x18>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,192,69                   ; pshufd        $0x45,%xmm0,%xmm0
@@ -24352,23 +25185,23 @@
   DB  102,15,96,200                       ; punpcklbw     %xmm0,%xmm1
   DB  102,15,97,200                       ; punpcklwd     %xmm0,%xmm1
   DB  242,15,16,193                       ; movsd         %xmm1,%xmm0
-  DB  235,157                             ; jmp           3325 <_sk_load_a8_sse2+0x18>
+  DB  235,157                             ; jmp           3316 <_sk_load_a8_sse2+0x18>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
-  DB  235,146                             ; jmp           3325 <_sk_load_a8_sse2+0x18>
+  DB  235,146                             ; jmp           3316 <_sk_load_a8_sse2+0x18>
 
 PUBLIC _sk_load_a8_dst_sse2
 _sk_load_a8_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,46                              ; jne           33cb <_sk_load_a8_dst_sse2+0x38>
+  DB  117,46                              ; jne           33bc <_sk_load_a8_dst_sse2+0x38>
   DB  102,65,15,110,36,18                 ; movd          (%r10,%rdx,1),%xmm4
   DB  102,15,96,224                       ; punpcklbw     %xmm0,%xmm4
   DB  102,15,97,224                       ; punpcklwd     %xmm0,%xmm4
-  DB  102,15,219,37,93,51,0,0             ; pand          0x335d(%rip),%xmm4        # 6710 <_sk_callback_sse2+0xb10>
+  DB  102,15,219,37,44,54,0,0             ; pand          0x362c(%rip),%xmm4        # 69d0 <_sk_callback_sse2+0xb0d>
   DB  15,91,252                           ; cvtdq2ps      %xmm4,%xmm7
-  DB  15,89,61,99,51,0,0                  ; mulps         0x3363(%rip),%xmm7        # 6720 <_sk_callback_sse2+0xb20>
+  DB  15,89,61,50,54,0,0                  ; mulps         0x3632(%rip),%xmm7        # 69e0 <_sk_callback_sse2+0xb1d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
   DB  102,15,87,237                       ; xorpd         %xmm5,%xmm5
@@ -24377,12 +25210,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,54                              ; je            340e <_sk_load_a8_dst_sse2+0x7b>
+  DB  116,54                              ; je            33ff <_sk_load_a8_dst_sse2+0x7b>
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            33f7 <_sk_load_a8_dst_sse2+0x64>
+  DB  116,21                              ; je            33e8 <_sk_load_a8_dst_sse2+0x64>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,195                             ; jne           33ab <_sk_load_a8_dst_sse2+0x18>
+  DB  117,195                             ; jne           339c <_sk_load_a8_dst_sse2+0x18>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,228,69                   ; pshufd        $0x45,%xmm4,%xmm4
@@ -24391,10 +25224,10 @@
   DB  102,15,96,232                       ; punpcklbw     %xmm0,%xmm5
   DB  102,15,97,232                       ; punpcklwd     %xmm0,%xmm5
   DB  242,15,16,229                       ; movsd         %xmm5,%xmm4
-  DB  235,157                             ; jmp           33ab <_sk_load_a8_dst_sse2+0x18>
+  DB  235,157                             ; jmp           339c <_sk_load_a8_dst_sse2+0x18>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
-  DB  235,146                             ; jmp           33ab <_sk_load_a8_dst_sse2+0x18>
+  DB  235,146                             ; jmp           339c <_sk_load_a8_dst_sse2+0x18>
 
 PUBLIC _sk_gather_a8_sse2
 _sk_gather_a8_sse2 LABEL PROC
@@ -24434,7 +25267,7 @@
   DB  102,15,96,193                       ; punpcklbw     %xmm1,%xmm0
   DB  102,15,97,193                       ; punpcklwd     %xmm1,%xmm0
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,132,50,0,0                 ; mulps         0x3284(%rip),%xmm3        # 6730 <_sk_callback_sse2+0xb30>
+  DB  15,89,29,83,53,0,0                  ; mulps         0x3553(%rip),%xmm3        # 69f0 <_sk_callback_sse2+0xb2d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
@@ -24448,7 +25281,7 @@
   DB  72,131,236,40                       ; sub           $0x28,%rsp
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  68,15,40,5,114,50,0,0               ; movaps        0x3272(%rip),%xmm8        # 6740 <_sk_callback_sse2+0xb40>
+  DB  68,15,40,5,65,53,0,0                ; movaps        0x3541(%rip),%xmm8        # 6a00 <_sk_callback_sse2+0xb3d>
   DB  68,15,89,195                        ; mulps         %xmm3,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
   DB  102,65,15,114,240,16                ; pslld         $0x10,%xmm8
@@ -24456,7 +25289,7 @@
   DB  102,69,15,107,192                   ; packssdw      %xmm8,%xmm8
   DB  102,69,15,103,192                   ; packuswb      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,17                              ; jne           3503 <_sk_store_a8_sse2+0x46>
+  DB  117,17                              ; jne           34f4 <_sk_store_a8_sse2+0x46>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  65,137,4,18                         ; mov           %eax,(%r10,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -24467,51 +25300,51 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,59                              ; je            3555 <_sk_store_a8_sse2+0x98>
+  DB  116,59                              ; je            3546 <_sk_store_a8_sse2+0x98>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,22                              ; je            3536 <_sk_store_a8_sse2+0x79>
+  DB  116,22                              ; je            3527 <_sk_store_a8_sse2+0x79>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,213                             ; jne           34fb <_sk_store_a8_sse2+0x3e>
+  DB  117,213                             ; jne           34ec <_sk_store_a8_sse2+0x3e>
   DB  102,68,15,127,68,36,16              ; movdqa        %xmm8,0x10(%rsp)
   DB  138,68,36,24                        ; mov           0x18(%rsp),%al
   DB  65,136,68,18,2                      ; mov           %al,0x2(%r10,%rdx,1)
-  DB  102,68,15,219,5,17,50,0,0           ; pand          0x3211(%rip),%xmm8        # 6750 <_sk_callback_sse2+0xb50>
+  DB  102,68,15,219,5,224,52,0,0          ; pand          0x34e0(%rip),%xmm8        # 6a10 <_sk_callback_sse2+0xb4d>
   DB  102,69,15,103,192                   ; packuswb      %xmm8,%xmm8
   DB  102,69,15,103,192                   ; packuswb      %xmm8,%xmm8
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,65,137,4,18                     ; mov           %ax,(%r10,%rdx,1)
-  DB  235,166                             ; jmp           34fb <_sk_store_a8_sse2+0x3e>
+  DB  235,166                             ; jmp           34ec <_sk_store_a8_sse2+0x3e>
   DB  102,68,15,127,4,36                  ; movdqa        %xmm8,(%rsp)
   DB  138,4,36                            ; mov           (%rsp),%al
   DB  65,136,4,18                         ; mov           %al,(%r10,%rdx,1)
-  DB  235,151                             ; jmp           34fb <_sk_store_a8_sse2+0x3e>
+  DB  235,151                             ; jmp           34ec <_sk_store_a8_sse2+0x3e>
 
 PUBLIC _sk_load_g8_sse2
 _sk_load_g8_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,49                              ; jne           359f <_sk_load_g8_sse2+0x3b>
+  DB  117,49                              ; jne           3590 <_sk_load_g8_sse2+0x3b>
   DB  102,65,15,110,4,18                  ; movd          (%r10,%rdx,1),%xmm0
   DB  102,15,96,192                       ; punpcklbw     %xmm0,%xmm0
   DB  102,15,97,192                       ; punpcklwd     %xmm0,%xmm0
-  DB  102,15,219,5,220,49,0,0             ; pand          0x31dc(%rip),%xmm0        # 6760 <_sk_callback_sse2+0xb60>
+  DB  102,15,219,5,171,52,0,0             ; pand          0x34ab(%rip),%xmm0        # 6a20 <_sk_callback_sse2+0xb5d>
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,226,49,0,0                  ; mulps         0x31e2(%rip),%xmm0        # 6770 <_sk_callback_sse2+0xb70>
+  DB  15,89,5,177,52,0,0                  ; mulps         0x34b1(%rip),%xmm0        # 6a30 <_sk_callback_sse2+0xb6d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,233,49,0,0                 ; movaps        0x31e9(%rip),%xmm3        # 6780 <_sk_callback_sse2+0xb80>
+  DB  15,40,29,184,52,0,0                 ; movaps        0x34b8(%rip),%xmm3        # 6a40 <_sk_callback_sse2+0xb7d>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,54                              ; je            35e2 <_sk_load_g8_sse2+0x7e>
+  DB  116,54                              ; je            35d3 <_sk_load_g8_sse2+0x7e>
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            35cb <_sk_load_g8_sse2+0x67>
+  DB  116,21                              ; je            35bc <_sk_load_g8_sse2+0x67>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,192                             ; jne           357c <_sk_load_g8_sse2+0x18>
+  DB  117,192                             ; jne           356d <_sk_load_g8_sse2+0x18>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,192,69                   ; pshufd        $0x45,%xmm0,%xmm0
@@ -24520,37 +25353,37 @@
   DB  102,15,96,200                       ; punpcklbw     %xmm0,%xmm1
   DB  102,15,97,200                       ; punpcklwd     %xmm0,%xmm1
   DB  242,15,16,193                       ; movsd         %xmm1,%xmm0
-  DB  235,154                             ; jmp           357c <_sk_load_g8_sse2+0x18>
+  DB  235,154                             ; jmp           356d <_sk_load_g8_sse2+0x18>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
-  DB  235,143                             ; jmp           357c <_sk_load_g8_sse2+0x18>
+  DB  235,143                             ; jmp           356d <_sk_load_g8_sse2+0x18>
 
 PUBLIC _sk_load_g8_dst_sse2
 _sk_load_g8_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,49                              ; jne           3628 <_sk_load_g8_dst_sse2+0x3b>
+  DB  117,49                              ; jne           3619 <_sk_load_g8_dst_sse2+0x3b>
   DB  102,65,15,110,36,18                 ; movd          (%r10,%rdx,1),%xmm4
   DB  102,15,96,224                       ; punpcklbw     %xmm0,%xmm4
   DB  102,15,97,224                       ; punpcklwd     %xmm0,%xmm4
-  DB  102,15,219,37,131,49,0,0            ; pand          0x3183(%rip),%xmm4        # 6790 <_sk_callback_sse2+0xb90>
+  DB  102,15,219,37,82,52,0,0             ; pand          0x3452(%rip),%xmm4        # 6a50 <_sk_callback_sse2+0xb8d>
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,137,49,0,0                 ; mulps         0x3189(%rip),%xmm4        # 67a0 <_sk_callback_sse2+0xba0>
+  DB  15,89,37,88,52,0,0                  ; mulps         0x3458(%rip),%xmm4        # 6a60 <_sk_callback_sse2+0xb9d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,61,144,49,0,0                 ; movaps        0x3190(%rip),%xmm7        # 67b0 <_sk_callback_sse2+0xbb0>
+  DB  15,40,61,95,52,0,0                  ; movaps        0x345f(%rip),%xmm7        # 6a70 <_sk_callback_sse2+0xbad>
   DB  15,40,236                           ; movaps        %xmm4,%xmm5
   DB  15,40,244                           ; movaps        %xmm4,%xmm6
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,54                              ; je            366b <_sk_load_g8_dst_sse2+0x7e>
+  DB  116,54                              ; je            365c <_sk_load_g8_dst_sse2+0x7e>
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3654 <_sk_load_g8_dst_sse2+0x67>
+  DB  116,21                              ; je            3645 <_sk_load_g8_dst_sse2+0x67>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,192                             ; jne           3605 <_sk_load_g8_dst_sse2+0x18>
+  DB  117,192                             ; jne           35f6 <_sk_load_g8_dst_sse2+0x18>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,228,69                   ; pshufd        $0x45,%xmm4,%xmm4
@@ -24559,10 +25392,10 @@
   DB  102,15,96,232                       ; punpcklbw     %xmm0,%xmm5
   DB  102,15,97,232                       ; punpcklwd     %xmm0,%xmm5
   DB  242,15,16,229                       ; movsd         %xmm5,%xmm4
-  DB  235,154                             ; jmp           3605 <_sk_load_g8_dst_sse2+0x18>
+  DB  235,154                             ; jmp           35f6 <_sk_load_g8_dst_sse2+0x18>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
-  DB  235,143                             ; jmp           3605 <_sk_load_g8_dst_sse2+0x18>
+  DB  235,143                             ; jmp           35f6 <_sk_load_g8_dst_sse2+0x18>
 
 PUBLIC _sk_gather_g8_sse2
 _sk_gather_g8_sse2 LABEL PROC
@@ -24602,9 +25435,9 @@
   DB  102,15,96,193                       ; punpcklbw     %xmm1,%xmm0
   DB  102,15,97,193                       ; punpcklwd     %xmm1,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,183,48,0,0                  ; mulps         0x30b7(%rip),%xmm0        # 67c0 <_sk_callback_sse2+0xbc0>
+  DB  15,89,5,134,51,0,0                  ; mulps         0x3386(%rip),%xmm0        # 6a80 <_sk_callback_sse2+0xbbd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,190,48,0,0                 ; movaps        0x30be(%rip),%xmm3        # 67d0 <_sk_callback_sse2+0xbd0>
+  DB  15,40,29,141,51,0,0                 ; movaps        0x338d(%rip),%xmm3        # 6a90 <_sk_callback_sse2+0xbcd>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  91                                  ; pop           %rbx
@@ -24616,9 +25449,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,193                          ; mov           %rax,%r9
   DB  77,133,201                          ; test          %r9,%r9
-  DB  116,5                               ; je            372b <_sk_gather_i8_sse2+0xf>
+  DB  116,5                               ; je            371c <_sk_gather_i8_sse2+0xf>
   DB  76,137,200                          ; mov           %r9,%rax
-  DB  235,2                               ; jmp           372d <_sk_gather_i8_sse2+0x11>
+  DB  235,2                               ; jmp           371e <_sk_gather_i8_sse2+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  85                                  ; push          %rbp
   DB  65,86                               ; push          %r14
@@ -24670,11 +25503,11 @@
   DB  102,66,15,110,76,149,0              ; movd          0x0(%rbp,%r10,4),%xmm1
   DB  102,68,15,98,201                    ; punpckldq     %xmm1,%xmm9
   DB  102,68,15,98,200                    ; punpckldq     %xmm0,%xmm9
-  DB  102,15,111,21,215,47,0,0            ; movdqa        0x2fd7(%rip),%xmm2        # 67e0 <_sk_callback_sse2+0xbe0>
+  DB  102,15,111,21,166,50,0,0            ; movdqa        0x32a6(%rip),%xmm2        # 6aa0 <_sk_callback_sse2+0xbdd>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,211,47,0,0               ; movaps        0x2fd3(%rip),%xmm8        # 67f0 <_sk_callback_sse2+0xbf0>
+  DB  68,15,40,5,162,50,0,0               ; movaps        0x32a2(%rip),%xmm8        # 6ab0 <_sk_callback_sse2+0xbed>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -24700,84 +25533,84 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,83                              ; jne           38be <_sk_load_565_sse2+0x5d>
+  DB  117,83                              ; jne           38af <_sk_load_565_sse2+0x5d>
   DB  243,65,15,126,20,82                 ; movq          (%r10,%rdx,2),%xmm2
   DB  102,15,97,208                       ; punpcklwd     %xmm0,%xmm2
-  DB  102,15,111,5,131,47,0,0             ; movdqa        0x2f83(%rip),%xmm0        # 6800 <_sk_callback_sse2+0xc00>
+  DB  102,15,111,5,82,50,0,0              ; movdqa        0x3252(%rip),%xmm0        # 6ac0 <_sk_callback_sse2+0xbfd>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,133,47,0,0                  ; mulps         0x2f85(%rip),%xmm0        # 6810 <_sk_callback_sse2+0xc10>
-  DB  102,15,111,13,141,47,0,0            ; movdqa        0x2f8d(%rip),%xmm1        # 6820 <_sk_callback_sse2+0xc20>
+  DB  15,89,5,84,50,0,0                   ; mulps         0x3254(%rip),%xmm0        # 6ad0 <_sk_callback_sse2+0xc0d>
+  DB  102,15,111,13,92,50,0,0             ; movdqa        0x325c(%rip),%xmm1        # 6ae0 <_sk_callback_sse2+0xc1d>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,143,47,0,0                 ; mulps         0x2f8f(%rip),%xmm1        # 6830 <_sk_callback_sse2+0xc30>
-  DB  102,15,219,21,151,47,0,0            ; pand          0x2f97(%rip),%xmm2        # 6840 <_sk_callback_sse2+0xc40>
+  DB  15,89,13,94,50,0,0                  ; mulps         0x325e(%rip),%xmm1        # 6af0 <_sk_callback_sse2+0xc2d>
+  DB  102,15,219,21,102,50,0,0            ; pand          0x3266(%rip),%xmm2        # 6b00 <_sk_callback_sse2+0xc3d>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,157,47,0,0                 ; mulps         0x2f9d(%rip),%xmm2        # 6850 <_sk_callback_sse2+0xc50>
+  DB  15,89,21,108,50,0,0                 ; mulps         0x326c(%rip),%xmm2        # 6b10 <_sk_callback_sse2+0xc4d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,164,47,0,0                 ; movaps        0x2fa4(%rip),%xmm3        # 6860 <_sk_callback_sse2+0xc60>
+  DB  15,40,29,115,50,0,0                 ; movaps        0x3273(%rip),%xmm3        # 6b20 <_sk_callback_sse2+0xc5d>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,50                              ; je            38fd <_sk_load_565_sse2+0x9c>
+  DB  116,50                              ; je            38ee <_sk_load_565_sse2+0x9c>
   DB  102,15,239,210                      ; pxor          %xmm2,%xmm2
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            38ea <_sk_load_565_sse2+0x89>
+  DB  116,21                              ; je            38db <_sk_load_565_sse2+0x89>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,154                             ; jne           3875 <_sk_load_565_sse2+0x14>
+  DB  117,154                             ; jne           3866 <_sk_load_565_sse2+0x14>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,208,69                   ; pshufd        $0x45,%xmm0,%xmm2
   DB  102,65,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm0
   DB  102,15,97,192                       ; punpcklwd     %xmm0,%xmm0
   DB  242,15,16,208                       ; movsd         %xmm0,%xmm2
-  DB  233,120,255,255,255                 ; jmpq          3875 <_sk_load_565_sse2+0x14>
+  DB  233,120,255,255,255                 ; jmpq          3866 <_sk_load_565_sse2+0x14>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,208                      ; movd          %eax,%xmm2
-  DB  233,106,255,255,255                 ; jmpq          3875 <_sk_load_565_sse2+0x14>
+  DB  233,106,255,255,255                 ; jmpq          3866 <_sk_load_565_sse2+0x14>
 
 PUBLIC _sk_load_565_dst_sse2
 _sk_load_565_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,83                              ; jne           3968 <_sk_load_565_dst_sse2+0x5d>
+  DB  117,83                              ; jne           3959 <_sk_load_565_dst_sse2+0x5d>
   DB  243,65,15,126,52,82                 ; movq          (%r10,%rdx,2),%xmm6
   DB  102,15,97,240                       ; punpcklwd     %xmm0,%xmm6
-  DB  102,15,111,37,73,47,0,0             ; movdqa        0x2f49(%rip),%xmm4        # 6870 <_sk_callback_sse2+0xc70>
+  DB  102,15,111,37,24,50,0,0             ; movdqa        0x3218(%rip),%xmm4        # 6b30 <_sk_callback_sse2+0xc6d>
   DB  102,15,219,230                      ; pand          %xmm6,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,75,47,0,0                  ; mulps         0x2f4b(%rip),%xmm4        # 6880 <_sk_callback_sse2+0xc80>
-  DB  102,15,111,45,83,47,0,0             ; movdqa        0x2f53(%rip),%xmm5        # 6890 <_sk_callback_sse2+0xc90>
+  DB  15,89,37,26,50,0,0                  ; mulps         0x321a(%rip),%xmm4        # 6b40 <_sk_callback_sse2+0xc7d>
+  DB  102,15,111,45,34,50,0,0             ; movdqa        0x3222(%rip),%xmm5        # 6b50 <_sk_callback_sse2+0xc8d>
   DB  102,15,219,238                      ; pand          %xmm6,%xmm5
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
-  DB  15,89,45,85,47,0,0                  ; mulps         0x2f55(%rip),%xmm5        # 68a0 <_sk_callback_sse2+0xca0>
-  DB  102,15,219,53,93,47,0,0             ; pand          0x2f5d(%rip),%xmm6        # 68b0 <_sk_callback_sse2+0xcb0>
+  DB  15,89,45,36,50,0,0                  ; mulps         0x3224(%rip),%xmm5        # 6b60 <_sk_callback_sse2+0xc9d>
+  DB  102,15,219,53,44,50,0,0             ; pand          0x322c(%rip),%xmm6        # 6b70 <_sk_callback_sse2+0xcad>
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
-  DB  15,89,53,99,47,0,0                  ; mulps         0x2f63(%rip),%xmm6        # 68c0 <_sk_callback_sse2+0xcc0>
+  DB  15,89,53,50,50,0,0                  ; mulps         0x3232(%rip),%xmm6        # 6b80 <_sk_callback_sse2+0xcbd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,61,106,47,0,0                 ; movaps        0x2f6a(%rip),%xmm7        # 68d0 <_sk_callback_sse2+0xcd0>
+  DB  15,40,61,57,50,0,0                  ; movaps        0x3239(%rip),%xmm7        # 6b90 <_sk_callback_sse2+0xccd>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,50                              ; je            39a7 <_sk_load_565_dst_sse2+0x9c>
+  DB  116,50                              ; je            3998 <_sk_load_565_dst_sse2+0x9c>
   DB  102,15,239,246                      ; pxor          %xmm6,%xmm6
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3994 <_sk_load_565_dst_sse2+0x89>
+  DB  116,21                              ; je            3985 <_sk_load_565_dst_sse2+0x89>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,154                             ; jne           391f <_sk_load_565_dst_sse2+0x14>
+  DB  117,154                             ; jne           3910 <_sk_load_565_dst_sse2+0x14>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,244,69                   ; pshufd        $0x45,%xmm4,%xmm6
   DB  102,65,15,110,36,82                 ; movd          (%r10,%rdx,2),%xmm4
   DB  102,15,97,224                       ; punpcklwd     %xmm0,%xmm4
   DB  242,15,16,244                       ; movsd         %xmm4,%xmm6
-  DB  233,120,255,255,255                 ; jmpq          391f <_sk_load_565_dst_sse2+0x14>
+  DB  233,120,255,255,255                 ; jmpq          3910 <_sk_load_565_dst_sse2+0x14>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,240                      ; movd          %eax,%xmm6
-  DB  233,106,255,255,255                 ; jmpq          391f <_sk_load_565_dst_sse2+0x14>
+  DB  233,106,255,255,255                 ; jmpq          3910 <_sk_load_565_dst_sse2+0x14>
 
 PUBLIC _sk_gather_565_sse2
 _sk_gather_565_sse2 LABEL PROC
@@ -24810,19 +25643,19 @@
   DB  102,15,196,208,3                    ; pinsrw        $0x3,%eax,%xmm2
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,97,208                       ; punpcklwd     %xmm0,%xmm2
-  DB  102,15,111,5,165,46,0,0             ; movdqa        0x2ea5(%rip),%xmm0        # 68e0 <_sk_callback_sse2+0xce0>
+  DB  102,15,111,5,116,49,0,0             ; movdqa        0x3174(%rip),%xmm0        # 6ba0 <_sk_callback_sse2+0xcdd>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,167,46,0,0                  ; mulps         0x2ea7(%rip),%xmm0        # 68f0 <_sk_callback_sse2+0xcf0>
-  DB  102,15,111,13,175,46,0,0            ; movdqa        0x2eaf(%rip),%xmm1        # 6900 <_sk_callback_sse2+0xd00>
+  DB  15,89,5,118,49,0,0                  ; mulps         0x3176(%rip),%xmm0        # 6bb0 <_sk_callback_sse2+0xced>
+  DB  102,15,111,13,126,49,0,0            ; movdqa        0x317e(%rip),%xmm1        # 6bc0 <_sk_callback_sse2+0xcfd>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,177,46,0,0                 ; mulps         0x2eb1(%rip),%xmm1        # 6910 <_sk_callback_sse2+0xd10>
-  DB  102,15,219,21,185,46,0,0            ; pand          0x2eb9(%rip),%xmm2        # 6920 <_sk_callback_sse2+0xd20>
+  DB  15,89,13,128,49,0,0                 ; mulps         0x3180(%rip),%xmm1        # 6bd0 <_sk_callback_sse2+0xd0d>
+  DB  102,15,219,21,136,49,0,0            ; pand          0x3188(%rip),%xmm2        # 6be0 <_sk_callback_sse2+0xd1d>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,191,46,0,0                 ; mulps         0x2ebf(%rip),%xmm2        # 6930 <_sk_callback_sse2+0xd30>
+  DB  15,89,21,142,49,0,0                 ; mulps         0x318e(%rip),%xmm2        # 6bf0 <_sk_callback_sse2+0xd2d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,198,46,0,0                 ; movaps        0x2ec6(%rip),%xmm3        # 6940 <_sk_callback_sse2+0xd40>
+  DB  15,40,29,149,49,0,0                 ; movaps        0x3195(%rip),%xmm3        # 6c00 <_sk_callback_sse2+0xd3d>
   DB  91                                  ; pop           %rbx
   DB  255,224                             ; jmpq          *%rax
 
@@ -24830,12 +25663,12 @@
 _sk_store_565_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  68,15,40,5,198,46,0,0               ; movaps        0x2ec6(%rip),%xmm8        # 6950 <_sk_callback_sse2+0xd50>
+  DB  68,15,40,5,149,49,0,0               ; movaps        0x3195(%rip),%xmm8        # 6c10 <_sk_callback_sse2+0xd4d>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
   DB  102,65,15,114,241,11                ; pslld         $0xb,%xmm9
-  DB  68,15,40,21,187,46,0,0              ; movaps        0x2ebb(%rip),%xmm10        # 6960 <_sk_callback_sse2+0xd60>
+  DB  68,15,40,21,138,49,0,0              ; movaps        0x318a(%rip),%xmm10        # 6c20 <_sk_callback_sse2+0xd5d>
   DB  68,15,89,209                        ; mulps         %xmm1,%xmm10
   DB  102,69,15,91,210                    ; cvtps2dq      %xmm10,%xmm10
   DB  102,65,15,114,242,5                 ; pslld         $0x5,%xmm10
@@ -24847,7 +25680,7 @@
   DB  102,65,15,114,224,16                ; psrad         $0x10,%xmm8
   DB  102,69,15,107,192                   ; packssdw      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3ae7 <_sk_store_565_sse2+0x6a>
+  DB  117,10                              ; jne           3ad8 <_sk_store_565_sse2+0x6a>
   DB  242,69,15,17,4,82                   ; movsd         %xmm8,(%r10,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -24855,109 +25688,109 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,38                              ; je            3b1f <_sk_store_565_sse2+0xa2>
+  DB  116,38                              ; je            3b10 <_sk_store_565_sse2+0xa2>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,18                              ; je            3b11 <_sk_store_565_sse2+0x94>
+  DB  116,18                              ; je            3b02 <_sk_store_565_sse2+0x94>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,222                             ; jne           3ae3 <_sk_store_565_sse2+0x66>
+  DB  117,222                             ; jne           3ad4 <_sk_store_565_sse2+0x66>
   DB  102,65,15,197,192,4                 ; pextrw        $0x4,%xmm8,%eax
   DB  102,65,137,68,82,4                  ; mov           %ax,0x4(%r10,%rdx,2)
   DB  242,69,15,112,192,232               ; pshuflw       $0xe8,%xmm8,%xmm8
   DB  102,69,15,126,4,82                  ; movd          %xmm8,(%r10,%rdx,2)
-  DB  235,196                             ; jmp           3ae3 <_sk_store_565_sse2+0x66>
+  DB  235,196                             ; jmp           3ad4 <_sk_store_565_sse2+0x66>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,65,137,4,82                     ; mov           %ax,(%r10,%rdx,2)
-  DB  235,184                             ; jmp           3ae3 <_sk_store_565_sse2+0x66>
+  DB  235,184                             ; jmp           3ad4 <_sk_store_565_sse2+0x66>
 
 PUBLIC _sk_load_4444_sse2
 _sk_load_4444_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,98                              ; jne           3b97 <_sk_load_4444_sse2+0x6c>
+  DB  117,98                              ; jne           3b88 <_sk_load_4444_sse2+0x6c>
   DB  243,65,15,126,28,82                 ; movq          (%r10,%rdx,2),%xmm3
   DB  102,15,97,216                       ; punpcklwd     %xmm0,%xmm3
-  DB  102,15,111,5,41,46,0,0              ; movdqa        0x2e29(%rip),%xmm0        # 6970 <_sk_callback_sse2+0xd70>
+  DB  102,15,111,5,248,48,0,0             ; movdqa        0x30f8(%rip),%xmm0        # 6c30 <_sk_callback_sse2+0xd6d>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,43,46,0,0                   ; mulps         0x2e2b(%rip),%xmm0        # 6980 <_sk_callback_sse2+0xd80>
-  DB  102,15,111,13,51,46,0,0             ; movdqa        0x2e33(%rip),%xmm1        # 6990 <_sk_callback_sse2+0xd90>
+  DB  15,89,5,250,48,0,0                  ; mulps         0x30fa(%rip),%xmm0        # 6c40 <_sk_callback_sse2+0xd7d>
+  DB  102,15,111,13,2,49,0,0              ; movdqa        0x3102(%rip),%xmm1        # 6c50 <_sk_callback_sse2+0xd8d>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,53,46,0,0                  ; mulps         0x2e35(%rip),%xmm1        # 69a0 <_sk_callback_sse2+0xda0>
-  DB  102,15,111,21,61,46,0,0             ; movdqa        0x2e3d(%rip),%xmm2        # 69b0 <_sk_callback_sse2+0xdb0>
+  DB  15,89,13,4,49,0,0                   ; mulps         0x3104(%rip),%xmm1        # 6c60 <_sk_callback_sse2+0xd9d>
+  DB  102,15,111,21,12,49,0,0             ; movdqa        0x310c(%rip),%xmm2        # 6c70 <_sk_callback_sse2+0xdad>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,63,46,0,0                  ; mulps         0x2e3f(%rip),%xmm2        # 69c0 <_sk_callback_sse2+0xdc0>
-  DB  102,15,219,29,71,46,0,0             ; pand          0x2e47(%rip),%xmm3        # 69d0 <_sk_callback_sse2+0xdd0>
+  DB  15,89,21,14,49,0,0                  ; mulps         0x310e(%rip),%xmm2        # 6c80 <_sk_callback_sse2+0xdbd>
+  DB  102,15,219,29,22,49,0,0             ; pand          0x3116(%rip),%xmm3        # 6c90 <_sk_callback_sse2+0xdcd>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,77,46,0,0                  ; mulps         0x2e4d(%rip),%xmm3        # 69e0 <_sk_callback_sse2+0xde0>
+  DB  15,89,29,28,49,0,0                  ; mulps         0x311c(%rip),%xmm3        # 6ca0 <_sk_callback_sse2+0xddd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,50                              ; je            3bd6 <_sk_load_4444_sse2+0xab>
+  DB  116,50                              ; je            3bc7 <_sk_load_4444_sse2+0xab>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3bc3 <_sk_load_4444_sse2+0x98>
+  DB  116,21                              ; je            3bb4 <_sk_load_4444_sse2+0x98>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,139                             ; jne           3b3f <_sk_load_4444_sse2+0x14>
+  DB  117,139                             ; jne           3b30 <_sk_load_4444_sse2+0x14>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
   DB  102,65,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm0
   DB  102,15,97,192                       ; punpcklwd     %xmm0,%xmm0
   DB  242,15,16,216                       ; movsd         %xmm0,%xmm3
-  DB  233,105,255,255,255                 ; jmpq          3b3f <_sk_load_4444_sse2+0x14>
+  DB  233,105,255,255,255                 ; jmpq          3b30 <_sk_load_4444_sse2+0x14>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,216                      ; movd          %eax,%xmm3
-  DB  233,91,255,255,255                  ; jmpq          3b3f <_sk_load_4444_sse2+0x14>
+  DB  233,91,255,255,255                  ; jmpq          3b30 <_sk_load_4444_sse2+0x14>
 
 PUBLIC _sk_load_4444_dst_sse2
 _sk_load_4444_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,98                              ; jne           3c50 <_sk_load_4444_dst_sse2+0x6c>
+  DB  117,98                              ; jne           3c41 <_sk_load_4444_dst_sse2+0x6c>
   DB  243,65,15,126,60,82                 ; movq          (%r10,%rdx,2),%xmm7
   DB  102,15,97,248                       ; punpcklwd     %xmm0,%xmm7
-  DB  102,15,111,37,240,45,0,0            ; movdqa        0x2df0(%rip),%xmm4        # 69f0 <_sk_callback_sse2+0xdf0>
+  DB  102,15,111,37,191,48,0,0            ; movdqa        0x30bf(%rip),%xmm4        # 6cb0 <_sk_callback_sse2+0xded>
   DB  102,15,219,231                      ; pand          %xmm7,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,242,45,0,0                 ; mulps         0x2df2(%rip),%xmm4        # 6a00 <_sk_callback_sse2+0xe00>
-  DB  102,15,111,45,250,45,0,0            ; movdqa        0x2dfa(%rip),%xmm5        # 6a10 <_sk_callback_sse2+0xe10>
+  DB  15,89,37,193,48,0,0                 ; mulps         0x30c1(%rip),%xmm4        # 6cc0 <_sk_callback_sse2+0xdfd>
+  DB  102,15,111,45,201,48,0,0            ; movdqa        0x30c9(%rip),%xmm5        # 6cd0 <_sk_callback_sse2+0xe0d>
   DB  102,15,219,239                      ; pand          %xmm7,%xmm5
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
-  DB  15,89,45,252,45,0,0                 ; mulps         0x2dfc(%rip),%xmm5        # 6a20 <_sk_callback_sse2+0xe20>
-  DB  102,15,111,53,4,46,0,0              ; movdqa        0x2e04(%rip),%xmm6        # 6a30 <_sk_callback_sse2+0xe30>
+  DB  15,89,45,203,48,0,0                 ; mulps         0x30cb(%rip),%xmm5        # 6ce0 <_sk_callback_sse2+0xe1d>
+  DB  102,15,111,53,211,48,0,0            ; movdqa        0x30d3(%rip),%xmm6        # 6cf0 <_sk_callback_sse2+0xe2d>
   DB  102,15,219,247                      ; pand          %xmm7,%xmm6
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
-  DB  15,89,53,6,46,0,0                   ; mulps         0x2e06(%rip),%xmm6        # 6a40 <_sk_callback_sse2+0xe40>
-  DB  102,15,219,61,14,46,0,0             ; pand          0x2e0e(%rip),%xmm7        # 6a50 <_sk_callback_sse2+0xe50>
+  DB  15,89,53,213,48,0,0                 ; mulps         0x30d5(%rip),%xmm6        # 6d00 <_sk_callback_sse2+0xe3d>
+  DB  102,15,219,61,221,48,0,0            ; pand          0x30dd(%rip),%xmm7        # 6d10 <_sk_callback_sse2+0xe4d>
   DB  15,91,255                           ; cvtdq2ps      %xmm7,%xmm7
-  DB  15,89,61,20,46,0,0                  ; mulps         0x2e14(%rip),%xmm7        # 6a60 <_sk_callback_sse2+0xe60>
+  DB  15,89,61,227,48,0,0                 ; mulps         0x30e3(%rip),%xmm7        # 6d20 <_sk_callback_sse2+0xe5d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,50                              ; je            3c8f <_sk_load_4444_dst_sse2+0xab>
+  DB  116,50                              ; je            3c80 <_sk_load_4444_dst_sse2+0xab>
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3c7c <_sk_load_4444_dst_sse2+0x98>
+  DB  116,21                              ; je            3c6d <_sk_load_4444_dst_sse2+0x98>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,139                             ; jne           3bf8 <_sk_load_4444_dst_sse2+0x14>
+  DB  117,139                             ; jne           3be9 <_sk_load_4444_dst_sse2+0x14>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  102,65,15,110,36,82                 ; movd          (%r10,%rdx,2),%xmm4
   DB  102,15,97,224                       ; punpcklwd     %xmm0,%xmm4
   DB  242,15,16,252                       ; movsd         %xmm4,%xmm7
-  DB  233,105,255,255,255                 ; jmpq          3bf8 <_sk_load_4444_dst_sse2+0x14>
+  DB  233,105,255,255,255                 ; jmpq          3be9 <_sk_load_4444_dst_sse2+0x14>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,248                      ; movd          %eax,%xmm7
-  DB  233,91,255,255,255                  ; jmpq          3bf8 <_sk_load_4444_dst_sse2+0x14>
+  DB  233,91,255,255,255                  ; jmpq          3be9 <_sk_load_4444_dst_sse2+0x14>
 
 PUBLIC _sk_gather_4444_sse2
 _sk_gather_4444_sse2 LABEL PROC
@@ -24990,21 +25823,21 @@
   DB  102,15,196,216,3                    ; pinsrw        $0x3,%eax,%xmm3
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,97,216                       ; punpcklwd     %xmm0,%xmm3
-  DB  102,15,111,5,77,45,0,0              ; movdqa        0x2d4d(%rip),%xmm0        # 6a70 <_sk_callback_sse2+0xe70>
+  DB  102,15,111,5,28,48,0,0              ; movdqa        0x301c(%rip),%xmm0        # 6d30 <_sk_callback_sse2+0xe6d>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,79,45,0,0                   ; mulps         0x2d4f(%rip),%xmm0        # 6a80 <_sk_callback_sse2+0xe80>
-  DB  102,15,111,13,87,45,0,0             ; movdqa        0x2d57(%rip),%xmm1        # 6a90 <_sk_callback_sse2+0xe90>
+  DB  15,89,5,30,48,0,0                   ; mulps         0x301e(%rip),%xmm0        # 6d40 <_sk_callback_sse2+0xe7d>
+  DB  102,15,111,13,38,48,0,0             ; movdqa        0x3026(%rip),%xmm1        # 6d50 <_sk_callback_sse2+0xe8d>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,89,45,0,0                  ; mulps         0x2d59(%rip),%xmm1        # 6aa0 <_sk_callback_sse2+0xea0>
-  DB  102,15,111,21,97,45,0,0             ; movdqa        0x2d61(%rip),%xmm2        # 6ab0 <_sk_callback_sse2+0xeb0>
+  DB  15,89,13,40,48,0,0                  ; mulps         0x3028(%rip),%xmm1        # 6d60 <_sk_callback_sse2+0xe9d>
+  DB  102,15,111,21,48,48,0,0             ; movdqa        0x3030(%rip),%xmm2        # 6d70 <_sk_callback_sse2+0xead>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,99,45,0,0                  ; mulps         0x2d63(%rip),%xmm2        # 6ac0 <_sk_callback_sse2+0xec0>
-  DB  102,15,219,29,107,45,0,0            ; pand          0x2d6b(%rip),%xmm3        # 6ad0 <_sk_callback_sse2+0xed0>
+  DB  15,89,21,50,48,0,0                  ; mulps         0x3032(%rip),%xmm2        # 6d80 <_sk_callback_sse2+0xebd>
+  DB  102,15,219,29,58,48,0,0             ; pand          0x303a(%rip),%xmm3        # 6d90 <_sk_callback_sse2+0xecd>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,113,45,0,0                 ; mulps         0x2d71(%rip),%xmm3        # 6ae0 <_sk_callback_sse2+0xee0>
+  DB  15,89,29,64,48,0,0                  ; mulps         0x3040(%rip),%xmm3        # 6da0 <_sk_callback_sse2+0xedd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  255,224                             ; jmpq          *%rax
@@ -25013,7 +25846,7 @@
 _sk_store_4444_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  68,15,40,5,111,45,0,0               ; movaps        0x2d6f(%rip),%xmm8        # 6af0 <_sk_callback_sse2+0xef0>
+  DB  68,15,40,5,62,48,0,0                ; movaps        0x303e(%rip),%xmm8        # 6db0 <_sk_callback_sse2+0xeed>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -25035,7 +25868,7 @@
   DB  102,65,15,114,224,16                ; psrad         $0x10,%xmm8
   DB  102,69,15,107,192                   ; packssdw      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3df2 <_sk_store_4444_sse2+0x7e>
+  DB  117,10                              ; jne           3de3 <_sk_store_4444_sse2+0x7e>
   DB  242,69,15,17,4,82                   ; movsd         %xmm8,(%r10,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -25043,32 +25876,32 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,38                              ; je            3e2a <_sk_store_4444_sse2+0xb6>
+  DB  116,38                              ; je            3e1b <_sk_store_4444_sse2+0xb6>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,18                              ; je            3e1c <_sk_store_4444_sse2+0xa8>
+  DB  116,18                              ; je            3e0d <_sk_store_4444_sse2+0xa8>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,222                             ; jne           3dee <_sk_store_4444_sse2+0x7a>
+  DB  117,222                             ; jne           3ddf <_sk_store_4444_sse2+0x7a>
   DB  102,65,15,197,192,4                 ; pextrw        $0x4,%xmm8,%eax
   DB  102,65,137,68,82,4                  ; mov           %ax,0x4(%r10,%rdx,2)
   DB  242,69,15,112,192,232               ; pshuflw       $0xe8,%xmm8,%xmm8
   DB  102,69,15,126,4,82                  ; movd          %xmm8,(%r10,%rdx,2)
-  DB  235,196                             ; jmp           3dee <_sk_store_4444_sse2+0x7a>
+  DB  235,196                             ; jmp           3ddf <_sk_store_4444_sse2+0x7a>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,65,137,4,82                     ; mov           %ax,(%r10,%rdx,2)
-  DB  235,184                             ; jmp           3dee <_sk_store_4444_sse2+0x7a>
+  DB  235,184                             ; jmp           3ddf <_sk_store_4444_sse2+0x7a>
 
 PUBLIC _sk_load_8888_sse2
 _sk_load_8888_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,98                              ; jne           3ea2 <_sk_load_8888_sse2+0x6c>
+  DB  117,98                              ; jne           3e93 <_sk_load_8888_sse2+0x6c>
   DB  243,68,15,111,12,144                ; movdqu        (%rax,%rdx,4),%xmm9
-  DB  102,15,111,21,178,44,0,0            ; movdqa        0x2cb2(%rip),%xmm2        # 6b00 <_sk_callback_sse2+0xf00>
+  DB  102,15,111,21,129,47,0,0            ; movdqa        0x2f81(%rip),%xmm2        # 6dc0 <_sk_callback_sse2+0xefd>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,174,44,0,0               ; movaps        0x2cae(%rip),%xmm8        # 6b10 <_sk_callback_sse2+0xf10>
+  DB  68,15,40,5,125,47,0,0               ; movaps        0x2f7d(%rip),%xmm8        # 6dd0 <_sk_callback_sse2+0xf0d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -25088,31 +25921,31 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,40                              ; je            3ed7 <_sk_load_8888_sse2+0xa1>
+  DB  116,40                              ; je            3ec8 <_sk_load_8888_sse2+0xa1>
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,18                              ; je            3ecc <_sk_load_8888_sse2+0x96>
+  DB  116,18                              ; je            3ebd <_sk_load_8888_sse2+0x96>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,134                             ; jne           3e46 <_sk_load_8888_sse2+0x10>
+  DB  117,134                             ; jne           3e37 <_sk_load_8888_sse2+0x10>
   DB  102,15,110,68,144,8                 ; movd          0x8(%rax,%rdx,4),%xmm0
   DB  102,68,15,112,200,69                ; pshufd        $0x45,%xmm0,%xmm9
   DB  102,68,15,18,12,144                 ; movlpd        (%rax,%rdx,4),%xmm9
-  DB  233,111,255,255,255                 ; jmpq          3e46 <_sk_load_8888_sse2+0x10>
+  DB  233,111,255,255,255                 ; jmpq          3e37 <_sk_load_8888_sse2+0x10>
   DB  102,68,15,110,12,144                ; movd          (%rax,%rdx,4),%xmm9
-  DB  233,100,255,255,255                 ; jmpq          3e46 <_sk_load_8888_sse2+0x10>
+  DB  233,100,255,255,255                 ; jmpq          3e37 <_sk_load_8888_sse2+0x10>
 
 PUBLIC _sk_load_8888_dst_sse2
 _sk_load_8888_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,98                              ; jne           3f4e <_sk_load_8888_dst_sse2+0x6c>
+  DB  117,98                              ; jne           3f3f <_sk_load_8888_dst_sse2+0x6c>
   DB  243,68,15,111,12,144                ; movdqu        (%rax,%rdx,4),%xmm9
-  DB  102,15,111,53,38,44,0,0             ; movdqa        0x2c26(%rip),%xmm6        # 6b20 <_sk_callback_sse2+0xf20>
+  DB  102,15,111,53,245,46,0,0            ; movdqa        0x2ef5(%rip),%xmm6        # 6de0 <_sk_callback_sse2+0xf1d>
   DB  102,65,15,111,225                   ; movdqa        %xmm9,%xmm4
   DB  102,15,219,230                      ; pand          %xmm6,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  68,15,40,5,34,44,0,0                ; movaps        0x2c22(%rip),%xmm8        # 6b30 <_sk_callback_sse2+0xf30>
+  DB  68,15,40,5,241,46,0,0               ; movaps        0x2ef1(%rip),%xmm8        # 6df0 <_sk_callback_sse2+0xf2d>
   DB  65,15,89,224                        ; mulps         %xmm8,%xmm4
   DB  102,65,15,111,233                   ; movdqa        %xmm9,%xmm5
   DB  102,15,114,213,8                    ; psrld         $0x8,%xmm5
@@ -25132,18 +25965,18 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,40                              ; je            3f83 <_sk_load_8888_dst_sse2+0xa1>
+  DB  116,40                              ; je            3f74 <_sk_load_8888_dst_sse2+0xa1>
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,18                              ; je            3f78 <_sk_load_8888_dst_sse2+0x96>
+  DB  116,18                              ; je            3f69 <_sk_load_8888_dst_sse2+0x96>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,134                             ; jne           3ef2 <_sk_load_8888_dst_sse2+0x10>
+  DB  117,134                             ; jne           3ee3 <_sk_load_8888_dst_sse2+0x10>
   DB  102,15,110,100,144,8                ; movd          0x8(%rax,%rdx,4),%xmm4
   DB  102,68,15,112,204,69                ; pshufd        $0x45,%xmm4,%xmm9
   DB  102,68,15,18,12,144                 ; movlpd        (%rax,%rdx,4),%xmm9
-  DB  233,111,255,255,255                 ; jmpq          3ef2 <_sk_load_8888_dst_sse2+0x10>
+  DB  233,111,255,255,255                 ; jmpq          3ee3 <_sk_load_8888_dst_sse2+0x10>
   DB  102,68,15,110,12,144                ; movd          (%rax,%rdx,4),%xmm9
-  DB  233,100,255,255,255                 ; jmpq          3ef2 <_sk_load_8888_dst_sse2+0x10>
+  DB  233,100,255,255,255                 ; jmpq          3ee3 <_sk_load_8888_dst_sse2+0x10>
 
 PUBLIC _sk_gather_8888_sse2
 _sk_gather_8888_sse2 LABEL PROC
@@ -25175,11 +26008,11 @@
   DB  102,67,15,110,12,145                ; movd          (%r9,%r10,4),%xmm1
   DB  102,68,15,98,201                    ; punpckldq     %xmm1,%xmm9
   DB  102,68,15,98,200                    ; punpckldq     %xmm0,%xmm9
-  DB  102,15,111,21,48,43,0,0             ; movdqa        0x2b30(%rip),%xmm2        # 6b40 <_sk_callback_sse2+0xf40>
+  DB  102,15,111,21,255,45,0,0            ; movdqa        0x2dff(%rip),%xmm2        # 6e00 <_sk_callback_sse2+0xf3d>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,44,43,0,0                ; movaps        0x2b2c(%rip),%xmm8        # 6b50 <_sk_callback_sse2+0xf50>
+  DB  68,15,40,5,251,45,0,0               ; movaps        0x2dfb(%rip),%xmm8        # 6e10 <_sk_callback_sse2+0xf4d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -25202,7 +26035,7 @@
 _sk_store_8888_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,238,42,0,0               ; movaps        0x2aee(%rip),%xmm8        # 6b60 <_sk_callback_sse2+0xf60>
+  DB  68,15,40,5,189,45,0,0               ; movaps        0x2dbd(%rip),%xmm8        # 6e20 <_sk_callback_sse2+0xf5d>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -25221,31 +26054,214 @@
   DB  102,69,15,235,193                   ; por           %xmm9,%xmm8
   DB  102,69,15,235,194                   ; por           %xmm10,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           40d2 <_sk_store_8888_sse2+0x6d>
+  DB  117,10                              ; jne           40c3 <_sk_store_8888_sse2+0x6d>
   DB  243,68,15,127,4,144                 ; movdqu        %xmm8,(%rax,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,33                              ; je            4100 <_sk_store_8888_sse2+0x9b>
+  DB  116,33                              ; je            40f1 <_sk_store_8888_sse2+0x9b>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,19                              ; je            40f8 <_sk_store_8888_sse2+0x93>
+  DB  116,19                              ; je            40e9 <_sk_store_8888_sse2+0x93>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,227                             ; jne           40ce <_sk_store_8888_sse2+0x69>
+  DB  117,227                             ; jne           40bf <_sk_store_8888_sse2+0x69>
   DB  102,69,15,112,200,78                ; pshufd        $0x4e,%xmm8,%xmm9
   DB  102,68,15,126,76,144,8              ; movd          %xmm9,0x8(%rax,%rdx,4)
   DB  102,68,15,214,4,144                 ; movq          %xmm8,(%rax,%rdx,4)
-  DB  235,206                             ; jmp           40ce <_sk_store_8888_sse2+0x69>
+  DB  235,206                             ; jmp           40bf <_sk_store_8888_sse2+0x69>
   DB  102,68,15,126,4,144                 ; movd          %xmm8,(%rax,%rdx,4)
-  DB  235,198                             ; jmp           40ce <_sk_store_8888_sse2+0x69>
+  DB  235,198                             ; jmp           40bf <_sk_store_8888_sse2+0x69>
+
+PUBLIC _sk_load_bgra_sse2
+_sk_load_bgra_sse2 LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  72,139,0                            ; mov           (%rax),%rax
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,98                              ; jne           4165 <_sk_load_bgra_sse2+0x6c>
+  DB  243,68,15,111,12,144                ; movdqu        (%rax,%rdx,4),%xmm9
+  DB  102,15,111,5,31,45,0,0              ; movdqa        0x2d1f(%rip),%xmm0        # 6e30 <_sk_callback_sse2+0xf6d>
+  DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
+  DB  102,15,219,200                      ; pand          %xmm0,%xmm1
+  DB  15,91,209                           ; cvtdq2ps      %xmm1,%xmm2
+  DB  68,15,40,5,27,45,0,0                ; movaps        0x2d1b(%rip),%xmm8        # 6e40 <_sk_callback_sse2+0xf7d>
+  DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
+  DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
+  DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
+  DB  102,15,219,200                      ; pand          %xmm0,%xmm1
+  DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
+  DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
+  DB  102,65,15,111,217                   ; movdqa        %xmm9,%xmm3
+  DB  102,15,114,211,16                   ; psrld         $0x10,%xmm3
+  DB  102,15,219,216                      ; pand          %xmm0,%xmm3
+  DB  15,91,195                           ; cvtdq2ps      %xmm3,%xmm0
+  DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
+  DB  102,65,15,114,209,24                ; psrld         $0x18,%xmm9
+  DB  65,15,91,217                        ; cvtdq2ps      %xmm9,%xmm3
+  DB  65,15,89,216                        ; mulps         %xmm8,%xmm3
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,3                        ; and           $0x3,%r9b
+  DB  65,128,249,1                        ; cmp           $0x1,%r9b
+  DB  116,40                              ; je            419a <_sk_load_bgra_sse2+0xa1>
+  DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
+  DB  65,128,249,2                        ; cmp           $0x2,%r9b
+  DB  116,18                              ; je            418f <_sk_load_bgra_sse2+0x96>
+  DB  65,128,249,3                        ; cmp           $0x3,%r9b
+  DB  117,134                             ; jne           4109 <_sk_load_bgra_sse2+0x10>
+  DB  102,15,110,68,144,8                 ; movd          0x8(%rax,%rdx,4),%xmm0
+  DB  102,68,15,112,200,69                ; pshufd        $0x45,%xmm0,%xmm9
+  DB  102,68,15,18,12,144                 ; movlpd        (%rax,%rdx,4),%xmm9
+  DB  233,111,255,255,255                 ; jmpq          4109 <_sk_load_bgra_sse2+0x10>
+  DB  102,68,15,110,12,144                ; movd          (%rax,%rdx,4),%xmm9
+  DB  233,100,255,255,255                 ; jmpq          4109 <_sk_load_bgra_sse2+0x10>
+
+PUBLIC _sk_load_bgra_dst_sse2
+_sk_load_bgra_dst_sse2 LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  72,139,0                            ; mov           (%rax),%rax
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,98                              ; jne           4211 <_sk_load_bgra_dst_sse2+0x6c>
+  DB  243,68,15,111,12,144                ; movdqu        (%rax,%rdx,4),%xmm9
+  DB  102,15,111,37,147,44,0,0            ; movdqa        0x2c93(%rip),%xmm4        # 6e50 <_sk_callback_sse2+0xf8d>
+  DB  102,65,15,111,233                   ; movdqa        %xmm9,%xmm5
+  DB  102,15,219,236                      ; pand          %xmm4,%xmm5
+  DB  15,91,245                           ; cvtdq2ps      %xmm5,%xmm6
+  DB  68,15,40,5,143,44,0,0               ; movaps        0x2c8f(%rip),%xmm8        # 6e60 <_sk_callback_sse2+0xf9d>
+  DB  65,15,89,240                        ; mulps         %xmm8,%xmm6
+  DB  102,65,15,111,233                   ; movdqa        %xmm9,%xmm5
+  DB  102,15,114,213,8                    ; psrld         $0x8,%xmm5
+  DB  102,15,219,236                      ; pand          %xmm4,%xmm5
+  DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
+  DB  65,15,89,232                        ; mulps         %xmm8,%xmm5
+  DB  102,65,15,111,249                   ; movdqa        %xmm9,%xmm7
+  DB  102,15,114,215,16                   ; psrld         $0x10,%xmm7
+  DB  102,15,219,252                      ; pand          %xmm4,%xmm7
+  DB  15,91,231                           ; cvtdq2ps      %xmm7,%xmm4
+  DB  65,15,89,224                        ; mulps         %xmm8,%xmm4
+  DB  102,65,15,114,209,24                ; psrld         $0x18,%xmm9
+  DB  65,15,91,249                        ; cvtdq2ps      %xmm9,%xmm7
+  DB  65,15,89,248                        ; mulps         %xmm8,%xmm7
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,3                        ; and           $0x3,%r9b
+  DB  65,128,249,1                        ; cmp           $0x1,%r9b
+  DB  116,40                              ; je            4246 <_sk_load_bgra_dst_sse2+0xa1>
+  DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
+  DB  65,128,249,2                        ; cmp           $0x2,%r9b
+  DB  116,18                              ; je            423b <_sk_load_bgra_dst_sse2+0x96>
+  DB  65,128,249,3                        ; cmp           $0x3,%r9b
+  DB  117,134                             ; jne           41b5 <_sk_load_bgra_dst_sse2+0x10>
+  DB  102,15,110,100,144,8                ; movd          0x8(%rax,%rdx,4),%xmm4
+  DB  102,68,15,112,204,69                ; pshufd        $0x45,%xmm4,%xmm9
+  DB  102,68,15,18,12,144                 ; movlpd        (%rax,%rdx,4),%xmm9
+  DB  233,111,255,255,255                 ; jmpq          41b5 <_sk_load_bgra_dst_sse2+0x10>
+  DB  102,68,15,110,12,144                ; movd          (%rax,%rdx,4),%xmm9
+  DB  233,100,255,255,255                 ; jmpq          41b5 <_sk_load_bgra_dst_sse2+0x10>
+
+PUBLIC _sk_gather_bgra_sse2
+_sk_gather_bgra_sse2 LABEL PROC
+  DB  83                                  ; push          %rbx
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,139,8                            ; mov           (%rax),%r9
+  DB  243,15,91,201                       ; cvttps2dq     %xmm1,%xmm1
+  DB  102,15,110,80,16                    ; movd          0x10(%rax),%xmm2
+  DB  102,15,112,210,0                    ; pshufd        $0x0,%xmm2,%xmm2
+  DB  102,15,112,217,245                  ; pshufd        $0xf5,%xmm1,%xmm3
+  DB  102,15,244,218                      ; pmuludq       %xmm2,%xmm3
+  DB  102,15,112,219,232                  ; pshufd        $0xe8,%xmm3,%xmm3
+  DB  102,15,244,209                      ; pmuludq       %xmm1,%xmm2
+  DB  102,15,112,202,232                  ; pshufd        $0xe8,%xmm2,%xmm1
+  DB  102,15,98,203                       ; punpckldq     %xmm3,%xmm1
+  DB  243,15,91,192                       ; cvttps2dq     %xmm0,%xmm0
+  DB  102,15,254,193                      ; paddd         %xmm1,%xmm0
+  DB  102,15,112,200,78                   ; pshufd        $0x4e,%xmm0,%xmm1
+  DB  102,72,15,126,200                   ; movq          %xmm1,%rax
+  DB  65,137,194                          ; mov           %eax,%r10d
+  DB  72,193,232,32                       ; shr           $0x20,%rax
+  DB  102,73,15,126,195                   ; movq          %xmm0,%r11
+  DB  68,137,219                          ; mov           %r11d,%ebx
+  DB  73,193,235,32                       ; shr           $0x20,%r11
+  DB  102,67,15,110,4,153                 ; movd          (%r9,%r11,4),%xmm0
+  DB  102,65,15,110,12,129                ; movd          (%r9,%rax,4),%xmm1
+  DB  102,15,98,193                       ; punpckldq     %xmm1,%xmm0
+  DB  102,69,15,110,12,153                ; movd          (%r9,%rbx,4),%xmm9
+  DB  102,67,15,110,12,145                ; movd          (%r9,%r10,4),%xmm1
+  DB  102,68,15,98,201                    ; punpckldq     %xmm1,%xmm9
+  DB  102,68,15,98,200                    ; punpckldq     %xmm0,%xmm9
+  DB  102,15,111,5,157,43,0,0             ; movdqa        0x2b9d(%rip),%xmm0        # 6e70 <_sk_callback_sse2+0xfad>
+  DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
+  DB  102,15,219,200                      ; pand          %xmm0,%xmm1
+  DB  15,91,209                           ; cvtdq2ps      %xmm1,%xmm2
+  DB  68,15,40,5,153,43,0,0               ; movaps        0x2b99(%rip),%xmm8        # 6e80 <_sk_callback_sse2+0xfbd>
+  DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
+  DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
+  DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
+  DB  102,15,219,200                      ; pand          %xmm0,%xmm1
+  DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
+  DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
+  DB  102,65,15,111,217                   ; movdqa        %xmm9,%xmm3
+  DB  102,15,114,211,16                   ; psrld         $0x10,%xmm3
+  DB  102,15,219,216                      ; pand          %xmm0,%xmm3
+  DB  15,91,195                           ; cvtdq2ps      %xmm3,%xmm0
+  DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
+  DB  102,65,15,114,209,24                ; psrld         $0x18,%xmm9
+  DB  65,15,91,217                        ; cvtdq2ps      %xmm9,%xmm3
+  DB  65,15,89,216                        ; mulps         %xmm8,%xmm3
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  91                                  ; pop           %rbx
+  DB  255,224                             ; jmpq          *%rax
+
+PUBLIC _sk_store_bgra_sse2
+_sk_store_bgra_sse2 LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  72,139,0                            ; mov           (%rax),%rax
+  DB  68,15,40,5,91,43,0,0                ; movaps        0x2b5b(%rip),%xmm8        # 6e90 <_sk_callback_sse2+0xfcd>
+  DB  68,15,40,202                        ; movaps        %xmm2,%xmm9
+  DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
+  DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
+  DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
+  DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
+  DB  102,69,15,91,210                    ; cvtps2dq      %xmm10,%xmm10
+  DB  102,65,15,114,242,8                 ; pslld         $0x8,%xmm10
+  DB  102,69,15,235,209                   ; por           %xmm9,%xmm10
+  DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
+  DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
+  DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
+  DB  102,65,15,114,241,16                ; pslld         $0x10,%xmm9
+  DB  68,15,89,195                        ; mulps         %xmm3,%xmm8
+  DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
+  DB  102,65,15,114,240,24                ; pslld         $0x18,%xmm8
+  DB  102,69,15,235,193                   ; por           %xmm9,%xmm8
+  DB  102,69,15,235,194                   ; por           %xmm10,%xmm8
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,10                              ; jne           4395 <_sk_store_bgra_sse2+0x6d>
+  DB  243,68,15,127,4,144                 ; movdqu        %xmm8,(%rax,%rdx,4)
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,3                        ; and           $0x3,%r9b
+  DB  65,128,249,1                        ; cmp           $0x1,%r9b
+  DB  116,33                              ; je            43c3 <_sk_store_bgra_sse2+0x9b>
+  DB  65,128,249,2                        ; cmp           $0x2,%r9b
+  DB  116,19                              ; je            43bb <_sk_store_bgra_sse2+0x93>
+  DB  65,128,249,3                        ; cmp           $0x3,%r9b
+  DB  117,227                             ; jne           4391 <_sk_store_bgra_sse2+0x69>
+  DB  102,69,15,112,200,78                ; pshufd        $0x4e,%xmm8,%xmm9
+  DB  102,68,15,126,76,144,8              ; movd          %xmm9,0x8(%rax,%rdx,4)
+  DB  102,68,15,214,4,144                 ; movq          %xmm8,(%rax,%rdx,4)
+  DB  235,206                             ; jmp           4391 <_sk_store_bgra_sse2+0x69>
+  DB  102,68,15,126,4,144                 ; movd          %xmm8,(%rax,%rdx,4)
+  DB  235,198                             ; jmp           4391 <_sk_store_bgra_sse2+0x69>
 
 PUBLIC _sk_load_f16_sse2
 _sk_load_f16_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,96,1,0,0                     ; jne           4276 <_sk_load_f16_sse2+0x16e>
+  DB  15,133,96,1,0,0                     ; jne           4539 <_sk_load_f16_sse2+0x16e>
   DB  102,15,16,4,208                     ; movupd        (%rax,%rdx,8),%xmm0
   DB  102,15,16,76,208,16                 ; movupd        0x10(%rax,%rdx,8),%xmm1
   DB  102,68,15,40,192                    ; movapd        %xmm0,%xmm8
@@ -25257,7 +26273,7 @@
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
   DB  102,65,15,111,206                   ; movdqa        %xmm14,%xmm1
   DB  102,65,15,97,202                    ; punpcklwd     %xmm10,%xmm1
-  DB  102,68,15,111,13,26,42,0,0          ; movdqa        0x2a1a(%rip),%xmm9        # 6b70 <_sk_callback_sse2+0xf70>
+  DB  102,68,15,111,13,135,42,0,0         ; movdqa        0x2a87(%rip),%xmm9        # 6ea0 <_sk_callback_sse2+0xfdd>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,193                   ; pand          %xmm9,%xmm0
   DB  102,15,239,200                      ; pxor          %xmm0,%xmm1
@@ -25265,11 +26281,11 @@
   DB  102,68,15,111,233                   ; movdqa        %xmm1,%xmm13
   DB  102,65,15,114,245,13                ; pslld         $0xd,%xmm13
   DB  102,68,15,235,232                   ; por           %xmm0,%xmm13
-  DB  102,68,15,111,29,255,41,0,0         ; movdqa        0x29ff(%rip),%xmm11        # 6b80 <_sk_callback_sse2+0xf80>
+  DB  102,68,15,111,29,108,42,0,0         ; movdqa        0x2a6c(%rip),%xmm11        # 6eb0 <_sk_callback_sse2+0xfed>
   DB  102,69,15,254,235                   ; paddd         %xmm11,%xmm13
-  DB  102,68,15,111,37,1,42,0,0           ; movdqa        0x2a01(%rip),%xmm12        # 6b90 <_sk_callback_sse2+0xf90>
+  DB  102,68,15,111,37,110,42,0,0         ; movdqa        0x2a6e(%rip),%xmm12        # 6ec0 <_sk_callback_sse2+0xffd>
   DB  102,65,15,239,204                   ; pxor          %xmm12,%xmm1
-  DB  102,15,111,29,4,42,0,0              ; movdqa        0x2a04(%rip),%xmm3        # 6ba0 <_sk_callback_sse2+0xfa0>
+  DB  102,15,111,29,113,42,0,0            ; movdqa        0x2a71(%rip),%xmm3        # 6ed0 <_sk_callback_sse2+0x100d>
   DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
   DB  102,15,102,193                      ; pcmpgtd       %xmm1,%xmm0
   DB  102,65,15,223,197                   ; pandn         %xmm13,%xmm0
@@ -25317,24 +26333,24 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,15,16,4,208                     ; movsd         (%rax,%rdx,8),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,17                              ; jne           4292 <_sk_load_f16_sse2+0x18a>
+  DB  117,17                              ; jne           4555 <_sk_load_f16_sse2+0x18a>
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  102,15,20,193                       ; unpcklpd      %xmm1,%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
-  DB  233,143,254,255,255                 ; jmpq          4121 <_sk_load_f16_sse2+0x19>
+  DB  233,143,254,255,255                 ; jmpq          43e4 <_sk_load_f16_sse2+0x19>
   DB  102,15,22,68,208,8                  ; movhpd        0x8(%rax,%rdx,8),%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,123,254,255,255              ; jb            4121 <_sk_load_f16_sse2+0x19>
+  DB  15,130,123,254,255,255              ; jb            43e4 <_sk_load_f16_sse2+0x19>
   DB  242,15,16,76,208,16                 ; movsd         0x10(%rax,%rdx,8),%xmm1
-  DB  233,112,254,255,255                 ; jmpq          4121 <_sk_load_f16_sse2+0x19>
+  DB  233,112,254,255,255                 ; jmpq          43e4 <_sk_load_f16_sse2+0x19>
 
 PUBLIC _sk_load_f16_dst_sse2
 _sk_load_f16_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,96,1,0,0                     ; jne           441f <_sk_load_f16_dst_sse2+0x16e>
+  DB  15,133,96,1,0,0                     ; jne           46e2 <_sk_load_f16_dst_sse2+0x16e>
   DB  102,15,16,36,208                    ; movupd        (%rax,%rdx,8),%xmm4
   DB  102,15,16,108,208,16                ; movupd        0x10(%rax,%rdx,8),%xmm5
   DB  102,68,15,40,196                    ; movapd        %xmm4,%xmm8
@@ -25346,7 +26362,7 @@
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
   DB  102,65,15,111,238                   ; movdqa        %xmm14,%xmm5
   DB  102,65,15,97,234                    ; punpcklwd     %xmm10,%xmm5
-  DB  102,68,15,111,13,177,40,0,0         ; movdqa        0x28b1(%rip),%xmm9        # 6bb0 <_sk_callback_sse2+0xfb0>
+  DB  102,68,15,111,13,30,41,0,0          ; movdqa        0x291e(%rip),%xmm9        # 6ee0 <_sk_callback_sse2+0x101d>
   DB  102,15,111,229                      ; movdqa        %xmm5,%xmm4
   DB  102,65,15,219,225                   ; pand          %xmm9,%xmm4
   DB  102,15,239,236                      ; pxor          %xmm4,%xmm5
@@ -25354,11 +26370,11 @@
   DB  102,68,15,111,237                   ; movdqa        %xmm5,%xmm13
   DB  102,65,15,114,245,13                ; pslld         $0xd,%xmm13
   DB  102,68,15,235,236                   ; por           %xmm4,%xmm13
-  DB  102,68,15,111,29,150,40,0,0         ; movdqa        0x2896(%rip),%xmm11        # 6bc0 <_sk_callback_sse2+0xfc0>
+  DB  102,68,15,111,29,3,41,0,0           ; movdqa        0x2903(%rip),%xmm11        # 6ef0 <_sk_callback_sse2+0x102d>
   DB  102,69,15,254,235                   ; paddd         %xmm11,%xmm13
-  DB  102,68,15,111,37,152,40,0,0         ; movdqa        0x2898(%rip),%xmm12        # 6bd0 <_sk_callback_sse2+0xfd0>
+  DB  102,68,15,111,37,5,41,0,0           ; movdqa        0x2905(%rip),%xmm12        # 6f00 <_sk_callback_sse2+0x103d>
   DB  102,65,15,239,236                   ; pxor          %xmm12,%xmm5
-  DB  102,15,111,61,155,40,0,0            ; movdqa        0x289b(%rip),%xmm7        # 6be0 <_sk_callback_sse2+0xfe0>
+  DB  102,15,111,61,8,41,0,0              ; movdqa        0x2908(%rip),%xmm7        # 6f10 <_sk_callback_sse2+0x104d>
   DB  102,15,111,231                      ; movdqa        %xmm7,%xmm4
   DB  102,15,102,229                      ; pcmpgtd       %xmm5,%xmm4
   DB  102,65,15,223,229                   ; pandn         %xmm13,%xmm4
@@ -25406,17 +26422,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,15,16,36,208                    ; movsd         (%rax,%rdx,8),%xmm4
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,17                              ; jne           443b <_sk_load_f16_dst_sse2+0x18a>
+  DB  117,17                              ; jne           46fe <_sk_load_f16_dst_sse2+0x18a>
   DB  102,15,87,237                       ; xorpd         %xmm5,%xmm5
   DB  102,15,20,229                       ; unpcklpd      %xmm5,%xmm4
   DB  102,15,87,237                       ; xorpd         %xmm5,%xmm5
-  DB  233,143,254,255,255                 ; jmpq          42ca <_sk_load_f16_dst_sse2+0x19>
+  DB  233,143,254,255,255                 ; jmpq          458d <_sk_load_f16_dst_sse2+0x19>
   DB  102,15,22,100,208,8                 ; movhpd        0x8(%rax,%rdx,8),%xmm4
   DB  102,15,87,237                       ; xorpd         %xmm5,%xmm5
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,123,254,255,255              ; jb            42ca <_sk_load_f16_dst_sse2+0x19>
+  DB  15,130,123,254,255,255              ; jb            458d <_sk_load_f16_dst_sse2+0x19>
   DB  242,15,16,108,208,16                ; movsd         0x10(%rax,%rdx,8),%xmm5
-  DB  233,112,254,255,255                 ; jmpq          42ca <_sk_load_f16_dst_sse2+0x19>
+  DB  233,112,254,255,255                 ; jmpq          458d <_sk_load_f16_dst_sse2+0x19>
 
 PUBLIC _sk_gather_f16_sse2
 _sk_gather_f16_sse2 LABEL PROC
@@ -25456,7 +26472,7 @@
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
   DB  102,65,15,111,206                   ; movdqa        %xmm14,%xmm1
   DB  102,65,15,97,202                    ; punpcklwd     %xmm10,%xmm1
-  DB  102,68,15,111,13,237,38,0,0         ; movdqa        0x26ed(%rip),%xmm9        # 6bf0 <_sk_callback_sse2+0xff0>
+  DB  102,68,15,111,13,90,39,0,0          ; movdqa        0x275a(%rip),%xmm9        # 6f20 <_sk_callback_sse2+0x105d>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,193                   ; pand          %xmm9,%xmm0
   DB  102,15,239,200                      ; pxor          %xmm0,%xmm1
@@ -25464,11 +26480,11 @@
   DB  102,68,15,111,233                   ; movdqa        %xmm1,%xmm13
   DB  102,65,15,114,245,13                ; pslld         $0xd,%xmm13
   DB  102,68,15,235,232                   ; por           %xmm0,%xmm13
-  DB  102,68,15,111,29,210,38,0,0         ; movdqa        0x26d2(%rip),%xmm11        # 6c00 <_sk_callback_sse2+0x1000>
+  DB  102,68,15,111,29,63,39,0,0          ; movdqa        0x273f(%rip),%xmm11        # 6f30 <_sk_callback_sse2+0x106d>
   DB  102,69,15,254,235                   ; paddd         %xmm11,%xmm13
-  DB  102,68,15,111,37,212,38,0,0         ; movdqa        0x26d4(%rip),%xmm12        # 6c10 <_sk_callback_sse2+0x1010>
+  DB  102,68,15,111,37,65,39,0,0          ; movdqa        0x2741(%rip),%xmm12        # 6f40 <_sk_callback_sse2+0x107d>
   DB  102,65,15,239,204                   ; pxor          %xmm12,%xmm1
-  DB  102,15,111,29,215,38,0,0            ; movdqa        0x26d7(%rip),%xmm3        # 6c20 <_sk_callback_sse2+0x1020>
+  DB  102,15,111,29,68,39,0,0             ; movdqa        0x2744(%rip),%xmm3        # 6f50 <_sk_callback_sse2+0x108d>
   DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
   DB  102,15,102,193                      ; pcmpgtd       %xmm1,%xmm0
   DB  102,65,15,223,197                   ; pandn         %xmm13,%xmm0
@@ -25520,17 +26536,17 @@
 _sk_store_f16_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  102,68,15,111,21,254,37,0,0         ; movdqa        0x25fe(%rip),%xmm10        # 6c30 <_sk_callback_sse2+0x1030>
+  DB  102,68,15,111,21,107,38,0,0         ; movdqa        0x266b(%rip),%xmm10        # 6f60 <_sk_callback_sse2+0x109d>
   DB  102,68,15,111,224                   ; movdqa        %xmm0,%xmm12
   DB  102,69,15,219,226                   ; pand          %xmm10,%xmm12
   DB  102,68,15,111,232                   ; movdqa        %xmm0,%xmm13
   DB  102,69,15,239,236                   ; pxor          %xmm12,%xmm13
-  DB  102,68,15,111,13,241,37,0,0         ; movdqa        0x25f1(%rip),%xmm9        # 6c40 <_sk_callback_sse2+0x1040>
+  DB  102,68,15,111,13,94,38,0,0          ; movdqa        0x265e(%rip),%xmm9        # 6f70 <_sk_callback_sse2+0x10ad>
   DB  102,65,15,114,212,16                ; psrld         $0x10,%xmm12
   DB  102,69,15,111,193                   ; movdqa        %xmm9,%xmm8
   DB  102,69,15,102,197                   ; pcmpgtd       %xmm13,%xmm8
   DB  102,65,15,114,213,13                ; psrld         $0xd,%xmm13
-  DB  102,68,15,111,29,226,37,0,0         ; movdqa        0x25e2(%rip),%xmm11        # 6c50 <_sk_callback_sse2+0x1050>
+  DB  102,68,15,111,29,79,38,0,0          ; movdqa        0x264f(%rip),%xmm11        # 6f80 <_sk_callback_sse2+0x10bd>
   DB  102,69,15,235,227                   ; por           %xmm11,%xmm12
   DB  102,69,15,254,229                   ; paddd         %xmm13,%xmm12
   DB  102,65,15,114,244,16                ; pslld         $0x10,%xmm12
@@ -25582,7 +26598,7 @@
   DB  102,69,15,111,200                   ; movdqa        %xmm8,%xmm9
   DB  102,69,15,98,204                    ; punpckldq     %xmm12,%xmm9
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,21                              ; jne           4790 <_sk_store_f16_sse2+0x16c>
+  DB  117,21                              ; jne           4a53 <_sk_store_f16_sse2+0x16c>
   DB  68,15,17,12,208                     ; movups        %xmm9,(%rax,%rdx,8)
   DB  102,69,15,106,196                   ; punpckhdq     %xmm12,%xmm8
   DB  243,68,15,127,68,208,16             ; movdqu        %xmm8,0x10(%rax,%rdx,8)
@@ -25590,13 +26606,13 @@
   DB  255,224                             ; jmpq          *%rax
   DB  102,68,15,214,12,208                ; movq          %xmm9,(%rax,%rdx,8)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            478c <_sk_store_f16_sse2+0x168>
+  DB  116,240                             ; je            4a4f <_sk_store_f16_sse2+0x168>
   DB  102,68,15,23,76,208,8               ; movhpd        %xmm9,0x8(%rax,%rdx,8)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            478c <_sk_store_f16_sse2+0x168>
+  DB  114,227                             ; jb            4a4f <_sk_store_f16_sse2+0x168>
   DB  102,69,15,106,196                   ; punpckhdq     %xmm12,%xmm8
   DB  102,68,15,214,68,208,16             ; movq          %xmm8,0x10(%rax,%rdx,8)
-  DB  235,213                             ; jmp           478c <_sk_store_f16_sse2+0x168>
+  DB  235,213                             ; jmp           4a4f <_sk_store_f16_sse2+0x168>
 
 PUBLIC _sk_load_u16_be_sse2
 _sk_load_u16_be_sse2 LABEL PROC
@@ -25604,7 +26620,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,190,0,0,0                    ; jne           488b <_sk_load_u16_be_sse2+0xd4>
+  DB  15,133,190,0,0,0                    ; jne           4b4e <_sk_load_u16_be_sse2+0xd4>
   DB  102,65,15,16,4,65                   ; movupd        (%r9,%rax,2),%xmm0
   DB  102,65,15,16,76,65,16               ; movupd        0x10(%r9,%rax,2),%xmm1
   DB  102,15,40,208                       ; movapd        %xmm0,%xmm2
@@ -25621,7 +26637,7 @@
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  102,65,15,97,201                    ; punpcklwd     %xmm9,%xmm1
   DB  15,91,193                           ; cvtdq2ps      %xmm1,%xmm0
-  DB  68,15,40,5,66,36,0,0                ; movaps        0x2442(%rip),%xmm8        # 6c60 <_sk_callback_sse2+0x1060>
+  DB  68,15,40,5,175,36,0,0               ; movaps        0x24af(%rip),%xmm8        # 6f90 <_sk_callback_sse2+0x10cd>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -25649,17 +26665,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,65,15,16,4,65                   ; movsd         (%r9,%rax,2),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,17                              ; jne           48a8 <_sk_load_u16_be_sse2+0xf1>
+  DB  117,17                              ; jne           4b6b <_sk_load_u16_be_sse2+0xf1>
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  102,15,20,193                       ; unpcklpd      %xmm1,%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
-  DB  233,50,255,255,255                  ; jmpq          47da <_sk_load_u16_be_sse2+0x23>
+  DB  233,50,255,255,255                  ; jmpq          4a9d <_sk_load_u16_be_sse2+0x23>
   DB  102,65,15,22,68,65,8                ; movhpd        0x8(%r9,%rax,2),%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,29,255,255,255               ; jb            47da <_sk_load_u16_be_sse2+0x23>
+  DB  15,130,29,255,255,255               ; jb            4a9d <_sk_load_u16_be_sse2+0x23>
   DB  242,65,15,16,76,65,16               ; movsd         0x10(%r9,%rax,2),%xmm1
-  DB  233,17,255,255,255                  ; jmpq          47da <_sk_load_u16_be_sse2+0x23>
+  DB  233,17,255,255,255                  ; jmpq          4a9d <_sk_load_u16_be_sse2+0x23>
 
 PUBLIC _sk_load_rgb_u16_be_sse2
 _sk_load_rgb_u16_be_sse2 LABEL PROC
@@ -25667,7 +26683,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,82                         ; lea           (%rdx,%rdx,2),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,175,0,0,0                    ; jne           498a <_sk_load_rgb_u16_be_sse2+0xc1>
+  DB  15,133,175,0,0,0                    ; jne           4c4d <_sk_load_rgb_u16_be_sse2+0xc1>
   DB  243,65,15,111,20,65                 ; movdqu        (%r9,%rax,2),%xmm2
   DB  243,65,15,111,92,65,8               ; movdqu        0x8(%r9,%rax,2),%xmm3
   DB  102,15,115,219,4                    ; psrldq        $0x4,%xmm3
@@ -25688,7 +26704,7 @@
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,65,15,97,200                    ; punpcklwd     %xmm8,%xmm1
   DB  15,91,193                           ; cvtdq2ps      %xmm1,%xmm0
-  DB  68,15,40,13,49,35,0,0               ; movaps        0x2331(%rip),%xmm9        # 6c70 <_sk_callback_sse2+0x1070>
+  DB  68,15,40,13,158,35,0,0              ; movaps        0x239e(%rip),%xmm9        # 6fa0 <_sk_callback_sse2+0x10dd>
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -25705,34 +26721,34 @@
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,209                        ; mulps         %xmm9,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,248,34,0,0                 ; movaps        0x22f8(%rip),%xmm3        # 6c80 <_sk_callback_sse2+0x1080>
+  DB  15,40,29,101,35,0,0                 ; movaps        0x2365(%rip),%xmm3        # 6fb0 <_sk_callback_sse2+0x10ed>
   DB  255,224                             ; jmpq          *%rax
   DB  102,65,15,110,20,65                 ; movd          (%r9,%rax,2),%xmm2
   DB  102,65,15,196,84,65,4,2             ; pinsrw        $0x2,0x4(%r9,%rax,2),%xmm2
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           49af <_sk_load_rgb_u16_be_sse2+0xe6>
+  DB  117,13                              ; jne           4c72 <_sk_load_rgb_u16_be_sse2+0xe6>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
-  DB  233,80,255,255,255                  ; jmpq          48ff <_sk_load_rgb_u16_be_sse2+0x36>
+  DB  233,80,255,255,255                  ; jmpq          4bc2 <_sk_load_rgb_u16_be_sse2+0x36>
   DB  102,65,15,110,68,65,6               ; movd          0x6(%r9,%rax,2),%xmm0
   DB  102,65,15,196,68,65,10,2            ; pinsrw        $0x2,0xa(%r9,%rax,2),%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,24                              ; jb            49e0 <_sk_load_rgb_u16_be_sse2+0x117>
+  DB  114,24                              ; jb            4ca3 <_sk_load_rgb_u16_be_sse2+0x117>
   DB  102,65,15,110,92,65,12              ; movd          0xc(%r9,%rax,2),%xmm3
   DB  102,65,15,196,92,65,16,2            ; pinsrw        $0x2,0x10(%r9,%rax,2),%xmm3
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,31,255,255,255                  ; jmpq          48ff <_sk_load_rgb_u16_be_sse2+0x36>
+  DB  233,31,255,255,255                  ; jmpq          4bc2 <_sk_load_rgb_u16_be_sse2+0x36>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
-  DB  233,22,255,255,255                  ; jmpq          48ff <_sk_load_rgb_u16_be_sse2+0x36>
+  DB  233,22,255,255,255                  ; jmpq          4bc2 <_sk_load_rgb_u16_be_sse2+0x36>
 
 PUBLIC _sk_store_u16_be_sse2
 _sk_store_u16_be_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
-  DB  68,15,40,21,146,34,0,0              ; movaps        0x2292(%rip),%xmm10        # 6c90 <_sk_callback_sse2+0x1090>
+  DB  68,15,40,21,255,34,0,0              ; movaps        0x22ff(%rip),%xmm10        # 6fc0 <_sk_callback_sse2+0x10fd>
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  69,15,89,194                        ; mulps         %xmm10,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
@@ -25777,7 +26793,7 @@
   DB  102,69,15,111,208                   ; movdqa        %xmm8,%xmm10
   DB  102,69,15,98,209                    ; punpckldq     %xmm9,%xmm10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,21                              ; jne           4af8 <_sk_store_u16_be_sse2+0x10f>
+  DB  117,21                              ; jne           4dbb <_sk_store_u16_be_sse2+0x10f>
   DB  69,15,17,20,65                      ; movups        %xmm10,(%r9,%rax,2)
   DB  102,69,15,106,193                   ; punpckhdq     %xmm9,%xmm8
   DB  243,69,15,127,68,65,16              ; movdqu        %xmm8,0x10(%r9,%rax,2)
@@ -25785,13 +26801,13 @@
   DB  255,224                             ; jmpq          *%rax
   DB  102,69,15,214,20,65                 ; movq          %xmm10,(%r9,%rax,2)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            4af4 <_sk_store_u16_be_sse2+0x10b>
+  DB  116,240                             ; je            4db7 <_sk_store_u16_be_sse2+0x10b>
   DB  102,69,15,23,84,65,8                ; movhpd        %xmm10,0x8(%r9,%rax,2)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            4af4 <_sk_store_u16_be_sse2+0x10b>
+  DB  114,227                             ; jb            4db7 <_sk_store_u16_be_sse2+0x10b>
   DB  102,69,15,106,193                   ; punpckhdq     %xmm9,%xmm8
   DB  102,69,15,214,68,65,16              ; movq          %xmm8,0x10(%r9,%rax,2)
-  DB  235,213                             ; jmp           4af4 <_sk_store_u16_be_sse2+0x10b>
+  DB  235,213                             ; jmp           4db7 <_sk_store_u16_be_sse2+0x10b>
 
 PUBLIC _sk_load_f32_sse2
 _sk_load_f32_sse2 LABEL PROC
@@ -25802,7 +26818,7 @@
   DB  72,193,224,4                        ; shl           $0x4,%rax
   DB  69,15,16,4,2                        ; movups        (%r10,%rax,1),%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           4b7f <_sk_load_f32_sse2+0x60>
+  DB  117,66                              ; jne           4e42 <_sk_load_f32_sse2+0x60>
   DB  67,15,16,68,138,16                  ; movups        0x10(%r10,%r9,4),%xmm0
   DB  67,15,16,92,138,32                  ; movups        0x20(%r10,%r9,4),%xmm3
   DB  71,15,16,76,138,48                  ; movups        0x30(%r10,%r9,4),%xmm9
@@ -25822,17 +26838,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  69,15,87,201                        ; xorps         %xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,8                               ; jne           4b91 <_sk_load_f32_sse2+0x72>
+  DB  117,8                               ; jne           4e54 <_sk_load_f32_sse2+0x72>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
-  DB  235,190                             ; jmp           4b4f <_sk_load_f32_sse2+0x30>
+  DB  235,190                             ; jmp           4e12 <_sk_load_f32_sse2+0x30>
   DB  67,15,16,68,138,16                  ; movups        0x10(%r10,%r9,4),%xmm0
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,8                               ; jb            4ba5 <_sk_load_f32_sse2+0x86>
+  DB  114,8                               ; jb            4e68 <_sk_load_f32_sse2+0x86>
   DB  67,15,16,92,138,32                  ; movups        0x20(%r10,%r9,4),%xmm3
-  DB  235,170                             ; jmp           4b4f <_sk_load_f32_sse2+0x30>
+  DB  235,170                             ; jmp           4e12 <_sk_load_f32_sse2+0x30>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
-  DB  235,165                             ; jmp           4b4f <_sk_load_f32_sse2+0x30>
+  DB  235,165                             ; jmp           4e12 <_sk_load_f32_sse2+0x30>
 
 PUBLIC _sk_load_f32_dst_sse2
 _sk_load_f32_dst_sse2 LABEL PROC
@@ -25843,7 +26859,7 @@
   DB  72,193,224,4                        ; shl           $0x4,%rax
   DB  69,15,16,4,2                        ; movups        (%r10,%rax,1),%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           4c0a <_sk_load_f32_dst_sse2+0x60>
+  DB  117,66                              ; jne           4ecd <_sk_load_f32_dst_sse2+0x60>
   DB  67,15,16,100,138,16                 ; movups        0x10(%r10,%r9,4),%xmm4
   DB  67,15,16,124,138,32                 ; movups        0x20(%r10,%r9,4),%xmm7
   DB  71,15,16,76,138,48                  ; movups        0x30(%r10,%r9,4),%xmm9
@@ -25863,17 +26879,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  69,15,87,201                        ; xorps         %xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,8                               ; jne           4c1c <_sk_load_f32_dst_sse2+0x72>
+  DB  117,8                               ; jne           4edf <_sk_load_f32_dst_sse2+0x72>
   DB  15,87,255                           ; xorps         %xmm7,%xmm7
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
-  DB  235,190                             ; jmp           4bda <_sk_load_f32_dst_sse2+0x30>
+  DB  235,190                             ; jmp           4e9d <_sk_load_f32_dst_sse2+0x30>
   DB  67,15,16,100,138,16                 ; movups        0x10(%r10,%r9,4),%xmm4
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,8                               ; jb            4c30 <_sk_load_f32_dst_sse2+0x86>
+  DB  114,8                               ; jb            4ef3 <_sk_load_f32_dst_sse2+0x86>
   DB  67,15,16,124,138,32                 ; movups        0x20(%r10,%r9,4),%xmm7
-  DB  235,170                             ; jmp           4bda <_sk_load_f32_dst_sse2+0x30>
+  DB  235,170                             ; jmp           4e9d <_sk_load_f32_dst_sse2+0x30>
   DB  15,87,255                           ; xorps         %xmm7,%xmm7
-  DB  235,165                             ; jmp           4bda <_sk_load_f32_dst_sse2+0x30>
+  DB  235,165                             ; jmp           4e9d <_sk_load_f32_dst_sse2+0x30>
 
 PUBLIC _sk_store_f32_sse2
 _sk_store_f32_sse2 LABEL PROC
@@ -25897,7 +26913,7 @@
   DB  102,69,15,20,203                    ; unpcklpd      %xmm11,%xmm9
   DB  102,69,15,17,36,2                   ; movupd        %xmm12,(%r10,%rax,1)
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,29                              ; jne           4ca7 <_sk_store_f32_sse2+0x72>
+  DB  117,29                              ; jne           4f6a <_sk_store_f32_sse2+0x72>
   DB  102,69,15,21,211                    ; unpckhpd      %xmm11,%xmm10
   DB  71,15,17,68,138,16                  ; movups        %xmm8,0x10(%r10,%r9,4)
   DB  102,71,15,17,76,138,32              ; movupd        %xmm9,0x20(%r10,%r9,4)
@@ -25905,12 +26921,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,246                             ; je            4ca3 <_sk_store_f32_sse2+0x6e>
+  DB  116,246                             ; je            4f66 <_sk_store_f32_sse2+0x6e>
   DB  71,15,17,68,138,16                  ; movups        %xmm8,0x10(%r10,%r9,4)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,234                             ; jb            4ca3 <_sk_store_f32_sse2+0x6e>
+  DB  114,234                             ; jb            4f66 <_sk_store_f32_sse2+0x6e>
   DB  102,71,15,17,76,138,32              ; movupd        %xmm9,0x20(%r10,%r9,4)
-  DB  235,225                             ; jmp           4ca3 <_sk_store_f32_sse2+0x6e>
+  DB  235,225                             ; jmp           4f66 <_sk_store_f32_sse2+0x6e>
 
 PUBLIC _sk_clamp_x_sse2
 _sk_clamp_x_sse2 LABEL PROC
@@ -25950,7 +26966,7 @@
   DB  243,69,15,91,209                    ; cvttps2dq     %xmm9,%xmm10
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,84,13,96,31,0,0               ; andps         0x1f60(%rip),%xmm9        # 6ca0 <_sk_callback_sse2+0x10a0>
+  DB  68,15,84,13,205,31,0,0              ; andps         0x1fcd(%rip),%xmm9        # 6fd0 <_sk_callback_sse2+0x110d>
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
@@ -25971,7 +26987,7 @@
   DB  243,69,15,91,209                    ; cvttps2dq     %xmm9,%xmm10
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,84,13,33,31,0,0               ; andps         0x1f21(%rip),%xmm9        # 6cb0 <_sk_callback_sse2+0x10b0>
+  DB  68,15,84,13,142,31,0,0              ; andps         0x1f8e(%rip),%xmm9        # 6fe0 <_sk_callback_sse2+0x111d>
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
@@ -25992,13 +27008,13 @@
   DB  65,15,92,192                        ; subps         %xmm8,%xmm0
   DB  243,69,15,88,201                    ; addss         %xmm9,%xmm9
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
-  DB  243,68,15,89,21,241,34,0,0          ; mulss         0x22f1(%rip),%xmm10        # 70d0 <_sk_callback_sse2+0x14d0>
+  DB  243,68,15,89,21,94,35,0,0           ; mulss         0x235e(%rip),%xmm10        # 7400 <_sk_callback_sse2+0x153d>
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  68,15,89,208                        ; mulps         %xmm0,%xmm10
   DB  243,69,15,91,218                    ; cvttps2dq     %xmm10,%xmm11
   DB  69,15,91,219                        ; cvtdq2ps      %xmm11,%xmm11
   DB  69,15,194,211,1                     ; cmpltps       %xmm11,%xmm10
-  DB  68,15,84,21,194,30,0,0              ; andps         0x1ec2(%rip),%xmm10        # 6cc0 <_sk_callback_sse2+0x10c0>
+  DB  68,15,84,21,47,31,0,0               ; andps         0x1f2f(%rip),%xmm10        # 6ff0 <_sk_callback_sse2+0x112d>
   DB  69,15,87,228                        ; xorps         %xmm12,%xmm12
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  69,15,89,217                        ; mulps         %xmm9,%xmm11
@@ -26022,13 +27038,13 @@
   DB  65,15,92,200                        ; subps         %xmm8,%xmm1
   DB  243,69,15,88,201                    ; addss         %xmm9,%xmm9
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
-  DB  243,68,15,89,21,123,34,0,0          ; mulss         0x227b(%rip),%xmm10        # 70d4 <_sk_callback_sse2+0x14d4>
+  DB  243,68,15,89,21,232,34,0,0          ; mulss         0x22e8(%rip),%xmm10        # 7404 <_sk_callback_sse2+0x1541>
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  68,15,89,209                        ; mulps         %xmm1,%xmm10
   DB  243,69,15,91,218                    ; cvttps2dq     %xmm10,%xmm11
   DB  69,15,91,219                        ; cvtdq2ps      %xmm11,%xmm11
   DB  69,15,194,211,1                     ; cmpltps       %xmm11,%xmm10
-  DB  68,15,84,21,88,30,0,0               ; andps         0x1e58(%rip),%xmm10        # 6cd0 <_sk_callback_sse2+0x10d0>
+  DB  68,15,84,21,197,30,0,0              ; andps         0x1ec5(%rip),%xmm10        # 7000 <_sk_callback_sse2+0x113d>
   DB  69,15,87,228                        ; xorps         %xmm12,%xmm12
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  69,15,89,217                        ; mulps         %xmm9,%xmm11
@@ -26046,7 +27062,7 @@
 _sk_clamp_x_1_sse2 LABEL PROC
   DB  69,15,87,192                        ; xorps         %xmm8,%xmm8
   DB  68,15,95,192                        ; maxps         %xmm0,%xmm8
-  DB  68,15,93,5,42,30,0,0                ; minps         0x1e2a(%rip),%xmm8        # 6ce0 <_sk_callback_sse2+0x10e0>
+  DB  68,15,93,5,151,30,0,0               ; minps         0x1e97(%rip),%xmm8        # 7010 <_sk_callback_sse2+0x114d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -26057,7 +27073,7 @@
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,194,200,1                     ; cmpltps       %xmm8,%xmm9
-  DB  68,15,84,13,24,30,0,0               ; andps         0x1e18(%rip),%xmm9        # 6cf0 <_sk_callback_sse2+0x10f0>
+  DB  68,15,84,13,133,30,0,0              ; andps         0x1e85(%rip),%xmm9        # 7020 <_sk_callback_sse2+0x115d>
   DB  69,15,92,193                        ; subps         %xmm9,%xmm8
   DB  65,15,92,192                        ; subps         %xmm8,%xmm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -26065,14 +27081,14 @@
 
 PUBLIC _sk_mirror_x_1_sse2
 _sk_mirror_x_1_sse2 LABEL PROC
-  DB  68,15,40,5,20,30,0,0                ; movaps        0x1e14(%rip),%xmm8        # 6d00 <_sk_callback_sse2+0x1100>
+  DB  68,15,40,5,129,30,0,0               ; movaps        0x1e81(%rip),%xmm8        # 7030 <_sk_callback_sse2+0x116d>
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,13,24,30,0,0               ; movaps        0x1e18(%rip),%xmm9        # 6d10 <_sk_callback_sse2+0x1110>
+  DB  68,15,40,13,133,30,0,0              ; movaps        0x1e85(%rip),%xmm9        # 7040 <_sk_callback_sse2+0x117d>
   DB  68,15,89,200                        ; mulps         %xmm0,%xmm9
   DB  243,69,15,91,209                    ; cvttps2dq     %xmm9,%xmm10
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,84,13,14,30,0,0               ; andps         0x1e0e(%rip),%xmm9        # 6d20 <_sk_callback_sse2+0x1120>
+  DB  68,15,84,13,123,30,0,0              ; andps         0x1e7b(%rip),%xmm9        # 7050 <_sk_callback_sse2+0x118d>
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,88,210                        ; addps         %xmm10,%xmm10
@@ -26086,10 +27102,10 @@
 PUBLIC _sk_luminance_to_alpha_sse2
 _sk_luminance_to_alpha_sse2 LABEL PROC
   DB  15,40,218                           ; movaps        %xmm2,%xmm3
-  DB  15,89,5,244,29,0,0                  ; mulps         0x1df4(%rip),%xmm0        # 6d30 <_sk_callback_sse2+0x1130>
-  DB  15,89,13,253,29,0,0                 ; mulps         0x1dfd(%rip),%xmm1        # 6d40 <_sk_callback_sse2+0x1140>
+  DB  15,89,5,97,30,0,0                   ; mulps         0x1e61(%rip),%xmm0        # 7060 <_sk_callback_sse2+0x119d>
+  DB  15,89,13,106,30,0,0                 ; mulps         0x1e6a(%rip),%xmm1        # 7070 <_sk_callback_sse2+0x11ad>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
-  DB  15,89,29,3,30,0,0                   ; mulps         0x1e03(%rip),%xmm3        # 6d50 <_sk_callback_sse2+0x1150>
+  DB  15,89,29,112,30,0,0                 ; mulps         0x1e70(%rip),%xmm3        # 7080 <_sk_callback_sse2+0x11bd>
   DB  15,88,217                           ; addps         %xmm1,%xmm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
@@ -26355,9 +27371,9 @@
   DB  72,139,24                           ; mov           (%rax),%rbx
   DB  76,139,112,8                        ; mov           0x8(%rax),%r14
   DB  72,255,203                          ; dec           %rbx
-  DB  120,7                               ; js            5389 <_sk_evenly_spaced_gradient_sse2+0x18>
+  DB  120,7                               ; js            564c <_sk_evenly_spaced_gradient_sse2+0x18>
   DB  243,72,15,42,203                    ; cvtsi2ss      %rbx,%xmm1
-  DB  235,21                              ; jmp           539e <_sk_evenly_spaced_gradient_sse2+0x2d>
+  DB  235,21                              ; jmp           5661 <_sk_evenly_spaced_gradient_sse2+0x2d>
   DB  73,137,217                          ; mov           %rbx,%r9
   DB  73,209,233                          ; shr           %r9
   DB  131,227,1                           ; and           $0x1,%ebx
@@ -26453,15 +27469,15 @@
 
 PUBLIC _sk_gauss_a_to_rgba_sse2
 _sk_gauss_a_to_rgba_sse2 LABEL PROC
-  DB  15,40,5,54,24,0,0                   ; movaps        0x1836(%rip),%xmm0        # 6d60 <_sk_callback_sse2+0x1160>
+  DB  15,40,5,163,24,0,0                  ; movaps        0x18a3(%rip),%xmm0        # 7090 <_sk_callback_sse2+0x11cd>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,60,24,0,0                   ; addps         0x183c(%rip),%xmm0        # 6d70 <_sk_callback_sse2+0x1170>
+  DB  15,88,5,169,24,0,0                  ; addps         0x18a9(%rip),%xmm0        # 70a0 <_sk_callback_sse2+0x11dd>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,66,24,0,0                   ; addps         0x1842(%rip),%xmm0        # 6d80 <_sk_callback_sse2+0x1180>
+  DB  15,88,5,175,24,0,0                  ; addps         0x18af(%rip),%xmm0        # 70b0 <_sk_callback_sse2+0x11ed>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,72,24,0,0                   ; addps         0x1848(%rip),%xmm0        # 6d90 <_sk_callback_sse2+0x1190>
+  DB  15,88,5,181,24,0,0                  ; addps         0x18b5(%rip),%xmm0        # 70c0 <_sk_callback_sse2+0x11fd>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,78,24,0,0                   ; addps         0x184e(%rip),%xmm0        # 6da0 <_sk_callback_sse2+0x11a0>
+  DB  15,88,5,187,24,0,0                  ; addps         0x18bb(%rip),%xmm0        # 70d0 <_sk_callback_sse2+0x120d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
@@ -26477,12 +27493,12 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,249,2                        ; cmp           $0x2,%r9
-  DB  114,50                              ; jb            55a5 <_sk_gradient_sse2+0x46>
+  DB  114,50                              ; jb            5868 <_sk_gradient_sse2+0x46>
   DB  72,139,88,72                        ; mov           0x48(%rax),%rbx
   DB  73,255,201                          ; dec           %r9
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  15,40,21,39,24,0,0                  ; movaps        0x1827(%rip),%xmm2        # 6db0 <_sk_callback_sse2+0x11b0>
+  DB  15,40,21,148,24,0,0                 ; movaps        0x1894(%rip),%xmm2        # 70e0 <_sk_callback_sse2+0x121d>
   DB  243,15,16,27                        ; movss         (%rbx),%xmm3
   DB  15,198,219,0                        ; shufps        $0x0,%xmm3,%xmm3
   DB  15,194,216,2                        ; cmpleps       %xmm0,%xmm3
@@ -26490,7 +27506,7 @@
   DB  102,15,254,203                      ; paddd         %xmm3,%xmm1
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  73,255,201                          ; dec           %r9
-  DB  117,228                             ; jne           5589 <_sk_gradient_sse2+0x2a>
+  DB  117,228                             ; jne           584c <_sk_gradient_sse2+0x2a>
   DB  102,15,112,209,78                   ; pshufd        $0x4e,%xmm1,%xmm2
   DB  102,73,15,126,211                   ; movq          %xmm2,%r11
   DB  69,137,217                          ; mov           %r11d,%r9d
@@ -26625,29 +27641,29 @@
   DB  69,15,94,220                        ; divps         %xmm12,%xmm11
   DB  69,15,40,227                        ; movaps        %xmm11,%xmm12
   DB  69,15,89,228                        ; mulps         %xmm12,%xmm12
-  DB  68,15,40,45,232,21,0,0              ; movaps        0x15e8(%rip),%xmm13        # 6dc0 <_sk_callback_sse2+0x11c0>
+  DB  68,15,40,45,85,22,0,0               ; movaps        0x1655(%rip),%xmm13        # 70f0 <_sk_callback_sse2+0x122d>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
-  DB  68,15,88,45,236,21,0,0              ; addps         0x15ec(%rip),%xmm13        # 6dd0 <_sk_callback_sse2+0x11d0>
+  DB  68,15,88,45,89,22,0,0               ; addps         0x1659(%rip),%xmm13        # 7100 <_sk_callback_sse2+0x123d>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
-  DB  68,15,88,45,240,21,0,0              ; addps         0x15f0(%rip),%xmm13        # 6de0 <_sk_callback_sse2+0x11e0>
+  DB  68,15,88,45,93,22,0,0               ; addps         0x165d(%rip),%xmm13        # 7110 <_sk_callback_sse2+0x124d>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
-  DB  68,15,88,45,244,21,0,0              ; addps         0x15f4(%rip),%xmm13        # 6df0 <_sk_callback_sse2+0x11f0>
+  DB  68,15,88,45,97,22,0,0               ; addps         0x1661(%rip),%xmm13        # 7120 <_sk_callback_sse2+0x125d>
   DB  69,15,89,235                        ; mulps         %xmm11,%xmm13
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,40,21,243,21,0,0              ; movaps        0x15f3(%rip),%xmm10        # 6e00 <_sk_callback_sse2+0x1200>
+  DB  68,15,40,21,96,22,0,0               ; movaps        0x1660(%rip),%xmm10        # 7130 <_sk_callback_sse2+0x126d>
   DB  69,15,92,213                        ; subps         %xmm13,%xmm10
   DB  69,15,84,209                        ; andps         %xmm9,%xmm10
   DB  69,15,85,205                        ; andnps        %xmm13,%xmm9
   DB  69,15,86,202                        ; orps          %xmm10,%xmm9
   DB  68,15,194,192,1                     ; cmpltps       %xmm0,%xmm8
-  DB  68,15,40,21,230,21,0,0              ; movaps        0x15e6(%rip),%xmm10        # 6e10 <_sk_callback_sse2+0x1210>
+  DB  68,15,40,21,83,22,0,0               ; movaps        0x1653(%rip),%xmm10        # 7140 <_sk_callback_sse2+0x127d>
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,84,208                        ; andps         %xmm8,%xmm10
   DB  69,15,85,193                        ; andnps        %xmm9,%xmm8
   DB  69,15,86,194                        ; orps          %xmm10,%xmm8
   DB  68,15,40,201                        ; movaps        %xmm1,%xmm9
   DB  68,15,194,200,1                     ; cmpltps       %xmm0,%xmm9
-  DB  68,15,40,21,213,21,0,0              ; movaps        0x15d5(%rip),%xmm10        # 6e20 <_sk_callback_sse2+0x1220>
+  DB  68,15,40,21,66,22,0,0               ; movaps        0x1642(%rip),%xmm10        # 7150 <_sk_callback_sse2+0x128d>
   DB  69,15,92,208                        ; subps         %xmm8,%xmm10
   DB  69,15,84,209                        ; andps         %xmm9,%xmm10
   DB  69,15,85,200                        ; andnps        %xmm8,%xmm9
@@ -26670,7 +27686,7 @@
 PUBLIC _sk_save_xy_sse2
 _sk_save_xy_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,167,21,0,0               ; movaps        0x15a7(%rip),%xmm8        # 6e30 <_sk_callback_sse2+0x1230>
+  DB  68,15,40,5,20,22,0,0                ; movaps        0x1614(%rip),%xmm8        # 7160 <_sk_callback_sse2+0x129d>
   DB  15,17,0                             ; movups        %xmm0,(%rax)
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,88,200                        ; addps         %xmm8,%xmm9
@@ -26678,7 +27694,7 @@
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,40,217                        ; movaps        %xmm9,%xmm11
   DB  69,15,194,218,1                     ; cmpltps       %xmm10,%xmm11
-  DB  68,15,40,37,146,21,0,0              ; movaps        0x1592(%rip),%xmm12        # 6e40 <_sk_callback_sse2+0x1240>
+  DB  68,15,40,37,255,21,0,0              ; movaps        0x15ff(%rip),%xmm12        # 7170 <_sk_callback_sse2+0x12ad>
   DB  69,15,84,220                        ; andps         %xmm12,%xmm11
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
   DB  69,15,92,202                        ; subps         %xmm10,%xmm9
@@ -26721,8 +27737,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,11,21,0,0                   ; addps         0x150b(%rip),%xmm0        # 6e50 <_sk_callback_sse2+0x1250>
-  DB  68,15,40,13,19,21,0,0               ; movaps        0x1513(%rip),%xmm9        # 6e60 <_sk_callback_sse2+0x1260>
+  DB  15,88,5,120,21,0,0                  ; addps         0x1578(%rip),%xmm0        # 7180 <_sk_callback_sse2+0x12bd>
+  DB  68,15,40,13,128,21,0,0              ; movaps        0x1580(%rip),%xmm9        # 7190 <_sk_callback_sse2+0x12cd>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -26733,7 +27749,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,2,21,0,0                    ; addps         0x1502(%rip),%xmm0        # 6e70 <_sk_callback_sse2+0x1270>
+  DB  15,88,5,111,21,0,0                  ; addps         0x156f(%rip),%xmm0        # 71a0 <_sk_callback_sse2+0x12dd>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -26743,8 +27759,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,244,20,0,0                 ; addps         0x14f4(%rip),%xmm1        # 6e80 <_sk_callback_sse2+0x1280>
-  DB  68,15,40,13,252,20,0,0              ; movaps        0x14fc(%rip),%xmm9        # 6e90 <_sk_callback_sse2+0x1290>
+  DB  15,88,13,97,21,0,0                  ; addps         0x1561(%rip),%xmm1        # 71b0 <_sk_callback_sse2+0x12ed>
+  DB  68,15,40,13,105,21,0,0              ; movaps        0x1569(%rip),%xmm9        # 71c0 <_sk_callback_sse2+0x12fd>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -26755,7 +27771,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,234,20,0,0                 ; addps         0x14ea(%rip),%xmm1        # 6ea0 <_sk_callback_sse2+0x12a0>
+  DB  15,88,13,87,21,0,0                  ; addps         0x1557(%rip),%xmm1        # 71d0 <_sk_callback_sse2+0x130d>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -26765,13 +27781,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,221,20,0,0                  ; addps         0x14dd(%rip),%xmm0        # 6eb0 <_sk_callback_sse2+0x12b0>
-  DB  68,15,40,13,229,20,0,0              ; movaps        0x14e5(%rip),%xmm9        # 6ec0 <_sk_callback_sse2+0x12c0>
+  DB  15,88,5,74,21,0,0                   ; addps         0x154a(%rip),%xmm0        # 71e0 <_sk_callback_sse2+0x131d>
+  DB  68,15,40,13,82,21,0,0               ; movaps        0x1552(%rip),%xmm9        # 71f0 <_sk_callback_sse2+0x132d>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,225,20,0,0              ; mulps         0x14e1(%rip),%xmm9        # 6ed0 <_sk_callback_sse2+0x12d0>
-  DB  68,15,88,13,233,20,0,0              ; addps         0x14e9(%rip),%xmm9        # 6ee0 <_sk_callback_sse2+0x12e0>
+  DB  68,15,89,13,78,21,0,0               ; mulps         0x154e(%rip),%xmm9        # 7200 <_sk_callback_sse2+0x133d>
+  DB  68,15,88,13,86,21,0,0               ; addps         0x1556(%rip),%xmm9        # 7210 <_sk_callback_sse2+0x134d>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -26782,16 +27798,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,216,20,0,0                  ; addps         0x14d8(%rip),%xmm0        # 6ef0 <_sk_callback_sse2+0x12f0>
-  DB  68,15,40,13,224,20,0,0              ; movaps        0x14e0(%rip),%xmm9        # 6f00 <_sk_callback_sse2+0x1300>
+  DB  15,88,5,69,21,0,0                   ; addps         0x1545(%rip),%xmm0        # 7220 <_sk_callback_sse2+0x135d>
+  DB  68,15,40,13,77,21,0,0               ; movaps        0x154d(%rip),%xmm9        # 7230 <_sk_callback_sse2+0x136d>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,228,20,0,0               ; movaps        0x14e4(%rip),%xmm8        # 6f10 <_sk_callback_sse2+0x1310>
+  DB  68,15,40,5,81,21,0,0                ; movaps        0x1551(%rip),%xmm8        # 7240 <_sk_callback_sse2+0x137d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,232,20,0,0               ; addps         0x14e8(%rip),%xmm8        # 6f20 <_sk_callback_sse2+0x1320>
+  DB  68,15,88,5,85,21,0,0                ; addps         0x1555(%rip),%xmm8        # 7250 <_sk_callback_sse2+0x138d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,236,20,0,0               ; addps         0x14ec(%rip),%xmm8        # 6f30 <_sk_callback_sse2+0x1330>
+  DB  68,15,88,5,89,21,0,0                ; addps         0x1559(%rip),%xmm8        # 7260 <_sk_callback_sse2+0x139d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,240,20,0,0               ; addps         0x14f0(%rip),%xmm8        # 6f40 <_sk_callback_sse2+0x1340>
+  DB  68,15,88,5,93,21,0,0                ; addps         0x155d(%rip),%xmm8        # 7270 <_sk_callback_sse2+0x13ad>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -26799,17 +27815,17 @@
 PUBLIC _sk_bicubic_p1x_sse2
 _sk_bicubic_p1x_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,234,20,0,0               ; movaps        0x14ea(%rip),%xmm8        # 6f50 <_sk_callback_sse2+0x1350>
+  DB  68,15,40,5,87,21,0,0                ; movaps        0x1557(%rip),%xmm8        # 7280 <_sk_callback_sse2+0x13bd>
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,72,64                      ; movups        0x40(%rax),%xmm9
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,21,230,20,0,0              ; movaps        0x14e6(%rip),%xmm10        # 6f60 <_sk_callback_sse2+0x1360>
+  DB  68,15,40,21,83,21,0,0               ; movaps        0x1553(%rip),%xmm10        # 7290 <_sk_callback_sse2+0x13cd>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,234,20,0,0              ; addps         0x14ea(%rip),%xmm10        # 6f70 <_sk_callback_sse2+0x1370>
+  DB  68,15,88,21,87,21,0,0               ; addps         0x1557(%rip),%xmm10        # 72a0 <_sk_callback_sse2+0x13dd>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,230,20,0,0              ; addps         0x14e6(%rip),%xmm10        # 6f80 <_sk_callback_sse2+0x1380>
+  DB  68,15,88,21,83,21,0,0               ; addps         0x1553(%rip),%xmm10        # 72b0 <_sk_callback_sse2+0x13ed>
   DB  68,15,17,144,128,0,0,0              ; movups        %xmm10,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -26819,11 +27835,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,217,20,0,0                  ; addps         0x14d9(%rip),%xmm0        # 6f90 <_sk_callback_sse2+0x1390>
+  DB  15,88,5,70,21,0,0                   ; addps         0x1546(%rip),%xmm0        # 72c0 <_sk_callback_sse2+0x13fd>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,217,20,0,0               ; mulps         0x14d9(%rip),%xmm8        # 6fa0 <_sk_callback_sse2+0x13a0>
-  DB  68,15,88,5,225,20,0,0               ; addps         0x14e1(%rip),%xmm8        # 6fb0 <_sk_callback_sse2+0x13b0>
+  DB  68,15,89,5,70,21,0,0                ; mulps         0x1546(%rip),%xmm8        # 72d0 <_sk_callback_sse2+0x140d>
+  DB  68,15,88,5,78,21,0,0                ; addps         0x154e(%rip),%xmm8        # 72e0 <_sk_callback_sse2+0x141d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -26834,13 +27850,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,207,20,0,0                 ; addps         0x14cf(%rip),%xmm1        # 6fc0 <_sk_callback_sse2+0x13c0>
-  DB  68,15,40,13,215,20,0,0              ; movaps        0x14d7(%rip),%xmm9        # 6fd0 <_sk_callback_sse2+0x13d0>
+  DB  15,88,13,60,21,0,0                  ; addps         0x153c(%rip),%xmm1        # 72f0 <_sk_callback_sse2+0x142d>
+  DB  68,15,40,13,68,21,0,0               ; movaps        0x1544(%rip),%xmm9        # 7300 <_sk_callback_sse2+0x143d>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,211,20,0,0              ; mulps         0x14d3(%rip),%xmm9        # 6fe0 <_sk_callback_sse2+0x13e0>
-  DB  68,15,88,13,219,20,0,0              ; addps         0x14db(%rip),%xmm9        # 6ff0 <_sk_callback_sse2+0x13f0>
+  DB  68,15,89,13,64,21,0,0               ; mulps         0x1540(%rip),%xmm9        # 7310 <_sk_callback_sse2+0x144d>
+  DB  68,15,88,13,72,21,0,0               ; addps         0x1548(%rip),%xmm9        # 7320 <_sk_callback_sse2+0x145d>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -26851,16 +27867,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,201,20,0,0                 ; addps         0x14c9(%rip),%xmm1        # 7000 <_sk_callback_sse2+0x1400>
-  DB  68,15,40,13,209,20,0,0              ; movaps        0x14d1(%rip),%xmm9        # 7010 <_sk_callback_sse2+0x1410>
+  DB  15,88,13,54,21,0,0                  ; addps         0x1536(%rip),%xmm1        # 7330 <_sk_callback_sse2+0x146d>
+  DB  68,15,40,13,62,21,0,0               ; movaps        0x153e(%rip),%xmm9        # 7340 <_sk_callback_sse2+0x147d>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,213,20,0,0               ; movaps        0x14d5(%rip),%xmm8        # 7020 <_sk_callback_sse2+0x1420>
+  DB  68,15,40,5,66,21,0,0                ; movaps        0x1542(%rip),%xmm8        # 7350 <_sk_callback_sse2+0x148d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,217,20,0,0               ; addps         0x14d9(%rip),%xmm8        # 7030 <_sk_callback_sse2+0x1430>
+  DB  68,15,88,5,70,21,0,0                ; addps         0x1546(%rip),%xmm8        # 7360 <_sk_callback_sse2+0x149d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,221,20,0,0               ; addps         0x14dd(%rip),%xmm8        # 7040 <_sk_callback_sse2+0x1440>
+  DB  68,15,88,5,74,21,0,0                ; addps         0x154a(%rip),%xmm8        # 7370 <_sk_callback_sse2+0x14ad>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,225,20,0,0               ; addps         0x14e1(%rip),%xmm8        # 7050 <_sk_callback_sse2+0x1450>
+  DB  68,15,88,5,78,21,0,0                ; addps         0x154e(%rip),%xmm8        # 7380 <_sk_callback_sse2+0x14bd>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -26868,17 +27884,17 @@
 PUBLIC _sk_bicubic_p1y_sse2
 _sk_bicubic_p1y_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,219,20,0,0               ; movaps        0x14db(%rip),%xmm8        # 7060 <_sk_callback_sse2+0x1460>
+  DB  68,15,40,5,72,21,0,0                ; movaps        0x1548(%rip),%xmm8        # 7390 <_sk_callback_sse2+0x14cd>
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,72,96                      ; movups        0x60(%rax),%xmm9
   DB  65,15,88,200                        ; addps         %xmm8,%xmm1
-  DB  68,15,40,21,214,20,0,0              ; movaps        0x14d6(%rip),%xmm10        # 7070 <_sk_callback_sse2+0x1470>
+  DB  68,15,40,21,67,21,0,0               ; movaps        0x1543(%rip),%xmm10        # 73a0 <_sk_callback_sse2+0x14dd>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,218,20,0,0              ; addps         0x14da(%rip),%xmm10        # 7080 <_sk_callback_sse2+0x1480>
+  DB  68,15,88,21,71,21,0,0               ; addps         0x1547(%rip),%xmm10        # 73b0 <_sk_callback_sse2+0x14ed>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,214,20,0,0              ; addps         0x14d6(%rip),%xmm10        # 7090 <_sk_callback_sse2+0x1490>
+  DB  68,15,88,21,67,21,0,0               ; addps         0x1543(%rip),%xmm10        # 73c0 <_sk_callback_sse2+0x14fd>
   DB  68,15,17,144,160,0,0,0              ; movups        %xmm10,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -26888,11 +27904,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,200,20,0,0                 ; addps         0x14c8(%rip),%xmm1        # 70a0 <_sk_callback_sse2+0x14a0>
+  DB  15,88,13,53,21,0,0                  ; addps         0x1535(%rip),%xmm1        # 73d0 <_sk_callback_sse2+0x150d>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,200,20,0,0               ; mulps         0x14c8(%rip),%xmm8        # 70b0 <_sk_callback_sse2+0x14b0>
-  DB  68,15,88,5,208,20,0,0               ; addps         0x14d0(%rip),%xmm8        # 70c0 <_sk_callback_sse2+0x14c0>
+  DB  68,15,89,5,53,21,0,0                ; mulps         0x1535(%rip),%xmm8        # 73e0 <_sk_callback_sse2+0x151d>
+  DB  68,15,88,5,61,21,0,0                ; addps         0x153d(%rip),%xmm8        # 73f0 <_sk_callback_sse2+0x152d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -27110,11 +28126,11 @@
   DB  128,191,0,0,128,191,0               ; cmpb          $0x0,-0x40800000(%rdi)
   DB  0,224                               ; add           %ah,%al
   DB  64,0,0                              ; add           %al,(%rax)
-  DB  224,64                              ; loopne        5ea8 <.literal16+0x1d8>
+  DB  224,64                              ; loopne        6168 <.literal16+0x1d8>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,64                              ; loopne        5eac <.literal16+0x1dc>
+  DB  224,64                              ; loopne        616c <.literal16+0x1dc>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,64                              ; loopne        5eb0 <.literal16+0x1e0>
+  DB  224,64                              ; loopne        6170 <.literal16+0x1e0>
   DB  154                                 ; (bad)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
@@ -27134,13 +28150,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5ed1 <.literal16+0x201>
+  DB  71,225,61                           ; rex.RXB       loope 6191 <.literal16+0x201>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5ed5 <.literal16+0x205>
+  DB  71,225,61                           ; rex.RXB       loope 6195 <.literal16+0x205>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5ed9 <.literal16+0x209>
+  DB  71,225,61                           ; rex.RXB       loope 6199 <.literal16+0x209>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5edd <.literal16+0x20d>
+  DB  71,225,61                           ; rex.RXB       loope 619d <.literal16+0x20d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -27165,13 +28181,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f11 <.literal16+0x241>
+  DB  71,225,61                           ; rex.RXB       loope 61d1 <.literal16+0x241>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f15 <.literal16+0x245>
+  DB  71,225,61                           ; rex.RXB       loope 61d5 <.literal16+0x245>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f19 <.literal16+0x249>
+  DB  71,225,61                           ; rex.RXB       loope 61d9 <.literal16+0x249>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f1d <.literal16+0x24d>
+  DB  71,225,61                           ; rex.RXB       loope 61dd <.literal16+0x24d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -27196,13 +28212,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f51 <.literal16+0x281>
+  DB  71,225,61                           ; rex.RXB       loope 6211 <.literal16+0x281>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f55 <.literal16+0x285>
+  DB  71,225,61                           ; rex.RXB       loope 6215 <.literal16+0x285>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f59 <.literal16+0x289>
+  DB  71,225,61                           ; rex.RXB       loope 6219 <.literal16+0x289>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f5d <.literal16+0x28d>
+  DB  71,225,61                           ; rex.RXB       loope 621d <.literal16+0x28d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -27227,13 +28243,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f91 <.literal16+0x2c1>
+  DB  71,225,61                           ; rex.RXB       loope 6251 <.literal16+0x2c1>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f95 <.literal16+0x2c5>
+  DB  71,225,61                           ; rex.RXB       loope 6255 <.literal16+0x2c5>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f99 <.literal16+0x2c9>
+  DB  71,225,61                           ; rex.RXB       loope 6259 <.literal16+0x2c9>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f9d <.literal16+0x2cd>
+  DB  71,225,61                           ; rex.RXB       loope 625d <.literal16+0x2cd>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -27254,11 +28270,11 @@
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,127                    ; add           %al,0x7f00003f(%rax)
   DB  67,0,0                              ; rex.XB        add %al,(%r8)
-  DB  127,67                              ; jg            5fdb <.literal16+0x30b>
+  DB  127,67                              ; jg            629b <.literal16+0x30b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            5fdf <.literal16+0x30f>
+  DB  127,67                              ; jg            629f <.literal16+0x30f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            5fe3 <.literal16+0x313>
+  DB  127,67                              ; jg            62a3 <.literal16+0x313>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -27545,13 +28561,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6229 <.literal16+0x559>
+  DB  224,7                               ; loopne        64e9 <.literal16+0x559>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        622d <.literal16+0x55d>
+  DB  224,7                               ; loopne        64ed <.literal16+0x55d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6231 <.literal16+0x561>
+  DB  224,7                               ; loopne        64f1 <.literal16+0x561>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6235 <.literal16+0x565>
+  DB  224,7                               ; loopne        64f5 <.literal16+0x565>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -27616,11 +28632,11 @@
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            630b <.literal16+0x63b>
+  DB  127,67                              ; jg            65cb <.literal16+0x63b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            630f <.literal16+0x63f>
+  DB  127,67                              ; jg            65cf <.literal16+0x63f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6313 <.literal16+0x643>
+  DB  127,67                              ; jg            65d3 <.literal16+0x643>
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,129                          ; cmpb          $0x81,(%rbx)
   DB  128,128,59,129,128,128,59           ; addb          $0x3b,-0x7f7f7ec5(%rax)
@@ -27635,16 +28651,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6304 <.literal16+0x634>
+  DB  127,0                               ; jg            65c4 <.literal16+0x634>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6308 <.literal16+0x638>
+  DB  127,0                               ; jg            65c8 <.literal16+0x638>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            630c <.literal16+0x63c>
+  DB  127,0                               ; jg            65cc <.literal16+0x63c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6310 <.literal16+0x640>
+  DB  127,0                               ; jg            65d0 <.literal16+0x640>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -27653,7 +28669,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6395 <.literal16+0x6c5>
+  DB  119,115                             ; ja            6655 <.literal16+0x6c5>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -27664,7 +28680,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           62f9 <.literal16+0x629>
+  DB  117,191                             ; jne           65b9 <.literal16+0x629>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -27676,7 +28692,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a33a <_sk_callback_sse2+0xffffffffe9a3473a>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a5fa <_sk_callback_sse2+0xffffffffe9a34737>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -27730,16 +28746,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            63d4 <.literal16+0x704>
+  DB  127,0                               ; jg            6694 <.literal16+0x704>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            63d8 <.literal16+0x708>
+  DB  127,0                               ; jg            6698 <.literal16+0x708>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            63dc <.literal16+0x70c>
+  DB  127,0                               ; jg            669c <.literal16+0x70c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            63e0 <.literal16+0x710>
+  DB  127,0                               ; jg            66a0 <.literal16+0x710>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -27748,7 +28764,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6465 <.literal16+0x795>
+  DB  119,115                             ; ja            6725 <.literal16+0x795>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -27759,7 +28775,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           63c9 <.literal16+0x6f9>
+  DB  117,191                             ; jne           6689 <.literal16+0x6f9>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -27771,7 +28787,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a40a <_sk_callback_sse2+0xffffffffe9a3480a>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a6ca <_sk_callback_sse2+0xffffffffe9a34807>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -27825,16 +28841,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            64a4 <.literal16+0x7d4>
+  DB  127,0                               ; jg            6764 <.literal16+0x7d4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            64a8 <.literal16+0x7d8>
+  DB  127,0                               ; jg            6768 <.literal16+0x7d8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            64ac <.literal16+0x7dc>
+  DB  127,0                               ; jg            676c <.literal16+0x7dc>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            64b0 <.literal16+0x7e0>
+  DB  127,0                               ; jg            6770 <.literal16+0x7e0>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -27843,7 +28859,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6535 <.literal16+0x865>
+  DB  119,115                             ; ja            67f5 <.literal16+0x865>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -27854,7 +28870,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           6499 <.literal16+0x7c9>
+  DB  117,191                             ; jne           6759 <.literal16+0x7c9>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -27866,7 +28882,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a4da <_sk_callback_sse2+0xffffffffe9a348da>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a79a <_sk_callback_sse2+0xffffffffe9a348d7>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -27920,16 +28936,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6574 <.literal16+0x8a4>
+  DB  127,0                               ; jg            6834 <.literal16+0x8a4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6578 <.literal16+0x8a8>
+  DB  127,0                               ; jg            6838 <.literal16+0x8a8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            657c <.literal16+0x8ac>
+  DB  127,0                               ; jg            683c <.literal16+0x8ac>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6580 <.literal16+0x8b0>
+  DB  127,0                               ; jg            6840 <.literal16+0x8b0>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -27938,7 +28954,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6605 <.literal16+0x935>
+  DB  119,115                             ; ja            68c5 <.literal16+0x935>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -27949,7 +28965,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           6569 <.literal16+0x899>
+  DB  117,191                             ; jne           6829 <.literal16+0x899>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -27961,7 +28977,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a5aa <_sk_callback_sse2+0xffffffffe9a349aa>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a86a <_sk_callback_sse2+0xffffffffe9a349a7>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -28011,13 +29027,13 @@
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
-  DB  127,67                              ; jg            6687 <.literal16+0x9b7>
+  DB  127,67                              ; jg            6947 <.literal16+0x9b7>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            668b <.literal16+0x9bb>
+  DB  127,67                              ; jg            694b <.literal16+0x9bb>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            668f <.literal16+0x9bf>
+  DB  127,67                              ; jg            694f <.literal16+0x9bf>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6693 <.literal16+0x9c3>
+  DB  127,67                              ; jg            6953 <.literal16+0x9c3>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -28064,16 +29080,16 @@
   DB  128,3,62                            ; addb          $0x3e,(%rbx)
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6713 <.literal16+0xa43>
+  DB  118,63                              ; jbe           69d3 <.literal16+0xa43>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6717 <.literal16+0xa47>
+  DB  118,63                              ; jbe           69d7 <.literal16+0xa47>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           671b <.literal16+0xa4b>
+  DB  118,63                              ; jbe           69db <.literal16+0xa4b>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           671f <.literal16+0xa4f>
+  DB  118,63                              ; jbe           69df <.literal16+0xa4f>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
@@ -28102,11 +29118,11 @@
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            678b <.literal16+0xabb>
+  DB  127,67                              ; jg            6a4b <.literal16+0xabb>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            678f <.literal16+0xabf>
+  DB  127,67                              ; jg            6a4f <.literal16+0xabf>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6793 <.literal16+0xac3>
+  DB  127,67                              ; jg            6a53 <.literal16+0xac3>
   DB  255,0                               ; incl          (%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  255,0                               ; incl          (%rax)
@@ -28177,13 +29193,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6829 <.literal16+0xb59>
+  DB  224,7                               ; loopne        6ae9 <.literal16+0xb59>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        682d <.literal16+0xb5d>
+  DB  224,7                               ; loopne        6aed <.literal16+0xb5d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6831 <.literal16+0xb61>
+  DB  224,7                               ; loopne        6af1 <.literal16+0xb61>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6835 <.literal16+0xb65>
+  DB  224,7                               ; loopne        6af5 <.literal16+0xb65>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -28229,13 +29245,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6899 <.literal16+0xbc9>
+  DB  224,7                               ; loopne        6b59 <.literal16+0xbc9>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        689d <.literal16+0xbcd>
+  DB  224,7                               ; loopne        6b5d <.literal16+0xbcd>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        68a1 <.literal16+0xbd1>
+  DB  224,7                               ; loopne        6b61 <.literal16+0xbd1>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        68a5 <.literal16+0xbd5>
+  DB  224,7                               ; loopne        6b65 <.literal16+0xbd5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -28281,13 +29297,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6909 <.literal16+0xc39>
+  DB  224,7                               ; loopne        6bc9 <.literal16+0xc39>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        690d <.literal16+0xc3d>
+  DB  224,7                               ; loopne        6bcd <.literal16+0xc3d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6911 <.literal16+0xc41>
+  DB  224,7                               ; loopne        6bd1 <.literal16+0xc41>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6915 <.literal16+0xc45>
+  DB  224,7                               ; loopne        6bd5 <.literal16+0xc45>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -28325,13 +29341,13 @@
   DB  65,0,0                              ; add           %al,(%r8)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            69a6 <.literal16+0xcd6>
+  DB  124,66                              ; jl            6c66 <.literal16+0xcd6>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            69aa <.literal16+0xcda>
+  DB  124,66                              ; jl            6c6a <.literal16+0xcda>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            69ae <.literal16+0xcde>
+  DB  124,66                              ; jl            6c6e <.literal16+0xcde>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            69b2 <.literal16+0xce2>
+  DB  124,66                              ; jl            6c72 <.literal16+0xce2>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,240                               ; add           %dh,%al
@@ -28465,13 +29481,13 @@
   DB  136,136,61,137,136,136              ; mov           %cl,-0x777776c3(%rax)
   DB  61,137,136,136,61                   ; cmp           $0x3d888889,%eax
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            6b35 <.literal16+0xe65>
+  DB  112,65                              ; jo            6df5 <.literal16+0xe65>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            6b39 <.literal16+0xe69>
+  DB  112,65                              ; jo            6df9 <.literal16+0xe69>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            6b3d <.literal16+0xe6d>
+  DB  112,65                              ; jo            6dfd <.literal16+0xe6d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            6b41 <.literal16+0xe71>
+  DB  112,65                              ; jo            6e01 <.literal16+0xe71>
   DB  255,0                               ; incl          (%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  255,0                               ; incl          (%rax)
@@ -28502,11 +29518,46 @@
   DB  128,59,129                          ; cmpb          $0x81,(%rbx)
   DB  128,128,59,0,0,127,67               ; addb          $0x43,0x7f00003b(%rax)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6bab <.literal16+0xedb>
+  DB  127,67                              ; jg            6e6b <.literal16+0xedb>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6baf <.literal16+0xedf>
+  DB  127,67                              ; jg            6e6f <.literal16+0xedf>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6bb3 <.literal16+0xee3>
+  DB  127,67                              ; jg            6e73 <.literal16+0xee3>
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
+  DB  128,59,129                          ; cmpb          $0x81,(%rbx)
+  DB  128,128,59,255,0,0,0                ; addb          $0x0,0xff3b(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
+  DB  128,59,129                          ; cmpb          $0x81,(%rbx)
+  DB  128,128,59,255,0,0,0                ; addb          $0x0,0xff3b(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
+  DB  128,59,129                          ; cmpb          $0x81,(%rbx)
+  DB  128,128,59,0,0,127,67               ; addb          $0x43,0x7f00003b(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  127,67                              ; jg            6edb <.literal16+0xf4b>
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  127,67                              ; jg            6edf <.literal16+0xf4f>
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  127,67                              ; jg            6ee3 <.literal16+0xf53>
   DB  0,128,0,0,0,128                     ; add           %al,-0x80000000(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,128,0,0,0,128                     ; add           %al,-0x80000000(%rax)
@@ -28602,13 +29653,13 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  255                                 ; (bad)
-  DB  127,71                              ; jg            6cdb <.literal16+0x100b>
+  DB  127,71                              ; jg            700b <.literal16+0x107b>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            6cdf <.literal16+0x100f>
+  DB  127,71                              ; jg            700f <.literal16+0x107f>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            6ce3 <.literal16+0x1013>
+  DB  127,71                              ; jg            7013 <.literal16+0x1083>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            6ce7 <.literal16+0x1017>
+  DB  127,71                              ; jg            7017 <.literal16+0x1087>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -28685,10 +29736,10 @@
   DB  61,152,221,147,61                   ; cmp           $0x3d93dd98,%eax
   DB  152                                 ; cwtl
   DB  221,147,61,45,16,17                 ; fstl          0x11102d3d(%rbx)
-  DB  192,45,16,17,192,45,16              ; shrb          $0x10,0x2dc01110(%rip)        # 2dc07e7a <_sk_callback_sse2+0x2dc0227a>
+  DB  192,45,16,17,192,45,16              ; shrb          $0x10,0x2dc01110(%rip)        # 2dc081aa <_sk_callback_sse2+0x2dc022e7>
   DB  17,192                              ; adc           %eax,%eax
   DB  45,16,17,192,18                     ; sub           $0x12c01110,%eax
-  DB  120,57                              ; js            6dac <.literal16+0x10dc>
+  DB  120,57                              ; js            70dc <.literal16+0x114c>
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
@@ -28816,11 +29867,11 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,114                          ; cmpb          $0x72,(%rdi)
   DB  28,199                              ; sbb           $0xc7,%al
-  DB  62,114,28                           ; jb,pt         6ef2 <.literal16+0x1222>
+  DB  62,114,28                           ; jb,pt         7222 <.literal16+0x1292>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6ef6 <.literal16+0x1226>
+  DB  62,114,28                           ; jb,pt         7226 <.literal16+0x1296>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6efa <.literal16+0x122a>
+  DB  62,114,28                           ; jb,pt         722a <.literal16+0x129a>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -28864,7 +29915,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63fd85 <_sk_callback_sse2+0x3d63a185>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d6400b5 <_sk_callback_sse2+0x3d63a1f2>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -28890,7 +29941,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63fdc5 <_sk_callback_sse2+0x3d63a1c5>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d6400f5 <_sk_callback_sse2+0x3d63a232>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -28899,13 +29950,13 @@
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
-  DB  114,28                              ; jb            6fbe <.literal16+0x12ee>
+  DB  114,28                              ; jb            72ee <.literal16+0x135e>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6fc2 <.literal16+0x12f2>
+  DB  62,114,28                           ; jb,pt         72f2 <.literal16+0x1362>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6fc6 <.literal16+0x12f6>
+  DB  62,114,28                           ; jb,pt         72f6 <.literal16+0x1366>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         6fca <.literal16+0x12fa>
+  DB  62,114,28                           ; jb,pt         72fa <.literal16+0x136a>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -28926,11 +29977,11 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,114                          ; cmpb          $0x72,(%rdi)
   DB  28,199                              ; sbb           $0xc7,%al
-  DB  62,114,28                           ; jb,pt         7002 <.literal16+0x1332>
+  DB  62,114,28                           ; jb,pt         7332 <.literal16+0x13a2>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         7006 <.literal16+0x1336>
+  DB  62,114,28                           ; jb,pt         7336 <.literal16+0x13a6>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         700a <.literal16+0x133a>
+  DB  62,114,28                           ; jb,pt         733a <.literal16+0x13aa>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -28974,7 +30025,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63fe95 <_sk_callback_sse2+0x3d63a295>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d6401c5 <_sk_callback_sse2+0x3d63a302>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -29000,7 +30051,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63fed5 <_sk_callback_sse2+0x3d63a2d5>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d640205 <_sk_callback_sse2+0x3d63a342>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -29009,13 +30060,13 @@
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
-  DB  114,28                              ; jb            70ce <.literal16+0x13fe>
+  DB  114,28                              ; jb            73fe <.literal16+0x146e>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         70d2 <_sk_callback_sse2+0x14d2>
+  DB  62,114,28                           ; jb,pt         7402 <_sk_callback_sse2+0x153f>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         70d6 <_sk_callback_sse2+0x14d6>
+  DB  62,114,28                           ; jb,pt         7406 <_sk_callback_sse2+0x1543>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         70da <_sk_callback_sse2+0x14da>
+  DB  62,114,28                           ; jb,pt         740a <_sk_callback_sse2+0x1547>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -29120,7 +30171,7 @@
 PUBLIC _sk_constant_color_hsw_lowp
 _sk_constant_color_hsw_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,121,24,5,106,26,0,0         ; vbroadcastss  0x1a6a(%rip),%xmm0        # 1ba0 <_sk_xor__hsw_lowp+0x78>
+  DB  196,226,121,24,5,238,32,0,0         ; vbroadcastss  0x20ee(%rip),%xmm0        # 2224 <_sk_xor__hsw_lowp+0x78>
   DB  197,248,88,24                       ; vaddps        (%rax),%xmm0,%xmm3
   DB  196,226,125,121,195                 ; vpbroadcastw  %xmm3,%ymm0
   DB  197,251,112,203,234                 ; vpshuflw      $0xea,%xmm3,%xmm1
@@ -29137,7 +30188,7 @@
 PUBLIC _sk_set_rgb_hsw_lowp
 _sk_set_rgb_hsw_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  197,250,16,21,45,26,0,0             ; vmovss        0x1a2d(%rip),%xmm2        # 1ba4 <_sk_xor__hsw_lowp+0x7c>
+  DB  197,250,16,21,177,32,0,0            ; vmovss        0x20b1(%rip),%xmm2        # 2228 <_sk_xor__hsw_lowp+0x7c>
   DB  197,234,88,0                        ; vaddss        (%rax),%xmm2,%xmm0
   DB  196,193,121,126,193                 ; vmovd         %xmm0,%r9d
   DB  196,193,121,110,193                 ; vmovd         %r9d,%xmm0
@@ -29172,16 +30223,16 @@
   DB  15,133,210,0,0,0                    ; jne           2b6 <_sk_load_8888_hsw_lowp+0xe0>
   DB  196,193,126,111,92,147,32           ; vmovdqu       0x20(%r11,%rdx,4),%ymm3
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
-  DB  197,253,111,5,199,25,0,0            ; vmovdqa       0x19c7(%rip),%ymm0        # 1bc0 <_sk_xor__hsw_lowp+0x98>
+  DB  197,253,111,5,71,32,0,0             ; vmovdqa       0x2047(%rip),%ymm0        # 2240 <_sk_xor__hsw_lowp+0x94>
   DB  196,226,61,0,200                    ; vpshufb       %ymm0,%ymm8,%ymm1
   DB  196,227,253,0,201,232               ; vpermq        $0xe8,%ymm1,%ymm1
   DB  196,226,101,0,192                   ; vpshufb       %ymm0,%ymm3,%ymm0
   DB  196,227,253,0,192,232               ; vpermq        $0xe8,%ymm0,%ymm0
   DB  196,227,117,56,192,1                ; vinserti128   $0x1,%xmm0,%ymm1,%ymm0
   DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
-  DB  196,98,125,121,13,189,25,0,0        ; vpbroadcastw  0x19bd(%rip),%ymm9        # 1be0 <_sk_xor__hsw_lowp+0xb8>
+  DB  196,98,125,121,13,61,32,0,0         ; vpbroadcastw  0x203d(%rip),%ymm9        # 2260 <_sk_xor__hsw_lowp+0xb4>
   DB  196,193,125,228,193                 ; vpmulhuw      %ymm9,%ymm0,%ymm0
-  DB  197,253,111,13,208,25,0,0           ; vmovdqa       0x19d0(%rip),%ymm1        # 1c00 <_sk_xor__hsw_lowp+0xd8>
+  DB  197,253,111,13,80,32,0,0            ; vmovdqa       0x2050(%rip),%ymm1        # 2280 <_sk_xor__hsw_lowp+0xd4>
   DB  196,226,61,0,209                    ; vpshufb       %ymm1,%ymm8,%ymm2
   DB  196,227,253,0,210,232               ; vpermq        $0xe8,%ymm2,%ymm2
   DB  196,226,101,0,201                   ; vpshufb       %ymm1,%ymm3,%ymm1
@@ -29189,7 +30240,7 @@
   DB  196,227,109,56,201,1                ; vinserti128   $0x1,%xmm1,%ymm2,%ymm1
   DB  197,245,113,241,8                   ; vpsllw        $0x8,%ymm1,%ymm1
   DB  196,193,117,228,201                 ; vpmulhuw      %ymm9,%ymm1,%ymm1
-  DB  197,253,111,21,194,25,0,0           ; vmovdqa       0x19c2(%rip),%ymm2        # 1c20 <_sk_xor__hsw_lowp+0xf8>
+  DB  197,253,111,21,66,32,0,0            ; vmovdqa       0x2042(%rip),%ymm2        # 22a0 <_sk_xor__hsw_lowp+0xf4>
   DB  196,98,61,0,210                     ; vpshufb       %ymm2,%ymm8,%ymm10
   DB  196,67,253,0,210,232                ; vpermq        $0xe8,%ymm10,%ymm10
   DB  196,226,101,0,210                   ; vpshufb       %ymm2,%ymm3,%ymm2
@@ -29197,7 +30248,7 @@
   DB  196,227,45,56,210,1                 ; vinserti128   $0x1,%xmm2,%ymm10,%ymm2
   DB  197,237,113,242,8                   ; vpsllw        $0x8,%ymm2,%ymm2
   DB  196,193,109,228,209                 ; vpmulhuw      %ymm9,%ymm2,%ymm2
-  DB  197,125,111,21,180,25,0,0           ; vmovdqa       0x19b4(%rip),%ymm10        # 1c40 <_sk_xor__hsw_lowp+0x118>
+  DB  197,125,111,21,52,32,0,0            ; vmovdqa       0x2034(%rip),%ymm10        # 22c0 <_sk_xor__hsw_lowp+0x114>
   DB  196,66,61,0,194                     ; vpshufb       %ymm10,%ymm8,%ymm8
   DB  196,67,253,0,192,232                ; vpermq        $0xe8,%ymm8,%ymm8
   DB  196,194,101,0,218                   ; vpshufb       %ymm10,%ymm3,%ymm3
@@ -29311,16 +30362,16 @@
   DB  15,133,210,0,0,0                    ; jne           518 <_sk_load_8888_dst_hsw_lowp+0xe0>
   DB  196,193,126,111,124,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%ymm7
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
-  DB  197,253,111,37,5,24,0,0             ; vmovdqa       0x1805(%rip),%ymm4        # 1c60 <_sk_xor__hsw_lowp+0x138>
+  DB  197,253,111,37,133,30,0,0           ; vmovdqa       0x1e85(%rip),%ymm4        # 22e0 <_sk_xor__hsw_lowp+0x134>
   DB  196,226,61,0,236                    ; vpshufb       %ymm4,%ymm8,%ymm5
   DB  196,227,253,0,237,232               ; vpermq        $0xe8,%ymm5,%ymm5
   DB  196,226,69,0,228                    ; vpshufb       %ymm4,%ymm7,%ymm4
   DB  196,227,253,0,228,232               ; vpermq        $0xe8,%ymm4,%ymm4
   DB  196,227,85,56,228,1                 ; vinserti128   $0x1,%xmm4,%ymm5,%ymm4
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
-  DB  196,98,125,121,13,251,23,0,0        ; vpbroadcastw  0x17fb(%rip),%ymm9        # 1c80 <_sk_xor__hsw_lowp+0x158>
+  DB  196,98,125,121,13,123,30,0,0        ; vpbroadcastw  0x1e7b(%rip),%ymm9        # 2300 <_sk_xor__hsw_lowp+0x154>
   DB  196,193,93,228,225                  ; vpmulhuw      %ymm9,%ymm4,%ymm4
-  DB  197,253,111,45,14,24,0,0            ; vmovdqa       0x180e(%rip),%ymm5        # 1ca0 <_sk_xor__hsw_lowp+0x178>
+  DB  197,253,111,45,142,30,0,0           ; vmovdqa       0x1e8e(%rip),%ymm5        # 2320 <_sk_xor__hsw_lowp+0x174>
   DB  196,226,61,0,245                    ; vpshufb       %ymm5,%ymm8,%ymm6
   DB  196,227,253,0,246,232               ; vpermq        $0xe8,%ymm6,%ymm6
   DB  196,226,69,0,237                    ; vpshufb       %ymm5,%ymm7,%ymm5
@@ -29328,7 +30379,7 @@
   DB  196,227,77,56,237,1                 ; vinserti128   $0x1,%xmm5,%ymm6,%ymm5
   DB  197,213,113,245,8                   ; vpsllw        $0x8,%ymm5,%ymm5
   DB  196,193,85,228,233                  ; vpmulhuw      %ymm9,%ymm5,%ymm5
-  DB  197,253,111,53,0,24,0,0             ; vmovdqa       0x1800(%rip),%ymm6        # 1cc0 <_sk_xor__hsw_lowp+0x198>
+  DB  197,253,111,53,128,30,0,0           ; vmovdqa       0x1e80(%rip),%ymm6        # 2340 <_sk_xor__hsw_lowp+0x194>
   DB  196,98,61,0,214                     ; vpshufb       %ymm6,%ymm8,%ymm10
   DB  196,67,253,0,210,232                ; vpermq        $0xe8,%ymm10,%ymm10
   DB  196,226,69,0,246                    ; vpshufb       %ymm6,%ymm7,%ymm6
@@ -29336,7 +30387,7 @@
   DB  196,227,45,56,246,1                 ; vinserti128   $0x1,%xmm6,%ymm10,%ymm6
   DB  197,205,113,246,8                   ; vpsllw        $0x8,%ymm6,%ymm6
   DB  196,193,77,228,241                  ; vpmulhuw      %ymm9,%ymm6,%ymm6
-  DB  197,125,111,21,242,23,0,0           ; vmovdqa       0x17f2(%rip),%ymm10        # 1ce0 <_sk_xor__hsw_lowp+0x1b8>
+  DB  197,125,111,21,114,30,0,0           ; vmovdqa       0x1e72(%rip),%ymm10        # 2360 <_sk_xor__hsw_lowp+0x1b4>
   DB  196,66,61,0,194                     ; vpshufb       %ymm10,%ymm8,%ymm8
   DB  196,67,253,0,192,232                ; vpermq        $0xe8,%ymm8,%ymm8
   DB  196,194,69,0,250                    ; vpshufb       %ymm10,%ymm7,%ymm7
@@ -29449,7 +30500,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  197,189,113,208,7                   ; vpsrlw        $0x7,%ymm0,%ymm8
-  DB  196,98,125,121,13,85,22,0,0         ; vpbroadcastw  0x1655(%rip),%ymm9        # 1d00 <_sk_xor__hsw_lowp+0x1d8>
+  DB  196,98,125,121,13,213,28,0,0        ; vpbroadcastw  0x1cd5(%rip),%ymm9        # 2380 <_sk_xor__hsw_lowp+0x1d4>
   DB  196,65,61,234,193                   ; vpminsw       %ymm9,%ymm8,%ymm8
   DB  196,66,125,51,208                   ; vpmovzxwd     %xmm8,%ymm10
   DB  196,67,125,57,192,1                 ; vextracti128  $0x1,%ymm8,%xmm8
@@ -29559,16 +30610,413 @@
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
 
+PUBLIC _sk_load_bgra_hsw_lowp
+_sk_load_bgra_hsw_lowp LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,139,24                           ; mov           (%rax),%r11
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  15,133,210,0,0,0                    ; jne           94c <_sk_load_bgra_hsw_lowp+0xe0>
+  DB  196,193,126,111,92,147,32           ; vmovdqu       0x20(%r11,%rdx,4),%ymm3
+  DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
+  DB  197,253,111,5,17,27,0,0             ; vmovdqa       0x1b11(%rip),%ymm0        # 23a0 <_sk_xor__hsw_lowp+0x1f4>
+  DB  196,226,61,0,200                    ; vpshufb       %ymm0,%ymm8,%ymm1
+  DB  196,227,253,0,201,232               ; vpermq        $0xe8,%ymm1,%ymm1
+  DB  196,226,101,0,192                   ; vpshufb       %ymm0,%ymm3,%ymm0
+  DB  196,227,253,0,192,232               ; vpermq        $0xe8,%ymm0,%ymm0
+  DB  196,227,117,56,192,1                ; vinserti128   $0x1,%xmm0,%ymm1,%ymm0
+  DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
+  DB  196,98,125,121,13,7,27,0,0          ; vpbroadcastw  0x1b07(%rip),%ymm9        # 23c0 <_sk_xor__hsw_lowp+0x214>
+  DB  196,193,125,228,209                 ; vpmulhuw      %ymm9,%ymm0,%ymm2
+  DB  197,253,111,5,26,27,0,0             ; vmovdqa       0x1b1a(%rip),%ymm0        # 23e0 <_sk_xor__hsw_lowp+0x234>
+  DB  196,226,61,0,200                    ; vpshufb       %ymm0,%ymm8,%ymm1
+  DB  196,227,253,0,201,232               ; vpermq        $0xe8,%ymm1,%ymm1
+  DB  196,226,101,0,192                   ; vpshufb       %ymm0,%ymm3,%ymm0
+  DB  196,227,253,0,192,232               ; vpermq        $0xe8,%ymm0,%ymm0
+  DB  196,227,117,56,192,1                ; vinserti128   $0x1,%xmm0,%ymm1,%ymm0
+  DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
+  DB  196,193,125,228,201                 ; vpmulhuw      %ymm9,%ymm0,%ymm1
+  DB  197,253,111,5,12,27,0,0             ; vmovdqa       0x1b0c(%rip),%ymm0        # 2400 <_sk_xor__hsw_lowp+0x254>
+  DB  196,98,61,0,208                     ; vpshufb       %ymm0,%ymm8,%ymm10
+  DB  196,67,253,0,210,232                ; vpermq        $0xe8,%ymm10,%ymm10
+  DB  196,226,101,0,192                   ; vpshufb       %ymm0,%ymm3,%ymm0
+  DB  196,227,253,0,192,232               ; vpermq        $0xe8,%ymm0,%ymm0
+  DB  196,227,45,56,192,1                 ; vinserti128   $0x1,%xmm0,%ymm10,%ymm0
+  DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
+  DB  196,193,125,228,193                 ; vpmulhuw      %ymm9,%ymm0,%ymm0
+  DB  197,125,111,21,254,26,0,0           ; vmovdqa       0x1afe(%rip),%ymm10        # 2420 <_sk_xor__hsw_lowp+0x274>
+  DB  196,66,61,0,194                     ; vpshufb       %ymm10,%ymm8,%ymm8
+  DB  196,67,253,0,192,232                ; vpermq        $0xe8,%ymm8,%ymm8
+  DB  196,194,101,0,218                   ; vpshufb       %ymm10,%ymm3,%ymm3
+  DB  196,227,253,0,219,232               ; vpermq        $0xe8,%ymm3,%ymm3
+  DB  196,227,61,56,219,1                 ; vinserti128   $0x1,%xmm3,%ymm8,%ymm3
+  DB  197,229,113,243,8                   ; vpsllw        $0x8,%ymm3,%ymm3
+  DB  196,193,101,228,217                 ; vpmulhuw      %ymm9,%ymm3,%ymm3
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,15                       ; and           $0xf,%r9b
+  DB  197,229,239,219                     ; vpxor         %ymm3,%ymm3,%ymm3
+  DB  196,65,61,239,192                   ; vpxor         %ymm8,%ymm8,%ymm8
+  DB  65,254,201                          ; dec           %r9b
+  DB  65,128,249,14                       ; cmp           $0xe,%r9b
+  DB  15,135,30,255,255,255               ; ja            887 <_sk_load_bgra_hsw_lowp+0x1b>
+  DB  69,15,182,201                       ; movzbl        %r9b,%r9d
+  DB  76,141,21,28,1,0,0                  ; lea           0x11c(%rip),%r10        # a90 <_sk_load_bgra_hsw_lowp+0x224>
+  DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
+  DB  76,1,208                            ; add           %r10,%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  196,65,121,110,4,147                ; vmovd         (%r11,%rdx,4),%xmm8
+  DB  233,255,254,255,255                 ; jmpq          887 <_sk_load_bgra_hsw_lowp+0x1b>
+  DB  196,193,121,110,68,147,8            ; vmovd         0x8(%r11,%rdx,4),%xmm0
+  DB  196,226,121,89,192                  ; vpbroadcastq  %xmm0,%xmm0
+  DB  197,229,239,219                     ; vpxor         %ymm3,%ymm3,%ymm3
+  DB  196,99,101,2,192,4                  ; vpblendd      $0x4,%ymm0,%ymm3,%ymm8
+  DB  196,194,121,53,4,147                ; vpmovzxdq     (%r11,%rdx,4),%xmm0
+  DB  197,249,112,192,232                 ; vpshufd       $0xe8,%xmm0,%xmm0
+  DB  196,99,61,2,192,3                   ; vpblendd      $0x3,%ymm0,%ymm8,%ymm8
+  DB  233,211,254,255,255                 ; jmpq          887 <_sk_load_bgra_hsw_lowp+0x1b>
+  DB  196,193,121,110,68,147,24           ; vmovd         0x18(%r11,%rdx,4),%xmm0
+  DB  196,226,125,89,192                  ; vpbroadcastq  %xmm0,%ymm0
+  DB  197,229,239,219                     ; vpxor         %ymm3,%ymm3,%ymm3
+  DB  196,99,101,2,192,64                 ; vpblendd      $0x40,%ymm0,%ymm3,%ymm8
+  DB  196,99,125,57,192,1                 ; vextracti128  $0x1,%ymm8,%xmm0
+  DB  196,195,121,34,68,147,20,1          ; vpinsrd       $0x1,0x14(%r11,%rdx,4),%xmm0,%xmm0
+  DB  196,99,61,56,192,1                  ; vinserti128   $0x1,%xmm0,%ymm8,%ymm8
+  DB  196,99,125,57,192,1                 ; vextracti128  $0x1,%ymm8,%xmm0
+  DB  196,195,121,34,68,147,16,0          ; vpinsrd       $0x0,0x10(%r11,%rdx,4),%xmm0,%xmm0
+  DB  196,99,61,56,192,1                  ; vinserti128   $0x1,%xmm0,%ymm8,%ymm8
+  DB  196,193,122,111,4,147               ; vmovdqu       (%r11,%rdx,4),%xmm0
+  DB  196,67,125,2,192,240                ; vpblendd      $0xf0,%ymm8,%ymm0,%ymm8
+  DB  233,132,254,255,255                 ; jmpq          887 <_sk_load_bgra_hsw_lowp+0x1b>
+  DB  196,193,121,110,68,147,40           ; vmovd         0x28(%r11,%rdx,4),%xmm0
+  DB  196,226,121,89,192                  ; vpbroadcastq  %xmm0,%xmm0
+  DB  197,245,239,201                     ; vpxor         %ymm1,%ymm1,%ymm1
+  DB  196,227,117,2,216,4                 ; vpblendd      $0x4,%ymm0,%ymm1,%ymm3
+  DB  196,195,97,34,68,147,36,1           ; vpinsrd       $0x1,0x24(%r11,%rdx,4),%xmm3,%xmm0
+  DB  196,227,101,2,216,15                ; vpblendd      $0xf,%ymm0,%ymm3,%ymm3
+  DB  196,193,121,110,68,147,32           ; vmovd         0x20(%r11,%rdx,4),%xmm0
+  DB  196,227,101,2,216,1                 ; vpblendd      $0x1,%ymm0,%ymm3,%ymm3
+  DB  233,72,254,255,255                  ; jmpq          881 <_sk_load_bgra_hsw_lowp+0x15>
+  DB  196,193,121,110,68,147,56           ; vmovd         0x38(%r11,%rdx,4),%xmm0
+  DB  196,226,125,89,192                  ; vpbroadcastq  %xmm0,%ymm0
+  DB  197,245,239,201                     ; vpxor         %ymm1,%ymm1,%ymm1
+  DB  196,227,117,2,216,64                ; vpblendd      $0x40,%ymm0,%ymm1,%ymm3
+  DB  196,227,125,57,216,1                ; vextracti128  $0x1,%ymm3,%xmm0
+  DB  196,195,121,34,68,147,52,1          ; vpinsrd       $0x1,0x34(%r11,%rdx,4),%xmm0,%xmm0
+  DB  196,227,101,56,216,1                ; vinserti128   $0x1,%xmm0,%ymm3,%ymm3
+  DB  196,227,125,57,216,1                ; vextracti128  $0x1,%ymm3,%xmm0
+  DB  196,195,121,34,68,147,48,0          ; vpinsrd       $0x0,0x30(%r11,%rdx,4),%xmm0,%xmm0
+  DB  196,227,101,56,216,1                ; vinserti128   $0x1,%xmm0,%ymm3,%ymm3
+  DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
+  DB  196,193,122,111,68,147,32           ; vmovdqu       0x20(%r11,%rdx,4),%xmm0
+  DB  196,227,125,2,219,240               ; vpblendd      $0xf0,%ymm3,%ymm0,%ymm3
+  DB  233,248,253,255,255                 ; jmpq          887 <_sk_load_bgra_hsw_lowp+0x1b>
+  DB  144                                 ; nop
+  DB  237                                 ; in            (%dx),%eax
+  DB  254                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,14                              ; decl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  248                                 ; clc
+  DB  254                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,98,255                          ; jmpq          *-0x1(%rdx)
+  DB  255                                 ; (bad)
+  DB  255,78,255                          ; decl          -0x1(%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  58,255                              ; cmp           %bh,%bh
+  DB  255                                 ; (bad)
+  DB  255,36,255                          ; jmpq          *(%rdi,%rdi,8)
+  DB  255                                 ; (bad)
+  DB  255,241                             ; push          %rcx
+  DB  253                                 ; std
+  DB  255                                 ; (bad)
+  DB  255,151,255,255,255,137             ; callq         *-0x76000001(%rdi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,115,255                         ; pushq         -0x1(%rbx)
+  DB  255                                 ; (bad)
+  DB  255,231                             ; jmpq          *%rdi
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,211                             ; callq         *%rbx
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  191,255,255,255,169                 ; mov           $0xa9ffffff,%edi
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; .byte         0xff
+
+PUBLIC _sk_load_bgra_dst_hsw_lowp
+_sk_load_bgra_dst_hsw_lowp LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,139,24                           ; mov           (%rax),%r11
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  15,133,210,0,0,0                    ; jne           bac <_sk_load_bgra_dst_hsw_lowp+0xe0>
+  DB  196,193,126,111,124,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%ymm7
+  DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
+  DB  197,253,111,37,81,25,0,0            ; vmovdqa       0x1951(%rip),%ymm4        # 2440 <_sk_xor__hsw_lowp+0x294>
+  DB  196,226,61,0,236                    ; vpshufb       %ymm4,%ymm8,%ymm5
+  DB  196,227,253,0,237,232               ; vpermq        $0xe8,%ymm5,%ymm5
+  DB  196,226,69,0,228                    ; vpshufb       %ymm4,%ymm7,%ymm4
+  DB  196,227,253,0,228,232               ; vpermq        $0xe8,%ymm4,%ymm4
+  DB  196,227,85,56,228,1                 ; vinserti128   $0x1,%xmm4,%ymm5,%ymm4
+  DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
+  DB  196,98,125,121,13,71,25,0,0         ; vpbroadcastw  0x1947(%rip),%ymm9        # 2460 <_sk_xor__hsw_lowp+0x2b4>
+  DB  196,193,93,228,241                  ; vpmulhuw      %ymm9,%ymm4,%ymm6
+  DB  197,253,111,37,90,25,0,0            ; vmovdqa       0x195a(%rip),%ymm4        # 2480 <_sk_xor__hsw_lowp+0x2d4>
+  DB  196,226,61,0,236                    ; vpshufb       %ymm4,%ymm8,%ymm5
+  DB  196,227,253,0,237,232               ; vpermq        $0xe8,%ymm5,%ymm5
+  DB  196,226,69,0,228                    ; vpshufb       %ymm4,%ymm7,%ymm4
+  DB  196,227,253,0,228,232               ; vpermq        $0xe8,%ymm4,%ymm4
+  DB  196,227,85,56,228,1                 ; vinserti128   $0x1,%xmm4,%ymm5,%ymm4
+  DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
+  DB  196,193,93,228,233                  ; vpmulhuw      %ymm9,%ymm4,%ymm5
+  DB  197,253,111,37,76,25,0,0            ; vmovdqa       0x194c(%rip),%ymm4        # 24a0 <_sk_xor__hsw_lowp+0x2f4>
+  DB  196,98,61,0,212                     ; vpshufb       %ymm4,%ymm8,%ymm10
+  DB  196,67,253,0,210,232                ; vpermq        $0xe8,%ymm10,%ymm10
+  DB  196,226,69,0,228                    ; vpshufb       %ymm4,%ymm7,%ymm4
+  DB  196,227,253,0,228,232               ; vpermq        $0xe8,%ymm4,%ymm4
+  DB  196,227,45,56,228,1                 ; vinserti128   $0x1,%xmm4,%ymm10,%ymm4
+  DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
+  DB  196,193,93,228,225                  ; vpmulhuw      %ymm9,%ymm4,%ymm4
+  DB  197,125,111,21,62,25,0,0            ; vmovdqa       0x193e(%rip),%ymm10        # 24c0 <_sk_xor__hsw_lowp+0x314>
+  DB  196,66,61,0,194                     ; vpshufb       %ymm10,%ymm8,%ymm8
+  DB  196,67,253,0,192,232                ; vpermq        $0xe8,%ymm8,%ymm8
+  DB  196,194,69,0,250                    ; vpshufb       %ymm10,%ymm7,%ymm7
+  DB  196,227,253,0,255,232               ; vpermq        $0xe8,%ymm7,%ymm7
+  DB  196,227,61,56,255,1                 ; vinserti128   $0x1,%xmm7,%ymm8,%ymm7
+  DB  197,197,113,247,8                   ; vpsllw        $0x8,%ymm7,%ymm7
+  DB  196,193,69,228,249                  ; vpmulhuw      %ymm9,%ymm7,%ymm7
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,15                       ; and           $0xf,%r9b
+  DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
+  DB  196,65,61,239,192                   ; vpxor         %ymm8,%ymm8,%ymm8
+  DB  65,254,201                          ; dec           %r9b
+  DB  65,128,249,14                       ; cmp           $0xe,%r9b
+  DB  15,135,30,255,255,255               ; ja            ae7 <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  DB  69,15,182,201                       ; movzbl        %r9b,%r9d
+  DB  76,141,21,28,1,0,0                  ; lea           0x11c(%rip),%r10        # cf0 <_sk_load_bgra_dst_hsw_lowp+0x224>
+  DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
+  DB  76,1,208                            ; add           %r10,%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  196,65,121,110,4,147                ; vmovd         (%r11,%rdx,4),%xmm8
+  DB  233,255,254,255,255                 ; jmpq          ae7 <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  DB  196,193,121,110,100,147,8           ; vmovd         0x8(%r11,%rdx,4),%xmm4
+  DB  196,226,121,89,228                  ; vpbroadcastq  %xmm4,%xmm4
+  DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
+  DB  196,99,69,2,196,4                   ; vpblendd      $0x4,%ymm4,%ymm7,%ymm8
+  DB  196,194,121,53,36,147               ; vpmovzxdq     (%r11,%rdx,4),%xmm4
+  DB  197,249,112,228,232                 ; vpshufd       $0xe8,%xmm4,%xmm4
+  DB  196,99,61,2,196,3                   ; vpblendd      $0x3,%ymm4,%ymm8,%ymm8
+  DB  233,211,254,255,255                 ; jmpq          ae7 <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  DB  196,193,121,110,100,147,24          ; vmovd         0x18(%r11,%rdx,4),%xmm4
+  DB  196,226,125,89,228                  ; vpbroadcastq  %xmm4,%ymm4
+  DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
+  DB  196,99,69,2,196,64                  ; vpblendd      $0x40,%ymm4,%ymm7,%ymm8
+  DB  196,99,125,57,196,1                 ; vextracti128  $0x1,%ymm8,%xmm4
+  DB  196,195,89,34,100,147,20,1          ; vpinsrd       $0x1,0x14(%r11,%rdx,4),%xmm4,%xmm4
+  DB  196,99,61,56,196,1                  ; vinserti128   $0x1,%xmm4,%ymm8,%ymm8
+  DB  196,99,125,57,196,1                 ; vextracti128  $0x1,%ymm8,%xmm4
+  DB  196,195,89,34,100,147,16,0          ; vpinsrd       $0x0,0x10(%r11,%rdx,4),%xmm4,%xmm4
+  DB  196,99,61,56,196,1                  ; vinserti128   $0x1,%xmm4,%ymm8,%ymm8
+  DB  196,193,122,111,36,147              ; vmovdqu       (%r11,%rdx,4),%xmm4
+  DB  196,67,93,2,192,240                 ; vpblendd      $0xf0,%ymm8,%ymm4,%ymm8
+  DB  233,132,254,255,255                 ; jmpq          ae7 <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  DB  196,193,121,110,100,147,40          ; vmovd         0x28(%r11,%rdx,4),%xmm4
+  DB  196,226,121,89,228                  ; vpbroadcastq  %xmm4,%xmm4
+  DB  197,213,239,237                     ; vpxor         %ymm5,%ymm5,%ymm5
+  DB  196,227,85,2,252,4                  ; vpblendd      $0x4,%ymm4,%ymm5,%ymm7
+  DB  196,195,65,34,100,147,36,1          ; vpinsrd       $0x1,0x24(%r11,%rdx,4),%xmm7,%xmm4
+  DB  196,227,69,2,252,15                 ; vpblendd      $0xf,%ymm4,%ymm7,%ymm7
+  DB  196,193,121,110,100,147,32          ; vmovd         0x20(%r11,%rdx,4),%xmm4
+  DB  196,227,69,2,252,1                  ; vpblendd      $0x1,%ymm4,%ymm7,%ymm7
+  DB  233,72,254,255,255                  ; jmpq          ae1 <_sk_load_bgra_dst_hsw_lowp+0x15>
+  DB  196,193,121,110,100,147,56          ; vmovd         0x38(%r11,%rdx,4),%xmm4
+  DB  196,226,125,89,228                  ; vpbroadcastq  %xmm4,%ymm4
+  DB  197,213,239,237                     ; vpxor         %ymm5,%ymm5,%ymm5
+  DB  196,227,85,2,252,64                 ; vpblendd      $0x40,%ymm4,%ymm5,%ymm7
+  DB  196,227,125,57,252,1                ; vextracti128  $0x1,%ymm7,%xmm4
+  DB  196,195,89,34,100,147,52,1          ; vpinsrd       $0x1,0x34(%r11,%rdx,4),%xmm4,%xmm4
+  DB  196,227,69,56,252,1                 ; vinserti128   $0x1,%xmm4,%ymm7,%ymm7
+  DB  196,227,125,57,252,1                ; vextracti128  $0x1,%ymm7,%xmm4
+  DB  196,195,89,34,100,147,48,0          ; vpinsrd       $0x0,0x30(%r11,%rdx,4),%xmm4,%xmm4
+  DB  196,227,69,56,252,1                 ; vinserti128   $0x1,%xmm4,%ymm7,%ymm7
+  DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
+  DB  196,193,122,111,100,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%xmm4
+  DB  196,227,93,2,255,240                ; vpblendd      $0xf0,%ymm7,%ymm4,%ymm7
+  DB  233,248,253,255,255                 ; jmpq          ae7 <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  DB  144                                 ; nop
+  DB  237                                 ; in            (%dx),%eax
+  DB  254                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,14                              ; decl          (%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  248                                 ; clc
+  DB  254                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,98,255                          ; jmpq          *-0x1(%rdx)
+  DB  255                                 ; (bad)
+  DB  255,78,255                          ; decl          -0x1(%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  58,255                              ; cmp           %bh,%bh
+  DB  255                                 ; (bad)
+  DB  255,36,255                          ; jmpq          *(%rdi,%rdi,8)
+  DB  255                                 ; (bad)
+  DB  255,241                             ; push          %rcx
+  DB  253                                 ; std
+  DB  255                                 ; (bad)
+  DB  255,151,255,255,255,137             ; callq         *-0x76000001(%rdi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,115,255                         ; pushq         -0x1(%rbx)
+  DB  255                                 ; (bad)
+  DB  255,231                             ; jmpq          *%rdi
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,211                             ; callq         *%rbx
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  191,255,255,255,169                 ; mov           $0xa9ffffff,%edi
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; .byte         0xff
+
+PUBLIC _sk_store_bgra_hsw_lowp
+_sk_store_bgra_hsw_lowp LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,139,24                           ; mov           (%rax),%r11
+  DB  197,189,113,210,7                   ; vpsrlw        $0x7,%ymm2,%ymm8
+  DB  196,98,125,121,13,161,23,0,0        ; vpbroadcastw  0x17a1(%rip),%ymm9        # 24e0 <_sk_xor__hsw_lowp+0x334>
+  DB  196,65,61,234,193                   ; vpminsw       %ymm9,%ymm8,%ymm8
+  DB  196,66,125,51,208                   ; vpmovzxwd     %xmm8,%ymm10
+  DB  196,67,125,57,192,1                 ; vextracti128  $0x1,%ymm8,%xmm8
+  DB  196,66,125,51,192                   ; vpmovzxwd     %xmm8,%ymm8
+  DB  197,165,113,209,7                   ; vpsrlw        $0x7,%ymm1,%ymm11
+  DB  196,65,37,234,217                   ; vpminsw       %ymm9,%ymm11,%ymm11
+  DB  196,66,125,51,227                   ; vpmovzxwd     %xmm11,%ymm12
+  DB  196,67,125,57,219,1                 ; vextracti128  $0x1,%ymm11,%xmm11
+  DB  196,66,125,51,219                   ; vpmovzxwd     %xmm11,%ymm11
+  DB  196,193,37,114,243,8                ; vpslld        $0x8,%ymm11,%ymm11
+  DB  196,193,29,114,244,8                ; vpslld        $0x8,%ymm12,%ymm12
+  DB  197,149,113,208,7                   ; vpsrlw        $0x7,%ymm0,%ymm13
+  DB  196,65,21,234,233                   ; vpminsw       %ymm9,%ymm13,%ymm13
+  DB  196,67,125,57,238,1                 ; vextracti128  $0x1,%ymm13,%xmm14
+  DB  196,66,125,51,246                   ; vpmovzxwd     %xmm14,%ymm14
+  DB  196,66,125,51,237                   ; vpmovzxwd     %xmm13,%ymm13
+  DB  196,193,21,114,245,16               ; vpslld        $0x10,%ymm13,%ymm13
+  DB  196,193,13,114,246,16               ; vpslld        $0x10,%ymm14,%ymm14
+  DB  197,133,113,211,7                   ; vpsrlw        $0x7,%ymm3,%ymm15
+  DB  196,65,5,234,201                    ; vpminsw       %ymm9,%ymm15,%ymm9
+  DB  196,67,125,57,207,1                 ; vextracti128  $0x1,%ymm9,%xmm15
+  DB  196,66,125,51,255                   ; vpmovzxwd     %xmm15,%ymm15
+  DB  196,66,125,51,201                   ; vpmovzxwd     %xmm9,%ymm9
+  DB  196,193,53,114,241,24               ; vpslld        $0x18,%ymm9,%ymm9
+  DB  196,193,5,114,247,24                ; vpslld        $0x18,%ymm15,%ymm15
+  DB  196,65,61,235,198                   ; vpor          %ymm14,%ymm8,%ymm8
+  DB  196,65,45,235,237                   ; vpor          %ymm13,%ymm10,%ymm13
+  DB  196,65,37,235,215                   ; vpor          %ymm15,%ymm11,%ymm10
+  DB  196,65,61,235,210                   ; vpor          %ymm10,%ymm8,%ymm10
+  DB  196,65,29,235,193                   ; vpor          %ymm9,%ymm12,%ymm8
+  DB  196,65,21,235,192                   ; vpor          %ymm8,%ymm13,%ymm8
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,17                              ; jne           dfa <_sk_store_bgra_hsw_lowp+0xce>
+  DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
+  DB  196,65,126,127,84,147,32            ; vmovdqu       %ymm10,0x20(%r11,%rdx,4)
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,15                       ; and           $0xf,%r9b
+  DB  65,254,201                          ; dec           %r9b
+  DB  65,128,249,14                       ; cmp           $0xe,%r9b
+  DB  119,236                             ; ja            df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  69,15,182,201                       ; movzbl        %r9b,%r9d
+  DB  76,141,21,175,0,0,0                 ; lea           0xaf(%rip),%r10        # ec4 <_sk_store_bgra_hsw_lowp+0x198>
+  DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
+  DB  76,1,208                            ; add           %r10,%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  196,65,121,126,4,147                ; vmovd         %xmm8,(%r11,%rdx,4)
+  DB  235,208                             ; jmp           df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  196,67,121,22,68,147,8,2            ; vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,4)
+  DB  196,65,121,214,4,147                ; vmovq         %xmm8,(%r11,%rdx,4)
+  DB  235,192                             ; jmp           df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
+  DB  196,67,121,22,76,147,24,2           ; vpextrd       $0x2,%xmm9,0x18(%r11,%rdx,4)
+  DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
+  DB  196,67,121,22,76,147,20,1           ; vpextrd       $0x1,%xmm9,0x14(%r11,%rdx,4)
+  DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
+  DB  196,65,121,126,76,147,16            ; vmovd         %xmm9,0x10(%r11,%rdx,4)
+  DB  196,65,122,127,4,147                ; vmovdqu       %xmm8,(%r11,%rdx,4)
+  DB  235,143                             ; jmp           df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  196,67,121,22,84,147,40,2           ; vpextrd       $0x2,%xmm10,0x28(%r11,%rdx,4)
+  DB  196,67,121,22,84,147,36,1           ; vpextrd       $0x1,%xmm10,0x24(%r11,%rdx,4)
+  DB  196,65,121,126,84,147,32            ; vmovd         %xmm10,0x20(%r11,%rdx,4)
+  DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
+  DB  233,109,255,255,255                 ; jmpq          df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  196,67,125,57,209,1                 ; vextracti128  $0x1,%ymm10,%xmm9
+  DB  196,67,121,22,76,147,56,2           ; vpextrd       $0x2,%xmm9,0x38(%r11,%rdx,4)
+  DB  196,67,125,57,209,1                 ; vextracti128  $0x1,%ymm10,%xmm9
+  DB  196,67,121,22,76,147,52,1           ; vpextrd       $0x1,%xmm9,0x34(%r11,%rdx,4)
+  DB  196,67,125,57,209,1                 ; vextracti128  $0x1,%ymm10,%xmm9
+  DB  196,65,121,126,76,147,48            ; vmovd         %xmm9,0x30(%r11,%rdx,4)
+  DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
+  DB  196,65,122,127,84,147,32            ; vmovdqu       %xmm10,0x20(%r11,%rdx,4)
+  DB  233,50,255,255,255                  ; jmpq          df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  90                                  ; pop           %rdx
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,106,255                         ; ljmp          *-0x1(%rdx)
+  DB  255                                 ; (bad)
+  DB  255,98,255                          ; jmpq          *-0x1(%rdx)
+  DB  255                                 ; (bad)
+  DB  255,155,255,255,255,142             ; lcall         *-0x71000001(%rbx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,128,255,255,255,114             ; incl          0x72ffffff(%rax)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  186,255,255,255,179                 ; mov           $0xb3ffffff,%edx
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,171,255,255,255,163             ; ljmp          *-0x5c000001(%rbx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  238                                 ; out           %al,(%dx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,225                             ; jmpq          *%rcx
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,211                             ; callq         *%rbx
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,197                             ; inc           %ebp
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; .byte         0xff
+
 PUBLIC _sk_load_a8_hsw_lowp
 _sk_load_a8_hsw_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,45                              ; jne           8a3 <_sk_load_a8_hsw_lowp+0x37>
+  DB  117,45                              ; jne           f37 <_sk_load_a8_hsw_lowp+0x37>
   DB  196,193,122,111,4,19                ; vmovdqu       (%r11,%rdx,1),%xmm0
   DB  196,226,125,48,192                  ; vpmovzxbw     %xmm0,%ymm0
   DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
-  DB  196,226,125,121,13,115,20,0,0       ; vpbroadcastw  0x1473(%rip),%ymm1        # 1d02 <_sk_xor__hsw_lowp+0x1da>
+  DB  196,226,125,121,13,191,21,0,0       ; vpbroadcastw  0x15bf(%rip),%ymm1        # 24e2 <_sk_xor__hsw_lowp+0x336>
   DB  197,253,228,217                     ; vpmulhuw      %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,253,239,192                     ; vpxor         %ymm0,%ymm0,%ymm0
@@ -29580,35 +31028,35 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,197                             ; ja            87c <_sk_load_a8_hsw_lowp+0x10>
+  DB  119,197                             ; ja            f10 <_sk_load_a8_hsw_lowp+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,194,0,0,0                 ; lea           0xc2(%rip),%r10        # 984 <_sk_load_a8_hsw_lowp+0x118>
+  DB  76,141,21,194,0,0,0                 ; lea           0xc2(%rip),%r10        # 1018 <_sk_load_a8_hsw_lowp+0x118>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,166                             ; jmp           87c <_sk_load_a8_hsw_lowp+0x10>
+  DB  235,166                             ; jmp           f10 <_sk_load_a8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,2,2            ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm0,%xmm0
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,227,121,14,193,1                ; vpblendw      $0x1,%xmm1,%xmm0,%xmm0
-  DB  235,137                             ; jmp           87c <_sk_load_a8_hsw_lowp+0x10>
+  DB  235,137                             ; jmp           f10 <_sk_load_a8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,6,6            ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,5,5            ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,4,4            ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,92,255,255,255                  ; jmpq          87c <_sk_load_a8_hsw_lowp+0x10>
+  DB  233,92,255,255,255                  ; jmpq          f10 <_sk_load_a8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,10,10          ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,9,9            ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,8,8            ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,193,122,126,12,19               ; vmovq         (%r11,%rdx,1),%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,47,255,255,255                  ; jmpq          87c <_sk_load_a8_hsw_lowp+0x10>
+  DB  233,47,255,255,255                  ; jmpq          f10 <_sk_load_a8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,14,14          ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,13,13          ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm0,%xmm0
@@ -29616,7 +31064,7 @@
   DB  196,193,122,126,12,19               ; vmovq         (%r11,%rdx,1),%xmm1
   DB  196,195,113,34,76,19,8,2            ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm1,%xmm1
   DB  196,227,113,2,192,8                 ; vpblendd      $0x8,%xmm0,%xmm1,%xmm0
-  DB  233,250,254,255,255                 ; jmpq          87c <_sk_load_a8_hsw_lowp+0x10>
+  DB  233,250,254,255,255                 ; jmpq          f10 <_sk_load_a8_hsw_lowp+0x10>
   DB  102,144                             ; xchg          %ax,%ax
   DB  71,255                              ; rex.RXB       (bad)
   DB  255                                 ; (bad)
@@ -29628,7 +31076,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  123,255                             ; jnp           999 <_sk_load_a8_hsw_lowp+0x12d>
+  DB  123,255                             ; jnp           102d <_sk_load_a8_hsw_lowp+0x12d>
   DB  255                                 ; (bad)
   DB  255,111,255                         ; ljmp          *-0x1(%rdi)
   DB  255                                 ; (bad)
@@ -29658,11 +31106,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,45                              ; jne           9f7 <_sk_load_a8_dst_hsw_lowp+0x37>
+  DB  117,45                              ; jne           108b <_sk_load_a8_dst_hsw_lowp+0x37>
   DB  196,193,122,111,36,19               ; vmovdqu       (%r11,%rdx,1),%xmm4
   DB  196,226,125,48,228                  ; vpmovzxbw     %xmm4,%ymm4
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
-  DB  196,226,125,121,45,33,19,0,0        ; vpbroadcastw  0x1321(%rip),%ymm5        # 1d04 <_sk_xor__hsw_lowp+0x1dc>
+  DB  196,226,125,121,45,109,20,0,0       ; vpbroadcastw  0x146d(%rip),%ymm5        # 24e4 <_sk_xor__hsw_lowp+0x338>
   DB  197,221,228,253                     ; vpmulhuw      %ymm5,%ymm4,%ymm7
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,221,239,228                     ; vpxor         %ymm4,%ymm4,%ymm4
@@ -29674,35 +31122,35 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,197                             ; ja            9d0 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  119,197                             ; ja            1064 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,194,0,0,0                 ; lea           0xc2(%rip),%r10        # ad8 <_sk_load_a8_dst_hsw_lowp+0x118>
+  DB  76,141,21,194,0,0,0                 ; lea           0xc2(%rip),%r10        # 116c <_sk_load_a8_dst_hsw_lowp+0x118>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,166                             ; jmp           9d0 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  235,166                             ; jmp           1064 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,2,2            ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm4,%xmm4
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,227,89,14,229,1                 ; vpblendw      $0x1,%xmm5,%xmm4,%xmm4
-  DB  235,137                             ; jmp           9d0 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  235,137                             ; jmp           1064 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,6,6            ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,5,5            ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,4,4            ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,92,255,255,255                  ; jmpq          9d0 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  233,92,255,255,255                  ; jmpq          1064 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,10,10          ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,9,9            ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,8,8            ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,193,122,126,44,19               ; vmovq         (%r11,%rdx,1),%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,47,255,255,255                  ; jmpq          9d0 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  233,47,255,255,255                  ; jmpq          1064 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,14,14          ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,13,13          ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm4,%xmm4
@@ -29710,7 +31158,7 @@
   DB  196,193,122,126,44,19               ; vmovq         (%r11,%rdx,1),%xmm5
   DB  196,195,81,34,108,19,8,2            ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm5,%xmm5
   DB  196,227,81,2,228,8                  ; vpblendd      $0x8,%xmm4,%xmm5,%xmm4
-  DB  233,250,254,255,255                 ; jmpq          9d0 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  233,250,254,255,255                 ; jmpq          1064 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  102,144                             ; xchg          %ax,%ax
   DB  71,255                              ; rex.RXB       (bad)
   DB  255                                 ; (bad)
@@ -29722,7 +31170,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  123,255                             ; jnp           aed <_sk_load_a8_dst_hsw_lowp+0x12d>
+  DB  123,255                             ; jnp           1181 <_sk_load_a8_dst_hsw_lowp+0x12d>
   DB  255                                 ; (bad)
   DB  255,111,255                         ; ljmp          *-0x1(%rdi)
   DB  255                                 ; (bad)
@@ -29755,7 +31203,7 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,65,57,103,193                   ; vpackuswb     %xmm9,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           b38 <_sk_store_a8_hsw_lowp+0x24>
+  DB  117,10                              ; jne           11cc <_sk_store_a8_hsw_lowp+0x24>
   DB  196,65,122,127,4,19                 ; vmovdqu       %xmm8,(%r11,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -29763,32 +31211,32 @@
   DB  65,128,225,15                       ; and           $0xf,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,236                             ; ja            b34 <_sk_store_a8_hsw_lowp+0x20>
+  DB  119,236                             ; ja            11c8 <_sk_store_a8_hsw_lowp+0x20>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,137,0,0,0                 ; lea           0x89(%rip),%r10        # bdc <_sk_store_a8_hsw_lowp+0xc8>
+  DB  76,141,21,137,0,0,0                 ; lea           0x89(%rip),%r10        # 1270 <_sk_store_a8_hsw_lowp+0xc8>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,20,4,19,0                ; vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,207                             ; jmp           b34 <_sk_store_a8_hsw_lowp+0x20>
+  DB  235,207                             ; jmp           11c8 <_sk_store_a8_hsw_lowp+0x20>
   DB  196,67,121,20,68,19,2,2             ; vpextrb       $0x2,%xmm8,0x2(%r11,%rdx,1)
   DB  196,67,121,21,4,19,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,190                             ; jmp           b34 <_sk_store_a8_hsw_lowp+0x20>
+  DB  235,190                             ; jmp           11c8 <_sk_store_a8_hsw_lowp+0x20>
   DB  196,67,121,20,68,19,6,6             ; vpextrb       $0x6,%xmm8,0x6(%r11,%rdx,1)
   DB  196,67,121,20,68,19,5,5             ; vpextrb       $0x5,%xmm8,0x5(%r11,%rdx,1)
   DB  196,67,121,20,68,19,4,4             ; vpextrb       $0x4,%xmm8,0x4(%r11,%rdx,1)
   DB  196,65,121,126,4,19                 ; vmovd         %xmm8,(%r11,%rdx,1)
-  DB  235,158                             ; jmp           b34 <_sk_store_a8_hsw_lowp+0x20>
+  DB  235,158                             ; jmp           11c8 <_sk_store_a8_hsw_lowp+0x20>
   DB  196,67,121,20,68,19,10,10           ; vpextrb       $0xa,%xmm8,0xa(%r11,%rdx,1)
   DB  196,67,121,20,68,19,9,9             ; vpextrb       $0x9,%xmm8,0x9(%r11,%rdx,1)
   DB  196,67,121,20,68,19,8,8             ; vpextrb       $0x8,%xmm8,0x8(%r11,%rdx,1)
-  DB  235,32                              ; jmp           bd0 <_sk_store_a8_hsw_lowp+0xbc>
+  DB  235,32                              ; jmp           1264 <_sk_store_a8_hsw_lowp+0xbc>
   DB  196,67,121,20,68,19,14,14           ; vpextrb       $0xe,%xmm8,0xe(%r11,%rdx,1)
   DB  196,67,121,20,68,19,13,13           ; vpextrb       $0xd,%xmm8,0xd(%r11,%rdx,1)
   DB  196,67,121,20,68,19,12,12           ; vpextrb       $0xc,%xmm8,0xc(%r11,%rdx,1)
   DB  196,67,121,22,68,19,8,2             ; vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,1)
   DB  196,65,121,214,4,19                 ; vmovq         %xmm8,(%r11,%rdx,1)
-  DB  233,89,255,255,255                  ; jmpq          b34 <_sk_store_a8_hsw_lowp+0x20>
+  DB  233,89,255,255,255                  ; jmpq          11c8 <_sk_store_a8_hsw_lowp+0x20>
   DB  144                                 ; nop
   DB  128,255,255                         ; cmp           $0xff,%bh
   DB  255,145,255,255,255,137             ; callq         *-0x76000001(%rcx)
@@ -29829,14 +31277,14 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,50                              ; jne           c54 <_sk_load_g8_hsw_lowp+0x3c>
+  DB  117,50                              ; jne           12e8 <_sk_load_g8_hsw_lowp+0x3c>
   DB  196,193,122,111,4,19                ; vmovdqu       (%r11,%rdx,1),%xmm0
   DB  196,226,125,48,192                  ; vpmovzxbw     %xmm0,%ymm0
   DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
-  DB  196,226,125,121,13,203,16,0,0       ; vpbroadcastw  0x10cb(%rip),%ymm1        # 1d06 <_sk_xor__hsw_lowp+0x1de>
+  DB  196,226,125,121,13,23,18,0,0        ; vpbroadcastw  0x1217(%rip),%ymm1        # 24e6 <_sk_xor__hsw_lowp+0x33a>
   DB  197,253,228,193                     ; vpmulhuw      %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,121,29,190,16,0,0       ; vpbroadcastw  0x10be(%rip),%ymm3        # 1d08 <_sk_xor__hsw_lowp+0x1e0>
+  DB  196,226,125,121,29,10,18,0,0        ; vpbroadcastw  0x120a(%rip),%ymm3        # 24e8 <_sk_xor__hsw_lowp+0x33c>
   DB  197,253,111,200                     ; vmovdqa       %ymm0,%ymm1
   DB  197,253,111,208                     ; vmovdqa       %ymm0,%ymm2
   DB  255,224                             ; jmpq          *%rax
@@ -29845,35 +31293,35 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,192                             ; ja            c28 <_sk_load_g8_hsw_lowp+0x10>
+  DB  119,192                             ; ja            12bc <_sk_load_g8_hsw_lowp+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,193,0,0,0                 ; lea           0xc1(%rip),%r10        # d34 <_sk_load_g8_hsw_lowp+0x11c>
+  DB  76,141,21,193,0,0,0                 ; lea           0xc1(%rip),%r10        # 13c8 <_sk_load_g8_hsw_lowp+0x11c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,161                             ; jmp           c28 <_sk_load_g8_hsw_lowp+0x10>
+  DB  235,161                             ; jmp           12bc <_sk_load_g8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,2,2            ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm0,%xmm0
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,227,121,14,193,1                ; vpblendw      $0x1,%xmm1,%xmm0,%xmm0
-  DB  235,132                             ; jmp           c28 <_sk_load_g8_hsw_lowp+0x10>
+  DB  235,132                             ; jmp           12bc <_sk_load_g8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,6,6            ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,5,5            ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,4,4            ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,87,255,255,255                  ; jmpq          c28 <_sk_load_g8_hsw_lowp+0x10>
+  DB  233,87,255,255,255                  ; jmpq          12bc <_sk_load_g8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,10,10          ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,9,9            ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,8,8            ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,193,122,126,12,19               ; vmovq         (%r11,%rdx,1),%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,42,255,255,255                  ; jmpq          c28 <_sk_load_g8_hsw_lowp+0x10>
+  DB  233,42,255,255,255                  ; jmpq          12bc <_sk_load_g8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,14,14          ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,13,13          ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm0,%xmm0
@@ -29881,7 +31329,7 @@
   DB  196,193,122,126,12,19               ; vmovq         (%r11,%rdx,1),%xmm1
   DB  196,195,113,34,76,19,8,2            ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm1,%xmm1
   DB  196,227,113,2,192,8                 ; vpblendd      $0x8,%xmm0,%xmm1,%xmm0
-  DB  233,245,254,255,255                 ; jmpq          c28 <_sk_load_g8_hsw_lowp+0x10>
+  DB  233,245,254,255,255                 ; jmpq          12bc <_sk_load_g8_hsw_lowp+0x10>
   DB  144                                 ; nop
   DB  72,255                              ; rex.W         (bad)
   DB  255                                 ; (bad)
@@ -29892,7 +31340,7 @@
   DB  255,140,255,255,255,132,255         ; decl          -0x7b0001(%rdi,%rdi,8)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  124,255                             ; jl            d49 <_sk_load_g8_hsw_lowp+0x131>
+  DB  124,255                             ; jl            13dd <_sk_load_g8_hsw_lowp+0x131>
   DB  255                                 ; (bad)
   DB  255,112,255                         ; pushq         -0x1(%rax)
   DB  255                                 ; (bad)
@@ -29922,14 +31370,14 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,50                              ; jne           dac <_sk_load_g8_dst_hsw_lowp+0x3c>
+  DB  117,50                              ; jne           1440 <_sk_load_g8_dst_hsw_lowp+0x3c>
   DB  196,193,122,111,36,19               ; vmovdqu       (%r11,%rdx,1),%xmm4
   DB  196,226,125,48,228                  ; vpmovzxbw     %xmm4,%ymm4
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
-  DB  196,226,125,121,45,119,15,0,0       ; vpbroadcastw  0xf77(%rip),%ymm5        # 1d0a <_sk_xor__hsw_lowp+0x1e2>
+  DB  196,226,125,121,45,195,16,0,0       ; vpbroadcastw  0x10c3(%rip),%ymm5        # 24ea <_sk_xor__hsw_lowp+0x33e>
   DB  197,221,228,229                     ; vpmulhuw      %ymm5,%ymm4,%ymm4
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,121,61,106,15,0,0       ; vpbroadcastw  0xf6a(%rip),%ymm7        # 1d0c <_sk_xor__hsw_lowp+0x1e4>
+  DB  196,226,125,121,61,182,16,0,0       ; vpbroadcastw  0x10b6(%rip),%ymm7        # 24ec <_sk_xor__hsw_lowp+0x340>
   DB  197,253,111,236                     ; vmovdqa       %ymm4,%ymm5
   DB  197,253,111,244                     ; vmovdqa       %ymm4,%ymm6
   DB  255,224                             ; jmpq          *%rax
@@ -29938,35 +31386,35 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,192                             ; ja            d80 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  119,192                             ; ja            1414 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,193,0,0,0                 ; lea           0xc1(%rip),%r10        # e8c <_sk_load_g8_dst_hsw_lowp+0x11c>
+  DB  76,141,21,193,0,0,0                 ; lea           0xc1(%rip),%r10        # 1520 <_sk_load_g8_dst_hsw_lowp+0x11c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,161                             ; jmp           d80 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  235,161                             ; jmp           1414 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,2,2            ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm4,%xmm4
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,227,89,14,229,1                 ; vpblendw      $0x1,%xmm5,%xmm4,%xmm4
-  DB  235,132                             ; jmp           d80 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  235,132                             ; jmp           1414 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,6,6            ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,5,5            ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,4,4            ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,87,255,255,255                  ; jmpq          d80 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  233,87,255,255,255                  ; jmpq          1414 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,10,10          ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,9,9            ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,8,8            ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,193,122,126,44,19               ; vmovq         (%r11,%rdx,1),%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,42,255,255,255                  ; jmpq          d80 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  233,42,255,255,255                  ; jmpq          1414 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,14,14          ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,13,13          ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm4,%xmm4
@@ -29974,7 +31422,7 @@
   DB  196,193,122,126,44,19               ; vmovq         (%r11,%rdx,1),%xmm5
   DB  196,195,81,34,108,19,8,2            ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm5,%xmm5
   DB  196,227,81,2,228,8                  ; vpblendd      $0x8,%xmm4,%xmm5,%xmm4
-  DB  233,245,254,255,255                 ; jmpq          d80 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  233,245,254,255,255                 ; jmpq          1414 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  144                                 ; nop
   DB  72,255                              ; rex.W         (bad)
   DB  255                                 ; (bad)
@@ -29985,7 +31433,7 @@
   DB  255,140,255,255,255,132,255         ; decl          -0x7b0001(%rdi,%rdi,8)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  124,255                             ; jl            ea1 <_sk_load_g8_dst_hsw_lowp+0x131>
+  DB  124,255                             ; jl            1535 <_sk_load_g8_dst_hsw_lowp+0x131>
   DB  255                                 ; (bad)
   DB  255,112,255                         ; pushq         -0x1(%rax)
   DB  255                                 ; (bad)
@@ -30015,20 +31463,20 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,220,1,0,0                    ; jne           10b2 <_sk_srcover_rgba_8888_hsw_lowp+0x1ea>
+  DB  15,133,220,1,0,0                    ; jne           1746 <_sk_srcover_rgba_8888_hsw_lowp+0x1ea>
   DB  196,193,126,111,124,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%ymm7
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
-  DB  197,253,111,37,53,14,0,0            ; vmovdqa       0xe35(%rip),%ymm4        # 1d20 <_sk_xor__hsw_lowp+0x1f8>
+  DB  197,253,111,37,129,15,0,0           ; vmovdqa       0xf81(%rip),%ymm4        # 2500 <_sk_xor__hsw_lowp+0x354>
   DB  196,226,61,0,236                    ; vpshufb       %ymm4,%ymm8,%ymm5
   DB  196,227,253,0,237,232               ; vpermq        $0xe8,%ymm5,%ymm5
   DB  196,226,69,0,228                    ; vpshufb       %ymm4,%ymm7,%ymm4
   DB  196,227,253,0,228,232               ; vpermq        $0xe8,%ymm4,%ymm4
   DB  196,227,85,56,228,1                 ; vinserti128   $0x1,%xmm4,%ymm5,%ymm4
-  DB  196,98,125,121,13,48,14,0,0         ; vpbroadcastw  0xe30(%rip),%ymm9        # 1d40 <_sk_xor__hsw_lowp+0x218>
+  DB  196,98,125,121,13,124,15,0,0        ; vpbroadcastw  0xf7c(%rip),%ymm9        # 2520 <_sk_xor__hsw_lowp+0x374>
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
-  DB  196,98,125,121,21,36,14,0,0         ; vpbroadcastw  0xe24(%rip),%ymm10        # 1d42 <_sk_xor__hsw_lowp+0x21a>
+  DB  196,98,125,121,21,112,15,0,0        ; vpbroadcastw  0xf70(%rip),%ymm10        # 2522 <_sk_xor__hsw_lowp+0x376>
   DB  196,193,93,228,226                  ; vpmulhuw      %ymm10,%ymm4,%ymm4
-  DB  197,253,111,45,53,14,0,0            ; vmovdqa       0xe35(%rip),%ymm5        # 1d60 <_sk_xor__hsw_lowp+0x238>
+  DB  197,253,111,45,129,15,0,0           ; vmovdqa       0xf81(%rip),%ymm5        # 2540 <_sk_xor__hsw_lowp+0x394>
   DB  196,226,61,0,245                    ; vpshufb       %ymm5,%ymm8,%ymm6
   DB  196,227,253,0,246,232               ; vpermq        $0xe8,%ymm6,%ymm6
   DB  196,226,69,0,237                    ; vpshufb       %ymm5,%ymm7,%ymm5
@@ -30036,7 +31484,7 @@
   DB  196,227,77,56,237,1                 ; vinserti128   $0x1,%xmm5,%ymm6,%ymm5
   DB  197,213,113,245,8                   ; vpsllw        $0x8,%ymm5,%ymm5
   DB  196,193,85,228,234                  ; vpmulhuw      %ymm10,%ymm5,%ymm5
-  DB  197,253,111,53,39,14,0,0            ; vmovdqa       0xe27(%rip),%ymm6        # 1d80 <_sk_xor__hsw_lowp+0x258>
+  DB  197,253,111,53,115,15,0,0           ; vmovdqa       0xf73(%rip),%ymm6        # 2560 <_sk_xor__hsw_lowp+0x3b4>
   DB  196,98,61,0,222                     ; vpshufb       %ymm6,%ymm8,%ymm11
   DB  196,67,253,0,219,232                ; vpermq        $0xe8,%ymm11,%ymm11
   DB  196,226,69,0,246                    ; vpshufb       %ymm6,%ymm7,%ymm6
@@ -30044,7 +31492,7 @@
   DB  196,227,37,56,246,1                 ; vinserti128   $0x1,%xmm6,%ymm11,%ymm6
   DB  197,205,113,246,8                   ; vpsllw        $0x8,%ymm6,%ymm6
   DB  196,193,77,228,242                  ; vpmulhuw      %ymm10,%ymm6,%ymm6
-  DB  197,125,111,29,25,14,0,0            ; vmovdqa       0xe19(%rip),%ymm11        # 1da0 <_sk_xor__hsw_lowp+0x278>
+  DB  197,125,111,29,101,15,0,0           ; vmovdqa       0xf65(%rip),%ymm11        # 2580 <_sk_xor__hsw_lowp+0x3d4>
   DB  196,66,61,0,195                     ; vpshufb       %ymm11,%ymm8,%ymm8
   DB  196,67,253,0,192,232                ; vpermq        $0xe8,%ymm8,%ymm8
   DB  196,194,69,0,251                    ; vpshufb       %ymm11,%ymm7,%ymm7
@@ -30052,7 +31500,7 @@
   DB  196,227,61,56,255,1                 ; vinserti128   $0x1,%xmm7,%ymm8,%ymm7
   DB  197,197,113,247,8                   ; vpsllw        $0x8,%ymm7,%ymm7
   DB  196,193,69,228,250                  ; vpmulhuw      %ymm10,%ymm7,%ymm7
-  DB  196,98,125,121,5,10,14,0,0          ; vpbroadcastw  0xe0a(%rip),%ymm8        # 1dc0 <_sk_xor__hsw_lowp+0x298>
+  DB  196,98,125,121,5,86,15,0,0          ; vpbroadcastw  0xf56(%rip),%ymm8        # 25a0 <_sk_xor__hsw_lowp+0x3f4>
   DB  197,61,249,195                      ; vpsubw        %ymm3,%ymm8,%ymm8
   DB  196,66,93,11,208                    ; vpmulhrsw     %ymm8,%ymm4,%ymm10
   DB  196,66,125,29,210                   ; vpabsw        %ymm10,%ymm10
@@ -30099,7 +31547,7 @@
   DB  196,65,13,235,193                   ; vpor          %ymm9,%ymm14,%ymm8
   DB  196,65,37,235,192                   ; vpor          %ymm8,%ymm11,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,77                              ; jne           10ee <_sk_srcover_rgba_8888_hsw_lowp+0x226>
+  DB  117,77                              ; jne           1782 <_sk_srcover_rgba_8888_hsw_lowp+0x226>
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
   DB  196,65,126,127,84,147,32            ; vmovdqu       %ymm10,0x20(%r11,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -30110,26 +31558,26 @@
   DB  196,65,61,239,192                   ; vpxor         %ymm8,%ymm8,%ymm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  15,135,20,254,255,255               ; ja            ee3 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  DB  15,135,20,254,255,255               ; ja            1577 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,238,1,0,0                 ; lea           0x1ee(%rip),%r10        # 12c8 <_sk_srcover_rgba_8888_hsw_lowp+0x400>
+  DB  76,141,21,238,1,0,0                 ; lea           0x1ee(%rip),%r10        # 195c <_sk_srcover_rgba_8888_hsw_lowp+0x400>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,110,4,147                ; vmovd         (%r11,%rdx,4),%xmm8
-  DB  233,245,253,255,255                 ; jmpq          ee3 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  DB  233,245,253,255,255                 ; jmpq          1577 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,15                       ; and           $0xf,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,176                             ; ja            10ae <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  119,176                             ; ja            1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  65,15,182,193                       ; movzbl        %r9b,%eax
-  DB  76,141,13,251,1,0,0                 ; lea           0x1fb(%rip),%r9        # 1304 <_sk_srcover_rgba_8888_hsw_lowp+0x43c>
+  DB  76,141,13,251,1,0,0                 ; lea           0x1fb(%rip),%r9        # 1998 <_sk_srcover_rgba_8888_hsw_lowp+0x43c>
   DB  73,99,4,129                         ; movslq        (%r9,%rax,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,126,4,147                ; vmovd         %xmm8,(%r11,%rdx,4)
-  DB  235,148                             ; jmp           10ae <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  235,148                             ; jmp           1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  196,193,121,110,100,147,8           ; vmovd         0x8(%r11,%rdx,4),%xmm4
   DB  196,226,121,89,228                  ; vpbroadcastq  %xmm4,%xmm4
   DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
@@ -30137,7 +31585,7 @@
   DB  196,194,121,53,36,147               ; vpmovzxdq     (%r11,%rdx,4),%xmm4
   DB  197,249,112,228,232                 ; vpshufd       $0xe8,%xmm4,%xmm4
   DB  196,99,61,2,196,3                   ; vpblendd      $0x3,%ymm4,%ymm8,%ymm8
-  DB  233,157,253,255,255                 ; jmpq          ee3 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  DB  233,157,253,255,255                 ; jmpq          1577 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   DB  196,193,121,110,100,147,24          ; vmovd         0x18(%r11,%rdx,4),%xmm4
   DB  196,226,125,89,228                  ; vpbroadcastq  %xmm4,%ymm4
   DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
@@ -30150,7 +31598,7 @@
   DB  196,99,61,56,196,1                  ; vinserti128   $0x1,%xmm4,%ymm8,%ymm8
   DB  196,193,122,111,36,147              ; vmovdqu       (%r11,%rdx,4),%xmm4
   DB  196,67,93,2,192,240                 ; vpblendd      $0xf0,%ymm8,%ymm4,%ymm8
-  DB  233,78,253,255,255                  ; jmpq          ee3 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  DB  233,78,253,255,255                  ; jmpq          1577 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   DB  196,193,121,110,100,147,40          ; vmovd         0x28(%r11,%rdx,4),%xmm4
   DB  196,226,121,89,228                  ; vpbroadcastq  %xmm4,%xmm4
   DB  197,213,239,237                     ; vpxor         %ymm5,%ymm5,%ymm5
@@ -30159,7 +31607,7 @@
   DB  196,227,69,2,252,15                 ; vpblendd      $0xf,%ymm4,%ymm7,%ymm7
   DB  196,193,121,110,100,147,32          ; vmovd         0x20(%r11,%rdx,4),%xmm4
   DB  196,227,69,2,252,1                  ; vpblendd      $0x1,%ymm4,%ymm7,%ymm7
-  DB  233,18,253,255,255                  ; jmpq          edd <_sk_srcover_rgba_8888_hsw_lowp+0x15>
+  DB  233,18,253,255,255                  ; jmpq          1571 <_sk_srcover_rgba_8888_hsw_lowp+0x15>
   DB  196,193,121,110,100,147,56          ; vmovd         0x38(%r11,%rdx,4),%xmm4
   DB  196,226,125,89,228                  ; vpbroadcastq  %xmm4,%ymm4
   DB  197,213,239,237                     ; vpxor         %ymm5,%ymm5,%ymm5
@@ -30173,10 +31621,10 @@
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
   DB  196,193,122,111,100,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%xmm4
   DB  196,227,93,2,255,240                ; vpblendd      $0xf0,%ymm7,%ymm4,%ymm7
-  DB  233,194,252,255,255                 ; jmpq          ee3 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  DB  233,194,252,255,255                 ; jmpq          1577 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   DB  196,67,121,22,68,147,8,2            ; vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,4)
   DB  196,65,121,214,4,147                ; vmovq         %xmm8,(%r11,%rdx,4)
-  DB  233,122,254,255,255                 ; jmpq          10ae <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  233,122,254,255,255                 ; jmpq          1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,67,121,22,76,147,24,2           ; vpextrd       $0x2,%xmm9,0x18(%r11,%rdx,4)
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
@@ -30184,12 +31632,12 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,65,121,126,76,147,16            ; vmovd         %xmm9,0x10(%r11,%rdx,4)
   DB  196,65,122,127,4,147                ; vmovdqu       %xmm8,(%r11,%rdx,4)
-  DB  233,70,254,255,255                  ; jmpq          10ae <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  233,70,254,255,255                  ; jmpq          1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  196,67,121,22,84,147,40,2           ; vpextrd       $0x2,%xmm10,0x28(%r11,%rdx,4)
   DB  196,67,121,22,84,147,36,1           ; vpextrd       $0x1,%xmm10,0x24(%r11,%rdx,4)
   DB  196,65,121,126,84,147,32            ; vmovd         %xmm10,0x20(%r11,%rdx,4)
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
-  DB  233,36,254,255,255                  ; jmpq          10ae <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  233,36,254,255,255                  ; jmpq          1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  196,67,125,57,209,1                 ; vextracti128  $0x1,%ymm10,%xmm9
   DB  196,67,121,22,76,147,56,2           ; vpextrd       $0x2,%xmm9,0x38(%r11,%rdx,4)
   DB  196,67,125,57,209,1                 ; vextracti128  $0x1,%ymm10,%xmm9
@@ -30198,7 +31646,7 @@
   DB  196,65,121,126,76,147,48            ; vmovd         %xmm9,0x30(%r11,%rdx,4)
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
   DB  196,65,122,127,84,147,32            ; vmovdqu       %xmm10,0x20(%r11,%rdx,4)
-  DB  233,233,253,255,255                 ; jmpq          10ae <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  233,233,253,255,255                 ; jmpq          1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  15,31,0                             ; nopl          (%rax)
   DB  27,254                              ; sbb           %esi,%edi
   DB  255                                 ; (bad)
@@ -30212,7 +31660,7 @@
   DB  255                                 ; (bad)
   DB  255,148,254,255,255,126,254         ; callq         *-0x1810001(%rsi,%rdi,8)
   DB  255                                 ; (bad)
-  DB  255,21,252,255,255,241              ; callq         *-0xe000004(%rip)        # fffffffff20012e5 <_sk_xor__hsw_lowp+0xfffffffff1fff7bd>
+  DB  255,21,252,255,255,241              ; callq         *-0xe000004(%rip)        # fffffffff2001979 <_sk_xor__hsw_lowp+0xfffffffff1fff7cd>
   DB  254                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,227                             ; jmpq          *%rbx
@@ -30223,7 +31671,7 @@
   DB  255                                 ; (bad)
   DB  255,65,255                          ; incl          -0x1(%rcx)
   DB  255                                 ; (bad)
-  DB  255,45,255,255,255,25               ; ljmp          *0x19ffffff(%rip)        # 1a0012fc <_sk_xor__hsw_lowp+0x19fff7d4>
+  DB  255,45,255,255,255,25               ; ljmp          *0x19ffffff(%rip)        # 1a001990 <_sk_xor__hsw_lowp+0x19fff7e4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,3                               ; incl          (%rbx)
@@ -30232,7 +31680,7 @@
   DB  255,14                              ; decl          (%rsi)
   DB  254                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,37,255,255,255,29               ; jmpq          *0x1dffffff(%rip)        # 1e00130c <_sk_xor__hsw_lowp+0x1dfff7e4>
+  DB  255,37,255,255,255,29               ; jmpq          *0x1dffffff(%rip)        # 1e0019a0 <_sk_xor__hsw_lowp+0x1dfff7f4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,89,255                          ; lcall         *-0x1(%rcx)
@@ -30245,7 +31693,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  123,255                             ; jnp           1321 <_sk_srcover_rgba_8888_hsw_lowp+0x459>
+  DB  123,255                             ; jnp           19b5 <_sk_srcover_rgba_8888_hsw_lowp+0x459>
   DB  255                                 ; (bad)
   DB  255,116,255,255                     ; pushq         -0x1(%rdi,%rdi,8)
   DB  255,108,255,255                     ; ljmp          *-0x1(%rdi,%rdi,8)
@@ -30261,7 +31709,7 @@
 _sk_scale_1_float_hsw_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,122,16,0                        ; vmovss        (%rax),%xmm8
-  DB  197,58,88,5,90,8,0,0                ; vaddss        0x85a(%rip),%xmm8,%xmm8        # 1ba8 <_sk_xor__hsw_lowp+0x80>
+  DB  197,58,88,5,74,8,0,0                ; vaddss        0x84a(%rip),%xmm8,%xmm8        # 222c <_sk_xor__hsw_lowp+0x80>
   DB  197,121,126,192                     ; vmovd         %xmm8,%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
   DB  196,66,125,121,192                  ; vpbroadcastw  %xmm8,%ymm8
@@ -30281,11 +31729,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,75                              ; jne           13dc <_sk_scale_u8_hsw_lowp+0x55>
+  DB  117,75                              ; jne           1a70 <_sk_scale_u8_hsw_lowp+0x55>
   DB  196,65,122,111,4,19                 ; vmovdqu       (%r11,%rdx,1),%xmm8
   DB  196,66,125,48,192                   ; vpmovzxbw     %xmm8,%ymm8
   DB  196,193,61,113,240,8                ; vpsllw        $0x8,%ymm8,%ymm8
-  DB  196,98,125,121,13,23,10,0,0         ; vpbroadcastw  0xa17(%rip),%ymm9        # 1dc2 <_sk_xor__hsw_lowp+0x29a>
+  DB  196,98,125,121,13,99,11,0,0         ; vpbroadcastw  0xb63(%rip),%ymm9        # 25a2 <_sk_xor__hsw_lowp+0x3f6>
   DB  196,65,61,228,193                   ; vpmulhuw      %ymm9,%ymm8,%ymm8
   DB  196,194,125,11,192                  ; vpmulhrsw     %ymm8,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -30302,35 +31750,35 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,166                             ; ja            1397 <_sk_scale_u8_hsw_lowp+0x10>
+  DB  119,166                             ; ja            1a2b <_sk_scale_u8_hsw_lowp+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,200,0,0,0                 ; lea           0xc8(%rip),%r10        # 14c4 <_sk_scale_u8_hsw_lowp+0x13d>
+  DB  76,141,21,200,0,0,0                 ; lea           0xc8(%rip),%r10        # 1b58 <_sk_scale_u8_hsw_lowp+0x13d>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  235,135                             ; jmp           1397 <_sk_scale_u8_hsw_lowp+0x10>
+  DB  235,135                             ; jmp           1a2b <_sk_scale_u8_hsw_lowp+0x10>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,2,2              ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm8,%xmm8
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,67,57,14,193,1                  ; vpblendw      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,102,255,255,255                 ; jmpq          1397 <_sk_scale_u8_hsw_lowp+0x10>
+  DB  233,102,255,255,255                 ; jmpq          1a2b <_sk_scale_u8_hsw_lowp+0x10>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,6,6              ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,5,5              ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,4,4              ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,67,57,2,193,1                   ; vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,56,255,255,255                  ; jmpq          1397 <_sk_scale_u8_hsw_lowp+0x10>
+  DB  233,56,255,255,255                  ; jmpq          1a2b <_sk_scale_u8_hsw_lowp+0x10>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,10,10            ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,9,9              ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,8,8              ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,65,122,126,12,19                ; vmovq         (%r11,%rdx,1),%xmm9
   DB  196,67,49,2,192,12                  ; vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  DB  233,10,255,255,255                  ; jmpq          1397 <_sk_scale_u8_hsw_lowp+0x10>
+  DB  233,10,255,255,255                  ; jmpq          1a2b <_sk_scale_u8_hsw_lowp+0x10>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,14,14            ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,13,13            ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm8,%xmm8
@@ -30338,7 +31786,7 @@
   DB  196,65,122,126,12,19                ; vmovq         (%r11,%rdx,1),%xmm9
   DB  196,67,49,34,76,19,8,2              ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm9,%xmm9
   DB  196,67,49,2,192,8                   ; vpblendd      $0x8,%xmm8,%xmm9,%xmm8
-  DB  233,212,254,255,255                 ; jmpq          1397 <_sk_scale_u8_hsw_lowp+0x10>
+  DB  233,212,254,255,255                 ; jmpq          1a2b <_sk_scale_u8_hsw_lowp+0x10>
   DB  144                                 ; nop
   DB  65,255                              ; rex.B         (bad)
   DB  255                                 ; (bad)
@@ -30349,7 +31797,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  122,255                             ; jp            14d9 <_sk_scale_u8_hsw_lowp+0x152>
+  DB  122,255                             ; jp            1b6d <_sk_scale_u8_hsw_lowp+0x152>
   DB  255                                 ; (bad)
   DB  255,109,255                         ; ljmp          *-0x1(%rbp)
   DB  255                                 ; (bad)
@@ -30378,13 +31826,13 @@
 _sk_lerp_1_float_hsw_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,122,16,0                        ; vmovss        (%rax),%xmm8
-  DB  197,58,88,5,158,6,0,0               ; vaddss        0x69e(%rip),%xmm8,%xmm8        # 1bac <_sk_xor__hsw_lowp+0x84>
+  DB  197,58,88,5,142,6,0,0               ; vaddss        0x68e(%rip),%xmm8,%xmm8        # 2230 <_sk_xor__hsw_lowp+0x84>
   DB  197,121,126,192                     ; vmovd         %xmm8,%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
   DB  196,66,125,121,192                  ; vpbroadcastw  %xmm8,%ymm8
   DB  196,194,125,11,192                  ; vpmulhrsw     %ymm8,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
-  DB  196,98,125,121,13,150,8,0,0         ; vpbroadcastw  0x896(%rip),%ymm9        # 1dc4 <_sk_xor__hsw_lowp+0x29c>
+  DB  196,98,125,121,13,226,9,0,0         ; vpbroadcastw  0x9e2(%rip),%ymm9        # 25a4 <_sk_xor__hsw_lowp+0x3f8>
   DB  196,65,53,249,200                   ; vpsubw        %ymm8,%ymm9,%ymm9
   DB  196,66,93,11,209                    ; vpmulhrsw     %ymm9,%ymm4,%ymm10
   DB  196,66,125,29,210                   ; vpabsw        %ymm10,%ymm10
@@ -30412,15 +31860,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,145,0,0,0                    ; jne           162c <_sk_lerp_u8_hsw_lowp+0x9f>
+  DB  15,133,145,0,0,0                    ; jne           1cc0 <_sk_lerp_u8_hsw_lowp+0x9f>
   DB  196,65,122,111,4,19                 ; vmovdqu       (%r11,%rdx,1),%xmm8
   DB  196,66,125,48,192                   ; vpmovzxbw     %xmm8,%ymm8
   DB  196,193,61,113,240,8                ; vpsllw        $0x8,%ymm8,%ymm8
-  DB  196,98,125,121,13,17,8,0,0          ; vpbroadcastw  0x811(%rip),%ymm9        # 1dc6 <_sk_xor__hsw_lowp+0x29e>
+  DB  196,98,125,121,13,93,9,0,0          ; vpbroadcastw  0x95d(%rip),%ymm9        # 25a6 <_sk_xor__hsw_lowp+0x3fa>
   DB  196,65,61,228,193                   ; vpmulhuw      %ymm9,%ymm8,%ymm8
   DB  196,194,125,11,192                  ; vpmulhrsw     %ymm8,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
-  DB  196,98,125,121,13,251,7,0,0         ; vpbroadcastw  0x7fb(%rip),%ymm9        # 1dc8 <_sk_xor__hsw_lowp+0x2a0>
+  DB  196,98,125,121,13,71,9,0,0          ; vpbroadcastw  0x947(%rip),%ymm9        # 25a8 <_sk_xor__hsw_lowp+0x3fc>
   DB  196,65,53,249,200                   ; vpsubw        %ymm8,%ymm9,%ymm9
   DB  196,66,93,11,209                    ; vpmulhrsw     %ymm9,%ymm4,%ymm10
   DB  196,66,125,29,210                   ; vpabsw        %ymm10,%ymm10
@@ -30447,35 +31895,35 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  15,135,92,255,255,255               ; ja            15a1 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  15,135,92,255,255,255               ; ja            1c35 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,204,0,0,0                 ; lea           0xcc(%rip),%r10        # 171c <_sk_lerp_u8_hsw_lowp+0x18f>
+  DB  76,141,21,204,0,0,0                 ; lea           0xcc(%rip),%r10        # 1db0 <_sk_lerp_u8_hsw_lowp+0x18f>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  233,58,255,255,255                  ; jmpq          15a1 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  233,58,255,255,255                  ; jmpq          1c35 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,2,2              ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm8,%xmm8
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,67,57,14,193,1                  ; vpblendw      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,25,255,255,255                  ; jmpq          15a1 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  233,25,255,255,255                  ; jmpq          1c35 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,6,6              ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,5,5              ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,4,4              ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,67,57,2,193,1                   ; vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,235,254,255,255                 ; jmpq          15a1 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  233,235,254,255,255                 ; jmpq          1c35 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,10,10            ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,9,9              ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,8,8              ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,65,122,126,12,19                ; vmovq         (%r11,%rdx,1),%xmm9
   DB  196,67,49,2,192,12                  ; vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  DB  233,189,254,255,255                 ; jmpq          15a1 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  233,189,254,255,255                 ; jmpq          1c35 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,14,14            ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,13,13            ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm8,%xmm8
@@ -30483,7 +31931,7 @@
   DB  196,65,122,126,12,19                ; vmovq         (%r11,%rdx,1),%xmm9
   DB  196,67,49,34,76,19,8,2              ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm9,%xmm9
   DB  196,67,49,2,192,8                   ; vpblendd      $0x8,%xmm8,%xmm9,%xmm8
-  DB  233,135,254,255,255                 ; jmpq          15a1 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  233,135,254,255,255                 ; jmpq          1c35 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  61,255,255,255,88                   ; cmp           $0x58ffffff,%eax
   DB  255                                 ; (bad)
@@ -30494,7 +31942,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  121,255                             ; jns           1731 <_sk_lerp_u8_hsw_lowp+0x1a4>
+  DB  121,255                             ; jns           1dc5 <_sk_lerp_u8_hsw_lowp+0x1a4>
   DB  255                                 ; (bad)
   DB  255,108,255,255                     ; ljmp          *-0x1(%rdi,%rdi,8)
   DB  255,183,255,255,255,175             ; pushq         -0x50000001(%rdi)
@@ -30525,14 +31973,6 @@
   DB  197,124,41,194                      ; vmovaps       %ymm8,%ymm2
   DB  255,224                             ; jmpq          *%rax
 
-PUBLIC _sk_swap_rb_dst_hsw_lowp
-_sk_swap_rb_dst_hsw_lowp LABEL PROC
-  DB  197,124,40,196                      ; vmovaps       %ymm4,%ymm8
-  DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  197,252,40,230                      ; vmovaps       %ymm6,%ymm4
-  DB  197,124,41,198                      ; vmovaps       %ymm8,%ymm6
-  DB  255,224                             ; jmpq          *%rax
-
 PUBLIC _sk_move_src_dst_hsw_lowp
 _sk_move_src_dst_hsw_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -30564,7 +32004,7 @@
 _sk_srcatop_hsw_lowp LABEL PROC
   DB  196,226,125,11,199                  ; vpmulhrsw     %ymm7,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
-  DB  196,98,125,121,5,3,6,0,0            ; vpbroadcastw  0x603(%rip),%ymm8        # 1dca <_sk_xor__hsw_lowp+0x2a2>
+  DB  196,98,125,121,5,95,7,0,0           ; vpbroadcastw  0x75f(%rip),%ymm8        # 25aa <_sk_xor__hsw_lowp+0x3fe>
   DB  197,61,249,195                      ; vpsubw        %ymm3,%ymm8,%ymm8
   DB  196,66,93,11,200                    ; vpmulhrsw     %ymm8,%ymm4,%ymm9
   DB  196,66,125,29,201                   ; vpabsw        %ymm9,%ymm9
@@ -30591,7 +32031,7 @@
 _sk_dstatop_hsw_lowp LABEL PROC
   DB  196,98,93,11,195                    ; vpmulhrsw     %ymm3,%ymm4,%ymm8
   DB  196,66,125,29,192                   ; vpabsw        %ymm8,%ymm8
-  DB  196,98,125,121,13,148,5,0,0         ; vpbroadcastw  0x594(%rip),%ymm9        # 1dcc <_sk_xor__hsw_lowp+0x2a4>
+  DB  196,98,125,121,13,240,6,0,0         ; vpbroadcastw  0x6f0(%rip),%ymm9        # 25ac <_sk_xor__hsw_lowp+0x400>
   DB  197,53,249,207                      ; vpsubw        %ymm7,%ymm9,%ymm9
   DB  196,194,125,11,193                  ; vpmulhrsw     %ymm9,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -30642,7 +32082,7 @@
 
 PUBLIC _sk_srcout_hsw_lowp
 _sk_srcout_hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,211,4,0,0          ; vpbroadcastw  0x4d3(%rip),%ymm8        # 1dce <_sk_xor__hsw_lowp+0x2a6>
+  DB  196,98,125,121,5,47,6,0,0           ; vpbroadcastw  0x62f(%rip),%ymm8        # 25ae <_sk_xor__hsw_lowp+0x402>
   DB  197,61,249,199                      ; vpsubw        %ymm7,%ymm8,%ymm8
   DB  196,194,125,11,192                  ; vpmulhrsw     %ymm8,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -30657,7 +32097,7 @@
 
 PUBLIC _sk_dstout_hsw_lowp
 _sk_dstout_hsw_lowp LABEL PROC
-  DB  196,226,125,121,5,156,4,0,0         ; vpbroadcastw  0x49c(%rip),%ymm0        # 1dd0 <_sk_xor__hsw_lowp+0x2a8>
+  DB  196,226,125,121,5,248,5,0,0         ; vpbroadcastw  0x5f8(%rip),%ymm0        # 25b0 <_sk_xor__hsw_lowp+0x404>
   DB  197,253,249,219                     ; vpsubw        %ymm3,%ymm0,%ymm3
   DB  196,226,93,11,195                   ; vpmulhrsw     %ymm3,%ymm4,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -30672,7 +32112,7 @@
 
 PUBLIC _sk_srcover_hsw_lowp
 _sk_srcover_hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,101,4,0,0          ; vpbroadcastw  0x465(%rip),%ymm8        # 1dd2 <_sk_xor__hsw_lowp+0x2aa>
+  DB  196,98,125,121,5,193,5,0,0          ; vpbroadcastw  0x5c1(%rip),%ymm8        # 25b2 <_sk_xor__hsw_lowp+0x406>
   DB  197,61,249,195                      ; vpsubw        %ymm3,%ymm8,%ymm8
   DB  196,66,93,11,200                    ; vpmulhrsw     %ymm8,%ymm4,%ymm9
   DB  196,66,125,29,201                   ; vpabsw        %ymm9,%ymm9
@@ -30691,7 +32131,7 @@
 
 PUBLIC _sk_dstover_hsw_lowp
 _sk_dstover_hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,30,4,0,0           ; vpbroadcastw  0x41e(%rip),%ymm8        # 1dd4 <_sk_xor__hsw_lowp+0x2ac>
+  DB  196,98,125,121,5,122,5,0,0          ; vpbroadcastw  0x57a(%rip),%ymm8        # 25b4 <_sk_xor__hsw_lowp+0x408>
   DB  197,61,249,199                      ; vpsubw        %ymm7,%ymm8,%ymm8
   DB  196,194,125,11,192                  ; vpmulhrsw     %ymm8,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -30723,7 +32163,7 @@
 
 PUBLIC _sk_multiply_hsw_lowp
 _sk_multiply_hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,171,3,0,0          ; vpbroadcastw  0x3ab(%rip),%ymm8        # 1dd6 <_sk_xor__hsw_lowp+0x2ae>
+  DB  196,98,125,121,5,7,5,0,0            ; vpbroadcastw  0x507(%rip),%ymm8        # 25b6 <_sk_xor__hsw_lowp+0x40a>
   DB  197,61,249,207                      ; vpsubw        %ymm7,%ymm8,%ymm9
   DB  196,66,125,11,209                   ; vpmulhrsw     %ymm9,%ymm0,%ymm10
   DB  196,66,125,29,210                   ; vpabsw        %ymm10,%ymm10
@@ -30763,7 +32203,7 @@
 
 PUBLIC _sk_screen_hsw_lowp
 _sk_screen_hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,252,2,0,0          ; vpbroadcastw  0x2fc(%rip),%ymm8        # 1dd8 <_sk_xor__hsw_lowp+0x2b0>
+  DB  196,98,125,121,5,88,4,0,0           ; vpbroadcastw  0x458(%rip),%ymm8        # 25b8 <_sk_xor__hsw_lowp+0x40c>
   DB  197,61,249,200                      ; vpsubw        %ymm0,%ymm8,%ymm9
   DB  196,98,53,11,204                    ; vpmulhrsw     %ymm4,%ymm9,%ymm9
   DB  196,66,125,29,201                   ; vpabsw        %ymm9,%ymm9
@@ -30785,7 +32225,7 @@
 
 PUBLIC _sk_xor__hsw_lowp
 _sk_xor__hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,169,2,0,0          ; vpbroadcastw  0x2a9(%rip),%ymm8        # 1dda <_sk_xor__hsw_lowp+0x2b2>
+  DB  196,98,125,121,5,5,4,0,0            ; vpbroadcastw  0x405(%rip),%ymm8        # 25ba <_sk_xor__hsw_lowp+0x40e>
   DB  197,61,249,207                      ; vpsubw        %ymm7,%ymm8,%ymm9
   DB  196,194,125,11,193                  ; vpmulhrsw     %ymm9,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -30855,7 +32295,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,17                              ; callq         *(%rcx)
-  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a352d <_sk_xor__hsw_lowp+0x1d1a1a05>
+  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3bad <_sk_xor__hsw_lowp+0x1d1a1a01>
   DB  30                                  ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -30946,7 +32386,208 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,17                              ; callq         *(%rcx)
-  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a35cd <_sk_xor__hsw_lowp+0x1d1a1aa5>
+  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3c4d <_sk_xor__hsw_lowp+0x1d1a1aa1>
+  DB  30                                  ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,2                               ; incl          (%rdx)
+  DB  3,6                                 ; add           (%rsi),%eax
+  DB  7                                   ; (bad)
+  DB  10,11                               ; or            (%rbx),%cl
+  DB  14                                  ; (bad)
+  DB  15,255                              ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,18                              ; callq         *(%rdx)
+  DB  19,22                               ; adc           (%rsi),%edx
+  DB  23                                  ; (bad)
+  DB  26,27                               ; sbb           (%rbx),%bl
+  DB  30                                  ; (bad)
+  DB  31                                  ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,3                               ; incl          (%rbx)
+  DB  255,7                               ; incl          (%rdi)
+  DB  255,11                              ; decl          (%rbx)
+  DB  255,15                              ; decl          (%rdi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,19                              ; callq         *(%rbx)
+  DB  255,23                              ; callq         *(%rdi)
+  DB  255,27                              ; lcall         *(%rbx)
+  DB  255,31                              ; lcall         *(%rdi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,1                                 ; add           %al,(%rcx)
+  DB  4,5                                 ; add           $0x5,%al
+  DB  8,9                                 ; or            %cl,(%rcx)
+  DB  12,13                               ; or            $0xd,%al
+  DB  128,128,128,128,128,128,128         ; addb          $0x80,-0x7f7f7f80(%rax)
+  DB  128,0,1                             ; addb          $0x1,(%rax)
+  DB  4,5                                 ; add           $0x5,%al
+  DB  8,9                                 ; or            %cl,(%rcx)
+  DB  12,13                               ; or            $0xd,%al
+  DB  128,128,128,128,128,128,128         ; addb          $0x80,-0x7f7f7f80(%rax)
+  DB  128,129,128,0,0,0,0                 ; addb          $0x0,0x80(%rcx)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  1,2                                 ; add           %eax,(%rdx)
+  DB  5,6,9,10,13                         ; add           $0xd0a0906,%eax
+  DB  14                                  ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,17                              ; callq         *(%rcx)
+  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3d0d <_sk_xor__hsw_lowp+0x1d1a1b61>
+  DB  30                                  ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,2                               ; incl          (%rdx)
+  DB  3,6                                 ; add           (%rsi),%eax
+  DB  7                                   ; (bad)
+  DB  10,11                               ; or            (%rbx),%cl
+  DB  14                                  ; (bad)
+  DB  15,255                              ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,18                              ; callq         *(%rdx)
+  DB  19,22                               ; adc           (%rsi),%edx
+  DB  23                                  ; (bad)
+  DB  26,27                               ; sbb           (%rbx),%bl
+  DB  30                                  ; (bad)
+  DB  31                                  ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,3                               ; incl          (%rbx)
+  DB  255,7                               ; incl          (%rdi)
+  DB  255,11                              ; decl          (%rbx)
+  DB  255,15                              ; decl          (%rdi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,19                              ; callq         *(%rbx)
+  DB  255,23                              ; callq         *(%rdi)
+  DB  255,27                              ; lcall         *(%rbx)
+  DB  255,31                              ; lcall         *(%rdi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,0                               ; incl          (%rax)
+  DB  1,4,5,8,9,12,13                     ; add           %eax,0xd0c0908(,%rax,1)
+  DB  128,128,128,128,128,128,128         ; addb          $0x80,-0x7f7f7f80(%rax)
+  DB  128,0,1                             ; addb          $0x1,(%rax)
+  DB  4,5                                 ; add           $0x5,%al
+  DB  8,9                                 ; or            %cl,(%rcx)
+  DB  12,13                               ; or            $0xd,%al
+  DB  128,128,128,128,128,128,128         ; addb          $0x80,-0x7f7f7f80(%rax)
+  DB  128,129,128,0,0,0,0                 ; addb          $0x0,0x80(%rcx)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  1,2                                 ; add           %eax,(%rdx)
+  DB  5,6,9,10,13                         ; add           $0xd0a0906,%eax
+  DB  14                                  ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,17                              ; callq         *(%rcx)
+  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3dad <_sk_xor__hsw_lowp+0x1d1a1c01>
   DB  30                                  ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -31048,7 +32689,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,17                              ; callq         *(%rcx)
-  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a368d <_sk_xor__hsw_lowp+0x1d1a1b65>
+  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3e6d <_sk_xor__hsw_lowp+0x1d1a1cc1>
   DB  30                                  ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -31202,7 +32843,7 @@
 _sk_constant_color_ssse3_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,24                            ; movups        (%rax),%xmm3
-  DB  15,88,29,128,21,0,0                 ; addps         0x1580(%rip),%xmm3        # 16b0 <_sk_xor__ssse3_lowp+0xa8>
+  DB  15,88,29,208,25,0,0                 ; addps         0x19d0(%rip),%xmm3        # 1b00 <_sk_xor__ssse3_lowp+0xa7>
   DB  242,15,112,195,0                    ; pshuflw       $0x0,%xmm3,%xmm0
   DB  102,15,112,192,80                   ; pshufd        $0x50,%xmm0,%xmm0
   DB  242,15,112,203,170                  ; pshuflw       $0xaa,%xmm3,%xmm1
@@ -31217,7 +32858,7 @@
 PUBLIC _sk_set_rgb_ssse3_lowp
 _sk_set_rgb_ssse3_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  243,15,16,21,202,23,0,0             ; movss         0x17ca(%rip),%xmm2        # 1930 <_sk_xor__ssse3_lowp+0x328>
+  DB  243,15,16,21,202,28,0,0             ; movss         0x1cca(%rip),%xmm2        # 1e30 <_sk_xor__ssse3_lowp+0x3d7>
   DB  243,15,16,0                         ; movss         (%rax),%xmm0
   DB  243,15,88,194                       ; addss         %xmm2,%xmm0
   DB  102,65,15,126,193                   ; movd          %xmm0,%r9d
@@ -31257,16 +32898,16 @@
   DB  15,133,191,0,0,0                    ; jne           2a9 <_sk_load_8888_ssse3_lowp+0xcd>
   DB  69,15,16,68,147,16                  ; movups        0x10(%r11,%rdx,4),%xmm8
   DB  102,65,15,16,28,147                 ; movupd        (%r11,%rdx,4),%xmm3
-  DB  102,15,111,13,194,20,0,0            ; movdqa        0x14c2(%rip),%xmm1        # 16c0 <_sk_xor__ssse3_lowp+0xb8>
+  DB  102,15,111,13,18,25,0,0             ; movdqa        0x1912(%rip),%xmm1        # 1b10 <_sk_xor__ssse3_lowp+0xb7>
   DB  102,15,40,195                       ; movapd        %xmm3,%xmm0
   DB  102,15,56,0,193                     ; pshufb        %xmm1,%xmm0
   DB  102,65,15,111,208                   ; movdqa        %xmm8,%xmm2
   DB  102,15,56,0,209                     ; pshufb        %xmm1,%xmm2
   DB  102,15,108,194                      ; punpcklqdq    %xmm2,%xmm0
   DB  102,15,113,240,8                    ; psllw         $0x8,%xmm0
-  DB  102,68,15,111,13,173,20,0,0         ; movdqa        0x14ad(%rip),%xmm9        # 16d0 <_sk_xor__ssse3_lowp+0xc8>
+  DB  102,68,15,111,13,253,24,0,0         ; movdqa        0x18fd(%rip),%xmm9        # 1b20 <_sk_xor__ssse3_lowp+0xc7>
   DB  102,65,15,228,193                   ; pmulhuw       %xmm9,%xmm0
-  DB  102,68,15,111,21,175,20,0,0         ; movdqa        0x14af(%rip),%xmm10        # 16e0 <_sk_xor__ssse3_lowp+0xd8>
+  DB  102,68,15,111,21,255,24,0,0         ; movdqa        0x18ff(%rip),%xmm10        # 1b30 <_sk_xor__ssse3_lowp+0xd7>
   DB  102,15,40,203                       ; movapd        %xmm3,%xmm1
   DB  102,65,15,56,0,202                  ; pshufb        %xmm10,%xmm1
   DB  102,65,15,111,208                   ; movdqa        %xmm8,%xmm2
@@ -31274,7 +32915,7 @@
   DB  102,15,108,202                      ; punpcklqdq    %xmm2,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
   DB  102,65,15,228,201                   ; pmulhuw       %xmm9,%xmm1
-  DB  102,68,15,111,21,147,20,0,0         ; movdqa        0x1493(%rip),%xmm10        # 16f0 <_sk_xor__ssse3_lowp+0xe8>
+  DB  102,68,15,111,21,227,24,0,0         ; movdqa        0x18e3(%rip),%xmm10        # 1b40 <_sk_xor__ssse3_lowp+0xe7>
   DB  102,15,40,211                       ; movapd        %xmm3,%xmm2
   DB  102,65,15,56,0,210                  ; pshufb        %xmm10,%xmm2
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
@@ -31282,7 +32923,7 @@
   DB  102,65,15,108,211                   ; punpcklqdq    %xmm11,%xmm2
   DB  102,15,113,242,8                    ; psllw         $0x8,%xmm2
   DB  102,65,15,228,209                   ; pmulhuw       %xmm9,%xmm2
-  DB  102,68,15,111,21,118,20,0,0         ; movdqa        0x1476(%rip),%xmm10        # 1700 <_sk_xor__ssse3_lowp+0xf8>
+  DB  102,68,15,111,21,198,24,0,0         ; movdqa        0x18c6(%rip),%xmm10        # 1b50 <_sk_xor__ssse3_lowp+0xf7>
   DB  102,65,15,56,0,218                  ; pshufb        %xmm10,%xmm3
   DB  102,69,15,56,0,194                  ; pshufb        %xmm10,%xmm8
   DB  102,65,15,108,216                   ; punpcklqdq    %xmm8,%xmm3
@@ -31347,16 +32988,16 @@
   DB  15,133,191,0,0,0                    ; jne           419 <_sk_load_8888_dst_ssse3_lowp+0xcd>
   DB  69,15,16,68,147,16                  ; movups        0x10(%r11,%rdx,4),%xmm8
   DB  102,65,15,16,60,147                 ; movupd        (%r11,%rdx,4),%xmm7
-  DB  102,15,111,45,162,19,0,0            ; movdqa        0x13a2(%rip),%xmm5        # 1710 <_sk_xor__ssse3_lowp+0x108>
+  DB  102,15,111,45,242,23,0,0            ; movdqa        0x17f2(%rip),%xmm5        # 1b60 <_sk_xor__ssse3_lowp+0x107>
   DB  102,15,40,231                       ; movapd        %xmm7,%xmm4
   DB  102,15,56,0,229                     ; pshufb        %xmm5,%xmm4
   DB  102,65,15,111,240                   ; movdqa        %xmm8,%xmm6
   DB  102,15,56,0,245                     ; pshufb        %xmm5,%xmm6
   DB  102,15,108,230                      ; punpcklqdq    %xmm6,%xmm4
   DB  102,15,113,244,8                    ; psllw         $0x8,%xmm4
-  DB  102,68,15,111,13,141,19,0,0         ; movdqa        0x138d(%rip),%xmm9        # 1720 <_sk_xor__ssse3_lowp+0x118>
+  DB  102,68,15,111,13,221,23,0,0         ; movdqa        0x17dd(%rip),%xmm9        # 1b70 <_sk_xor__ssse3_lowp+0x117>
   DB  102,65,15,228,225                   ; pmulhuw       %xmm9,%xmm4
-  DB  102,68,15,111,21,143,19,0,0         ; movdqa        0x138f(%rip),%xmm10        # 1730 <_sk_xor__ssse3_lowp+0x128>
+  DB  102,68,15,111,21,223,23,0,0         ; movdqa        0x17df(%rip),%xmm10        # 1b80 <_sk_xor__ssse3_lowp+0x127>
   DB  102,15,40,239                       ; movapd        %xmm7,%xmm5
   DB  102,65,15,56,0,234                  ; pshufb        %xmm10,%xmm5
   DB  102,65,15,111,240                   ; movdqa        %xmm8,%xmm6
@@ -31364,7 +33005,7 @@
   DB  102,15,108,238                      ; punpcklqdq    %xmm6,%xmm5
   DB  102,15,113,245,8                    ; psllw         $0x8,%xmm5
   DB  102,65,15,228,233                   ; pmulhuw       %xmm9,%xmm5
-  DB  102,68,15,111,21,115,19,0,0         ; movdqa        0x1373(%rip),%xmm10        # 1740 <_sk_xor__ssse3_lowp+0x138>
+  DB  102,68,15,111,21,195,23,0,0         ; movdqa        0x17c3(%rip),%xmm10        # 1b90 <_sk_xor__ssse3_lowp+0x137>
   DB  102,15,40,247                       ; movapd        %xmm7,%xmm6
   DB  102,65,15,56,0,242                  ; pshufb        %xmm10,%xmm6
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
@@ -31372,7 +33013,7 @@
   DB  102,65,15,108,243                   ; punpcklqdq    %xmm11,%xmm6
   DB  102,15,113,246,8                    ; psllw         $0x8,%xmm6
   DB  102,65,15,228,241                   ; pmulhuw       %xmm9,%xmm6
-  DB  102,68,15,111,21,86,19,0,0          ; movdqa        0x1356(%rip),%xmm10        # 1750 <_sk_xor__ssse3_lowp+0x148>
+  DB  102,68,15,111,21,166,23,0,0         ; movdqa        0x17a6(%rip),%xmm10        # 1ba0 <_sk_xor__ssse3_lowp+0x147>
   DB  102,65,15,56,0,250                  ; pshufb        %xmm10,%xmm7
   DB  102,69,15,56,0,194                  ; pshufb        %xmm10,%xmm8
   DB  102,65,15,108,248                   ; punpcklqdq    %xmm8,%xmm7
@@ -31435,7 +33076,7 @@
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  102,68,15,111,192                   ; movdqa        %xmm0,%xmm8
   DB  102,65,15,113,208,7                 ; psrlw         $0x7,%xmm8
-  DB  102,68,15,111,21,139,18,0,0         ; movdqa        0x128b(%rip),%xmm10        # 1760 <_sk_xor__ssse3_lowp+0x158>
+  DB  102,68,15,111,21,219,22,0,0         ; movdqa        0x16db(%rip),%xmm10        # 1bb0 <_sk_xor__ssse3_lowp+0x157>
   DB  102,69,15,234,194                   ; pminsw        %xmm10,%xmm8
   DB  102,69,15,239,219                   ; pxor          %xmm11,%xmm11
   DB  102,69,15,111,232                   ; movdqa        %xmm8,%xmm13
@@ -31522,16 +33163,293 @@
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
 
+PUBLIC _sk_load_bgra_ssse3_lowp
+_sk_load_bgra_ssse3_lowp LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,139,24                           ; mov           (%rax),%r11
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  15,133,191,0,0,0                    ; jne           6f9 <_sk_load_bgra_ssse3_lowp+0xcd>
+  DB  69,15,16,68,147,16                  ; movups        0x10(%r11,%rdx,4),%xmm8
+  DB  102,65,15,16,28,147                 ; movupd        (%r11,%rdx,4),%xmm3
+  DB  102,15,111,5,114,21,0,0             ; movdqa        0x1572(%rip),%xmm0        # 1bc0 <_sk_xor__ssse3_lowp+0x167>
+  DB  102,15,40,211                       ; movapd        %xmm3,%xmm2
+  DB  102,15,56,0,208                     ; pshufb        %xmm0,%xmm2
+  DB  102,65,15,111,200                   ; movdqa        %xmm8,%xmm1
+  DB  102,15,56,0,200                     ; pshufb        %xmm0,%xmm1
+  DB  102,15,108,209                      ; punpcklqdq    %xmm1,%xmm2
+  DB  102,15,113,242,8                    ; psllw         $0x8,%xmm2
+  DB  102,68,15,111,13,93,21,0,0          ; movdqa        0x155d(%rip),%xmm9        # 1bd0 <_sk_xor__ssse3_lowp+0x177>
+  DB  102,65,15,228,209                   ; pmulhuw       %xmm9,%xmm2
+  DB  102,68,15,111,21,95,21,0,0          ; movdqa        0x155f(%rip),%xmm10        # 1be0 <_sk_xor__ssse3_lowp+0x187>
+  DB  102,15,40,203                       ; movapd        %xmm3,%xmm1
+  DB  102,65,15,56,0,202                  ; pshufb        %xmm10,%xmm1
+  DB  102,65,15,111,192                   ; movdqa        %xmm8,%xmm0
+  DB  102,65,15,56,0,194                  ; pshufb        %xmm10,%xmm0
+  DB  102,15,108,200                      ; punpcklqdq    %xmm0,%xmm1
+  DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
+  DB  102,65,15,228,201                   ; pmulhuw       %xmm9,%xmm1
+  DB  102,68,15,111,21,67,21,0,0          ; movdqa        0x1543(%rip),%xmm10        # 1bf0 <_sk_xor__ssse3_lowp+0x197>
+  DB  102,15,40,195                       ; movapd        %xmm3,%xmm0
+  DB  102,65,15,56,0,194                  ; pshufb        %xmm10,%xmm0
+  DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
+  DB  102,69,15,56,0,218                  ; pshufb        %xmm10,%xmm11
+  DB  102,65,15,108,195                   ; punpcklqdq    %xmm11,%xmm0
+  DB  102,15,113,240,8                    ; psllw         $0x8,%xmm0
+  DB  102,65,15,228,193                   ; pmulhuw       %xmm9,%xmm0
+  DB  102,68,15,111,21,38,21,0,0          ; movdqa        0x1526(%rip),%xmm10        # 1c00 <_sk_xor__ssse3_lowp+0x1a7>
+  DB  102,65,15,56,0,218                  ; pshufb        %xmm10,%xmm3
+  DB  102,69,15,56,0,194                  ; pshufb        %xmm10,%xmm8
+  DB  102,65,15,108,216                   ; punpcklqdq    %xmm8,%xmm3
+  DB  102,15,113,243,8                    ; psllw         $0x8,%xmm3
+  DB  102,65,15,228,217                   ; pmulhuw       %xmm9,%xmm3
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,7                        ; and           $0x7,%r9b
+  DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
+  DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
+  DB  65,254,201                          ; dec           %r9b
+  DB  65,128,249,6                        ; cmp           $0x6,%r9b
+  DB  15,135,48,255,255,255               ; ja            646 <_sk_load_bgra_ssse3_lowp+0x1a>
+  DB  69,15,182,201                       ; movzbl        %r9b,%r9d
+  DB  76,141,21,95,0,0,0                  ; lea           0x5f(%rip),%r10        # 780 <_sk_load_bgra_ssse3_lowp+0x154>
+  DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
+  DB  76,1,208                            ; add           %r10,%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  243,65,15,16,28,147                 ; movss         (%r11,%rdx,4),%xmm3
+  DB  233,17,255,255,255                  ; jmpq          646 <_sk_load_bgra_ssse3_lowp+0x1a>
+  DB  102,65,15,110,68,147,8              ; movd          0x8(%r11,%rdx,4),%xmm0
+  DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
+  DB  102,65,15,18,28,147                 ; movlpd        (%r11,%rdx,4),%xmm3
+  DB  233,250,254,255,255                 ; jmpq          646 <_sk_load_bgra_ssse3_lowp+0x1a>
+  DB  102,65,15,110,68,147,24             ; movd          0x18(%r11,%rdx,4),%xmm0
+  DB  102,68,15,112,192,69                ; pshufd        $0x45,%xmm0,%xmm8
+  DB  243,65,15,16,68,147,20              ; movss         0x14(%r11,%rdx,4),%xmm0
+  DB  65,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm0
+  DB  65,15,198,192,226                   ; shufps        $0xe2,%xmm8,%xmm0
+  DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
+  DB  243,65,15,16,68,147,16              ; movss         0x10(%r11,%rdx,4),%xmm0
+  DB  243,68,15,16,192                    ; movss         %xmm0,%xmm8
+  DB  233,193,254,255,255                 ; jmpq          640 <_sk_load_bgra_ssse3_lowp+0x14>
+  DB  144                                 ; nop
+  DB  170                                 ; stos          %al,%es:(%rdi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,193                             ; inc           %ecx
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,181,255,255,255,192             ; pushq         -0x3f000001(%rbp)
+  DB  254                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  238                                 ; out           %al,(%dx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  217,255                             ; fcos
+  DB  255                                 ; (bad)
+  DB  255,204                             ; dec           %esp
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; .byte         0xff
+
+PUBLIC _sk_load_bgra_dst_ssse3_lowp
+_sk_load_bgra_dst_ssse3_lowp LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,139,24                           ; mov           (%rax),%r11
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  15,133,191,0,0,0                    ; jne           869 <_sk_load_bgra_dst_ssse3_lowp+0xcd>
+  DB  69,15,16,68,147,16                  ; movups        0x10(%r11,%rdx,4),%xmm8
+  DB  102,65,15,16,60,147                 ; movupd        (%r11,%rdx,4),%xmm7
+  DB  102,15,111,37,82,20,0,0             ; movdqa        0x1452(%rip),%xmm4        # 1c10 <_sk_xor__ssse3_lowp+0x1b7>
+  DB  102,15,40,247                       ; movapd        %xmm7,%xmm6
+  DB  102,15,56,0,244                     ; pshufb        %xmm4,%xmm6
+  DB  102,65,15,111,232                   ; movdqa        %xmm8,%xmm5
+  DB  102,15,56,0,236                     ; pshufb        %xmm4,%xmm5
+  DB  102,15,108,245                      ; punpcklqdq    %xmm5,%xmm6
+  DB  102,15,113,246,8                    ; psllw         $0x8,%xmm6
+  DB  102,68,15,111,13,61,20,0,0          ; movdqa        0x143d(%rip),%xmm9        # 1c20 <_sk_xor__ssse3_lowp+0x1c7>
+  DB  102,65,15,228,241                   ; pmulhuw       %xmm9,%xmm6
+  DB  102,68,15,111,21,63,20,0,0          ; movdqa        0x143f(%rip),%xmm10        # 1c30 <_sk_xor__ssse3_lowp+0x1d7>
+  DB  102,15,40,239                       ; movapd        %xmm7,%xmm5
+  DB  102,65,15,56,0,234                  ; pshufb        %xmm10,%xmm5
+  DB  102,65,15,111,224                   ; movdqa        %xmm8,%xmm4
+  DB  102,65,15,56,0,226                  ; pshufb        %xmm10,%xmm4
+  DB  102,15,108,236                      ; punpcklqdq    %xmm4,%xmm5
+  DB  102,15,113,245,8                    ; psllw         $0x8,%xmm5
+  DB  102,65,15,228,233                   ; pmulhuw       %xmm9,%xmm5
+  DB  102,68,15,111,21,35,20,0,0          ; movdqa        0x1423(%rip),%xmm10        # 1c40 <_sk_xor__ssse3_lowp+0x1e7>
+  DB  102,15,40,231                       ; movapd        %xmm7,%xmm4
+  DB  102,65,15,56,0,226                  ; pshufb        %xmm10,%xmm4
+  DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
+  DB  102,69,15,56,0,218                  ; pshufb        %xmm10,%xmm11
+  DB  102,65,15,108,227                   ; punpcklqdq    %xmm11,%xmm4
+  DB  102,15,113,244,8                    ; psllw         $0x8,%xmm4
+  DB  102,65,15,228,225                   ; pmulhuw       %xmm9,%xmm4
+  DB  102,68,15,111,21,6,20,0,0           ; movdqa        0x1406(%rip),%xmm10        # 1c50 <_sk_xor__ssse3_lowp+0x1f7>
+  DB  102,65,15,56,0,250                  ; pshufb        %xmm10,%xmm7
+  DB  102,69,15,56,0,194                  ; pshufb        %xmm10,%xmm8
+  DB  102,65,15,108,248                   ; punpcklqdq    %xmm8,%xmm7
+  DB  102,15,113,247,8                    ; psllw         $0x8,%xmm7
+  DB  102,65,15,228,249                   ; pmulhuw       %xmm9,%xmm7
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,7                        ; and           $0x7,%r9b
+  DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
+  DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
+  DB  65,254,201                          ; dec           %r9b
+  DB  65,128,249,6                        ; cmp           $0x6,%r9b
+  DB  15,135,48,255,255,255               ; ja            7b6 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  DB  69,15,182,201                       ; movzbl        %r9b,%r9d
+  DB  76,141,21,95,0,0,0                  ; lea           0x5f(%rip),%r10        # 8f0 <_sk_load_bgra_dst_ssse3_lowp+0x154>
+  DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
+  DB  76,1,208                            ; add           %r10,%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  243,65,15,16,60,147                 ; movss         (%r11,%rdx,4),%xmm7
+  DB  233,17,255,255,255                  ; jmpq          7b6 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  DB  102,65,15,110,100,147,8             ; movd          0x8(%r11,%rdx,4),%xmm4
+  DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
+  DB  102,65,15,18,60,147                 ; movlpd        (%r11,%rdx,4),%xmm7
+  DB  233,250,254,255,255                 ; jmpq          7b6 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  DB  102,65,15,110,100,147,24            ; movd          0x18(%r11,%rdx,4),%xmm4
+  DB  102,68,15,112,196,69                ; pshufd        $0x45,%xmm4,%xmm8
+  DB  243,65,15,16,100,147,20             ; movss         0x14(%r11,%rdx,4),%xmm4
+  DB  65,15,198,224,0                     ; shufps        $0x0,%xmm8,%xmm4
+  DB  65,15,198,224,226                   ; shufps        $0xe2,%xmm8,%xmm4
+  DB  68,15,40,196                        ; movaps        %xmm4,%xmm8
+  DB  243,65,15,16,100,147,16             ; movss         0x10(%r11,%rdx,4),%xmm4
+  DB  243,68,15,16,196                    ; movss         %xmm4,%xmm8
+  DB  233,193,254,255,255                 ; jmpq          7b0 <_sk_load_bgra_dst_ssse3_lowp+0x14>
+  DB  144                                 ; nop
+  DB  170                                 ; stos          %al,%es:(%rdi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,193                             ; inc           %ecx
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,181,255,255,255,192             ; pushq         -0x3f000001(%rbp)
+  DB  254                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  238                                 ; out           %al,(%dx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  217,255                             ; fcos
+  DB  255                                 ; (bad)
+  DB  255,204                             ; dec           %esp
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; .byte         0xff
+
+PUBLIC _sk_store_bgra_ssse3_lowp
+_sk_store_bgra_ssse3_lowp LABEL PROC
+  DB  72,131,236,24                       ; sub           $0x18,%rsp
+  DB  15,41,60,36                         ; movaps        %xmm7,(%rsp)
+  DB  102,68,15,111,210                   ; movdqa        %xmm2,%xmm10
+  DB  102,65,15,113,210,7                 ; psrlw         $0x7,%xmm10
+  DB  102,68,15,111,13,56,19,0,0          ; movdqa        0x1338(%rip),%xmm9        # 1c60 <_sk_xor__ssse3_lowp+0x207>
+  DB  102,69,15,234,209                   ; pminsw        %xmm9,%xmm10
+  DB  102,69,15,239,246                   ; pxor          %xmm14,%xmm14
+  DB  102,65,15,111,250                   ; movdqa        %xmm10,%xmm7
+  DB  102,65,15,97,254                    ; punpcklwd     %xmm14,%xmm7
+  DB  102,69,15,105,214                   ; punpckhwd     %xmm14,%xmm10
+  DB  102,68,15,111,225                   ; movdqa        %xmm1,%xmm12
+  DB  102,65,15,113,212,7                 ; psrlw         $0x7,%xmm12
+  DB  102,69,15,234,225                   ; pminsw        %xmm9,%xmm12
+  DB  102,69,15,111,236                   ; movdqa        %xmm12,%xmm13
+  DB  102,69,15,97,238                    ; punpcklwd     %xmm14,%xmm13
+  DB  102,69,15,105,230                   ; punpckhwd     %xmm14,%xmm12
+  DB  102,68,15,111,248                   ; movdqa        %xmm0,%xmm15
+  DB  102,65,15,113,215,7                 ; psrlw         $0x7,%xmm15
+  DB  102,69,15,234,249                   ; pminsw        %xmm9,%xmm15
+  DB  102,68,15,111,195                   ; movdqa        %xmm3,%xmm8
+  DB  102,65,15,113,208,7                 ; psrlw         $0x7,%xmm8
+  DB  102,69,15,234,193                   ; pminsw        %xmm9,%xmm8
+  DB  102,69,15,111,207                   ; movdqa        %xmm15,%xmm9
+  DB  102,69,15,105,206                   ; punpckhwd     %xmm14,%xmm9
+  DB  102,69,15,97,254                    ; punpcklwd     %xmm14,%xmm15
+  DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
+  DB  102,69,15,105,222                   ; punpckhwd     %xmm14,%xmm11
+  DB  102,69,15,97,198                    ; punpcklwd     %xmm14,%xmm8
+  DB  102,65,15,114,241,16                ; pslld         $0x10,%xmm9
+  DB  102,69,15,235,202                   ; por           %xmm10,%xmm9
+  DB  102,65,15,114,247,16                ; pslld         $0x10,%xmm15
+  DB  102,68,15,235,255                   ; por           %xmm7,%xmm15
+  DB  102,65,15,114,244,8                 ; pslld         $0x8,%xmm12
+  DB  102,65,15,114,243,24                ; pslld         $0x18,%xmm11
+  DB  102,69,15,235,220                   ; por           %xmm12,%xmm11
+  DB  102,69,15,235,217                   ; por           %xmm9,%xmm11
+  DB  102,65,15,114,245,8                 ; pslld         $0x8,%xmm13
+  DB  102,65,15,114,240,24                ; pslld         $0x18,%xmm8
+  DB  102,69,15,235,197                   ; por           %xmm13,%xmm8
+  DB  102,69,15,235,199                   ; por           %xmm15,%xmm8
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  76,139,24                           ; mov           (%rax),%r11
+  DB  77,133,192                          ; test          %r8,%r8
+  DB  117,25                              ; jne           a03 <_sk_store_bgra_ssse3_lowp+0xf7>
+  DB  243,69,15,127,4,147                 ; movdqu        %xmm8,(%r11,%rdx,4)
+  DB  243,69,15,127,92,147,16             ; movdqu        %xmm11,0x10(%r11,%rdx,4)
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  15,40,60,36                         ; movaps        (%rsp),%xmm7
+  DB  72,131,196,24                       ; add           $0x18,%rsp
+  DB  255,224                             ; jmpq          *%rax
+  DB  69,137,193                          ; mov           %r8d,%r9d
+  DB  65,128,225,7                        ; and           $0x7,%r9b
+  DB  65,254,201                          ; dec           %r9b
+  DB  65,128,249,6                        ; cmp           $0x6,%r9b
+  DB  119,228                             ; ja            9f7 <_sk_store_bgra_ssse3_lowp+0xeb>
+  DB  69,15,182,201                       ; movzbl        %r9b,%r9d
+  DB  76,141,21,82,0,0,0                  ; lea           0x52(%rip),%r10        # a70 <_sk_store_bgra_ssse3_lowp+0x164>
+  DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
+  DB  76,1,208                            ; add           %r10,%rax
+  DB  255,224                             ; jmpq          *%rax
+  DB  102,69,15,126,4,147                 ; movd          %xmm8,(%r11,%rdx,4)
+  DB  235,200                             ; jmp           9f7 <_sk_store_bgra_ssse3_lowp+0xeb>
+  DB  102,65,15,112,248,78                ; pshufd        $0x4e,%xmm8,%xmm7
+  DB  102,65,15,126,124,147,8             ; movd          %xmm7,0x8(%r11,%rdx,4)
+  DB  102,69,15,214,4,147                 ; movq          %xmm8,(%r11,%rdx,4)
+  DB  235,179                             ; jmp           9f7 <_sk_store_bgra_ssse3_lowp+0xeb>
+  DB  102,65,15,112,251,78                ; pshufd        $0x4e,%xmm11,%xmm7
+  DB  102,65,15,126,124,147,24            ; movd          %xmm7,0x18(%r11,%rdx,4)
+  DB  102,65,15,112,251,229               ; pshufd        $0xe5,%xmm11,%xmm7
+  DB  102,65,15,126,124,147,20            ; movd          %xmm7,0x14(%r11,%rdx,4)
+  DB  102,69,15,126,92,147,16             ; movd          %xmm11,0x10(%r11,%rdx,4)
+  DB  243,69,15,127,4,147                 ; movdqu        %xmm8,(%r11,%rdx,4)
+  DB  235,138                             ; jmp           9f7 <_sk_store_bgra_ssse3_lowp+0xeb>
+  DB  15,31,0                             ; nopl          (%rax)
+  DB  183,255                             ; mov           $0xff,%bh
+  DB  255                                 ; (bad)
+  DB  255,204                             ; dec           %esp
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  191,255,255,255,245                 ; mov           $0xf5ffffff,%edi
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  238                                 ; out           %al,(%dx)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,225                             ; jmpq          *%rcx
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,212                             ; callq         *%rsp
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; .byte         0xff
+
 PUBLIC _sk_load_a8_ssse3_lowp
 _sk_load_a8_ssse3_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,37                              ; jne           65b <_sk_load_a8_ssse3_lowp+0x2f>
+  DB  117,37                              ; jne           abb <_sk_load_a8_ssse3_lowp+0x2f>
   DB  243,65,15,126,28,19                 ; movq          (%r11,%rdx,1),%xmm3
   DB  102,15,96,216                       ; punpcklbw     %xmm0,%xmm3
   DB  102,15,113,243,8                    ; psllw         $0x8,%xmm3
-  DB  102,15,228,29,35,17,0,0             ; pmulhuw       0x1123(%rip),%xmm3        # 1770 <_sk_xor__ssse3_lowp+0x168>
+  DB  102,15,228,29,195,17,0,0            ; pmulhuw       0x11c3(%rip),%xmm3        # 1c70 <_sk_xor__ssse3_lowp+0x217>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  102,15,87,192                       ; xorpd         %xmm0,%xmm0
   DB  15,87,201                           ; xorps         %xmm1,%xmm1
@@ -31542,15 +33460,15 @@
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,209                             ; ja            640 <_sk_load_a8_ssse3_lowp+0x14>
+  DB  119,209                             ; ja            aa0 <_sk_load_a8_ssse3_lowp+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,110,0,0,0                 ; lea           0x6e(%rip),%r10        # 6e8 <_sk_load_a8_ssse3_lowp+0xbc>
+  DB  76,141,21,110,0,0,0                 ; lea           0x6e(%rip),%r10        # b48 <_sk_load_a8_ssse3_lowp+0xbc>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,15,110,216                      ; movd          %eax,%xmm3
-  DB  235,178                             ; jmp           640 <_sk_load_a8_ssse3_lowp+0x14>
+  DB  235,178                             ; jmp           aa0 <_sk_load_a8_ssse3_lowp+0x14>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  102,15,196,216,2                    ; pinsrw        $0x2,%eax,%xmm3
@@ -31558,7 +33476,7 @@
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,96,192                       ; punpcklbw     %xmm0,%xmm0
   DB  243,15,16,216                       ; movss         %xmm0,%xmm3
-  DB  235,144                             ; jmp           640 <_sk_load_a8_ssse3_lowp+0x14>
+  DB  235,144                             ; jmp           aa0 <_sk_load_a8_ssse3_lowp+0x14>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  102,15,196,216,6                    ; pinsrw        $0x6,%eax,%xmm3
@@ -31569,7 +33487,7 @@
   DB  102,65,15,110,4,19                  ; movd          (%r11,%rdx,1),%xmm0
   DB  102,15,96,192                       ; punpcklbw     %xmm0,%xmm0
   DB  242,15,16,216                       ; movsd         %xmm0,%xmm3
-  DB  233,88,255,255,255                  ; jmpq          640 <_sk_load_a8_ssse3_lowp+0x14>
+  DB  233,88,255,255,255                  ; jmpq          aa0 <_sk_load_a8_ssse3_lowp+0x14>
   DB  155                                 ; fwait
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -31596,11 +33514,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,37                              ; jne           733 <_sk_load_a8_dst_ssse3_lowp+0x2f>
+  DB  117,37                              ; jne           b93 <_sk_load_a8_dst_ssse3_lowp+0x2f>
   DB  243,65,15,126,60,19                 ; movq          (%r11,%rdx,1),%xmm7
   DB  102,15,96,248                       ; punpcklbw     %xmm0,%xmm7
   DB  102,15,113,247,8                    ; psllw         $0x8,%xmm7
-  DB  102,15,228,61,91,16,0,0             ; pmulhuw       0x105b(%rip),%xmm7        # 1780 <_sk_xor__ssse3_lowp+0x178>
+  DB  102,15,228,61,251,16,0,0            ; pmulhuw       0x10fb(%rip),%xmm7        # 1c80 <_sk_xor__ssse3_lowp+0x227>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  102,15,87,228                       ; xorpd         %xmm4,%xmm4
   DB  15,87,237                           ; xorps         %xmm5,%xmm5
@@ -31611,15 +33529,15 @@
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,209                             ; ja            718 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  DB  119,209                             ; ja            b78 <_sk_load_a8_dst_ssse3_lowp+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,110,0,0,0                 ; lea           0x6e(%rip),%r10        # 7c0 <_sk_load_a8_dst_ssse3_lowp+0xbc>
+  DB  76,141,21,110,0,0,0                 ; lea           0x6e(%rip),%r10        # c20 <_sk_load_a8_dst_ssse3_lowp+0xbc>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,15,110,248                      ; movd          %eax,%xmm7
-  DB  235,178                             ; jmp           718 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  DB  235,178                             ; jmp           b78 <_sk_load_a8_dst_ssse3_lowp+0x14>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  102,15,196,248,2                    ; pinsrw        $0x2,%eax,%xmm7
@@ -31627,7 +33545,7 @@
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,96,224                       ; punpcklbw     %xmm0,%xmm4
   DB  243,15,16,252                       ; movss         %xmm4,%xmm7
-  DB  235,144                             ; jmp           718 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  DB  235,144                             ; jmp           b78 <_sk_load_a8_dst_ssse3_lowp+0x14>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  102,15,196,248,6                    ; pinsrw        $0x6,%eax,%xmm7
@@ -31638,7 +33556,7 @@
   DB  102,65,15,110,36,19                 ; movd          (%r11,%rdx,1),%xmm4
   DB  102,15,96,224                       ; punpcklbw     %xmm0,%xmm4
   DB  242,15,16,252                       ; movsd         %xmm4,%xmm7
-  DB  233,88,255,255,255                  ; jmpq          718 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  DB  233,88,255,255,255                  ; jmpq          b78 <_sk_load_a8_dst_ssse3_lowp+0x14>
   DB  155                                 ; fwait
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -31669,7 +33587,7 @@
   DB  102,65,15,113,208,7                 ; psrlw         $0x7,%xmm8
   DB  102,69,15,103,192                   ; packuswb      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,14                              ; jne           808 <_sk_store_a8_ssse3_lowp+0x2c>
+  DB  117,14                              ; jne           c68 <_sk_store_a8_ssse3_lowp+0x2c>
   DB  242,69,15,17,4,19                   ; movsd         %xmm8,(%r11,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,131,196,88                       ; add           $0x58,%rsp
@@ -31678,24 +33596,24 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,232                             ; ja            800 <_sk_store_a8_ssse3_lowp+0x24>
+  DB  119,232                             ; ja            c60 <_sk_store_a8_ssse3_lowp+0x24>
   DB  102,68,15,96,192                    ; punpcklbw     %xmm0,%xmm8
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,132,0,0,0                 ; lea           0x84(%rip),%r10        # 8ac <_sk_store_a8_ssse3_lowp+0xd0>
+  DB  76,141,21,132,0,0,0                 ; lea           0x84(%rip),%r10        # d0c <_sk_store_a8_ssse3_lowp+0xd0>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  102,68,15,127,4,36                  ; movdqa        %xmm8,(%rsp)
   DB  138,4,36                            ; mov           (%rsp),%al
   DB  65,136,4,19                         ; mov           %al,(%r11,%rdx,1)
-  DB  235,192                             ; jmp           800 <_sk_store_a8_ssse3_lowp+0x24>
+  DB  235,192                             ; jmp           c60 <_sk_store_a8_ssse3_lowp+0x24>
   DB  102,68,15,127,68,36,16              ; movdqa        %xmm8,0x10(%rsp)
   DB  138,68,36,20                        ; mov           0x14(%rsp),%al
   DB  65,136,68,19,2                      ; mov           %al,0x2(%r11,%rdx,1)
-  DB  102,68,15,56,0,5,70,15,0,0          ; pshufb        0xf46(%rip),%xmm8        # 17a0 <_sk_xor__ssse3_lowp+0x198>
+  DB  102,68,15,56,0,5,230,15,0,0         ; pshufb        0xfe6(%rip),%xmm8        # 1ca0 <_sk_xor__ssse3_lowp+0x247>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,65,137,4,19                     ; mov           %ax,(%r11,%rdx,1)
-  DB  235,154                             ; jmp           800 <_sk_store_a8_ssse3_lowp+0x24>
+  DB  235,154                             ; jmp           c60 <_sk_store_a8_ssse3_lowp+0x24>
   DB  102,68,15,127,68,36,64              ; movdqa        %xmm8,0x40(%rsp)
   DB  138,68,36,76                        ; mov           0x4c(%rsp),%al
   DB  65,136,68,19,6                      ; mov           %al,0x6(%r11,%rdx,1)
@@ -31705,9 +33623,9 @@
   DB  102,68,15,127,68,36,32              ; movdqa        %xmm8,0x20(%rsp)
   DB  138,68,36,40                        ; mov           0x28(%rsp),%al
   DB  65,136,68,19,4                      ; mov           %al,0x4(%r11,%rdx,1)
-  DB  102,68,15,56,0,5,240,14,0,0         ; pshufb        0xef0(%rip),%xmm8        # 1790 <_sk_xor__ssse3_lowp+0x188>
+  DB  102,68,15,56,0,5,144,15,0,0         ; pshufb        0xf90(%rip),%xmm8        # 1c90 <_sk_xor__ssse3_lowp+0x237>
   DB  102,69,15,126,4,19                  ; movd          %xmm8,(%r11,%rdx,1)
-  DB  233,85,255,255,255                  ; jmpq          800 <_sk_store_a8_ssse3_lowp+0x24>
+  DB  233,85,255,255,255                  ; jmpq          c60 <_sk_store_a8_ssse3_lowp+0x24>
   DB  144                                 ; nop
   DB  133,255                             ; test          %edi,%edi
   DB  255                                 ; (bad)
@@ -31734,13 +33652,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,42                              ; jne           8fc <_sk_load_g8_ssse3_lowp+0x34>
+  DB  117,42                              ; jne           d5c <_sk_load_g8_ssse3_lowp+0x34>
   DB  243,65,15,126,4,19                  ; movq          (%r11,%rdx,1),%xmm0
   DB  102,15,96,192                       ; punpcklbw     %xmm0,%xmm0
   DB  102,15,113,240,8                    ; psllw         $0x8,%xmm0
-  DB  102,15,228,5,199,14,0,0             ; pmulhuw       0xec7(%rip),%xmm0        # 17b0 <_sk_xor__ssse3_lowp+0x1a8>
+  DB  102,15,228,5,103,15,0,0             ; pmulhuw       0xf67(%rip),%xmm0        # 1cb0 <_sk_xor__ssse3_lowp+0x257>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,206,14,0,0                 ; movaps        0xece(%rip),%xmm3        # 17c0 <_sk_xor__ssse3_lowp+0x1b8>
+  DB  15,40,29,110,15,0,0                 ; movaps        0xf6e(%rip),%xmm3        # 1cc0 <_sk_xor__ssse3_lowp+0x267>
   DB  102,15,111,200                      ; movdqa        %xmm0,%xmm1
   DB  102,15,111,208                      ; movdqa        %xmm0,%xmm2
   DB  255,224                             ; jmpq          *%rax
@@ -31749,15 +33667,15 @@
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,204                             ; ja            8dc <_sk_load_g8_ssse3_lowp+0x14>
+  DB  119,204                             ; ja            d3c <_sk_load_g8_ssse3_lowp+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,113,0,0,0                 ; lea           0x71(%rip),%r10        # 98c <_sk_load_g8_ssse3_lowp+0xc4>
+  DB  76,141,21,113,0,0,0                 ; lea           0x71(%rip),%r10        # dec <_sk_load_g8_ssse3_lowp+0xc4>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
-  DB  235,173                             ; jmp           8dc <_sk_load_g8_ssse3_lowp+0x14>
+  DB  235,173                             ; jmp           d3c <_sk_load_g8_ssse3_lowp+0x14>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,196,192,2                    ; pinsrw        $0x2,%eax,%xmm0
@@ -31765,7 +33683,7 @@
   DB  102,15,110,200                      ; movd          %eax,%xmm1
   DB  102,15,96,200                       ; punpcklbw     %xmm0,%xmm1
   DB  243,15,16,193                       ; movss         %xmm1,%xmm0
-  DB  235,139                             ; jmp           8dc <_sk_load_g8_ssse3_lowp+0x14>
+  DB  235,139                             ; jmp           d3c <_sk_load_g8_ssse3_lowp+0x14>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,196,192,6                    ; pinsrw        $0x6,%eax,%xmm0
@@ -31776,7 +33694,7 @@
   DB  102,65,15,110,12,19                 ; movd          (%r11,%rdx,1),%xmm1
   DB  102,15,96,200                       ; punpcklbw     %xmm0,%xmm1
   DB  242,15,16,193                       ; movsd         %xmm1,%xmm0
-  DB  233,83,255,255,255                  ; jmpq          8dc <_sk_load_g8_ssse3_lowp+0x14>
+  DB  233,83,255,255,255                  ; jmpq          d3c <_sk_load_g8_ssse3_lowp+0x14>
   DB  15,31,0                             ; nopl          (%rax)
   DB  152                                 ; cwtl
   DB  255                                 ; (bad)
@@ -31804,13 +33722,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,42                              ; jne           9dc <_sk_load_g8_dst_ssse3_lowp+0x34>
+  DB  117,42                              ; jne           e3c <_sk_load_g8_dst_ssse3_lowp+0x34>
   DB  243,65,15,126,36,19                 ; movq          (%r11,%rdx,1),%xmm4
   DB  102,15,96,224                       ; punpcklbw     %xmm0,%xmm4
   DB  102,15,113,244,8                    ; psllw         $0x8,%xmm4
-  DB  102,15,228,37,7,14,0,0              ; pmulhuw       0xe07(%rip),%xmm4        # 17d0 <_sk_xor__ssse3_lowp+0x1c8>
+  DB  102,15,228,37,167,14,0,0            ; pmulhuw       0xea7(%rip),%xmm4        # 1cd0 <_sk_xor__ssse3_lowp+0x277>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,61,14,14,0,0                  ; movaps        0xe0e(%rip),%xmm7        # 17e0 <_sk_xor__ssse3_lowp+0x1d8>
+  DB  15,40,61,174,14,0,0                 ; movaps        0xeae(%rip),%xmm7        # 1ce0 <_sk_xor__ssse3_lowp+0x287>
   DB  102,15,111,236                      ; movdqa        %xmm4,%xmm5
   DB  102,15,111,244                      ; movdqa        %xmm4,%xmm6
   DB  255,224                             ; jmpq          *%rax
@@ -31819,15 +33737,15 @@
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,204                             ; ja            9bc <_sk_load_g8_dst_ssse3_lowp+0x14>
+  DB  119,204                             ; ja            e1c <_sk_load_g8_dst_ssse3_lowp+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,113,0,0,0                 ; lea           0x71(%rip),%r10        # a6c <_sk_load_g8_dst_ssse3_lowp+0xc4>
+  DB  76,141,21,113,0,0,0                 ; lea           0x71(%rip),%r10        # ecc <_sk_load_g8_dst_ssse3_lowp+0xc4>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
-  DB  235,173                             ; jmp           9bc <_sk_load_g8_dst_ssse3_lowp+0x14>
+  DB  235,173                             ; jmp           e1c <_sk_load_g8_dst_ssse3_lowp+0x14>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  102,15,196,224,2                    ; pinsrw        $0x2,%eax,%xmm4
@@ -31835,7 +33753,7 @@
   DB  102,15,110,232                      ; movd          %eax,%xmm5
   DB  102,15,96,232                       ; punpcklbw     %xmm0,%xmm5
   DB  243,15,16,229                       ; movss         %xmm5,%xmm4
-  DB  235,139                             ; jmp           9bc <_sk_load_g8_dst_ssse3_lowp+0x14>
+  DB  235,139                             ; jmp           e1c <_sk_load_g8_dst_ssse3_lowp+0x14>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  102,15,196,224,6                    ; pinsrw        $0x6,%eax,%xmm4
@@ -31846,7 +33764,7 @@
   DB  102,65,15,110,44,19                 ; movd          (%r11,%rdx,1),%xmm5
   DB  102,15,96,232                       ; punpcklbw     %xmm0,%xmm5
   DB  242,15,16,229                       ; movsd         %xmm5,%xmm4
-  DB  233,83,255,255,255                  ; jmpq          9bc <_sk_load_g8_dst_ssse3_lowp+0x14>
+  DB  233,83,255,255,255                  ; jmpq          e1c <_sk_load_g8_dst_ssse3_lowp+0x14>
   DB  15,31,0                             ; nopl          (%rax)
   DB  152                                 ; cwtl
   DB  255                                 ; (bad)
@@ -31875,21 +33793,21 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,17,2,0,0                     ; jne           cac <_sk_srcover_rgba_8888_ssse3_lowp+0x224>
+  DB  15,133,17,2,0,0                     ; jne           110c <_sk_srcover_rgba_8888_ssse3_lowp+0x224>
   DB  69,15,16,68,147,16                  ; movups        0x10(%r11,%rdx,4),%xmm8
   DB  102,65,15,16,60,147                 ; movupd        (%r11,%rdx,4),%xmm7
   DB  72,131,236,24                       ; sub           $0x18,%rsp
-  DB  102,15,111,45,61,13,0,0             ; movdqa        0xd3d(%rip),%xmm5        # 17f0 <_sk_xor__ssse3_lowp+0x1e8>
+  DB  102,15,111,45,221,13,0,0            ; movdqa        0xddd(%rip),%xmm5        # 1cf0 <_sk_xor__ssse3_lowp+0x297>
   DB  102,15,40,231                       ; movapd        %xmm7,%xmm4
   DB  102,15,56,0,229                     ; pshufb        %xmm5,%xmm4
   DB  102,65,15,111,240                   ; movdqa        %xmm8,%xmm6
   DB  102,15,56,0,245                     ; pshufb        %xmm5,%xmm6
   DB  102,15,108,230                      ; punpcklqdq    %xmm6,%xmm4
-  DB  102,15,111,13,46,13,0,0             ; movdqa        0xd2e(%rip),%xmm1        # 1800 <_sk_xor__ssse3_lowp+0x1f8>
+  DB  102,15,111,13,206,13,0,0            ; movdqa        0xdce(%rip),%xmm1        # 1d00 <_sk_xor__ssse3_lowp+0x2a7>
   DB  102,15,113,244,8                    ; psllw         $0x8,%xmm4
-  DB  102,68,15,111,13,48,13,0,0          ; movdqa        0xd30(%rip),%xmm9        # 1810 <_sk_xor__ssse3_lowp+0x208>
+  DB  102,68,15,111,13,208,13,0,0         ; movdqa        0xdd0(%rip),%xmm9        # 1d10 <_sk_xor__ssse3_lowp+0x2b7>
   DB  102,65,15,228,225                   ; pmulhuw       %xmm9,%xmm4
-  DB  102,68,15,111,21,50,13,0,0          ; movdqa        0xd32(%rip),%xmm10        # 1820 <_sk_xor__ssse3_lowp+0x218>
+  DB  102,68,15,111,21,210,13,0,0         ; movdqa        0xdd2(%rip),%xmm10        # 1d20 <_sk_xor__ssse3_lowp+0x2c7>
   DB  102,15,40,239                       ; movapd        %xmm7,%xmm5
   DB  102,65,15,56,0,234                  ; pshufb        %xmm10,%xmm5
   DB  102,65,15,111,240                   ; movdqa        %xmm8,%xmm6
@@ -31897,7 +33815,7 @@
   DB  102,15,108,238                      ; punpcklqdq    %xmm6,%xmm5
   DB  102,15,113,245,8                    ; psllw         $0x8,%xmm5
   DB  102,65,15,228,233                   ; pmulhuw       %xmm9,%xmm5
-  DB  102,68,15,111,21,22,13,0,0          ; movdqa        0xd16(%rip),%xmm10        # 1830 <_sk_xor__ssse3_lowp+0x228>
+  DB  102,68,15,111,21,182,13,0,0         ; movdqa        0xdb6(%rip),%xmm10        # 1d30 <_sk_xor__ssse3_lowp+0x2d7>
   DB  102,15,40,247                       ; movapd        %xmm7,%xmm6
   DB  102,65,15,56,0,242                  ; pshufb        %xmm10,%xmm6
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
@@ -31905,13 +33823,13 @@
   DB  102,65,15,108,243                   ; punpcklqdq    %xmm11,%xmm6
   DB  102,15,113,246,8                    ; psllw         $0x8,%xmm6
   DB  102,65,15,228,241                   ; pmulhuw       %xmm9,%xmm6
-  DB  102,68,15,111,21,249,12,0,0         ; movdqa        0xcf9(%rip),%xmm10        # 1840 <_sk_xor__ssse3_lowp+0x238>
+  DB  102,68,15,111,21,153,13,0,0         ; movdqa        0xd99(%rip),%xmm10        # 1d40 <_sk_xor__ssse3_lowp+0x2e7>
   DB  102,65,15,56,0,250                  ; pshufb        %xmm10,%xmm7
   DB  102,69,15,56,0,194                  ; pshufb        %xmm10,%xmm8
   DB  102,65,15,108,248                   ; punpcklqdq    %xmm8,%xmm7
   DB  102,15,113,247,8                    ; psllw         $0x8,%xmm7
   DB  102,65,15,228,249                   ; pmulhuw       %xmm9,%xmm7
-  DB  102,68,15,111,29,229,12,0,0         ; movdqa        0xce5(%rip),%xmm11        # 1850 <_sk_xor__ssse3_lowp+0x248>
+  DB  102,68,15,111,29,133,13,0,0         ; movdqa        0xd85(%rip),%xmm11        # 1d50 <_sk_xor__ssse3_lowp+0x2f7>
   DB  102,68,15,249,219                   ; psubw         %xmm3,%xmm11
   DB  102,68,15,111,196                   ; movdqa        %xmm4,%xmm8
   DB  102,69,15,56,11,195                 ; pmulhrsw      %xmm11,%xmm8
@@ -31967,7 +33885,7 @@
   DB  102,65,15,235,192                   ; por           %xmm8,%xmm0
   DB  102,15,235,194                      ; por           %xmm2,%xmm0
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,100                             ; jne           ce8 <_sk_srcover_rgba_8888_ssse3_lowp+0x260>
+  DB  117,100                             ; jne           1148 <_sk_srcover_rgba_8888_ssse3_lowp+0x260>
   DB  243,65,15,127,4,147                 ; movdqu        %xmm0,(%r11,%rdx,4)
   DB  243,65,15,127,76,147,16             ; movdqu        %xmm1,0x10(%r11,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -31983,30 +33901,30 @@
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,222,253,255,255              ; ja            aa7 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  DB  15,135,222,253,255,255              ; ja            f07 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,208,0,0,0                 ; lea           0xd0(%rip),%r10        # da4 <_sk_srcover_rgba_8888_ssse3_lowp+0x31c>
+  DB  76,141,21,208,0,0,0                 ; lea           0xd0(%rip),%r10        # 1204 <_sk_srcover_rgba_8888_ssse3_lowp+0x31c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  243,65,15,16,60,147                 ; movss         (%r11,%rdx,4),%xmm7
-  DB  233,191,253,255,255                 ; jmpq          aa7 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  DB  233,191,253,255,255                 ; jmpq          f07 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,153                             ; ja            c91 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
+  DB  119,153                             ; ja            10f1 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
   DB  65,15,182,193                       ; movzbl        %r9b,%eax
-  DB  76,141,13,189,0,0,0                 ; lea           0xbd(%rip),%r9        # dc0 <_sk_srcover_rgba_8888_ssse3_lowp+0x338>
+  DB  76,141,13,189,0,0,0                 ; lea           0xbd(%rip),%r9        # 1220 <_sk_srcover_rgba_8888_ssse3_lowp+0x338>
   DB  73,99,4,129                         ; movslq        (%r9,%rax,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  102,65,15,126,4,147                 ; movd          %xmm0,(%r11,%rdx,4)
-  DB  233,122,255,255,255                 ; jmpq          c91 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
+  DB  233,122,255,255,255                 ; jmpq          10f1 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
   DB  102,65,15,110,100,147,8             ; movd          0x8(%r11,%rdx,4),%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  102,65,15,18,60,147                 ; movlpd        (%r11,%rdx,4),%xmm7
-  DB  233,121,253,255,255                 ; jmpq          aa7 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  DB  233,121,253,255,255                 ; jmpq          f07 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   DB  102,65,15,110,100,147,24            ; movd          0x18(%r11,%rdx,4),%xmm4
   DB  102,68,15,112,196,69                ; pshufd        $0x45,%xmm4,%xmm8
   DB  243,65,15,16,100,147,20             ; movss         0x14(%r11,%rdx,4),%xmm4
@@ -32015,23 +33933,23 @@
   DB  68,15,40,196                        ; movaps        %xmm4,%xmm8
   DB  243,65,15,16,100,147,16             ; movss         0x10(%r11,%rdx,4),%xmm4
   DB  243,68,15,16,196                    ; movss         %xmm4,%xmm8
-  DB  233,64,253,255,255                  ; jmpq          aa1 <_sk_srcover_rgba_8888_ssse3_lowp+0x19>
+  DB  233,64,253,255,255                  ; jmpq          f01 <_sk_srcover_rgba_8888_ssse3_lowp+0x19>
   DB  102,15,112,200,78                   ; pshufd        $0x4e,%xmm0,%xmm1
   DB  102,65,15,126,76,147,8              ; movd          %xmm1,0x8(%r11,%rdx,4)
   DB  102,65,15,214,4,147                 ; movq          %xmm0,(%r11,%rdx,4)
-  DB  233,25,255,255,255                  ; jmpq          c91 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
+  DB  233,25,255,255,255                  ; jmpq          10f1 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
   DB  102,15,112,209,78                   ; pshufd        $0x4e,%xmm1,%xmm2
   DB  102,65,15,126,84,147,24             ; movd          %xmm2,0x18(%r11,%rdx,4)
   DB  102,15,112,209,229                  ; pshufd        $0xe5,%xmm1,%xmm2
   DB  102,65,15,126,84,147,20             ; movd          %xmm2,0x14(%r11,%rdx,4)
   DB  102,65,15,126,76,147,16             ; movd          %xmm1,0x10(%r11,%rdx,4)
   DB  243,65,15,127,4,147                 ; movdqu        %xmm0,(%r11,%rdx,4)
-  DB  233,239,254,255,255                 ; jmpq          c91 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
+  DB  233,239,254,255,255                 ; jmpq          10f1 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
   DB  102,144                             ; xchg          %ax,%ax
   DB  57,255                              ; cmp           %edi,%edi
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,255                             ; jg            da9 <_sk_srcover_rgba_8888_ssse3_lowp+0x321>
+  DB  127,255                             ; jg            1209 <_sk_srcover_rgba_8888_ssse3_lowp+0x321>
   DB  255                                 ; (bad)
   DB  255,115,255                         ; pushq         -0x1(%rbx)
   DB  255                                 ; (bad)
@@ -32066,7 +33984,7 @@
 _sk_scale_1_float_ssse3_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  243,68,15,16,0                      ; movss         (%rax),%xmm8
-  DB  243,68,15,88,5,72,11,0,0            ; addss         0xb48(%rip),%xmm8        # 1934 <_sk_xor__ssse3_lowp+0x32c>
+  DB  243,68,15,88,5,232,11,0,0           ; addss         0xbe8(%rip),%xmm8        # 1e34 <_sk_xor__ssse3_lowp+0x3db>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  242,69,15,112,192,0                 ; pshuflw       $0x0,%xmm8,%xmm8
@@ -32087,11 +34005,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,74                              ; jne           e86 <_sk_scale_u8_ssse3_lowp+0x54>
+  DB  117,74                              ; jne           12e6 <_sk_scale_u8_ssse3_lowp+0x54>
   DB  243,69,15,126,4,19                  ; movq          (%r11,%rdx,1),%xmm8
   DB  102,68,15,96,192                    ; punpcklbw     %xmm0,%xmm8
   DB  102,65,15,113,240,8                 ; psllw         $0x8,%xmm8
-  DB  102,68,15,228,5,10,10,0,0           ; pmulhuw       0xa0a(%rip),%xmm8        # 1860 <_sk_xor__ssse3_lowp+0x258>
+  DB  102,68,15,228,5,170,10,0,0          ; pmulhuw       0xaaa(%rip),%xmm8        # 1d60 <_sk_xor__ssse3_lowp+0x307>
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
   DB  102,15,56,29,192                    ; pabsw         %xmm0,%xmm0
   DB  102,65,15,56,11,200                 ; pmulhrsw      %xmm8,%xmm1
@@ -32107,15 +34025,15 @@
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,172                             ; ja            e47 <_sk_scale_u8_ssse3_lowp+0x15>
+  DB  119,172                             ; ja            12a7 <_sk_scale_u8_ssse3_lowp+0x15>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,126,0,0,0                 ; lea           0x7e(%rip),%r10        # f24 <_sk_scale_u8_ssse3_lowp+0xf2>
+  DB  76,141,21,126,0,0,0                 ; lea           0x7e(%rip),%r10        # 1384 <_sk_scale_u8_ssse3_lowp+0xf2>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  235,140                             ; jmp           e47 <_sk_scale_u8_ssse3_lowp+0x15>
+  DB  235,140                             ; jmp           12a7 <_sk_scale_u8_ssse3_lowp+0x15>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,68,15,196,192,2                 ; pinsrw        $0x2,%eax,%xmm8
@@ -32123,7 +34041,7 @@
   DB  102,68,15,110,200                   ; movd          %eax,%xmm9
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  243,69,15,16,193                    ; movss         %xmm9,%xmm8
-  DB  233,98,255,255,255                  ; jmpq          e47 <_sk_scale_u8_ssse3_lowp+0x15>
+  DB  233,98,255,255,255                  ; jmpq          12a7 <_sk_scale_u8_ssse3_lowp+0x15>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,68,15,196,192,6                 ; pinsrw        $0x6,%eax,%xmm8
@@ -32134,7 +34052,7 @@
   DB  102,69,15,110,12,19                 ; movd          (%r11,%rdx,1),%xmm9
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  242,69,15,16,193                    ; movsd         %xmm9,%xmm8
-  DB  233,36,255,255,255                  ; jmpq          e47 <_sk_scale_u8_ssse3_lowp+0x15>
+  DB  233,36,255,255,255                  ; jmpq          12a7 <_sk_scale_u8_ssse3_lowp+0x15>
   DB  144                                 ; nop
   DB  139,255                             ; mov           %edi,%edi
   DB  255                                 ; (bad)
@@ -32160,14 +34078,14 @@
 _sk_lerp_1_float_ssse3_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  243,68,15,16,0                      ; movss         (%rax),%xmm8
-  DB  243,68,15,88,5,232,9,0,0            ; addss         0x9e8(%rip),%xmm8        # 1938 <_sk_xor__ssse3_lowp+0x330>
+  DB  243,68,15,88,5,136,10,0,0           ; addss         0xa88(%rip),%xmm8        # 1e38 <_sk_xor__ssse3_lowp+0x3df>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  242,69,15,112,192,0                 ; pshuflw       $0x0,%xmm8,%xmm8
   DB  102,69,15,112,192,80                ; pshufd        $0x50,%xmm8,%xmm8
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
   DB  102,68,15,56,29,200                 ; pabsw         %xmm0,%xmm9
-  DB  102,68,15,111,21,245,8,0,0          ; movdqa        0x8f5(%rip),%xmm10        # 1870 <_sk_xor__ssse3_lowp+0x268>
+  DB  102,68,15,111,21,149,9,0,0          ; movdqa        0x995(%rip),%xmm10        # 1d70 <_sk_xor__ssse3_lowp+0x317>
   DB  102,69,15,249,208                   ; psubw         %xmm8,%xmm10
   DB  102,15,111,196                      ; movdqa        %xmm4,%xmm0
   DB  102,65,15,56,11,194                 ; pmulhrsw      %xmm10,%xmm0
@@ -32198,14 +34116,14 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,169,0,0,0                    ; jne           10ac <_sk_lerp_u8_ssse3_lowp+0xb7>
+  DB  15,133,169,0,0,0                    ; jne           150c <_sk_lerp_u8_ssse3_lowp+0xb7>
   DB  243,69,15,126,4,19                  ; movq          (%r11,%rdx,1),%xmm8
   DB  102,68,15,96,192                    ; punpcklbw     %xmm0,%xmm8
   DB  102,65,15,113,240,8                 ; psllw         $0x8,%xmm8
-  DB  102,68,15,228,5,99,8,0,0            ; pmulhuw       0x863(%rip),%xmm8        # 1880 <_sk_xor__ssse3_lowp+0x278>
+  DB  102,68,15,228,5,3,9,0,0             ; pmulhuw       0x903(%rip),%xmm8        # 1d80 <_sk_xor__ssse3_lowp+0x327>
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
   DB  102,68,15,56,29,200                 ; pabsw         %xmm0,%xmm9
-  DB  102,68,15,111,21,94,8,0,0           ; movdqa        0x85e(%rip),%xmm10        # 1890 <_sk_xor__ssse3_lowp+0x288>
+  DB  102,68,15,111,21,254,8,0,0          ; movdqa        0x8fe(%rip),%xmm10        # 1d90 <_sk_xor__ssse3_lowp+0x337>
   DB  102,69,15,249,208                   ; psubw         %xmm8,%xmm10
   DB  102,15,111,196                      ; movdqa        %xmm4,%xmm0
   DB  102,65,15,56,11,194                 ; pmulhrsw      %xmm10,%xmm0
@@ -32235,15 +34153,15 @@
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,73,255,255,255               ; ja            100e <_sk_lerp_u8_ssse3_lowp+0x19>
+  DB  15,135,73,255,255,255               ; ja            146e <_sk_lerp_u8_ssse3_lowp+0x19>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,128,0,0,0                 ; lea           0x80(%rip),%r10        # 1150 <_sk_lerp_u8_ssse3_lowp+0x15b>
+  DB  76,141,21,128,0,0,0                 ; lea           0x80(%rip),%r10        # 15b0 <_sk_lerp_u8_ssse3_lowp+0x15b>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  233,38,255,255,255                  ; jmpq          100e <_sk_lerp_u8_ssse3_lowp+0x19>
+  DB  233,38,255,255,255                  ; jmpq          146e <_sk_lerp_u8_ssse3_lowp+0x19>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,68,15,196,192,2                 ; pinsrw        $0x2,%eax,%xmm8
@@ -32251,7 +34169,7 @@
   DB  102,68,15,110,200                   ; movd          %eax,%xmm9
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  243,69,15,16,193                    ; movss         %xmm9,%xmm8
-  DB  233,252,254,255,255                 ; jmpq          100e <_sk_lerp_u8_ssse3_lowp+0x19>
+  DB  233,252,254,255,255                 ; jmpq          146e <_sk_lerp_u8_ssse3_lowp+0x19>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,68,15,196,192,6                 ; pinsrw        $0x6,%eax,%xmm8
@@ -32262,14 +34180,14 @@
   DB  102,69,15,110,12,19                 ; movd          (%r11,%rdx,1),%xmm9
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  242,69,15,16,193                    ; movsd         %xmm9,%xmm8
-  DB  233,190,254,255,255                 ; jmpq          100e <_sk_lerp_u8_ssse3_lowp+0x19>
+  DB  233,190,254,255,255                 ; jmpq          146e <_sk_lerp_u8_ssse3_lowp+0x19>
   DB  137,255                             ; mov           %edi,%edi
   DB  255                                 ; (bad)
   DB  255,169,255,255,255,152             ; ljmp          *-0x67000001(%rcx)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  235,255                             ; jmp           115d <_sk_lerp_u8_ssse3_lowp+0x168>
+  DB  235,255                             ; jmp           15bd <_sk_lerp_u8_ssse3_lowp+0x168>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  223,255                             ; (bad)
@@ -32290,14 +34208,6 @@
   DB  65,15,40,208                        ; movaps        %xmm8,%xmm2
   DB  255,224                             ; jmpq          *%rax
 
-PUBLIC _sk_swap_rb_dst_ssse3_lowp
-_sk_swap_rb_dst_ssse3_lowp LABEL PROC
-  DB  68,15,40,196                        ; movaps        %xmm4,%xmm8
-  DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,230                           ; movaps        %xmm6,%xmm4
-  DB  65,15,40,240                        ; movaps        %xmm8,%xmm6
-  DB  255,224                             ; jmpq          *%rax
-
 PUBLIC _sk_move_src_dst_ssse3_lowp
 _sk_move_src_dst_ssse3_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -32329,7 +34239,7 @@
 _sk_srcatop_ssse3_lowp LABEL PROC
   DB  102,15,56,11,199                    ; pmulhrsw      %xmm7,%xmm0
   DB  102,68,15,56,29,192                 ; pabsw         %xmm0,%xmm8
-  DB  102,68,15,111,13,210,6,0,0          ; movdqa        0x6d2(%rip),%xmm9        # 18a0 <_sk_xor__ssse3_lowp+0x298>
+  DB  102,68,15,111,13,129,7,0,0          ; movdqa        0x781(%rip),%xmm9        # 1da0 <_sk_xor__ssse3_lowp+0x347>
   DB  102,68,15,249,203                   ; psubw         %xmm3,%xmm9
   DB  102,15,111,196                      ; movdqa        %xmm4,%xmm0
   DB  102,65,15,56,11,193                 ; pmulhrsw      %xmm9,%xmm0
@@ -32360,7 +34270,7 @@
   DB  102,68,15,111,196                   ; movdqa        %xmm4,%xmm8
   DB  102,68,15,56,11,195                 ; pmulhrsw      %xmm3,%xmm8
   DB  102,69,15,56,29,192                 ; pabsw         %xmm8,%xmm8
-  DB  102,68,15,111,13,81,6,0,0           ; movdqa        0x651(%rip),%xmm9        # 18b0 <_sk_xor__ssse3_lowp+0x2a8>
+  DB  102,68,15,111,13,0,7,0,0            ; movdqa        0x700(%rip),%xmm9        # 1db0 <_sk_xor__ssse3_lowp+0x357>
   DB  102,68,15,249,207                   ; psubw         %xmm7,%xmm9
   DB  102,65,15,56,11,193                 ; pmulhrsw      %xmm9,%xmm0
   DB  102,15,56,29,192                    ; pabsw         %xmm0,%xmm0
@@ -32417,7 +34327,7 @@
 
 PUBLIC _sk_srcout_ssse3_lowp
 _sk_srcout_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,119,5,0,0           ; movdqa        0x577(%rip),%xmm8        # 18c0 <_sk_xor__ssse3_lowp+0x2b8>
+  DB  102,68,15,111,5,38,6,0,0            ; movdqa        0x626(%rip),%xmm8        # 1dc0 <_sk_xor__ssse3_lowp+0x367>
   DB  102,68,15,249,199                   ; psubw         %xmm7,%xmm8
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
   DB  102,15,56,29,192                    ; pabsw         %xmm0,%xmm0
@@ -32432,7 +34342,7 @@
 
 PUBLIC _sk_dstout_ssse3_lowp
 _sk_dstout_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,72,5,0,0            ; movdqa        0x548(%rip),%xmm8        # 18d0 <_sk_xor__ssse3_lowp+0x2c8>
+  DB  102,68,15,111,5,247,5,0,0           ; movdqa        0x5f7(%rip),%xmm8        # 1dd0 <_sk_xor__ssse3_lowp+0x377>
   DB  102,68,15,249,195                   ; psubw         %xmm3,%xmm8
   DB  102,15,111,196                      ; movdqa        %xmm4,%xmm0
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
@@ -32450,7 +34360,7 @@
 
 PUBLIC _sk_srcover_ssse3_lowp
 _sk_srcover_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,13,5,0,0            ; movdqa        0x50d(%rip),%xmm8        # 18e0 <_sk_xor__ssse3_lowp+0x2d8>
+  DB  102,68,15,111,5,188,5,0,0           ; movdqa        0x5bc(%rip),%xmm8        # 1de0 <_sk_xor__ssse3_lowp+0x387>
   DB  102,68,15,249,195                   ; psubw         %xmm3,%xmm8
   DB  102,68,15,111,204                   ; movdqa        %xmm4,%xmm9
   DB  102,69,15,56,11,200                 ; pmulhrsw      %xmm8,%xmm9
@@ -32472,7 +34382,7 @@
 
 PUBLIC _sk_dstover_ssse3_lowp
 _sk_dstover_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,184,4,0,0           ; movdqa        0x4b8(%rip),%xmm8        # 18f0 <_sk_xor__ssse3_lowp+0x2e8>
+  DB  102,68,15,111,5,103,5,0,0           ; movdqa        0x567(%rip),%xmm8        # 1df0 <_sk_xor__ssse3_lowp+0x397>
   DB  102,68,15,249,199                   ; psubw         %xmm7,%xmm8
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
   DB  102,15,56,29,192                    ; pabsw         %xmm0,%xmm0
@@ -32504,7 +34414,7 @@
 
 PUBLIC _sk_multiply_ssse3_lowp
 _sk_multiply_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,77,4,0,0            ; movdqa        0x44d(%rip),%xmm8        # 1900 <_sk_xor__ssse3_lowp+0x2f8>
+  DB  102,68,15,111,5,252,4,0,0           ; movdqa        0x4fc(%rip),%xmm8        # 1e00 <_sk_xor__ssse3_lowp+0x3a7>
   DB  102,69,15,111,200                   ; movdqa        %xmm8,%xmm9
   DB  102,68,15,249,207                   ; psubw         %xmm7,%xmm9
   DB  102,68,15,111,208                   ; movdqa        %xmm0,%xmm10
@@ -32551,7 +34461,7 @@
 
 PUBLIC _sk_screen_ssse3_lowp
 _sk_screen_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,115,3,0,0           ; movdqa        0x373(%rip),%xmm8        # 1910 <_sk_xor__ssse3_lowp+0x308>
+  DB  102,68,15,111,5,34,4,0,0            ; movdqa        0x422(%rip),%xmm8        # 1e10 <_sk_xor__ssse3_lowp+0x3b7>
   DB  102,69,15,111,200                   ; movdqa        %xmm8,%xmm9
   DB  102,68,15,249,200                   ; psubw         %xmm0,%xmm9
   DB  102,68,15,56,11,204                 ; pmulhrsw      %xmm4,%xmm9
@@ -32576,7 +34486,7 @@
 
 PUBLIC _sk_xor__ssse3_lowp
 _sk_xor__ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,15,3,0,0            ; movdqa        0x30f(%rip),%xmm8        # 1920 <_sk_xor__ssse3_lowp+0x318>
+  DB  102,68,15,111,5,190,3,0,0           ; movdqa        0x3be(%rip),%xmm8        # 1e20 <_sk_xor__ssse3_lowp+0x3c7>
   DB  102,69,15,111,200                   ; movdqa        %xmm8,%xmm9
   DB  102,68,15,249,207                   ; psubw         %xmm7,%xmm9
   DB  102,65,15,56,11,193                 ; pmulhrsw      %xmm9,%xmm0
@@ -32619,7 +34529,7 @@
   DB  12,13                               ; or            $0xd,%al
   DB  12,13                               ; or            $0xd,%al
   DB  14                                  ; (bad)
-  DB  15,129,128,129,128,129              ; jno           ffffffff81809855 <_sk_xor__ssse3_lowp+0xffffffff8180824d>
+  DB  15,129,128,129,128,129              ; jno           ffffffff81809ca5 <_sk_xor__ssse3_lowp+0xffffffff8180824c>
   DB  128,129,128,129,128,129,128         ; addb          $0x80,-0x7e7f7e80(%rcx)
   DB  129,128,129,128,1,2,5,6,9,10        ; addl          $0xa090605,0x2018081(%rax)
   DB  13,14,9,10,13                       ; or            $0xd0a090e,%eax
@@ -32648,7 +34558,76 @@
   DB  12,13                               ; or            $0xd,%al
   DB  12,13                               ; or            $0xd,%al
   DB  14                                  ; (bad)
-  DB  15,129,128,129,128,129              ; jno           ffffffff818098a5 <_sk_xor__ssse3_lowp+0xffffffff8180829d>
+  DB  15,129,128,129,128,129              ; jno           ffffffff81809cf5 <_sk_xor__ssse3_lowp+0xffffffff8180829c>
+  DB  128,129,128,129,128,129,128         ; addb          $0x80,-0x7e7f7e80(%rcx)
+  DB  129,128,129,128,1,2,5,6,9,10        ; addl          $0xa090605,0x2018081(%rax)
+  DB  13,14,9,10,13                       ; or            $0xd0a090e,%eax
+  DB  14                                  ; (bad)
+  DB  13,14,15,255,2                      ; or            $0x2ff0f0e,%eax
+  DB  3,6                                 ; add           (%rsi),%eax
+  DB  7                                   ; (bad)
+  DB  10,11                               ; or            (%rbx),%cl
+  DB  14                                  ; (bad)
+  DB  15,10                               ; (bad)
+  DB  11,14                               ; or            (%rsi),%ecx
+  DB  15,14                               ; femms
+  DB  15,255                              ; (bad)
+  DB  255,3                               ; incl          (%rbx)
+  DB  255,7                               ; incl          (%rdi)
+  DB  255,11                              ; decl          (%rbx)
+  DB  255,15                              ; decl          (%rdi)
+  DB  255,11                              ; decl          (%rbx)
+  DB  255,15                              ; decl          (%rdi)
+  DB  255,15                              ; decl          (%rdi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,0                               ; incl          (%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  255,0                               ; incl          (%rax)
+  DB  0,1                                 ; add           %al,(%rcx)
+  DB  4,5                                 ; add           $0x5,%al
+  DB  8,9                                 ; or            %cl,(%rcx)
+  DB  12,13                               ; or            $0xd,%al
+  DB  8,9                                 ; or            %cl,(%rcx)
+  DB  12,13                               ; or            $0xd,%al
+  DB  12,13                               ; or            $0xd,%al
+  DB  14                                  ; (bad)
+  DB  15,129,128,129,128,129              ; jno           ffffffff81809d55 <_sk_xor__ssse3_lowp+0xffffffff818082fc>
+  DB  128,129,128,129,128,129,128         ; addb          $0x80,-0x7e7f7e80(%rcx)
+  DB  129,128,129,128,1,2,5,6,9,10        ; addl          $0xa090605,0x2018081(%rax)
+  DB  13,14,9,10,13                       ; or            $0xd0a090e,%eax
+  DB  14                                  ; (bad)
+  DB  13,14,15,255,2                      ; or            $0x2ff0f0e,%eax
+  DB  3,6                                 ; add           (%rsi),%eax
+  DB  7                                   ; (bad)
+  DB  10,11                               ; or            (%rbx),%cl
+  DB  14                                  ; (bad)
+  DB  15,10                               ; (bad)
+  DB  11,14                               ; or            (%rsi),%ecx
+  DB  15,14                               ; femms
+  DB  15,255                              ; (bad)
+  DB  255,3                               ; incl          (%rbx)
+  DB  255,7                               ; incl          (%rdi)
+  DB  255,11                              ; decl          (%rbx)
+  DB  255,15                              ; decl          (%rdi)
+  DB  255,11                              ; decl          (%rbx)
+  DB  255,15                              ; decl          (%rdi)
+  DB  255,15                              ; decl          (%rdi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,0                               ; incl          (%rax)
+  DB  1,4,5,8,9,12,13                     ; add           %eax,0xd0c0908(,%rax,1)
+  DB  8,9                                 ; or            %cl,(%rcx)
+  DB  12,13                               ; or            $0xd,%al
+  DB  12,13                               ; or            $0xd,%al
+  DB  14                                  ; (bad)
+  DB  15,129,128,129,128,129              ; jno           ffffffff81809da5 <_sk_xor__ssse3_lowp+0xffffffff8180834c>
   DB  128,129,128,129,128,129,128         ; addb          $0x80,-0x7e7f7e80(%rcx)
   DB  129,128,129,128,1,2,5,6,9,10        ; addl          $0xa090605,0x2018081(%rax)
   DB  13,14,9,10,13                       ; or            $0xd0a090e,%eax
diff --git a/src/jumper/SkJumper_stages.cpp b/src/jumper/SkJumper_stages.cpp
index 2dd1c1d..63c4d46 100644
--- a/src/jumper/SkJumper_stages.cpp
+++ b/src/jumper/SkJumper_stages.cpp
@@ -520,12 +520,6 @@
     b = tmp;
 }
 
-STAGE(swap_rb_dst) {
-    auto tmp = dr;
-    dr = db;
-    db = tmp;
-}
-
 STAGE(move_src_dst) {
     dr = r;
     dg = g;
@@ -906,6 +900,29 @@
     store(ptr, px, tail);
 }
 
+STAGE(load_bgra) {
+    auto ptr = *(const uint32_t**)ctx + x;
+    from_8888(load<U32>(ptr, tail), &b,&g,&r,&a);
+}
+STAGE(load_bgra_dst) {
+    auto ptr = *(const uint32_t**)ctx + x;
+    from_8888(load<U32>(ptr, tail), &db,&dg,&dr,&da);
+}
+STAGE(gather_bgra) {
+    const uint32_t* ptr;
+    U32 ix = ix_and_ptr(&ptr, ctx, r,g);
+    from_8888(gather(ptr, ix), &b,&g,&r,&a);
+}
+STAGE(store_bgra) {
+    auto ptr = *(uint32_t**)ctx + x;
+
+    U32 px = round(b, 255.0f)
+           | round(g, 255.0f) <<  8
+           | round(r, 255.0f) << 16
+           | round(a, 255.0f) << 24;
+    store(ptr, px, tail);
+}
+
 STAGE(load_f16) {
     auto ptr = *(const uint64_t**)ctx + x;
 
diff --git a/src/jumper/SkJumper_stages_lowp.cpp b/src/jumper/SkJumper_stages_lowp.cpp
index a683738..b07cd3a 100644
--- a/src/jumper/SkJumper_stages_lowp.cpp
+++ b/src/jumper/SkJumper_stages_lowp.cpp
@@ -249,6 +249,19 @@
     store(ptr, to_8888(r,g,b,a), tail);
 }
 
+STAGE(load_bgra) {
+    auto ptr = *(const uint32_t**)ctx + x;
+    from_8888(load<U32>(ptr, tail), &b,&g,&r,&a);
+}
+STAGE(load_bgra_dst) {
+    auto ptr = *(const uint32_t**)ctx + x;
+    from_8888(load<U32>(ptr, tail), &db,&dg,&dr,&da);
+}
+STAGE(store_bgra) {
+    auto ptr = *(uint32_t**)ctx + x;
+    store(ptr, to_8888(b,g,r,a), tail);
+}
+
 STAGE(load_a8) {
     auto ptr = *(const uint8_t**)ctx + x;
     r = g = b = 0.0f;
@@ -334,12 +347,6 @@
     r = b;
     b = tmp;
 }
-STAGE(swap_rb_dst) {
-    auto tmp = dr;
-    dr = db;
-    db = tmp;
-}
-
 STAGE(move_src_dst) {
     dr = r;
     dg = g;
diff --git a/src/shaders/SkImageShader.cpp b/src/shaders/SkImageShader.cpp
index a197812..859bb15 100644
--- a/src/shaders/SkImageShader.cpp
+++ b/src/shaders/SkImageShader.cpp
@@ -336,8 +336,8 @@
             case kGray_8_SkColorType:    p->append(SkRasterPipeline::gather_g8,   gather); break;
             case kRGB_565_SkColorType:   p->append(SkRasterPipeline::gather_565,  gather); break;
             case kARGB_4444_SkColorType: p->append(SkRasterPipeline::gather_4444, gather); break;
-            case kRGBA_8888_SkColorType:
-            case kBGRA_8888_SkColorType: p->append(SkRasterPipeline::gather_8888, gather); break;
+            case kBGRA_8888_SkColorType: p->append(SkRasterPipeline::gather_bgra, gather); break;
+            case kRGBA_8888_SkColorType: p->append(SkRasterPipeline::gather_8888, gather); break;
             case kRGBA_F16_SkColorType:  p->append(SkRasterPipeline::gather_f16,  gather); break;
             default: SkASSERT(false);
         }
@@ -396,11 +396,7 @@
         p->append(SkRasterPipeline::move_dst_src);
     }
 
-    auto effective_color_type = [](SkColorType ct) {
-        return ct == kIndex_8_SkColorType ? kN32_SkColorType : ct;
-    };
-
-    if (effective_color_type(info.colorType()) == kBGRA_8888_SkColorType) {
+    if (info.colorType() == kIndex_8_SkColorType && kN32_SkColorType == kBGRA_8888_SkColorType) {
         p->append(SkRasterPipeline::swap_rb);
     }
     if (info.colorType() == kAlpha_8_SkColorType) {