x86: include x86inc.asm in x86util.asm

[ffmpeg] / libavcodec / x86 / fmtconvert.asm
diff --git a/libavcodec/x86/fmtconvert.asm b/libavcodec/x86/fmtconvert.asm

index d6210897f6c4b6e48969e4be6ee719c52575ec54..d59c43ba7a76eb93212358d0e97297ec1d2bb286 100644 (file)
--- a/libavcodec/x86/fmtconvert.asm
+++ b/libavcodec/x86/fmtconvert.asm
@@ -19,7 +19,6 @@
  ;* Foundation, Inc., 51 Franklin Street, Fifth Floor, Boston, MA 02110-1301 USA
  ;******************************************************************************
  
-%include "x86inc.asm"
  %include "x86util.asm"
  
  SECTION_TEXT
@@ -28,14 +27,14 @@ SECTION_TEXT
  ; void int32_to_float_fmul_scalar(float *dst, const int *src, float mul, int len);
  ;---------------------------------------------------------------------------------
  %macro INT32_TO_FLOAT_FMUL_SCALAR 2
-%ifdef UNIX64
+%if UNIX64
  cglobal int32_to_float_fmul_scalar_%1, 3,3,%2, dst, src, len
  %else
  cglobal int32_to_float_fmul_scalar_%1, 4,4,%2, dst, src, mul, len
  %endif
-%ifdef WIN64
+%if WIN64
      SWAP 0, 2
-%elifdef ARCH_X86_32
+%elif ARCH_X86_32
      movss   m0, mulm
  %endif
      SPLATD  m0
@@ -115,6 +114,84 @@ FLOAT_TO_INT16 sse, 0
  FLOAT_TO_INT16 3dnow, 0
  %undef cvtps2pi
  
+;------------------------------------------------------------------------------
+; void ff_float_to_int16_step(int16_t *dst, const float *src, long len, long step);
+;------------------------------------------------------------------------------
+%macro FLOAT_TO_INT16_STEP 2
+cglobal float_to_int16_step_%1, 4,7,%2, dst, src, len, step, step3, v1, v2
+    add       lenq, lenq
+    lea       srcq, [srcq+2*lenq]
+    lea     step3q, [stepq*3]
+    neg       lenq
+.loop:
+%ifidn %1, sse2
+    cvtps2dq    m0, [srcq+2*lenq   ]
+    cvtps2dq    m1, [srcq+2*lenq+16]
+    packssdw    m0, m1
+    movd       v1d, m0
+    psrldq      m0, 4
+    movd       v2d, m0
+    psrldq      m0, 4
+    mov     [dstq], v1w
+    mov  [dstq+stepq*4], v2w
+    shr        v1d, 16
+    shr        v2d, 16
+    mov  [dstq+stepq*2], v1w
+    mov  [dstq+step3q*2], v2w
+    lea       dstq, [dstq+stepq*8]
+    movd       v1d, m0
+    psrldq      m0, 4
+    movd       v2d, m0
+    mov     [dstq], v1w
+    mov  [dstq+stepq*4], v2w
+    shr        v1d, 16
+    shr        v2d, 16
+    mov  [dstq+stepq*2], v1w
+    mov  [dstq+step3q*2], v2w
+    lea       dstq, [dstq+stepq*8]
+%else
+    cvtps2pi    m0, [srcq+2*lenq   ]
+    cvtps2pi    m1, [srcq+2*lenq+ 8]
+    cvtps2pi    m2, [srcq+2*lenq+16]
+    cvtps2pi    m3, [srcq+2*lenq+24]
+    packssdw    m0, m1
+    packssdw    m2, m3
+    movd       v1d, m0
+    psrlq       m0, 32
+    movd       v2d, m0
+    mov     [dstq], v1w
+    mov  [dstq+stepq*4], v2w
+    shr        v1d, 16
+    shr        v2d, 16
+    mov  [dstq+stepq*2], v1w
+    mov  [dstq+step3q*2], v2w
+    lea       dstq, [dstq+stepq*8]
+    movd       v1d, m2
+    psrlq       m2, 32
+    movd       v2d, m2
+    mov     [dstq], v1w
+    mov  [dstq+stepq*4], v2w
+    shr        v1d, 16
+    shr        v2d, 16
+    mov  [dstq+stepq*2], v1w
+    mov  [dstq+step3q*2], v2w
+    lea       dstq, [dstq+stepq*8]
+%endif
+    add       lenq, 16
+    js .loop
+%ifnidn %1, sse2
+    emms
+%endif
+    REP_RET
+%endmacro
+
+INIT_XMM
+FLOAT_TO_INT16_STEP sse2, 2
+INIT_MMX
+FLOAT_TO_INT16_STEP sse, 0
+%define cvtps2pi pf2id
+FLOAT_TO_INT16_STEP 3dnow, 0
+%undef cvtps2pi
  
  ;-------------------------------------------------------------------------------
  ; void ff_float_to_int16_interleave2(int16_t *dst, const float **src, long len);
@@ -171,7 +248,7 @@ FLOAT_TO_INT16_INTERLEAVE2 sse2
  %macro PSWAPD_SSE 2
      pshufw %1, %2, 0x4e
  %endmacro
-%macro PSWAPD_3DN1 2
+%macro PSWAPD_3DNOW 2
      movq  %1, %2
      psrlq %1, 32
      punpckldq %1, %2
@@ -179,9 +256,8 @@ FLOAT_TO_INT16_INTERLEAVE2 sse2
  
  %macro FLOAT_TO_INT16_INTERLEAVE6 1
  ; void float_to_int16_interleave6_sse(int16_t *dst, const float **src, int len)
-cglobal float_to_int16_interleave6_%1, 2,7,0, dst, src, src1, src2, src3, src4, src5
-%ifdef ARCH_X86_64
-    %define lend r10d
+cglobal float_to_int16_interleave6_%1, 2,8,0, dst, src, src1, src2, src3, src4, src5, len
+%if ARCH_X86_64
      mov     lend, r2d
  %else
      %define lend dword r2m
@@ -229,10 +305,10 @@ cglobal float_to_int16_interleave6_%1, 2,7,0, dst, src, src1, src2, src3, src4,
  %define pswapd PSWAPD_SSE
  FLOAT_TO_INT16_INTERLEAVE6 sse
  %define cvtps2pi pf2id
-%define pswapd PSWAPD_3DN1
+%define pswapd PSWAPD_3DNOW
  FLOAT_TO_INT16_INTERLEAVE6 3dnow
  %undef pswapd
-FLOAT_TO_INT16_INTERLEAVE6 3dn2
+FLOAT_TO_INT16_INTERLEAVE6 3dnowext
  %undef cvtps2pi
  
  ;-----------------------------------------------------------------------------
@@ -240,9 +316,8 @@ FLOAT_TO_INT16_INTERLEAVE6 3dn2
  ;-----------------------------------------------------------------------------
  
  %macro FLOAT_INTERLEAVE6 2
-cglobal float_interleave6_%1, 2,7,%2, dst, src, src1, src2, src3, src4, src5
-%ifdef ARCH_X86_64
-    %define lend r10d
+cglobal float_interleave6_%1, 2,8,%2, dst, src, src1, src2, src3, src4, src5, len
+%if ARCH_X86_64
      mov     lend, r2d
  %else
      %define lend dword r2m
@@ -328,7 +403,7 @@ cglobal float_interleave2_%1, 3,4,%2, dst, src, len, src1
      mov     src1q, [srcq+gprsize]
      mov      srcq, [srcq        ]
      sub     src1q, srcq
-.loop
+.loop:
      MOVPS      m0, [srcq             ]
      MOVPS      m1, [srcq+src1q       ]
      MOVPS      m3, [srcq      +mmsize]