Voz a texto

Cuándo usarlo

Usa STT para transcribir audios de usuario, notas de voz, grabaciones cortas o entradas habladas antes de procesarlas con un modelo de texto.

Modelo y endpoint

Endpoint POST /audio/transcriptions
Modelo transcribe
Uso orientativo 0,5% / minuto

Ejemplo con curl

curl https://inference.devexpert.io/v1/audio/transcriptions \
  -H "Authorization: Bearer $DEVEXPERT_API_KEY" \
  -F "model=transcribe" \
  -F "file=@./audio.mp3"

Ejemplo en TypeScript

import fs from "node:fs";
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.DEVEXPERT_API_KEY,
  baseURL: "https://inference.devexpert.io/v1",
});

const transcription = await client.audio.transcriptions.create({
  model: "transcribe",
  file: fs.createReadStream("audio.mp3"),
});

console.log(transcription.text);

Ejemplo en Python

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEVEXPERT_API_KEY"],
    base_url="https://inference.devexpert.io/v1",
)

with open("audio.mp3", "rb") as audio:
    transcription = client.audio.transcriptions.create(
        model="transcribe",
        file=audio,
    )

print(transcription.text)

Errores habituales

  • Enviar JSON en lugar de multipart/form-data.
  • Subir archivos demasiado largos para una prueba inicial.
  • Olvidar abrir el archivo en modo binario en Python.