Voz a texto
Cuándo usarlo
Usa STT para transcribir audios de usuario, notas de voz, grabaciones cortas o entradas habladas antes de procesarlas con un modelo de texto.
Modelo y endpoint
| Endpoint | POST /audio/transcriptions |
| Modelo | transcribe |
| Uso orientativo | 0,5% / minuto |
Ejemplo con curl
curl https://inference.devexpert.io/v1/audio/transcriptions \ -H "Authorization: Bearer $DEVEXPERT_API_KEY" \ -F "model=transcribe" \ -F "file=@./audio.mp3"
Ejemplo en TypeScript
import fs from "node:fs";
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.DEVEXPERT_API_KEY,
baseURL: "https://inference.devexpert.io/v1",
});
const transcription = await client.audio.transcriptions.create({
model: "transcribe",
file: fs.createReadStream("audio.mp3"),
});
console.log(transcription.text); Ejemplo en Python
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEVEXPERT_API_KEY"],
base_url="https://inference.devexpert.io/v1",
)
with open("audio.mp3", "rb") as audio:
transcription = client.audio.transcriptions.create(
model="transcribe",
file=audio,
)
print(transcription.text) Errores habituales
- Enviar JSON en lugar de
multipart/form-data. - Subir archivos demasiado largos para una prueba inicial.
- Olvidar abrir el archivo en modo binario en Python.