r/devsarg • u/Apprehensive_Foot671 • 5d ago
proyectos Renuncié a Mercado Libre para desarrollar el primer motor de STT a bajo nivel de LATAM
Buenas gente. Mi nombre es Mateo, y esta es una historia que todavía no sé si es de éxito, pero ojalá algún día lo sea.
Laburaba en Mercado Libre y renuncié para meterme de lleno en un problema que me venía haciendo ruido hace rato: la infraestructura de voz que usa Latinoamérica tiene baches por todos lados. Las transcripciones pierden accuracy apenas aparece un dialecto distinto, como si hablara igual una abuela de Medellín que un pibe de Lanús. Las curvas de concurrencia no siempre son negociables con los proveedores grandes. Y ni hablar del TTS, ahí el mercado está recontra desamparado.
Y esto no es una molestia estética, es plata y son riesgos reales. Hay empresas acá auditando miles de llamadas por mes con transcripciones donde "ibuprofeno 600" aparece como "buprofeno seiscientos". Call centers tomando decisiones sobre conversaciones donde el motor directamente se comió turnos enteros y nadie se enteró. Ese es el dolor. Le estás pidiendo a un motor gringo que entienda a una señora apurada en un mostrador con ruido de fondo, y el motor hace lo que puede, que es poco.
Así nació Zorzal-1. Nuestro motor propio, desarrollado a bajo nivel en C++. Lo entrenamos y calibramos al revés que todos: con los casos que rompen a los demás. Conversaciones clínicas, llamadas técnicas con jerga que no existe en ningún corpus, audio mono con cinco personas pisándose. Ahí descubrimos cosas que no vimos en ningún paper, como que cuando una ventana de audio viene sucia el decoder se envenena y arrastra a las ventanas siguientes, entra en bucle repitiendo una frase, o convierte 40% del audio en nada.
Después vino la linda: medirnos en público. El benchmark interno lo corrimos contra más de 300 audios reales, pero publicamos 13 (transcribir llamadas palabra por palabra para armar la referencia es un infierno, y el resto del dataset es justamente donde está nuestro laburo, no lo vamos a regalar). Con esas 13 llamadas reales de Argentina, Colombia, México y Perú nos pusimos contra Soniox, AssemblyAI, Speechmatics, Deepgram, Gladia, Elevenlabs y Rev.ai. Salimos cuartos, a 3 puntos del primero. Los tres de arriba levantaron entre 90 y 158 millones de dólares. Nosotros, cero. Y cobramos de 4 a 8 veces menos: $0.025 la hora contra $0.10-0.21 de ellos. Hoy en accuracy por dólar no nos gana nadie, y no lo digo yo, está el número publicado con los audios al lado.
Lo loco es que funcionó donde menos esperaba. Publicar el benchmark saliendo cuartos (con bug confesado incluido, porque durante semanas medimos con una config distinta a la de producción y preferimos contarlo) nos trajo más confianza que cualquier campaña. Ya estamos cerrando contratos B2B con empresas que procesan miles de horas por mes, gente que llegó justamente porque mostramos dónde perdemos.
El plan es el primer puesto. Todo el audio y el código están acá:
orchardrun.com/benchmark
github.com/Orchard-Run/orchard-stt-bench
Se aceptan preguntas y críticas, pero sobre todo audios imposibles. Si tenés una llamada con acento cerrado, micrófono horrible o gente hablándose encima que rompa los transcriptores actuales, mandámela y la sumo al benchmark. En serio, es lo que más nos sirve.
EDIT: les dejo el enlace al discord del proyecto por si les interesa unirse:






