Detalle de la noticia

Ciberseguridad

La transcripción Speech-to-Text Client-Side que no puntúa correctamente por no usar un LLM-MM

Fuente: El Lado del Mal Publicado: 28/09/2026 · 05:01 UTC
Compartir:
Ciberseguridad La transcripción Speech-to-Text Client-Side que no puntúa correctamente por no usar un LLM-MM
Imagen: El Lado del Mal

No soy mucho de en­viar au­dios por las apli­ca­cio­nes de men­sa­je­ría. Lo hago sólo con ami­gos, y gente muy cer­ca­na, pero no me gusta mucho usar la voz. Va de­ma­sia­do de mí en los au­dios. Sin em­bar­go, es mucho más rá­pi­do que es­cri­bir. Pero... ¿por qué no usar el Speech-To-Text del smartpho­ne? Pues por­que no suelo tener buena ex­pe­rien­cia con la pun­tua­ción. Eso es lo que es­ta­ba pen­san­do ayer do­min­go, tra­ba­jan­do vien­do el puen­te del 25 de Abril de Lis­boa , así que quise pro­bar si, con la lle­ga­da de los LLMs Multi Mo­da­les, había me­jo­ra­do. Fi­gu­ra 1: La trans­crip­ción Speech-to-Text Client-Side que no pun­túa co­rrec­ta­men­te por no usar un LLM-MM Pri­me­ra prue­ba, usan­do Twit­ter/X en iOS , y el botón de Speech-To-Text del te­cla­do del iPho­ne 17 Pro Max que tengo, con un men­sa­je muy sen­ci­llo. Aquí te­néis el re­sul­ta­do, muy al es­ti­lo de los pri­me­ros Cog­ni­ti­ve Ser­vi­ces del año 2016 (si no an­te­rio­res) . Han pa­sa­do 10 años ya para se­guir con esta ca­li­dad. Fi­gu­ra 2: Speech-to-Text del te­cla­do de iPho­ne. No pone el punto ni las in­te­rro­ga­cio­nes. Ni una coma. Six-Seven nada más. Lo si­guien­te que hice fue pro­bar­lo en Ge­mi­ni , pero ahora pi­dién­do­le que me lo hi­cie­ra bien con un Prompt y su­bién­do­le un audio, para que hi­cie­ra todo el pro­ce­so en bac­kend (Ser­ver-Side) . El re­sul­ta­do es muy bueno, que es lo que yo estoy es­pe­ran­do de un Speech-to-Text en el ter­mi­nal móvil. Fi­gu­ra 3: Ge­mi­ni lo borda. Co­rrec­to. Así que, como lo hizo muy bien Ge­mi­ni , que es un LLM-MM , le pre­gun­té por qué la so­lu­cio­nes Speech-To-Text en Smartpho­ne tie­nen tan­tas ca­ren­cias a la hora de poner las pun­tua­cio­nes co­rrec­tas, y aquí está la ex­pli­ca­ción que me dio. Fi­gu­ra 4: Pro­ble­mas del Speech-to-Text para pun­tuar co­rrec­ta­men­te. Por su­pues­to, la pri­me­ra es que no se dic­tan los pun­tos y las comas, ni las in­te­rro­ga­cio­nes o ex­cla­ma­cio­nes. Evi­den­te, pero en el mundo que es­ta­mos hoy en día, l os mo­de­los de IA re­co­no­cen las en­to­na­cio­nes con fa­ci­li­dad, así como se hace el aná­li­sis de sen­ti­mien­to, que de eso hemos ha­bla­do mucho . Basta con un cla­si­fi­ca­dor de Ma­chi­ne-Lear­ning para hacer eso. Fi­gu­ra 5: Libro de Ma­chi­ne Lear­ning apli­ca­do a Ci­ber­se­gu­ri­dad de Car­men To­rrano , Fran Ra­mí­rez , Pa­lo­ma Re­cue­ro, José To­rres y San­tia­go Her­nán­dez Lo si­guien­te que dice es que las pau­sas pue­den ser am­bi­güas, bueno, pero se puede hacer mejor que lo que se hace ahora. Tam­bién dice que puede afec­tar la di­fe­ren­te forma de en­to­nar que se tiene o que el con­tex­to puede ser in­de­ter­mi­na­do. Ade­más del uso de fór­mu­las ha­bla­das, como las mu­le­ti­llas. Nada, no se lo com­pro, de­be­ría ser mucho mejor que esta prue­ba que he hecho con Notas de iPho­ne . Fi­gu­ra 6: Ni una pun­tua­ción. Visto esto, le pre­gun­té a Ge­mi­ni , si estos pro­ble­mas exis­ten, cómo es po­si­ble qué él lo hu­bie­ra hecho tan bien con el audio que le había su­bi­do, y la res­pues­ta se re­su­me en... Yo soy un LLM-MM de pri­mer nivel, para mí es tri­vial. Fi­gu­ra 7: La res­pues­ta de por qué lo hace él tan bien Por su­pues­to, hay una di­fe­ren­cia fun­da­men­tal entre hacer un aná­li­sis en tiem­po real del flujo de audio en " stream " a ha­cer­lo con el fi­che­ro com­ple­to en " blo­que ", pero aún así es muy me­jo­ra­ble. De hecho, este Prompt se lo he su­bi­do usan­do el Speeh-To-Text en Goo­gle Chro­me en la we­bapp de Ge­mi­ni - eje­cu­tán­do­se el Client-Side - , y la ver­dad que lo hace muy bien. Fi­gu­ra 8: Usan­do el Speech-To-Text de Ge­mi­ni en Goo­gle Chro­me Client-Side Lo dicho, creo que si estos sis­te­mas de Speech-To-Text en Client-Side fun­cio­na­ra mejor - que es­ta­mos en la era Ele­ven­Labs y tra­duc­ción en tiem­po real de con­ver­sa­cio­nes, la gente haría menos uso de los en­víos de au­dios, y sería un avan­ce para los usua­rios, por­que a veces hay que es­cri­bir tex­tos muy lar­gos por no en­viar el audio a una per­so­na que no se quie­re en­viar. ¡Sa­lu­dos Ma­lig­nos! Autor: Chema Alon­so ( Con­tac­tar con Chema Alon­so ) Únete al foro de Ci­ber­se­gu­ri­dad de Chema Alon­so en My­Pu­bli­cIn­box Sigue Un in­for­má­ti­co en el lado del mal RSS 0xWord - Con­tac­ta con Chema Alon­so en My­Pu­bli­cIn­box.com…