זיהוי דיבור (Speech-to-Text, או STT) הוא השלב הראשון בשרשרת של סוכן AI קולי: המרת הקול המדובר לטקסט. ככל שהשלב הזה מדויק יותר, כל מה שבא אחריו - ההבנה, ההיגיון העסקי והתשובה - מדויק יותר.
איך זה עובד
המערכת מקבלת זרם אודיו מהשיחה ומפענחת אותו למילים תוך כדי הדיבור. במקום לחכות לסוף המשפט, הזיהוי רץ ב-streaming כדי לאפשר זמן תגובה נמוך.
האתגר של עברית
עברית מציבה אתגרים ייחודיים: כתיב חסר ניקוד, שורשים, סלנג, ומעברים מהירים בין עברית לאנגלית באותו משפט. מודלים שמותאמים לעברית מדוברת מתמודדים עם רעש רקע, מבטאים שונים ושיבושי קו - ושומרים על דיוק גבוה גם בתנאי שטח אמיתיים.
למה ההקשר העסקי חשוב
כשהמערכת יודעת מראש על מה מדברים - שמות שירותים, מוצרים, מונחים מקצועיים - הדיוק עולה. לכן הסוכן הקולי נבנה סביב מאגר הידע של העסק, ולא כמודל גנרי. אחרי הזיהוי, הסוכן מנתח את הכוונה ומגיב באמצעות המרת טקסט לדיבור.