חדש - async simple: סוכן AI לעסק תוך דקות להתחיל עכשיו
Async
Async
התחברות לקבל דמו
ידע מעמיק

זיהוי דיבור בעברית (ASR)

איך מערכות AI מבינות עברית מדוברת, סלנג, מבטאים ורעש רקע - ומה משפיע על הדיוק.

מבוא

זיהוי דיבור (Speech-to-Text, ASR) הוא השלב הראשון בשרשרת של סוכן AI קולי: הפיכת הקול המדובר לטקסט. ככל שהשלב הזה מדויק יותר, כל מה שבא אחריו מדויק יותר.

איך זה עובד

המערכת מקבלת זרם אודיו ומפענחת אותו למילים תוך כדי הדיבור. במקום לחכות לסוף המשפט, הזיהוי רץ ב-streaming - וזה תנאי הכרחי לזמן תגובה נמוך.

למה עברית קשה במיוחד

  • כתיב חסר ניקוד - אותה מילה כתובה יכולה להיקרא בכמה אופנים.
  • סלנג ומילים שאולות - שפת דיבור יומיומית רחוקה מעברית "תקנית".
  • מעבר בין שפות (code-switching) - "תקבע לי תור ל-follow up מחר" באותו משפט.
  • הטיות ושורשים - מבנה מורפולוגי עשיר שמקשה על מודלים גנריים.

רעש, מבטאים ותנאי שטח

לקוחות מתקשרים מהרחוב, מהרכב וממקומות רועשים, עם מבטאים שונים ולפעמים קו לא יציב. מנוע שמותאם לעברית מדוברת מתמודד עם אלה ושומר על דיוק - בעוד מנוע גנרי "נשבר".

מה משפיע על הדיוק

איכות הקו והאודיו, רמת הרעש, המבטא, וכמה ההקשר העסקי הוגדר מראש. כשהמערכת יודעת על מה מדברים - שמות שירותים, מוצרים ומונחים - הדיוק קופץ. לכן סוכן טוב נבנה סביב מאגר הידע של העסק ולא כמודל כללי.

איך לבדוק ספק

  • בקשו הדגמה על הקלטה אמיתית עם רעש רקע, לא תנאי מעבדה.
  • בדקו מה קורה עם מבטא, סלנג ומעבר לאנגלית.
  • שאלו איך הזיהוי משתלב עם זמן התגובה הכולל.

נושאים קשורים

שאלות נפוצות

שאלות נפוצות.

דברו עם הצוות
זיהוי הדיבור עובד טוב בעברית?

כן, עם מנוע מותאם לעברית מדוברת - כולל סלנג, מבטאים ורעש רקע. דיוק עולה כשההקשר העסקי מוגדר מראש.

מה ההבדל בין STT ל-NLU?

STT הופך קול לטקסט; NLU מבין את הכוונה מאחורי הטקסט. שניהם נדרשים לשיחה אמיתית.

מקורות

להמשך קריאה

רוצים מוקד קולי שעונה לכל שיחה?

נראה לכם איך המוקד הקולי עונה על שיחות אמיתיות של העסק.