גוגל הכריזה רשמית על Gemini 3.5 Transcribe, מודל דיבור-לטקסט חדש שנועד לקלוט שטף דיבור אנושי, יומיומי ומבולגן, ולהמיר אותו ישירות לטקסט כתוב, מעוצב ומדויק ללא צורך בהכתבה מכנית של סימני פיסוק.
בשונה ממערכות תמלול מסורתיות שנכשלות ברעשי רקע, בסלנג מקצועי או בהיסוסים, המודל החדש נשען על הבנת שפה עמוקה. הוא מבצע עריכה לשונית בזמן אמת, מנפה שיבושים ומספק פלט נקי גם בתנאי שמע ירודים ומורכבים.
דיוק משופר וסינון גמגומים בזמן אמת
הפיתוח מציג שיפור של 70% בזמן ההגעה לתמלול הסופי לעומת מודל Chirp 3 מ-2025. שיעור שגיאות המילים (WER) ירד ל-2.6% בלבד בקבצים מוקלטים ול-4.0% בשידור חי, מה שמציב רף ביצועים חדש בתחום עיבוד הקול.
הטכנולוגיה מוחקת אוטומטית מילות היסוס ומילוי כמו 'אממ' או 'אהה', ומזהה חרטות ותיקונים עצמיים של הדובר תוך כדי משפט. המערכת מבינה את כוונת המשתמש ומעדכנת את הטקסט הסופי מבלי לדרוש עריכה ידנית נוספת.
לצד תמיכה בלמעלה מ-85 שפות ומבטאים, המודל מבצע הפרדה אוטומטית בין עד שלושה דוברים כולל חותמות זמן מדויקות. בנוסף, הוא תומך בהפעלת פונקציות ומאציל משימות מורכבות למודלי בינה מלאכותית מקבילים.
זמינות באקוסיסטם ובכלי הפיתוח
גוגל כבר החלה בהטמעה: מקלדת Gboard באנדרואיד קיבלה את תכונת Rambler לסידור מחשבות מדוברות, אפליקציית macOS משלבת ניתוח מסך עם הכתבה, ובקרוב ישולב כלי הכתבה מובנה ישירות בדפדפן כרום לכל שדה טקסט.
עבור מפתחים וארגונים, המודל זמין כעת בגרסת תצוגה מקדימה דרך ה-API של Google AI Studio ובפלטפורמת Gemini Enterprise, עם אפשרות לחיבור ישיר לסוכנים קוליים בזמן אמת ולערוצי שירות לקוחות מתקדמים.
טעינו? נתקן! אם מצאתם טעות בכתבה, נשמח שתשתפו אותנו
