کیفیت یک سامانه تبدیل گفتار فارسی به متن باید در همان محیطی سنجیده شود که قرار است استفاده شود. نتیجه یک فایل استودیویی با مکالمه تلفنی، جلسه چندنفره، صدای محیط صنعتی یا فرمان کوتاه یکسان نیست. به همین دلیل انتخاب موتور صرفاً بر اساس یک رتبه‌بندی عمومی می‌تواند گمراه‌کننده باشد.

مجموعه آزمون واقعی بسازید

نمونه‌های صوتی باید نماینده کاربران، لهجه‌ها، تجهیزات ضبط و نویز محیط باشند. بهتر است مجموعه آزمون از داده‌های مجاز و ناشناس‌شده تشکیل شود و متن مرجع دقیق برای هر فایل وجود داشته باشد. بدون متن مرجع، مقایسه موتورهای مختلف بیشتر سلیقه‌ای خواهد بود.

معیارهایی فراتر از نرخ خطا

  • تشخیص درست نام اشخاص، مکان‌ها و واژگان تخصصی
  • تبدیل دقیق اعداد، تاریخ، ساعت و واحدهای اندازه‌گیری
  • تفکیک گویندگان در جلسه یا مرکز تماس
  • امکان دریافت خروجی لحظه‌ای برای تجربه تعاملی
  • زمان پردازش فایل‌های طولانی و مصرف پردازنده یا GPU
  • امکان افزودن واژه‌نامه و اصلاح پس از پردازش
  • سیاست نگهداری صدا و متن و محل پردازش داده

یک موتور ممکن است نرخ خطای کلی مناسبی داشته باشد، اما نام مشتری یا شماره پیگیری را اشتباه بنویسد؛ در فرایند کسب‌وکار همین خطاهای کوچک بیشترین هزینه را ایجاد می‌کنند.

نقش نرمال‌سازی فارسی

خروجی خام معمولاً برای ورود مستقیم به نرم‌افزار آماده نیست. یک لایه نرمال‌سازی می‌تواند شکل حروف فارسی، فاصله و نیم‌فاصله، اعداد، تاریخ، نشانه‌گذاری و واژگان خاص را یکدست کند. این لایه باید بر اساس کاربرد تنظیم شود؛ تبدیل «بیست و سه» به عدد در متن ادبی و فرم ثبت سفارش الزام یکسانی ندارد.

معماری چندموتوره

وابستگی کامل به یک موتور، امکان بهبود و کنترل هزینه را محدود می‌کند. در یک هاب گفتار، API ثابت می‌ماند و موتور بر اساس نوع درخواست، زبان، حساسیت داده یا کیفیت موردنیاز انتخاب می‌شود. نتیجه‌ها قابل مقایسه‌اند و در صورت اختلال، مسیر جایگزین وجود دارد.

تصمیم نهایی

ابتدا معیار پذیرش را بنویسید، سپس دو یا سه گزینه را روی مجموعه آزمون واقعی بسنجید. دقت، سرعت، هزینه، محرمانگی و قابلیت یکپارچه‌سازی باید در یک جدول تصمیم کنار هم قرار گیرند. موتور مناسب، موتوری نیست که در همه شرایط بهترین ادعا را دارد؛ موتوری است که در فرایند واقعی شما نتیجه قابل اتکاتری می‌دهد.