کیفیت یک سامانه تبدیل گفتار فارسی به متن باید در همان محیطی سنجیده شود که قرار است استفاده شود. نتیجه یک فایل استودیویی با مکالمه تلفنی، جلسه چندنفره، صدای محیط صنعتی یا فرمان کوتاه یکسان نیست. به همین دلیل انتخاب موتور صرفاً بر اساس یک رتبهبندی عمومی میتواند گمراهکننده باشد.
مجموعه آزمون واقعی بسازید
نمونههای صوتی باید نماینده کاربران، لهجهها، تجهیزات ضبط و نویز محیط باشند. بهتر است مجموعه آزمون از دادههای مجاز و ناشناسشده تشکیل شود و متن مرجع دقیق برای هر فایل وجود داشته باشد. بدون متن مرجع، مقایسه موتورهای مختلف بیشتر سلیقهای خواهد بود.
معیارهایی فراتر از نرخ خطا
- تشخیص درست نام اشخاص، مکانها و واژگان تخصصی
- تبدیل دقیق اعداد، تاریخ، ساعت و واحدهای اندازهگیری
- تفکیک گویندگان در جلسه یا مرکز تماس
- امکان دریافت خروجی لحظهای برای تجربه تعاملی
- زمان پردازش فایلهای طولانی و مصرف پردازنده یا GPU
- امکان افزودن واژهنامه و اصلاح پس از پردازش
- سیاست نگهداری صدا و متن و محل پردازش داده
یک موتور ممکن است نرخ خطای کلی مناسبی داشته باشد، اما نام مشتری یا شماره پیگیری را اشتباه بنویسد؛ در فرایند کسبوکار همین خطاهای کوچک بیشترین هزینه را ایجاد میکنند.
نقش نرمالسازی فارسی
خروجی خام معمولاً برای ورود مستقیم به نرمافزار آماده نیست. یک لایه نرمالسازی میتواند شکل حروف فارسی، فاصله و نیمفاصله، اعداد، تاریخ، نشانهگذاری و واژگان خاص را یکدست کند. این لایه باید بر اساس کاربرد تنظیم شود؛ تبدیل «بیست و سه» به عدد در متن ادبی و فرم ثبت سفارش الزام یکسانی ندارد.
معماری چندموتوره
وابستگی کامل به یک موتور، امکان بهبود و کنترل هزینه را محدود میکند. در یک هاب گفتار، API ثابت میماند و موتور بر اساس نوع درخواست، زبان، حساسیت داده یا کیفیت موردنیاز انتخاب میشود. نتیجهها قابل مقایسهاند و در صورت اختلال، مسیر جایگزین وجود دارد.
تصمیم نهایی
ابتدا معیار پذیرش را بنویسید، سپس دو یا سه گزینه را روی مجموعه آزمون واقعی بسنجید. دقت، سرعت، هزینه، محرمانگی و قابلیت یکپارچهسازی باید در یک جدول تصمیم کنار هم قرار گیرند. موتور مناسب، موتوری نیست که در همه شرایط بهترین ادعا را دارد؛ موتوری است که در فرایند واقعی شما نتیجه قابل اتکاتری میدهد.