مدیرانی که تجربه کار با تیم فروش را داشته‌اند، می‌دانند که در پایان روز با صدها دقیقه مکالمه تلفنی مواجه‌اند که در سیستم‌شان ثبت شده و باید تحلیل شود. بین این تماس‌ها احتمالاً چند مکالمه خیلی مهم وجود دارد که آن تجربه‌های ناب و آن فوت‌های کوزه‌گری در آن‌ها نهفته. اما چه کسی می‌رود این همه راه را؟ کدام مدیر وقت دارد که این همه تماس را بشنود؟ دقیقاً همین‌جاست که قابلیت تبدیل تماس به متن اهمیت خودش را نشان می‌دهد... 

تبدیل تماس به متن چیست و چه کاربردی دارد؟

تبدیل تماس به متن یا Speech to Text یا Call Transcription به فرایندی گفته می‌شود که صدای یک مکالمه تلفنی توسط فناوری‌های تشخیص خودکارِ گفتار یا Automatic Speech Recognition (ASR) پردازش شده و به یک متن قابل خواندن تبدیل می‌شود.

در ساده‌ترین حالت، سیستم یک فایل صوتی یا جریان زنده صوت را دریافت می‌کند، بخش‌های گفتاری آن را تشخیص می‌دهد و کلمات اداشده را به شکل متن برمی‌گرداند. سرویس‌های حرفه‌ای امروزی البته می‌توانند اطلاعات بیشتری نیز تولید کنند؛ برای مثال زمان شروع و پایان کلمات، تشخیص گویندگان مختلف و حتی اطلاعات تحلیلی درباره مکالمه.

تبدیل تماس به متن چه تفاوتی با تبدیل صدای معمولی به متن دارد؟

از نظر فناوری پایه، هر دو به Speech-to-Text متکی هستند. اما محیط تلفن اینترنتی VoIP ویژگی‌های خاص خودش را دارد. صدای تماس تلفنی معمولاً از نظر کیفیت، پهنای باند و شرایط ضبط با صدای یک فایل استودیویی یا پادکست تفاوت دارد. به همین دلیل، برخی موتورهای تشخیص گفتار مدل‌های اختصاصی برای صدای تلفنی ارائه می‌کنند.

برای نمونه، Google Cloud مدل‌های مخصوص داده‌های تلفنی دارد که برای صوت حاصل از تماس‌های تلفنی، از جمله صوت‌هایی با نرخ نمونه‌برداری رایج ۸ کیلوهرتز، بهینه شده‌اند. انتخاب مدل متناسب با نوع صوت می‌تواند روی کیفیت خروجی اثر قابل‌توجهی داشته باشد.

بنابراین اگر هدف شما تبدیل مکالمات واقعی مشتری و کارشناس به متن است، نمی‌توان صرفاً هر ابزار عمومی Voice-to-Text را انتخاب کرد و انتظار داشت نتیجه همیشه دقیق باشد. ماهیت صوت ورودی، زبان، لهجه، کیفیت تماس و حتی نوع کاربرد، در انتخاب راهکار مناسب اهمیت دارند.

راهنمای جامع تبدیل تماس به متن

چرا کسب‌وکارها مکالمات تلفنی را به متن تبدیل می‌کنند؟

اولین فایده، خیلی ساده اما شدیداً مهم است: دیگر مجبور نیستید برای پیدا کردن اطلاعات، تمام مکالمه را گوش کنید. تصور کنید مشتری در یک تماس ۱۵ دقیقه‌ای درباره قیمت، شرایط پرداخت و زمان تحویل صحبت کرده است. 

اگر مکالمه فقط به‌صورت فایل صوتی ذخیره شده باشد، پیدا کردن این اطلاعات مستلزم گوش دادن به فایل است. اما وقتی همان تماس به متن تبدیل شده باشد، می‌توان عبارت‌هایی مثل «قیمت»، «تخفیف»، «زمان ارسال» یا «شرایط پرداخت» را در آن جست‌وجو کرد.

از طرف دیگر، متن مکالمه امکان بررسی تعداد بسیار بیشتری از تماس‌ها را فراهم می‌کند. در یک مرکز تماس، مدیر می‌تواند به‌جای انتخاب تصادفی چند فایل برای شنیدن، مکالمات را بر اساس کلمات کلیدی، موضوع، نتیجه تماس یا شاخص‌های مشخص دسته‌بندی و بررسی کند. 

سرویس‌های تخصصی Call Analytics حتی امکان بررسی شاخص‌هایی مانند زمان سکوت، میزان صحبت، سرعت گفتار، قطع کردن صحبت یکدیگر و احساسات مکالمه را نیز فراهم کرده‌اند.

تبدیل مکالمه تلفنی به متن چطور کار می‌کند؟ 

حالا به بخش فنی ماجرا برسیم. وقتی می‌گوییم «هوش مصنوعی VoIP تماس را به متن تبدیل می‌کند»، در واقع اتفاقی بسیار پیچیده‌تر از تبدیل مستقیم صدا به کلمه رخ می‌دهد. اگر بخواهیم فرایند را ساده کنیم، می‌توان آن را این‌طور دید:

  • مکالمه تلفنی

  • دریافت و آماده‌سازی صوت

  • تشخیص گفتار

  • تبدیل گفتار به کلمات

  • تشخیص گویندگان و زمان‌بندی

  • تولید Transcript 

  • تحلیل و پردازش متن

هر کدام از این مراحل روی کیفیت نتیجه نهایی اثر می‌گذارند.

مراحل تبدیل تماس به متن

مرحله

چه اتفاقی می‌افتد؟

خروجی

دریافت صدای مکالمه

دریافت فایل ضبط‌شده یا جریان صوتی تماس

Audio

پردازش صوت

آماده‌سازی و کاهش اثر نویز و مشکلات صوتی

صوت آماده پردازش

Speech-to-Text

تشخیص گفتار و تبدیل آن به کلمات

متن اولیه

تشخیص گویندگان

تفکیک صحبت مشتری و کارشناس

Transcript تفکیک‌شده

ثبت زمان

ثبت زمان شروع و پایان بخش‌های گفتار

Transcript زمان‌بندی‌شده

پردازش متن

استخراج موضوع، احساسات، کلمات کلیدی و اقدامات بعدی

داده تحلیلی

مرحله اول) دریافت صدای مکالمه

همه‌چیز از Audio شروع می‌شود. سیستم باید صدای مکالمه را از یک منبع دریافت کند؛ این منبع می‌تواند یک فایل ضبط‌شده از تماس باشد یا یک جریان صوتی که در لحظه از تماس دریافت می‌شود.

اینجا تفاوت مهمی میان دو سناریو وجود دارد. در Post-Call Transcription، ابتدا تماس ضبط می‌شود و پس از پایان تماس فایل صوتی برای تبدیل به متن پردازش می‌شود. در Real-Time Transcription، صوت در همان زمان که مکالمه جریان دارد به موتور تشخیص گفتار ارسال می‌شود. سرویس‌های تخصصی Call Analytics هر دو مدل را پشتیبانی می‌کنند.

مرحله دوم) آماده‌سازی و پردازش سیگنال صوتی

صدایی که از تماس دریافت می‌شود الزاماً تمیز و ایده‌آل نیست. ممکن است نویز محیط وجود داشته باشد، صدای دو نفر روی هم بیفتد یا کیفیت کانال تلفنی پایین باشد.

موتور Speech-to-Text باید از این سیگنال صوتی، بخش‌های مرتبط با گفتار را استخراج و آن را برای مرحله تشخیص گفتار آماده کند. کیفیت ورودی در همین نقطه می‌تواند روی خروجی نهایی اثر بگذارد.

به همین دلیل، نمی‌توان دقت تبدیل تماس به متن را فقط به «خوب یا بد بودن هوش مصنوعی» نسبت داد. کیفیت صوت، مدل انتخاب‌شده و شرایط واقعی مکالمه همگی در نتیجه دخیل‌اند. 

مرحله سوم) تشخیص گفتار با مدل Speech-to-Text

در این مرحله، موتور ASR تلاش می‌کند الگوی صوتی را به واحدهای زبانی تبدیل کند. به زبان ساده، سیستم باید از روی چیزی که شنیده است، محتمل‌ترین کلمات و عبارت‌ها را تشخیص دهد. اما این کار صرفاً شناسایی تک‌تک کلمات نیست. مدل باید با توجه به زمینه، توالی کلمات و ساختار زبان تصمیم بگیرد که چه عبارتی احتمال بیشتری دارد.

برای همین است که مدل‌های جدید Speech-to-Text از مدل‌های یادگیری ماشین و مدل‌های زبانی گسترده استفاده می‌کنند و برای سناریوهای مختلف، مدل‌های تخصصی‌تری هم ارائه می‌شود. 

در تماس‌های فارسی، این مرحله اهمیت دوچندانی دارد؛ چون نام افراد و برندها، اعداد، کلمات انگلیسی، اصطلاحات تخصصی و لهجه می‌توانند تشخیص صحیح کلمات را دشوارتر کنند. بنابراین برای یک کسب‌وکار ایرانی، صرفاً پشتیبانی شدن زبان فارسی روی کاغذ کافی نیست؛ باید کیفیت واقعی خروجی در شرایط واقعی تماس نیز ارزیابی شود.

مرحله چهارم) تشخیص اینکه «چه کسی چه چیزی گفته...»

فرض کنید خروجی سیستم فقط چنین متنی باشد: «سلام وقت بخیر بله حتماً محصول رو بررسی کردیم قیمتش اینه و مشتری میگه برای من گرونه...»

این متن شاید از نظر تبدیل صوت به نوشته درست باشد، اما برای تحلیل یک مکالمه چندان کاربردی نیست. شما باید بدانید کدام جمله را کارشناس گفته و کدام جمله را مشتری.

اینجاست که قابلیت Speaker Diarization یا تفکیک گویندگان اهمیت پیدا می‌کند. این فناوری تلاش می‌کند بخش‌های مختلف مکالمه را به گویندگان متفاوت نسبت دهد. سرویس‌هایی مانند Amazon Transcribe می‌توانند برای هر بخش، شناسه گوینده و زمان شروع و پایان آن را در خروجی ثبت کنند.

در نتیجه، خروجی می‌تواند ساختاری شبیه این داشته باشد:

  • کارشناس: «سلام، وقت بخیر. در خدمت شما هستم.»

  • مشتری: «سلام. درباره هزینه سرویس سؤال داشتم.»

  • کارشناس: «حتماً. بسته به تعداد خطوط و امکانات موردنیاز شما، هزینه متفاوت است.»

  • مشتری: «من برای یک تیم فروش پنج‌نفره می‌خواهم.»

حالا دیگر فقط با یک متن خام روبه‌رو نیستیم؛ بلکه یک رونوشت ساختاریافته از مکالمه داریم که می‌توان آن را برای تحلیل‌های بعدی استفاده کرد.

مرحله پنجم) ثبت زمان و ساخت Transcript قابل جست‌وجو

مرحله بعد، تبدیل خروجی خام به متنی است که انسان بتواند آن را بخواند و نرم‌افزار نیز بتواند آن را پردازش کند. در خروجی‌های حرفه‌ای، اطلاعاتی مانند زمان شروع و پایان کلمات یا بخش‌های گفتار و حتی امتیاز اطمینان تشخیص می‌تواند وجود داشته باشد. این یعنی سیستم فقط نمی‌گوید «این کلمه گفته شده»، بلکه می‌تواند مشخص کند این کلمه تقریباً در چه زمانی از فایل یا جریان صوتی شنیده شده است.

مرحله ششم) پردازش متن

تا اینجا فقط یک کار انجام داده‌ایم: صدا را به متن تبدیل کرده‌ایم. اما ارزش تجاری واقعی معمولاً از مرحله بعد آغاز می‌شود. متن می‌تواند برای استخراج کلمات کلیدی، دسته‌بندی تماس‌ها، تشخیص موضوع، تحلیل احساسات، خلاصه‌سازی و استخراج اقدامات بعدی پردازش شود. 

در راهکارهای پیشرفته Call Analytics، حتی امکان شناسایی اطلاعات حساس، دسته‌بندی تماس، تحلیل احساسات و تولید خلاصه‌ای شامل مسئله، نتیجه و اقدام بعدی وجود دارد.

در عمل، چه زمانی باید متن مکالمه تولید شود؟

حالا که مسیر کلی تبدیل صدا به متن را شناختیم، به یک سوال مهم می‌رسیم: چه زمانی باید متن مکالمه تولید شود؟ آیا بهتر است سیستم همان لحظه‌ای که مشتری صحبت می‌کند، حرف‌های او را به متن تبدیل کند یا بعد از پایان تماس این کار انجام شود؟

پاسخ به هدف شما بستگی دارد. اگر هدف، آرشیو و تحلیل تماس‌های گذشته باشد، پردازش بعد از تماس معمولاً کافی است؛ اما اگر قرار است سیستم در همان لحظه به کارشناس کمک کند یا مدیر در لحظه از اتفاقات تماس باخبر شود، به Transcription بلادرنگ نیاز دارید. 

سرویس‌های حرفه‌ای امروزی مانند تلفنچی هر دو سناریو را پوشش می‌دهند و حتی امکان تحلیل مکالمه هم‌زمان با جریان تماس را فراهم کرده‌اند.

آیا می‌توان مکالمات فارسی را با دقت بالا به متن تبدیل کرد؟

پاسخ کوتاه این است: بله، اما میزان دقت به شرایط مکالمه و فناوری مورد استفاده بستگی دارد. فارسی مانند هر زبان دیگری چالش‌های خاص خودش را دارد و در تماس تلفنی این چالش‌ها بیشتر می‌شوند. مکالمه واقعی معمولاً کتابی و رسمی نیست. افراد کلمات را کوتاه می‌کنند، جمله‌ها را نیمه‌تمام می‌گذارند، با سرعت‌های متفاوت صحبت می‌کنند و در میان صحبت از واژه‌های انگلیسی استفاده می‌کنند.

برای مثال، یک کارشناس ممکن است بگوید: «من الان تیکتتون رو چک می‌کنم، بعد اگر اوکی بود، درخواست رو می‌فرستم برای واحد فنی.»

یک سیستم خوب باید بتواند زبان محاوره‌ای و انگلیسی را در کنار اصطلاحات تخصصی تشخیص دهد. برای همین، حتماً بررسی کنید که سرویس موردنظر شما با واژگان تخصصی و ترکیب زبانی رایج در کسب‌وکارتان چقدر خوب کنار می‌آید.

در ضمن، اگر هدف شما استفاده از Transcript برای ثبت اطلاعات در CRM است، باید خروجی را از نظر اعداد، نام‌ها، شناسه‌ها و داده‌های حساس نیز ارزیابی کنید.

پس، یک هشدار مهم برای کسب‌وکارهای ایرانی!

اگر قرار است تبدیل تماس به متن بخشی از فرایند روزانه کسب‌وکار شما باشد، بهتر است قبل از تصمیم‌گیری این پنج مورد را با تماس واقعی خودتان آزمایش کنید:

  • تماس با کیفیت معمول شبکه

  • مکالمه محاوره‌ای فارسی

  • مکالمه همراه با اصطلاحات تخصصی

  • صحبت هم‌زمان مشتری و کارشناس

  • وجود نام، عدد، مبلغ و اطلاعات حساس

اگر سیستم در چنین شرایطی خروجی قابل اتکایی تولید کند، آن زمان می‌توان درباره استفاده عملی از آن تصمیم گرفت.

راهنمای جامع تبدیل تماس به متن

تحلیل احساسات مشتری در تبدیل تماس به متن

یکی دیگر از لایه‌های مهم کار، Sentiment Analysis یا تحلیل احساسات است. هدف این فناوری این است که متن مکالمه و در برخی راهکارها ویژگی‌های مرتبط با گفتار را بررسی می‌کند تا مشخص شود لحن یا محتوای مکالمه در چه وضعیتی قرار دارد؛ برای مثال مثبت، منفی یا خنثی.

در راهکارهای Call Analytics، حتی می‌توان روند احساسات مشتری را در طول تماس بررسی کرد. این موضوع از نظر مدیریتی جالب است: ممکن است مشتری تماس را با نارضایتی شروع کند، اما در پایان مکالمه وضعیت او بهتر شده باشد. در این حالت، می‌توان بررسی کرد که چه اتفاقی باعث تغییر تجربه مشتری شده است.

البته تحلیل احساسات را نباید یک «حقیقت قطعی درباره احساس مشتری» در نظر گرفت. این خروجی یک برآورد هوش مصنوعی و الگوریتمی است و در زبان فارسی، به‌خصوص در مکالمات محاوره‌ای، باید با احتیاط بیشتری تفسیر شود.

قابلیت خلاصه‌سازی خودکار مکالمه را فراموش نکنیم...

یک تماس ۲۰ دقیقه‌ای ممکن است برای یک مدیر فقط به سه جمله اطلاعاتی مهم منجر شود. هوش مصنوعی می‌تواند بعد از تبدیل تماس به متن، مکالمه را خلاصه کند و موارد مهم را جدا کند؛ مثلاً:

  • موضوع: مشکل مشتری در فعال‌سازی سرویس

  • اقدام انجام‌شده: درخواست برای بررسی توسط واحد فنی

  • نتیجه: نیاز به تماس مجدد

  • اقدام بعدی: پیگیری توسط کارشناس پشتیبانی

راهکارهای جدید تبدیل تماس به متن از Generative AI برای تولید خلاصه مکالمه استفاده می‌کنند و می‌توانند مواردی مانند Issue، Outcome و Action Item را استخراج کنند.

این قابلیت برای تیم‌های فروش و پشتیبانی بسیار مهم است؛ چون کارشناس دیگر مجبور نیست بعد از هر تماس، تمام جزئیات را از حافظه بازسازی کند.

و در نهایت، می‌رسیم به اهمیت اتصال داده‌های تماس به CRM

یکی از بهترین سناریوها این است که تماس، خلاصه یا همان Transcript و اطلاعات مشتری از هم جدا نباشند. وقتی تماس برقرار می‌شود، اطلاعات تماس‌گیرنده در CRM قابل مشاهده است. بعد از تماس هم، Transcript یا خلاصه آن ذخیره می‌شود. کار وقتی جالب‌تر می‌شود که شما نتیجه تماس و اقدام بعدی را نیز ثبت کنید.

در این حالت، کارشناس برای فهمیدن سابقه مشتری مجبور نیست میان چند سیستم مختلف جست‌وجو کند. برای شرکت‌هایی که زیرساخت تلفنی خود را با تلفن ابری کسب‌وکار راه‌اندازی کرده‌اند، این یکپارچگی می‌تواند بخشی از یک اکوسیستم ارتباطی بزرگ‌تر باشد؛ اکوسیستمی که در آن تلفن، CRM، پنل پیامک و سایر کانال‌های ارتباطی در کنار هم قرار می‌گیرند.

 جمع‌بندی

تبدیل تماس به متن در ظاهر یک فرایند ساده است: صدا وارد سیستم می‌شود و متن از آن خارج می‌شود. اما همان‌طور که دیدیم، پشت این فرایند مجموعه‌ای از فناوری‌ها قرار دارد؛ از پردازش سیگنال و Speech-to-Text گرفته تا تشخیص گوینده، تحلیل احساسات، خلاصه‌سازی و اتصال به CRM.

اما در واقعیت، عاملی که می‌تواند فناوری Speech-to-Text را از یک قابلیت جذاب به یک ابزار واقعی برای افزایش فروش و بهبود پشتیبانی تبدیل کند، ارائه‌دهنده‌ی این سرویس به شماست. در این راستا، شرکت تلفنچی با فراهم کردن زیرساخت‌های تلفن ابری، VoIP، IVR و سایر ابزارهای ارتباطی، می‌تواند زمینه ایجاد یک اکوسیستم یکپارچه‌ی تلفنی را برای کسب‌وکارتان فراهم کند.