مدیرانی که تجربه کار با تیم فروش را داشتهاند، میدانند که در پایان روز با صدها دقیقه مکالمه تلفنی مواجهاند که در سیستمشان ثبت شده و باید تحلیل شود. بین این تماسها احتمالاً چند مکالمه خیلی مهم وجود دارد که آن تجربههای ناب و آن فوتهای کوزهگری در آنها نهفته. اما چه کسی میرود این همه راه را؟ کدام مدیر وقت دارد که این همه تماس را بشنود؟ دقیقاً همینجاست که قابلیت تبدیل تماس به متن اهمیت خودش را نشان میدهد...
تبدیل تماس به متن چیست و چه کاربردی دارد؟
تبدیل تماس به متن یا Speech to Text یا Call Transcription به فرایندی گفته میشود که صدای یک مکالمه تلفنی توسط فناوریهای تشخیص خودکارِ گفتار یا Automatic Speech Recognition (ASR) پردازش شده و به یک متن قابل خواندن تبدیل میشود.
در سادهترین حالت، سیستم یک فایل صوتی یا جریان زنده صوت را دریافت میکند، بخشهای گفتاری آن را تشخیص میدهد و کلمات اداشده را به شکل متن برمیگرداند. سرویسهای حرفهای امروزی البته میتوانند اطلاعات بیشتری نیز تولید کنند؛ برای مثال زمان شروع و پایان کلمات، تشخیص گویندگان مختلف و حتی اطلاعات تحلیلی درباره مکالمه.
تبدیل تماس به متن چه تفاوتی با تبدیل صدای معمولی به متن دارد؟
از نظر فناوری پایه، هر دو به Speech-to-Text متکی هستند. اما محیط تلفن اینترنتی VoIP ویژگیهای خاص خودش را دارد. صدای تماس تلفنی معمولاً از نظر کیفیت، پهنای باند و شرایط ضبط با صدای یک فایل استودیویی یا پادکست تفاوت دارد. به همین دلیل، برخی موتورهای تشخیص گفتار مدلهای اختصاصی برای صدای تلفنی ارائه میکنند.
برای نمونه، Google Cloud مدلهای مخصوص دادههای تلفنی دارد که برای صوت حاصل از تماسهای تلفنی، از جمله صوتهایی با نرخ نمونهبرداری رایج ۸ کیلوهرتز، بهینه شدهاند. انتخاب مدل متناسب با نوع صوت میتواند روی کیفیت خروجی اثر قابلتوجهی داشته باشد.
بنابراین اگر هدف شما تبدیل مکالمات واقعی مشتری و کارشناس به متن است، نمیتوان صرفاً هر ابزار عمومی Voice-to-Text را انتخاب کرد و انتظار داشت نتیجه همیشه دقیق باشد. ماهیت صوت ورودی، زبان، لهجه، کیفیت تماس و حتی نوع کاربرد، در انتخاب راهکار مناسب اهمیت دارند.

چرا کسبوکارها مکالمات تلفنی را به متن تبدیل میکنند؟
اولین فایده، خیلی ساده اما شدیداً مهم است: دیگر مجبور نیستید برای پیدا کردن اطلاعات، تمام مکالمه را گوش کنید. تصور کنید مشتری در یک تماس ۱۵ دقیقهای درباره قیمت، شرایط پرداخت و زمان تحویل صحبت کرده است.
اگر مکالمه فقط بهصورت فایل صوتی ذخیره شده باشد، پیدا کردن این اطلاعات مستلزم گوش دادن به فایل است. اما وقتی همان تماس به متن تبدیل شده باشد، میتوان عبارتهایی مثل «قیمت»، «تخفیف»، «زمان ارسال» یا «شرایط پرداخت» را در آن جستوجو کرد.
از طرف دیگر، متن مکالمه امکان بررسی تعداد بسیار بیشتری از تماسها را فراهم میکند. در یک مرکز تماس، مدیر میتواند بهجای انتخاب تصادفی چند فایل برای شنیدن، مکالمات را بر اساس کلمات کلیدی، موضوع، نتیجه تماس یا شاخصهای مشخص دستهبندی و بررسی کند.
سرویسهای تخصصی Call Analytics حتی امکان بررسی شاخصهایی مانند زمان سکوت، میزان صحبت، سرعت گفتار، قطع کردن صحبت یکدیگر و احساسات مکالمه را نیز فراهم کردهاند.
تبدیل مکالمه تلفنی به متن چطور کار میکند؟
حالا به بخش فنی ماجرا برسیم. وقتی میگوییم «هوش مصنوعی VoIP تماس را به متن تبدیل میکند»، در واقع اتفاقی بسیار پیچیدهتر از تبدیل مستقیم صدا به کلمه رخ میدهد. اگر بخواهیم فرایند را ساده کنیم، میتوان آن را اینطور دید:
مکالمه تلفنی
دریافت و آمادهسازی صوت
تشخیص گفتار
تبدیل گفتار به کلمات
تشخیص گویندگان و زمانبندی
تولید Transcript
تحلیل و پردازش متن
هر کدام از این مراحل روی کیفیت نتیجه نهایی اثر میگذارند.
مراحل تبدیل تماس به متن
مرحله | چه اتفاقی میافتد؟ | خروجی |
|---|---|---|
دریافت صدای مکالمه | دریافت فایل ضبطشده یا جریان صوتی تماس | Audio |
پردازش صوت | آمادهسازی و کاهش اثر نویز و مشکلات صوتی | صوت آماده پردازش |
Speech-to-Text | تشخیص گفتار و تبدیل آن به کلمات | متن اولیه |
تشخیص گویندگان | تفکیک صحبت مشتری و کارشناس | Transcript تفکیکشده |
ثبت زمان | ثبت زمان شروع و پایان بخشهای گفتار | Transcript زمانبندیشده |
پردازش متن | استخراج موضوع، احساسات، کلمات کلیدی و اقدامات بعدی | داده تحلیلی |
مرحله اول) دریافت صدای مکالمه
همهچیز از Audio شروع میشود. سیستم باید صدای مکالمه را از یک منبع دریافت کند؛ این منبع میتواند یک فایل ضبطشده از تماس باشد یا یک جریان صوتی که در لحظه از تماس دریافت میشود.
اینجا تفاوت مهمی میان دو سناریو وجود دارد. در Post-Call Transcription، ابتدا تماس ضبط میشود و پس از پایان تماس فایل صوتی برای تبدیل به متن پردازش میشود. در Real-Time Transcription، صوت در همان زمان که مکالمه جریان دارد به موتور تشخیص گفتار ارسال میشود. سرویسهای تخصصی Call Analytics هر دو مدل را پشتیبانی میکنند.
مرحله دوم) آمادهسازی و پردازش سیگنال صوتی
صدایی که از تماس دریافت میشود الزاماً تمیز و ایدهآل نیست. ممکن است نویز محیط وجود داشته باشد، صدای دو نفر روی هم بیفتد یا کیفیت کانال تلفنی پایین باشد.
موتور Speech-to-Text باید از این سیگنال صوتی، بخشهای مرتبط با گفتار را استخراج و آن را برای مرحله تشخیص گفتار آماده کند. کیفیت ورودی در همین نقطه میتواند روی خروجی نهایی اثر بگذارد.
به همین دلیل، نمیتوان دقت تبدیل تماس به متن را فقط به «خوب یا بد بودن هوش مصنوعی» نسبت داد. کیفیت صوت، مدل انتخابشده و شرایط واقعی مکالمه همگی در نتیجه دخیلاند.
مرحله سوم) تشخیص گفتار با مدل Speech-to-Text
در این مرحله، موتور ASR تلاش میکند الگوی صوتی را به واحدهای زبانی تبدیل کند. به زبان ساده، سیستم باید از روی چیزی که شنیده است، محتملترین کلمات و عبارتها را تشخیص دهد. اما این کار صرفاً شناسایی تکتک کلمات نیست. مدل باید با توجه به زمینه، توالی کلمات و ساختار زبان تصمیم بگیرد که چه عبارتی احتمال بیشتری دارد.
برای همین است که مدلهای جدید Speech-to-Text از مدلهای یادگیری ماشین و مدلهای زبانی گسترده استفاده میکنند و برای سناریوهای مختلف، مدلهای تخصصیتری هم ارائه میشود.
در تماسهای فارسی، این مرحله اهمیت دوچندانی دارد؛ چون نام افراد و برندها، اعداد، کلمات انگلیسی، اصطلاحات تخصصی و لهجه میتوانند تشخیص صحیح کلمات را دشوارتر کنند. بنابراین برای یک کسبوکار ایرانی، صرفاً پشتیبانی شدن زبان فارسی روی کاغذ کافی نیست؛ باید کیفیت واقعی خروجی در شرایط واقعی تماس نیز ارزیابی شود.
مرحله چهارم) تشخیص اینکه «چه کسی چه چیزی گفته...»
فرض کنید خروجی سیستم فقط چنین متنی باشد: «سلام وقت بخیر بله حتماً محصول رو بررسی کردیم قیمتش اینه و مشتری میگه برای من گرونه...»
این متن شاید از نظر تبدیل صوت به نوشته درست باشد، اما برای تحلیل یک مکالمه چندان کاربردی نیست. شما باید بدانید کدام جمله را کارشناس گفته و کدام جمله را مشتری.
اینجاست که قابلیت Speaker Diarization یا تفکیک گویندگان اهمیت پیدا میکند. این فناوری تلاش میکند بخشهای مختلف مکالمه را به گویندگان متفاوت نسبت دهد. سرویسهایی مانند Amazon Transcribe میتوانند برای هر بخش، شناسه گوینده و زمان شروع و پایان آن را در خروجی ثبت کنند.
در نتیجه، خروجی میتواند ساختاری شبیه این داشته باشد:
کارشناس: «سلام، وقت بخیر. در خدمت شما هستم.»
مشتری: «سلام. درباره هزینه سرویس سؤال داشتم.»
کارشناس: «حتماً. بسته به تعداد خطوط و امکانات موردنیاز شما، هزینه متفاوت است.»
مشتری: «من برای یک تیم فروش پنجنفره میخواهم.»
حالا دیگر فقط با یک متن خام روبهرو نیستیم؛ بلکه یک رونوشت ساختاریافته از مکالمه داریم که میتوان آن را برای تحلیلهای بعدی استفاده کرد.
مرحله پنجم) ثبت زمان و ساخت Transcript قابل جستوجو
مرحله بعد، تبدیل خروجی خام به متنی است که انسان بتواند آن را بخواند و نرمافزار نیز بتواند آن را پردازش کند. در خروجیهای حرفهای، اطلاعاتی مانند زمان شروع و پایان کلمات یا بخشهای گفتار و حتی امتیاز اطمینان تشخیص میتواند وجود داشته باشد. این یعنی سیستم فقط نمیگوید «این کلمه گفته شده»، بلکه میتواند مشخص کند این کلمه تقریباً در چه زمانی از فایل یا جریان صوتی شنیده شده است.
مرحله ششم) پردازش متن
تا اینجا فقط یک کار انجام دادهایم: صدا را به متن تبدیل کردهایم. اما ارزش تجاری واقعی معمولاً از مرحله بعد آغاز میشود. متن میتواند برای استخراج کلمات کلیدی، دستهبندی تماسها، تشخیص موضوع، تحلیل احساسات، خلاصهسازی و استخراج اقدامات بعدی پردازش شود.
در راهکارهای پیشرفته Call Analytics، حتی امکان شناسایی اطلاعات حساس، دستهبندی تماس، تحلیل احساسات و تولید خلاصهای شامل مسئله، نتیجه و اقدام بعدی وجود دارد.
در عمل، چه زمانی باید متن مکالمه تولید شود؟
حالا که مسیر کلی تبدیل صدا به متن را شناختیم، به یک سوال مهم میرسیم: چه زمانی باید متن مکالمه تولید شود؟ آیا بهتر است سیستم همان لحظهای که مشتری صحبت میکند، حرفهای او را به متن تبدیل کند یا بعد از پایان تماس این کار انجام شود؟
پاسخ به هدف شما بستگی دارد. اگر هدف، آرشیو و تحلیل تماسهای گذشته باشد، پردازش بعد از تماس معمولاً کافی است؛ اما اگر قرار است سیستم در همان لحظه به کارشناس کمک کند یا مدیر در لحظه از اتفاقات تماس باخبر شود، به Transcription بلادرنگ نیاز دارید.
سرویسهای حرفهای امروزی مانند تلفنچی هر دو سناریو را پوشش میدهند و حتی امکان تحلیل مکالمه همزمان با جریان تماس را فراهم کردهاند.
آیا میتوان مکالمات فارسی را با دقت بالا به متن تبدیل کرد؟
پاسخ کوتاه این است: بله، اما میزان دقت به شرایط مکالمه و فناوری مورد استفاده بستگی دارد. فارسی مانند هر زبان دیگری چالشهای خاص خودش را دارد و در تماس تلفنی این چالشها بیشتر میشوند. مکالمه واقعی معمولاً کتابی و رسمی نیست. افراد کلمات را کوتاه میکنند، جملهها را نیمهتمام میگذارند، با سرعتهای متفاوت صحبت میکنند و در میان صحبت از واژههای انگلیسی استفاده میکنند.
برای مثال، یک کارشناس ممکن است بگوید: «من الان تیکتتون رو چک میکنم، بعد اگر اوکی بود، درخواست رو میفرستم برای واحد فنی.»
یک سیستم خوب باید بتواند زبان محاورهای و انگلیسی را در کنار اصطلاحات تخصصی تشخیص دهد. برای همین، حتماً بررسی کنید که سرویس موردنظر شما با واژگان تخصصی و ترکیب زبانی رایج در کسبوکارتان چقدر خوب کنار میآید.
در ضمن، اگر هدف شما استفاده از Transcript برای ثبت اطلاعات در CRM است، باید خروجی را از نظر اعداد، نامها، شناسهها و دادههای حساس نیز ارزیابی کنید.
پس، یک هشدار مهم برای کسبوکارهای ایرانی!
اگر قرار است تبدیل تماس به متن بخشی از فرایند روزانه کسبوکار شما باشد، بهتر است قبل از تصمیمگیری این پنج مورد را با تماس واقعی خودتان آزمایش کنید:
تماس با کیفیت معمول شبکه
مکالمه محاورهای فارسی
مکالمه همراه با اصطلاحات تخصصی
صحبت همزمان مشتری و کارشناس
وجود نام، عدد، مبلغ و اطلاعات حساس
اگر سیستم در چنین شرایطی خروجی قابل اتکایی تولید کند، آن زمان میتوان درباره استفاده عملی از آن تصمیم گرفت.

تحلیل احساسات مشتری در تبدیل تماس به متن
یکی دیگر از لایههای مهم کار، Sentiment Analysis یا تحلیل احساسات است. هدف این فناوری این است که متن مکالمه و در برخی راهکارها ویژگیهای مرتبط با گفتار را بررسی میکند تا مشخص شود لحن یا محتوای مکالمه در چه وضعیتی قرار دارد؛ برای مثال مثبت، منفی یا خنثی.
در راهکارهای Call Analytics، حتی میتوان روند احساسات مشتری را در طول تماس بررسی کرد. این موضوع از نظر مدیریتی جالب است: ممکن است مشتری تماس را با نارضایتی شروع کند، اما در پایان مکالمه وضعیت او بهتر شده باشد. در این حالت، میتوان بررسی کرد که چه اتفاقی باعث تغییر تجربه مشتری شده است.
البته تحلیل احساسات را نباید یک «حقیقت قطعی درباره احساس مشتری» در نظر گرفت. این خروجی یک برآورد هوش مصنوعی و الگوریتمی است و در زبان فارسی، بهخصوص در مکالمات محاورهای، باید با احتیاط بیشتری تفسیر شود.
قابلیت خلاصهسازی خودکار مکالمه را فراموش نکنیم...
یک تماس ۲۰ دقیقهای ممکن است برای یک مدیر فقط به سه جمله اطلاعاتی مهم منجر شود. هوش مصنوعی میتواند بعد از تبدیل تماس به متن، مکالمه را خلاصه کند و موارد مهم را جدا کند؛ مثلاً:
موضوع: مشکل مشتری در فعالسازی سرویس
اقدام انجامشده: درخواست برای بررسی توسط واحد فنی
نتیجه: نیاز به تماس مجدد
اقدام بعدی: پیگیری توسط کارشناس پشتیبانی
راهکارهای جدید تبدیل تماس به متن از Generative AI برای تولید خلاصه مکالمه استفاده میکنند و میتوانند مواردی مانند Issue، Outcome و Action Item را استخراج کنند.
این قابلیت برای تیمهای فروش و پشتیبانی بسیار مهم است؛ چون کارشناس دیگر مجبور نیست بعد از هر تماس، تمام جزئیات را از حافظه بازسازی کند.
و در نهایت، میرسیم به اهمیت اتصال دادههای تماس به CRM
یکی از بهترین سناریوها این است که تماس، خلاصه یا همان Transcript و اطلاعات مشتری از هم جدا نباشند. وقتی تماس برقرار میشود، اطلاعات تماسگیرنده در CRM قابل مشاهده است. بعد از تماس هم، Transcript یا خلاصه آن ذخیره میشود. کار وقتی جالبتر میشود که شما نتیجه تماس و اقدام بعدی را نیز ثبت کنید.
در این حالت، کارشناس برای فهمیدن سابقه مشتری مجبور نیست میان چند سیستم مختلف جستوجو کند. برای شرکتهایی که زیرساخت تلفنی خود را با تلفن ابری کسبوکار راهاندازی کردهاند، این یکپارچگی میتواند بخشی از یک اکوسیستم ارتباطی بزرگتر باشد؛ اکوسیستمی که در آن تلفن، CRM، پنل پیامک و سایر کانالهای ارتباطی در کنار هم قرار میگیرند.
جمعبندی
تبدیل تماس به متن در ظاهر یک فرایند ساده است: صدا وارد سیستم میشود و متن از آن خارج میشود. اما همانطور که دیدیم، پشت این فرایند مجموعهای از فناوریها قرار دارد؛ از پردازش سیگنال و Speech-to-Text گرفته تا تشخیص گوینده، تحلیل احساسات، خلاصهسازی و اتصال به CRM.
اما در واقعیت، عاملی که میتواند فناوری Speech-to-Text را از یک قابلیت جذاب به یک ابزار واقعی برای افزایش فروش و بهبود پشتیبانی تبدیل کند، ارائهدهندهی این سرویس به شماست. در این راستا، شرکت تلفنچی با فراهم کردن زیرساختهای تلفن ابری، VoIP، IVR و سایر ابزارهای ارتباطی، میتواند زمینه ایجاد یک اکوسیستم یکپارچهی تلفنی را برای کسبوکارتان فراهم کند.



نظرات و تجربههای شما
هنوز دیدگاهی ثبت نشده است؛ اولین دیدگاه را شما بنویسید.