چتبات فارسی واقعی یعنی چه؟ از «ی» و «ک» عربی تا تاریخ شمسی
چتبات فارسی فقط فارسی جواب دادن نیست؛ از «ی» و «ک» عربی و اعداد تا PDF اسکنشده، تاریخ شمسی و تومان. ببینید آیوا با هر کدام چه میکند و چطور امتحانش کنید.
این روزها تقریباً هر چتباتی میگوید «از زبان فارسی پشتیبانی میکند». منظور معمولاً این است که میتواند به فارسی جواب بنویسد. اما برای یک کسبوکار ایرانی، نوشتن فقط نیمی از ماجراست. نیم دیگر این است که چتبات فایلهای فارسی شما را درست بخواند، سؤال مشتری را با هر صفحهکلیدی که تایپ شده بفهمد، تاریخ را شمسی بشناسد و قیمت را به تومان بگوید.
فرض کنید فهرست محصولاتتان سالها پیش با یک نرمافزار قدیمی تایپ شده و مشتری امروز با صفحهکلید فارسی گوشیاش سؤال میپرسد. کلمهها روی صفحه یکسان به نظر میرسند، اما حروفشان برای کامپیوتر فرق دارد و ممکن است چتبات جوابی را که جلوی چشمش است پیدا نکند.
در این مقاله، بدون اصطلاحات پیچیده، توضیح میدهیم فارسی واقعی در یک چتبات چه لایههایی دارد، آیوا با هر کدام چه میکند و چطور میتوانید فارسی بودن هر چتباتی را خودتان امتحان کنید.
چرا «پشتیبانی از فارسی» کافی نیست؟
مدلهای هوش مصنوعی امروزی فارسی را بهخوبی میفهمند و روان مینویسند. مشکل معمولاً در خود مدل نیست؛ در مسیری است که محتوای شما طی میکند تا به مدل برسد. دستیار هوشمند برای جواب دادن، اول در محتوای شما جستوجو میکند و بخشهای مرتبط را پیدا میکند. این روش را در مقاله RAG به زبان ساده توضیح دادهایم. اگر این جستوجو بهخاطر یک حرف عربی یا یک عدد انگلیسی خطا کند، حتی مدلی که فارسی را عالی میفهمد هم جواب درستی نمیدهد، چون متن درست اصلاً به دستش نرسیده است.
پس فارسی بودن یک چتبات را باید در چند لایه سنجید:
- متن فایلها و سؤالها را به یک شکل استاندارد درمیآورد؟
- فایلهای اسکنشده و PDFهای فارسی قدیمی را میخواند؟
- متن را با توجه به علائم نگارشی فارسی تکهتکه میکند؟
- با تقویم شمسی، ساعت ایران و تومان کار میکند؟
- ظاهرش راستبهچپ است و به کانالهای ایرانی وصل میشود؟
یکسانسازی حروف و اعداد: از «ي» تا «۱۲۳»
«ي» و «ك» عربی
در صفحهکلیدهای عربی و بعضی نرمافزارهای قدیمی، «ی» و «ک» با نسخه عربیشان تایپ میشوند: «ي» و «ك». این حروف روی صفحه تقریباً شبیه نسخه فارسیاند و معمولاً کسی متوجه فرقشان نمیشود، اما برای کامپیوتر دو حرف کاملاً متفاوتاند. نتیجه اینکه عبارت «كيف چرمي» در فایل شما با «کیف چرمی» که مشتری تایپ کرده یکی نیست و جستوجوی کلیدواژهای آن را پیدا نمیکند.
آیوا متن فایلهای PDF و Word را هنگام خواندن، و هر سؤال مشتری را پیش از جستوجو، به یک شکل استاندارد فارسی درمیآورد. «ي» و «ى» به «ی» و «ك» به «ک» تبدیل میشوند؛ پس فرقی نمیکند فایل با کدام صفحهکلید تایپ شده یا مشتری با کدام گوشی سؤال میپرسد.
اعداد فارسی، عربی و انگلیسی
همین ماجرا برای اعداد هم هست. «۴۵۰» فارسی، «٤٥٠» عربی و «450» انگلیسی برای کامپیوتر سه چیز متفاوتاند. اگر در کاتالوگ نوشته باشید «گارانتی مدل ۴۵۰» و مشتری بپرسد «مدل 450 گارانتی دارد؟»، بدون یکسانسازی ممکن است جواب پیدا نشود. در آیوا اعداد هم در متن فایلهای PDF و Word و هم در سؤالها به یک شکل درمیآیند.
اعراب، کشیده، نیمفاصله و نویسههای نامرئی
چند مورد کوچکتر هم هست که در عمل زیاد پیش میآید و آیوا در همان مرحله یکسانسازی به آنها رسیدگی میکند:
- اعراب: نامی که در بروشور با اعراب نوشته شده، مثل «مُحَمَّد»، با «محمد» یکی میشود.
- کشیده: عنوانی که برای زیبایی کشیده نوشته شده، مثل «کـــتاب»، به «کتاب» برمیگردد.
- «ۀ» و «هٔ»: «خانۀ» و «خانهٔ» با «خانه» یکی میشوند.
- نیمفاصله: خود نیمفاصله نگه داشته میشود، چون در فارسی معنا دارد، اما فاصلههای اضافه دور آن حذف میشود.
- نویسههای نامرئی: متنی که از سایت یا فایل دیگری کپی شده، گاهی علامتهای نامرئی تعیین جهت متن را با خودش میآورد. این علامتها پاک میشوند.
- فاصلهها و خطهای خالی اضافه هم مرتب میشوند.
خلاصه این تبدیلها در یک نگاه:
| آنچه در فایل یا سؤال آمده | شکلی که با آن جستوجو میشود |
|---|---|
| كيف (با «ك» و «ي» عربی) | کیف |
| ٤٥٠ یا 450 | ۴۵۰ |
| مُحَمَّد | محمد |
| کـــتاب | کتاب |
| خانۀ یا خانهٔ | خانه |
یکسانسازی غلط املایی را درست نمیکند و «میرود» بدون نیمفاصله را هم به «میرود» تبدیل نمیکند. در چنین مواردی بخش معنایی جستوجو، که به معنای جمله نگاه میکند نه به حروف دقیق، کمک میکند؛ اما جای متن تمیز را نمیگیرد.
نکته: این یکسانسازی روی متن فایلهای PDF و Word و روی سؤالها انجام میشود. اگر فهرست محصولاتتان را بهصورت اکسل یا CSV از یک نرمافزار قدیمی گرفتهاید، پیش از بارگذاری با ابزار جستوجو و جایگزینی اکسل، «ي» و «ك» عربی را با «ی» و «ک» فارسی عوض کنید. فایلهای CSV و TXT را هم با قالب UTF-8 ذخیره کنید تا حروف فارسی بههم نریزند.
PDFهای اسکنشده و فونتهای خراب
بخش بزرگی از اسناد فارسی کسبوکارها PDF است: کاتالوگ، آییننامه، تعرفه. این PDFها دو دردسر رایج دارند:
- اسکنشدهاند. هر صفحه در واقع یک عکس است و متنی برای خواندن ندارد.
- فونت خراب دارند. خیلی از PDFهای فارسی که با نرمافزارها یا فونتهای قدیمی ساخته شدهاند، روی صفحه درست دیده میشوند، اما اگر متنشان را کپی کنید، حروف جابهجا یا نامفهوم میشوند.
آیوا هر صفحه PDF را جداگانه بررسی میکند. اگر صفحه متن سالم داشته باشد، همان متن را برمیدارد. اگر متن نداشته باشد یا متنش بههمریخته باشد، صفحه را به تصویری با وضوح بالا تبدیل میکند، آن را سیاهوسفید میکند تا حروف واضحتر شوند و با نویسهخوان نوری (OCR) فارسی و انگلیسی میخواند. عکسهای داخل فایلهای Word هم با همین نویسهخوان خوانده میشوند. متنی که به این شکل به دست میآید هم از همان یکسانسازی بخش قبل میگذرد. بارگذاری فایل PDF و Word در همه پلنها ممکن است.
صادقانه بگوییم: نویسهخوان نوری معجزه نمیکند. صفحه کج، کمنور، دستنویس یا اسکن بیکیفیت ممکن است درست خوانده نشود و جدولی که داخل تصویر است هم ممکن است ساختارش را از دست بدهد. اگر نسخه متنی سند را دارید، همان را بارگذاری کنید. نکتههای بیشتر را در چکلیست آمادهسازی محتوا برای آموزش چتبات آوردهایم.
تکهتکه کردن متن با علائم فارسی
دستیار هوشمند یک فایل صدصفحهای را یکجا نمیخواند؛ متن را به تکههای کوچکتر تقسیم میکند و هنگام جواب دادن، تکههای مرتبط را پیدا میکند. جایی که متن بریده میشود مهم است: اگر جملهای وسط راه نصف شود، نیمی از اطلاعات در یک تکه و نیم دیگر در تکه بعدی میماند.
آیوا برای بریدن متن، اول مرز پاراگرافها را در نظر میگیرد، بعد خطها و بعد پایان جملهها؛ علامت سؤال فارسی «؟» هم مثل «?» و نقطه، پایان جمله شناخته میشود. اگر تکه هنوز بلند باشد، متن از ویرگول یا نقطهویرگول فارسی، یعنی «،» و «؛»، بریده میشود و در آخر از فاصله بین کلمهها، تا کلمهها نصفه نمانند. ضمن اینکه تکههای کنار هم کمی همپوشانی دارند تا مطلبی که درست روی مرز دو تکه افتاده گم نشود.
جدولها قاعده جداگانهای دارند: هر ردیف اکسل یا CSV کامل و همراه با نام ستونهایش نگه داشته میشود و هیچ ردیفی بین دو تکه نصف نمیشود. پس قیمت یک محصول از نام همان محصول جدا نمیشود. روش افزودن هر نوع محتوا را در آموزش پایگاه دانش آیوا ببینید.
تاریخ شمسی، ساعت تهران و تومان
یک چتبات ایرانی باید با تقویم و پول ایران کار کند. در آیوا:
- دستیار تاریخ امروز را میداند، هم شمسی و هم میلادی. اگر در پایگاه دانش نوشته باشید «جشنواره تا ۱۵ مهر ادامه دارد»، دستیار میتواند تاریخ امروز را هم در نظر بگیرد.
- زمان پیامها در ویجت با اعداد فارسی و به شکل «امروز ۱۴:۳۰»، «دیروز» یا تاریخ کامل شمسی نمایش داده میشود.
- تاریخچه گفتگوها در داشبورد تاریخها را شمسی و با اعداد فارسی نشان میدهد؛ مثلاً «۱۴۰۵/۷/۱». داشبورد در همه پلنها هست.
- نمودار ساعتهای شلوغ در میزکار بر اساس ساعت تهران و هفتهای که از شنبه شروع میشود رسم میشود.
- فاکتورها تاریخ شمسی دارند و در صورت درخواست، فاکتور رسمی با نام شرکت و شناسه ملی صادر میشود.
- فرمها و نوبتدهی تقویم شمسی و ساعت تهران دارند؛ این دو امکان فقط در پلن آیوا ژرف هستند.
- ریال و تومان: قیمتها در باسلام به ریال ثبت میشوند، اما مشتری ایرانی معمولاً به تومان فکر میکند. دستیار آیوا وقتی قیمت محصول غرفه باسلام را میگوید، آن را به تومان تبدیل میکند تا مشتری عددی ده برابر نبیند؛ مثلاً قیمت ۴ میلیون و ۵۰۰ هزار ریالی را ۴۵۰ هزار تومان اعلام میکند. اتصال به باسلام در همه پلنها هست و جزئیاتش در مقاله پاسخ خودکار به مشتریان باسلام آمده است.
ظاهر، کانالها و زبان پاسخ
- ویجت راستبهچپ با فونت وزیرمتن (Vazirmatn) طراحی شده و روی گوشی تمامصفحه میشود تا خواندن و تایپ فارسی راحت باشد. ویجت در همه پلنها هست.
- فرم ثبتنام پیش از گفتگو، که در همه پلنها هست، شماره موبایل را با اعداد فارسی هم میپذیرد و لازم نیست مشتری صفحهکلیدش را عوض کند.
- کانالهای ایرانی: گفتینو و چت غرفه باسلام در همه پلنها و پیامرسان بله از پلن آیوا آگاه در دسترساند. خرید اشتراک هم با درگاههای زرینپال و باسلام انجام میشود. نحوه کار یک دستیار در چند کانال را در مقاله یک چتبات، چند کانال توضیح دادهایم.
- زبان پاسخ: پیشفرض فارسی است. با گزینه «خودکار»، دستیار به زبان آخرین پیام کاربر جواب میدهد و اگر کاربر زبانش را عوض کند، او هم عوض میکند. زبانهای پاسخ فارسی، انگلیسی، عربی و ترکیاند و انتخاب زبان در همه پلنها ممکن است. رابط خود ویجت اما همیشه فارسی میماند.
چطور فارسی بودن یک چتبات را امتحان کنید؟
ادعا را باور نکنید؛ امتحان کنید. این آزمونها را در دوره آزمایشی هر چتباتی، از جمله آیوا، انجام دهید:
- یک فایل PDF یا Word بارگذاری کنید که با «ي» و «ك» عربی تایپ شده و با صفحهکلید فارسی دربارهاش بپرسید.
- عددی را که در فایل با اعداد فارسی آمده، با اعداد انگلیسی بپرسید.
- یک صفحه اسکنشده خوانا بارگذاری کنید و درباره متنش سؤال کنید.
- PDFی را امتحان کنید که وقتی متنش را کپی میکنید بههم میریزد.
- ویجت را روی گوشی باز کنید و راستبهچپ بودن، فونت و زمان پیامها را ببینید.
- سؤالی بپرسید که جوابش به تاریخ امروز بستگی دارد؛ مثلاً درباره مهلت جشنوارهای که در محتوایتان نوشتهاید.
- اگر قیمتهایتان به ریال ثبت شدهاند، ببینید چتبات قیمت را با چه واحدی میگوید.
برای سؤالهای دیگری که پیش از خرید باید پرسید، چکلیست انتخاب چتبات برای سایت را ببینید.
جمعبندی
چتبات فارسی واقعی فقط چتباتی نیست که فارسی جواب بدهد. چتباتی است که «ي» و «ك» عربی و اعداد مختلف را یکسان کند، PDF اسکنشده و فونت خراب را بخواند، متن را با علائم فارسی ببرد، تاریخ را شمسی و قیمت را به تومان بشناسد و در کانالهایی باشد که مشتری ایرانی واقعاً از آنها استفاده میکند. این جزئیات کوچک به نظر میرسند، اما همینها تعیین میکنند مشتری جوابش را میگیرد یا جمله «اطلاعاتی در این باره در دسترسم نیست».
اگر میخواهید اینها را با فایلهای خودتان امتحان کنید، ساخت دستیار را رایگان در آیوا شروع کنید و همین آزمونها را در دوره آزمایشی انجام دهید.
