هوش مصنوعی و دسترس‌پذیری: کمک به نابینایان و ناشنوایان

توصیف تصویر برای نابینا، زیرنویس زنده برای ناشنوا، ساده‌سازی متن برای نارساخوان و کنترل صوتی برای اختلال حرکتی؛ اینجا می‌بینیم کدام‌شان در فارسی واقعاً جواب می‌دهد و کدام هنوز نه.

🍊 تیم نارنگی ⏱ 5 دقیقه مطالعه
دستی که گوشی را نگه داشته و صفحه، توصیف صوتی یک تصویر را نشان می‌دهد

یک آگهی در دیوار: شش عکس از یک آپارتمان و در متن فقط نوشته «تصاویر ضمیمه». برای کسی که نمی‌بیند، آن آگهی خالی است. صفحه‌خوان به عکس‌ها که می‌رسد می‌گوید «تصویر، تصویر، تصویر» و رد می‌شود.

تا چند سال پیش راه‌حلی نداشت. حالا دارد؛ نه کامل، ولی چیزی بین «هیچ» و «همه چیز». مدلی که تصویر را می‌بیند می‌گوید کابینت‌ها سفیدند، پنجره رو به حیاط باز می‌شود و کف سرامیک روشن است. کاربر نابینا این را با صدا می‌شنود و خودش تصمیم می‌گیرد.

پایین چهار گروه از نیازها را جدا کرده‌ام: کجا ابزار جواب می‌دهد و کجا هنوز چیزی وجود ندارد.

نابینا و کم‌بینا: چشمی که توصیف می‌کند

دو کار اینجا از بقیه مهم‌تر است. اول توصیف تصویر: عکس را می‌دهید و متن می‌گیرید. مدل‌های چندوجهی این کار را به فارسی روان انجام می‌دهند و برای صفحه‌ی کتاب، نمودار یا قفسه‌ی داروخانه واقعاً جواب می‌دهند.

دوم خواندن متن از عکس: برچسب دارو، شماره‌ی اتوبوس، فیش حقوقی. اینجا سراغ تشخیص نویسه می‌روید نه توصیف کلی؛ روشش در تبدیل عکس به متن فارسی آمده. متن چاپی درست خوانده می‌شود، دست‌نویس فارسی هنوز نه.

در نارنگی می‌شود عکس را فرستاد و توصیف فارسی گرفت. این پرامپت را ذخیره کنید:

این تصویر را برای کسی توصیف کن که آن را نمی‌بیند.
اول کل صحنه در یک جمله، بعد جزئیات مهم.
هر نوشته‌ی داخل تصویر را عیناً بخوان و بگو کجاست.
عدد، قیمت و تاریخ را شمرده بگو.
درباره‌ی هویت افراد حدس نزن.
حداکثر شش جمله، بدون مقدمه.

صدای فارسی: از لحن ربات تا قابل شنیدن

صفحه‌خوانی که کاربران نابینای ایرانی سال‌هاست با آن کار می‌کنند روی موتور گفتار قدیمی سوار است: قابل فهم، ولی تخت. مدل‌های تازه‌ی متن‌به‌گفتار فارسی این را عوض کرده‌اند — مکث سر ویرگول، لحن پرسشی، تلفظ درست‌تر اسم‌ها. تفاوتش وقتی معلوم می‌شود که کسی بخواهد جزوه‌ی چهل‌صفحه‌ای را بشنود.

هنوز کامل نیست. اعداد، نیم‌فاصله و کلمه‌های هم‌نویسه مثل «کرم» گاهی اشتباه خوانده می‌شوند. مقایسه‌ی عملی موتورها در راهنمای گفتار به متن و متن به گفتار هست.

ناشنوا و کم‌شنوا: زیرنویس زنده و صورت‌جلسه

دو سناریو مدام با هم اشتباه گرفته می‌شوند. زیرنویس زنده یعنی متن هم‌زمان با حرف زدن بیاید؛ پیاده‌سازی یعنی بعد از جلسه، صوت به متن تبدیل شود. دومی خیلی دقیق‌تر است، چون مدل کل جمله را می‌بیند.

در کلاس آنلاین با یک مدرس و میکروفون خوب، زیرنویس زنده‌ی فارسی قابل دنبال کردن است. در جلسه‌ای با پنج نفر که وسط حرف هم می‌پرند، خروجی به هم می‌ریزد و همکار ناشنوا نصف بحث را می‌بازد. راه عملی این است که جلسه ضبط و بعد متن تمیز تحویل شود؛ مسیرش در ساخت زیرنویس فارسی آمده.

⚠️ زبان اشاره‌ی ایرانی: اینجا ابزاری وجود ندارد

هیچ سرویس در دسترسی زبان اشاره‌ی ایرانی را به فارسی برنمی‌گرداند و برعکس. نمونه‌های موجود یا آزمایشگاهی‌اند یا روی زبان اشاره‌ی آمریکایی‌اند که دستور و واژگانش فرق دارد. برای کسی که زبان اولش اشاره است، فارسی نوشتاری زبان دوم است و زیرنویس جای مترجم را نمی‌گیرد؛ در موقعیت پزشکی، حقوقی یا اداری همچنان مترجم انسانی لازم است.

نارساخوانی و اختلال یادگیری: تغییر قالب، نه تغییر محتوا

برای دانش‌آموزی با نارساخوانی، مشکل معمولاً فهمیدن مطلب نیست؛ رمزگشایی حروف است. سه کار اثر زیادی دارد: ساده کردن جمله‌ها بدون حذف مطلب، تبدیل پاراگراف طولانی به فهرست، و شنیدن متن به‌جای خواندنش.

یک هشدار: از مدل نخواهید درس را «خلاصه» کند و همان را ملاک امتحان بگیرید؛ خلاصه چیزهایی را می‌اندازد که خودش کم‌اهمیت تشخیص داده. کار درست ساده‌سازی است نه کوتاه‌سازی.

اختلال حرکتی: صدا به‌جای دست

دیکته‌ی فارسی برای کسی که تایپ برایش دردناک است بیشترین بازده را دارد؛ ایمیل کاری را می‌گویید و متن مرتب تحویل می‌گیرید. آنچه هنوز ضعیف است، فرمان دادن به سیستم‌عامل به فارسی است — «پنجره را ببند»، «برو به تنظیمات» — که در انگلیسی جا افتاده و در فارسی پیاده نشده.

نیاز، ابزار، حال‌وروز فارسی

نیازابزاروضعیت فارسی
توصیف عکس و صحنهمدل چندوجهیخوب و قابل تنظیم
خواندن متن از تابلوتشخیص نویسهچاپی خوب، دست‌نویس ضعیف
شنیدن متن صفحهصفحه‌خوانمتوسط؛ لحن تخت
شنیدن کتاب و جزوهمتن‌به‌گفتار تازهرو به بهبود
زیرنویس زندهگفتار به متن بی‌درنگفقط در محیط آرام
صورت‌جلسه‌ی ضبط‌شدهپیاده‌سازی صوتدقیق‌تر از حالت زنده
ساده‌سازی متن درسیمدل زبانیخوب
دیکته و نگارش صوتیگفتار به متنمتن خوب، فرمان ضعیف
زبان اشاره‌ی ایرانیوجود ندارد

صادقانه: فارسی یک قدم عقب است

هر قابلیتی که نام بردم اول به انگلیسی رسیده و بعد با تأخیر و کیفیت پایین‌تر به فارسی. دلیلش داده است: متن و صوت فارسیِ در دسترس مدل‌ها بسیار کمتر است. ریشه‌ی این شکاف در محدودیت‌های فارسی در هوش مصنوعی باز شده، و برای دانستن اینکه صفحه‌خوان چطور کار می‌کند مدخل Screen reader شروع خوبی است.

کاری که سازنده‌ی سایت و اپ باید بکند

هیچ ابزار کمکی سایتی را که ساختار ندارد نجات نمی‌دهد. متن جایگزین بنویسید — نه «عکس محصول»، بلکه توضیح واقعی؛ همان که در سئوی تصویر هم به کارتان می‌آید. عنوان‌ها را با تگ درست بزنید نه با متن پررنگ، به دکمه‌های آیکونی برچسب بدهید، و ویدیو را بی‌زیرنویس منتشر نکنید. مرجعش راهنمای WCAG است.

💡 آزمون سی‌ثانیه‌ای

صفحه‌خوان گوشی را روشن کنید، چشم‌ها را ببندید و در سایت خودتان یک محصول را به سبد اضافه کنید. هر جا گیر کردید، برای کاربر واقعی هم بن‌بست است.

جمع‌بندی

برای نابینایان، توصیف تصویر و خواندن متن از عکس امروز واقعاً کار می‌کنند. برای ناشنوایان، پیاده‌سازی ضبط‌شده قابل اتکاست و زیرنویس زنده فقط در شرایط آرام. صدای فارسی بهتر شده ولی به انگلیسی نرسیده، و درباره‌ی زبان اشاره‌ی ایرانی باید صریح گفت ابزاری در کار نیست.

اگر فقط یک کار قرار است بکنید، همان متن جایگزین تصویرهاست. ابزار کمکی را دیگران می‌سازند؛ خوانده‌شدن سایت شما دست خودتان است.

برای ادامه:

پرسش‌های پرتکرار

توصیف تصویر با هوش مصنوعی به فارسی چقدر دقیق است؟ +
برای صحنه‌های روزمره مثل اتاق، غذا، خیابان و قفسه‌ی فروشگاه معمولاً دقیق و روان است و جزئیات مهم را می‌آورد. جایی که می‌لنگد، خواندن نوشته‌های ریز داخل تصویر و تشخیص هویت افراد است. برای متن داخل عکس بهتر است جداگانه از تشخیص نویسه استفاده کنید تا از توصیف کلی.
زیرنویس زنده‌ی فارسی در جلسه‌ها قابل اتکاست؟ +
در محیط آرام و با یک گوینده، خروجی معمولاً قابل دنبال کردن است. با چند نفر که هم‌زمان حرف می‌زنند، لهجه‌ی محلی یا اصطلاح تخصصی، دقت به‌شدت افت می‌کند. برای جلسه‌ی حساس باید یک نسخه‌ی ضبط‌شده هم پیاده‌سازی شود، چون خروجی بی‌درنگ همیشه ضعیف‌تر از پیاده‌سازی بعدی است.
آیا هوش مصنوعی زبان اشاره‌ی ایرانی را ترجمه می‌کند؟ +
عملاً نه. زبان اشاره‌ی ایرانی داده‌ی آموزشی عمومی و کافی ندارد و هیچ ابزار در دسترسی وجود ندارد که ویدیوی اشاره را به فارسی برگرداند یا برعکس. آنچه امروز کمک می‌کند مسیر غیرمستقیم است: گفتار به متن، و متن روی صفحه.
صدای فارسی متن‌به‌گفتار هنوز ربات‌گونه است؟ +
بستگی به موتور دارد. موتورهای قدیمی که در صفحه‌خوان‌ها استفاده می‌شوند لحن یکنواخت و ماشینی دارند، ولی مدل‌های تازه‌ی گفتارساز فارسی به‌مراتب طبیعی‌ترند و مکث و آهنگ جمله را رعایت می‌کنند. برای شنیدن طولانی‌مدت هنوز از انگلیسی عقب‌تر است، اما دیگر آزاردهنده نیست.
به‌عنوان سازنده‌ی سایت چه کاری بیشترین اثر را دارد؟ +
نوشتن متن جایگزین درست برای تصویرها و رعایت ساختار عنوان‌ها، چون صفحه‌خوان از همین دو چیز نقشه‌ی صفحه را می‌سازد. دکمه‌هایی که فقط آیکون دارند باید برچسب متنی داشته باشند و ویدیوها زیرنویس. این کارها ساعت‌ها وقت نمی‌برد و بدون آن‌ها بهترین ابزار کمکی هم روی سایت شما گیر می‌کند.
#دسترس‌پذیری #توصیف تصویر برای نابینا #زیرنویس زنده فارسی #تبدیل متن به گفتار #ابزار کمکی ناشنوایان
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است