لماذا تعجز نماذج الذكاء الاصطناعي عن التهجئة الصحيحة؟

اكتشف مستخدمون أن ميزة نظرة عامة بالذكاء الاصطناعي في غوغل تُخطئ في تهجئة كلمات بسيطة، والسبب في بنية النموذج اللغوي ذاتها التي تعالج النصوص كرموز رقمية لا كحروف منفردة.

تحرير
ألمعي · هيئة التحرير
النشر
٢٨ مايو ٢٠٢٦
المصدر
TechCrunch
القراءات
٠
الوقت
قراءة دقيقتين
اسم غوغل مكتوباً بصورة خاطئة بحرفين P كما أخطأ فيه الذكاء الاصطناعي

في مشهد يصعب تصديقه، أخطأت ميزة نظرة عامة بالذكاء الاصطناعي التابعة لغوغل في تهجئة كلمات أولية، حتى إن النظام كتب اسم الشركة المطوِّرة له بحرفَي P بدلاً من حرف واحد، وحوّل كلمة journalism إلى j-o-u-r-n-a-d-i-s-m، فيما ظهرت Trump مُشوَّهةً على هيئة t-r-p-u-m. هذه الأخطاء ليست نادرة عشوائية، بل تعكس قيداً هيكلياً عميقاً في طريقة عمل النماذج اللغوية الكبيرة.

لفهم السبب، لا بد من النظر في البنية الجوهرية لهذه النماذج. يقوم النموذج اللغوي الكبير (Large Language Model) على معمارية المحوّل، وهي نظام لا يُعالج النصوص حرفاً بحرف كما يفعل الإنسان، بل يُحوِّلها أولاً إلى وحدات تُسمى الرموز المميزة (tokens)، وهي كُتَل نصية قد تكون كلمةً كاملة أو جزءاً منها. عملية التجزئة إلى رموز تُفكّك النص إلى هذه الوحدات الحسابية قبل أن يبدأ النموذج بتحليلها.

وكما شرح باحث في هذا المجال: حين يرى النموذج كلمة the، يمتلك تمثيلاً موحداً لمعناها الكلي، لكنه لا يعرف شيئاً عن حروفها المنفردة. بعبارة أخرى، النموذج يفهم مفهوم الكلمة الكاملة كوحدة رقمية، لكنه يغيب عنه الوعي بالبنية الحرفية التفصيلية.

وقد كشف هذا الخلل عن سلسلة من الإحراجات المتكررة لغوغل منذ إطلاق ميزة نظرة عامة بالذكاء الاصطناعي ضمن محرك البحث؛ إذ سبق أن نقل النظام مقتطفات ساخرة من موقع The Onion على أنها معلومات حقيقية، وأرفق ردوداً جُمِعت من منصة Reddit دون التحقق من دقتها.

تبقى أخطاء التهجئة من أكثر الإشكاليات وضوحاً للمستخدم العادي، رغم أنها ليست الأخطر من الناحية التقنية. يؤكد الباحثون أن إصلاح هذه المشكلة ليس بالأمر اليسير، إذ يرى بعضهم أن القيد متأصّل في آلية عمل النماذج اللغوية الكبيرة ذاتها: حتى لو صُمِّمت قوائم رموز مثالية، سيظل النموذج يُفكّك المعلومات إلى كتل أكبر من الحروف الفردية.

ومن المفارقات اللافتة أن هذا القيد لا يمس الكفاءة الحقيقية لهذه النماذج في المهام الجوهرية؛ فالنماذج اللغوية الكبيرة تتفوق في البرمجة وحل المشكلات المعقدة وتوليد النصوص الطويلة والترجمة. أخطاء التهجئة تُذكِّرنا بأن الفهم الذي تُبديه هذه الأنظمة مختلف جذرياً عن الفهم البشري: فالإنسان يتعلم الحروف قبل الكلمات، أما النموذج فيتعلم المعنى مباشرة من خلال أنماط إحصائية ضخمة دون أن يُخزّن بنية الكلمة الحرفية بالطريقة ذاتها.

يطرح هذا القيد تساؤلات أعمق حول طبيعة الذكاء الاصطناعي وحدوده. فالأنظمة التي تكتب مقالات أكاديمية متماسكة وتُصحّح أكواداً برمجية معقدة عاجزة في الوقت ذاته عن عدّ حروف كلمة بسيطة بدقة موثوقة. وهذا لا يعني فشل النموذج، بل يعني أنه مُدرَّب لأداء مهام مختلفة جوهرياً عن عمليات الفهرسة الحرفية التي تبدو بديهية للإنسان.

وفي سياق أوسع، لا تزال شركات الذكاء الاصطناعي تبحث عن حلول تقنية لتجسير هذه الهوة: من تحسين خوارزميات التجزئة إلى رموز لتكون أكثر حساسية للبنية الداخلية للكلمات، إلى دمج وحدات حسابية مساعدة متخصصة في التحقق الحرفي. غير أن الباحثين يتحفظون على تقديم وعود مبكرة، مشيرين إلى أن المشكلة تمس البنية المعمارية الأساسية لأنظمة اليوم.

في المحصلة، تُذكّرنا هذه الأخطاء الساذجة الظاهر بحقيقة جوهرية: الأنظمة الذكية الأكثر تطوراً في العالم ليست سوى آلات إحصائية قوية جداً تتعلم أنماط اللغة دون أن تُدركها بالمعنى الحرفي الأعمق. ولعل أهم درس تقدمه هذه الظاهرة هو التذكير الدائم بضرورة مراجعة مخرجات الذكاء الاصطناعي والتحقق منها، خاصةً في التفاصيل الصغيرة التي يبدو للوهلة الأولى أنها أبسط من أن تُخطئ.

المصدر الأصلي
TechCrunch
قراءة المقال الأصلي ↗
قصة اليوم · كل صباح

أعجبك التقرير؟ استلم واحداً كل صباح.

قصةٌ تقنية واحدة تستحقّ وقتك، بالعربية. بلا إعلانات، بلا إزعاج.

بلا إعلانات · إلغاء الاشتراك بنقرة واحدة · بياناتك آمنة

اقرأ أيضًا

المزيد من ذكاء اصطناعي

معدات كاتربيلر الثقيلة في معرض تقني تعرض تقنيات LiDAR والمركبات ذاتية القيادة

كاتربيلر تنقل دروس أتمتة المناجم إلى نشر الذكاء الاصطناعي في مصانع المستقبل

تستثمر شركة كاتربيلر العملاقة عقودها من خبرة الأتمتة في مناجم المعادن لنشر الذكاء الاصطناعي عبر 1.6 مليون أصل متصل، ومساعد صوتي للتقنيين في الميدان، وتوائم رقمية لمواقع البناء.

TechCrunch
طائرة مسيّرة تجارية تحلق في السماء تمثيلاً للتنافس التكنولوجي بين الولايات المتحدة والصين في قطاع الطائرات المسيّرة والروبوتات

أمريكا تُحكم قبضتها على الطائرات المسيّرة والروبوتات لكن الصين تملك ما لا يمكن حظره: الحجم

فرضت الولايات المتحدة رسوماً جمركية على الطائرات المسيّرة والروبوتات الأجنبية بذريعة الأمن القومي، غير أن الصين التي تمسك بـ86% من سوق الروبوتات الإنسانية العالمية قد تُحوّل هذه القيود إلى فرصة للسيطرة على الأسواق الدولية.

TechCrunch
جنسن هوانغ مع رقاقة إنفيديا الجديدة

إنفيديا تتجاوز حدود المعالج الرسومي نحو ميزة تنافسية جديدة في الذكاء الاصطناعي

تكشف إنفيديا عن استراتيجية تتخطى صراع المعالجات نحو التحكم الذكي في حركة البيانات وتنسيق أنظمة مراكز البيانات بالكامل، مستفيدةً من بنيتها الجديدة فيرا روبن.

TechCrunch
معدات تسجيل موسيقي في استوديو

شركتا سوني ميوزيك ووارنر تُقاضيان أنثروبيك بتهمة سرقة الأعمال الموسيقية المحمية

وجّهت عملاقتا النشر الموسيقي سوني ميوزيك ووارنر شابيل دعوى قضائية ضد شركة أنثروبيك، متهمتَيْن إياها باستخدام آلاف الأعمال الموسيقية المحمية بحقوق النشر لتدريب نموذجها كلود دون إذن.

TechCrunch
حرب الاستحواذ على شركات الذكاء الاصطناعي في وادي السيليكون

حرب الاستحواذ على شركات الذكاء الاصطناعي مفتوح الأوزان تشتعل في سيليكون فالي

صفقات بمليارات تُعيد تشكيل مشهد الذكاء الاصطناعي: إنفيديا تتفاوض على هاغينغ فيس بـ13 مليار دولار وسترايب تستحوذ على OpenRouter بـ7 مليارات، في مؤشر على حرب الهيمنة على النماذج مفتوحة الأوزان.

TechCrunch
مكاتب شركة أندريسن هوروويتز للاستثمار التقني

أندريسن هوروويتز تُطلق صندوق 1.1 مليار دولار لبناء البنية المادية للذكاء الاصطناعي

تتحول شركة الاستثمار التقني الشهيرة نحو الهاردوير بتأسيس صندوق ضخم يستهدف رقائق إلكترونية ومراكز بيانات وروبوتات، في رهان على أن ذكاء اصطناعياً ناجحاً يحتاج أولاً إلى أساس مادي صلب.

TechCrunch