أجرى كولن فرايزر تجربة على منصة Bluesky لاستكشاف قدرة نماذج اللغة الكبيرة على إجراء عمليات حسابية بسيطة وإرجاع النتيجة مكتوبةً بالكلمات. استخدم في البداية GPT‑4o، ثم أعاد التجربة على جهاز محلي DGX Spark باستخدام نموذج Qwen3.8‑27B‑Q4_K_M.gguf.
طريقة التجربة
التجربة الأولى مع GPT‑4o استهدفت مجموعة أعداد متزايدة الحجم، وتم عرض النتائج على مخطط حراري يوضح نسبة النجاح. لاحقاً، تم تشغيل نفس الاختبار على Qwen 3.8 27B بطريقتين: إحداهما مع تعطيل خاصية التفكير (reasoning) واستخدام 30 محاولة لكل زوج من الأعداد، والأخرى مع تمكين التفكير لكن بعدد عينة واحد فقط لكل زوج.
النتائج
- مع تعطيل التفكير، أظهر النموذج نسبة نجاح متفاوتة حسب حجم الأعداد، كما هو واضح في المخطط المرفق.
- مع تمكين التفكير، نجح النموذج في 167 من 169 محاولة، أي نسبة نجاح تقارب 98.8٪.
- عند تمكين التفكير، قدم النموذج تتبعاً خطوةً خطوةً للعمليات الحسابية، موضحاً عمليات الجمع من اليمين إلى اليسار مع حمل الأرقام.
الملاحظة المهمة هي أن Qwen 3.8 27B تمكن من تقديم إجابات صحيحة حتى مع أعداد ضخمة مثل 4,299,366,105,622 و6,088,794,067,970، مع توضيح تفاصيل الجمع لكل خانة.
ما يعنيه هذا للمطورين
برأينا، هذه النتائج تُظهر أن النماذج المفتوحة المصدر الكبيرة قد وصلت إلى مستوى يمكن الاعتماد عليه في مهام حسابية بسيطة دون الحاجة إلى استدعاء خدمات خارجية. إذا كنت تطوّر تطبيقاً يعتمد على LLM للمعالجة النصية مع بعض العمليات الحسابية، قد يكون تشغيل نموذج محلي مثل Qwen 3.8 27B على عتادك الخاص خياراً فعّالاً من حيث التكلفة والخصوصية.
مع ذلك، يجب الانتباه إلى أن تمكين التفكير يزيد من زمن الاستجابة بشكل ملحوظ، لذا اختيار الوضع المناسب يعتمد على متطلبات الأداء في تطبيقك.
المصدر: simonwillison.net