GPT-6.1 Sol يدفع حدود كفاءة التكلفة: أداء قريب من Astra وإصلاحات جديدة لفهم الصور
فهرس المقال
- 1. ما الجديد في GPT-6.1 Sol؟
- 2. لماذا أصبحت كفاءة التكلفة مهمة؟
- 3. الأرقام: $0.72 مقابل $3.26
- 4. مقارنة GPT-6.1 Sol مع GPT-6 Sol
- 5. ماذا يعني انخفاض التكلفة مقارنة بـGPT-5.6 Sol؟
- 6. ما معنى حدود باريتو لكفاءة التكلفة؟
- 7. مستويات جهد التفكير في GPT-6.1 Sol
- 8. الفرق بين تكلفة المهمة وسعر الرموز
- 9. لماذا ما زال GPT-6 Astra مهمًا؟
- 10. إصلاح مشكلة الإدخال متعدد الوسائط
- 11. لماذا تؤثر معالجة الصور في نتائج النماذج؟
- 12. تحسن GPT-6 Luna في اختبارات الرؤية
- 13. ماذا يعني تحسن GDP.pdf؟
- 14. ماذا يخبرنا ارتفاع MMMU-Pro؟
- 15. ارتفاع GDPval-AA v2.1 بمقدار 71 Elo
- 16. تحسن AA-Briefcase بمقدار 36 Elo
- 17. لماذا كان تحسن GPT-6 Sol أصغر؟
- 18. لماذا لا تكفي نتيجة اختبار واحدة؟
- 19. ماذا يعني GPT-6.1 Sol للمطورين؟
- 20. العلاقة بين التكلفة والوكلاء الذكيين
- 21. البرمجة كأحد أهم مجالات Sol
- 22. استخدام الحاسوب والمهام متعددة الخطوات
- 23. ماذا تعني كلمة "مهام مهنية"؟
- 24. لماذا تصبح الفروقات الصغيرة ضخمة على نطاق واسع؟
- 25. تأثير التكلفة على الشركات
- 26. الأسعار الرسمية الحالية في API
- 27. أهمية الإدخال المخزن مؤقتًا
- 28. هل يجب استخدام GPT-6.1 Sol لكل شيء؟
- 29. حدود الادعاءات المتعلقة بالكفاءة
- 30. ماذا يعني هذا لمستقبل نماذج الذكاء الاصطناعي؟
- 31. الخلاصة
1. ما الجديد في GPT-6.1 Sol؟
أطلقت OpenAI GPT-6.1 Sol باعتباره إصدارًا أحدث من عائلة Sol، مع تركيز واضح على العلاقة بين جودة النتائج وتكلفة تشغيل النموذج.
وتصف OpenAI النموذج بأنه يقدم أداءً قريبًا من GPT-6 Astra في الأعمال المعقدة، ولكن بسعر أقل، وتوصي به عندما يحتاج المستخدم إلى قدرات قوية في البرمجة أو استخدام الحاسوب أو العمل المهني دون دفع تكلفة النموذج الأعلى.
هذه الفكرة تبدو بسيطة، لكنها تمثل تحولًا مهمًا في طريقة تقييم نماذج الذكاء الاصطناعي.
في السنوات الأولى من المنافسة بين النماذج، كان التركيز غالبًا على نتائج اختبارات مثل الرياضيات والبرمجة والاستدلال واللغة.
أما الآن، فالمستخدم التجاري يهتم بسؤال مختلف:
هذا السؤال هو الذي يجعل GPT-6.1 Sol مهمًا من الناحية الاقتصادية، وليس التقنية فقط.
2. لماذا أصبحت كفاءة التكلفة مهمة؟
الذكاء الاصطناعي المتقدم ليس مجانيًا من ناحية البنية التحتية.
النماذج التي تستخدم كميات كبيرة من الحساب أثناء التفكير تحتاج إلى موارد حوسبة كبيرة، خصوصًا عندما تنفذ مهام طويلة متعددة الخطوات.
وعندما يستخدم نموذج مرة واحدة فقط، قد لا يكون الفرق بين دولار واحد وثلاثة دولارات كبيرًا.
لكن الصورة تتغير عندما يصبح النظام جزءًا من منتج يستخدم آلاف أو ملايين المرات.
إذا كانت مهمة واحدة تكلف دولارًا واحدًا ويتم تنفيذها مليون مرة، فإن تكلفة النموذج تصل إلى مليون دولار.
إذا أمكن تنفيذ المهمة بجودة مماثلة تقريبًا مقابل 0.70 دولار، يصبح الفرق مئات الآلاف من الدولارات.
لهذا السبب أصبحت كفاءة التكلفة أحد أهم المقاييس عند تقييم نماذج الذكاء الاصطناعي الحديثة.
ولا تعني كفاءة التكلفة أن النموذج الأرخص هو الأفضل دائمًا.
المعيار الحقيقي هو العلاقة بين:
- جودة النتيجة.
- صعوبة المهمة.
- عدد خطوات التفكير.
- السرعة.
- تكلفة التنفيذ.
- قدرة النموذج على استخدام الأدوات.
3. الأرقام: $0.72 مقابل $3.26
من أبرز الأرقام المرتبطة بالحديث عن GPT-6.1 Sol تكلفة المهمة عند استخدام أعلى مستوى من الجهد.
وفق الأرقام الواردة في البيانات التي نستند إليها هنا، تبلغ تكلفة المهمة في الاختبار المستخدم لقياس مؤشر الذكاء حوالي $0.72 لـGPT-6.1 Sol، مقابل حوالي $3.26 لـGPT-6 Astra.
| النموذج | تكلفة المهمة المذكورة | المقارنة مع GPT-6.1 Sol |
|---|---|---|
| GPT-6.1 Sol | $0.72 | المرجع |
| GPT-6 Astra | $3.26 | أعلى بكثير |
| GPT-6 Sol | $1.04 | أعلى من GPT-6.1 Sol |
| GPT-5.6 Sol | $1.99 | أعلى بشكل واضح |
وبهذه الأرقام، تصبح تكلفة GPT-6.1 Sol أقل من ربع تكلفة GPT-6 Astra في ذلك الاختبار المحدد.
لكن يجب الانتباه إلى أن هذه تكلفة مهمة benchmark معينة وليست سعر استخدام ثابتًا لكل طلب في API.
هذه نقطة مهمة جدًا لأن OpenAI تسعر نماذجها في الـAPI بناءً على عدد الرموز المستخدمة، بينما تختلف تكلفة المهمة الفعلية بحسب طول المدخلات والمخرجات ومستوى الاستدلال والأدوات وطبيعة المهمة. وتعرض OpenAI حاليًا GPT-6.1 Sol بسعر قياسي قدره $2 لكل مليون رمز إدخال و$10 لكل مليون رمز إخراج.
4. مقارنة GPT-6.1 Sol مع GPT-6 Sol
المقارنة مع GPT-6 Sol الأصلي مهمة لأن GPT-6.1 Sol ليس مجرد نموذج جديد في السلسلة، بل يمثل محاولة لتحسين العلاقة بين الأداء والتكلفة داخل فئة Sol نفسها.
وفق البيانات المذكورة، تبلغ تكلفة المهمة في المؤشر حوالي $1.04 لـGPT-6 Sol، مقابل $0.72 لـGPT-6.1 Sol عند أقصى جهد.
هذا يعني أن الإصدار الجديد يخفض تكلفة المهمة بحوالي 31%.
والأهم أن التخفيض يأتي مع الحفاظ على مستوى مرتفع من الأداء في المهام المعقدة.
وتؤكد وثائق OpenAI الحالية أن GPT-6.1 Sol يدعم مستويات reasoning effort هي:
- Low
- Medium
- High
- XHigh
- Max
ويكون Medium هو المستوى الافتراضي، بينما لا يدعم النموذج مستويي None وMinimal.
5. ماذا يعني انخفاض التكلفة مقارنة بـGPT-5.6 Sol؟
عند مقارنة GPT-6.1 Sol مع GPT-5.6 Sol، يصبح التحسن الاقتصادي أكثر وضوحًا.
وفق الأرقام المذكورة في البيانات التي طلبت تحليلها، تبلغ تكلفة المهمة حوالي $1.99 لـGPT-5.6 Sol، مقابل $0.72 لـGPT-6.1 Sol.
أي أن النموذج الجديد يحتاج إلى تكلفة أقل بكثير لتنفيذ المهمة نفسها في ذلك التقييم.
لكن المقارنة لا تعني أن جميع استخدامات API ستنتج هذا الفرق نفسه.
هناك فرق بين:
- سعر الرموز.
- عدد الرموز التي ينتجها النموذج.
- عدد خطوات التفكير.
- استخدام الأدوات.
- تكلفة كل مهمة كاملة.
وهذا هو السبب في أن مقاييس "التكلفة لكل مهمة" مفيدة جدًا عند مقارنة نماذج تستخدم reasoning بشكل مختلف.
6. ما معنى حدود باريتو لكفاءة التكلفة؟
مصطلح Pareto frontier أو "حدود باريتو" يستخدم لوصف مجموعة من الخيارات التي لا يمكن تحسين أحد جوانبها دون التضحية بجانب آخر.
في حالة نماذج الذكاء الاصطناعي، يمكن تصور محورين:
- محور للذكاء أو جودة الأداء.
- محور للتكلفة.
إذا كان لدينا نموذجان يقدمان المستوى نفسه من الذكاء تقريبًا، لكن أحدهما أرخص، فإن النموذج الأغلى لا يكون على حدود باريتو لأنه يمكن استبداله بخيار أرخص بنفس مستوى الأداء.
والعبارة التي تقول إن مستويات GPT-6.1 Sol تدفع حدود كفاءة التكلفة للأمام تعني أن النموذج يحاول تقديم مجموعة من نقاط الأداء والتكلفة تجعل الخيارات السابقة أقل جاذبية عند المقارنة المباشرة.
إذا احتجت مستوى معينًا من الأداء، فإن الهدف هو أن تجد في GPT-6.1 Sol خيارًا يحقق ذلك المستوى بتكلفة أقل من النماذج السابقة.
وهذه الفكرة أكثر أهمية من مجرد إعلان أن نموذجًا "أذكى" من نموذج آخر.
7. مستويات جهد التفكير في GPT-6.1 Sol
من أهم خصائص GPT-6.1 Sol أنه لا يعمل بمستوى واحد ثابت من reasoning.
يمكن للمستخدم اختيار مستوى الجهد حسب طبيعة المهمة.
في المهام البسيطة، قد لا يكون من المنطقي إنفاق قدر كبير من الحوسبة على التفكير.
أما في مسألة برمجية معقدة أو سير عمل متعدد الخطوات، فقد يكون من المفيد إعطاء النموذج وقتًا وموارد أكبر للتفكير.
توضح وثائق OpenAI أن GPT-6.1 Sol يدعم مستويات low وmedium وhigh وxhigh وmax، وهو ما يسمح بموازنة الأداء والتكلفة حسب المهمة.
| مستوى الجهد | الفكرة العامة | الاستخدام المحتمل |
|---|---|---|
| Low | جهد أقل | مهام تحتاج استجابة أسرع |
| Medium | توازن | الاستخدام العام |
| High | تفكير أعمق | مهام أكثر تعقيدًا |
| XHigh | جهد مرتفع جدًا | مشكلات صعبة متعددة الخطوات |
| Max | أقصى جهد | المهام التي تستحق أعلى مستوى من الاستدلال |
8. الفرق بين تكلفة المهمة وسعر الرموز
هذه من أهم النقاط التي يجب توضيحها في أي مقال عن كفاءة التكلفة.
قد يقرأ المستخدم أن مهمة معينة كلفت $0.72، ثم يذهب إلى صفحة الأسعار ويجد أن سعر GPT-6.1 Sol هو $2 لكل مليون رمز إدخال و$10 لكل مليون رمز إخراج.
قد يبدو الأمر متناقضًا، لكنه ليس كذلك.
سعر الرموز هو سعر وحدة الاستخدام.
أما تكلفة المهمة فهي تكلفة تشغيل مهمة كاملة وفق إعدادات وكمية بيانات وعدد رموز وعمليات تفكير وأدوات محددة.
لذلك يمكن أن تختلف تكلفة مهمة من مهمة إلى أخرى حتى عند استخدام النموذج نفسه.
وتعرض OpenAI حاليًا السعر القياسي لـGPT-6.1 Sol عند $2 لكل مليون رمز إدخال و$0.10 للإدخال المخزن مؤقتًا و$10 لكل مليون رمز إخراج، بينما GPT-6 Astra يبلغ $10 للإدخال و$50 للإخراج.
9. لماذا ما زال GPT-6 Astra مهمًا؟
انخفاض تكلفة GPT-6.1 Sol لا يعني أن GPT-6 Astra أصبح بلا فائدة.
OpenAI تصف Astra بأنه نموذجها الأعلى للمهام التي تتطلب أقصى مستوى من الذكاء والاستدلال، بينما تصف GPT-6.1 Sol بأنه خيار قريب من Astra مع تكلفة أقل.
بعبارة أخرى، النموذجان يستهدفان حالات استخدام مختلفة نسبيًا.
يمكن أن يكون Astra مناسبًا عندما تكون الأولوية القصوى لجودة النتيجة، حتى إذا كانت تكلفة المهمة أعلى.
أما Sol فيصبح جذابًا عندما تكون المهمة معقدة لكن عدد المهام كبير، أو عندما يكون المستخدم بحاجة إلى توازن أفضل بين الجودة والتكلفة.
لا يوجد نموذج واحد مناسب بالضرورة لكل مهمة. الاختيار يعتمد على مستوى الجودة المطلوب، وحجم الاستخدام، والميزانية، وطبيعة المهمة.
10. إصلاح مشكلة الإدخال متعدد الوسائط
الجزء الثاني من القصة يتعلق بالصور.
النماذج الحديثة لا تتعامل مع النص فقط. يمكنها أيضًا استقبال صور ومستندات وصفحات وجداول ومحتوى بصري.
وهذا يسمى عادة Multimodal Input.
لكن معالجة الصور تمر بعدة مراحل قبل أن تصل المعلومات البصرية إلى النموذج.
إذا حدث خطأ في مرحلة الترميز أو تحويل الصورة إلى تمثيل يستطيع النموذج معالجته، فقد تتأثر النتيجة حتى لو كان النموذج نفسه قويًا في الرؤية.
وفق المعلومات التي قدمتها، أصلحت OpenAI خطأ في ترميز الصور أثر في GPT-6 Luna وGPT-6 Sol، وهو ما أدى إلى تحسن في مجموعة من الاختبارات التي تعتمد بدرجات مختلفة على الفهم البصري.
وهذا النوع من الإصلاح مهم لأنه يوضح أن أداء النموذج لا يعتمد على النموذج اللغوي وحده، وإنما على كامل سلسلة معالجة البيانات.
11. لماذا تؤثر معالجة الصور في نتائج النماذج؟
لنفترض أن النموذج يستطيع فهم الرسوم البيانية والوثائق والصور.
إذا تم تحويل الصورة بطريقة غير صحيحة قبل إرسالها إلى النموذج، فقد تضيع بعض المعلومات.
يمكن أن تكون المشكلة في:
- الدقة.
- الضغط.
- الترميز.
- الأبعاد.
- تقسيم الصورة.
- معالجة النص داخل الصورة.
عندها قد يبدو أن النموذج ضعيف في الاختبار، بينما المشكلة الحقيقية في طريقة تقديم الصورة إليه.
وهذا يفسر لماذا يمكن لإصلاح هندسي في نظام الإدخال أن يؤدي إلى تحسن في نتائج benchmarks دون إعادة تدريب النموذج بالكامل.
12. تحسن GPT-6 Luna في اختبارات الرؤية
بحسب الأرقام المذكورة في البيانات التي طلبت تحليلها، حصل GPT-6 Luna عند أقصى جهد على تحسن بمقدار نقطة واحدة في مؤشر الذكاء بعد إصلاح مشكلة ترميز الصور.
لكن التحسن لم يكن متساويًا في جميع الاختبارات.
وهذه نقطة مهمة.
الاختبارات التي تعتمد بشكل أكبر على فهم الصور أو المستندات البصرية قد تستفيد بصورة أكبر من إصلاح في مسار الإدخال متعدد الوسائط.
ولهذا ظهرت زيادات أكبر في بعض التقييمات مقارنة بالزيادة الصغيرة في مؤشر الذكاء العام.
13. ماذا يعني تحسن GDP.pdf؟
أحد الأرقام المذكورة هو زيادة قدرها 2.4 نقطة في اختبار GDP.pdf.
عندما يكون benchmark مبنيًا على مستندات، فإن القدرة على قراءة الصفحة وفهم عناصرها البصرية يمكن أن تكون مهمة جدًا.
المستندات ليست مجرد نص.
قد تحتوي على:
- جداول.
- عناوين.
- رسوم.
- مخططات.
- توزيع بصري للمعلومات.
- أرقام في أماكن مختلفة.
إذا أصبحت معالجة الصور أكثر دقة، فمن الطبيعي أن تظهر الفائدة بصورة أكبر في اختبارات تتطلب فهم هذه العناصر.
14. ماذا يخبرنا ارتفاع MMMU-Pro؟
وفق الأرقام التي قدمتها، ارتفع أداء GPT-6 Luna في MMMU-Pro بمقدار 4.1 نقطة.
MMMU من الاختبارات المعروفة التي تقيس قدرة النماذج متعددة الوسائط على التعامل مع أسئلة من مجالات متنوعة تتطلب فهمًا للنصوص والصور.
ولهذا فإن أي إصلاح في مسار معالجة الصور يمكن أن يكون له تأثير ملحوظ على هذا النوع من التقييمات.
لكن يجب عدم تفسير الزيادة البالغة 4.1 نقطة على أنها تعني أن النموذج أصبح "أذكى" بالضرورة في كل أنواع المهام.
الأدق هو القول إن الإصلاح حسّن أداء النموذج في الاختبار الذي يعتمد على هذه القدرات.
15. ارتفاع GDPval-AA v2.1 بمقدار 71 Elo
من أكثر الأرقام لفتًا للانتباه في البيانات المقدمة ارتفاع نتيجة GPT-6 Luna في GDPval-AA v2.1 بمقدار 71 نقطة Elo.
نظام Elo يستخدم لقياس الأداء النسبي في المقارنات، وهو معروف من أنظمة التصنيف التنافسية.
OpenAI قدمت أصلًا GDPval باعتباره تقييمًا للمهام الواقعية ذات القيمة الاقتصادية عبر مجموعة من المهن، بهدف قياس قدرة النماذج على تنفيذ أعمال مرتبطة بالعمل الحقيقي بدل الاعتماد فقط على الأسئلة الأكاديمية.
لذلك فإن التحسن في نسخة من هذا النوع من التقييمات قد يكون مهمًا عند تحليل قدرة النموذج على التعامل مع مستندات ومهام مهنية.
ارتفاع Elo لا يعني أن النموذج أصبح أفضل بـ71%، ولا يمكن تحويل الرقم مباشرة إلى نسبة تحسن في كل أنواع العمل. Elo مقياس تصنيفي يعتمد على نتائج المقارنات.
16. تحسن AA-Briefcase بمقدار 36 Elo
ظهر أيضًا تحسن قدره 36 Elo في AA-Briefcase وفق البيانات المذكورة.
مثل GDPval، يجب فهم الرقم في سياق benchmark نفسه.
هذه التحسينات تهم لأنها تظهر أن إصلاحًا واحدًا في مسار الصور يمكن أن ينتشر أثره على اختبارات مختلفة بدل أن يكون التحسن محصورًا في اختبار بصري واحد.
ومع ذلك، لا يمكن استنتاج أن كل مهمة بصرية ستتحسن بالقدر نفسه.
17. لماذا كان تحسن GPT-6 Sol أصغر؟
تشير البيانات التي قدمتها إلى أن GPT-6 Sol شهد تحسنًا صغيرًا بعد إصلاح ترميز الصور مقارنة بالتحسن الذي ظهر في Luna.
هذا أمر منطقي من منظور التقييمات، لأن النماذج قد تستخدم مسارات مختلفة أو تكون حساسية كل نموذج لنفس مشكلة الإدخال مختلفة.
كما أن benchmark معين قد يكون أكثر حساسية للمعلومات البصرية من غيره.
لذلك لا ينبغي تفسير الفرق بين Luna وSol على أنه دليل بسيط على أن أحد النموذجين "أفضل في الرؤية" بشكل مطلق.
الأدق هو النظر إلى مجموعة واسعة من الاختبارات وتحديد المجالات التي يظهر فيها التحسن.
18. لماذا لا تكفي نتيجة اختبار واحدة؟
هذه قاعدة مهمة في قراءة أخبار الذكاء الاصطناعي.
عندما نرى أن نموذجًا ارتفع عدة نقاط في benchmark معين، قد يبدو الخبر ضخمًا.
لكن النموذج يمكن أن يتحسن في اختبار واحد ويظل مستواه قريبًا من السابق في اختبار آخر.
لذلك من الأفضل النظر إلى:
- اختبارات الاستدلال.
- اختبارات البرمجة.
- اختبارات الرؤية.
- المهام المهنية.
- استخدام الأدوات.
- السرعة.
- التكلفة.
وكلما كانت الصورة أوسع، كان من الأسهل معرفة ما إذا كان التحسن عامًا أم مرتبطًا بنوع معين من المهام.
19. ماذا يعني GPT-6.1 Sol للمطورين؟
بالنسبة للمطورين، أحد أكبر التغييرات المحتملة هو القدرة على تشغيل مهام reasoning أكثر تعقيدًا دون أن تصبح التكلفة مرتفعة جدًا.
وتوضح OpenAI أن GPT-6.1 Sol موجه للبرمجة المعقدة واستخدام الحاسوب والعمل المهني، مع دعم أدوات مثل البحث على الويب والبحث في الملفات وCode Interpreter واستخدام الحاسوب.
وهذا مهم بشكل خاص في الأنظمة التي لا تنفذ طلبًا واحدًا فقط.
فالوكيل الذكي قد ينفذ عشرات الخطوات لإنجاز مهمة.
إذا كانت كل خطوة تحتاج إلى نموذج قوي، فإن تكلفة الخطوات تتراكم بسرعة.
لذلك فإن تقليل تكلفة المهمة الواحدة يمكن أن يكون له أثر كبير على تكلفة النظام بالكامل.
20. العلاقة بين التكلفة والوكلاء الذكيين
الـAI Agents تختلف عن روبوتات الدردشة البسيطة.
في المحادثة التقليدية، قد يرسل المستخدم سؤالًا ويحصل على إجابة.
أما الوكيل فقد:
- يفهم المهمة.
- يضع خطة.
- يبحث عن المعلومات.
- يستخدم أداة.
- يفحص النتيجة.
- يعدل الخطة.
- ينفذ خطوة جديدة.
- يتحقق من النتيجة.
كل خطوة يمكن أن تتطلب استدعاء النموذج.
لذلك فإن نموذجًا قويًا لكنه أرخص لكل مهمة يمكن أن يكون مهمًا جدًا في بناء وكلاء قابلة للتوسع.
وتشير OpenAI إلى أن GPT-6.1 Sol يدعم الأدوات واستخدام الحاسوب والعمل البرمجي المعقد، وهي مجالات ترتبط بشكل مباشر بهذا النوع من سير العمل.
21. البرمجة كأحد أهم مجالات Sol
البرمجة من المجالات التي تستفيد كثيرًا من نماذج reasoning.
فالمشكلة البرمجية المعقدة لا تحتاج دائمًا إلى كتابة بضعة أسطر من الكود فقط.
قد يحتاج النموذج إلى:
- فهم بنية مشروع كامل.
- قراءة ملفات متعددة.
- تحديد مصدر الخطأ.
- اقتراح تعديل.
- تشغيل اختبارات.
- تحليل نتائج الاختبارات.
- إعادة تعديل الكود.
- التأكد من عدم كسر وظائف أخرى.
هذه عملية متعددة الخطوات، ولذلك تصبح تكلفة كل عملية استدلال مهمة.
وتصنف OpenAI GPT-6.1 Sol ضمن النماذج المناسبة للبرمجة المعقدة وسير العمل الاحترافي.
22. استخدام الحاسوب والمهام متعددة الخطوات
جانب آخر مهم هو computer use.
النموذج الذي يستطيع التعامل مع واجهات الكمبيوتر يمكن استخدامه لتنفيذ عمليات أكثر تعقيدًا من مجرد توليد النص.
لكن هذه العمليات عادةً تحتوي على عدة خطوات.
كل خطوة إضافية تعني احتمال استدعاء النموذج مرة أخرى أو استخدام أداة أخرى.
لذلك تصبح الكفاءة الاقتصادية عنصرًا أساسيًا.
وتوضح وثائق OpenAI أن GPT-6.1 Sol يدعم computer use عبر Responses API.
23. ماذا تعني كلمة "مهام مهنية"؟
عندما تصف OpenAI GPT-6.1 Sol بأنه مناسب للعمل المهني، فإن المقصود ليس مهمة واحدة محددة.
يمكن أن يشمل ذلك أعمالًا مثل:
- تحليل المستندات.
- كتابة البرمجيات.
- البحث.
- التعامل مع جداول البيانات.
- إعداد التقارير.
- تنفيذ سير العمل.
- تحليل المعلومات.
- استخدام الأدوات.
والعامل المشترك بينها هو أنها تتطلب أكثر من إجابة قصيرة.
24. لماذا تصبح الفروقات الصغيرة ضخمة على نطاق واسع؟
لنأخذ الفرق المذكور بين $1.04 و$0.72.
الفرق في مهمة واحدة هو $0.32 فقط.
لكن عند تنفيذ مليون مهمة:
وهذا يوضح لماذا يهتم المطورون والشركات بتكلفة المهمة.
في الأنظمة الكبيرة، لا يتم تنفيذ المهمة مرة أو عشر مرات.
قد يتم تنفيذها آلاف أو ملايين المرات يوميًا.
وهنا يمكن أن تتحول الفروقات الصغيرة إلى مبالغ كبيرة.
25. تأثير التكلفة على الشركات
الشركات لا تقيس النموذج فقط بناءً على قدرته على الإجابة.
هناك ميزانية تشغيلية كاملة.
إذا كان النموذج أغلى، فقد تضطر الشركة إلى:
- تقليل عدد الطلبات.
- استخدام نموذج أصغر.
- تقييد الوكلاء.
- تقليل طول السياق.
- تقليل عدد الخطوات.
أما إذا انخفضت تكلفة المهام، فقد يصبح من الممكن استخدام الذكاء الاصطناعي في عمليات كانت مكلفة سابقًا.
وهذا هو الجانب الاقتصادي الأهم من GPT-6.1 Sol.
26. الأسعار الرسمية الحالية في API
وفق صفحة التسعير الرسمية لـOpenAI، تبلغ أسعار GPT-6.1 Sol القياسية:
| النموذج | الإدخال / مليون رمز | الإدخال المخزن مؤقتًا | الإخراج / مليون رمز |
|---|---|---|---|
| GPT-6.1 Sol | $2 | $0.10 | $10 |
| GPT-6 Astra | $10 | $1 | $50 |
| GPT-6 Sol | $2 | $0.20 | $10 |
| GPT-6 Luna | $0.10 | $0.01 | $0.50 |
وتشير صفحة الأسعار إلى أن GPT-6.1 Sol وGPT-6 Sol لديهما السعر نفسه للإدخال والإخراج، لكن GPT-6.1 Sol يخفض سعر الإدخال المخزن مؤقتًا إلى $0.10 لكل مليون رمز مقابل $0.20 لـGPT-6 Sol.
هذه نقطة أخرى يمكن أن تؤثر في التطبيقات التي تعيد استخدام أجزاء كبيرة من السياق.
27. أهمية الإدخال المخزن مؤقتًا
في بعض التطبيقات، لا يبدأ كل طلب من الصفر.
قد يكون هناك سياق طويل متكرر، مثل:
- تعليمات النظام.
- ملفات المشروع.
- تعريفات الأدوات.
- معلومات متكررة.
- سياق المحادثة.
عندما يكون جزء من الإدخال مؤهلًا للتخزين المؤقت، يمكن أن تكون تكلفته أقل من الإدخال العادي.
ولهذا فإن انخفاض سعر cached input في GPT-6.1 Sol يمكن أن يكون مهمًا للتطبيقات التي تعتمد على سياقات متكررة. وتعرض OpenAI حاليًا سعر $0.10 لكل مليون رمز للإدخال المخزن مؤقتًا في GPT-6.1 Sol.
28. هل يجب استخدام GPT-6.1 Sol لكل شيء؟
لا توجد قاعدة تقول إن نموذجًا واحدًا يجب أن يستخدم في جميع المهام.
يمكن التفكير في الاختيار بهذه الطريقة:
| نوع المهمة | الخيار المحتمل |
|---|---|
| أعلى مستوى من الاستدلال المعقد | GPT-6 Astra |
| موازنة الذكاء والتكلفة | GPT-6.1 Sol |
| مهام كبيرة الحجم وحساسة للتكلفة | GPT-6 Luna |
وهذه ليست قاعدة مطلقة، وإنما هي الطريقة التي تقدم بها OpenAI حاليًا أدوار هذه النماذج في اختيار النموذج.
الأفضل عمليًا هو اختبار النماذج على مهام حقيقية من التطبيق نفسه بدل الاعتماد على benchmark واحد.
29. حدود الادعاءات المتعلقة بالكفاءة
هناك نقطة ضرورية عند قراءة عبارة مثل "لا يوجد نموذج أرخص لنفس مستوى الذكاء".
هذه العبارة يجب فهمها ضمن benchmark ومنهجية التقييم المستخدمة.
لا يمكن تحويلها إلى قاعدة عامة تقول إن GPT-6.1 Sol هو الأرخص في كل مهمة ممكنة.
قد تختلف النتيجة إذا تغير:
- نوع المهمة.
- حجم المدخلات.
- طول المخرجات.
- مستوى reasoning.
- الأدوات المستخدمة.
- طريقة قياس الجودة.
- أسعار API المستقبلية.
لذلك فإن الأدق هو القول إن GPT-6.1 Sol يحقق نقطة قوية في منحنى كفاءة التكلفة وفق التقييمات المشار إليها، وليس أن هناك نموذجًا واحدًا أرخص في جميع الظروف.
30. ماذا يعني هذا لمستقبل نماذج الذكاء الاصطناعي؟
ربما يكون أهم درس من GPT-6.1 Sol هو أن المنافسة لم تعد تدور فقط حول من يستطيع بناء النموذج الأكثر ذكاءً.
هناك منافسة أخرى تجري بالتوازي:
يمكن للنموذج أن يكون ممتازًا في المختبر، لكن إذا كانت تكلفة تشغيله مرتفعة جدًا، فقد يكون من الصعب استخدامه في ملايين العمليات اليومية.
أما إذا استطاعت الشركة خفض تكلفة المهمة مع الحفاظ على مستوى مرتفع من الجودة، فإن النموذج يصبح أكثر قابلية للتوسع.
وهذا ما يجعل GPT-6.1 Sol مهمًا في سياق تطور عائلة GPT-6.
فـOpenAI تضع Astra في أعلى فئة من حيث القدرة، بينما تقدم Sol كحل أقرب إلى Astra من ناحية الأداء مع تكلفة أقل، وتضع Luna كخيار أكثر كفاءة للمهام المركزة وعالية الحجم.
31. ماذا عن المنافسة بين الذكاء والكفاءة؟
لسنوات، كان من الممكن تصور العلاقة بين الذكاء والتكلفة كالتالي:
نموذج أقوى = نموذج أغلى.
لكن التطورات الجديدة تحاول كسر هذه العلاقة.
الهدف ليس بالضرورة جعل النموذج الأرخص أفضل من النموذج الأغلى في كل شيء، وإنما جعل منحنى الأداء مقابل التكلفة أكثر كفاءة.
إذا استطاع نموذج متوسط التكلفة تحقيق 90 أو 95 أو 98% من جودة نموذج أغلى بكثير في مجموعة كبيرة من المهام، فقد يصبح الخيار الاقتصادي أكثر جاذبية لبعض التطبيقات.
وهذا بالضبط ما يجعل مفهوم Pareto frontier مهمًا في سوق النماذج.
32. لماذا تعتبر إصلاحات البنية التحتية مهمة مثل إطلاق نموذج جديد؟
قد يعتقد البعض أن التحسن الكبير في benchmark يحتاج دائمًا إلى نموذج جديد أو تدريب جديد.
لكن قصة معالجة الصور توضح شيئًا مختلفًا.
أحيانًا تكون المشكلة في الطريق الذي تصل به البيانات إلى النموذج.
إذا تم إصلاح هذا المسار، يمكن أن تتحسن النتائج دون تغيير جوهر النموذج نفسه.
وهذا يعني أن هندسة النظام المحيط بالنموذج أصبحت جزءًا أساسيًا من جودة الذكاء الاصطناعي.
في النماذج متعددة الوسائط تحديدًا، لا يكفي أن يكون النموذج قادرًا نظريًا على فهم الصور.
يجب أن تكون الصورة نفسها ممثلة بطريقة صحيحة قبل أن يبدأ النموذج عملية الاستدلال.
33. الصورة الأكبر: من النماذج إلى أنظمة الذكاء الاصطناعي
من السهل التركيز على اسم النموذج.
لكن المستخدم النهائي لا يتعامل مع النموذج وحده.
هو يتعامل مع نظام كامل يتكون من:
- النموذج.
- واجهة الاستخدام.
- الأدوات.
- البحث.
- الملفات.
- الذاكرة أو السياق.
- معالجة الصور.
- التخزين المؤقت.
- البنية التحتية.
لذلك يمكن أن يؤدي تحسين صغير في أحد هذه المكونات إلى فرق كبير في التجربة النهائية.
وهذا ما يظهر في حالة GPT-6 Luna وSol بعد إصلاح معالجة الصور، وفي حالة GPT-6.1 Sol مع تحسين العلاقة بين القدرة والتكلفة.
34. ماذا يعني ذلك للمستخدم العادي؟
قد تبدو أرقام الـAPI بعيدة عن المستخدم العادي، لكنها تؤثر في المنتجات التي يستخدمها.
كلما انخفضت تكلفة تشغيل النماذج القوية، يصبح من الأسهل على الشركات والمطورين دمج قدرات reasoning متقدمة في التطبيقات.
وهذا قد يؤدي إلى:
- مساعدين أكثر قدرة.
- أدوات برمجة أفضل.
- وكلاء أكثر استقلالية.
- تحليل مستندات أكثر تقدمًا.
- معالجة أفضل للصور.
- تطبيقات ذكاء اصطناعي تعمل على نطاق أكبر.
لكن ذلك لا يعني أن كل تطبيق سيستخدم GPT-6.1 Sol أو أن كل خدمة ستصبح أرخص مباشرة.
المطور هو الذي يقرر النموذج والبنية والتكلفة النهائية.
35. الخلاصة النهائية
GPT-6.1 Sol يمثل اتجاهًا مهمًا في تطور نماذج OpenAI: تحسين العلاقة بين الذكاء والتكلفة.
الأرقام المذكورة في البيانات التي تناولناها هنا تضع تكلفة مهمة المؤشر عند حوالي $0.72 لـGPT-6.1 Sol عند أقصى جهد، مقابل $3.26 لـGPT-6 Astra، و$1.04 لـGPT-6 Sol، و$1.99 لـGPT-5.6 Sol.
هذه الأرقام لا تعني أن هذه هي أسعار كل استخدامات API، بل تصف تكلفة المهمة في التقييم المشار إليه. أما أسعار API الرسمية الحالية لـGPT-6.1 Sol فهي $2 لكل مليون رمز إدخال و$10 لكل مليون رمز إخراج، مع $0.10 للإدخال المخزن مؤقتًا.
وفي الجانب متعدد الوسائط، أدى إصلاح مشكلة ترميز الصور إلى تحسينات ملحوظة في بعض تقييمات GPT-6 Luna، بما في ذلك الأرقام المذكورة لـGDP.pdf وMMMU-Pro وGDPval-AA v2.1 وAA-Briefcase.
هذه التحسينات توضح أن أداء نموذج الذكاء الاصطناعي لا يعتمد فقط على قدرات النموذج الأساسية، وإنما أيضًا على جودة النظام الذي يعالج البيانات قبل وصولها إليه.
أما بالنسبة للمطورين والشركات، فإن أهمية GPT-6.1 Sol قد تكون أكبر في المهام التي تتكرر آلاف أو ملايين المرات، لأن الفرق الصغير في تكلفة المهمة يمكن أن يتحول إلى وفورات كبيرة عند التوسع.
المصادر والمراجع
- وثائق OpenAI الرسمية لنموذج GPT-6.1 Sol.
- دليل OpenAI لاختيار نماذج GPT-6.
- صفحة أسعار OpenAI API الرسمية.
- صفحة مقارنة نماذج OpenAI.
- معلومات OpenAI الرسمية حول GPT-6 Astra وGPT-6.1 Sol وGPT-6 Luna.
- صفحة OpenAI حول تقييم GDPval والمهام الواقعية.
تمت إضافة شرح تحليلي إلى الأرقام والأداء بدل الاكتفاء بإعادة نشر الإعلان، مع التمييز بين تكلفة المهمة في الاختبارات وبين أسعار استخدام API.
