Instructions to use Hatim2221/Fikr-7B-Reasoning with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Local Apps Settings
- Unsloth Desktop
- Fikr-7B-Reasoning: Benchmark & Evaluation
- 📊 Benchmark Results
- 🔍 Sample Comparison
- Fikr-7B-Reasoning (Ours)
- Prompt Format
- السؤال: كم يساوي 47 × 36؟
- السؤال: عند أحمد 24 تفاحة، أعطى نصفها لصديقه ثم اشترى 10 تفاحات إضافية. كم تفاحة أصبح عنده؟
- السؤال: قطار يسير بسرعة 80 كم/سا، كم يستغرق ليقطع 240 كم؟
- السؤال: إذا كان طبيب يعطيك 3 حبوب وطلب منك أخذ حبة كل نصف ساعة، فكم من الوقت تستغرق حتى تنهي الحبوب؟
- السؤال: كم عدد الأشهر التي فيها 28 يوماً؟
- ملاحظات الاختبار (Evaluation Notes)
Fikr-7B-Reasoning: Benchmark & Evaluation
Fikr-7B-Reasoning is an Arabic reasoning model fine-tuned from Qwen/Qwen2.5-7B-Instruct using supervised fine-tuning (SFT) to enforce structured, multi-step Chain-of-Thought reasoning inside native <think>...</think> tokens.
📊 Benchmark Results
Both models were evaluated on the full test split (1,319 questions) of the Arabic-GSM8K benchmark using exact numerical match via greedy decoding (temperature=0.0) on an NVIDIA A100 GPU:
| Model | Architecture | Arabic Reasoning Format | Arabic-GSM8K Accuracy | Delta (Δ) |
|---|---|---|---|---|
Qwen/Qwen2.5-7B-Instruct (Base) |
7B Dense | Standard CoT | 72.40%[cite: 3] | Baseline |
Fikr-7B-Reasoning (Ours) |
7B Dense | <think> Native CoT |
71.95%[cite: 4] | -0.45% |
Key Takeaways
- Accuracy Trade-off: While the model strictly enforces the
<think>tag reasoning structure, it experienced a minor -0.45% regression in raw exact-match accuracy compared to the strong Qwen 2.5 7B baseline[cite: 3, 4]. This is a common phenomenon in first-pass SFT reasoning models and typically requires a follow-up Reinforcement Learning (RL) phase (like DPO or PPO) to align the structured thoughts with correct final answers. - Clean Trace Separation: The fine-tuned model strictly separates intermediate logical steps inside
<think>...</think>from the final parsed response[cite: 4]. - Arabic Mathematical Fluency: The model demonstrates improved formatting stability across multi-step arithmetic, fraction reductions, and currency conversions in native Arabic phrasing.
🔍 Sample Comparison
Problem:
ذهب كايلار إلى المتجر لشراء أكواب لشقة الجديدة. تكلفة الكوب الواحد 5 دولارات، لكن كل كوب ثاني يكلف فقط 60٪ من السعر. يريد كايلار شراء 16 كوبًا. كم يجب أن يدفع مقابلها؟[cite: 3]
Fikr-7B-Reasoning (Ours)
<think>
1. سعر الكوب الأول هو 5 دولارات.
2. سعر الكوب الثاني هو 60٪ من 5 دولارات، أي 5 * 0.60 = 3 دولارات.
3. لحساب التكلفة لـ 16 كوبًا:
- الكؤوس الأولى (8 كؤوس): 8 * 5 = 40 دولارًا.
- الكؤوس المخفضة (8 كؤوس): 8 * 3 = 24 دولارًا.
- التكلفة الإجمالية: 40 + 24 = 64 دولارًا.
</think>
لذا، يجب على كايلار أن يدفع 64 دولارًا مقابل 16 كوبًا.
Prompt Format
To trigger full reasoning behavior, format inputs using the Qwen ChatML template with the system instruction:
prompt = """<|im_start|>system
أنت مساعد رياضيات بارع. فكّر خطوة بخطوة داخل <think> قبل إعطاء الإجابة النهائية.<|im_end|>
<|im_start|>user
[سؤالك هنا]<|im_end|>
<|im_start|>assistant
<think>
"""
أمثلة على الاستدلال والمنطق (Reasoning Showcases)
المثال الأول: مسألة حسابية متعددة الخطوات السؤال:اشترى أحمد 3 صناديق من التفاح، يحتوي كل صندوق على 24 تفاحة. إذا تبرع بنصف التفاح لمسجد الحي، وباع ثلث ما تبقى بسعر 1.5 ريال للتفاحة الواحدة، كم ريالاً جنى أحمد؟
استجابة النموذج:
<think>
الخطوة 1: احسب العدد الإجمالي للتفاح: 3 * 24 = 72 تفاحة
الخطوة 2: احسب عدد التفاح المبرع: 72 / 2 = 36 تفاحة
الخطوة 3: احسب عدد التفاح المتبقية: 72 - 36 = 36 تفاحة
الخطوة 4: احسب عدد التفاح المباعة: 36 / 3 = 12 تفاحة
الخطوة 5: احسب المبلغ الذي تم جمعه: 12 * 1.5 = 18 ريالًا
</think>
18 ريالًا
🧩 المثال الثاني: استنتاج وترتيب منطقي السؤال:
في سباق جري، أنهى خالد السباق قبل سعد ولكن بعد فيصل. وأنهى ماجد السباق قبل فيصل. ما هو الترتيب التنازلي للمتسابقين من المركز الأول إلى الأخير؟
استجابة النموذج:
<think>
الخطوة 1: خالد قبل سعد ولكنه بعد فيصل، إذن فيصل > خالد > سعد.
الخطوة 2: ماجد قبل فيصل، إذن ماجد > فيصل.
الخطوة 3: بالتالي، الترتيب التنازلي هو: ماجد > فيصل > خالد > سعد.
</think>
ماجد، فيصل، خالد، سعد
⏳ المثال الثالث: الجبر ومسائل الأعمار السؤال:
عمر سارة الآن ثلاثة أضعاف عمر أخيها الصغير. بعد 5 سنوات، سيكون مجموع عمريهما 38 سنة. كم عمر سارة الآن؟
استجابة النموذج:
<think>
الخطوة 1: ليكن عمر أخي سارة الصغير هو x. إذن عمر سارة هي 3x.
الخطوة 2: بعد 5 سنوات، سيكون عمر أخي سارة الصغير x + 5، وسارة ستكون 3x + 5.
الخطوة 3: مجموع أعمارهما بعد 5 سنوات هو (x + 5) + (3x + 5) = 4x + 10.
الخطوة 4: نعلم أن 4x + 10 = 38. إذن 4x = 28، و x = 7.
الخطوة 5: عمر سارة الآن هو 3x = 3 * 7 = 21.
</think>
21
💰 المثال الرابع: حساب الخصومات والضرائب السؤال:
لابتوب سعره الأصلي 4000 ريال، عليه خصم 20%. ثم أضيف عليه ضريبة قيمة مضافة بنسبة 15% بعد الخصم. ما هو السعر النهائي للابتوب؟
استجابة النموذج:
Plaintext
<think>
الخطوة 1: حساب قيمة الخصم: 4000 * 0.20 = 800
الخطوة 2: حساب السعر بعد الخصم: 4000 - 800 = 3200
الخطوة 3: حساب ضريبة القيمة المضافة: 3200 * 0.15 = 480
الخطوة 4: حساب السعر النهائي: 3200 + 480 = 3680
</think>
3680 ريال
السؤال: كم يساوي 47 × 36؟
🧠 عرض التفكير (Show reasoning)
الخطوة 1: اضرب 47 × 6 = 282 الخطوة 2: اضرب 47 × 30 = 1410 الخطوة 3: أضف 282 + 1410 = 1692السؤال: عند أحمد 24 تفاحة، أعطى نصفها لصديقه ثم اشترى 10 تفاحات إضافية. كم تفاحة أصبح عنده؟
🧠 عرض التفكير (Show reasoning)
الخطوة 1: نصف 24 تفاحة هو 24 / 2 = 12 تفاحة. الخطوة 2: أعطى 12 تفاحة لصديق، إذن لديه 24 − 12 = 12 تفاحة. الخطوة 3: اشترى 10 تفاحات إضافية، إذن لديه 12 + 10 = 22 تفاحة.السؤال: قطار يسير بسرعة 80 كم/سا، كم يستغرق ليقطع 240 كم؟
🧠 عرض التفكير (Show reasoning)
الخطوة 1: الوقت = المسافة / السرعة الخطوة 2: الوقت = 240 كم ÷ 80 كم/سا الخطوة 3: الوقت = 3 ساعاتالسؤال: إذا كان طبيب يعطيك 3 حبوب وطلب منك أخذ حبة كل نصف ساعة، فكم من الوقت تستغرق حتى تنهي الحبوب؟
🧠 عرض التفكير (Show reasoning)
الخطوة 1: أخذ حبة كل نصف ساعة يعني أخذ 3 حبات في 3 × 0.5 ساعة. الخطوة 2: الوقت الكلي = 3 × 0.5 ساعة = 1.5 ساعةالسؤال: كم عدد الأشهر التي فيها 28 يوماً؟
🧠 عرض التفكير (Show reasoning)
الخطوة 1: كل شهر له على الأقل 28 يومًا (كانون الأول/ديسمبر). الخطوة 2: جميع الشهور الستة الأولى لها 30 يومًا على الأقل.ملاحظات الاختبار (Evaluation Notes)
- النموذج أظهر أداءً قوياً وثابتاً في مسائل الحساب المباشرة ومسائل الخطوة الواحدة.
- في أسئلة "الفخ" المصممة لاختبار الاستدلال المنطقي (وليس الحساب فقط)، أخطأ النموذج في سؤال الحبوب الثلاث، بينما أجاب بشكل صحيح على سؤال أشهر السنة رغم تفكير غير مكتمل.
- خطوات
<think>تُظهر تفكيراً سردياً منظماً بالعربية قبل الوصول للإجابة النهائية، متوافقاً مع أسلوب التدريب (GRPO reasoning).
تم توليد هذا الملف من جلسة اختبار تفاعلية عبر واجهة Gradio.
- Downloads last month
- 1,553