نظرة سريعة
ملاحظات حول نقاط النهاية
تُدعمservice_tier في واجهات طلبات النص الرئيسية:
استخدم ultrafast وfast (أو priority حيث يُدعم) وflex فقط عندما يدعمها مزيج النموذج والمزوّد المحدد. يختار Ultrafast أعلى مستوى سرعة مدعوم؛ ويستخدم fast وpriority توجيه Fast وتسعيره نفسيهما. يكون standard افتراضيًا عند حذف service_tier.
ليست Batch قيمةً لـ service_tier. تستخدم طلبات الدُفعات واجهة Batch API منفصلة.
في طلبات Messages المتوافقة مع Anthropic، تكون قيم Anthropic الأصلية لدى المزوّد upstream هي auto وstandard_only. وقد يطبّع Phaseo هذه القيم أو يعيّنها بين المزوّدين مع الحفاظ على السلوك المتوافق مع Anthropic في /v1/messages.
إذا كنت تستخدم SDK الرسمي لـ Anthropic مع عنوان base مخصص يشير إلى Phaseo، ففضّل قيم Anthropic الأصلية في /v1/messages. وبالنسبة لعناصر التحكم في الفئات الموحّدة بين المزوّدين مثل ultrafast, priority وflex، أو الاسم البديل fast لدى OpenAI، ففضّل طلبات HTTP الخام أو واجهات النص الأصلية للبوابة أو المتوافقة مع OpenAI.
مرجع المعلمات
model
يحدد معرّف نموذج البوابة للطلب。
استخدم معرّف النموذج الأساسي الظاهر في دليل البدء السريع لكل صفحة نموذج، إلا إذا كنت تريد عمدًا الاعتماد على اسم بديل مقبول. وتُعد المعرّفات الأساسية الخيار الأكثر أمانًا للأمثلة والأتمتة والتكاملات طويلة الأمد.
stream
يعيد المخرجات تدريجيًا عبر Server-Sent Events بدلًا من انتظار نص استجابة نهائي واحد。
فعّل هذا الخيار لواجهات الدردشة أو عرض الرموز تباعًا أو الردود الطويلة التي يحسّن فيها ظهور المخرجات مبكرًا تجربة الاستخدام. وأوقفه إذا أردت استجابة JSON كاملة واحدة أو إعادة محاولات أبسط أو تحليلًا منظمًا أسهل。
ملاحظات:
يختلف دعم البث حسب نقطة النهاية.
يكون البث عادةً خيارًا للنقل، لا عنصرًا للتحكم في الجودة.
قد تختلف طريقة البث أيضًا حسب المزوّد في مسارات استدعاء الأدوات أو المخرجات المنظمة.
temperature
يتحكم في مدى عشوائية اختيار الرموز.
تجعل القيم المنخفضة المخرجات أكثر تحفظًا وقابلية للتكرار. وتزيد القيم المرتفعة التنوع، ما قد يفيد في العصف الذهني أو الكتابة الإبداعية، لكنه قد يقلل الاتساق والالتزام بالمخطط.
استخدامات مناسبة:
استخراج المعلومات
التصنيف
مخرجات JSON أو المخطط
التوليد الإبداعي
إرشادات عملية:
ابدأ بقيمة منخفضة للمهام المنظمة.
غيّر
temperature أو top_p أولًا، وليس كليهما معًا.
قد تؤدي الحرارة المرتفعة مع التكميم القوي إلى زيادة عدم الاستقرار.
top_p
يطبّق أخذ العينات بالنواة، فيحصر المرشحين في أصغر مجموعة رموز يبلغ مجموع احتمالاتها التراكمي top_p.
تجعل القيم المنخفضة النموذج يختار من نطاق احتمالي أضيق، ما ينتج عادةً مخرجات أكثر أمانًا وتركيزًا. وتتيح القيم الأعلى النظر في مجموعة أوسع من الرموز.
ملاحظات:
اضبط
top_p إذا أردت تضييق مساحة البحث أو توسيعها دون تغيير temperature مباشرةً.
في معظم التطبيقات، تُعد قيمة معتدلة لـ temperature وقيمة top_p قريبة من 1.0 نقطة بداية معقولة.
top_k
يقيّد أخذ العينات في كل خطوة بأفضل k من الرموز المرشحة لدى المزوّدين الذين يدعمونه.
تضيّق قيم
top_k المنخفضة خيارات النموذج وقد تجعل المخرجات أكثر قابلية للتوقع. وتوسّع القيم الأعلى مجموعة المرشحين.
ملاحظات:
لا يتوفر top_k لدى جميع المزوّدين.
اعتبره محددًا أكثر صراحةً لمجموعة الرموز مقارنةً بـ top_p.
max_tokens
يحد طول المخرجات في نقاط النهاية والمزوّدين الذين ما زالوا يستخدمون الحقل max_tokens.
استخدمه للتحكم في التكلفة وزمن الاستجابة واحتمال اقتطاع المخرجات. إذا كانت القيمة منخفضة جدًا، فقد تبدو المخرجات غير مكتملة رغم أن النموذج عمل كما ينبغي.
max_output_tokens
يحد طول المخرجات في المسارات التي تستخدم max_output_tokens بدلًا من max_tokens.
يماثل
max_tokens من حيث المعنى، لكن أرسل اسم الحقل الذي تتوقعه نقطة النهاية أو واجهة SDK المحددة.
max_completion_tokens
يحد طول المخرجات في واجهات النص الأحدث المتوافقة مع OpenAI التي تستخدم max_completion_tokens.
هذا حقل آخر لميزانية رموز المخرجات. استخدم الاسم المتوقع لنقطة النهاية بدلًا من خلط أسماء بديلة لطول المخرجات في بنية طلب واحدة.
frequency_penalty
يقلل تكرار الرموز بما يتناسب مع عدد مرات ظهورها سابقًا.
ارفع القيمة إذا دخل النموذج في حلقات أو كرر عبارات أو أفرط في استخدام الصياغة نفسها.
presence_penalty
يقلل إعادة استخدام الرمز بمجرد ظهوره، ما قد يساعد النموذج على استكشاف موضوعات أو صياغات جديدة.
بالمقارنة مع
frequency_penalty، يتحكم هذا عادةً في التجديد على نطاق أوسع بدلًا من عدد مرات التكرار.
repetition_penalty
يطبّق سلوكًا خاصًا بالمزوّد للحد من التكرار خارج حقول العقوبة التقليدية المتوافقة مع OpenAI.
يشبه الغرض منه
frequency_penalty وpresence_penalty، لكن دلالته تختلف أكثر حسب المزوّد. تعامل معه كسلوك أصلي للمزوّد، لا كعنصر تحكم موحّد تمامًا.
seed
يطلب أخذ عينات حتميًا عندما يدعم المزوّد upstream التوليد باستخدام seed.
استخدمه لتصحيح الأخطاء واختبارات التراجع وإعادة إنتاج السلوك قدر ما تسمح به المنصة upstream. يحسّن التوليد باستخدام seed قابلية إعادة الإنتاج، لكنه لا يضمن حتمية تامة لدى جميع المزوّدين أو عند تغييرات البنية التحتية.
stop
يحدد تسلسلًا واحدًا أو أكثر لإنهاء التوليد مبكرًا.
يفيد عند الحاجة إلى حدود صارمة للمخرجات، مثل التوقف قبل التذييل أو فاصل الأداة أو القسم الاصطناعي التالي.
logprobs
يطلب بيانات وصفية لاحتمالات الرموز عند توفرها.
يفيد هذا أساسًا في التحليل والتقييم والترتيب وتصحيح الأخطاء ومسارات العمل المرتبطة بالثقة. ولا تحتاج إليه عادةً في استجابات المنتجات المعتادة.
top_logprobs
يطلب أفضل الرموز المرشحة البديلة لكل موضع في المخرجات مع احتمالاتها اللوغاريتمية.
استخدمه لفحص فروع الرموز البديلة بدلًا من رمز المخرجات المختار فقط.
tools
يعرّف الأدوات أو الوظائف القابلة للاستدعاء في مسارات عمل النماذج التي تستخدم الأدوات.
استخدم مخطط الأدوات المتوافق مع OpenAI ما لم تنص وثائق نقطة النهاية على خلاف ذلك. تصف تعريفات الأدوات ما يمكن للنموذج استدعاؤه، لا ما يجب عليه استدعاؤه.
tool_choice
يتحكم فيما إذا كان يمكن للنموذج استدعاء الأدوات تلقائيًا أو يجب ألا يستدعيها أو يتعين عليه استخدام أداة محددة.
استخدم
none إذا أردت المحتوى فقط، وauto إذا كان للنموذج أن يقرر، وقيمًا أكثر صرامة إذا كان التنسيق اللاحق يتطلب استدعاء أداة.
parallel_tool_calls
يسمح باستدعاءات الأدوات المتزامنة أو يمنعها في واجهات API المتوافقة.
عطّله إذا كانت الأنظمة اللاحقة تتطلب تنفيذًا متتابعًا بدقة أو آثارًا جانبية مرتبة أو آثار agent أبسط.
response_format
يطلب تنسيق مخرجات محددًا مثل النص العادي أو JSON أو الاستجابات المقيدة بمخطط.
تعتمد البنى المقبولة بدقة على نقطة النهاية ومحوّل المزوّد. استخدمه عند الحاجة إلى أكثر من نص حر، خصوصًا لاستجابات JSON ومسارات الاستخراج المنظم.
structured_outputs
يشير إلى دعم الاستجابات المنظمة أو المقيدة بمخطط على المسار ومجموعة المزوّدين المحددين.
تساعدك هذه القيمة في جداول البدء السريع على معرفة ما إذا كان endpoint والمزوّدون النشطون يدعمون مسارات المخرجات المنظمة بموثوقية. والأفضل اعتبارها بيانات وصفية عن الدعم.
json_schema
يوفر مخطط JSON المستخدم لفرض المخرجات المنظمة على النماذج ونقاط النهاية المتوافقة.
استخدمه عندما يحتاج تطبيقك إلى حقول مضمونة أو استخراج ذي أنواع محددة أو عقد استجابة صارم. اجعل المخططات ضيقة ومخصصة للمهمة لتحسين الالتزام بها.
reasoning
يتضمن إعدادات استدلال خاصة بالمزوّد لواجهات API القادرة على الاستدلال.
قد يشمل ذلك، حسب المسار، التفعيل أو مستوى الجهد أو ميزانية الرموز أو مستوى التفصيل أو إرجاع محتوى الاستدلال.
reasoning_effort
يطلب ميزانية استدلال أقل أو أعلى عندما تتيح نقطة النهاية والنموذج هذا التحكم.
قد يحسّن مستوى الجهد الأعلى مهام الاستدلال الصعبة، لكنه يزيد زمن الاستجابة واستهلاك الرموز. وغالبًا ما يناسب الجهد الأقل الطلبات الأسرع والأقل تكلفة.
reasoning_tokens
يمثل حقل رموز خاصًا بالاستدلال عند توفر الدعم.
قد يكون ذلك، حسب المسار، عنصر تحكم في الطلب أو حدًا أو حقل محاسبة في الاستجابة، وليس معلمة طلب مدعومة عالميًا.
include_reasoning
يطلب إرفاق محتوى الاستدلال أو ملخصاته في الاستجابات عند توفر الدعم.
استخدمه بحذر. قد تكون بيانات الاستدلال أكبر حجمًا، وقد لا تتوفر في كل النماذج، وقد لا تلائم استجابات الإنتاج التي لا تحتاج إلى تفاصيل تشخيصية إضافية.
service_tier
يحدد فئة توجيه أو تسعير مدعومة في واجهات النص المتوافقة.
استخدم
ultrafast وfast (أو priority حيث يُدعم) وflex فقط عندما يدعمها مزيج النموذج والمزوّد المختار. يختار Ultrafast أعلى مستوى سرعة مدعوم؛ ويستخدم fast وpriority توجيه Fast وتسعيره نفسيهما. احذف الحقل للبقاء على المستوى القياسي الافتراضي.
يحوّل Phaseo داخليًا قيم الفئات الموحّدة في البوابة إلى عناصر تحكم أصلية لدى المزوّد، ما يتيح للمتصلين استخدام قيم service_tier نفسها عبر واجهات النص المدعومة.
ملاحظات:
Batch مسار API منفصل وليس قيمةً لفئة الخدمة.
يختلف الدعم حسب نقطة النهاية والمزوّد.
prompt_cache_key
يوفر مفتاح ارتباط ثابتًا بالتخزين المؤقت للتوجيه المراعي لذاكرة prompt المؤقتة.
استخدمه عندما تشترك مجموعة طلبات في بادئات prompt ثابتة ويُفضّل أن تستخدم المزوّد upstream أو المنطقة نفسها متى أمكن. ويمكن لـ Phaseo استنتاج ارتباط التخزين المؤقت من سياق الطلب أيضًا، لكن المفتاح الصريح أفضل للمحادثات الطويلة وجلسات agent ومسارات العمل المتكررة.
prompt_cache_options
يمرر عناصر تحكم ذاكرة التخزين المؤقت لموجّهات OpenAI عبر مسارات OpenAI المدعومة.
في GPT-6 Astra، استخدم
{"mode":"explicit","ttl":"30m"} للتخزين المؤقت الصريح للموجّهات. يحتفظ Phaseo بهذا الكائن أثناء تطبيع الطلب ويرسله إلى OpenAI دون تغيير.
cache_control
يطبّق سياسة لذاكرة prompt المؤقتة مستقلة عن المزوّد على واجهات طلبات النص المدعومة.
استخدم
cache_control في المستوى الأعلى لطلبات Chat Completions وResponses وAnthropic Messages لتمرير تلميح التخزين المؤقت نفسه عبر المخطط المشترك للبوابة. ويمكنك أيضًا وضعه على كتل المحتوى المدعومة عند الحاجة إلى نقاط فصل صريحة.
قيم TTL المعتادة هي 5m و1h حسب دعم المزوّد والنموذج. وتظل الأسماء البديلة الخاصة بالمزوّد، مثل provider_options.anthropic.cache_control وprovider_options.google.cache_control، مقبولة للتكاملات الأصلية.
prompt_cache_retention
يحدد سياسة الاحتفاظ بذاكرة prompt المؤقتة المتوافقة مع OpenAI في الطلبات المدعومة الموجّهة إلى OpenAI.
استخدمه لتمرير خيارات الاحتفاظ بذاكرة OpenAI المؤقتة دون تضمينها داخل الخيارات الخاصة بالمزوّد. يظل الاسم البديل
provider_options.openai.prompt_cache_retention مقبولًا. وعند وجود القيمتين، تكون الأولوية لقيمة prompt_cache_retention في المستوى الأعلى.
provider
يتضمن قيود التوجيه وتفضيلات المزوّد.
استخدمه لتحديد المزوّدين upstream المسموح لهم بتنفيذ الطلب وكيفية ترتيبهم ومتطلبات الامتثال الواجب استيفاؤها.
تشمل الحقول الشائعة:
يتبع
quantizations مفردات توجيه المزوّدين المتوافقة مع OpenRouter، ويُقبل ضمن provider أو routing. ولا يراعي التطابق حالة الأحرف ويتجاهل المسافات والواصلات والشرطات السفلية؛ وتُعد الأسماء الواضحة مثل float8/FP8 وbfloat16/BF16 أسماء بديلة. تُستبعد العروض التي تفتقر إلى بيانات كمية عند وجود هذا المرشح. وإذا لم يطابق أي عرض مؤهل، تعيد البوابة خطأً يتضمن القيم المطلوبة والمتاحة حاليًا بدلًا من التوجيه بصمت إلى نسخة مختلفة.
provider_options
يتضمن إعدادات تمرير خاصة بالمزوّد ينبغي ألا تُطبّع ضمن بنية طلب البوابة المشتركة.
تشمل الأمثلة:
openai.context_managementopenai.prompt_cache_retentionanthropic.cache_controlgoogle.cache_controlgoogle.cached_content
cache_control في المستوى الأعلى لتلميحات التخزين المؤقت العامة وprompt_cache_retention في المستوى الأعلى للاحتفاظ المتوافق مع OpenAI.
للاطلاع على أمثلة تخزين prompt مؤقتًا حسب المزوّد عبر Chat Completions وResponses وAnthropic Messages، راجع تخزين prompt مؤقتًا.
meta
يطلب بيانات وصفية إضافية في الاستجابة عند توفر الدعم.
استخدمه عند الحاجة إلى بيانات وصفية إضافية غير أساسية في الاستجابة للتصحيح أو التحليلات أو الفحص اللاحق.
usage
يطلب تفاصيل احتساب الاستخدام عند توفر الدعم.
يفيد ذلك عند الحاجة إلى تضمين احتساب الرموز أو الاستخدام صراحةً في متن الاستجابة بدلًا من الاعتماد على الترويسات أو لوحات المعلومات فقط.
debug
يتيح تشخيصًا مضبوطًا للطلب والتوجيه.
تشمل حقول التصحيح المدعومة:
قد تتضمن بيانات التصحيح سياقًا حساسًا للطلب. استخدمها في التطوير أو البيئات الخاضعة لرقابة صارمة فقط.
مثال على الطلب
شروحات مفصلة
إذا أردت إرشادات أعمق حول الضبط بدلًا من مرجع الحقول فقط، فراجع الصفحات التالية:- معلمات الاستدلال لنصائح عملية حول temperature وtop_p وtop_k وحدود الرموز وتسلسلات التوقف وسير الضبط
- أخذ العينات وفك الترميز لفهم تأثير العشوائية والعقوبات وضوابط فك الترميز في سلوك النموذج