پارامترها — Parameters
پارامترهای نمونهگیری، فرآیند تولید token توسط مدل را شکل میدهند. میتوانید هر پارامتری از فهرست زیر و نیز پارامترهای دیگری را به آشا بفرستید.
وقتی پارامتر نمونهگیری در درخواست شما وجود ندارد، آشا آن را upstream نمیفرستد و بهجای جایگزینی
یک مقدار سختکد شده، ارائهدهنده پیشفرض خودش را اعمال میکند. «پیشفرضِ» ذکرشده برای هر پارامتر
در زیر، مقدار مرسوم است، نه مقداری که آشا تزریق کند. فرستادن صریح آن (مثلاً
temperature: 1.0) همچنان به جلو منتقل میشود و ممکن است با
حذفکردن آن تفاوت داشته باشد (مثلاً میتواند روی کلیدهای کش سمت ارائهدهنده اثر بگذارد). آشا برخی
پارامترهای خاص ارائهدهنده را هم مستقیم به همان ارائهدهنده منتقل میکند؛ مثل
safe_prompt برای Mistral یا
raw_mode برای Hyperbolic.
برای تأیید اینکه کدام پارامترها پشتیبانی میشوند، به بخش «ارائهدهنده» همان مدل مراجعه کنید.
Temperature — دما
- کلید:
temperature - اختیاری، float، از 0.0 تا 2.0
- پیشفرض: 1.0
- ویدیوی توضیحی: تماشا
این تنظیم بر تنوع پاسخهای مدل اثر میگذارد. مقادیر پایینتر به پاسخهای قابلپیشبینی و معمول میانجامند و مقادیر بالاتر پاسخهای متنوعتر و کممعمولتر را تشویق میکنند. در صفر، مدل برای یک ورودی مشخص همیشه همان پاسخ را میدهد.
Top P
- کلید:
top_p - اختیاری، float، از 0.0 تا 1.0
- پیشفرض: 1.0
- ویدیوی توضیحی: تماشا
این تنظیم انتخابهای مدل را به درصدی از token های محتمل محدود میکند: فقط token های برتری که احتمالهایشان روی هم به P برسد. مقدار پایینتر، پاسخهای مدل را قابلپیشبینیتر میکند، در حالیکه پیشفرض، طیف کاملی از انتخابهای token را ممکن میسازد. آن را مثل یک Top-K پویا در نظر بگیرید.
Top K
- کلید:
top_k - اختیاری، integer، صفر یا بیشتر
- پیشفرض: 0
- ویدیوی توضیحی: تماشا
این گزینه انتخاب token ها در هر مرحله را محدود میکند و مدل را وادار میکند از مجموعهٔ کوچکتری انتخاب کند. مقدار 1 یعنی مدل همیشه محتملترین token بعدی را برمیگزیند و به نتایج قابلپیشبینی میانجامد. بهصورت پیشفرض این تنظیم غیرفعال است و مدل همهٔ گزینهها را در نظر میگیرد.
Frequency Penalty — جریمهٔ فراوانی
- کلید:
frequency_penalty - اختیاری، float، از 2.0- تا 2.0
- پیشفرض: 0.0
- ویدیوی توضیحی: تماشا
این تنظیم با توجه به اینکه token ها چند بار در ورودی ظاهر شدهاند، تکرار آنها را کنترل میکند. سعی میکند token هایی که در ورودی بیشتر ظاهر شدهاند را متناسب با فراوانی وقوعشان کمتر استفاده کند. جریمهٔ token با تعداد وقوعها مقیاس میشود. مقادیر منفی، استفادهٔ دوبارهٔ token ها را تشویق میکنند.
Presence Penalty — جریمهٔ حضور
- کلید:
presence_penalty - اختیاری، float، از 2.0- تا 2.0
- پیشفرض: 0.0
- ویدیوی توضیحی: تماشا
میزان تکرار token های خاصی را که قبلاً در ورودی استفاده شدهاند تنظیم میکند. مقادیر بالاتر چنین تکرارهایی را کماحتمالتر میکنند و مقادیر منفی برعکس عمل میکنند. جریمهٔ token با تعداد وقوعها مقیاس نمیشود. مقادیر منفی، استفادهٔ دوبارهٔ token ها را تشویق میکنند.
Repetition Penalty — جریمهٔ تکرار
- کلید:
repetition_penalty - اختیاری، float، از 0.0 تا 2.0
- پیشفرض: 1.0
- ویدیوی توضیحی: تماشا
به کاهش تکرار token های ورودی کمک میکند. مقدار بالاتر، احتمال تکرار token ها را کمتر میکند، اما مقدار خیلی زیاد میتواند خروجی را کمانسجام کند (اغلب با جملههای بدون درنگ که واژههای کوتاه ندارند). جریمهٔ token بر اساس احتمال اولیهٔ همان token مقیاس میشود.
Min P
- کلید:
min_p - اختیاری، float، از 0.0 تا 1.0
- پیشفرض: 0.0
حداقل احتمال لازم برای در نظر گرفته شدن یک token را نشان میدهد، نسبت به احتمال محتملترین token. (مقدار بسته به سطح اطمینانِ محتملترین token تغییر میکند.) اگر Min-P شما 0.1 باشد، فقط token هایی مجاز میشوند که حداقل یکدهمِ احتمالِ بهترین گزینهٔ ممکن را داشته باشند.
Top A
- کلید:
top_a - اختیاری، float، از 0.0 تا 1.0
- پیشفرض: 0.0
فقط token های برتری را در نظر میگیرد که «بهاندازهٔ کافی» احتمال بالا دارند، بر اساس احتمالِ محتملترین token. آن را مثل یک Top-P پویا در نظر بگیرید. مقدار Top-A پایینتر، انتخابها را بر اساس محتملترین token اما با دامنهٔ محدودتر متمرکز میکند. مقدار بالاتر لزوماً روی خلاقیت خروجی اثر نمیگذارد، بلکه فرآیند فیلتر کردن را بر اساس بیشینهٔ احتمال اصلاح میکند.
Seed — دانهٔ تصادفی
- کلید:
seed - اختیاری، integer
اگر مشخص شود، استنتاج بهصورت قطعی نمونهگیری میکند؛ بهطوریکه درخواستهای تکراری با همان seed و همان پارامترها باید همان نتیجه را بدهند. قطعیبودن برای برخی مدلها تضمین نمیشود.
Max Tokens — حداکثر توکن
- کلید:
max_tokens - اختیاری، integer، 1 یا بالاتر
سقف بالای تعداد token هایی را که مدل میتواند در پاسخ تولید کند تعیین میکند. بیش از این حد تولید نمیکند. مقدار بیشینه، طول بافت منهای طول prompt است.
Max Completion Tokens — حداکثر توکن تکمیل
- کلید:
max_completion_tokens - اختیاری، integer، 1 یا بالاتر
سقف بالای تعداد token هایی را که مدل میتواند در پاسخ تولید کند تعیین میکند. بیش از این حد تولید نمیکند. مقدار بیشینه، طول بافت منهای طول prompt است.
Logit Bias — بایاس لجیت
- کلید:
logit_bias - اختیاری، map
یک شیء JSON میپذیرد که token ها (با شناسهٔ token خود در tokenizer) را به یک مقدار بایاس از 100- تا 100 نگاشت میکند. از نظر ریاضی، بایاس قبل از نمونهگیری به logits تولیدشده توسط مدل اضافه میشود. اثر دقیق بسته به مدل متفاوت است، اما مقادیر بین 1- و 1 باید احتمال انتخاب را کم یا زیاد کنند و مقادیری مثل 100- یا 100 باید به ممنوعیت یا انتخاب انحصاری آن token منجر شوند.
Logprobs — احتمال لگاریتمی
- کلید:
logprobs - اختیاری، boolean
تعیین میکند که احتمال لگاریتمی token های خروجی برگردانده شود یا نه. اگر true باشد، احتمال لگاریتمی هر token خروجی برگردانده میشود.
Top Logprobs
- کلید:
top_logprobs - اختیاری، integer
یک عدد صحیح بین 0 و 20 که تعداد محتملترین token هایی را تعیین میکند که در هر موقعیت token، هرکدام با احتمال لگاریتمی مرتبط، برگردانده شوند. اگر از این پارامتر استفاده شود، logprobs باید true باشد.
Response Format — قالب پاسخ
- کلید:
response_format - اختیاری، map
مدل را وادار میکند قالب خروجی مشخصی تولید کند. قرار دادن
{ "type": "json_object" } حالت JSON را فعال میکند که
تضمین میکند پیام تولیدشده توسط مدل، JSON معتبر است.
Structured Outputs — خروجی ساختاریافته
- کلید:
structured_outputs - اختیاری، boolean
مشخص میکند که مدل میتواند با استفاده از
response_format json_schema خروجی ساختاریافته برگرداند.
Stop — توقف
- کلید:
stop - اختیاری، array
اگر مدل به هر token مشخصشده در آرایهٔ stop برسد، تولید را فوراً متوقف کند.
Tools — ابزارها
- کلید:
tools - اختیاری، array
پارامتر فراخوانی ابزار، مطابق با شکل درخواست فراخوانی ابزار OpenAI. برای ارائهدهندههای غیر-OpenAI متناسب با آنها تبدیل میشود. در راهنمای «Tool Calling» بیشتر بیاموزید.
Tool Choice — انتخاب ابزار
- کلید:
tool_choice - اختیاری، string یا object
تعیین میکند که مدل کدام (اگر هرکدام) ابزار را صدا بزند. 'none'
یعنی مدل هیچ ابزاری را صدا نمیزند و بهجای آن پیام تولید میکند. 'auto'
یعنی مدل میتواند بین تولید پیام یا صدا زدن یک یا چند ابزار انتخاب کند. 'required'
یعنی مدل باید یک یا چند ابزار را صدا بزند. مشخصکردن یک ابزار خاص با
{"type": "function", "function": {"name": "my_function"}} مدل را
مجبور به صدا زدن همان ابزار میکند.
Parallel Tool Calls — فراخوانی موازی ابزار
- کلید:
parallel_tool_calls - اختیاری، boolean
- پیشفرض: true
تعیین میکند که فراخوانی موازیِ تابع در هنگام استفاده از ابزار فعال باشد. اگر true باشد، مدل میتواند چند تابع را همزمان صدا بزند. اگر false باشد، توابع بهصورت ترتیبی صدا زده میشوند. فقط وقتی tools ارائه شود اعمال میشود.
Include Reasoning — شامل استدلال
- کلید:
include_reasoning - اختیاری، boolean
نام مستعار منسوخشده برای reasoning.exclude. وقتی true باشد
و مدل از آن پشتیبانی کند، token های استدلال در پاسخ برگردانده میشوند.
Reasoning — استدلال
- کلید:
reasoning - اختیاری، map
رفتار استدلال را برای مدلهایی که از token های تفکر پشتیبانی میکنند کنترل میکند؛ از جمله اینکه استدلال فعال باشد، تلاش استدلال، حداکثر token های استدلال، و اینکه استدلال از پاسخ حذف شود یا نه.
Reasoning Effort — تلاش استدلال
- کلید:
reasoning_effort - اختیاری، enum (xhigh, high, medium, low, minimal, none)
تنظیم تلاش استدلال به سبک OpenAI. مقادیر بالاتر به مدل اجازه میدهند در صورت پشتیبانی، token های بیشتری را صرف استدلال داخلی کند.
Web Search Options — گزینههای جستوجوی وب
- کلید:
web_search_options - اختیاری، map
گزینههای جستوجوی وب بومی را برای مدلها و ارائهدهندههایی که از پاسخهای متصل به وب پشتیبانی میکنند تنظیم میکند.
Verbosity — بلندی پاسخ
- کلید:
verbosity - اختیاری، enum (low, medium, high, xhigh, max)
- پیشفرض: medium
میزان بلندی پاسخ مدل را محدود میکند. مقادیر پایینتر پاسخهای موجزتری میدهند و مقادیر بالاتر پاسخهای جزئیتر و کاملتری. این پارامتر توسط OpenAI برای Responses API معرفی شده است.
برای مدلهای Anthropic، این پارامتر به output_config.effort
نگاشت میشود. سطح 'xhigh' توسط Anthropic Claude 4.7 Opus و
مدلهای بعدی و سطح 'max' توسط Anthropic Claude 4.6 Opus و
مدلهای بعدی پشتیبانی میشود.