پارامترها — Parameters

پارامترهای نمونه‌گیری، فرآیند تولید token توسط مدل را شکل می‌دهند. می‌توانید هر پارامتری از فهرست زیر و نیز پارامترهای دیگری را به آشا بفرستید.

وقتی پارامتر نمونه‌گیری در درخواست شما وجود ندارد، آشا آن را upstream نمی‌فرستد و به‌جای جایگزینی یک مقدار سخت‌کد شده، ارائه‌دهنده پیش‌فرض خودش را اعمال می‌کند. «پیش‌فرضِ» ذکرشده برای هر پارامتر در زیر، مقدار مرسوم است، نه مقداری که آشا تزریق کند. فرستادن صریح آن (مثلاً temperature: 1.0) همچنان به جلو منتقل می‌شود و ممکن است با حذف‌کردن آن تفاوت داشته باشد (مثلاً می‌تواند روی کلیدهای کش سمت ارائه‌دهنده اثر بگذارد). آشا برخی پارامترهای خاص ارائه‌دهنده را هم مستقیم به همان ارائه‌دهنده منتقل می‌کند؛ مثل safe_prompt برای Mistral یا raw_mode برای Hyperbolic.

برای تأیید اینکه کدام پارامترها پشتیبانی می‌شوند، به بخش «ارائه‌دهنده» همان مدل مراجعه کنید.

Temperature — دما

  • کلید: temperature
  • اختیاری، float، از 0.0 تا 2.0
  • پیش‌فرض: 1.0
  • ویدیوی توضیحی: تماشا

این تنظیم بر تنوع پاسخ‌های مدل اثر می‌گذارد. مقادیر پایین‌تر به پاسخ‌های قابل‌پیش‌بینی و معمول می‌انجامند و مقادیر بالاتر پاسخ‌های متنوع‌تر و کم‌معمول‌تر را تشویق می‌کنند. در صفر، مدل برای یک ورودی مشخص همیشه همان پاسخ را می‌دهد.

Top P

  • کلید: top_p
  • اختیاری، float، از 0.0 تا 1.0
  • پیش‌فرض: 1.0
  • ویدیوی توضیحی: تماشا

این تنظیم انتخاب‌های مدل را به درصدی از token های محتمل محدود می‌کند: فقط token های برتری که احتمال‌هایشان روی هم به P برسد. مقدار پایین‌تر، پاسخ‌های مدل را قابل‌پیش‌بینی‌تر می‌کند، در حالی‌که پیش‌فرض، طیف کاملی از انتخاب‌های token را ممکن می‌سازد. آن را مثل یک Top-K پویا در نظر بگیرید.

Top K

  • کلید: top_k
  • اختیاری، integer، صفر یا بیشتر
  • پیش‌فرض: 0
  • ویدیوی توضیحی: تماشا

این گزینه انتخاب token ها در هر مرحله را محدود می‌کند و مدل را وادار می‌کند از مجموعهٔ کوچک‌تری انتخاب کند. مقدار 1 یعنی مدل همیشه محتمل‌ترین token بعدی را برمی‌گزیند و به نتایج قابل‌پیش‌بینی می‌انجامد. به‌صورت پیش‌فرض این تنظیم غیرفعال است و مدل همهٔ گزینه‌ها را در نظر می‌گیرد.

Frequency Penalty — جریمهٔ فراوانی

  • کلید: frequency_penalty
  • اختیاری، float، از 2.0- تا 2.0
  • پیش‌فرض: 0.0
  • ویدیوی توضیحی: تماشا

این تنظیم با توجه به اینکه token ها چند بار در ورودی ظاهر شده‌اند، تکرار آن‌ها را کنترل می‌کند. سعی می‌کند token هایی که در ورودی بیشتر ظاهر شده‌اند را متناسب با فراوانی وقوع‌شان کمتر استفاده کند. جریمهٔ token با تعداد وقوع‌ها مقیاس می‌شود. مقادیر منفی، استفادهٔ دوبارهٔ token ها را تشویق می‌کنند.

Presence Penalty — جریمهٔ حضور

  • کلید: presence_penalty
  • اختیاری، float، از 2.0- تا 2.0
  • پیش‌فرض: 0.0
  • ویدیوی توضیحی: تماشا

میزان تکرار token های خاصی را که قبلاً در ورودی استفاده شده‌اند تنظیم می‌کند. مقادیر بالاتر چنین تکرارهایی را کم‌احتمال‌تر می‌کنند و مقادیر منفی برعکس عمل می‌کنند. جریمهٔ token با تعداد وقوع‌ها مقیاس نمی‌شود. مقادیر منفی، استفادهٔ دوبارهٔ token ها را تشویق می‌کنند.

Repetition Penalty — جریمهٔ تکرار

  • کلید: repetition_penalty
  • اختیاری، float، از 0.0 تا 2.0
  • پیش‌فرض: 1.0
  • ویدیوی توضیحی: تماشا

به کاهش تکرار token های ورودی کمک می‌کند. مقدار بالاتر، احتمال تکرار token ها را کمتر می‌کند، اما مقدار خیلی زیاد می‌تواند خروجی را کم‌انسجام کند (اغلب با جمله‌های بدون درنگ که واژه‌های کوتاه ندارند). جریمهٔ token بر اساس احتمال اولیهٔ همان token مقیاس می‌شود.

Min P

  • کلید: min_p
  • اختیاری، float، از 0.0 تا 1.0
  • پیش‌فرض: 0.0

حداقل احتمال لازم برای در نظر گرفته شدن یک token را نشان می‌دهد، نسبت به احتمال محتمل‌ترین token. (مقدار بسته به سطح اطمینانِ محتمل‌ترین token تغییر می‌کند.) اگر Min-P شما 0.1 باشد، فقط token هایی مجاز می‌شوند که حداقل یک‌دهمِ احتمالِ بهترین گزینهٔ ممکن را داشته باشند.

Top A

  • کلید: top_a
  • اختیاری، float، از 0.0 تا 1.0
  • پیش‌فرض: 0.0

فقط token های برتری را در نظر می‌گیرد که «به‌اندازهٔ کافی» احتمال بالا دارند، بر اساس احتمالِ محتمل‌ترین token. آن را مثل یک Top-P پویا در نظر بگیرید. مقدار Top-A پایین‌تر، انتخاب‌ها را بر اساس محتمل‌ترین token اما با دامنهٔ محدودتر متمرکز می‌کند. مقدار بالاتر لزوماً روی خلاقیت خروجی اثر نمی‌گذارد، بلکه فرآیند فیلتر کردن را بر اساس بیشینهٔ احتمال اصلاح می‌کند.

Seed — دانهٔ تصادفی

  • کلید: seed
  • اختیاری، integer

اگر مشخص شود، استنتاج به‌صورت قطعی نمونه‌گیری می‌کند؛ به‌طوری‌که درخواست‌های تکراری با همان seed و همان پارامترها باید همان نتیجه را بدهند. قطعی‌بودن برای برخی مدل‌ها تضمین نمی‌شود.

Max Tokens — حداکثر توکن

  • کلید: max_tokens
  • اختیاری، integer، 1 یا بالاتر

سقف بالای تعداد token هایی را که مدل می‌تواند در پاسخ تولید کند تعیین می‌کند. بیش از این حد تولید نمی‌کند. مقدار بیشینه، طول بافت منهای طول prompt است.

Max Completion Tokens — حداکثر توکن تکمیل

  • کلید: max_completion_tokens
  • اختیاری، integer، 1 یا بالاتر

سقف بالای تعداد token هایی را که مدل می‌تواند در پاسخ تولید کند تعیین می‌کند. بیش از این حد تولید نمی‌کند. مقدار بیشینه، طول بافت منهای طول prompt است.

Logit Bias — بایاس لجیت

  • کلید: logit_bias
  • اختیاری، map

یک شیء JSON می‌پذیرد که token ها (با شناسهٔ token خود در tokenizer) را به یک مقدار بایاس از 100- تا 100 نگاشت می‌کند. از نظر ریاضی، بایاس قبل از نمونه‌گیری به logits تولیدشده توسط مدل اضافه می‌شود. اثر دقیق بسته به مدل متفاوت است، اما مقادیر بین 1- و 1 باید احتمال انتخاب را کم یا زیاد کنند و مقادیری مثل 100- یا 100 باید به ممنوعیت یا انتخاب انحصاری آن token منجر شوند.

Logprobs — احتمال لگاریتمی

  • کلید: logprobs
  • اختیاری، boolean

تعیین می‌کند که احتمال لگاریتمی token های خروجی برگردانده شود یا نه. اگر true باشد، احتمال لگاریتمی هر token خروجی برگردانده می‌شود.

Top Logprobs

  • کلید: top_logprobs
  • اختیاری، integer

یک عدد صحیح بین 0 و 20 که تعداد محتمل‌ترین token هایی را تعیین می‌کند که در هر موقعیت token، هرکدام با احتمال لگاریتمی مرتبط، برگردانده شوند. اگر از این پارامتر استفاده شود، logprobs باید true باشد.

Response Format — قالب پاسخ

  • کلید: response_format
  • اختیاری، map

مدل را وادار می‌کند قالب خروجی مشخصی تولید کند. قرار دادن { "type": "json_object" } حالت JSON را فعال می‌کند که تضمین می‌کند پیام تولیدشده توسط مدل، JSON معتبر است.

نکته: هنگام استفاده از حالت JSON، باید خودتان هم از طریق یک پیام سیستم یا کاربر به مدل بگویید JSON تولید کند.

Structured Outputs — خروجی ساختاریافته

  • کلید: structured_outputs
  • اختیاری، boolean

مشخص می‌کند که مدل می‌تواند با استفاده از response_format json_schema خروجی ساختاریافته برگرداند.

Stop — توقف

  • کلید: stop
  • اختیاری، array

اگر مدل به هر token مشخص‌شده در آرایهٔ stop برسد، تولید را فوراً متوقف کند.

Tools — ابزارها

  • کلید: tools
  • اختیاری، array

پارامتر فراخوانی ابزار، مطابق با شکل درخواست فراخوانی ابزار OpenAI. برای ارائه‌دهنده‌های غیر-OpenAI متناسب با آن‌ها تبدیل می‌شود. در راهنمای «Tool Calling» بیشتر بیاموزید.

Tool Choice — انتخاب ابزار

  • کلید: tool_choice
  • اختیاری، string یا object

تعیین می‌کند که مدل کدام (اگر هرکدام) ابزار را صدا بزند. 'none' یعنی مدل هیچ ابزاری را صدا نمی‌زند و به‌جای آن پیام تولید می‌کند. 'auto' یعنی مدل می‌تواند بین تولید پیام یا صدا زدن یک یا چند ابزار انتخاب کند. 'required' یعنی مدل باید یک یا چند ابزار را صدا بزند. مشخص‌کردن یک ابزار خاص با {"type": "function", "function": {"name": "my_function"}} مدل را مجبور به صدا زدن همان ابزار می‌کند.

Parallel Tool Calls — فراخوانی موازی ابزار

  • کلید: parallel_tool_calls
  • اختیاری، boolean
  • پیش‌فرض: true

تعیین می‌کند که فراخوانی موازیِ تابع در هنگام استفاده از ابزار فعال باشد. اگر true باشد، مدل می‌تواند چند تابع را هم‌زمان صدا بزند. اگر false باشد، توابع به‌صورت ترتیبی صدا زده می‌شوند. فقط وقتی tools ارائه شود اعمال می‌شود.

Include Reasoning — شامل استدلال

  • کلید: include_reasoning
  • اختیاری، boolean

نام مستعار منسوخ‌شده برای reasoning.exclude. وقتی true باشد و مدل از آن پشتیبانی کند، token های استدلال در پاسخ برگردانده می‌شوند.

Reasoning — استدلال

  • کلید: reasoning
  • اختیاری، map

رفتار استدلال را برای مدل‌هایی که از token های تفکر پشتیبانی می‌کنند کنترل می‌کند؛ از جمله اینکه استدلال فعال باشد، تلاش استدلال، حداکثر token های استدلال، و اینکه استدلال از پاسخ حذف شود یا نه.

Reasoning Effort — تلاش استدلال

  • کلید: reasoning_effort
  • اختیاری، enum (xhigh, high, medium, low, minimal, none)

تنظیم تلاش استدلال به سبک OpenAI. مقادیر بالاتر به مدل اجازه می‌دهند در صورت پشتیبانی، token های بیشتری را صرف استدلال داخلی کند.

Web Search Options — گزینه‌های جست‌وجوی وب

  • کلید: web_search_options
  • اختیاری، map

گزینه‌های جست‌وجوی وب بومی را برای مدل‌ها و ارائه‌دهنده‌هایی که از پاسخ‌های متصل به وب پشتیبانی می‌کنند تنظیم می‌کند.

Verbosity — بلندی پاسخ

  • کلید: verbosity
  • اختیاری، enum (low, medium, high, xhigh, max)
  • پیش‌فرض: medium

میزان بلندی پاسخ مدل را محدود می‌کند. مقادیر پایین‌تر پاسخ‌های موجزتری می‌دهند و مقادیر بالاتر پاسخ‌های جزئی‌تر و کامل‌تری. این پارامتر توسط OpenAI برای Responses API معرفی شده است.

برای مدل‌های Anthropic، این پارامتر به output_config.effort نگاشت می‌شود. سطح 'xhigh' توسط Anthropic Claude 4.7 Opus و مدل‌های بعدی و سطح 'max' توسط Anthropic Claude 4.6 Opus و مدل‌های بعدی پشتیبانی می‌شود.