IranRouter

کدام مدل برای متن فارسی بهتر است؟

تیم تحریریه ایران روتر۱۲ مرداد ۱۴۰۵۷ دقیقه مطالعه

کدام مدل برای متن فارسی بهتر است؟

این سؤال را زیاد می‌پرسند و معمولاً انتظار یک اسم در جواب دارند. جواب صادقانه این است که «بهترین مدل برای فارسی» به کاری که می‌کنید بستگی دارد، و مهم‌تر از آن، تفاوت هزینه بین مدل‌ها روی متن فارسی خیلی بیشتر از چیزی است که بیشتر آدم‌ها انتظار دارند.

این نوشته دو چیز به شما می‌دهد: توضیح اینکه چرا فارسی گران‌تر تمام می‌شود، و روشی برای اینکه خودتان در یک بعدازظهر جواب را برای دادهٔ خودتان پیدا کنید.

اول یک واقعیت فنی که روی صورت‌حساب اثر مستقیم دارد

مدل‌ها متن را کلمه‌به‌کلمه نمی‌بینند؛ آن را به «توکن» می‌شکنند. توکنایزرهای امروزی عمدتاً روی متن انگلیسی آموزش دیده‌اند، و نتیجه‌اش این است که یک جملهٔ فارسی معمولاً به توکن‌های بیشتری شکسته می‌شود تا همان جمله به انگلیسی.

به زبان ساده: یک متن فارسی و ترجمهٔ انگلیسی‌اش، با اینکه یک حرف می‌زنند، هزینهٔ یکسانی ندارند. فارسی گران‌تر است، و مقدار این گرانی از مدلی به مدل دیگر فرق می‌کند، چون هر خانوادهٔ مدل توکنایزر خودش را دارد.

این یعنی وقتی دو مدل را با هم مقایسه می‌کنید، نگاه‌کردن به قیمت هر میلیون توکن به‌تنهایی گمراه‌کننده است. مدل ارزان‌تر ممکن است متن شما را به توکن‌های بیشتری بشکند و در عمل گران‌تر تمام شود.

معیار درست، «قیمت هر میلیون توکن» نیست؛ «هزینهٔ یک درخواست واقعی شما» است.

سه چیزی که باید هم‌زمان بسنجید

۱. کیفیت روی کار مشخص شما

«خوب بودن در فارسی» یک عدد واحد نیست. یک مدل ممکن است در خلاصه‌سازی متن حقوقی عالی باشد و در نوشتن محاوره‌ای بد. مدل دیگری برعکس. پس اول تعریف کنید کار شما دقیقاً چیست:

  • خلاصه‌سازی متن بلند
  • پاسخ به سؤال از روی سند
  • بازنویسی و ویرایش
  • استخراج داده‌ٔ ساختاریافته از متن آزاد
  • مکالمهٔ پشتیبانی

۲. هزینهٔ واقعی هر درخواست

نه قیمت لیست، بلکه رقمی که بعد از اجرای نمونه‌های خودتان در گزارش مصرف می‌بینید.

۳. تأخیر

برای یک ایجنت پس‌زمینه چند ثانیه اهمیتی ندارد. برای یک چت زنده، دارد. مدلی که کمی بهتر ولی سه برابر کندتر است، برای رابط کاربری زنده انتخاب بدی است.


روش سنجش، در یک بعدازظهر

این کار سخت نیست و نتیجه‌اش از هر جدول مقایسه‌ای که در اینترنت پیدا کنید برای شما معتبرتر است.

گام ۱ — بیست نمونهٔ واقعی جمع کنید

از دادهٔ خودتان، نه از نمونه‌های ساختگی. اگر پشتیبانی مشتری دارید، بیست تیکت واقعی بردارید. اگر خلاصه‌سازی می‌کنید، بیست سند واقعی. تنوع مهم است: چند نمونهٔ کوتاه، چند نمونهٔ بلند، چند نمونهٔ سخت.

گام ۲ — برای هر مدل یک کلید جدا بسازید

این مهم‌ترین ترفند این راهنماست. اگر برای هر مدل که می‌آزمایید یک کلید API جداگانه بسازید، در پایان آزمایش، گزارش مصرف خودش هزینهٔ هر مدل را جدا به شما نشان می‌دهد. بدون این کار، همه‌چیز در یک عدد قاطی می‌شود و باید دستی حساب کنید.

گام ۳ — همان بیست نمونه را از همهٔ مدل‌ها بگذرانید

با همان پرامپت، همان تنظیمات. تنها متغیر باید نام مدل باشد.

MODELS = ["gpt-4o-mini", "claude-sonnet-4.5", "gemini-2.0-flash"]

for model in MODELS:
    client = OpenAI(api_key=KEYS[model], base_url="https://iranrouter.com/v1")
    for sample in samples:
        resp = client.chat.completions.create(
            model=model,
            messages=[{"role": "user", "content": PROMPT + sample}],
        )
        save(model, sample, resp.choices[0].message.content)

گام ۴ — خروجی‌ها را کور داوری کنید

نام مدل را از خروجی‌ها بردارید و بعد قضاوت کنید. این کار مسخره به نظر می‌رسد ولی تفاوت واقعی ایجاد می‌کند: وقتی می‌دانید کدام خروجی از مدل گران‌تر آمده، ناخودآگاه بهترش می‌بینید.

گام ۵ — هزینه را از گزارش مصرف بخوانید

در پنل کاربری به بخش «مصرف» بروید و تفکیک را روی «کلید» بگذارید. حالا دقیقاً می‌بینید هر مدل برای همان بیست نمونه چقدر توکن مصرف کرده و چقدر هزینه داشته است.

چطور نتیجه را بخوانید

بعد از این کار معمولاً یکی از این سه حالت پیش می‌آید:

  • یک مدل ارزان به‌اندازهٔ کافی خوب است. رایج‌ترین حالت. کار تمام است، ارزان را بردارید.
  • مدل گران واقعاً بهتر است، ولی فقط روی نمونه‌های سخت. در این حالت مسیریابی دو مرحله‌ای جواب می‌دهد: کار عادی به مدل ارزان، و فقط موارد سخت به مدل گران.
  • تفاوتی نیست. ارزان‌ترین را بردارید و به کار مهم‌تری برسید.

نتیجهٔ سنجش ما

ما در حال اجرای یک ارزیابی روی مجموعهٔ متن فارسی هستیم و نتیجه را وقتی آماده شد، با روش و دادهٔ کامل همین‌جا منتشر می‌کنیم. تا آن موقع ترجیح می‌دهیم عددی را که خودمان اندازه نگرفته‌ایم منتشر نکنیم.

یک نکتهٔ عملی برای همین حالا

فهرست کامل مدل‌های در دسترس، همراه با اندازهٔ پنجرهٔ متن و قیمت ریالی هر کدام، در صفحهٔ «مدل‌ها» به‌روز است. اگر می‌خواهید بدون هزینه شروع کنید، پلن رایگان چند مدل را در اختیارتان می‌گذارد و برای همین بیست نمونهٔ آزمایشی معمولاً کافی است.

فارسیمقایسهٔ مدلتوکنهزینهارزیابی