· 7 min read

دستیار طراحی که بر روی دستگاه شما اجرا می شود – No Account، No Server

دستیار PinePaper در دستگاه AI به یک صحنه واقعی با استفاده از یک مدل زبان تبدیل می شود که به طور کامل در مرورگر شما اجرا می شود. در اینجا معماری است - تماس های ابزار محدود، دو ارائه دهنده و یک حساب صادقانه از آنچه یک مدل کوچک می تواند و نمی تواند انجام دهد.

فرضیه

بسیاری از ابزارهای طراحی AI به یک سرور ارسال می کنند، یک مدل بزرگ را اجرا می کنند و کد را به عقب ارسال می کنند. این نیاز به یک حساب، یک دور شبکه، و اعتماد به این که کار شما در حال حرکت به زیرساخت های شخص دیگری است.

ما می خواستیم بدانیم که چقدر دیگر سخت است: ** یک دستیار طراحی که در آن مدل بر روی ماشین خود اجرا می شود. حساب نیست. آپلود نکنید. این سرعت هرگز مرورگر را ترک نمی کند. این در حال حاضر در ویرایشگر PinePaper به عنوان آزمایشی **AI / کد - Assistant ** تب زندگی می کند، و این پست یک حساب صادقانه از چگونگی کار و جایی که آن را کوتاه است.

چرا فقط از مدل کد سوال نمی کنیم؟?

رویکرد واضح این است که از مدل دستگاه برای نوشتن جاوا اسکریپت در برابر PinePaper استفاده کنید و آن را اجرا کنید. ما آن را امتحان کردیم. بد شکست می خورد.

مدل های کوچک – مدل هایی که بر روی یک لپ تاپ مناسب هستند – هیچ دانشی در مورد API برنامه خاصی ندارند. از یک مدل 0.5-2B برای تماس با PinePaper.create()QQQ و آن بداهه پردازی بپرسید: یک کلید روش خواندن نیست (یک SVG-style fillQ1Q1Q2Q) که در آن API انتظار می رود color2QQQ2Q، یک روش آن تصور، استدلال در شکل اشتباه. خروجی * به نظر می رسد مانند کد و در سکوت کار اشتباه است.

بنابراین ما درخواست کد نداریم. ما از یک لیست آموزش دیده از تماس های ابزار درخواست می کنیم:

[
  { "name": "pinepaper_set_background_color", "arguments": { "color": "#0F0F1A" } },
  { "name": "pinepaper_create_item", "arguments": { "itemType": "star", "x": 400, "y": 300, "radius": 90, "color": "#E74C3C", "animationType": "pulse" } }
]

همان واژگان PinePaper (MCP server) (/api/guides/mcp-integrationQQ) در معرض عوامل خارجی قرار می گیرد، اما توسط یک مدل به صورت محلی اجرا می شود و از طریق یک فرستنده کوچک اجرا می شود.

عدم اعتبار خروجی غیرممکن

حرکت کلیدی **Conss Education de Encrypt به جای امید به تولید یک شکل معتبر، ما محدود می کنیم - چه توکن هایی حتی مجاز به انتشار هستند:

  • در طرح داخلی Chrome **Prompt API ** (Gemini Nano)، ما یک طرح **JSON را به عنوان یک محدودیت پاسخ عبور می کنیم. این مدل فقط می تواند اشیایی را تولید کند که مجوز های طرح را دارند – با additionalProperties: falseQQQQ، هر گونه استدلالی که طرح تعریف نمی کند، به معنای واقعی کلمه غیر قابل نمایش است.
  • On **WebLLM ** (یک مدل باز در WebGPU) *EBNF Grammar - از طریق XGrammar. گرامر ساختار را دیکته می کند؛ مدل فقط ارزش ها را پر می کند.

هر دو شکل همان ابزار را تولید می کنند. پس از آن یک تعمیر کوچک یک مدل کوچک را نجات می دهد - name0Q، استدلال بدون بسته بندی آنها - با در نظر گرفتن ابزار از شکل استدلال. نتیجه این است که “یک پنتاگون سبز” به جای یک خطا تبدیل به یک تماس create_item واقعی می شود.

دو ارائه دهنده، یک قرارداد

AI یک چیز نیست – بستگی به مرورگر دارد:

    • Browser AI ** ساخته شده توسط Chrome'Gemini Nano ** (window.LanguageModel) کشتی های مدل با مرورگر؛ چیزی برای دانلود از ما وجود ندارد. این قابل اعتماد ترین مسیر دستگاه امروز است، زیرا محدودیت JSON-schema ارزان و به خوبی پشتیبانی می شود.
  • *PinePaper AI **WebLLM ** یک مدل Qwen2.5 را در هر مرورگر WebGPU اجرا می کند. پس از آن یک مدل را دانلود می کند و سپس به صورت آفلاین اجرا می شود.
  • ** زبان ها - محرک های غیر انگلیسی به زبان انگلیسی در دستگاه اول (از طریق مترجم داخلی مرورگر) ترجمه می شوند، زیرا مدل های کد گرا کوچک انگلیسی محور هستند. صحنه تولید شده بدون در نظر گرفتن زبان سریع یکسان است.

کاربر موتور را انتخاب می کند؛ همه چیز به پایین - محدودیت، executor، بوم - یکسان است.

ویرایش، نه فقط تولید

یک ژنراتور یک شات یک دستیار نیست. برای حمایت از "ساخت ستاره قرمز"، مدل باید بداند که در حال حاضر چه چیزی در بوم وجود دارد. بنابراین هر نوبت ما آن را یک عکس فوری جمع آوری از موارد فعلی - شناسه ها، انواع و رنگ - دقیقا مانند یک چت سمت سرور. "ستاره را قرمز کنید" سپس به یک تماس واقعی modify_itemQQQ در برابر شناسه مورد حل و فصل می شود. (و به این دلیل که یک مدل کوچک گاهی اوقات به “کلک” اشاره می کند، زمانی که به معنی ستاره است، executor منابع فازی را در برابر بوم زنده حل می کند.)

Log مکالمه ** بر روی دستگاه شما ** در ذخیره سازی محلی نگهداری می شود. هیچ چیز در مورد آن ارسال نمی شود - مگر اینکه شما به طور واضح تصمیم به اشتراک گذاری علل شکست خورده بگیرید، که به ما کمک می کند تا سرعت ها و دستور زبان را بهبود ببخشیم.

وقتی مدل کوچک کافی نیست – افزایش

در اینجا بخش صادقانه است: ** یک مدل 0.5-2B ضعیف ترین لایه است. تضمین های کدگذاری هماهنگ شده *ساختار ارزش گذاری *، اما مدل هنوز هم باید ابزار مناسب و ارزش های معقول را انتخاب کند و همیشه نخواهد بود. از یک پنتاگون و یک مدل زیر چشم به شما یک حلقه می دهد؛ دو بار برای “red” بپرسید و ممکن است به جای آن یک ژنراتور را اجرا کند.

بنابراین معماری به عنوان لایه اول * عمل می کند، نه تنها یک. پس از چند تلاش شکست خورده دستیار ارائه می دهد تا ** تمام مکالمه را انجام دهید به مدل ابر - همان هدف، همان بوم، یک مدل بسیار توانمند تر - و شما دقیقا همان جایی که شما ترک کردید ادامه دهید. وفاداری پایین، رایگان و خصوصی، با یک راه یک کلیک به وفاداری بالا زمانی که شما به آن نیاز دارید.

آنچه آموخته ایم

  • ** محدودیت های شکست خورده یک سیستم پایه کمک می کند؛ یک دستور زبان/شما که خروجی نامعتبر را غیر ممکن می کند، به مراتب بیشتر کمک می کند. بزرگ ترین پرش قابلیت اطمینان از کدگذاری محدود شده است، نه از یک سرعت بهتر.
    • اندازه مدل هنوز غالب است. رفتن از 0.5B به یک مدل 1.5B به طور قابل توجهی بهبود می یابد که چگونه اغلب دستیار ابزار مناسب را انتخاب می کند. هیچ عجله ای وجود ندارد که یک مدل کوچک را به یک مدل هوشمند تبدیل کند.
    • دستور زبان کامل می تواند خیلی بزرگ باشد. اولین دستور زبان ما رمزگذاری شده است - هر عملیات ممکن - از جمله یک دریچه فرار طولانی برای کد نقاشی خودسرانه. آنقدر بزرگ بود که صفحه را محدود کرد. یک دستور زبان فشرده که عملیات مشترک را پوشش می دهد پیش فرض درست است؛ سطح کامل انتخابی است.
  • ** آن را از قسمت اصلی حذف کنید. یک مدل انجام تداخل در موضوع UI صفحه را مسدود می کند. WebLLM در یک کارمند وب اجرا می شود، بنابراین ویرایشگر در حالی که یک بار مدل و تولید می کند، پاسخگو باقی می ماند.

بعدی چیست

این آزمایش و بهبود است. در نقشه راه:

  • ** پوشش ابزار در مسیر محدود - بیشتر عملیات PinePaper بدون خروج آزاد قابل بیان است.
  • *Larger بر روی مدل های دستگاه ** به عنوان کاتالوگ مدل WebGPU رشد، اندازه دانلود تجاری برای قابلیت اطمینان.
  • ** یک حلقه تنگ تر eval ** با استفاده از گزارش های شکست انتخاب شده برای اندازه گیری که منجر به سفر به مدل های دستگاه و سخت دستور زبان در برابر آنها.
  • ** یک نرم افزار بر روی دستگاه - Cloud Handoff **، بنابراین افزایش احساس می کند که به جای تعویض ابزار، باعث افزایش کیفیت می شود.

از طریق خط: همان واژگان ابزار یکپارچه یک مدل را در هر دو طرف از مرز مرورگر هدایت می کند. یک عامل خارجی این ابزار را بر روی MCP می نامد؛ یک مدل دستگاه به صورت محلی همان شکل را می نامد. یک قرارداد، هر جا که اداره می شود.

  • آن را در ویرایشگر - باز **AI / کد - Assistant ** رایگان است، بر روی دستگاه شما اجرا می شود و نیازی به حساب ندارد

Ready to create?

Start making animated GIFs, videos, and graphics — free, no signup.

Open PinePaper Editor