دستیار طراحی که بر روی دستگاه شما اجرا می شود – No Account، No Server
دستیار PinePaper در دستگاه AI به یک صحنه واقعی با استفاده از یک مدل زبان تبدیل می شود که به طور کامل در مرورگر شما اجرا می شود. در اینجا معماری است - تماس های ابزار محدود، دو ارائه دهنده و یک حساب صادقانه از آنچه یک مدل کوچک می تواند و نمی تواند انجام دهد.
On this page
فرضیه
بسیاری از ابزارهای طراحی AI به یک سرور ارسال می کنند، یک مدل بزرگ را اجرا می کنند و کد را به عقب ارسال می کنند. این نیاز به یک حساب، یک دور شبکه، و اعتماد به این که کار شما در حال حرکت به زیرساخت های شخص دیگری است.
ما می خواستیم بدانیم که چقدر دیگر سخت است: یک دستیار طراحی که در آن مدل بر روی ماشین خود اجرا می شود. نه حساب. آپلود نکنید. این سرعت هرگز مرورگر را ترک نمی کند. این در حال حاضر در ویرایشگر PinePaper به عنوان آزمایشیAI / کد - Assistant ** تب زندگی می کند، و این پست یک حساب صادقانه از چگونگی کار و جایی که آن را کوتاه است.
چرا فقط از مدل کد سوال نمی کنیم؟?
رویکرد واضح این است که از مدل دستگاه برای نوشتن جاوا اسکریپت در برابر PinePaper استفاده کنید و آن را اجرا کنید. ما آن را امتحان کردیم. بد شکست می خورد.
مدل های کوچک – آنهایی که روی یک لپ تاپ مناسب هستند – * هیچ دانشی در مورد API برنامه خاص ندارد. از یک مدل 0.5-2B برای تماس با Zq0qqZ و پیش نویس آن بپرسید: یک کلید روش خواندن نیست (یک SVG-style fill که در آن API انتظار Z2qZ را دارد)، روشی که آن را تصور می کرد، استدلال در شکل اشتباه. خروجی * به نظر می رسد مانند کد و در سکوت کار اشتباه است.
بنابراین ما درخواست کد نداریم. ما از یک لیست آموزش دیده از تماس های ابزار درخواست می کنیم:
[
{ "name": "pinepaper_set_background_color", "arguments": { "color": "#0F0F1A" } },
{ "name": "pinepaper_create_item", "arguments": { "itemType": "star", "x": 400, "y": 300, "radius": 90, "color": "#E74C3C", "animationType": "pulse" } }
]
همان واژگان PinePaper (MCP server) (/api/guides/mcp-integration) در معرض عوامل خارجی - اما منتشر شده توسط یک مدل به صورت محلی، و اجرا بر روی بوم از طریق یک فرستنده کوچک.
عدم اعتبار خروجی غیرممکن
حرکت کلیدی **Conss Education de Encrypt به جای امید به تولید یک شکل معتبر، ما محدود می کنیم - چه توکن هایی حتی مجاز به انتشار هستند:
- در طرح داخلی Chrome’Prompt API (Gemini Nano)، ما یک طرحJSON را به عنوان یک محدودیت پاسخ عبور می کنیم. این مدل فقط می تواند اشیایی را تولید کند که مجوز طرح دارند با
additionalProperties: false، هر استدلالی که طرح تعریف نمی کند به معنای واقعی کلمه غیر قابل نمایش است. - در WebLLM (یک مدل باز که در WebGPU اجرا می شود)، ما یک دستور زبان EBNF را از طریق XGrammar متصل می کنیم. گرامر ساختار را دیکته می کند؛ مدل فقط ارزش ها را پر می کند.
هر دو شکل همان ابزار را تولید می کنند. پس از آن یک تعمیر کوچک یک مدل کوچک را نجات می دهد یک name، استدلال بدون پوشش آنها با استفاده از ابزار از شکل استدلال. نتیجه این است که “یک پنتاگون سبز” به جای یک خطا به یک تماس واقعی Zq1Z تبدیل می شود.
سوئیچ بین سه زیر. دو گزینه محدود به نظر می رسد یکسان است هدف: این ادعا است. آنچه بین آنها تغییر می کند، مکانیسم است نه نتیجه.
دو ارائه دهنده، یک قرارداد
AI یک چیز نیست بستگی به مرورگر دارد:
- Browser AI Chrome’s Built-inGemini Nano ** (
window.LanguageModel). کشتی های مدل با مرورگر؛ چیزی برای دانلود از ما وجود ندارد. این قابل اطمینان ترین مسیر دستگاه امروز است، زیرا محدودیت JSON-schema ارزان و به خوبی پشتیبانی می شود. - *PinePaper AI ** *WebLLM ** اجرای مدل Qwen2.5 در هر مرورگر WebGPU. پس از آن یک مدل را دانلود می کند و سپس به صورت آفلاین اجرا می شود.
- ** زبان ها - محرک های غیر انگلیسی به زبان انگلیسی در دستگاه اول (از طریق مترجم داخلی مرورگر) ترجمه می شوند، زیرا مدل های کد گرا کوچک انگلیسی محور هستند. صحنه تولید شده بدون در نظر گرفتن زبان سریع یکسان است.
کاربر موتور را انتخاب می کند؛ همه چیز به پایین این محدودیت، executor، - یکسان است.
ویرایش، نه فقط تولید
یک ژنراتور یک شات یک دستیار نیست. برای حمایت از "ساخت ستاره قرمز"، مدل باید بداند که در حال حاضر چه چیزی در بوم وجود دارد. بنابراین هر نوبت ما آن را به یک تصویر کلی از موارد فعلی تغذیه می کنیم شخصیت ها، انواع و رنگ ها درست مثل یک چت سمت سرور. "ستاره را قرمز کنید" سپس به یک modify_item واقعی در برابر شناسه مورد حل و فصل می شود. (و به این دلیل که یک مدل کوچک گاهی اوقات به “کلک” اشاره می کند، زمانی که به معنی ستاره است، executor منابع فازی را در برابر بوم زنده حل می کند.)
Log مکالمه بر روی دستگاه شما در ذخیره سازی محلی نگهداری می شود. هیچ چیز در مورد آن ارسال نمی شود - مگر اینکه شما به طور واضح تصمیم به اشتراک گذاری علل شکست خورده بگیرید، که به ما کمک می کند تا سرعت ها و دستور زبان را بهبود ببخشیم.
وقتی مدل کوچک کافی نیست – افزایش تشدید
در اینجا بخش صادقانه است: ** یک مدل 0.5-2B ضعیف ترین لایه است. تضمین های کدگذاری هماهنگ شده *ساختار ارزش گذاری *، اما مدل هنوز هم باید ابزار مناسب و ارزش های معقول را انتخاب کند و همیشه نخواهد بود. از یک پنتاگون و یک مدل زیر چشم به شما یک حلقه می دهد؛ دو بار برای “red” بپرسید و ممکن است به جای آن یک ژنراتور را اجرا کند.
بنابراین معماری به عنوان لایه اول * عمل می کند، نه تنها یک. پس از چند تلاش شکست خورده، دستیار ارائه می دهد تا ** تمام مکالمه را به مدل Cloud واگذار کنید همان هدف، همان بوم، یک مدل بسیار توانمند تر و شما دقیقا همان جایی را که ترک کردید ادامه می دهید. وفاداری پایین، رایگان و خصوصی، با یک راه یک کلیک به وفاداری بالا زمانی که شما به آن نیاز دارید.
آنچه آموخته ایم
- ** محدودیت های شکست خورده یک سیستم پایه کمک می کند؛ یک دستور زبان/شما که خروجی نامعتبر را غیر ممکن می کند، به مراتب بیشتر کمک می کند. بزرگ ترین پرش قابلیت اطمینان از کدگذاری محدود شده است، نه از یک سرعت بهتر.
- اندازه مدل هنوز غالب است. رفتن از 0.5B به یک مدل 1.5B به طور قابل توجهی بهبود می یابد که چگونه اغلب دستیار ابزار مناسب را انتخاب می کند. هیچ عجله ای وجود ندارد که یک مدل کوچک را به یک مدل هوشمند تبدیل کند.
- دستور زبان کامل می تواند خیلی بزرگ باشد. اولین دستور زبان ما رمزگذاری شده است - هر عملیات ممکن - از جمله یک دریچه فرار طولانی برای کد نقاشی دلخواه. آنقدر بزرگ بود که صفحه را محدود کرد. یک دستور زبان فشرده که عملیات مشترک را پوشش می دهد پیش فرض درست است؛ سطح کامل انتخابی است.
- ** آن را از قسمت اصلی حذف کنید. یک مدل انجام تداخل در موضوع UI صفحه را مسدود می کند. WebLLM در یک کارمند وب اجرا می شود، بنابراین سردبیر در حالی که یک بار مدل و تولید می کند، پاسخگو باقی می ماند.
بعدی چیست
این آزمایش و بهبود است. در نقشه راه:
- ** پوشش ابزار در مسیر محدود بیشتر عملیات PinePaper بدون خروج آزاد قابل بیان است.
- *Larger بر روی مدل های دستگاه ** به عنوان کاتالوگ مدل WebGPU رشد، اندازه دانلود تجاری برای قابلیت اطمینان.
- ** یک حلقه محکم eval با استفاده از گزارش های شکست انتخاب شده برای اندازه گیری که منجر به سفر به مدل های دستگاه و سخت دستور زبان در برابر آنها.
- یک نرم افزار بر روی دستگاه - Cloud Handoff، بنابراین افزایش احساس می کند که به جای تعویض ابزار، باعث افزایش کیفیت می شود.
از طریق خط: همان واژگان ابزار یکپارچه یک مدل را در هر دو طرف از مرز مرورگر هدایت می کند. یک عامل خارجی این ابزار را بر روی MCP می نامد؛ یک مدل دستگاه به صورت محلی همان شکل را می نامد. یک قرارداد، هر جا که اداره می شود.
آن را در ویرایشگر امتحان کنید - باز AI / کد - Assistant. رایگان است، بر روی دستگاه شما اجرا می شود و نیازی به حساب ندارد.
Ready to create?
Start making animated GIFs, videos, and graphics — free, no signup.
Open PinePaper Editor