<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>ربات - مرکز توسعه هوش مصنوعی بنو</title>
	<atom:link href="https://bennuai.com/tag/%D8%B1%D8%A8%D8%A7%D8%AA/feed/" rel="self" type="application/rss+xml" />
	<link>https://bennuai.com/tag/ربات/</link>
	<description>طراحی و اجرای پروژه های هوش مصنوعی</description>
	<lastBuildDate>Wed, 13 Nov 2024 07:36:32 +0000</lastBuildDate>
	<language>fa-IR</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.1</generator>

<image>
	<url>https://bennuai.com/wp-content/uploads/2024/10/cropped-EJ-2-2-32x32.png</url>
	<title>ربات - مرکز توسعه هوش مصنوعی بنو</title>
	<link>https://bennuai.com/tag/ربات/</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>ربات‌های خودبهبود دهنده</title>
		<link>https://bennuai.com/%da%86%da%af%d9%88%d9%86%d9%87-%d8%b1%d8%a8%d8%a7%d8%aa-%d9%85%d8%b9%d9%84%d9%85-%d8%ae%d9%88%d8%af-%d8%b4%d9%88%d8%af%d8%9f/</link>
					<comments>https://bennuai.com/%da%86%da%af%d9%88%d9%86%d9%87-%d8%b1%d8%a8%d8%a7%d8%aa-%d9%85%d8%b9%d9%84%d9%85-%d8%ae%d9%88%d8%af-%d8%b4%d9%88%d8%af%d8%9f/#respond</comments>
		
		<dc:creator><![CDATA[توسعه هوش مصنوعی بنو]]></dc:creator>
		<pubDate>Wed, 07 Aug 2024 06:07:15 +0000</pubDate>
				<category><![CDATA[بلاگ]]></category>
		<category><![CDATA[ربات]]></category>
		<category><![CDATA[هوش مصنوعی]]></category>
		<category><![CDATA[یادگیری تقویتی]]></category>
		<guid isPermaLink="false">https://bennuai.com/?p=3031</guid>

					<description><![CDATA[<p>ربات‌های خودبهبود دهنده: ربات هایی که به خود آموزش میدهند! در این پست از سایت بنو قصد ... <a class="cz_readmore" href="https://bennuai.com/%da%86%da%af%d9%88%d9%86%d9%87-%d8%b1%d8%a8%d8%a7%d8%aa-%d9%85%d8%b9%d9%84%d9%85-%d8%ae%d9%88%d8%af-%d8%b4%d9%88%d8%af%d8%9f/"><i class="fa czico-110-link-symbol" aria-hidden="true"></i><span>ادامه مطلب</span></a></p>
<p>نوشته <a href="https://bennuai.com/%da%86%da%af%d9%88%d9%86%d9%87-%d8%b1%d8%a8%d8%a7%d8%aa-%d9%85%d8%b9%d9%84%d9%85-%d8%ae%d9%88%d8%af-%d8%b4%d9%88%d8%af%d8%9f/">ربات‌های خودبهبود دهنده</a> اولین بار در <a href="https://bennuai.com">مرکز توسعه هوش مصنوعی بنو</a>. پدیدار شد.</p>
]]></description>
										<content:encoded><![CDATA[		<div data-elementor-type="wp-post" data-elementor-id="3031" class="elementor elementor-3031" data-elementor-post-type="post">
				<div class="elementor-element elementor-element-6c6f2f68 e-flex e-con-boxed e-con e-parent" data-id="6c6f2f68" data-element_type="container">
					<div class="e-con-inner">
				<div class="elementor-element elementor-element-1f661237 elementor-widget elementor-widget-text-editor" data-id="1f661237" data-element_type="widget" data-widget_type="text-editor.default">
				<div class="elementor-widget-container">
									<h4 style="text-align: center"><strong><span style="color: #ff0000">ربات‌های خودبهبود دهنده</span>: ربات هایی که به خود آموزش میدهند!</strong></h4><p style="text-align: center"><span style="color: #000000">در این پست از سایت بنو قصد داریم ربات‌های خودبهبود دهنده را بررسی کنیم.</span></p><p><span style="color: #000000">تا به حال به این فکر کرده اید که ما چگونه مهارتی را به ربات ها می آموزیم؟ آیا چقدر این کار میتواند برای نیروی انسانی طاقت فرسا و هزینه بر باشد؟ یادگیری مهارت‌های پیچیده نیاز به تکرار دارد: امتحان کن، اصلاح کن، سپس دوباره امتحان کن. اما آیا ربات‌ها هم می‌توانند از طریق تمرین و تکرار مهارتی را یاد بگیرند بدون نیاز به دخالت انسان؟</span></p><h3> </h3><h4><span style="color: #000000"><strong>چالش‌های جمع‌آوری داده‌های رباتیک</strong></span></h4><p><span style="color: #000000">بهبود خودمختاری برای ربات‌ها یکی از چالش‌های اصلی در زمینه رباتیک است. جمع‌آوری داده‌های رباتیک تحت نظارت انسان بسیار گران‌قیمت است. برای مثال، یکی از بزرگترین مجموعه داده‌های تعاملی رباتیک که برای پروژه‌های SayCan و RT-1 استفاده شده، شامل ۱۳۰,۰۰۰ نمایش از وظایفی مانند &#8220;برداشتن قوطی نوشابه&#8221; است که طی ۱۷ ماه با استفاده از ۱۳ ربات تحت نظارت انسان جمع‌آوری شده است.</span></p><h4><span style="color: #000000"><strong>جمع‌آوری داده‌ها به صورت خودمختار</strong></span></h4><p><span style="color: #000000">حال تصور کنید اگر این ربات‌ها به صورت خودمختار داده جمع‌آوری می‌کردند. یک محاسبه ساده نشان می‌دهد که ۱۳ رباتی که به صورت خودمختار در طول ۱۷ ماه تعامل می‌کنند، می‌توانند بیش از ۱۷ میلیون مسیر جمع‌آوری کنند، یعنی تا ۱۰۰ برابر بیشتر داده‌های تعاملی!</span></p><h4><span style="color: #000000"><strong>ساخت ربات‌های خودمختار</strong></span></h4><p><span style="color: #000000">چگونه می‌توانیم ربات‌های خودمختاری بسازیم که بتوانند به طور معنی‌داری با محیط‌هایشان تعامل داشته باشند و از چنین تعاملی بهبود یابند؟ یادگیری تقویتی (Reinforcement Learning) یا به اختصار RL، یک چارچوب طبیعی برای ساخت چنین سیستم‌هایی ارائه می‌دهد. در RL، عامل‌ها می‌توانند از طریق آزمون و خطا یاد بگیرند.</span></p><h4><span style="color: #000000"><strong>چالش‌های یادگیری تقویتی</strong></span></h4><p><span style="color: #000000">متأسفانه، آموزش سیستم‌های رباتیک با استفاده از RL هنوز نیاز به نظارت گسترده انسان در طول آموزش دارد. با این حال، پیشرفت در این زمینه می‌تواند به توسعه سیستم‌های رباتیک ماهر از دستکاری تا حرکت منجر شود.</span></p><p><span style="color: #000000">توسعه ربات‌های خودمختار که بتوانند به طور موثر با محیط خود تعامل کنند و از تعاملات خود بیاموزند، همچنان یک چالش بزرگ در علم رباتیک است. اما با استفاده از روش‌های نوین مانند یادگیری تقویتی، می‌توان به پیشرفت‌های قابل توجهی دست یافت.</span></p><p style="text-align: center"><span style="color: #000000"><img decoding="async" class="aligncenter size-full wp-image-3058" src="https://bennuai.com/wp-content/uploads/2024/08/1.1.gif" alt="" width="300" height="100" /></span></p><p style="text-align: center"><span style="color: #000000"><img decoding="async" class="aligncenter size-full wp-image-3059" src="https://bennuai.com/wp-content/uploads/2024/08/1.2.gif" alt="" width="140" height="140" /></span></p><p style="text-align: center"><span style="color: #000000"><img decoding="async" class="aligncenter size-full wp-image-3060" src="https://bennuai.com/wp-content/uploads/2024/08/1.3.gif" alt="" width="200" height="100" /></span></p><p><span style="font-size: 11px;color: #000000">انسان‌ها محیط را برای ربات‌ها به طور مکرر تنظیم مجدد می‌کنند تا وظایف مربوطه خود را تمرین کنند. مداخلات انسانی برای تنظیم مجدد محیط می‌تواند به دفعات هر دقیقه یک بار باشد.</span></p><p><span style="color: #000000">یک انسان باید محیط را قبل از هر آزمون وظیفه برای الگوریتم‌های فعلی RL تنظیم مجدد کند تا به طور موفقیت‌آمیز وظیفه‌ای را یاد بگیرد. در واقع، چنین نظارتی گران‌قیمت است و مانع از این می‌شود که ربات‌ها به طور خودمختار یاد بگیرند و بهبود یابند. زیرا تنظیم مجدد محیط می‌تواند به اندازه خود وظیفه دشوار باشد. به عنوان مثال، یادگیری نحوه باز کردنِ در، نیاز به بستنِ در برای تنظیم مجدد محیط دارد که می‌تواند به همان اندازه برای ربات سخت باشد. به طور مؤثر، به حداقل رساندن نیاز به نظارت انسانی برای تنظیم مجدد محیط‌ها پس از هر آزمون، برای جمع‌آوری مجموعه داده‌های عظیم ضروری، برای آموزش ربات‌ها بسیار حیاتی است.</span></p><p><span style="color: #000000">در ادامه  سه مورد در این زمینه مورد بحث قرار می‌گیرد:</span></p><p><span style="color: #000000">(الف) <strong>EARL</strong> نشان می‌دهد که الگوریتم‌های فعلی RL بدون تنظیمات مکرر انسانی مشکل دارند و توضیحی ممکن برای این پدیده ارائه می‌دهد</span></p><p><span style="color: #000000">(ب) <strong>MEDAL</strong> یک الگوریتم RL ارائه می‌دهد که می‌تواند به صورت کارآمد و خودمختار یاد بگیرد</span></p><p><span style="color: #000000">(ج) ربات‌های خودبهبود بر اساس <strong>MEDAL</strong> یک سیستم ربات واقعی ارائه می‌دهد که می‌تواند از تعامل خودمختار با محیط بهبود یابد.</span></p><p><span style="color: #000000"><strong>EARL</strong><strong>: الگوریتم‌های </strong><strong>RL</strong><strong> بدون تنظیم مکرر محیط شکست می‌خورند.</strong></span></p><figure id="attachment_3044" aria-describedby="caption-attachment-3044" style="width: 783px" class="wp-caption aligncenter"><img loading="lazy" decoding="async" class=" wp-image-3044" src="https://bennuai.com/wp-content/uploads/2024/07/2-rs1-300x112.png" alt="environment steps" width="783" height="292" srcset="https://bennuai.com/wp-content/uploads/2024/07/2-rs1-300x112.png 300w, https://bennuai.com/wp-content/uploads/2024/07/2-rs1-768x287.png 768w, https://bennuai.com/wp-content/uploads/2024/07/2-rs1-600x224.png 600w, https://bennuai.com/wp-content/uploads/2024/07/2-rs1.png 1000w" sizes="(max-width: 783px) 100vw, 783px" /><figcaption id="caption-attachment-3044" class="wp-caption-text"><span style="color: #000000;font-size: 11px">در یک وظیفه‌ی هدایت یک عامل ماهی به محل هدفش در مجموعه کنترل DeepMind، بازده محیط به طور متوسط با افزایش طول اپیزودهای آموزشی از ۱۰۰۰ گام به ۱۰۰,۰۰۰ گام بدتر می‌شود. عامل به اندازه کافی به حالت اولیه بازنشانی نمی‌شود و نمی‌تواند وظیفه را به اندازه کافی تکرار کند تا یک سیاست مؤثر را یاد بگیرد.</span></figcaption></figure><p><span style="color: #000000">وظیفه یادگیری حرکت ماهی زرد به سمت هدف قرمز را در شکل بالا در نظر بگیرید. یک الگوریتم RL معمولی به صورت اپیزودیک با این وظیفه برخورد می‌کند، به این معنا که یک عامل تلاش می‌کند وظیفه را برای تعداد ثابتی از گام‌ها انجام دهد قبل از اینکه در صورت ناموفق بودن، از ادامه دادن صرف‌نظر کند. نکته مهم این است که بین هر اپیزود، محیط باید بازنشانی شود تا عامل بتواند دوباره تلاش کند. اما اگر به جای بازنشانی محیط، به سادگی به عامل اجازه دهیم به عمل خود ادامه دهد، چه اتفاقی می‌افتد؟ برای آزمون این فرضیه، آزمایشی ترتیب داده شد که عملکرد عامل را که به عنوان طول اپیزود افزایش می‌یابد، اندازه‌گیری می‌کند. مشاهده شد که سیاست یادگرفته شده به طور قابل توجهی بدتر می‌شود وقتی که محیط کمتر بازنشانی می‌شود. این مسئله محور مشکل ما را نشان می‌دهد: <strong>یک الگوریتم RL معمولی نیاز دارد که وظیفه را چندین بار تکرار کند و بازنشانی محیط نیازمند نظارت انسانی مداوم در طول آموزش است!</strong></span></p><p><span style="color: #000000">چرا بازنشانی کمتر محیط به سیاست‌های بدتر منجر می‌شود؟ پاسخ این است که وقتی محیط به طور مکرر بازنشانی نمی‌شود، عامل که آموزش دیده تا یک تابع پاداش(reward function) را به حداکثر برساند، تمایل دارد که در حالت‌های با پاداش بالا پرسه بزند. این امر منجر به عدم کاوش کافی در کل فضا و در نتیجه داده‌های ناکافی برای یادگیری یک سیاست کارآمد می‌شود. با این حال، بازنشانی مکرر محیط در دنیای واقعی عملی نیست. برای کمک به طراحی الگوریتم‌های مناسب برای یادگیری در دنیای واقعی، ما مشکل یادگیری تقویتی خودمختار را پیشنهاد دادیم، که در آن یک عامل موظف است در محیطی با حداقل بازنشانی‌های مکرر یک سیاست مؤثر را یاد بگیرد. ما یک بنچمارک از محیط‌های شبیه‌سازی شده چالش‌برانگیز معرفی کردیم تا عملکرد بدون مداخلات مکرر برای بازنشانی محیط را ارزیابی کنیم. متوجه شدیم که الگوریتم‌های RL موجود در این بنچمارک‌ها مشکل دارند و فضای زیادی برای بهبود وجود دارد.</span></p><p><span style="color: #000000">حالا یک راه حل پیش روی ماست و میرویم تا با MEDAL آشنا شویم!</span></p><p><span style="color: #000000"><strong>(<a style="color: #000000" href="https://arxiv.org/abs/2205.05212">Matching Expert Distributions for Autonomous Learning</a>)MEDAL</strong><strong>: اگر سیاستی برای لغو کار یاد بگیریم چه؟</strong></span></p><p style="text-align: center"><span style="color: #000000"><img loading="lazy" decoding="async" class="aligncenter size-full wp-image-3063" src="https://bennuai.com/wp-content/uploads/2024/08/3.gif" alt="" width="1668" height="808" /></span></p><p><span style="font-size: 11px;color: #000000">مروری بر MEDAL برای آموزش عوامل RL به طور مستقل با حداقل مداخلات انسانی برای تنظیم مجدد محیط.</span></p><h4><span style="color: #000000"><strong>چگونه می‌توانیم ربات ها را بدون مداخلات مکرر انسانی آموزش دهیم؟</strong></span></h4><p><span style="color: #000000">ایده کلیدی این است که محیط را به گونه‌ای بازنشانی کنیم که نیازی به مداخلات مکرر انسانی نباشد. به طور خاص، ربات ما دو سیاست یاد می‌گیرد: یک سیاست به جلو برای انجام وظیفه و یک سیاست به عقب برای لغو وظیفه. این دو سیاست به ترتیب به یکدیگر متصل شده‌اند تا به عامل امکان دهند که به طور خودمختار با حداقل مداخلات انسانی آموزش ببیند. سیاست به عقب باید چه چیزی را بهینه کند؟ به نظر می‌رسد طبیعی باشد که سیاست به عقب را برای رسیدن به توزیع حالت‌های اولیه آموزش دهیم، به طوری که سیاست به جلو بتواند وظیفه را به طور مکرر از توزیع حالت‌های اولیه امتحان کند. آیا می‌توانیم سیاست به عقب را به گونه‌ای یاد بگیریم که به سیاست به جلو کمک کند تا به طور مؤثرتری یاد بگیرد؟</span></p><p><span style="color: #000000">برای یادگیری مؤثر سیاست به جلو برای حل وظیفه، یادگیری ربات اغلب نیاز به مجموعه‌ای کوچک از نمایش‌های کارشناسی در مورد &#8220;چگونگی حل وظیفه&#8221; دارد. یافتن مسیر اولیه به هدف می‌تواند بسیار زمان‌بر باشد (یعنی &#8220;مسئله کاوش&#8221;) و نمایش‌های کارشناسی می‌توانند به طور قابل توجهی سرعت یادگیری را با مقابله با این چالش کاوش افزایش دهند. بینش کلیدی ما این است که اگر چنین نمایش‌های کارشناسی در دسترس باشد، <strong>(الف)</strong> یادگیری سیاست به عقب برای رسیدن به هر یک از حالت‌هایی که کارشناس در نمایش‌ها بازدید کرده است، می‌تواند آسان‌تر از یادگیری برای رسیدن به فقط توزیع حالت‌های اولیه باشد و <strong>(ب)</strong> حالت‌های کارشناسی توزیع مؤثرتری از حالت‌های شروع برای یادگیری سیاست به جلو فراهم می‌آورند، زیرا عامل می‌تواند وظیفه را از حالت‌های مختلف که از آسان تا دشوار متغیر هستند امتحان کند. سیاست به جلو می‌تواند یاد بگیرد که چگونه وظیفه را از حالت‌های نزدیک به هدف (&#8220;حالت‌های اولیه آسان&#8221;) حل کند و از موفقیت‌ها برای یادگیری از حالت‌های دورتر از هدف (&#8220;حالت‌های اولیه دشوار&#8221;) استفاده کند.</span></p><p><span style="color: #000000">این رویکرد به عنوان انگیزه‌ای برای MEDAL (مطابقت توزیع‌های کارشناسی برای یادگیری خودمختار) عمل می‌کند، جایی که عامل یک سیاست به جلو را برای حداکثر کردن پاداش‌های وظیفه یاد می‌گیرد و سیاست به عقب یاد می‌گیرد که به طور یکنواخت حالت‌هایی که کارشناس بازدید کرده است را پوشش دهد، بدون نیاز به توابع پاداش اضافی برای آموزش سیاست به عقب. در واقع، MEDAL به طور قابل توجهی هم کارایی یادگیری و هم عملکرد نهایی سیاست‌های یادگرفته شده را بهبود می‌بخشد.</span></p><h4><span style="color: #000000"><strong>چگونه می‌توانیم یک سیستم رباتیک خودبهبود دهنده بسازیم؟</strong></span></h4><p><span style="color: #000000">حالا که یک الگوریتم یادگیری کارآمد بدون نیاز به مداخلات مکرر انسانی داریم، می‌توانیم به هدف خود برای ساخت ربات‌های خودبهبود دهنده برگردیم! یادگیری ربات‌ها در دنیای واقعی دو چالش اضافی به غیر از کمبود نظارت برای بازنشانی محیط‌ها دارد:</span></p><p><span style="color: #000000"><strong>۱. چالش اول</strong>: نیاز به یادگیری از داده‌های حسی خام</span></p><p><span style="color: #000000">&#8211; حالت‌های کم‌بعدی مانند مختصات اشیاء برای هر وظیفه گران‌قیمت هستند و نیازمند مهندسی دقیق (شامل شناسایی اشیاء، کالیبراسیون و غیره) هستند. سیستم‌های رباتیک باید بتوانند به طور مستقیم از داده‌های حسی خام، مانند ورودی‌های تصویری، یاد بگیرند.</span></p><p><span style="color: #000000"><strong>۲. چالش دوم</strong>: عدم وجود برچسب‌های پاداش در دنیای واقعی</span></p><p><span style="color: #000000">&#8211; در دنیای واقعی برچسب‌های پاداش وجود ندارد و ربات‌ها باید بدون توابع پاداش خاص وظیفه که به طور مهندسی طراحی شده‌اند، یاد بگیرند. این بدان معناست که ربات‌ها باید توانایی یادگیری از تجربیات و تعاملات خود را بدون نیاز به پاداش‌های مشخص برای هر وظیفه داشته باشند.</span></p><p style="text-align: center"><span style="color: #000000"><img loading="lazy" decoding="async" class="aligncenter size-medium wp-image-3068" src="https://bennuai.com/wp-content/uploads/2024/08/4-300x110.gif" alt="" width="300" height="110" /></span></p><p style="text-align: right"><span style="font-size: 11px;color: #000000">مروری بر MEDAL++: یک الگوریتم عملی قابل تحقق برای آموزش ربات ها به صورت مستقل.</span></p><p><span style="color: #000000">برای حل این مسائل، ما ++MEDAL را پیشنهاد می‌کنیم تا MEDAL را برای سیستم‌های رباتیک خودبهبود دهنده تطبیق داده و بهبود بخشد!</span></p><p><span style="color: #000000">برای آموزش مؤثر سیاست‌های خود از ورودی‌های پیکسلی، از تکنیک‌های تقویتی مانند برش تصادفی و تغییر موقعیت استفاده می‌کنیم تا یادگیری را منظم کنیم. نکته مهم این است که چگونه می‌توانیم بدون پاداش‌های وظیفه یاد بگیریم؟ نمایش‌های کارشناسی دوباره به کمک می‌آیند! ما می‌توانیم از حالت‌های پایانی در نمایش‌های کارشناسی به عنوان نماینده‌ای برای حالت‌های هدف استفاده کنیم و سیاست به جلو را برای رسیدن به حالت‌های &#8220;مشابه&#8221; این حالت‌ها پاداش دهیم. شباهت با استفاده از یک طبقه‌بند آموزش دیده به روش مخالف اندازه‌گیری می‌شود، بر اساس این ایده که شباهت بصری با نزدیک‌تر شدن ربات به هدف افزایش می‌یابد. بنابراین، نمایش‌های کارشناسی به عنوان نظارت برای آموزش هر دو سیاست به جلو و سیاست به عقب عمل می‌کنند.</span></p><p><span style="color: #000000">محققان از ++MEDAL برای آموزش یک بازوی فرانکا به طور خودمختار برای انجام چندین وظیفه manipulative استفاده کردند که نمونه‌هایی از آن در شکل زیر نشان داده شده است. با شروع از تنها 50 نمایش کارشناسی، بازوی رباتی توانست نرخ موفقیت را بین 30-70% از طریق (عمدتاً) تمرین خودمختار در طی 20 ساعت (با کمتر از 50 مداخله برای بازنشانی محیط!) بهبود بخشد. به طور کلی، ++MEDAL به یک الگوی یادگیری اجازه می‌دهد که در آن یک کارشناس از طریق تعداد کمی از نمایش‌ها دستورالعمل را ارائه دهد و ربات می‌تواند به طور خودمختار پس از آن تمرین کند.</span></p><p style="text-align: center"><span style="color: #000000"><img loading="lazy" decoding="async" class="aligncenter wp-image-3062" src="https://bennuai.com/wp-content/uploads/2024/08/5.gif" alt="" width="200" height="200" /></span></p><h4><span style="color: #000000"><strong>آیا به آنجا رسیدیم؟</strong></span></h4><p><span style="color: #000000">این دوران برای مقیاس‌پذیری یادگیری ربات‌ها بسیار هیجان‌انگیز است و جمع‌آوری و آموزش بر روی مجموعه‌های داده بزرگ در قلب این موضوع قرار دارد. تحقیقات اخیر شروع به استفاده از منابع داده در مقیاس اینترنتی (مانند یوتیوب) برای تقویت یادگیری ربات‌ها کرده‌اند. در حالی که این منابع برای ایجاد نمایه‌هایی از جهان اهمیت دارند، داده‌های ربات‌های تجسم‌شده برای یادگیری مهارت‌های پیچیده بسیار حیاتی هستند زیرا اطلاعاتی درباره تعاملات ربات با محیط بدون هیچ گونه تغییر دامنه ارائه می‌دهند. همان‌طور که در این پست اشاره کردیم، می‌توان این داده‌ها را از طریق چارچوبی که پیشنهاد شد، برای یادگیری تقویتی خودمختار (RL) به میزان زیادی مقیاس‌پذیر کرد.</span></p><p><span style="color: #000000">با این حال، کار ما تنها شروعی برای پرداختن به این مشکل چالش‌برانگیز است و سوالات و مسیرهای بهبودی زیادی وجود دارد:</span></p><p><span style="color: #000000"><strong>خودمختاری مشترک:</strong> در حالی که در این مقاله بر روی خودمختاری و کاهش نیاز به بازنشانی محیط‌ها تأکید کرده‌ایم، نظارت انسانی واقعاً برای یادگیری ربات‌ها بسیار مفید است. با این حال، استفاده از آن برای بازنشانی مکرر محیط‌ها به نظر نمی‌رسد بهترین استفاده از این نظارت باشد. تخصیص مؤثر و مقیاس‌پذیر بین اشکال مختلف نظارت انسانی، مانند بازنشانی محیط‌ها، برچسب‌گذاری پاداش‌ها یا نمایش‌های کارشناسی وظیفه، چیست؟</span></p><p><span style="color: #000000"><strong>مدیریت غیرقابلیت بازگشت:</strong> به طور اجتناب‌ناپذیر، عامل‌های رباتیک با وضعیت‌های غیرقابل بازگشت مواجه خواهند شد که در آن‌ها انسان‌ها باید مداخله کنند، به عنوان مثال، بیرون راندن یک لیوان از دسترس بازوی ربات. ما یک تلاش اولیه با &#8220;PAINT&#8221; به عنوان چارچوبی برای یادگیری زمان درخواست کمک از انسان انجام دادیم، اما هنوز فضای زیادی برای بهبود استفاده از نظارت انسانی وجود دارد!</span></p><p><span style="color: #000000"><strong>استقرار خودمختار:</strong>  ربات‌های مستقر به طور خودمختار به طور اجتناب‌ناپذیر با وضعیت‌های جدیدی که در داده‌های آموزشی وجود ندارد، مواجه خواهند شد. آیا آن‌ها می‌توانند به طور خودمختار بازگردند اگر گیر کنند (برای مثال، یک ربات تحویل در آخرین کیلومتر که در یک چاله گیر کرده است) و به بهینه‌سازی اهداف خود ادامه دهند؟</span></p><p><span style="color: #000000"><strong>معیارهای بهتر:</strong> &#8220;EARL&#8221; یک معیار کوچک با چالش‌های زیادی از یادگیری تقویتی خودمختار است که هنوز پوشش داده نشده است (برای مثال، وضعیت‌های غیرقابل بازگشت). ایجاد محیط‌های متنوع و بیانگر می‌تواند به توسعه الگوریتمی بهتر کمک کند و درک تعادلات بین اشکال و مقادیر نظارت را بهبود بخشد.</span></p><p><span style="color: #000000"><strong>جمع‌بندی:</strong> برای دستیابی به ربات‌های کاملاً قادر که بتوانند به طور خودمختار در محیط‌های غیرساختاریافته مانند آشپزخانه‌ها، خانه‌ها و دفاتر عمل کنند، ممکن است مفید باشد که به طور مستقیم در دنیای واقعی به یادگیری خودمختار بپردازیم. فکر کردن به آنچه که لازم است ربات‌ها بتوانند به طور ۲۴x۷ کار کنند و داده‌ها را در محیط‌های متنوع جمع‌آوری کنند تا واقعاً به تحقق این دیدگاه نزدیک شویم، ارزشمند است.</span></p><p><span style="color: #000000">این پست مرکز هوش مصنوعی بنو برگرفته از مقاله ی زیر است، برای مطالعه ی بیشتر به لینک گذاشته شده مراجعه کنید:</span></p><p><a href="https://ai.stanford.edu/blog/self-improving-robots/">Self-Improving Robots: Embracing Autonomy in Robot Learning | SAIL Blog (stanford.edu)</a></p><p>برای دیدن پست های بیشتر در زمینه ی هوش مصنوعی به <a href="https://bennuai.com/blog/" target="_blank" rel="noopener">اینجا (وبلاگ هوش مصنوعی بنو)</a> سر بزنید!</p>								</div>
				</div>
					</div>
				</div>
				</div>
		<p>نوشته <a href="https://bennuai.com/%da%86%da%af%d9%88%d9%86%d9%87-%d8%b1%d8%a8%d8%a7%d8%aa-%d9%85%d8%b9%d9%84%d9%85-%d8%ae%d9%88%d8%af-%d8%b4%d9%88%d8%af%d8%9f/">ربات‌های خودبهبود دهنده</a> اولین بار در <a href="https://bennuai.com">مرکز توسعه هوش مصنوعی بنو</a>. پدیدار شد.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://bennuai.com/%da%86%da%af%d9%88%d9%86%d9%87-%d8%b1%d8%a8%d8%a7%d8%aa-%d9%85%d8%b9%d9%84%d9%85-%d8%ae%d9%88%d8%af-%d8%b4%d9%88%d8%af%d8%9f/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
