คุณเคยได้ยินเรื่องความขัดแย้งของ Moravec หรือไม่? Paradox ระบุว่าการใช้เหตุผลขั้นสูงนั้นต้องการพลังการคำนวณน้อยมากสำหรับระบบปัญญาประดิษฐ์ (AI) ในขณะที่การใช้ทักษะการรับรู้ด้วยมอเตอร์ที่มนุษย์ใช้ในการรับสิทธิ์นั้นต้องใช้ทรัพยากรการคำนวณขนาดใหญ่ ในสาระสำคัญงานเชิงตรรกะที่ซับซ้อนนั้นง่ายกว่าสำหรับ AI มากกว่างานทางประสาทสัมผัสพื้นฐานที่สัญชาตญาณของมนุษย์สามารถทำได้ ความขัดแย้งนี้เน้นถึงความแตกต่างระหว่าง AI และความสามารถทางปัญญาของมนุษย์ในขั้นตอนนี้
ผู้คนมีหลายรูปแบบโดยเนื้อแท้ เราแต่ละคนเป็นเหมือนขั้วอัจฉริยะที่มักจะต้องไปโรงเรียนเพื่อรับการศึกษา (ได้รับการฝึกฝน) แต่จุดประสงค์และผลของการฝึกอบรมและการเรียนรู้คือเรามีความสามารถในการทำงานและใช้ชีวิตอย่างอิสระโดยไม่ต้องพึ่งพาคำแนะนำภายนอกและ ควบคุม.
เราเรียนรู้เกี่ยวกับโลกรอบตัวเราผ่านการสัมผัสทางประสาทสัมผัสหลายอย่างเช่นสายตาคำพูดเสียงสัมผัสรสชาติและกลิ่นเพื่อวิเคราะห์เหตุผลตัดสินใจและดำเนินการ
หลังจากหลายปีของการฟิวชั่นเซ็นเซอร์และวิวัฒนาการ AI หุ่นยนต์ส่วนใหญ่จะติดตั้งเซ็นเซอร์หลายรูปแบบในขั้นตอนนี้ ในขณะที่เรานำพลังการคำนวณมาสู่อุปกรณ์ขอบเช่นหุ่นยนต์อุปกรณ์เหล่านี้กำลังฉลาดขึ้นและฉลาดขึ้นสามารถรับรู้สภาพแวดล้อมความเข้าใจและการสื่อสารในภาษาธรรมชาติได้รับสัมผัสผ่านอินเทอร์เฟซการตรวจจับดิจิตอล ความเร็วเชิงมุมและแม้กระทั่งสนามแม่เหล็กรอบหุ่นยนต์ผ่านการรวมกันของเครื่องเร่งความเร็ว, ไจโรสโคปและเครื่องวัดแม่เหล็กและอื่น ๆ
สู่ยุคใหม่ของหุ่นยนต์และความรู้ความเข้าใจของเครื่องจักร
ก่อนที่จะมีหม้อแปลงและโมเดลภาษาขนาดใหญ่ (LLMS) การใช้งาน multimodality ใน AI มักจะต้องใช้แบบจำลองหลายแบบแยกต่างหากที่รับผิดชอบข้อมูลประเภทต่าง ๆ (ข้อความ, ภาพ, เสียง) และการรวมโมเดลที่แตกต่างกันผ่านกระบวนการที่ซับซ้อน
ด้วยการถือกำเนิดของโมเดลหม้อแปลงและ LLMs ความหลากหลายได้กลายเป็นแบบบูรณาการมากขึ้นทำให้โมเดลเดียวสามารถประมวลผลและทำความเข้าใจกับหลายประเภทข้อมูลได้พร้อมกันส่งผลให้ระบบ AI ที่มีความสามารถในการตรวจจับสภาพแวดล้อมของพวกเขาอย่างครอบคลุมมากขึ้น การเปลี่ยนแปลงนี้ได้ปรับปรุงประสิทธิภาพและประสิทธิผลของแอปพลิเคชัน AI แบบหลายรูปแบบอย่างมาก
ในขณะที่ LLMS เช่น GPT -3 เป็นพื้นฐานของข้อความ แต่อุตสาหกรรมได้ดำเนินการอย่างรวดเร็วไปสู่ความหลากหลาย จากคลิปของ Openai และ Dall-E และตอนนี้ Sora และ GPT -4 o เป็นตัวอย่างของแบบจำลองที่ย้ายไปสู่ความหลากหลายและการมีปฏิสัมพันธ์ระหว่างมนุษย์กับคอมพิวเตอร์ธรรมชาติมากขึ้น ตัวอย่างเช่นคลิปเข้าใจภาพที่จับคู่กับภาษาธรรมชาติดังนั้นจึงเชื่อมช่องว่างระหว่างข้อมูลภาพและข้อความ Dall-E มีจุดมุ่งหมายเพื่อสร้างภาพตามคำอธิบายที่เป็นข้อความ เราเห็นโมเดล Google Gemini ที่ได้รับการวิวัฒนาการที่คล้ายกัน
ในปี 2024 วิวัฒนาการหลายรูปแบบเร่งความเร็ว ในเดือนกุมภาพันธ์ Openai เปิดตัว Sora ซึ่งสร้างวิดีโอที่สมจริงหรือจินตนาการตามคำอธิบายข้อความ เมื่อคุณคิดเกี่ยวกับมันสิ่งนี้อาจเป็นเส้นทางที่มีแนวโน้มในการสร้างเครื่องจำลองโลกสากลหรือกลายเป็นเครื่องมือสำคัญสำหรับการฝึกอบรมหุ่นยนต์ หลังจากสามเดือน GPT -4 o ได้ปรับปรุงประสิทธิภาพของการมีปฏิสัมพันธ์กับหุ่นยนต์ของมนุษย์อย่างมีนัยสำคัญและสามารถให้เหตุผลในเวลาจริงระหว่างเสียงวิสัยทัศน์และข้อความ การรวมข้อมูลข้อความภาพและเสียงเพื่อฝึกอบรมแบบ end-to-end รุ่นใหม่จะช่วยลดการเปลี่ยนโมดอลสองแบบจากการป้อนข้อมูลอินพุตเป็นข้อความจากนั้นจากข้อความไปเป็นโมเดิร์นเอาท์พุทซึ่งจะช่วยปรับปรุงประสิทธิภาพได้อย่างมาก
ในสัปดาห์เดียวกันในเดือนกุมภาพันธ์ Google เปิดตัว Gemini 1.5 ซึ่งขยายความยาวบริบทเป็น 1 ล้านโทเค็นอย่างมาก ซึ่งหมายความว่า 1.5 Pro สามารถประมวลผลข้อมูลจำนวนมากในครั้งเดียวรวมถึงวิดีโอหนึ่งชั่วโมงเสียง 11 ชั่วโมงและรหัสเบสที่มีมากกว่า 30, 000 บรรทัดของรหัสหรือ 700, 000}} Words.gemini 1.5 สร้างขึ้นจากการวิจัยชั้นนำของ Google เกี่ยวกับหม้อแปลงและสถาปัตยกรรมผู้เชี่ยวชาญที่มีสมาชิกผสม (MOE) และโมเดลโอเพ่นซอร์ส 2B และ 7B ที่สามารถปรับใช้ได้ที่ด้านขอบ ในการประชุม Google I/O ในเดือนพฤษภาคมนอกเหนือจากการเพิ่มความยาวของบริบทเป็นสองเท่าและปล่อยชุดเครื่องมือ AI และแอพพลิเคชั่น Generative แล้ว Google ได้สำรวจวิสัยทัศน์สำหรับอนาคตของ Project Astra ผู้ช่วย AI ที่ใช้งานทั่วไปซึ่งประมวลผลข้อมูลหลายรูปแบบ เข้าใจบริบทที่ผู้ใช้ถูกวางไว้และโต้ตอบกับผู้คนในการสนทนาในลักษณะที่เป็นธรรมชาติมาก
ในฐานะ บริษัท ที่อยู่เบื้องหลัง LLM LLM โอเพนซอร์ซเมตาก็เข้าร่วมการติดตามปัญญาประดิษฐ์ทั่วไป (AGI)
ความหลากหลายที่แท้จริงนี้เพิ่มระดับความฉลาดของเครื่องจักรอย่างมากและจะนำไปสู่กระบวนทัศน์ใหม่สำหรับหลายอุตสาหกรรม
ตัวอย่างเช่นหุ่นยนต์เคยเป็นเนื้อเดียวกันมากด้วยเซ็นเซอร์และความสามารถในการเคลื่อนที่บางอย่าง แต่โดยทั่วไปแล้วพวกเขาไม่มี "สมอง" เพื่อเรียนรู้สิ่งใหม่ ๆ และปรับให้เข้ากับสภาพแวดล้อมที่ไม่มีโครงสร้างและไม่คุ้นเคย
LLM หลายรูปแบบคาดว่าจะเปลี่ยนความสามารถของหุ่นยนต์ในการวิเคราะห์เหตุผลและเรียนรู้ย้ายพวกเขาจากความเชี่ยวชาญไปสู่การวางนัยทั่วไป พีซีเซิร์ฟเวอร์และสมาร์ทโฟนเป็นผู้นำในแพลตฟอร์มคอมพิวเตอร์ที่มีวัตถุประสงค์ทั่วไปและสามารถเรียกใช้แอพพลิเคชั่นซอฟต์แวร์หลายประเภทเพื่อให้ได้ฟังก์ชั่นที่หลากหลาย การวางนัยทั่วไปจะช่วยขยายขนาดการสร้างรายได้และราคาสามารถลดลงได้อย่างมากในขณะที่พวกเขาขยายขนาดขึ้นนำไปสู่วัฏจักรที่มีคุณธรรมของการยอมรับในพื้นที่มากขึ้น
Elon Musk สังเกตเห็นประโยชน์ของเทคโนโลยีทั่วไปในช่วงต้นเนื่องจากหุ่นยนต์ของเทสลาวิวัฒนาการมาจาก Bumblebee ในปี 2565 ถึง Optimus Gen 1 ประกาศในเดือนมีนาคม 2566 และ Gen 2 ประกาศเมื่อสิ้นสุดปี 2566 ด้วยความสามารถรอบตัวและความสามารถในการเรียนรู้ที่เพิ่มขึ้นเรื่อย ๆ ในช่วงเดือนที่ผ่านมา 6-12 เราได้เห็นความก้าวหน้าจำนวนมากในสาขาหุ่นยนต์และหุ่นยนต์มนุษย์
เทคโนโลยีใหม่ที่อยู่เบื้องหลังหุ่นยนต์รุ่นต่อไปและสติปัญญาที่เป็นตัวเป็นตน
ไม่ต้องสงสัยเลยว่าเรายังคงมีงานต้องทำมากมายก่อนที่หน่วยสืบราชการลับจะมาถึงการผลิตจำนวนมาก เราต้องการการออกแบบที่เบากว่ารันไทม์ที่ยาวขึ้นและแพลตฟอร์มการคำนวณขอบที่เร็วขึ้นและทรงพลังยิ่งขึ้นเพื่อประมวลผลและหลอมรวมข้อมูลเซ็นเซอร์เซ็นเซอร์เพื่อทำการตัดสินใจในเวลาที่เหมาะสมและควบคุมการกระทำ
และเรากำลังก้าวไปสู่การสร้างหุ่นยนต์มนุษย์ อารยธรรมมนุษย์หลายพันปีได้สร้างสภาพแวดล้อมที่แพร่หลายที่ออกแบบมาสำหรับมนุษย์และระบบหุ่นยนต์มนุษย์คาดว่าจะสามารถโต้ตอบกับมนุษย์และสิ่งแวดล้อมได้อย่างสะดวกสบายและดำเนินการที่จำเป็นในสภาพแวดล้อมที่มีอยู่มนุษย์เนื่องจากความคล้ายคลึงกันในรูปแบบของผู้คน ระบบเหล่านี้จะเหมาะอย่างยิ่งในการจัดการงานที่สกปรกอันตรายและน่าเบื่อเช่นการดูแลผู้ป่วยและการฟื้นฟูสมรรถภาพงานบริการในอุตสาหกรรมการบริการการสอนเครื่องช่วยหรือการเรียนรู้เพื่อนร่วมงานในสาขาการศึกษาและงานที่เป็นอันตรายเช่นการตอบสนองจากภัยพิบัติและการจัดการวัสดุอันตราย . แอปพลิเคชันดังกล่าวใช้ประโยชน์จากเครื่องจักรของมนุษย์คุณลักษณะของมนุษย์เพื่ออำนวยความสะดวกในการปฏิสัมพันธ์ระหว่างหุ่นยนต์มนุษย์ตามธรรมชาติทำหน้าที่ในพื้นที่ที่มีมนุษย์เป็นศูนย์กลางและปฏิบัติงานที่มักจะยากสำหรับหุ่นยนต์ดั้งเดิมที่จะบรรลุผล
บริษัท AI และหุ่นยนต์หลายแห่งกำลังเปิดตัวการวิจัยใหม่และการทำงานร่วมกันเกี่ยวกับวิธีการฝึกอบรมหุ่นยนต์ให้มีเหตุผลและวางแผนที่ดีขึ้นในสภาพแวดล้อมที่ไม่มีโครงสร้างใหม่ ในฐานะที่เป็น "สมอง" ของหุ่นยนต์ใหม่แบบจำลองที่ได้รับการฝึกอบรมล่วงหน้าเกี่ยวกับข้อมูลจำนวนมากมีความสามารถในการวางแนวทั่วไปที่ยอดเยี่ยมทำให้หุ่นยนต์มองเห็นและเข้าใจสภาพแวดล้อมของพวกเขาได้อย่างครอบคลุมมากขึ้นปรับการเคลื่อนไหวและการกระทำตามข้อเสนอแนะทางประสาทสัมผัสและเพิ่มประสิทธิภาพการทำงานของพวกเขา ในสภาพแวดล้อมแบบไดนามิกที่หลากหลาย
เป็นตัวอย่างที่น่าสนใจสุนัขหุ่นยนต์ของบอสตันพลวัตสามารถทำหน้าที่เป็นไกด์นำเที่ยวในพิพิธภัณฑ์โต้ตอบกับผู้เยี่ยมชมแนะนำพวกเขาในการจัดแสดงที่หลากหลายและตอบคำถามของพวกเขา มันอาจจะยากที่จะเชื่อ แต่ในกรณีการใช้งานนี้การแสดงความบันเทิงการโต้ตอบและการแสดงที่ละเอียดอ่อนของ Spot นั้นสำคัญกว่าการตรวจสอบให้แน่ใจว่าข้อเท็จจริงนั้นถูกต้อง
Robotics Transformer: สมองใหม่ของหุ่นยนต์
Robotics Transformer (RT) กำลังพัฒนาอย่างรวดเร็วเพื่อแปลอินพุตหลายรูปแบบลงในรหัสที่สามารถดำเนินการได้โดยตรง RT ของ Google DeepMind -2 ดำเนินการเช่นเดียวกับรุ่นก่อน RT -1 โดยมีอัตราความสำเร็จใกล้ 100% เมื่อปฏิบัติงานที่เคยเห็นมาก่อน อย่างไรก็ตามเมื่อได้รับการฝึกฝนด้วย Palm-E (โมเดลภาษาหลายรูปแบบที่มุ่งเน้นหุ่นยนต์) และ Pali-X (รูปแบบการมองเห็นหลายภาษาและภาษาขนาดใหญ่ไม่ได้ออกแบบมาสำหรับหุ่นยนต์โดยเฉพาะ), RT -2 และมีประสิทธิภาพเหนือกว่า RT -1 ในงานที่มองไม่เห็น
Microsoft แนะนำ Llava ซึ่งเป็นผู้ช่วยและวิสัยทัศน์ขนาดใหญ่ เดิมทีออกแบบมาสำหรับงานที่ใช้ข้อความ LLAVA ใช้ประโยชน์จากพลังของ GPT -4 เพื่อสร้างกระบวนทัศน์ใหม่สำหรับคำแนะนำหลายรูปแบบเพื่อติดตามข้อมูลการรวมส่วนประกอบที่เป็นข้อความและภาพซึ่งเป็นประโยชน์สำหรับงานหุ่นยนต์ เมื่อเปิดตัว LLAVA ได้ตั้งค่าบันทึกใหม่สำหรับการแชทหลายรูปแบบและงานสอบถามทางวิทยาศาสตร์ซึ่งเกินความสามารถเฉลี่ยของมนุษย์แล้ว
ดังที่ได้กล่าวไว้ก่อนหน้านี้การจู่โจมของเทสลาสู่หุ่นยนต์อเนกประสงค์ของมนุษย์และ AI ทั่วไปนั้นมีความสำคัญไม่เพียงเพราะมันถูกออกแบบมาสำหรับการผลิตขนาดและการผลิตจำนวนมาก แต่ยังเป็นเพราะมูลนิธิเทคโนโลยีการขับขี่ด้วยตนเอง (FSD) ที่แข็งแกร่ง (FSD) ของ Autopilot ของ Tesla สำหรับรถยนต์ หุ่นยนต์ เทสลายังมีกรณีการใช้งานการผลิตที่ชาญฉลาดสำหรับการใช้ Optimus กับกระบวนการผลิตรถยนต์พลังงานใหม่
แขนเป็นรากฐานที่สำคัญของอนาคตของหุ่นยนต์
ARM เชื่อว่าสมองหุ่นยนต์ทั้ง "สมองขนาดใหญ่" และ "สมองน้อย" ควรเป็นระบบคอมพิวเตอร์ AI ที่ต่างกันซึ่งให้ประสิทธิภาพที่เหนือกว่าการตอบสนองแบบเรียลไทม์และประสิทธิภาพการใช้พลังงาน

หุ่นยนต์เกี่ยวข้องกับงานที่หลากหลายรวมถึงการคำนวณขั้นพื้นฐาน (เช่นการส่งและรับสัญญาณไปยังและจากมอเตอร์) การประมวลผลข้อมูลขั้นสูง (เช่นการตีความข้อมูลภาพและเซ็นเซอร์) และการเรียกใช้ LLM หลายรูปแบบที่กล่าวถึงก่อนหน้านี้ CPU นั้นเหมาะสมสำหรับงานทั่วไปในขณะที่แป้นก๊าซ AI และ GPU สามารถจัดการงานการประมวลผลแบบขนานได้อย่างมีประสิทธิภาพมากขึ้นเช่นการเรียนรู้ของเครื่อง (ML) และการประมวลผลกราฟิก คันเหยียบก๊าซเพิ่มเติมเช่นตัวประมวลผลสัญญาณภาพและตัวแปลงสัญญาณวิดีโอสามารถรวมเข้าด้วยกันเพื่อเพิ่มความสามารถในการมองเห็นของหุ่นยนต์และประสิทธิภาพการจัดเก็บ/การส่งสัญญาณ นอกจากนี้ CPU ควรมีการตอบสนองแบบเรียลไทม์และจำเป็นต้องสามารถเรียกใช้ระบบปฏิบัติการเช่นแพ็คเกจ Linux และ ROS
เมื่อขยายไปยังสแต็กซอฟต์แวร์หุ่นยนต์เลเยอร์ระบบปฏิบัติการอาจต้องใช้ระบบปฏิบัติการแบบเรียลไทม์ (RTOS) ที่สามารถจัดการงานที่สำคัญต่อเวลาได้อย่างน่าเชื่อถือเช่นเดียวกับการกระจาย Linux ที่ปรับแต่งสำหรับหุ่นยนต์เช่น ROS บริการที่ออกแบบมาสำหรับกลุ่มคอมพิวเตอร์ที่ต่างกัน เราเชื่อว่ามาตรฐานและโปรแกรมการรับรองที่ได้รับการสนับสนุนจาก ARM เช่น SystemReady และ PSA Certified จะช่วยขยายการพัฒนาซอฟต์แวร์หุ่นยนต์ SystemReady ได้รับการออกแบบมาเพื่อให้แน่ใจว่าการแจกแจง OS แบบ Rich มาตรฐานนั้นทำงานบนระบบบนชิป (SOCS) ที่หลากหลายตามสถาปัตยกรรม ARM ในขณะที่ PSA ได้รับการรับรองช่วยให้โซลูชั่นการใช้งานด้านความปลอดภัยง่ายขึ้นเพื่อให้เป็นไปตามข้อกำหนดด้านความปลอดภัยและกฎระเบียบสำหรับอุปกรณ์ที่เชื่อมต่อ
ความก้าวหน้าในแบบจำลองหลายรูปแบบขนาดใหญ่และ AI ที่เกิดจากการสร้างยุคใหม่ในการพัฒนาหุ่นยนต์ AI และหุ่นยนต์มนุษย์ นอกเหนือจากการคำนวณ AI และระบบนิเวศประสิทธิภาพการใช้พลังงานความปลอดภัยและความปลอดภัยในการใช้งานเป็นสิ่งจำเป็นในการสร้างกระแสหลักของหุ่นยนต์ในยุคใหม่นี้ โปรเซสเซอร์ ARM มีการใช้กันอย่างแพร่หลายในหุ่นยนต์และเราหวังว่าจะได้ทำงานอย่างใกล้ชิดกับระบบนิเวศเพื่อทำให้แขนเป็นรากฐานที่สำคัญของอนาคตของหุ่นยนต์ AI




