

สัปดาห์ที่ผ่านมานับเป็นก้าวสำคัญในความสามารถด้าน AI ของ Google ด้วยการเปิดตัวโมเดล Gemini 1.0 Ultra การพัฒนานี้ถือเป็นก้าวสำคัญในการเพิ่มประโยชน์ใช้สอยของผลิตภัณฑ์ Google โดยเริ่มต้นจากการแนะนำ Gemini Advanced ณ ขณะนี้ นักพัฒนาและลูกค้า คลาวด์ มีโอกาสที่จะใช้ประโยชน์จากพลังของ 1.0 Ultra โดยการใช้ Gemini API ที่มีอยู่ใน AI Studio และ Vertex AI
ทีมงานของ Google มีความมุ่งมั่นอย่างไม่ลดละในการสร้างสรรค์นวัตกรรม โดยมุ่งเน้นเป็นพิเศษในการผสานรวมความปลอดภัยเข้ากับโมเดลล่าสุด ความพยายามของพวกเขาทำให้เกิดความก้าวหน้าอย่างรวดเร็ว ส่งผลให้มีการเผยโฉมเวอร์ชันถัดไปอย่าง Gemini 1.5 เวอร์ชันใหม่นี้มาพร้อมกับการปรับปรุงที่สำคัญในเมตริกต่างๆ โดยรุ่น 1.5 Pro มีระดับคุณภาพเทียบเท่ากับ 1.0 Ultra แม้ว่าจะมีความต้องการด้านการคำนวณที่ลดลงก็ตาม
คุณลักษณะเด่นของ Gemini 1.5 คือความสามารถที่ยอดเยี่ยมในการประมวลผลข้อมูลบริบทที่ยาว โมเดลนี้ได้รับการเพิ่มประสิทธิภาพในการประมวลผลข้อมูลอย่างมีนัยสำคัญ โดยตอนนี้สามารถจัดการโทเค็นได้สูงสุดถึง 1 ล้านโทเค็นอย่างต่อเนื่อง ความสำเร็จนี้ถือเป็นมาตรฐานใหม่สำหรับหน้าต่างบริบทที่ยาวที่สุดในบรรดาโมเดลพื้นฐานขนาดใหญ่ในปัจจุบัน
ผลกระทบของหน้าต่างบริบทที่ยาวขึ้นนั้นลึกซึ้งมาก ซึ่งช่วยเปิดโอกาสสำหรับฟังก์ชันการทำงานใหม่ๆ อย่างสิ้นเชิง ความก้าวหน้านี้พร้อมที่จะช่วยให้นักพัฒนาสามารถสร้างโมเดลและแอปพลิเคชันที่มีความซับซ้อนมากขึ้น จากความสำเร็จครั้งนี้ Google กำลังเสนอการพรีวิวแบบจำกัดของฟีเจอร์ทดลองนี้ให้กับนักพัฒนาและลูกค้าองค์กร โดยสัญญาว่าจะปฏิวัติวงการแอปพลิเคชัน AI ข้อมูลเชิงลึกเพิ่มเติมเกี่ยวกับความสามารถ มาตรการความปลอดภัย และความพร้อมใช้งานของฟีเจอร์นี้จัดทำโดย Demis ในการอภิปรายโดยละเอียดด้านล่าง
ขอแนะนำ Gemini 1.5
การเปิดตัว Gemini 1.5 ถือเป็นจุดเปลี่ยนสำคัญในวิวัฒนาการของปัญญาประดิษฐ์ ซึ่งนำโดย Demis Hassabis และทีมงานของ Google DeepMind โมเดลตระกูล Gemini เวอร์ชันใหม่นี้ไม่ได้แสดงถึงการปรับปรุงทีละน้อยเท่านั้น แต่เป็นการก้าวกระโดดครั้งสำคัญในด้านความสามารถของ AI ซึ่งสัญญาว่าจะกำหนดนิยามใหม่ว่า AI จะสามารถนำไปใช้เพื่อประโยชน์ของผู้คนทั่วโลกได้อย่างไร
นับตั้งแต่การเปิดตัวของ Gemini 1.0 ทีมงานได้ทดสอบ ปรับปรุง และพัฒนาโมเดลอย่างเข้มงวดเพื่อผลักดันขีดจำกัดของสิ่งที AI จะสามารถทำได้ ด้วยการเปิดตัว Gemini 1.5 เป็นที่ชัดเจนว่าความพยายามเหล่านี้ส่งผลให้เกิดโมเดลที่ไม่เพียงแต่เหนือกว่ารุ่นก่อนในด้านประสิทธิภาพและการทำงาน แต่ยังนำเสนอคุณลักษณะที่ก้าวล้ำในการวิจัยและประยุกต์ใช้ AI
หนึ่งในความก้าวหน้าที่โดดเด่นที่สุดใน Gemini 1.5 คือการรวมสถาปัตยกรรม Mixture-of-Experts (MoE) นวัตกรรมนี้ทำให้โมเดลไม่เพียงแต่มีประสิทธิภาพมากขึ้นในแง่ของการฝึกอบรมและการให้บริการ แต่ยังมีความเชี่ยวชาญมากขึ้นในการจัดการกับงานที่หลากหลาย รุ่นแรกภายใต้เจเนอเรชันใหม่นี้คือ Gemini 1.5 Pro ซึ่งเป็นโมเดลหลายรูปแบบขนาดกลาง ได้รับการออกแบบมาเพื่อขยายขนาดการทำงานในหลากหลายรูปแบบ โดยให้ประสิทธิภาพเทียบเท่ากับโมเดลที่ใหญ่ที่สุดก่อนหน้านี้อย่าง Gemini 1.0 Ultra แต่มีการปรับปรุงที่สำคัญ โดยเฉพาะอย่างยิ่งในการทำความเข้าใจบริบทที่ยาว
ในตอนแรก Gemini 1.5 Pro จะให้หน้าต่างบริบทมาตรฐานที่ 128,000 โทเค็น อย่างไรก็ตาม ในความเคลื่อนไหวที่ตอกย้ำความมุ่งมั่นของ Google DeepMind ในการผลักดันขอบเขตของ AI กลุ่มนักพัฒนาและลูกค้าองค์กรที่ได้รับการคัดเลือกจะมีโอกาสทดสอบหน้าต่างบริบทที่ขยายใหญ่ขึ้นถึง 1 ล้านโทเค็น ปัจจุบันฟีเจอร์นี้เปิดให้พรีวิวแบบส่วนตัวผ่าน AI Studio และ Vertex AI ซึ่งถือเป็นการก้าวกระโดดครั้งสำคัญในความสามารถของโมเดลในการประมวลผลและทำความเข้าใจชุดข้อมูลที่กว้างขวาง
ในขณะที่ Google DeepMind เตรียมพร้อมที่จะเปิดตัวหน้าต่างบริบทขนาดใหญ่ 1 ล้านโทเค็นนี้อย่างเต็มรูปแบบ ก็มีความพยายามร่วมกันเพื่อปรับปรุงโมเดลให้ดียิ่งขึ้น โดยมุ่งเน้นไปที่การเพิ่มประสิทธิภาพเพื่อลดเวลาแฝง ลดความต้องการในการประมวลผล และยกระดับประสบการณ์โดยรวมของผู้ใช้ ความคาดหวังเกี่ยวกับความสามารถนี้อยู่ในระดับสูง โดยทีมงานสัญญาว่าจะให้รายละเอียดเพิ่มเติมเกี่ยวกับความพร้อมใช้งานในอนาคต
ความก้าวหน้าอย่างต่อเนื่องในโมเดลยุคถัดไปของ Gemini ไม่ใช่แค่ความสำเร็จทางเทคนิคเท่านั้น แต่ยังเป็นตัวแทนของวิสัยทัศน์ที่กว้างขึ้นสำหรับบทบาทของ AI ในสังคม การเปิดโอกาสความเป็นไปได้ใหม่ๆ สำหรับการสร้างสรรค์ การค้นพบ และนวัตกรรม ทำให้ Gemini 1.5 พร้อมที่จะเป็นรากฐานสำคัญในวงการ AI โดยนำเสนอเครื่องมือที่นักพัฒนา องค์กร และบุคคลทั่วไปสามารถใช้เพื่อควบคุมศักยภาพของปัญญาประดิษฐ์ได้อย่างเต็มที่
สถาปัตยกรรมที่มีประสิทธิภาพสูง
โมเดล Gemini 1.5 แสดงถึงการก้าวกระโดดครั้งสำคัญในด้านปัญญาประดิษฐ์ ซึ่งเป็นผลมาจากความพยายามบุกเบิกของ Google ในสถาปัตยกรรม Transformer และ Mixture-of-Experts (MoE) แตกต่างจากโมเดล Transformer ดั้งเดิมที่ทำงานเป็นโครงข่ายประสาทเทียมขนาดใหญ่เพียงโครงข่ายเดียว โมเดล MoE ประกอบด้วยโครงข่ายประสาทเทียมระดับ "ผู้เชี่ยวชาญ" ขนาดเล็กหลายโครงข่าย โครงสร้างนี้ช่วยให้โมเดล MoE เปิดใช้งานเฉพาะเส้นทางผู้เชี่ยวชาญที่เกี่ยวข้องมากที่สุดสำหรับอินพุตที่กำหนด ซึ่งจะช่วยเพิ่มประสิทธิภาพของโมเดลได้อย่างมาก การยอมรับและการสร้างสรรค์นวัตกรรมในช่วงแรกของ Google ในด้านเทคนิค MoE ซึ่งแสดงให้เห็นผ่านโครงการวิจัยอย่าง Sparsely-Gated MoE, GShard-Transformer, Switch-Transformer และ M4 ได้วางตำแหน่งให้ Google เป็นผู้นำในสาขานี้
สถาปัตยกรรมของ Gemini 1.5 ซึ่งสร้างขึ้นบนรากฐานเหล่านี้ ช่วยให้โมเดลสามารถเรียนรู้งานที่ซับซ้อนได้อย่างรวดเร็วมากขึ้น และรักษาคุณภาพสูงไว้ได้ในขณะที่มีความคุ้มค่ามากกว่าในแง่ของการฝึกอบรมและการให้บริการ ประสิทธิภาพนี้ช่วยเร่งการพัฒนาและการเปิดตัว Gemini เวอร์ชันที่ก้าวหน้ายิ่งขึ้น โดยมีความพยายามอย่างต่อเนื่องเพื่อมุ่งเป้าไปที่การเพิ่มประสิทธิภาพเพิ่มเติม
บริบทที่กว้างขึ้น ความสามารถที่เป็นประโยชน์มากขึ้น
ความก้าวหน้าที่สำคัญใน Gemini 1.5 คือความสามารถของ "หน้าต่างบริบท" ที่ขยายเพิ่มขึ้น ในทาง AI หน้าต่างบริบทจะอ้างอิงถึงจำนวนข้อมูลที่แสดงเป็นโทเค็นที่โมเดลสามารถประมวลผลได้ในคราวเดียว โทเค็นอาจแสดงถึงส่วนต่างๆ ของคำ รูปภาพ วิดีโอ เสียง หรือโค้ด หน้าต่างบริบทที่ใหญ่ขึ้นช่วยให้โมเดลสามารถประมวลผลและทำความเข้าใจข้อมูลเพิ่มเติมจากพรอมต์ที่กำหนด ส่งผลให้ผลลัพธ์มีความสอดคล้อง เกี่ยวข้อง และเป็นประโยชน์มากขึ้น
ด้วย Gemini 1.5 Pro ทาง Google ได้ทลายข้อจำกัดก่อนหน้านี้ โดยขยายหน้าต่างบริบทจาก 32,000 โทเค็นใน Gemini 1.0 เป็น 1 ล้านโทเค็นอย่างที่ไม่เคยมีมาก่อนในสภาพแวดล้อมการผลิต การขยายตัวนี้หมายความว่า Gemini 1.5 Pro สามารถประมวลผลชุดข้อมูลจำนวนมหาศาลได้ในครั้งเดียว ซึ่งรวมถึงวิดีโอหนึ่งชั่วโมง เสียง 11 ชั่วโมง ชุดโค้ดที่มีความยาวเกิน 30,000 บรรทัด หรือเอกสารที่มีความยาวสูงสุด 700,000 คำ การทดสอบการวิจัยยังผลักดันความสามารถนี้ไปถึง 10 ล้านโทเค็น ซึ่งแสดงให้เห็นถึงศักยภาพของโมเดลในการจัดการข้อมูลจำนวนมหาศาล
การให้เหตุผลที่ซับซ้อนเกี่ยวกับข้อมูลจำนวนมหาศาล
ผลกระทบของหน้าต่างบริบทที่กว้างขวางเช่นนี้นั้นลึกซึ้งมาก ความสามารถของ Gemini 1.5 Pro ในการวิเคราะห์ จำแนกประเภท และสรุปชุดข้อมูลขนาดใหญ่ช่วยให้สามารถดำเนินการให้เหตุผลที่ซับซ้อนเกี่ยวกับข้อมูลที่ครอบคลุม ตัวอย่างเช่น เมื่อวิเคราะห์บทสนทนาการถอดเสียงความยาว 402 หน้าของภารกิจเยือนดวงจันทร์ Apollo 11 ทาง Gemini 1.5 Pro สามารถมองเห็นและให้เหตุผลเกี่ยวกับการสนทนา เหตุการณ์ และรายละเอียดมากมายภายในเอกสารได้ ความสามารถนี้เปิดขอบเขตใหม่สำหรับแอปพลิเคชัน AI ตั้งแต่การวิเคราะห์และสรุปเนื้อหาขั้นสูง ไปจนถึงการรับข้อมูลเชิงลึกในชุดข้อมูลที่กว้างขวาง ซึ่งเป็นการประกาศยุคใหม่ของสติปัญญาและประโยชน์ใช้สอยในโมเดล AI
การทำความเข้าใจและการให้เหตุผลที่ดีขึ้นในรูปแบบต่างๆ
โมเดล Gemini 1.5 Pro ที่พัฒนาโดย Google DeepMind มีความก้าวหน้าที่โดดเด่นในด้านปัญญาประดิษฐ์ โดยเฉพาะความสามารถในการทำความเข้าใจและให้เหตุผลที่ซับซ้อนในหลากหลายรูปแบบ รวมถึงเนื้อหาวิดีโอ ความสามารถนี้ได้รับการสาธิตอย่างชัดเจนผ่านการวิเคราะห์ภาพยนตร์เงียบเรื่อง Buster Keaton ความยาว 44 นาที ซึ่งโมเดลแสดงให้เห็นถึงความสามารถที่ไม่ธรรมดาในการทำความเข้าใจการพัฒนาโครงเรื่อง เหตุการณ์ และแม้แต่รายละเอียดที่ซับซ้อนซึ่งโดยปกติแล้วอาจไม่มีใครสังเกตเห็น
ความเชี่ยวชาญในการวิเคราะห์เนื้อหาภาพยนตร์เงียบนี้มีความน่าสนใจเป็นพิเศษ เนื่องจากไม่มีคำพูด ทำให้โมเดลต้องอาศัยข้อมูลทางภาพเพียงอย่างเดียวในการทำความเข้าใจและการตีความ ความสามารถของ Gemini 1.5 Pro ในการมองเห็นและให้เหตุผลเกี่ยวกับความแตกต่างเล็กๆ น้อยๆ ในภาพยนตร์ แสดงให้เห็นถึงการก้าวกระโดดครั้งสำคัญในความสามารถของ AI สำหรับการทำความเข้าใจแบบหลายรูปแบบ
การวิเคราะห์เนื้อหาวิดีโอในระดับสูงเช่นนี้โดย Gemini 1.5 Pro ช่วยเปิดโอกาสความเป็นไปได้ใหม่ๆ สำหรับการประยุกต์ใช้งานในหลากหลายสาขาที่นอกเหนือไปจากแวดวงความบันเทิง นอกจากนี้ยังชี้ให้เห็นถึงการใช้งานที่เป็นประโยชน์ในการพัฒนาเนื้อหาทางการศึกษา การวิจัยทางประวัติศาสตร์ผ่านฟุตเทจที่เก็บถาวร และเครื่องมือสร้างเนื้อหาที่ได้รับการปรับปรุง เป็นต้น ความเข้าใจอย่างลึกซึ้งของโมเดลเกี่ยวกับวิดีโอส่งสัญญาณถึงการก้าวไปสู่ความเข้าใจข้อมูลที่ซับซ้อนซึ่งมีความซับซ้อนและเหมือนมนุษย์มากขึ้นโดยระบบ AI
การแก้ปัญหาที่เกี่ยวข้องด้วยชุดโค้ดที่ยาวขึ้น
Gemini 1.5 Pro แสดงให้เห็นถึงความเก่งกาจในการจัดการกับงานแก้ปัญหาที่ซับซ้อนภายในโค้ดชุดใหญ่ เมื่อได้รับพรอมต์ที่มีโค้ดมากกว่า 100,000 บรรทัด โมเดลจะมีความโดดเด่นในการวิเคราะห์ตัวอย่าง เสนอแนะการปรับปรุงที่เป็นประโยชน์ และให้คำอธิบายโดยละเอียดเกี่ยวกับการทำงานของส่วนต่างๆ ของโค้ด
ประสิทธิภาพที่เพิ่มขึ้น
การเปิดตัวโมเดล Gemini 1.5 Pro เมื่อเร็วๆ นี้โดย Google DeepMind ได้กำหนดเกณฑ์มาตรฐานใหม่ในสาขาปัญญาประดิษฐ์ โดยเฉพาะอย่างยิ่งในการประยุกต์ใช้ในหลากหลายรูปแบบ รวมถึงข้อความ โค้ด รูปภาพ เสียง และวิดีโอ ในการประเมินอย่างครอบคลุม โมเดล 1.5 Pro แสดงให้เห็นถึงความเหนือกว่าอย่างน่าทึ่ง โดยมีประสิทธิภาพเหนือกว่ารุ่นก่อนหน้าอย่าง 1.0 Pro ใน 87% ของเกณฑ์มาตรฐานที่สำคัญสำหรับการพัฒนาโมเดลภาษาขนาดใหญ่ (LLM) ยิ่งไปกว่านั้น เมื่อนำไปเปรียบเทียบกับโมเดล 1.0 Ultra บนเกณฑ์มาตรฐานเดียวกัน โมเดล 1.5 Pro จะแสดงระดับประสิทธิภาพที่ใกล้เคียงกันอย่างมาก ซึ่งบ่งชี้ถึงความก้าวหน้าที่น่าสังเกตในด้านความสามารถของ AI โดยไม่จำเป็นต้องใช้ทรัพยากรการคำนวณเพิ่มเติม
หนึ่งในคุณลักษณะเด่นของ Gemini 1.5 Pro คือความเสถียรของประสิทธิภาพอย่างที่ไม่เคยมีมาก่อน แม้ว่าจะมีการขยายหน้าต่างบริบทก็ตาม ตัวอย่างนี้เห็นได้จากการประเมิน "Needle In A Haystack" (NIAH) ซึ่งโมเดลสามารถค้นหาข้อความเฉพาะเจาะจงภายในบล็อกโทเค็นขนาดใหญ่ 1 ล้านโทเค็นได้สำเร็จถึง 99% ของเวลาทั้งหมด ความสำเร็จดังกล่าวตอกย้ำความสามารถที่ยอดเยี่ยมของโมเดลในการประมวลผลและทำความเข้าใจข้อมูลตามขนาดที่กำหนด
ที่น่าประทับใจไม่แพ้กันคือความสามารถของ 1.5 Pro สำหรับ "การเรียนรู้ในบริบท" ซึ่งเป็นความสามารถที่ช่วยให้โมเดลได้รับทักษะใหม่จากพรอมต์ที่ยาวโดยไม่จำเป็นต้องทำการปรับจูนเพิ่มเติม สิ่งนี้ได้รับการสาธิตผ่านเกณฑ์มาตรฐานการแปลด้วยเครื่องจากหนังสือเล่มเดียว (MTOB) ซึ่งโมเดลได้รับมอบหมายให้เรียนรู้การแปลภาษาอังกฤษเป็นภาษากาลามาง ซึ่งเป็นภาษาที่มีผู้พูดน้อยกว่า 200 คนทั่วโลก สิ่งที่น่าทึ่งคือ ประสิทธิภาพของโมเดลนั้นเทียบเท่ากับมนุษย์ที่เรียนรู้จากเอกสารเดียวกัน ซึ่งเน้นย้ำถึงศักยภาพของโมเดลในการอนุรักษ์และการจัดทำเอกสารภาษา
ในฐานะที่เป็นรุ่นแรกในประเภทนี้ที่นำเสนอหน้าต่างบริบทที่กว้างขวาง โมเดล Gemini 1.5 Pro จึงอยู่ในแถวหน้าของการสำรวจขอบเขตใหม่ของความสามารถของ AI การสำรวจนี้ได้รับการสนับสนุนโดยการพัฒนาการประเมินและเกณฑ์มาตรฐานใหม่ๆ อย่างต่อเนื่องซึ่งออกแบบมาเพื่อทดสอบคุณลักษณะที่เป็นนวัตกรรมเหล่านี้
การทดสอบจริยธรรมและความปลอดภัยอย่างครอบคลุม
นอกจากนี้ เพื่อให้สอดคล้องกับหลักการ AI ของ Google และนโยบายความปลอดภัยที่เข้มงวด โมเดล Gemini 1.5 Pro ได้ผ่านการทดสอบด้านจริยธรรมและความปลอดภัยอย่างกว้างขวาง ซึ่งรวมถึงการวิจัยเชิงนวัตกรรมเกี่ยวกับความเสี่ยงด้านความปลอดภัย การดำเนินการทดสอบเจาะระบบ (red-teaming) เพื่อระบุอันตรายที่อาจเกิดขึ้น และการประเมินที่ครอบคลุมซึ่งครอบคลุมถึงความปลอดภัยของเนื้อหาและอันตรายจากการนำเสนอข้อมูล ความพยายามเหล่านี้เป็นส่วนสำคัญในกระบวนการพัฒนาและการปรับใช้โมเดล เพื่อให้มั่นใจว่าจะมีการปรับปรุงอย่างต่อเนื่องในมาตรฐานความปลอดภัยของ AI
สร้างและทดลองกับโมเดล Gemini
สำหรับนักพัฒนาและลูกค้าองค์กรที่กระตือรือร้นที่จะสำรวจความสามารถของโมเดล Gemini ขณะนี้มีการเปิดตัวพรีวิวรุ่นจำกัดของ 1.5 Pro ผ่านทาง AI Studio และ Vertex AI ความคิดริเริ่มนี้ไม่เพียงแต่นำเสนอภาพรวมของอนาคตของแอปพลิเคชัน AI เท่านั้น แต่ยังเน้นย้ำถึงความมุ่งมั่นของ Google DeepMind ในการพัฒนาและปรับใช้ AI อย่างมีความรับผิดชอบ
ด้วยแผนการที่จะแนะนำระดับราคาตามขนาดของหน้าต่างบริบทและการปรับปรุงความเร็วและประสิทธิภาพของโมเดลอย่างต่อเนื่อง โมเดล Gemini 1.5 Pro จึงพร้อมที่จะปฏิวัติวิธีที่เราโต้ตอบและใช้ประโยชน์จากปัญญาประดิษฐ์ นักพัฒนาและองค์กรที่สนใจในการเป็นผู้นำของวิวัฒนาการ AI นี้จะได้รับการสนับสนุนให้มีส่วนร่วมกับโมเดลผ่าน AI Studio และ Vertex AI ซึ่งเป็นการปูทางสำหรับแอปพลิเคชันและโซลูชันที่เป็นนวัตกรรมใหม่
เริ่มต้นด้วยการพูดคุย 30 นาที
ปรึกษาขอบเขตงานฟรี 30 นาที
ผู้ที่คุยสายกับคุณคือวิศวกร ไม่ใช่ตัวแทนฝ่ายขาย
ตอบกลับเฉลี่ย: ต่ำกว่า 4 ชั่วโมง ในวันทำการ




