หลายคนอาจจะเคยสังเกตหรือตั้งข้อสงสัยในใจเวลาใช้งานแชทบอทอัจฉริยะว่า ทำไมคำตอบที่ได้มักจะมีกลิ่นอายหรือข้อมูลที่ดูเหมือนหลุดออกมาจากกระทู้สนทนาในเว็บไซต์ชื่อดังอย่างเรดดิทอยู่บ่อยครั้ง ซึ่งความจริงแล้วข้อสงสัยนี้ไม่ได้เป็นเพียงแค่จินตนาการไปเอง เพราะกระบวนการเรียนรู้ของปัญญาประดิษฐ์ในปัจจุบันนั้นพึ่งพาชุดข้อมูลขนาดมหาศาลจากอินเทอร์เน็ต เฟซบุ๊ก กับ ไอจี ล่ม และแพลตฟอร์มโซเชียลมีเดียประเภทเว็บบอร์ดถือเป็นแหล่งขุมทรัพย์ข้อมูลที่สำคัญที่สุดแหล่งหนึ่งที่นักพัฒนาเลือกใช้ในการฝึกฝนโมเดลภาษาขนาดใหญ่ให้มีความเป็นธรรมชาติ
เหตุผลหลักที่ปัญญาประดิษฐ์ให้ความสำคัญกับข้อมูลจากเรดดิทเป็นเพราะความเป็นธรรมชาติของภาษาที่ใช้ในนั้น แตกต่างจากสารานุกรมหรือบทความวิชาการที่ถูกเขียนขึ้นอย่างเป็นทางการ ข้อมูลในบอร์ดสนทนาเต็มไปด้วยการโต้ตอบที่เหมือนมนุษย์ มีการใช้สำนวนเปรียบเปรย น้ำมันเบนซิน การแสดงความคิดเห็นเชิงวิพากษ์วิจารณ์ และการแบ่งปันประสบการณ์ส่วนตัวที่หาอ่านไม่ได้จากตำราเรียนทั่วไป สิ่งเหล่านี้ช่วยให้ปัญญาประดิษฐ์เรียนรู้บริบทของการสนทนาที่ซับซ้อน รวมถึงวิธีการตอบโต้กับผู้ใช้งานให้ดูมีความเป็นกันเองและเข้าถึงง่ายมากขึ้นกว่าการตอบแบบหุ่นยนต์ในอดีต
อย่างไรก็ตาม กระเป๋าลายช้าง การใช้ข้อมูลจากแหล่งนี้ก็มีดาบสองคมที่น่าสนใจ ประการแรกคือเรื่องของคุณภาพข้อมูล เนื่องจากเนื้อหาในบอร์ดสนทนาถูกสร้างขึ้นโดยผู้ใช้งานทั่วไป ทำให้ข้อมูลบางส่วนอาจมีความคลาดเคลื่อน วอลเลย์บอลชายทีมชาติไทย ขาดความน่าเชื่อถือ หรือเต็มไปด้วยอคติส่วนบุคคล ซึ่งปัญญาประดิษฐ์มักจะดูดซับข้อมูลเหล่านี้เข้าไปโดยไม่สามารถแยกแยะได้ว่าสิ่งใดคือข้อเท็จจริงหรือสิ่งใดคือความเห็นส่วนตัว ระบบ ทางรัฐ สิ่งนี้จึงกลายเป็นความท้าทายสำคัญของทีมพัฒนาในการคัดกรองเนื้อหาเพื่อไม่ให้โมเดลตอบคำถามแบบผิดๆ หรือนำเสนอข้อมูลที่สร้างความเข้าใจผิดให้แก่ผู้ใช้งาน
นอกจากประเด็นเรื่องคุณภาพแล้ว ยังมีเรื่องของลิขสิทธิ์และจริยธรรมในการนำข้อมูลมาใช้งาน เพราะแม้ว่าเนื้อหาเหล่านั้นจะถูกโพสต์แบบสาธารณะ แต่การที่บริษัทเทคโนโลยีขนาดใหญ่กวาดข้อมูลจากชุมชนเหล่านี้ไปพัฒนาผลิตภัณฑ์เพื่อแสวงหาผลกำไรโดยที่เจ้าของความคิดเห็นไม่ได้รับผลตอบแทนใดๆ จึงเกิดเป็นข้อถกเถียงในระดับสากลว่าเราควรมีขอบเขตในการนำข้อมูลจากโซเชียลมีเดียมาเทรนเอไออย่างไร สเปน VS อาร์เจนตินา ฟุตบอลโลก 20... r/Thailand เพื่อสร้างความสมดุลระหว่างการพัฒนาเทคโนโลยีที่ก้าวหน้ากับการคุ้มครองสิทธิของผู้ใช้งานที่เป็นผู้สร้างสรรค์เนื้อหาต้นฉบับเหล่านั้น
ในอนาคตเราอาจจะได้เห็นการเปลี่ยนแปลงที่น่าสนใจเกี่ยวกับวิธีการที่เอไอเข้าถึงข้อมูลเหล่านี้มากขึ้น เนื่องจากหลายแพลตฟอร์มเริ่มมีการจำกัดการเข้าถึงข้อมูลผ่านระบบเอพีไอและเรียกเก็บค่าธรรมเนียมสูงขึ้น เพื่อป้องกันไม่ให้ข้อมูลถูกดึงไปใช้โดยไม่ได้รับอนุญาต ซึ่งแนวโน้มนี้อาจส่งผลให้ปัญญาประดิษฐ์ในรุ่นถัดไปต้องปรับเปลี่ยนแหล่งข้อมูลใหม่ ซีรีส์จีน Overdo หรือหันไปพึ่งพาข้อมูลที่ผ่านการคัดกรองและรับรองความถูกต้องจากแหล่งข้อมูลที่มีความน่าเชื่อถือสูงมากขึ้น แทนที่จะพึ่งพาการสุ่มอ่านข้อมูลจากกระทู้สนทนาทั่วไปเพียงอย่างเดียว
ท้ายที่สุดแล้วการที่เอไอชอบตอบคำถามโดยอ้างอิงข้อมูลจากแหล่งดังกล่าวถือเป็นเครื่องสะท้อนให้เห็นถึงยุคสมัยที่อินเทอร์เน็ตกลายเป็นห้องสมุดที่ใหญ่ที่สุดในโลก Reddit คือ การเข้าใจว่าเอไอมีที่มาที่ไปของข้อมูลอย่างไร จะช่วยให้ผู้ใช้งานอย่างเราสามารถเลือกเสพข้อมูลได้อย่างชาญฉลาดและไม่หลงเชื่อคำตอบของเอไอแบบร้อยเปอร์เซ็นต์ การตรวจสอบข้อมูลจากแหล่งอ้างอิงหลักควบคู่ไปกับการใช้คำตอบจากปัญญาประดิษฐ์จึงยังคงเป็นทักษะที่จำเป็นอย่างยิ่งในยุคดิจิทัลที่ข้อมูลล้นหลามเช่นนี้ marc cucurella เพื่อให้เราได้ประโยชน์สูงสุดจากเทคโนโลยีโดยไม่ตกเป็นเหยื่อของข้อมูลที่ขาดความแม่นยำ
ไม่มีความคิดเห็น:
แสดงความคิดเห็น