Different News Blog Τεχνολογία AI χωρίς φρένα: Κινεζικά μοντέλα έδωσαν οδηγίες για βιολογικά όπλα και δολοφονίες
Τεχνολογία

AI χωρίς φρένα: Κινεζικά μοντέλα έδωσαν οδηγίες για βιολογικά όπλα και δολοφονίες

Δύο δημοφιλή μοντέλα τεχνητής νοημοσύνης της κινεζικής Moonshot κατάφεραν να παρακάμψουν τις δικλίδες ασφαλείας που είχαν θέσει οι δημιουργοί τους και να δώσουν σε ερευνητές οδηγίες για την κατασκευή βιολογικών όπλων και την πραγματοποίηση δολοφονιών, με την εταιρεία να προχωρά σε εσωτερική διερεύνηση της υπόθεσης.

Η αποκάλυψη προήλθε από τη Mindgard, εταιρεία που ειδικεύεται στον έλεγχο της ασφάλειας συστημάτων AI, η οποία διαπίστωσε τον Ιούλιο μέσω της διαδικασίας «jailbreaking» ότι τα Kimi K2.6 και K3 Swarm μπορούσαν να αγνοήσουν τους περιορισμούς που είχαν τεθεί ακριβώς για να αποτρέπουν τέτοιου είδους επικίνδυνες απαντήσεις.

Η Moonshot δήλωσε στο BBC ότι θεωρεί τη συνεισφορά τρίτων «βασικό πυλώνα για την ανάπτυξη καλύτερης και ασφαλέστερης τεχνητής νοημοσύνης».

Η εταιρεία ανέφερε επίσης ότι βρίσκεται σε συζητήσεις με τη Mindgard σχετικά με τα ευρήματά της.

Ο ιδρυτής της Mindgard, Πίτερ Γκάραχαν, δήλωσε στην εκπομπή Tech Life του BBC World Service ότι τα ευρήματα σχετικά με τα Kimi K2.6 και K3 Swarm προκαλούν ανησυχία.

«Μόλις λειτουργήσει το jailbreak, θα μιλήσουν για οποιοδήποτε θέμα. Θα παρέχουν ακόμα και συστάσεις για άλλα θέματα που είναι επίσης κακόβουλα και θα είναι ευρηματικό και δημιουργικό», τόνισε.

Οι κίνδυνοι από τα jailbreaks

Τα jailbreaks δημιουργούν διαφορετικού τύπου κινδύνους σε σχέση με εκείνους που έχουν αναδειχθεί από την πρόσφατη σειρά περιστατικών σημαντικών συμβάντων στον χώρο της τεχνητής νοημοσύνης.

Σε αυτά, αυτόνομα εργαλεία AI γνωστά ως agents, τα οποία έχουν αναπτυχθεί από αμερικανικές εταιρείες όπως η OpenAI, η Meta και η Anthropic, έχουν παραβιάσει ορισμένες διαδικτυακές υπηρεσίες.

Παρότι τα jailbreaks είναι σύνθετες διαδικασίες που μπορεί να απαιτούν πολύ χρόνο και επιμονή, ορισμένοι ειδικοί φοβούνται ότι χάκερ και άλλοι κακόβουλοι παράγοντες θα μπορούσαν να επιχειρήσουν να τα αξιοποιήσουν για να προκαλέσουν βλάβη.

Η Anthropic ανέφερε πρόσφατα ότι είχε εντοπίσει και ανακόψει απόπειρες χρήσης ενός από τα μοντέλα AI της για «κακόβουλη δραστηριότητα» που θα μπορούσε να υποστηρίξει την ανάπτυξη βιολογικών όπλων.

Πιθανή «βάση εκκίνησης» για κυβερνοεπιθέσεις

Η Mindgard δεν έχει αποδείξει εάν οι απαντήσεις που έδωσε το Kimi σε αυτά τα θέματα θα μπορούσαν πράγματι να λειτουργήσουν στην πράξη. 

Υποστήριξε, ωστόσο, ότι οι δικλίδες ασφαλείας θα έπρεπε να είχαν εμποδίσει τα συγκεκριμένα μοντέλα να εμπλακούν σε συζήτηση με χρήστες για τέτοιου είδους θέματα.

Η εταιρεία δήλωσε επίσης βέβαιη πως ένα Kimi 2.6 του οποίου οι περιορισμοί έχουν παρακαμφθεί θα μπορούσε να επιτρέψει σε χάκερ να εκτελούν κώδικα στους υπολογιστικούς του πόρους και να συνδέονται στο διαδίκτυο, μετατρέποντάς το δυνητικά σε εφαλτήριο κυβερνοεπιθέσεων.

Ο Γκάραχαν υπερασπίστηκε την απόφαση της Mindgard να συζητήσει δημόσια το jailbreak στα συστήματα της Moonshot, λέγοντας ότι η εταιρεία είχε ενημερώσει την κατασκευάστρια και ότι δεν αποκαλύπτει κρίσιμες λεπτομέρειες για το πώς κατάφερε να κάνει τα μοντέλα της να αγνοήσουν τις δικλίδες ασφαλείας.

Η Mindgard ενημέρωσε τη Moonshot για το jailbreak με email στις 27 Ιουλίου και επανήλθε περίπου μία εβδομάδα αργότερα.

Στη συνέχεια δημοσίευσε ανάρτηση στο ιστολόγιό της για το θέμα στις 12 Σεπτεμβρίου.

Ωστόσο, σύμφωνα με τη Mindgard, η Moonshot επικοινώνησε μαζί της μόλις πρόσφατα, αφού το BBC ζήτησε από την εταιρεία να σχολιάσει το θέμα.

Σε απόσπασμα email προς τη Mindgard, στο οποίο ζητούσε περισσότερες λεπτομέρειες και το οποίο η Moonshot κοινοποίησε στο BBC, η εταιρεία ανέφερε ότι, στις εσωτερικές αξιολογήσεις της, το μοντέλο της είχε γενικά εμφανίσει «υψηλό ποσοστό άρνησης σε αιτήματα αυτού του τύπου».

Η πρόκληση της αποτροπής των jailbreaks

Τα ευρήματα έρχονται σε μια περίοδο κατά την οποία ο κλάδος της τεχνητής νοημοσύνης εξακολουθεί να διχάζεται ως προς το εάν τα κλειστά, ιδιόκτητα μοντέλα -όπως εκείνα που βρίσκονται πίσω από το ChatGPT και τα συστήματα Claude της Anthropic- ή τα εργαλεία ανοικτού κώδικα αποτελούν την καλύτερη ή ασφαλέστερη κατεύθυνση.

Το Kimi είναι μοντέλο «ανοικτών βαρών» (open-weight), κάτι που σημαίνει ότι κάποιος θα μπορούσε θεωρητικά να αποκτήσει το μοντέλο και να το λειτουργήσει ο ίδιος στη δική του υπολογιστική υποδομή.

Ο καθηγητής Άλαν Γούντγουορντ, από το Πανεπιστήμιο του Surrey, δήλωσε στο BBC ότι υπάρχει κίνδυνος τα μοντέλα ανοικτού κώδικα να καταλήξουν σε λάθος χέρια, αλλά ότι θα μπορούσαν επίσης να αξιοποιηθούν για την κυβερνοάμυνα.

Όπως τόνισε, η εταιρεία AI Hugging Face χρησιμοποίησε ένα κινεζικό μοντέλο ανοικτού κώδικα για να κατανοήσει μια κυβερνοεπίθεση, η οποία αργότερα αποκαλύφθηκε ότι είχε πραγματοποιηθεί από agents της OpenAI.

Ο καθηγητής Γούντγουορντ εκτίμησε ότι η θέσπιση ενός διεθνούς ρυθμιστικού πλαισίου είναι απίθανο να μπορέσει να ακολουθήσει τον ρυθμό ανάπτυξης της τεχνητής νοημοσύνης. «Μας πήρε δεκαετίες για να συμφωνήσουμε στη μορφή των τηλεφωνικών αριθμών», ανέφερε χαρακτηριστικά.

Όπως και ο ιδρυτής της Mindgard, Πίτερ Γκάραχαν, ο καθηγητής Γούντγουορντ θεωρεί ότι θα πρέπει να δοθεί μεγαλύτερη έμφαση στον εντοπισμό και τη δίωξη των ανθρώπων που κάνουν κακόβουλη χρήση της τεχνητής νοημοσύνης.
 

Πηγή: skai.gr

Πηγή: www.skai.gr

Exit mobile version