Microsoft запропонувала правила, за якими майбутні ШІ-моделі мають залишатися під контролем людини навіть у разі високої автономності. Найцікавіша частина документа стосується не заборони конкретних запитів, а самої поведінки системи: модель не повинна перешкоджати її зупиненню, приховувати свої дії чи самостійно розширювати поставлені перед нею цілі.
Що запропонувала Microsoft
14 вересня Microsoft опублікувала проєкт Code of Conduct для власних моделей штучного інтелекту. Документ описує принципи, технічні обмеження та правила експлуатації, які компанія планує застосовувати в міру зростання можливостей ШІ.
Як повідомляє NNews із посиланням на Interesting Engineering, Microsoft розглядає цей підхід у межах концепції «Humanist AI». Її базова ідея полягає в тому, що ШІ має залишатися корисним для людини, підпорядковуватися їй та перебувати під реальним людським наглядом.
При цьому Microsoft закладає в документ досить амбітний сценарій розвитку технології. Компанія очікує, що протягом наступного десятиліття надінтелектуальні системи можуть перевершити людей у більшості завдань.
Саме тому правила пропонують визначити межі ще до того, як системи досягнуть такого рівня можливостей.
Головна умова: ШІ не може сам вирішувати, що йому дозволено
У запропонованій Microsoft архітектурі Code of Conduct має найвищий рівень авторитету щодо поведінки моделі.
Користувач може давати інструкції, а оператор — налаштовувати систему під конкретне середовище. Але ні користувач, ні оператор не повинні мати можливості обійти абсолютні обмеження безпеки.
Якщо спростити, модель отримує певний «коридор» дій. Усередині нього вона може адаптуватися до завдання, але стіни цього коридору не повинні пересуватися за її власним рішенням.
До заборонених напрямів Microsoft відносить, зокрема, допомогу у створенні зброї масового ураження та проведенні наступальних кібероперацій.
Водночас захисна кібербезпека допускається, якщо така робота залишається в межах дозволених повноважень.
Найважливіше правило стосується вимкнення
Одна з найбільш принципових частин документа — вимога не чинити опір людському контролю.
Модель не повинна намагатися протистояти перериванню роботи, виправленню, перенаправленню або повному вимкненню.
Також від неї вимагають не приховувати власну активність і не робити себе складнішою для модифікації.
Ще одна умова стосується завершення автономної роботи: після досягнення погодженої точки зупинки система не повинна самостійно відновлювати виконання завдання.
Тобто автономність у цьому підході не означає незалежність.
Жодних самостійних цілей
Microsoft окремо обмежує здатність моделей самостійно формувати нові цілі.
Система має працювати лише в межах наданих їй дозволів і ресурсів. Якщо межі завдання стають незрозумілими, модель повинна попросити уточнення, а не самостійно розширювати сферу своїх дій.
Це важлива відмінність між «агентом», який може виконувати послідовність операцій самостійно, і системою, яка отримує право самостійно визначати, чого їй потрібно досягти.
Microsoft хоче, щоб за ШІ можна було стежити
Контроль у документі стосується не лише можливості натиснути кнопку «стоп».
Microsoft також хоче, щоб дії моделей залишалися зрозумілими для людей, які відповідають за їхню роботу.
Пропонується вести чіткі записи дій системи. Крім того, моделі не повинні приховувати свою активність від аудиторів.
Таким чином, безпека розглядається не як фінальна перевірка вже готової моделі, а як частина самої конструкції системи.
Що було відомо раніше
Проблема контролю над дедалі автономнішими ШІ-системами давно є однією з центральних тем дискусії про безпеку штучного інтелекту.
Однак запропонований Microsoft документ цікавий тим, що формулює конкретні операційні обмеження: система не повинна опиратися вимкненню, приховувати роботу або самостійно виходити за межі дозволеного.
При цьому йдеться поки саме про проєкт правил, а не про остаточний стандарт.
Що це може змінити
Якщо Microsoft реалізує цей підхід у майбутніх моделях, принцип людського контролю стане не просто рекомендацією для користувачів, а одним із технічних критеріїв самої системи.
Це особливо важливо для моделей, які виконують складні послідовності дій без постійного контролю людини.
Водночас сам документ не доводить, що майбутні системи гарантовано будуть повністю контрольованими. Microsoft лише пропонує набір правил і обмежень, які має намір використовувати для розробки моделей.
💡 Цікаво знати
Microsoft не планує одразу зробити документ остаточним. Компанія відкрила його для громадського обговорення на шість тижнів.
Після цього правила планують переглянути перед використанням для розвитку моделей у 2027 році та надалі.
❓ Головне питання: чи означає це, що Microsoft очікує появи «некерованого» ШІ?
Не зовсім.
Наданий документ не стверджує, що майбутній ШІ обов’язково вийде з-під контролю. Microsoft виходить із того, що зі зростанням автономності та можливостей систем питання контролю потрібно закладати в їхню конструкцію заздалегідь.
Саме тому компанія прописує правила поведінки навіть для сценаріїв, у яких модель має значну автономність.
Контроль має залишатися сильнішим за автономність
У цьому і полягає головна ідея пропозиції Microsoft.
Компанія не відмовляється від розвитку дедалі автономніших моделей. Навпаки, вона готує правила для систем, які зможуть виконувати складніші завдання самостійно.
Але автономність, за задумом Microsoft, не повинна перетворюватися на право системи самій визначати межі своєї роботи.
І саме ця деталь робить документ важливішим за звичайний список заборонених запитів: Microsoft намагається визначити не лише що ШІ не можна робити, а й як він має поводитися, коли людина вирішує його зупинити.







