
Компанія Figure AI 17 вересня 2026 року оприлюднила результати польового тесту нової моделі Helix 2.5: гуманоїдний робот Figure 03 виконав 237 із 420 завдань — 56% — у 30 приватних будинках каліфорнійського регіону Bay Area, де жоден із роботів компанії раніше не бував. Попередня версія тієї самої архітектури без нового методу попереднього навчання Index давала 9% в аналогічних умовах.
- Умови тесту: 30 будинків Bay Area, три завдання, 420 спроб
- Index: 16 мільйонів відео і 35 хвилин нових даних щосекунди
- Межі результату: внутрішній протокол, зовнішньої верифікації немає
- Tesla Optimus і 1X NEO: альтернативні архітектурні ставки
- Більше матеріалів
- США і КНР продовжили торгове перемир’я до 10 січня 2027
- Figure 03 виконав 56% завдань у незнайомих будинках
- Ф’ючерсний контракт: маржа, mark-to-market і трлн
- Агент OpenAI проник у Medicare Австралії – ні слова три місяці
- McDonald’s вкладе ,5 млрд у AI-каси і нову курку до 2036 року
- Romero-Talamas зібрав реактор CMFX зі старих МРТ і досяг 10 млн К
Умови тесту: 30 будинків Bay Area, три завдання, 420 спроб
Тест проходив у 30 окремих приватних будинках, жоден із яких команда не відвідувала під час навчання. Figure 03 отримував одне завдання на вибір: застелити ліжко, скласти рушник або прибрати іграшки у вітальні. Правила оцінки виключали суб’єктивність: обидві подушки мають бути у верхній третині ліжка, всі чотири кутки рушника — у радіусі 2,54 см одне від одного, час на одну іграшку — 60 секунд без часткових балів. Будь-яке втручання людини з міркувань безпеки автоматично кваліфікувалося як невдача.
Успішність різнилась за завданнями: застелити ліжко — 94 зі 140 спроб (67%), прибрати іграшки — близько 40%, складання рушника — між цими значеннями. Figure опублікувала приблизно 4 години відеодокументації невдалих спроб, втім TechTimes 19 вересня зазначила: «сира відеофутаж не замінює незалежного відтворення 30-будинкового тесту».
Index: 16 мільйонів відео і 35 хвилин нових даних щосекунди
Figure запустила датасет Index у публічний доступ 25 серпня 2026 року після чотирьох місяців закритої розробки. На момент оголошення Helix 2.5 платформа нараховувала 264 тисячі завантажень застосунку з 108 країн, понад 44 тисячі активних щотижневих учасників і 16 мільйонів відеозаписів. Нові дані надходили зі швидкістю приблизно 35 хвилин відео на секунду — 5,7 роки людської активності на добу. Компанія виплатила учасникам $15 млн винагород.
Кожна тисяча годин Index містить 373 унікальних завдання, 1 146 унікальних об’єктів і 116 різних середовищ. Набір проходить п’ятиетапну обробку: фільтрація, перевірка на шахрайство, дедублікація, перебалансування і анотування. Жодне оціночне завдання не перевищує 1,90% загального обсягу. Helix 2.5 ініціалізований з нуля і навчений виключно на Index: «без великої мовної моделі як основи, без специфічних демонстрацій у цільовому середовищі», йдеться в офіційному релізі. Модель вимагала вдвічі менше специфічних даних про завдання, ніж попередня Helix 02, щоб досягти аналогічної успішності у знайомих середовищах.
У вересні 2026 року Figure оголосила про вкладення $3,5 млрд в обчислювальну інфраструктуру для навчання Helix через стратегічне партнерство з провайдером nscale.
Детальніший аналіз нових підходів до навчання роботів і архітектур AI читайте в нашому розділі технологій NewsGroup.
Межі результату: внутрішній протокол, зовнішньої верифікації немає
Тест залишається внутрішнім: незалежного відтворення 30-будинкового протоколу іншими командами не проводилось. Важливе технічне застереження: Figure виміряла закон масштабування для втрати прогнозування наступної дії, а не для успішності завдань у незнайомих середовищах. «Ми ще не виміряли, як нульовий успіх масштабується з даними Index», — зазначено в офіційному релізі компанії.
При 56% успіху робот не справляється приблизно в кожному другому завданні в незнайомому будинку — що унеможливлює автономне домашнє використання без нагляду. Незалежні дослідники оцінюють, що нові середовища самі по собі спричиняють 20–40% падіння успішності в добре навчених системах. Figure визнала: «щонайменше один конкурент опублікував вищі показники у власних оцінках», але стверджує, що порівняння некоректне через різні протоколи.
Tesla Optimus і 1X NEO: альтернативні архітектурні ставки
Прямих конкурентних тестів у нульовому відтворенні домашніх середовищ не існує. Tesla Optimus Gen 3 активно розгорнутий на промислових об’єктах, проте еквівалентних публічних даних для побутового використання компанія не публікувала. Норвезький стартап 1X Technologies будує NEO на відеосвітовій моделі (video world model) замість behavior cloning — Startup Fortune від 18 вересня описує це як «принципово інший підхід до узагальнення попереднього навчання». Figure 03 тим часом вже обслуговує BMW Spartanburg у Південній Кароліні, де попередня Figure 02 за 11 місяців роботи сприяла випуску понад 30 тисяч автомобілів X3.
CEO Brett Adcock розпочав 2026 рік із публічним прогнозом: гуманоїдні роботи виконуватимуть «завдання без нагляду протягом кількох днів у будинках, де вони ніколи раніше не були, виключно за допомогою нейронних мереж». Helix 2.5 — перше підтвердження цього прогнозу з опублікованими цифрами, хоча до «кількох днів без нагляду» ще далеко: поточна успішність у 56% показує потенціал методу, але не готовність продукту.
56% — це перший публічний результат нульового відтворення, де відрив від базового рівня (9% без Index) настільки великий, що статистична варіація не може бути єдиним поясненням. Саме тому Figure завершила реліз коротко: «It’s time to scale up.»
Figure планує розширити масштаб тестування Index упродовж 2026–2027 років. Незалежне відтворення 30-будинкового протоколу не заплановано — принаймні публічно.
Джерела: TechTimes, “Figure AI Helix 2.5 Enters 30 Homes Cold: Index Pretraining Yields Sixfold Leap” · Startup Fortune, “Figure AI’s Helix 2.5 Robot Made Beds in 30 Homes It Had Never Seen”






