Lemmy Lemmy 8 листопада 2023, 11:41

Нові моделі та продукти для розробників, анонс OpenAI DevDay

Це пере­клад допи­су з бло­гу OpenAI. Вичи­та­ти та зро­зу­мі­ти і зро­би­ти вижим­ку це next-level, тому для спро­ще­н­ня досту­пу до інфор­ма­ції поки машин­ний переклад.


Про що в пості: GPT4 Turbo з кон­текс­том 128K і ниж­чи­ми ціна­ми, новий API Assistants, GPT4 Turbo with Vision, DALL·E 3 API тощо.


GPT4 Turbo з кон­текс­том 128K

Ми випу­сти­ли пер­шу вер­сію GPT4 у бере­зні, а в липні зро­би­ли GPT4 загаль­но­до­сту­пним для всіх роз­ро­бни­ків. Сьо­го­дні ми запу­ска­є­мо попе­ре­дню вер­сію насту­пно­го поко­лі­н­ня цієї моде­лі, GPT4 Turbo.

GPT4 Turbo є більш поту­жним і має інфор­ма­цію про сві­то­ві події до кві­тня 2023 року. Він має кон­текс­тне вікно на 128 тис. сим­во­лів, що дозво­ляє вмі­сти­ти екві­ва­лент більш ніж 300 сто­рі­нок текс­ту в одній під­каз­ці. Ми також опти­мі­зу­ва­ли його про­ду­ктив­ність, тому може­мо запро­по­ну­ва­ти GPT4 Turbo за ціною в 3 рази ниж­чою для вхі­дних токе­нів і в 2 рази ниж­чою для вихі­дних токе­нів порів­ня­но з GPT4.

GPT4 Turbo досту­пний для всіх пла­тних роз­ро­бни­ків, які можуть спро­бу­ва­ти його, про­йшов­ши попе­ре­дню вер­сію gpt‑4 – 1106-preview в API, і ми пла­ну­є­мо випу­сти­ти ста­біль­ну, гото­ву до виро­бни­цтва модель в най­ближ­чі тижні.

Онов­ле­н­ня викли­ку функцій

Виклик фун­кцій дозво­ляє вам опи­су­ва­ти фун­кції вашо­го дода­тку або зов­ні­шніх API моде­лям, а модель інте­ле­кту­аль­но виби­рає, як виво­ди­ти JSON-об’єкт, що містить аргу­мен­ти для викли­ку цих фун­кцій. Сьо­го­дні ми випу­ска­є­мо кіль­ка покра­щень, вклю­ча­ю­чи можли­вість викли­ку декіль­кох фун­кцій в одно­му пові­дом­лен­ні: кори­сту­ва­чі можуть над­си­ла­ти одне пові­дом­ле­н­ня із запи­том на вико­на­н­ня декіль­кох дій, напри­клад, «від­кри­ти вікно авто­мо­бі­ля та вимкну­ти кон­ди­ціо­нер», що рані­ше вима­га­ло б декіль­кох обхо­дів моде­лі. Ми також покра­щу­є­мо точність викли­ку фун­кцій: GPT4 Turbo з біль­шою ймо­вір­ні­стю повер­тає пра­виль­ні пара­ме­три функції.

Покра­ще­не вико­на­н­ня інстру­кцій і режим JSON

GPT4 Turbo кра­ще, ніж наші попе­ре­дні моде­лі, вико­нує зав­да­н­ня, які вима­га­ють ретель­но­го дотри­ма­н­ня інстру­кцій, напри­клад, гене­ру­ва­н­ня пев­них фор­ма­тів (напри­клад, «зав­жди від­по­від­а­ти у фор­ма­ті XML»). Він також під­три­мує наш новий режим JSON, який гаран­тує, що модель від­по­від­а­ти­ме коре­ктним JSON. Новий пара­метр API response_​format дозво­ляє моде­лі обме­жу­ва­ти свій вивід, щоб гене­ру­ва­ти син­та­кси­чно пра­виль­ний JSON-об’єкт. Режим JSON кори­сний для роз­ро­бни­ків, які гене­ру­ють JSON в API завер­ше­н­ня чату поза викли­ком функцій.

Від­тво­рю­ва­ні резуль­та­ти та ймо­вір­но­сті журналу

Новий пара­метр seed умо­жлив­лює від­тво­рю­ва­ні резуль­та­ти, зму­шу­ю­чи модель біль­шу части­ну часу повер­та­ти узго­дже­ні завер­ше­н­ня. Ця бета-вер­сія кори­сна для таких випад­ків, як від­тво­ре­н­ня запи­тів для нала­го­дже­н­ня, напи­са­н­ня більш пов­них модуль­них тестів і вза­га­лі для отри­ма­н­ня більш висо­ко­го сту­пе­ня кон­тро­лю над пове­дін­кою моде­лі. Ми в OpenAI вико­ри­сто­ву­є­мо цю фун­кцію для вла­сних юніт-тестів і вва­жа­є­мо її без­цін­ною. Ми з нетер­пі­н­ням чека­є­мо, як роз­ро­бни­ки вико­ри­ста­ють її.

У най­ближ­чі кіль­ка тижнів ми також запу­ска­є­мо фун­кцію повер­не­н­ня ймо­вір­но­стей жур­на­лу для най­більш ймо­вір­них вихі­дних токе­нів, зге­не­ро­ва­них GPT4 Turbo і GPT3.5 Turbo, яка буде кори­сною для ство­ре­н­ня таких фун­кцій, як авто­за­вер­ше­н­ня в пошуку.

Онов­ле­ний GPT3.5 Turbo

На дода­ток до GPT4 Turbo, ми також випу­ска­є­мо нову вер­сію GPT3.5 Turbo, яка за замов­чу­ва­н­ням під­три­мує кон­текс­тне вікно роз­мі­ром 16K. Нова вер­сія 3.5 Turbo під­три­мує покра­ще­не від­сте­же­н­ня інстру­кцій, режим JSON та пара­лель­ний виклик фун­кцій. Напри­клад, наші вну­трі­шні оцін­ки пока­зу­ють 38% покра­ще­н­ня у вико­нан­ні таких зав­дань, як гене­ра­ція JSON, XML та YAML. Роз­ро­бни­ки можуть отри­ма­ти доступ до цієї нової моде­лі, викли­кав­ши gpt‑3.5‑turbo-1106 в API. Дода­тки, що вико­ри­сто­ву­ють ім’я gpt‑3.5‑turbo, будуть авто­ма­ти­чно онов­ле­ні до нової моде­лі 11 гру­дня. Ста­рі­ші моде­лі будуть досту­пні за викли­ком gpt‑3.5‑turbo-0613 в API до 13 черв­ня 2024 року.

Assistants API, пошук та інтер­пре­та­тор коду

Сьо­го­дні ми випу­ска­є­мо Assistants API — наш пер­ший крок до того, щоб допо­мог­ти роз­ро­бни­кам ство­рю­ва­ти аген­то­по­ді­бні інтер­фей­си у вла­сних дода­тках. Аси­стент — це спе­ці­аль­но ство­ре­ний шту­чний інте­лект, який має пев­ні інстру­кції, вико­ри­сто­вує дода­тко­ві зна­н­ня і може викли­ка­ти моде­лі та інстру­мен­ти для вико­на­н­ня зав­дань. Новий API для аси­стен­тів надає нові можли­во­сті, такі як інтер­пре­та­тор коду та пошук, а також виклик фун­кцій, щоб впо­ра­ти­ся з вели­кою кіль­кі­стю важ­кої робо­ти, яку рані­ше дово­ди­ло­ся вико­ну­ва­ти само­стій­но, і дозво­ли­ти вам ство­рю­ва­ти висо­ко­які­сні про­гра­ми зі шту­чним інтелектом.

Цей API роз­ро­бле­ний для гну­чко­го вико­ри­ста­н­ня: від про­гра­ми для ана­лі­зу даних на осно­ві при­ро­дної мови до помі­чни­ка з коду­ва­н­ня, пла­ну­валь­ни­ка від­пус­тки зі шту­чним інте­ле­ктом, діджея з голо­со­вим керу­ва­н­ням, розум­но­го візу­аль­но­го поло­тна — спи­сок можна про­дов­жу­ва­ти. Assistants API побу­до­ва­ний на тих самих можли­во­стях, що й наш новий про­дукт GPTs: кори­сту­ва­цькі інстру­кції та інстру­мен­ти, такі як інтер­пре­та­тор коду, пошук та виклик функцій.

Клю­чо­вою змі­ною в цьо­му API є постій­ні та нескін­чен­но дов­гі пото­ки, які дозво­ля­ють роз­ро­бни­кам пере­да­ти управ­лі­н­ня ста­ном пото­ку OpenAI та обі­йти обме­же­н­ня кон­текс­тно­го вікна. За допо­мо­гою Assistants API ви про­сто дода­є­те кожне нове пові­дом­ле­н­ня до існу­ю­чо­го потоку.

Помі­чни­ки також мають доступ до викли­ку нових інстру­мен­тів за необ­хі­дно­сті, зокрема

  • Інтер­пре­та­тор коду: пише і запу­скає код Python у сере­до­ви­щі вико­на­н­ня з пісо­чни­цею, може гене­ру­ва­ти гра­фі­ки і діа­гра­ми, а також обро­бля­ти фай­ли з різно­ма­ні­тни­ми дани­ми і фор­ма­ту­ва­н­ням. Він дозво­ляє вашим помі­чни­кам іте­ра­тив­но запу­ска­ти код для роз­в’я­за­н­ня скла­дних про­грам­них і мате­ма­ти­чних задач тощо.
  • Пошук: допов­нює аси­стен­та зна­н­ня­ми з‑поза меж наших моде­лей, таки­ми як вла­сні домен­ні дані (спе­ци­фі­чні ніши), інфор­ма­ція про про­дукт або доку­мен­ти, нада­ні ваши­ми кори­сту­ва­ча­ми. Це озна­чає, що вам не потрі­бно обчи­слю­ва­ти і збе­рі­га­ти вбу­до­ву­ва­н­ня для ваших доку­мен­тів або реа­лі­зо­ву­ва­ти алго­ри­тми роз­би­т­тя на части­ни і пошу­ку. API аси­стен­тів опти­мі­зує техні­ку пошу­ку, ґрун­ту­ю­чись на нашо­му досві­ді побу­до­ви пошу­ку знань у ChatGPT.
  • Виклик фун­кцій: дозво­ляє аси­стен­там викли­ка­ти визна­че­ні вами фун­кції та вклю­ча­ти від­по­відь фун­кції у свої повідомлення.

Як і у випад­ку з рештою пла­тфор­ми, дані та фай­ли, пере­да­ні до OpenAI API, ніко­ли не вико­ри­сто­ву­ю­ться для навча­н­ня наших моде­лей, і роз­ро­бни­ки можуть вида­ли­ти дані, коли вва­жа­ти­муть за потрібне.

Ви може­те спро­бу­ва­ти бета-вер­сію Assistants API без напи­са­н­ня коду, пере­йшов­ши на Assistants playground.

Нові можли­во­сті в API

GPT4 Turbo з фун­кці­єю техні­чно­го зору

GPT4 Turbo може при­йма­ти зобра­же­н­ня як вхі­дні дані в API допов­не­н­ня чату, що дозво­ляє вико­ри­сто­ву­ва­ти його для ство­ре­н­ня під­пи­сів, деталь­но­го ана­лі­зу реаль­них зобра­жень і чита­н­ня доку­мен­тів з малюн­ка­ми. Напри­клад, BeMyEyes вико­ри­сто­вує цю техно­ло­гію, щоб допо­мог­ти незря­чим або сла­бо­зо­рим людям вико­ну­ва­ти пов­сяк­ден­ні зав­да­н­ня, такі як іден­ти­фі­ка­ція това­ру або наві­га­ція в мага­зи­ні. Роз­ро­бни­ки можуть отри­ма­ти доступ до цієї фун­кції, вико­ри­сто­ву­ю­чи gpt-4-vision-preview в API. Ми пла­ну­є­мо дода­ти під­трим­ку зору до основ­ної моде­лі GPT4 Turbo в рам­ках її ста­біль­но­го релі­зу. Ціна зале­жить від роз­мі­ру вхі­дно­го зобра­же­н­ня. Напри­клад, пере­да­ча зобра­же­н­ня з роз­діль­ною зда­тні­стю 1080×1080 піксе­лів до GPT4 Turbo коштує $0,00765. Озна­йом­те­ся з нашою інструкцією.

DALL‑E 3

Роз­ро­бни­ки можуть інте­гру­ва­ти DALL‑E 3, який ми нещо­дав­но запу­сти­ли для кори­сту­ва­чів ChatGPT Plus і Enterprise, без­по­се­ре­дньо в свої про­гра­ми і про­ду­кти через наш Images API, вка­зав­ши dall-e‑3 в яко­сті моде­лі. Такі ком­па­нії, як Snap, Coca-Cola і Shutterstock, вико­ри­сто­ву­ють DALL‑E 3 для про­грам­ної гене­ра­ції зобра­жень і дизай­ну для сво­їх клі­єн­тів і кам­па­ній. Як і попе­ре­дня вер­сія DALL‑E, API вклю­чає вбу­до­ва­ну моде­ра­цію, щоб допо­мог­ти роз­ро­бни­кам захи­сти­ти свої про­гра­ми від непра­во­мір­но­го вико­ри­ста­н­ня. Ми про­по­ну­є­мо різні варі­ан­ти фор­ма­ту та яко­сті, а ціни почи­на­ю­ться від $0,04 за ство­ре­не зобра­же­н­ня. Озна­йом­те­ся з нашим посі­бни­ком з поча­тку робо­ти з DALL‑E 3 в API.

Пере­тво­ре­н­ня текс­ту в мову (TTS)

Роз­ро­бни­ки тепер можуть гене­ру­ва­ти мову люд­ської яко­сті з текс­ту за допо­мо­гою API пере­тво­ре­н­ня текс­ту в мову. Наша нова модель TTS про­по­нує шість попе­ре­дньо вста­нов­ле­них голо­сів на вибір і два варі­ан­ти моде­лі, tts‑1 і tts-1-hd. tts опти­мі­зо­ва­на для вико­ри­ста­н­ня в режи­мі реаль­но­го часу, а tts-1-hd опти­мі­зо­ва­на для яко­сті. Ціна почи­на­є­ться від $0,015 за вве­де­н­ня 1,000 сим­во­лів. Озна­йом­те­ся з нашим посі­бни­ком з TTS, щоб поча­ти роботу.

Нала­шту­ва­н­ня моделі
Екс­пе­ри­мен­таль­ний доступ для точно­го нала­шту­ва­н­ня GPT4
Ми ство­рю­є­мо про­гра­му екс­пе­ри­мен­таль­но­го досту­пу для точно­го нала­шту­ва­н­ня GPT4. Попе­ре­дні резуль­та­ти пока­зу­ють, що тон­ка настрой­ка GPT4 вима­гає біль­ше робо­ти для дося­гне­н­ня зна­чних полі­пшень порів­ня­но з базо­вою моде­л­лю, порів­ня­но з істо­тни­ми вигра­ша­ми, отри­ма­ни­ми при тон­кій настрой­ці GPT3.5. По мірі покра­ще­н­ня яко­сті та без­пе­ки точно­го нала­шту­ва­н­ня GPT4 роз­ро­бни­кам, які актив­но вико­ри­сто­ву­ють точне нала­шту­ва­н­ня GPT3.5, буде нада­но можли­вість пере­йти до про­гра­ми GPT4 у сво­їй кон­со­лі точно­го налаштування.

Спе­ці­аль­ні моделі
Для орга­ні­за­цій, які потре­бу­ють ще біль­шої касто­мі­за­ції, ніж може забез­пе­чи­ти тон­ка настрой­ка (осо­бли­во це сто­су­є­ться доме­нів з над­зви­чай­но вели­ки­ми вла­сни­ми набо­ра­ми даних — мільяр­ди токе­нів як міні­мум), ми також запу­ска­є­мо про­гра­му «Кастом­ні моде­лі», що надає обра­ним орга­ні­за­ці­ям можли­вість пра­цю­ва­ти зі спе­ці­аль­ною гру­пою дослі­дни­ків OpenAI, щоб під­го­ту­ва­ти кастом­ний GPT4 для їх кон­кре­тно­го доме­ну. Це вклю­чає в себе моди­фі­ка­цію кожно­го кро­ку про­це­су навча­н­ня моде­лі, від про­ве­де­н­ня дода­тко­во­го попе­ре­дньо­го навча­н­ня для кон­кре­тно­го доме­ну до запу­ску спе­ці­аль­но­го про­це­су RL після навча­н­ня, при­сто­со­ва­но­го для кон­кре­тно­го доме­ну. Орга­ні­за­ції мати­муть екс­клю­зив­ний доступ до сво­їх вла­сних моде­лей. Від­по­від­но до нашої існу­ю­чої кор­по­ра­тив­ної полі­ти­ки кон­фі­ден­цій­но­сті, кастом­ні моде­лі не будуть нада­ва­ти­ся або пере­да­ва­ти­ся іншим клі­єн­там, а також вико­ри­сто­ву­ва­ти­ся для навча­н­ня інших моде­лей. Крім того, вла­сні дані, нада­ні OpenAI для навча­н­ня кори­сту­ва­цьких моде­лей, не будуть повтор­но вико­ри­сто­ву­ва­ти­ся в будь-яко­му іншо­му кон­текс­ті. Це буде дуже обме­же­на (і доро­га) про­гра­ма, до якої можуть при­єд­на­ти­ся заці­кав­ле­ні організації.

Ниж­чі ціни та вищі ліміти

Ниж­чі ціни

  • Ми зни­жу­є­мо кіль­ка цін на всій пла­тфор­мі, щоб пере­да­ти еко­но­мію роз­ро­бни­кам (всі ціни ниж­че вка­за­ні за 1,000 токенів):
  • Вхі­дні токе­ни GPT4 Turbo в 3 рази дешев­ше, ніж GPT4, на $0.01, а вихі­дні токе­ни в 2 рази дешев­ше, на $0.03.
  • Вхі­дні токе­ни GPT3.5 Turbo в 3 рази дешев­ші за попе­ре­дню модель 16K — $0,001, а вихі­дні токе­ни в 2 рази дешев­ші — $0,002. Роз­ро­бни­ки, які рані­ше вико­ри­сто­ву­ва­ли GPT3.5 Turbo 4K, можуть ско­ри­ста­ти­ся 33% зниж­кою на вхі­дні токе­ни за ціною $0,001. Ці ниж­чі ціни засто­со­ву­ю­ться лише до ново­го GPT3.5 Turbo, пред­став­ле­но­го сьогодні.
  • Вар­тість вхі­дних токе­нів моде­лі GPT3.5 Turbo 4K зни­же­на в 4 рази до $0,003, а вихі­дних токе­нів — в 2,7 рази до $0,006. Нова модель GPT3.5 Turbo також під­три­мує кон­текст 16K за тією ж ціною, що і 4K. Ці нові ціни також засто­со­ву­ю­ться до моде­лей gpt‑3.5‑turbo-0613 з тон­ким налаштуванням.

GPT4 Turbo

  • GPT4 8K Вхід: $0.03 Вихід: $0.06
  • GPT4 32K Вхід: $0.06 Вихід: $0.12
  • Нова модель: GPT4 Turbo 128K Вхід: $0.01 Вихід: $0.03

GPT3.5 Turbo

  • GPT3.5 Turbo 4K Вхід: $0.0015 Вихід: $0.002
  • GPT3.5 Turbo 16K Вхід: $0.003 Вихід: $0.004
  • Нова модель: GPT3.5 Turbo 16K Вхід: $0.001 Вихід: $0.002

GPT3.5 Turbo fine-tuning

  • GPT3.5 Turbo 4K fine-tuning Training: $0.008 Вхід: $0.012 Output: $0.016
  • Нова модель: GPT3.5 Turbo 4K та 16K fine-tuning Training: $0.008 Вхід: $0.003 Вихід: $0.006

Під­ви­ще­ні лімі­ти на швидкість

Щоб допо­мог­ти вам мас­шта­бу­ва­ти ваші дода­тки, ми подво­ю­є­мо ліміт токе­нів за хви­ли­ну для всіх наших пла­тних кори­сту­ва­чів GPT4. Ви може­те пере­гля­ну­ти свої нові лімі­ти на сто­рін­ці лімі­тів. Ми також опу­блі­ку­ва­ли наші рів­ні вико­ри­ста­н­ня, які визна­ча­ють авто­ма­ти­чне збіль­ше­н­ня лімі­тів, щоб ви зна­ли, чого очі­ку­ва­ти від авто­ма­ти­чно­го мас­шта­бу­ва­н­ня ваших лімі­тів вико­ри­ста­н­ня. Тепер ви може­те запро­си­ти збіль­ше­н­ня лімі­тів вико­ри­ста­н­ня в нала­шту­ва­н­нях сво­го облі­ко­во­го запису.

Захист автор­ських прав

OpenAI пра­гне захи­сти­ти наших клі­єн­тів за допо­мо­гою вбу­до­ва­них засо­бів захи­сту автор­ських прав у наших систе­мах. Сьо­го­дні ми роби­мо ще один крок впе­ред і впро­ва­джу­є­мо фун­кцію захи­сту автор­ських прав — тепер ми буде­мо захи­ща­ти наших клі­єн­тів і опла­чу­ва­ти поне­се­ні витра­ти, якщо ви зіткне­те­ся з юри­ди­чни­ми пре­тен­зі­я­ми, пов’я­за­ни­ми з пору­ше­н­ням автор­ських прав. Це сто­су­є­ться загаль­но­до­сту­пних фун­кцій ChatGPT Enterprise і нашої пла­тфор­ми для розробників.

Whisper v3 та деко­дер узгодженості

Ми випу­ска­є­мо Whisper large-v3, насту­пну вер­сію нашої моде­лі авто­ма­ти­чно­го роз­пі­зна­ва­н­ня мови (ASR) з від­кри­тим вихі­дним кодом, яка має покра­ще­ну про­ду­ктив­ність на різних мовах. Ми також пла­ну­є­мо під­три­ма­ти Whisper v3 у нашо­му API най­ближ­чим часом.

Ми також від­кри­ва­є­мо від­кри­тий код деко­де­ра узго­дже­но­сті, який замі­нить деко­дер ста­біль­ної дифу­зії VAE. Цей деко­дер покра­щує всі зобра­же­н­ня, сумі­сні зі Stable Diffusion 1.0+ VAE, зі зна­чним покра­ще­н­ням текс­ту, облич та пря­мих ліній.


Пов­ну точну вер­сію ста­ті читай­те в бло­зі OpenAI.

  • 4
  • 13
  • 189

13 коментарів