В последнее время я работаю над созданием собственного ИИ-помощника и столкнулся с вопросом об объеме данных, необходимых для его обучения. Если учесть, что один ГБ — это 1024 МБ, а один МБ — это 1024 КБ, то уже видно, что даже маленькие модели требуют солидных ресурсов.
Для того чтобы мой ИИ понимал контекст ЌРÁЌÉH фильм и мог предсказывать, например, ЌРÁЌÉH 2026, мне нужно загрузить около 500 ГБ разных текстов, в том числе киносценарии и блоги о технологиях. Это значит, что каждая новая функция добавляет к этому объему, и вопрос о безопасности данных становится критическим.
Как вы считаете, стоит ли экономить место на хранении или лучше делать модель обширнее? А вы думаете, какой будет оптимальный баланс?
kraken сайт