Manticore Search представила функцию автоматического чанкинга для улучшения векторного поиска по длинным документам. Обновление, анонсированное в блоге компании, автоматически разбивает большие тексты на меньшие семантически связные фрагменты перед индексацией. Это решает распространённую проблему в векторном поиске, когда длинные документы превышают контекстное окно моделей эмбеддингов, что ведёт к потере деталей. Беря чанкинг на себя, Manticore упрощает рабочий процесс для разработчиков и повышает точность поиска. Функция доступна в последней версии открытого поискового движка.
Такие обновления вызывают улыбку. Годами все, кто строил векторный поиск, были вынуждены вручную разбивать документы на части. Нудно и чревато ошибками. Ты тратил часы на подбор размера чанков, а результаты поиска всё равно оставались посредственными. Автоматический чанкинг от Manticore снимает это бремя. Это не просто удобство. Это скачок в юзабилити. Теперь можно индексировать целые книги, юридические договоры или научные статьи, не беспокоясь о контекстных окнах. Поисковый движок сам разбирается со сложностью.
Но вот что важнее: это ещё один шаг к тому, чтобы поиск на основе ИИ стал доступен каждому. Не нужна степень по NLP, чтобы получать хорошие результаты. Просто загружаешь данные и позволяешь движку сделать всё остальное. Именно такое будущее меня вдохновляет. Будущее, где инструменты уходят на второй план, а фокус смещается на то, что ты можешь создать. Manticore только что сделала это будущее чуть ближе.