Open Research · fancy color · ML

Две версии ML для fancy-цвета: от разметчиков к сканеру Cutwise

Опубликовано 27.07.2026 · обновлено 27.07.2026 · эмпирический ML-отчёт · гипотезы отдельно

Аннотация. Две небольшие модели пытаются предсказать интенсивность fancy-цвета, но делают это принципиально по-разному. V1 учится на 153 записях, CHROMA и — в полной версии — человеческих разметках: модель с одной насыщенностью дала 64.7% accuracy, EBM на полном наборе — 76.5%. Последний результат нельзя называть автономным, потому что мнение разметчика уже есть во входах. V2 использует 226 очищенных записей Cutwise, сканерную колориметрию и форму камня; CatBoost показал 85.93% accuracy по кросс-валидации при ранговой MAE 0.208. Разбираем, почему цифры V1 и V2 нельзя напрямую сравнивать, где в данных прячется дисбаланс классов и зачем модели право воздержаться от решения. GIA здесь — язык терминологии, не источник автоматического грейдинга. Ни одна версия не заменяет лабораторное заключение.

Ключевые слова: fancy color, интенсивность цвета бриллианта, CatBoost, Cutwise, OctoNus, GIA

Введение

В fancy-цвете особенно легко спутать впечатление с измерением. «Яркий», «редкий», «дорогой» — хорошие слова для торгового разговора, но плохие признаки для модели. Интенсивность связана с оттенком, насыщенностью, светлотой, огранкой и светом, в котором показывают камень. Лаборатория выстраивает для этого собственную процедуру; коммерческие данные почти всегда живут по менее строгим правилам.

Поэтому машинное обучение не стоит выдавать за новый способ сертификации. Его более скромная, но полезная роль — разобрать закономерности в известной разметке, найти спорные записи, проверить, где инструментальные показатели действительно несут сигнал. В таком режиме модель — рабочий прибор аналитика, а не автоматический геммолог.

В материале сопоставлены две версии. V1 училась на 153 наблюдениях. В минимальной постановке она видела CHROMA, в полной — ещё две человеческие разметки. V2 построена на 226 очищенных записях из открытых проектов Cutwise и получает сканерную колориметрию с формой камня. Вторая версия ближе к предварительному скринингу, потому что перед входом в модель оператору не нужно назвать класс. Это не делает её заменой заключения.

Точность в этом отчёте — это точность предсказания целевого ярлыка в конкретной выборке и при выбранной схеме разбиения. Она не равна доле «правильно определённых GIA-камней» во всём мире. Для редких классов и соседних градаций это различие решает почти всё.

Метод и источники

Работа объединяет два экспериментальных контура. В V1 классы выстроены в порядок Y-Z, Light, Fancy, Intense, Vivid. Исходный размер — n=153. В признаках есть CHROMA, а в полной конфигурации — ЦВЕТ_ПРОГНОЗ и ЦВЕТ_ТАБЛИЦА, то есть результаты человеческой маркировки. Сравнивались Random Forest и Explainable Boosting Machine (EBM); качество оценивалось кросс-валидацией.

Перед расчётом V2 данные очистили, после чего осталось n=226 cleaned. В наборе представлены Cushion, Pear, Oval, Radiant. Модель получает координаты LCH, Munsell, Cutwise Color и форму. Гистограмма, построенная в рабочем процессе, оказалась пустой. Это дефект визуализации, а не свидетельство равномерного или «хорошего» распределения данных. Распределение классов поэтому берётся из прямого подсчёта строк.

Для V2 проверялись CatBoost, XGBoost, Decision Tree, Random Forest и логистическая регрессия. Рядом с accuracy приведена средняя абсолютная ошибка ранга, MAE. Классы интенсивности упорядочены: промах на соседнюю ступень не равен переходу через две или три. MAE это замечает, хотя не говорит о коммерческой цене ошибки.

Технологический контекст дают материалы OctoNus о fancy-color оптимизации и платформа Cutwise. Научным фоном служит King et al., 1994, Gems & Gemology, 30(4):220–242. GIA в названии и обсуждении обозначает привычный язык интенсивности; обучающие ярлыки GIA не предполагаются, если это не сказано о самом наборе.

Что предсказывается, а что нет

Целевая переменная здесь — дискретный класс интенсивности, уже присутствующий или назначенный в исходных данных. Это не прямое физическое измерение цвета и не денежная оценка. Модели не определяют цену, происхождение, чистоту, полировку, качество сертификата или инвестиционную привлекательность. И они не обещают, что два камня с близкими координатами будут одинаково выглядеть в любом свете.

Порядок классов важен. Light ближе к Fancy, чем к Vivid; Intense обычно соседствует с Fancy и Vivid, а не с Light. Классификатор, который в основном ошибается на соседнюю ступень, может оказаться полезнее модели с такой же accuracy, но редкими дальними промахами. В продаже и соседняя ошибка иногда болезненна: Intense и Vivid создают у покупателя разные ожидания.

Разделять надо две задачи. Первая — предсказать уже известную разметку в документированном датасете. Вторая — независимо установить цветовой грейд конкретного камня. Отчёт относится к первой. Вторая требует стандартизированной процедуры, прибора, наблюдения и ответственности лаборатории.

V1: выборка, классы и CHROMA

В V1 — n=153 записей. Диапазон CHROMA составляет примерно ≈37.0–92.8. Классы распределены неравномерно: Y-Z — 19, Light — 26, Fancy — 76, Intense — 25, Vivid — 7. Fancy почти в одиннадцать раз многочисленнее Vivid. В такой структуре общая точность легко выглядит лучше, чем реальное положение редких классов.

Класс V1Число наблюдений
Y-Z19
Light26
Fancy76
Intense25
Vivid7
Всего153

Базовая Random Forest, которой дали только CHROMA, получила 64.7% accuracy и F1macro 0.622. Результат содержательный. Насыщенность действительно помогает отличать интенсивность, но один числовой признак не удерживает границы всей шкалы. Похожие значения могут встретиться у разных оттенков, форм, пропорций и условий измерения.

Полная Random Forest достигла 69.9% accuracy и F1 0.698. EBM на полном наборе — 76.5% accuracy и F1 0.742. В интерпретируемой модели важность CHROMA составляет примерно ≈1.62. Это не процент вклада и не физическая константа. Речь о важности внутри конкретной модели, собранной на конкретном представлении данных.

Главный нюанс V1 прячется именно в росте результата. Полные модели видят ЦВЕТ_ПРОГНОЗ и ЦВЕТ_ТАБЛИЦА — оценки человека. Такой алгоритм нельзя честно предлагать как способ назначить грейд до ручной разметки: экспертный сигнал уже попал на вход. Зато он годится для контроля согласованности, сравнения двух разметок, поиска необычных записей и внутреннего аудита решений.

Здесь не стоит прятать термин «утечка» за технической формулировкой. Это не обязательно ошибка в коде. Иногда модель честно получает колонку, которой в реальном процессе на этот момент ещё нет. Тогда оценка качества отвечает на вопрос «как хорошо алгоритм повторяет уже начатое экспертное решение», а не «что он сделает до эксперта». Для внутреннего контроля это может быть ровно нужной задачей. Для обещания автоматического грейда — уже нет.

V1: сравнение классов и цена дисбаланса

Макро-F1 ставит каждый класс в равные условия и потому здесь информативнее одной общей accuracy. Ниже — per-class F1 для трёх постановок: Random Forest только с CHROMA, полная Random Forest и EBM.

КлассRF: только CHROMAFull RFEBM
Y-Z0.8210.8950.895
LIGHT0.5830.5650.571
FANCY0.7300.7520.820
INTENSE0.2610.4800.654
VIVID0.7140.8000.769

Самый тревожный сигнал в таблице — 0.261 у INTENSE в модели с одним CHROMA. Это не второстепенная деталь. Intense лежит на стыке Fancy и Vivid, поэтому уязвим к шуму измерения, неясной разметке и малому числу примеров. С дополнительными признаками F1 растёт до 0.480 у Full RF и 0.654 у EBM. Но это улучшение нельзя отделить от того факта, что часть новых признаков уже выражает человеческое решение.

У Vivid F1 выглядит высоким при всего семи наблюдениях. Уверенности это не добавляет: несколько примеров в тестовом фолде способны резко сдвинуть показатель. LIGHT, напротив, почти не выигрывает от добавления признаков — 0.583, 0.565, 0.571. В прикладной системе после такого результата полезнее показывать не только метку, но и степень уверенности, ближайшие альтернативы и причину отправить случай на ручную проверку.

Сценарий / гипотеза

V1 полезнее как контроль согласованности

Пока человеческие метки остаются среди признаков, V1 логичнее использовать для поиска расхождений между двумя разметчиками, CHROMA и историческим решением, чем для автоматической выдачи грейда. Гипотезу можно проверить на свежем наборе с заранее закрытой независимой экспертизой.

V2: переход к измерениям сканера

V2 задаёт другой вопрос: получится ли получить рабочий прогноз без разметчика на входе? Здесь остались n=226 cleaned записей форм Cushion, Pear, Oval и Radiant. Вместо ручных полей используются светлота и насыщенность LCH, Munsell, Cutwise Color и форма. При одинаково стандартизированном измерении этот набор признаков теоретически можно получить повторно — до предварительного мнения оператора.

Целевые классы V2 распределились так: Intense 87 (38.5%), Vivid 50 (22.1%), Fancy 47 (20.8%), Deep 24 (10.6%), Light 18 (8.0%). Deep в V1 отсутствовал. По этой причине V1 и V2 нельзя читать как два замера одной шкалы и объявлять вторую версию «лучше на столько-то пунктов». Это другие входы, другая выборка и другой состав классов.

Класс V2Число наблюденийДоля
Intense8738.5%
Vivid5022.1%
Fancy4720.8%
Deep2410.6%
Light188.0%
Всего226100%

Пустая гистограмма не сообщает ничего ни о бимодальности, ни о выбросах, ни о форме распределения непрерывных признаков. Корректнее зафиксировать сбой графика и опереться на таблицу классов. При повторе работы визуализацию нужно чинить отдельно, не подменяя её предположениями о данных.

Корреляции V2 и риск дублирующих признаков

Зафиксированы следующие Pearson-корреляции с целевой структурой или сигналом интенсивности: chroma/lightness ratio 0.819, cutwise_color_chroma 0.805, lch_chroma 0.785, lch_lightness −0.492. Положительная связь у насыщенности и её отношения к светлоте согласуется с ожиданием: более сильный цветовой сигнал в этом наборе чаще идёт с более высокой интенсивностью. Светлота LCH движется в обратную сторону.

Корреляция не превращается из-за этого в причинное объяснение. Несколько колонок могут описывать близкое физическое свойство разными формулами. Для линейной модели это риск мультиколлинеарности; для дерева и бустинга — возможность опереться на дублирующие сигналы и затем хуже перенестись на другой прибор. Анализ важностей в такой ситуации легко переоценить.

Форма в модели — не украшение таблицы. Cushion, Pear, Oval и Radiant по-разному работают с огранкой, распределением света и коммерческим описанием цвета. Но форму нельзя позволить превратить в косвенный ярлык. Валидация должна проверять, не запоминает ли алгоритм небольшие группы или источник данных вместо устойчивой закономерности.

V2: модели и кросс-валидация

По CV V2 первой стала CatBoost: 85.93% accuracy и ранговая MAE 0.208. XGBoost получила 81.64% / 0.278, Decision Tree — 79.97% / 0.307, Random Forest — 77.66% / 0.353, логистическая регрессия — 73.02% / 0.443.

МодельAccuracy CVMAE ранга
CatBoost85.93%0.208
XGBoost81.64%0.278
Decision Tree79.97%0.307
Random Forest77.66%0.353
Logistic Regression73.02%0.443

Разрыв между CatBoost и логистической регрессией похож на след нелинейных границ и взаимодействий между цветовыми признаками и формой. Но из него нельзя делать вывод, что CatBoost «понимает цвет». Модель лучше разделяет ярлыки именно этого набора при этой схеме кросс-валидации. Следующая проверка должна включать отложенную партию, результаты по формам, матрицы ошибок и калибровку вероятностей.

MAE 0.208 означает небольшую среднюю ошибку в закодированном порядковом пространстве. Она не назначает стоимость промаха. Если бизнес-правило не позволяет назвать Vivid вместо Intense, понадобятся отдельные пороги, анализ вероятностей и механизм отказа от решения. Одна уверенная с виду метка делает риск невидимым.

Здесь начинается практическая развилка. Модель можно заставить отвечать на каждый запрос — и получить красивую сводную метрику. А можно заранее выделить диапазон, где она не выбирает класс и возвращает запись специалисту. Второй путь уменьшит долю автоматически обработанных камней, зато не замаскирует пограничные случаи. Для small data это обычно честнее, чем имитировать безошибочный автомат.

Сценарий / гипотеза

Сканерный контур пригоден для triage

При одинаковой калибровке Cutwise-измерений и контроле форм V2 может ранжировать записи по вероятной интенсивности и выделять пограничные случаи до ручной проверки. Подтвердить это можно только на независимом наборе, который не участвовал в обучении, с заранее записанным правилом, когда модель обязана воздержаться.

OctoNus, Cutwise и границы технического слоя

Страница OctoNus о fancy-color diamonds задаёт технологический контекст оптимизации работы с цветным камнем. Cutwise выступает источником открытых проектных данных и измерительных представлений, использованных во V2. В этом смысле модель интересна как мост между сканером и аналитикой: её признаки можно получить раньше ручного классификационного комментария.

Из этого не следует официальная сертификация со стороны OctoNus, Cutwise или GIA. Камень не похож на ровный цветовой образец. На результат влияют огранка, ориентация, отражения, флуоресценция, освещение, настройка прибора и подготовка образца. Сканер даёт повторяемый сигнал в пределах своей измерительной цепочки; перенос показаний на другой прибор без калибровки нельзя считать автоматическим.

King et al. (1994) полезен именно этим напоминанием: терминология fancy-color связывает наблюдение, сопоставление и систематическое описание, а не сводится к одному универсальному датчику. В карточке товара модельный ярлык нельзя ставить рядом с лабораторным сертификатом так, будто оба документа равны по статусу.

Синтез и обсуждение

V1 показала, что в маленьком наборе CHROMA и дополнительные признаки содержат сильный классификационный сигнал: от 64.7% у CHROMA-only RF до 76.5% у EBM. Однако рост не означает автономной автоматизации. Полные модели получают на вход человеческие разметки. Самым уязвимым местом оказался Intense, а Vivid слишком мал для широких уверенных выводов.

V2 устраняет именно эту проблему входа. CatBoost видит сканерные показатели и форму, не мнение разметчика, и при n=226 cleaned получает 85.93% CV accuracy и MAE 0.208. Это не «улучшение V1 на 9,43 пункта»: различаются и классы, и данные, и постановка задачи.

Общий вывод скромнее — и полезнее громкой формулы. Измеряемые цветовые признаки позволяют строить в ограниченных данных рабочие классификаторы. Но нужно честно показать входы, разбиение, дисбаланс и зоны неуверенности. Нормальный продуктовый интерфейс здесь — подсказка, вероятность, соседние классы и передача спорных записей человеку.

Остаётся вопрос, как встроить этот вывод в реальный процесс. В сортировке партия может сначала пройти сканер, затем модельный ранжирующий слой, а уже потом ручную проверку случаев с низкой уверенностью. В карточке товара модельную оценку лучше хранить как внутренний технический атрибут, а не выдавать за часть лабораторного документа. Такой порядок не делает обработку «объективной» в философском смысле, но оставляет аудитируемую цепочку: измерение, прогноз, решение человека.

Сценарии и гипотезы

Сценарий / гипотеза

Ошибки будут соседними, но это надо измерить

Низкая MAE V2 и упорядоченные классы позволяют предположить, что заметная доля ошибок приходится на соседние интенсивности. Пока нет confusion matrix, это только правдоподобное допущение. На новом тесте стоит посчитать промахи на один, два и более рангов.

Сценарий / гипотеза

Intense останется хрупким классом

В V1 INTENSE получил F1 0.261 при одном CHROMA и 0.654 у EBM. Вероятное объяснение — пограничное положение класса и ограниченная выборка. Его можно проверить, собрав независимые примеры вокруг Fancy/Intense и Intense/Vivid с сохранением источника и условий измерения.

Сценарий / гипотеза

Форма улучшает прогноз неравномерно

Различия Cushion, Pear, Oval и Radiant могут означать, что форма помогает одним классам больше других. Нужны ablation-тест без формы и кросс-валидация, стратифицированная по форме. Только так можно отличить реальный эффект от запоминания состава выборки.

Ограничения

Выборки невелики: 153 записи в V1 и 226 после очистки в V2. Классы несбалансированы: Vivid V1 включает семь наблюдений, Light V2 — восемнадцать. Кросс-валидация снижает зависимость от одного разбиения, но не заменяет внешний тест и не подтверждает переносимость на другие партии, цвета, формы, лаборатории или настройки прибора.

В V1 есть риск утечки смысла через ручные признаки. ЦВЕТ_ПРОГНОЗ и ЦВЕТ_ТАБЛИЦА помогают предсказывать ярлык, поскольку уже связаны с экспертным решением. V2 этого конкретного риска избегает, но зависит от очистки, доступности сканерных значений и набора форм. Пустая гистограмма не даёт визуальных оснований судить о непрерывных признаках.

Ни V1, ни V2 не заменяют GIA. Они не устанавливают официальный цветовой грейд, не выдают сертификат и не определяют стоимость. Для продажи, страхового документа и публичной карточки важно различать модельную оценку, внутренний скрининг и лабораторное заключение.

Выводы

  1. V1 на n=153 показала информативность CHROMA, но её полные модели зависят от человеческих разметок на входе.
  2. V1: RF только CHROMA — 64.7% и F1macro 0.622; Full RF — 69.9% и F1 0.698; EBM — 76.5% и F1 0.742.
  3. Intense остаётся зоной неопределённости V1; редкий Vivid требует осторожного чтения метрик.
  4. V2 на n=226 cleaned использует сканерную колориметрию и форму; CatBoost лидирует с 85.93% CV accuracy и MAE 0.208.
  5. Наиболее реалистичное применение моделей — исследование, triage и контроль качества с участием человека, а не замена GIA.

FAQ

Можно ли по сканеру предсказать интенсивность fancy-цвета? В V2 сочетание сканерных признаков и формы дало CatBoost 85.93% accuracy по CV. Это результат конкретного набора, а не гарантия для любого камня или прибора.

Почему V1 нельзя назвать полностью автоматической? Полная V1 использует ЦВЕТ_ПРОГНОЗ и ЦВЕТ_ТАБЛИЦА, то есть человеческие разметки. Человек уже участвует на входе модели.

Заменяет ли модель заключение GIA? Нет. Это внутренний исследовательский прогноз класса, а не лабораторный грейд, сертификат или оценка стоимости.

Что означает MAE 0.208? Это средняя абсолютная ошибка по числовому порядку классов. Метрика дополняет accuracy и показывает, насколько далеко от истинной градации в среднем оказался прогноз.

Почему Intense сложнее предсказывать? В V1 класс расположен между соседними градациями и показал F1 от 0.261 до 0.654 в разных моделях. Нужны дополнительные пограничные примеры и матрица ошибок.

Библиография

  1. OctoNus. Fancy-color diamonds: https://www.octonus.com/projects/fancy-color-diamonds
  2. Cutwise. Публичные проекты и описание платформы: https://cutwise.com/pr/
  3. King, J. M., Moses, T. M., Shigley, J. E., Welbourn, C. M., Lawson, S. C., Cooper, M. 1994. Characterizing Natural-Color Type IIb Blue Diamonds. Gems & Gemology, 30(4), 220–242.
  4. BrillPulse. Экспериментальные датасеты и ноутбуки V1/V2, использованные для указанных метрик.
  5. GIA. Публичные материалы о терминологии и лабораторной оценке цветных бриллиантов; используется как контекст, не как сертификат модели.

Open Research · fancy color · ML

Two ML versions for fancy color: from human labellers to the Cutwise scanner

Published 27.07.2026 · updated 27.07.2026 · empirical ML report · hypotheses kept apart

Abstract. Two small models try to predict fancy-color intensity, but they do it in fundamentally different ways. V1 trains on 153 records, CHROMA and — in the full version — human labels: a saturation-only model gave 64.7% accuracy, EBM on the full set 76.5%. The latter result cannot be called autonomous, because the labeller’s opinion is already in the inputs. V2 uses 226 cleaned Cutwise records, scanner colorimetry and stone shape; CatBoost showed 85.93% accuracy on cross-validation with rank MAE of 0.208. We unpack why V1 and V2 figures cannot be compared directly, where class imbalance hides in the data, and why a model should have the right to abstain. GIA here is a language of terminology, not a source of automatic grading. Neither version replaces a laboratory report.

Keywords: fancy color, diamond color intensity, CatBoost, Cutwise, OctoNus, GIA

Introduction

In fancy color it is especially easy to confuse impression with measurement. “Bright”, “rare”, “expensive” are good words for a sales conversation and poor features for a model. Intensity is tied to hue, saturation, lightness, cut and the light in which the stone is shown. A laboratory builds its own procedure for this; commercial data almost always live by less strict rules.

So machine learning should not be presented as a new way of certification. Its more modest, but useful, role is to unpack regularities in a known labelling, find disputed records, and check where instrumental indicators actually carry signal. In that mode the model is an analyst’s working instrument, not an automatic gemmologist.

The note compares two versions. V1 trained on 153 observations. In the minimal setting it saw CHROMA; in the full setting, two further human labels. V2 is built on 226 cleaned records from open Cutwise projects and receives scanner colorimetry plus stone shape. The second version is closer to a pre-screen, because the operator need not name a class before the model input. That does not make it a substitute for a report.

Accuracy in this report is accuracy of predicting the target label in a particular sample and under a chosen split scheme. It is not the share of “correctly identified GIA stones” in the whole world. For rare classes and neighbouring grades that distinction decides almost everything.

Method and sources

The work joins two experimental contours. In V1 the classes are ordered Y-Z, Light, Fancy, Intense, Vivid. The original size is n=153. Features include CHROMA, and in the full configuration ЦВЕТ_ПРОГНОЗ and ЦВЕТ_ТАБЛИЦА — results of human marking. Random Forest and Explainable Boosting Machine (EBM) were compared; quality was assessed by cross-validation.

Before the V2 calculation the data were cleaned, after which n=226 cleaned remained. The set includes Cushion, Pear, Oval, Radiant. The model receives LCH coordinates, Munsell, Cutwise Color and shape. A histogram built in the working process came out empty. That is a visualisation defect, not evidence of a uniform or “good” data distribution. Class distribution is therefore taken from a direct count of rows.

For V2, CatBoost, XGBoost, Decision Tree, Random Forest and logistic regression were tested. Beside accuracy, mean absolute rank error, MAE, is given. Intensity classes are ordered: a miss to a neighbouring step is not equal to a jump of two or three. MAE notices that, though it does not speak of the commercial cost of the error.

Technological context comes from OctoNus materials on fancy-color optimisation and the Cutwise platform. Scientific background is King et al., 1994, Gems & Gemology, 30(4):220–242. GIA in the title and discussion denotes the familiar language of intensity; GIA training labels are not assumed unless that is said of the set itself.

What is predicted, and what is not

The target variable here is a discrete intensity class already present or assigned in the source data. It is not a direct physical colour measurement and not a money valuation. The models do not determine price, origin, clarity, polish, certificate quality or investment appeal. And they do not promise that two stones with close coordinates will look the same in any light.

The order of classes matters. Light is closer to Fancy than to Vivid; Intense usually neighbours Fancy and Vivid, not Light. A classifier that mostly errs to a neighbouring step may be more useful than a model with the same accuracy but rare distant misses. In a sale even a neighbouring error is sometimes painful: Intense and Vivid create different expectations in the buyer.

Two tasks must be separated. The first is to predict an already known labelling in a documented dataset. The second is independently to establish the colour grade of a specific stone. The report belongs to the first. The second requires a standardised procedure, an instrument, observation and the laboratory’s responsibility.

V1: sample, classes and CHROMA

V1 has n=153 records. The CHROMA range is about ≈37.0–92.8. Classes are uneven: Y-Z — 19, Light — 26, Fancy — 76, Intense — 25, Vivid — 7. Fancy is almost eleven times more numerous than Vivid. In such a structure overall accuracy easily looks better than the real position of rare classes.

V1 classObservations
Y-Z19
Light26
Fancy76
Intense25
Vivid7
Total153

A baseline Random Forest given only CHROMA obtained 64.7% accuracy and F1macro 0.622. The result is substantive. Saturation does help distinguish intensity, but one numeric feature does not hold the boundaries of the whole scale. Similar values can appear for different hues, shapes, proportions and measurement conditions.

The full Random Forest reached 69.9% accuracy and F1 0.698. EBM on the full set — 76.5% accuracy and F1 0.742. In the interpretable model, CHROMA importance is about ≈1.62. That is not a contribution percentage and not a physical constant. It is importance inside a particular model, assembled on a particular representation of the data.

The main nuance of V1 hides precisely in the rise of the result. Full models see ЦВЕТ_ПРОГНОЗ and ЦВЕТ_ТАБЛИЦА — a person’s scores. Such an algorithm cannot honestly be offered as a way to assign a grade before hand labelling: the expert signal has already entered the input. It is fit, though, for checking consistency, comparing two labellings, finding unusual records and an internal audit of decisions.

The term “leakage” should not be hidden behind a technical wording. This is not necessarily a bug in the code. Sometimes the model honestly receives a column that, in the real process, is not yet there at that moment. Then the quality score answers “how well the algorithm repeats an expert decision already begun”, not “what it will do before the expert”. For internal control that may be exactly the needed task. For a promise of automatic grade — no longer.

V1: class comparison and the cost of imbalance

Macro-F1 puts each class on equal terms and is therefore more informative here than a single overall accuracy. Below — per-class F1 for three settings: Random Forest with CHROMA only, full Random Forest, and EBM.

ClassRF: CHROMA onlyFull RFEBM
Y-Z0.8210.8950.895
LIGHT0.5830.5650.571
FANCY0.7300.7520.820
INTENSE0.2610.4800.654
VIVID0.7140.8000.769

The most alarming signal in the table is 0.261 for INTENSE in the CHROMA-only model. That is not a side detail. Intense sits at the join of Fancy and Vivid, so it is vulnerable to measurement noise, unclear labelling and a small number of examples. With extra features F1 rises to 0.480 for Full RF and 0.654 for EBM. But that improvement cannot be separated from the fact that part of the new features already express a human decision.

Vivid’s F1 looks high with only seven observations. That does not add confidence: a few examples in a test fold can shift the indicator sharply. LIGHT, by contrast, almost does not gain from added features — 0.583, 0.565, 0.571. In an applied system after such a result it is more useful to show not only a label, but a degree of confidence, nearest alternatives and a reason to send the case to a hand check.

Scenario / hypothesis

V1 is more useful as a consistency check

While human labels remain among the features, V1 is more logically used to find discrepancies between two labellers, CHROMA and a historical decision, than to issue a grade automatically. The hypothesis can be tested on a fresh set with an independent expertise closed in advance.

V2: the move to scanner measurements

V2 asks a different question: can a working prediction be obtained without a labeller on the input? Here n=226 cleaned records of Cushion, Pear, Oval and Radiant remain. Instead of hand fields, LCH lightness and chroma, Munsell, Cutwise Color and shape are used. With equally standardised measurement this feature set can in principle be obtained again — before a preliminary opinion of the operator.

V2 target classes distributed as follows: Intense 87 (38.5%), Vivid 50 (22.1%), Fancy 47 (20.8%), Deep 24 (10.6%), Light 18 (8.0%). Deep was absent in V1. For that reason V1 and V2 cannot be read as two measurements of one scale and the second version declared “better by so many points”. These are other inputs, another sample and another class composition.

V2 classObservationsShare
Intense8738.5%
Vivid5022.1%
Fancy4720.8%
Deep2410.6%
Light188.0%
Total226100%

An empty histogram says nothing about bimodality, outliers, or the shape of continuous-feature distributions. It is more correct to record the chart failure and lean on the class table. On a repeat of the work, visualisation should be fixed separately, not replaced with assumptions about the data.

V2 correlations and the risk of duplicate features

The following Pearson correlations with the target structure or intensity signal were recorded: chroma/lightness ratio 0.819, cutwise_color_chroma 0.805, lch_chroma 0.785, lch_lightness −0.492. A positive link for saturation and its ratio to lightness matches the expectation: a stronger colour signal in this set more often goes with higher intensity. LCH lightness moves the other way.

Correlation does not thereby become a causal explanation. Several columns may describe a close physical property with different formulae. For a linear model this is a multicollinearity risk; for a tree and boosting — a chance to lean on duplicate signals and then transfer worse to another instrument. Importance analysis in such a situation is easy to over-read.

Shape in the model is not a table decoration. Cushion, Pear, Oval and Radiant work differently with cut, light distribution and the commercial description of colour. But shape cannot be allowed to become an indirect label. Validation should check whether the algorithm is memorising small groups or a data source instead of a stable regularity.

V2: models and cross-validation

On CV, V2 was led by CatBoost: 85.93% accuracy and rank MAE 0.208. XGBoost obtained 81.64% / 0.278, Decision Tree 79.97% / 0.307, Random Forest 77.66% / 0.353, logistic regression 73.02% / 0.443.

ModelAccuracy CVRank MAE
CatBoost85.93%0.208
XGBoost81.64%0.278
Decision Tree79.97%0.307
Random Forest77.66%0.353
Logistic Regression73.02%0.443

The gap between CatBoost and logistic regression looks like a trace of non-linear boundaries and interactions among colour features and shape. But one cannot conclude from it that CatBoost “understands colour”. The model better separates the labels of this set under this cross-validation scheme. The next check should include a held-out batch, results by shape, confusion matrices and probability calibration.

MAE 0.208 means a small average error in the encoded ordinal space. It does not assign a cost to a miss. If a business rule does not allow Vivid to be named instead of Intense, separate thresholds, probability analysis and a refusal mechanism will be needed. A single confident-looking label makes the risk invisible.

Here a practical fork begins. The model can be forced to answer every request — and a handsome summary metric obtained. Or a range can be set in advance where it does not choose a class and returns the record to a specialist. The second path will reduce the share of automatically processed stones, but will not mask borderline cases. For small data that is usually more honest than imitating a faultless automaton.

Scenario / hypothesis

The scanner contour is fit for triage

With the same calibration of Cutwise measurements and control of shapes, V2 can rank records by likely intensity and flag borderline cases before a hand check. This can be confirmed only on an independent set that did not take part in training, with a rule written in advance for when the model must abstain.

OctoNus, Cutwise and the bounds of the technical layer

The OctoNus page on fancy-color diamonds sets the technological context of optimisation work with coloured stone. Cutwise is the source of open project data and measurement representations used in V2. In that sense the model is interesting as a bridge between scanner and analytics: its features can be obtained before a hand classification comment.

It does not follow that there is official certification from OctoNus, Cutwise or GIA. A stone is not like a flat colour sample. Cut, orientation, reflections, fluorescence, lighting, instrument setup and sample preparation all affect the result. A scanner gives a repeatable signal inside its measurement chain; transferring readings to another instrument without calibration cannot be treated as automatic.

King et al. (1994) is useful precisely as this reminder: fancy-color terminology ties observation, comparison and systematic description, and does not reduce to one universal sensor. On a product card a model label cannot be placed next to a laboratory certificate as if both documents were equal in status.

Synthesis and discussion

V1 showed that in a small set CHROMA and extra features contain a strong classification signal: from 64.7% for CHROMA-only RF to 76.5% for EBM. The rise, however, does not mean autonomous automation. Full models receive human labels on the input. Intense proved the most vulnerable place, and Vivid is too small for broad confident conclusions.

V2 removes exactly that input problem. CatBoost sees scanner indicators and shape, not a labeller’s opinion, and at n=226 cleaned obtains 85.93% CV accuracy and MAE 0.208. This is not “a 9.43-point improvement on V1”: classes, data and task setting all differ.

The overall conclusion is more modest — and more useful than a loud formula. Measurable colour features allow working classifiers to be built in limited data. But inputs, split, imbalance and zones of uncertainty need to be shown honestly. A normal product interface here is a hint, a probability, neighbouring classes and a hand-off of disputed records to a person.

The question remains how to embed this conclusion in a real process. In sorting, a batch may first pass a scanner, then a model ranking layer, and only then a hand check of low-confidence cases. On a product card a model score is better kept as an internal technical attribute, not issued as part of a laboratory document. That order does not make processing “objective” in a philosophical sense, but it leaves an auditable chain: measurement, prediction, human decision.

Scenarios and hypotheses

Scenario / hypothesis

Errors will be neighbouring, but that has to be measured

V2’s low MAE and ordered classes allow the assumption that a noticeable share of errors falls on neighbouring intensities. Until there is a confusion matrix, this is only a plausible assumption. On a new test, misses of one, two and more ranks should be counted.

Scenario / hypothesis

Intense will remain a fragile class

In V1 INTENSE obtained F1 0.261 with CHROMA only and 0.654 with EBM. A likely explanation is the class’s borderline position and a limited sample. It can be tested by collecting independent examples around Fancy/Intense and Intense/Vivid while keeping source and measurement conditions.

Scenario / hypothesis

Shape improves the prediction unevenly

Differences among Cushion, Pear, Oval and Radiant may mean that shape helps some classes more than others. An ablation test without shape and cross-validation stratified by shape are needed. Only then can a real effect be distinguished from memorising the sample composition.

Limitations

The samples are small: 153 records in V1 and 226 after cleaning in V2. Classes are unbalanced: Vivid V1 includes seven observations, Light V2 eighteen. Cross-validation reduces dependence on a single split, but does not replace an external test and does not confirm transfer to other batches, colours, shapes, laboratories or instrument settings.

In V1 there is a risk of meaning leakage through hand features. ЦВЕТ_ПРОГНОЗ and ЦВЕТ_ТАБЛИЦА help predict the label because they are already tied to an expert decision. V2 avoids this particular risk, but depends on cleaning, availability of scanner values and the set of shapes. An empty histogram gives no visual grounds to judge continuous features.

Neither V1 nor V2 replaces GIA. They do not establish an official colour grade, do not issue a certificate and do not determine value. For a sale, an insurance document and a public product card it is important to distinguish a model score, an internal screen and a laboratory report.

Conclusions

  1. V1 at n=153 showed the informativeness of CHROMA, but its full models depend on human labels on the input.
  2. V1: RF CHROMA only — 64.7% and F1macro 0.622; Full RF — 69.9% and F1 0.698; EBM — 76.5% and F1 0.742.
  3. Intense remains V1’s zone of uncertainty; rare Vivid requires a cautious reading of metrics.
  4. V2 at n=226 cleaned uses scanner colorimetry and shape; CatBoost leads with 85.93% CV accuracy and MAE 0.208.
  5. The most realistic use of the models is research, triage and quality control with a person involved, not a replacement for GIA.

FAQ

Can fancy-color intensity be predicted from a scanner? In V2 a combination of scanner features and shape gave CatBoost 85.93% accuracy on CV. That is a result of a particular set, not a guarantee for any stone or instrument.

Why can V1 not be called fully automatic? Full V1 uses ЦВЕТ_ПРОГНОЗ and ЦВЕТ_ТАБЛИЦА, that is human labels. A person already takes part on the model input.

Does the model replace a GIA report? No. It is an internal research class prediction, not a laboratory grade, certificate or valuation.

What does MAE 0.208 mean? It is mean absolute error on the numeric order of classes. The metric complements accuracy and shows how far, on average, the prediction sat from the true grade.

Why is Intense harder to predict? In V1 the class sits between neighbouring grades and showed F1 from 0.261 to 0.654 in different models. Extra borderline examples and an error matrix are needed.

Bibliography

  1. OctoNus. Fancy-color diamonds: https://www.octonus.com/projects/fancy-color-diamonds
  2. Cutwise. Public projects and platform description: https://cutwise.com/pr/
  3. King, J. M., Moses, T. M., Shigley, J. E., Welbourn, C. M., Lawson, S. C., Cooper, M. 1994. Characterizing Natural-Color Type IIb Blue Diamonds. Gems & Gemology, 30(4), 220–242.
  4. BrillPulse. Experimental datasets and V1/V2 notebooks used for the stated metrics.
  5. GIA. Public materials on terminology and laboratory assessment of coloured diamonds; used as context, not as a certificate of the model.